直接回答:LoRA 冻结预训练权重 W,旁路训练低秩分解矩阵 ΔW = BA(B 是 d×r,A 是 r×k,r 远小于 d),前向时 W 与 BA 相加,训练参数量从全量的 100% 降到 0.1%~1%。QLoRA 在此基础上把基座权重量化到 4bit(NF4)加载,反传时按需反量化,配合分页优化器让 65B 模型单卡可微调。

展开解析:秩的选择逻辑:r 决定适配容量,经验起点 8~16;任务与预训练分布差异小(风格对齐、格式约束)r=4~8 足够;要学新知识、新语言或复杂领域推理,升到 32~64,但超过 64 收益锐减且过拟合风险上升——低秩的前提假设就是微调所需的变化是低秩的。配套超参:alpha 一般设为 r 的 1~2 倍(等效学习率缩放),dropout 小数据集开 0.05~0.1。目标模块:至少挂 q/v 投影,预算够就全线性层(q/k/v/o 加 MLP),全层 r=16 常优于仅 qv 的 r=64。QLoRA 的注意点:4bit 量化有精度损失,对数值敏感任务(数学、代码)要评测确认;合并权重部署时先反量化再合并,避免二次损失;多任务场景可以训练多个 LoRA 适配器热切换,这是相对全量微调的独有工程优势。

追问方向:LoRA 为什么不带来推理延迟?DoRA 相对 LoRA 改了什么?

(约 450 字)