全参数微调要更新全部权重并保存优化器状态,7B 模型需上百 GB 显存。LoRA 的假设是:微调引起的权重变化 ΔW 是低秩的,于是冻结原权重 W,把 ΔW 分解为两个小矩阵 BA(B 维度 d×r,A 维度 r×d,秩 r 常取 8-64),只训练这两个矩阵,参数量降至原来的千分之几,前向为 Wx + BAx。推理时可将 BA 合并回 W,零额外延迟。

QLoRA 更进一步:基座模型以 4bit NF4 量化冻结(NF4 是针对正态分布权重的信息论最优 4bit 格式),LoRA 适配器用 BF16 训练,反向传播时权重实时反量化,配合分页优化器管理显存峰值,单张 24GB 消费级显卡即可微调 13B 模型,精度接近全参数 16bit 微调。

易错点:LoRA 不学新 token 的嵌入层时遇到新词可能效果差;秩 r 太小欠拟合,太大失去高效意义;LoRA 适合领域风格适配,注入大量新知识仍应靠继续预训练。追问方向:LoRA 一般加在哪些层(Q/K/V/O,还是全部线性层)?