量化把 FP16/BF16 权重(和激活)映射到 INT8、INT4 等低比特表示,显存占用成倍下降、推理吞吐提升,是本地部署大模型的关键技术。分两类:训练后量化(PTQ,直接对训好的模型量化,成本低)和量化感知训练(QAT,训练中模拟量化,精度好但成本高)。LLM 部署主流是 4bit PTQ。
GPTQ 基于二阶信息逐层量化:利用近似海森矩阵逐列量化权重,并用剩余未量化权重补偿误差,速度快、bitsandbytes 级易用。AWQ 的观察不同:只有约 1% 的显著权重(激活幅度大的通道)对精度影响大,量化的主要误差来自激活而非权重,因此它按激活统计对显著通道做缩放保护再量化,不依赖反向传播,4bit 下精度通常优于 GPTQ,尤其适合小模型。
易错点:量化主要省显存,计算加速依赖专门的低比特 kernel(如 Marlin);激活量化(W4A8 等)比仅权重量化(W4A16)难得多,因为激活有离群值。追问方向:QLoRA 的 NF4 与普通 INT4 有何不同?