直接回答:量化把 FP16 权重映射到低比特整数表示,显存占用等比下降(INT4 约为 FP16 的 1/4),同时低比特矩阵乘在带宽受限的解码阶段显著提速。方法分两类:纯舍入(RTN)误差大;校准类方法 GPTQ 用少量校准数据逐层最小化量化误差(基于 Hessian 近似的逐列补偿),AWQ 发现 1% 的显著权重通道决定大部分精度、对其放大保护,同位宽下 AWQ 通常略优。GGUF 是 llama.cpp 的格式,支持 K-quants 混合精度(重要层高位宽)。
展开解析:量化收益最大的场景是显存受限的本地推理和中小并发服务:INT4 让 7B 模型跑进 6GB 显存。代价方面:困惑度(perplexity)通常只上升零点几个点,但长链推理、代码、数学等任务对误差更敏感,必须在自己的任务评测集上验证。工程建议:优先量化权重而非激活(W4A16 比 W4A8 稳妥);MoE 模型量化掉点更明显要谨慎;服务端高并发场景往往更推荐 FP8(H100 原生支持)或用蒸馏小模型替代量化大模型。
追问方向:为什么解码阶段是带宽受限?KV cache 能不能量化?量化对投机采样有什么影响?
(约 450 字)