直接回答:知识蒸馏(Hinton et al., 2015)让小模型(student)学习大模型(teacher)输出的软标签,而不是只用 one-hot 硬标签训练。做法是用温度 T 软化 logits:p = softmax(z/T),T 越大分布越平滑,类别间的相对相似性——即所谓 dark knowledge,比如模型认为猫与虎的相似度远高于猫与卡车——被暴露给学生。总损失通常是 α·KL(student‖teacher 软标签) + (1-α)·CE(硬标签) 的加权和,其中软标签项的梯度要乘 T² 以保持量级正确。
展开解析:除输出层蒸馏外,还有特征层蒸馏(对齐中间 hidden states、attention 分布)与关系蒸馏。大模型时代的主流是序列级蒸馏:用强模型生成带思维链的推理轨迹或高质量回答,直接作为 SFT 数据训练小模型——DeepSeek-R1 蒸馏出的 Qwen、Llama 系列小模型即为例证,思维链数据让小模型获得远超其规模直觉的推理能力,成本远低于从头 RL。注意点:teacher 与 student 容量差距过大时蒸馏效果反而下降,可引入中间尺寸的助教模型逐级蒸馏;student 会继承甚至放大 teacher 的偏见、幻觉与风格癖好,生成数据的过滤与去污染不可省。
追问方向:温度 T 如何影响梯度尺度,为什么软标签项要乘 T²?序列级蒸馏与 logits 蒸馏各自的适用场景?on-policy 蒸馏(student 采样、teacher 打分纠正)解决了什么问题?(约 530 字)