现代 LLM 训练通常分三个阶段。第一阶段预训练:在数万亿 token 的无标注语料上做下一个词预测,模型习得语言规律与世界知识,得到基座模型,此阶段占 99% 以上算力。第二阶段监督微调(SFT):用高质量指令-回答对微调,让模型学会按指令对话的格式与风格,数据贵精不贵多(几万到几十万条)。第三阶段人类偏好对齐:经典路线是 RLHF——先收集人类对多个回答的排序训练奖励模型,再用 PPO 以奖励模型为信号优化策略,同时加 KL 惩罚防止偏离 SFT 模型太远;近年 DPO 等直接偏好优化方法省去奖励模型和强化学习,成为主流简化方案。

易错点:认为 RLHF 是教模型新知识——它主要塑造行为偏好(有用、诚实、无害),知识来自预训练;SFT 数据质量远比数量重要,少量低质样本就会引入幻觉风格。追问方向:为什么 RLHF 后要防 reward hacking?RLVR(可验证奖励强化学习,如数学代码)与 RLHF 的区别?