直接回答:RLHF 先训奖励模型(RM)拟合人类偏好,再用 PPO 在线强化学习最大化奖励;DPO 跳过 RM,直接从偏好对(chosen/rejected)构造闭式损失做离线监督训练,数学上等价于在 Bradley-Terry 偏好模型下的 RLHF 最优解。DPO 简单稳定便宜,RLHF 上限更高但工程复杂。

展开解析:差异拆解:数据流上 DPO 只需静态偏好对,RLHF 的 PPO 阶段要在线采样生成,基础设施(推理加训练联动)重得多;稳定性上 PPO 对超参敏感、容易奖励黑客(模型钻 RM 空子刷分,如疯狂加长回复),DPO 是监督式损失收敛平稳;能力上限上 DPO 受限于离线数据的分布——模型生成超出偏好对覆盖的行为就失去约束,而在线 RL 能探索新解,这也是 o1/R1 类推理模型仍走 RL 路线的原因。工程选型:资源有限、偏好数据现成的对齐场景选 DPO(或其变体 IPO、KTO——KTO 只需单条好坏标注,适合用户点赞点踩数据);追求推理能力突破、能负担在线训练选 RL(PPO/GRPO)。实践折中:先 DPO 快速拿到 80 分对齐效果,再上在线 RL 攻坚推理上限。共同前提都是 SFT 模型先训好,偏好数据质量不达标两种方法都救不了。

追问方向:GRPO 相对 PPO 做了什么简化?奖励黑客如何检测?

(约 470 字)