PPO 路线是完整的在线强化学习:先训练奖励模型拟合人类偏好排序,再让策略模型生成回答、奖励模型打分,用 PPO 更新策略,并以 KL 散度约束不偏离参考模型。需要同时加载策略、参考、奖励、价值四个模型,训练不稳定、超参敏感、显存开销巨大。

DPO 从理论上推导出:在 KL 约束的 RLHF 目标下,最优策略与奖励函数存在闭式对应,因此可以把偏好学习转化为一个简单的二分类损失——直接增大偏好回答相对非偏好回答的对数概率比,无需奖励模型、无需采样、无需强化学习。训练只需策略加参考两个模型,稳定且便宜。

优劣对比:DPO 简单稳定,适合中小规模偏好对齐,是开源社区主流;但它离线学习、分布外泛化弱,数据分布偏移后易退化。PPO 在线探索、上限更高,头部实验室在关键模型上仍用 RL(且扩展到 RLVR 可验证奖励)。易错点:以为 DPO 完全取代了 RLHF——实际两者常结合使用。追问方向:IPO、KTO、GRPO 各自改了什么?