DPO(Direct Preference Optimization,直接偏好优化)是对经典 RLHF 流程的一种简化。
1. 是否保留奖励模型
- 经典 RLHF 需先训练奖励模型,再用 PPO 做强化学习
- DPO 利用偏好对(chosen / rejected)直接优化模型,省去了独立的奖励模型与强化学习循环
2. 训练稳定性与成本
- DPO 本质是一个监督式损失,训练更简单、更稳定
- 无需 rollout 采样,同等数据下算力开销通常明显低于 PPO
3. 适用场景差异
- DPO 擅长风格塑造、拒答行为、格式遵循等"模仿偏好"类任务
- 它不做探索,若正确答案从未出现在数据中,DPO 无法凭空发现
- 需要探索的数学、代码、长程推理任务,更适合 PPO 或 GRPO