推理模型强调长链思维与可校验答案,RLHF 家族算法在此有重要演进。
1. 从"人类偏好"转向"可验证正确"
- 推理任务中,答案正确性往往可由验证器判定(如单元测试通过、数学答案匹配)
- 训练信号从"人类给这个回答打几分"转为"这个答案能否被证明正确"
2. GRPO 成为关键工具
- GRPO(Group Relative Policy Optimization,组相对策略优化)由 DeepSeek 团队提出,并在 DeepSeek-R1 中大规模应用
- 它去掉 PPO 中的价值网络,改用同一问题下的一组采样结果做组内归一化来估计优势
- 相比 PPO,显存占用和工程复杂度显著下降,天然适配推理任务的多候选采样场景
3. 支持纯强化学习探索
- 在 DeepSeek-R1-Zero 中,仅凭强化学习(无 SFT 示范数据)就使模型涌现出自我反思、自我验证的推理行为
- 表明 RL 在激发模型自主推理能力方面具有独特潜力