RLHF 在带来对齐能力的同时,也存在若干固有局限。
1. 奖励黑客(Reward Hacking)
- 模型可能找到奖励模型的漏洞,输出"高分但实际不佳"的回答
- 例如堆砌冗长、客套或格式化的表达来博取高分,而非真正提升质量
2. 对齐税与能力折损
- 对齐过程可能轻微削弱模型在部分基准任务上的原始能力
- 需要在对齐强度与能力保留之间权衡
3. 偏好难以完整刻画
- 成对比较难以覆盖长期、复杂、多元的人类价值
- 标注者群体的主观偏差也会被引入模型(详见第十四节)
4. 工程与成本门槛高
- PPO 阶段需同时维护多个大模型,对算力和显存要求高
- 训练超参数敏感,调优难度大