AI 对齐指让模型的目标与行为符合人类意图和社会价值,RLHF 是实现对齐最实践化的路径之一。
1. 弥补预训练的目标缺口
- 预训练只优化"预测下一个词",并不保证输出有益、诚实、无害
- RLHF 把人类偏好直接引入训练目标,弥合"模型能做什么"与"人类真正想要什么"之间的差距
2. 学习难以显式定义的偏好
- 礼貌、共情、语气得体等细腻的人类偏好,难以用固定规则或公式穷举
- RLHF 通过比较判断,让模型从数据中习得这些难以显式规定的价值取向
3. 提升交互质量与安全性
- 经 RLHF 对齐的模型更能生成相关、得体、负责任的回答
- 更能妥善处理歧义与复杂情境,减少有害输出,提升整体交互可靠性