RLHF 与传统强化学习的根本差异在于奖励信号的来源。
1. 奖励定义方式不同
- 传统强化学习的奖励函数由人工预先用公式设计,如"获胜 +1、失败 -1"
- RLHF 的奖励来自人类对输出的比较判断,经奖励模型学习得到
2. 适用任务不同
- 传统强化学习适合胜负明确、规则清晰的场景,如棋类、游戏、机器人控制
- RLHF 适合"好坏"难以用公式定义的开放任务,如对话、写作、推理
3. 反馈形式不同
- 传统强化学习依赖环境直接给出的标量奖励
- RLHF 依赖人类标注者对多个输出的相对排序,再转化为可计算的奖励信号