奖励模型(Reward Model, RM)负责把人类的主观偏好转化为可计算的标量分数,是 RLHF 的核心组件。
1. 收集比较排序数据
- 对同一提示,让模型生成多个不同回答
- 由标注者从有用性、诚实性、无害性、自然度等维度比较这些回答的优劣
- 采用成对比较(pairwise)而非绝对打分,判断"哪个更好"
2. 采用比较评价的原因
- 绝对评分("这个回答打几分")易因标注者标准不一而产生较大噪声
- 比较评价更贴合人类直觉、判断一致性更高,能有效降低标注偏差
3. 训练奖励模型
- 用大量比较数据训练模型,使其对更受偏好的回答给出更高分数
- 最终得到一个能对任意"提示—回答"对输出标量分数的评价器,作为强化学习的奖励信号来源