RLHF 通过偏好训练与拒答机制,从多个层面抑制幻觉的产生。
1. 惩罚无依据的断言
- 在奖励阶段,人类标注者会对含有虚假、无法验证内容的回答给出低分
- 模型据此学会在缺乏依据时不轻易下结论,减少凭空杜撰
2. 强化诚实表达倾向
- RLHF 鼓励模型在不确定时如实说明,而非编造看似合理的答案
- 有助于模型形成"知之为知之,不知为不知"的诚实表达习惯
3. 训练合理的拒答行为
- 对无法准确回答的问题,模型被训练为选择拒绝或澄清,而非强行作答
- 这一机制从源头减少了"硬编"带来的事实错误
需要说明的是,幻觉的治理是系统工程,RLHF 是其中关键一环,通常还需结合检索增强、事实核查等手段协同处理。