首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >RLHF 中的奖励模型是如何构建的?

RLHF 中的奖励模型是如何构建的?

词条归属:RLHF

奖励模型(Reward Model, RM)负责把人类的主观偏好转化为可计算的标量分数,是 RLHF 的核心组件。

1. 收集比较排序数据

  • 对同一提示,让模型生成多个不同回答
  • 由标注者从有用性、诚实性、无害性、自然度等维度比较这些回答的优劣
  • 采用成对比较(pairwise)而非绝对打分,判断"哪个更好"

2. 采用比较评价的原因

  • 绝对评分("这个回答打几分")易因标注者标准不一而产生较大噪声
  • 比较评价更贴合人类直觉、判断一致性更高,能有效降低标注偏差

3. 训练奖励模型

  • 用大量比较数据训练模型,使其对更受偏好的回答给出更高分数
  • 最终得到一个能对任意"提示—回答"对输出标量分数的评价器,作为强化学习的奖励信号来源
相关文章
人工智能LLM模型:奖励模型的训练、PPO 强化学习的训练、RLHF
在大语言模型完成 SFT 监督微调后,下一阶段是构建一个奖励模型来对问答对作出得分评价。奖励模型源于强化学习中的奖励函数,能对当前的状态刻画一个分数,来说明这个状态产生的价值有多少。在大语言模型微调中的奖励模型是对输入的问题和答案计算出一个分数。输入的答案与问题匹配度越高,则奖励模型输出的分数也越高。
汀丶人工智能
2023-07-17
2.3K1
BERT 是如何构建模型的
前面我写了一篇文章来讲 BERT 是如何分词的,现在,轮到该说说 BERT 模型是如何定义的了。
Alan Lee
2020-06-24
3K0
大语言模型中的 RLHF:强化学习如何优化 AI 交互体验
近年来,大语言模型(Large Language Model, LLM)取得了突破性的进展,GPT-3、GPT-4 以及其他基于 Transformer 架构的模型在自然语言处理(NLP)任务中展现出卓越的性能。然而,尽管这些模型具备强大的生成能力,它们的输出仍然可能存在不符合人类期望的情况,比如生成误导性信息、带有偏见的内容,或者在对话中缺乏连贯性。
编程小妖女
2025-02-03
1.4K0
解读ChatGPT中的RLHF
无论是 ChatGPT 还是 GPT-4,它们的核心技术机制之一都是基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF)。这是大型语言模型生成领域的新训练范式,即以强化学习方式依据人类反馈优化语言模型。那么,什么是 RLHF 呢?
半吊子全栈工匠
2023-09-02
2.4K0
我是如何轻松拿到Google $1337现金奖励的
一、 发现过程 时间回到5月8号的中午12点30分,饭后同事说新出的Jenknis漏洞RCE的EXP网上已经在转播了,当时记得那个漏洞是大概在5月1号出的,然后在网上迅速流出针对Jenknis2.23.1的RCE漏洞POC和EXP。 随后上了Fofa进行查询,查询语句: header=”jenkins” 当时第一眼的是ci.tensorflow.org,现在的检索结果已经改变了 因为平时关注到机器学习和深度学习,当然就注意到了这个域名就是Google旗下的Tensorflow分支项目二级域名(当时心里想的是
FB客服
2018-02-28
1.5K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券