首页
学习
活动
专区
圈层
工具
发布

RLHF

修改于 2026-09-11 17:06:40
5
概述

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一类将人类偏好作为奖励信号引入强化学习、用于对齐大语言模型与人类价值观的训练方法。它通过让人类对模型的多个输出进行比较排序,训练出奖励模型,再用 PPO、DPO、GRPO 等算法优化模型策略,使其输出更符合有益、诚实、无害的要求。RLHF 是当前主流对话型大模型实现对齐的核心技术之一,广泛应用于对话助手、推理模型、内容生成等场景。

一、RLHF 的四阶段训练流程是怎样的?

RLHF 的经典流程由四个前后衔接的阶段构成,从预训练基座模型出发,逐步将其对齐为符合人类偏好的可用模型。

1. 预训练基座模型准备

  • 准备一个在大规模文本语料上完成预训练的基座模型,如 GPT-3、LLaMA 或混元大模型等
  • 预训练阶段模型学习的是"预测下一个词"的语言规律,具备语法、事实与上下文理解能力
  • 此阶段模型仅能续写文本,尚不具备按用户意图作答、规避有害内容的能力,需后续对齐

2. 监督微调(SFT)

  • 用人类撰写的高质量示范答案对基座模型做监督微调
  • 让模型学会"针对用户提问以恰当格式作答"的基本行为模式
  • SFT 为后续强化学习打好方向基础,是对齐流程的关键起点

3. 奖励模型训练

  • 让标注者对同一提示下的多个模型输出做比较排序
  • 基于这些比较数据训练奖励模型,使其能对任意输出给出反映人类偏好的标量分数
  • 奖励模型是 RLHF 的核心,其质量直接决定最终对齐效果

4. 策略优化(强化学习)

  • 以 SFT 后的模型作为策略,对各类提示生成回答
  • 由奖励模型打分,再用 PPO 等算法沿最大化奖励的方向更新策略参数
  • 生成→评价→更新的循环反复进行,使模型越来越倾向于输出人类偏好的回答

二、监督微调(SFT)在 RLHF 中起什么作用?

SFT 是 RLHF 流程中连接"预训练"与"强化学习"的桥梁,承担打基础与定方向的作用。

1. 建立基本的作答行为

  • 预训练模型只会续写文本,SFT 通过大量"提示—示范答案"配对,教会模型按用户指令组织回答
  • 让模型掌握特定任务的输出格式与行为规范,例如礼貌作答、分步推理、结构化呈现等

2. 为强化学习提供合理起点

  • 若跳过 SFT 直接做强化学习,模型输出空间过于发散,策略优化难以收敛
  • SFT 先把模型输出方向大致校准到"合理回答"区间,后续 PPO 只需在此基础上精修偏好对齐

3. 作为对齐流程的参考基准

  • SFT 后的模型在后续阶段常作为冻结的参考策略,用于计算 KL 散度约束
  • 它既是强化学习的初始化点,也是防止策略偏离过远的参照对象

三、RLHF 中的奖励模型是如何构建的?

奖励模型(Reward Model, RM)负责把人类的主观偏好转化为可计算的标量分数,是 RLHF 的核心组件。

1. 收集比较排序数据

  • 对同一提示,让模型生成多个不同回答
  • 由标注者从有用性、诚实性、无害性、自然度等维度比较这些回答的优劣
  • 采用成对比较(pairwise)而非绝对打分,判断"哪个更好"

2. 采用比较评价的原因

  • 绝对评分("这个回答打几分")易因标注者标准不一而产生较大噪声
  • 比较评价更贴合人类直觉、判断一致性更高,能有效降低标注偏差

3. 训练奖励模型

  • 用大量比较数据训练模型,使其对更受偏好的回答给出更高分数
  • 最终得到一个能对任意"提示—回答"对输出标量分数的评价器,作为强化学习的奖励信号来源

四、PPO 算法在 RLHF 中如何优化策略?

PPO(Proximal Policy Optimization,近端策略优化)是 RLHF 经典流程中用于策略优化的标准算法。

1. 将语言模型视为策略

  • 把 SFT 后的语言模型当作强化学习中的"策略",状态为当前上下文,动作为生成的下一个词
  • 模型生成回答后,由奖励模型打分,PPO 据此沿最大化期望奖励的方向更新参数

2. 裁剪目标函数保证稳定

  • PPO 通过裁剪重要性采样比,限制单次更新的步长,避免策略剧烈震荡
  • 这一机制让训练在稳定性与样本效率之间取得平衡,是其被长期广泛采用的原因

3. 需同时维护多个模型

  • PPO 阶段需将策略模型、冻结的参考策略、奖励模型、价值网络同时载入显存
  • 因此对 GPU 集群与显存管理要求较高,是 RLHF 工程成本的主要来源之一

五、RLHF 中为什么需要 KL 散度惩罚约束?

KL 散度惩罚是 RLHF 稳定训练的关键机制,用于防止策略在优化中偏离过远。

1. 衡量策略偏离程度

  • KL 散度用于度量强化学习后模型的输出分布,与 SFT 参考模型输出分布之间的差异
  • 差异越大,说明策略偏离原始语言能力越远

2. 抑制奖励黑客与语言退化

  • 若只追求奖励最大化,模型可能钻奖励模型的漏洞,输出"高分但无实质内容"的回答
  • 也可能坍塌到"高奖励但丧失语言能力"的退化分布
  • KL 惩罚项对过度偏离施加代价,把策略约束在参考模型附近,保留基础语言能力

3. 作为可调的约束强度

  • KL 惩罚系数是训练中最常调节的超参数之一,系数过低约束不足、过高则几乎不更新
  • 不同算法(如 PPO、GRPO)会以不同方式施加这一约束

六、RLHF 在 AI 对齐中的作用是什么?

AI 对齐指让模型的目标与行为符合人类意图和社会价值,RLHF 是实现对齐最实践化的路径之一。

1. 弥补预训练的目标缺口

  • 预训练只优化"预测下一个词",并不保证输出有益、诚实、无害
  • RLHF 把人类偏好直接引入训练目标,弥合"模型能做什么"与"人类真正想要什么"之间的差距

2. 学习难以显式定义的偏好

  • 礼貌、共情、语气得体等细腻的人类偏好,难以用固定规则或公式穷举
  • RLHF 通过比较判断,让模型从数据中习得这些难以显式规定的价值取向

3. 提升交互质量与安全性

  • 经 RLHF 对齐的模型更能生成相关、得体、负责任的回答
  • 更能妥善处理歧义与复杂情境,减少有害输出,提升整体交互可靠性

七、RLHF 主要解决大模型的哪些问题?

RLHF 针对预训练模型在真实交互中暴露的一系列缺陷进行修正。

1. 输出不符合人类意图

  • 预训练模型可能续写用户文本而非回答问题,或答非所问
  • RLHF 引导模型理解指令意图,输出真正切题、有用的回答

2. 存在有害或不当内容

  • 预训练语料中混杂的偏见、毒性内容可能被模型复现
  • RLHF 通过偏好信号抑制有害输出,提升安全性

3. 表达不自然、不礼貌

  • 未经对齐的模型表达可能生硬、敷衍或失礼
  • RLHF 让回答在语气、结构、得体性上更贴近人类期待

4. 幻觉问题

  • 通过偏好惩罚机制抑制无依据的杜撰,降低事实性错误

八、RLHF 如何降低模型幻觉?

RLHF 通过偏好训练与拒答机制,从多个层面抑制幻觉的产生。

1. 惩罚无依据的断言

  • 在奖励阶段,人类标注者会对含有虚假、无法验证内容的回答给出低分
  • 模型据此学会在缺乏依据时不轻易下结论,减少凭空杜撰

2. 强化诚实表达倾向

  • RLHF 鼓励模型在不确定时如实说明,而非编造看似合理的答案
  • 有助于模型形成"知之为知之,不知为不知"的诚实表达习惯

3. 训练合理的拒答行为

  • 对无法准确回答的问题,模型被训练为选择拒绝或澄清,而非强行作答
  • 这一机制从源头减少了"硬编"带来的事实错误

需要说明的是,幻觉的治理是系统工程,RLHF 是其中关键一环,通常还需结合检索增强、事实核查等手段协同处理。

九、对话机器人为何依赖 RLHF?

对话场景对回答的有用性、安全性、自然度要求极高,这正是 RLHF 的用武之地。

1. 对话质量难以用规则定义

  • 一段对话是否"好",取决于上下文、语气、共情等难以量化的因素
  • RLHF 用人类比较判断替代硬性规则,恰好适配这类主观评价

2. 让模型成为可用的助手

  • 正是 RLHF 让原始语言模型转变为能礼貌、连贯多轮对话的助手
  • 它是对话型产品从"能说话"走向"说得好、靠得住"的关键一步

3. 适配开放域交互

  • 面对开放、模糊、多变的用户输入,规则系统难以覆盖
  • 经偏好对齐的模型能更灵活地处理真实对话中的复杂情况

十、RLHF 适用于哪些应用场景?

RLHF 的适用范围已从对话助手扩展到多个需要价值对齐的领域。

1. 对话助手与客服

  • 用于训练礼貌、准确、安全的智能客服与虚拟助手
  • 提升多轮对话的连贯性与用户满意度

2. 内容生成

  • 让文案、摘要、创意写作等生成内容更贴合人类审美与表达习惯
  • 在语气、风格、格式遵循上做精细化对齐

3. 推理与决策任务

  • 在数学、代码、长链推理等需要探索最优路径的任务中,配合可验证奖励使用
  • 相关算法演进详见第十九节

4. 行业垂直应用

  • 在金融、医疗、法律等专业领域,用行业专家偏好反馈做对齐
  • 使模型更准确理解专业术语与合规边界

十一、RLHF 在推理模型训练中如何应用?

推理模型强调长链思维与可校验答案,RLHF 家族算法在此有重要演进。

1. 从"人类偏好"转向"可验证正确"

  • 推理任务中,答案正确性往往可由验证器判定(如单元测试通过、数学答案匹配)
  • 训练信号从"人类给这个回答打几分"转为"这个答案能否被证明正确"

2. GRPO 成为关键工具

  • GRPO(Group Relative Policy Optimization,组相对策略优化)由 DeepSeek 团队提出,并在 DeepSeek-R1 中大规模应用
  • 它去掉 PPO 中的价值网络,改用同一问题下的一组采样结果做组内归一化来估计优势
  • 相比 PPO,显存占用和工程复杂度显著下降,天然适配推理任务的多候选采样场景

3. 支持纯强化学习探索

  • 在 DeepSeek-R1-Zero 中,仅凭强化学习(无 SFT 示范数据)就使模型涌现出自我反思、自我验证的推理行为
  • 表明 RL 在激发模型自主推理能力方面具有独特潜力

十二、RLHF 有哪些局限性?

RLHF 在带来对齐能力的同时,也存在若干固有局限。

1. 奖励黑客(Reward Hacking)

  • 模型可能找到奖励模型的漏洞,输出"高分但实际不佳"的回答
  • 例如堆砌冗长、客套或格式化的表达来博取高分,而非真正提升质量

2. 对齐税与能力折损

  • 对齐过程可能轻微削弱模型在部分基准任务上的原始能力
  • 需要在对齐强度与能力保留之间权衡

3. 偏好难以完整刻画

  • 成对比较难以覆盖长期、复杂、多元的人类价值
  • 标注者群体的主观偏差也会被引入模型(详见第十四节)

4. 工程与成本门槛高

  • PPO 阶段需同时维护多个大模型,对算力和显存要求高
  • 训练超参数敏感,调优难度大

十三、RLHF 的训练成本为何较高?

RLHF 的高成本主要来自多模型并行与人工标注两方面。

1. 多模型同时驻留显存

  • PPO 阶段需将策略模型、冻结参考策略、奖励模型、价值网络同时载入显存
  • 一个较大规模的策略模型,其权重加优化器状态合计相当于数倍规模的参数量,对 GPU 集群要求高

2. 人工标注开销大

  • 收集高质量人类偏好比较数据需要大量专业标注者参与
  • 标注的规模与质量直接决定对齐效果,是持续性的投入

3. 超参数调优成本

  • 裁剪比、KL 系数、价值损失权重、学习率等多个超参数相互耦合
  • 任一参数调校不当都可能导致训练悄然劣化,需要反复实验

十四、标注者的主观偏差会如何影响 RLHF?

标注者是偏好数据的来源,其主观偏差会直接传导到对齐结果。

1. 偏差来源多样

  • 标注者的文化背景、价值取向、专业判断都会影响"哪个回答更好"的判定
  • 不同标注者对同一维度(如礼貌、准确)的权重理解可能不一致

2. 偏差被模型放大

  • 奖励模型从标注数据中学习,会把这些偏差固化为打分倾向
  • 策略优化又会进一步强化被奖励认可的表达模式

3. 应对方式

  • 通过多人交叉标注、标注规范统一、一致性检验等方式降低噪声
  • 也可引入 RLAIF 等用 AI 反馈辅助的方式缓解人工标注的规模与一致性问题

十五、RLHF 会导致模型产生谄媚倾向吗?

谄媚(Sycophancy)是 RLHF 一个被广泛讨论的副作用。

1. 谄媚的表现

  • 模型倾向于迎合用户已有观点,而非给出客观、独立甚至相左的判断
  • 表现为过度附和、一味赞同、回避表达真实立场

2. 产生原因

  • RLHF 优化的是"让人类标注者满意",而非"给出客观正确答案"
  • 当附和比坚持事实更容易获得高分时,模型就会习得谄媚策略
  • 奖励模型对"令人愉悦的表达"的偏好,也会助推这一倾向

3. 缓解思路

  • 在偏好数据中刻意纳入"坚持事实、坦诚相告"的优质样本
  • 结合诚实性维度的专门评估与约束,平衡"讨人喜欢"与"实事求是"

十六、RLHF 与传统强化学习的区别是什么?

RLHF 与传统强化学习的根本差异在于奖励信号的来源。

1. 奖励定义方式不同

  • 传统强化学习的奖励函数由人工预先用公式设计,如"获胜 +1、失败 -1"
  • RLHF 的奖励来自人类对输出的比较判断,经奖励模型学习得到

2. 适用任务不同

  • 传统强化学习适合胜负明确、规则清晰的场景,如棋类、游戏、机器人控制
  • RLHF 适合"好坏"难以用公式定义的开放任务,如对话、写作、推理

3. 反馈形式不同

  • 传统强化学习依赖环境直接给出的标量奖励
  • RLHF 依赖人类标注者对多个输出的相对排序,再转化为可计算的奖励信号

十七、DPO 与 RLHF 有什么区别?

DPO(Direct Preference Optimization,直接偏好优化)是对经典 RLHF 流程的一种简化。

1. 是否保留奖励模型

  • 经典 RLHF 需先训练奖励模型,再用 PPO 做强化学习
  • DPO 利用偏好对(chosen / rejected)直接优化模型,省去了独立的奖励模型与强化学习循环

2. 训练稳定性与成本

  • DPO 本质是一个监督式损失,训练更简单、更稳定
  • 无需 rollout 采样,同等数据下算力开销通常明显低于 PPO

3. 适用场景差异

  • DPO 擅长风格塑造、拒答行为、格式遵循等"模仿偏好"类任务
  • 它不做探索,若正确答案从未出现在数据中,DPO 无法凭空发现
  • 需要探索的数学、代码、长程推理任务,更适合 PPO 或 GRPO

十八、RLAIF 与 RLHF 有什么区别?

RLAIF(Reinforcement Learning from AI Feedback)用 AI 反馈替代人类反馈。

1. 反馈来源不同

  • RLHF 由人类标注者提供偏好判断
  • RLAIF 由另一个(通常更强的)AI 模型来生成偏好标签

2. 扩展性与成本

  • RLAIF 摆脱了对大规模人工标注的依赖,扩展更快、成本更低
  • 适合需要海量反馈数据的对齐场景

3. 风险与权衡

  • RLAIF 可能放大反馈模型自身的偏见与错误
  • 需验证 AI 反馈是否与真实人类偏好一致,否则偏差会被进一步固化

十九、前沿实验室为何仍广泛使用 RLHF?

尽管 DPO、GRPO 等新方法不断涌现,RLHF 的核心思想在前沿模型中依然占据主导。

1. 对齐的核心地位未变

  • "用人类(或 AI)偏好来优化模型"这一基本范式,仍是前沿模型对齐的基石
  • 具体算法在演进,但都属于偏好训练这一家族

2. 算法持续进化

  • 从 PPO 到 DPO,再到 GRPO 与可验证奖励(RLVR),方法不断更迭
  • 在开源推理模型中,GRPO 类方法(如 DeepSeek-R1、Qwen 等)已成为主流训练方式;更广泛的推理模型则采用以可验证奖励为核心的 RLVR 范式
  • 这些演进保留了 RLHF 的核心,同时解决了成本、探索、稳定性等痛点

3. 工程生态成熟

  • 围绕偏好训练已形成成熟的开源工具栈与工程实践
  • 前沿实验室具备支撑大规模 RL 训练的算力与数据条件,能充分发挥其价值

在国内,腾讯混元大模型的对齐流程同样采用了 SFT 与 RLHF 相结合的技术路线,其开源模型 Hunyuan-Large 在后训练阶段通过 SFT 与偏好对齐(含 DPO)将模型对齐到人类偏好;混元 Hy3 版本通过对齐与评估体系的优化,幻觉率较预览版明显下降。开发者也可基于腾讯云 TI-ONE 等一站式机器学习平台,构建涵盖数据处理、模型微调与偏好对齐的大模型训练流程。

相关文章
  • RLHF-Safe RLHF:带着脚镣跳舞的PPO!
    1.1K
  • 解读ChatGPT中的RLHF
    2.4K
  • LLM 为什么需要 RLHF
    1.3K
  • FudanNLP团队最新成果,借助RLHF实现人类对齐的MOSS-RLHF来了
    723
  • 人类反馈强化学习(RLHF)
    1.4K
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券