RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一类将人类偏好作为奖励信号引入强化学习、用于对齐大语言模型与人类价值观的训练方法。它通过让人类对模型的多个输出进行比较排序,训练出奖励模型,再用 PPO、DPO、GRPO 等算法优化模型策略,使其输出更符合有益、诚实、无害的要求。RLHF 是当前主流对话型大模型实现对齐的核心技术之一,广泛应用于对话助手、推理模型、内容生成等场景。
RLHF 的经典流程由四个前后衔接的阶段构成,从预训练基座模型出发,逐步将其对齐为符合人类偏好的可用模型。
SFT 是 RLHF 流程中连接"预训练"与"强化学习"的桥梁,承担打基础与定方向的作用。
奖励模型(Reward Model, RM)负责把人类的主观偏好转化为可计算的标量分数,是 RLHF 的核心组件。
PPO(Proximal Policy Optimization,近端策略优化)是 RLHF 经典流程中用于策略优化的标准算法。
KL 散度惩罚是 RLHF 稳定训练的关键机制,用于防止策略在优化中偏离过远。
AI 对齐指让模型的目标与行为符合人类意图和社会价值,RLHF 是实现对齐最实践化的路径之一。
RLHF 针对预训练模型在真实交互中暴露的一系列缺陷进行修正。
RLHF 通过偏好训练与拒答机制,从多个层面抑制幻觉的产生。
需要说明的是,幻觉的治理是系统工程,RLHF 是其中关键一环,通常还需结合检索增强、事实核查等手段协同处理。
对话场景对回答的有用性、安全性、自然度要求极高,这正是 RLHF 的用武之地。
RLHF 的适用范围已从对话助手扩展到多个需要价值对齐的领域。
推理模型强调长链思维与可校验答案,RLHF 家族算法在此有重要演进。
RLHF 在带来对齐能力的同时,也存在若干固有局限。
RLHF 的高成本主要来自多模型并行与人工标注两方面。
标注者是偏好数据的来源,其主观偏差会直接传导到对齐结果。
谄媚(Sycophancy)是 RLHF 一个被广泛讨论的副作用。
RLHF 与传统强化学习的根本差异在于奖励信号的来源。
DPO(Direct Preference Optimization,直接偏好优化)是对经典 RLHF 流程的一种简化。
RLAIF(Reinforcement Learning from AI Feedback)用 AI 反馈替代人类反馈。
尽管 DPO、GRPO 等新方法不断涌现,RLHF 的核心思想在前沿模型中依然占据主导。
在国内,腾讯混元大模型的对齐流程同样采用了 SFT 与 RLHF 相结合的技术路线,其开源模型 Hunyuan-Large 在后训练阶段通过 SFT 与偏好对齐(含 DPO)将模型对齐到人类偏好;混元 Hy3 版本通过对齐与评估体系的优化,幻觉率较预览版明显下降。开发者也可基于腾讯云 TI-ONE 等一站式机器学习平台,构建涵盖数据处理、模型微调与偏好对齐的大模型训练流程。