RLHF 的经典流程由四个前后衔接的阶段构成,从预训练基座模型出发,逐步将其对齐为符合人类偏好的可用模型。
1. 预训练基座模型准备
- 准备一个在大规模文本语料上完成预训练的基座模型,如 GPT-3、LLaMA 或混元大模型等
- 预训练阶段模型学习的是"预测下一个词"的语言规律,具备语法、事实与上下文理解能力
- 此阶段模型仅能续写文本,尚不具备按用户意图作答、规避有害内容的能力,需后续对齐
2. 监督微调(SFT)
- 用人类撰写的高质量示范答案对基座模型做监督微调
- 让模型学会"针对用户提问以恰当格式作答"的基本行为模式
- SFT 为后续强化学习打好方向基础,是对齐流程的关键起点
3. 奖励模型训练
- 让标注者对同一提示下的多个模型输出做比较排序
- 基于这些比较数据训练奖励模型,使其能对任意输出给出反映人类偏好的标量分数
- 奖励模型是 RLHF 的核心,其质量直接决定最终对齐效果
4. 策略优化(强化学习)
- 以 SFT 后的模型作为策略,对各类提示生成回答
- 由奖励模型打分,再用 PPO 等算法沿最大化奖励的方向更新策略参数
- 生成→评价→更新的循环反复进行,使模型越来越倾向于输出人类偏好的回答