首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >RLHF 的四阶段训练流程是怎样的?

RLHF 的四阶段训练流程是怎样的?

词条归属:RLHF

RLHF 的经典流程由四个前后衔接的阶段构成,从预训练基座模型出发,逐步将其对齐为符合人类偏好的可用模型。

1. 预训练基座模型准备

  • 准备一个在大规模文本语料上完成预训练的基座模型,如 GPT-3、LLaMA 或混元大模型等
  • 预训练阶段模型学习的是"预测下一个词"的语言规律,具备语法、事实与上下文理解能力
  • 此阶段模型仅能续写文本,尚不具备按用户意图作答、规避有害内容的能力,需后续对齐

2. 监督微调(SFT)

  • 用人类撰写的高质量示范答案对基座模型做监督微调
  • 让模型学会"针对用户提问以恰当格式作答"的基本行为模式
  • SFT 为后续强化学习打好方向基础,是对齐流程的关键起点

3. 奖励模型训练

  • 让标注者对同一提示下的多个模型输出做比较排序
  • 基于这些比较数据训练奖励模型,使其能对任意输出给出反映人类偏好的标量分数
  • 奖励模型是 RLHF 的核心,其质量直接决定最终对齐效果

4. 策略优化(强化学习)

  • 以 SFT 后的模型作为策略,对各类提示生成回答
  • 由奖励模型打分,再用 PPO 等算法沿最大化奖励的方向更新策略参数
  • 生成→评价→更新的循环反复进行,使模型越来越倾向于输出人类偏好的回答
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券