首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >监督微调(SFT)在 RLHF 中起什么作用?

监督微调(SFT)在 RLHF 中起什么作用?

词条归属:RLHF

SFT 是 RLHF 流程中连接"预训练"与"强化学习"的桥梁,承担打基础与定方向的作用。

1. 建立基本的作答行为

  • 预训练模型只会续写文本,SFT 通过大量"提示—示范答案"配对,教会模型按用户指令组织回答
  • 让模型掌握特定任务的输出格式与行为规范,例如礼貌作答、分步推理、结构化呈现等

2. 为强化学习提供合理起点

  • 若跳过 SFT 直接做强化学习,模型输出空间过于发散,策略优化难以收敛
  • SFT 先把模型输出方向大致校准到"合理回答"区间,后续 PPO 只需在此基础上精修偏好对齐

3. 作为对齐流程的参考基准

  • SFT 后的模型在后续阶段常作为冻结的参考策略,用于计算 KL 散度约束
  • 它既是强化学习的初始化点,也是防止策略偏离过远的参照对象
相关文章
大语言模型训练范式入门课:LLM都是如何训练出来的?干货满满,一文讲清楚!
PPO(Proximal Policy Optimization,近端策略优化) 和 DPO (Direct Preference Optimization,直接偏好优化) 的核心区别在于训练范式、流程复杂度和适用场景,简单总结如下:
烟雨平生
2026-04-14
1.1K0
大模型对齐核心技术拆解:详解RLHF强化学习、PPO优化、DPO偏好对齐的差异与实践22.3
在日常使用大模型的过程中,很多人都会遇到一类典型问题:模型本身储备的知识足够全面,但输出的回答往往生硬冗长、重点模糊,甚至频繁出现内容幻觉、答非所问等问题,无法贴合人类的对话逻辑与使用习惯。这类问题并非源于预训练阶段的知识训练不足,核心原因是模型未完成人类偏好对齐优化。
未闻花名
2026-09-12
101
深度拆解 LLM 训练三阶段:为什么 AI 能像人一样对话?
做AI入行这么久,经常被新手问一个灵魂问题:明明大模型只是一堆冰冷的参数矩阵,既没有大脑也没有思维,为什么现在能流畅聊天、懂逻辑推理、还能恪守底线不乱说话?
虫无涯
2026-05-26
4750
100_RLHF(人类反馈强化学习)原理与实践
在大型语言模型(LLM)的发展历程中,我们见证了模型从简单的文本生成工具,逐渐演变为能够理解复杂指令、进行多轮对话、甚至展示创造性思维的智能系统。然而,这一进化并非仅仅依靠模型规模的增大和数据量的增加,更重要的是训练方法的创新。其中,人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)作为一种革命性的训练范式,在2022年随着ChatGPT的问世而广受关注,并在随后的GPT-4、Claude、Gemini等先进模型中得到广泛应用。
安全风信子
2025-11-16
2.2K0
Laravel中APP_KEY起什么作用
传送门:https://segmentfault.com/q/1010000009773300
咪啪咪啪
2019-11-15
1.5K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券