SFT 是 RLHF 流程中连接"预训练"与"强化学习"的桥梁,承担打基础与定方向的作用。
1. 建立基本的作答行为
- 预训练模型只会续写文本,SFT 通过大量"提示—示范答案"配对,教会模型按用户指令组织回答
- 让模型掌握特定任务的输出格式与行为规范,例如礼貌作答、分步推理、结构化呈现等
2. 为强化学习提供合理起点
- 若跳过 SFT 直接做强化学习,模型输出空间过于发散,策略优化难以收敛
- SFT 先把模型输出方向大致校准到"合理回答"区间,后续 PPO 只需在此基础上精修偏好对齐
3. 作为对齐流程的参考基准
- SFT 后的模型在后续阶段常作为冻结的参考策略,用于计算 KL 散度约束
- 它既是强化学习的初始化点,也是防止策略偏离过远的参照对象