PPO(Proximal Policy Optimization,近端策略优化)是 RLHF 经典流程中用于策略优化的标准算法。
1. 将语言模型视为策略
- 把 SFT 后的语言模型当作强化学习中的"策略",状态为当前上下文,动作为生成的下一个词
- 模型生成回答后,由奖励模型打分,PPO 据此沿最大化期望奖励的方向更新参数
2. 裁剪目标函数保证稳定
- PPO 通过裁剪重要性采样比,限制单次更新的步长,避免策略剧烈震荡
- 这一机制让训练在稳定性与样本效率之间取得平衡,是其被长期广泛采用的原因
3. 需同时维护多个模型
- PPO 阶段需将策略模型、冻结的参考策略、奖励模型、价值网络同时载入显存
- 因此对 GPU 集群与显存管理要求较高,是 RLHF 工程成本的主要来源之一