首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >PPO 算法在 RLHF 中如何优化策略?

PPO 算法在 RLHF 中如何优化策略?

词条归属:RLHF

PPO(Proximal Policy Optimization,近端策略优化)是 RLHF 经典流程中用于策略优化的标准算法。

1. 将语言模型视为策略

  • 把 SFT 后的语言模型当作强化学习中的"策略",状态为当前上下文,动作为生成的下一个词
  • 模型生成回答后,由奖励模型打分,PPO 据此沿最大化期望奖励的方向更新参数

2. 裁剪目标函数保证稳定

  • PPO 通过裁剪重要性采样比,限制单次更新的步长,避免策略剧烈震荡
  • 这一机制让训练在稳定性与样本效率之间取得平衡,是其被长期广泛采用的原因

3. 需同时维护多个模型

  • PPO 阶段需将策略模型、冻结的参考策略、奖励模型、价值网络同时载入显存
  • 因此对 GPU 集群与显存管理要求较高,是 RLHF 工程成本的主要来源之一
相关文章
近端策略优化算法(PPO)
策略梯度迭代,通过计算策略梯度的估计,并利用随机梯度上升算法进行迭代。其常用的梯度估计形式为: E^t[∇θlogπθ(at∣st)A^t] \hat{\mathbb{E}}_t[\nabla_\theta log \pi_\theta(a_t | s_t)\hat{A}_t] E^t​[∇θ​logπθ​(at​∣st​)A^t​] 其中πθ\pi_\thetaπθ​为随机策略,A^t\hat{A}_tA^t​是优势函数在时间步t的估计,其损失函数为: LPG(θ)=E^t[logπθ(at∣st)A^t] L^{PG}(\theta)=\hat{\mathbb{E}}_t[log_{\pi_\theta}(a_t|s_t)\hat{A}_t] LPG(θ)=E^t​[logπθ​​(at​∣st​)A^t​]
Steve Wang
2020-02-18
1.7K0
PPO(Proximal Policy Optimization)近端策略优化算法
强化学习可以按照方法学习策略来划分成基于值和基于策略两种。而在深度强化学习领域将深度学习与基于值的Q-Learning算法相结合产生了DQN算法,通过经验回放池与目标网络成功的将深度学习算法引入了强化学习算法。其中最具代表性分别是Q-Learning与Policy Gradient算法,将Q-Learning算法与深度学习相结合产生了Deep Q Network,而后又出现了将两种方式的优势结合在一起的更为优秀Actor Critic,DPG, DDPG,A3C,TRPO,PPO等算法。而本文所采用的是目前效果较好的近端策略优化算法PPO。
狼啸风云
2021-01-29
14.1K0
近端策略优化算法PPO的核心概念和PyTorch实现详解
近端策略优化(Proximal Policy Optimization, PPO)作为强化学习领域的重要算法,在众多实际应用中展现出卓越的性能。本文将详细介绍PPO算法的核心原理,并提供完整的PyTorch实现方案。
用户8262580
2025-09-01
7230
近端策略优化算法PPO的核心概念和PyTorch实现详解
近端策略优化(Proximal Policy Optimization, PPO)作为强化学习领域的重要算法,在众多实际应用中展现出卓越的性能。本文将详细介绍PPO算法的核心原理,并提供完整的PyTorch实现方案。
deephub
2025-11-15
1.4K0
学界 | 策略梯度下降过时了,OpenAI 拿出一种新的策略优化算法PPO
AI 科技评论按:美国时间7月20日,OpenAI 刚刚通过自己的研究博客介绍了一种新的优化算法 Proximal Policy Optimization(近端策略优化,PPO)。据介绍,这种算法用在
AI科技评论
2018-03-13
2K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券