首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >RLHF 在推理模型训练中如何应用?

RLHF 在推理模型训练中如何应用?

词条归属:RLHF

推理模型强调长链思维与可校验答案,RLHF 家族算法在此有重要演进。

1. 从"人类偏好"转向"可验证正确"

  • 推理任务中,答案正确性往往可由验证器判定(如单元测试通过、数学答案匹配)
  • 训练信号从"人类给这个回答打几分"转为"这个答案能否被证明正确"

2. GRPO 成为关键工具

  • GRPO(Group Relative Policy Optimization,组相对策略优化)由 DeepSeek 团队提出,并在 DeepSeek-R1 中大规模应用
  • 它去掉 PPO 中的价值网络,改用同一问题下的一组采样结果做组内归一化来估计优势
  • 相比 PPO,显存占用和工程复杂度显著下降,天然适配推理任务的多候选采样场景

3. 支持纯强化学习探索

  • 在 DeepSeek-R1-Zero 中,仅凭强化学习(无 SFT 示范数据)就使模型涌现出自我反思、自我验证的推理行为
  • 表明 RL 在激发模型自主推理能力方面具有独特潜力
相关文章
从RLHF、PPO到GRPO再训练推理模型,这是你需要的强化学习入门指南
强化学习(RL)已经成为当今 LLM 不可或缺的技术之一。从大模型对齐到推理模型训练再到如今的智能体强化学习(Agentic RL),你几乎能在当今 AI 领域的每个领域看到强化学习的身影。
机器之心
2025-06-23
1.8K0
反思RLHF,如何更加高效训练有偏好的LLM
当前 LLM 蓬勃发展,各种模型和方法层出不穷,但总体看来,但是朝着以下3点目标前进:
ShuYini
2023-11-20
2K0
解析最新开源的 AReaL-boba² 框架:异步强化学习在大型推理模型训练中的应用
自 OpenAI 推出 o1 模型以来,推理已经逐渐成为了大语言模型的必备能力。在推理能力背后,强化学习(RL)扮演着越来越重要的角色,但也对训练系统提出了新的要求。
不二小段
2026-04-09
3770
RDMA 高性能网络在 AI 训练中的应用:TKE 如何保障分布式训练效率
摘要: RDMA 远程直接内存访问技术通过绕过 CPU 内核实现节点间高速数据传输,显著降低大规模 AI 分布式训练的通信延迟。腾讯云容器服务 TKE 提供统一 GID Index、NUMA 亲和调度
hollyx
2026-08-07
2430
[机器学习|理论&实践] 机器学习在体育训练优化中的应用
体育训练一直是追求优秀运动表现的关键。随着机器学习技术的迅速发展,它在体育训练中的应用为教练员和运动员提供了新的工具,以更科学、更精准地制定训练计划、优化表现,甚至预防运动损伤。本项目旨在深入探讨机器学习在体育训练中的应用,结合实例详细介绍部署过程,同时展望未来发展方向。
二一年冬末
2024-02-12
8500
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券