首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >前沿实验室为何仍广泛使用 RLHF?

前沿实验室为何仍广泛使用 RLHF?

词条归属:RLHF

尽管 DPO、GRPO 等新方法不断涌现,RLHF 的核心思想在前沿模型中依然占据主导。

1. 对齐的核心地位未变

  • "用人类(或 AI)偏好来优化模型"这一基本范式,仍是前沿模型对齐的基石
  • 具体算法在演进,但都属于偏好训练这一家族

2. 算法持续进化

  • 从 PPO 到 DPO,再到 GRPO 与可验证奖励(RLVR),方法不断更迭
  • 在开源推理模型中,GRPO 类方法(如 DeepSeek-R1、Qwen 等)已成为主流训练方式;更广泛的推理模型则采用以可验证奖励为核心的 RLVR 范式
  • 这些演进保留了 RLHF 的核心,同时解决了成本、探索、稳定性等痛点

3. 工程生态成熟

  • 围绕偏好训练已形成成熟的开源工具栈与工程实践
  • 前沿实验室具备支撑大规模 RL 训练的算力与数据条件,能充分发挥其价值

在国内,腾讯混元大模型的对齐流程同样采用了 SFT 与 RLHF 相结合的技术路线,其开源模型 Hunyuan-Large 在后训练阶段通过 SFT 与偏好对齐(含 DPO)将模型对齐到人类偏好;混元 Hy3 版本通过对齐与评估体系的优化,幻觉率较预览版明显下降。开发者也可基于腾讯云 TI-ONE 等一站式机器学习平台,构建涵盖数据处理、模型微调与偏好对齐的大模型训练流程。

相关文章
Claude 大模型如何思考?Anthropic 员工万字长谈:RL 智能体、可解释性与 AGI 未来
近日,Anthropic 的两位核心研究员 Sholto Douglas 和 Trenton Bricken,与著名的科技播客主持人 Dwarkesh Patel 深度剖析了过去一年 AI 研究的巨变,特别是强化学习 (RL) 的新范式、模型思维的可解释性追踪,以及通往 AGI(通用人工智能)道路上的机遇与挑战。
不二小段
2026-04-09
4670
最新综述:基于反馈的强化学习
基于人类反馈的强化学习(RLHF)已成为部署最新机器学习系统的重要技术和叙事工具。在本书中,我们希望为具备一定量化背景的读者提供对核心方法的简明介绍。本书首先回顾RLHF的起源——既包括近期文献中的发展,也涵盖经济学、哲学和最优控制等不同科学领域的交汇融合。随后,我们将介绍相关定义、问题建模、数据收集以及文献中常用的数学基础,为后续内容奠定基础。最后,我们将详细介绍当前流行的RLHF算法,并探讨该领域未来的发展方向。
CreateAMind
2026-03-11
8640
ICLR 2024 | RLHF有了通用平台和基准,天大开源,专攻现实决策场景
RLHF 通过学习人类偏好,能够在难以手工设计奖励函数的复杂决策任务中学习到正确的奖励引导,得到了很高的关注,在不同环境中选择合适的人类反馈类型和不同的学习方法至关重要。
机器之心
2024-04-12
5340
在化学宇宙中寻找 美丽分子 :生成式 AI 药物设计的现状、挑战与未来
生成式 AI(Generative AI,简称 GenAI)正在以前所未有的速度改变各行各业。在制药领域,各大生物技术公司纷纷声称 AI 将颠覆药物发现——但临床成功的案例寥寥无几,绝大多数 AI 生成的分子依然止步于纸面。
DrugIntel
2026-04-21
4530
2018年十大人工智能技术趋势,人工智能的进步对未来的巨大影响
了解人工智能的进步,这将对未来产生巨大的影响: 人工智能是前沿和中心,商界和政府领导人正在思考正确的举措。但是在实验室里发生了什么呢?在实验室里,学术和企业研究人员的发现将为未来一年乃至更长的时间设定
程序你好
2018-07-20
6950
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券