尽管 DPO、GRPO 等新方法不断涌现,RLHF 的核心思想在前沿模型中依然占据主导。
1. 对齐的核心地位未变
- "用人类(或 AI)偏好来优化模型"这一基本范式,仍是前沿模型对齐的基石
- 具体算法在演进,但都属于偏好训练这一家族
2. 算法持续进化
- 从 PPO 到 DPO,再到 GRPO 与可验证奖励(RLVR),方法不断更迭
- 在开源推理模型中,GRPO 类方法(如 DeepSeek-R1、Qwen 等)已成为主流训练方式;更广泛的推理模型则采用以可验证奖励为核心的 RLVR 范式
- 这些演进保留了 RLHF 的核心,同时解决了成本、探索、稳定性等痛点
3. 工程生态成熟
- 围绕偏好训练已形成成熟的开源工具栈与工程实践
- 前沿实验室具备支撑大规模 RL 训练的算力与数据条件,能充分发挥其价值
在国内,腾讯混元大模型的对齐流程同样采用了 SFT 与 RLHF 相结合的技术路线,其开源模型 Hunyuan-Large 在后训练阶段通过 SFT 与偏好对齐(含 DPO)将模型对齐到人类偏好;混元 Hy3 版本通过对齐与评估体系的优化,幻觉率较预览版明显下降。开发者也可基于腾讯云 TI-ONE 等一站式机器学习平台,构建涵盖数据处理、模型微调与偏好对齐的大模型训练流程。