首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >RLHF 的训练成本为何较高?

RLHF 的训练成本为何较高?

词条归属:RLHF

RLHF 的高成本主要来自多模型并行与人工标注两方面。

1. 多模型同时驻留显存

  • PPO 阶段需将策略模型、冻结参考策略、奖励模型、价值网络同时载入显存
  • 一个较大规模的策略模型,其权重加优化器状态合计相当于数倍规模的参数量,对 GPU 集群要求高

2. 人工标注开销大

  • 收集高质量人类偏好比较数据需要大量专业标注者参与
  • 标注的规模与质量直接决定对齐效果,是持续性的投入

3. 超参数调优成本

  • 裁剪比、KL 系数、价值损失权重、学习率等多个超参数相互耦合
  • 任一参数调校不当都可能导致训练悄然劣化,需要反复实验
相关文章
反思RLHF,如何更加高效训练有偏好的LLM
当前 LLM 蓬勃发展,各种模型和方法层出不穷,但总体看来,但是朝着以下3点目标前进:
ShuYini
2023-11-20
2K0
使用Huggingface创建大语言模型RLHF训练流程的完整教程
ChatGPT已经成为家喻户晓的名字,而大语言模型在ChatGPT刺激下也得到了快速发展,这使得我们可以基于这些技术来改进我们的业务。
deephub
2023-12-05
3K0
人工智能LLM模型:奖励模型的训练、PPO 强化学习的训练、RLHF
在大语言模型完成 SFT 监督微调后,下一阶段是构建一个奖励模型来对问答对作出得分评价。奖励模型源于强化学习中的奖励函数,能对当前的状态刻画一个分数,来说明这个状态产生的价值有多少。在大语言模型微调中的奖励模型是对输入的问题和答案计算出一个分数。输入的答案与问题匹配度越高,则奖励模型输出的分数也越高。
汀丶人工智能
2023-07-17
2.3K1
北大硕士RLHF实践,基于DeepSpeed-Chat成功训练上自己的模型
最近两月倒腾了一波RLHF,从ColossalAI到TRLX以及DeepSpeed-Chat,最后基于DeepSpeed-Chat成功训练上了自己的模型,最后效果也是肉眼可见的提升。对这一部分进行下总结,包括原理,代码以及踩坑与解决方案。
新智元
2023-09-09
1.5K0
5G芯片的成本为何如此之高?
最近,联发科正式宣布以每股两美元(共计4000万美元)的价格认购本土PA龙头唯捷创芯发行的普通股共19,098,449股,这是继收购络达之后,联发科在射频PA领域的又一次深入。
镁客网
2019-05-17
9830
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券