RLHF 的高成本主要来自多模型并行与人工标注两方面。
1. 多模型同时驻留显存
- PPO 阶段需将策略模型、冻结参考策略、奖励模型、价值网络同时载入显存
- 一个较大规模的策略模型,其权重加优化器状态合计相当于数倍规模的参数量,对 GPU 集群要求高
2. 人工标注开销大
- 收集高质量人类偏好比较数据需要大量专业标注者参与
- 标注的规模与质量直接决定对齐效果,是持续性的投入
3. 超参数调优成本
- 裁剪比、KL 系数、价值损失权重、学习率等多个超参数相互耦合
- 任一参数调校不当都可能导致训练悄然劣化,需要反复实验