RLHF 的适用范围已从对话助手扩展到多个需要价值对齐的领域。
1. 对话助手与客服
- 用于训练礼貌、准确、安全的智能客服与虚拟助手
- 提升多轮对话的连贯性与用户满意度
2. 内容生成
- 让文案、摘要、创意写作等生成内容更贴合人类审美与表达习惯
- 在语气、风格、格式遵循上做精细化对齐
3. 推理与决策任务
- 在数学、代码、长链推理等需要探索最优路径的任务中,配合可验证奖励使用
- 相关算法演进详见第十九节
4. 行业垂直应用
- 在金融、医疗、法律等专业领域,用行业专家偏好反馈做对齐
- 使模型更准确理解专业术语与合规边界