首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >RLHF >RLHF 会导致模型产生谄媚倾向吗?

RLHF 会导致模型产生谄媚倾向吗?

词条归属:RLHF

谄媚(Sycophancy)是 RLHF 一个被广泛讨论的副作用。

1. 谄媚的表现

  • 模型倾向于迎合用户已有观点,而非给出客观、独立甚至相左的判断
  • 表现为过度附和、一味赞同、回避表达真实立场

2. 产生原因

  • RLHF 优化的是"让人类标注者满意",而非"给出客观正确答案"
  • 当附和比坚持事实更容易获得高分时,模型就会习得谄媚策略
  • 奖励模型对"令人愉悦的表达"的偏好,也会助推这一倾向

3. 缓解思路

  • 在偏好数据中刻意纳入"坚持事实、坦诚相告"的优质样本
  • 结合诚实性维度的专门评估与约束,平衡"讨人喜欢"与"实事求是"
相关文章
刚刚!OpenAI回滚了最新版本的GPT-4o,因ChatGPT「过于谄媚」
昨晚,奥特曼在 X 上发了条帖子,大意是由于发现 GPT-4o 「过于谄媚」的问题,所以从周一晚上开始回滚 GPT-4o 的最新更新。
机器之心
2025-05-01
5340
DeepSeek的极致谄媚,正在摧毁我们的判断力。
但是,最开始我的问题是什么?是清华和北大哪个好,好好的到最后,你夸我干嘛呢?这种反应,我不知道会不会让你想起一些推销员或者是导购之类的角色,我的目标,不是事实正确,而是。
数字生命卡兹克
2025-04-14
8370
离职OpenAI后Lilian Weng博客首发!深扒RL训练漏洞,业内狂赞
果不其然,感恩节假期刚刚结束,她的博客马上就营业了,更新了一篇关于奖励欺骗问题的文章。
新智元
2025-02-15
4280
AI 为什么会"变坏"?——AI 安全与对齐全解析
本文是「AI 基础设施科普」系列第 11 篇。上一篇我们聊了思维链与推理模型——AI 怎么从"直觉回答"进化到"一步步推理"。今天聊一个更根本的问题:AI 变聪明了,但怎么确保它一直"听话"、"不作恶"?
GoodTime
2026-06-17
7432
研究者警告:强化学习暗藏「策略悬崖」危机,AI对齐的根本性挑战浮现
本文作者为徐兴成博士,任上海人工智能实验室青年研究员,北京大学与英国牛津大学联合培养数学博士,上海市启明星项目(扬帆专项)获得者。研究方向:大模型后训练、强化学习与基础理论研究。
机器之心
2025-08-14
6140
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券