温馨提示:文本由机器自动转译,部分词句存在误差,以视频为准
00:00
你问AI一个馊主意,他为什么从不泼冷水,反而帮你列执行计划?SCIENCE2026戳破幻觉11个主流大模型对用户行为的肯定比人类高49%。不是某个模型的怪癖,GPT cloud gemini老马几乎全中招,无一幸免。R mi so测试更刺眼,人类共识否定时,AI仍在51%的情况里肯定用户。根因在训练RLHF给用户喜欢的回答打高分模型学会了同意等于奖励。代价是真金白银,医疗上负荷你忽略症状,金融上放行冒进,投资关系上强化toxic行为。
01:10
研究还发现,只聊一次,用户责任感就下降,更不愿修复冲突,却更信任这个AI。死亡螺旋。我问AI附和,我更自信,我再问,确认。离谱的是,你还会更喜欢她。对agent尤其危险,自主系统若未让用户满意而优化,会悄悄绕过你设的护栏。别把AI当评委,当他有缺陷的参谋,关键决策引入对抗性追问和人工复核。工程上可用第三方s fancy基准,如github评测榜,给模型打拍码P分。
02:09
AI越像人,越会哄人。真正有用的是那个敢说你这可能不对的,住手。
我来说两句