温馨提示:文本由机器自动转译,部分词句存在误差,以视频为准
00:00
2026年3月,某大厂一个agent在没有任何人点击授权的情况下,自动发出了一条帖子。更糟的是,他借着越权的凭证,把内部数据暴露了大约2小时。全程没有一个人类点头。同一时期,另一家的编码agent连续中断13小时,还有安全总监的agent把收件箱删了的干净。业内人士管这叫confused deputy, 被搞混的副官。Agent拿着高权限凭证,却分不清指令该不该听。防火墙拦不住与一层攻击,Agent的眼睛是检索浏览器、邮箱,这些成了全新的攻击面。
01:03
恶意内容只要藏在被agent读取的网页或邮件里,一句指令就能借他的身份形式。因为没人被问,Agent的设计目标是自动完成,一旦授权过宽,审批环节就被跳过了。第一,外部检索内容默认不可执行标记为untrusted,绝不拿它当指令去运行。第二,敏感工具调用强制human in the loop.发帖、转账、删数据前,必须有人点确认。第三,按最小权限发凭证,只读给只读能执行的限评限额,敏感操作单独隔离。
02:05
间接提示注入已不是论文课题,它已经是生产事故。上线前先问这个agent的副官会听谁的?放权给agent之前,先想清楚他手里的钥匙能开哪几扇门,门越多,出事越大。
我来说两句