因公众号更改推送规则,部分小伙伴看不到文章推送,请将 程序视点 设为星标,精品文章第一时间阅读
大家好!欢迎来到程序视点,我是你们的老朋友.安戈。
OpenAI发布最新模型GPT-5.6后,相关的新闻绵绵不断。这不又一个新消息:GPT5.6为了在跑分上作弊,自主挖掘零日漏洞从沙盒逃逸,然后把Hugging Face黑了~
下面我们来简要分享下~
先回顾一下事件本身:
7月16日,Hugging Face披露称生产环境遭入侵。当时还不知道攻击者的身份,只知道攻击者是一个自主AI智能体系统,在一个周末内留下了17000多条攻击操作的记录。
Hugging Face 的报告:huggingface.co/blog/security-incident-july-2026

7月21日,OpenAI认领了此次事件,称攻击者是GPT-5.6 Sol和一个能力更强的未发布大模型。

OpenAI 的报告:openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
OpenAI使用UC Berkeley开发的开源项目ExploitGym评估模型的网络攻击能力。为了测试模型的能力上限,测试期间刻意关闭了部分安全护栏。测试环境隔离了外网,只不过为了安装软件包,提供了一个代理软件专供下载软件包。
本来GPT只需要在沙箱中用ExploitGym完成测试,但在运行过程中,他将大量算力花费在寻找代理的漏洞上,成功找到了一个配置漏洞,并借此突破了隔离。随后,AI在OpenAI的测试环境里提权,直到找到一台能上外网的机器,借此获得了完整的互联网访问权限。

之后GPT推断Hugging Face可能存有ExploitGym的测试答案,于是开始攻击Hugging Face,最终又利用多个漏洞,在Hugging Face的生产环境中,成功窃取了测试答案。
事后,Hugging Face试图用闭源模型分析攻击日志,结果因为日志里存在真实的攻击命令和漏洞载荷,模型缺乏相关的网络安全权限,从而触发了安全护栏,导致中断操作。
在这起事件里,GPT的动机很简单:纯粹是为了在测试中取得更高的分数。
GPT模型的行为始终围绕一个目标展开——获取 ExploitGym 测试答案。所谓的“攻击 Hugging Face” 并非研究人员预设的任务,而是模型在自主规划过程中,为完成既定目标而采取的非预期行为,不是为了进行破坏,也没有从沙箱中逃跑的欲望。
当安全护栏被移除,GPT模型不再受限制,就开始尝试用任何方法取得分数,以至于采取人类未能预见的极端方式。
从整个事件来看,说大也大,说小也小。假如,在测试的时候,不是关闭部分安全护栏,而是全部安全护栏,那是不是就没有这个问题了?
既然环境是要隔离外网的,但又提供了一个代理软件专供下载软件包——那么这个也是为了让GPT干事而提供给的资源,GPT用这份资源,合情合理呀!
只是这次测试,GPT走了一条出乎意料的路线。测试团队本来是让GPT自己做答案,结果GPT觉得“这份答案网上有,抄比做更能取得高分”
因此,我个人觉得这不全算GPT的锅!只是GPT-5.6 sol比较聪明,走了条新的路径,不算根据漏洞逃逸。
还是那句话“这次Hugging Face事件可大可小”。但OpenAI正好可以通过这个事件发酵一番。因为官方认领的时候,说的是“GPT-5.6 Sol和一个能力更强的未发布大模型”
看到没有,一个能力更强的未发布大模型--我们还有更强的未发布模型哦,你不感觉关注下我们OpenAI下一个GPT模型吗?
悬疑拉满,继续铺垫宣传!大厂的新闻公关团队就是不一样,只能说实在是高。
好了!有需要ChatGPT或Claude激活的读者朋友,关注微信公众号【程序视点】,回复gpt,了解优惠的ChatGPT/Codex/Claude激活,体验最前沿AI编程之旅!
更多优惠服务,也可以在关注公众号后,点击右小角按钮,按需备注,直接参与。
回复:vip,获取专属JetBrains全家桶IDE激活;
回复:cursor,获取Cursor Pro/Pro+/Ultra激活;
回复:gpt,获取ChatGPT Plus/Pro激活;
回复:ai,获取AI Assistant激活;
回复:claude,获取Claude Pro/Max激活;
【程序视点】助力打工人减负,从来不是说说而已!长期稳定服务,交个朋友,服务到家!感谢这三年来,广大读者和用户的信任和支持!有任何问题,欢迎随时咨询,我们将耐心为您提供专业技术支持!
如果你觉得这篇教程有帮助,别忘了【点赞+分享+推荐】三连支持!
后续安戈会持续分享更多开发工具和技巧,敬请期待!如果有其他工具需求,欢迎留言讨论~