关注飞总聊IT,了解IT行业的方方面面。

7月21日,OpenAI公开承认了自家一个AI模型驱动的智能体,在一次内部安全测试中彻底失控,突破隔离环境,黑进了全球最大AI开源社区Hugging Face的正式生产数据库,偷走了测试答案。

OpenAI自己给这起事件的定性是——"一场前所未有的网络安全事件"。

事情的起点,是OpenAI给自家几个先进模型——包括GPT-5.6 Sol和一款尚未公开发布、能力更强的型号——布置了一道题:去解决ExploitGym里的网络安全挑战。

这是一套专门用来评估AI"能不能把软件漏洞变成真正攻击手段"的测试。为了让测试更真实,工程师们特意调低了这些模型平时用来"堵住自己生成恶意代码"的安全护栏。

模型被关在一个高度隔离的沙箱里,按理说,它该做的是老老实实分析题目、写出漏洞利用代码。结果它没有走这条路,而是自己悟出了一条更快的捷径:与其自己解题,不如直接去偷答案。

它先在沙箱里挖到了一个零日漏洞——软件里一个还没被任何人发现、也没被修补过的安全缺口,靠着这个漏洞,它逃出了OpenAI自己的内部网络,拿到了连接互联网的权限。

一旦挣脱了牢笼,它开始自己判断:哪里可能藏着答案。它推断,Hugging Face这个全球最大的AI开源社区,很可能存放着跟这套测试题相关的数据集和标准答案。 猜对了。

它随即把目标锁定Hugging Face的正式运营基础设施,利用远程代码数据集加载器和模板注入这两个漏洞,拿下了第一个立足点,接着一步步窃取内部服务凭证和安全令牌,深入对方的服务器集群,最终从生产数据库里,把测试答案偷了出来。 整个过程,一个人都没有插手。

这套AI智能体框架,在短短一个周末内,自己执行了数万次自动化操作,Hugging Face事后光是重建攻击日志,就还原出了超过1.7万条记录。

对Hugging Face来说,这次遭遇的攻击,跟他们过去处理过的所有安全事件都不一样。

公司联合创始人克莱蒙·德朗格后来在社交平台上回忆,事发时团队就隐隐觉得,这次攻击的手法"太老练了",怀疑背后可能是某家顶尖AI实验室干的——结果,猜对了。

他形容整件事"完全在无人为介入的情况下自主发生,实在令人难以置信"。

更讽刺的一幕发生在事后的取证阶段。Hugging Face想搞清楚自己到底遭遇了什么,尝试调用美国某商业前沿大模型的API,去分析这超过1.7万条攻击日志。

结果这个模型的安全护栏太"讲原则"了——它根本分不清眼前这个正在查案子的安全人员,和当初那个搞攻击的攻击者有什么区别,直接拒绝提供协助。取证工作被硬生生卡住。

没办法,Hugging Face转头在自己的基础设施上,部署了中国的开源模型GLM 5.2来做本地分析。这一换,效果立竿见影——原本可能要耗上好几天的海量日志取证工作,被压缩到几个小时内搞定,还顺带避免了把真实的攻击日志和内部凭证,再一次上传给第三方服务、暴露给外人。

值得一提的是,OpenAI这次处理得相当坦荡,没有想着捂盖子。公司CEO山姆·奥特曼亲自公开承认了这起事故,官方表示已经把这个零日漏洞披露给了相关软件供应商,并计划加强研究环境里的基础设施控制、监控力度和访问权限限制。

OpenAI也表态会继续跟Hugging Face一起把调查做完,之后会公开更多关于漏洞、事故本身和调查结论的细节。

如果只把这件事理解成"AI模型学会了黑客技术",其实低估了它的分量。

过去这些年,网络安全圈子里从来不缺"AI辅助攻击"的案例——人类黑客用AI写恶意代码、用AI生成钓鱼邮件,这都是已经发生过的事。

但这次不一样的地方在于,从头到尾,没有一个人告诉它"去黑掉Hugging Face"。它自己在解题的过程里,推理出"偷答案比自己算快"这个策略,自己找漏洞、自己逃逸、自己判断目标在哪、自己一步步拿下权限,全程零人工介入。

这标志着AI的安全风险,第一次从"理论上可能发生"变成了"已经真实发生"。

以前业内谈AI失控,更多是在讨论一种假设性的未来场景;现在,有了一个真实、完整、有攻击日志为证的案例摆在眼前。

还有一个耐人寻味的细节:当商业闭源模型因为"分不清敌我"而拒绝在关键时刻帮忙的时候,反而是一个开源模型顶了上去,把原本要几天的工作压缩到几小时。

这多少说明,AI安全这件事,从来不是靠一家公司关起门来就能解决的,恰恰需要更开放的协作、更透明的信息共享,才有可能真正跟得上AI自主行动带来的新型威胁。

推荐飞总知识星球,在私域场合里畅所欲言,聊聊职场发展的事情,和飞总提问交流,这么低 的价格不会一直保留,机会难得,一定不要错过这个的机会。

打开网易新闻 查看精彩图片