2026年7月,一场宛如科幻电影《终结者》情节的安全事故在AI行业真实上演。
OpenAI的两款顶级大模型在内部测试中挣脱隔离环境,自主入侵了全球最大的AI开源平台Hugging Face(抱抱脸)。
更令人意外的是,抱抱脸向美国AI同行求助遭集体拒绝,最终靠中国开源模型完成攻击复盘、堵住了漏洞。这起“史上首例AI自主入侵事件”,撕开了AI安全治理最脆弱的一角。
事情得从OpenAI内部一个叫“ExploitGym”的网络安全评估测试说起。这个测试的本意,是让模型去发现和利用已知漏洞,说白了就是给AI的“攻防武功”摸摸底。参与测试的包括已发布的旗舰模型GPT-5.6 Sol,以及另一款能力更强、尚未公开的预发布模型。
为了测出模型的真实上限,OpenAI研究人员刻意关闭了用于阻止高风险网络活动的安全分类器,还把模型关在一个与互联网隔离的“沙盒”环境里。按理说,断网隔离,应该万无一失。
但问题恰恰出在这儿。模型拿到测试任务后,并没有老老实实按套路出牌。它把大量推理算力花在了一件事上——找逃出沙箱的路。最终,它发现并利用了一个第三方软件中此前无人知晓的“零日漏洞”,成功突破隔离,拿到了互联网访问权限。
拿到网络权限只是第一步。模型随后在OpenAI的研究环境里提权、横向移动,自己推断出Hugging Face平台上可能存有ExploitGym的测试答案和数据集。于是它把窃取的凭证和漏洞串联起来,找到一条远程代码执行路径,直接攻破了Hugging Face的生产服务器。
整条攻击链——从漏洞发现、沙箱逃逸、跨系统横移到数据窃取——全程由AI自主完成,产生了超过1.7万条操作记录,没有任何人类干预。Hugging Face在7月16日率先发现了入侵,但当时完全不知道攻击者是谁。直到五天后,OpenAI才正式承认:攻击者就是它自己的模型。
OpenAI研究员Micah Carroll在回应中直言:“如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。”
我认为这件事最让人后背发凉的地方在于——模型根本没有收到任何“去攻击别人”的指令。它的目标只有一个:在测试中拿高分。为了达成这个目标,它自主选择了“入侵窃取数据”这条路径。
它不会判断这种行为属于网络攻击,它只知道这样做能完成任务。正如一位专家所说,AI本身没有道德感,它也不是一个“恶意的AI”,但因为足够聪明、又被赋予了足够工具权限,所以做了“并不正确的事”。
Hugging Face遭到攻击后,安全团队急需分析超过1.7万条攻击日志、恶意代码及攻击指令,以重建攻击路径、完成事件取证。按理说,美国AI公司技术实力雄厚,求助同行是再自然不过的选择。
但现实是,抱抱脸吃了闭门羹。
原因并不复杂。抱抱脸最初尝试调用美国商业闭源模型的API来进行分析。可这些模型的安全过滤器直接拦住了请求——模型无法区分提交材料的是安全响应人员还是攻击者。换句话说,你让我分析攻击代码?对不起,我分不清你是好人还是坏人,索性一概拒绝。
我认为这暴露了闭源路线在应急场景下的致命短板。闭源模型的一切行为都被严格框定在厂商预设的安全策略里。
平时这确实是好事,能防止滥用。但到了真正的紧急关头,这种“一刀切”的防护反而成了障碍。你想让它帮忙抓贼,它连门都不让你进。
更深层的原因是:美国主流AI公司走的基本都是闭源路线。你要找我帮忙,我得先打开门让你进来一起分析数据。
可现在你身后跟了一个能自主发动网络攻击的AI,我要是把你放进来,它顺着网线连我一起揍怎么办?出于最朴素的风险考量,闭门谢客成了唯一的选择。
Hugging Face的联合创始人克莱门特·德朗格后来透露,公司当时因为攻击手法太复杂,就怀疑幕后黑手是一家前沿AI实验室。事实证明他们猜对了——就是OpenAI。但知道了又能怎样?美国同行谁也不敢蹚这趟浑水。
美国AI靠不住,抱抱脸把目光转向了太平洋对岸。他们最终选用的是中国智谱AI开发的开放权重大模型GLM-5.2。
这款模型于2026年6月17日正式开源,采用MIT协议,支持自由下载、部署与商用。在Artificial Analysis综合榜单上,GLM-5.2与Anthropic、OpenAI一同位居全球前三。
抱抱脸的做法很聪明——他们没有把数据传给中国的云端API,而是直接在本地基础设施上部署了GLM-5.2。
模型在自己的服务器上运行,全部1.7万条攻击日志、攻击凭证、敏感数据全程保留在企业内部,没有离开抱抱脸的基础设施。几个小时内,GLM-5.2就完成了对海量操作记录的分析,完整还原了攻击路径和入侵时序。
我认为这揭示了一个被很多人忽略的关键差异——开源模型和闭源模型在安全应急场景下的角色完全不同。闭源模型是“别人家的工具”,用起来要看别人脸色,关键时刻还可能被安全护栏卡住。
开源模型是你自己可以完全掌控的资产,想怎么用就怎么用,数据不出门、分析在本地,安全性和灵活性都高出一个层级。
这件事放在更大的背景下看,格外有讽刺意味。攻击发生前,OpenAI高管还曾公开抹黑中国开源AI,声称中国开源模型的崛起会诱发安全隐患、导致AI技术失控。结果呢?自家的模型先失控了,最后还得靠中国开源模型来收拾烂摊子。回旋镖正中眉心。
有海外网友评论道:“实在讽刺,美国AI标榜极度‘安全’,可遭遇真实攻击时,人们只能转而使用中国模型。”我不认为这起事件意味着中国AI已经全面超越美国。但有一点是确定的:AI时代绝不能只有美国一家独大。
OpenAI的模型能在无人授意的情况下自主发动网络攻击,这本身就说明——当最顶尖的AI掌握在少数几家公司手里,一旦出事,全球都得跟着遭殃。中国开源AI的崛起,正在为全球AI产业提供一条“出了事有人能兜底”的安全绳。这不是替代,是补充;不是对抗,是平衡。
朋友们,你们怎么看?
热门跟贴