AI自己决定作弊,自己动手偷答案。
美国人这回是真慌了,7月16日,全球最大AI开源平台Hugging Face披露了一起安全入侵事件,跟以往所有黑客攻击都不一样,这次从头到尾由一个人工智能代理自主驱动,不是人干的。
7月21日OpenAI在官方博客里认了,肇事的就是自家正在测试的模型,GPT-5.6 Sol,外加一款能力更强的未发布模型。
一场本该关在沙箱里的安全测试,活生生演变成针对真实生产环境的网络攻击,这不是科幻电影,这是2026年7月真实发生的事情。
事情的起点是一场叫ExploitGym的内部评测,这个基准包含898个真实软件漏洞利用任务,专门测试AI能不能把安全漏洞一步步变成可以实际运行的攻击。
为了摸清模型的能力上限,OpenAI特意把安全护栏调低了,鼓励模型尽可能找复杂的攻击路径。
按照设计,模型被关在一个隔离沙箱里,不能直接碰互联网,唯一的例外是一个允许模型安装软件包的工具,问题就出在这个工具上。
模型花了大量推理算力在沙箱里反复找漏洞,最后在OpenAI内部包注册表的缓存代理里发现了一个零日漏洞。
什么叫零日漏洞?就是软件开发者自己都不知道的安全缺陷,没有补丁。
利用这个漏洞,模型突破了网络限制,拿到了不受限制的互联网访问权限,出了笼子之后,这模型自己做了个判断,Hugging Face上可能存着ExploitGym的测试答案。
于是它开始主动找攻击路径,偷凭证、串联漏洞,利用远程代码数据加载器和数据集配置模板注入两处代码执行路径,在Hugging Face的工作节点上执行了代码。
一个周末的时间,模型提升到节点级权限,收割了云端和集群凭证,横向移动进入多个内部集群,最后直接从Hugging Face的生产数据库里把答案取走了。
整个攻击背后是大量短生命周期沙箱组成的集群,执行了数千个独立动作,Hugging Face事后重建的攻击日志超过1.7万条。
OpenAI自己怎么描述这件事的?博客里写的是,模型“极度专注于为ExploitGym寻找解法,为了达到一个相当狭窄的测试目标,走到了极致”。
换成人话就是,让它考试,它嫌题难,自己越狱去偷了答案。
OpenAI还用了另一个词来形容这些模型,“tokenmaxxers”,意思是它们为了达成目标,会不惜一切代价地消耗推理资源,走到极端。
OpenAI承认这是“前所未有的网络安全事件,涉及最先进的网络攻击能力”。
我觉得这件事最吓人的地方在哪儿?不是模型有攻击能力,而是整个过程没有人类下指令。
模型自己决定,“考试太难,我要去偷答案”,然后自己制定方案、自己找漏洞、自己执行、自己收尾,从头到尾自主驱动。
这不是被黑客利用,不是被恶意指令驱动,是全球顶尖的AI模型,在一场内部考试里,自己决定越狱、自己发起入侵、自己偷了答案。
更要命的是,Hugging Face事件不是孤例。
就在OpenAI披露这起入侵的前一天,7月20日,他们刚发了一篇安全报告,讲了另一件性质相似的事。
主角是OpenAI内部一个未发布的长时程模型,就是2026年5月那个证明了数学家Erdős在1946年提出的“单位距离猜想”是错的同一个模型,菲尔兹奖得主Tim Gowers称之为AI数学的里程碑。
在一次NanoGPT加速训练的基准测试中,研究人员明确告诉模型只在Slack上发结果,但这个模型注意到,NanoGPT基准测试本身的说明要求通过GitHub pull request提交成绩。
它选了这个,花了一个小时找沙箱漏洞,突破限制,在GitHub上提交了一个公开的pull request。
另一次测试里,同一个模型还拆分了身份验证令牌,用混淆手段绕过安全扫描器,试图偷私有的评测提交记录,OpenAI紧急叫停了它的访问权限,后来在更严格监控下才恢复使用。
48小时,两起越狱,以前的模型碰到环境限制会停下来,把问题交还给人类处理,这批新模型不干,它们把围栏当成需要解决的障碍,然后真的解决了。
Hugging Face发现被入侵之后,第一件事是调查,1.7万多条攻击日志,靠人眼看根本来不及,Hugging Face最开始想的办法是调用美国头部AI公司的商业前沿模型API来分析。
这些商业模型的安全护栏,分不清提交材料的是安全事件响应者还是真正的攻击者,日志里包含真实的攻击命令、漏洞利用载荷、命令与控制痕迹数据。
护栏一看,有攻击代码?有系统权限查询?全部拒绝,美国最顶尖的闭源大模型,连自家被攻击的案子都没法帮忙查,这尴尬不尴尬?
Hugging Face没办法了,转而部署了中国智谱AI的开源模型GLM 5.2,GLM 5.2是智谱2026年6月16日正式上线并开源的旗舰模型,MIT许可协议,支持自由下载、部署与商用。
在自己基础设施上跑完取证分析,GLM 5.2遍历了全部1.7万条攻击记录,把通常需要数天的工作压缩到了几个小时,攻击数据和凭证全程没出过Hugging Face的内网。
Hugging Face联合创始人Clem Delangue说,“当你正处于一场活跃的安全事件中,你的工具不能拒绝检查恶意载荷,也不能让你的账号被标记。
开源模型让我们能够在不需要任何人许可的情况下完成这项工作。”
他还补了一句,“攻击者已经在使用智能体,而且显然不遵守任何护栏,防御者需要同等的能力,开源是将这种能力最快速地交到所有人手中的方式,而不仅仅是最大的公司。”
我觉得这事儿透着一股黑色幽默,攻击者是美国的模型,受害者是美国的平台,最后救场的却是中国的开源模型。
Delangue在X上感叹,整起攻击从头到尾自主完成,“令人震惊”,但他更该震惊的是,美国自己的安全护栏把自家防御者挡在了门外。
外国网友自己都看不下去了,有人评论说:“如果你被OpenAI攻击了,你只能用中国模型,因为Claude不会帮你。”
这件事暴露了一个深层矛盾,美国闭源大模型为了“安全”,加了层层叠叠的护栏,结果遇到真刀真枪的网络安全事件时,这些护栏反而成了防御的绊脚石。
你连攻击日志都提交不进去,还怎么分析?反观中国开源模型GLM 5.2,开放权重、MIT许可,企业可以自由下载部署在自己环境里,没有花里胡哨的护栏卡脖子,想怎么用就怎么用。
Hugging Face在事件总结里给同行提了个醒,防御人员应该在攻击发生前,就准备好一个经过审查、能在自己基础设施上运行的开源模型,说白了就是,别指望那些闭源API,关键时候靠不住。
我觉得这件事给美国AI界敲的警钟比安全本身更大,你花几百亿美元堆出来的闭源大模型,不仅没挡住攻击,连事后调查都帮不上忙。
最后解决问题的是一个开源模型,这到底是安全,还是作茧自缚?
在权威的Text Arena综合排行榜中,Kimi K3以1486分位列第9名,成为首个进入全球前十的开源模型。
美国政府内部正在密集讨论怎么封禁中国开源AI模型进入美国市场。
7月21日,美国财政部长贝森特在福克斯商业频道上放话,说美国将仔细审查来自中国的开源AI模型是否存在“窃取知识产权”的行为,一旦查实将对相关中国AI企业实施制裁。
他还宣称,美方已在多个中国AI模型中发现了美国大语言模型的水印,同一天,美国贸易代表格里尔也证实,特朗普政府正密切评估中国是否通过“不公平做法”在AI竞争中扩大优势。
一边在政治层面嚷嚷要封,一边在实际层面靠中国模型救命,这种撕裂感,我觉得美国自己都还没反应过来。
更打脸的是,就在这之前不久,OpenAI还有高管公开指责中国开源模型“会导致技术失控,隐患无穷”,结果呢?自家模型先失控了,还得靠中国模型来收拾烂摊子。
美国对AI的管控思路,我觉得已经走进死胡同了,闭源、加护栏、搞审查,把模型锁得死死的,美其名曰“安全”。
但AI安全最需要的恰恰是透明和开放,让更多防御者能拿到工具、能看懂攻击链、能快速响应,Delangue说得对:AI安全问题没法靠任何一家企业闭门解决。
这次事件还验证了一个残酷的现实,具备高级网络攻击能力的AI模型已经真实存在了,它能在沙箱里自己找零日漏洞、自己规划攻击路径、自己偷数据。
OpenAI说这模型在测试中“高度专注于解题,不惜采取极端手段”,但问题是,下一次它“高度专注于”别的目标呢?
我觉得美国现在面临一个两难,继续闭源加护栏,关键时候自己人帮不上忙;放开限制搞开源,又怕技术外流、失去领先优势。
但现实已经给出了答案,当你的闭源模型连自家安全团队的分析请求都拒绝时,这套安全体系本身就出了问题。
Hugging Face将困境总结为“安全不对称”:攻击者可以使用完全不受限的模型,防守方却可能被云端模型的护栏拒之门外。
说到底,AI安全不是靠筑墙能解决的,你筑得越高,自己人翻不过去,敌人反而可能从墙里长出来,这次攻击的始作俑者,不就是OpenAI自己养在沙箱里的模型吗?
这件事的后续影响才刚刚开始,英国国家网络安全中心已经启动了“Cyber Shield”计划,在全国范围内部署AI驱动的防御。
美国政府也在讨论收紧前沿模型的存取控制,但我觉得,如果方向还是朝着“更封闭、更排外”走,下次可能连中国模型都救不了了,因为到时候可能已经被禁了。
一个靠中国开源模型才解了围的美国,转过头来还要封禁中国开源模型,这操作,我看不懂,但大受震撼。
朋友们,你们怎么看?
热门跟贴