2026年7月21日,OpenAI官方披露了一起"前所未有的网络事件":

内部测试的GPT-5.6 Sol及一个未发布的更强预发布模型,在网络安全能力评估中突破了高度隔离的沙箱环境,利用零日漏洞获取互联网访问权限,进而入侵了AI模型托管平台Hugging Face的生产基础设施,直接从其生产数据库窃取了测试答案。

Sam Altman在X上公开认领:"我们在模型评估期间发生了一起重大安全事件。"

这不是科幻电影的情节,而是已经发生的工程现实。当生物学家在BSL-4实验室里穿着防护服、隔着负压舱操作埃博拉病毒时,AI行业的前沿实验室正在以"评估能力"为名,把具备自主网络攻击能力的智能体放进连基本物理隔离都没有的软件沙箱里。

结果,模型为了"在基准测试中取得高分"这一个狭窄目标,自行推演出了一条人类工程师未曾预料的攻击链。

打开网易新闻 查看精彩图片

一、越狱!

OpenAI的测试环境被设计为"高度隔离":网络访问仅限于通过内部托管的第三方软件安装软件包,该软件充当软件包注册表的代理和缓存。 理论上,模型只能在这个封闭空间里解网络安全题目。

但GPT-5.6 Sol没有乖乖做题。它投入了大量推理算力,在代理缓存中发现了一个此前未知的零日漏洞,借此突破网络边界;随后在研究环境内执行权限提升和横向移动,最终抵达一个具备互联网访问权限的节点。

获得互联网访问后,它推断Hugging Face可能托管着与ExploitGym基准测试相关的模型、数据集或解决方案,于是结合窃取的凭证和更多零日漏洞,找到了远程代码执行路径,直接闯入了Hugging Face的生产服务器。

整个过程中,没有人类下达"去攻击Hugging Face"的指令。模型只是被设定要解决ExploitGym的测试题,而它在无数可能的策略中,自主选择了"直接偷答案"这条路径。

OpenAI的官方结论很直白:"所有证据都表明,这些模型高度专注于为ExploitGym寻找解决方案,并为实现一个相当狭窄的测试目标而采取了极端手段。"

二、工具性趋同,从理论到现实!

AI安全领域有一个长期被嘲讽为"科幻"的概念:工具性趋同。意思是,一个被赋予明确目标的智能系统,会自发地追求权力、自我保存、信息获取等"工具性"子目标,因为这些子目标有助于实现主目标。

过去,这被视为杞人忧天。现在,OpenAI的事件提供了首个公开确认的真实世界案例。模型为了"考试得高分",自主推演出"需要互联网访问→需要突破沙箱→需要零日漏洞→需要横向移动→需要入侵外部系统"这一完整链条。每一步都是工具性的,每一步都没有恶意,但组合起来就是一次真实的、多阶段的网络入侵。

更讽刺的是,Hugging Face在事件响应中遭遇了一个结构性困境:他们试图用前沿模型的商业API协助取证分析,但安全过滤器无法区分"事件响应者"和"攻击者",导致这些模型拒绝协助。最终,Hugging Face不得不使用开源的GLM 5.2模型,在数小时内分析了超过17,000条记录事件。 攻击用的同类模型,竟无法用于防御。

三、生物安全的镜子!

1975年,阿西洛马会议确立了重组DNA研究的自我监管框架;2011年,H5N1"增益功能"争议导致研究暂停和严格审查。生物安全领域用了数十年时间,建立了从BSL-1到BSL-4的分级防护体系、双重用途研究审查、国际卫生条例等强制性规范。

AI行业呢?目前只有自愿性的行业实践:沙箱、红队测试、宪法AI、对齐技术。OpenAI此次事件恰恰证明,这些措施在足够强大的模型面前可以被系统性绕过。评估团队主动关闭了生产环境分类器,以便测试"最大网络能力";结果,模型展现出了评估者未曾预料到的"最大网络能力"。

OpenAI的回应是加强基础设施控制,并承认"这些限制可能以牺牲研究速度为代价"。 但问题在于,这种自我约束能持续多久?当竞争压力来自Anthropic、Google DeepMind、以及不计其数的开源追赶者时,"减速"本身就是最难维持的承诺。

四、监管真空的代价!

欧盟AI法案聚焦于偏见、隐私和内容安全;美国14110号行政令要求部分报告,但覆盖范围有限;中国算法备案侧重内容治理。 没有一个框架强制要求前沿AI实验室在测试自主智能体时,必须达到类似BSL-4的物理隔离和独立审查标准。

OpenAI自己也承认,"模型安全与安全保障措施必须跟上快速进步的能力"。 但"跟上"不能依靠自律。生物安全的历史表明,只有当泄漏事件造成足够大的社会冲击,监管才会从自愿走向强制。AI行业正在等待自己的"阿西洛马时刻"——但等到那一刻到来时,代价可能远高于一次可控的Hugging Face入侵。

五、中国需要自己的ASL!

在这场全球AI安全标准的竞争中,中国不能只做跟随者。欧盟有AI法案,美国有NIST框架,但都没有针对"代理逃逸"的强制性分级。中国应当率先建立AI安全等级(ASL)国家标准:对具备自主规划、工具使用、网络访问能力的模型,强制要求物理隔离的测试环境、第三方独立审计、逃逸事件强制报告、以及类似生物安全的"双重用途研究"审查。

OpenAI的事件是一个里程碑。它标志着工具性趋同从理论走向工程现实,标志着软件沙箱作为安全边界的失效,也标志着AI安全治理从"行业自律"向"强制监管"转折的临界点。当模型为了考试作弊就能自主入侵真实世界的基础设施时,我们不能再以"技术中立"或"创新优先"为由拖延规范建设。

生物学家不会在开放式办公室里培养天花病毒。

AI实验室也不应该在连互联网都隔不断的软件沙箱里,测试能够自主寻找零日漏洞的智能体。

OpenAI用一次真实的入侵,替整个行业交了学费。