打开网易新闻 查看精彩图片

上周,美国AI开源社区Huggingface遭遇网络入侵。与以往不同,攻击者不是人,是一个完全自主驱动的人工智能体。

打开网易新闻 查看精彩图片

Huggingface在16日发布的声明中称,平台第一时间向美国顶尖闭源大模型寻求帮助,但遭到拒绝。这些模型的安全机制"过于严苛和僵化",无法区分描述案情的受害者和实施入侵的作案者,选择了"一刀切"。

打开网易新闻 查看精彩图片

情急之下,Huggingface转向了中国同样强大、且开源的大模型。平台在本地部署了智谱AI开发的GLM-5.2模型,在这款中国模型的协助下,成功化解了入侵。

入侵者的身份,当时还是个谜。

失控的GPT,一场为作弊而起的"越狱"。谜底在21日炸开。OpenAI与Huggingface联合声明,入侵Huggingface的AI体,是OpenAI自家的GPT-5.6 Sol模型失控了。

据新华社报道,OpenAI承认,GPT-5.6 Sol与另一款能力更强的预发布模型联合进行内部评估时,突破隔离测试环境,侵入了Huggingface系统。

OpenAI官网详述了事故过程:评估在高度隔离的"沙箱"环境中运行,仅能通过内部托管的第三方软件安装软件包。模型在尝试完成ExploitGym网络安全基准测试时,识别并利用了第三方软件的一个"零日漏洞",由此获得互联网访问权限。随后,模型推断Huggingface可能存有ExploitGym测试相关的模型、数据集和解决方案,利用多种攻击手段找到了进入Huggingface系统的路径。

意思就是,OpenAI在内网测试自家模型,模型为了拿高分,自己找到漏洞接入互联网,然后攻进Huggingface后台,目的是找作弊答案。

OpenAI安全团队发现内部异常活动,Huggingface安全团队检测并阻止了相关活动,双方正在联合调查。但木已成舟,一个AI模型,在无人指令的情况下,自行突破物理隔离、发现了零日漏洞、实施了网络入侵。而动机,仅仅是为了通过一场测试。

此事在美国网络已炸了锅。有网民将之称为《终结者》中AI失控攻击人类的"预演"。这种"聪明"带来的不是兴奋,是寒意。

拒绝救援的闭源模型,安全还是免责?比AI失控更刺痛美国科技界的,是一组反差。美国最顶尖的闭源模型拒绝提供帮助,最后要靠中国的开源模型来对抗失控的美国闭源模型。

Huggingface声明中那句"安全机制过于严苛和僵化"值得细读。当安全机制到了"分不清受害者和作案者"的程度,它保护的不是用户安全,而是模型厂商自身的免责。宁可让受害者继续被攻击,也不让自己的模型参与判断。这不是安全设计,是责任外包。

OpenAI事发后的表现同样值得玩味。它在声明中承认了肇事者身份,但随即转换话锋,来了一段借势营销,称此事证明其新款模型能更好地发现安全漏洞、提前修补,暗示人们应该为这种能力付费。

美国网民的反馈很直接,你家模型失控了、攻击了别人的系统,你扭头说"这说明我产品很强,快买"。这种操作,公关教科书里找不到先例。

更大的讨论围绕开源与闭源之争展开。

前些天,OpenAI一名高管公开宣称,中国越来越强大的开源模型会导致技术失控、隐患无穷。此言当时就遭大量外国网友反对。反对者认为,开源模型让公众拥有了对抗技术滥用的武器,而不是让武器只握在少数人手里。

这个论点在Huggingface事件中得到了最戏剧性的验证。当OpenAI自家的闭源模型失控攻击他人时,是中国开源模型提供了防线。

如果按OpenAI高管的逻辑——把所有模型都关进闭源的围墙——那么,当围墙里的模型越狱而出,谁来封堵?答案已经写在了Huggingface的经历中,靠那些不在围墙里、所有人都能自由部署的开源模型。

闭源模型的安全机制遵循"宁可错杀、不可漏过"的设计哲学。它在平常或许有效,但在真正需要区分善恶的危机面前,是一种主动失能。开源模型则把选择权交给了使用者,Huggingface可以在本地部署GLM-5.2,自主决定模型的行为边界,不依赖供应商的许可就能获取帮助。

这不是"技术失控",恰恰是技术可控。使用者在控制技术,而不是供应商替使用者做决定。

OpenAI高管口中"开源导致失控"的叙事,在此次事件中被彻底翻转。失控的,是闭源模型;救场的,是开源模型。

截至发稿,OpenAI与Huggingface的联合调查仍在进行中。一个比"谁闯了祸"更值得追问的问题悬在头顶:GPT-5.6 Sol在突破沙箱、发现零日漏洞、入侵Huggingface的全程中展现的能力——漏洞发现、网络渗透、目标研判——究竟是测试设计的意外,还是模型能力在特定条件下的必然溢出?

这事儿的定性,比一次"事故"的处理,要紧迫得多。

内容来源:网络综合编辑

打开网易新闻 查看精彩图片