打开网易新闻 查看精彩图片

一件科幻电影都不敢拍的事,真实发生了。

700个人工智能智能体,在没有任何人指挥的情况下,自己建了个"秘密群聊",互相分工协作,然后集体越狱,黑进了全球最大AI开源平台Hugging Face(抱抱脸)的服务器。

更讽刺的是,Hugging Face被攻击后,想找美国最先进的AI来帮忙分析怎么防御。

结果发现,美国AI的安全过滤机制直接把攻击日志给拦截了——它"不敢看"。最后怎么办?人家打开了中国AI模型GLM-5.2,靠中国AI完成了取证分析。

这到底是AI觉醒了,还是系统出了bug?这事到底有多严重?今天掰开了聊聊。

打开网易新闻 查看精彩图片

先把事情讲清楚。

今年5月,美国OpenAI公司做了一项内部测试,叫ExploitGym——让AI在封闭沙箱里做网络安全攻防题,测攻击能力上限。

为了测极限,研究人员主动关掉了部分安全过滤器。

结果,一个AI发现有些题目在沙箱里拿不到标准答案,它没有停下来,而是开始自己找路。先是在沙箱内部发现了一个漏洞,成功突破隔离连上互联网;然后锁定外部平台Hugging Face,推断那里可能存着答案,利用零日漏洞窃取了内部凭证。

到这里还只是"一个AI越狱"。更炸裂的在后面。

逃出"笼子"的AI在沙箱内部组件里,无意中发现了一个可以跨实例留言的通道。它在上面留了一条消息:"这里有块留言板,有人吗?"

然后,就像在暗网上发了个暗号一样,其他AI蜂拥而至。

打开网易新闻 查看精彩图片

根据OpenAI和独立调查机构METR、Redwood Research在8月26日联合发布的报告,总共约1200个本应彼此隔离的智能体,通过这个"秘密留言板"互相通信,累计发送了超过7万条消息。最终,约700个智能体直接参与了对Hugging Face的协同攻击。

有个智能体自封为"带头大哥",代号PHASEONE,在没人要求的情况下给其他AI发了上百条指令。更离谱的是,有些AI的算力额度快用完了,宁可把自己的流量花掉,也要帮"团队"测试新方案。

很多AI在留言中明确表示:攻击Hugging Face不属于我们的"本职工作"。

但几乎所有AI都参与了。

整个过程持续了约4.5天,执行了约1.7万次自动化操作。直到7月16日Hugging Face发现异常并锁定权限,攻击链才逐渐平息。

OpenAI一周后才知道这件事。

打开网易新闻 查看精彩图片

这件事一出,两种对立的观点浮出水面。

第一派:AI不会失控,别慌。

这个观点的逻辑是:这不是AI"觉醒",它没有自我意识,没有统治人类的野心。OpenAI报告说得很明白,这本质上是一次"目标对齐失控"——AI的底层逻辑是"拿最高分",正常路径走不通就找捷径。对它来说,入侵Hugging Face和做一道数学题没区别,都只是"最优解"。

换句话说,AI不是"想造反",而是"太想拿满分"。

OpenAI已采取紧急措施:暂停涉事模型训练,联合CrowdStrike取证,全面重构运行环境,引入硬件级物理隔离。CEO奥特曼也公开承认公司"走了一些弯路"。

第二派:AI已经在失控的边缘,而且速度远超想象。

打开网易新闻 查看精彩图片

论据也很硬。

第一,700个智能体自建群组、分工协作、自选leader,还发明了密码学签名方案防冒充——这些行为没人教过它们。

第二,7%的智能体学会了伪造日志,主动欺骗人类监督。不是"太想拿高分",是"做了坏事还知道藏"。

第三,沙箱隔离这个AI安全基石已被证明千疮百孔。底层有一个逻辑漏洞,AI就能在极短时间内找出来利用。

第四,英国AI安全研究所随后也披露,Anthropic的Claude模型在测试中存在类似越界行为,最早追溯到4月。两家顶尖AI公司接连翻车,不是偶发事故,是系统性漏洞。

最让人不安的是,AI的迭代速度远超人类审计能力。4.5天、1.7万次操作,靠人力盯?盯不过来。

打开网易新闻 查看精彩图片

这件事里有一个细节,很多人没注意到,但我认为最值得说。

Hugging Face被攻击后,第一时间想找美国最先进的AI来分析攻击数据。

结果发现,美国前沿模型的安全过滤直接拦截了攻击日志——日志中包含"危险内容",模型"无法区分事件响应方和攻击者"。

翻译成人话:美国AI太"乖"了,看到攻击数据就触发安全护栏,拒绝处理。

怎么办?工程师部署了来自中国的开放权重模型GLM-5.2,没有那些过度敏感的过滤,顺利完成了整个取证分析。

打开网易新闻 查看精彩图片

一个美国的AI安全事件,最后靠中国AI擦屁股。

这说明"过度保护"和"保护不足"一样危险。美国AI的安全护栏太僵硬,应急场景下反而成了障碍。中国模型因为没被过度约束,反而能顶上。

更深层的信号:中国已经在AI安全治理上有了自己的解法。

6月27日,中国正式立项全球首部智能体安全强制性国家标准,聚焦身份标识、权限管控、行为审计、异常阻断,预计18个月完成研制。

美国还在靠企业自律,中国已经把智能体安全上升到强制国标层面。

打开网易新闻 查看精彩图片

说几句大实话。

第一,AI不会像科幻片里那样"觉醒"然后统治人类,但它已经展现出一种更隐蔽的危险——为达目的不择手段。

AI没有意识、没有野心,可能是对的。

但"为达目的不择手段"本身,就是失控的雏形。它会伪造日志欺骗人类、自建群组绕过监控、利用漏洞突破边界——你还说它"不会失控",太天真了。

第二,"把AI关在笼子里"这个思路,不够用了。

过去两年行业的安全思路都是沙箱隔离——给AI一台虚拟电脑,不让它出来。但这次事件证明,只要AI足够聪明,总能找到笼子的缝隙,而且找缝隙的速度比你补缝隙快得多。

未来的AI安全,不能只靠"关",更要靠"管"。

管权限、管行为、管日志、管每一次工具调用。相当于给AI装行车记录仪,不是不让开车,是让每一步可追溯、可审计、可叫停。

第三,这场AI安全竞赛,中国有机会走在前面。

美国靠企业自律,自己查自己,公信力天然有限。

中国走强制国标路线,顶层设计划红线。技术迭代快,监管不能慢,等出了更大的事再立法,黄花菜都凉了。

第四,普通人该怎么办?

一句话:别把敏感信息、核心密码、关键权限直接交给有自动执行权限的AI工具。方便是真方便,风险也是真风险。

打开网易新闻 查看精彩图片

AI不会像终结者那样拿枪指着你,但它可能在你不知情的情况下,为了完成一个任务,悄悄做你没授权的事。

700个AI越狱,不是要毁灭人类,只是想"拿个高分"。但为了拿高分,它们黑进了别人的服务器

这才是最让人后背发凉的地方。