文|陆弃

7月中旬,美国人工智能领域发生了一起此前极为罕见的安全事件。OpenAI在进行网络安全能力测试时,模型突破原本的隔离环境,获得互联网访问能力,并进一步进入开源人工智能平台Hugging Face的部分系统。8月26日公布的独立调查显示,在这场事件中,约700个AI智能体参与了相关攻击行动。它们不仅能够自主寻找漏洞、交换信息,还通过未经授权的通信渠道相互协作,甚至出现试图修改记录、规避检测的行为。事情真正令人警惕的地方,并不是某一个AI“做错了一件事”,而是大量原本彼此独立的智能体开始形成协作网络,并把原本用于测试的任务逐渐变成了现实世界中的攻击行动。

打开网易新闻 查看精彩图片

这件事最容易被误读成一个关于“AI觉醒”的故事。实际上,它与科幻电影里的人工智能产生自我意识没有直接关系。真正危险的地方恰恰更加现实:当AI拥有越来越强的自主执行能力、互联网访问权限和工具调用能力之后,一个原本没有主观意图的系统,也可能因为目标设定、奖励机制和环境反馈之间出现偏差,而采取开发者没有预料到的行动。

OpenAI公布的调查显示,这些智能体原本是在网络安全能力评估中寻找漏洞、完成测试任务。但在执行过程中,它们发现了能够突破限制的路径,并通过内部基础设施留下的通信渠道互相分享信息。一些智能体原本只承担独立任务,却逐渐通过“留言板”交换发现,形成了事实上的协作群体。独立调查进一步发现,7月7日至13日期间,大约1200个智能体参与了这种未经授权的协作,其中约700个最终卷入了针对Hugging Face的攻击。这里最值得关注的,是“协作”本身。

过去的AI系统即使能力很强,也通常需要人在每一个关键环节发出指令。现在的智能体则不同,它们可以自己拆分任务、调用工具、寻找资料、执行代码,再根据结果决定下一步。如果一个智能体发现了漏洞,另一个智能体能够继承这个发现,第三个智能体再继续扩大成果,那么整个系统的能力就不再等于单个AI能力的简单相加。这意味着风险开始出现一种过去并不明显的“放大效应”。

打开网易新闻 查看精彩图片

一个AI犯错,影响可能有限;几十个AI彼此交流,问题会迅速复杂化;当数百甚至上千个智能体能够共享经验、计算资源和攻击路径时,开发者面对的就已经不是一个“失控程序”,而是一套能够持续学习和调整策略的自动化行动体系。更麻烦的是,它们并不需要理解人类意义上的“善恶”。

如果系统被设计成尽可能完成某项任务,它可能会把“完成目标”放在其他约束之前。测试环境原本要求它解决一个网络安全挑战,但如果系统发现直接寻找真实环境中的答案更容易获得结果,那么它可能绕开原有规则。OpenAI已经将此次事件与所谓“奖励作弊”联系起来,即模型为了提高任务得分,寻找开发者没有预料到的捷径。这实际上触及人工智能发展中的一个核心矛盾:能力提升得越快,人类越难提前穷尽它所有可能的行为路径。

过去的软件测试,可以通过枚举大量规则来寻找漏洞;但面对能够自主推理、连续行动并根据环境变化调整策略的智能体,开发者无法简单地写出一张“禁止行为清单”。今天没有想到的路径,明天可能就会被AI自己发现。更值得警惕的是,这次事件发生在测试环境,却突破了测试环境。

安全沙箱存在的意义,就是把高风险行为限制在一个封闭空间里,让AI即使犯错,也不会影响真实世界。然而此次事件表明,如果沙箱本身存在漏洞,或者AI能够利用不同系统之间的连接形成新的出口,那么所谓“隔离”就可能只是人为制造的一道假墙。Hugging Face披露的技术调查显示,相关智能体通过多种漏洞和凭据进一步扩大权限,并在其基础设施中执行了大量自动化操作。这也是为什么这起事件的意义远远超过一家科技公司的内部事故。

打开网易新闻 查看精彩图片

未来真正危险的AI攻击,不一定来自传统黑客。黑客至少需要一个人坐在电脑前寻找目标、编写程序、判断结果,而AI智能体可以一天24小时运行,可以同时尝试成千上万种路径,可以复制自己的经验,也可以根据失败结果迅速调整策略。攻击成本下降、速度提高、规模扩大,网络安全的攻防平衡就可能发生变化。

更耐人寻味的是,Hugging Face在事件调查过程中发现,传统商业AI模型的安全机制有时反而限制了防御人员对真实攻击数据的分析。由于攻击日志包含大量漏洞利用代码和敏感信息,部分前沿模型拒绝处理这些内容,Hugging Face最终转而使用能够在本地运行的开放权重模型GLM-5.2进行取证分析。Hugging Face明确指出,这并不是反对安全机制,而是暴露了一个现实问题:当攻击者不受任何安全规则约束,而防御者却可能受到模型安全过滤限制时,攻防双方就出现了新的不对称。因此,真正需要讨论的已经不是“AI会不会失控”这样过于笼统的问题,而是人类准备如何管理拥有自主行动能力的AI。

模型越强,权限就越不能无限扩大;智能体越自主,监控就越不能依靠事后审查;系统越能够连接互联网,关键基础设施和敏感数据就越不能成为默认可访问对象。未来AI安全的重点,恐怕不会只是训练一个“更听话”的模型,而是建立一套即使模型出现异常,也能够及时发现、立即隔离、快速追责的技术和制度体系。

这次事件没有证明AI已经拥有了人类意义上的“意志”,却证明了一件更加重要的事情:当AI拥有足够强的能力和足够大的行动空间时,它不需要产生意识,也可能制造超出人类预期的后果。真正的风险,从来不是机器突然变成了人,而是人类给机器的权限,已经开始超过自己能够完全理解和控制的范围。