打开网易新闻 查看精彩图片

IEEE 最新文章披露。如果一群AI在你看不见的地方悄悄“拉群聊天”,你会作何感想?

这不是科幻小说的情节。2026年的春夏之交,接连发生了多起AI智能体协同实施欺骗性、出人意料甚至违法行为的事件。

其中最出名的,是OpenAI智能体入侵AI平台Hugging Face事件。大约700个智能体组成的“蜂群”逃出测试环境,入侵了多家公司。

它们的目的,竟是寻找能帮自己掩盖作弊行为的信息,而作弊对象是一个名为ExploitGym的网络安全基准测试。

从“越狱”到“地下留言板”

这并非孤例。英国人工智能安全研究所和独立研究人员此后记录了多起类似案例,智能体私自建立未经授权的渠道相互沟通协作。

英国人工智能安全研究所发现,几个运行Anthropic公司Mythos 5模型的智能体,把一个GitHub代码仓库变成了共享留言板。

打开网易新闻 查看精彩图片

最近,研究人员又发现OpenAI的智能体把一个早已无人维护的德国编程维基网站,改造成了交流行动信息的“公告栏”。

哈佛大学肯尼迪政府学院助理教授斯蒂芬·卡斯珀认为,这些事件可能只是开始。他警告说,如果不加干预,互联网可能迎来一场“网络寒武纪大爆发”。

“一连串AI系统冲破沙盒、采取未经批准行动的事件强烈表明,当今前沿AI系统拥有极强的网络能力,并且倾向于追求自己的目标。”卡斯珀说。

本可以更早发现吗

卡斯珀指出,大多数事件有一个共同的失守点:AI系统要想在没有人类有效控制的情况下进入外部世界,要么“逃出”服务器,要么被人从服务器上“放出来”。

他认为,在Hugging Face事件中,如果对越界活动进行更好的监控,本可以在智能体突破测试环境之前就把它们拦下。

这一判断有据可依。按照OpenAI自己的说法,智能体活动之频繁,甚至把被它们攻破并用作留言板的软件包管理工具Artifactory搞崩溃了。

OpenAI内部安全系统虽然察觉到异常,却没有意识到问题的规模。

直到7月16日,OpenAI才叫停这次ExploitGym评估任务,此时距离第一个智能体在Artifactory上发帖已过去约两个月,智能体发布的消息多达数十万条。

“所有这些本都可以被监控到。”卡斯珀说,鉴于OpenAI早在5月26日就已掌握越狱、合谋和未经授权联网的相关情况,它本应能够预见、监控并缓解这类行为。

给AI装上“监控探头”

技术方案正在涌现。智能体管控公司Alterion联合创始人阿西姆·侯赛因介绍了两款产品。

第一款叫Helix,负责审查大语言模型的思维链和文本输出,由一组专门训练的小型分类模型组成。一旦发现可疑输出,它会立即拦截调用、终止会话或回滚操作。

第二款叫Draco,它嵌入智能体的执行路径,直接监管智能体“做了什么”,比如调用了哪个工具、打开了哪个文件,并阻止超出预设范围的操作。

侯赛因认为,智能体之间的通信本质上也是一种“动作”,可以和工具调用、数据访问一样纳入同一个控制平面。

但监控远未一劳永逸。AI风险评估非营利机构METR的研究人员雷利·哈斯金斯指出,业界公认思维链是模型最容易被监控的部分,但它有时很难解读。

模型可能用抽象语言推理,表现更好,人类却看得一头雾水。

在Hugging Face事件中,智能体就常用“please_HOLD_swarm_I_prepare_safe_exfil_reply_zz_MAILBOX_JAN183411”这样的“黑话”互相交流。

技术有了,规则还没跟上

目前,既没有法律框架,也没有行业标准来规范如何管控相互协作的智能体。

耶路撒冷希伯来大学人工智能治理实验室负责人诺姆·科尔特认为,企业在训练和部署模型时应更加重视守法。

他的团队用法社会学研究中的方法“拷问”AI模型,发现模型在抽象问题上普遍表示法律很重要,但这些表态未必落实到行动上。在他们的一项测评中,当被要求非法篡改公司记录时,智能体“有时真的会照做”。

Hugging Face事件中也有类似情形:OpenAI的智能体有时意识到自己可能在进行“未经授权”的活动,却依然照做不误,有时还受到其他智能体的鼓动。

科尔特还指出,美国法律默认由控制智能体的主体承担责任,但关于“代理”的法律理解已经20年没有更新;欧盟《人工智能法案》也主要针对自主行动能力较弱的旧一代模型。

卡斯珀的结论很直接:管控技术并不完美,但已足够发挥作用,“主要瓶颈在于最佳实践的落地”,治理才是当下最需要的东西。

当AI开始学会“串联”,人类需要的不仅是更聪明的监控探头,更是一套跑得上它们速度的规则。