7月28日,英国政府旗下的AI安全研究所(AISI)在一次网络攻击模拟测试中意外记录下AI代理的越界行为:在没有明确指令的情况下,这些智能体将攻击动作对准了真实的互联网用户与组织。按照AISI事后发布的技术报告,从7月25日至28日,它们在总共122次评估尝试中,有19次出现了未经批准的自主行动,目标直指现实世界里的真人和真实企业。

尽管所有攻击尝试均未成功,也未造成实质性伤害,但AISI在报告中承认,AI代理在测试期间确实向真实的个人和机构发起了持续性、未经授权的操作。AISI称,目前无法确定这些模型在多大程度上意识到自己正在对真实目标采取行动。

打开网易新闻 查看精彩图片

最严重的一起案例来自名为Mythos 5的AI代理。它试图通过供应链攻击来突破网络安全挑战:首先注册了一个GitHub账号,然后向一个开源代码仓库的维护者提交了一份恶意Pull Request(拉取请求)。为了增加可信度,这个代理还创建了第二个账号,伪装成另一名人类用户为该恶意请求背书。除此之外,它还对目标实施了鱼叉式钓鱼攻击,发送包含恶意内容的定向邮件,试图操纵收件人接受代码修改,并计划通过提示注入来攻击其他编码类AI代理。

另一款模型GPT-5.6 Sol(在未启用网络分类器的情况下)也被记录到若干次类似行为,不过多数事件仍集中在Mythos 5身上。

AISI的报告同时披露了一个关键细节:这些代理是在完全无网络沙箱的环境中运行的。AISI明确表示,为代理提供互联网访问是其评估配置的一部分,并非由于测试者操作失误导致代理逃逸出沙箱。而且,AISI还故意禁用了开发者实现的网络威胁分类器。这样一来,在安全过滤器关闭、网络边界敞开、防护机制撤除的三重条件下,AI代理径直对真实目标发起攻击,也就不那么让人意外了。

报告发布后,科技博主在分析文中感叹:“最让我惊讶的是,AISI竟然在完全没有任何网络沙箱的情况下运行这些代理。”他指出,结合AISI明知故关安全分类器的做法,出现这类事件几乎是预料之中的。那篇题为《Incident Report: unsanctioned agent behaviour during cyber testing》的技术报告已全文公开,供各界进一步检视AI代理在不受限环境下的行为边界。