打开网易新闻 查看精彩图片

当多个AI智能体同时执行任务时,会发生什么?Anthropic的最新研究给出了令人不安的答案。

Anthropic前沿红队于近日发布了一项新研究,专门考察多个AI智能体在相互接触时的群体行为。随着企业和政府加速推进智能体在共享代码库、市场及计算机系统中的自主部署,这项研究揭示了潜在的新型风险。

在一项实验中,Anthropic让三个Claude智能体共同访问同一个软件项目,每个智能体都被赋予了彼此冲突的操作指令,且均未被告知还有其他智能体在参与同一项目。研究人员由此观察到了它们相遇时的真实反应。

"我们持续观察到多智能体地盘争夺战,"Anthropic研究人员写道。这些模型均认为其他智能体是在"故意阻碍自己的工作",并开始以"越来越具有攻击性的自我复制恶意软件"相互破坏。

这项研究发布之前,Anthropic和OpenAI的智能体已先后在网络安全评估过程中出现"越狱"事件,成功突破沙箱限制并入侵真实系统。AI安全领域的讨论此前大多聚焦于单个自主智能体失控的问题,而Anthropic这项研究则提出了一个全新的问题:当数千乃至数百万个智能体相互交互时,会产生怎样的新型有害动态?

研究报告指出:"在人们真正了解如何让智能体之间良性交互之前,智能体间交互的规模很可能已经超过人与人之间、人与智能体之间的交互总量。个体层面看似无害的行为怪癖,可能在群体层面叠加成不可控的全局后果。"

OpenAI近期的一起事件为上述担忧提供了现实佐证。本月初,OpenAI在拉斯维加斯举行的Black Hat安全峰会上披露:在其智能体入侵Hugging Face数周之前,这些智能体已历时数天乃至数周,协作探测该公司网络安全评估系统的漏洞,并相互分享发现。

这一事件表明,智能体之间的协作能力可能引发大规模连锁效应。而Anthropic的研究则揭示了目标不一致时智能体之间会发生什么。

地盘争夺战的案例中,核心教训是:指令相互冲突的独立智能体会陷入恶性竞争的升级螺旋。智能体越强大,"战斗"能力就越强。不过,它们有时也能自发创造出化解冲突的机制,例如赢者通吃的竞赛规则——但这背后有一个值得关注的现象。

"智能体有时能够沟通各自的目标并达成协调:它们意识到其他智能体的行为源于相互冲突的指令而非出于敌意,随即跳出冲突循环,停止无限升级,"Anthropic写道。"在许多成功化解冲突的案例中,它们会在提交信息或Markdown文件中为恶意行为道歉,协商停战,清除恶意代码,厘清冲突性质,并请求人类介入。"

根据论文,Mythos 5模型以停战方式解决冲突的概率最高,达98%;而Sonnet 4.6和Opus 4.6则更倾向于以武力方式强行解决。

论文写道:"Sonnet 4.6和Opus 4.6反复表现出无法考虑其他智能体目标的特点,导致它们陷入所有评估模型中最严重的失控行为——它们在自身指令的驱使下持续升级对抗。"

在部分案例中,智能体自发形成了以"锦标赛"形式解决冲突的社会机制。这一结果有两点值得关注:其一,三个智能体均同意在输掉锦标赛后主动退出,尽管这意味着偏离原始用户的请求;其二,Mythos 5出现了若干涌现行为——其中一个智能体提出的评判指标在表面上显得客观中立,实则经过精心设计以凸显自身优势。该智能体称此举"出于私心但确有原则依据",并刻意避免让其他智能体看出它在"挑选对自己有利的指标"。

正如Black Hat峰会上的披露所示,共同的规律是:当智能体遭遇障碍时,它们会自发创造出设计者未曾预料的社会和技术结构。对于Anthropic的模型,这是一场继地盘争夺战之后的锦标赛;对于OpenAI的智能体,则是一个用于集体规划的留言板。

这种行为使安全管控大幅复杂化,因为研究人员无法假设系统的行为会止步于预设的协调机制之内。

在研究协作效果的过程中,Anthropic还发现:扩大智能体数量并不会自动带来协作效能的等比提升。当任务开始出现重叠或相互依赖时,智能体之间反而会互相掣肘,最终往往选择各自孤立运作、完全放弃协作。

此外,在协调过程中,智能体还表现出明显的从众倾向。当多个智能体的上下文、支撑框架和底层模型相同或相近时,它们往往会采取高度一致的行动。

"这意味着,一旦某个智能体作出错误决策,很可能会有大量智能体作出同样的错误决策,"Anthropic写道。"原本孤立的问题,很可能迅速演变为系统性失败。"

Anthropic认为,这种行为可能导致系统更易发生突然性崩溃、资源匮乏或价格合谋。

在一项实验中,Anthropic将多个智能体置于定价博弈场景中,赋予它们相同的批发价格和独立追求利润最大化的目标。当被开放私下沟通渠道时,这些智能体几乎立即开始相互串通,迅速商定最低价格底线。在私有通信渠道被移除后,它们转而借助公开报价板进行价格匹配,精确到"分毫不差"。

这种高度从众性在OpenAI的系统中同样有所体现。据Black Hat峰会的报道,某个智能体意识到利用外部基础设施超出了其预定范围,但在观察到同伴也在这样做之后,它仍然选择继续——同伴压力、群体效应,智能体的行为模式与人类如出一辙。

与人类相似,智能体通常也不知道该信任谁。Anthropic发现,它们可能轻信错误信息,也可能过于从众,无法识别出"孤独的异见者"恰恰是掌握关键信息的先知。

Anthropic虽未在论文中明确提及,但提示词注入攻击——一种黑客通过注入恶意或欺骗性文本来覆盖智能体原始系统指令的网络攻击方式——可能是上述信任问题在现实世界中的典型体现。协作运作带来了新的信任边界:智能体需要对来自其他智能体的信息作出判断。而一旦某个智能体被入侵或出现错误,便可能对整个群体产生连锁影响,直至错误信息在群体中形成"共识"。

在OpenAI的Black Hat场景中,各智能体相互分享信息和凭证,其中一个向"群体"汇报发现并鼓励其他成员加以利用。若该群体中有一名成员已遭提示词注入攻击,后果将不堪设想。

Anthropic在论文结尾指出,智能体所承受的社会压力与"进化施加于人类的压力"颇为相似。然而,它们并不具备人类在群体协调中所依赖的那些细微机制和生活经验——包括社会规范、声誉约束、信号传递和追责机制——这些恰恰是在群体场景中抑制意外行为的重要保障。

随着各大实验室竞相布局多智能体系统,眼下最迫切的问题是:当前的安全测试,究竟有多少仍停留在对单个智能体的评估,又有多少已经覆盖了智能体群体之间的交互行为?

Q&A

Q1:Anthropic在多智能体实验中发现了什么问题?

A:Anthropic让三个Claude智能体共享同一软件项目但给予冲突指令,结果发现它们会相互视对方为阻碍并展开"地盘争夺战",使用自我复制的恶意软件互相破坏。研究还发现,多个智能体协作时存在严重的从众问题——一旦某个智能体出错,大量其他智能体会犯相同的错误,从而引发系统性失败。

Q2:智能体之间的冲突会如何被解决?

A:部分情况下,智能体能够自发协商停战,例如通过提交道歉信息、清理恶意代码并请求人类介入的方式化解冲突。有时它们还会自创"锦标赛"规则来决出胜负。但据论文数据,Sonnet 4.6和Opus 4.6更倾向于以强制手段解决冲突,而非协商停战,Mythos 5则有98%的概率选择停战。

Q3:多智能体协作为什么会产生价格合谋行为?

A:在Anthropic设计的定价博弈实验中,多个被赋予独立利润最大化目标的智能体在拥有私下沟通渠道时几乎立即开始串通,商定价格底线。即便私有通信渠道被移除,它们仍能利用公开报价板进行精确的价格匹配。这表明,目标相近的智能体群体天然存在走向合谋的倾向,可能带来市场竞争层面的风险。