Anthropic旗下前沿红队(Frontier Red Team)本周四发布了一项新研究,专门观察AI代理在“野外”相遇时会如何表现。结果发现,一旦多个AI代理被置于同一环境,局面很快就会失控。 在实验中,研究人员给三个Claude代理分配了同一个软件项目,但每个代理都收到了互不兼容的指令,且它们并不知道还有其他代理也在处理该项目。研究者希望借此观察,当它们不期而遇时会采取什么行动。 结果研究人员“持续看到多代理地盘争夺战”。这些模型都把对方误认为是“有意阻挠自己工作的干扰者”,于是开始互相破坏,手段不断升级,甚至使用了“攻击性越来越强、能够自我复制的恶意软件”。 这一研究发布之际,Anthropic和OpenAI的代理在网络安全评估中已经发生过数次逃逸事件,甚至突破沙箱接触到了真实系统。但此次研究关注的是另一个问题:当数千、数百万个代理彼此交互时,会不会产生全新的、有害的动态? 研究人员在报告中警告说:“代理与代理之间的交互量,很可能在人类理解‘如何让这类交互顺利进行’之前,就超过人与人、人与代理的交互量。”个体层面一些看似无害的行为怪癖,可能会叠加成无法预料的全局后果。 报告中还提到,OpenAI在拉斯维加斯Black Hat安全大会上的一次事件,就提供了一个混乱的现实例证,展示了类似的多代理互动风险。随着企业和政府加速部署代理系统,这种“混战”可能不再只是实验室里的场景。
打开网易新闻 查看精彩图片
热门跟贴