把语言模型接上工具、让它替你操作电脑,这件事听起来已经近在眼前。一篇综述论文把“模型能力”“系统集成”“实际授权”这三件常被混为一谈的事拆开来看,分别评估。
论文的核心做法是把证据按三个维度重新归类:委托权限、时间持续性、环境耦合度。模型、执行框架和运行环境在归因时保持分离,不再笼统地说“这个智能体成功了”。
打开网易新闻 查看精彩图片
行动接口扩张,不等于任务可靠完成
论文检视的多项研究显示,行动接口的扩张被记录得远比“稳健完成、失败恢复、授权机制、独立验证”更有说服力。换句话说,系统能接更多工具、触发更多操作,但能不能把事做完、做错了能不能自己收场,证据弱得多。
MCP和Agent2Agent这类协议提升了互操作性,让不同组件之间能通信、能协作。但论文指出,这并不等于证明了委托本身可信。能互相调用接口,和能放心把权限交出去,是两码事。
多智能体协作的代价
多智能体组织确实能买到专业化——让不同角色各管一摊。但代价是成本,以及关联性失败。论文把这一点列为需要正视的结构性问题,而不是可以忽略的工程细节。
这篇综述的实用价值在于它提供了一个框架,用来判断到底该给一个智能体多少权限。不是看它演示时多流畅,而是看它在委托权限、时间持续性和环境耦合度上,有没有被独立验证过的证据。
热门跟贴