五个AI代理不等于一个团队

给五个AI代理开放同一个代码仓库的权限,不会自动组成一支团队。它只会制造五个速度快、信心足的开发者,他们可能同时提交互相冲突的拉取请求,重复犯同一个错误,然后互相告诉对方“一切看起来都很好”。这话说得有点重,但它正在被真实系统里的开发者逐步验证。

打开网易新闻 查看精彩图片

多智能体演示很容易做得漂亮。一个代理做规划,另一个写代码,第三个做审查,最后一个宣布成功。流程图看着干净,实际执行往往乱得多。Anthropic在漏洞研究和协作软件项目上测试了代理集群,结果既让人期待又让人不安:代理覆盖了巨大的搜索空间,可一旦工作彼此依赖,协调就变得脆弱。

教训不是避开多智能体系统,而是别再拿“更多代理”当架构。

什么才算多智能体系统

多智能体系统里有多个AI工作者,各自拥有独立的上下文、职责或工具。它们可以并行运行、互相传递工作、审查输出,或者向一个编排者汇报。目前已经出现两种常见设计:一种是管理者保持控制权,按需调用专家代理处理有边界的任务;另一种是路由器把任务交给某个专家代理,由它接管后续全部交互。

OpenAI的Agents SDK记录了这两种模式,并划出一条重要分界:你可以让大模型决定工作流,也可以在代码里控制工作流。由大模型主导的编排更灵活,由代码主导的编排在成本、速度和行为上更可预测。这个区别比代理数量更关键。一个拥有十个代理却没有确定性控制的系统,往往不如一个在严格循环里带着测试运行的单个代理可靠。

并行工作是最容易的部分

多智能体系统最擅长处理能拆成独立片段的任务。安全研究就是典型例子。Anthropic给45个代理各自分配了虚拟机,让它们搜索15个开源项目的漏洞。这些代理可以通过共享论坛协调、互相评审发现,并把结果提交给一个仲裁代理。

这个集群找到了266个漏洞,消耗了2700万个token。而一个更简单的并行设置找到了21个漏洞,用了650万个token。这些数字并不能自动证明集群更高效。集群发现里大约一半位于简单设置被分配的核心目录之外,而且只有12个漏洞同时出现在两组结果中。

真正有价值的是覆盖范围。独立代理探索了不同区域、构建了工具、形成了分工。一个代理漏掉的发现,不会让另一个代理的工作作废。这种模式很适合几类开发任务:检查独立模块的安全问题、调研相互竞争的库、为不相关的组件生成测试、检查独立页面的可访问性,以及从性能、安全和产品角度审查同一处改动。