3 万 Agent 上岗,多 Agent 开始比成本。

9 月 18 日,Claude Code 的架构换了一遍。

主对话框下一个高阶目标,协调器拆成多个子任务,派给并行工作线程。每个线程跑在云端独立环境里,各自拉一条 Git 分支,写完自动提交、生成 PR。

指令下完就能合上电脑走人。

同一天,Anthropic 披露《衡量 AI 研发节奏》。

内部研发平台每天同时跑着 3 万个 AI Agent,单月决策量超 10 亿次,AL4 级研发任务占比 26%。

今年 2 月,这个数字还不足 1%。

Anthropic 自己的公开表述里还有一句"多 Agent 肯定是不便宜的",并提醒注意 usage。

多 Agent 协作的竞争落点,已经从模型能力转到了编排成本上。

拆解、代码隔离、上下文对齐这三件事,以前是在人脑子里做的,现在被拆成了系统环节。

要解决的是多个写手同时开工怎么不互相踩,怎么共享同一套上下文。

这跟模型写得好不好是两件事。

26% 是任务口径,跟岗位数不是一回事,混着读会把进度看快一年。

另一头是成本。并行的分母里还有两笔账没被算清:Token 和合并冲突。

而在一周之内,Anthropic 和 Cursor 做了同方向的动作。

事实部分来自 Anthropic 9 月 18 日的《衡量 AI 研发节奏》报告与 Claude Code 架构更新说明,以及 Cursor 9 月 10 日的 Projects beta 公开信息。

没有可复现的实测数据,就不写实测口吻。

多 Agent 卡住的不是模型会不会写

此前主流的编码 Agent 是单 Agent 模式:一次处理一个任务。Cursor、Claude Code、Codex 都是这个形态。

新架构把三个环节从人脑里搬了出来。

数据来源:Anthropic 2026-09-18 公开信息

一个人一次只能盯住一个任务,这是注意力的上限。

把并行线程数提上去,先要解决多条线同时改同一个仓库的问题。

打开网易新闻 查看精彩图片

图 1 多 Agent 协作链路的五个环节

26% 是任务口径,不是岗位口径

AL4 级的定义是"AI 凭高阶指令端到端完成任务",26% 指这个级别的研发任务占比。

另一个数是 AL3 级(深度人机协作)流程占比,超 90%。

两者不是一回事。

90% 更接近多数团队眼下的真实状态:人牵头,AI 深度参与。

26% 讲的是另外那部分——人给一句高阶指令,剩下交给 AI。

报告还给了两项监控与安全口径的数字。

  • 8 月的 10 亿次决策中,Agent Oversight 拦截约 0.002% 的高风险或异常行为
  • 7 月 13 日至 20 日,约 6% 的 AI 研发算力用于安全与对齐研究

0.002% 是拦截比例。它说的是监控拦下了多少,不是总共发生了多少。

公开信息里没有给出后者。

打开网易新闻 查看精彩图片

图 2 AL3 与 AL4 的公开分级口径

打开网易新闻 查看精彩图片

图 3 AL4 级研发任务占比:2 月与 9 月

并行的分母里有两笔账还没算清

第一笔是 Token。

多 Agent 并行意味着多个线程同时调用模型。线程数是乘数,消耗跟着走。

公开表述只到"不便宜"这一层,具体贵多少没给数。

第二笔是合并冲突。

多条分支并行改同一片代码,协调器能理清依赖,但重叠修改该撞还是会撞。

最后还是需要人介入,判断哪一条留下。并行度越高,这块的边际成本越大。

判断口径可以这么设:多 Agent 比单 Agent 贵 5 倍、只快 2 倍的话,商业上就站不住。

真正缺的是这一格数。

报告给了决策量、拦截率、算力占比,唯独没给每个任务的平均成本和多 Agent 相比单 Agent 的效率差。

这两项没有披露,眼下关于投入产出的判断都还停在推算阶段。

一周之内两家做同一件事,竞争落点换了

9 月 10 日,Cursor 发布 Projects beta,主打 Coordinator Agent,向下派发数千个子 Agent。

8 天后,Claude Code 更新为原生多 Agent 架构。

编码 Agent 早先的卖点一直是模型能力:补全准不准、上下文多长、一次能改多少文件。

比较对象换了一层——比的不再是单次输出质量,而是多个线程同时跑时,编排做得怎么样。

打开网易新闻 查看精彩图片

图 4 两家在同一周内的公开动作并列

可比的维度有三个:编排的粒度、可控的程度、单位任务的花费。

前两项目前没有可比较的公开口径,第三项两家都没有公布数。

单个任务能做多好,取决于模型。同一时间能推进多少、每个要花多少,取决于编排。

评估重点也就从"模型行不行",挪到了"单位产出要多少成本"。

两个地方不成立。

一是口径。3 万 Agent、26% 出自 Anthropic 自家的内部研发平台,跑在自研仓库与自家工具链上。

换一支代码库更小、模块耦合更高的团队,并行的收益结构会不一样。

二是前置条件。多 Agent 的收益建立在单次任务成功率足够高之上。

单 Agent 基线本来就低的话,并行会把失败一起放大。

顺序是先跑顺单 Agent,再加线程。

两个指标值得盯:多 Agent 相比单 Agent 的实际效率差,以及单位任务成本能不能降下来。

本文事实信息来自 Anthropic《衡量 AI 研发节奏》报告与 Cursor 官方发布,截至 2026 年 9 月 18 日。观点部分为基于公开信息的分析,不构成对任何产品或企业的评价。