本文来自PRO会员通讯内容,文末关注「机器之心PRO会员」,查看更多专题解读。

打开网易新闻 查看精彩图片

AI 行业正经历从生成式能力向 Agent 行动力的结构性跃迁,其核心矛盾已从模型能力边界转向推理成本的可控性。随着金融、制造、互联网等行业头部企业将 Agent 编入自动化流水线,Token 消耗受到广泛关注。2026 年以来,从模型侧的自适应推理机制到路由侧的智能调度方案,业界的注意力开始集中于以「降本」为核心的技术路线。

未来的基础模型是否需要默认具备自适应思考能力?...

Agent 推理成本为何阶梯式上升?ReAct 循环范式为何天然推高 Token 消耗?...

目录

01.是什么导致了 Agent 的推理成本阶梯式上升?

02.业界为降低 Agent 推理成本设计了哪些降本方案?

Anthropic 自适应思考从模型侧压降成本的机制是什么?...

03.「模型侧集成降本能力」后,第三方 Agent 编排层还有存在价值吗?

是什么导致了 Agent 的推理成本阶梯式上升?

1、过去数月,AI 智能体加速从实验室走向企业生产,企业通过 Harness 把 Agent 接入自动化流程。与此同时,Agent 的 Token 消耗量呈指数级上升,模型厂商希望企业扩大用量、企业希望控制成本,二者之间的诉求正在推动行业寻找技术降本的解法。[1-1]

智能体的有状态特性使其在长时运行中需持久化执行代码并处理过程性错误,小规模系统故障在缺乏有效缓解措施的条件下,可对智能体产生灾难性影响,导致 Token 消耗急剧膨胀。[1-2]

② 多智能体协作系统进一步放大这一成本压力。在单 Agent 循环消耗之外,Agent 间的任务分配、状态同步与结果汇总叠加了额外开销。Anthropic 团队研究数据表明,运行单一 Agent 完成一项标准任务的 Token 消耗量约为传统单轮对话的 4 倍,而多智能体协同架构下的 Token 消耗量达到标准对话的 15 倍以上。[1-2]

2、相比传统大语言模型的单轮请求-响应,Agent 采用的 ReAct 推理范式将任务拆解为多轮「思考-行动」循环,每轮均需重新编码完整历史上下文,Token 消耗随循环深度持续累积,且循环终止条件取决于任务复杂度,难以提前预估。[1-3]

① 在复杂任务中,Agent 可能需要数十轮推理-行动循环才能收敛到答案,边缘情况下 Agent 甚至可能陷入循环无法自行终止,导致 Token 消耗无上限增长。[1-3]

3、即使单次循环的成本尚可接受,当 Agent 采用 Plan-and-Solve 架构将任务拆解为数个甚至数十个执行步骤且每一步都独立触发 ReAct 式的多轮循环时,上下文窗口的累积增长便构成了成本放大的另一层因素。[1-4]

① Plan-and-Solve 是一种将任务分解为「先规划、再执行」两个阶段的提示架构,模型首先生成有序多步执行计划,随后逐步执行每个子任务。[1-4]

4、当前流行的多智能体工作流设计导致推理成本显著增加,使业界对 Agent 推理成本的关注度持续上升,而在烧掉数百万 Token 后未能产出有效结果的情形下,则进一步加重了企业的成本压力。

① 2026 年米哈游一位工程师周末部署数十个 Agent 进行多智能体协作测试,未设 Token 消耗上限即离开,智能体陷入循环调用,连续运行 13 小时,烧掉价值 200 万元人民币的大模型 Token。[1-5]

② OpenClaw 创始人 Peter Steinberger 公开其 OpenAI 账单,3 人团队指挥 100 个 Codex 智能体,30 天内消耗 6030 亿 Token、发起 760 万次请求,账单高达 130 万美元(约合人民币 930 万元)。[1-6]

业界为降低 Agent 推理成本设计了哪些降本方案?

1、在智能体推理成本日益上升的趋势下,业界正在从多个维度下探索降本方案。如模型厂商将推理预算控制内置至模型自身,部分开源项目在 Agent 与模型之间加设请求级路由,另有工具从数据输入侧过滤冗余上下文或从提示词侧压缩固定消耗...

关注「机器之心PRO会员」,前往「收件箱」查看完整解读

打开网易新闻 查看精彩图片