一个Agent跑完同样的任务,Token消耗能差出六成。这不是模型换代的功劳,是工作流里藏了太多看不见的浪费。英伟达开源了一个叫 SoL-Pi 的 Agent Harness,专门干一件事:让AI自己去审计AI的工作流,把浪费揪出来。

结果摆在这:相比基线 Pi,Token 减少 35-64%,API 成本下降 50-54%。省钱幅度不小,但更值得看的是它怎么省的。

四个"漏钱"的地方

SoL-Pi 没有靠工程师拍脑袋猜哪里费Token,而是让 AI 跑 RSI(递归自我改进)实验,自动审计工作流,最后定位出四类浪费模式:

  • 历史重放——同样的上下文被反复搬运
  • 大内容反复传输——整块材料来回塞进上下文
  • 无谓思考往返——模型之间做没有产出的来回确认
  • 贵模型干便宜活——高成本模型被用来做粗读这类低价值动作

这四类问题,做过Agent的人大概都不陌生。难的是识别出来之后怎么改,SoL-Pi 给每一项都配了一个对应的结构性优化。

省钱可以,偷懒不行

第一项,把确定性的子任务合并成单一原子动作,减少来回调用。第二项,引入压缩评估器,只有当预期未来节省能覆盖重写成本时,才去压缩上下文——不是无脑压。第三项,大块内容外置到仓库,上下文里只留"取件码"和短摘录,用的时候按页取。第四项,长日志的粗读外包给廉价模型,但廉价模型必须交出一份可逐条核验的 Receipt,通过之后才把结果交回贵模型做决策。

这四项优化有一个共同点:每一项都设了验收门槛。压缩要过成本收益测算,外置内容要能精准取回,廉价模型的摘要要能逐条对回归档日志核验。

SoL-Pi 给自己定了一条铁律——省下的钱必须来自消除浪费,不能来自偷懒少干活,否则直接判不合格。任何以牺牲任务完成度换来的Token节省,都会被拒收。

这条约束其实是整个方案里最容易被忽略、也最关键的部分。Agent降本最省事的做法就是少读、少想、少验证,代价是任务质量悄悄下滑,而且很难在指标上立刻看出来。SoL-Pi 把"质量不降级"写成了硬性门槛,等于堵死了这条捷径。

能直接抄的工程细节

原子动作合并、按需压缩评估器、内容仓库化加取件码、Receipt 核验机制,这几个设计模式不绑定特定框架。也就是说,不管你用的是哪套 LLM 多轮交互系统,这些思路都能搬过去。

相对基线 Pi,SoL-Pi 的 Token 减少 45-49%,成本降到原来的三分之一左右。对于按Token计费的Agent产品来说,这个数字直接对应毛利空间。

更值得留意的是方法本身:不靠人工经验猜测瓶颈,而是让 AI 自动跑实验发现浪费模式,再按图索骥做结构性优化。这套闭环如果能复制到别的系统上,降本就不再是一次性的调优,而是一个可以反复跑的过程。