NVIDIA的研究团队把目光从模型权重上移开了。他们提出的SoL-Pi方法,锁定的是Harness层——也就是模型之外、框架之内的那一整套调用与调度逻辑。在EdgeBench上,这套方法保留94%分数的前提下,把Token流量压低了49%,API成本降了三分之一。
这不是靠换更小的模型做到的。模型权重固定不动,改的全是框架里那些被反复浪费的环节。
为什么盯上框架层
7×24小时无人值守的Coding Agent,真正的成本瓶颈往往不在推理本身,而在过程性浪费。一次任务里,编辑、测试、调用来回往返,上下文反复压缩,大段输出被完整塞回模型——这些动作和具体任务无关,和具体模型也无关。
正因为无关,收益才可迁移。框架每个环节的浪费模式是通用的,一次优化能惠及所有任务。素材里提到,Opus 5在零适配的情况下验证省下了44.7%。
自动化研究怎么防过拟合
SoL-Pi的筛选过程本身就是一条自动化研究流水线,规模达到152个方向、535个环境、3000+次运行、60k+次交互。规模一大,最容易出的问题就是进化过拟合——筛出来的机制只在测试集上好看。
团队用了三道设计来挡:
- 独立验证留出集,永不回流到训练流程
- 冻结指标先行,能力指标不越界,效率指标至少改进一项
- 一次性技能循环,实例隔离无耦合
这三条保证了筛选出的机制具备真泛化能力,而不是记住了某几个环境的特征。
活下来的四个机制
最终有四个机制通过了筛选,每一个都对应一种可测量的具体Token浪费模式。
Action Fusion把编辑和测试调用合并,砍掉往返开销。Context Compact在子任务结束时做压缩,并且把缓存账算清楚。ObservationPack把大输出在本地归档,只给模型句柄和摘录,降低观测带宽。Evidence Reducer用便宜模型提炼日志,再逐句验证,验证不过就回退。
这四个机制的工程细节都指向同一个思路:不减少必要的信息,只减少信息的搬运次数和体积。
成本账算得很诚实
实验里没有回避缓存写放大的成本。单位分数成本从$0.586降到$0.417。按这个数字外推,持续运行时每小时能省下$8.75到$13.50。
省Token不掉分,才是真效率。这句话放在7×24运行的Agent场景里,分量比听起来更重——因为成本是按小时累积的,而分数掉一点,可能就意味着整条流水线要人工介入。
热门跟贴