大模型任务跑到一半换模型,不是无缝衔接,而是要付一笔“交接税”。一篇新论文把这个代价量化了出来:强模型接手时,弱模型的历史留得越少,效果往往越好;弱模型接手时,保留强模型的工作记录反而更有利。

接手方不是从零开始

打开网易新闻 查看精彩图片

中途切换模型,接手的一方并不会清空重来。它继承的是另一个模型的推理过程、工具调用、编辑痕迹,还有那些走进死胡同的尝试。这些“非原生轨迹”会直接影响后续表现。

论文标题叫《交接税:大模型智能体中的非原生轨迹延续》,发布在arxiv上,编号2608.24358。核心发现指向同一个结论:交接策略必须看方向,不能一刀切。

方向不同,策略相反

具体来说,往更强的模型切换时,删掉大部分弱模型的历史记录,结果会更好。强模型有能力自己重新推理,弱模型留下的错误路径反而会把它带偏。

反过来,往更便宜的模型切换时,保留强模型的工作成果更划算。弱模型可以站在强模型打好的地基上继续干活,省下从头摸索的成本。

代价的本质是轨迹污染

这笔“交接税”的根源在于:强模型会继承弱模型的错误,而弱模型能继承强模型的有用铺垫。同样的历史记录,在不同方向的交接中价值完全不同。

对工程实践来说,这意味着模型切换不能简单地把上下文原样传递。需要根据切换方向,主动裁剪或保留历史内容,才能把交接损耗压到最低。