微软一篇论文把大模型智能体的长程表现拉出来量了一遍。研究跨了9个模型,结论很直接:依赖的步骤越多,成功率越低。

短程近乎满分,长程直接崩

打开网易新闻 查看精彩图片

在ToolQA基准上,短程任务里模型表现接近满分。但任务拉到16步时,成功率只剩0%到33%。这不是某一个模型的问题,9个模型都出现了同样的衰减曲线。

缩短上下文反而更糟

实验里还试了缩短上下文,结果衰减没有缓解,反而更严重。论文据此判断,问题主要由步数驱动,而不是上下文长度。步骤一多,错误就开始累积。

作者给了三个建议

  • 按真实工作流的长度来测试,别只看短程分数。
  • 度量每一步的可靠性,而不是只看最终结果。
  • 在错误扩散之前加入检查点,把长任务切成可校验的段落。

这篇论文的价值在于把“智能体做长任务会变差”这件事,从体感变成了可复现的数字。