16步后成功率跌到0%,微软论文拆解智能体长程衰减
野生运营
·北京
微软一篇论文把大模型智能体的长程表现拉出来量了一遍。研究跨了9个模型,结论很直接:依赖的步骤越多,成功率越低。
短程近乎满分,长程直接崩
打开网易新闻 查看精彩图片
在ToolQA基准上,短程任务里模型表现接近满分。但任务拉到16步时,成功率只剩0%到33%。这不是某一个模型的问题,9个模型都出现了同样的衰减曲线。
缩短上下文反而更糟
实验里还试了缩短上下文,结果衰减没有缓解,反而更严重。论文据此判断,问题主要由步数驱动,而不是上下文长度。步骤一多,错误就开始累积。
作者给了三个建议
- 按真实工作流的长度来测试,别只看短程分数。
- 度量每一步的可靠性,而不是只看最终结果。
- 在错误扩散之前加入检查点,把长任务切成可校验的段落。
这篇论文的价值在于把“智能体做长任务会变差”这件事,从体感变成了可复现的数字。
热门跟贴