Salesforce 的一项新研究揭示了一个值得警惕的现象:自我改进智能体的记忆存在明显脆弱性,任务执行顺序的微小变化,就可能导致性能大幅波动。

研究人员测试了两种基于记忆的智能体方法。在 WebArena 默认任务顺序下,ReasoningBank 方法性能提升了 1.5 分;但一旦打乱任务顺序,其性能反而下降了 4.5 分。同样的方法,仅仅因为执行顺序不同,结果就出现了 6 分的巨大落差。

打开网易新闻 查看精彩图片

错误经验被“保存”下来

更值得警惕的是,智能体会把错误经验一并保存。例如,在一个无法调用 API 的环境中,它反而会推荐使用 API。这种“坏记忆”的累积,使得71% 的案例中结果变得比之前更不稳定

研究团队尝试通过改进任务细节和环境反馈来补救,但效果有限——只能恢复约 31% 的性能下降。这意味着,大部分由顺序混乱造成的性能损失,目前仍难以挽回。

这项研究给智能体开发提了个醒:记忆机制不能只关注“记住什么”,更要关注“记住的顺序”。如何让智能体在动态环境中保持稳定表现,仍是一个待解的难题。