一篇新论文对基于记忆的自我改进智能体提出了重新评估,结论有些出人意料:此前报告的性能增益,可能主要来自评估过程中的噪声,而非智能体本身的记忆能力。
研究团队补充了此前工作忽略的两个关键变量:多次运行的测量方差,以及随机打乱任务顺序。结果显示,这两项调整都显著降低了智能体的性能表现。
打开网易新闻 查看精彩图片
课程学习是主因
论文指出,默认任务顺序中隐含的“课程学习”(由易到难)才是报告增益的主要来源。当任务顺序被随机化后,增益大幅缩水。
有趣的是,添加详细的评分标准与环境反馈,可以部分恢复性能,但与此前报告的差距依然明显。这意味着,此前部分结论的可靠性需要打上问号。
热门跟贴