长程任务中,AI智能体常常"一步错、步步错"。浙大与百度联合提出的BEACON框架,正试图解决这一顽疾。

在ALFWorld基准测试中,BEACON将长程任务成功率从53.5%提升至92.9%,接近翻倍。这项成果已被ICML 2026收录。

打开网易新闻 查看精彩图片

问题出在哪?

长程Agent在强化学习中面临两大难题:信用误分配样本利用率低。简单说,一个任务包含几十步操作,当最终失败时,系统很难判断究竟是哪一步出了错,导致每一步都得不到有效反馈。

BEACON的解法

BEACON引入里程碑引导的信用分配机制。它将长程任务拆解为多个阶段性里程碑,每一步的奖励不再依赖最终结果,而是参考当前里程碑的完成情况。这让Agent在每一步都能获得更精准的反馈信号,学习效率显著提升。

目前,该框架在ALFWorld上的表现已证明其有效性。对于依赖多步决策的AI应用,这一思路或能提供新的优化方向。