字节跳动新论文提出一种叫 Chain-of-Experience 的方法,核心做法是在上下文中保留先前尝试与反馈,而不是把这些内容整理成简洁摘要。

实验数据

打开网易新闻 查看精彩图片

在 6 个数学、编程和知识基准上,自我反馈平均得分 71.0%,高于无反馈迭代求解的 66.8%;使用正确性或执行器反馈可达 79.3%

方法逻辑

保留完整尝试历史,让模型能参考此前每一步的失败与修正过程,比压缩成摘要更利于后续推理。