字节跳动新论文提出一种叫 Chain-of-Experience 的方法,核心做法是在上下文中保留先前尝试与反馈,而不是把这些内容整理成简洁摘要。
实验数据
打开网易新闻 查看精彩图片
在 6 个数学、编程和知识基准上,自我反馈平均得分 71.0%,高于无反馈迭代求解的 66.8%;使用正确性或执行器反馈可达 79.3%。
方法逻辑
保留完整尝试历史,让模型能参考此前每一步的失败与修正过程,比压缩成摘要更利于后续推理。
字节跳动新论文提出一种叫 Chain-of-Experience 的方法,核心做法是在上下文中保留先前尝试与反馈,而不是把这些内容整理成简洁摘要。
实验数据
在 6 个数学、编程和知识基准上,自我反馈平均得分 71.0%,高于无反馈迭代求解的 66.8%;使用正确性或执行器反馈可达 79.3%。
方法逻辑
保留完整尝试历史,让模型能参考此前每一步的失败与修正过程,比压缩成摘要更利于后续推理。
00:00
热门跟贴