给智能体喂同样的历史轨迹,只换一种打包方式,任务成功率就差了6.06个百分点。研究人员把过去执行记录做成两种形态:一种保留更多执行细节的“工作流记忆”,另一种是提炼后的技能说明文件。结果后者明显胜出。
经验没变,包装变了
打开网易新闻 查看精彩图片
这项对比实验的关键在于控制变量。两组智能体拿到的是同一批过往执行轨迹,没有谁多获得一条数据。区别只在于,一组拿到的是接近原始记录的工作流记忆,另一组拿到的是经过蒸馏的技能文档。技能文档版本的表现比工作流记忆版本高出6.06个百分点。
这说明智能体缺的不是更多经验,而是把已有经验整理得更清晰。同样的内容,以更可执行的步骤呈现,就能直接改变行为效果。
技能主要锚定执行流程
轨迹分析进一步揭示了机制。在技能文档起作用的案例里,65.7%是通过“程序锚定”实现的,也就是明确先做什么、用哪个工具、检查什么、避开哪些错误。只有4.5%的案例是因为技能补充了原本缺失的知识。
换句话说,技能的价值集中在执行层面,而不是知识层面。智能体已经知道该知道的东西,它需要的是把动作顺序固定下来,减少临场发挥带来的偏差。
失败模式同样清晰
技能文档并非万能。当技能被用在错误场景,或者被过于死板地执行时,它反而会拖累表现。一个为特定流程优化的步骤清单,换到不匹配的环境里,可能把智能体引向错误路径。
这提醒开发者,技能需要配合场景判断使用。只给步骤清单,不给“何时适用”的边界,效果会打折扣。
自改进智能体的方向
整体结论指向一个更具体的判断:自改进智能体需要提升的是经验的蒸馏和应用方式,而不只是扩大记忆库。把过去经历堆得更多,不如把已有经历提炼得更准。
对正在构建智能体系统的团队来说,这意味着投入应该向“如何整理经验”倾斜。一份结构清晰的技能文档,可能比翻倍的轨迹数据更值钱。
热门跟贴