你的Agent上线半年了,回头看看——它比第一天聪明了吗?它可能还在犯三个月前就犯过的错,还在重复三个月前就走过的弯路,还在对三个月前就见过的场景表现得像个新手。半年的线上流量喂过去,它一点经验都没攒下来。
问题不在模型不够强。问题在于——没有人给它搭一条从"做过"到"记住"到"变好"的路。腾讯程序员yannisyang、ethanytzhou基于对Anthropic递归自改进报告、斯坦福CS329A课程、EvoAgentX等开源框架的深度研读,结合业界多个团队已验证的优秀实践,提炼出一套评测→记忆→落地→控制的四齿飞轮方法论。
一个被拆散的系统
最近几个月,一个普遍且致命的现象被观察到:评测、记忆、Self-Improve这三件事,在大多数团队里是被拆散着做的。评测团队搭了一套评分系统,跑完打个分就结束了——分数去了周报,没有去到Prompt或Skill的改进链路里。记忆团队做了一套向量检索,存了一堆对话历史——但召回的东西噪声太高,Agent反而被干扰了,最后记忆模块被默默关掉。
每个团队都在认真地做自己那一块,但飞轮没有转起来。因为这三件事不是三个独立的功能点——它们是同一个闭环的不同环节。评测是闭环的"眼睛"(感知哪里有问题),记忆是闭环的"大脑"(积累可复用的经验),Self-Improve是闭环的"手脚"(把经验变成实际的改进),人机协作是闭环的"方向盘和刹车"(确保进化方向不跑偏)。
自进化改的到底是什么?
2026年上半年,自进化从"学术概念"突然变成了"工程热点"——斯坦福开了CS329A课程、Anthropic发布了递归自改进报告和Dreaming机制、多个开源框架出现、业界多个团队跑通了完整闭环。这个领域正从"能不能做"跨越到"怎么做好"的阶段。
"自进化"这个词被用得很滥。有人拿Self-Refine(让Agent多改几版输出)叫自进化,有人拿Agent RL(训模型权重)叫自进化。它们是完全不同的东西。改什么,就决定了"进化"的持久性和价值,分为三层:
- 第一层:Artifacts迭代——改输出产物。代码写了三版越来越好、方案改了几稿越来越靠谱。但任务结束,Agent本身没有任何改变。这不是进化,这是打草稿。
- 第二层:Harness自改进——改Agent的配套系统。记忆、Skill文件、Prompt、工具配置、工作流——这些改动持久化到文件或数据库,跨会话生效。这是当前最具性价比的进化方向。
- 第三层:Model进化——改模型参数本身。通过Agent RL、自对弈微调将经验写入权重。持久性最强,但成本最高、风险最大,目前仍在研究阶段。
为什么Harness层是主战场?四个字:即时、可控。改完Skill/Prompt立刻生效,不需要重训模型;改错了一键回滚,不会造成不可逆的损害。已有落地案例通过Harness层进化,迭代次数减少70%、Token消耗降低80%+;在Agent Memory场景中Token节省超60%——这些收益全部来自"改配套系统",一个模型参数都没动。
核心立场与飞轮结构
这篇文章的核心立场有三个:①自进化的瓶颈不是任何一个技术点,而是环节之间的衔接。评测信号必须能流进记忆和Skill更新;更新后必须能被评测验证;验证结果必须能反哺下一轮进化。这条链路断了任何一环,飞轮都转不起来。②评测的可信度大于系统的复杂度。一个简单但评测可信的系统,远好于一个复杂但评测失真的系统。错误的正反馈会让Agent加速开往悬崖。③记忆系统的核心不是存储能力,而是治理能力。存得多不如治得好——版本控制、主动遗忘、冲突解决、来源溯源,这些"不性感"的治理能力才是决定记忆系统到底帮忙还是添乱的关键。
飞轮按照四个齿逐一展开:信号(评测)→积累(记忆)→落地(工程化)→控制(人机协作)。每个环节讲清楚三件事:核心矛盾是什么、应该怎么建设、有哪些坑必须避开。最后一章讲它们怎么咬合成飞轮、以及从零到一的落地路线。
一个具体的例子帮助理解三层的区别:假设你的Agent在处理"日期格式转换"时经常出错。Artifacts层让Agent在本次任务中多试几次、自我纠错——这次做对了,但下次遇到同样的问题它不会更快。Harness层写一条Skill——"遇到日期格式转换时,先识别源格式再用对应的转换函数"——持久化保存,下次遇到直接follow这条Skill,不再犯错。Model层用大量日期格式转换的正确样本微调模型——模型本身"学会"了这件事。成本最高,但也最根本。对于绝大多数团队来说,写一条Skill(Harness层)就能解决问题——不需要微调模型。
热门跟贴