Agent 的自进化能力,正在从概念走向工程实践。但很多团队卡在同一个问题上:评测、记忆、落地、控制,这四个环节到底怎么串成一个能转起来的飞轮?
腾讯技术工程团队基于对 Anthropic 递归自改进报告、斯坦福 CS329A 课程以及 EvoAgentX 等开源框架的研读,结合多个团队已验证的实践,提炼出一套四齿飞轮方法论。核心思路很直接:评测是信号源,记忆是燃料库,落地是执行器,控制是方向盘。
评测:不是打分,是信号源
评测在自进化中的角色被严重低估了。它不只是给 Agent 的表现打个分,而是整个飞轮的信号来源。没有可靠的评测信号,后续的记忆沉淀、策略调整都无从谈起。
但搭建评测体系并不容易,文章总结了七大核心难题:弱评估器、评什么维度、评什么粒度、开放式任务难量化、评测集漂移、预算公平性、评测成本。这些问题的本质,是一个结构性的精度 × 成本 × 覆盖面三难困境——想测得准,成本就高;想覆盖广,精度就降。
四个建设要点,把评测做实
针对上述难题,文章给出四个建设要点:
- 评测手段分层组合:不同任务用不同强度的评估方式,不搞一刀切
- 评测集的工程化管理:像管理代码一样管理评测集,分层维护 train 集、val 集和 test 集
- 评测的终点不是打分,是诊断归因:分数只是中间产物,找到失败原因才是目的
- 评估器本身也需要被评测:评估工具的可信度,决定了整个飞轮的可靠性
文章里有一句金句点出了要害:“评测的可信度 > 系统的复杂度”。评测信号如果失真,飞轮转得越快,偏离越大。
记忆与落地:治理比存储更重要
进入记忆环节,常见的误区是堆存储。文章强调,记忆系统的核心不是存储,而是治理——什么该记、什么该忘、什么该优先被检索,这些规则决定了记忆的质量。落地环节则关注如何把策略变化安全地部署到生产环境,控制环节负责设定边界,防止自进化跑偏。
四个环节环环相扣,评测提供信号,记忆沉淀经验,落地执行变化,控制守住底线。这套飞轮方法论的价值在于,它把“自进化”从一个模糊的概念,拆解成了可落地的工程步骤。对于正在搭建 Agent 系统的团队来说,值得对照自己的架构逐一检查:信号源可靠吗?记忆有治理吗?控制有边界吗?
热门跟贴