Agent 的自进化能力,正在从概念走向工程实践。但很多团队卡在同一个问题上:评测、记忆、落地、控制,这四个环节到底怎么串成一个能转起来的飞轮?

腾讯技术工程团队基于对 Anthropic 递归自改进报告、斯坦福 CS329A 课程以及 EvoAgentX 等开源框架的研读,结合多个团队已验证的实践,提炼出一套四齿飞轮方法论。核心思路很直接:评测是信号源,记忆是燃料库,落地是执行器,控制是方向盘

打开网易新闻 查看精彩图片

评测:不是打分,是信号源

评测在自进化中的角色被严重低估了。它不只是给 Agent 的表现打个分,而是整个飞轮的信号来源。没有可靠的评测信号,后续的记忆沉淀、策略调整都无从谈起。

但搭建评测体系并不容易,文章总结了七大核心难题:弱评估器、评什么维度、评什么粒度、开放式任务难量化、评测集漂移、预算公平性、评测成本。这些问题的本质,是一个结构性的精度 × 成本 × 覆盖面三难困境——想测得准,成本就高;想覆盖广,精度就降。

四个建设要点,把评测做实

针对上述难题,文章给出四个建设要点:

  • 评测手段分层组合:不同任务用不同强度的评估方式,不搞一刀切
  • 评测集的工程化管理:像管理代码一样管理评测集,分层维护 train 集、val 集和 test 集
  • 评测的终点不是打分,是诊断归因:分数只是中间产物,找到失败原因才是目的
  • 评估器本身也需要被评测:评估工具的可信度,决定了整个飞轮的可靠性

文章里有一句金句点出了要害:“评测的可信度 > 系统的复杂度”。评测信号如果失真,飞轮转得越快,偏离越大。

记忆与落地:治理比存储更重要

进入记忆环节,常见的误区是堆存储。文章强调,记忆系统的核心不是存储,而是治理——什么该记、什么该忘、什么该优先被检索,这些规则决定了记忆的质量。落地环节则关注如何把策略变化安全地部署到生产环境,控制环节负责设定边界,防止自进化跑偏。

四个环节环环相扣,评测提供信号,记忆沉淀经验,落地执行变化,控制守住底线。这套飞轮方法论的价值在于,它把“自进化”从一个模糊的概念,拆解成了可落地的工程步骤。对于正在搭建 Agent 系统的团队来说,值得对照自己的架构逐一检查:信号源可靠吗?记忆有治理吗?控制有边界吗?