腾讯在一篇论文里提出了一个叫 SkillAdam 的方法,让 AI 智能体的技能指令能够自动优化。核心思路是让负责改写的 AI 记住过往的修复经验,同时避免大幅重写。

这套方法瞄准的是一个具体问题:自动改写技能时容易反复循环,token 被大量浪费。SkillAdam 的做法是让改写过程带上"记忆",不再每次都推倒重来。

打开网易新闻 查看精彩图片

两组数字的对比

在长程购物与旅行规划任务上,SkillAdam 的平均准确率达到 28.3%。此前最佳方法 SkillOpt 的成绩是 21.7%。

除了准确率,成本端的差距同样明显:SkillAdam 的 token 消耗约为 SkillOpt 的三分之一。

换句话说,同样的任务,它做得更准,花的 token 更少。对于需要反复调用模型来优化技能的场景,这个比例直接关系到能不能跑得下去。

为什么"记住"这件事重要

技能自动改写的常见困境是循环:改一版,效果不好,再改回去,来回折腾。每一轮都要消耗 token,而模型未必记得上一轮为什么失败。

SkillAdam 让改写 AI 记住过往的修复,等于给这个过程加了一条经验线。避免大幅重写,则是防止好不容易调好的部分被一次推翻。

这两个约束叠加,指向的是同一个目标——把 token 花在真正需要调整的地方。