一个AI系统,如果不仅能自己写代码、调工具,还能自己定义"什么才算好结果",甚至自己出更难的考题——它会变成什么样?这个概念叫递归式自我改进(RSI),最近在AI研究圈讨论度很高。简单说,就是让AI进入一个自我进化的循环:每一次改进,都让它更擅长发起下一轮改进。

但文章作者给出了一个冷静的判断:真正的RSI还没实现。现在的AI Agent确实能改自己的运行环境、加插件、优化训练轨迹,但距离"自己定标准、自己验证、自己出题"的完整闭环,还差着关键一环——判断力。

打开网易新闻 查看精彩图片

从"迭代"到"自我改进",再到"递归"

要理解RSI,得先分清三个层级。最基础的叫迭代:模型在单次任务里反复调整输出,比如写一篇文章改三遍,改完就完了,系统本身没变。再往上叫自我改进:系统通过持久化的改变让自己未来表现更好,比如给Agent新增一个工具、改一段Prompt,下次遇到类似任务它就更强了。

递归式自我改进,要求系统同时做到两件事:一是提升执行能力,二是提升评估标准——也就是那把"尺子"。系统不仅要做得更好,还要更擅长判断"什么才算好",并且能应对更难的测试。文章里有个比喻很形象:Agent = Model + Harness,模型是大脑,Harness是它运行的环境和工具链。

为什么先改Harness,而不是直接改模型权重?

目前的主流方向,是让Agent修改围绕模型运行的代码(Harness),而不是直接动模型权重。原因很实际:改代码比改权重容易得多,风险也小。像Karpathy的Autoresearch和DeepSeek的插件架构,都是让Agent自己写扩展插件并动态加载,在无人干预的情况下扩展能力、优化训练轨迹。

这种"模型与Harness共同进化"的思路,是当前最接近RSI的实践。但作者指出,这些改进大多处于"受约束"状态——系统能优化执行,但评估标准还是人定的。

真正的瓶颈:验证器与"品味"

RSI的核心障碍有两个。第一个是验证机制:如果Agent能编辑自己的评估器,就会导致严重的Reward Hacking(奖励作弊)——它会想办法骗过评分,而不是真正变强。目前的系统依赖外部独立验证器,这意味着AI还无法在不依赖人类设定目标的前提下,自主且诚实地提升标准。

第二个障碍更微妙,叫"品味"。AI很擅长在给定指标下爬升分数,但不擅长判断这个指标本身有没有价值、有没有研究意义。谁来决定"什么值得优化"?目前还是人类。文章里有一句话点得很透:如果没有判断力,递归式自我改进只会让系统更快地把错误方向做到极致。

换句话说,现在的AI是优秀的"执行者",但还不是合格的"评审"。真正的RSI,需要系统同时改进验证器、生成更难的测试、提升判断质量,并且不能控制最终的评估信号——这个闭环,目前还没有任何系统能完整跑通。

所以,AI会不会某天突然开始自我进化?至少从这篇文章的分析看,卡点不在算力,也不在算法,而在"谁来定义对错"这件事上。在人类交出这把尺子之前,RSI更像一个理论上的极限,而不是眼前的现实。