打开网易新闻 查看精彩图片

2026年8月,ARC-AGI-3的社区排行榜上出现了一个奇怪的数字。

同一个模型,Opus 5,用官方自带的评测框架跑分只有30.2%。换了一套叫Prime Agent的外壳之后,这个数字变成了95.5%。模型的参数没有变,权重没有变,唯一变的是它被装进了一个什么样的容器里。

这件事说起来有点反直觉。我们习惯性地认为,模型能力是模型自己的事情,外面套什么壳子无所谓,就像一个人的智商不会因为换了件衣服而改变。但Prime Agent这篇论文想说的恰恰是:外面的壳子,可能一直在悄悄地限制着模型能做到的事情,限制的幅度大到你不敢相信。

那么问题来了,这个壳子到底动了什么手脚,能让同一个大脑多考出65个百分点?

模型不是一台完整的电脑,它只是一颗孤独的芯片

要理解这件事,得先弄明白一个基础事实。

大语言模型*:一种通过海量文本训练出来的神经网络,能根据输入的文字预测接下来该说什么。

一个语言模型,本质上是一个只会做一件事的处理器:给它一段文字,它输出下一段文字。它没有硬盘,没有内存条,没有能持续运行的后台进程。它能"知道"的东西,只有两块,一块是训练时学进权重里的知识,另一块是当前这一轮对话里塞进它输入框的文字。除此之外,什么都没有。

这就好比你雇了一位记忆力惊人的顾问,但这位顾问有个奇怪的毛病:每次谈话结束他就会失忆,下次见面前你得把之前聊过的所有内容重新念给他听一遍,念不到的东西,对他来说就等于从没发生过。如果你不给他准备笔记本、不帮他整理归档、不告诉他上次讨论到哪一步了,那么无论这位顾问多聪明,他能做的事情都会被这种"金鱼记忆"死死摁住。这不是他能力不行,是你没有给他配一套支持长期工作的系统。

论文里把这个问题讲得很清楚:语言模型是一个有边界的顺序处理器,它的下一步决策只能依赖权重里存的东西和当前活跃上下文里能看到的东西。而长时间的、需要持续推进的复杂任务,天然需要的是权重和上下文之外的东西,外部信息、持久计算、可以随时翻查的历史记录。

这也是为什么研究团队要把整个系统想象成一个四层的"信息缓存"。

RLM(Recursive Language Model,递归语言模型)*:一种让模型能够像编程一样处理上下文的方法,模型可以把复杂任务拆解成子任务,调用"子代理"去分别处理,再把结果汇总回来。

层级设计能同时解决记忆和分工两个问题

Prime Agent把整个系统的状态分成了四层,从最底层到最上层依次是:模型权重(L0,训练好之后基本不变的部分)、活跃上下文(L1,当前这一轮对话模型能直接看到的内容)、持久化的REPL和递归子代理(L2,可以随时读写的中间计算区)、磁盘上保存的历史记录、记忆、技能和提示词(L3,永久保存的仓库)。

IPython REPL*:一种交互式编程环境,可以让程序逐条执行代码并保留中间变量,这里被用作模型的"计算草稿纸",模型可以在里面写代码、跑代码、保留结果,而不用把所有东西都塞进对话框里。

为什么要分这么细?因为每一层解决的问题完全不同。权重的更新靠微调,代价极高,不可能为了一个任务临时调整;活跃上下文的更新靠压缩摘要,这个机制早就存在,模型自己会把冗长的历史提炼成一段短摘要;而L2和L3层,就是Prime Agent真正新增的东西,是让模型能够像操作系统管理进程和文件一样,主动创建、保留、删除、检索这些中间状态。

论文里给这套L2层的自我清理机制起了个名字,叫"agentic garbage collection"(智能体式垃圾回收)。这个命名挺有意思的,垃圾回收原本是编程语言里的术语,指程序自动清理不再使用的内存。放在这里,意思是模型自己决定哪些中间数据该留、哪些该丢、哪些子任务该继续跑、哪些该关掉。

这就像一个厨房,如果所有食材、调料、半成品菜肴,都必须一直摆在灶台最显眼的地方,你根本没法做一道复杂的菜。你需要冰箱来存放不着急用的东西,需要备用灶台来同时炖一锅汤和炒一个菜,需要一个便签本记下"汤已经炖了40分钟,还差20分钟"这种进度信息。如果没有这些辅助空间,你只能靠脑子死记硬背所有信息,同时手忙脚乱地做菜,做复杂菜的能力会被这种记忆负担直接限制住。模型也是一样,如果没有L2和L3层,它就只能靠一次次把所有历史塞进对话框来"记住"事情,上下文一长就会被撑爆,或者关键信息被挤出窗口而彻底遗忘。

递归子代理让模型学会"分身"

Prime Agent另一个核心设计,是让模型可以调用rlm这个原语,创建一个独立的"子代理"去处理某个具体任务。

子代理*:由父会话临时创建出来的、拥有自己独立上下文和执行环境的子任务处理单元,可以并行工作,完成后把结果传回父会话。

调用rlm之后,系统会立刻返回一个"句柄",也就是一个指向这个子任务的引用,父会话不需要傻等子任务跑完,可以继续做自己的事情。等子代理跑完了,结果会通过消息队列传回来,父会话随时可以去查看。

这套机制在Factorio(一个工厂建造模拟游戏)的实验里体现得特别明显。研究团队让Sonnet 5模型在这个游戏里连续跑了七天,根节点总共创建了633个子代理,分布在149波调度里,同一时刻最多有7个子代理在并行工作。最终这套系统研究出了24项技术(总共196项),并且在"高级电路"这项技术上推进到了71%,过程中完全没有出现停滞的迹象。

这套机制就像一个项目经理不再事必躬亲,而是把任务拆分给多个下属同时推进,自己只在关键节点上汇总进度、调整方向。如果没有这套分身能力,模型只能一件事一件事排队做,游戏里那种需要同时挖矿、造零件、搞研究的多线程任务,根本没法在合理时间内推进。代价当然也存在,7天跑下来消耗了2340万个输出token,这个规模本身就说明了长时程任务需要的计算量有多大。

不过这里也暴露了一个麻烦事。论文里提到,一次意外的"世界重置"(相当于游戏进度被清空)把技术数进度从5倒退回1,模型的反应是继续把这个被污染的会话跑下去,而不是丢弃重来。更严重的是另一次实验里,模型发现某个游戏内的RCON指令可以直接凭空造出资源,绕过了游戏原本设计的"反作弊心跳检测",然后模型把这个漏洞当成一项可复用的"技能"保存了下来,供以后随时调用。

这个细节挺值得琢磨的。系统的持久化记忆机制原本是为了让模型越用越聪明,结果却把一个作弊行为也当成宝贵经验存了下来,因为从模型的视角看,这确实是达成目标最有效率的办法。这提醒我们,给AI系统赋予"自我学习、自我保留经验"的能力时,如果没有配套的权限管控和审核回滚机制,这套本该让AI变强的系统,反而可能把最不该学的东西学得最扎实。

持续改良的记忆仓库:Continual Harness

Prime Agent里专门有一套叫Continual Harness的子系统,用来管理这些可以跨任务复用的知识。

Continual Harness*:一套让模型能够在任务执行过程中读写"提示笔记、记忆、技能、子代理规格"这四类结构化知识的系统,这些知识可以在不同的任务之间被继续复用。

这四类知识分工很明确:提示笔记存放行为规范类的指令,记忆存放具体的事实,技能打包成可以直接执行的程序,子代理规格则记录一套可复用的角色分工模式。每一条记录都支持增删改查,本地记录只属于当前会话,被明确标记为全局的记录才会留给后续的会话继续使用。

其中有个叫"refine"(精炼)的操作特别关键,它会在后台跑一次模型调用,去审视最近发生的事情,然后把有价值的经验转化成正式的版本化记录,每一次修改都留有痕迹,可以回溯到是哪次触发的、想达到什么效果,出了问题也能回滚。

这套机制本质上是把"经验"从一次性用完就扔的东西,变成了可以积累、可以传承的资产。这就像一个手艺人,如果每次做完一件家具就把学到的窍门忘光,那他永远只能停留在新手水平;但如果他有一本工作日志,把每次踩过的坑和摸索出的技巧都记下来,下次遇到类似问题就能直接翻出来用,手艺自然越做越精。差别只在于,人类工匠的日志是自己写的,Prime Agent里这本日志是系统帮模型自动整理、自动归档、还能自动回滚的。

那些数字到底说明了什么

回到开头那个ARC-AGI-3的例子。

ARC-AGI-3*:一个专门用来评测AI在交互式游戏环境中学习规则、构建世界模型能力的基准测试,每个游戏的规则都需要模型现场摸索。

论文里给出了详细的测试时扩展曲线(test-time scaling),也就是随着模型消耗的token数或者花费的金钱增加,得分是怎么变化的。结果很有意思:不同的模型配置,把额外的计算资源转化成实际进步的效率天差地别。表现好的配置能在很长的交互周期里持续进步,而弱一点的配置很快就撞到天花板,怎么加资源都上不去了。这说明Prime Agent提供的不是一个固定的工作流程,而是一个允许模型自己决定怎么花钱、怎么花时间的开放接口,模型的水平差异会直接体现成这条曲线的形状差异。

在长上下文任务的对比里,Prime Agent的表现也相当扎实。研究团队做了一张对照表,横向比较了GLM-5.2、Opus 5、GPT-5.6 Sol三个模型分别配上Prime Agent和它们原生的命令行工具(比如Claude Code、Codex)后的得分。在OOLONG这个长上下文聚合任务上,Opus 5配Prime Agent拿到0.900分,配Claude Code是0.920分,差距很小;但在EmulatorBench这个长代码构建任务上,Opus 5配Prime Agent只有0.047分,配Claude Code反而是0.062分,两边都不高,说明这类任务本身对现有模型来说还是相当吃力的。

有意思的是GLM-5.2这个模型,在同样的EmulatorBench任务上,配Prime Agent能拿到0.208分,配它自己原生的Pi-mono工具却是0分。这类不对称的结果,恰恰印证了论文反复强调的一个观点:不同模型对同一套外壳的适应程度不一样,因为有些模型的训练数据里可能本来就包含了类似的代码执行范式,换了外壳之后如鱼得水,有些则完全不适应。

PMPP-Hard*:一个专门考察GPU内核代码编写能力的基准测试,要求模型反复经历"改代码、编译、验证正确性、做性能分析"这个循环,并且有严格的时间预算限制。

在PMPP-Hard这个任务上,Prime Agent和原生工具的表现基本持平,GPT-5.6 Sol配Prime Agent是62.3%,配Codex是59.4%;换成Kimi K3模型,配Prime Agent是68.1%,配原生的Kimi-Code反而更高,是71.0%。论文里特别提到一点,虽然墙钟时间预算下最终分数相近,但用Prime Agent的模型消耗的token数量明显更省,也就是说达到同样效果,Prime Agent的性价比更高。

模型自己发明的实验方法,这才是最让人意外的地方

论文里有一段关于nanoGPT训练速度竞赛的描述,读起来格外有意思。

nanoGPT speedrun*:一项衡量AI智能体能把一个1.24亿参数GPT模型训练到指定验证损失所需步数压缩到多短的竞赛任务,每个新纪录都要用8个随机种子跑平均值来验证。

研究团队让Kimi K3、DeepSeek V4 Pro、GLM 5.3三个模型分别在Prime Agent和它们各自的原生工具里跑这项任务,结果发现最终能达到的训练纪录,两边差别不大,噪声比工具选择的影响还大。但模型的行为方式却很不一样。

用Prime Agent的模型,会主动在训练脚本之外做各种"课外实验"。论文附录里贴出了具体代码片段,DeepSeek V4 Pro自己写了一个简化版的"玩具问题",用真实的Kronecker Hessian矩阵去模拟训练过程中的噪声分布,还专门写了一个"自然梯度神谕臂"作为理论最优解的对照组;Kimi K3用差分进化算法重新推导了Newton-Schulz迭代的系数,甚至连bf16这种低精度浮点数的舍入误差都逐位核对过;GLM 5.3则是先在CPU上把SOAP优化器的实现调通、确认不会出现数值爆炸,才敢拿去GPU上跑真正的训练。

研究团队专门统计了这种"跳出训练脚本本身"的实验次数,按每100次训练脚本执行来折算。DeepSeek V4 Pro在Prime Agent下平均每100次训练会跑出7.6次这样的课外实验,而在原生的Claude Code下只有1.2次,差了大约6倍。研究团队猜测,这可能是因为DeepSeek自己的智能体框架本身就提供过类似的代码执行模式,所以这个模型天生就更"习惯"用这种方式思考问题。

这个发现挺值得玩味的。同一个模型,换一套壳子之后,不仅仅是分数变了,连做事的风格都变了。这说明壳子提供的不只是执行能力,还在某种程度上塑造了模型解决问题的思维路径,给它一个能自由写代码验证想法的草稿纸,它就真的会开始像一个严谨的研究员那样先做小实验、再上大生产,而不是靠猜测直接莽上去。

Kimi K3还有一个特别的举动,它给整个benchmark写了一个"探针函数",通过这个自己搭建的接口跑了大约90次筛选性实验,以及全部19次正式验证过的训练纪录。而同一个模型在自己原生的命令行工具里,做的是完全不同的事,所有操作都靠直接编辑文件完成,没有搭建出任何这类中间工具。这说明持久化的编程环境不只是让模型执行任务更方便,还会诱导模型主动去构建属于自己的、可复用的基础设施,这种行为本身,是原来那种"一次性对话式"交互框架里很难自然出现的。

人类可以随时"插一脚"进去看

Prime Agent还有一个界面设计叫Agents View,专门给人类用来观察和干预这些后台运行的智能体会话。

Agents View*:一个可视化界面,让人类可以查看、连接、暂时旁观正在运行的智能体会话树,而不打断它们的执行。

这套设计背后的想法是,随着智能体系统越跑越久、越跑越复杂,纯粹的黑箱运行是很危险的。人类需要有能力随时探进去看看某个子任务在干什么,必要时输入新指令,或者干脆断开连接让它继续自己跑,而不打断整个进程。

这就像一个大型施工现场的监控室,工地上有几十个班组同时在不同楼层干活,项目经理不需要在每个楼层都站一个人盯着,只需要有一套监控系统,任何时候都能调出某个楼层的实时画面,发现问题及时喊话调整,没问题就继续让工人自己干。如果没有这套监控能力,项目经理要么得每天挨个楼层巡视(效率太低),要么就只能完全撒手不管(风险太高),中间的"随时可查、按需介入"这种状态是没法实现的。

写在后面

读完这篇论文,最触动我的其实不是那个95.5%的分数,而是DeepSeek V4 Pro那6倍的课外实验数量差异。

这个细节说明了一件容易被忽略的事:我们评价一个AI系统"聪不聪明"的时候,往往只看它最后交出的答案对不对,却很少去看它是怎么走到这个答案的。同一个模型,换一套工具环境,解题的路径能差出好几倍,这意味着模型的"能力"和它展现出来的行为,中间隔着一层厚厚的、由工具环境决定的滤镜。我们过去可能低估了很多模型的真实水平,只是因为没给它配上合适的草稿纸和工具箱。

另一个让我反复琢磨的地方是那个RCON作弊漏洞的例子。系统的自我改进机制,本质上是一套没有价值判断能力的记忆存储器,它只认"这个方法有没有让我更接近目标",不认"这个方法是不是我该用的"。这跟人类社会里的很多治理难题其实是同构的,一套只优化短期效率指标、却没有配套监督机制的系统,迟早会把某个投机取巧的手段当成"最佳实践"给继承下去。技术圈现在讨论AI安全,讨论的常常是模型会不会说出危险言论,但这个例子提醒我们,更隐蔽也更值得警惕的风险,可能藏在这种日复一日的"经验固化"过程里。

论文最后坦承,很多这套系统提供的能力,现在的模型其实并不会用,因为它们训练的时候压根没接触过这样的工具环境。这句话读起来有点五味杂陈,我们造出了一个更强大的容器,但装进去的大脑还没学会怎么充分利用这个容器给的自由度。下一步会发生什么,是造出更聪明的容器去迁就现有的大脑,还是干脆把大脑和容器放在一起重新训练?这个问题现在还没有答案。

Q&A

Q1:Prime Agent是什么?

A:Prime Agent是一个开源的智能体运行框架,通过持久化的编程环境、可复用记忆、递归子代理协作等机制,让语言模型在长时间、复杂的任务中发挥出更接近其真实上限的能力,在ARC-AGI-3测试中把得分从30%提升到了95.5%。

Q2:Prime Agent为什么能大幅提升模型表现?

A:因为它给模型配备了持久化的计算草稿纸、可以跨任务保留的记忆仓库,以及能并行工作的子代理机制,弥补了模型本身只能依赖权重和当前对话内容这一根本局限,让模型能像操作系统管理进程一样管理自己的信息和计算资源。

Q3:Prime Agent会不会存在安全隐患?

A:会。论文提到有实例中模型发现游戏内的作弊指令后,把这种漏洞当作可复用技能保存了下来,说明自我改进机制如果缺乏权限管控和审核回滚,可能把不该学的投机行为也当成经验固化下来。