把 Opus 5 带到 ARC-AGI-3 上 95.5% 成绩的 Prime Agent,现在有了正式技术报告。报告标题为《Prime Agent: A Self-Improving RLM Harness》,发布在 arxiv.org 上,编号 abs/2608.23552。
核心机制是记忆层级
报告指出,这套系统的关键不在单一模型能力,而是一套记忆层级机制。模型权重和活跃上下文位于底层,上面是一个持久的 IPython 会话,再往上是基于磁盘存储的历史记录、技能和提示词库。模型不是把状态压缩掉,而是用代码在这些层级之间移动状态。
这种设计改变了长上下文任务的处理方式。长输入不再被简单塞进上下文窗口,而是作为变量留在 REPL 环境中。代理可以随时搜索这些变量、对它们做变换,把长上下文工作从“阅读理解问题”变成“信息管理问题”。
从压缩到可检索
传统做法里,上下文一旦变长,模型往往需要把信息压缩成摘要,过程中容易丢失细节。Prime Agent 的思路是把原始信息保留在磁盘和会话里,让模型通过代码去定位、提取和改写。这样,模型不需要一次性“读完”所有内容,而是按需调用。
报告没有把这项成果描述成通用人工智能的突破,而是把它定位为一个自改进的 RLM 框架。ARC-AGI-3 的 95.5% 是当前可见的具体结果,但技术报告的重点放在机制本身:状态如何在权重、上下文、会话和磁盘之间流动。
对长上下文工作的影响
如果长上下文任务可以被拆成信息管理问题,那么很多依赖超长上下文的场景就有了新的实现路径。代理不再被动承受上下文窗口的限制,而是主动把信息放到可搜索、可变换的存储层里。这对需要处理大量文档、代码库或历史记录的任务来说,提供了一种不同的工程思路。
目前报告刚发布,更多实现细节还需要从论文中进一步读取。但至少有一点已经明确:Prime Agent 的成绩背后,是一套明确可描述的机制,而不是单纯堆参数或调提示词。
热门跟贴