近期,全球顶尖 AI 实验室正在密集释放一个信号:AI 正在从帮助人类完成任务,走向参与自身的研发与改进。
9 月,OpenAI 宣布已经实现「自动化 AI 研究实习生」的阶段性目标,并计划在 2028 年 3 月前打造真正的「自动化 AI 研究员」。OpenAI 首席科学家 Jakub Pachocki 同期发表长文,讨论了递归自我改进(Recursive Self-Improvement,RSI)的发展前景。9 月 21 日,OpenAI 又进一步将自动化 AI 研究员以及持续改进 AI 研发能力,列为下一阶段的重要战略方向。
OpenAI 于 2026 年 9 月 21 日发布官方战略声明,将自动化 AI 研究员和递归自我改进列为下一阶段的重要目标
另一边,Anthropic 也公布了一组引人关注的数据:截至今年 8 月,Claude 已经在约26% 的内部 AI 研发工作中承担主导角色,越来越多原本由研究人员完成的研发任务,开始交由 AI 在人类监督下执行。
从 OpenAI 到 Anthropic,RSI 正从遥远的技术设想,进入全球顶尖实验室的核心研发议程。AI 不再只是解决外部问题的工具,也开始参与推动自身能力的发展。
但这条持续进化的道路,最核心的关键在于:
AI 如何让过去的探索与试错真正成为下一次进步的基础,而不是每次面对新任务都从头开始?
记忆是支撑 Agent 持续自我改进的关键基础。它让每一次探索留下的不只是任务结果,还有能够被后续任务继承和复用的经验,使 Agent 的能力提升有机会跨越单次任务,在持续积累中不断进化。
01 |从经验积累到持续进化:记忆如何支撑 RSI
要让 Agent 在持续执行中不断提升能力,关键是让经验能够跨越单次任务:从过去的探索中沉淀有效方法,在新的任务中准确调用,并根据执行结果不断修正和优化。其中,记忆写入与检索承担着两个相互衔接的关键环节。
记忆写入需要从复杂执行轨迹中识别有效方法、失败结论及其适用条件,让过去的任务真正留下可复用的经验;记忆检索则需要根据新的任务需求,准确找到适用的历史方法与关键证据,避免经验遗漏和错误迁移。
更进一步,任务反馈还能够反过来检验经验的实际价值。通过持续更新记忆内容,并将有效反馈用于记忆基础模型训练,推动记忆自身的能力提升,形成经验积累与 Agent 改进相互促进的过程。
02 |记忆的学习与进化:让 Agent 从经验中持续变强
围绕 Agent RSI 中经验积累、跨任务复用与持续改进的需求,MemoraX 构建了以经验学习、经验迁移和反馈优化为核心的记忆能力体系,通过高质量记忆数据构造、动态记忆组织与基于真实任务反馈的优化,持续训练记忆基础模型,让 Agent 从历史经验中不断学习改进决策与执行。
从任务中学习:让经验积累成为可优化的模型能力
Agent 任务执行的过程中结果验证与策略调整会源源不断产生新的经验。成功的决策为后续任务提供可复用的方法,经过验证的失败结论则帮助 Agent 排除无效方案、减少重复试错。但经验的价值往往要在后续任务中才能体现,准确概括过去,并不意味着能够有效支持未来。因此,记忆学习的过程不仅需要识别值得保留的经验,还要保存其验证依据、环境约束与适用条件,避免经验被遗漏或误用,远非简单的信息摘要与压缩能够解决。
针对这一挑战,MemoraX将记忆写入建模为面向未来任务收益的可学习策略,持续建设覆盖环境构建、数据采集、样本构造与规模化 Agentic RL 训练的完整体系。在可交互、可验证的任务环境中,采集执行轨迹、记忆使用记录与验证反馈,构造关联写入决策及后续使用效果的训练样本;再结合后续任务的完成质量、执行效率与重复试错情况设计奖励信号,优化记忆写入策略。这一过程使模型的优化目标从信息提炼的准确性,进一步延伸到记忆对后续任务质量、执行效率与重复试错的实际影响,学习更有利于未来任务的记忆写入策略。
从经验中迁移:让历史经验指导新的任务
经验能够被保存,并不意味着它能在新任务中发挥作用。面对不同的任务目标、环境约束与执行阶段,Agent 需要准确识别适用的历史方法,避免无关信息干扰和经验的错误迁移。
为此,MemoraX 将记忆内容与访问结构解耦,根据当前任务动态调整记忆访问入口和关联关系,让相同的历史信息能够适应不同的使用需求。
在检索层面,进一步通过模型训练学习当前任务需求与历史关键证据之间的匹配关系,结合细粒度证据识别与相似记忆消歧,提高关键经验的定位能力,区分 “主题相关” 与 “证据正确”。
在经验使用环节,MemoraX 结合当前任务状态与执行进展,将历史积累的通用经验转化为具有明确目标、操作约束和验证标准的行动指导,并随任务阶段动态调整,让历史经验真正参与 Agent 的决策与执行。
从反馈中进化:让执行结果持续优化记忆能力
在 RSI 的持续迭代中,历史经验并非始终有效。新的任务既可能验证已有方法,也可能暴露其局限。如何利用执行反馈判断经验的真实价值,并据此不断优化记忆,是持续自我改进的重要环节。
其中的核心挑战是Memory Credit Assignment(记忆贡献归因):长程任务可能调用多条历史经验,但哪些真正影响了 Agent 的决策,哪些只是被读取却未发挥作用?即使最终任务成功,如何判断不同记忆的实际贡献,仍然是一个需要解决的问题。
围绕这一挑战,MemoraX 将记忆版本、实际使用记录与任务执行反馈建立关联,追踪历史经验是否真正参与了 Agent 的行动,以及使用后的任务表现与验证结果。在此基础上,持续评估并迭代已有记忆,让有效经验得到保留和强化,并根据新的任务反馈,及时修正不再适用的经验。
这些真实反馈也为记忆基础模型的持续训练提供了数据基础和优化信号,使记忆的改进从内容层面的更新,进一步延伸到记忆模型对经验价值与记忆策略的学习。
03 |从经验积累到能力提升:MemoraX 的多场景 RSI 实践
对于 Agent RSI,更值得关注的不只是某一次任务取得了多好的结果,而是历史经验能否被不断积累、修正,并在后续任务中持续产生价值。
围绕这一过程,在长程复杂 Coding 、金融分析、复杂数学推理三类任务中,分别验证了经验的持续迭代、跨任务迁移与反馈优化能力,同时进一步验证了记忆如何推动 Agent 在长程任务中的质量与效率提升。
(1)长程复杂 Coding:从经验迭代到复杂工程能力提升
长程复杂 Coding 实验在通信、金融、物流等5 大行业,13 项工业级系统开发任务中,累计进行了 78 次开发运行,总开发时长超过 300 小时,单次最长超过 12 小时。最终,MemoraX 记忆增强方案通过率提升 20%+,同时主 Coding Agent 的累计 Token 消耗合计减少 20%+。
从经验积累到递归改进:记忆的自我迭代之路
针对传统静态记忆难以在任务执行中持续积累和优化经验的问题,MemoraX 团队提出了Memory Model–Driven RSI(记忆模型驱动的递归自我改进)方法:通过自研记忆模型与 Agent 系统协同,由专用记忆模型负责从 Agent 执行轨迹与在线反馈中提炼、更新程序性记忆,并由 Agent 系统将记忆应用于实际任务,形成经验提炼、任务应用、效果验证与记忆更新的闭环迭代机制,使有效经验能够不断积累、优化并指导后续任务。在长程 Coding 任务构成的训练用例中,经过多轮记忆迭代优化,程序性记忆的质量提升超过 10%。
带着反复迭代后的经验,挑战 335 小时的复杂工程开发
当积累下来的经验脱离原来的学习任务,面对新的工程挑战时,还能发挥多大的作用?
为此,将已经积累的经验用于全新的复杂工程开发任务。在 13 项复杂软件工程任务中,累计进行了 78 次开发运行,总开发时长超过 335 小时,单次最长超过 12 小时。这些任务远不止简单的代码修改,而是涉及复杂业务逻辑、跨模块依赖和大量测试的真实工程挑战。
最终,通过率提升 20%+,同时 Coding Agent 的累计 Token 消耗合计减少 20%+。
其中,AccessSentinel 是一个具有代表性的高难案例。Agent 需要构建一套完整的企业级权限控制系统,并确保严格的安全约束
在记忆模型的帮助下,历史经验不再停留于静态的信息参考,而是能够随着任务状态变化,持续参与 Agent 的执行与验证。从开发启动后第 43 分钟到第 2 小时 30 分钟,记忆在不同关键节点主动提供针对性的指导:
- 设备权限撤销时,不仅要禁止设备再次登录,还要确保之前已经登录的账号无法继续访问系统。
- 安全策略恢复旧版本时,既要保留历史记录,也要防止已经取消的权限被意外恢复。
- 批量处理申请时,先检查所有申请是否符合要求,只有全部通过才能统一执行,避免出现一部分成功、一部分失败的情况。
在测试中,三次运行的平均通过率相对提升 45%+,而主 Coding Agent 累计 Token 消耗减少了 66%+。
(2)复杂金融分析:从证据积累到自主持续改进
金融研究需要从大量分散材料中形成完整、可靠的分析判断。除了找到相关数据,Agent 还需要在复杂上下文下,准确理解主体、时间和统计口径,建立不同证据之间的关联,避免因信息遗漏或口径混淆而影响最终结论。
MemoraX 关注两个相互衔接的问题:如何让证据支撑完整回答,以及如何利用回答中的问题,反过来改进证据的保存与检索方式。为此,MemoraX 基于金融领域权威基准 FinRank 开展实验,该基准覆盖制药、油气和汽车等行业 22 家美国上市公司真实财报,涵盖大量跨公司、跨周期的复杂金融数据。围绕这些任务,MemoraX 利用任务反馈持续优化记忆组织与检索,形成 “执行 — 反馈 — 记忆改进 — 再执行” 的 RSI 迭代闭环。经30 余次记忆模型和金融分析系统的协同迭代,最终证据链召回率接近 100%,相比于 CodeX 任务完成准确率提升 20%,成本降低了近 98%。
从找到数据,到组织能够支持判断的证据
以某大型制造企业的财务分析任务为例,任务相关证据分散在包含连续三年财务报表、供应商披露和风险说明的大量相似行业材料中。仅凭关键词或语义相似度,容易找到主题相关、却不属于目标企业或报告期的内容;仅保留摘要,又可能遗漏数值口径和风险成立的条件。
针对此,MemoraX 首先将上下文材料转化为结构化记忆,并根据回答反馈迭代调整记忆组织方式,面向金融问答场景,逐步形成兼顾数值精确、口径对齐与来源可追溯的记忆模型输出表征;检索时,再围绕当前问题关联调用这些证据,把库存现状、采购结构和潜在风险放在一起分析。这种组织方式兼顾了金融任务对数值准确、口径一致和来源可追溯的要求。
MemoraX 最终任务完成准确率较 Codex 对照提升近 20%。此外,按实际 API 用量统计,该方案成本相比于 Codex 对照方案降低了近 98%,在取得更高通过率的同时,显著降低了调用费用。
从回答反馈到策略迭代:让记忆改进 “如何保存、如何找回”
MemoraX 根据任务反馈,针对证据遗漏、关系混淆和引用冗余,不断探索记忆的信息选择与组织方式,并在训练任务中持续积累关联写入决策、记忆内容与后续使用效果的交互样本,用于优化记忆模型。训练后的模型再参与新一轮任务,其执行反馈继续用于改进写入策略和后续训练,形成任务交互与模型优化相互促进的 RSI 循环。在这一过程中,模型逐步涌现出适应金融场景的记忆表征特性:将关键数值与适用条件关联保存,区分不同主体、报告期和来源,并建立事实与原文证据之间的对应关系。经过36 轮 RSI 迭代,MemoraX证据召回率达到 96.49%,任务准确率从 33.33% 提升至 73.33%。
对于需要长期跟踪财报与公告的研究者,同一批材料构建的记忆可以服务于不同问题,摊薄前期投入;后续分析中的反馈,又能继续修正记忆内容与使用策略。让答案更完整、让使用更经济、让经验能够持续积累,共同构成了 MemoraX 在复杂金融任务中的实践价值。
(3)复杂数学推理:从经验反馈到求解策略自迭代
在高难度数学推理实验中,MemoraX 进一步探索了利用历史经验与验证反馈,支持 Agent 在复杂问题中持续修正推理、优化求解策略的能力。在 IMO (International Mathematical Olympiad) 难度的组合优化难题中,Agent 经过约4 小时持续求解、600+ 次模型调用,最终找到了经过验证的21 块矩形最优解。相比较 OpenAI Codex 方案,求解时间降低 13%,成本降低 98%。
从失败证明到最优解:在反馈中持续改进推理
Matilda 16×16 是一道 IMO 级别的高难度组合优化问题:要求使用尽可能少的矩形覆盖 16×16 网格中的 240 个方格,同时保证每行、每列恰好留下一个空洞。仅空洞位置就存在约20.9 万亿种排列可能。难点不仅在于找到可行解,更在于证明不存在使用更少矩形的方案。
面对这一挑战,Agent 围绕构造搜索、形式证明、精确建模与独立审计持续协作。系统最初找到 27 块、23 块的候选构造,但关于 23 块全局最优性的论证被独立审计否决。
MemoraX 能够持续积累先前的候选方案、推理过程与验证反馈,记忆基模从成功轨迹提取有效改进经验,将失败经验转化为后续调整求解策略的参考:
- 记忆自纠错:从错误结论到记忆修正。独立审计否决了 23 块的错误最优性证明,推动 Agent 重新审视已有结论,并将“可行解不等于最优解”的验证反馈用于修正记忆,避免后续推理重复相同错误。
- 策略自优化:从记忆更新到方法改进。基于记忆基模所提炼的此前候选方案与验证反馈,指导 Agent 调整建模方法,将空洞位置与矩形边界约束统一纳入求解搜索,先后找到 22 块、21 块的更优方案。
- 记忆再迭代:从结果验证到持续优化。Agent 通过逐步检查与调用工具进行精确求解,最终确认答案的最优性,并将新的验证结果反馈记忆基模完善求解记忆构建,为后续类似问题提供参考。
Matilda 16×16 问题的 21 块矩形最优铺法。黑色方格为空洞,不同颜色区域为矩形瓷砖
这展示了 Agent 在复杂数学任务中的持续迭代能力:历史经验不再只是静态的推理记录,而是能够结合新的验证反馈,持续参与后续求解策略的调整。
从记忆出发,走向持续进化的 Agent
MemoraX AI(忆纪元)由前华为决策与推理实验室主任、大模型算法实验室主任、智能决策方向首席专家郝建业创立,聚焦下一代可学习、可演化的 Agent 记忆模型。
团队自主研发的基于 Agentic RL 技术的记忆模型在全球权威记忆榜单获得冠军,被麻省理工科技评论等国内外媒体广泛报道和关注。团队的记忆解决方案在编程、医疗、金融、安全、智能家居等行业头部企业广泛落地应用,是华为云 / 腾讯云战略合作伙伴。
如今,团队正进一步深入基于记忆基模的 RSI,让 Agent 从积累和复用经验,走向持续学习与自我进化,进一步夯实在 AI 记忆领域的领先优势。同时,加速多场景落地应用,推进面向 B 端产业和 C 端产品的记忆模块标准化研发与规模化商业化。
结束语
Agent RSI 的关键,不只是让 AI 在单次任务中表现得更好,更在于让每一次执行都能成为下一次能力提升的基础。成功的方法、失败的经验与适用条件,通过长期记忆得以积累,并在新任务中转化为可复用的行动指导;新的执行结果又反过来推动经验更新、记忆策略优化与记忆基础模型的持续学习。
MemoraX 正在探索的,是记忆与 Agent 自我改进相互促进的双向演进路径:一方面,让记忆为 Agent RSI 提供持续积累、跨任务迁移的经验基础;另一方面,让真实任务中的执行与反馈不断反哺记忆自身的学习与进化。
当每一次任务都能留下经验,每一次反馈都能推动改进,Agent 的能力提升就不再局限于单次执行,而有机会成为一个持续积累、自我演进的过程。
热门跟贴