允中 发自 凹非寺
量子位 | 公众号 QbitAI
2026年夏天,注定是自进化AI的历史一刻。
当海外NeoLab还忙于靠叙事拿下数亿美元融资时,一家中国团队用连续三篇论文,交出了自进化AI领域第一份全栈答案。
它就是EverMind,由盛大集团孵化,延袭当年创新院研究基因。
其实回顾中国互联网史,盛大创新院的存在几乎算得上「异类」。
2008年,陈天桥在盛大集团内部创立该机构,其定位不是做产品、也不追KPI,就是纯粹地探索技术前沿。
这在那个流量为王、变现至上的互联网时代,其实是一种极为罕见的企业内研究文化。
彼时,这种模式在中国企业界几乎是开创性的。
十余年后,时代的底色已经从互联网切换到了AI。
而盛大集团的战略布局,也已经集中到更为前沿的脑科学和人工智能方向——
近三年来,盛大All in AI,在原有风险投资体系基础上,通过内部孵化机制在全球范围内广泛吸引顶尖AI人才,陆续孵化出多支专注于不同AI方向的研究型团队。
EverMind,正是其中一支。
如果说盛大创新院开创了中国企业内研究型组织的先河,那么EverMind的出现,则是这一基因在AI时代的延续与升华。
也正因如此,这支团队从一开始便选择了一条在商业上看似“最难”、在技术上却“最根本”的路:
解决AI的长期记忆问题,并在此基础上,探索AI的自进化之路。
放至2026年的AI版图上,这个模式有了一个更为响亮的名字——NeoLab(新一代AI实验室)。
海外团队纷纷下注,NeoLab浪潮狂飙
NeoLab这个词,最早是被用来描述那批从OpenAI、Google DeepMind、Meta等顶级AI机构出走、押注前沿技术方向独立创业的研究型团队。
他们的共同特征是:面向下一代AI技术、研究驱动和长期主义。
2026年,这股浪潮已经汹涌到了无法忽视的程度:
比如,前Salesforce首席科学家Richard Socher与前Meta FAIR科学家总监田渊栋联合创立的Recursive Superintelligence(RSI)。
其在团队不足30人、尚无任何产品的情况下,拿到了6.5亿美元融资,估值高达46.5亿美元,并随即与AWS签署了4.1亿美元的多年算力合作协议。
DeepMind的AlphaGo之父David Silver带着Ineffable Intelligence以51亿美元估值杀入战局。
Engram以6亿美元估值完成了9800万美元A轮融资,Adaption Labs以10亿美元估值拿到了5000万美元种子轮,Core Automation的估值目标直指40亿美元……
这些团队押注的核心命题,都指向同一个方向:如何让AI在部署后不再是一成不变的静物,而是能够通过自我迭代实现持续进化。
这个方向,在学术上被称为递归自我改进(Recursive Self-Improvement),在产业上被称为自进化AI(Self-Evolving AI)。
然而,当我们仔细审视这些估值惊人的NeoLab时,会发现他们大多仍停留在单点突破的理论探索阶段:
- RSI:初步分享了先进的理念和路线设计,但尚未公布具体方案或成果;
- Engram:专注于参数化权重记忆,但缺乏脚手架层的灵活进化机制;
- Adaption Labs:主攻推理时适应,但没有长期技能沉淀体系;
- Core Automation:方向最为接近,但也还没有公开的论文和开源生态。
就在海外团队还在各自的细分领域摸索时,EverMind悄然完成了一件令人瞩目的事:
连续发布三篇重量级论文,从技能层、脚手架层到模型权重层,系统性地给出了一套完整的自进化AI技术答案。
一次对话,两个入口:当RSI遇上EverMind
在深入这三篇论文之前,有一个细节值得单独记录。
今年四月,EverMind主办了一场名为“记忆起源”(Memory Origins)的Hackathon活动。
在这场活动上,出现了一位特别的嘉宾——Recursive Superintelligence(RSI)的联合创始人之一,田渊栋。
田渊栋在活动上分享了他对AI记忆工作的深度理解,而彼时RSI融资的相关进展尚未披露。
在活动结束后,田渊栋与EverMind负责人邓亚峰共同接受了「硅谷创见汇」播客的采访,两人就AI行业的发展走向和记忆相关技术的前景进行了深入对谈。
在这次对话中,邓亚峰提出了一个核心判断,也透露了EverMind技术战略的脉络:
从长期记忆,结合持续学习,走向自我进化是下一代AI的核心技术路线。
这句话值得细细品味。
记忆,是Agent积累经验的载体;自进化,是把经验转化为能力跃升的路径。
没有高质量的记忆,自进化就是无源之水;没有自进化作为目标,记忆就只是一个越来越大的档案馆。
EverMind从EverOS(记忆操作系统)到Raven(自进化Agent框架),再到三篇自进化论文所构建的完整技术栈,正是这一判断的系统性实践。
田渊栋与邓亚峰在同一个舞台上的相遇,某种程度上也是一个隐喻:
当海外最顶尖的自进化研究者,与中国最具研究深度的记忆AI团队相遇,他们发现彼此正在从不同的入口,攀登同一座山峰。
为什么「自进化」重要且难?
在深入EverMind的技术细节之前,还需想清楚一件事:为什么“让AI自我进化”既是必答题,又是一道难题。
传统大语言模型一旦完成训练并部署,能力就被冻结了,不再随使用而增长。可人类智能最迷人的地方恰恰相反——每一次交流、每一次思考,我们都在悄然进化。
下一代AI也理应如此:能够通过持续学习不断变得更聪明,而不是停在出厂那一刻。
而且这条路正在变得现实。
随着大模型能力的跃升,越来越多的案例表明,“AI自主改进AI”已经从设想走向可行,在某些环节甚至开始超越人类专家。
一旦AI能够稳定地自我改进,随之而来的很可能是一场生产力的跃迁。
但要真正做到这一点并不容易。业界通常有三条路径,每一条都横着一道难关。
脚手架(Harness)的自我改进,是第一道关卡。
一个Agent的实际表现,不仅取决于模型本身,更取决于包裹在模型外围的「脚手架」——提示词、注入的知识、运行时控制逻辑等。
让模型自己修改这些代码看似简单,真正的难点却在于如何避免过拟合:模型自我生成的反馈往往充满噪声,一个看似有效的修改,可能只是针对特定测试集的过拟合,换个场景就会导致灾难性崩溃。
技能(Skills)的规模化管理,是第二道关卡。
当Agent把成功经验固化为可复用的技能文件,技能数量会爆炸式增长,那么如何管理这些碎片化、冗余、质量参差不齐的技能?又如何在一个数十万量级的技能库中,精准检索出当前任务真正需要的那几个?
这类工程问题长期被学术界忽视,却恰恰是产品能否落地的关键。
模型权重(Weights)的训练信号分配,是第三道关卡。
在最底层的模型训练阶段,同策略自我蒸馏(On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段。
但传统OPSD在处理长序列推理时,会把相同的监督权重均匀分配给每一个生成步骤,完全忽略了错误发生的时序上下文。这就像长跑时,无论你在起跑摔倒还是在终点前摔倒,教练的惩罚都一模一样。
如此粗颗粒度的信号分配,严重拖累了模型的学习效率。
EverMind的三篇论文,正是分别瞄准这三道难关,各自给出了严谨的解法。
HarnessBank:让Agent学会安全改写「脚手架」
在实际部署中,模型权重往往是冻结的,修改Agent外围的Harness成为了提升性能的最直接手段。
EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(https://arxiv.org/abs/2607.13683)一文中,提出了一套全新的框架:
它能够让Agent自主诊断失败并重写自己的运行逻辑,同时从根本上解决了自我改进中的过拟合问题。
这套框架的核心创新在于将“提出变更”与“归因变更”彻底分离。
在过去的研究中,模型既当运动员又当裁判,自己写代码自己评估,极易产生幻觉式的性能提升。
而在EverMind的方案中,语言模型只负责诊断失败原因并提出补丁(Patch),所有的采样、测量和显著性检验全部交由确定性的代码逻辑来控制。
这一设计确保了每一个被系统认可的性能提升,在统计意义上都是绝对可靠的,而非测量误差或随机波动。
更有创新性的是其引入的装备基因库(Harness Gene Bank, HGB)机制。
传统的自进化系统往往以“任务”为键(Key)来存储改进,这极易导致系统只学会了如何解决特定的几道题,换一个场景便原形毕露。
EverMind则将每一份高性能脚手架以“WHERE × WHY”(改动作用在哪个环节、又是为何被引入)作为语义坐标存档,并支持通过故障诊断进行“重新发明”,或跨单元进行“机制重组”,防止搜索过程陷入崩溃或原地打转。
这种设计引入了强大的抗过拟合归纳偏置——系统学到的不是“如何解决这道题”,而是“如何修复这类病理”。
为了从大量候选后代脚手架中高效挑出真正有效的改进,团队还设计了分级装备筛选(Gated Harness Screening)机制,用有效性、激活、配对显著性、增益四道顺序闸门层层过滤,兼顾了评估成本与结果的可信度。
实验结果证明了这一设计的有效性。
团队默认以Qwen3.6-27B作为任务Agent、Claude Opus 4.8作为进化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七个多样化基准上评测,并与GEPA、DGM(Darwin Gödel Machine)两种当前最先进的自进化方法对比。
结果显示,在冻结任务Agent权重的情况下,HarnessBank在全部七个基准上取得了5.1%到15.4%的一致性能提升。
同时所有增益均通过了配对显著性检验(z≥1.96),证明这些提升在统计意义上绝对可靠,而非测量误差或随机波动。
论文中还有一个极具启发性的发现:
跨模型实验证实,这些性能提升来自模型特异性的自进化过程,而不是存在某个放之四海而皆准的“万能脚手架”。
获胜的补丁追踪的是模型的主导“病理”,而不是模型的大小或家族。
也就是说,当你更换一个不同的基础模型时,主导病理会改变,对应的最优脚手架也会随之改变;但同样的病理-补丁匹配关系,会在不同的模型家族中重复出现。
这意味着,EverMind构建的这套“诊断-归因”循环机制,是一种可以跨模型迁移的元能力,证明了AI for AI的技术可行性。
SkillCorpus:10万技能库背后的工程与科学
如果说Harness的自进化赋予了Agent重写逻辑的能力,那么“技能”(Skills)则是Agent沉淀经验的具体载体。
在EverMind的Raven框架中,内置了高达10万项开箱即用的技能。
这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(https://arxiv.org/abs/2607.15557)。
随着开源社区中技能文件(如Skill.md格式)的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均。
EverMind团队构建了一个名为SkillCorpus的框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。
这个过程堪称一场浩大的数字淘金。
团队从爬取的大约82.1万个原始技能中,通过多阶段多维度策略过滤,最终精选出96401个高质量技能。
为了管理这些技能,他们建立了一个包含16个类别的分类法,并从实用性(Utility)、鲁棒性(Robustness)和安全性(Safety)三个维度进行了严格的质量控制。
仅仅有库还不够,关键在于检索。
EverMind配合这个庞大的语料库,微调了一套专门的检索与选择技术栈,确保Agent在执行任务时能够精准匹配到相关的技能。
SkillsBench、GDPVal和QwenClawBench三个基准测试中的端到端评估显示,自研的Raven Harness集成SkillCorpus后,Agent在所有基准上均获得了稳定的性能提升,其中在SkillsBench上的提升最大,达到了7.5个百分点。
通过深入的运营分析,团队还识别出了技能带来的增益边界——
覆盖边界(技能库是否覆盖了任务所需的知识)和Harness边界(Agent的脚手架是否能有效调用技能),这为未来如何进一步优化技能检索和应用指明了方向。
这篇论文不仅是对Raven 10万技能库的技术解密,更是业界首个关于“经过策展和检索服务的社区技能库如何在真实Agent任务中发挥作用”的端到端系统性研究。
更进一步,技能并非一入库就固定不变。
无论是人工编写的技能,还是AI自动生成的技能,EverOS都能依据任务执行的成败经验对其持续打磨。
用得好的被强化、被复用,用得差的被修正、被淘汰。
技能库因此不是一份静态清单,而是一个随任务不断自我进化、越用越强的资产,这也正是技能沉淀归属于任务层的原因所在。
DASH:让模型看清哪里出了错
自进化的最深层,是模型权重的自我迭代。
EverMind的最新论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》(https://arxiv.org/pdf/2608.06243v1),展示了其在底层算法上的深厚功底。
传统的同策略自我蒸馏(OPSD)存在一个致命的时间盲区:
它对所有局部散度(即学生与教师的差异)分配相同的系数,完全忽略了错误发生的时间顺序和上下文。
EverMind的研究团队通过对大量真实推理轨迹的分析,发现了一个关键现象:在一个推理序列中,局部散度值的大小与未来散度的演变之间,存在极弱的关联。
这意味着,用同一个系数来处理所有时间步的散度,本质上是在用一把尺子量所有不同形状的错误,必然导致监督信号的严重失真。
为了解决这一问题,EverMind提出了DASH(Divergence-Adaptive Supervision Horizons)。
DASH的核心思想是将每个局部蒸馏信号与序列级均值之间的差距,转化为一个自适应的传播门(Propagation Gate),然后利用这些门控制向后的多步聚合。
当一个时间步的局部散度高于序列均值时,说明这里是一个高风险分叉点,DASH会打开一个更大的传播门,让这个时间步的监督信号向前传播更远;反之,传播门收窄,避免无关紧要的步骤干扰整体学习。
实验结果令人印象深刻。
在AIME 2024、AIME 2025和HMMT 2025三个极具挑战性的数学推理基准上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三个模型规模上均取得了所有对比方法中的最高分。
在Qwen3-1.7B上,DASH将三个基准的平均得分从vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,从65.00提升至66.40。
更重要的是,DASH不需要引入任何额外的教师或学生前向传递开销,这意味着这种性能提升几乎是免费的。
EverMind的自进化框架全景
△EverMind的自进化之路(四层框架)
在长期记忆领域已经贡献了数篇ACL、KDD等顶会高质量论文,并取得开源库1.8万star后,EverMind继续分享对自进化演进的研究成果——
将自进化的完整路径,概括为一个从任务层到元改进层的四层递进体系。
上述三篇论文构成的技术栈,与EverMind内部的产品和研究框架之间,存在着精密的映射关系:
1、任务层:
任务层是最直接的进化层次,进化在单次任务中即时发生。
优化对象是单次任务的执行质量,既包括记忆的提取与回写,也包括技能(Skills)的即时沉淀与复用;经验来源是 Context、Trace 与用户反馈,更新动作是即时回写,验证方式是结果与反馈。
这一层的能力复利是“记得更牢、用得更顺、单次任务做得更好”,价值定位是沉淀任务级、可复用的记忆与技能资产。
这正是EverOS与SkillCorpus所覆盖的核心场景。
2、脚手架层:
脚手架层(Harness)优化对象是Code与Policy,即Agent外围的运行逻辑与控制策略;经验来源是Eval与Reflection,更新动作是脚手架的版本迭代,验证方式是Agent Evals复盘。
这一层的能力复利是“更会执行”,价值定位是可复用行为资产的持续积累。
这正是Raven框架与Self-Evolving Harness论文所对应的工作。
3、模型层:
模型层优化对象是模型本身,经验来源是高价值轨迹、偏好与失败样本,更新动作是LoRA与端侧模型的验证后灰度,验证方式是离线集加灰度测试。
这一层的能力复利是“更准、更省”,价值定位是个性化的专属模型能力。DASH论文正是这一层的核心算法支撑。
4、元改进层:
元改进层是整个框架最令人兴奋的顶层。
优化对象是Evaluator、Data与Training Recipe本身,经验来源是多轮实验与Benchmark,更新动作是优化“提出—选择—验证”的整个循环,验证方式是版本门槛加评测体系。
这一层的能力复利是“下一轮进化更快、更可靠”,价值定位是让改进能力本身也持续升级。
这个四层框架的深刻之处在于,它把自进化拆成了四个层层递进又彼此支撑的环节,并为每一层都配备了具体的技术路径与验证机制。
它不是一张空洞的愿景图,而是一个有工程细节、有学术支撑的完整路线图。
其实在今年4月,团队就率先提出了针对Agent自进化的评测基准EvoAgentBench,当月在Hugging Face同类benchmark上下载量第一。
这是一套用于衡量智能体从既往执行中提取并迁移能力效果的评测方法,为技能沉淀、脚手架迭代和模型优化提供统一、可比较的验证框架。
结合三篇论文从技术、脚手架到模型权重的系统性探索,EverMind已将自进化能力建设由方法研究延伸至评测体系,形成更完整的技术闭环。
对比海外坐标系,EverMind走到了哪一步?
要理解EverMind这套完整技术栈的领先性,我们不妨将目光投向海外那些估值令人咋舌的NeoLab。
Recursive Superintelligence(RSI)提出了宏大的“自动化AI研究闭环”理念,并拿到了6.5亿美元融资和AWS的4.1亿美元算力合作协议。
其第一阶段目标是训练一个具备“5万名博士”能力的系统来自动化AI科学研究本身。
然而,RSI目前仍处于纯研发阶段,尚无成型的产品或框架落地,其公开结果仅限于在GPU内核算法优化基准上超越了人类两年的优化记录。
Engram以6亿美元估值完成了9800万美元A轮融资,其核心技术是基于稀疏记忆模块的参数化权重记忆(如LoRA微调)。
Engram在降低推理成本和解决灾难性遗忘方面做出了出色工作,但其路径过于依赖底层权重的更新,缺乏在Agent脚手架(Harness)和外部技能库层面的灵活进化机制,且需要白盒访问模型权重,这在实际部署中是一个重大限制。
Adaption Labs(估值10亿美元)主攻无梯度推理时适应,试图通过动态解码和适配器组合来消除微调和提示词工程。
这在思路上与EverMind的Harness自进化有相似之处,但Adaption Labs缺乏如SkillCorpus这样庞大且经过策展的外部经验沉淀体系,也没有在底层训练算法上进行深度优化。
Core Automation(估值目标40亿美元)由前OpenAI研究副总裁Jerry Tworek创立,其旗舰项目Ceres专注于持续学习模型,目标是将训练数据需求降低100倍。
这是与EverMind方向最为接近的项目,但Core Automation目前仍在早期研发阶段,缺乏EverMind这样完整的技术栈和开源生态。
相比之下,EverMind的独特之处在于其“三层并发”的战略纵深。
它没有陷入「参数化记忆」与「非参数化记忆」的非此即彼的争论,而是通过EverOS(非参数化长期记忆)、Raven(Harness自进化)和DASH(底层权重训练优化)构建了一个全栈生态。
更重要的是,EverMind坚持开源优先,通过在GitHub上积累的超过1.2万颗Star(同期mem0为7千),正在迅速建立起类似Android的底层开发者生态护城河。
属于中国NeoLab的时刻到了
再往前,EverMind团队相信:
下一代AI,必然是一个能记住用户偏好、越用越聪明的AI。
以长期记忆累积经验,以持续学习改进模型,真正走向AI的全栈自我进化,将是这一代AI最重要的技术路线。
这条路线一旦被打通,无论是数字世界里的Agent、物理世界中的具身机器人,还是整个AI for Science领域,都将被深刻改变。
在互联网时代,盛大创新院曾是中国企业内研究文化的先行者,被后来的互联网及各领域巨头纷纷效仿;在AI时代,EverMind也正在成为中国NeoLab浪潮中最具研究深度的代表之一。
仅仅一年间,团队就在长期记忆与自进化领域产出9篇高质量论文,其中数篇被ACL、KDD等顶会录用。
这意味着EverMind的自进化不只是一个工程化产品,更有扎实的底层技术与严谨的学术支撑:
DASH让模型在训练时“看清自己错在哪里”,Self-Evolving Harness让Agent在运行时安全地重写自身逻辑,SkillCorpus让Agent的成功经验被规模化地沉淀与复用。
三者合一,构成了一个从「感知错误」到「修改逻辑」再到「沉淀记忆」的完整自进化闭环。
但这条路,EverMind并不想独自走完,团队诚挚邀请各领域的伙伴与之同行,一起共同构建AI长期记忆的基础设施,把持续学习与自我进化推向科学、具身、金融、智能硬件等更广阔的场景。
在定义「数字生命」下一个形态的道路上,中国的研究型团队,已经来了。
至于更精彩的部分,才刚刚开始。
HarnessBank论文链接:https://arxiv.org/abs/2607.13683
SkillCorpus论文链接:https://arxiv.org/abs/2607.15557
DASH论文链接:https://arxiv.org/pdf/2608.06243v1
热门跟贴