打开网易新闻 查看精彩图片

作者 | 研究团队

编辑丨ScienceAI

9 月 16 日,继此前自研虚拟细胞模型 OCOO 取得 SOTA 突破后,无界进化(INFevo)正式开放科研 AI Agent 工作台 Karl Workbench 的 Beta 内测。

Karl Workbench 专为真实的科研任务设计,它将研究意图、科学假说、数据、文献、分析工具和研究证据统一组织在同一个工作空间中,并完整保存任务执行轨迹与可复现产物。

在开放内测前,Karl Workbench 在科研 Agent 基准 SciAgentArena 的单细胞组学和空间组学复测中,综合得分均位列所有参评 AI 系统第一。在单细胞组学评测中,Karl Workbench 综合得分为 0.86,领先于 Hermes、STELLA(mem)、Codex、Claude Code 和 Biomni,并高于人类专家参考解的 0.80;在空间组学评测中,其综合得分为 0.70,与人类专家参考解持平,稳居所有 AI 系统榜首。

直击真实研究痛点:从单次问答到完整任务执行

Karl Workbench 解决的是大模型预测「之后」的工程落地问题。真实的组学研究不仅仅是生成一段代码,更涉及数据读取、质量控制、方法选择、代码执行与证据整理,任何一环的逻辑断裂都会导致结论失效。

为此,无界进化将系统接入了极具挑战性的 SciAgentArena。该基准是由耶鲁大学、Broad 研究所、哈佛大学和斯坦福大学等顶尖机构联合发布的科研 Agent 评测标准。它不考单个问答,而是直接输入接近真实研究流程的复杂任务,并以人类专家为参考解,对 AI 的预处理、方法选择、分析执行等步骤进行严格的「逐步核验(Step-wise Verification)」。

打开网易新闻 查看精彩图片

Karl Workbench 在 SciAgentArena 单细胞组学(A)与空间组学(B)评测中得分位列第一。每个系统两根柱分别为数据分析通过率与方法选择得分,横线为两者均值。带†标注的 STELLA(mem)、Biomni 和人类专家参考解数据引自 SciAgentArena 论文 Figure 4 的 step-wise 结果。由于论文未给出数值,相关得分依据图中色标逐格读取;每格为三个数据集均值。

复测结果显示,Karl Workbench 在单细胞组学评测中的数据分析通过率达到 1.00,方法选择得分高达 0.72;在空间组学评测中,其数据分析通过率同样为 1.00,且是同场唯一通过全部预处理步骤的 AI 系统。

值得注意的是,本次复测中 Karl Workbench 与 Hermes 均搭载 DeepSeek V4 Pro,Codex 使用 gpt-5.6-terra,Claude Code 使用 Claude Opus 5。在底层模型相同的情况下,Karl Workbench 不仅实现了关键超越,更在空间组学这种高复杂度的预处理环节拉开了身位。这表明基础大模型仅提供通用智能,而优秀的上下文组织、工具调用、过程验证与研究状态管理架构,才是决定系统能否稳定跑通科研流程的核心。科研 Agent 的竞争,已正式步入系统级架构的较量。

以 RSD 框架沉淀「科研复利」

基础大模型虽然能高效生成代码或总结文献,但在面对高维、高噪声的真实生物学数据时,极易出现步骤遗漏、逻辑断链和「幻觉」。更重要的是,单次调用的 AI 无法记住前序尝试中的「失败路径」,导致同样的错误在后续研究中反复发生。

Karl Workbench 能够登顶权威基准,其核心壁垒在于无界进化创新提出的递归科学发现(Recursive Scientific Discovery,RSD)框架。

如果说 AI 领域的 RSI(递归自我改进)旨在优化模型自身的能力;那么 RSD 关注的则是如何让科学发现过程从「自身历史」中学习。它将上一轮研究的结论、证据、失败路径及方法边界,保存为结构化的研究状态,直接用于约束和更新下一轮的假说空间与验证策略。

为了将这一理念转化为可用的基础设施,Karl Workbench 将 RSD 拆解为五层系统能力:

1.记录层:全量保存任务输入、数据版本、代码和参数,实现链路级的全景可追溯。

2.积累层:自动记录失败路径与被证伪的假说,将「错误」转化为约束条件,减少重复试错。

3.产物层:将关键结果封装为独立、可引用的研究产物,并严格关联底层数据与证据链。

4.监督层:内置审查机制,检验分析逻辑与置信度,同时始终保留人类科学家的最高决策权。

5.进化层:智能识别系统在不同任务中的成功路径与能力瓶颈,持续优化后续的任务规划。

五层结构并不是五项彼此独立的功能:记录形成可积累的研究历史,研究产物将历史带入后续任务,监督机制保证结果能够被检查,进化层再依据实际表现改善系统行为。

从科学假说到可复现的研究产物

Karl Workbench 隶属于无界进化旗下的科学发现平台 The Popper Project(TPP)。两者命名均致敬科学哲学家 Karl Popper—— 他提出,科学假说必须接受证据检验,并在持续的证伪中获得演进。

在 Karl Workbench 中,每个研究问题都独立沙盒化。科研人员定义目标、导入数据和文献后,系统会建立专属的任务上下文(Context)。

打开网易新闻 查看精彩图片

单独定义每次任务的context

任务完成后,系统不仅交付结论,还会生成可复现脚本。这意味着科学家可以将这段分析无缝带入其他计算环境重新运行,或保存至私有存储中。

打开网易新闻 查看精彩图片

所有轨迹与产物的留存

尤其值得关注的是,Karl Workbench 首次将「科学假说」本身纳入了可管理的研究资产。

打开网易新闻 查看精彩图片

假设成为附件资产

过去,假说仅存在于论文或科学家的脑海中;现在,研究人员可以将 TPP 中的假说直接拉入新任务,与自有数据结合进行验证。研究流程由此形成了一条清晰的闭环链路:

假说 + 研究目标 + 数据 → 分析代码 → 提取证据 → 更新假说

假说由论文、笔记和个人记忆中的研究线索,转化为可以调用、检验、更新和继续积累的研究对象。这使科学假说不再只存在于论文、笔记或个人记忆中,而可以与数据、代码和证据共同保存,并进入下一轮研究。

从细胞预测走向闭环科学发现:大幅缩短「假说 - 验证」周期

此前,无界进化发布的虚拟细胞大模型 OCOO-T 已在 Tahoe100M、Replogle 和 PBMC 三类公开基准中达到 SOTA,具备强大的化学药物、基因及细胞因子扰动响应预测能力,为药物发现、靶点研究、免疫与炎症研究、细胞状态调控和细胞命运设计带来了新的可能。

打开网易新闻 查看精彩图片

OCOO-T(蓝色实线) 在 Tahoe100M、Replogle 和 PBMC 三类公开扰动基准上均取得了业界最高水平(SOTA)

OCOO-T 与 Karl Workbench 共同构成了无界进化技术体系的核心双引擎:前者负责「底座预测」,为机制研究提供计算依据;后者负责「任务执行」,使假说能够与真实数据分析、证据沉淀持续衔接。研究团队可以在更大的候选空间中进行计算筛选,优先验证更具价值的方向,并持续积累模型预测与真实实验之间的反馈。

在此图景下,未来的生物医药研发范式将被重塑:以科研人员的专业判断为中心,AI 承担大规模的底层预测、流程执行和知识积累。研究团队可以在超大规模的假设空间中广阔筛选,优先验证高价值靶点。

随着虚拟细胞模型、科研 Agent 与自动化实验平台的进一步融合对接,一条从假说提出、计算预测、实验验证到认知更新的闭环正在成型。Karl Workbench Beta 版的开放,标志着 AI for Science 正在告别单点辅助工具时代,正式迈入能组织研究过程、维护证据链并持续产生「认知复利」的科研基础设施时代。

访问地址:https://thepopperproject.com/

OCOO-T 预印本:https://arxiv.org/abs/2606.12838

关于无界进化

北京无界进化科技有限公司(INFevo)致力于构建 AI 虚拟细胞模型和面向科学发现的智能研究系统。公司围绕自研 OCOO 模型、科研 Agent 与自动化细胞实验平台,探索从生物学建模、科学假说生成与验证,到实验反馈和成果转化的闭环技术体系。

无界进化重点关注抗衰老、神经退行性疾病、自身免疫疾病、代谢疾病和肿瘤等研究方向,致力于为新机制与新靶点发现、虚拟药物筛选、候选分子评价和临床研究提供新的计算与实验工具。