作者 | 研究团队
编辑丨ScienceAI
9 月 16 日,继此前自研虚拟细胞模型 OCOO 取得 SOTA 突破后,无界进化(INFevo)正式开放科研 AI Agent 工作台 Karl Workbench 的 Beta 内测。
Karl Workbench 专为真实的科研任务设计,它将研究意图、科学假说、数据、文献、分析工具和研究证据统一组织在同一个工作空间中,并完整保存任务执行轨迹与可复现产物。
在开放内测前,Karl Workbench 在科研 Agent 基准 SciAgentArena 的单细胞组学和空间组学复测中,综合得分均位列所有参评 AI 系统第一。在单细胞组学评测中,Karl Workbench 综合得分为 0.86,领先于 Hermes、STELLA(mem)、Codex、Claude Code 和 Biomni,并高于人类专家参考解的 0.80;在空间组学评测中,其综合得分为 0.70,与人类专家参考解持平,稳居所有 AI 系统榜首。
直击真实研究痛点:从单次问答到完整任务执行
Karl Workbench 解决的是大模型预测「之后」的工程落地问题。真实的组学研究不仅仅是生成一段代码,更涉及数据读取、质量控制、方法选择、代码执行与证据整理,任何一环的逻辑断裂都会导致结论失效。
为此,无界进化将系统接入了极具挑战性的 SciAgentArena。该基准是由耶鲁大学、Broad 研究所、哈佛大学和斯坦福大学等顶尖机构联合发布的科研 Agent 评测标准。它不考单个问答,而是直接输入接近真实研究流程的复杂任务,并以人类专家为参考解,对 AI 的预处理、方法选择、分析执行等步骤进行严格的「逐步核验(Step-wise Verification)」。
Karl Workbench 在 SciAgentArena 单细胞组学(A)与空间组学(B)评测中得分位列第一。每个系统两根柱分别为数据分析通过率与方法选择得分,横线为两者均值。带†标注的 STELLA(mem)、Biomni 和人类专家参考解数据引自 SciAgentArena 论文 Figure 4 的 step-wise 结果。由于论文未给出数值,相关得分依据图中色标逐格读取;每格为三个数据集均值。
复测结果显示,Karl Workbench 在单细胞组学评测中的数据分析通过率达到 1.00,方法选择得分高达 0.72;在空间组学评测中,其数据分析通过率同样为 1.00,且是同场唯一通过全部预处理步骤的 AI 系统。
值得注意的是,本次复测中 Karl Workbench 与 Hermes 均搭载 DeepSeek V4 Pro,Codex 使用 gpt-5.6-terra,Claude Code 使用 Claude Opus 5。在底层模型相同的情况下,Karl Workbench 不仅实现了关键超越,更在空间组学这种高复杂度的预处理环节拉开了身位。这表明基础大模型仅提供通用智能,而优秀的上下文组织、工具调用、过程验证与研究状态管理架构,才是决定系统能否稳定跑通科研流程的核心。科研 Agent 的竞争,已正式步入系统级架构的较量。
以 RSD 框架沉淀「科研复利」
基础大模型虽然能高效生成代码或总结文献,但在面对高维、高噪声的真实生物学数据时,极易出现步骤遗漏、逻辑断链和「幻觉」。更重要的是,单次调用的 AI 无法记住前序尝试中的「失败路径」,导致同样的错误在后续研究中反复发生。
Karl Workbench 能够登顶权威基准,其核心壁垒在于无界进化创新提出的递归科学发现(Recursive Scientific Discovery,RSD)框架。
如果说 AI 领域的 RSI(递归自我改进)旨在优化模型自身的能力;那么 RSD 关注的则是如何让科学发现过程从「自身历史」中学习。它将上一轮研究的结论、证据、失败路径及方法边界,保存为结构化的研究状态,直接用于约束和更新下一轮的假说空间与验证策略。
为了将这一理念转化为可用的基础设施,Karl Workbench 将 RSD 拆解为五层系统能力:
1.记录层:全量保存任务输入、数据版本、代码和参数,实现链路级的全景可追溯。
2.积累层:自动记录失败路径与被证伪的假说,将「错误」转化为约束条件,减少重复试错。
3.产物层:将关键结果封装为独立、可引用的研究产物,并严格关联底层数据与证据链。
4.监督层:内置审查机制,检验分析逻辑与置信度,同时始终保留人类科学家的最高决策权。
5.进化层:智能识别系统在不同任务中的成功路径与能力瓶颈,持续优化后续的任务规划。
五层结构并不是五项彼此独立的功能:记录形成可积累的研究历史,研究产物将历史带入后续任务,监督机制保证结果能够被检查,进化层再依据实际表现改善系统行为。
从科学假说到可复现的研究产物
Karl Workbench 隶属于无界进化旗下的科学发现平台 The Popper Project(TPP)。两者命名均致敬科学哲学家 Karl Popper—— 他提出,科学假说必须接受证据检验,并在持续的证伪中获得演进。
在 Karl Workbench 中,每个研究问题都独立沙盒化。科研人员定义目标、导入数据和文献后,系统会建立专属的任务上下文(Context)。
单独定义每次任务的context
任务完成后,系统不仅交付结论,还会生成可复现脚本。这意味着科学家可以将这段分析无缝带入其他计算环境重新运行,或保存至私有存储中。
所有轨迹与产物的留存
尤其值得关注的是,Karl Workbench 首次将「科学假说」本身纳入了可管理的研究资产。
假设成为附件资产
过去,假说仅存在于论文或科学家的脑海中;现在,研究人员可以将 TPP 中的假说直接拉入新任务,与自有数据结合进行验证。研究流程由此形成了一条清晰的闭环链路:
假说 + 研究目标 + 数据 → 分析代码 → 提取证据 → 更新假说
假说由论文、笔记和个人记忆中的研究线索,转化为可以调用、检验、更新和继续积累的研究对象。这使科学假说不再只存在于论文、笔记或个人记忆中,而可以与数据、代码和证据共同保存,并进入下一轮研究。
从细胞预测走向闭环科学发现:大幅缩短「假说 - 验证」周期
此前,无界进化发布的虚拟细胞大模型 OCOO-T 已在 Tahoe100M、Replogle 和 PBMC 三类公开基准中达到 SOTA,具备强大的化学药物、基因及细胞因子扰动响应预测能力,为药物发现、靶点研究、免疫与炎症研究、细胞状态调控和细胞命运设计带来了新的可能。
OCOO-T(蓝色实线) 在 Tahoe100M、Replogle 和 PBMC 三类公开扰动基准上均取得了业界最高水平(SOTA)
OCOO-T 与 Karl Workbench 共同构成了无界进化技术体系的核心双引擎:前者负责「底座预测」,为机制研究提供计算依据;后者负责「任务执行」,使假说能够与真实数据分析、证据沉淀持续衔接。研究团队可以在更大的候选空间中进行计算筛选,优先验证更具价值的方向,并持续积累模型预测与真实实验之间的反馈。
在此图景下,未来的生物医药研发范式将被重塑:以科研人员的专业判断为中心,AI 承担大规模的底层预测、流程执行和知识积累。研究团队可以在超大规模的假设空间中广阔筛选,优先验证高价值靶点。
随着虚拟细胞模型、科研 Agent 与自动化实验平台的进一步融合对接,一条从假说提出、计算预测、实验验证到认知更新的闭环正在成型。Karl Workbench Beta 版的开放,标志着 AI for Science 正在告别单点辅助工具时代,正式迈入能组织研究过程、维护证据链并持续产生「认知复利」的科研基础设施时代。
访问地址:https://thepopperproject.com/
OCOO-T 预印本:https://arxiv.org/abs/2606.12838
关于无界进化
北京无界进化科技有限公司(INFevo)致力于构建 AI 虚拟细胞模型和面向科学发现的智能研究系统。公司围绕自研 OCOO 模型、科研 Agent 与自动化细胞实验平台,探索从生物学建模、科学假说生成与验证,到实验反馈和成果转化的闭环技术体系。
无界进化重点关注抗衰老、神经退行性疾病、自身免疫疾病、代谢疾病和肿瘤等研究方向,致力于为新机制与新靶点发现、虚拟药物筛选、候选分子评价和临床研究提供新的计算与实验工具。
热门跟贴