打开网易新闻 查看精彩图片

4 小时,一个 AI 智能体能做出什么?

谢澎涛团队给出的答案是:独立处理一个真实科学任务,理解问题、分析数据、设计模型、写出代码,再通过训练结果反复修改方案。整个过程不需要人类研究者参与。

谢澎涛现任加州大学圣地亚哥分校(UCSD)电气与计算机工程系副教授,博士毕业于卡内基梅隆大学机器学习系,研究方向聚焦人工智能及其在生物和医疗领域的应用。

在此前的研究中,他带领团队开发了一个可以自动构建 AI 模型的 AI 智能体 AIBuildAI。用户提供任务描述和数据后,这套系统可以自主完成模型设计、代码生成、训练和调优,并在 OpenAI 推出的 MLE-bench 中排名第一。此后,项目从 AIBuildAI Agent 1 迭代到 2 和 2.5 版本。谢澎涛也与几位博士生成立了 AIBuildAI 公司,并完成了约 400 万美元的融资。

最近,团队又推出面向 AI for Science 的 AIBuildAI Science Agent,并将它放进 NatureBench 进行评测。NatureBench 包含 90 个来自 Nature 系列期刊论文的真实科研任务,涉及生命科学、材料、能源和物理等领域。智能体无法查看原论文及其方法,只能根据任务描述、数据和评价目标自行寻找解法,每项任务限时 4 小时。

根据团队提供的数据,Science Agent 最终位列 NatureBench 第一,排名超过 Claude Code、Codex 和 Gemini CLI 等通用编程智能体。在 90 个任务中,25.6% 的任务超过论文报告的最佳方法,57.8% 的任务达到或超过论文中的最高水平。

图 | 所有 90 项任务的结果(来源:受访者提供)
打开网易新闻 查看精彩图片
图 | 所有 90 项任务的结果(来源:受访者提供)

围绕 Science Agent 的最新进展、AI build AI 的能力边界及其对科研和 AI 行业的影响,DeepTech 与谢澎涛进行了一次交流。

以下是 DeepTech 和谢澎涛的对话:

4 小时,AI 能把科研模型做到哪一步

DeepTech:上次我们聊的时候,AIBuildAI 主要展示的是自动完成模型设计、代码生成和训练调优。这次推出 Science Agent,相比之前几版最大的不同是什么?

谢澎涛:这次的进展主要体现在两个方面。

第一,是从自动完成模型开发,进一步走向在真实科研问题上达到甚至超越人类最高水平。

上次我们更多展示的是,Agent 能够自主完成模型设计、代码实现、训练和调优,证明模型开发流程本身可以被 AI 自动化。这一次,Science Agent 又往前走了一步。在 NatureBench 的 90 个真实科研任务中,它不仅能够独立完成整个模型研发流程,而且在 57.8% 的任务上,达到或超过了相关 Nature 子刊论文中人类研究者已经取得的最高水平;其中有 25.6% 的任务,Agent 开发出的模型直接超过了人类此前发表的最佳方法。

这意味着,Agent 已经不只是能够替人完成模型开发,而是开始具备开发出超越现有人类最佳方案的模型的能力。

第二,是研发效率的大幅提升。

对于人类研究者来说,要开发一个达到顶尖水平的模型,通常需要经历文献调研、方法设计、代码实现、实验验证和反复调优等过程,整个周期往往需要数周甚至数月。而在 NatureBench 中,Science Agent 每个任务的时间预算只有 4 个小时,并且能够在没有人工参与的情况下,从头到尾完成整个研发流程。也就是说,它把过去以周甚至月为单位的模型研发周期,压缩到了以小时为单位。

DeepTech:能不能结合一个具体的科研任务,讲一下 Science Agent 是怎样自主完成整个模型开发过程的?

谢澎涛:可以。比如 NatureBench 中有一个任务,来自 2025 年发表在 Nature Computational Science 上的一项研究,主要是预测非编码变异对基因表达的调控效应。

对于这个任务,我们给 Science Agent 的输入仍然只有两部分:一是任务描述,告诉它输入和输出分别是什么;二是论文公开的训练数据。除此之外,不会告诉它应该使用什么模型、采用什么算法,后面的事情全部由 Agent 自己完成。

拿到任务以后,它首先会设计多个候选模型,然后由 Coding Agent 完成代码编写和 Debug。代码能够正常运行之后,它会开始训练模型、调整参数并进行实验。通常第一次得到的结果并不是最优的,这时 Agent 会根据实验结果重新调整模型设计,再修改代码、重新训练和验证。整个过程会不断迭代,直到找到性能更好的方案。

在这个任务中,它最终设计的模型会分别处理长距离和局部序列信息:对于远距离信息,它结合领域知识构建了一些位置、距离等特征;对于局部序列,则使用深度学习模型进行建模,再将不同部分的信息整合起来。最终,Science Agent 在这个任务上得到的模型,相比原论文中人类研究者开发的方法,性能提升了大约 14%。

所以这个案例比较直观地说明,Science Agent 做的并不是简单地调用一个现成模型或者自动写一段代码,而是能够自己提出模型方案、做实验、根据结果调整方案,再继续迭代,完成一个相对完整的模型研发过程。

DeepTech:NatureBench 的 90 个任务都来自已经发表的论文,因此训练数据本身是现成的。那如果面对一个全新的科研问题,Science Agent 所需要的数据从哪里来?

谢澎涛:现阶段,数据仍主要由人类科学家收集和准备,这与现在的科研流程比较接近。

通常确定研究问题之后,需要先准备数据。一类来自公开数据库或互联网已有资源,另一类来自实验室,通过湿实验获得。

有了任务和数据之后,才进入模型开发阶段,包括模型设计、代码实现、训练、调参和反复优化,这也是整个过程中比较耗时的一部分。

Science Agent 目前主要自动化的就是这一阶段。也就是说,人类科学家负责定义问题、准备数据,后续的模型研发交给 Agent 来完成。

DeepTech:在科研数据里,除了成功的结果,失败实验的数据其实也很重要。对于 Science Agent 来说,这些失败数据会被用于模型训练吗?

谢澎涛:会。如果是生物实验、湿实验产生的数据,那么无论成功还是失败,通常都需要纳入模型训练。

训练一个能够泛化的 AI 模型,需要同时有正样本和负样本。比如成功的实验结果可以看作正样本,失败的实验结果则可以作为负样本。模型只有同时学习这两类信息,才能逐渐识别什么情况下结果可能成立、什么情况下可能失败。

如果训练数据全部都是正样本,模型实际上很难学到完整的判断边界,后续的泛化能力也会受到很大限制。所以从模型训练的角度来看,失败的数据同样具有价值。

DeepTech:除了 NatureBench 的这 90 个任务,你们有没有用更大规模的任务来测试 Science Agent 的泛化能力?

谢澎涛:目前系统性的评测主要围绕 NatureBench 的 90 个任务展开。这些任务本身具有较高的多样性,覆盖不同学科和不同类型的科研问题。未来也可以继续从更多 Nature 系列期刊中收集新的任务进行验证。

比较重要的是,这 90 个任务对 Science Agent 来说都是此前没有接触过的新任务。评测时我们还关闭了搜索功能,它不能查找对应论文或参考论文中的方法,只能根据任务描述和训练数据,自主完成模型设计、实验和优化。

因此,如果它能够在这些不同类型的陌生任务上取得较好的结果,也说明它已经表现出一定的泛化能力。

图 | 按照科学领域划分评测结果(来源:受访者提供)
打开网易新闻 查看精彩图片
图 | 按照科学领域划分评测结果(来源:受访者提供)

DeepTech:在这 90 个任务里,有没有哪些类型的任务,Science Agent 的表现会特别好?

谢澎涛:一般来说,Science Agent 在目标明确、输入输出清晰,并且能够通过可微损失函数优化的任务上表现更好。比如非编码变异表达效应预测,本身就是一个比较标准的 AI 建模问题,可以通过损失函数和梯度下降不断优化。

相对而言,它在整数规划、动态规划等传统算法问题上表现会弱一些。比如 NatureBench 中推断转移性肿瘤迁移历史的任务,原论文采用整数规划和动态规划方法,目标函数不可微,无法直接通过梯度下降优化,因此对目前的 Science Agent 来说更有挑战。

DeepTech:NatureBench 对 Science Agent 的单个任务设置了 4 小时的时间限制。如果把这个时间放宽,它最终得到的模型性能还会继续提升吗?

谢澎涛:会。我们做过类似尝试。把时间限制放宽以后,一些原本在 4 小时内没有达到 SOTA 的任务,后来也能够达到。

不同任务需要的时间不一样。我们曾把部分任务的时间预算延长到 24 小时,让 Agent 有更多时间进行模型设计、实验和迭代,结果会进一步提升。

实际上,在真实科研应用中,并不一定要求模型必须在几个小时内完成。如果用一天甚至两天能够获得更好的结果,这个时间成本是可以接受的。NatureBench 设置 4 小时限制,更多是出于统一评测和控制计算资源的考虑;在实际应用中,这个限制完全可以放宽。

从模型开发到湿实验,还缺哪些环节

DeepTech:目前,Science Agent 实现的是模型开发环节的闭环,最终得到的结果还没有进一步进入实验室做湿实验验证。未来是否要把 Science Agent 接入自动化实验室,形成从模型开发到实验验证的闭环,你们有这样的计划吗?

谢澎涛:我们自己大概率不会做自动化实验室,重点还是把模型开发这一部分做好。

实际上,我们也不只聚焦 AI for Science。此前的 1.0、2.0 和 2.5 版本面向的是通用 AI 模型开发任务,Science Agent 则是在 2.5 基础上针对 AI for Science 场景进一步优化,核心目标仍然是交付性能尽可能好的模型。

模型完成之后,怎么接入具体应用和实验流程,我们更倾向于通过合作来推进。比如把 Agent 以 API 或技术模块的形式提供给合作方,再由他们接入自己的实验系统。

我们现在也在和圣地亚哥一家实验管理平台公司讨论合作。理想的流程是:Agent 根据已有数据构建模型并做预测,再进入实验系统验证,新的实验结果继续回流,用于下一轮模型训练和迭代,逐步形成“模型预测—实验验证—数据回流—模型迭代”的闭环。

所以,这个方向我们会通过合作推动,但自动化实验室本身并不是我们准备亲自去做的。

DeepTech:目前真正能够实现“干湿闭环”的团队还比较少。从你的经验来看,要把计算模型和自动化实验真正连接起来,最大的难点是什么?

谢澎涛:我觉得最大的难点还是在湿实验这一端。

因为湿实验发生在物理世界里,涉及真实设备、样品和实验操作,本身会存在很多不确定性。而且目前自动化实验还缺乏统一、标准化的流程,不同实验之间的差异非常大,包括样品怎么处理、数据怎么采集、设备怎么操作等,都可能完全不同。所以这一部分整体上还没有那么成熟。

相比之下,计算这一端已经相对清楚了。比如把任务描述和数据输入进来,Agent 可以构建模型,再利用模型进行预测。以药物研发为例,模型可以先筛选新的候选分子,再把筛选结果交给湿实验系统进行验证。

所以从整个闭环来看,我认为目前更大的不确定性还是在湿实验设备和硬件这一端。

DeepTech:现在行业里经常谈“AI build AI”。按照你的标准,一个系统至少做到什么程度,才能真正称得上“AI build AI”?

谢澎涛:真正的“AI build AI”与简单的代码生成或自动训练模型有本质区别。它不应该只是帮助人完成某一个开发环节,而应该能够自主完成整个 AI 模型研发闭环。

具体来说,至少需要具备四方面的能力。

第一,理解问题和目标。AI 需要能够理解用户想解决的问题,分析数据特点,明确模型需要达到的目标,而不是简单执行人类已经设计好的方案。

第二,自主设计模型和算法。面对一个新的任务,AI 应该能够探索不同的方法,自主设计模型架构和训练策略,而不是依赖人提前指定模型类型。

第三,自主完成工程实现和实验验证。包括编写代码、配置训练流程、运行实验、分析结果,并判断当前方案是否有效。

第四,持续迭代和优化。真正的模型研发并不是一次生成,而是不断发现问题、提出改进方案、重新实验,最终得到性能更好的模型。

所以,如果 AI 只是帮助研究人员写代码,或者在已有方案上自动调参,我认为更接近 AI 辅助开发。真正的“AI build AI”,应该是人只需要提供任务目标和数据,AI 就能够像一个 AI 工程师一样,自主完成从问题理解、模型设计到开发、实验和优化的全过程,最终构建出满足需求的高性能模型。

DeepTech:开发一个 AI 模型,需要确定问题、整理数据、设计模型、编写代码、训练测试,最后再投入使用。在这套流程中,现在最适合交给 AI 的是哪些工作?哪些事情暂时还离不开人?

谢澎涛:我认为目前最适合交给 AI 的,是从模型设计到训练优化这一整段模型研发过程。

当人已经确定要解决的问题并准备好相应数据后,AI 可以自主完成模型和算法设计、代码编写、训练测试、结果分析,并根据实验结果不断迭代优化。这些工作过去往往需要 AI 工程师或研究人员花费几周甚至几个月,现在已经有可能由 AI Agent 在很短时间内自主完成。

暂时还离不开人的,主要是模型研发的两端。前端是问题定义:要解决什么问题、什么目标真正有价值、应该收集什么数据,这些仍然需要人的专业知识和判断。后端则是模型的实际应用,包括模型是否可靠、如何部署到真实场景,以及安全、伦理和责任等决策,也仍然需要人来把关。

所以现阶段比较合理的分工是:人负责定义有价值的问题和最终决策,AI 负责中间大量复杂、耗时的模型研发工作。

DeepTech:如果未来 Agent 能够生成大量科学假设和候选药物,下游的湿实验验证能力还能跟得上吗?会不会反而成为新的瓶颈?

谢澎涛:下游验证肯定存在产能上限。比如一个实验平台一次只能验证 100 个候选,那么计算端要做的不是无限增加候选数量,而是尽可能提高这 100 个候选的质量。

比如原来 100 个候选分子里只有 3 个有效,如果通过更好的模型把它提高到 30 个,下游湿实验的成功率就会显著提升,同样的实验资源也能产生更大的价值。

所以,缓解下游验证压力的关键之一,是提高模型的预测准确率。同时,下游实验产生的新数据还可以持续反馈回来,用于下一轮模型训练和优化。

尤其在 AI for Science 中,很多实验成本很高、数据量有限,因此如何在小样本条件下把模型性能做好,同时保证鲁棒性和泛化能力,是我们目前比较关注的问题。

(来源:受访者提供)
打开网易新闻 查看精彩图片
(来源:受访者提供)

DeepTech:从早期的 AI 制药,到如今利用大模型驱动生命科学研究,作为从业者,你观察到的最大变化是什么?

谢澎涛:最大的变化是 AI 在生命科学中的角色正在从“辅助工具”转变为“科研伙伴”。

早期的 AI 制药更多是利用机器学习解决某一个具体环节,比如预测药物性质、筛选候选分子等。而随着大模型和 AI Agent 的发展,AI 开始具备理解复杂问题、自主设计方案、构建模型和迭代优化的能力,能够参与更完整的科研流程。

未来,AI 不仅会帮助科学家分析数据,更有可能帮助科学家提出方案、设计实验,并加速从计算发现到实验验证的整个过程。

AI build AI 离“AI 科学家”还有多远

DeepTech:你觉得现在的 AI 更多还是在人的既定框架里寻找更优答案,还是已经能够跳出人类给定的思路,提出新的技术路线?

谢澎涛:我认为现在的 AI 正在从“在人类划定的范围内寻找更好的答案”,逐渐走向“自主探索新的技术路线”。

过去很多 AI 系统,本质上是在一个由人定义好的空间里进行搜索和优化。比如人先确定使用什么模型、什么算法,AI 再帮助调参数、写代码或者提高性能。但现在的 AI Agent 已经开始能够自己提出模型和算法设计,通过实验验证这些想法,再根据结果不断调整甚至改变技术路线。

一个很直接的例子就是我们在 NatureBench 上的实验。我们给 Science Agent 的主要是科学问题、数据和评价目标,并不会告诉它应该采用什么模型或者沿着哪条技术路线去做。它需要自己设计模型和算法,完成代码实现和训练,然后根据实验结果不断提出新的方案、验证和改进。最终,在 25.6% 的任务上,它自主开发出的模型超过了原论文中人类研究者开发的最佳方法。

所以至少在 AI 模型研发这个领域,AI 已经不只是沿着人类预先指定的路线做优化,而是开始具备自主探索技术路线的能力。当然,目前这种探索仍然建立在人类已有的知识基础上,还不能简单理解为 AI 已经可以完全脱离人类知识、创造全新的科学理论。但从人告诉 AI 怎么做,到人只告诉 AI 要解决什么问题,由 AI 自己探索怎么做,我认为这是一个非常重要的变化。

DeepTech:现在行业经常关注底层大模型的能力。对于 AI build AI 而言,更强的大模型是否自然就会成为更强的 AI 开发者?

谢澎涛:总体来说,基础模型越强,Agent 的表现通常也会越好。但基础模型并不是决定 Agent 性能的唯一因素。即使使用相同的基础模型,不同 Agent 在 Benchmark 上的表现也可能有很大差异,这说明基础模型之外的 Harness,也就是整个 Agent 系统,同样非常重要。

对于 AIBuildAI 来说,关键能力之一是持续迭代和优化。因为 AI 模型研发本身就是一个反复试验、分析、修改和再训练的过程,而基础模型更多提供的是一次性的推理和代码生成能力。真正困难的是,怎样把这种能力转化为持续学习和优化,也就是 recursive self-improvement。

这需要在基础模型之外进一步搭建搜索、知识获取、模型设计、推理流程以及记忆和上下文管理等机制。所以,基础模型越强,Agent 往往也会更强;但仅靠基础模型还不够,还需要一套能够持续学习、实验和优化的 Agent 系统。

DeepTech:那现在有没有比较明确的指标,可以判断 Agent 自主设计出来的模型究竟有没有创新性?

谢澎涛:目前一个比较直接的指标,还是看它能否超过人类已经发表的最佳模型。

如果 Agent 能够从头设计一个模型,并最终在性能上超过人类目前最好的方法,通常说明它并不是简单复制已有方案。尤其是一些案例中,它并非基于现有模型进行调参、数据增强等局部优化,而是重新设计模型结构,并最终取得更好的结果。从这个角度来看,可以认为它具备一定的创新能力。

另一方面,也可以直接分析 Agent 最终设计出的模型,看它具体采用了哪些模块,这些模块是对已有方法的重新组合,还是形成了新的设计,以及它与原论文中的模型究竟存在多大差异。

DeepTech:随着 AI 开始自主构建更强的 AI,你认为这种能力会怎样改变整个 AI 行业的研发速度、人才结构和竞争方式?

谢澎涛:我认为这种能力会对 AI 行业产生非常深远的影响。

第一,研发速度会大幅提升。过去开发一个高性能 AI 模型,往往需要一个团队花几周甚至几个月不断设计、实验和优化。未来这些工作可以由 AI Agent 24 小时持续进行,把很多研发周期从“月”压缩到“天”,甚至“小时”。而当更强的 AI 又能够帮助开发下一代 AI 时,这个过程还可能进一步加速。

第二,人才结构会发生变化。未来可能不再需要大量工程师去完成重复的代码开发、训练和调参工作。人的价值会更多集中在提出重要问题、定义目标、提供领域知识,以及判断 AI 产生的结果是否真正有价值。一个很小的团队借助 AI Agent,也可能拥有过去一个大型研发团队的模型开发能力。

第三,竞争壁垒会从拥有多少 AI 工程师,逐渐转向谁拥有更强的 AI 研发系统。当底层大模型越来越普及之后,真正拉开差距的,是 Agent 能否持续积累实验经验、改进搜索和模型设计能力,并形成自我改进的闭环。

长期来看,我认为最大的变化是:AI 研发本身会逐渐从一个主要由人驱动的过程,变成一个由人定义目标、AI 大规模自主探索和迭代的过程。

DeepTech:在你看来,现在这些 Agent 能称得上真正的 AI 科学家吗?

谢澎涛:目前还不能。

以 Science Agent 为例,它现在主要负责模型研发这一环节,但完整的科学研究过程远不只是开发模型。前端的研究问题定义、研究方向选择,以及数据收集,无论是从公开数据库整理,还是通过实验获得,目前仍主要由人类科学家完成。

在后端,模型开发完成之后如何使用、如何验证结果,以及涉及的安全性、伦理性等问题,也仍然需要人来判断。

所以从完整科研流程来看,目前的 Agent 只是自动化了中间的模型研发环节,还不能称为真正的“AI 科学家”。

当然,现在已经有一些 Agent 在尝试向前后端延伸。例如在前端自主阅读文献、发现研究空白、提出新的研究问题,并从公开数据库或论文中自动获取数据,未来甚至可能自主安排实验、生成新的数据。

如果有一天,从提出问题、收集数据,到模型开发、实验验证和结果分析,都能够由 Agent 自主完成并形成完整闭环,那么它才更接近真正意义上的“AI 科学家”。

DeepTech:现在越来越多来自 OpenAI、Google 等公司的 AI 人才开始进入生命科学领域。如果把时间拉长到未来三到五年,你认为 AI 最先会深刻改变哪些科研领域?

谢澎涛:我认为未来三到五年,AI build AI 最可能率先改变那些高度依赖计算模型和数据的科研领域,比如生物医药、材料科学、化学、能源等。这些领域现在已经大量使用 AI 模型,但开发一个高性能模型仍然需要很多专业研究人员投入大量时间。如果这个过程能够被 AI 自动化,科研效率会有非常大的提升。

1.https://www.aibuildai.io/blog-naturebench

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成