打开网易新闻 查看精彩图片

9 月 20 日至 21 日,以“下一代物理智能前沿”为主题的 PAIR Conference 2026 在上海举行。会议由上海物理智能与机器人研究院举办,大会邀请来自高校、科研机构及产业界的多位专家学者参与,围绕下一代智算系统、下一代智能载体、下一代科学发现和下一代计算范式等方向展开讨论。

其中,“下一代科学发现”专题重点放在 AI 从辅助科研走向智能观测、自主实验之后,科学研究方法和科研体系可能发生的变化。在 9 月 21 日上午的专题论坛上,中国科学院院士鄂维南以《关于 AI for Science 发展战略的一点思考》为题展开了主题演讲。

鄂维南长期从事应用数学和科学计算研究,是国际上最早系统推动 AI for Science 的学者之一,研究涉及机器学习、分子模拟、材料计算等多个方向,并持续关注人工智能如何改变传统科学研究的方法和基础设施。

与通常围绕模型能力、自动化实验室或具体科研案例展开的讨论不同,他把问题进一步延伸到当前的科研基础设施和科研组织体系:如果 AI for Science 真正成为一种新的科研范式,我们需要建设什么样的基础设施?中国和美国正在形成怎样不同的技术路线?当 AI 大幅降低计算、实验和知识获取的门槛后,现有的科研体系又将发生什么变化?

图|鄂维南位于 PAIR 活动现场(来源:PAIR)
打开网易新闻 查看精彩图片
图|鄂维南位于 PAIR 活动现场(来源:PAIR)

在鄂维南看来,AI for Science 的发展可以分成两个层面。第一个层面,是越来越多科研和研发活动走向“工业化”,需要建立一套支撑大规模科研活动的新型基础设施;第二个层面,则是由生产力变化进一步推动科研“生产关系”的改变,包括打破学科之间、理论与实验之间、科研与产业之间的边界。后者也是他所说的 AI for Science“下半场”。

以下为鄂维南演讲内容,经编辑整理。

真正的新科研范式,需要一套新的基础设施

我们一直在说 AI for Science 会改变科研范式,但什么才算真正的范式变革?一个越来越明确的趋势是,未来相当一部分科研和研发活动,会逐渐走向工业化。

如果这一趋势成立,接下来就要面对几个非常实际的问题:我们能不能打造出这样的科研“工厂”?支撑它的软硬件技术是否已经成熟?当这种新的生产力出现以后,我们又需要建立一套怎样的科研体系来承载它?

除此之外,还有一个同样重要、但目前讨论相对较少的问题:未来的科研当然不可能全部变成“流水线工厂”,真正处在最前沿、能够重新定义一个领域的,仍然是颠覆性的原始创新。例如 ChatGPT 这样的工作,它的出现之后彻底重塑了人工智能的发展路径。所以我们同样需要去理解:颠覆性的科技成果究竟是通过什么机制产生的?我们该怎样保护和培育这种机制?这同样是未来科研体系必须面对的问题。

目前,从全球范围来看,推动 AI for Science 最主要的力量来自中国和美国,但两边的技术路线并不完全一样。

美国此前更多是通过一些标志性的重点项目来带动,比如 AlphaFold,以及材料结构预测等工作。这些工作非常重要,但它们更多体现为某一个具体科学问题上的突破,当时还没有形成一套覆盖整体科研全过程的基础设施体系。

美国的转折点是去年白宫提出的“创世纪计划”。这是他们第一次提出建设新的科研基础设施以推动整体科研范式的变革。与此同时,像 OpenAI、Anthropic 这样的企业也在加大对科学领域的投入。它们代表的路径是:依托通用基座模型不断提升科学研究能力,再与自动化、智能化的实验体系结合起来。

而在中国,我们从 2022 年开始提出并推动新的科研基础设施建设,核心包括四个部分:算力,模型、算法和软件,数据库和知识库,以及自动化、智能化实验室。

有了这样一套基础设施,科学家进入某个具体领域开展研究,感觉就会像开发者在安卓系统平台上开发手机应用。团队不需要每次都把所有基础能力重新建一遍,而是直接在公共基础设施之上做科研。这也是为什么我把它称为“平台科研”。

在此基础上,每个具体问题的研究可以通过垂直整合来完成:把底层理论、计算模拟、实验探索、中试放大一直到产业端的需求密切串联起来,形成一条完整的链条。现在,这种模式在国内已经跑出了一些雏形。

自动化实验室之外,计算仍然是关键

现在大家很重视自动化实验室建设,也很重视数据和文献的挖掘,但还有一个重要环节容易被忽视,那就是理论和计算。

自动化实验室解决的是执行和操作的自动化,它难以直接产生足够的新科学假设;文献中已有的数据也总是有限的。真正能够帮我们打破认知盲区、进一步提出新问题和新假设的重要能力,最终仍然主要来自理论与计算。

以材料和化学为例,最基本的计算工具之一,是描述原子间相互作用的分子动力学。我们很早就开始做神经网络表达的分子动力学势函数,后来王涵等人进一步提出大原子模型(DPA),希望构建出一套通用的分子动力学模型。这项工作从 2022 年开始坚持到现在。DPA-4 已经可以应用于有机分子、催化反应、复杂界面等不同场景,下一步的目标是真正走向材料设计。

但如果要把计算进一步推向“材料工艺设计”,坦率地说,目前还做不到。工艺所涉及的时间和空间尺度要大得多。过去几年,分子动力学的计算通量虽然已经提高了几个数量级,但距离真正从第一性原理出发去搞定材料组分和工艺设计,仍然有两到三个数量级的差距。这两三个数量级是一定要继续跨过去的。只有当这种计算工具真正成熟,我们才可能像设计房子一样去设计新材料和新分子,目前全球都还没有真正实现这一点。

至于已经受到广泛关注的自动化和智能化实验室,现在国内已经有不少布局,比如北京、合肥、苏州、厦门、深圳、宜宾等地,上海也有一些重点项目正在推进。虽然从整体规模和体系成熟度来看还有进一步发展的空间,但这无疑是未来三到五年非常重要的投入方向。

自动化实验室面临一个基本的技术卡点,那就是实验结果如何自动表征?比如在分子和材料研究中,核磁共振是非常核心的表征手段。过去几十年,这几乎完全依赖资深科学家的个人经验去阅读核磁谱来反推分子结构。如果我们要建真正的自动化实验室,这些环节必须算法化。

北大朱戎教授团队和深势科技合作做的 SpecXMaster 平台就是一个例子。这个工具在今年 3 月上线,目前已经有几千名化学家在使用,每个月能沉淀几万条反馈数据。它在相关任务上的解析能力已经达到较高水平,至少接近优秀博士生的水平。

这个案例也可以用来观察通用模型和专用科学模型之间的差异。Claude 此前也展示过读取核磁谱的能力。如果只提供纯粹的核磁数据和分子式,它此前的成功率其实很低;但如果把反应物等其它信息一起提供给模型,它的识别能力就会显著提高。

这正是通用模型的一个特点,当你提供的信息越丰富,它能够利用的上下文越多,综合表现就越好。相比之下,在输入信息比较有限、纯靠专业物理化学规律推断的场景下,专门针对科学任务训练的专用模型仍然具有明显优势。

某种程度上,这也反映出当前中美两边在技术侧重上的不同。中国团队更倾向于在重要的科研环节和一个个具体科学场景里,把专用工具和专业壁垒做深;美国第一梯队的大模型公司,则试图不断把基座模型本身的通用推理能力推向极致,用更强的底座去覆盖科学任务。过去这一年,Anthropic、OpenAI 等公司把相当一部分精力转向科学领域,也是沿着这个思路在走。

最困难的科学问题,取决于底层基座模型

由此延伸出来,中国 AI for Science 当前面临的一个核心隐患,依然是底层基座模型的能力。

尤其在面对最困难的任务时,我们与国际最先进的模型之间仍然存在差距。年初北大团队测试过国内外模型在最优化科研任务上的表现。当时国内外基座模型之间的差距还是很明显的。虽然目前国内基座模型的整体能力有了明显提升,但在触及最顶层难度的任务上,差距依然存在。这也是我们自己做科学基座模型过程中的一个深切感受。

去年我们花了一年时间研发面向科学领域的基座模型 Innovator,并在世界人工智能大会上发布。但在做完这个工作之后,我们越来越深刻地感觉到:如果只是拿现成的开源通用模型作为内核,在此基础上作微调或者叠加各种科学能力,这种意义上的“科学基座模型”在某种程度上可能是一个伪命题,因为它没有解决核心困难。

当然,这种做法不是没有任何意义。这种方法得到的模型对一般性科学问题也能取得不错的效果。但真正做前沿科研的人,最关心的往往是最难的那部分问题;而恰恰是在这些硬骨头上,底层推理内核的差距会被放大得最明显。所以最后没有太多捷径可走,必须把最底层的通用基座模型真正做好。

这里说“科学模型可能是伪命题”,并不是说不应该发展面向科学的模型,而是强调如果底座内核本身不够强,仅仅在上面堆叠科学数据,面对最深水区的科学任务时,天花板依然会受到严重限制。底层基座模型最终要能够解决最困难的逻辑与科学任务,这是目前最大的挑战之一。

第二个需要正视的风险来自高端科研仪器设备。我国相当一部分高端科研仪器过去依赖国外进口,这是我们构建科研基础设施时必须补齐的短板。国内这几年推进的速度很快,单纯从技术参数看,一些领域的差距已经没有过去那么大。目前更加突出的瓶颈在于市场应用和生态建设。只有让国产仪器真正进入主流实验室、被高频使用起来,整个硬件和算法的迭代闭环才能真正跑通。

AI for Science 的“下半场”:三个边界会被打破

当这些新的科研生产力逐渐建立起来之后,接下来就会进入我们所说的“下半场”,也就是科研体系本身的变化。我认为至少会出现“三个打破”:打破理论与实验之间的界限,打破学科与学科之间的界限,打破科研与产业之间的界限。

首先是理论、计算和实验之间的界限。我是做计算算法出身的,过去科研中常常遇到一个困惑——我们设计出了非常漂亮的计算方法,论文也得到了很高的学术认可,但真正面对实验场景,仍然有很大距离。

而在很多传统工程领域,这种界限早就被打破了。比如设计大桥、建筑或者飞机,绝大部分力学验证可以完全依靠仿真软件完成,我们不需要每设计一栋楼,都先建一座实验模型去看看它会不会倒塌。但在材料科学、化学和生命科学中,情况依然很不一样。

面对一种新药、一个新分子或者一种新催化剂,我们今天还无法仅仅依靠计算就足够可靠地完成设计任务。过去几年,算法能力已经提升了几个数量级,但距离真正指导实验和工艺,依然存在两到三个数量级的差距。我希望再经过两三年的努力,能够把这部分差距继续缩小,让计算和实验真正走到一起。

第二个需要打破的是学科之间的界限。以材料科学为例,国内有几个不同领域都在研究材料。一部分来自凝聚态物理,比如黄昆先生的研究领域;另一部分来自固体力学,比如清华大学黄克智先生代表的方向;还有一部分则来自更加正统的材料科学,比如师昌绪先生。

这些领域研究的对象其实都是材料,只是关注的时空尺度和具体问题不一样。传统材料学更多依赖实验、经验和数据,主要关注材料缺陷、位错、掺杂;凝聚态物理更多从量子力学、电子能带和声子谱等切入;固体力学则关注宏观的器件,例如其弹性变形和断裂。

过去我们习惯把这些方向划分为不同的独立学科,但如果真要解决一个实际的材料问题,就必须从最基本的能带、晶体结构,到介观的缺陷,再到宏观器件,这原本就是一个连续的过程。

从底层来看科学原本就是统一的,如果我们把科研最主要的手段归纳一下,无非就是理论计算与实验两部分,其主要理论工具和实验工具并不很多。不同学科真正的区别,往往只是所覆盖的时间和空间尺度不同。比如材料和化学研究在理论上会大量使用密度泛函理论和分子动力学,实验上依赖电镜和光谱;如果研究大气和海洋,各类湍流模型是主要理论工具,观测则依赖遥感和卫星。很多复杂问题根本无法被框死在单一尺度上,材料如此,大气湍流也是如此:宏观的大气动力学过程同样包含着微观的分子化学过程。

过去人类很难跨越这些尺度,是因为个人的学习经历、阅读文献的能力、做实验和计算的能力都是有限的。AI for Science 带来的一个重要变化,就是让这种能力提升了几个数量级,使我们跨越不同尺度和学科边界成为可能。所以我们现在对学生的要求应该是,面对任何一个实际问题,都应该设法切进去研究,而不是首先去问这个问题到底属于物理、化学还是生物。

第三个需要打破的是科研与产业之间的界限。我们先看两个典型例子:晶体管和锂电池。它们最初的基础发明都获得了诺贝尔奖,但从原始创新真正走向大规模产业化,都经历了数十年的时间。

锂电池的原型是在国外实验室发现的,但今天全球最大的产业链沉淀在中国。过去这是一种非常普遍的模式:科学发现首先在高校或实验室产生,之后经历漫长的工程放大过程,最终才进入产业。

周期之所以这么长,是因为从原理突破到工业落地之间,隔着海量的工程实践与优化。这些工作不是简单的重复劳动,它本身往往具有极高的科研难度,需要博士水平的科研团队长期浸泡在里面。

现在情况开始发生变化。随着各类 AI 智能体的介入,包括文献梳理、数据处理、论文撰写在内的大量科研任务,AI 已经能够完成得相当好。许多从原始创新到工程落地之间的中间环节,AI 也正在取得突破。这必然会倒逼我们思考:未来的科研体系究竟应该是什么样子?

一个极为重要的变化将是科研的“平权化”。未来 5 到 10 年,科研门槛有望大幅降低,创新的主体不再完全被传统高校和少数顶尖实验室垄断。一个有想法的个人或小团队,借助公共基础设施,完全有能力通过利用科研基础设施来实现自己的想法。

伴随这种平权化,科研经费的来源也会发生变化。除了政府和国家体系的支持,产业资本和市场化基金会发挥更大的作用,比如上海未来产业基金等已经在做这方面的探索。同时,知识产权交易平台、中试基地等转化设施也需要加速建立,让科研成果从提出到产业化之间有更顺畅的通道。

另一个变化,是需要更多地从产业视角来重新思考科研的组织方式。目前全球科研体系普遍存在一个共性问题是:在很大程度上它是一个由行政和学术主导的“计划经济”体系,科研成果的“生产”与“应用”是相互脱节的。科研人员的主要考核往往集中在发表论文上,至于论文发出来之后能不能用、能不能变成产品,通常不是现有评价机制最关心的事;而产业界则需要在海量论文里大海捞针,寻找可以落地的技术。

中国过去在经济改革中积累过非常宝贵的经验,其中之一就是设立“特区”,在原有体系之外用新的机制去探索新模式。科研体系未来同样需要类似的尝试,直接在现有体系内部推动全面重塑阻力较大,可以探索建立一些新型研发机构和公共科研平台,以解决实际产业问题为牵引,在体制机制上彻底打通研发与落地之间的鸿沟。

自由探索仍然是颠覆性创新的核心

最后,还有一个必须强调的问题,就是颠覆性创新机制的建立。

无论 AI 把科研工程化的效率推到多高、自动化做得多么完备,基于人类好奇心的自由探索,始终是产生颠覆性科技成果最核心的源泉,这一点必须得到坚决的保护与支持。但在今天这个节点上,我们也需要重新思考:什么才算真正意义上的“自由探索”?

如果仅仅把写出一篇普通的学术论文就等同于自由探索,这个门槛显然定得偏低了。真正能够打破原有认知、重新定义一个领域的创新,这样的成果从来都是极少的。因此,我们需要把自由探索的标准设得更高,需要加大力度去识别和支持那些真正敢于提出新问题、开辟新方向的研究。关于这方面的讨论只能留到以后了。

最后我说说个人的几个判断。一个是数学可能会经历一段“迷茫期”。随着人工智能在定理证明、符号推演和复杂数学问题上的能力不断提升,数学研究的工作习惯和研究方式,会受到很直接的冲击。

另一个是,人工智能背后的数理基础和基本原理,会成为下一阶段非常重要的主流方向。我们不能永远把模型做成一个知其然而不知其所以然的黑盒,不仅要把模型做得更大更强,更要从根本上理解它为什么能工作,进而建立起更清晰的理论指导原则。

与此同时,未来几年,科研资源的整合会变得越来越重要。高校和科研院所未必还需要每个团队都去重复建设属于自己的整套实验室,而应该更多走向公共基础设施的共建共享,提高设备和资金的使用效率。

随着整个体系的演进,过去单纯以论文为核心的单一评价机制会被逐渐打破,科研与产业的结合会越来越紧密,“唯论文”被打破之后,“能否真正创造价值”会成为越来越重要、越来越现实的标尺。

如果说 AI for Science 的上半场主要解决的是工具、算法、模型、数据和自动化实验室这些底座能力的建设,那么接下来的下半场,问题已经超出了技术本身。当一套全新的科研生产力建立起来以后,我们真正需要回答的,是我们该用什么样的科研组织体系来承载它。

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成