医药工业“十五五”规划把创新药摆在核心位置,从靶点发现到临床转化的全链条都在寻求更快、更准的研发工具。AI正从靶点发现到分子设计全面渗透研发流程。
但再先进的设计,最终都绕不开一个底层问题:分子在真实环境中怎样工作、化学键如何变化,才是决定其功能的关键。对抗体药物,这关乎构象变化和质子化状态如何影响分子识别与结合;对酶,则关乎底物如何反应、键如何断裂与形成。
分子结构只给线索,要解释这些过程必须追踪原子间不断变化的相互作用——而这正是过去十几年卡住计算化学的死结,不只是算不准,是根本算不动。分子之心的新成果,第一次让接近量子力学精度的反应性模拟,在完整蛋白体系和单张GPU上跑通。
近日,分子之心团队关于QuantaMind的研究发表于《Science Advances》。他们自主研发的QuantaMind是一个基于物理原理的机器学习力场(MLFF,简单说就是用AI学出来的原子间相互作用模型)。
首次在单张GPU上,它把含17,792个原子的PETase(一种能降解PET塑料的酶)体系完整催化循环跑了6纳秒,精度接近DFT(密度泛函理论,一种高精度量子化学计算方法)的参考结果。
根据分子之心公布的最新进展,QuantaMind可以在单张GPU上以接近DFT的精度,实现十万原子级复杂生物体系数百纳秒的反应性模拟。
我把论文读了一遍。下面不翻译摘要,只说两件事:它真正跨过了哪道坎,以及这件事对行业意味着什么。
它跨过了哪道坎
分子动力学的逻辑很简单:每步算一次每个原子受多大力,按牛顿方程往前推,推几百万步就是一条轨迹。
量子力学计算电子结构,能描述键的断裂和生成,准,但计算量巨大,慢得让人想放弃。
经典力场用经验公式近似原子间作用,每一步的计算量相对较小,能跑几万原子、微秒级的轨迹,但参数是固定的,预先规定了化学键的连接关系,碰到化学反应直接抓瞎。
为了兼顾两者,研究者常用QM/MM(量子力学/分子力学分区)方法:反应中心用量子力学算,周围环境用经典力场算。这让复杂体系的反应研究成为可能,但选多大的量子区、边界怎么过渡,本身就是一门手艺,还可能引入边界误差。
机器学习力场理论上两头都占,可实际用起来有两个老毛病:一是长期稳定性差,模拟跑着跑着就崩了。能量和温度突然飙到不合理的数值,整条轨迹直接作废;二是训练域外可靠性不足,碰到训练集里没覆盖的化学体系,预测精度就明显下降。
QuantaMind要解决的就是这两个毛病。
它的意义不在于又一个更准的MLFF,而在于第一次让基于物理原理的建模,能同时兼顾反应性、长时间稳定运行和计算效率,在复杂生物体系中(十万级原子规模也正好对应一个全长抗体-抗原复合物的尺度)捕捉反应的底层机理,并且仅需单张GPU即可运行。
三个设计选择
论文技术细节很多,真正值得行业外读者记住的是三个关键做法。
1.把反应现场当训练核心。
大多数MLFF的训练数据来自平衡态构型,就是蛋白在水里待着的样子。可化学反应偏偏发生在远离平衡的地方:键在拉长、在断、在重组。训练集里没有这些构型,模型到了反应区域就是瞎猜。
QuantaMind直接塞了三个过渡态数据集、共5,286个过渡态构型进去,覆盖不同类型的催化反应路径。它解决的是一个基础问题:要模拟反应,模型得先认识反应发生时的分子状态。
论文还特意交代,这些数据最初是为别的独立研究项目生成的,不是为这篇论文挑的。这点我反而更信,专门挑过的数据集,过拟合的嫌疑就大了。
图1:QuantaMind在三个过渡态数据集(TS1–TS3)上的精度提升。左:过渡态构型示意;右:加/不加过渡态数据时,能量与力的预测误差对比。
2.让模型自己生产训练数据。
再大的训练集也不可能预先覆盖所有生物体系。QuantaMind采用迭代训练流程:先用模型跑MD(分子动力学模拟),从轨迹里挑出它不熟悉的构型,用DFT补算能量和力,再回填训练集微调。
论文用PETase酰化步骤演示,从轨迹里抽226个构型补数据后,PETase测试集误差明显降了,其他测试集也没掉。
这是从demo走向工具的关键一步:承认模型会在分布外表现不稳,然后给一条自我迭代的流水线。
3.完整反应体系的统一处理,告别QM/MM分区。
MLFF天然对全体系一视同仁,但能在包含完整蛋白的17,792个原子体系中以接近DFT的精度长时间稳定运行,才是真正的门槛。
PETase模拟中全部原子由MLFF统一处理,没有量子区和经典区的人为边界——传统QM/MM最头疼的选区大小、边界衔接这些全靠经验又容易引入误差的问题,被直接消掉了。
当然,是否分区不单独决定精度,模型靠不靠谱最终要和量子化学参考计算及实验结果对比。
它验证了什么
水体系中,QuantaMind复现了Grotthuss“接力式”质子跳跃、抓到纯水自发电离、估计了酸碱中和速率,三项均与实验吻合——真能在动态模拟里看到化学键生灭。
图2:水中质子扩散,最大体系24,001原子,Grotthuss机制,扩散系数与实验吻合。
图3:373K下3,333个水分子自发电离,模拟pH与实验接近。
PETase完整催化循环更有分量:17,792原子全由MLFF处理,覆盖酰化到脱酰化,自由能垒与实验同一量级,原子受力预测与高精度DFT计算高度吻合,单张A100每纳秒反应模拟计算耗时约20小时,已经进入实际研究能承受的成本区间。
图4:PETase完整催化循环示意。
水体系的能力直接延伸到蛋白场景:传统MD需预先固定残基质子化状态,QuantaMind则让质子转移自然发生。
论文用鸡蛋清溶菌酶在磷酸盐缓冲液里跑20纳秒,不加任何质子化约束,预测His15pKa为5.81(NMR实验为5.51,传统恒定pHMD为4.84–5.42),意味着pH依赖的生物过程首次可在真实蛋白里自洽计算。
QuantaMind更像一个整套面向生物药的技术平台,而不只是某个特定反应的模拟器。
图5:HEWL组氨酸滴定,His15质子化自然切换,pKa预测5.81与NMR5.51吻合。
这件事和做抗体的人有什么关系
读到这里,做抗体的人可能会想:PETase催化、组氨酸pKa,跟我有什么关系?
关系比看起来大。关键是QuantaMind展示的底层模拟能力:在模拟原子运动的同时,描述质子转移及其引发的局部相互作用变化。
抗体研发中,不少难题恰好与pH、组氨酸、界面电荷和分子运动有关。
具体来说,至少可以看到五条值得关注的潜在应用路径。
pH依赖的结合和解离。
抗体在血液pH7.4结合抗原,在内体pH5.0–6.0发生解离,这是抗体PK/PD的核心机制,背后往往是组氨酸的质子化状态变化。
传统MD要么固定质子化状态分别开展模拟,要么采用恒定pH方法,但需要调试大量参数。
如果QuantaMind能够实现组氨酸质子化自发发生,就可以更自洽地观察抗体–抗原界面在不同pH下的动态变化:哪些组氨酸会随pH降低发生质子化,如何改变界面氢键网络,并驱动抗原解离。
这对pH-switchantibody的设计、内体释放效率优化具备直接价值。
值得一提的是,分子之心在公开报道中已披露相关研发探索:在一项结合QuantaMind与其他AI设计模型的pH敏感抗体项目中,一款候选抗体在pH6.0下的解离速率约为pH7.4下的62倍,表现出显著的pH响应。
FcRn循环。
IgG的Fc段和FcRn的结合严格pH依赖,内体酸性下结合,血液中性下释放,这个循环是IgG长半衰期的基础。
FcRn结合界面涉及多个组氨酸残基。
能自洽模拟pH依赖的蛋白-蛋白相互作用,对理解Fc工程怎么影响半衰期、设计更长半衰期的Fc变体,是一个潜在工具。
组氨酸工程和developability。
抗体开发里经常引入组氨酸突变来调pH依赖结合、改善溶解度或降聚集。
但组氨酸突变对局部微环境、pKa偏移、界面动态的影响,传统计算很难算准,常常要到后期实验才暴露。
一个能自然处理质子化状态的反应性力场,可以在设计阶段更真实地评估组氨酸突变的后果。
说白了,是把一部分developability风险从湿实验往计算阶段挪。
催化反应与蛋白工程。
PETase案例已经证明QuantaMind能跑完整酶催化循环并给出自由能垒。
蛋白酶、糖苷酶、核酸酶这些和生物药相关的酶,机制理解和理性设计同理。
靶点-配体识别与微观信号传递。
在更广的药物研发场景中,局部质子化状态、水分子网络和构象变化,可能共同影响配体识别及蛋白功能。反应性模拟提供了一种观察这些因素如何相互作用的工具。
例如,当实验发现两个配体结合姿势相似、功能却不同,研究者可以进一步考察局部电荷和动态相互作用是否参与其中。
这些场景指向同一个需求:做药的人不仅想知道分子“长什么样”,还想看清它在具体环境中“如何工作”,并据此决定下一步怎么设计。
QuantaMind提供原子尺度动态机制分析的底层能力,分子之心推出的AI原生研发操作系统MoleculeOS则提供了更完整的研发入口:将蛋白设计、结构与性质评估、动态机制分析和实验反馈衔接起来,让模拟发现能够回到设计中,再由实验检验。对研发团队来说,这才是更值得期待的变化:把“看见机制”变成可以反复使用的研发能力。
它还没解决什么
一篇好的技术论文,成果要展示,局限也得说清楚。
QuantaMind目前也有几个可以继续完善的方向:化学覆盖还比较聚焦,训练集主要基于蛋白质数据,扩展到新的化学体系时,迭代训练的闭环就变得尤为关键。
采样方案和自由能面刻画仍有提升空间,PETase用的是一维伞形采样,组氨酸滴定中质子化转换集中在特定时段,pKa的统计稳健性还有待更多数据验证。
水体系中每个模拟盒子只有一个额外质子,单条轨迹只能给出一个扩散系数估计,误差估计可能偏乐观。
没有一条是致命的,但合在一起勾出了它当前的真实能力边界。
我的判断
QuantaMind不是第一个MLFF,也不会是最后一个。
它做对了三件事:以反应为中心的数据策略、工程化的迭代训练闭环、全体系统一处理的勇气。这三件事加起来,让它从学术demo往生产工具迈了一大步,以往只能在“小体系高精度”和“大体系长时间尺度”之间二选一的问题,第一次有机会在真实生物体系里被统一处理。
过去AI和结构模型更多告诉我们分子长什么样、怎么结合;QuantaMind想进一步回答的是,这些原子接下来怎么动、质子怎么转移、化学键什么时候形成或断裂——更精确地刻画化学与原子层面的动态,捕捉决定蛋白功能的物理底层规律。
对药物研发来说,这个方向的价值不在今天就能替代现有计算工具,而在于它打开了一些过去根本算不动的问题:pH依赖的结合界面动态、组氨酸微环境对developability的影响、催化循环的完整自由能图谱……
这些问题长期要么靠实验试错,要么靠简化模型估算,现在多了一个能在真实生物体系里跑的计算选项。
当然,从展示案例走向日常研发,还需要在更多化学体系和复杂抗体场景中检验可靠性,并把模拟能力接入实际工作流程。
但一个门槛已经开始松动:在接近DFT精度下跑一个完整催化循环,正在从昂贵的研究设想,变成可供研发人员使用的计算能力。
参考来源:
Xia S, Zhang D, Shang X, Xu J. Bridging the accuracy-speed divide in reactive molecular dynamics with QuantaMind MD. Science Advances, 2026,12(37): eaeg3595.https://doi.org/10.1126/sciadv.aeg3595.
MoleculeMind.AI-Driven Reactive Modeling Platform QuantaMind Research Published in Science Advances.2026-9-14.
识别微信二维码,添加抗体圈小编,符合条件者即可加入
抗体圈微信群!
请注明:姓名+研究方向!
本公众号所有转载文章系出于传递更多信息之目的,且明确注明来源和作者,不希望被转载的媒体或个人可与我们联系(cbplib@163.com),我们将立即进行删除处理。所有文章仅代表作者观不本站。
热门跟贴