编辑丨王多鱼
排版丨水成文
AI 预测蛋白质结构,这几年很火,但到了“预测药物和蛋白怎么结合”这一步,行业普遍遇到一个尴尬境地——公开数据不够,而且越接近真实药物研发越不够。公共数据库中缺乏适合训练工业级模型的蛋白质-配体结构数据,已成为限制 AI 药物发现的一个主要障碍。
各大制药公司数十年来在研究中积累了大量的蛋白质-配体复合物的专有数据集,但由于知识产权、保密性和监管限制,这些数据仍处于孤立状态。
2026 年 9 月 14 日,Nature官网头条报道了一个新进展——由艾伯维、Astex、BMS、强生、武田这五家药企组成的AISB(AI Structural Biology)网络,使用超过 2 万个药企私有的蛋白-配体结构数据,对OpenFold3模型(AlphaFold3 的开源复现版本)进行训练,开发了性能更强的新模型——AISB-1-Fed,在蛋白-药物复合物预测上显著超越只使用公开数据训练的模型。这件事的意义不只在提高准确率,而在它验证了一条路径——药企不交原始数据,也能联合把 AI 模型训练得更好。
公开库 PDB 为什么“不够制药”
AlphaFold2当年能拿诺贝尔化学奖,底层靠的是PDB(Protein Data Bank)——一个拥有超过 20 万例实验解析蛋白结构的公开库。但问题在于, PDB 很“学术”、不够“制药”。
PDB 目前超过 24 万例结构,但其中只包含约 1.06 万例已获批或在研药物相关结构,AlphaFold3 训练截止后新增的这类结构仅约 3000 例。Astex 公司则给出一个保守的评估:PDB 里的“实验解析+类药分子”的蛋白结构可能也就 1 万个左右。
这带来结果也很直接:AlphaFold3、Boltz、OpenFold3 这类共折叠模型,在“和训练集相似”的蛋白-配体对上表现不错;一旦配体化学类型、靶点构象和训练数据差异变大,准确率就会明显下滑。2026 年 FoldBench 等基准也印证:配体与训练集相似度越低,对接精度越差,抗体-抗原等复杂界面同样是硬骨头。对药企来说,这才是最要命的部分——新靶点、新骨架、新构象,恰恰最不像公开数据。
AISB 怎么用“私有数据”训练模型
AISB 网络这次的做法是联邦学习+OpenFold3 微调。
参与方——艾伯维、Astex、BMS、强生、武田,这五家药企贡献私有结构;底层模型使用OpenFold3(开源版 AlphaFold3 思路)。各家不出本地数据,只在自己环境里用自有实验结构微调,再把模型参数/更新聚合起来。公开披露口径中,训练集共 20167 个蛋白-配体结构,全部来自这五家药企私有的药物发现项目,这些结构来自 X 射线晶体以及冷冻电镜等方法解析。
测试集留出 1056 个未参与训练的蛋白-配体结构,结果显示——AISB 模型的高质量预测占比超过一半(52.1%);公开版 OpenFold3 则有约三分之一(35.6%)达到同样标准;开源模型 Boltz-2 则有 40.9% 达到同样标准。这表明加入药企私有、类药、多靶点数据后,模型对蛋白-配体互作预测明显提效。
更重要的是,联合训练还优于“单个药企自己训自己数据”。说明数据多样性比单纯堆量更重要:一家药企哪怕有几千个结构,也只覆盖自己的靶点和化合物偏好;多家药企加起来,化学空间、靶点类型、实验条件更全。
药企私有数据库为什么香?因为这些结构来自多年新药项目:激酶、蛋白酶、GPCR、抗体片段、配体筛选命中物等等,很多和专利、在研管线、商业机密绑定。让他们把这些数据直接上传 PDB,显然不可能。
AISB 的妥协方案是联邦学习:原始结构不出门,只传梯度/模型更新,通过在计算基础设施上做隐私保护设计,难以通过最终模型反推“秘密结构”,这解决了药企对私有数据泄漏的顾虑,也让“多竞品联合训练模型”在合规上变得可谈。
类似思路还有礼来的 TuneLab:小型生物公司分享数据,换礼来的 AI 工具使用权;本质是“数据库换算力或模型”。但 TuneLab 更偏平台闭环,AISB 则更偏开放模型社区。
私有数据只是“过渡方案”
Boltz 公司 CEOGabriele Corso则提出了保留意见:AISB 的结果还没看到在广泛公开基准、以及与最新前沿共折叠模型全面对比,单看自有测试集不够说服人。这批评也合理——药企内部测试集再好,也需要 PoseBusters、FoldBench、跨靶点 cross-dock 等第三方基准复现。
AISB 项目的参与者、哥伦比亚大学计算生物学家Mohammed AlQuraishi则表示,回收药企历史结构只是过渡方案,真正要突破,得主动生成新数据,专门补齐当前模型盲区。
目前有两条公开路线正在尝试这么做——
OpenBind:Diamond Light Source 同步辐射+ X 化学片段筛选,目标建立面向 AI 的蛋白-药物大规模公开库。2026 年 5 月首批释放 EV-A71 2A 蛋白酶数据,699 个化合物、925 个晶体学结合事件、601 个带亲和力 KD;长期目标数十万级结构并回灌 PDB。后续 OpenBind-0 基于 OpenFold3 做开源共折叠基线,在部分新靶点表现好,但在柔性 RdRp 等体系仍很低,说明“新数据+新模型”都要迭代。
LIGAND-AI:不只做结构,还做千级、亿级小分子和蛋白结合强度,形成“结构 + 亲和”双信号;由辉瑞、SGC 等牵头,数据开放给 AI 开发者。
差别在于,AISB 使用“存量私有数据”快速提模型;OpenBind、LIGAND-AI 则使用“增量公开数据”重新画训练分布。短期药厂受益,长期整个学术界和小公司受益。
对国内 AI 制药的启发
1)共折叠模型别只刷 PDB,药物项目要补内部晶体、SPR、ITC、cryo-EM、HDX,形成自有 benchmark,否则 AlphaFold3/Boltz 看起来都好,真到自研靶点就塌房。
2)联邦学习会从“概念”变“基础设施”。国内多家药企、CRO、AI 公司如果共建模型,联邦+隐私计算比“建一个共享数据库”更现实。
3)公开稀缺区值得主动造数据。抗病毒、耐药激酶、GPCR、蛋白-蛋白界面、共价/大环/蛋白降解剂,这些公开结构少,谁先做成标准化实验+AI 闭环,谁有基准红利。
4)别把“预测结构准”等同于“能找药”。共折叠模型可能给不了可靠的 KD/IC50;AISB 提升的是结构判断,后面仍要对接、自由能、活性排序和湿实验。
AISB 的这个结果还没经过同行评审,模型也未公开,但它揭开了行业心照不宣的事实——药企“保险柜里”的结构,才是蛋白-药物 AI 下一步的最大燃料。未来大概率是“联邦学习私有存量+大科学计划创造公开增量”两条腿一起走。等 OpenBind、LIGAND-AI 跑出几十万高质量结构,AlphaFold 类模型才可能真正跨过“只会在熟悉分子上表现好”的坎。
https://www.nature.com/articles/d41586-026-02882-x
热门跟贴