美国西雅图公司Talus Bio在10月初把自研模型Ptarmigan-1放上公开门户,开放给研究社区使用。
公司表示:“这是首个不需要蛋白三维结构的AI制药模型”。它只凭蛋白序列和化合物的化学式,判断哪些小分子会结合、结合在哪个位置。
它的意义在于,把可成药性的前提从「能否获得可靠结构」改写为「能否在蛋白序列与化学空间中建立相互作用映射」,使缺乏稳定折叠和明确结合口袋的靶点首次进入系统筛选范围。
需要注意的是,模型权重与代码均未公开,属于开放访问而非开源。
绕开三维结构 把筛选变成检索
Talus Bio总部位于西雅图,成立于2020年,由Alex Federation与Lindsay Pino联合创立。Federation为哈佛化学生物博士,师承Jay Bradner,是化学蛋白质组平台MARMOT的主要发明人。Pino为华盛顿大学基因组科学博士,曾在Broad Institute从事蛋白质组学研究。
公司2024年完成的1120万美元种子加轮,本次预印本署名作者均为公司员工,项目获NIH资助。
传统虚拟筛选依赖明确的蛋白结合口袋,AlphaFold3、Boltz2、Chai‑1 等共折叠模型,均需输出蛋白‑配体三维复合物。
但据Pino估算,约半数人类蛋白缺少可供建模的稳定结构;其7月预印本数据显示,约2万个人类蛋白中87%既无获批药物,也无强效小分子配体。
Ptarmigan‑1的做法是把问题搬到机器更擅长的空间,模型用蛋白序列编码器和配体SMILES编码器,把每个残基和每个化合物放进同一个256维潜在空间,训练目标很直接,真实结合的分子和残基要在空间里靠得最近。
筛选由此不再是逐对模拟,而是一次建图、反复查询,类似在地图里找最近的店。
作者还强调,训练数据大量来自化学蛋白质组学和生物活性数据,包括细胞环境下的活性位点测量,所以模型学到的是"在哪里结合",而不只是"是否结合"。
10毫秒对54秒 两年压缩三小时
跳过蛋白折叠,不仅规避方法学难题,更能大幅降低算力开销。
据Talus预印本基准测试,单张英伟达H100显卡上,Ptarmigan‑1对单个化合物打分平均仅需10毫秒;对比之下,开源共折叠模型Boltz‑2完成相同打分约需54秒,性能差距约5000倍。
据此测算,单个靶点筛选100万个化合物,耗时可由接近两年压缩至3小时以内。
团队还完成更大规模验证:使用20张H100、耗时约1天,完成34亿化合物对20431个人类蛋白的全局互筛,仅消耗20个H100 GPU小时,这类任务若采用共折叠方案,算力成本将高到难以落地。
CEO Alex Federation也表示,结构生物学方法仍具备价值,公司采取分工式研发策略:先用Ptarmigan‑1低成本从海量化学空间完成初筛缩圈,再将候选分子交由结构模型解析、细化结合模式。
在标准LIT‑PCBA基准测试中,Ptarmigan‑1性能仅次于Boltz‑2位居第二,优于Glide‑SP、Gnina等传统对接工具;作为完全不依赖三维坐标的模型,其基础表现具备竞争力。
二者差距主要体现在高难度靶点场景:当AlphaFold置信度落入无序区域、口袋为配体诱导才形成、靶点为共价结合模式时,结构类模型的前置假设不再成立,Ptarmigan‑1依旧可以实现有效活性富集。
真正的说服力在难靶点,团队将训练集中刻意剔除的STAT6转录因子专利抑制剂系列用于盲测,模型成功找回活性分子并定位结合残基,得分约0.94,结构方法基线约0.58,接近随机。模型对同样剔除的KRAS G12C相关分子,能够按研发代际排序,提示其捕捉的是相互作用规律而非训练记忆。
需特别注明,上述结果来自公司预印本,性质仍属回顾性验证。
短期来看,Ptarmigan‑1更适合作为结构类筛选的前置辅助工具,模型已展现出一定技术潜力,但其真实价值仍需依靠前瞻性实验、同行评议以及新药研发项目的实际命中率持续验证。
—The End—
热门跟贴