撰文丨王聪
编辑丨王多鱼
排版丨水成文
天然产物(Natural Product)作为源自微生物、动物或植物的代谢产物,具有多样化的生物活性,因而对药物发现至关重要。目前,天然产物研究中的深度学习方法主要依赖于针对特定下游任务设计的监督学习策略。然而,这种“一任务一模型”的模式往往泛化能力不足,且存在较大的性能提升空间。此外,现有的分子表征方法并不完全适用于天然产物特有的任务需求。
近日,北京大学药学院刘振明教授、西安交通大学人工智能与机器人研究所郑南宁院士等,在 Nature 子刊Nature Machine Intelligence上发表了题为:Pretraining a foundation model for small-molecule natural products 的研究论文。
该研究开发了一种用于天然产物挖掘及相关药物发现的基础模型——NaFM。
在这项最新研究中,研究团队基于天然产物的独有特性,预训练了一个天然产物基础模型——NaFM(Foundation Model for Natural Product)。该方法采用专门针对天然产物设计的预训练策略,通过结合对比学习与掩码图学习目标,在捕捉侧链信息的同时,突出分子支架中蕴含的进化信息。NaFM 在与天然产物挖掘及药物发现相关的多项下游任务中取得了最佳性能(SOTA)。
研究团队首先通过将分类学分类任务与专注于合成分子的基线模型进行比较,说明现有模型在理解天然合成过程方面的不足。进一步,通过在基因和微生物层面进行细粒度分析,NaFM 展现出捕捉进化信息的能力。最后,研究团队将该方法应用于虚拟筛选,展示了其能够形成信息丰富的天然产物表征,从而更有效地识别潜在药物候选分子。
值得一提的是,Nature Machine Intelligence期刊发表了题为:Learning the chemical language of natural products 的 News & Views 文章,文章指出,该研究开发出了一种有前景的基础模型,用于天然产物挖掘的一系列下游应用。
论文链接:
https://www.nature.com/articles/s42256-026-01226-8
热门跟贴