打开网易新闻 查看精彩图片

文章概述

近日,华中科技大学生命科学与技术学院宁康团队于期刊Advanced Genetics发表题为“Foundation models for microbiome research: from sequence semantics to community dynamics and multimodal world models”的综述,系统梳理了微生物组基础模型从分子序列、群落组成到多模态世界模型的发展脉络。

该综述以生物尺度为主线,比较序列中心、群落中心和多模态模型的能力边界,并提出一条由表征、预测、动态、干预走向模拟的研究路线。文章同时讨论群落切词、小队列泛化、因果建模、评估标准和实验验证等关键问题,为微生物组人工智能从相关性预测走向机制理解与干预设计提供了系统框架。

打开网易新闻 查看精彩图片

正文

1 研究背景:数据快速增长,理解为何仍然滞后?

过去十余年,16S rRNA测序、宏基因组、宏转录组及相关多组学技术建立了庞大的微生物观测记录。然而,传统分析往往围绕单个队列寻找差异物种或疾病标志物:在一个数据集上有效的信号,换到另一个人群、生境或测序平台后,可能迅速衰减。

这一困难不只是模型容量不足,更来自数据形态与生物学问题之间的不匹配。微生物组数据同时具有稀疏性、组成性、层级性和强上下文依赖;同一个菌种在不同宿主或环境中可能承担不同生态角色,类似的群落表型也可能由不同的基因功能基础形成。因此,核心问题不再只是“有没有信号”,而是能否学到跨尺度、跨队列且仍具生物意义的表征。

基础模型提供了新的起点:先在大规模、多为无标注的数据上预训练,再将所学表征迁移至多个下游任务。但综述强调,“模型大”不等于“基础模型”。评价微生物组基础模型时,不能只看单一数据集上的准确率,还要考察跨队列、跨生境的迁移性,以及经历批次效应和扰动后能否保留稳定、可解释的生态信息。

2 跨尺度框架:从序列语义到群落生态

综述提出,微生物组基础模型并非一个“万能模型”,而是分布在多个生物尺度上的方法家族。从核苷酸、蛋白质、基因组,到物种、群落、宿主、环境与扰动,生物学复杂度不断提升,模型所要学习的“语言”也随之变化。

序列中心模型:回答“微生物可能做什么”。DNA、RNA和蛋白质具有内在的符号顺序,模型可通过自监督学习捕捉模体、结构、进化和功能规律,服务于功能注释、结构预测与分子设计。

群落中心模型:回答“微生物群落正处于什么状态”。这类模型从丰度或组成剖面中学习共现、互作和表型相关结构。由于群落没有像DNA那样天然的“句子顺序”,按丰度排序、分箱或组合分类与丰度标记,实际都在为生态对象施加建模假设。因此,“如何切词”本身就是科学问题。

多模态模型:回答“功能潜力在特定上下文中如何变成实际表型”。它们尝试对齐序列、群落组成、宿主生理、临床元数据、代谢物、空间位置、时间与治疗历史。真正的多模态对齐不能只是拼接向量,而需要配对多组学、纵向扰动轨迹和生物一致性检验。

打开网易新闻 查看精彩图片

图1:微生物组基础模型的跨尺度框架。从经典队列分析,到序列中心、群落中心模型,再到融合宿主、时间与干预信息的世界模型

3 能力进阶:从表征、预测到动态与干预

团队进一步给出了一条从静态到动态的路线图:表征模型捕捉序列、组成和功能模式;上下文模型加入宿主与环境变量,提升表型预测;多模态模型融合异质生物信号;动态模型引入时间、轨迹与扰动历史;世界模型则进一步学习生态系统在不同干预下如何演化,以支持模拟、规划与控制。

与单细胞转录组图谱或蛋白质互作网络常被作为分子状态快照或相对静态的关系图不同,微生物群落具有双向生态反馈、快速转换和对系统级扰动的响应。抗生素、饮食、免疫调节和微生物治疗等干预又提供了可操作的输入。这使微生物组更需要世界模型,也使采样密集、扰动明确的纵向研究能够为学习“干预—响应”关系提供现实入口。

需要强调的是,综述将“微生物组世界模型”定义为长期研究路线,而非宣称通用的微生物组模拟器已经成熟。当前的数字孪生与扰动预测更适合数据密集、生态复杂度受限、扰动边界清晰的特定场景。

打开网易新闻 查看精彩图片

图2:从表征模型到世界模型的研究路线。模型能力由表征、预测、动态、干预向模拟递进,并对应数字孪生、虚拟扰动、精准治疗和合成生态系统等未来应用

4 关键挑战:走向世界模型前的五道关口

1. 可扩展且具生物意义的分词。序列、丰度和多模态数据被如何编码,直接决定模型可以看见什么、又会丢失什么。

2. 小队列与异质数据下的泛化。采样、测序、人群和环境差异会形成显著域偏移,大规模预训练只能缓解,不能自动消除这些问题。

3. 从关联走向因果。物种共现可能来自直接互作、共同环境驱动或宿主中介;没有受控扰动数据,这些机制很难区分。

4. 建立超越单一准确率的评估标准。评估应覆盖跨队列迁移、跨生境泛化、批次效应与零膨胀鲁棒性、扰动预测校准、生态解释稳定性,并与经典统计或机器学习方法进行透明比较。

5. 实验验证与不确定性约束。培养、扰动实验和体内验证成本高、周期长,却是防止模型将统计关联误读为生物机制的必要环节。

总结与展望:

近期(1—3年):优先推进透明的模型比较、群落切词评估、跨队列与跨生境基准,并完善预训练数据和模型开放性报告。

中期(3—5年):聚焦多模态对齐、纵向扰动建模、经校准的生态解释与实验支持的验证体系。

长期(5年以上):在有实测动态、不确定性估计和实验反馈约束的前提下,探索干预感知的微生物组世界模型、数字孪生和闭环微生物组工程。

这篇综述的落脚点并非“把模型做得更大”,而是把微生物组研究的智能单元从队列中的特征表扩展到基因、蛋白质、基因组、物种、群落和宿主状态之间的跨尺度表征。序列中心模型擅长描述功能潜力,群落中心模型擅长描述生态状态,未来的重要进展将来自二者与宿主、环境、时间和扰动的可验证对齐。

微生物组基础模型的终点,不应只是一个更准确的分类器,而应是一个具有生物学根基、能够理解动态并在实验中被问责的干预感知框架。它能否成为现实,取决于该领域能否把表征学习转化为机制性、可校准、可实验验证的微生物组科学。

作者简介

打开网易新闻 查看精彩图片

通讯作者:宁康华中科技大学生命科学与技术学院教授、博士生导师。主要从事微生物组大数据和人工智能研究,已作为通讯作者在Nature Microbiology、Nature Communications、PNAS、Gut等高水平学术期刊上发表论文100余篇,文章总引用超过9000次。

打开网易新闻 查看精彩图片

第一作者:张皓鸿,华中科技大学生命科学与技术学院博士生,研究方向为微生物组基础模型、AI for Biology与生物信息学。以第一或共同第一作者在Advanced Science、Briefings in Bioinformatics和mSystems等期刊发表多篇论文。

论文信息

Foundation Models for Microbiome Research: From Sequence Semantics to Community Dynamics and Multimodal World Models

Haohong Zhang, Zixin Kang, Kang Ning

期刊名称:Advanced Genetics

DOI: 10.1002/ggn2.70046

原文链接:https://doi.org/10.1002/ggn2.70046

打开网易新闻 查看精彩图片

更多关于Advanced Genetics

打开网易新闻 查看精彩图片

Homepage: www.advgenet.com

E-mail:advgenet@wiley.com

PubMed: Adv Genet (Hoboken)

Social Media:

LinkedIn:Advanced Portfolio

X:@Adv_Genet

ResearchGate:

https://www.researchgate.net/journal/Advanced-Genetics-2641-6573

Advanced Portfolio 公众号

综述与展望

评论

研究

专栏