单细胞 RNA 测序正在以前所未有的分辨率描绘细胞异质性。与此同时,深度学习和单细胞基础模型不断提升细胞表征能力,但一个关键问题仍未得到充分解决:模型可以把细胞 “ 分得很准 ” ,却未必能够解释自己究竟学到了什么。对于生命科学而言, 聚类 性能只是起点;真正重要的是,模型能否进一步指向具体的基因、生物通路以及与细胞状态变化相关的分子机制。
针对这一挑战,加拿大麦吉尔大学李岳团队与中山大学饶洋辉团队等合作,提出了单细胞外部知识引导的嵌入聚类正则化主题模型 scE²TM ( single-cell External knowledge-guided Embedding clustering regularization Topic Model )。该研究将单细胞基础模型提供的外部知识与可解释主题模型相结合,并通过嵌入聚类正则化缓解传统主题模型中的“解释坍塌( interpretation collapse )”问题,使不同主题能够更充分地对应彼此区分的基因程序。2026 年 8 月 17 日,相关成果以 scE2TM improves single-cell embedding interpretability and reveals cellular perturbation signatures 为题发表于 Nature Communications 。麦吉尔大学计算机学院与中山大学计算机学院等单位合作完成该研究, Hegang Chen 为第一作者, Yanghui Rao 和 Yue Li 为通讯作者。研究在20个单细胞RNA测序数据集上系统评估细胞表征性能,建立了由10项定量指标组成的可解释性评估体系,并在干扰素刺激PBMC和黑色素瘤数据中开展主题层面的计算扰动实验。结果表明, scE²TM 能够在保持高质量细胞表征的同时提取具有生物学意义的转录程序,并利用这些可解释 “ 主题 ” 模拟细胞状态变化。
图 1 scE²TM 整体框架
从“黑箱表征”到可解释的基因程序
主题模型最初用于文本分析:一篇文章可以由多个 “ 主题 ” 组成,每个主题又由一组具有代表性的词语刻画。将这一思想迁移到单细胞转录组中,一个细胞可以被表示为多个潜在 “ 生物主题 ” 的组合,而每个主题对应一组具有较高权重的基因。这样,模型的低维表示不再只是难以解释的数字坐标,而能够直接连接到基因与生物过程。然而, 主题模型存在 “ 解释坍塌 ” 问题 :模型看似学习了许多主题,实际上却可能反复描述相似的基因和通路,既造成信息冗余,也可能遗漏稀有细胞群或细粒度生物学信号。 scE²TM 为此引入嵌入聚类正则化( Embedding Clustering Regularization, ECR ),将主题嵌入视为不同基因簇的 “ 中心 ” ,并通过最优传输建立基因与主题之间的软分配关系,从几何结构上鼓励不同 主题聚合不同的基因集合。与此同时,模型通过 Cross-view Encoder ( CVE )将单细胞基础模型的外部表征知识蒸馏到自身的主题空间中,使模型既能够利用大规模预训练模型蕴含的细胞上下文信息,又 能 增强 主题模型 “ 细胞 — 主题 — 基因 ” 的可解释 质量 。
20个数据集系统评测:细胞“分得准”,解释也要“讲得清”
研究团队在 20 个覆盖不同物种、不同测序技术和不同数据规模的 scRNA-seq 数据集上,将 scE²TM 与 7 种代表性方法进行比较。结果显示,相较于表现最好的竞争方法, scE²TM 的平均 ARI 提升 11.3% , NMI 提升 8.7% ,表明其能够稳定获得高质量的细胞嵌入。更重要的是,研究指出:聚类性能高,并不意味着模型解释一定具有生物学意义。为避免仅凭个别案例 “ 看图解释 ” ,团队引入了包含 Interpretation Purity 、 Topic Diversity 、 Topic Coherence 以及 ORA/GSEA 通路富集质量等在内的 10 项定量指标,从主题一致性、多样性和通路层面的功能相关性等多个角度评价模型解释。在这一体系下, scE²TM 在 Interpretation Purity 、 Topic Quality 、 GSEA Quality 和 ORA Quality 等关键指标上相较次优方法分别提升 8.6% 、 66.5% 、 27.5% 和 16.1% 。相关性分析进一步发现,主题质量及通路富集质量与传统 ARI 、 NMI 聚类指标的相关性较弱。这意味着,一个能够很好地区分细胞类型的模型,并不必然学习到清晰、非冗余且具有生物学意义的基因程序。该结果也强调了在单细胞 AI 研究中对 “ 可解释性本身 ” 进行独立、系统评估的必要性。
图 2 聚类与可解释基准的相关性 评估
“拨动”生物主题:在计算机中模拟细胞状态变化
如果一个主题真正代表某种生物学程序,那么改变这个主题的活性,是否能够推动细胞状态发生相应变化?基于这一思路,研究进一步将主题从 “ 解释工具 ” 拓展为细胞状态计算扰动的 目标 。在 IFN- β 刺激的外周血单个核细胞( PBMC )数据中, scE²TM 识别出与干扰素刺激显著相关的主题 59 和 76 。研究者在对照细胞中增强这两个主题的活性,并利用模型解码器重建扰动后的基因表达。随着 IFN 相关主题扰动强度增加,越来越多的对照细胞被分类为 IFN 刺激状态;在 UMAP 空间中,扰动后的细胞也逐步由对照群体向真实 IFN 刺激细胞群移动。这一实验提供了一个直观的视角: scE²TM 学 习到的 “ 主题 ” 不仅是用于描述细胞的统计特征,还可以作为可操作的转录程序,在计算机中探索 “ 如果增强某个生物程序,细胞可能发生怎样的变化 ” 。这为利用可解释模型开展 in silico 假设生成提供了新的可能。
图 3 IFN 相关主题扰动推动对照细胞向刺激状态转变
从黑色素瘤单细胞到TCGA:连接肿瘤转录程序与患者预后
研究进一步在黑色素瘤数据中检验这一框架。 scE²TM 从恶性细胞与正常细胞的比较中识别出 33 个恶性特异主题。随后,研究者逐步降低这些恶性相关主题的活性,模拟对肿瘤相关转录程序的抑 制。随着扰动增强,越来越多的恶性细胞被分类为正常状态,并在低维空间中逐渐向正常细胞群靠近;相比之下,扰动非恶性特异主题并不能产生相同的状态转移。团队将单细胞数据中识别到的恶性相关基因程序外推至 TCGA 黑色素瘤患者队列。由主题扰动得到的恶性相关基因与患者生存显著相关( p =1.6×10⁻⁴ ),而从单细胞数据中学习到的恶性特异主题在独立患者数据中同样表现出显著的生存关联。这表明, scE²TM 能够在单细胞层面识别具有临床意义的转录程序,并为连接细胞状态、疾病机制与患者 预后 提供一种可解释的计算桥梁。
图 4 黑色素瘤恶性主题扰动及其与患者生存的关联
总结、局限性与展望:让单细胞AI从“预测工具”走向“机制发现工具”
综上,scE²TM尝试在高性能单细胞表征与生物学可解释性之间建立连接:一方面利用单细胞基础模型提供的外部知识提升细胞表征,另一方面通过结构化主题将复杂的潜在空间拆解为可追踪的基因程序。研究进一步建立了系统的定量可解释性评估框架,并通过 IFN 刺激 PBMC 和黑色素瘤数据中的主题扰动实验,展示了这些可解释主题用于模拟细胞状态变化、生成可检验生物学假设的潜力。与此同时,该研究也提示,高聚类性能并不必然对应高质量的生物学解释,因此单细胞AI模型的可解释性需要独立于传统预测或聚类指标进行系统评估。需要指出的是,该研究仍存在若干局限。首先,部分可解释性指标依赖通用生物通路数据库,尚不能充分判断所识别通路是否真正具有组织或细胞类型特异性; 其次 ,当前主题 — 基因依赖关系主要在数据集整体层面学习,可能难以充分刻画单个细胞或特定细胞亚群中的细粒度差异。上述问题也为后续研究提出了新的方向:未来可进一步构建组织 / 细胞类型特异知识资源,探索细胞特异的主题结构,并将该框架拓展至多模态单细胞数据,从而进一步检验其在更复杂生物场景中的泛化能力,并推动可解释单细胞 AI 从表征分析走向更可靠的机制假设生成与实验验证。
论文地址:https://doi.org/10.1038/s41467-026-76825-5
代码地址:https://github.com/li-lab-mcgill/scE2TM
制版人: 十一
学术合作组织
(*排名不分先后)
战略合作伙伴
(*排名不分先后)
推荐直播
转载须知
【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
点击主页推荐活动
关注更多最新活动!
热门跟贴