撰文 | 林无隅
细胞是生命的基本单位,长期以来生物学家一直尝试将细胞概念化为不同的通用景观,以绘制其表型范围、相互关系以及在发育和疾病期间的状态转变【1】。随着单细胞RNA测序(scRNA-seq)数据集的大幅增长,研究人员通过构建细胞图谱来创建细胞类型的分子定义,这为深入研究细胞景观提供了前所未有的丰富高维数据 。然而,现有的计算方法在联合分析这些异质数据集时面临巨大挑战。由于物种特异性限制或数据集特异性伪影(即批次效应)的存在,现有的统一表征往往无法直接扩展到新的数据集【2,3】。因此,该领域亟待解决的瓶颈问题是:如何构建一个能够消除跨实验噪声和批次效应,并且无需针对新数据集进行重复标注或模型微调的通用细胞表征模型。
为了解决上述跨数据集整合和非通用表征的难题,2026年7月8日,美国斯坦福大学计算机科学系Jure Leskovec及其团队在Nature上发表题为Universal cell embedding provides a foundation model for cell biology的文章,作者开发了一种名为通用细胞嵌入(Universal Cell Embedding,UCE)的单细胞基因表达基础模型 。该模型采用自监督学习策略,在涵盖8个物种、包含超过3600万个细胞的大规模数据集上进行训练,成功构建了一个统一的生物学隐空间 。通过将单细胞的RNA表达抽象为“RNA袋”并结合大语言模型生成的蛋白质嵌入,UCE实现了无需模型微调或重新训练即可直接映射新数据集的零样本(Zero-shot)嵌入能力 。这一研究手段有效克服了由于实验噪声和物种差异导致的对齐障碍,为单细胞数据的自动化注释、跨物种比较以及未知细胞功能解码提供了强有力的通用计算工具。
为了解决上述跨数据集整合和非通用表征的难题,作者开发了一种名为通用细胞嵌入(Universal Cell Embedding, UCE)的单细胞基因表达基础模型 (如图1所示) 。该模型采用自监督学习策略,在涵盖8个物种、包含超过3600万个细胞的大规模数据集上进行训练,成功构建了一个统一的生物学隐空间 。通过将单细胞的RNA表达抽象为“RNA袋 (bags of RNA) ”并结合大语言模型生成的蛋白质嵌入,UCE实现了无需模型微调或重新训练即可直接映射新数据集的零样本(Zero-shot)嵌入能力 。这一研究手段有效克服了由于实验噪声和物种差异导致的对齐障碍,为单细胞数据的自动化注释、跨物种比较以及未知细胞功能解码提供了强有力的通用计算工具。
Fig1 Overview of the UCE model
在模型构建与训练方法上,UCE将单细胞的scRNA-seq计数数据作为输入,根据非零表达水平进行加权和归一化抽样,将其转换为基因序列。随后,利用拥有150亿参数的蛋白质语言模型ESM2,将这些基因转化为其编码蛋白质的数值向量(即蛋白质嵌入)。这些基因解析出的Token会根据基因组位置进行排序并按染色体分组,在头部拼接一个代表整个细胞的特殊CLS Token后,统一输入到一个33层、包含6.5亿参数的大型Transformer神经网络中。训练过程完全采用自监督方式,通过随机掩蔽20%的已表达基因,并利用神经网络联合细胞嵌入与蛋白质嵌入来预测该基因是否在细胞中表达,最终在24块A100 GPU上历时40天完成了超过300个数据集的训练。
在验证UCE的零样本嵌入能力时,作者将其直接应用于未参与训练的全新人类图谱数据集Tabula Sapiens v.2(包含来自27个组织的581,430个细胞)。数据表明,在全面衡量生物学信息保留与批次效应消除的单细胞整合基准测试中,UCE的综合评分相比于次优的自监督方法Geneformer显著提升了13.9%,其中生物学保留得分提高了16.2%,批次校正得分提高了10.1%。即使面对包含10x Genomics和Smart-seq2两种不同测序技术带来的严重技术批次效应,UCE的零样本表现也达到了与scVI、scArches等依赖显式标签微调的有监督模型相当的水平。
为了展现UCE超越传统基因同源性比对的物种通用性,作者对未包含在训练集中的新物种(如绿猴、裸鼹鼠和鸡)进行了零样本嵌入测试。在绿猴淋巴结与肺部细胞的测试中,通过将绿猴细胞嵌入与由3600万细胞构成的集成超大规模图谱(IMA)进行比对,17个细胞类型质心中有13个在空间中与其跨物种的同类细胞最为接近 。在此基础上,基于人类淋巴结数据训练的简易逻辑回归分类器能够以极高的准确率直接识别绿猴的B细胞和T细胞。此外,UCE还在绿猴数据中成功纠正了一处原始的错误标注:它将一组误标为B细胞的细胞簇明显聚集到了T细胞区域,后续的差异表达分析证实该细胞簇高度表达Cd3d、Fyb1等经典T细胞标志物。
综上所述,本文展示的UCE基础模型通过蛋白质语言模型和染色体位置编码的创新结合,从根本上摆脱了传统单细胞分析对基因同源性配对和重复模型微调的依赖。它不仅能以零样本的方式精确纠正跨技术、跨实验的批次效应,还能在完全无监督的表征空间中自发涌现出与细胞本体论、发育谱系高度一致的生物学层级结构。该研究的重大意义在于打破了过去小规模、私有数据集之间的计算孤岛,为跨物种和跨组织的综合单细胞研究建立了一个通用的坐标系。这种如同“细胞生物学ChatGPT”的基础模型,将极大地推动未知细胞类型的发现、疾病机制的理性假设生成以及全球超大规模细胞图谱的无缝集成。
https://www.nature.com/articles/s41586-026-10187-2
制版人: 十一
参考文献
1. The Tabula Muris Consortium. Single-cell transcriptomics of 20 mouse organs creates a tabula muris.Nature562, 367–372 (2018)
2. Avsec, Ž. et al. Effective gene expression prediction from sequence by integrating long-range interactions. Nat. Methods 18, 1196–1203 (2021).Schneider, G. et al.Nat. Rev. Cancer17, 239-253 (2017).
3. Rives, A. et al. Biological structure and function emerge from scaling unsupervised learning to 250 million protein sequences.Proc. Natl Acad. Sci. USA118, e2016239118(2021)
学术合作组织
(*排名不分先后)
战略合作伙伴
(*排名不分先后)
推荐直播
转载须知
【原创文章】BioArt原创文章,欢迎个人转发分享,未经允许禁止转载,所刊登的所有作品的著作权均为BioArt所拥有。BioArt保留所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
点击主页推荐活动
关注更多最新活动!
热门跟贴