撰文 | 林无隅
准确预测大规模细胞扰动的影响,对于阐明基因与细胞功能之间的因果关系以及推动靶向治疗和药物研发具有重要潜力。当前的功能基因组学技术(如单细胞CRISPR筛选或小分子扰动)能够在特定细胞语境下实现转录组级别的读出,但其高昂的成本使得跨多种语境的拓展难以普及。为了打破实验限制,研究人员开发了一系列用于预测扰动效应的计算与深度学习方法。然而,现有的深度学习模型在跨细胞语境泛化扰动效应时,效果往往难以超越简单的线性模型。因此,该领域的待解决问题在于如何有效消除单细胞扰动数据中由群体内生物学异质性(如细胞周期变异或细胞系偏好)和实验技术噪声(如测序深度和批次效应)带来的干扰,实现高精度的跨语境泛化预测。
近 日, Arc 研究所 等的Yusuf H. Roohani团队在Cell杂志上发表了题为Predicting cellular responses to perturbation across diverse contexts with State的文章。 作者提出了一个名为State的多尺度深度学习架构,由 State Transition (ST) 模块和 State Embedding (SE) 模块共同组成。该架构通过在具有共享协变量的细胞集上进行自注意力机制建模,成功消除了生物异质性与技术噪声的干扰。研究同时推出了 Cell-Eval 评估框架,从差异基因表达、基因表达计数及扰动效应量等维度对模型性能进行综合评价。实验表明,State在预测未完全观测或全新细胞语境下的扰动效应时,显著超越了现有的线性模型、变分自编码器及单细胞大模型,为开发干细胞状态的计算模型奠定了坚实基础。
在模型架构设计方面,作者通过整合自注意力机制与多尺度预训练策略构建了State模型。核心的ST模块采用基于Transformer的架构,在按协变量匹配的控制细胞集上执行双向自注意力计算,从而在保持单细胞分辨率的同时捕获细胞群体的分布变化。配合使用在1.67亿单细胞观测数据上预训练的SE模块, State能够生成高度鲁棒且对扰动表型极具区分度的密集细胞嵌入表示。这种设计使模型不仅能在有监督模式下工作,还能在缺乏靶向扰动数据时进行跨数据集的零样本(zero-shot)效应预测。
在性能评估与实验验证中,作者利用 Tahoe-100M(化学扰动)、Parse-PBMC(细胞因子信号扰动)及 Replogle-Nadig(基因扰动)等大规模数据集对State进行了全面测试。在Cell-Eval评估体系下,State在扰动区分度得分上较次优模型提升了10%至66%,并展现出显著更高的差异表达基因(DEGs)预测精度与更准确的p值校准。此外,该模型成功预测了细胞类型特异性的基因表达响应(如异源细胞系对Trametinib的特异性反应),并准确捕获了细胞周期特征及细胞存活率等非转录组表型。
在干实验模拟与机制探索方面,作者展示了State作为“虚拟细胞”在实际科研场景中的应用潜力。模型能够准确识别调控特定细胞表达程序所需的最佳扰动,并在连续前向传播模拟中成功预测药物组合的非加性协同效应(如与DrugComb协同得分一致)。通过将药物扰动空间映射到基因扰动空间, State在无需重新训练的情况下实现了基因敲除效应的零样本模拟,其预测的细胞生存效应与DepMap数据库中的CRISPR必需性数据高度相关。
图1 S tate Embedding model
总结而言,文章阐明了State模型从多尺度 Transformer 架构设计,到跨化学、信号及遗传扰动数据集的高精度验证,再到干实验模拟药物协同与基因功能的完整过程。研究表明,State 嵌入能够跨数据集提升对扰动效应的检测能力 ,且 实现了特定语境下的干实验(in silico)模拟,以协助假设生成 。 State通过自注意力机制成功克服了单细胞数据中的生物异质性与技术噪声,实现了卓越的跨语境泛化能力。该研究的重大意义在于打破了单细胞扰动实验高成本的限制,为药物重定向、机制解析及AI驱动的自主实验设计提供了强有力的计算工具。
https://doi.org/10.1016/j.cell.2026.07.052
制版人: 十一
学术合作组织
(*排名不分先后)
战略合作伙伴
(*排名不分先后)
推荐直播
转载须知
【原创文章】BioArt原创文章,欢迎个人转发分享,未经允许禁止转载,所刊登的所有作品的著作权均为BioArt所拥有。BioArt保留所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
点击主页推荐活动
关注更多最新活动!
热门跟贴