撰文丨王聪
编辑丨王多鱼
排版丨水成文
系统性地模拟和预测在异质性细胞环境中多种干预措施的表型效应(例如,敲除一个基因,或添加一种药物,细胞会产生什么变化),是实现人工智能虚拟细胞(Artificial Intelligence Virtual Cell,AIVC)愿景的核心。
然而,一直以来,研究遗传(基因)和化学(药物)的实验室往往是两条平行线。遗传筛选通量高,但难以直接成药,化学筛选针对治疗却因化学空间浩瀚无比而效率低下。如果能用一个统一的 AI 模型桥接这两大领域,打破遗传与化学扰动之间的壁垒,不仅能揭示更深层的生物学机制,还能极大加速药物研发。
2026 年 7 月 24 日,腾讯生命科学实验室(AI for Life Sciences Lab)姚建华研究员、杨帆研究员及中南大学计算机学院李敏教授作为共同通讯作者(李一鸣为论文第一作者),在国际顶尖学术期刊Cell上发表了题为:UniPert-G2CP bridges genetic and chemical screens from molecular representation to phenotype modeling 的研究论文。
该研究构建了一个名为UniPert-G2CP的全新 AI 框架,通过整合多模态分子扰动因子(原因)表征,并实现从遗传到化学扰动表型(结果)的迁移学习,从而连接遗传筛选与化学筛选,从而更准确地预测扰动、发现作用机制,并实现高效的计算机辅助药物筛选。UniPert-G2CP推动了通用生物学因果建模的发展,加速了人工智能虚拟细胞(AIVC)的实现,并拓展了 AI 驱动的精准医学的应用潜力。
痛点:基因与药物的“鸡同鸭讲”
模拟细胞状态并预测来自多种干预措施(包括遗传和化学扰动因子)的表型效应,已成为人工智能虚拟细胞(Artificial Intelligence Virtual Cell,AIVC)发展中的核心目标。这一进展得益于诸如 Connectivity Map、Cancer Dependency Map 及 Cell Painting Gallery 等项目所提供的具有上下文特异性的、高通量、多领域的扰动后表型特征数据。通过对这些扰动因子所引起的细胞响应与行为进行联合建模与分析,可系统性地探索生物学机制和治疗干预手段,同时有助于识别潜在的治疗靶点,并发现针对特定疾病的新型药物候选物,从而推动高效的数据驱动型个体化医疗。然而,这一前景广阔的范式在细胞扰动建模方面仍面临若干关键瓶颈——
1、模态差异大: 基因是由 A、G、C、T 组成的长链序列,而药物通常是原子构成的小分子化合物,传统的 AI 模型很难将两者映射到同一个语义空间中。
2、数据规模不对等: 基因库相对有限(人类只有大约 2 万个基因),可以通过 CRISPR 技术进行大规模并行筛选;而化学药物的空间近乎无限(估计有超过 10⁶³ 种化合物),实验筛选成本高昂,覆盖率极低。
3、细胞异质性: 同样的药,对不同来源的细胞(例如不同患者的癌细胞)效果可能截然不同,模型需要具备跨环境的泛化能力。
破局:UniPert-G2CP 是如何工作的?
为了攻克上述难题,研究团队设计了一个两阶段深度学习框架,以克服跨扰动域、分子模态和文库规模的表型筛选中的建模瓶颈。在第一阶段,研究团队开发了UniPert(Unified Multimodal Perturbagen Representation Learning),这是一个基于对比学习的多模态分子表征学习模型,能够将大分子和小分子编码到共享的语义嵌入空间中,从而桥接遗传扰动与化学扰动。在第二阶段,研究团队将 UniPert 集成到一个扰动效应预测模型中,开发出了G2CP(Genetic-to-Chemical Perturbation Transfer Learning),这是一种遗传到化学扰动的迁移学习方法,利用系统性的基于 CRISPR 的遗传筛选来提升计算药物筛选的效率。
第一阶段:UniPert——打造通用的分子“语言”
UniPert的核心任务是将基因(编码的蛋白质)和小分子药物转化为同一种“AI 语言”(向量嵌入)。
对于药物(小分子): 它使用了经典的 ECFP 指纹作为输入,这相当于提取了药物的结构骨架特征。
对于基因(编码的蛋白质): 这是创新的关键,它不仅仅依赖最新的蛋白质语言模型(例如 ESM)来获取全局特征,还结合了多序列比对(MSA)和图神经网络(GNN)。这就像一个既懂宏观语法又精通局部方言的专家,能更好地捕捉蛋白质的保守功能区域。
对齐训练: 利用已知的化合物-靶点相互作用(CPI)数据,通过对比学习,强制让相互作用的药物和蛋白在向量空间中“贴在一起”。
结果显示,UniPert 不仅学会了区分不同作用机制的药物,甚至能识别出结合在同一蛋白不同位点的结构不相似的药物(例如作用于 GABAA 受体的不同变构调节剂)。对于蛋白来说,它能准确地将功能相似的蛋白家族聚集在一起,甚至能推断出未被充分研究的蛋白所属家族或相互作用关系。
第二阶段:G2CP——“以基因为师,导药入海”
有了UniPert这个强大的“翻译器”,G2CP框架就能大显身手了,它的策略是“遗传预训练 + 化学微调”。
预训练(学基因): 首先,利用大量、系统性的 CRISPR 基因筛选数据来训练模型。这让模型深刻理解了“敲除某个基因会导致细胞发生什么变化”这一底层逻辑,给模型打下了坚实的生物学基础。
微调(学药物): 由于化学药物数据少,直接用少量药物数据训练效果差。G2CP 的做法是将 UniPert 编码的药物信息输入模型,利用从基因中学到的知识,去预测未见过的药物会引起的细胞反应。
这就像先在题库(基因库)里做了海量练习,掌握了解题规律,然后再参加考试,遇到新题型(药物),也能举一反三,准确作答。
成绩:效果显著,洞察深刻
论文中的实验结果令人印象深刻——
1、预测更准确: 在多个数据集(例如 LINCS、sciPlex3)上,G2CP 预测药物诱导的基因表达变化(转录组)和形态学变化的准确度远超现有方法。特别是在数据稀缺的情况下,性能提升尤为明显(高达 375%)。
2、搞定“难搞”的药物: 对于组蛋白去乙酰化酶(HDAC)抑制剂这类结构相似但药效有细微差别的药物,UniPert-G2CP 也能精准区分它们的分子特征和预期效果。
3、揭示耐药机制: 作为一个案例研究,研究团队聚焦于乳腺癌中的雌激素受体(ER),成功复现了 ER 突变(例如 Y537S、D538G)如何导致对现有药物(例如氟维司群)产生耐药性,并指出了潜在的耐药相关基因通路(例如 MYC、DNA 修复通路)。这为克服内分泌治疗耐药提供了新的计算视角。
意义与展望:迈向虚拟细胞时代
UniPert-G2CP的核心是一个通用计算框架,通过统一因果和效应两个视角下的扰动表征,结合多模态分子表征学习和跨域扰动表型迁移学习,显著提升了生物学因果模型在不同数据模态、实验尺度和生物学背景下的泛化能力。该研究的意义不止于开发了一个新算法,更为整个领域带来了新范式——
加速药物发现: 通过“遗传指导化学”,可以用计算机模拟海量化合物的效果,优先筛选出最有潜力的候选药物,大幅降低湿实验的成本和时间。
赋能精准医疗: 模型能考虑到不同细胞系(患者来源)的异质性,未来有望根据患者的基因背景,预测其个性化用药反应,实现真正的“对症下药”。
奠定 AIVC 基础: UniPert-G2CP 提供了一种统一建模“原因”(扰动因子)和“结果”(细胞表型)的通用框架,是推动构建全功能人工智能虚拟细胞(AIVC)的重要一步。
总的来说,UniPert-G2CP的出现,标志着我们在利用 AI 解析复杂生命系统、连接基因型与表型方面迈出了坚实一步。它不仅是一个强大的预测工具,更是一个生成假设的平台,有望在未来帮助我们更快地发现新药、破解疾病机制,最终造福人类健康。
论文链接:
https://www.cell.com/cell/fulltext/S0092-8674(26)00654-9
热门跟贴