来源:市场资讯

(来源:BioAI Frontier)

—— 多模态分子表征 × 遗传→化学迁移学习 × 因果-效应空间 × in silico 药物筛选

一句话

• 要解决的事:基因扰动(CRISPR 敲基因)和化学扰动(小分子加药)是两套割裂的筛选体系——尺度不同、模态不同、数据量差几个量级,长期没法放进同一个模型里一起建模。

• 这篇的做法:先用对比学习把基因/蛋白和小分子编码进同一个语义空间(UniPert),再用「基因预训练 + 化学微调」把便宜、丰富的基因筛选知识迁移到稀缺的化学筛选上(G2CP)。

• 为什么重要:在 LINCS 上把化学扰动预测的相关性拉高 375.4%,并把「分子层面的因(cause)」和「细胞层面的果(effect)」放进一个联合空间——这正是 AI 虚拟细胞(AIVC)缺的那块拼图。

一、导读:两套筛选,一道鸿沟

要造一个能预测「任意扰动会把细胞变成什么样」的 AI 虚拟细胞(AI virtual cell, AIVC),绕不开两类核心扰动:基因扰动(敲除/敲低某个基因)和化学扰动(加某个小分子药)。偏偏这两套体系在现实里几乎是分开跑的,中间隔着一道很难跨的鸿沟。

第一道是尺度和通量的鸿沟。基因筛选可以做到基因组规模——针对约 4,500 个可成药基因,用混池(pooled)CRISPR 一次并行敲成千上万个,靠单向导 RNA 测序去卷积,数据又多又系统。化学空间则大到离谱,估计超过 10⁶³ 种化合物,而实验又基本是分孔板(arrayed)一个一个测,受制于加药条件,通量极低——即便是目前最大的化学扰动图谱,也只覆盖了几千个化合物。全景式的化学筛选实验上不可行,只能靠 in silico 计算来补。

第二道是分子模态的鸿沟。大生物分子(基因/蛋白,以核苷酸/氨基酸为单位)和小分子(以原子为单位)在尺度和结构上完全是两种东西,把它们塞进同一个可解释的向量空间,既需要生物学先验知识,又容易在数值化的过程中丢掉分子的关键局部信息(比如蛋白的进化保守区、化合物的功能基团)。

第三道是异质性和泛化的鸿沟。同一个扰动在不同细胞背景里的表型可能天差地别,而已有模型往往被共性模式主导,把这种「细胞特异性」信号给抹平了,一到没见过的新条件(OOD)就失灵。

UniPert-G2CP 就是冲着这三道鸿沟来的,是一个两阶段的深度学习框架。作者来自中南大学、腾讯 AI for Life Sciences、清华、香港城市大学和香港浸会大学。

打开网易新闻 查看精彩图片

1:UniPert-G2CP 总览。A 为 UniPert——把大生物分子和小分子编码进统一的多模态语义空间;B 为 G2CP——「基因预训练 + 化学微调」的迁移学习;C 为化学扰动效应预测(基因预训练带来 +375.4%);D 为因(context-free)与果(context-aware)两类空间共同支撑 AIVC;E 为下游应用。

二、用了什么技术、什么原理

▍ 1. UniPert:把「基因」和「药」放进同一个空间

第一阶段 UniPert 是一个基于对比学习的多模态分子表征模型。目标只有一个:让功能相似的基因、同作用机制(MoA)的化合物、以及参与同一条通路的跨域扰动,在向量空间里彼此靠近。两条模态各有各的编码方式:

• 小分子这一路:输入 SMILES 字符串(保证在化学空间里可扩展),先用二进制拓扑扩展连接指纹 ECFP 做子结构刻画,再投影成稠密嵌入,细化功能基团表征,方便和基因侧对齐。

• 基因/蛋白这一路:蛋白是细胞功能的基本单元,所以 UniPert 编码的是靶基因对应的氨基酸序列。直接用蛋白语言模型(PLM,如 ESM)压缩全局向量会丢掉局部序列特征,于是它把 PLM 和传统的多序列比对(MSA)结合,再用图神经网络(GNN)捕捉全局上下文和保守 motif。

蛋白侧的具体做法值得说清楚:对每个查询蛋白,先用 Smith-Waterman 局部比对,在一个全基因组参考蛋白集(n = 19,187)里找相似序列,构建一张以查询蛋白为中心的图——节点是蛋白、边编码两两序列相似度;节点初始嵌入来自 ESM,再经 GNN 的消息传递机制在相似序列间传播信息。这套「PLM + MSA + GNN」的混合策略,让模型能识别保守的功能区段。

训练用的是双重优化,同时建立模态内和模态间的关系:

• 模态内(intra-modal):图自监督学习——对图做随机的边/节点特征 dropout,要求同一蛋白在不同图变体下的节点嵌入保持一致,以此补充序列比对、稳住 PLM 表征。

• 模态间(inter-modal):对比学习对齐——用一大批化合物-靶点相互作用(CPI)数据把「拉近/推远」学出来。拉近的是有相互作用、且高度相似的对,推远其余的对。

对齐用的 CPI 规模:53,963 对相互作用,涉及 4,250 个蛋白和 8,533 个化合物。对比学习把这些相互作用的化合物-靶点对在空间里拉到一起,从而捕捉它们在通路里共享的角色。

▍ 2. G2CP:用便宜的基因筛选,去补贵的化学筛选

第二阶段G2CP(Genetic-to-Chemical Perturbation)是把 UniPert 装进扰动效应预测器后做的迁移学习,核心策略八个字:「基因预训练 + 化学微调」。逻辑其实很生物:化学扰动经常通过汇聚到共同的信号级联和调控程序,去模拟基因扰动的效果——那就先在数据又多又系统的基因筛选(约 5,000 个基因)上预训练,学到细胞的遗传背景和响应模式,再在有限的化学筛选数据上微调,适配化合物的响应动力学。

Stage 1UniPert :SMILES ─(ECFP→投影)─┐

├─►统一分子语义空间U

蛋白序列 ─(ESM+MSA+GNN)─┘(对比学习 · 53,963 CPI)

Stage 2G2CP:U ─► 基因预训练(~5,000 基因) ─► 化学微调(少量化合物) ─► 预测

P_gene(遗传背景)P_chem(化合物响应)

这么做最直接的收益是数据效率。在 LINCS 转录组数据上,不做基因预训练时,PCC 只能随化合物数量慢慢爬;而做了完整基因预训练的模型,在只用 20% 化合物的情况下就实现了 375.4% 的整体提升——相当于用一小部分化学数据,换到了原本要海量加药实验才能得到的预测能力。

▍ 3. 因与果:两类空间,共同支撑虚拟细胞

UniPert 和 G2CP 合起来,刻画的是两类互补的空间,这也是全文的顶层框架:

• 因(cause)空间——context-free、与细胞背景无关。就是 UniPert 学出来的分子扰动表征,普适、可解释、可扩展,回答「这是个什么样的扰动」。

• 果(effect)空间——context-aware、随细胞背景变化。就是 G2CP 预测出来的扰动后表型状态,跨细胞、跨域、可泛化,回答「这个扰动在这种细胞里会造成什么后果」。

把「分子层面的因」和「表型层面的果」显式地分开又对齐,正是 AIVC 建模所需要的底层结构——既能做普适的分子注释,又能做上下文相关的表型预测。

三、UniPert 的表征能annotate「被冷落」的分子

第一组应用检验的是 UniPert 这个「因空间」够不够好。生物医学研究长期集中在少数被研究透的分子上,大量蛋白和化合物是「understudied」的。好的表征应该能靠相似性,把这些冷门分子挂靠到已注释的对应物上。

• 化合物侧:在 2,812 个已知 MoA 的药物上,UniPert 嵌入的 MoA 类别语义可分性(标准化均值差 SMD)比 ECFP 高 14.4%;在 18 类 MoA 中的 13 类都更好。典型例子是 GABAA 受体的正向别构调节剂(PAM)——地西泮、佐匹克隆、丙泊酚等结构差异很大、ECFP 相似度很低,UniPert 却能把它们在空间里聚到一起。

• 蛋白侧:在 4,417 个人类蛋白靶点、按专家整理的层级 PCL 注释上,UniPert 比 ESM 的聚类调整兰德指数(ARI)高 76.3%、标准化互信息(NMI)高 47.0%;还能正确聚类锌指、驱动蛋白(KIF)、微管蛋白等家族,把未分类的 CENPE、FOXM1 定位到合理位置,并捕捉到 PD-1/PD-L1 复合物亚基间的相互作用。

四、把 UniPert 当编码器,预测「没见过的」扰动

好的表征应该能提升下游预测器在 OOD(没见过的扰动)上的泛化。作者把 UniPert 作为序列化的扰动编码器,插进两个代表性框架 GEARS 和 CPA 里,横跨基因和化学、单基因到组合、小规模到大规模做了系统评测:

评测场景

数据集

UniPert 的表现

单基因扰动

Dixit

三项指标全面优于 PseAAC / ESM / OntoProtein 等编码器

双基因组合扰动

Norman

在「两个基因都没见过」的最难场景优势最大

未见药物扰动

sciPlex3

PCC / MSE 均优于 chemCPA(20% 通路留出做测试)

HDAC 逐药留一

LINCS-HDAC

9 个高响应抑制剂上整体更优,能抓到 ZBG/cap 关键结构特征

表1:UniPert 作为编码器在多种未见扰动场景下的泛化。相比只学序列的 ESM,UniPert 额外注入 CPI 信号和功能上下文,因此在需要外推到新组合、新化合物时更稳。

为什么对组合扰动尤其有用?作者的解释是:ESM 靠自监督学序列内特征,更受益于训练里见过的基因;而 UniPert 额外带了相互作用/网络层面的上下文,支持向新组合外推。对未见的 CBL+CNN1 组合,它对扰动后前 20 个差异表达基因的预测,比原始 GEARS 更贴近真实响应。

五、G2CP:让 in silico 药物筛选又快又准

这是全文的「主菜」。作者在 LINCS(5 个癌细胞系)和 CPJUMP1(细胞画像)上,系统性地变化「基因预训练比例」和「化学微调比例」两个旋钮,对照三个基线做交叉评测。核心发现:

• 预训练是关键:不做基因预训练时,PCC 随化合物增多才缓慢上升;做了完整预训练的模型,在 5 个细胞背景下都更稳更准,20% 化学数据即达 375.4% 提升。

• 拐点在 10%→50%:基因预训练比例从 10% 提到 50% 收益明显,再往上只有小幅改善——说明预训练用约 2,500 个基因可能就够拿到大部分好处。

• 数据少时更救命:化学扰动本来就少的细胞系(如 HT29,<4,000 化合物),即便给到 80% 化学数据也难达标,G2CP 靠基因预训练补上了这块短板。

• 怎么选基因、怎么切化合物有讲究:按细胞特异的基因必需性来选预训练基因(context-specific / context-integrated)比随机选更高效;按化合物 ECFP 相似度切分训练/测试会带来最大难度落差,但预训练模型受影响更小。

打开网易新闻 查看精彩图片

4:G2CP 让基因指导的化学扰动预测又省又准。A 为真实的体内外靶向药发现流程;B 为 in silico 版的 G2CP;C 为 5 个 LINCS 细胞系的基因/化学扰动计数(可见化学远少于基因);E 为 PCC/MSE 随化学数据比例的变化(完整基因预训练的绿线始终高于无预训练的橙线);F 为预训练×微调比例的性能地形;G/H 为预训练策略与化合物切分方案的影响。

六、因-效应联合空间:读出细胞特异的药理敏感性

验证完「因」和「果」各自好用,作者把它们合起来做联合分析——这一步指向精准医学里最难的问题:同一类药在不同细胞背景里为什么反应不同。做法是对每个药理类别(PCL),同时算一个分子连接矩阵 CS_cause(UniPert 给的)和多个上下文相关的表型连接矩阵 CS_effect(G2CP 给的),再用 Mantel 检验下的 Spearman 相关 ρ衡量二者的一致性:ρ越高,说明该 PCL 在这个细胞背景里,分子相似越能稳定地翻译成一致的转录响应,也就是细胞敏感性越强。

覆盖规模:4,994 个基因 × 7,860 个小分子 × 5 个癌细胞系,超过 8,200 万个两两对。在一批经过验证的 PCL 上,所有 PCL 都给出正的因-效应对应(ρ > 0),但敏感性各不相同。最典型的是雌激素受体(ER)激动剂:在 MCF7 乳腺癌细胞里敏感性最高(ρ = 0.73),与 ER 信号在乳腺组织中的核心地位一致;PPAR 激动剂则在 HT29 和 PC3 里最敏感。

七、案例:用 in silico 扰动解读 ESR1 与内分泌耐药

最后作者拿 ESR1(编码 ERα,ER⁺ 乳腺癌的主要驱动因子,也是内分泌治疗的靶点)做了一个机制解读的案例,很能体现这套框架的「可解释」价值。他们在 MCF7 里组装了一个 in silico 交叉扰动面板,横跨 ESR1 的各个结构域、常见耐药突变、以及 SERM/SERD 类药物:

• 结构域与突变:野生型 ESR1 分 AF1、DBD(DNA 结合域)、hinge、AF2/LBD(配体结合域);复现性耐药突变 Y537S、D538G 会模拟一种不依赖雌二醇的组成型激活状态。

• 药物:雌二醇(E2,天然激动剂)、SERM(他莫昔芬、雷洛昔芬)、SERD(氟维司群、elacestrant)。

在「因」空间里,UniPert 复现了稳健的 ESR1-配体连接,并解析出功能相关的亚序列贡献:LBD 和 DBD 与配体的耦合,强于 AF1 和 hinge。在「果」空间里,MCF7 对 ESR1 敲除和 ER 激动剂处理都表现出一致的低连接性,与其高度依赖 ER 信号相符。进一步比较 978 个 landmark 基因的响应分布发现:hinge 和 AF1 扰动最接近对照,而突变效应被表型放大(Y537S → D538G → 双突变,趋向一种类似 DBD 破坏的状态)。

差异响应基因把一批已报道的乳腺癌标志物拎了出来:CCNA1、NCK1、HSPB1 上调,氟维司群处理下 SRC 升高;DUSP3、RRS1 下调,并伴随 MYC 相关、DNA 修复、上皮-间质转化(EMT)、脂肪酸代谢等通路的差异富集——这些都是和耐药相关的基因与程序。换句话说,纯计算的扰动预测,给出了生物学上说得通的耐药机制假设。

打开网易新闻 查看精彩图片

6:in silico 因-效应空间解读 ESR1 扰动响应与耐药。A 为野生型 ESR1 的结构域与调控机制示意;B 为 UniPert 算出的 ESR1 突变/结构域与各 ER 配体的分子连接;C 为因-效应两空间里的 ER 激动剂连接;E 为 89 个差异响应基因的扰动效应热图;F 为通路富集(NES)。

八、局限与展望

作者在讨论里给的边界很清楚,几条值得单独拎出来:

• 表征维度的取舍:更大的嵌入容量更强,但计算和内存成本也涨;未来可考虑对高度相似节点做图压缩/剪枝来提效。

• 只到「编码基因」为止:目前无法显式表示编码基因之外的扰动(如调控非编码区的干预);未来可引入 Evo(DNA)、RNAErnie(RNA)等更细粒度的生物序列语言模型。

• 表型读出资源稀缺:多域、协调一致的表型数据本身就贵且少,限制了框架的更广采用;当前主要用转录组,图像画像和蛋白组、表观组等多组学是明确的扩展方向。

• 这是资源/方法论工作:它证明的是「基因筛选能系统地补化学筛选」这条路走得通,把虚拟筛选从只看分子结构,推向「分子关系 + 上下文表型后果」的联合建模——但离临床级预测仍有距离。

技术速览一卡通

• Stage 1 · UniPert:对比学习的多模态分子表征。小分子走 SMILES→ECFP→投影;蛋白走 ESM(PLM)+MSA+GNN;用 53,963 对 CPI(4,250 蛋白 / 8,533 化合物)做模态间对齐 + 图自监督做模态内对齐。

• Stage 2 · G2CP:「基因预训练(~5,000 基因)+ 化学微调」的遗传→化学迁移学习;LINCS 上 20% 化学数据即 +375.4% PCC。

• 顶层框架:context-free 的「因空间」(UniPert 分子表征)+ context-aware 的「果空间」(G2CP 表型状态),两者对齐,支撑 AI 虚拟细胞(AIVC)。

• 联合分析:4,994 基因 × 7,860 分子 × 5 细胞系;用 CS_cause 与 CS_effect 的 Spearman ρ 量化 PCL 细胞敏感性(ER 激动剂在 MCF7 ρ=0.73)。

• 案例价值:ESR1 结构域/突变 × SERM/SERD 的 in silico 面板,给出 CCNA1、SRC、MYC/EMT 等耐药相关的机制假设。

论文:Li Y, Zeng M, Zhu J, Liu L, Wang F, Huang L, Yang F, Li M, Yao J. UniPert-G2CP bridges genetic and chemical screens from molecular representation to phenotype modeling. Cell 189, 1–18 (2026). DOI: 10.1016/j.cell.2026.06.005

开放获取(CC-BY 4.0) · 通讯作者:Fan Yang、Jianhua Yao(腾讯),Min Li(中南大学) · 插图均来自原文