打开网易新闻 查看精彩图片

如果能够在计算机中准确预测某个基因被敲除、某种药物被加入后,细胞将发生怎样的变化,研究人员就有机会在真正开展实验之前,先完成大规模的“虚拟筛选”。这种能够模拟细胞状态及其对外界干预反应的人工智能虚拟细胞,被视为药物研发和精准医学的重要发展方向。近年来,Connectivity Map、Cancer Dependency Map等项目积累了大量细胞扰动数据,CRISPR技术和单细胞测序也让研究人员可以系统观察基因干预造成的转录变化。然而,基因筛选与化合物筛选长期处于相对割裂的状态:基因筛选可以利用混合式CRISPR文库,在同一细胞群中同时测试数千个基因;化合物筛选却通常需要把不同药物分别放置在不同孔板中,实验成本和操作难度随化合物数量快速增长。面对规模可能超过1063种分子的类药化学空间,依靠实验逐一筛选显然不现实。

两类扰动在信息形式上也存在根本差异。基因或蛋白质通常由核酸、氨基酸序列表示,小分子药物则由原子连接关系和化学结构表示,传统模型很难把它们放入同一个具有生物学意义的坐标系。与此同时,细胞对同一种药物的反应还受到组织来源、基因背景和细胞状态影响。单纯增加某一实验条件下的细胞数量,虽然能够更精细地描述已经观察过的反应,却不一定能帮助模型预测从未测试过的药物或新的细胞环境。如何把相对系统的遗传筛选知识迁移到数据稀缺的药物筛选中,同时保留不同细胞的特异性,因而成为构建人工智能虚拟细胞必须解决的问题。

近日,中南大学李敏与腾讯AI for Life Sciences Lab的姚建华杨帆合作(第一作者为李一鸣博士)在Cell上发表了文章UniPert-G2CP bridges genetic and chemical screens from molecular representation to phenotype modeling提出了两阶段深度学习框架UniPert-G2CP。

打开网易新闻 查看精彩图片

该学习框架的基本思路是同时理解扰动的“原因”和“结果”:UniPert负责建立基因、蛋白质与小分子的统一分子表征,回答“施加了什么干预、不同干预在机制上有多相似”;G2CP负责学习干预后的转录组或形态表型,回答“这种干预会让特定细胞发生什么变化”。在UniPert中,小分子以SMILES字符串和扩展连接指纹表示;蛋白质则结合蛋白质语言模型ESM、多序列比对和图神经网络进行编码。研究人员以全人类蛋白质为参照,通过局部序列比对构建蛋白质相似性网络,从而兼顾完整序列中的全局信息和进化保守基序等局部特征。随后,模型利用包含4250种蛋白质、8533种化合物的53963对化合物—靶点相互作用开展对比学习,让能够相互作用或参与相同生物过程的蛋白质和药物在统一空间中彼此靠近。

结果显示,这个统一空间不仅能够表示化学结构,还能捕捉药理机制。对2812种已知作用机制的化合物进行分析时,UniPert在18类药物中的13类表现出更好的类别区分能力,平均标准化差异由传统化学指纹的1.61提高到1.85。某些作用于GABAA受体不同结合位点的配体,虽然结构差异明显,仍会因为共享药理作用而被模型归入相近区域。对于4417个人类靶蛋白,UniPert在35个药理类别上的聚类效果也明显优于单独使用ESM,调整兰德指数和标准化互信息分别提升76.3%和47.0%。它还能够识别蛋白家族、保守功能基序以及蛋白质之间的调控或相互作用关系,为研究不足的蛋白质和化合物提供潜在功能注释。将UniPert接入GEARS、CPA等扰动预测框架后,模型在未见过的单基因、双基因组合及药物扰动任务上均表现出更好的泛化能力,其中包括对组蛋白去乙酰化酶抑制剂反应的预测。

在第二阶段,研究团队构建G2CP,采用“遗传筛选预训练+化合物筛选微调”的迁移学习方案。模型先从较系统的CRISPR扰动数据中学习不同细胞的遗传背景和通路反应,再使用数量有限的药物数据适配化合物特有的作用模式。基于LINCS转录组数据的测试表明,在仅使用20%化合物作为训练数据时,完整遗传预训练使模型在五种细胞环境中的总体预测表现提高375.4%;预训练基因数量从约500个增加到约2500个时收益最为明显,之后继续增加的改善趋于有限。进一步分析发现,使用特定细胞系的遗传数据进行预训练,通常优于简单混合多个细胞系的数据;根据该细胞中的基因必需性选择预训练基因,也比随机选择更加高效。这说明模型不是把所有细胞平均化,而是在学习不同细胞环境下真正重要的遗传依赖关系。

研究人员随后为4994个基因和7860种小分子建立了统一的“原因空间”,并针对五种癌细胞系训练表型预测模型,形成超过8200万对扰动关系。UniPert在一个独立的化合物—靶点数据集上,能够显著富集真实配体,说明其有望用于寻找此前未知的药物—靶点联系。将分子相似性与细胞表型相似性联合分析后,团队还量化了不同药理类别的细胞敏感性。例如,雌激素受体激动剂在MCF7乳腺癌细胞中呈现最强的“原因—结果”一致性,相关系数达到0.73。围绕雌激素受体ESR1的案例研究进一步表明,模型能够区分配体结合域、DNA结合域等区域的贡献,并模拟Y537S、D538G等耐药相关突变。预测结果还指向SRC升高,以及DUSP3、RRS1表达变化和MYC、DNA修复、上皮—间质转化、脂肪酸代谢等潜在耐药程序,为理解内分泌治疗反应提供了可检验的线索。

UniPert-G2CP的重要意义,在于把过去相对独立的基因筛选和药物筛选连接为一个统一的生物因果建模问题:模型既表示干预分子的结构与功能,也预测干预在具体细胞环境中造成的后果。遗传筛选因此可以成为药物筛选的“知识底座”,帮助研究人员用更少的化合物实验预测更广阔的化学空间;分子层与表型层的联合分析,则有助于发现细胞类型特异的药物敏感性、作用机制和耐药通路。它推动虚拟筛选从主要关注分子能否结合靶点,进一步走向预测药物在不同细胞中究竟会产生什么效果。

不过,这项工作仍有清晰边界。较大的分子嵌入会增加计算和内存成本;当前遗传编码主要面向蛋白质编码基因,尚不能充分描述非编码DNA和RNA扰动;不同实验平台产生的表型数据也缺少统一标准,图像表型任务的表现仍受样本量和数据质量限制。此外,模型提出的药物机制和耐药线索属于计算预测,仍需通过细胞、动物乃至临床研究验证。即便如此,这项研究已经展示了一条颇具潜力的路线:以统一分子语言连接遗传与化学干预,再以细胞背景为条件预测其表型结果,从而为人工智能虚拟细胞、低成本药物发现和个体化治疗提供更接近真实生物系统的计算基础。

打开网易新闻 查看精彩图片

https://www.cell.com/cell/fulltext/S0092-8674(26)00654-9

学术合作组织

(*排名不分先后)

打开网易新闻 查看精彩图片

战略合作伙伴

(*排名不分先后)

推荐直播

转载须知

【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。

BioArt

Med

Plants

人才招聘

打开网易新闻 查看精彩图片

点击主页推荐活动

关注更多最新活动!

打开网易新闻 查看精彩图片