编辑丨王多鱼
排版丨水成文
生命现象看似复杂、随机,背后却隐藏着严密而深刻的秩序。这种生命的内在秩序究竟是什么?长久以来,无数探索者以非凡的智慧、卓绝的努力和极大的耐心孜孜求索,推动生命科学取得了一系列伟大发现。今天,在人工智能时代,新一代科学家正在探索生命奥秘的新路径。
继在蛋白质结构预测等单类生物分子研究领域取得一系列突破后,人工智能正逐步拓展至细胞这一生命活动基本单元的研究。近两年来,虚拟细胞(Virtual Cell)研究逐渐成为全球“AI+生物医药”领域研究与转化的前沿方向,并有望对生物医药、生物制造、农业生产等领域产生颠覆性影响。
然而,如何构建具有实际应用价值的虚拟细胞?什么样的数据才能支撑有效虚拟细胞模型的构建?又应如何科学评估虚拟细胞模型的性能?
2026 年 9 月 9 日,西湖大学医学院/生命科学学院/西湖实验室郭天南教授、西湖实验室朱怡研究员,北京科学智能研究院温翰研究员,北京大学周沛劼研究员作为共同通讯作者(西湖大学医学院助理研究员孙瑞博士、西湖大学医学院助理研究员钱鎏佳博士、深势科技算法工程师李永歌博士和哈尔滨医科大学刘通教授为论文共同第一作者),在国际顶尖学术期刊Nature上发表了题为:An operational perturbation proteomics-based virtual cell model 的研究论文。
该研究开发了一款具有可操作性的虚拟细胞模型——ProteinTalks,用于三阴性乳腺癌的药物疗效预测、肿瘤耐药靶点挖掘并个性化精准治疗指引。该研究展示了一条不同于单纯扩大数据和模型规模的新路径:以真实、连续的蛋白质动态为基础,构建了一个具有一定临床应用潜力的虚拟细胞垂类模型。
近年来,基于转录组数据训练的基座模型被用于探究AI虚拟细胞(AIVC),并将给药后的基因表达变化作为核心预测对象。这些模型通过自监督学习从静态转录组快照中提取细胞状态特征,或通过扰动数据集学习细胞对干预的响应模式,在表征细胞状态与转变方面取得了重要进展。然而,与 RNA 相比,蛋白质作为细胞功能的主要执行者,与表型更直接相关,对基于蛋白质组的虚拟细胞模型的探索才刚刚起步。
在这项最新研究中,研究团队将目光投向了三阴性乳腺癌——这一因缺失雌激素受体、孕激素受体和 HER2 靶点而治疗困难的恶性肿瘤亚型。正因其缺乏明确治疗靶标,需要探索的药物组合空间极为庞大,对数据的需求呈指数级增长,这恰好构成了检验新方法的严峻考验。
面对蛋白质组数据通量的限制,研究团队没有选择单纯扩大样本规模,而是通过引入时间维度来提升数据信息密度。他们设计了时间分辨的扰动蛋白质组学实验,在精心选择的时间节点捕获癌细胞对不同药物的蛋白质网络响应。这种纵向采样策略将静态的分子快照转化为动态轨迹数据,在有限的实验规模内获取了药物作用的时空演化特征,为模型训练提供了关键的动态信息维度。
1、构建大规模时间分辨扰动蛋白质组数据集
该研究以三阴性乳腺癌为主要应用场景。三阴性乳腺癌缺乏雌激素受体、孕激素受体和 HER2 表达,可选择的靶向治疗方案相对有限,具有显著的药物筛选和治疗分层需求。
为确定具有代表性的采样时间,研究团队首先构建了一个包含 2528 个蛋白质组样本的预实验数据集,在药物处理后的 11 个时间点进行采样和测量。结果显示,细胞反应具有相对清晰的早期、中期和晚期结构。基于这一结果,研究团队最终选择 0、6、24 和 48 小时,分别表征基线及不同阶段的药物反应。
研究团队对 16 个三阴性乳腺癌细胞系和 2 个非三阴性乳腺癌细胞系进行了系统研究,使用 63 种临床应用的小分子药物及 59 种药物组合进行扰动。
经过数据质控分析后,ProteinTalks数据集包括:16311 个扰动蛋白质组 DIA-MS 数据文件包含 5585 个定量蛋白质组和超过 3800 万项蛋白质丰度测量值;23482 项细胞毒性测量值。
生物学分析表明,这些时间序列数据能够反映药物作用机制。不同阶段的蛋白质变化呈现出明确的时间特征:药物作用机制相关通路主要在 6 小时富集;随后,调控网络、代谢过程和细胞周期逐渐重塑;而与细胞死亡相关的通路在 48 小时更加突出。
图1. ProteinTalks 工作流程概述
2、ProteinTalks模型构建
ProteinTalks是一个学习扰动条件下的蛋白质组动态和药物表型的联合模型。模型首先将细胞的基线蛋白质组与以蛋白质为维度表征的药物扰动信息(包含药物靶点信息)共同编码为潜在表示,并在潜在表示空间中利用神经常微分方程学习其随时间的连续演化过程,再将对应于 6、24 和 48 小时的状态解码为蛋白质组预测。
在此基础上,模型的表型预测头对基线蛋白质组、预测的蛋白质变化轨迹,以及单药或药物组合中各药物的分子指纹和理化性质特征进行编码融合,并通过卷积层和全连接层(多层感知器)预测单药疗效或双药组合的协同作用概率。蛋白质组重建与药物表型预测两个任务采用固定权重的联合损失函数进行协同训练,因此,表型预测误差也可通过反向传播参与动态表征的学习。
不同于一些预先在预定义表征空间中进行轨迹插值的方法,ProteinTalks 在训练过程中同步学习蛋白质组表征及其在扰动条件下的时间演化,从而使动态预测任务参与模型内部表征的塑造。换言之,模型不仅拟合细胞在给定时间点的蛋白质状态,还刻画这些状态在给定扰动条件下随时间变化的规律。
论文中的比较结果显示,与所比较的静态转录组基础模型相比,ProteinTalks的模型参数量和训练数据点数量均约少三个数量级。
3、从药效预测到跨系统迁移
在留出的测试集中,ProteinTalks 的预测准确率达到 0.86,受试者工作特征曲线下面积(AUROC)为 0.92,精确率-召回率曲线下面积(AUPRC)为 0.84。
在针对 17 种可评估细胞系进行的“留一细胞系”验证中,模型的平均准确率、AUROC 和 AUPRC 分别达到 0.90、0.95 和 0.89。在论文所报告的评估条件下,ProteinTalks 的整体性能优于 3 种转录组基础模型和 4 种传统机器学习模型。
研究团队还考察了模型对训练阶段未见药物的泛化能力,在一个包含 4 种三阴性乳腺癌细胞系、81 种抗癌化合物的独立数据集中,ProteinTalks 在未经微调的情况下取得了 0.90 的 AUPRC、0.90 的AUROC 和 0.88 的准确率。
在少样本迁移实验中,模型进一步应用于来自黑色素瘤、结直肠癌、肺癌和胰腺癌的扰动蛋白质组数据,获得 0.41 的平均 AUPRC 和 0.77 的平均 AUROC,显示出向乳腺癌之外的其他肿瘤细胞迁移的潜力。
图2. ProteinTalks的临床应用验证。a-b. 跨癌种药物响应预测;c-e. 三阴性乳腺癌患者预后分层;f-i. 个体化药物筛选及类器官实验验证。
4、动态蛋白质网络重塑与药物响应相关蛋白
对于药物反应预测模型,准确率并不是唯一需要评估的维度。为此,研究团队引入动态 SHAP 分析,分别计算 6、24 和 48 小时各蛋白质对药效预测结果的贡献。
传统的特征重要性分析通常只提供一个静态排序。动态 SHAP 则能够形成随时间变化的蛋白质贡献图谱:有些蛋白质可能在给药早期具有较高权重,随后逐渐减弱;另一些蛋白质则可能在细胞进入死亡或耐药阶段后,才成为影响模型判断的重要因素。通过这种方式,ProteinTalks 可以将药效预测追溯到具体蛋白质及其时间依赖性变化,为研究药物敏感性和耐药机制提供候选线索。
不过,模型归因并不等同于生物学因果关系。某个蛋白质对预测结果具有较高贡献,并不能直接证明它决定了药物反应,仍需通过进一步的功能实验加以验证。在抗有丝分裂药物的分析中,AKR1C3 被模型识别为重要的药效相关蛋白。研究团队随后在三阴性乳腺癌细胞系 BT20 中利用 siRNA 敲低 AKR1C3,发现细胞对多西他赛的敏感性显著提高。这一结果从侧面验证了模型提出的生物学假设,也表明了ProteinTalks不仅能够预测药物反应,还可以从动态蛋白质网络中筛选值得进一步研究的候选机制。
5、从肿瘤细胞系走向患者来源的模型
完成细胞系层面的验证后,研究团队进一步评估了 ProteinTalks 的临床应用潜力。
在患者来源异种移植模型中,研究团队先使用乳腺癌数据对模型进行适配,随后在 140 个非乳腺癌模型中开展零样本测试。与三种转录组基础模型实现相比,ProteinTalks 的平均 AUROC 提高了 24%。
研究团队还分析了 501 名未经治疗的三阴性乳腺癌患者的基线石蜡包埋肿瘤样本。基于基线蛋白质组和计划采用的治疗方案计算模型评分后,患者可被划分为总生存期和无复发生存期等不同的亚组。该结果初步支持利用蛋白质组进行辅助预后分层的可行性。然而,由于该分析属于回顾性研究,模型的临床效用仍需通过前瞻性研究进一步验证。
在个体化药物筛选方面,研究团队还基于三个三阴性乳腺癌患者来源类器官的基线蛋白质组,对约 3000 种已上市或处于临床开发阶段的化合物进行了虚拟筛选。除顺铂外,模型还筛选出 citarinostat、THZ-1 和 CAY10603 等候选药物。这些化合物在论文报道的类器官实验中表现出比临床标准化疗的顺铂更低的半数抑制浓度。
这是不是一个完整的虚拟细胞?
目前还不是。
ProteinTalks并不是对真实细胞全部结构和功能的数字化复制。它首先聚焦于一项明确任务:从细胞的基线蛋白质组出发,预测药物作用后的蛋白质动态变化,在这个特定场景构建了蛋白质组的虚拟细胞模型,并应用于药物筛选和机制分析。
这项研究为蛋白质组虚拟细胞的技术放大奠定了基础,但从当前的概念验证走向更完整、更普适的虚拟细胞,仍面临若干关键挑战。首先,需要进一步整合能够表征转录与翻译状态的多层组学数据,建立不同分子层之间动态变化的对应关系。其次,现有训练数据的规模、癌种覆盖范围和生物学情境仍需扩展,以支持模型在更复杂扰动条件下的泛化。当前模型主要基于群体细胞水平的蛋白质组数据,尚不能充分解析单细胞异质性及其与群体平均信号之间的差异。更重要的是,如何跨越细胞系、类器官和患者来源模型之间的生物学差异,将模型稳定迁移至真实人体样本和临床场景,仍是下一阶段需要解决的核心问题。随着更大规模、时间分辨且跨层次的数据不断积累,ProteinTalks 所验证的技术路线有望进一步拓展为更接近真实生命过程的虚拟细胞体系。
这项工作的标志性意义在于提出并验证了一条新的研究路径——以时间分辨的扰动蛋白质组作为动态监督信号,构建能够捕捉细胞动态流形的预训练模型,从而提升 AI 对细胞状态与复杂表型的表征能力,并将其应用于药物研发。蛋白质组与功能表型更为接近,而对时间演化规律的显式建模,则有助于推动 AI 的学习从静态相关性建模走向动态机制刻画。二者结合,使 ProteinTalks 在训练数据规模和模型参数量均比所比较的转录组模型少约 2-3 个数量级的情况下,仍取得了更优的整体性能。这将为未来虚拟细胞模型的发展提供重要的方法论参考。
2025 年 3 月 25 日,郭天南团队在Cell Research期刊发表了题为:Grow AI virtual cells: three data pillars and closed-loop learning 的社论。
该文章提出,人工智能虚拟细胞(AIVC)的演进和发展依赖于三个关键的数据支柱——先验知识(priori knowledge)、静态架构(static architecture)和动态状态(dynamic states),这些数据支柱与深度学习算法(deep learning algorithms)相结合,构成了 AIVC 发展的基础。
2026 年 6 月 17 日,郭天南团队等在Nature 期刊发表了题为:Spatial distribution of the proteome in the human body and in cancers 的研究论文。
该研究系统性绘制了迄今为止分辨率最高、覆盖范围最广的人体蛋白质组空间图谱。该研究不仅让我们看清了 13609 种蛋白质在全身 58 种主要组织、251 种亚型中的分布,更揭示了它们在 25 种癌症中的“叛变”模式,为精准医疗和药物开发打开了新的大门,也为未来的“人工智能虚拟细胞”(AIVC)建模奠定了基础。
2026 年 7 月 1 日,郭天南团队等在Nature期刊发表了题为:Towards the construction of a virtual yeast 的前瞻性评述文章,提出了“虚拟酵母”(Virtual Yeast)计划,旨在使用 AI 打造全球首个可预测、可实验验证的虚拟真核细胞,这不是简单的细胞动画,而是一个能模拟酵母从基因表达到代谢产物全链条行为的 AI 系统。
虚拟酵母既是一个概念平台,也是一个操作平台,可用于优化生物合成通路,支持在多种细胞过程中生成和优先排序假设,并加速靶点发现。通过将生物真实性与自主 AI 推理相结合,虚拟酵母为构建虚拟真核细胞和推动合成生物学发展建立了一个可推广的蓝图。
这些工作,以及刚刚发表的 ProteinTalks,都在朝着虚拟细胞的方向努力。郭天南教授表示,目前来看,虚拟细胞模型所能做的还很有限,我们对细胞体系运作的科学规律理解仍极其碎片化,离我们期盼构建的细胞的“数字孪生”还有很大距离。虽然目前还做不到描绘和预测细胞的所有行为,但我们可以先走一小步,迈出一小步,再思考,再讨论,总是可以越走越远。此外,虚拟细胞研究并非要取代生命研究,虚拟细胞研究代表了生命科学研究的一个新阶段——人类尝试更全面的采集生命活动的数据,用更复杂的算法分析这些数据,以获得前所未有的洞见,为疾病的诊治提供更高维度的解决方案。
论文链接:
https://www.nature.com/articles/s41586-026-11001-9
https://www.nature.com/articles/s41422-025-01101-y
https://www.nature.com/articles/s41586-026-10660-y
https://www.nature.com/articles/s41586-026-10574-9
热门跟贴