/ 全文约 1200 字

阅读约需 3 分钟

播客 | 生命前哨

制作 | 百岁新我

几个月前,一家刚成立两年的AI制药公司Xaira Therapeutics公布了一个数字:49亿。

这不是它们公司的市值,也不是融资额——而是它的虚拟细胞模型X-Cell的参数规模。这个模型能预测基因被敲除后细胞会如何响应、药物处理后转录组会怎样变化。

为了训练它,团队构建了包含2560万个细胞的扰动数据集,覆盖16种生物学背景。一个模型在电脑里跑完一轮预测只需要几个小时,而传统实验室完成同样的动作可能需要几个月的时间。

打开网易新闻 查看精彩图片

这就是虚拟细胞——一种用AI构建的细胞数字模型。

传统的药物研发成本高、周期长,并且即使是最顶尖的团队,也无法精准预测一种药物或基因编辑手段进入人体细胞后,会引发什么样的连锁反应。如果在电脑里有一个“细胞数字孪生”,就能在干实验里做成千上万次预演,看看细胞是会恢复健康,还是会走向恶变,从而大大提高成功率,缩短研发周期。

听起来很美好对吧?

但是虚拟细胞目前面临着一个根本性的挑战:我们还没有“细胞的蛋白质数据库”蛋白质结构预测之所以能被AI攻克,是因为有了数十年积累的超过25万个实验解析结构作为训练数据。而在细胞层面,还不存在这样的基础设施。Biohub今年4月宣布投入5亿美元启动虚拟生物学计划,目标就是在五年内生成驱动虚拟细胞模型所需的多模态数据集。

打开网易新闻 查看精彩图片

由扎克伯格夫妇(马克·扎克伯格与普莉希拉·陈)联合创立的生物医学非营利研究机构 Biohub

在数据集还没填满之前,现在的AI公司们是如何进行预测的呢?

目前主流的路线有两种,一种聚焦在转录组——我们开头提到的X-Cell就是其中的典型代表。另外像Arc研究所开发的,用来预测干细胞、癌细胞和免疫细胞对药物反应的STATE模型也属于这一类。它们的核心逻辑,都是给AI喂入海量的“单细胞RNA测序”数据。

而另一条路线则是从“批量转录组”入手,比如Ginkgo Bioworks旗下的AI部门发布的“虚拟细胞药理学计划”,就不是测单个细胞,而是看大量细胞的整体反应,这种方式覆盖的基因更多、信号更稳定,更适合快速筛选药物作用的模式,而不是捕捉每个细胞的细微差异。

但两种路径都面临同一个问题——细胞不仅仅是它的RNA

打开网易新闻 查看精彩图片

Hani Goodarzi 教授

Arc研究所的科学家Hani Goodarzi打过一个很生动的比方:这就好比大语言模型,虽然只读文本就能变得非常强大,但纯文本依然无法代表人类交流的全貌,因为它少了语气、表情和动作。RNA只是基因表达的中间产物,细胞内部蛋白质的数量、染色体的折叠状态、代谢变化,乃至蛋白质在细胞内部的物理位置,都共同决定着细胞的命运。

基于这种反思,下一代虚拟细胞模型正在向“多尺度”进化,试图把“空间”和“时间”这两个关键维度补齐。从简单的基因数据堆叠,到融合空间蛋白分布,再到模拟时间的动态信号,虚拟细胞的演进路线正在变得越来越清晰,那个奇点正在离我们越来越近。

* 文章内容仅供参考,不构成任何建议

since 2015.

来源/ Genetic Engineering and Biotechnology News