作者 | 费斌杰 北京市青联委员 熵简科技CEO

这周末学习了一篇新鲜出炉的重磅论文,题为《Generative design of bacteriophages with genome language models》。

这是人类首次借助基因组语言模型完成完整噬菌体基因组的生成式设计,也让"用 AI 设计基因组"从设想变成了现实。

本文作为学习笔记,如有疏漏敬请指正。论文原文链接放在文末,也可以关注后回复【基因组】获取。

打开网易新闻 查看精彩图片

(1)AI 第一次写出了完整基因组

1977 年,Sanger 团队测出噬菌体 ΦX174 的全部序列,人类第一次读出一个完整基因组。

2003 年,Venter 团队用合成寡核苷酸把它重新拼装出来,人类第一次写出一个完整DNA基因组。

2026 年 8 月,ΦX174 第三次站上了生物科技的里程碑,这次它成了 AI 的设计模板。

斯坦福大学与 Arc Institute 的团队用基因组语言模型(genome language model,简称 gLM)Evo 1 和 Evo 2,生成了数千条自然界从未出现过的完整噬菌体基因组。

他们从中挑出约 300 条进行化学合成,并送进活细菌里测试,最终得到 16 株真正具有感染活性的噬菌体

这是人类第一次在完整基因组尺度上完成生成式设计。

在此之前,AI 生物设计的天花板停在单个基因或小型基因回路上,比如CRISPR-Cas 复合物、转座元件、毒素-抗毒素系统,这些系统的遗传组件很少。

而作为模板的 ΦX174 虽然只有 5.4 kb,却塞进了 11 个基因、至少 7 个调控元件和 2 个识别序列。

如果说此前人们可以用AI设计一个零件,那么这次就是用AI直接设计一台机器,必须处理各组件之间复杂的耦合关系。

值得一提的是,这次AI生成的是只感染细菌、不感染人的噬菌体,模板是一个被研究了半个世纪的天然基因组。

但它证明了一件此前只能靠推测的事:AI从海量基因组里学到的东西,已经足以支撑一次可以被实验验证的完整基因组设计

打开网易新闻 查看精彩图片

(2)基因组语言模型:预测下一个碱基

在开始正式展开实验之前,先搞明白两个基础问题。

第一,什么是基因组语言模型。第二,什么是噬菌体 ΦX174。

基因组语言模型(Genome Language Model,简称gLM)的原理和其他大语言模型一致,只不过ChatGPT是在人类文本序列中预测的下一个词,Evo模型则是在数百万条基因组序列中预测下一个碱基(A/T/C/G)。

正如LLM为了准确预测下一个Token,会自动学会语法结构;gLM为了准确预测出下一个碱基,能自动识别出DNA序列中的特征,即哪些碱基组合能构成可存活的基因组。

看似是四选一,怎么选都有25%的命中率,好像很简单。但是基因组里决定功能的信息,往往编码在相隔数千个碱基的位点之间的相互配合上

要把这类远距离依赖预测准确,模型必须掌握整个基因组的组织规则,而不只是碱基的局部统计频率。

打开网易新闻 查看精彩图片

(3)为什么选择噬菌体 ΦX174 作为实验对象?

噬菌体(Bacteriophage)是专门感染细菌的病毒,结构只有蛋白外壳加一段核酸。

它不感染人、动物或植物细胞,宿主范围通常极窄,往往只能感染某一种细菌,甚至只能感染该细菌的特定菌株。

这篇论文中的 ΦX174 就是一株噬菌体,宿主是大肠杆菌 C(E. coli C)。

论文里反复出现的"宿主特异性"(host tropism)测试,就是在验证生成的噬菌体是否只感染指定的那一株大肠杆菌。

那么为何选噬菌体 ΦX174 呢?

首先,ΦX174的基因组只有 5.4 kb、11 个基因,落在当前 DNA 合成成本可承受的范围内。

第二,训练数据充足。ΦX174 所属的微病毒科(Microviridae)基因组普遍只有 4-6 kb,且已积累大量测序数据,研究者得以用约 15,000 条该科基因组对模型做专项微调。

第三,实验操作性强。大肠杆菌培养快、成本低,测一条生长曲线即可判断噬菌体是否有活性,适合对近 300 个设计做高通量筛选。

第四,安全可控。噬菌体不感染人体细胞,宿主大肠杆菌 C 是特性明确的非致病实验室菌株。

此外,ΦX174 是第一个被完整测序(1977年)和第一个被化学合成(2003年)的基因组,近 50 年的研究积累提供了可靠的参照系。

(4)第一步:测试预训练模型的零样本能力

研究的第一步是确认 Evo 1 和 Evo 2 在未经任何专项微调的情况下,是否已具备生成噬菌体类序列的能力。

这两个模型的预训练语料包含超过 200 万条噬菌体基因组,问题在于:见过如此大量的样本后,模型是否已经隐性地学到了噬菌体基因组应有的样子?这就是所谓的零样本基线能力(baseline capability)。

预训练时,每条基因组序列都附带了分类学标签,这相当于为模型预留了一个可控生成的开关:只要在提示词中写上标签,就能定向输出对应类型的序列。

研究者据此按三大病毒域分别生成:Duplodnaviria(双链 DNA 病毒)、Monodnaviria(单链 DNA 病毒)、Riboviria(RNA 病毒)。ΦX174 属于其中的 Monodnaviria。

打开网易新闻 查看精彩图片

评估工具选用 geNomad,一款广泛使用的病毒分类工具。

先验证它本身可靠:天然噬菌体序列有 89%-100% 被判定为病毒,把同一批序列随机打乱后仅剩 1.9%-11%。

在这个标尺下,Evo 1 生成序列有 19%–33% 被判定为病毒,Evo 2 为 34%–38%,具体比例取决于提示词。

结果明显高于打乱对照、低于天然序列,说明两个预训练模型都已具备生成噬菌体类序列的能力,Evo 2 的基线更强

打开网易新闻 查看精彩图片

BLAST 比对显示,这些序列与已知序列的相似度很低,但预测编码密度和遗传特征仍接近天然噬菌体。

这说明未经微调的 Evo 模型已能生成生物学上合理、同时超出已观测自然演化范围的噬菌体基因组序列

打开网易新闻 查看精彩图片

(5)第二步:微调与约束

实验的第二步是如何把"AI 能生成像噬菌体的序列"推进到"AI 能设计出完整、可能真正有活性的噬菌体基因组"。

首先,他们选定大肠杆菌 C 株及其天然噬菌体 ΦX174 作为试验体系,先用约 1.5 万条微病毒科(Microviridae)序列对 Evo 1 和 Evo 2 做监督微调,使模型具备生成 ΦX174 类基因组的能力

打开网易新闻 查看精彩图片

由于所有 ΦX174 类基因组都以同一段共有序列起始,他们用这段共有序列的前几个碱基作为提示词来定向引导生成。

随后他们建立了三层筛选约束:

  • 基础序列质量:长度 4–6 kb、GC 含量 30–65%、无长同聚物、至少 7 个蛋白能匹配天然噬菌体

  • 宿主特异性:要求生成的刺突蛋白与 ΦX174 刺突蛋白保持 ≥60% 同一性,因为宿主范围主要由刺突蛋白与受体的结合决定

  • 演化新颖性:要求平均氨基酸同一性 ≤95%、基因排布不与 ΦX174 完全雷同、基因总数为 10 或 12 个

打开网易新闻 查看精彩图片

实验结果发现,生成质量高度依赖提示词长度与采样温度的配合

提示词 ≥9 个碱基且低温时,模型只会机械"背出" ΦX174 本体,毫无多样性。

提示词如果只有 1–2 个碱基则约束不足、生成不出 ΦX174 类序列。

只有提示词控制在 4–9 个碱基、温度设在 0.7-0.9 这个窄窗口内,才能同时获得多样性与真实性。

这一步证明,可控生成与系统化设计约束的组合,能够产出既符合生物学规律、又受模板引导、且区别于所有已知天然噬菌体的候选基因组

(6)第三步:湿实验

与纯算法研究不同,生物研究必须经过"湿实验"环节,即真实的实验台操作。

这一步要验证的是:这些计算设计稿能否变成真正有活性的噬菌体

研究者从生成序列中筛出 302 个候选基因组,命名为 Evo-Φ 系列,其中 285 个成功完成合成与组装,另有 17 个因 DNA 合成复杂度过高失败。

活性验证借用了已有的"噬菌体重启"(phage rebooting)方案。

ΦX174 的成熟颗粒携带环状单链 DNA,复制过程中会转为双链,因此把体外拼接好的环状双链 DNA 直接转化进大肠杆菌 C,即可启动完整的生命周期。

判读方式是测菌液浊度(OD600),当细菌生长被抑制时,说明噬菌体有活性。

最终 16 个生成基因组成功抑制了大肠杆菌 C 的生长:Evo 1 的 227 个设计中 12 个存活,成功率 5.3%;Evo 2 的 58 个中 4 个存活,成功率 6.9%。

至此可以确认:基因组语言模型配合推理阶段的引导与筛选,能够设计出真正有活性、且宿主范围可控的噬菌体基因组

打开网易新闻 查看精彩图片

(7)生成噬菌体的适应度谱宽于天然噬菌体

下一步要回答的是:这 16 株活下来的生成噬菌体,各自能力如何

研究者的假设是:生成序列未经自然选择过滤,其功能性突变可能带来比天然噬菌体更宽的适应度谱。

研究者把 16 株生成噬菌体与野生型 ΦX174 按相同感染复数(MOI)混合投入同一批大肠杆菌 C 培养物,通过测序读数的累积倍数变化(FC)追踪各自的相对增长,FC 最高者即在种群中获得了最大的相对优势。

结果 Evo-Φ69、Evo-Φ100、Evo-Φ111 三者胜出,其中 Evo-Φ69 在感染 6 小时后累积 FC 达到约 10–41 倍,高于野生型 ΦX174 和几乎所有其他生成株。

最值得注意的一点是:噬菌体的"自然度"(与天然序列的接近程度)与其竞争力之间没有相关性。

"越像自然的越强"这个直觉在生成噬菌体上不成立,自然度不是适应度的可靠预测指标

结论是:基因组语言模型能在整条基因组尺度上引入多样化突变,产出裂解动力学与适应度谱都远宽于天然种群的噬菌体群体

打开网易新闻 查看精彩图片

(8)生成噬菌体混合物快速克服细菌耐药性

噬菌体疗法的最大瓶颈是细菌快速产生耐药性,研究者据此假设:生成噬菌体的高度多样性可以组成一个更容易突破耐药的混合制剂(cocktail)

他们先培育出两株对野生型 ΦX174 耐药的大肠杆菌 C(CR1、CR2)。

随后他们比较三种攻击方案:单独的 ΦX174、由 16 个天然 ΦX174 类噬菌体加 ΦX174 组成的天然鸡尾酒、以及 16 个生成噬菌体加 ΦX174 组成的生成鸡尾酒。

结果非常明确:三者初始都只能抑制敏感菌、对耐受菌无效,但生成鸡尾酒仅传代 1 次就攻克了 CR1、传代 2 次攻克了 CR2,并持续抑制至少 5 代。

而单独的 ΦX174 和天然鸡尾酒即使传代 5 次仍完全无效,这说明天然噬菌体群的遗传多样性不足以提供所需的适应性变异。

结论是:模型的作用不是产出一株性能更强的噬菌体,而是提供天然种群不具备的适应性变异储备,后续的重组与筛选由自然过程完成

打开网易新闻 查看精彩图片

(9)结语

最后我们来看编辑的总结语:

用 AI 设计复杂生物系统有望彻底改变生物技术。

但此前的进展基本停留在单个基因和蛋白的尺度,全基因组设计一直未能实现。

这项研究用在数百万条天然基因组上训练的生成式模型完成了完整噬菌体的设计,实验验证得到 16 个功能性基因组,在序列、结构和适应度特征上都具备多样性。

其混合制剂迅速克服了已对天然噬菌体演化出抗性的细菌。

这项研究为全基因组尺度的 AI 引导生物功能设计奠定了基础。

打开网易新闻 查看精彩图片

(文毕)

参考资料:

[1] https://www.science.org/doi/10.1126/science.aec2657

对AI投研感兴趣的朋友可以关注我的公众号,欢迎扫码入群,也可以后台回复【入群】。

欢迎关注我的公众号,这里会分享一些前沿科技及投资的最新观点。

如果你是机构投资者,欢迎下载AlphaEngine APP,或登录AlphaEngine网页版体验专业的AI投研神器。

PC端地址:

https://www.alphaengine.top/

APP下载地址:

https://www.alphaengine.top/app