AI设计的蛋白质,正在悄悄进入实验室和数据库。问题是,没人能一眼看出它到底来自自然界,还是来自某个模型。

Google DeepMind在2026年9月30日发布了一项叫SynthID Bio的技术,专门给AI设计的蛋白质等生体分子埋进一种可检测的“水印”。关键在于,这个水印不破坏蛋白质本身的功能,而且不只是数字文件里能查,连实际合成出来的蛋白质也能验出来。

打开网易新闻 查看精彩图片

这件事的背景并不复杂。DeepMind此前已经做出了预测蛋白质立体结构的AlphaFold,以及设计能结合目标蛋白的新蛋白质的AlphaProteo。AI能造出自然界里不存在的新生体分子,随之而来的就是一个识别问题:一段陌生的序列,到底是自然界里找到的,还是AI生成的?

打开网易新闻 查看精彩图片

水印是怎么埋进去的

蛋白质由多个氨基酸排列而成。SynthID Bio在给氨基酸序列加水印时,做法是在不大幅改变蛋白质性质的前提下,对生成序列时氨基酸的选择做轻微诱导,让配列带上一种事后可以统计检测出来的特征。如果是立体结构数据,则通过微调原子坐标来嵌入同样的识别信息。

换句话说,水印不是贴在表面的标签,而是织进分子本身的特征。这也是它能从实际合成的蛋白质里被验出来的原因。

透水印之后功能还在不在,是这项技术能不能用的前提。DeepMind把蛋白质设计AI的AlphaProteo和生成氨基酸序列的ProteinMPNN组合起来,针对VEGF-A、SARS-CoV-2的刺突蛋白RBD、PD-L1这3种标的设计了结合蛋白。

实验室检测的结果是:带水印的蛋白质,和不带水印的蛋白质相比,设计成功率和结合强度处于同一水平,序列的多样性也保持住了。DeepMind的报告说法是,他们做出了“带着水印、同时在生物学上能发挥功能的蛋白质结合分子”。

连AlphaFold 3的预测结构也能带上

打开网易新闻 查看精彩图片

SynthID Bio还能嵌进AlphaFold 3的蛋白质立体结构预测里。DeepMind微调了AlphaFold 3内部扩散网络的一部分,把生成水印的机制直接做进模型本身。按发布说法,预测精度维持住了,水印几乎能被完全检测出来,即使给数据加上一点噪声、或者稍微改动坐标,也还是能查出来。

这项技术被寄望用在几个地方:

  • DNA合成时的筛查——如果从AI生成的序列里能查到可验证的水印,就能作为判断它来自某个带安全措施的模型的线索
  • Protein Data Bank、UniProt、GenBank这类生物学数据库,用来识别AI生成的数据

但DeepMind也说得很清楚,SynthID Bio本身解决不了生物安全上的全部问题。面对有意的改篡,如何让水印更强,是摆在面前的课题。他们也在考虑把它和记录生成来源的元数据、以及AI生成生物数据的登记系统配合使用。

除了蛋白质,DeepMind还和斯坦福大学、Arc Institute合作,把SynthID Bio埋进了基因组生成AI“Evo 2”设计的噬菌体基因组里。初期实验确认,带水印的噬菌体能在细菌培养环境中正常工作。DeepMind表示,今后会公开技术论文,谈的不只是蛋白质,还有更复杂的生物学数据上的应用。

水印这件事,在图像、音频、视频、文本上已经做了很久,SynthID就是这套思路的产物。现在它被搬到了合成生物学里,成了一个概念验证。AI造出来的东西越来越多,怎么在它身上留下“我来自哪里”的痕迹,正在从数字世界延伸到分子世界。