当地时间 9 月 23 日,Anthropic 宣布成立生命科学研究组,并在美国旧金山湾区建了一座分子生物学实验室。
随公告一起放出的,还有实验室的第一项成果:Claude 在噬菌体(感染细菌的病毒)的 DNA 里,「自己发现」了一类此前从没被描述过的酶系统,取名「阵列相关逆转录酶」(ART)。
图源:网络
不过,Anthropic 也把话说明白了:这套系统的生物学功能还没有定论,离成为成熟的基因编辑工具还差得远。
01 Claude 在噬菌体 DNA 里「看」出了新东西
故事要从今年春天说起。Anthropic 组建了一支生命科学团队,给 Claude 下了一道很笼统的指令:去海量 DNA 数据库里,找值得深挖的新型逆转录酶。
逆转录酶是一类能把 RNA 抄写成 DNA 的酶。接下来,大约 950 个运行高阶模型的智能体会话并行开工,忙了 21 个小时,消耗约 2.1 亿个 token,翻检了约 19.4 亿个蛋白簇,收集到超过 20 万个逆转录酶序列,再筛出约 3500 个候选系统,最后收敛到约 20 个最有价值的对象,写出了 19 份人能读懂的分析报告。
Anthropic 说,同样的工作量,人类专家通常要花几周到几个月。
真正的转折,来自其中一个智能体的「灵光一现」。它在一条巨型噬菌体的原始 DNA 序列旁边,看到了一串间隔均匀、排列规则的重复序列,还在会话日志里写下了一句话——
「这段 DNA 太壮观了,我肉眼就能看到串联重复阵列,这看起来像一个 CRISPR 样的重复阵列。」
原始 DNA 序列截图 图源:Anthropic 的博客
然后,它像人类科学家一样开始自我怀疑:数了重复单元的长度和间距,和已知的逆转录酶系统逐一比对,又查了文献确认没人报道过,最后才提交报告。
Anthropic 特别强调,这个环节没有调用任何现成的重复序列查找工具,那串重复,是模型在通读原始序列时自己「看」出来的。
新型 RT 谱系的智能体发现 来源:Anthropic
被发现的 ART 系统主要由三部分组成:一个逆转录酶、紧挨着它的搭档基因,以及一长串间隔均匀的非编码 DNA 重复序列。因为它的重复排布和 CRISPR 阵列很像,而历史上凡是具备这类特征的系统,几乎都可编程、能对 DNA 做剪切复制粘贴,Anthropic 才拿它跟 CRISPR 类比。
但公司反复强调:ART 到底有什么功能,目前没人知道。
02 张锋:好例子,但只谈「值得研究」
CRISPR 基因编辑的先驱之一、麻省理工学院及博德研究所教授张锋,在审阅预印本后给出了措辞克制的评价:
这是「AI 智能体如何为生物学发现作出贡献的一个令人兴奋的例子」,与逆转录酶相关联的 RNA 重复阵列「确实很有意思,值得进一步研究」,还希望这项工作能鼓励更多科学家探索如何用 AI 支持自己的研究。
张锋 来源:MIT Technology Review
舆论注意到,张锋肯定的是 AI 介入科研这种协作方式,而不是直接背书 ART 就是「下一个 CRISPR」。
这份谨慎不难理解:CRISPR 从 1987 年在大肠杆菌里被当成「奇怪的重复序列」记下来,到确认为细菌免疫系统用了大约 20 年,再到 2013 年才被张锋团队改造成能在哺乳动物细胞里编辑基因的工具。
张锋团队 2025 年发表的 TIGR-Tas 也长着「重复阵列加蛋白」的结构,但那篇论文当时已经证明,它能被加工成向导 RNA、改造后能在人类细胞里实现精确切割。而 ART 离这一步,还差得很远。
03 只有一组湿实验,重跑 10 次全错过
报告对自身局限的披露相当坦率。目前所有证据,主要来自计算分析、结构预测和他人公开的数据;湿实验只做了一组:团队把 ART 系统放进大肠杆菌里表达,通过小 RNA 测序,检测到了多个边界固定的短 RNA 片段。
此前一项中国团队(青岛农业大学、北京化工大学,2022 年发表)的公开转录组数据也显示,噬菌体 SA1 感染 15 分钟时,这个阵列转录出的 RNA,最高能占到噬菌体全部 RNA 的 8%。但逆转录酶的活性、蛋白纯化、噬菌体感染实验都还没做,那些短 RNA 到底是不是它的作用底物,也还没有证实。
阵列相关逆转录酶位点的特征 来源:Anthropic
更有信息量的是可重复性测试。研究团队把同一套搜索流程重跑了 10 次,几乎每次都采样到了 ART 所在的位点,其中两次还专门跟进过这个家族,却没有一次主动去读逆转录酶上游的原始 DNA——10 次全部错过了那串重复。
另外,最初提交的 19 份报告里,ART 只被模型裁判排在第三位,最后是人类研究员凭经验把它挑了出来;后续确认它是独立家族、找齐 95 个成员的工作,也是人和 Claude 协作完成的。换句话说,Claude 独立走完了发现最关键的第一步,验证和兜底仍然靠人。
Anthropic CEO Dario Amodei 也在 X 平台上坦言,这个发现建立在他人工作之上:发布当天,斯坦福大学 Brian Hie 团队(Evo 系列基因组语言模型的核心研发者之一)在 bioRxiv 贴出预印本,用专用模型在另一类逆转录酶 UG27 旁边,找到了成串的非编码 RNA;Hie 本人也审阅过 Anthropic 报告的早期稿件。Anthropic 判断,这种阵列结构在自然界中恐怕不止演化出一次。
回头看这件事,最有意思的可能不是 ART 本身,而是「AI 加人」一起做科研的这种新方式。
Anthropic 这次是今年春天刚组建的生命科学研究组,实验室在湾区,做的是低风险(BSL-1、BSL-2)研究,不碰能感染人类的病原体,所有实验都是人类科学家亲手做的。AI 负责在数据库里不知疲倦地翻、生成假说、写报告;人类负责定义问题、判断哪些值得做实验、亲手验证。
AI 把「翻数据库翻到眼花」的活接过去了,让人类可以把精力放在真正需要动手和判断的地方。ART 本身,现在还只是一串「值得研究」的重复序列——它离变成下一个 CRISPR,还差着好多个实验台的距离。
参考资料:
1.https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
2.https://www-cdn.anthropic.com/22573675ada52a8ca8a97a1a4b4326b2f208a071.pdf
3.网络相关报道
热门跟贴