新智元报道
AlphaFold几乎把自然界2亿多种蛋白质结构预测了一遍。
David Baker想走另一条路:不预测自然造了什么,而是造出自然从没造过的东西。
今年8月的一个早上,研究助理Jack Boylan调出前一晚的实验结果。
实验室的DNA测序仪旁,试管里泡着一大批人工设计的DNA序列,都是自然界从未进化出来的。哪条能用、哪条是废品,全靠这台机器一次读完、一次报出。
不久前的一次实验,他们把600万条这样的设计序列一起丢进同一支试管,同时测。换成传统做法,光是测这一批就得花上好几年。
Boylan所在的这家机构叫AI BioDesign,9月3日刚在西雅图对外亮相,距离艾伦研究所总部不过几分钟路程。
它背后是保罗·艾伦遗产体系砸下的9460万美元,领头人正是2024年诺贝尔化学奖得主Baker和基因组学家Jay Shendure。
左:David Baker,2024年诺贝尔化学奖得主。右:Jay Shendure,基因组学家。两人共同领衔AI BioDesign。
在这个算力决定一切的时代,他们不打算拿这近一亿美元去训一个更大的模型,而是要在那支试管上做文章。
劫持细胞机器
在试管里做大并发
他们的玩法是打造一个狂奔的闭环:
AI提出设计,实验室造出来并测量,结果回馈模型,再由模型决定下一轮造什么。
听起来是大家熟悉的「设计-构建-测量-学习」,但真正不一样的地方,是这个圈是怎么转起来的。
这里没有铺满机械臂的自动化车间,「规模不来自机器人,来自在试管内部做并行。」执行总监Jesse Gray说。
所谓试管内部的并行,用Shendure的话说,就是劫持进化留给人类的那条细胞流水线,拿它去造、去测几百万个分子。
具体做法是:把几百万条设计序列一起丢进同一支试管,让细胞把它们各自造出来,再放到同样的条件下跑一遍。最后交给测序仪,一次读出哪些能用、哪些是废品。
这样一来,模型学「设计的规则」时,面对的就是海量例子,而不是自然产生的那有限的一小撮。
这类设计出来的分子长什么样?
下图是Baker实验室此前设计的一个结合蛋白:紫色与粉色部分由AI设计,白色是被它整个裹住的胰淀素。
AI设计的胰淀素结合蛋白表面渲染图。
实验不再验证结论
只为喂饱模型
更有意思的是这条产线的KPI。
实验室按五六人一组编成小队,各自死磕一个具体的生物设计难题,旁边配着机器学习团队随时接应。
每一轮实验的成绩怎么算?不只看做出了多少个能用的分子,更看模型从这一轮里学到了多少。
传统实验室的逻辑是先有假设,再设计实验去验证。
AI BioDesign把顺序倒了过来:实验首先是给模型出的「练习题」,按「设计—构建—测量—学习」的循环一轮轮转下去。
每轮结束,机器学习团队会根据结果挑出模型最没把握、最可能学到新东西的那批序列,定下一轮测什么。测完的数据回流给模型,模型更新后再吐出下一批设计。
目标是让每次实验带回的信息量最大,而不是尽快凑出一个成品。
过去是人指挥实验台,现在,实验台开始听AI的安排。
艾伦研究所研究助理Jack Boylan(左)与AI BioDesign执行总监Jesse Gray,在实验室的DNA测序仪前。
造自然界没有的蛋白
他2003年就做到了
这不是一个「AI造出了自然界没有的蛋白质」的故事。
这件事,Baker早在23年前就做到了。
2003年,他的团队用Rosetta软件设计出一个名叫Top7的蛋白:93个氨基酸,折叠方式在当时所有已知蛋白里都找不到先例。
2024年的诺贝尔化学奖,一半给了计算蛋白质设计的Baker,另一半给了预测蛋白质结构的AlphaFold团队的Demis Hassabis和John Jumper。
2024年10月9日,David Baker接到诺贝尔奖委员会的电话。
如果说AlphaFold解决的是「读」:预测这串氨基酸会折成什么形状,那么Baker解决的就是「写」:为了实现某个功能,我该造个什么形状。
后来,读的那一半这几年被推上了神坛,AlphaFold2和同期那批大模型采用的是同一路打法:吃的都是人类已经攒好的数据。
「写」这一半没这个便宜可占。自然界没有的东西,数据库里根本查不到,只能自己造出来、自己测出来。
于是,它一直就憋屈地卡在一个现实的泥潭里:
AI一晚上能吐出几十万个候选设计,传统实验室一年做几百个就算高产。
设计与验证之间巨大的落差,才是这个领域一直难以击穿的天花板。
用Baker的话说,这个项目真正的突破,是AI的速度第一次开始匹配合成生物学的实验能力。
一边一天生成几百万个候选设计,另一边一管子测掉几百万个,这两只齿轮终于咬合上了。
不追通用大模型
重仓实验基础设施
当大家都在追一个能回答所有问题、甚至能模拟整个虚拟细胞的通用大模型时,Baker和AI BioDesign选了另一条路:
做一批只管具体难题的小模型,再为每个问题专门造出海量新数据去喂它。
道理不难懂。
自然进化留下的样本,只是它在几十亿年里试出来的一小撮解,拿这一小撮去学普适的设计规则,本来就有很大的缺口。
要补上这个缺口,就得缺什么数据、自己造什么数据。而造数据这件事,不能靠堆显卡,要靠试管、测序仪和实验台。
上一阶段大家抢的是算力基础设施,下一阶段要抢的,是实验基础设施。
更反直觉的是,这局哪怕押赢,成果也全都白送。模型、数据集、实验方法、试剂、基准,全部开放。
万一别人拿这些数据做出了赚钱的药怎么办?
总裁Rui Costa说得很轻松:「如果有很多公司拿这些数据去把世界变好,那是我们的运气。」
狂飙之下也有隐忧。批量制造自然界不存在的分子,必须防范意料之外的生态影响和恶意滥用。
这条链上有个绕不开的环节:合成DNA。设计画得再多,最后总得有人把它做成实物。
守在这里的是行业的筛查系统。你下单合成一段DNA,系统会拿它去比对已知的毒素和病原体基因,对上了就拦下。
2025年10月发表在Science上的研究显示,微软团队用公开的蛋白设计工具,把72种受关注蛋白改写成约7.2万条合成同源序列,结构和功能大体保留、序列面目全非,四款筛查软件大量漏检。
该团队随后联合四家合成公司打了补丁,检出率大幅回升。
微软团队的AI蛋白设计红队流程:从受关注蛋白生成合成同源序列,再送进筛查软件验证。
问题在于,补丁只能补已经发现的那个漏洞。设计能力在指数级往前走,守门人却始终在后面追。
Baker给出的主张是:所有人工合成的DNA都做登记留档,记录序列,也记录下单的人。
他认为这是一道实际可行的防滥用门槛。
18个月后开牌
打开生物学的新抽屉
赌局已经下注。
Costa给的时限是18到24个月拿出真正的进展,五年内开放给全世界的研究者。
Baker的愿景清单上写着:一种新疾病的疗法几周而不是几十年就能做出来,海里的塑料被酶吃掉,生物计算机的耗电远低于硅芯片。
这些目前都还只是方向。Baker自己也承认,这条路上会先冒出一批能用、却说不清为什么能用的分子。
造得出来,但讲不清楚。
达尔文曾用「无尽之形最美」惊叹自然的多样性。
但在Baker看来,那些最美的形式,只是几十亿年里试出来的一小撮,抽屉里绝大多数格子还没打开过。
现在,他借着AI把抽屉拉开了,一次翻600万格。
AlphaFold把2亿多种蛋白质的结构预测了个遍,「读懂自然」这条路已经走到头。
Baker押注的是,下一段路的关口不在模型,而在数据:一条能源源不断吐出新数据的产线。
参考资料:
https://www.wired.com/story/nobel-prize-protein-design-now-using-ai-to-create-molecules-beyond-nature/?utm_source=chatgpt.com
https://alleninstitute.org/news/ai-biodesign-accelerator-combines-experimental-biology-and-artificial-intelligence-to-learn-natures-design-rules?utm_source=chatgpt.com
https://www.nobelprize.org/prizes/chemistry/2024/press-release/b/?utm_source=chatgpt.com
编辑:元宇
热门跟贴