宋乐的身份有点特殊:GenBio AI联合创始人兼CTO,佐治亚理工学院前终身教授。他从计算机跨界到生命科学,在百图生科训练过千亿参数的蛋白质语言模型,后来又离开学术界和工业界,自己下场做AI for Science。这期播客里,他讲了一个核心判断:AI正在两条路上同时爆发,但离“伟大的科学发现”还有一道硬门槛。
两条路径,上限不同
宋乐把AI for Science拆成两条技术路线。一条是大厂主导的自动化Coding Agent,擅长文献阅读、工具调用、把科研流程里能公式化的部分自动化。另一条是深入领域数据构建专用模型,AlphaFold就是典型代表。他的观点很直接:通用Agent负责把科研闭环跑通,但决定任务结果上限的,是领域专用模型。两条路最终会汇合,而不是谁取代谁。
这个判断背后有一个容易被忽略的细节:AI在逻辑推理、数据处理这些环节已经能胜任,甚至做得比人快得多。但宋乐反复强调,创造性跨越不在这个范围内。孟德尔从3:1的性状分离比例跳到“遗传因子”这个概念,香农把“熵”从热力学搬进信息论,这类无中生有的跨越,AI目前难以企及。后续的逻辑补全可以交给机器,但第一步的跳跃仍然属于人类智慧的高地。
虚拟细胞:AlphaFold前夜
宋乐把“虚拟细胞”定义为生命科学的世界模型。它需要跨尺度整合DNA、RNA、蛋白等多模态信息,还要模拟带状态的细胞响应——记住一系列扰动之后细胞状态怎么变化。这个思路类比具身智能里的世界模型,目标很明确:做药物筛选和疾病预测。
目前虚拟细胞处于什么阶段?宋乐给出的参照系是AlphaFold 1的前夜。单模态基础模型已经有了,跨模态整合才刚起步。他给了一个可量化的商用标准:当模型预测的准确度达到重复实验的相关性,也就是大约80分的水平,预测结果就和再做一次实验差不多,这时候才算工业界可用。他预计还需要4到5年。
数据质量比数据量更关键
宋乐还纠正了一个常见误区:公开的细胞数据噪音大、同质化严重,信息量不足时,深度学习甚至不如线性模型。关键不是细胞数量,而是种类多样性。他提出的解法是AI主动学习——让模型自己计算哪些数据点能最大程度降低自身不确定性,再有针对性地收集信息量更高的数据。这样数据产生本身变得更高效,不需要盲目堆量,模型反而能更快变好。
整场对话里,宋乐有一句话点出了AI for Science的长期价值:如果人人都有智能,最大的价值是不断开创和发现新东西。但至少目前,开创性那一步,AI还站在门外。
热门跟贴