只用1300张H200,在一项硬核科学基准上,赢了GPT-6 Astra。这不是段子,是前OpenAI研究副总裁Liam Fedus在X上晒出的成绩单。
他亮出的是Periodic Labs的第一个模型:Periodic Neon。帖子最抓人的一句话是——只用1300张H200,加上几个月的实验数据,Neon在他们自家的分析基准上超过了GPT-6 Astra。
数字的反差很快在圈内炸开。Jeff Dean第一时间在Fedus的帖子下留言祝贺。1300对10万,这组数字背后,藏着让AI继续变强的另一条路。
一个做大模型的人,为什么跑去啃材料
Fedus曾是ChatGPT的核心创造者之一,在OpenAI负责后训练,最清楚模型靠什么变强。去年创立Periodic时,他就把话挑明了:互联网上的文本总共约10T token,最好的前沿模型已经把它读完了。AI要再往前走,需要互联网上没有的新数据。
去哪找?实验室。
于是,他拉上前谷歌DeepMind化学与物理研究负责人Ekin Dogus Cubuk,从第一天起就自己建实验室、自己造数据,目标只有一个:造一个AI科学家。一年后,第一份答卷来了。
Periodic在门洛帕克建起了高磁场材料实验室。一排排样品托上放着刚合成出来的候选材料,它们会被送进X射线衍射仪拍下「指纹」,再变成Neon要读的图谱。实验室24小时连轴转,合成、测量、喂数据。Fedus说,他们第一批要啃的,是超导体、磁体和半导体材料里的硬骨头。
一张考卷,把2.7%拉到55.3%
Neon解决的问题叫X射线衍射分析,简称XRD。
打个比方:一束X射线照进晶体,会在几个固定角度衍射出亮峰。材料不同,亮峰的位置也不同,就像指纹。合成出来的东西是不是超导体、磁性材料或半导体材料,先要看这枚「指纹」对不对得上。
麻烦在于实验室合成的样品往往极不纯净,多种物质重叠在一起,就像几百个人的指纹乱七八糟印在同一张纸上。材料学家要认清里面有什么,通常得开软件、翻数据库、对比论文,折腾很久。
Periodic挑选了134道这种「连专家都头疼」的硬骨头,组成基准测试FrontierXRD。Neon的55.3%,就是在这134道题上拿到的。所有模型用的都是Periodic自己搭的科学工具环境,Periodic Harness。
与基于Claude Code、配标准XRD工具的方案相比,在单题成本差不多的情况下,Periodic Harness的成功率是后者的3.8倍。AI做科研,一半靠脑子,一半靠手边的工具。
为了防止模型「背答案」,团队还另外准备了198道题,题目涉及的化学体系在训练数据里都被刻意剔除。Neon依然领先一众前沿模型。不过官方也承认,这套题比FrontierXRD简单。
成本上,Neon也更划算。最高档下,Neon成功率55.3%,每题成本约4美元多;GPT-6 Astra每题约7美元多,成绩反而低于Neon;Claude Fable 5.1成本和Astra相近,成功率只有约40%。
论参数,据业内传闻,Astra总参数在数万亿量级,Neon只有1T;论算力,按黄仁勋的公开说法,Astra背后是10万张以上的Grace Blackwell;Neon最终训练的峰值规模,只有1300张H200。
互联网就要被AI读完了,他们想造一口永不干涸的水井
抛开跑分,Periodic真正想让人看到的,是它在门洛帕克建起的高通量材料实验室。
从最初的第一批实验,到如今24小时连续运转,Periodic把材料发现拆成了一个循环:
- 先猜要做什么,依据是对材料稳定性和性质的预测;
- 再预测怎么把它合成出来;
- 最后搞清楚实际做出了什么,性质对不对。拿到结果,修正猜想,再来一轮。
每循环一圈,实验室就吐出一批新鲜、私有、带着物理反馈的数据。这些数据,就是Neon的原料。Periodic的中训练语料,混合了学术文献、代码和实验数据,规模目前每个月翻一倍。他们还发现,先靠中训练把科学知识灌进去,后面的RL效果更好。
而且实验跑的时候,GPU不用干等。模型可以拿已有的实验数据继续分析、继续改进预测。
Periodic那篇研究博客的标题,叫「自然就是学习环境」(Nature Is
热门跟贴