不到四周,30多个开源生物分子模型被重写了一遍。AlphaFold3、Boltz-2、Chai-1、ESMFold2、RFdiffusion,这些名字在生物计算圈里几乎等于基础设施。Anthropic 公布的结果是:允许少量数值精度变化时,任务平均加速约 4 倍;要求输出完全一致时,平均加速接近 2 倍。相关代码同步开源。
更值得琢磨的是干活的方式。代码优化主要由 Claude 自己完成,盯着它的只有两名 Anthropic 技术人员。这两人懂生物建模,但按报告的说法,他们并不具备传统意义上的推理优化或 GPU kernel 工程背景。
这份报告回答的是"AI 能不能做到"。它没回答的是另一个问题:AI 写出来的科学代码,离榨干硬件性能还有多远。
一段跑得通、却慢了三倍的代码
几乎同一时间,一个开源项目试图接住这个问题。9 月 17 日,AItonomy Foundation 发布首个开源项目 ScienceIDE,赞助方为 PhAI Labs 与阿里 Qwen。它要做的事,是把世界上的科学代码库转化成可执行、可验证的学习环境。
筹备期间,团队在等离子体物理与天体物理代码上做过一次实验,对象是 PLUTO。这是一套广泛使用的高性能科学计算代码,代表性论文发表于 2007 年,覆盖流体力学、磁流体力学、相对论流体力学与相对论磁流体力学等多个物理系统。
它的复杂度不在代码量上。以流体和磁流体计算为例,Godunov 型激波捕捉格式要把空间重构、网格界面的黎曼求解器和时间推进组织成完整流程,每一步都有自己的数据依赖、访存模式和数值稳定性要求。磁流体模拟还要处理磁场无散条件,约束输运与散度清理把额外的物理约束直接带进了数值实现。
团队在 M1 Ultra、A100 和 H100 上重新实现 PLUTO 的磁流体力学模块。A100 的一次测试里,AI 生成的第一版实现已经能跑,检查的算例上也得到符合预期的物理结果;但相对团队使用的 128 核 CPU 节点配置,速度提升还不到 5 倍。随后团队用一两天时间与 AI 一起分析瓶颈,调整数据布局、内存访问、kernel 组织以及不必要的数据搬运。在不改变所求解物理问题的前提下,这套 GPU 实现的速度又提高到第一版的接近 3 倍。
也就是说,AI 已经把代码"写出来"之后,仍然留下了数倍的性能空间。要继续挖这部分空间,AI 必须能测量、诊断、修改、验证,再根据结果继续迭代。数据布局怎么匹配线程访问?相邻线程能否形成合并访存?哪些中间结果值得缓存,哪些可以重算以减少内存流量?kernel fusion 能不能减少启动开销,又会不会增加寄存器压力、影响 occupancy?这些都得靠 profiling 和实际运行来判断。
跑得通,不等于算得对
性能优化始终伴随另一个问题:改写后的程序,还能不能可靠地回答原来的研究问题。
Anthropic 的报告里有个现成的例证。为了测试优化极限,他们让 Claude 在单个 8 卡 B300 节点上预测 31,000 到 70,000 token 以上的完整病毒衣壳和蛋白区室。推理全部跑通了,这本身就是此前需要多节点集群才能做的事。但报告写得很直接:这些结构没有被正确预测。报告分析指出,预测结构发生坍塌,模型在训练上下文近两个数量级之外缺乏泛化能力。
程序能跑,不代表科学上正确。判断一个科学结果对不对,要拿它去和科学参考答案比对,而不是看程序有没有报错退出。
放到科学代码加速这件事上,判据很具体:质量与能量的守恒误差是否可控?磁场散度是否满足所选数值方法的要求?激波位置、波传播速度和关键物理量是否与参考结果一致?不同的科学问题,验收标准也不一样。不把这些定下来,一个程序完全可以通过少算几步、降低分辨率或跳过重要过程变快,同时失去原来的用途。ScienceIDE 把这一点称为科学等效性,并把它写成了任务是否算完成的判据。
最强的模型,也只做到 67%
如果一次成功的优化只是一个交付物,那它只能被使用,不能被学习。ScienceIDE 想解决的是后一件事。
做法是:由领域专家定义科学算例与验收标准,再与 AI 一起把代码库整理成可执行环境。在这些环境里,AI 完成任务、运行程序、检查科学结果,经过验证的交互经验被用于评测、监督微调和强化学习。
论文报告的集合包含来自 27 个科学代码库的 64 个环境、2,812 个任务,以及 1,076 项可执行的科学检查,覆盖天体磁流体、空间等离子体、海洋气候、引力 N 体、光子学与电磁、材料、量子、相对论、粒子探测器、免疫学等方向。任务分为加速、修复、发现、复现、集成、标定、实现七类。当前任务主要集中在代码修复与功能实现,加速类任务还只有初步实例。
为了衡量难度,团队挑出 85 个难任务作为公开评测集 ScienceIDE-Hard,来自 PLUTO、Athena++、MITgcm、LAPS、PHANTOM 等环境,包含 52 个修复任务和 33 个实现任务。判定标准是在任务的验收条件下与私有科学参考答案一致,而不是执行成功。
参评的是来自 8 家厂商的 15 个模型,通过 Codex、Claude Code 或 Gemini CLI 执行,每个 episode 一小时预算。结果:
- Claude Fable 5.1:67.1%
- Claude Opus 5:64.6%
- GPT-6-astra:63.1%
- 一半以上的前沿模型停在 30% 以下
真正的科学任务,远没有被解决。
科学不只是应用场景,也可能是训练场
这项工作还有另一侧结果。团队用经过验证的科学交互轨迹做监督微调,训练并开源了 PhAI-IDE-4B、9B、72B 三个规模的模型。提升的不只是科学任务本身,代码、推理、知识三类通用基准同时受益。
在 72B 上,APPS Introductory 从 0.609 提升到 0.672,LiveCodeBench Execution 从 0.539 提升到 0.594;在 9B 上,BBH Word Sorting 从 0.240 提升到 0.576。
这组结果指向一个判断:科学不只是 AI 的应用场景,也可能是推高智能上限的训练场。与常规代码任务相比,科学任务天然更长程,也更依赖对物理约束与数值行为的理解。
AItonomy Foundation 是一个注册在硅谷的非营利组织,愿景是加速 AI 与科学之间的闭环。按其官网表述,这两个方向都依赖可靠的反馈:模型提出的假设需要通过计算或实验接受检验;科研过程中产生的数据、操作记录与失败尝试,也需要经过整理和验证,才能成为模型的学习材料。论文能传递研究成果,却往往难以完整保留得出成果之前的判断、调整与试错。
目前参与的研究者来自伯克利、CMU、康奈尔、加州理工、哈佛、MIT、牛津、UCL、普林斯顿、斯坦福等二十余所机构,以个人身份参与。团队还公开表示,希望把 Anthropic 此次开源的 36 个优化包整理成 ScienceIDE 环境——这些包附带参考实现和可度量的验收标准,条件接近理想。如果这件事成立,社区将不只是使用这批优化的结果,而是能在这类工作上训练和评测模型。
PLUTO 那次实验给出的答案是数倍。要把这数倍拿到手,靠的不是更强的一次生成,是测量、诊断、修改、验证,再迭代。Anthropic 的报告证明了模型有能力做这类工作;ScienceIDE 想回答的是下一个问题:怎样让这种能力持续积累,把一次次成功的优化,变成 AI 可以反复学习、验证,并迁移到新问题上的经验。
热门跟贴