来源:市场资讯
(来源:DeepTech深科技)
近两年,AI for Science 持续升温。大模型在蛋白质折叠、数学推导、材料模拟等科研任务中不断交出亮眼答卷,各类评测榜单上前沿模型分数屡创新高。GPT、Claude 等主流模型搭配 harness,看似已经具备比肩科研人员的能力。
但一个关键问题是:AI 完成一项科研任务,究竟意味着它会做研究,还是只是擅长执行人类已经设计好的研究方案?
为衡量 AI 的科学自主性——在没有人类方法论指导的情况下,AI 能自主完成多少真实科研工作。清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发了一个名为 ASI-Bench 的全新测试基准,试图专门测量这其中的差别。
这里的 ASI 指的是人工超级智能(Artificial Superintelligence)。在研究团队看来,通往 ASI 的关键,不只是让 AI 更擅长解决已有问题,而是让它能够走出现有人类知识和既定研究流程,探索未知、创造新知识,并把新的想法转化为可以验证的科研结果。
因此,与其不断给 AI 出更难的题,研究团队采用了另一种办法:针对同一个科研项目,逐步减少人类提供的方法和操作步骤,观察 AI 的能力会从哪里开始下降。
实验结果显示,18 种模型与智能体系统组合在获得完整方法指导时,平均得到 50.91 分;拿走具体步骤,只留下方法名称,平均分降到 29.10;连方法名称也拿走,只给研究目标和原始数据,平均分进一步降到 26.62。
也就是说,真正让 AI 成绩大幅下降的,并不是要求它自主选择研究方法,而是当人类撤掉具体操作步骤、只保留方法提示时。
同一个科研项目,让 AI 做四遍
与此前评测相比,ASI-Bench 试图测量的不是某一种单独的能力。比如,Humanity’s Last Exam(HLE)主要考察高难度知识与推理,Terminal-Bench 更侧重工具使用和长程任务执行,ScienceAgentBench 则关注数据驱动的科学分析。这些基准分别覆盖了科研能力的一部分,但大多在固定任务说明下进行,很难进一步判断 AI 的成功有多少依赖于人类已经提供的研究方法。
ASI-Bench 的不同之处,是把人类指导程度本身变成一个变量。研究团队为每个任务准备了 B1 到 B4 四个不同的指导条件。四个版本使用相同的研究目标、输入数据、输出要求和评分标准,唯一变化的是:人类告诉 AI 的提示越来越少。
B1 最接近一份完整的研究说明书。研究方法、公式、实现步骤甚至部分参数选择都会直接提供,AI 主要负责把方案正确实现出来;到了 B2,详细步骤被拿掉,只保留方法层面的提示。也就是说,人类告诉 AI 应该走哪条技术路线,但如何把方法变成一套可运行的方案,需要它自己完成。
B3 则进一步撤掉方法提示,只留下研究目标、数据、约束和需要提交的结果,模型必须自行判断应该采用什么方法,并完成后续实现和验证。B4 与 B3 基本相同,但会额外加入一些事实正确、却与当前任务无关的信息,用来观察 AI 是否容易被干扰。
B1 到 B3 之间的分数差距越大,说明系统越依赖人类提供的研究方案。
为了让这种比较尽量可靠,研究团队最初收集了 1,300 多个候选科研问题,经过 5 轮、超过 1,100 次人工评审和 2,000 多次修订,最终精选出 60 道完整科研项目,覆盖数学、物理、化学、生物、天文、材料、地球科学、医学/生物统计、计算机、机器人、电子工程 11 个基础与工程学科。
开发过程中,研究团队还进行了超过 1,500 次沙盒运行,检查参考结果能否复现、评分是否稳定,以及是否存在信息泄漏或可以绕过正常研究过程的“捷径”。整个基准的构建和验证累计投入超过 3.1 万个人工小时,以尽可能确保这 60 个任务真正测到的是科研能力,而不是模型对题目的投机适配。
也正是在这套逐步撤掉提示的设置下,一个颇为反直觉的结果出现了:AI 的最大性能断层,并没有发生在完全需要自己选择研究方法的 B3,而是在更早的 B1 到 B2 之间。
AI 自主科研,卡的不只是模型能力
研究团队随后测试了 18 种 harness 与模型的组合。使用的 harness 包括 Codex、Claude Code、Kimi Code、MiMo Code 和 OpenHands,搭配 GPT-5.5、GPT-5.6 Sol、Claude Opus、Kimi、DeepSeek、GLM、MiniMax、MiMo 等模型。
结果显示,随着人类指导逐渐减少,AI 的科研表现明显下降:B1 平均得分为 50.91,B2 降至 29.10,B3 进一步降到 26.62,加入干扰信息后的 B4 为 26.99。
最明显的结果出现在 B1 到 B2 之间。从 B1 到 B2,研究目标和方法都没有改变,人类只是撤掉了具体的实现步骤,平均成绩就从 50.91 降到了 29.10,下降了 21.82 分。相比之下,从 B2 到 B3,连应该采用什么方法也不再告诉 AI,成绩却只下降了 2.48 分。
即使是本次测试中表现最好的配置也存在明显差距。Codex 搭配 GPT-5.6 Sol(ultra)在 B1 中得到 71.78 分,到了需要自行选择方法的 B3 仍有 51.60 分,是所有组合中唯一超过 50 分的 B3 成绩,但相比 B1 依然下降了约 20 分。
也就是说,AI 最大的性能下降,并没有发生在需要自己选择研究方法的时候,而是发生在人类不再提供具体研究流程、只告诉它该用什么方法之后。
除此之外,论文还发现了几个比较有意思的现象。
首先,更强的推理确实能够提升自主科研表现,但代价不低。在 Codex 框架下,GPT-5.6 Sol 从 xhigh 提升到 ultra 后,B3 得分由 40.86 升至 51.60,增加了 10.74 分,说明增加推理预算确实有助于 AI 在缺少方法指导时完成更复杂的研究任务。
其次,Agent 框架也会显著影响模型最终表现。同一个底层模型换用不同 harness,成绩可能相差不少。例如,MiMo V2.5 Pro 搭配 MiMo Code 时总体得分为 16.17,换成 Claude Code 后升至 23.25;Kimi K2.7 也从 19.72 提升到 27.34。这意味着,科研能力并不是模型单独决定的,而是模型和系统共同作用的结果。
计算成本的结果同样有些反直觉。获得完整方法学指导的 B1,反而是成本最低的设置。 B1 平均每个任务消耗约 435 万 token,运行 37.8 分钟。由于研究方法、实现步骤和参数选择都已基本明确,AI 只需要按照既定流程执行,不必进行大量搜索和试错。
到了 B2,人类只告诉 AI 应该采用什么方法,却不再提供具体实现步骤,成本反而升至最高:平均每个任务消耗 691 万 token、运行 49.7 分钟,较 B1 分别增加 59% 和 32%。原因在于,AI 一方面受到既定方法的约束,另一方面又必须自行补齐求解、参数设置和调试等大量细节,因此需要更多探索和迭代。
相比之下,完全撤掉方法提示的 B3、B4,平均 token 消耗约为 540 万和 570 万,反而低于 B2。这说明,不完整的人类指导未必能够降低科研成本,有时反而会增加额外的搜索负担。
这给正在推进 auto research 的团队一个重要信号:与其只给 AI 一个方向,再让它自行补全后续流程,不如要么提供足够完整的指导,让 AI 高效执行;要么减少路线限制,让系统自行探索并完成研究。
当然,ASI-Bench 的意义并不只是给不同模型排出名次,而是为不同类型的 AI 科研系统提供了一套更有针对性的能力检验方式。
对于新的基础模型或推理系统,ASI-Bench 尤其是 B3 这类“只给目标、不提供方法”的低指导条件,可以进一步检验模型是否真正具备更强的科学推理和自主研究能力。
对于 AI Scientist 或 AI for Science 系统,B1–B4 也可以作为一套诊断工具:B1 到 B2 降幅大,说明系统依赖完整操作流程;B2 到 B3 降幅大,则说明方法选择仍是短板;B3 与 B4 的差异,则反映系统面对干扰信息时的鲁棒性。
对于 Agent 或 Harness 开发者,同一底层模型搭配不同框架的表现差异,也能帮助判断性能提升究竟来自模型本身,还是任务规划、代码执行等系统设计。
目前 ASI-Bench 仍远未饱和,18 组配置在 B3 上平均只有 26.62 分,最高为 51.60。因此,未来任何在低指导条件下取得的稳定提升,都可以作为衡量 AI 自主科研能力进展的重要参照。
但真实科研远比这 60 个任务复杂,研究团队也因此把 ASI-Bench 设计成一个持续更新的开放基准,未来还会不断加入新的学科和任务。它更像是一把动态的尺子,用来观察随着人类指导逐渐减少,AI 能否越来越独立地完成方法选择、研究执行和结果验证。至于这是否意味着 AGI 或 ASI 正在到来,单一评测显然无法回答,但至少它把“AI 到底能不能自己做研究”这个过去较为模糊的问题,变成了一个可以持续比较的指标。
1.https://arxiv.org/abs/2608.17271
2.任务贡献:https://asibench.apexin.ai/submit
3.GitHub:https://github.com/apexin-ai/ASI-Bench
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
热门跟贴