9 月 22 日,AI 安全中心(Center for AI Safety)和 Scale AI 发布 HLE-Diamond(人类最终考试·钻石版)。

这是从"人类最终考试"(Humanity's Last Exam, HLE)题库中精炼出的一个子集。

这套题库打磨了一年,共包含 1000 道精华题。

题目设计为闭卷可答,一半考推理,一半考专家级知识。

打开网易新闻 查看精彩图片

HLE是由 Center for AI Safety 和 Scale AI 联合推出的超高难度基准测试,于 2025 年初发布。

它面向全球各领域专家征集了约 3000 道题目,覆盖数学、物理、化学、生物、医学、法律、人文等上百个学科,题目前沿且小众,旨在成为"人类最后一批还能难住 AI 的考题"。

也就是说,当 AI 能在这套题上拿高分,就意味着在专家级任务上追平了人类。因此 HLE 如今被视为衡量前沿模型真实能力上限的标尺。

HLE-Diamond 就是目前最难、也最干净的一套 AI 测验。它不仅花了一年时间打磨,还联合研究社区进行了众包质检。

目前已上架 Hugging Face:cais/hle-diamond。

这次“ AI 高考”的结果如下:

排名

模型

得分

GPT-6 Astra

60.6%

Claude Opus 5.5

55.0%

Claude Fable 5.1

51.3%

4

Claude Opus 5

38.6%

5

Gemini 3.8 Flash

34.3%

6

GPT-6 Sol

33.8%

7

GPT-5.6 Sol

31.2%

8

Muse Spark 1.3

25.4%

9

Grok 4.7

23.4%

全场第一名,刚刚过及格线,60.6 分。

60 分这个数字,既是里程碑,更是清醒剂。

最近 Anthropic 、马斯克、山姆奥特曼都在传播“AI 末日论”,要“放缓前沿 AI 研”,但实际上,AI 赶人类的路还长着呢。

把成绩单拆成两半看,事情就更有意思了。

模型

推理题

知识题

GPT-6 Astra

75.6%

45.6%

Claude Opus 5.5

63.2%

46.8%

Claude Fable 5.1

62.0%

40.6%

发现没有?几乎所有模型都是推理分,明显高于知识分。也就是说,现在的 AI 思维很猛,但"肚里的墨水"还不够。

给它一个数学逻辑题,它能给你拆得明明白白;问它一个冷门的专业领域知识,它就开始一本正经地胡说八道。

这也给行业提了个醒,光靠强化学习把"推理链"练得再长,但expert knowledge(专家知识)的积累,依然是硬骨头。

如果说上面的成绩是"裸考",那接下来的操作就是——允许带工具(联网搜索 + 写代码跑程序)。

结果画风突变。

模型

裸考

带工具

GPT-6 Astra

60.6%

82.9%

Claude Opus 5.5

55.0%

73.9%

Claude Fable 5.1

51.3%

72.4%

Claude Opus 5

38.6%

69.1%

Gemini 3.8 Flash

34.3%

60.3%

平均暴涨 20 多个百分点,最强者直接冲破 80 分。

这组对比其实也点出了 2026 年 AI 竞赛的真正赛点。

模型本身的"裸实力"是一回事,会不会调用工具、会不会当 agent(智能体)干活,完全是另一回事。

一个会自己查资料、自己跑代码的 AI,战斗力是裸奔状态的数倍。

AI 的"大脑"还没装满,但"手脚"已经越来越麻利了。

但是只有当某一天,AI 在这张卷子上裸考也能拿高分,那可能才是真正的"奇点临近"。

(数据来源:Center for AI Safety & Scale AI,2026.09.22所有模型均在 reasoning high 模式下评估)