一道化学题,四个选项,答对率25%靠蒙。但有一群博士,认真作答也只拿到69.7%。这就是GPQA Diamond,目前大模型评测里最不客气的一张卷子。

它不考常识,不考代码,专挑生物、物理、化学三个方向里连专家都要想一会儿的题。出题人本身就是这些领域的博士,或者正在读博的人。题目设计的目标很直接:让非专家即使能上网随便查,也答不出来。

打开网易新闻 查看精彩图片

198道题,怎么来的

GPQA全称是Graduate-Level Google-Proof Q&A,直译过来就是"研究生级别、谷歌也搜不到答案的问答"。它是一套多选题数据集,覆盖生物、物理、化学。

Epoch AI跑评测时,用的不是完整版,而是其中的Diamond子集。这个子集是从主数据集里筛出来的,标准有两条:质量更高,难度更大。

具体怎么筛?每道题都要满足一个条件——领域内的专家标注者能答对,但大多数非领域专家会答错。最终留下来的,是198道题。

这个筛选逻辑决定了Diamond的定位:它不是用来测"模型知不知道",而是用来测"模型能不能像专家一样推理"。

25%是蒙,69.7%是人

因为是四选一,随机乱猜的基线准确率就是25%。这个数字很关键,它是一条底线——低于它,说明模型连蒙都没蒙对。

那人类专家什么水平?OpenAI为了把o1模型和人类做对比,专门招募了一批博士级专家来答GPQA Diamond的题,结果是69.7%。

这个分数不算高。换句话说,即便是受过多年专业训练的博士,在这套题上也会错掉三成左右。题目本身的难度,从这组对比里能看出来。

Epoch AI在评测时用的提示词来自simple-evals库,要求模型按步骤思考,最后一行必须输出固定格式:ANSWER加字母,字母是ABCD中的一个。

格式错了,直接零分

这里有个容易被忽略的细节:如果模型的回答不符合"ANSWER: LETTER"这个格式,这道题就拿不到分。

不是扣分,是零分。这种严格打分可能带来一个反直觉的结果——模型如果格式写得乱七八糟,最终准确率甚至可能低于25%的随机基线。

Epoch AI也解释了,他们部分GPQA Diamond分数低于25%,原因就在这里。不是模型不会答,是它没按规矩把答案写出来。

2026年2月20日,Epoch AI更新了GPQA的答案格式要求,从原来的写法改成ANSWER: LETTER,以匹配评测流程实际解析的格式。这次小改动之后,基准版本号升到了1.0.6。

Grok 4遇到的麻烦

评测过程中还碰到过技术问题。2025年7月,Epoch AI在使用API评测grok-4-0709时,遇到了超时和网络错误。

因此,截至2025年7月,他们对Grok 4采用了一套特定的评分规则。在OTIS Mock AIME 2024-2025、GPQA Diamond和FrontierMath-Tier-4-2025-07-01-Private这几项上,每次请求的最大输出长度设为128000个token,而默认是不设上限的。这个设置是xAI建议的。

如果请求因为网络错误或超时失败,对应的样本会直接进入评分阶段,通常会被判为错误。Epoch AI说明,这么做是因为这些评测对时间非常敏感。

另外,FrontierMath-2025-02-28-Private用的是标准设置,记录ID是gda5UeWrA8HcbDCRuLJ56H,走的是流式API。290道题里有1道没被评分,原因是服务器没有返回任何响应。他们允许最多1%的样本失败而不计分。

谁出钱,谁说了算

xAI为这次评测向Epoch AI提供了补偿,并给了算力额度。

Epoch AI特别声明:没有签署任何保密协议,保持了完整的编辑独立性,无论模型表现如何,所有结果都会照常发布。

这句话放在当下的大模型评测环境里,分量不轻。评测机构的独立性,直接决定了榜单上的数字能不能被当真。

回到GPQA Diamond本身,它的价值或许就在于那道门槛:25%是运气,69.7%是博士的水平。模型要证明自己不只是会搜答案,就得先跨过这条线。