GPT-5.5的数学水平,大概相当于一位普通数学教授。到了GPT-5.6,这个位置换成了排名前1%到2%的顶尖教授。而内部代号Astra之后的模型,能做出连最好的数学家都做不到的事。
这段话出自Sam Altman。他没有用"接近""有望"这类模糊词,而是直接给了一个可对照的坐标——从"平均教授"到"顶尖1-2%教授",中间只隔了一个小版本号。
一次不寻常的加速
Altman在表述里用了一个判断:数学领域的起飞速度"不寻常地快"。他补了一句,"按几乎任何定义来看,这都是一次快速起飞"。
这句话的分量在于说话人的位置。作为OpenAI的负责人,他见过每一代模型的内部评测曲线,仍然选择用"fast takeoff"来描述数学这一个单项的进展。
值得注意的是他给出的三段式对照:
- GPT-5.5:约等于普通数学教授
- GPT-5.6:约等于排名前1%到2%的数学教授
- Astra之后的内部模型:能做最好的数学家也做不到的事
前两档是能力对标,第三档换了性质——不再是"和人类比",而是"人类做不到"。这个转折是整段话里信息密度最高的部分。
为什么是数学
数学在AI能力评估里一直是个特殊科目。它的答案可验证,对错分明,很难靠语言技巧蒙混过关。一个模型在数学上被评价为"顶尖教授水平",意味着它在多步推理、符号操作、证明构造这些环节上,已经越过了某个门槛。
Altman没有解释GPT-5.6具体在哪些数学任务上达到了这个水平,也没有给出评测集名称或分数。他给的是一个体感式的类比——用"教授"这个人类职业来锚定模型能力。
这种表述方式本身也值得注意。把模型能力映射到人类职业等级上,比抽象地谈benchmark分数更容易传播,但也更依赖说话人的判断。Altman选择这么说,说明他认为这个类比是站得住的。
第三档意味着什么
"最好的数学家也做不到的事"——这句话没有展开。Altman没说是什么事,也没说Astra之后的模型具体指哪一代。
但把这句话和前两档放在一起看,逻辑链条是清楚的:GPT-5.5到5.6,是在人类教授的能力区间内往上走;过了Astra这条线,参照系换成了"人类能力的上限之外"。
数学只是第一个被点名的领域。Altman用"数学经历了不寻常的快速起飞"来收尾,没有说其他领域是否同步。这个留白本身也是一种信息——至少在他愿意公开谈论的范围里,数学是那个跑得最明显的。
对于关注模型能力边界的人来说,这条推文的价值不在于具体数字,而在于一个内部人士愿意用"顶尖1-2%教授"和"最好的数学家也做不到"这样的措辞来划分代际。这种划分方式,比任何评测榜单都更直接地反映了他对模型当前位置的判断。
热门跟贴