OpenAI把内部模型做数学的那批论文全放出来了:722篇手稿,覆盖372项数学结果。这是它此前"解决开放问题"说法背后的完整材料。

这批东西不是凭空冒出来的。按照公开的信息,OpenAI在测试阶段给内部模型喂了大约4K个研究问题,然后把模型产出的内容做分组和筛选,最后归并成372个"重要结果族"。也就是说,从四千道题到三百多项结果,中间隔着一道人工整理的工序。

打开网易新闻 查看精彩图片

算力账:平均每题3小时

更值得看的是成本这一栏。几乎所有这些结果都来自同一套标准设置,每一项平均消耗的算力,相当于ChatGPT Pro思考3小时。

这个数字放在一起看就有意思了:4K个问题进去,372项结果出来,单项成本3小时Pro级思考。它不是一次漫无目的的算力倾泻,而是一条有筛选、有归并的流水线。

为什么是数学

数学是少数能自动验证对错的领域。模型给出的证明对不对,不需要人来主观打分,逻辑链条自己会说话。这让它成了检验模型推理能力的天然试验场。

OpenAI这次把722篇手稿摆到台面上,等于把"模型到底做出了什么"这个问题交给外部去看。372项结果、4K道题、3小时算力,三个数字构成了这次公开的全部骨架。

至于这些结果的分量有多重,手稿本身会给出答案。