OpenAI 放出了一批由内部前沿模型生成的数学研究成果,数学家们现在可以公开访问数百个机器产出的结果。这批内容放在一个公开的 GitHub 仓库里,包含 722 篇手稿,被归入 372 个研究族,覆盖纯数学、理论计算机科学和数学物理。

这不是一次普通的论文合集发布。它同时给出了一个关键问题的部分答案:机器做出来的数学,能不能被验证?

一个仓库,装下了什么

仓库里的问题横跨数论、复杂性理论、几何和数学物理。有些结果触及的是那种"往前挪一小步都要付出巨大技术代价"的领域。

其中一个例子和圆周率 π 的无理性指数有关。这个量衡量的是有理数能以多近的程度逼近 π。模型产出了一个针对这种逼近数学行为的结果。

另一个研究族考察的是 NP 困难性。这类问题属于计算复杂性理论,关心的是那些被认为难以高效求解的任务。模型的工作为这一更广泛的研究体系补充了数学结果。

其他手稿涉及的问题包括马勒猜想、算术级数和自由群因子。合集里还有关于量子海森堡铁磁体和相对论性弗拉索夫-麦克斯韦方程的工作。

OpenAI 把相关手稿按研究族分组,用意是展示单个结果之间如何彼此连接。仓库还标出了 10 个研究族,附上了模型推理过程的简要摘要。

Lean 加上的那道检查

Lean 为这次发布提供了一层重要的验证。这门编程语言让研究者能把数学陈述和证明翻译成形式化代码。

翻译完成之后,计算机可以逐步检查每一步逻辑是否从既定假设中推出。但要注意,这并不自动意味着合集里的每一项研究主张都正确。

许多手稿目前还没有对应的 Lean 形式化版本。OpenAI 表示,随着研究者完成验证工作,会补充更多形式化内容。

仓库还追踪论文的修订情况,并提供引用指引。这样一来,当作者更正或扩展早先的手稿时,研究者能有一个更清晰的记录。OpenAI 在制定发布流程时,参考了普林斯顿高等研究院数学与人工智能独立咨询组的建议。

4000 道题,平均 3 小时

OpenAI 同时披露了数学评估规模的细节。在研究过程中,模型尝试了大约 4000 道问题。

一个被接受的结果,平均消耗约 3 小时等效的 ChatGPT Pro 思考算力。OpenAI 还发布了覆盖所尝试问题和研究产出的额外统计数据。

公司表示,推理摘要让研究者能更近距离地观察模型是如何处理选定数学问题的。这些摘要与 Lean 中的形式化证明是分开的两套东西。

OpenAI 计划支持工作坊、会议和特别项目,主题是理解 AI 生成的重大数学结果。它也预期数学家的反馈会影响未来的信息披露方式。

所以这次发布的意义不止于一批论文。它提供了一次测试:机器生成的数学,能否带着可复现的记录、计算机可检查的证明,以及对结果如何产生的更高可见度,进入真实的研究流程。

兴奋点在哪,边界也在哪

值得兴奋的地方很具体:过去讨论 AI 做数学,往往停留在"它能不能解出某道题"。这次不一样,它把成果、推理摘要、形式化验证和修订记录打包在一起,摆到了公开仓库里。

但边界同样清楚。Lean 检查的是逻辑步骤是否成立,不是研究主张是否全部正确。大量手稿还没有形式化版本,验证工作仍在进行中。仓库里那 10 个带推理摘要的研究族,也只是全部 372 个研究族中的一小部分。

换句话说,这是一次带着验证工具和公开记录的入场,而不是一次已经盖棺定论的宣告。数学家接下来怎么用这批材料、怎么反馈,才是真正决定它分量的部分。