来源丨硅基见闻
平均3小时,解决一道困 扰数学家 几十年的难题。 4000道题扔进去,722篇论文吐出来。
美东时间10月6日傍晚6点,OpenAI没有开发布会,也没有走同行评审,直接在GitHub上开了一个叫“math”的仓库。
里面的东西,让整个数学界一夜失眠: 准黎曼猜想、唯一游戏猜想、CM阿贝尔簇上的霍奇猜想、马勒猜想 ……一串名字,每一个都曾是某个领域几十年的“镇山之宝”。
《科学美国人》的标题毫不客气:OpenAI向一个早已陷入震惊的领域,又倾泻了数百个数学结果。
问题来了: 如果AI 3小时就能干完一个数学家半辈子的活,以后还需要学数学吗?
1
一夜722篇:数学界被“刷屏”
先看数字。
仓库openai/math里共有722篇手稿,分属372个“结果家族”,覆盖数论、代数几何、理论计算机科学、概率论、数学物理、偏微分方程等17个方向。 所有论文的作者栏只有一个名字:OpenAI。
它们出自一个尚未发布的内部前沿模型。
OpenAI在说明中交代了来龙去脉:现有的数学评测已经被模型“刷满”,于是他们开始拿真正的未解难题来考它。整个评估过程中,模型被投喂了约4000道问题; 每个结果平均只用了3小时的ChatGPT Pro级思考算力。 再经过聚合和显著性筛选,就成了今天这份目录。
但OpenAI也难得地留了余地:这批结果处于“不同的验证阶段”,并非每篇都有Lean形式化证明;没形式化的部分“可能存在问题”,发现后会尽快修正,所有修订都会以新版本保留。
还有两个例外没有走标准流程:一个是黎曼ζ函数的无零点区域,一个是CM阿贝尔簇上的霍奇猜想。换句话说,这两项是OpenAI专门“重点攻坚”的。
2
黎曼猜想的大门,被撬开了一条缝
全场最炸的,是编号003。
黎曼猜想,数学皇冠上的明珠。它断言ζ函数的所有非平凡零点,都整整齐齐地排在ℜs=1/2这条直线上。现代数论里成百上千条定理,都是在“假设黎曼猜想成立”的地基上盖起来的。 但160多年过去,人类连一个弱得多的版本都拿不下 :能不能找到一个小于1的固定常数σ,保证ℜs>σ的区域里一个零点都没有?
这就是“准黎曼猜想”。经典的无零点区域,会随着高度上升无限贴近ℜs=1这条线,始终给不出这样一个常数。
OpenAI的答案是:7/8。
论文声称:所有狄利克雷L函数,包括黎曼ζ函数本身,在整个半平面ℜs>7/8内都没有零点;ℚ(√−3)上的有限阶Hecke L函数同样如此。另一篇伴随论文,还用完全不同的方法证出了ℜs>11/12。
这还没完。
困扰数论学家近百年的“朗道–西格尔零点”幽灵,也被宣告驱散 :OpenAI声称证明了存在绝对常数c>0,使每个实狄利克雷L函数的实零点β都满足(1−β)·log q ≥ c。这个“例外零点”,长期卡着算术级数中素数分布和二次域类数估计的脖子。
如果属实,这将是解析数论几十年来最重要的推进之一。
不过要冷静: 7/8离黎曼猜想要求的1/2还差得远。 仓库的Lean目录里有一条“ℜs>7/8时ζ(s)≠0”的形式化声明,但覆盖全部L函数的完整版本和西格尔零点论文,目前还没看到对应的形式化条目。
3
唯一游戏猜想:
24年悬案,直接写成“定理”
如果说准黎曼猜想让数论圈坐不住,那编号102就是冲着整个理论计算机科学去的。
论文标题只有四个词:The Unique Games Theorem。
不是“猜想”,是“定理”。摘要第一句:我们证明唯一游戏猜想。
唯一游戏猜想(UGC)由Subhash Khot在2002年提出,是近似算法领域的“无冕之王”。它为什么重要?
芯片布线、物流调度、航线规划……大量现实中的优化问题都是NP困难的,人类只能退而求其次找近似解。2008年,Prasad Raghavendra证明了一个惊人结论:只要UGC成立,基本半定规划(Basic SDP)就是所有约束满足问题能达到的最优多项式时间近似。
但这座大厦一直悬在UGC这个“阿喀琉斯之踵”上。
OpenAI的做法是:对任意固定的ε和δ,构造一个从3SAT到唯一游戏问题的确定性多项式时间归约,完备性至少1−ε,可靠性至多δ。
一旦成立,Raghavendra的结论只需要P≠NP这一个标准假设。Max-Cut的Goemans–Williamson比值、顶点覆盖的因子2……一整串“最优门槛”被同时锁死:想用多项式时间算法超越它们,在数学上不可能。
这项主定理在仓库的Lean目录中有对应的形式化条目。
4
千禧年难题霍奇猜想,被撕开一角
第三个重磅,来自代数几何。
霍奇猜想是七大千禧年难题之一,核心是问:抽象的“霍奇类”,是否一定能由实实在在的代数闭链构造出来?
OpenAI没有正面强攻所有流形,而是盯住了一类高度对称的对象:具有复乘(CM)结构的阿贝尔簇。
编号032的论文声称:在任意维数、任意余维数上,CM阿贝尔簇的有理霍奇猜想全部成立。
顺带推出的还有一串:CM阿贝尔簇的广义霍奇猜想;借助Milne的定理,有限域上所有阿贝尔簇的泰特猜想;以及任意特征下阿贝尔簇的霍奇标准猜想。伴随论文还把战线推到了任意有限个K3曲面的乘积,并证明了Kuga–Satake对应的代数性。
但要看清边界: 千禧年难题要的是一般光滑射影簇,这里只拿下了特例。 而且这组结果目前在Lean目录中没有对应条目,可信度暂时只能靠人工审读。
5
还有更多:这份清单令人窒息
三大头条之外,372个家族里还藏着一长串名字。
两点Chowla猜想(Result 007):数论核心问题,一个有界乘法函数平移后的乘积,平均起来是否趋于零?OpenAI声称证明了普通两点Chowla猜想,给出对数幂次级别的误差节约,并推广到二元修正版Elliott猜想。
马勒猜想(Result 087):凸几何几十年的悬案,凸体与其极体的体积乘积,最小值在哪里取到?论文声称在所有维数上同时解决对称与非对称两种情形,极小值分别在Hanner多胞形和单纯形处取得,并给出全部等号情形的分类。对称版本在Lean目录中有形式化条目。
挂谷猜想(Result 074):声称解决了三维挂谷极大函数猜想,以及四维的豪斯多夫维数猜想。在四维空间里,每个方向都含一条单位线段的集合,豪斯多夫维数必为4。
此外还有π的无理性度量、Kaplansky直接有限性猜想(特征2)、稀释自旋玻璃的Mézard–Parisi公式、量子Heisenberg铁磁体的自发磁化……OpenAI为其中10项公开了模型推理过程的摘要。
顺带澄清一个流传的说法:这次仓库里与纳维–斯托克斯相关的编号376,是“受迫纳维–斯托克斯流中的通用计算”,并不是千禧年难题本身。千禧年难题的解答声明,是OpenAI在9月单独抛出的。
6
五个月,一场越演越烈的“数学军备竞赛”
722篇不是从天而降。
把时间线拉开,你会发现OpenAI的节奏一次比一次猛。
5月20日,OpenAI宣布一个通用推理模型推翻了埃尔德什单位距离猜想,这是1946年提出的离散几何问题。后来,Tim Gowers、Daniel Litt、Will Sawin等数学家专门写了一篇论文,把这个机器生成的反例“消化”成人类能读懂的版本。
8月1日,OpenAI以下一代模型Astra的名义,一口气放出10项数学与理论计算机进展:249页手稿、全部附Lean证书,据称搜索成本只有约2000美元的token。
8月28日,OpenAI开始训练一个新的内部模型。
9月初,OpenAI宣布解决纳维–斯托克斯千禧年难题,随即引爆争议。
纽约大学教授Tristan Buckmaster表示,他和Anthropic研究员Levent Alpöge已接近完成同一问题,并在9月3日主动联系过OpenAI;OpenAI负责该项目的Sébastien Bubeck否认模型接触过他们的工作。据The Conversation报道,OpenAI为此动用了约1万个AI智能体、估算花费1500万美元。
不久后OpenAI披露,那个8月28日开训的模型已解决100多个长期悬而未决的问题,进展速度“让OpenAI内部的数学家都感到意外”。
9月11日,一封题为《AI在数学中的严重错位》的公开信发布,据报道有27位菲尔兹奖得主联署,包括陶哲轩、Peter Scholze和Maryna Viazovska,矛头直指把名题当作AI基准、仓促发布、署名失范。
OpenAI的回应,是与数学家组建一个设在普林斯顿高等研究院(IAS)的独立顾问组。但OpenAI同时写明:顾问组不负责就其内部数学进展的节奏提供建议。然后,就是10月6日的722篇。
7
数学家们:兴奋、恐惧,还有愤怒
消息一出,数学圈的情绪极其复杂。据《连线》报道,西北大学数学家Bryna Kra形容研究者们的状态是: 兴奋与恐惧交织在一起 。
菲尔兹奖得主陶哲轩是最尖锐的批评者之一。《科学美国人》报道,他公开批评OpenAI等前沿实验室产出AI结果的速度“疯狂”。在纳维–斯托克斯风波中,他对CNN打了个比方:这就像看电影只看了开头十分钟和结尾十分钟,所有情节线技术上都收尾了,但观影体验的大部分价值丢掉了。他还说,眼下的局面已经变成一场狂热的竞赛。
陶哲轩曾经期待, AI在专家手里能成为数学家的显微镜和望远镜 。但他担心,AI公司只盯着答案,会让数学家放弃探索其他路径,而且这些公司很少公开模型尝试过、却失败了的方向。
数学家Williamson则说出了很多人的心声。OpenAI 8月公布的10项成果里,有两项和他自己的研究重叠。他对IEEE Spectrum说,现在你根本不知道,自己关心的问题会不会某天被别人直接丢进大模型里解决掉。
也有人持不同看法。多伦多大学数学家Daniel Litt对《科学美国人》表示:如果我们想知道这些问题的答案,他看不出有什么理由要求公司对我们保密。
最耐人寻味的,是OpenAI自己的表态。其发言人对《科学美国人》承认, 这次放出的许多新结果,连公司内部的数学家都还没吃透;同时坚称不能放慢脚步,因为这些数学难题是证明AI确实在变聪明的“不可或缺的测试” 。
8
那么,以后还需要学数学吗?
先泼一盆冷水:722篇手稿,目前还远不是722个“定理”。
《科学美国人》指出,数学家需要数月时间才能消化这批结果,判断其中多少是真正的新思想,多少只是既有技巧的重新组合。一部分结果已有Lean形式化,几乎可以确定正确;但Lean只保证证明与形式化陈述一致,陈述本身是否忠实于原问题,仍要专家逐条核对。 没有形式化的部分,OpenAI自己都承认可能有问题。
8月那批10项成果,就是一面镜子。一份人工审查报告显示,主要结果中暂未发现确认的实质性错误,但审查深度参差不齐,部分章节仍被专家要求大修。
这恰恰回答了标题的问题。AI能在3小时里产出一篇证明,但判断它对不对、值不值、意味着什么,仍然要靠懂数学的人。埃尔德什猜想的反例,最终是几位数学家把它“消化”成人类能读懂的论文,才真正进入数学文献。
数学也从来不只是答案。陶哲轩说过,在这个大量使用AI的时代, 要记得当一个孩子是什么感觉:纯数学的动力,是好奇心。 计算器没有让人不学算术,AI也不会让人不学数学。变的是学数学的目的:从“解出答案”,变成“理解答案、提出问题、判断价值”。
古典数学的时代或许正在落幕。 但人类对真理的追问,才刚刚换了一副引擎。
*免责声明:本文内容仅代表作者看法。市场有风险,投资需谨慎。在任何情况下,本文中的信息或所表述的意见均不构成对任何人的投资建议。
深蓝财经新媒体集群发源于深蓝 财经记者社 区,已有16年历史,是国内知名财经新媒体,旗下账号关注中国最具价值公司、前沿行业发展、新兴区域经济,为投资者、上市公司高管、中产阶级提供价值内容,欢迎关注。
热门跟贴