陶哲轩最近发起了一个叫First Proof的项目,简单说就是用AI去解“人类从未解过”的数学题。不是已知的题库,不是竞赛题改编,是全新的、前沿研究级的、尚未公开的题目。他想知道,AI到底能不能做数学研究,而不只是做“已知有答案的练习题”。
最新一批评测结果在ICM上公布了。10道题,四套AI系统应战。成本限制在每道题10到1000美元——大概就是一个研究生两三天的补助金。结果呢?7道题被攻克。
陶哲轩的原话是:“这比我想的快。”
有一道题,来自埃尔德什问题库第281号。这道题是传奇数学家埃尔德什和格雷厄姆在1980年提出的数论难题。45年来,全世界不知道多少数学博士生在这道题上折戟。然后GPT-5.2 Pro花了大概一周时间,花了几百美元的计算成本,交出了一份证明。陶哲轩亲自验证之后,在社交媒体上打下了一行字:没犯任何错误。
你知道这道题被解决意味着什么吗?意味着AI做数学的成本,正在断崖式下跌。以前你花几十年培养一个数学家,再花几年让他攻克一道难题,成本至少几十万上百万美元。现在几百美元,搞定。这不是取代计算器,这是取代创造力。
但最让我背后发凉的不是这个结果,而是这些AI系统的工作方式。陶哲轩说,AI的证明有时很“诡异”——逻辑完全正确,但采用的方法体系和人类完全不同。就像同一个目的地,人类开车走公路,AI开着飞船直接穿过山谷。你看到它到了,却看不太懂它怎么到的。
这种感受,陶哲轩形容为“像收到了来自未来的信号”。信息是对的,但你无法完全解码。
这件事也暴露了数学界一个尴尬的现实。我们过去以为,证明是数学里最难的事。现在AI证明出来了,人类最大的麻烦反而是——看不懂它写的东西。数学从证明时代,正式进入了验证时代。而验证,不需要天才,只需要耐心。
一个博士研究生花几个月去验证AI的一周成果,值不值得?没人知道。这不是陶哲轩一个人的困惑,这是整个行业面对技术奇点降临时集体性的不知所措。
热门跟贴