2026年9月17日到18日,哈佛大学数学科学与应用中心,24个全美最顶尖的数学家坐到了一起。
MIT的Larry Guth来了,普林斯顿的Assaf Naor来了,斯坦福的Ravi Vakil来了,伯克利的Martin Olsson和Thomas Scanlon也来了。这些人平时散落在各大高校,能在同一个屋檐下聚齐两天,本身就不寻常。
他们讨论的不是什么千年数学难题,而是一个更棘手的问题:当AI开始写论文,我们怎么判断一个博士生到底行不行?
两天后,一份8页的报告挂在了哈佛CMSA的官网上。这份报告的建议,用一句话概括就是:别再用博士论文来评定博士毕业了。
听听这话,从一个数学家的嘴里说出来,是不是有点疯?
但这群人没疯。他们在一份声明里写得明明白白:“论文本身,当被孤立地使用时,已经不是一个评估学生的可靠工具。”
换句话说,一篇看起来漂漂亮亮的博士论文,可能根本就不代表坐在你面前的那个年轻人,真的搞懂了里面任何一个证明。
一、 258篇论文的幽灵
就在哈佛这场闭门会议召开的前一周,学术圈已经炸了一次锅。
芝加哥大学布斯商学院,一位叫尼古拉斯·波尔森的统计学终身教授,被人扒出来在9个月里署名了超过200篇论文和14本书。哥伦比亚大学的安德鲁·盖尔曼教授专门跑去翻了波尔森的SSRN主页,发现这哥们儿不光产量惊人,而且篇篇都是长文,不少长达二三十页甚至五十多页,光8月份一个月就上传了104篇。
更离谱的是,8月26日当天,他上传了6篇。
你算算这个账。一个正常的数学或统计学研究者,一篇像样的论文从想法到定稿,少则几个月,多则几年。一年能发十来篇的已经是高产得让人眼红。波尔森一天发6篇,这不叫学术产出,这叫学术印刷机。
盖尔曼点开了其中一篇题为《人类联结理论》的论文,全文80页,横跨经济学、心理学、生物学、哲学和博弈论。看完之后他的结论是:内容缺乏实质价值,部分文字读起来像是聊天机器人生成的。
后来波尔森本人承认了,确实用了AI。他的解释倒也直白:AI让研究过程中的繁重工作变得容易,“原本具有生产力的研究人员可以大幅提高效率”。
SSRN反应很快,下架了他257篇文章,冻结了上传账号。
这事听起来像个学术界的奇闻轶事,不过如果你把它和哈佛那份报告放在一起看,就会发现这是一个巨大裂缝的两端。
一端是:AI已经可以批量生产看起来像论文的东西,而且速度快到人类审核根本追不上。另一端是:一个顶级的数学家群体已经得出结论,论文本身不再能证明什么了。
当生产端和审核端同时失效,博士学位赖以存在的根基就开始松动了。
二、博士这个东西是怎么来的
要知道这件事有多严重,得先搞清楚博士这个玩意儿到底是怎么来的。
12世纪的欧洲,工商业行会盛行,大学也照葫芦画瓢,搞起了自己的行会制度。学士、硕士、博士,本质上就是教师行会内部的等级资格认证。谁拿到了博士学位,谁就有资格单独开课收徒,有点像中世纪的“教师资格证”。
那时候的博士考试,核心环节是什么?公开辩论。你得站在台上,面对一群比你年长、比你资深的学者,用拉丁语唇枪舌剑,证明你真的吃透了知识。
真正把博士教育塑造成今天这个样子的,是19世纪初的德国人洪堡。1810年,威廉·冯·洪堡创办柏林大学,提出了一个在当时惊世骇俗的理念:教学与科研相统一。从此,博士不再只是一个“能教书的人”,而被定义为“能独立创造新知识的人”。柏林大学的哲学院开始授予哲学博士学位,强调学术自由和原创性研究,这就是现代博士生教育的起点。
洪堡模式给博士生教育注入了一个核心信念:博士的价值,在于他能不能创造出前人没有的知识。 为了证明这一点,你需要写一篇论文——一份独立完成的、包含原创贡献的学术作品。这篇论文,就是你智识成色的证明。
这个逻辑运转了两百多年。两百年里,论文就是博士的通行证,没论文就没有博士,天经地义。
问题是,洪堡当年做梦也想不到,有一天会有一台机器,能在几个小时内写出看起来像模像样的论文。洪堡假设了一个前提:能写出好论文的人,一定经过了严格的学术训练,具备独立的思考能力。 这个假设在AI时代,不成立了。
AI可以写出结构完整、引用规范、论证流畅的学术文本,然而它没有思考,没有判断,没有真正理解任何一个证明为什么成立。更麻烦的是,这些AI生成的文本和人类写的论文之间的差距,正在迅速缩小。有研究显示,在适当的提示下,AI生成的学术文章在某些方面——比如形式逻辑的严密性——甚至被评审认为优于人类作品。
洪堡模式用两百年建立起来的逻辑链条,正在被一行行代码无声地锯断。
三、那篇论文坐在椅子上
哈佛那份报告最狠的一句话,藏在推荐方案的第二段里。
报告建议,PhD候选人需要接受每年至少一次的、由多位教员参与的面对面严格评估,评估产生的报告应当成为学生未来求职档案的一部分。报告还建议借用其他学科已经通行的“研究计划书加口头答辩”模式,并且把博士论文答辩变成必须完全掌握研究内容的实质性考核。
翻译成人话就是:我们不看你怎么写的,我们看你怎么说的。
你拿一篇论文来,我们不看那几十页纸。我们把你叫到一个屋子里,坐在你对面,问你问题。你做的这个证明,第三步到第四步之间的逻辑跳跃是怎么来的?你引用的那篇参考文献,它的核心论证到底是什么?如果换一个条件,你的结论还成立吗?
AI可以替你写论文,可没法替你坐在那把椅子上。
已经有学者在呼吁,博士答辩必须从“确认性的提问”转向“探索性的追问”。什么叫确认性提问?“你的第三章讨论了什么?”候选人事先背过,张嘴就来。什么叫探索性追问?“如果把你引理2的假设放宽,证明的第15行会出什么问题?”这个问题AI答不了,因为你必须真的理解那个证明的每一个环节,才能回答。
说白了,论文从“评价对象”变成了“讨论材料”。 以前论文是终点,是你要交上来的成果证明;现在论文只是一个起点,一个供你和考官对话的素材。
这个转向的深刻之处在于,它改变了博士培养的底层逻辑。以前是“你写出来就算数”,现在是“你得让我相信你真的懂了”。而“真的懂了”这件事,只有通过对话才能验证。
有意思的是,哈佛24位数学家的建议,和中国2025年施行的《中华人民共和国学位法》在精神上撞到了一起。这部法律从立法层面把“实践成果答辩”和“学位论文答辩”并列,打破了“唯论文”的单一评价体系。南京大学已经出现了第一个以实践成果替代传统学位论文毕业的工程类博士生——他的“论文”是一套已经在南水北调工程中部署应用的检测设备。
一个在常春藤的数学圈里讨论,一个在中国工程教育的改革文件中落地,路径不同,却指向同一个方向:评价一个博士,不能只看他写了什么,得看他做了什么、懂了什么、能面对什么。
四、当写作不再是门槛
这里需要说清楚一件事:哈佛这帮数学家不是在否定论文写作。
他们报告里有一句话特别值得琢磨:他们建议放宽一个长期存在的规范——博士论文不需要记录某个命题的“首次证明”。
这话什么意思?以前我们说一篇博士论文有价值,很大程度上是因为它提供了某个东西的“第一次证明”。这个“第一次”就是你原创性的证据。但如果AI能快速生成证明呢?“第一次”的意义就被稀释了。
那什么还重要?理解。
你能不能理解这个证明背后的思想?你能不能看到它在更大框架中的位置?你能不能判断它是不是对的?你能不能说出它为什么重要?
这些东西,AI的代码写不出来。
所以哈佛的报告里提出了三条“强烈共识”的伦理规则:作者对自己署名下的数学内容承担全部责任;AI的使用必须具体披露;所有参与者在将材料输入模型前必须明确同意。
这三条规则的核心其实是一件事:你得对你写的东西负责,而“负责”的前提是“理解”。
这听起来像是废话。不过如果你仔细想想,一个博士生用AI生成了一篇论文,他自己都没完全看懂,然后签名交上去——这就是在违反第一条规则。他没有对自己署名下的内容承担全部责任,因为他压根不知道那些内容对不对。
所以问题的根源不在论文本身,而在于论文和“理解”之间的绑定关系松了。以前你写出一篇论文,我们默认你理解了;现在你写出一篇论文,我们得问一句:你真的理解了吗?
如果论文和“理解”之间的关系变得不可靠,那评价体系就得绕开论文,直接去检测“理解”本身。
面对面评估、年度考核、口头答辩——这些手段不是发明出来的新东西,它们只是把中世纪博士教育最初的形态,重新捡了回来。
五、改变的种子
这场变革不会一夜之间发生。
哈佛的报告本身也承认,这是一份“初稿”,未来几个月还会根据反馈不断修改。报告里说得很坦诚:参与者对AI在数学研究中哪些用途是“有益的”、哪些是“有害的”,存在显著分歧。
问题是有些东西已经开始动了。
已经有学术论文在探索AI时代博士论文评价的新框架,提出了包含原创性、概念清晰度、方法论严谨性、学术贡献和知识诚信五个维度的评价模型。有学者在呼吁学术诚信验证应该“以人为锚点而非以文本为锚点”,通过提交后的口头验证来确认学术真实性。从2026年开始,国内高校已经在学位论文审核中引入AIGC检测,把人工智能生成内容检测结果作为论文质量审核的重要参考。
这些零零碎碎的变化,看起来互不相干,但它们都在做同一件事:把评价的焦点从“文本”拉回到“人”。
当然,这个过程注定痛苦。导师们要花更多时间做面对面评估,院系要重新设计培养方案,学术共同体要建立新的评价标准。更重要的是,每一个正在读博的年轻人,都要面对一个不确定的未来——你辛苦写出来的那篇论文,可能不再是你毕业的全部依仗。
想一想也许这不是坏事。
如果你问任何一个真正做过研究的人,博士生涯里最重要的收获是什么?大多数人的答案不会是“我写了一篇论文”,而是“我学会了怎么思考一个问题”。
论文只是那个思考过程的记录。如果记录方式变了——AI可以帮忙写了——那就换一种方式验证思考过程本身。
博士这个东西,从诞生那天起,检验的就是一个人能不能独立思考。
中世纪靠辩论,洪堡时代靠论文,AI时代靠什么?
也许答案从来就没变过:靠你坐在那儿,用自己的脑子,回答别人的问题。
论文会变,AI会来,评价体系会改。可那个坐在椅子上的人,必须还是真的懂。这才是博士这两个字的底线。
热门跟贴