田渊栋在Meta FAIR待了多年,做出过Dark Forest和OpenGo,最后却选择离开,创办了一家叫Recursive Superintelligence的公司。让他下这个决心的,不是算力不够,也不是模型不行,而是一件听起来有点反直觉的事:AI能把研究效率拉高6到10倍,但它提不出一个值得做的好问题。
这个判断来自他最近的一次播客访谈。他回顾了自己从计算机视觉的非凸优化,到2012年被AlexNet拉进深度学习,再到Meta FAIR做围棋程序、做强化学习、做可解释性的整条路径。路径的终点,指向了同一个瓶颈。
效率提升6到10倍,但方向还得人来定
田渊栋在Meta的最后一篇论文,研究的是神经网络的grokking现象。这篇论文里,他和GPT-5合作,请它证明定理、检查结论、提供思路。他给出的评价是,效率达到了原来的6到10倍,而且当时代码还是他自己写的。
但他没有把这件事说成AI取代研究者。他的描述是,人的位置在上移——从实现和检验,移到提问和验证。人类仍然要发起项目、判断什么重要,并且验证AI给出的问题和答案。他强调,研究判断力之外,工程能力同样决定成果能不能被认真对待。
问题恰恰出在提问这一环。他说,如果你自己没有想法,AI给你的想法就会很平庸,基本上都是大家已经知道的东西,不是什么有意思、值得探索的方向。模型能按人的思路去实现和验证,但独立给出的点子往往平庸,还容易对训练或验证指标过拟合。
递归自我改进卡在哪
递归自我改进这个词听起来很科幻,田渊栋把它拆成了短期和长期两层。
短期受限于上下文。他认为增加上下文只能带来阶段性提升,长期需要比Transformer更好的架构。
长期受限于数据。现有范式依赖互联网上的海量重复性数据,所以模型擅长重复工作。一旦要做跳出惯常思路的创造性任务,数据就不够了。他的结论是,必须换成能用极少数据快速学习的新架构与优化器。
这也解释了他为什么把重心放在可解释性上。他提到,小规模实验依赖架构里的归纳偏置,数据变多之后这些偏置可能失效。视觉Transformer在ImageNet量级数据上不如卷积网络,在数亿张图片上反超,就是例子。他强调,要在一定程度上知道网络内部发生了什么,才能确信小规模结论可以泛化,否则只能盲从缩放定律,赢家只剩下算力最多的公司。
围棋教会他的,不是算法
2015年,Dark Forest用卷积网络击败了网上的顶尖业余棋手。2018年,复现AlphaZero的OpenGo只用一块GPU,就以5:0击败四位韩国职业棋手。
但田渊栋从围棋里带走的经验,不是某个算法。他说,真正重要的并不是算法,而是动作空间和状态空间怎么设计。此后他把强化学习推向现实问题时发现,关键往往就在这里。他尝试用潜在空间蒙特卡洛树搜索,自动找到让子空间差异最明显的动作空间,避免搜索空间指数爆炸。
他还推动在连续潜在空间而非token空间做推理,出发点很个人:他自己思考时并不使用语言。
开源、监管,和那个最糟糕的情况
田渊栋对开源模型的态度很明确。他认为模型只需跨过一个门槛就足够好用,Kimi等开源模型已经能做不少工作,只是思考过程更长。他给出的判断是,一旦到了这步,模型就会成为普通商品。
他担心的反面是,一小群精英掌控世界上有史以来最大最强的模型,并收取高溢价。所以他希望把成果开源,让更多人平等使用AI能力。
至于监管,他觉得递归自我改进的边界极其模糊。与编程agent迭代想法、与人合写论文,都可能被算作自我改进,加上开源模型扩散,监管很难执行。
把这些放在一起看,田渊栋创办Recursive Superintelligence的直接动因就清楚了:既然模型擅长重复、人类擅长提问,那就把重复研究交给AI,人去找新方向。这个分工能不能成立,取决于新架构和新优化器能不能让模型用极少数据学会创造——而这,正是他押注的那件事。
热门跟贴