Anthropic把这种趋势叫做“递归自我改进”——就是AI系统自己设计、构建、训练下一个版本,人类不再每一步都插手。更值得注意的是,他们还呼吁全行业协调:等递归自我改进真的到来时,要有办法暂缓甚至临时叫停前沿AI开发。而且他们已经开始行动了,限制最新的Claude Fable 5被用来研发前沿AI。
就在Anthropic发出警示的同时,田渊栋联合创立的Recursive Superintelligence,宣布向自动化AI研究迈出了第一步。这家公司刚结束隐身状态一个月,就拿出了第一项公开成果:一个开放式的自动化知识发现系统,在三个基准测试上都拿到了SOTA(最好成绩)。简单说,就是他们让AI替你跑实验,从提想法到写代码、验证结果,全流程自动化。
第二个场景更难,是NanoGPT Speedrun基准:用8块H100 GPU,把GPT模型训到验证损失3.28的最短时间。社区已经优化了两年多,从45分钟压缩到79.7秒。Recursive的系统从最优解出发,又把时间缩到77.5秒,省了2.2秒,和最近人类贡献的改进幅度相当甚至更好。核心技巧有三个:一是把FP8精度用到注意力计算,前向用FP8提升吞吐量,反向用BF16保持稳定;二是给优化器加了退火噪声,先大胆探索再稳健收敛;三是重写了MLP内核,省去一次显存读写,直接提速。这三个改进涉及精度策略、优化器设计、GPU内核编程三个不同领域,可见系统的通用性。
第三个场景深入到底层GPU内核优化,用的是英伟达的SOL-ExecBench基准,包含235个内核任务,评分0.5是PyTorch基准,1.0是硬件极限。之前最佳是0.699,Recursive的系统拿到了0.754,把距离硬件极限的差距缩小了18%。更牛的是,Recursive团队自己都承认不是内核专家,这些优化想法都是系统自己找出来的!
其实Recursive不是唯一的玩家,Yann LeCun的AMI Labs今年3月融了10亿,David Silver的Ineffable Intelligence4月拿了11亿种子轮,都在做让AI自主生成知识的事。但Recursive的成果是目前同类公司里最具体、可复现的。这种递归AI的逻辑很简单:AI提升AI研究能力,改进后的AI再进一步提升自己,周而复始。这能解决人类研究员稀缺的问题——全球能做前沿AI训练的研究员不超过几千个,如果AI能接管部分工作,AI进步的速度和成本都会变。
但Anthropic的警示也不能忽视:他们呼吁行业在递归自我改进到来时,要有暂停的选项,让社会和对齐研究跟上。一边是Recursive推进,一边是Anthropic警示,这两件事同时发生,耐人寻味。当然,Recursive也承认这只是第一步,目前系统在指标明确、反馈快、作弊易检测的场景效果好,离自主解决开放性科学问题还有距离,奖励作弊防控也是大挑战。但不管怎样,这个闭环已经开始转了,接下来就看它转得多快。
看到这里,你是不是也觉得AI的进化速度有点超出想象?AI自己搞研究,到底是能让人类更轻松,还是会带来不可控的风险?欢迎在评论区分享你的看法!觉得这篇内容有价值的话,别忘了点赞、收藏、转发,让更多人了解AI领域的最新突破~
热门跟贴