在围绕AI减速与暂停的讨论中,有一种反对暂停的论证认为:暂停无法在长期真正减缓进展。理由是,即便我们审计所有大规模算力集中,算法进步最终仍会让超级智能可以在某个人的普通游戏GPU上被训练出来。到那一刻,会出现突然的巨大堆积,随之而来的是一场极其危险的智能爆炸。因此,常见的说法是,更安全的做法其实是把所有算力都用于AI训练,让起飞过程更连续,理论上也更安全。
这类思路依赖一个前提:存在一种叫“算法进步”的因素,它以每年3到10倍的速度无限增长,让同等算力下的AI表现持续变好。人们还常常进一步论证:既然算法进步远快于硬件进步,那么限制集中硬件或AI总硬件规模基本没有意义。比如,即便砍掉90%可用于AI训练的硬件,一年后算法进步也能让AI效率提升10倍,等于最多只买到了一年时间。
核心问题:算法进步被当成了固定速率的外生变量
这里要提出的核心观点很简单:这类论证往往假设存在一种“算法进步”,它有固定的年增长率,而且关键的是,它是外生的——不受行业里其他事件影响。
关于“算力堆积”的论证,曾出现过一模一样的推理和失败。当时的说法是:前沿实验室最好把算力用于最大程度推进AI能力,因为在给定算力水平下,我们能发现哪些能力可以实现,这最终会让能力增长更平滑、更可预测,并且“用掉堆积”。反过来,如果不把全部算力用于AI训练,“算力堆积”会不断累积,一旦某天把所有算力从其他用途切换到AI,就可能出现极其危险的突然能力尖峰。
这个论证有一定道理,但它假设算力增长是一个外生变量,无论AI领域发生什么都会持续发生,让“干柴”以同样的速度堆积。而现实中并非如此。算力增长在很大程度上由AI需求驱动。因此,试图通过使用算力来减少“算力堆积”的做法,实际上制造了一个更糟糕的问题,并最终让AI能力发展得更快。
一些关于算力堆积的论证,或明或暗地假设算力增长是固定的,理由是台积电只能缓慢增加晶圆厂产能——这没错。即便在今天的需求下,台积电也在增加产能建设,但并非崩溃式的速度。然而,这忽略了系统可以更快调用的其他松弛空间,包括:把现有晶圆厂产能从其他用途重新分配给AI;以及开发在相同硅片面积成本下更适合AI的芯片。
今天英伟达和AMD等公司的AI芯片,与最初被改用于AI的游戏GPU几乎没有关系。如果我们还在尝试用游戏GPU训练模型,AI进展几乎肯定会慢得多。即便2030年世界上突然多出大量游戏GPU可以投入AI训练,这种“算力堆积”对训练AI的效果也远不如今天的芯片。
算法进步来自整个生态,而不是天降的吗哪
令人担心的是,人们正在用外生“算法进步”的概念,重复完全相同的问题。“算法进步”不是以固定速率从天上降下来的吗哪。它由整个AI工作生态造成——从AI研究者提出更好的算法,到数据公司生产能提升AI某些能力的数据。整个生态深受AI整体进展的影响。
如果AI进展迅速,AI公司有更多钱,更多人开始学习和从事AI工作,AI实验室的需求催生出支持性公司生态,更多学术研究聚焦于AI扩展当前面临的问题,更多软件和其他支持性基础设施被建造出来。
现在想象一个反事实的世界:AI进展和扩展远不如今天这么庞大。即便算法进步在某种程度上继续——有学者在改装的游戏GPU上摆弄神经网络——假设2030年某位学者想出了“AGI的秘密算法”。此时他仍然必须想办法:创办一家AI公司,这对学者和风投来说都更加陌生;让别人相信这个想法;建造大量基础设施,以支持训练和推理的扩展,才能高效、大规模地运行这个“新AGI算法”;设法把数百万块分散的游戏GPU联网,来训练和推理这个模型;等等。
反过来,如果同样的事情发生在今天,他发表论文后几小时内,多家万亿美元级AI实验室的AI智能体就会立即在它们的基础设施上重新实现并测试它。如果有效,它们有数十万块超强专用AI超算GPU来运行它,同时还有现成的基础设施,既能把这种算法的训练扩展到大规模联网GPU集群上,也能立即启动数百万个运行这种新算法的AI“群体”。我们整个“减少堆积”的策略,反而制造了我们原本担心的那种堆积。
我们不应在算法进步的概念上重复同样的错误。
热门跟贴