AI行业过去五年的信仰,可能从头就错了。
OpenAI前研究员Diogo Almeida发博客,指控2020年原始Scaling Law论文有三个致命bug。DeepMind专家Sander Dieleman转发背书。
原话是:"大概率害得业界在一堆体量过大、训练不足的模型上白白烧掉了海量算力。"
三个bug,一个比一个离谱。
**第一个:所有模型喂一样多的数据。**不管参数大小,都喂约130B tokens。小模型撑到吐,大模型营养不良。
这就像让幼儿园小朋友和博士生用同一张试卷考试,然后说成绩只跟天赋有关。
**第二个:余弦学习率衰减。**训练快到终点时把学习率摁到零,模型进步自然就平了。研究者说"加数据没用了,模型饱和了"。
真相是学习率把成长掐断了,制造了天花板假象。
**第三个:把局部真理当宇宙法则。**固定token上限下技术上没错,但不适用于"数据无限"的理想世界。
三个bug叠加,产生了一条既错又极难debug的"定律"。
这条定律告诉全世界:固定算力下优先把模型做大。最优参数量正比于算力的0.73次方。
这个结论定义了GPT-3:1750亿参数,往死里堆。
然后DeepMind的Chinchilla直接打了脸。
700亿参数配1.4万亿token,全面反超2800亿参数的Gopher。体量不到一半,数据四倍多,同样算力预算碾压。
一个养成了虚胖壮汉,一个练成了精瘦拳手。
说实话,我看完第一反应是:过去五年烧掉的算力算什么?
奥特曼信AGI的底气就来自这条曲线。全球最聪明的头脑沿着一条有bug的公式冲了五年。英伟达卖了天价GPU,所有人都在"大力出奇迹"的信仰下狂奔。
结果告诉你:力是出了,方向可能偏了。
但这里有个反直觉的判断。
很多人觉得"Scaling Law有bug"就是"大力出奇迹"被否了。不完全对。Chinchilla证明数据和参数要同等放大,不是否定scaling,是修正了配比。
方向没错,配方错了。
更值得琢磨的是第二个发现。
同样的架构算力,法语模型效率比英语高50到100倍。英语是形态贫乏的语言,需要海量数据猜词义。法语中文这种结构严密的语言,词汇本身带大量信息。
你以为在探索通用智能的物理定律,其实只在测量英语有多浪费算力。
如果用中文训练,同样算力可能跑出完全不同的效率曲线。这个发现对中国AI行业的意义比bug本身更大。
最讽刺的是:GPT-3的"虚胖"本身就是bug的证据。
但没人看出来,因为模型够大,表现够唬人。这跟GPT-5.6作弊门形成闭环。模型越大越会骗人,不只骗评测系统,从根子上就在骗研究者。
还有一个细节。
纠正OpenAI bug的Chinchilla论文,后来被发现自己也有bug。loss尺度设高,Huber损失求了平均而不是求和。
纠正bug的论文,自己带着另一个bug。
这可能是AI行业最诚实的隐喻。我们对自己模型的理解程度,远没有以为的那么高。
Scaling Law从来不是牛顿三定律。它只是一条经验拟合的曲线。
这话可能得罪人,但我觉得那些还在拿"Scaling Law证明大力出奇迹"说事的AI公司,有一半估值逻辑要重新审。
热门跟贴