一个只有3个关注者的GitHub账号,连续两次刷新了NanoGPT Speedrun的世界纪录。这个账号背后,是国产AI团队彩云科技,全队只有3个人。

NanoGPT Speedrun是全球开发者共同参与的开源竞速项目:用固定的8张H100显卡,把GPT-2 Small模型训练到统一标准,比拼端到端训练耗时。在这个公开擂台上,彩云团队用两次架构层面的技术创新,把训练时间从84.36秒一路压到了76.3秒。

打开网易新闻 查看精彩图片

仓库维护者Larry Dial的评价很直接:这是「一段时间以来最先进的PR」。论文作者也认为,这些思路未来很可能被用于更大规模的训练。

第一次突破:给Transformer装上「动态电梯」

传统Transformer的残差连接是固定的——每一层的信息只能按既定路径向后传递。彩云团队在第81次提交中提出的MUDD(Multiway Dynamic Dense Connections),打破了这种固定模式。

MUDD为Q、K、V、Residual四类信号各自设计了动态连接路径。模型可以根据当前Token和隐藏状态,自主判断应该从哪些历史层取回信息,以及这些信息以多大权重参与当前计算。论文里有个形象的比喻:这相当于给Transformer装上一套动态电梯,模型自己决定去哪层、取什么、拿多少。

这套机制的性价比相当惊人。论文显示,仅增加约0.23%的参数量和0.4%的计算量,就能达到普通Transformer使用1.8到2.4倍训练算力的效果。在实际竞速版本中,低开销的MUDD Skip Connections一次就把训练时间从84.36秒缩短到了81.78秒,砍掉2.58秒。

第二次突破:让注意力头学会协作

一个多月后,彩云团队在第85次提交中带来了第二项创新:MMUDD Gates与Lightweight DC MHA(Dynamically Composable Multi-Head Attention)。

传统多头注意力机制中,各个Head是并行独立计算的,缺少随输入动态协作的能力。彩云的设计复用了原有的Q/K投影,额外计算一个112 Token的局部注意力窗口,经Softmax后将多个Head的注意力图动态合成为共享图,再通过不同Head Scale作用于各自的Value。

简单说,它不再让多个Head各自为战,而是根据当前输入动态决定哪些Head需要协同、哪些信息应该加强或重新组合。这一设计在保留跨头组合能力的同时控制了额外开销,使训练步数下降约7%,将世界纪录从79.2秒推进到了76.3秒。

同一个方向,三条不同的路

彩云的MUDD,与Kimi的AttnRes、字节的Hyper-Connections,其实同属「打破Transformer固定信息流」这一研究大方向。三者都试图解决传统残差连接导致深层网络单层贡献被稀释的问题。

但MUDD的独特之处在于:AttnRes通过Softmax对历史层打分后选择参考哪些层,属于概率性路由;而MUDD不受Softmax归一化约束,可以直接生成正负连接系数,对信息进行放大、抑制或抵消,并且扩展到了Q、K、V三路,而非仅残差流。

在竞速实践中,不同方案的工程效果也有差异:Partitioned HC缩短约0.66秒,MUDD Skip Connections缩短约2.58秒。不过需要说明的是,两次提交基于不同版本的代码,数字不可严格对比。

小团队为什么能拿到大结果

「这真是,拿到大结果了!更意外的是,提交者的账号当时只有3个关注者。」这是文章作者的原话。一个3人团队、3个关注者的账号,在开源竞速中连续两次刷新世界纪录,这件事本身就足够反常识。

当然,也要保持清醒:当前测试对象仅为GPT-2 Small规模,模型规模、硬件环境、训练策略和并行方式都可能影响最终收益。3%的提升不意味着直接线性放大到百亿、千亿参数规模依然成立。

但在固定硬件、固定数据、公开代码和真实训练时间的约束条件下,彩云的两项工作证明了一件事:看似停留在论文里的架构优化,可以转化为真正改变训练过程的工程方法。NanoGPT Speedrun的意义,正是在于提供这样一个「公共擂台」,让有效想法进入代码库,成为下一次突破的起点。

技术演进史,从来不只是由声量书写。