本期「商业访谈录」学习播客特辑中,主持人张小珺邀请清华大学计算机系博士候选人、上海创智学院璞锐学者孙宇涛,领读 Kimi K3 技术报告。孙宇涛的研究方向正是大语言模型架构与预训练,他从自身对线性注意力、混合注意力与循环增强模型的研究经验出发,串联讲解了 RetNet、Gated DeltaNet、Kimi Linear、Gated MLA、Hyper-Connections、LatentMoE、Muon、Quantile Balancing、WSD、RNoPE、Kimi K1.5/K2.5、MiniLLM、DeepSeek-V3 等多篇相关工作,梳理出一条技术演进脉络。
混合注意力:3:1 比例下的无损长上下文
K3 的混合注意力设计是本次领读的重点之一。孙宇涛介绍,Kimi Delta Attention 将原先的标量衰减扩展为 channel-wise 细粒度衰减,以严格提升能力上限;同时通过 lower-bound 设计保证 BF16 数值精度与 kernel 高效实现。Gated MLA 则把门控技术引入 MLA,以提升训练稳定性。Attention Residuals 与 Hyper-Connections 为残差连接提供了新的维度。
孙宇涛在节目中提到一个关键判断:在线性注意力与全注意力约 3:1 混合下,模型可以获得无损甚至更好的长上下文表现,并在推理效率上获得显著收益。他说:“大家其实发现在保持一定的全注意力比例的基础上,整个模型其实是可以获得无损甚至更好的一个长上下文表现的。”
2.8T 参数 MoE:参数规模仍是智能上限的本质因素
K3 采用 2.8T 参数的 MoE 架构。孙宇涛认为,模型参数大小仍是解决模型智能最本质的因素,K3 在参数规模、激活参数与百万级上下文三个维度同步扩展,是有效 scaling 的体现。预训练章节讨论了 Scaling Law 与 WSD 调度、RNoPE 长上下文扩展;Stable LatentMoE 降低通信开销;Quantile Balancing 实现专家负载均衡。
在优化器层面,Muon 优化器与 Outlier 控制被重点提及。孙宇涛指出:“对于任何优化器来说,它都一定会出现 outlier。所以说如果想严格控制的方法,他一定是直接从模型架构下手的。”
后训练:多教师 on-policy 蒸馏与部署感知
后训练章节介绍了 K3 的多教师 on-policy 蒸馏、部署感知后训练与 Draft Model 微调。K3 采用基于学生生成样本的 on-policy 蒸馏,结合 partial rollout、reasoning-effort budget control 等 RL 技术,优化了训练效率与推理成本。基础设施章节则覆盖 KDA kernel、DualPipe 通信隐藏、动态专家分配、多模态编码器优化与推理侧缓存管理。
“忒修斯之船”与改良性进步
节目最后讨论了 K3 相比 K2 的战略转变,以及架构创新的哲学边界。孙宇涛用“忒修斯之船”比喻来讨论这一问题,并给出了一个被他自己称为“暴论”的判断:“我的判断比较暴论,我的暴论就是大模型可能没有太大的创新,后面都是一些改良性的进步。”
他认为 K3 等前沿模型是行业集体贡献的集成,未来方向更多是基于已有工作的改良式进步,而非架构层面的颠覆。商业化则依赖任务清晰定义。
热门跟贴