智谱人工智能创始人唐杰19日在X平台发文,系统阐述其对Scaling Law的最新理解,并以GLM-5.3作为"控制变量实验"佐证这一判断。这篇帖子的发布,恰好回应了外界对智谱未训练全新基座模型的质疑。
唐杰在文中指出,参数量从来不是评估模型能力的唯一维度,数据规模、算力分配与推理部署条件同样不可或缺。他表示,GLM-5.3与上一代GLM-5.2共用相同基座、相同架构、相同的753B总参数与40B激活参数,差异仅在于增加了一个月的长时域环境训练与强化学习(RL)后训练——而由此带来的能力提升"并非微小"。在AA评测指数中,GLM-5.3获得60分,较GLM-5.2的53分提升7分。
这一实验结论的核心在于:当基座模型参数规模已足以承载足够的知识,额外的能力提升往往来自"拨动其他旋钮"——尤其是后训练阶段,而非继续堆砌参数。这一判断对当前整个AI行业如何分配训练资源,具有直接的参考价值。
万亿参数:行业曾共同走过的弯路
唐杰在文中梳理了Scaling Law的演变脉络。2020年,Kaplan等人得出结论,认为参数规模的增长应快于数据增长,比例约为2.7:1。这一结论推动了GPT-3、Gopher、MT-NLG等超大规模模型的集中涌现,万亿参数一度被视为行业进步的必经路径。
然而,2022年Hoffmann等人对400余个模型重新开展实验后发现,算力最优的分配应接近每参数20个Token,且随着算力持续扩大,参数量与数据量应以大致相同的速度共同增长,而非持续拉大差距。这即是被广泛引用的"Chinchilla Scaling Law"。
唐杰在帖子中直言,早期拟合误差随着算力量级的提升被不断放大,导致当时规模最大的一批模型恰恰是算力分配最失衡的:
"万亿参数这一轮,回头来看,是整个领域一起走了一段弯路,然后又一起折返。"
推理成本与MoE:最优解持续移动
Chinchilla之后,最优解并未就此固定。唐杰指出,Chinchilla优化的目标是"训练一次、评测一次"的模型,而今天的主流模型每天可能被调用数十亿次,推理成本在全生命周期中远超一次性训练成本。
将推理成本纳入目标函数后,最优解将向"更小模型、训练更久"的方向移动。他援引Llama-2-7B与Gemma-2-9B为例,两者每参数对应Token数分别约为290和889,均属刻意"过训练"的范畴。
混合专家架构(MoE)的普及进一步使问题复杂化。唐杰区分了两个在MoE语境下必须分开讨论的维度:总参数量决定模型能够存储多少知识、事实与长尾信息;激活参数与每次前向计算的有效深度,则决定模型的长程推理能力。
他援引Roberts等人2025年的研究发现,最优的每参数Token数因任务而异——记忆类任务倾向于更多参数,推理类任务倾向于更多数据;而在固定每参数Token数的条件下,继续增加总参数会降低推理能力,激活更多专家则能稳定提升推理表现。唐杰据此指出,识别漏洞这类需要二十步因果链推理的任务,其核心能力并不存在于总参数量之中。
GLM-5.3:一次控制变量实验
基于上述判断,唐杰将GLM-5.3定位为一次有意为之的"控制变量实验"。相较于GLM-5.2,GLM-5.3保持基座、架构、总参数与激活参数完全不变,唯一的变量是增加了一个月的长时域环境Scaling与强化学习后训练。
他坦言,此次选择后训练这一"旋钮",是因为它当前拥有最大的改进空间,而非其他维度已无潜力可挖——"这并不意味着其他旋钮已经转到头了。"他明确表示,基座模型规模、预训练数据以及每次前向计算的算力投入,均仍在考量之列,下一步可能还会涉及中间训练(mid-training)与预训练层面的调整。
这一思路与外界此前对智谱"为何不训新基座"的质疑形成直接回应。在唐杰的框架中,各旋钮无需同步调节,关键在于判断"下一个最值得拨动的是哪一个"。目前,GLM-5.3的Coding能力已被多位开发者评价为国产模型中的当前最优水平。
热门跟贴