智谱联合创始人兼首席科学家唐杰近日公开表示,万亿参数规模是行业走过的弯路。他认为,模型规模的扩展不应只盯着参数量,而应综合考虑训练数据规模、算力投入和运行环境等多重因素。
这一判断直接体现在智谱最新一代模型的技术路线上。据唐杰介绍,智谱在GLM-5.3的迭代中,选择将资源投入到后训练(post-training)环节,而非继续堆高参数量。
打开网易新闻 查看精彩图片
参数竞赛的代价
过去几年,大模型行业围绕参数量展开了一场军备竞赛,万亿参数一度成为头部玩家追逐的标签。但唐杰的表述暗示,这条路线的边际收益正在递减——更大的模型意味着更高的训练和推理成本,而实际效果未必与参数规模成正比。
智谱的选择代表了一种务实转向:在同等甚至更小的模型规模下,通过优化后训练流程来挖掘性能潜力。这种思路更贴近实际部署场景中对效率和成本的双重考量。
当行业还在为参数数字较劲时,头部玩家的技术判断已经开始分化。智谱的取舍,或许会让更多团队重新审视"大就是好"的惯性思维。
热门跟贴