一个数字,第一眼看上去不太合理。
通义千问刚发布Qwen3.8-Flash-Next,每个token只激活60亿参数,却在基准测试里追平甚至超过每个token激活130亿参数的DeepSeek-V4-Flash,以及170亿参数的Qwen3.7-Plus。在它自己的基础测试中,这个6B激活模型据称在14项测试里超过8项,对手的激活量都远高于它。
直觉会告诉你:模型越小,结果越差,事情一直差不多是这样。那为什么一个每个token算得更少的模型,能打赢算力是自己两到三倍的对手?
答案不是某种神奇的基准测试技巧,而是一个大多数人在看模型规格表时会跳过的概念。一旦弄明白它,当下AI效率竞赛里的很多事会突然变得清晰。
规格表上真正该看的数字
人们评估模型时,习惯引用总参数量——“这是个125B模型”“那是个400B模型”。这是标题里的数字,但对于成本和速度来说,它几乎是最不该关心的那个。
这里有两个数字,含义完全不同:
- 总参数——模型在磁盘上的大小,它知道的一切都存储在权重里。这决定你需要多少内存来装下模型。
- 激活参数——处理每个token时实际用到多少参数。这决定每个token要算多少,直接驱动推理成本、速度和延迟。
对传统稠密模型来说,这两个数字是一样的:每个参数对每个token都会触发。这简单、可预测,但也昂贵——不管这个token需不需要,你都在付全价。
过去几年的核心思路,就是打破这种绑定:让总参数量很大,模型知道得很多;让激活参数量很小,每个token算起来便宜。这正是Qwen3.8-Flash-Next能在磁盘上存下约1800亿参数,却只让每个token走60亿参数的原因。
一句话版本:总参数告诉你模型知道多少,激活参数告诉你运行它要花多少钱。看价格和速度,激活参数才是该盯的数字。
混合专家模型到底是怎么回事
把这两个数字解耦的技术叫混合专家模型(MoE),它比名字听起来更简单。
与其用一个每次全部触发的大网络,MoE把模型的大部分拆成许多更小的子网络,称为“专家”——Qwen3.8-Flash-Next有512个专家。每个token到来时,一个叫“路由器”的小组件只挑少数几个专家实际运行,其余专家对这个token保持空闲。
打个比方:一家医院有512位专科医生。病人进来时,你不会叫醒全部512位,而是把病人分给两三位相关专科医生。医院里沉淀着大量专业知识,但单次问诊只动用其中一小部分。
这就是MoE的效率来源:模型“知道”的很多,但每次“做事”只调用一点点。总参数和激活参数之间的差距,就是省下来的算力。
为什么6B激活能赢更高激活量
关键不在于“少算就更好”,而在于算得更准。
稠密模型每个token都要让全部参数过一遍,其中大量计算对这个token可能毫无帮助。MoE模型则让路由器先判断这个token需要哪类知识,再把计算分配给最相关的专家。激活量虽然小,但每一份计算都更“对口”。
Qwen3.8-Flash-Next的512个专家池,给了路由器足够细的选择空间。每个token只激活6B参数,意味着它可以在更大的知识库中做更精准的调度,而不是像稠密模型那样把全部权重都压上去。
这也解释了为什么激活参数比总参数更能反映真实成本:你付的不是“模型有多大”,而是“每个token实际动用了多少计算”。当调度足够聪明,更少的激活量也能换来同等甚至更好的结果。
这场效率竞赛在争什么
Qwen3.8-Flash-Next的意义,不在于它又刷了一个榜单,而在于它把“激活参数”这个指标推到了更靠前的
热门跟贴