7月27日,月之暗面(Moonshot AI)把Kimi K3的完整权重搬上了HuggingFace——2.8万亿参数,96个分片,1.56TB。这是目前最大的开放权重模型,比DeepSeek V4-Pro的1.6万亿参数体量还要多出75%。
发布后不到30分钟,模型页就冲上了HuggingFace趋势榜第一。一小时之内,Reddit的r/LocalLLaMA板块出现一条3000点赞的帖子,问出了所有人心里最直接的问题:这玩意真的能跑起来吗?
很遗憾,答案几乎是“不能”。这个事实正好戳中了开放权重运动内部一个很少有人愿意明说的矛盾:模型越做越大,能真正部署的人却越来越少。
先算一笔让所有人冷静下来的账。Kimi K3是一个混合专家(MoE)模型,2.8万亿总参数,896个专家,每个token只有16个专家被激活,推理时活跃参数约为1040亿。从表面看,只有3.7%的参数在真正“干活”,稀疏化效率似乎很高。但MoE藏着营销材料里从不提及的弊端:所有896个专家都必须同时加载进显存。路由决策发生在计算过程中,因此模型无法在推理时只调用16个专家而把其余880个丢在磁盘上,它们只能全部待在内存里待命。
月之暗面在训练Kimi K3时就采用了量化感知训练(QAT),权重格式为MXFP4,激活值格式为MXFP8,使得每个参数的存储比特数压缩到约4.49。这就是问题所在:常规的“再量化到4比特”这条捷径已经被提前走完了,模型到手时就已经逼近了4比特的实用下限。就算有人能搞出一个尚未验证过的2比特量化方案,体积依然会超过700GB——并不存在“直接GGUF一下就搞定”的取巧退路。
按照vLLM推理的最低显存需求计算,跑起Kimi K3最少需要1680GB VRAM。能跨过这道门槛的配置大致如下:4张NVIDIA H100 80GB×8节点或者8张AMD MI300X 192GB节点。一次24小时的测试运行,成本高达1419至3840美元;如果要连续跑满一个月,费用则在43,158到116,800美元之间。这显然不是给个人爱好者准备的玩具。
社区里最活跃的量化团队Unsloth在权重放出几小时内就推出了Kimi K3的GGUF版本。他们的Q4变体是1.51TB,Q8无损版本是1.56TB——后者只比Q4大了50GB。两个量级之间的差距仅仅是50GB,放在1.5TB的底基上几乎就是个舍入误差。这正是量化感知训练带来的效果:它已经把模型预压缩到了再往下压缩几乎榨不出收益的程度。
一位开发者在X上精准地描述了这种荒诞感:他用15分钟、花4.43美元的云计算成本就搞出了一个Kimi K3 GGUF。MXFP4格式让打包变得极快,却也让“排量”原地锁死——下载之后,你仍然需要天价的硬件才能让它开口说话。开放是开放了,但真正用得起的,依然没几个。
热门跟贴