周三,Moonshot AI的开源模型Kimi K3在发布后的48小时内,官方就按下暂停键——不再接受新用户订阅。不是模型质量问题,而是涌入的开发者直接把GPU容量挤爆了。现有的付费和试用用户还能继续用,但新来的只能排队等下一批放量。
官方在X上解释得挺直白:“K3收获的热爱远超预期,过去48小时的需求已经逼近我们当前算力的极限。我们正在全速扩容,会分批重新开放订阅。”翻译成人话就是:模型太能打,但服务器没跟上。
这件事把整个AI行业一个越来越尖锐的瓶颈摆在了台面上:当模型的能力从“聊天”进化到“干活”,尤其是处理代码、跑长链路的智能体任务时,对推理算力的消耗根本不是一个量级。花旗半导体分析师Peter Lee在一份研究报告中点明了这个转变——智能体任务不是一问一答,它们在持续执行的过程中会不断地生成、读取、处理tokens。推理成本一旦下降,开发者立刻就会用更多的任务把省出来的算力重新填满,瓶颈就从算力本身转移到了服务器的内存和持续供给能力上。
Kimi K3自身的数据也让它更容易触发这个瓶颈。总参数量2.8万亿,是迄今最大的开源权重模型之一。在Arena.ai的前端代码竞技场上,它甚至把OpenAI的GPT-5.6 Sol和Anthropic的Claude Fable 5都挤到了身后。不过在更综合的Artificial Analysis智能指数上,K3得分57,仍然稍逊于Fable 5的60和Sol的59。但不管评分如何,它巨大的体量意味着谁想部署它,就得先准备好足够的GPU账单。开源权重让任何人都能下载模型,可跑起来之后的推理开销,还得自己扛。
而Moonshot作为一家中国公司,面临的还有区域性的额外制约。跟传统软件公司不同,AI厂商的算力大量依赖租用,比如阿里云、腾讯云、华为云。在芯片供应受限的环境下,想要迅速把推理集群铺开,比在海外更吃力。K3开放权重的日期定在了7月27日,如果在那之前算力还补不回来,到时候可能又是一波抢滩混战。
热门跟贴