作者|梁耀丹
主编|赵妍
来源|星火Ember
7 月 27 日,月之暗面官方正式开源 Kimi K3 模型。当天,月之暗面发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术:MoonEP、FlashKDA和AgentEnv。
Kimi K3模型发布于7月16日。据悉,该模型总参数达到2.8万亿,是目前全球参数规模最大的开源模型。
Kimi K3 的问世,被行业视作全新里程碑。在由加州大学伯克利分校搭建的国际AI盲测平台 Arena 上,K3凭借前端代码榜单1679分的成绩位居第一,超越了Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol等顶尖闭源模型。这也是中国大模型首次在编程能力测评中斩获榜首。
资本市场的反应几乎是条件反射式的。Kimi K3发布的首个交易日,英伟达单日市值蒸发约1000亿美元,费城半导体、纳斯达克综合指数,全部下跌。
IG市场分析师Tony Sycamore估计,来自Kimi K3的冲击,导致尚未上市的两大美国AI巨头OpenAI和Anthropic的预期估值合计蒸发了3140亿美元。
“DeepSeek时刻重现”——多家外媒的报道中,不约而同地使用了这个措辞。提到这个说法的还有中信建投,“K3的发布意味着中国大模型第一次以‘竞争威胁’身份进入全球大模型叙事。”中信建投在7月20日的文章中称。
历史似乎正在重演,但热潮褪去后,疑问随之而来:Kimi K3 高达2.8 万亿参数背后,真实技术含金量究竟如何?伴随产品发布涌现的各类争议,又暴露了这家头部AI创业公司哪些隐忧?
2.8万亿参数背后
要理解Kimi K3的2.8万亿参数规模意味着什么,需要建立几个坐标系。
Anthropic的Claude模型没有披露过参数规模,外界推测总参数量级大致在1万亿到5 万亿之间;OpenAI的GPT-4,被业内广泛推测为约1.8万亿参数;行业内对 Google Gemini Ultra 的总参数量估算普遍在 1.5 万亿;Meta开源的Llama 3最大版本停留在4050亿。在国内,百度发布的文心大模型5.0总参数规模超2.4万亿;DeepSeek最新发布的V4-Pro 总参数量为1.6万亿;智谱GLM-5.2模型参数规模为7440亿。
月之暗面有关负责人对媒体表示:“参数越大,能力上限越高,可以提供更智能的模型表现。参数就像人脑里的神经连接,近3万亿参数意味着这个模型能把更多的知识和规律装进‘脑子’,懂得更多、想得更深、答得更准。”
但参数不是全部,关键在于有效参数背后的“经济学”。
据月之暗面披露,Kimi K3 基于混合线性注意力机制 (Kimi Delta Attention,下称KDA)和注意力残差( Attention Residuals,下称AttnRes)构建。这两项架构更新,都是为了让信息在更长序列和更深模型中流动得更顺畅。团队也进一步扩大了 Mixture of Experts(MoE)的稀疏度:结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力。
假如把K3理解为一个内部就像一个拥有上千名员工的超级公司,那么KDA相当于给员工发了一个“随用随取的记事本”;AttnRes则相当于在公司每层楼之间修了“直达电梯”——底层发现的关键信息,可以一路畅通地送到最高层。混合专家模型(MoE)则是一种让 AI 模型更聪明且更省资源的架构,好比这家公司有 896 名员工,但每次接到任务,只叫其中 16 个最对口的上班,其余 880 多人休息。Stable LatentMoE分发机制则是这套“排班系统”的升级版——让每一次挑哪 16 个人更准、更稳定。
这也是在芯片受限的大背景下,国内大模型研发侧重算法优化和资源利用效率的缩影。
不过,在 AI 行业,参数规模从来都不是衡量模型能力的唯一标尺。
月之暗面也承认,“尽管 Kimi K3 总体上是一个非常有竞争力的模型,但与 Claude Fable 5 和 GPT-5.6 Sol 相比,在用户体验上仍有一定差距。”
唯一可以确认的是,正如月之暗面所说的,“它在我们的整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。”
虽然 K3的性能表现让市场看到了中国大模型持续缩小与全球顶尖模型的差距,但也有观点认为,Kimi K3的发布又不完全等同于“DeepSeek时刻”。
时针拨回2025年1月,DeepSeek R1横空出世,以极低的训练成本打造出比肩GPT-4o的推理能力,被视为大模型的研发可以“绕过高算力壁垒”,导致英伟达单日市值蒸发近6000亿美元。
但在Kimi K3发布后,来自多家国际投行的观点认为,Kimi K3不是算力需求的终结者,相反,加大了对算力的需求。
半导体研究机构Semi Analysis在报告中也提到,K3采用的KDA混合线性注意力机制不仅不会削弱高端AI硬件需求,反而可能进一步强化对英伟达高端GPU、HBM以及高速互联设备的需求。
狂奔背后的裂缝
技术实力从来不等同于商业上的成功。伴随Kimi K3诞生的还有诸多争议,暴露了月之暗面狂奔背后的裂缝与隐忧。
K3发布48小时内,用户请求量大幅超出预估,逼近现有集群承载极限,7月19日深夜,月之暗面被迫发布公告,暂停C端新用户的会员订阅,将算力全部投入已订阅用户。直至7月28日,这一限制仍未得以解除。
K3 发布不到三天即暂停C 端订阅,对一家传出6个月内赴港IPO、估值约315亿美元的公司而言,拒绝新用户等于中断增长曲线。
与算力瓶颈伴生的,还有昂贵的定价体系。
Kimi K3未缓存输入20元/百万Token、输出100元/百万Token,位列国产模型最贵一档,远超DeepSeek V4 Pro的价格(未缓存输入 3 元、输出 6 元)。国外主流大模型与之相比,GPT-5.6 Sol的价格是输入5美元、输出30美元,Fable 5输入10美元、输出50美元。
对此,月之暗面方面硬气回应:“开源模型、中国大模型不该被贴上低价标签,我们做出了SOTA级模型,也能匹配合理商业定价。”
K3发布不到一周,来自地缘政治的风险也初见苗头。
7月22日,美国白宫科技政策办公室主任迈克尔·克拉齐奥斯(Michael Kratsios)在其社交账号上抛出一个惊人言论称,Kimi K3是靠“蒸馏”美国最强的闭源模型Fable5才研发出来的。
但这个说法根本站不住脚。Fable 5大模型是于今年6月9日正式发布的,而Kimi K3发布于7月16日。两者发布时间相差仅1个多月,根本不可能完成克拉齐奥斯所说的“蒸馏”,更别提模型的研发流程还涉及大量的测试工作。
此外,据环球时报,近期有外媒报道称,美国政府正考虑禁止使用中国人工智能模型。相关禁令传闻已在硅谷初创圈引发普遍恐慌。大量初创企业创始人依靠成本更低的中国开放权重模型开发产品,无力承担Anthropic、OpenAI等美国人工智能企业高昂的调用费用。
即便如此,K3引发的连锁反应远未结束。
至今为止,Kimi K3 已经收获SpaceX CEO埃隆·马斯克、英伟达CEO黄仁勋、OpenAI 总裁兼联合创始人在内的美国科技圈大佬的“点赞”。
但真正的检验时刻尚未到来。如何持续守住技术优势、直面全球市场复杂的监管环境、跑出可行的商业模式,才是Kimi K3需要交出的长期答卷。
热门跟贴