打开网易新闻 查看精彩图片

作者 | 张弛

编辑 | 方堃

从"代际追赶"到"同台竞技",中国大模型Kimi K3的发布,让美国AI权力中心有了真正的危机感。

马斯克将K3列为Grok的追赶目标;美国国家前AI事务负责人大卫·塞克斯表示,中国模型第一次在前端编程赛道拿下第一,照此下去美国将输掉AI竞赛;OpenAI战略主管Dean W. Ball则批评中国不应开源如此优秀的模型。

而据Axios报道,特朗普政府内部已重新讨论限制中国先进AI模型进入美国市场的措施。

如何理解Kimi K3这颗重磅炸弹的威力?

2024年底,DeepSeek用极致工程优化把推理成本打到地板价,中国大模型第一次进入海外视野。但外界评价很微妙:中国公司擅长把贵的东西做便宜——但便宜意味着你没有定义价值的能力,只是在别人画好的商业区间里做减法。

Kimi K3改变了这一点。它不只是把贵的东西做便宜,更是用2.8万亿参数、顶级智能和工程能力,在硅谷制定的AI定价体系外重新写了一条规则:"我和你一样强,但我可以定自己的价。"

7月22日消息,《The Information》报道称,据知情人士透露,微软内部估算,若将旗下AI助手Copilot的部分推理请求,从OpenAI和Anthropic的模型切换至Kimi K3模型,每年最多可削减约6亿美元(约合40亿元人民币)的云基础设施成本。

把贵的东西做便宜,是制造业的胜利;定义最好的产品应该值多少钱,则是技术话语权的胜利。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

Scaling Law未死:

三条扩展方法论的交汇点

月之暗面发布的旗舰大模型Kimi K3,是全球首个开放权重的3T级模型。

第三方机构Artificial Analysis的智能排行指数中,Kimi K3跃居第3,紧随Fable 5和GPT-5.6 Sol之后,跟官方评测数据很接近。在大模型编程能力测试中,Kimi K3以76%的胜率超过两个最顶尖的闭源模型:Claude Fable 5(63%)和GPT-5.6 Sol(58%),登顶最有影响力的CodeArena榜单。

据行业消息,Code Arena 官方花了数小时反复核验全部数据,确认无偏差后才对外公开榜单结果,消息一经发布直接引爆硅谷AI圈层。

过去一年多,业界不乏"参数竞赛进入死胡同"的质疑。但Kimi K3的成功,证明了大模型的Scaling Law依然有效。

早在2024年,杨植麟提出了一个判断,Scaling Law的下一阶段叫做Reinforcement Learning Scaling。过去的Scaling Law,本质上是让模型"死记硬背刷题库",RL Scaling不让模型背答案,而是训练模型自主拆解问题、试错迭代、自我修正,形成闭环思考能力。

今天的K3,正是RL Scaling的大规模应用。正如K3技术报告中提到的"视觉闭环"(Vision in the Loop),本质是把在解数学题上的RL Scaling能力,扩展到了带视觉反馈的全场景。

2026年3月21日,杨植麟站在英伟达GTC舞台上,重点讲了三个维度的扩展方法论——K3就是这三条线的交汇点。

打开网易新闻 查看精彩图片

第一个维度:token效率。团队首次大规模使用Muon二阶优化器,实现得当,token效率提升两倍。50万亿高质量token在Muon手里,效果相当于100万亿。

数据墙时代,这种"无中生有"的能力是战略级的。但万亿参数训练时,注意力logit值会爆炸到1000以上,训练发散。团队配套推出 QK Clip 约束方案:实时计算每个注意力头的最大 Logit 值,生成专属缩放系数限制 Query、Key 数值区间。该方案不会从根源消除数值波动,而是为模型增加自主约束机制,最终实现 Loss 曲线稳定收敛、Logit 数值可控。

第二个维度:混合线性注意力机制。团队推出Kimi Linear架构,核心是新线性注意力变体Kimi Delta Attention(KDA)。原始线性注意力只有一个全局衰减因子,模型要么全忘、要么全记。KDA引入细粒度衰减因子,把标量换成对角矩阵,分别控制每个通道的衰减速度——一部分慢衰减保留长期信息,另一部分快衰减接收新信息。当上下文扩展到一百万token,KDA效率提升明显,这是第一个在短上下文、长输入和长输出任务上全面超过全注意力的方案。

有开发者告诉《创智记》,"K3的注意力机制是真的厉害,长上下文基本不会给你它忘记了的感觉,K3的百万上下文感觉是最好的,虽然大家都说自己百万,目前就它感觉是真百万。"

在日前举行的WAIC 2026思想者论坛上,2024年图灵奖获得者理查德.萨顿直言,“我们还不懂真正的深度学习。”在萨顿看来,灾难性遗忘是核心问题,目前的深度学习系统在持续学习时会忘记旧知识。

K3最大的成功之一,正是在于长期记忆的新突破。

第三个维度:Agent集群。一个主Agent协调,生成子Agent分配任务,收集结果,反复迭代。技术上,三种奖励构成强化学习目标:实例化奖励(鼓励生成子智能体)、完成奖励(鼓励任务实际完成)、结果奖励(衡量最终质量)。

K3用上述突破堆出了2.8万亿参数。KDA让序列计算更快、更低计算成本,AttnRes(注意力残差)让深度信息流更智能,Stable LatentMoE让参数容量更庞大。896个专家模块,每次推理只激活16个(不到2%)。Quantile Balancing省去人工调参;Per-Head Muon让每个注意力头独立学习,大规模训练更稳定,算得更省、流得更顺、装得更多。

现在回头看,对Scaling Law的质疑更像是蒸汽机车时代的工程师怀疑内燃机。看到了锅炉的极限,没看到燃烧室的革命。

Scaling Law没有死,只是换了更聪明的优化器、更高效的注意力机制、更复杂的智能体编排。当参数从1000亿推进到2.8万亿,再到未来的100万亿(人类大脑的神经连接),展现的不是简单的规模堆叠,而是智能的涌现——那种只有在足够复杂的系统中才会出现的、无法被还原为单个部件属性的整体能力。

据报道,一位用户连续使用K3十小时后,得到了完整的Windows XP系统模拟网站,内置的软件和游戏真的可以运行——这不是在回答问题,而是在创造世界。

定价权的转移:

中国AI从"跟随"到"并跑"

技术实力的跃迁,最终都要体现在服务价格上。

Kimi K3发布的同时,月之暗面做了一件很有信号意义的事:涨价。

相比K2.6,K3的输入价格从6.5元涨到20元;输出价格从27元涨到100元,这在中国大模型行业是反常识的——过去几年,行业主旋律是降价、降价、再降价。

但这一次,市场给出的答案是:供不应求。甚至因为K3过于火爆,算力不足、推理慢,导致等待时间比较长,月之暗面不得不暂停了新付费用户的注册——这在中国大模型行业发展史上,也是反常识的。

而K3的定价逻辑也变了。相比最顶级模型Claude Fable 5,对于绝大多数企业级用户来说,K3的性价比依然是碾压级的,达到同样的效果,只需要付1/10左右的成本。

中国大模型不再是"因为便宜所以选我",而是"我能力接近最强,但价格只有1/10"。前者是低端市场的内卷逻辑,后者是高端市场的竞争逻辑。

今年3月,月之暗面ARR(年化收入)首次突破1亿美元,6月接近3亿美元,API业务占比已经突破了70%,有消息称,在K3发布后,ARR又实现了数倍增长。

一位开发者告诉《创智记》,"上周末从最小套餐升级了2次到次最高套餐,然后单独充值了API,又在套餐的基础上充值了加油包,目前处于勉强够用阶段,如果用于日常,基本要最高套餐。"

打开网易新闻 查看精彩图片

这就是定价权的转移。

过去,全球大模型的价格锚点由OpenAI和Anthropic设定。它们出旗舰模型,定一个高价,然后其他厂商根据自己的能力差距,按比例往下打折。

Kimi K3第一次打破了这个定价体系。它没有在低端打价格战,而是直接切入了中高端市场——15美元的输出定价,刚好卡在Claude Sonnet档位($15输出),但能力超过Opus 4.8($25输出),接近Fable 5($50输出)。

打开网易新闻 查看精彩图片

《创智记》根据OpenRouter最新数据,对比统计了Kimi K3、Opus 4.8、Fable 5和GLM 5.2的目前价格,表面看,Kimi K3约为Fable 5的1/3,比GLM 5.2贵2倍多,但只看标准定价是常见的误区,因为忽略了计费逻辑中的核心变量:缓存命中率(Cache Hit Rate)。从0%到90%的缓存命中率差异,意味着输入价格可以相差 3-5 倍。

Kimi凭借与清华大学合作研发的大模型推理架构Mooncake,实现了平均90%的超高缓存命中率。根据OpenRouter实时统计的缓存命中率,Kimi K3远超各大对手。

我们按90%命中率,来计算Kimi K3 的1M token实际价格:

▶ 90%命中缓存部分:按缓存价2元/M tokens计费 = 1.8元

▶ 10%未命中部分:按标准价20元/M tokens计费 = 2元

因此,1M token输入的实际成本是 3.8 元。与标准定价20元相比,Kimi K3的实际输入价格相当于打了2折。

OpenRouter数据显示,Kimi K3的真实使用成本甚至比GLM 5.2还便宜。

打开网易新闻 查看精彩图片

此外,相比国内模型,Fable 5还要额外收取85元/百万token的写入费用,真实的综合成本达到Kimi K3的10倍左右。

据悉,Anthropic原本计划将Fable 5从现在的订阅制中下架,转为纯按量计费。然而就在K3发布后的第二天,Anthropic突然改口官宣,称Fable 5永久保留在订阅方案中。

摩根士丹利、高盛、杰富瑞、伯恩斯坦等迅速发布报告,核心判断趋于一致,这是中国AI从"跟随"到"并跑"的分水岭。

而Kimi K3的火爆,再次推动美国政府内部主张加强限制的声音升温。由于中国开源模型价格相对更低、性能逐步接近美国主流产品,越来越多美国企业开始将其用于开发和部署,这也引发美国对AI技术优势的担忧。

据报道,特朗普政府内部正在重新讨论限制中国先进AI模型进入美国市场的措施。相关方案一旦推进,将削弱中国开源模型在美国的使用空间,巩固OpenAI、Anthropic等美国闭源模型厂商的市场地位。

但对于欧洲等全球更多地区而言,中国大模型提供了另一种更有吸引力的选择。