研究员|卢杨
过去一个月,大模型行业最让人印象深刻的,是变化本身的速度。一款模型发布,数小时内登顶榜单,话题霸屏,但留给它在榜首的时间,变得前所未有的短暂。新的版本很快出现,新的价格表很快出现,新的能力边界很快被重新定义。
在这个节奏里,一个模型从“前沿”到“被超越”,中间隔的时间越来越短。但在这股浪潮中,出现一个例外。7月中旬发布的Kimi K3,在历经一个多月、十余款重磅模型的轮番冲击之后,依然没有掉出全球前沿模型的讨论范围。
发布数小时后,K3登顶Frontend Code Arena榜首——1679分,超越Claude Fable 5的1631分和GPT-5.6 Sol的1618分。这是中国大模型第一次站上那个位置。
但接下来的事情,更像是一场刻意安排的极限压力测试。此后的35天里,AI模型进入了近乎疯狂的发布期,Opus 5、DeepSeek V4 Pro、Qwen 3.8max、GLM5.3等几波冲击接连到来,各大榜单榜首几度易主。
但几轮过后,Kimi K3倒还在原位。在Artificial Analysis Intelligence Index上,K3(max版本)最新评分为60分,与刚刚发布的GLM-5.3同居全球第五,在AA-Briefcase(模拟真实企业知识工作的长程测试,涉及25000多条Slack消息、3500多封邮件、会议纪要和财务报表)中,K3以Elo 1543排名第二,仅次于Claude Fable 5的1574,超过了GPT-5.6 Sol的1501。
在Agent Arena上, K3(max版本)以+10.5%的净提升位列第四,是能力前十中唯一的中国模型。而它的单任务中位成本为0.62美元,仅为Claude Opus 5(3.37美元)的五分之一,是前八名中最低的。截至8月20日,在Code Arena的前端专项榜单及覆盖任务更全的WebDev总榜上,K3仅次于Opus 5位列第二,而这两个位置,都是在Qwen3.8、Grok4.6、GLM-5.3等更晚发布的模型冲击之下保持的。
相比上一代K2,官方称K3整体扩展效率提升了约2.5倍。这个数字不是说“智商提高了2.5倍”,它说明的是,当模型继续扩大时,每增加一单位算力投入,能换来多少真实的能力增量。
这也是K3想解决的核心问题。我们把它的解法简单归纳为三个维度上。这可能也恰恰是大模型继续扩大以后,无法绕开的三座山。
01 长上下文,不只是“装得多”
100万token上下文,听起来只是一个规格数字,在参数表里和“2.8T”并排列着。但当模型面对的是一整个代码仓库(包含数十个文件的依赖关系)、几百页企业尽调材料(含财务附注和法律条款)、或者一套需要连续执行数百步的Agent任务时,“能装下多少信息”和“能不能有效使用这些信息”,已经是两个截然不同的问题。
不同于简单的问答,模型开始被要求“接手一段完整的工作流”:读材料、理解背景、写代码、查资料、执行工具、检查结果、修正错误,再继续往下做。任务越复杂,模型需要维持的有效上下文就越长。
K3使用的是Kimi Delta Attention(KDA)。这不是新概念。月之暗面此前已将KDA定义为一种线性注意力模块,核心是在长序列场景下颠覆传统Attention机制的平方级复杂度:传统Transformer处理长度L的序列需要O(L²)的计算量,当L达到100万时,这个数字将变得不可承受。KDA通过线性复杂度的注意力设计,将计算量降至O(L)。
到了K3,KDA被正式放入百万token的完整架构里,与2.8T参数协同工作。
它的本质是让模型在超长上下文中依然保持“注意力聚焦”。在普通Transformer里,上下文越长,模型越容易“忘记”开头的关键信息,学术界称之为“注意力稀释”。KDA通过线性复杂度的注意力重计算与稀疏注意力模式,让模型在处理第90万个token时,依然能精准调用第1万个token里埋下的隐藏指令。
可以通俗理解为,K3在处理需要连续执行上百步的Agent任务时,不会因为“记忆衰减”而在任务中途跑偏。技术报告也将KDA与长上下文和长程Agent任务直接联系起来,这是AI从“聊天工具”走向“工作伙伴”的关键一步。
模型的“大”不只体现在宽度(专家数量),还体现在深度(层数)。网络越深,理论上能进行的抽象推理越复杂。每一层都可以在前一层的基础上构建更高级的表征:从词汇到短语到语义到逻辑结构。但层数增加后,一个经典难题出现了,梯度消失与信息遗忘。
底层的原始信息,经过数十上百层的传递后,传到顶层时往往已经被“稀释”得面目全非。传统残差连接(Residual Connection)通过“跳跃连接”的方式让信息可以绕过某些层直接向后传递,在一定程度上缓解了这个问题。但当网络深度继续增加时,这种简单粗暴的“整体传递”方式就变得不再高效。
K3使用了Attention Residuals。它的设计思路比传统残差连接更精细,让模型在向更深处计算时,每一层都能“回头看”,有选择地利用此前不同深度产生的信息。
月之暗面相关研究显示,在某些设置下,Block Attention Residuals可以达到相当于额外增加大量训练计算量的效果。
硅谷的投资人也在公开讨论这件事。a16z在社交媒体上写道,“America debates Chinese AI while the rest of the world buys it”(美国人还在争论,世界其他地方已经在下单);知名投资人Jason Calacanis则在一档节目中称,Anthropic的大客户正在认真评估转向Kimi——原因不是性能超越,而是“当性能可以用零头买到时,没有人愿意继续支付溢价”。这些说法带着明显的立场和渲染成分,但K3被列入这种讨论本身,说明它已进入海外机构的投资与采购框架,而不仅是技术圈的话题。
K3在处理极其复杂的逻辑推理,比如数学证明的多步推导、长链条的法律条款比对、或者需要多轮反思的代码调试时不容易在推理的“半路”丢掉关键线索,每一层都在贡献新的信息。
8月初美国白宫闭门会议敲定的“自愿AI安全审查框架”中,只有闭源前沿模型需在发布前送政府审查30天,开源与开放权重模型被排除在外;同期,179家美国中小企业联署反对对中国模型的全面封禁。开放权重正在获得更大的政策与市场空间,而K3恰好站在这个空间的入口处。
02 更宽的模型,2.8万亿参数
K3最容易被注意到的数字还是2.8万亿。它拥有896个路由专家,每个token实际只激活16个专家,激活参数量约1040亿。也就是说,它拥有巨大的“知识容量”,多达2.8万亿参数所代表的记忆和表征空间,每一次计算只调动其中一小部分。这是MoE架构的性感之处,也是它的梦魇。性感在于效率,一个模型可以有2.8万亿的知识储备,却只需要为每次计算支付1040亿的算力成本。
噩梦在于路由。专家越多,路由越难。如何把代码生成任务精准送到“代码专家”手里,把数学推理送到“数学专家”手里,把多语言任务送到对应的语言专家手里?如何避免某些热门专家过载瘫痪,而另一些冷门专家长期闲置“摸鱼”?如何在数万亿参数的分布式训练中保持数值稳定,不出现梯度爆炸或收敛失败?
K3使用Stable LatentMoE,并引入Quantile Balancing等方法处理专家负载。Quantile Balancing的核心思路是监控每个专家的负载分布,当某些专家的负载超过设定分位数时,系统会自动调整路由策略,将部分流量导向负载较低的专家。这套机制确保了896个专家不会出现“少数累死、多数闲死”的局面。
这背后是一套精密的基础设施工程它解决的是万亿参数集群的可操作性问题。没有这套路由稳定机制,2.8万亿参数将只是一堆无法有效调用的数字。所以,2.8万亿所代表的是模型拥有如此巨大的容量后,依然能够精准、稳定、稀疏地调用它。
架构只是容器。K3的性能释放,同样依赖于数据配方与后训练对齐,高质量语料的配比、多阶段预训练的数据调度、基于人类反馈的强化学习(RLHF),这些“看不见的工程”对最终模型质量的影响,丝毫不亚于架构创新。月之暗面技术报告花了大量篇幅描述其数据清洗与对齐策略,这正是K3能稳定输出高质量代码和复杂分析,而非仅仅在静态测试中刷分的关键暗线。
简单来说,KDA负责“长”,Attention Residuals负责“深”,Stable LatentMoE负责“宽”,数据与后训练负责“点燃”。四者同时作用,让K3在规模急剧膨胀时,没有变成一头笨重的巨兽,反而是保持了敏捷与高效。
03 代价:能力越强,瓶颈越深
如果把K3写成无短板的神器,这显然不现实。它最明显的短板是速度。Artificial Analysis数据显示,K3输出速度约为39 token/秒,在统计的101个模型中排名靠后。在AA-Briefcase长程测试中,它完成一个复杂任务平均需要近一个小时,平均83轮交互,单任务成本约10.57美元。
价格则是K3另一个常被开发者提及的痛点。输入每百万token 3美元,输出15美元——在中国同行里不算低价(DeepSeek V4 pro在涨价之后的高峰时段输出也仅需3.98美元)。这注定了K3不是“万金油”模型。对于简单的日常问答,它既慢又贵;它的主战场是那些任务足够复杂、上下文足够长、容错率极低的高价值场景。不过把坐标换到海外,账是另一种算法:Claude Fable 5的输出价格约为每百万token 50美元,K3约为其三分之一。同一价格,放在国内市场是“偏贵”,放进全球前沿模型的定价光谱里,则处于明显的低位。
04 考验在之后
这些技术选择带来的影响,很快溢出评测榜单,蔓延至产业层面。彭博社在7月17日的报道中指出,月之暗面将Kimi K3定价在Anthropic Sonnet的水平,“显示出公司相信凭借其能力可以向其他中国模型收取溢价”。一个月后,又在一篇题为《China’s Kimi K3 Is Closing In on America’s Best AI》的报道中,援引Artificial Analysis等多家测评,在其制作的性能-成本散点图上,K3落在Pareto前沿上——性能逼近Claude Fable 5,完成同等能力基准任务的加权平均成本约为其五分之一。这些信号连起来看:中国AI公司正在从“低价换市场”转向“性能定价格”。
研究机构也在重新评估。美国企业研究所研究员Ryan Fedasiuk在一份题为《中国已追上前沿AI》的报告中指出,过去“中方最强模型落后美国6至8个月”的普遍认知正在被打破,双方差距已“接近按周计算”。布鲁金斯学会研究员Kyle Chan则认为,Kimi K3已经超过了Opus 4.8和GPT-5.5等“理论上可被用作蒸馏来源”的美国模型,这表明中国AI能力并非只是对美国模型的衍生。
所以伴随着k3开源,且其能力逼近闭源模型的时候,一个不得不回答的问题摆在闭源模型面前:用户为什么还要选择你?
硬币的另一面也是商业化的自我博弈。权重完全开放后,具备技术能力的企业完全可以选择本地部署并自行微调,而不必调用月之暗面的官方API。这需要月之暗面在获得生态影响力的同时,也在一定程度上让渡了对商业化通道的独家控制权。
路透社8月报道称,月之暗面已对利用Kimi K3等模型建立大型商业服务的用户设置了相应商业条款;阿里也计划对Qwen新模型的大型商业用户探索新的商业化方式。这说明开放权重并不等于没有商业模式,但如何平衡生态扩张与商业变现、在“开放”与“收费”之间找到可持续的平衡点,是K3开源策略面临的真正考验。这个问题目前还没有答案,整个行业都在看着。
至少在这个月的模型混战中,没有哪个模型能永远SOTA。技术突破的窗口期从几个月缩短到几周,甚至几天。真正的考验是,当下一轮浪潮打来时,是被冲走,还是依然站在决定方向的牌桌上?
K3并不完美,速度慢、成本高,整体性能仍落后于最强的闭源模型,月之暗面在技术报告里也承认这一点。
但K3的上一代K2.6在Frontend Code Arena仅排第18名。从第18名到第1名,隔着的不是渐进改进,而是一次架构层面的重构。更重要的是,经历十多款重磅模型轮番冲击后,K3至今依然留在第一梯队。
这靠的是KDA、Attention Residuals、Stable LatentMoE,以及背后看不见的数据工程与强化学习对齐。
Kimi K3的35天证明了两件事。一是能力没有被时间快速折旧:在经历Opus 5、Qwen、DeepSeek、GLM等多轮冲击后,中国模型首次站上了参与定义“下一阶段前沿标准”的起跑线。二是当能力进入同一区间,竞争的天平开始向成本、部署方式与采购逻辑倾斜——榜单决定话题,账单决定选择。比登顶更难的,是留在牌桌上。K3暂时做到了,但艰难的道路还在后面。
(文中内容和观点仅供参考,不构成投资建议。投资有风险,入市需谨慎。)
编辑|邱慧
热门跟贴