来源:市场资讯

(来源:新财富产业研究院 新财富)

打开网易新闻 查看精彩图片

现在想在Kimi的聊天框里使用K3,要先成为付费会员。

按照年付价格计算,Kimi目前四档会员Andante、Moderato、Allegretto和Allegro,分别为每月39元、79元、159元和559元,对应每年468元、948元、1908元和6708元。不同档位的主要区别,是Agent额度、并行任务数量、Kimi Code额度和超长对话容量。

打开网易新闻 查看精彩图片

K3并不是国内第一个放在付费墙后的聊天模型。早在2023年,百度文心一言4.0就曾采用会员模式,免费用户只能使用较早版本。

7月19日,K3上线不到48小时,月之暗面宣布暂停C端新用户订阅。公司给出的解释是,请求量远超预期,现有GPU集群已经接近负载上限,有限算力需要优先保障存量付费用户。

模型太火,免费开放会迅速挤占有限算力。月之暗面只能提高使用门槛,把K3暂时留给愿意付费、需求更明确的用户。

API的定价则更加醒目。每输出100万个Token,Kimi K3收费100元。

K3缓存未命中的输入价格为20元/百万Token,缓存命中为2元,输出为100元。相比上一代旗舰K2.6的6.5元和27元,K3的输入价格上涨208%,输出价格上涨270%。

阿里Qwen3.7-Max的输入、输出价格分别为12元和36元;DeepSeek V4-Pro最高时段的输入和输出价格均为6元。K3的输出价格约为Qwen3.7-Max的2.8倍、DeepSeek V4-Pro的16.7倍。

K3每百万Token的输入、输出价格约为3美元和15美元,已经进入海外闭源前沿模型的价格区间。

放在过去两年的市场里,这套收费方式显得很不合群。

从DeepSeek R1开始,国产模型逐渐形成一种熟悉的发布方式:参数更大,能力更强,价格继续下降。模型公司用海外旗舰几分之一的API价格争夺开发者,再把最新模型免费放进聊天产品,用来获取用户和流量。

久而久之,“免费聊天”和“低价API”几乎成了国产大模型的默认配置。

就比如最近传出某模型公司定价策略按照十个月回本,并表示在当前价格区间内,用户对API价格并不敏感。即使价格提高一倍,Token使用量可能也不会明显下降,收入则可能接近翻倍。

K3改变了这种预期。

01

贵了,也确实更强了

2.8万亿参数,是全球首个开放的3T级模型,也是目前最大的开源模型;原生100万token上下文,原生视觉理解。架构上,K3用Kimi Delta Attention(KDA)加注意力残差(AttnRes)搭建,采用Stable Latent MoE,896个专家里每次只激活16个,相较K2整体缩放效率提升约2.5倍。月之暗面甚至从零写了一个类Triton的GPU编译器MiniTriton,自主完成了一颗专用推理芯片的架构设计与验证。

Frontend Code Arena 1679分登顶全球第一,超过Claude Fable 5和GPT-5.6 Sol,在七个前端细分领域中拿到六个第一。这个榜单采用匿名模型对战和用户盲选,最终结果会同时受到视觉效果、交互体验和任务完成度影响。从K2.6的第18名跃升到K3的第一名,说明月之暗面找到了自己的优势场景。

打开网易新闻 查看精彩图片

BrowseComp在100万token不做任何上下文管理时拿到90.4分。它证明了国产模型在特定维度上,已经能正面对抗最强的闭源。

K3的综合能力还没有达到全球第一。在Artificial Analysis智能指数中,K3得到57分,排在Claude Fable 5和GPT-5.6 Sol之后。月之暗面对此相当坦率,其技术说明直接承认,K3的整体表现仍落后于最强的海外闭源模型。

K3选择集中火力:前端开发、长程编程、知识工作和视觉Agent。

通用聊天模型需要照顾海量低价值请求,用户对价格很敏感,也很容易切换平台。编程Agent承担的任务更长,进入用户工作流更深。代码库、工具权限、提示词和历史记录一旦配置完成,更换模型的成本也会上升。

在编程Agent中,模型需要反复读取相同的代码库、系统提示和对话历史。月之暗面披露,K3在高频编程场景下的缓存命中率可以超过90%。缓存命中后的输入价格只有2元,相当于未命中价格的十分之一。

价目表上的20元并不等于企业的实际平均输入成本。如果大部分长上下文都能命中缓存,真正昂贵的部分主要是模型新生成的内容。K3输出价格达到100元,恰好把收费重点放在模型完成任务的过程和结果上。

Artificial Analysis测算,按照其测试任务中的Token结构,K3单项任务的平均调用成本约为0.94美元,与GPT-5.6 Sol的1.04美元接近,约为Claude Opus 4.8的一半。100元听起来很贵,分摊到具体任务里,差距并没有价目表看起来那么大。

不过,缓存只能降低输入成本,无法解决另外两个问题:速度和输出长度。

Artificial Analysis测得K3平均输出速度约为每秒33个Token,在同级模型中偏慢。它完成整套智能指数测试时生成约1.3亿个输出Token,接近同类模型中位数的两倍。输出越长,用户等待的时间越久,账单也越高。

因此,K3现阶段最适合高价值、长周期、可以异步完成的工作。

让它调试代码、制作网页、分析大量材料,等待几十分钟通常可以接受;把它放进需要高频沟通、即时修改的工作流,速度和额度就会成为阻力。K3已经具备了卖高价的能力,还没有提供与高价完全匹配的稳定体验。

02

Kimi K3证明Scaling Law仍是有效的

过去一年,大模型行业不断出现“Scaling Law即将失效”的判断:公开数据接近耗尽,参数增加的边际收益下降,新模型在传统基准上的进步也越来越小。

Kimi K3提供了一个不同的样本,从K2的1万亿参数扩大到K3的2.8万亿参数后,模型在前端开发、复杂搜索、长程编程和视觉Agent等场景继续提升。它的综合能力尚未超过最强闭源模型,但开放模型的能力上限再次被向前推进。这至少说明,大模型还没有撞上一堵无法跨越的技术高墙,更多计算投入仍然可以转化为更强能力。

只是今天的Scaling,已经不再是简单堆参数。

如果每生成一个Token都调用全部2.8万亿参数,K3很难大规模提供服务。为此,月之暗面采用混合专家架构,在896个专家中每次只激活16个;又通过Kimi Delta Attention、Attention Residuals和Stable Latent MoE,降低长上下文开销并提高训练稳定性。按照公司披露,K3相较K2的整体缩放效率提升约2.5倍。

Scaling Law正在从“扩大模型”升级为“扩大系统”。

参数规模仍然重要,但决定能力上限的已经不只是参数。数据质量、专家路由、注意力结构、强化学习、上下文长度、推理系统、编译器和Agent环境,都成为Scaling的一部分。任何一个环节没有同步升级,更大的模型都可能只是一台更昂贵的机器。

Scaling的方向也在改变。过去,模型主要回答一次性问题;现在,Agent需要读取代码、调用工具、检查结果、修复错误并重新规划。模型不仅要知道得更多,还要在更长时间里保持目标并完成任务。计算投入也从预训练延伸到后训练和推理阶段:模型可以思考更久、调用更多工具,用更多计算换取更高的任务成功率。

因此,K3传递给行业的信号并不是简单的“大力出奇迹”,而是前沿模型仍有继续扩展的空间,只是扩展变得更加系统,也更加昂贵。

模型还会更大,工作时间还会更长,承担的任务还会更复杂。大模型行业真正的问题已经从“能力还能不能提高”,变成了“下一次提高需要多少钱,以及谁来支付这笔钱”。

打开网易新闻 查看精彩图片

03

100元是产品力,也是生存方式

每百万输出Token收费100元,是月之暗面对这个问题给出的回答。

Kimi没有微信、淘宝这样的超级入口,也缺少成熟业务长期补贴模型。对于一家独立模型公司,持续参与低价竞争并不是最有利的选择:无论价格降到多低,市场上总会有成本更低、资本更充足或者生态更完整的平台。

K3因此选择把能力集中在编程、复杂搜索和长程Agent等高价值场景,再向真正节省了时间和人力的用户收费。用户购买的表面上是Token,实际购买的是任务完成率。只要K3能够少重试几次、减少人工接管,100元的输出价格未必会带来更高的项目总成本。

这一定价也有合理的产业逻辑。更高收入可以支付推理成本,支持算力扩容,并继续投入下一代模型。产品力形成收入,收入反过来支撑研发,独立模型公司才可能建立可持续的循环。如果始终依靠融资补贴调用量,模型越受欢迎,反而可能带来越大的服务器账单。

当然,发布初期的供不应求还不能证明Kimi已经拥有稳定的定价权。真正的检验,是用户用完额度后是否续费,企业测试结束后是否把K3留在生产流程中。高价格还意味着更高要求:稳定性、速度、并发能力和工具兼容都必须与模型能力匹配。

但K3至少迈出了关键一步。中国大模型过去证明了自己可以用更低成本追赶前沿;现在,Kimi开始证明,国产模型也可以凭借产品力建立自己的价格体系。

100元不是价格战的终点,而是月之暗面为持续发展选择的起点。