文 | 海豚研究

上周全球市场直接把大家跌懵了,真假小作文趁机甚嚣尘上。除了韩国加息、地缘问题导致的流动性去杠杆因素外,另一个市场相对一致性的大跌归因——K3 大模型的发布也被拿来反复讨论,以及与此一同被抬出来还有 “中美竞争” 的老生常谈。

K3 所代表的中国大模型明显缩短了前沿大模型的追赶进程,并且还依赖本身的成本优势(模型架构、人才、电力等)、开源优势给终端用户增加了优质大模型的另一个选择。

海豚君认为,K3 受制于短期算力供给,在性价比和输出速度上并不存在优势,因此实际短期对闭源模型龙头影响有限但开源模型首次大幅缩小与顶尖闭源模型的技术差距,意义重大,也是纯大模型商业模式边际恶化的一次拐点。对于独立 AI Lab 来说,很可能会因此拉长头部大模型厂商扭亏为盈的拐点等待期。

但这并不代表 AI 全行业的商业模式证伪。开源大模型的技术突破,短期给资金雄厚的追赶者们、中小企业本地部署需求增加大参数量模型的投入信心,中长期则因为开源模型降低门槛,加速 AI 大模型的大宗商品化进程,提高全行业的 AI 渗透,最终促使中游 CSP 等企业服务、下游 C 端应用层高速发展期的更快到来,共同做大 AI 的增量蛋糕。

一、当大模型竞争开始蔓延到头部

今年上半年,头部模型 Lab 密集发布各自的前沿大模型。就更新频次上,北美依旧是 Anthropic 和$OpenAI(OpenAI.NA) 保持模型创新的主要战斗力,xAI、Meta、Google 紧随其后。中国大模型虽然并不领先,但生态则是百家争鸣。

打开网易新闻 查看精彩图片

企业端极其看重模型质量,因此一路领先的 Anthropic 在 ARR 表现上是一超多强。2 月,Anthropic 搬出口碑超预期的 Opus 4.6,流水 ARR 重新加速。从 25 年四季度月均增速 9% MoM,一下子飙至 2026 年 1-2 月的 25% MoM。

随后的 Opus 4.7、4.8 虽不如当初的 Opus 4.6 带来的惊艳(体验升级的超预期幅度),但总归性能不断上升,以及同行中直到 4 月 Open AI 才搬出能与之有一战之力的 GPT-5.5,因此 Anthropic 迎来了专属于自己的 “春天”,从 3 月至 6 月,ARR 月环比增速保持在 30% 以上。

打开网易新闻 查看精彩图片

但独立 C 端用户上,价格是第一考虑因素,因此中国大模型靠着性价比 + 开源优势,在 OpenRouter 渠道(个人和中小团队用户为主)的 Token 用量占比持续上升,6 月起已经正式超过美国大模型,从而结构性的带动整体 Token 单价从 2026 年开始出现了一波下滑。

打开网易新闻 查看精彩图片

两个阵营原本相安无事,各自扫好门前雪。企业高端需求继续被 Anthropic 拿捏,Fable 一会关一会开,部分需求悄悄转移到了 OpenAI、智谱。个人普通需求中,除了一部分默默薅腾讯 HY3.0 的免费羊毛,其他需求则继续享受 DeepSeek、小米、Minimax 等高性价比方案。

但作为 AI 商业模式最易落地的场景,Coding 市场蛋糕原本已被 Anthropic 独吞。很快我们看到北美的 OpenAI、Google,以及中国的智谱、Kimi 在研发目标上的战略调整,集中算力资源提升大模型的 Coding 能力。

进入 7 月,战火才真正燃了起来:

(1)首先是北美内部互撕,OpenAI 推出的 GPT 5.6-Sol 性能上快速看齐 Fable 5。比较 Artificial Analysis 智能评分和 Arena 投票打分,两者差距都已经非常小。

而 Sol 的单价只有 Fable 5 的 30%,Artificial Analysis 评测的单任务成本指标里,Sol 也只有 Fable 5 的 38%。

(2)其次是东方卷王中国大模型的跃跃欲试,上周 Kimi 带着一款智能性同样可以归为一梯队的基模 K3,打入了 Anthropic 和 OpenAI 的核心阵营。

K3 的 AA 智能评分仅仅位列 Fable、Sol 之后,而靠着长周期任务的 Agent 优势,K3 甚至在 Arena 榜单中被投成了榜一。

下图为各家 AI Lab 最前沿大模型的 AA 智能评分,虚线代表北美厂商,实线代表中国厂商。可以看到,综合实力看北美厂商依旧有优势,但二季度以来,智谱、Kimi 先后进入 TOP 5,与老大 Anthropic 的研发差距已经从 6-12 个月缩短到 3 个月。

打开网易新闻 查看精彩图片

二、K3 短期竞争影响有限、但意义重大

作为继 DeepSeek 之后第二个令全球印象深刻的中国之光,Kimi K3 是纸面实力还是真硬气?相对一梯队的同行又有哪些优劣势?

1. 除了中国特色,大模型迭代还是 “越大越好”

Kimi K3 是一款开源权重大模型,除了最底层的代码和训练数据库不公开外,其他部分会在 7 月 27 日全网开源。在第三方评测的核心指标榜单上,K3 均排在前列,部分指标(来自 Arena 的前段代码领域)甚至被评到第一。

总的来说,K3 的优势在前端开发和智能体上,UI 审美高级、网页生成完成度较高,也更擅长处理长周期多工程任务。

而上述核心能力提升,主要源于总参数规模明显扩大、相比于其他同期的中国大模型,K3 的总参数量达到了 2.8 万亿,将 DeepSeek V4 的 1.6 万亿刷新了最高记录。

不过这个参数量仍然不能和 GPT 5.6、Fable 5 差不多 5-10 万亿级别的量级相比,所以为了继续提高性能,无论是闭源还是开源,目前大模型的迭代思路仍然是遵循 Scaling Law 规律,因此未来最前沿的大模型,在参数量大幅提升的趋势是非常明确的。

打开网易新闻 查看精彩图片

2. 实际性价比不高

K3 发布后,Anthropic 宣布将 Fable 5 从 7 月 20 日起永久性纳入 Max 及 Team 订阅体系。但实话说,至少目前为止 Kimi K3 的性价比并不高,尤其是和 GPT-5.6-Sol 相比。

在单价低一半下,K3 的 Token 使用效率偏低、推理速度偏慢,这使得从实际执行任务的角度,K3 消耗成本相比 GPT-5.6-Sol 只便宜了 10%(0.95/1.04=91%)。

打开网易新闻 查看精彩图片

在下图的 “智能性&单任务成本” 综合对比表中,也不属于 “绿色” 的综合优势领域。

打开网易新闻 查看精彩图片

从结果看,似乎 Kimi 并不具备性价比。但底层技术路线上,Kimi 仍然在致力于提高训练效率。其中两个核心技术的创新,据 Kimi 自己说相比上一版本的大模型 K2,带来了 2.5x 的缩放效率的提升。

中国 AI Lab 往往受困于高端芯片供应和资金短缺(独立模型厂商),导致训练大模型时并不能像欧美龙头一样随心所欲。比如大模型整体性能强悍的 Anthropic,目前仍主要用Dense 稠密模型架构,意味着每一次 Token 的处理,都需要每个参数参与计算。

而每此运行时只激活其中小部分参数的MoE 稀疏架构,则成为中国开源大模型厂商退而求其次的最优选择(OpenAI 自 GPT-4 起也开始采用)。

2024 年初 DeepSeek 就是通过对 MoE 稀释架构做了显著的工程优化,将训练效率和成本进一步得到了很大改善,引起全球侧目,也是影响行业发展方向的里程碑时刻。

而 Kimi 的 K3 大模型则通过继续扩大模型稀疏度,从而降低了无效算力消耗,每次运行激活率不足 2%(该架构一共设置 896 个专家,每次激活 16 个)。

K3 的有效激活率再次刷新了此前 DeepSeek V4 Pro 创下的 3% 记录,而性能接近的 GLM-5.2,激活率则有 5%。同梯队的北美大模型,甚至大多处于 10% 的激活率。每次运行时专家激活率越低,越能减少训练过程中的冗余计算量,从而使得训练效果和运行效率得到显著优化。

除此之外,K3 对训练效率的提升还得于另外两个自研核心技术——KDA(Kimi Delta Attention)注意力残差机制

后者 “注意力残差机制” 主要是解决大模型在深度场景的信息传递问题,减少因模型层数扩张、加深而带来信息传递损耗问题。

这两个技术都是用来解决传统 Transformer(采用全注意力)在 “长上下文” 上的弊端:一个是在训练阶段的算力消耗较高,另一个则是在推理解码阶段对 KV Cache 占用空间过大。当下前沿大模型已经大多为 100 万 Token,未来有希望继续向上突破。因此针对上下文的算力瓶颈,是全行业需要解决的核心问题。

而 Kimi 是将全注意力和线性注意力结合起来形成混合型,不需要保留每个历史 Token 完整 KV 值,仅在现有记忆状态无法解释新信息时才将误差补充写入,其他时期历史信息压缩在可持续更新的状态中。Kimi 官方披露,通过 KDA 技术可以减少 75% 的 KV Cache。

3. 高部署门槛

大参数量能快速提高模型性能,但随之而来的就是对硬件部署门槛要求也会提高。

尽管 K3 减少了 75% 的 KV 缓存,但 K3 本身模型参数上去了,总参数逼近 3T 级别。虽然每次推理只用到 896 个专家中的 16 个,也就是对应 500 亿参数,但所有专家权重都必须常驻显存中,因此整体模型权重的存储需求(原始权重 1.4T,还要加上一些量化因子、路由表、共享层以及运行缓存等)超 1.5TB。

这表明,仅加载模型就需要占用 1.5T 的 HBM 容量。但 NV DGC B200 单节点 8 颗 GPU 总显存约 1.4T(180GB*8),只能勉强装下原始权重,但几乎没有空间给到实际运行。

这种情况下,就需要上 GB300 机柜。Kimi 官方的建议是 K3 的最佳部署为包含至少 64 颗加速器的高带宽超级节点。按道理来说,除了 72 颗 GPU 的 GB300 NVL72,包含 64 颗 GPU 的华为升腾 950 Superpod 也可以满足 K3 的运行需求。

而等到模型权重开源后,哪怕是本地部署最小规模的 K3 推理集群,也要至少 8 颗 NV A100,硬件成本超 400 万元 RMB。

因此上周因为 K3 的一句 KV Cache 减少 75% 而加剧的存储恐慌,显然是 “鬼故事”。市场混淆了单位需求和整体需求的区别,KDA 技术只是降低了单 Token 存储和计算成本,但并不代表说所有推理过程的硬件需求整体压缩了。与此同时,开源模型本身也会进一步扩大全行业对硬件部署的需求规模。

就实测来看,由于参数量上去了,导致 K3 的算力紧缺已经相当明显:据调研 199 元/月的登月套餐 Allegretto,K3 只能用 10 小时 +,海豚君亲测 49 元/月的初级套餐 Andante,低频使用了三天也遭遇了算力告急(实际使用时会自动从 K3 模型切换到 K2.6)。

不仅如此,Kimi 官方也发了公告,暂停新增订阅,以保证存量用户的使用体验(额度和响应速度)。

打开网易新闻 查看精彩图片

三. 变天的不是行业,而是$Anthropic(ANTH.NA)

但仍有悲观声音喊出,Anthropic 和 OpenAI 本身模型迭代带来的性能边际提升已经缩小,同时中国大模型技术追赶上来了,中式内卷下,又会进一步加剧大模型行业竞争。因此 Anthropic 的 ARR(年化收入)很可能因此放缓,进而导致商业模式再次遇阻。

AI 龙头的商业化能否走通,确实会影响全行业的军备竞赛预期。AI 的颠覆性,让科技巨头不敢离开战场;但 AI ROI 的变化趋势,决定着科技巨头是否会暂时放慢投入速度。

因此在当前产业链预期打满下,Capex 哪怕只是降低增长斜率也会导致市场短期出现崩盘迹象。在周期顶部,低估值只是计算错觉。

市场关注度最高的 Anthropic ARR,在近一年有明显的一超多强优势,核心原因就是它主打 AI Coding 这个易落地的应用场景。目前市场预期今年能够实现经营利润转正,这要比更倚重 C 端的 OpenAI,先一步看到商业模式走通。

在上半年的 3-6 月,Anthropic 的 ARR 经历了一次明显加速。目前 7 月数据还没出来,前两天小作文传出的 Yipit 测算值 795 亿(21 天),被 Yipit 打假了。

海豚君暂时按照与预测值差不多的 20% 月均环比增速估算 7 月。8 月之后考虑到竞争加剧,那么增速按趋势缓慢下滑下,预计到年底能够达到 1180 亿。对比年初公司制定的今年 260 亿收入和市场预期的年底 1000 亿 ARR,目标达成的难度不是很大。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

但今年超目标是早已 priced in 的市场预期,如若下半年的 ARR 环比增速真如上述谨慎预期下降至年底的 5%,隐含年化增速 70%,对 Anthropic 上市后的估值弹性必将不利。

不过海豚君认为,出于上述所讨论的算力瓶颈问题导致的 “无性价比优势 + 输出速度劣势”,以及产品生态的布局(大模型、Claude code、专业领域 Agent 等),我们对 Kimi K3 对 Anthropic 的竞争影响短期没那么悲观,再加上川普正在考虑出台限制中国 AI 的相关政策,因此中国大模型的出海之路(尤其是企业端需求)可能没有想象中那么顺畅。

反过来说,就算 Anthropic 的 “势头走弱”(比如 OpenAI 目前已经有正面竞争的实力,GPT-5.6-Sol 在智能性上已经相差无几,但胜在便宜,以及后续若 Google 追赶上来),也不带代表全行业跟着完蛋。

如下图所示。北美作为全球 AI 投入最快、规模最大的市场,目前 AI 在各个领域的渗透率可以说是全球最高。目前 20% 的企业或多或少的已经采用 AI,26 年初一次显著跃升后,预计今年有望继续上升 3ppt。

分行业上,得益于 AI 原生能力的替代性更加丝滑,Coding 领域渗透率最高。其他领域,行业渗透率看着高,但这里面仍然是 IT 部门是目标人群。

公司内其他岗位的渗透,以及 To C 的端侧 AI(包括具身智能),是 AI 未来增长方向。但这需要配合相应的产品形态、成熟渠道触达到更多的用户。这里往往涉及偏专业定制化的产品终端设计,因此需要时间和资金投入,其中降低算力门槛是加速 AI 在 Coding 之外领域渗透的核心关键。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

四、大模型混战升级的思考

Kimi K3 的出现,弱化了市场对 Anthropic 技术壁垒的信仰,但也给了资金雄厚的追赶者们,尤其是本身有生态、渠道优势的 Big Tech 们更大的投入信心。

但同时大模型行业的残酷竞争也被撕开最后的幻想。尤其是对于独立 AI Lab 来说,一年数十亿至上百亿的基础设施 + 训练成本,换来的是从以前 12 个月的领先优势,到如今只有 3 个月的溢价红利期,那么这笔账是很难算的明白的。

打开网易新闻 查看精彩图片

尤其是在成本大头——算力硬件价格全球统一下(实际因为大国卡脖子,中国采购高端芯片的成本溢价直接爆表),中国大模型的 “性价比” 优势部分来源于人才(中国 AI 工程师平均年薪与美国同行存在 3-5 倍差距)、电力(核心区中国便宜 30-50%)的绝对差额,但更多的还是靠忍受亏损的 “补贴”,实际也就是投资人买单,包括地方政府的补贴。

如下图:

(1)2026 年 A&O 两家的毛利率目前都已经在 60% 上下,但智谱预计在 2026 年的毛利率还要继续削弱到 30% 以下。

(2)而如果考虑到负担更重的训练成本,经营亏损差距还将拉大,这一点光靠销售、管理等其他经营开支的低价优势,难以做有效对冲。

因此一定程度上可以说,盈利结构发生显著变化的拐点,源于下半年中国高端自主芯片的量产。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

海豚君在年初覆盖智谱&MiniMax 的深度报告中也曾提及,在缩放定律失效之前,竞争不会停歇,人人都认为自己有机会训练出下一个超越同行的前沿大模型。这种情况下,大模型公司会是持续的吞金兽,而公司商业模式本质上就变成了一场持续融资的资本竞赛。

下半年起,我们陆续会看到一梯队的 AI Lab 登上最大的融资舞台,Anthropic、OpenAI 以及 DeepSeek、Kimi 将陆续筹划上市。当所有选手都拥有一样的融资通道时,最终的决战也会开始。

AI 主权问题可能会将全球分割成数个战场,上游资源的地缘掣肘推高成本,人才流动下各方又拥有旗鼓相当的硬实力,上述因素都会使得这将成为一个持久战。

反过来混战期间,大模型的商业模式会更加难以看清,何时盈利、能否盈利也将在大模型厂商的每一次投入和融资时被投资人反复拷问,跑分刷榜来推动顺利融资的现象可能会出现得更加频繁。

而这个时候,拥有原有企业平台生态和渠道优势的 CSP 厂商,在开源大模型实力显著提升、大幅缩小与闭源模型差距的情况下,更有希望摆脱裸卖算力的低利润率模式。同时,通过结合原本产品服务,将硬件方下移的议价权收益,从滋润了大半年的模型厂端,拿回更多的话语权。