3月19日,Cursor发布了自研新模型Composer 2。官方博客写得很漂亮:CursorBench得分61.3,超过Claude Opus 4.6的58.2;SWE-bench Multilingual 73.7,相比上一代Composer 1.5的65.9大幅提升。博客用了一个精心措辞的说法——「我们的第一次继续预训练」,给人的感觉是,Cursor自己从头训练了一个编程模型。

一天之内,技术社区就发现了问题。有推特网友注意到,Composer 2的底层基于Kimi的开源模型Kimi K2.5微调。开发者们开始比对Composer 2的输出特征和已知开源模型的行为模式,结论指向了Kimi K2.5。但Cursor的博客里,一个字都没提。

打开网易新闻 查看精彩图片

一个估值500亿美元的硅谷AI编程工具,核心能力跑在一家中国公司的开源模型上,而且一开始还没说。

Cursor联合创始人的回应

随后的信息逐步浮出水面:Composer 2约25%的预训练来自K2.5的基座模型,Cursor在此基础上做了微调和续训,推理部署由Fireworks完成。马斯克同日在X上转发了相关讨论。事件发酵后,双方先后出面,将合作定性为授权合作。

Cursor联合创始人Aman Sanger回应得很直接:「一开始没在博客里提到Kimi的底座,是我们的疏忽。下一个模型我们会改正。」

这件事为什么重要?先看一个背景:Cursor此前只用OpenAI、Anthropic和Google的模型,它对模型供应商的筛选标准在行业里是出了名的严。现在,一家估值500亿美元的硅谷明星产品,选择了一个中国公司的开源模型来构建自己的核心编程能力。而且不是「加入可选列表」——是把K2.5的权重作为预训练基座,在上面搭建自己的模型。

Composer 2的定价也耐人寻味:标准版0.50/M input tokens、2.50/M output tokens,比K2.5的官方API定价(0.60/3.00)还低。Cursor之所以能把价格打到这个水平,正是因为K2.5本身的成本结构足够低。

The Decoder在3月21日的报道中分析了Cursor最初不披露的原因:「不披露很可能出于竞争定位的考虑……承认依赖(外部模型)会动摇其独立AI能力的说法。」但反过来看,Cursor选择K2.5本身就是最好的技术背书。如果K2.5不够好,一个对模型要求如此苛刻的产品不会冒险用它。

不止Cursor,硅谷的基础设施也在接入

Cursor是应用层的标志性事件。但Kimi同时也打进了硅谷的基础设施层和算力层。

在Cloudflare公布数据之前,硅谷已经有人喊出了更大的数字。K2.5发布不久,All-In Podcast的Chamath Palihapitiya在节目中说了一段很有冲击力的话:「我觉得大家还没意识到这个Kimi K2.5时刻有多重要……把下一代系统和开源结合起来,AI的成本能砍掉90%。」他甚至宣布:「我把所有OpenAI的账户都取消了。25000美元,没了。」

这是硅谷顶级投资人在一档累计播放量超过10亿的播客里,公开为一个中国开源模型站台。Chamath的预测是「省90%」——而Cloudflare随后用自己的生产数据给出了验证。

Cloudflare在Workers AI平台上架了Kimi K2.5。Workers AI是全球最大的边缘计算平台之一,开发者通过它调用AI模型,请求在离用户最近的节点上执行。此前平台上的模型清一色来自美国公司——Meta的Llama、Google的Gemma。K2.5是第一个来自中国的大语言模型。

但真正有说服力的不是「上架」这个动作本身,而是Cloudflare自己的使用数据。Cloudflare在官方博客中披露:他们内部的安全审查agent每天处理超过70亿个token,在一个代码库中就识别出了15个以上的确认问题。此前这个agent使用中等价位的闭源模型,年费约240万美元。切换到Kimi K2.5后,成本降低了77%。

Chamath说「省90%」,Cloudflare实测「省77%」。一个是投资人的判断,一个是工程团队的账本——量级基本对上了。被Cloudflare选中,不只是「多了一个渠道」,Kimi被编进了全球开发者的默认工具箱。

黄仁勋对Kimi的关注不是从GTC才开始的。1月初的CES上,黄仁勋就用Kimi模型来验证下一代芯片的性能表现。对NVIDIA来说,选择哪个模型来做芯片的「验货工具」,本身就是一个技术判断——它需要足够吃算力、足够考验架构,才能充分测试硬件的极限。

两个月后的GTC 2026,黄仁勋再次选择了Kimi。3月18日,也就是Cursor事件的前一天,他邀请杨植麟在GTC做了一场演讲,主题是:「我们如何扩展Kimi K2.5」。同时,NVIDIA在GTC上用Kimi模型展示了推理能力。杨植麟是唯一受邀现场演讲的中国独立大模型公司创始人。

杨植麟在演讲中首次系统披露了K2.5的完整技术路线图。他说了一句很关键的话:「很多通用技术标准正在成为scaling的瓶颈。」他提到的关键技术创新包括优化器改进、注意力机制重构和残差连接的重新设计——都是模型架构层面的「地基工程」。

Kimi做对了什么?

硅谷的工具链为什么会选一个中国开源模型?具体来说,有两个原因。

第一是技术路线:从底层架构入手。K2.5的模型架构是MoE架构,总参数1T,但每次推理只激活其中的32B——384个专家模块中选8个工作的,剩下的「休息」。这意味着你得到的是一个万亿参数级别模型的能力,但只付320亿参数的推理成本。这是Cursor和Cloudflare选择它的直接原因:性能在第一梯队,成本只有同级别闭源模型的几分之一。

编程场景的数据很能说明问题。K2.5在SWE-Bench Verified上达到76.8%,LiveCodeBench v6上达到85.0%——后者超过了DeepSeek-V3.2的83.3%。不是一个「还行」的模型,基本在编程场景的第一梯队。Cursor基于它微调出的Composer 2跑分超过了Claude Opus 4.6,侧面验证了基座模型的质量。

更值得关注的是Kimi团队在底层架构上的持续创新。3月16日,他们发布了一篇关于注意力残差的论文。传统Transformer的残差连接用固定权重把每一层的输出简单累加,层数越深,早期层的贡献就越被稀释。Kimi的做法是用softmax注意力替代固定权重,让模型能根据当前输入动态决定「回看」哪些层的信息。效果很直接:在GPQA-Diamond上提升7.5个百分点,相当于多用25%的算力训练。

杨植麟在GTC演讲中把这条路线概括为一句话:「很多通用技术标准正在成为scaling的瓶颈。」意思是,美国主流路线习惯于堆更多的GPU、喂更多的数据来提升模型能力,但这条路的边际收益在递减。Kimi选择的是另一条路——改底层架构,让同样的算力产出更多的智能。Cloudflare的77%成本降低就是这条技术路线最直接的商业验证。

第二是开源找到了自己的生态位。开源模型,目前可能只在榜单上打败了闭源。事实上,Anthropic的Claude、OpenAI的GPT、Google的Gemini,在绝对能力的天花板上仍然领先。如果你需要的是当前最强的通用推理能力,闭源模型依然是第一选择。但K2.5的案例证明了另一件事:开源模型已经找到了自己的应用市场和不可替代的竞争力。

具体来说,是三个闭源模型覆盖不了的生态位。

  • 性价比驱动的大规模部署。Cloudflare的安全审查agent每天跑70亿个token,一年省下约185万美元。这种量级的调用场景,用闭源模型的API定价根本不现实。开源模型可以自部署、可以量化压缩、可以针对特定场景优化推理成本。
  • 可定制性。Cursor基于K2.5的权重微调出了自己的编程模型。这件事在闭源世界里不可能发生——你没法拿到Claude或GPT的权重,也就没法在它们的基础上做深度定制。
  • 透明度和信任。开发者能看到权重、能审计模型行为、能本地部署不出内网。对安全敏感的企业和政府场景,这不是「nice to have」,是刚需。

K2.5在HuggingFace上的下载量已经超过356万,GitHub上有127个项目集成了它,ollama也已支持K2.5。开源不是在跟闭源打同一场仗。它找到了闭源模型覆盖不了的场景——大规模部署、深度定制、可审计——然后在这些场景里建立了自己的优势。而Kimi K2.5,是目前在这条路线上跑得最快的。

从模型公司到Agent基础设施公司

Kimi内部也在快速出牌。早在K2 thinking发布时,Kimi就提出了「模型即Agent」的路线。当时听着像愿景。过去两个月的产品动作证明,这可能是产品路线图。

Agent Swarm是K2.5带来的最激进的产品尝试。一个编排器可以动态调度最多100个子Agent,并行执行1500步任务,速度比单Agent快3到4.5倍。写一份深度研究报告、批量检索上百家公司信息——以前要拆成几十个对话窗口慢慢磨的活,现在一次性扔给集群。想解决的是「一个Agent不够用怎么办」。

Kimi CLI作为终端里的AI编程助手,已经在开发者社区攒下了一批核心用户。GUI版本正在试水,他们想把同样的能力推向非技术人群,让更多人来用。春节期间上线的KimiClaw,基于自家模型快速上线了一键部署版的Openclaw,一个24/7在线的Agent环境,不用搭服务器,不用碰命令行。配合K2.5模型,使用的感觉意外还不错。

Kimi正在从一个模型公司,变成一个Agent基础设施公司。数据也在验证这条路线。据Similarweb数据,kimi.com的访问量已达历史新高,最近三个月累计访问量突破1.2亿次。这个数字说明,Kimi不只是在开发者社区有口碑——它正在成为一个有规模的消费级产品。

外部被硅谷工具链选中,证明了模型能力;内部全面转向Agent基础设施,则是在把这种能力变成产品。Kimi现在估值180亿美元,正以投前估值180亿美元(约合人民币1200亿)进行新一轮10亿美元融资。1月29日开源发布,3月20日Cursor事件引爆。不到两个月,Kimi K2.5跑进了硅谷从应用层到基础设施层的核心工具链。