Kimi K3的完整模型权重正式上线Hugging Face。
仅仅半小时后,K3便获得超过4000个点赞,登上平台趋势榜第一。Hugging Face联合创始人兼CEO Clem Delangue感叹,这是平台迄今增长最快的一次发布。
美国公司也很快跟了上来。Vercel创始人兼CEOGuillermo Rauch称K3是“目前全球最强的开放权重模型”,并宣布Vercel已经通过美国本土推理服务商接入K3。vLLM在权重公开当天上线支持,Fireworks AI、Together AI、Modal、Baseten和DigitalOcean等平台也接连宣布上线。
这场热闹背后,也透着一种紧迫感。
就在K3开放权重前夕,OpenAI和Anthropic正在向华盛顿强调中国开放模型的蒸馏和安全风险。黄仁勋公开唱反调,微软、Meta、英伟达等公司也联名反对过早限制开放权重模型。
中国开源模型越逼近美国旗舰,硅谷围绕开放还是封闭的争吵就越激烈。
过去三个月,中国开放模型已经连续落下三锤。
第一锤是DeepSeek-V4预览版,在部分测试中性能接近美国闭源旗舰,价格却低得多。第二锤是GLM-5.2:支持100万Token上下文,把重点放在复杂、长时间运行的Agent任务上。第三锤是刚刚开放完整权重的Kimi K3:总参数达到2.8万亿,在多项独立评测中进入全球第一梯队,部分编程和长任务成绩超过Claude或GPT。
三锤分别打向美国闭源模型的价格、长任务能力和模型规模。
接下来,尚未发布的DeepSeek-V4正式版将是第四锤。它要挑战的,是美国闭源模型最后还占优势的地方。
一场中国开放模型继续逼近、美国闭源公司试图借监管抢先设防的赛跑,已经鸣枪。
01
硅谷“分裂”
7月27日,月之暗面开放了Kimi K3的完整模型权重。
几乎同一时间,硅谷关于开放模型的争论也烧到了最旺。
据《纽约时报》和Axios报道,OpenAI和Anthropic近期向美国政策制定者示警,称中国AI公司可能通过大量调用美国模型、收集输出结果,蒸馏出成本更低的新模型。API还能限制账户和地区,模型权重一旦公开,开发者便可以下载、修改和自行部署,很难再被原公司收回。美国闭源公司耗费巨资训练出的能力,可能迅速变成全球开发者都能使用的基础设施。
黄仁勋对此公开唱反调。7月22日,他告诉Axios,优秀的中国开放模型“应该被使用”,美国公司也“绝对应该获准”使用中国模型。
7月24日,英伟达、微软、Meta等25家公司和机构首批签署《开放权重与美国AI领导力》,要求华盛顿避免过早限制开放模型。
OpenAI、Google和SpaceX最初没有出现在名单中,随后在周末陆续加入。
这封公开信反对的是把蒸馏争议扩大成对开放权重模型的全面限制。截至7月27日,主要美国前沿模型公司中,Anthropic仍未签署。
CEO Dario Amodei当天专门回应,称公司从未主张全面禁止开放权重模型。他承认普通开放模型具有公共价值,同时认为最强模型开放后很难保留安全护栏,因此仍支持打击工业级蒸馏、限制先进芯片流向中国,并要求所有强模型接受安全测试。
当然了,可以看出OpenAI的立场同样微妙,它支持美国发展开放模型,也继续向华盛顿示警中国公司可能存在的违规蒸馏问题。
英伟达随后又联合微软、IBM、Hugging Face、SpaceXAI等公司成立“开放安全AI联盟”。联盟公告提到,Hugging Face处理此前的Agent越界安全事件时,部分闭源工具因安全限制拒绝协助取证,团队最终在本地运行GLM-5.2,分析超过1.7万次操作并控制入侵。联盟由此提出,防守者也需要能够本地部署、修改和检查的强模型。
争论背后是不同的生意。
OpenAI和Anthropic依靠订阅和API出售模型能力,仅Claude Code今年2月的年化收入就已超过25亿美元。英伟达卖芯片,微软卖云服务,Meta需要扩大开发者生态,都希望市场上出现更多便宜、开放的模型。
今年1月,Kimi、Qwen和GLM三家在清华AGI-Next峰会上同台,“中国开源四杰”中,只有DeepSeek没有出现在会上。几家的判断很接近:单纯比拼聊天能力已经很难拉开差距,下一轮竞争要看谁能让Agent处理更长、更复杂的任务
半年后,DeepSeek、GLM和Kimi连续更新,已经逼得硅谷公开站队。Kimi K3只是最新的火星,真正点燃争议的,是中国开放模型过去三个月落下的三锤。
02
中国“三锤”
2026年,中国开放模型已经连续追了三轮,每一轮都在拆美国闭源模型的一项优势。
“第一锤”来自DeepSeek。
4月24日,DeepSeek发布V4预览版,并同步开放模型权重。V4-Pro共有1.6万亿参数,每次调用激活490亿参数,支持100万Token上下文。
在DeepSeek模型卡公布的自测中,V4-Pro在最高推理强度下的SWE-bench Verified得分达到80.6%,与Claude Opus 4.6的80.8%几乎相同。BrowseComp达到83.4%,接近Claude Opus 4.6的83.7%,也高于GPT-5.4的82.7%。
更狠的是价格。5月23日,DeepSeek宣布将原本限时提供的75%折扣变成长期价格,5月31日后继续执行。目前每百万Token非缓存输入、输出分别收费0.435美元和0.87美元。
这意味着,开发者现在只需花美国闭源旗舰的一小部分费用,就能调用一款性能接近的开放模型。
“第二锤”来自智谱。
6月16日,智谱发布GLM-5.2,同样支持100万Token上下文,并以MIT许可证开放权重。
它的重点已经从回答问题转向长时间干活——阅读大型代码库、反复调用工具,在数百轮操作中完成软件工程任务。
按照智谱汇总的各家最佳测试结果,GLM-5.2在Terminal-Bench 2.1中达到82.7%,略低于GPT-5.5的83.4%,高于Claude Opus 4.8的78.9%。
虽然不同模型使用的Agent工具存在差异,这个成绩仍说明,开放模型已经能处理真实终端和复杂工作流,闭源模型对Agent能力的领先正在缩小。
第三锤来自Kimi K3。
7月27日,月之暗面开放K3完整权重。按照月之暗面的说法,这是全球首个开放权重的3万亿参数级模型:总参数达到2.8万亿,每次激活1040亿参数,同时支持图像、视频和100万Token上下文。此前很难同时出现在开放模型上的参数规模、多模态和长任务能力,被K3放到了一起。
在月之暗面公布的测试中,K3在Terminal-Bench 2.1拿到88.3%,超过Claude Fable 5的88.0%,距离GPT-5.6 Sol的88.8%只差0.5个百分点。
在考验超长软件工程任务的SWE-Marathon中,K3得到42分,也高于GPT-5.6 Sol的39分和Claude Opus 4.8的40分。
三锤落下,价格、长任务和模型规模都很难再成为闭源模型独享的优势。
但这些结果大多来自公司测试,部分比较还混用了不同的Agent工具和运行环境。它们尚未证明在真实项目和反复运行中,中国开放模型的整体稳定性已经赶上美国闭源旗舰。
这正是DeepSeek-V4正式版还要打穿的最后一道墙。
03
V4还要打穿哪堵墙?
既然部分评测分数已经追上,美国闭源模型为什么还能把API卖贵十几倍甚至几十倍?
月之暗面在K3官方模型卡里给出了一个很诚实的答案。K3虽然在多项评测中达到顶级水平,整体使用体验与Claude Fable 5和GPT-5.6 Sol相比,仍有“明显差距”。
GLM-5.2也有类似的问题。它在Terminal-Bench 2.1中最高达到82.7%,已经接近美国顶级模型。换到专门考验超长软件工程任务的SWE-Marathon,智谱公布的测试中,GLM-5.2只有13分,Claude Opus 4.8达到26分。
对企业来说,这些小错误会直接变成成本。
企业选择模型时,需要把API费用和返工时间一起计算。
DeepSeek-V4-Pro每百万Token缓存未命中输入和输出分别收费0.435美元和0.87美元,Claude Opus 5则需要5美元和25美元,输出价格接近DeepSeek的29倍。
这项价格优势很大,但如果长任务做到最后失败,工程师还要重新检查、修改和运行,省下的调用费很快就会耗在返工上。
因此,V4正式版需要拿出的,除了更高的分数,还有反复运行仍然稳定的工具调用、长上下文和多轮修改能力。它要让开发者敢把大型代码库、复杂研究和长时间Agent任务交给开放模型。
截至目前,DeepSeek尚未公布V4正式版的发布时间和具体规格。在近期流传的与投资人的交流中梁文锋有言,公司大概率仍会开放最强模型,商业化只追求“合理利润”。
如果这句话最终兑现,V4正式版还会继续采用DeepSeek最有杀伤力的组合:能力接近美国旗舰,价格低得多,同时开放权重。
写到这里,OpenAI和Anthropic最近的动作就更容易理解了。
三锤已经接连落下,它们不想等到V4正式版发布后再应对。因此,Kimi K3刚刚开源,两家公司便推动华盛顿调查模型蒸馏,并讨论制裁和使用限制。模型权重一旦被大量下载和部署,再出台限制,效果就会大打折扣。
现在比的是谁先到——DeepSeek-V4正式版,还是华盛顿的限制措施。
第四锤能有多大威力,一半取决于DeepSeek能否拿出稳定、低价、继续开放权重的正式版,另一半取决于主张限制中国开放模型的一派能否成功。
热门跟贴