智东西作者 茄子编辑 李水青
打开网易新闻 查看精彩图片
智东西作者 茄子编辑 李水青

智东西7月28日报道,刚刚,月之暗面发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术MoonEP、FlashKDA和AgentEnv。

打开网易新闻 查看精彩图片

Hugging Face CEO Clem Delangue发文,Kimi K3 30分钟内以超过4000个赞登顶趋势榜,迄今为止最快的发布增长速度

打开网易新闻 查看精彩图片

此前7月17日,月之暗面发布拥有2.8万亿参数的Kimi K3,随即凭借出色的基准测试和实际体验被不少网友称作“中国的Fable 5时刻”。

Kimi K3开源后,北美AI基础设施创企OsmanticAI的创始人兼CEO Ahmad发文,将Kimi K3称为“本地版Fable 5”,并“强烈建议大家下载体验”,这样“他们永远也夺不走我的Fable 5”了。

打开网易新闻 查看精彩图片

数字员工Devin开发主体、美国知名AI创企Cognition宣布,Kimi K3现已接入Devin桌面客户端与命令行工具(CLI),并称:“在FrontierCode 1.1评测基准上,Kimi K3是我们测试过首款性能逼近前沿水准的开源模型。”

打开网易新闻 查看精彩图片

Nebius、Baseten、Fireworks等海外AI基础设施厂商随即宣布Day 0适配Kimi K3。Nebius称:“Kimi K3是首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步。”

打开网易新闻 查看精彩图片

华为昇腾CANN宣布对模型MXFP4量化实现Day0原生支持,并提供在昇腾950PR/DT系列和Atlas A3系列集群部署实践。同时,趋境科技宣布,基于开源大模型推理引擎SGLang,完成了Kimi K3在华为昇腾910C超节点上的Day0适配,并同步开源相关适配成果。

打开网易新闻 查看精彩图片

网友在Kimi K3上线前的讨论也非常火热。有网友发帖戏称,Hugging Face甚至给Kimi K3做了个预热网页。

打开网易新闻 查看精彩图片

截至Kimi K3上线半小时前,已有近3700名开发者在等待上线。且在上线10分钟前,Kimi K3的上线页面还短暂出现过404的情况。

打开网易新闻 查看精彩图片

模型权重地址:
https://huggingface.co/moonshotai/Kimi-K3

技术报告地址:
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

技术博客地址:
https://www.kimi.com/blog/kimi-k3

一、2.8亿参数模型权重全面开放,三大关键Infra技术开源

Kimi K3是一个拥有2.8万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持100万token的上下文窗口。

现在,每个人都可以下载并部署Kimi K3模型。无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。

Kimi K3此次还同步开源了训练系统,即Infra基础设施层的三项Infra技术:MoonEP、FlashKDA和AgentEnv。

三项开源Infra技术中,MoonEP是为超大细粒度MoE设计的高性能通信库,让专家并行通信在不均衡情况下仍保持极致效率。

FlashKDA是Kimi Delta Attention的高性能算子,在英伟达H20上prefill速度相比flash-linear-attention基线提升1.72-2.22倍,可直接作为替换后端使用。

AgentEnv是与KVCache.ai合作开发的沙箱系统,为大规模Agent训练提供高保真、强隔离的运行环境,支持快速快照、恢复和分叉,可应对大规模并行的Agent工作流。其中,FlashKDA此前已开源,MoonEP和AgentEnv随本次发布正式开源。

在模型架构方面,KDA+AttnRes以3:1比例混合KDA与Gated MLA,通过块级注意力残差增强跨层信息流动,实现高效长上下文建模

Stable LatentMoE使每个token从896个路由专家中激活16个,通过SiTU-GLU与Quantile Balancing在极高稀疏度下保持训练稳定。

MoonViT-V2视觉编码器从零开始使用next-token prediction训练,无需对比预训练,在达到基线效果的同时获得更稳定的优化过程。

后训练方面,模型在通用推理、通用Agent和编程Agent三大领域进行大规模任务合成,配合百万token上下文的强化学习基建,并完成了近20个内部评测集的完整评估。

二、多维评测,验证编程、Agent与视觉能力全面提升

在官方公布的评测结果中,Kimi K3在编程、Agent任务和视觉理解等多个方向展现出较强能力。

在编程能力方面,Kimi K3在超长时序持续开发SWE Marathon、软件逆向Program Bench、终端运维Terminal Bench 2.1等测试中表现突出。

其中,SWE Marathon、Program Bench均取得第一,Terminal Bench 2.1达到88.3分,与GPT-5.6 Sol接近;在高难度软件工程任务FrontierSWE中,Kimi K3以81.2分位列第二,仅次于Claude Fable 5。

打开网易新闻 查看精彩图片

在Agent和知识工作场景中,Kimi K3同样展现出较强的任务执行能力。在网页深度调研BrowseComp、办公自动化Automation Bench、Excel财务建模SpreadsheetBench 2等测试中取得领先,其中BrowseComp达到91.2分,Automation Bench和SpreadsheetBench 2均排名第一。

不过,在综合白领任务GDPval-AA v2、APEX-Agents等更贴近真实办公流程的评测中,Kimi K3仍弱于Claude Fable 5等顶级闭源模型。

打开网易新闻 查看精彩图片

在视觉能力方面,Kimi K3在图表理解CharXiv、文档分析OmniDocBench等任务中表现较强,其中OmniDocBench达到91.1分,超过参与对比的多款模型;但在部分视觉推理任务中,Kimi K3仍存在差距,例如零样本视觉工具任务Zerobench低于Claude Fable 5。

打开网易新闻 查看精彩图片

Kimi内部也测试了Kimi K3的工程能力。在GPU内核优化测试中,Kimi K3需自主完成代码分析、内核重写和性能验证,覆盖AttnRes、KDA、MLA等GPU计算任务。结果显示,在最高推理强度下,Kimi K3表现接近Claude Fable 5(含回退机制),并超过Claude Opus 4.8、GPT-5.6 Sol和GPT-5.5。

打开网易新闻 查看精彩图片

在知识工作方面,Kimi内部Internal Knowledge Work Bench测试显示,在统一开启最高深度思考模式后,Kimi K3在通用推理、深度文档分析和金融专项三类任务中的表现均超过GPT-5.5和Claude Opus 4.8。

打开网易新闻 查看精彩图片

三、Kimi K3挑战复杂任务:生成游戏、设计芯片、分析科研数据

Kimi K3发布后,智东西在Kimi K3 Max模式下实测了该模型的多模态与代码生成能力。在要求生成3D横版格斗游戏的测试中,提示词涉及“被霸天虎入侵的破败城市地图”、“低多边形风格”、“5种擎天柱阵营角色”、“5种霸天虎变种敌人”等复杂设定。Kimi K3仅用一次就完成了游戏创建,没有出现错误。

打开网易新闻 查看精彩图片

海外开发者 @He1s_Sammy 在游戏设计场景下对比测试 Kimi K3、GPT-5.6 Sol、Fable 5 三款模型,向三者输入完全相同的提示词,围绕方案质量、游玩体验、调用成本综合评估。

打开网易新闻 查看精彩图片

测试结果显示,Kimi K3的游戏设计表现最优,能够抓住玩法核心,产出内容节奏自然;而Fable 5与GPT-5.6 Sol生成的游戏节奏普遍过快。

打开网易新闻 查看精彩图片

在价格方面Kimi K3:9.5/10,调用成本0.03美元(约合人民币0.2元)、Fable 5:7.5/10,调用成本0.38美元(约合人民币2.57元)、GPT-5.6 Sol:7/10,调用成本0.11美元(约合人民币0.74元)。

在官方展示的案例中,Kimi K3展现了更长程的任务执行能力。在芯片设计方面,K3基于开源EDA工具和Nangate 45nm工艺库,在48小时连续自主运行中独立完成了芯片的构建、优化与验证。

打开网易新闻 查看精彩图片

在科研领域,K3一次分析了391个GWTC-5引力波事件,调用20多个并发子智能体,产出7张科学可视化图、2张表格,并综合了10多篇论文的文献内容。

打开网易新闻 查看精彩图片

在GPU编程领域,它从零开发了类似Triton的编译器MiniTriton,将开发者编写的程序转换为GPU可执行的代码,部分场景性能甚至超过现有工具。

打开网易新闻 查看精彩图片

结语:中国开源模型正在进入全球开发者的工具箱

对于Kimi K3,海外开发者的反应和半年前已经不太一样了。半年前,DeepSeek-V3开源时,海外社区的讨论更多是“又一个中国模型”。而到了Kimi K3,话题变成了“它比Claude Opus强”、“开发者正在把Fable换成K3”。

影响力变大,也意味着被盯上的风险在变大。就在Kimi K3开源引发热议的同时,美国参议员蒂姆·斯科特和比尔·哈格蒂已提案扩大商务部权限以限制外国对手接触AI技术。美国商务部去年曾考虑将月之暗面、DeepSeek、阿里Qwen团队等中国AI实验室列入实体清单。白宫还曾考虑通过行政令,要求使用中国模型的美国企业对安全事件承担责任。OpenAI、Anthropic等美国闭源AI企业曾提案禁用中国开源模型。

商务部回应称,这是“典型的人工智能霸权主义行径”,并指出近200家美国初创企业敦促政府不要切断对中国开源模型的访问,认为这将削弱美国企业竞争力。

当美国企业自己都在用中国的开源模型,制裁的合理性自然站不住脚。AI能力正在从少数公司的技术优势,变成全球开发者可以调用的基础工具——这个趋势不会因为一纸制裁令而改变。

来源:Kimi、X

打开网易新闻 查看精彩图片