震动美股的Kimi K3,到底有多强?

实测的这几天,我们用K3复现了券商研报、搭建了实时选题监控系统,甚至用一段提示词和一张参考截图做出了一个有六种3D鱼类的“大鱼吃小鱼”游戏。

但这些,可能还没发挥出K3真正的水平——

有人用它在2小时内完成了一项通常需要天体物理研究员两周的计算,期间还发现了已发表论文中的公式问题。有人让它连续自主运行48小时,用开源EDA工具独立完成了一颗芯片的设计和验证。还有人三轮对话做出了一个可玩的CS:GO克隆,总成本只花了3美元稍稍出头。

7月17日,月之暗面发布Kimi K3。2.8万亿参数,原生视觉理解,100万token上下文窗口。完整权重将于7月27日开放下载,届时它将成为全球参数量最大的开源权重模型。

Arena AI前端代码竞技场,K3以1679分登顶全球第一,超过Claude Fable 5的1631分和GPT-5.6 Sol的1618分。

打开网易新闻 查看精彩图片

值得一提的是,这张榜和实验室里跑出来的分数不同。它用的是Elo对战机制,和国际象棋排名同一套逻辑:真实开发者提交真实的前端编程任务,两个匿名模型各交一份代码,开发者盲选更好的那个。投票的人,不知道自己在给谁投票。由于模型身份被隐藏,这类盲测能削弱品牌印象对投票的影响,比厂商自报的榜单更接近真实用户偏好。

而Kimi K3,首秀即登顶,胜率达到了76%,领先Fable 5整整48分。品牌营销、参考设计、数据分析、消费产品、模拟、内容创作、游戏这七个细分方向中,K3拿下六个第一,仅游戏类排名稍稍落后于Fable 5。

Vercel创始人Guillermo Rauch同样确认,K3在Next.js工程评测中排名第一,并称这是"首次有开源模型超越全部闭源模型";马斯克看完评了一个词:Impressive;摩根士丹利、高盛、Bernstein等国际顶尖投行用完连发数篇研报,从各个角度"花式夸夸"。

打开网易新闻 查看精彩图片

那么,Kimi K3的真实表现到底是夯了还是拉了?不妨从我们的一手实测说起。

打开网易新闻 查看精彩图片

一手实测:很强,还很有审美

我们给K3的第一个任务不是写段代码或画个界面,而是读懂一份60多页的券商宏观深度报告,然后把里面描述的研究方法论复现成一套可运行的系统,看看它能不能帮诸多金融从业者解决高频的“研报复现”工作。

复现一份研报的完整方法论

恰好,我们在刷研报的时候看到了一篇需要"四角色线性流水线"复盘报告生产体系:新闻收集员从华尔街见闻等源采集事件,数据底稿工程师校验14个Sheet的完整性和数据口径,研报撰写员只读底稿生成复盘报告,合规审查员执行七项审查并拥有最终否决权。四个角色依次执行,前一个不完成后一个不启动。

打开网易新闻 查看精彩图片

K3读完PDF后,按照我们的要求先输出了需求分析和产品设计文档,然后自行拆出两条并行开发线分头推进。

最终,kimi交付了一整套Python工程:四个Agent角色、十多个专业工具(双源新闻采集、四维度事件分类与双重去重、底稿校验与口径同步、月度复盘撰写、三情景展望框架、合规七项审查),以及一个可本地运行的Web服务和配套的自动化测试。

打开网易新闻 查看精彩图片

我们用黄金ETF 2026年5月的案例跑了一遍完整流水线。结果显示,系统从2233+865条原始新闻中筛选出76条底稿事件(资产配置23、货币16、避险28、商品9),生成了一份带走势三段式复盘、事件逐条点评和三情景概率展望的月度报告。数据口径与研报原文对齐,合规审查七项全部通过。

打开网易新闻 查看精彩图片

一份PDF进去,一套可运行的研究体系出来。对于这类需要同时理解金融逻辑、系统架构和工程实现的复合型任务,K3展现出的理解深度超出了我们的预期。

一段提示词做一个3D游戏

我们给K3下了一段提示词,附了一张游戏操作面板的参考截图,让它做一个3D海底世界的"大鱼吃小鱼"游戏。

打开网易新闻 查看精彩图片

K3的做法是先拆后合。它自行拆出两条并行工作线——一条负责海底场景和UI,另一条负责鱼类模型和玩法逻辑——分头开发,然后合并集成。

最终,kimi交出来的是一个完整度很高的3D网页游戏作品:6种程序化生成的鱼类(从小丑鱼到鲨鱼,每种有独立的体型、配色和游动行为),玩家操控一只虎鲸在海底吞噬比自己小的鱼,躲避大鱼,不断升级。HUD采用毛玻璃面板设计,配色是低饱和的海洋蓝绿色调,左上角血条、能量条、等级进度,右下角技能按钮,甚至做了移动端虚拟摇杆适配和非常精致的音效。

打开网易新闻 查看精彩图片

代码写完后,K3还会拉起运行画面的截图,根据视觉缺陷反复修改,直到画面正常、可以流畅游玩。这种能力,被Kimi官方称为vision in the loop。

坦白讲,拿到这个游戏的时候我们是有点吃惊的。不是因为"AI能做游戏"——这件事去年就有人演示过了——而是它交出来的东西有审美、有完成度,不像是AI临时拼凑的demo,倒更像是一个有设计意识的小团队花几天打磨出来的原型。

审美,可能是K3最被低估的能力

以上这些案例验证的是K3的工程能力。但在实测过程中,反复给我们留下印象的还有另一件事:它做出来的东西,和宣发视频一样高级,一样有审美。

使用K3的这些天里,我们用它制作了非常多高级、有质感的网站前端。社区里更有人做了一个黑洞引力透镜的交互可视化页面、有人仅用一段参考视频让K3复刻了出了精致细腻的Blender资产,效果精致到让不少从业者感叹"这个模型是不是偷偷读了个艺术硕士"。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

甚至能用它设计芯片

我们体验的主要是金融、媒体等领域的日常开发场景,而全球社区诸多大神们,把K3带去了更顶尖的领域——科研、芯片设计、编译器...这些对顶级闭源模型都非常有挑战性的领域。

科技记者Max Weinbach让K3 Agent集群在浏览器中重建了macOS 27的Liquid Glass界面。3小时自主执行后,产出了一个完整的浏览器版macOS:所有按钮可点击,内置Chess游戏实际可玩,低电量模式甚至会降低屏幕亮度。

打开网易新闻 查看精彩图片

还有一位开发者做了件更有想象力的事:他没有让K3做一个游戏,而是让K3做了一台“游戏机”——含卡带插槽、物理按键,插入一盘电子《逆转裁判》风格的卡带就能玩,风格极其逼真。

打开网易新闻 查看精彩图片

成本方面,独立评测平台TestingCatalog实测K3与Fable 5做同一款游戏:K3花费$3.11,Fable 5花费$12.23,约为后者的四分之一。

打开网易新闻 查看精彩图片

还有个开发者仅用三轮对话就生成了一个可玩的CS:GO克隆,总API成本仅3.24美元,约23元人民币。对比来看,同类任务在Fable 5上要花约9美元。

官方展示的案例同样令人印象深刻:K3从零搭建了一套完整的GPU编译器MiniTriton,性能在基准测试中持平甚至超过了Triton和torch.compile;连续自主运行48小时,独立完成了一颗芯片从设计到验证的全流程。

打开网易新闻 查看精彩图片

甚至,在K3开发后期,月之暗面团队把大部分kernel优化工作交给了K3的早期版本——没错,这个顶级AI在优化自己。值得一提的是,K3发布不到48小时,月之暗面就因爆火“断供”。由于用户涌入量远超预估,集群负载直接逼近极限,7月19日,公司宣布主动暂停C端新用户订阅,将全部算力优先保障已订阅用户体验,同时紧急推进扩容。

打开网易新闻 查看精彩图片

2.8万亿巨兽和它的设计哲学

模型做到2.8万亿参数,难的不是参数本身,是信息如何在这个规模下不丢、不乱、不慢。K3在架构上做了两件事。

第一件是Kimi Delta Attention(KDA),解决长度问题。传统注意力机制处理长文本时,每遇到新内容都要回头查阅全部原文,文本越长计算代价越大。KDA的做法是边读边记笔记:新信息写进去,不再重要的逐渐淡化,多数时候查笔记就够,必要时再翻原文。这让K3在百万token上下文窗口下的解码速度提升了6.3倍。

第二件是Attention Residuals(AttnRes),解决深度问题。模型内部上百层,信息逐层向后传递。传统做法相当于接力改稿,每个编辑只看上一版,改了上百轮后早期的关键判断很容易被淹没。AttnRes让后面的层可以有选择地直接检索前面各层的信息,按需取用。

两项技术配合Stable LatentMoE框架(总共896个专家,每次仅激活16个),K3整体扩展效率比上一代K2提升了约2.5倍。

打开网易新闻 查看精彩图片

三家投行连夜发研报

K3发布不到24小时,反响已经从技术社区蔓延到了资本市场。

PyTorch联合创始人Soumith Chintala称K3为"世界级模型"。前美国AI政策顾问Sriram Krishnan评价这是"对整个行业有重大影响的时刻"。Stability AI创始人Emad Mostaque更直接:"美国实验室最终会蒸馏中国模型。"杨植麟的博士生导师、CMU机器学习教授Russ Salakhutdinov发帖称K3"为开源社区带来了重大突破"。

资本市场上,三家投行的观点也很有看点。

摩根士丹利在7月17日研报中,将K3定位为中国LLM"在模型规模、性能和定价上全面追赶美国领导者"的信号。大摩特别指出:"我们不认为K3是一夜奇迹,而是中国AI产业累积进步的结果。"报告同时预期,下半年将有更多2到5万亿参数的中国模型发布。

打开网易新闻 查看精彩图片

高盛7月18日的研报用了一个更大的判断:中国AI开源模型"正在达到全球扩散的智能临界点"。K3把API定价抬到了中国模型中最高的水平(混合约$2.3/百万token),但仍只有Claude Fable 5的约三分之一。在高盛的框架中,评估AI模型公司竞争力的三个核心指标是定价权、成本效率和财务实力,K3在前两项上给出了新的标杆。

高盛在随后的报告中分析称,DeepSeek代表成本效率,Kimi K3代表新的能力前沿和定价权 。该机构表示,K3的API定价已是中国模型中最高的水平(混合约$2.3/百万token),仍只有Claude Fable 5的约三分之一,但彻底告别了过去的"白菜价"模式。高盛认为,中国开源模型的智能水平正在达到面向全球扩散的临界点:过去靠性价比入场,下一阶段,可能凭借前沿能力进入全球开发者的核心工作流。

打开网易新闻 查看精彩图片

Bernstein最为直接:"K3 a home run。"研报重新排列了中国AI实验室的SOTA排名,将Kimi列为新的领头羊,并测算K3比Opus 4.8便宜约40%,比Fable 5便宜约70%。

打开网易新闻 查看精彩图片

来到具体的市场表现。K3发布当日,纳斯达克100指数期货跌逾1.8%,日经225指数跌逾4%。Polymarket上,Anthropic年底估值达$1.5万亿的概率从78%跌至67%。

市场紧张的逻辑并不复杂:一个中国实验室在算力受限的条件下,通过架构创新把开源模型做到了逼近闭源旗舰的水平,这直接动摇了"前沿AI需要无限算力投入"的核心假设——而这正是美国科技股过去两年最大的估值支柱之一。

值得一提的是,上一次一个模型发布引发这种级别的全球市场波动,还是DeepSeek R1。

打开网易新闻 查看精彩图片

尾声

7月27日,K3的完整权重将正式开源。届时,全球开发者将第一次拥有一个参数规模和能力水平都逼近闭源旗舰的开源基座模型。如大摩和高盛在研报中所预判的,这可能只是中国万亿级开源模型密集登场的起点。

K3的中文发布博客以苏轼《思治论》开篇:"犯其至难而图其至远者,发之以勇,守之以专,达之以强。"去面对最困难的事,追求最远大的目标。出发靠勇气,坚守靠专注,抵达靠实力。

而官方产品发布稿的结尾,月之暗面从容坦然地写下:K3"在用户体验上与Fable 5和GPT-5.6 Sol仍有明显差距"。

有技术野心,亦谦虚泰然。这种气质,或许同样值得关注。

发之以勇,K3已经做到了。守之以专、达之以强——7月27日开源之后,这个故事会有更多优秀中国公司,和Kimi一起写下去。

*以上内容不构成投资建议,不代表刊登平台之观点,市场有风险,投资需谨慎,请独立判断和决策。