后来者居上,小米大模型如何生死突围?
引 言
小米大模型登顶全球,这可能是一场“技术、战略与组织”的协同胜利。
7月27日,OpenRouter数据显示,小米MiMo-V2.5登顶全球大模型调用量周榜、月榜双第一,月调用量达31.20T,成为当周全球唯一突破10T的模型。
5月以来,其单周调用量从1.46T飙升至10.46T,两个月增长约616%。
更震撼的是,7月调用量前五名均为中国模型,中国模型全球份额已达63.5%,美国仅占35.5%。
阿明评论
小米凭什么?答案不在运气,而在三个层面的系统破局。
▌1
技术破局:把不可能的降价变成“核武器”
5月27日,雷军宣布MiMo-V2.5系列API永久降价,最高降幅达99%。业内哗然,在算力成本高企的当下,这近乎疯狂。
秘密在于Hybrid SWA架构。MiMo-V2.5-Pro是一个万亿参数的稀疏MoE模型,70层Transformer中仅10层使用完整注意力,其余60层采用滑动窗口注意力。这套设计将KVCache存储压缩至传统方案的约1/7,缓存Token容量提升5倍,成本降低80%。小米还重构了从缓存管理到调度策略的完整推理栈。
模型能力没有任何缩减,精进的是推理系统工程能力本身。同一模型,相同硬件,更高吞吐,更低延迟。 当对手还在卷参数时,小米已在卷每Token成本。开发者用更少的钱获得更强的能力,调用量自然飙升。
▌2
战略定力:600亿砸出来的生态闭环
技术突破背后是惊人的战略决心。雷军宣布未来三年AI领域投入不低于600亿元,2026年单年达160亿元。
但钱不是撒胡椒面。小米将AI、芯片、OS确立为三大核心技术赛道,目标是在2026年内完成系统级整合。在模型层面,MiMo已完成大语言、多模态、语音全系列矩阵闭环。在部署上,采用端云协同,云端处理复杂推理,端侧模型在手机本地实现低延迟、高隐私的即时响应。
小米打的不是模型战,而是生态战。 MiMo不是实验室里的花瓶,而是要进入手机、汽车、智能家居每一个终端。当模型能力与亿万设备深度耦合,调用量的爆发只是水到渠成。
▌3
组织创新:用创业小队对抗大厂内耗
最容易被忽视却最关键的一点,就是组织模式。
小米MiMo团队全链路仅百人,核心攻坚只有二三十人。没有固定部门分组、没有严格职级、没有硬性交付节点。团队定下铁律,模型效果永远优先于进度与成本。训练中遇到数据偏移等隐患,果断停训排查,最长一次停训调整持续两周。
在动辄日烧百万算力的大模型行业,这种不计成本求质量的做法堪称另类。
但正是这种近乎偏执的技术洁癖,让MiMo在智能体能力上跻身全球第一梯队,在GDPVal-AA等测评中,MiMo-V2.5-Pro的Elo评分达1581。在SWE-bench Pro上得分57.2,可对标Claude Opus 4.6和GPT-5.4等头部模型。
▌4
结语:并非偶然,一个多维度的系统成功
小米MiMo的登顶,是一个多维度的系统胜利。技术上用架构创新把成本打下来,战略上用600亿投入把生态建起来,组织上用扁平化把效率提上去。
这或许揭示了大模型竞争的下一个阶段,不再是单一维度的参数竞赛,而是技术深度、战略广度与组织效率的综合较量。
在大模型这条新赛道上,小米已经抢到了领跑位置。
而OpenRouter上月榜前五被中国模型包揽的事实也表明,AI的全球权力版图,正在被重新绘制。
小米大模型,未来已来。
阿明书法:突围战 25CM*13.5CM 约0.3平尺
【声明】本文和作者回复仅代表个人观点,不构成任何投资建议。
热门跟贴