6月9日小米放出一则重磅AI技术消息,MiMo团队联合TileRT推理团队完成重大突破:万亿参数旗舰模型MiMo-V2.5-Pro推出UltraSpeed极速模式,在普通8卡商用GPU服务器上,输出速度稳稳突破1000tokens/s。雷军亲自在微博官宣这一进展,不同于行业里靠定制专用芯片堆速度的路线,小米全程使用市面上流通的标准硬件,用模型算法+底层推理系统双向打磨,拿下万亿参数模型千速推理的行业纪录。更快的生成速度不只是数字好看,更能改写代码开发、实时风控、医疗辅助等一大批AI落地场景的运行逻辑,国产大模型的实时化落地门槛被大幅压低。
一、1000tokens/s到底有多快?直观对比看懂差距
很多人对token单位没有概念,简单类比:1个token大约对应1-2个汉字、0.75个英文单词,1000tokens/s等同于每秒输出上千个汉字,是普通人打字速度的200倍有余。
拿实际任务对比差距更清晰:制作一套带动态动画、多图表、告警模块的AI运营可视化大屏,标准版MiMo-V2.5-Pro要6分15秒才能完成,UltraSpeed极速版仅13秒,同等画面效果下最高提速28倍。还有两个极具冲击力的演示效果,10秒就能生成完整贪吃蛇小游戏代码,1分钟复刻一套macOS系统页面架构,全程不用人工分步调试。
放到行业横向对比,差距一目了然。海外主流旗舰模型里,GPT-5.5速度约68tokens/s,ClaudeOpus4.6仅71tokens/s,主打高速的GeminiFlash也只有192tokens/s。此前TileRT和智谱合作优化的GLM-5.1高速版,创下彼时国产API速度天花板400tokens/s,如今小米直接把数值拉高两倍半。
速度提升带来最直接的体验变化:以往打开AI写代码、做复杂系统搭建,动辄等待几分钟,现在输入指令几乎秒出完整成果,长时间等待的卡顿感彻底消失。官方给出通俗总结:3倍定价,换来10倍左右的输出提速,性价比适配追求高效产出的企业开发者。
二、不靠特制芯片,通用GPU跑出极限算力
行业里想拉高大模型推理速度,主流路线是砸重金定制专用硬件:Cerebras晶圆级芯片、Groq片上存储芯片,靠硬件底层架构重构换取低延迟、高吞吐,但定制芯片成本高昂、通用性极差,普通中小企业根本负担不起部署成本。
小米全程走通用硬件优化路线,一台随处可采购的标准8卡GPU节点,就是跑出1000tokens/s的全部硬件基础,核心靠模型侧、系统侧两套技术双向协同打磨。
1.FP4精准量化:模型瘦身,实力不缩水
万亿MoE混合专家架构的模型,最大负担就是海量参数带来的显存占用、数据搬运带宽压力。如果全量用8比特、16比特精度运行,8卡GPU很容易被占满,算力大半耗在数据传输上而非计算。
小米没有一刀切整体压缩,采用差异化MXFP4量化方案:只对数量庞大、精度容错高的专家模块做4比特压缩,模型主干、注意力等核心模块保留高精度,搭配量化感知训练微调补偿精度损耗。压缩后模型体积大幅缩小,GPU来回搬运数据的开销骤降,整体智能水平和原版旗舰模型几乎没有差别,完美平衡体积、速度、能力三者关系。
2.DFlash块级推测解码:批量预判,不用逐字磨蹭
传统加速用小草稿模型逐一生成片段,再交给大模型逐段验证,一步等一步,串行流程拖慢整体速度。DFlash彻底改掉串行逻辑,草稿模型一次并行生成一整块token内容,一次性交给万亿大模型校验。
针对MiMo万亿MoE长文本特性,团队额外做两层适配:草稿模型搭载滑动窗口注意力,上下文变长也不会让算力消耗线性暴涨;训练信号下沉到单GPU分片,省去多卡通信损耗。实测代码场景表现亮眼,每轮校验8个预判token,平均能接纳6.3个,最高样本接纳7.14个,相当于每一次验证就能确认一大段有效内容。目前通用闲聊场景接纳率还有提升空间,团队仍在迭代优化。
3.TileRT定制推理内核:消灭计算间隙,榨干GPU性能
算法再好,没有适配的底层系统也发挥不出实力,TileRT专门为FP4量化、DFlash解码重写整套编译引擎与计算核。传统推理框架是算完一个算子、停下调度再跑下一个,微秒级的启停空隙堆积起来就是巨大延迟。
TileRT换成常驻内核模式,整条计算流水线一直留在GPU内部持续运转,数据搬运、张量计算、跨卡通信拆分成精细微型任务,不同线程束同步协作,计算和数据传输完全重叠。软硬件深度对齐后,1000tokens/s高负载运转下,GPU算力没有一丝无谓浪费,形成完整高效的闭环运行体系。
三、极速推理落地:四大场景迎来模式变革
每秒千token不只是跑分数字,它会实实在在改变AI的商用玩法,很多过去受延迟限制无法落地的模式,现在具备实操条件。
第一,解放编程Agent生产力。程序员调试系统、重构工程、批量写页面代码时,不用蹲守几分钟等待模型输出,实时补全、多方案对比一键生成,单人开发效率成倍拉高,也是本次技术优化表现最好的场景。
第二,搭建毫秒级实时决策闭环。高频量化交易信号筛选、平台瞬时反欺诈拦截、线上智能竞价、真人实时对话交互,这些场景容不得几秒延迟,万亿大模型以前只能做离线分析,如今能接入即时响应链路,决策质量和速度兼顾。
第三,医疗辅助提速增效。手术实时辅助判断、大批量医疗影像病灶筛查,更快的AI分析结果能给医生留出更多处置、研判时间,尤其急诊场景价值突出。
第四,用速度换思考深度。同等等待时长里,模型可以并行跑多条推理路径,自动对比纠错筛选最优答案,靠超高吞吐提升逻辑严谨度、减少幻觉问题,复杂逻辑问答、方案规划质量显著提升。
四、开放政策与开源进度,门槛逐步放开
目前UltraSpeed模式采用申请限时体验,开放周期从6月9日至6月23日,审核通过的开发者能领取两周免费Chat测试额度。线上配套两套入口,API调用平台与独立极速对话页面均可接入测试。
定价规则清晰对标标准版:MiMo-V2.5-Pro标准版缓存命中输入0.025元/百万token、未命中3元、输出6元;极速版对应价格翻三倍,缓存命中0.075元、未命中9元、输出18元,仅开放API调用,暂不支持Token包月套餐。
开源层面同步落地,MiMo-V2.5-Pro-FP4-DFlash完整权重、量化参数、DFlash配置文件已经上传HuggingFace平台,开发者可以自行下载部署调试,后续还会推出适配更多环境的极致推理适配包。
五、通用硬件路线,降低行业普及成本
小米这次突破最大的行业意义,不在于单纯刷新速度纪录,而是证明高性能万亿大模型不用绑定昂贵定制芯片。对比Cerebras、Groq的专属硬件路线,通用GPU优化方案硬件采购、运维成本更低,中小型科技公司、垂直行业厂商不用投入巨额硬件预算,就能部署高吞吐旗舰大模型。
客观来看这项技术还有短板:高接纳速度稳定集中在代码这类结构化任务,开放式闲聊、创意写作场景优化空间很大;极速节点资源有限,申请制开放也说明大规模全量商用还需要时间打磨扩容。但不可否认,1000tokens/s是国产万亿大模型迈向实时普惠应用的关键一步,后续随着迭代优化,极速推理会慢慢变成企业AI服务的常规配置。
国产大模型竞争早已不只是比参数、比测评分数,推理效率、落地成本、软硬件协同工程能力,正在成为决定长期竞争力的核心战场,小米MiMo这一步,给整个行业提供了一条更务实、可复制的提速路径。
热门跟贴