小米 MiMo 团队为即将推出的 MiMo-V3 打造了一套新的注意力架构,名字叫 HySparse2。这套架构的测试对象是 80B-A3B MoE 模型,跑出来的数字相当直接。
相比 MiMo-V2 系列使用的 Hybrid SWA,HySparse2 把 prefill FLOPs 降低了 5.02 倍;相比 HySparse,降低幅度是 2.92 倍。同一组对比里,KV cache 从 12.09 GB 压到了 2.69 GB。
打开网易新闻 查看精彩图片
为什么盯着 prefill 和 KV cache
大模型推理的成本大头,长期集中在两处:一是 prefill 阶段要一次性算完整个输入,算力开销随上下文长度快速上涨;二是 KV cache 要常驻显存,上下文越长占用越大。这两项压下来,直接决定同样的卡能塞进多长的上下文、能扛住多大的并发。
HySparse2 给出的两个降幅,正好落在这两个位置上。5.02 倍和 2.92 倍是相对不同基线算出来的,KV cache 的 12.09 GB 到 2.69 GB 则是绝对值的变化。
打开网易新闻 查看精彩图片
架构迭代的节奏
从命名看,HySparse2 是 HySparse 的下一代,而 MiMo-V2 系列用的是 Hybrid SWA。三代方案对应三组数字,团队把对比基线同时列了出来,等于把这条技术路线上的每一步收益都摆在了台面上。
这套架构的定位很明确:为即将推出的 MiMo-V3 服务。也就是说,这些数字目前是架构层面的测试结果,最终会以什么形态落到 MiMo-V3 上,还要看后续发布。
热门跟贴