每秒至少烧掉10美元,小米把两个模型的训练过程直接摆到了直播镜头前。这不是发布会上的PPT演示,而是一场正在进行中的后训练直播——屏幕上滚动的是实时训练指标,不是事后总结。
更值得琢磨的是,同时开训的是两个模型:mimo-v2.6-pro 和 mimo-v2.6-flash。从直播画面看,训练已经进入后训练阶段,标注里写着RL。而衡量训练效果的测试集是DeepSWE,这个选择本身就透露了方向——它练的是Agent能力,不是单纯的对话或答题。
两个模型,一个早期分数
目前mimo-v2.6-pro在DeepSWE上的得分是62。作为参照,头部模型比如DeepSeek-v4.1-flash的分数是74.2。从训练时间和得分来看,这轮训练还处在相对早期的阶段,离收敛还有距离。
但真正让围观者开始算账的,是那个烧钱速度:每秒至少10美元。这个数字不是随口说的,直播里有一组可以推算的指标。
58分钟,22亿token
看阶段10的数据:生成/推理耗时(timing_s/outer_gen)花了58分钟,这个阶段生成了22亿token。简单换算下来,每秒要生成约63万token。
再看上下文长度,阶段10的平均上下文(ctx_total_length/mean)是89K。这么长的上下文,吞吐通常会明显下降。按H100来估算,单卡吞吐在100-150tps左右的话:
- pro模型用于解码,大概需要4000-5000张H100
- flash模型算下来大概是2000-2500张H100
- 预估总卡量在6000-8000张左右
还有一个细节能佐证这个推算。生成/推理耗时58分钟,反向传播计算耗时(timing_s/trainer_ops)是64分钟,两者相加正好约等于单步总耗时(timing_s/step)的126分钟。这说明推理和反向传播用的是同一批卡——集群先花58分钟全力做Rollout推理,等22.2亿token吐完、环境打分完毕后,这批GPU立刻切换角色,花64分钟全力做分布式长序列的反向传播和梯度更新。既然卡是复用的,用Rollout解码推测出来的卡量,应该就是全量规模。
6万个沙箱在同时跑代码
训练的是Agent能力,这一点在环境数据里体现得更直接。直播画面显示,Pro维持着23,180个活跃沙箱,Flash维持着37,786个活跃沙箱。加起来,同时有超过60,000个真实的Linux/Docker沙箱在并发执行代码和终端命令。
这个规模解释了为什么烧钱速度是每秒10美元。Agentic RL不是让模型做选择题,而是让它在真实环境里执行、试错、拿反馈,每一步都要消耗算力。6万个沙箱同时运转,背后是实打实的计算资源在支撑。
从直播透露的信息看,这轮训练还处在早期,分数和头部模型之间还有明显差距。但把训练过程本身公开直播,并且让围观者能顺着指标一路推算卡量和成本,这个动作在模型厂商里并不常见。至于后续还有哪些数据,直播里留了一句“一会给大家带来更详细的解读”。
热门跟贴