小米把两场模型后训练搬上了直播。正在跑的是 mimo-v2.6-pro 和 flash 两个模型的 Agentic RL 后训练,训练过程对外实时可见。
有作者根据直播画面推算,这套训练每秒大约烧掉 10 美元。这个数字来自对直播内容的估算,不是官方口径。
打开网易新闻 查看精彩图片
分数摆在明面上
直播里给出的一个关键指标是 DeepSWE 得分。mimo-v2.6-pro 拿到 62,对比之下,DeepSeek-v4.1-flash 的同一项得分是 74.2。
差距接近 12 分。不过素材同时说明,mimo-v2.6-pro 仍处在训练早期,这个分数并非终态。
为什么值得看
把后训练过程直播出来,本身就把两件事同时暴露了:一是每秒约 10 美元的算力开销,二是模型在训练中途的真实分数。62 对 74.2 的对比,是训练早期的一个切片,不是结论。
热门跟贴