打开网易新闻 查看精彩图片
作者 | 汤安迪
编辑 | 周欢
近半年沉默。我们用这段时间研究一个问题:强化学习(RL)能扩展到多远。
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
MiMo-V2.6 目前正处于其 RL 运行的中途。我们扩展了三件事:计算资源(每步约 20 亿 token,1568 个提示 × 16 次 rollout,完全异步)、环境和测试框架(多任务代理式 RL,在一次运行中混合多个测试框架),以及评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。我们将在未来几周逐步开源细节。
注意它实际上是在进行 Agentic RL, 因为我们能看到衡量训练效果的测试集是DeepSWE, 不过从训练时间和得分来看, 还处于训练早期阶段.。
目前mimo-v2.6-pro 的 DeepSWE得分是62, 而现在的头部模型比如DeepSeek-v4.1-flash 是 74.2. 所以训练处于相对早期。
按照H100来估算, 单卡吞吐在100-150tps 左右的话, 那么大概就需要4000-5000张H100。注意这还只是训练pro用来解码的。还有flash模型的, 算下来大概是2000-2500 张H100。
这就是小米的烧钱速度。
•END•
欢迎点击奇偶工作室,看最新视频~
Question. Write.Narrate. Believe. Become a story.易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:
热门跟贴