每秒5.71美元。这是小米AI实验室给一次强化学习训练贴上的实时价签。周四下午,这个数字跳过了104.8万美元。
更少见的是,这笔钱花在哪儿、为什么重启、数据里混了什么,全部挂在公网上。页面地址是 mimo.xiaomi.com/rl,两个训练任务的后台日志直接对外直播。
如果你只看过模型发布博客,那正好是发布博客不会写的那部分。
两个还没发布的模型,先被围观了
直播的是两个强化学习后训练任务:MiMo 2.6 Pro,约1万亿参数、420亿激活;MiMo 2.6 Flash,3090亿参数、150亿激活。两个模型都还没发布。
Pro 任务在9月15日10:32 UTC启动,第二天04:00对外公开。到周三晚上,相关帖子在 Hacker News 拿到480分,比大多数模型正式发布时的热度还高。
它不是官方宣布的。周四13:40 UTC,官方账号在 X 上的最新一条还是9月8日一个桌面应用的邀请制测试。Hugging Face 的 Elie Bakouch 是最早转发的人之一。
页面上的说明文字很短:"我们正在直播大型强化学习任务。mimo-v2.6 系列即将到来。"页脚写着:"开放是我们珍视的。"
钱是怎么一秒一秒烧掉的
Pro 任务的计数器在周四下午读到1,048,236美元,以每秒5.71美元的速度跳动。换算下来约每小时2.05万美元,一天接近50万美元。
Flash 任务便宜一些,每秒2.85美元,当时停在47.5万美元,重启过两次。
这些数字来自页面在9月17日13:20到13:45 UTC之间读取的 JSON 接口。它们会变。
钱花在了强化学习后训练的循环里。预训练教模型预测文本,后训练教它完成任务:给一道题,让它试,检查答案,把权重推向做对的那些尝试。
Pro 任务每一步采样1568个提示词,每个生成16次尝试,也就是25088条序列。这些尝试在沙箱里运行并被打分。到周四,它已经用掉近200万个沙箱,训练了302亿 token。
第15步的采样来自5大类24个数据源:代码、通用、网络安全、视觉、对话。1568个提示词里有1061个是代码,约占每批的68%。这是一个正在被做出来的编程智能体模型。
51小时重启7次,原因都贴出来了
Pro 任务在9月15日到17日之间重启了7次。运营方每次都发通知,读起来像内部事故频道:
- 9月16日21:14 UTC:"mimo-v2.6-pro 任务因某个节点的显存问题正在重启。"
- 9月17日03:34 UTC:"我们从第15步重启了 flash 任务。原因:某个数据集上的一类基础设施错误在过去约3小时里没有被正确检测到。"
- 9月17日12:20 UTC:"pro 训练集群和打分服务之间出现网络连接问题。我们已重启任务。同时从接下来的 pro 任务中移除了网络安全数据集,因为我们在 rollout 日志里观察到一些不好的模式。"
这些是大规模训练里的正常故障。一个坏掉的 GPU 节点能拖住整个同步任务。打分器是独立服务,训练端和打分端之间的网络一断,奖励就送不过来。一个数据错误三小时没被发现,意味着三小时的梯度建立在错误奖励上,只能回滚到上一个好的检查点,Flash 就是这么处理的。
网络安全数据集那条最有意思。他们没有说"不好的模式"具体是什么。但道理是通用的:在强化学习里,模型会学奖励所支付的一切,而 rollout 日志正是你抓到它学错东西的地方。多数实验室会悄悄修掉,小米把它贴了出来。
按每秒5.71美元算,每次重启都有看得见的价格。
那条被质疑的基准线
随着检查点被评估,小米手工往一个基准面板里填数:DeepSWE v1.1,用 mini-swe-agent,三次运行取平均。Pro 从第1步的58.41涨到第11步的65.78。Flash 从48.67涨到60.77。
在 Hacker News 上,liuliu 问出了那个显而易见的问题:"你在训练的同时跑基准测试,这不就是污染的定义吗?"jampekka 的说法是:基准变成了验证集,最后就成了"刷榜"。lucrbvi 回复说,检查点评估在大规模强化学习里是标准做法,并不是训练数据。
两边都有道理,区别在于……
热门跟贴