2026年9月17日凌晨,小米大模型团队负责人罗福莉做了一件国内大模型圈没人干过的事——她把MiMo-V2.6的强化学习训练过程挂到了网上,实时公开。页面显示着每小时的烧钱速度、Token消耗量、任务通过率的起伏。

打开网易新闻 查看精彩图片

罗福莉在社交平台公开MiMo强化学习训练进展

截至当天下午,两个版本累计训练成本已超过135万美元,平均每小时约3.1万美元。

一年前,她还是“雷军千万年薪挖角”传闻里那个面目模糊的“95后天才少女”。一年后,她带的团队把小米大模型从“存在感不强”推到了开源模型榜单的第一排。9月22日,MiMo-V2.6系列正式发布,Pro版本在Artificial Analysis综合智能指数拿到46分,登顶全球开源大模型第一。

打开网易新闻 查看精彩图片

AI指数榜单显示MiMo登顶开源大模型榜首

同一天,小米对内发布晋升名单,31岁的罗福莉晋升至22级——小米职级体系的最高级别。

从入职到触顶,不到十个月。

罗福莉曾在公开访谈里表达过对“天才少女”这个标签的嫌弃。她吐槽说那些写自己的文章“事实错误一堆”,如果自己是不认识罗福莉的人,看完也会默默给“买热搜”的评论点个赞。这种不耐烦,和她这次做的事放在一起看,其实指向同一个东西:她想让产品替自己说话。

六天烧掉347万美元,小米在赌什么

MiMo-V2.6这次强化学习后训练,Pro版本花了约262万美元,Flash版本约85万美元,合计347万美元,累计约75万条训练轨迹。罗福莉自己说,这很可能是迄今为止开源模型团队进行过的最大规模单次RL训练。

打开网易新闻 查看精彩图片

钱花在哪儿了?三个维度同时拉满。

算力上,单次更新使用1568个样本、每条样本尝试16次,单步训练Token达到27亿至37亿,支持百万级上下文长度训练。环境上,构建了覆盖代码、通用、视觉、安全等多方向的混合训练体系。评估上,用组内相对比较的方式为长程任务提供更精准的奖励信号。

结果很直观。长程软件工程评测DeepSWE v1.1中,Pro从58.4分跳到72.57分,Flash从48.8分升到65.68分。

打开网易新闻 查看精彩图片

但花钱不是故事的全部。训练直播期间,外界看到了真实的技术事故:基建错误重跑、不良模式数据集、零梯度任务、GPU显存不足。

这些翻车现场没被藏起来,反而成了这场实验的一部分——小米正在押注一条叫RSI(递归自我改进)的技术路线,让模型自己从任务反馈中变强,而不是靠人类工程师不断修补。

这条路线目前还没有形成行业共识。全球部分AI安全学者公开质疑,递归自我改进尚无成熟的安全验证机制,公开直播中暴露的那些工程短板也说明离“稳定闭环”还有距离。

一个团队负责人,用行为说话

罗福莉带团队的方式,有几处细节能看出她的风格。

今年3月,她在X上说过一句“次日对话少于100次可以辞职”,很容易被理解为狼性管理。但她后来在访谈里解释,这不是硬性考核指标,目的是让大家真正上手用Agent工具。为了推这件事,她提前买好设备、部署好环境,让成员在群里一起尝试。

同一场访谈中,她还说了一段不太像“天才少女”会说的话:项目有实际推动的人,但这个人并不因此拥有对其他成员的绝对控制权。负责人不要有太强的掌控感,觉得“没了我就不行”。

这和她团队的组织方式对得上。MiMo团队足够扁平,不同领域的人每天坐在一起讨论RL瓶颈,少了各管一摊的壁垒,混合训练也就容易推进。

31岁触顶,放在行业里是什么概念

作为参照,阿里千问办公CEO陈宇森今年34岁,近期刚晋升至阿里巴巴集团副总裁(P11序列),已经是行业公认的破格快速晋升案例。陈宇森22岁创立长亭科技、公司卖给阿里后进入体系,从回归到升P11大约走了三年。

打开网易新闻 查看精彩图片

阿里千问办公CEO陈宇森在活动现场发表演讲

罗福莉31岁,从2025年11月公开加入小米算起,一路把MiMo从V2带到V2.6,公开成果周期不到一年。今年7月,小米调整小爱同学组织架构,她负责的MiMo团队承接了全公司AI基础底座能力建设,业务范围从小米大模型扩展到支撑手机、汽车、家电的全生态。

9月,直接上了小米的最高职级。

罗福莉在MiMo-V2.6发布后写了一句很有锐气的话:“在我看来,它背后的研究创新和工程挑战超过了DeepSeek R1,后者我曾部分参与。”

她没说“我们是第一”,说的是“这件事比R1还难,我们做出来了”。这大概就是她想要的,让产品和行动替一切标签说话。