编辑:前沿在线 编辑部
这段时间看大模型行业,多少有点审美疲劳。
翻来覆去都是差不多的剧本:参数涨一点,榜单分数涨几分,然后宣布降价,打一波性价比。
热闹是热闹,但是没什么真正的新东西。
直到小米 MiMo V2.6 这版更新出来,味道有点不一样。
开源榜首的成绩,和反常识的性价比
先说说最直观的榜单。
AA 综合智能指数里,V2.6 Pro 拿了 46 分,开源模型里排第一,追平了马斯克刚发的 Grok 4.7。
当然,和 GPT-6 Astra、Claude Fable 5.1 这些最顶级的闭源模型比,差距还很明显。官方自己也没回避这点,挺实在。
真正有点意思的是成本。
同样的任务,Grok 4.7 要花 3.74 美元,MiMo 只要 0.13 美元,差了快 30 倍。
横向比海外那些旗舰,同等智能水平下,成本大概只有对方的二十分到六十分之一。
0.13 美元是什么概念?
就在半年前,能跑到这个分数段的模型,单任务成本至少在 1 美元以上。
等于用不到一年时间,把同级别智能的成本打下来一个数量级。
这才是真正的效率红利。
更反行业常识的是,这次升级没加钱。
性能往上走了一档,API 定价和 V2.5 保持一致。等于同样的预算,能买到的智能直接升级.
这次一共出了两款原生模型,再加一个 Pro 专属的极速模式,
定位分得很清楚:
Pro 主打旗舰能力,复杂推理、科研、多模态这些重活都交给他;
Flash 走效率路线,性能比上代旗舰 V2.5 Pro 还强,适合企业大批量高频调用;
UltraSpeed 是 Pro 的提速档,不降精度,最高能到 20 倍速,对实时性要求高的场景用。
这里有个很见功底的地方。
很多模型的极速版本质上都是降质换速度,靠量化、剪枝挤出来的性能。
敢说不降精度还能翻倍提速,完全是靠前两代磨出来的架构底子撑着,这不是随便哪个模型都能抄的。
一套组合拳打下来,基本覆盖了从个人开发到企业级部署的大部分场景。
不只是跑分:落地能力到底怎么样
榜单分数看看就好,行业里见得多了,跑分厉害落地拉胯的模型有的是。
从目前放出来的案例看,V2.6 这次落地的完成度,比很多同分级的模型要扎实。
最明显的变化是多模态不再是看图说话的水平了。
官方提了个说法叫从 Vibe Coding 走向 Vibe World,说白了就是从生成单段代码、单张图,变成能搭完整的交互式场景。
比如 3D 开放世界,不是简单堆几个建筑,而是场景结构、交互逻辑、渲染效果整套做下来,能直接跑。
Blender 建模也是,结构和细节都在线,不是那种一眼 AI 感的拼接货。
更进一步的是具身智能和计算机操作这块。
能看懂 GUI 界面,能操控软件,能通过视觉反馈控制机械臂做精细动作。这几项能力很多模型都在做,但真能跑通完整流程的不多。
设计和内容创作这块,Design Arena 的评分追上了 Opus 5 和 GPT-5.6 Sol,做出来的 PPT、前端页面审美在线,逻辑也顺,不是那种排版工整但内容没魂的模板产物。
案例:https://mimo.xiaomi.com/mimo-v2-6/assets/frontend/site-01/
案例:https://mimo.xiaomi.com/mimo-v2-6/assets/frontend/site-07/
最有分量的还是科研场景的测试。官方定位很克制,叫 Co-Scientist,合作研究者,不是说替代科学家。
比如做 MOF 材料吸附 PFAS,模型能自己查文献、提假设、跑模拟筛选,把原来个把月的工作量压到了几天。
当然这里要说明白,现在还只是计算机模拟的干实验结果,最终能不能用,还得实验室做湿实验验证。
还有一个数学证明的案例挺有意思。
没专门做过数学训练的模型,在研究人员引导下,把经典的周期三蕴含混沌定理用 Lean4 完整形式化了,六千多行代码全校验通过。
这体现的不是数学能力有多强,而是长链条逻辑推理的泛化能力够好。
几项智能体基准也能佐证:Toolathlon、OSWorld 这些测试,分数都追近了顶级闭源模型,网络安全测试表现尤其突出。
真正的核心:把大规模 RL 跑通了
很多人好奇,基座没动,参数没加,怎么能力突然涨这么多?
答案就是大规模强化学习,也就是 RL。
官方开篇写了句话,我挺认同的:平坦的路上人多,崎岖的远路少有人走到头。
放在大模型行业里,堆参数、堆数据、打价格战,就是那条平坦的大路;死磕强化学习,就是那条难走的路。
行业里每家发布会都提 RL,但大多是单任务小范围微调,撑死几千条轨迹。敢上几十万条轨迹、多任务混在一起训的,一只手数得过来。
不是大家不想做,是一上规模就容易崩。
要么训成偏科的应试模型,换个场景就拉胯;要么奖励信号乱掉,训练直接走偏。敢把这件事工程化跑通的,才是真本事。
先说算力规模。
单步 1568 个样本,支持 1M 上下文,单步 Token 量 35 到 37亿。而且用的全异步架构,不用等所有任务都做完再更新,哪条跑完了就学哪条,算力利用率高很多。
全异步架构说起来简单,真正做起来非常考验工程能力。
轨迹调度、奖励对齐、模型更新时序,差一点都会把模型训崩。
传统同步训练虽然慢,但稳;异步效率高,但极其容易失控。国内之前能把大规模异步 RL 跑稳、跑出明确收益的,没几家。
然后是训练设计。
不是单一场景死磕,而是代码、通用智能体、视觉、网络安全混在一起训。
这里面调度很重要,不同任务耗时差几十倍,数据量差上百倍,弄不好就会某一类任务把其他的淹没了。他们做了动态调度来调比例,保证每个方向都能练到。
最关键的其实是评分环节。
传统 RL 就是简单的对错打分,很容易把模型训成应试机器,专找漏洞刷分,真干活不行。
小米这次在评分上也投了很多算力,做了个智能评分器,组内横向对比,从方案合理性、改动精度、有没有副作用好几个维度细打分。
相当于不是老师改作业打对错,是评委组给参赛作品排名次,还得写评语。这样训出来的模型,不是只会凑答案,而是会找更优的解法。
为了稳住训练,他们还冻结了 MoE 的路由,防止专家漂移;又做了多层防御来对付 Reward Hacking,避免模型钻空子刷分。
这次最有行业价值的其实是开源。
不只是开源了模型权重,连整套训练工具链都放出来了:七千多个任务环境、完整的训练框架、可组合的轻量组件,还有个 9B 的蒸馏模型。
很多人以为开源就是免费放个模型给大家用,其实这次最值钱的,是整套 RL 训练工具链。
等于把自己磨了半年的炼丹配方公开了,小团队不用从零开始摸黑试错。
对整个开源 RL 生态来说,这套基础设施的价值,远大于一个登顶的模型。
不是突然爆发,是三代技术攒出来的
外面很多人说小米大模型突然就冲上来了,其实不是。
这不是一次爆发,是三代版本攒下来的技术复利。
从 V2 开始,他们就没跟着行业堆参数,一直在抠 MoE 架构的效率,抠推理速度,抠 Token 消耗。
别人比谁更大,他们比谁更高效。
到 V2.5 的时候,这套高效架构已经得到市场验证了,登顶过 OpenRouter 的调用量榜单,单周跑了十万亿 Token。
那不是刷榜刷出来的,是全球开发者真金白银用出来的。
到了 V2.6,相当于在前两代的高效基座上,把大规模强化学习的能力叠加上去。
基座够稳,推理够快,才能撑得起这么大量的 RL 训练,成本才能控得住。
没有前面两年磨效率打底,就没有这次 RL 的爆发。
搅局行业之后,冷静看边界
说回对行业的影响。
这两年大模型卷价格卷得厉害,你降我也降,利润越压越薄,真正的技术突破反而不多。
小米这一下相当于换了个玩法。我不降价,我同价提质。你跟我拼价格,我跟你拼技术效率。等于把竞争的维度,从价格拉回了技术本身。
长远看,这其实是好事。总卷低价,行业最后只会越做越 low。有人愿意往技术深水区投钱,把价值做上去,对整个赛道都是正向的。
但客观来看,这一轮突破的边界其实很清晰。
这个第一,是开源赛道里的第一,用的也是 AA 垂直评测的口径。
放到全行业所有模型里去比,和最顶级的闭源产品还有代差,这点没什么可回避的。
更准确说,这轮突破的核心是大规模强化学习的工程化落地,把此前停留在论文和小范围实验里的技术,真正跑通了可复现、可规模化的完整流程。
RL 这条路径的上限在哪里,目前整个行业还在持续探索,但至少这一步验证了,它的增长潜力比此前普遍预期的要大得多。
大规模训出来的能力,长期稳不稳、极端场景下鲁棒性如何,都还得靠时间和更多实际场景去验证。
至于那些科研和创意场景的案例,也都有各自的前提。不是说模型拿过来就能替代专业人员,更多还是辅助提效的角色。
现在就说 RL 能彻底替代预训练,显然还太早。这一次更像是验证了一个方向:后训练的红利空间,比行业之前预想的要大得多。靠工程化的大规模 RL,不动基座也能拉出一截可观的能力涨幅。
接下来真正值得看的,是这条路能不能继续往上叠,能不能叠到顶级闭源模型的水平。
真能跑通的话,整个大模型的成本结构、竞争逻辑,都会被改写。
现在下结论还早,但至少,这条路有人扎扎实实跑通了第一步。
前沿人物
点「在看」,给前前加鸡腿
热门跟贴