打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

编辑:前沿在线 编辑部

这段时间看大模型行业,多少有点审美疲劳。

翻来覆去都是差不多的剧本:参数涨一点,榜单分数涨几分,然后宣布降价,打一波性价比。

热闹是热闹,但是没什么真正的新东西。

直到小米 MiMo V2.6 这版更新出来,味道有点不一样。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

开源榜首的成绩,和反常识的性价比

先说说最直观的榜单。

AA 综合智能指数里,V2.6 Pro 拿了 46 分,开源模型里排第一,追平了马斯克刚发的 Grok 4.7。

打开网易新闻 查看精彩图片

当然,和 GPT-6 Astra、Claude Fable 5.1 这些最顶级的闭源模型比,差距还很明显。官方自己也没回避这点,挺实在。

真正有点意思的是成本。

同样的任务,Grok 4.7 要花 3.74 美元,MiMo 只要 0.13 美元,差了快 30 倍。

横向比海外那些旗舰,同等智能水平下,成本大概只有对方的二十分到六十分之一。

打开网易新闻 查看精彩图片

0.13 美元是什么概念?

就在半年前,能跑到这个分数段的模型,单任务成本至少在 1 美元以上。

等于用不到一年时间,把同级别智能的成本打下来一个数量级。

这才是真正的效率红利。

更反行业常识的是,这次升级没加钱。

性能往上走了一档,API 定价和 V2.5 保持一致。等于同样的预算,能买到的智能直接升级.

这次一共出了两款原生模型,再加一个 Pro 专属的极速模式,

打开网易新闻 查看精彩图片

定位分得很清楚:

  • Pro 主打旗舰能力,复杂推理、科研、多模态这些重活都交给他;

  • Flash 走效率路线,性能比上代旗舰 V2.5 Pro 还强,适合企业大批量高频调用;

  • UltraSpeed 是 Pro 的提速档,不降精度,最高能到 20 倍速,对实时性要求高的场景用。

这里有个很见功底的地方。

很多模型的极速版本质上都是降质换速度,靠量化、剪枝挤出来的性能。

敢说不降精度还能翻倍提速,完全是靠前两代磨出来的架构底子撑着,这不是随便哪个模型都能抄的。

一套组合拳打下来,基本覆盖了从个人开发到企业级部署的大部分场景。

打开网易新闻 查看精彩图片

不只是跑分:落地能力到底怎么样

榜单分数看看就好,行业里见得多了,跑分厉害落地拉胯的模型有的是。

从目前放出来的案例看,V2.6 这次落地的完成度,比很多同分级的模型要扎实。

打开网易新闻 查看精彩图片

最明显的变化是多模态不再是看图说话的水平了。

官方提了个说法叫从 Vibe Coding 走向 Vibe World,说白了就是从生成单段代码、单张图,变成能搭完整的交互式场景。

比如 3D 开放世界,不是简单堆几个建筑,而是场景结构、交互逻辑、渲染效果整套做下来,能直接跑。

Blender 建模也是,结构和细节都在线,不是那种一眼 AI 感的拼接货。

更进一步的是具身智能和计算机操作这块。

能看懂 GUI 界面,能操控软件,能通过视觉反馈控制机械臂做精细动作。这几项能力很多模型都在做,但真能跑通完整流程的不多。

设计和内容创作这块,Design Arena 的评分追上了 Opus 5 和 GPT-5.6 Sol,做出来的 PPT、前端页面审美在线,逻辑也顺,不是那种排版工整但内容没魂的模板产物。

打开网易新闻 查看精彩图片

案例:https://mimo.xiaomi.com/mimo-v2-6/assets/frontend/site-01/

打开网易新闻 查看精彩图片

案例:https://mimo.xiaomi.com/mimo-v2-6/assets/frontend/site-07/

最有分量的还是科研场景的测试。官方定位很克制,叫 Co-Scientist,合作研究者,不是说替代科学家。

比如做 MOF 材料吸附 PFAS,模型能自己查文献、提假设、跑模拟筛选,把原来个把月的工作量压到了几天。

当然这里要说明白,现在还只是计算机模拟的干实验结果,最终能不能用,还得实验室做湿实验验证。

还有一个数学证明的案例挺有意思。

打开网易新闻 查看精彩图片

没专门做过数学训练的模型,在研究人员引导下,把经典的周期三蕴含混沌定理用 Lean4 完整形式化了,六千多行代码全校验通过。

这体现的不是数学能力有多强,而是长链条逻辑推理的泛化能力够好。

几项智能体基准也能佐证:Toolathlon、OSWorld 这些测试,分数都追近了顶级闭源模型,网络安全测试表现尤其突出。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

真正的核心:把大规模 RL 跑通了

很多人好奇,基座没动,参数没加,怎么能力突然涨这么多?

答案就是大规模强化学习,也就是 RL。

打开网易新闻 查看精彩图片

官方开篇写了句话,我挺认同的:平坦的路上人多,崎岖的远路少有人走到头。

放在大模型行业里,堆参数、堆数据、打价格战,就是那条平坦的大路;死磕强化学习,就是那条难走的路。

行业里每家发布会都提 RL,但大多是单任务小范围微调,撑死几千条轨迹。敢上几十万条轨迹、多任务混在一起训的,一只手数得过来。

不是大家不想做,是一上规模就容易崩。

要么训成偏科的应试模型,换个场景就拉胯;要么奖励信号乱掉,训练直接走偏。敢把这件事工程化跑通的,才是真本事。

先说算力规模。

单步 1568 个样本,支持 1M 上下文,单步 Token 量 35 到 37亿。而且用的全异步架构,不用等所有任务都做完再更新,哪条跑完了就学哪条,算力利用率高很多。

全异步架构说起来简单,真正做起来非常考验工程能力。

轨迹调度、奖励对齐、模型更新时序,差一点都会把模型训崩。

传统同步训练虽然慢,但稳;异步效率高,但极其容易失控。国内之前能把大规模异步 RL 跑稳、跑出明确收益的,没几家。

然后是训练设计。

不是单一场景死磕,而是代码、通用智能体、视觉、网络安全混在一起训。

这里面调度很重要,不同任务耗时差几十倍,数据量差上百倍,弄不好就会某一类任务把其他的淹没了。他们做了动态调度来调比例,保证每个方向都能练到。

最关键的其实是评分环节。

传统 RL 就是简单的对错打分,很容易把模型训成应试机器,专找漏洞刷分,真干活不行。

小米这次在评分上也投了很多算力,做了个智能评分器,组内横向对比,从方案合理性、改动精度、有没有副作用好几个维度细打分。

相当于不是老师改作业打对错,是评委组给参赛作品排名次,还得写评语。这样训出来的模型,不是只会凑答案,而是会找更优的解法。

为了稳住训练,他们还冻结了 MoE 的路由,防止专家漂移;又做了多层防御来对付 Reward Hacking,避免模型钻空子刷分。

这次最有行业价值的其实是开源。

不只是开源了模型权重,连整套训练工具链都放出来了:七千多个任务环境、完整的训练框架、可组合的轻量组件,还有个 9B 的蒸馏模型。

很多人以为开源就是免费放个模型给大家用,其实这次最值钱的,是整套 RL 训练工具链。

等于把自己磨了半年的炼丹配方公开了,小团队不用从零开始摸黑试错。

对整个开源 RL 生态来说,这套基础设施的价值,远大于一个登顶的模型。

打开网易新闻 查看精彩图片

不是突然爆发,是三代技术攒出来的

外面很多人说小米大模型突然就冲上来了,其实不是。

这不是一次爆发,是三代版本攒下来的技术复利。

从 V2 开始,他们就没跟着行业堆参数,一直在抠 MoE 架构的效率,抠推理速度,抠 Token 消耗。

别人比谁更大,他们比谁更高效。

到 V2.5 的时候,这套高效架构已经得到市场验证了,登顶过 OpenRouter 的调用量榜单,单周跑了十万亿 Token。

那不是刷榜刷出来的,是全球开发者真金白银用出来的。

到了 V2.6,相当于在前两代的高效基座上,把大规模强化学习的能力叠加上去。

基座够稳,推理够快,才能撑得起这么大量的 RL 训练,成本才能控得住。

没有前面两年磨效率打底,就没有这次 RL 的爆发。

打开网易新闻 查看精彩图片

搅局行业之后,冷静看边界

说回对行业的影响。

这两年大模型卷价格卷得厉害,你降我也降,利润越压越薄,真正的技术突破反而不多。

小米这一下相当于换了个玩法。我不降价,我同价提质。你跟我拼价格,我跟你拼技术效率。等于把竞争的维度,从价格拉回了技术本身。

长远看,这其实是好事。总卷低价,行业最后只会越做越 low。有人愿意往技术深水区投钱,把价值做上去,对整个赛道都是正向的。

但客观来看,这一轮突破的边界其实很清晰。

这个第一,是开源赛道里的第一,用的也是 AA 垂直评测的口径。

放到全行业所有模型里去比,和最顶级的闭源产品还有代差,这点没什么可回避的。

更准确说,这轮突破的核心是大规模强化学习的工程化落地,把此前停留在论文和小范围实验里的技术,真正跑通了可复现、可规模化的完整流程。

RL 这条路径的上限在哪里,目前整个行业还在持续探索,但至少这一步验证了,它的增长潜力比此前普遍预期的要大得多。

大规模训出来的能力,长期稳不稳、极端场景下鲁棒性如何,都还得靠时间和更多实际场景去验证。

至于那些科研和创意场景的案例,也都有各自的前提。不是说模型拿过来就能替代专业人员,更多还是辅助提效的角色。

现在就说 RL 能彻底替代预训练,显然还太早。这一次更像是验证了一个方向:后训练的红利空间,比行业之前预想的要大得多。靠工程化的大规模 RL,不动基座也能拉出一截可观的能力涨幅。

接下来真正值得看的,是这条路能不能继续往上叠,能不能叠到顶级闭源模型的水平。

真能跑通的话,整个大模型的成本结构、竞争逻辑,都会被改写。

现在下结论还早,但至少,这条路有人扎扎实实跑通了第一步。

打开网易新闻 查看精彩图片
前沿动态前沿大会
打开网易新闻 查看精彩图片
前沿动态前沿大会

前沿人物

点「在看」,给前前加鸡腿