作者丨郑佳美
编辑丨岑 峰
刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。
01
1M 上下文背后
Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。
02
RL 开始像分布式生产系统
1568 个 prompt,每个采样 16 条 rollout,一次更新对应 25088 条 trajectory。困难之处在于,这 25088 条轨迹不会按照统一节奏结束。有的代码任务几轮操作就找到问题,有的会不断运行测试、读取报错再重新修改;网络安全任务可能经历多次环境验证,视觉 Agent 又有不同的执行链路。轨迹长度、工具延迟和环境响应混在一起以后,一个 batch 内部很容易出现明显的长尾。如果继续采用严格同步方式,已经完成任务的计算资源需要等待少数仍在运行的轨迹。规模越大,这种等待造成的资源浪费越明显。MiMo-V2.6 用 fully asynchronous GRPO,把 rollout、环境执行、grader 和模型更新拆开运行。生成侧完成一条轨迹后可以继续领取任务,环境执行与评分各自推进,训练侧消费已经准备好的数据,不再要求一整个 batch 同时跨过每个阶段。这种变化看起来属于工程优化,却直接影响了小米怎样组织 RL 数据。MiMo-V2.6 没有为代码、通用 Agent、视觉和网络安全分别训练一套独立策略,而是把多领域任务以及不同 Agent harness 混入同一次 RL,小米将其称为 You Only RL Once。
03
从 GRS、GAR 到 MOPD2
传统可验证 RL 很依赖 binary reward。代码通过测试得到正向奖励,失败则没有。对于短任务,这种反馈已经足够清晰,但放进几十步甚至更长的 Agent 轨迹以后,大量过程差异会被压成同一个数字。假设同一道任务生成 16 条 rollout,其中 5 条通过测试。一条可能快速定位根因,只修改必要代码。另一条经历大量无效搜索,还有一条虽然通过测试,却引入许多额外修改。只看 pass / fail,这几条成功轨迹很难拉开差距。MiMo-V2.6 因此把 grader 从结果检查器进一步变成组内比较器。GRS,也就是 Groupwise Reward Synthesis,会同时观察同一道任务产生的多条 rollout,从它们之间已经出现的差异中构造 task-specific rubric,再把过程质量与测试结果结合起来。评价标准因此会随着当前 policy 实际暴露出来的问题发生变化。GAR(Groupwise Advantage Redistribution)则进一步影响策略更新。即使几条 trajectory 全部完成任务,grader 仍会继续比较它们,再把更多 advantage 分配给质量较高的方案。官方也明确提到,这套过程会结合环境加固、异常筛查和 verifier cross-check 来处理 reward hacking。这里带来的变化很直接:RL 的计算投入不再只用来制造更多样本,还开始投入到理解样本。
04
Agent RL 正在从算法变成系统工程
MiMo-V2.6 给出的信号,其实已经超出了某一种 RL 算法本身。Agent 进入真实环境以后,训练数据不再只有静态 token,还多出了状态、工具调用、执行结果、错误反馈和连续决策。模型需要亲自走过这些过程,才能产生一条能够用于强化学习的 trajectory。这也让后训练的竞争维度发生了扩展。模型架构要能够承受长时间生成,分布式系统要持续运行大量异步环境,grader 要从成功轨迹中进一步拆出质量差异,教师轨迹还要被复用到难以自动验证的任务里。MiMo-V2.6 依然运行在人设计的任务、环境、评分机制和训练框架内,但它展示出一种很清晰的方向:Agent 能力提升越来越依赖整个训练闭环的吞吐和反馈质量。参数继续扩大当然还有价值,只是到了 Agent 阶段,另一个变量已经越来越难忽略 —— 一套训练系统能够生产多少有价值的行为轨迹,又能从这些轨迹里转化出多少有效的学习信号。MiMo-V2.6 的技术意义,更多就落在这里。参考链接:https://mimo.xiaomi.com/zh/mimo-v2-6
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
热门跟贴