来源:市场资讯
(来源:华为计算)
上一期介绍了Code Agent长序列RL训练,本次继续解读AReaL-Ascend v1.0.5的两大创新:训推共卡部署形态与Multi-Teacher On-Policy Distillation。这两项能力分别解决了资源效率与能力融合两大核心痛点。
AReaL-Ascend v1.0.5新增了训练与推理共卡(Colocated Training & Rollout)能力。
相比训推分离需要分别为Trainer和Rollout Engine准备独立NPU资源,共卡模式让Training和vLLM Rollout复用同一组NPU,通过训练/推理阶段交替使用设备,大幅降低RL实验的资源门槛。
这一模式尤其适合:
NPU资源紧缺:无需额外准备独立Rollout Pool;
On-Policy训练:训练完成后使用最新policy直接进入下一轮 rollout,减少policy staleness;
快速调试与稳定复现:资源拓扑更简单,更适合作为RL correctness / convergence baseline。
因此,AReaL-Ascend现在可以同时支持两种部署方式:
训推分离:面向大规模异步吞吐;
训推共卡:面向资源效率、严格On-Policy和快速复现。
共卡实现:Ray调度+AWEX IPC Zero-Copy
共卡模式的核心流程可以概括为:
Ray NPU Bind↓Training↓Weight Offload↓Stride Fork↓Launch vLLM on the Same NPUs↓Rollout↓AWEX Weight Update
其中包含如下几个关键优化:
NPU Bind:Ray纳管NPU后,每个Training Worker固定绑定一张 NPU,为后续推理复用建立稳定的设备映射。
Stride Fork:根据vLLM推理实例的TP/并行规模,将一组Training Worke重新组织成一个推理实例,并复用原有Ray placement。
IPC Zero-Copy:推理进程通过IPC handle直接映射训练进程中的 NPU权重显存,避免 NPU → CPU → NPU 的额外数据搬运。
Group Tensor Packing:在IPC序列化前按照shape / dtype合并 Tensor,大幅减少大模型场景下的IPC handle数量和系统资源消耗。
Recursive Partition:基于AWEX transfer plan对训练权重进行重分片,仅向目标inference rank发送其所需权重,支持训练与推理并行策略不一致的场景。
训推共卡的核心价值在于“零拷贝”——通过AWEX IPC技术,推理进程可以直接映射训练进程的显存权重,避免了传统方案中“显存→CPU→显存”的冗余数据搬运。对于27B级别的大模型,这意味着节省了数十GB的数据传输开销和数秒的等待时间。
Qwen3.6-27B单节点共卡样例
v1.0.5已提供Qwen3.6-27B + Geometry3K + GRPO + AWEX Colocate 的可运行样例:
https://github.com/HwVanICI/AReaL/blob/ascend-v1.0.5/examples/vlm_npu/qwen3_6_27b_geometry3k_grpo_awex_colocate.yaml
样例配置:
运行命令:
python examples/vlm/geometry3k_grpo.py \--config examples/vlm_npu/qwen3_6_27b_geometry3k_grpo_awex_colocate.yaml
Multi-Teacher On-Policy Distillation:让多个领域专家能力汇聚到一个模型
除了Agentic RL,On-Policy Distillation正在成为大模型后训练中非常重要的一条技术路线。
传统RL可以将一个模型针对特定领域持续强化,但真正构建通用模型时,一个困难的问题是:
如何把多个已经训练好的领域专家能力,高效、稳定地整合到一个 Student Model中?
Multi-Teacher On-Policy Distillation(MOPD)正是针对这一问题提出的后训练范式。
为什么需要MOPD?
想象一下:你有一个擅长数学的模型A、一个精通代码的模型B、一个长于搜索的模型C——如何把它们的能力融合到一个通用模型中?传统方案是离线蒸馏,但存在“训练-测试分布不匹配”的问题。MOPD让Student模型自己生成内容,再由各领域Teacher实时评价,确保蒸馏信号始终对齐Student的真实行为。
MOPD的核心思路是:
针对不同domain,分别训练独立的expert / teacher;
不直接使用teacher离线生成的数据训练student;
由student自己进行on-policy rollout;
对student真正生成的token,由对应domain teacher进行token-level scoring;
将teacher-student log-probability gap转换成稠密优化信号;
最终将RL objective与distillation objective联合优化。
这相比传统off-policy distillation的一个重要优势是:MOPD通过on policy的方式,让teacher只在student当前策略真实采样出来的样本上打分,从而减少train-test distribution mismatch(训练分布和测试分布不匹配)/ teacher-student distribution mismatch(教师模型见过 / 生成的数据分布,和学生模型实际产出的数据分布不一致)。
一句话大白话总结:
传统离线蒸馏:老师提前出好卷子,学生刷卷子学习,只有参考答案那条路径有评分;学生一旦写的和参考答案中间步骤不一样,就没有参考答案可以参考。
MOPD:学生现场做题, 学生写任何一步,不管是不是标准答案,老师现场针对你写出来的这一步给分。
MOPD论文进一步报告了其在多领域能力集成上的效果,并已经用于MiMo-V2-Flash的工业级后训练实践,这也使得Multi-Teacher + On-Policy Distillation成为近期非常值得关注的post-training方向。
AReaL-Ascend中的MOPD
AReaL-Ascend v1.0.5已提供完整的MOPD示例:
文档:https://github.com/HwVanICI/AReaL/blob/ascend-v1.0.5/examples/distillation/mopd/README.md
当前example使用两个不同领域:
AIME:数学推理领域;
LeetCode:代码生成领域。
并已在如下环境完成验证:
2 台 Atlas 800T A3 Nodes (16卡)
Domain-aware Teacher Routing(领域感知教师路由)
AReaL支持按照dataset domain将不同trajectory路由到不同的 teacher:
例如:
AIME trajectory -> AIME TeacherLeetCode trajectory -> LeetCode Teacher
这种设计可以让每个专家教师专注于自己擅长的领域,提升蒸馏信号的针对性 。
除了domain routing,AReaL还支持mixture routing:多个teacher可以同时对同一trajectory进行scoring,再对它们的token log-probability进行加权组合。Mixture Routing提供了一种更灵活、更强大的知识蒸馏范式。 通过智能地融合多个专家教师的知识,来训练出一个能力更全面、更强大的学生模型,解决单一教师模型无法应对的复杂问题 。
RL + Distillation联合优化
MOPD并不是简单imitation。
Student首先自己rollout,Teacher再对Student已经生成的token进行评价。
简化理解,可以把每个token的teacher signal看成:
Teacher 更认可这个 token↓提高该 token 的学习优势Teacher 相比 Student 更不认可这个 token↓降低该 token 的学习优势
这种token级别的精细化反馈,为模型提供了比传统RL中“整体回答打分”更丰富、更及时的优化指引,相当于每一步都有教师给予实时指导。
在AReaL中,最终actor objective可以同时包含:
RL Loss + MOPD Distillation Loss因此可以同时利用:
Reward signal:告诉模型最终任务是否完成;
Teacher token-level signal:告诉模型生成过程中哪些token更接近领域专家策略。
相比只有terminal reward的RL,这提供了更加稠密的optimization signal。两种信号配合使用,既能确保模型最终目标不偏离,又能显著缓解纯RL训练稀疏、不稳定的问题,提升整体训练效率与收敛质量。
这类能力对于未来的模型后训练非常有价值:不同团队可以独立训练Math、Code、Search、Agent等领域Expert,再通过Multi-Teacher On-Policy Distillation将它们的能力逐步集成到一个通用Student中。这为"专家能力融合"提供了一条可规模化、可工程化的技术路径。
下期预告:下一期将介绍LoRA RL能力,并梳理LoRA RL的快速上手路径,帮助开发者低成本开启AReaL RL后训练之旅!
热门跟贴