原标题:后训练的胜负手,已从算法转向系统工程
一个Agent好不好用,往往不取决于它第一次答得如何,而取决于它能否在使用中持续变好。要让Agent越用越智能,就离不开Agentic RL——Agent需要在与人和环境的真实交互中不断学习、迭代策略,而这些交互本身,就是最好的训练数据。
这个判断,放在过去一年的大模型技术脉络里看得更清楚:能力竞争的重心正从预训练转向后训练,而一年半以前,支撑后训练的RL框架在领域里几乎是空白——这类基础设施该由谁来做,并没有现成答案。AReaL正是在这片空白里起步的,如今已从高效RL后训练走到在线智能体RL平台,在Agentic RL方向上积累了系统性的实践。
9月18日,华为全联接大会2026期间,创原会正式升级为INSPIRE CLUB,打造更具开放性、更聚焦智能体与AI-Native领域的全球技术交流平台。在主题为"Agent破局:从技术底座到场景落地的协同进化"的INSPIRE CLUB首场技术圆桌会上,AReaL开源社区联合创始人、中国香港科技大学计算机科学与工程系助理教授袁彬航作了题为《基于AReaL的智能体强化学习系统实践与优化》的分享,希望推动后训练从少数团队的工程技巧走向可复用的公共基础设施。
AReaL 1.0:在空白处选择异步
AReaL是一个可扩展的智能体强化学习(RL)基础设施,衔接基础模型训练与现代基于智能体的应用。
袁彬航介绍,要理解它的技术选择,首先要看清RL后训练与预训练的根本差异。在他看来,RL后训练多了一道推理环节——它有一个Rollout generation的过程,相当于大语言模型生成的Token被当成了Action Space,整个大模型的优化因此变成了一个RL问题。这也决定了它的计算是异质的:先由推理引擎完成Rollout生成,再计算奖励,最后才用带奖励信号的数据做训练。
他介绍当时最经典的设计是同步的:集群里所有算力先跑完Rollout、算完奖励,再统一训练。但在袁彬航看来,问题恰恰出在Rollout阶段——轨迹长度分布极不均匀,有的很短、有的很长,集群效率因此被显著拉低,而长轨迹又无法简单丢弃。关于这一点,他指出:“不能简单把很长的轨迹丢掉,因为这些很长的轨迹实际上会给提供更有效的signal的data。”
基于这一判断,AReaL把同步拆成了异步:一部分算力专门做Rollout,另一部分专门做训练;一旦训练端收集到足够数据,就进行一次模型更新,更新完毕再把权重推送给对应的Rollout worker,worker中断当前生成,改用新模型继续生成Token。
这个选择在当时的价值并不显然。他表示:“AReaL应该是最早指出异步的RL训练在后训练当中是非常有效的。”他同时给出一个关键结论:在系统层面做足够优化后,异步带来的数据陈旧度对后训练的影响可以被很好地控制,换来的是训练吞吐的显著提升。这套工作(AReaL 1.0)开源后,一些知名社区也吸收了其中的异步能力。
他还介绍了这条路线上的两项代表性工作:ASearcher用大规模异步强化学习实现超过十轮交互的长程智能体搜索;AReaL-DTA则针对Rollout中的冗余计算,复用共享的Rollout前缀避免重复,用基于深度优先搜索的注意力策略动态遍历前缀树,并在多块GPU之间均衡其工作负载。
AReaL 2.0:把训练接进真实业务
如果AReaL 1.0解决的是“训练得更快”,2.0面对的是另一个现实。袁彬航对此直言:“真正有大规模训练基模能力的用户是很少量的……但更接近实际生产环节、用户也更分散的情况,是基于智能体的训练。”
AReaL 2.0因此转向在线RL:开发者已有的Agent workflow不用重写,只需把标准的OpenAI兼容API接口换成一个轻量组件接到AReaL上;此后人与智能体交互的数据都会被数据代理(data proxy)捕获,自然进入模型更新过程。系统收集到足够数据后会自动拉起Training Service完成更新,模型因此可以在线迭代;这些轨迹还可用于模型蒸馏。
工程上,AReaL 2.0把RL基础设施微服务化:网关、路由器、数据代理与智能体计算工作节点各司其职,Rollout与训练被封装在统一的微服务API之后,把已部署的智能体流量转化为在线RL闭环——应用照常运行,训练在后台持续发生。
AReaL-DTE针对的正是训练与推理之间的权重传输,研究发现这一过程“天然稀疏”——每步策略更新中,推理侧可见的BF16权重变化不足2%。基于此,集群内采用无死锁的两轮P2P传输,跨集群则经共享存储传输稀疏数据块。结果:相比ByteCheckpoint最高提速19.9倍,相比PULSE提速3.2倍,GPU峰值开销降低41%,CPU降低87%。
再往后一步,是让Agent自己参与进来。AReaL-AutoPilot是一个覆盖全生命周期的控制层:输入工作负载规格(模型、算法、数据集、资源范围、优化目标),输出经验证的部署计划(并行策略、放置布局、批处理、Rollout与训练的配比),再完成实例化、持续监控与策略调整。
它继承了两条设计原则。一条是继承自ARGUS的“先验证、后执行”——在分配任何一块GPU前,部署计划先对照内存可行性、并行策略合法性与通信拓扑校验;被拒绝的计划返回的是反例而非崩溃日志。另一条是继承自Autopoiesis的“边运行、边适应”——RL后训练本身是非平稳的,随着策略提升,Rollout长度会漂移,最优系统配置也随之漂移。
这一层要解决的痛点很明确。袁彬航认为,“原本需要专家来熬夜监控的过程,希望由Agent来自动化。”由智能体安排训练负载、记录经验观察、判断轨迹收敛是否正常,当Rollout长度分布变化时,重新动态调度集群,帮助完成最优策略的优化。
开源社区:两条前进方向
当前AReaL开源社区正在快速成长,可以从一组数据看出:AReaL项目在GitHub上已积累5.7K+星标、500+ Fork、100+代码贡献者与1900+社区用户,维护者规模从4人扩展到14人。
生态与治理上,AReaL于2026年5月获准成为PyTorch生态项目,治理采用供应商中立模式,14名维护者来自6家机构——清华大学、蚂蚁集团、华为、字节跳动、小米和腾讯。
袁彬航将社区后续发展方向归纳为两大主线,第一条是贴近硬件:“我们希望贴近硬件厂商,让这套开源社区更贴近真实生产环境。”另一条是贴近用户:把复杂的机器学习工程做智能体化集成,让框架更易用,并推动其以云服务形式对外提供。
目前社区已与华为云持续合作,围绕昇腾平台开展深度适配与能力增强,攻克大规模分布式训练与推理的工程难题。
AReaL v1.0已完成昇腾环境安装适配,打通OpenClaw类智能体的训练接入链路与AWEX权重同步通道。双方也已联合发布AReaL-Ascend v1.0.5版本。AReaL-Ascend v1.0.5围绕Agentic RL与高效后训练场景进行了多项升级,包含Qwen3.6系列模型支持进一步完善,新增训推共卡(Colocated Training & Rollout)部署形态,支持Multi-Teacher On-Policy Distillation(MOPD)以及支持LoRA RL。
下一步,双方会把合作拓展至昇腾950平台的适配工作,共同探索RSI等技术方向迭代,持续推动相关技术能力在各行业落地应用。
后训练的下一程:走向公共基础设施
回到开头那个判断:Agent要越用越智能,靠的不该只是一次训练。袁彬航这场分享给出的,是一条“开源+硬件+用户”三方咬合的路径——它把后训练的竞争从单点算法推向了系统工程:异步调度、在线闭环、稀疏权重传输、自动化控制层,每一项都不是模型自身的能力,却决定了模型能不能被持续训得更好;而一个开放协作的社区生态,则决定了这套系统能走多远。
对产业而言,后训练正在从少数团队的“手工作坊”变成可被更广泛开发者复用的公共基础设施。而当复杂的机器学习工程被封装进易用的框架与云服务,受益的将不再只是头部厂商——这也正是袁彬航所期望的:“这套服务如果能上线在云厂商,我认为从普惠的角度来讲,也会给大家创造一些价值。”
热门跟贴