来源:市场资讯
(来源:网易智能)
9月4日消息,近日,星尘智能基座模型团队发布能异步执行的在线强化学习框架SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。该框架针对的是大模型异步推理成为真实部署常态后,online RL 应从哪些动作里学习的问题。技术报告已在星尘智能官网发布。
SmoothRL要解决的问题,由异步推理与online RL 的节奏错配引发。VLA、World-Action Model等机器人基础模型普遍采用action chunk,即一次生成未来一段时间的动作序列。但模型越大推理越慢,机器人不能每几百毫秒就停下来等下一段推理,尤其在投掷这类高动态任务中,一次停顿就可能让已积累的速度归零。因此真实部署多采用异步推理:机器人继续执行手头的动作,模型同时计算下一段。
图注:SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。
这种部署方式让"模型计划过"和"机器人真正做过"的动作不再完全对应。SmoothRL把一段action chunk按执行状态切成三个区域:已提交区域(committed region,已被上一轮推理锁定不可改)、执行区域(execution region,机器人当前轮实际执行的动作)、丢弃区域(discarded region,会被下一轮推理替换)。SmoothRL的核心是只对执行区域计算梯度——机器人真正做了什么,就只对什么做强化学习。
SmoothRL团队的另一项原则是"Reinforce in Deployment(在部署强化学习)",也就是在训练阶段就使用异步推理,replay buffer记录的是真实时间关系下的轨迹,而不是先在同步环境里训练好再切换到异步部署。
据论文披露的实现细节,团队采用针对各任务微调后的π0.5作为基础策略,沿用RLT骨架,用轻量TD3-style actor-critic在原始动作空间预测residual correction。星尘S1机器人以30Hz执行动作,推理请求频率为5Hz,即每200ms得到一个新的action chunk;基础策略每次预测32帧动作,在固定延迟预算下,Committed与Execution共占12帧,其中6帧属于本轮真正执行的Execution Region。
在绳驱本体星尘智能S1的真机任务上,三项任务的基线成功率均明显提升。动态投掷成功率从39%升至94%(250个rollout episodes),考验的是机器人在摆动中持续加速并在准确时刻释放的能力;给笔戴帽从8%升至83%,双臂需将相对位姿误差控制在约5mm以内;快递开箱从30%升至90%,机器人需将1mm宽刀片插入2—3mm宽的箱盖接缝。三项任务存在系统性偏差(投掷释放速度不准、开箱刀片左偏、戴帽动作过于相似),在线RL的功能是按真实执行结果将这些偏差修回。(袁宁)
热门跟贴