9月7日消息,据大厂日爆报道,前字节跳动强化学习专家、前腾讯 Robotics X 智能体中心负责人孙鹏博士正式加盟星尘智能,负责让 AI 自己学会变聪明方向的技术研发。据内部消息,孙鹏此次不是单独加入,后续还会继续扩充团队。

同一天,星尘智能公开了 SmoothRL 异步强化学习技术报告,探索在真实机器人部署环境中做异步在线学习,让机器人一边执行、一边学习。该技术的核心思路是只学习真正被执行了的动作,而非传统做法中把所有生成动作都拿来学习,技术层面需要精确建模执行的时间线,区分实际执行与计划但未执行的动作。在真实机器人任务上,三项任务的成功率分别从 39% 提升至 94%、8% 提升至 83%、30% 提升至 90%。

星尘智能自成立起采用 Design for AI 路线,将机器人的身体、数据和 AI 模型一起设计。目前已形成完整闭环:基座模型让机器人理解任务,前端 Agent 管理长期记忆和任务规划,真实部署后再持续学习优化,链路覆盖部署、执行、反馈、优化、新策略、再部署。