打开网易新闻 查看精彩图片

云蝶双 ICML 成果,夯实具身智能环境与协作推理。

编辑丨李希

在近日举行的WRC世界机器人大会上,越来越多展台开始演示无需现场接管的连续作业,以及机器人与传送带、工作台、其他机器人之间的协同。相比单次动作是否完成,现场更关注机器人能否在较少人工干预下连续工作。

环境决定智能体能学会什么,真实任务决定这些能力值多少钱。机器人进入工厂或公共空间,要在遮挡、人员走动和物料变化中找对目标,也要估计共同参与任务的人和机器接下来会做什么。云蝶科技在本届WRC发布了RoboForge系统级具身大脑和WING任务型本体。其科研团队赵梦辰指导的研究成果POLIA与Strat-Reasoner同期发表于ICML 2026,研究对象分别是视觉证据和他者意图。两篇论文并非RoboForge的产品说明书,却提供了理解这套具身大脑技术取向的两个切口。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

01

机器人上岗,先要看对现场

一台WING Air执行巡检任务时,视野里可能同时出现仪表、管线、障碍物和工作人员。RoboForge后面怎样规划,取决于模型有没有先找对与任务相关的对象。

多模态大模型会出现一种隐蔽的错误:看错图,却凭语言经验猜中了答案。回答“猫的右边是什么”时,常见的强化学习方法只检查答案是否正确。模型即使认错了猫,只要碰巧答对,仍可能得到奖励。

打开网易新闻 查看精彩图片

POLIA把反馈往前推了一步。它保留GRPO对候选答案的群组比较,同时识别推理中引用的视觉对象,按照候选框与真实对象的匹配置信度计算对象级内在优势。老师不只看学生选了A还是B,还要看他在图上圈出了什么。

这套方法仍依赖对象框监督,训练时也要求模型按指定格式生成坐标,并非无需标注的通用视觉方案。它解决的是一个更具体的问题:当训练数据只有最终答案时,怎样把功劳或错误更准确地分给推理中使用的视觉证据。

打开网易新闻 查看精彩图片

论文使用Qwen2.5-VL-7B-Instruct作为基础模型,在七项多模态推理基准上评测。与相同基础模型训练的GRPO相比,POLIA在VSR、TallyQA、GQA和MathVista上的得分分别提高22.3、8.7、11.3和9.3个百分点。这里的“准确率”由GPT-4o根据答案语义与参考答案的一致程度评分,并非简单的字符串命中。

打开网易新闻 查看精彩图片

在更依赖视觉定位的VSR、TallyQA和GQA上,POLIA-7B的表格得分高于论文列出的GPT-4o与Gemini 2.5 Pro对照结果。模型规模、训练数据和评测条件并不相同,因此不能把它写成“小模型全面超过闭源大模型”。更有说明力的是消融和训练曲线:去掉对象级内在优势后,视觉证据选择更分散;随着训练推进,候选答案引用的对象逐渐趋于一致,答案得分也随之提高。新增的内在优势计算在3B模型单次训练迭代中耗时0.002秒,主要开销仍在模型生成阶段。

放到具身系统里,这不是一道图像问答题的输赢。服务对象、目标物品或空间关系认错了,后面的任务链越长,错误越难收回来。POLIA没有直接证明机器人现场能力,但它把云蝶关注的一类基础问题写得很清楚:模型给出答案之前,先要知道自己的判断建立在哪些环境证据上。

02

共事,比做事更难

Strat-Reasoner的实验没有机器人,也没有开放世界。研究团队选择井字棋、Kuhn Poker和MiniHanabi,把两个智能体放进规则明确的对抗或协作游戏。这个选择反而便于隔离问题:对手也在观察和调整策略,只看整局输赢,很难判断模型究竟读懂了对方,还是一次冒险恰好得手。

打开网易新闻 查看精彩图片

行动之前,Strat-Reasoner要求智能体写出四类信息:对方上一轮的意图、对方如何预测自己、自己的当前意图,以及对方下一步可能采取的行动。训练阶段再把这些预测与另一名智能体实际写下的意图和后续动作逐项比较,形成回合级推理分数。这个分数经过组内归一化后,与整段博弈的回报共同用于策略更新。

这比“让模型多想几步”更具体。研究团队把原本藏在长推理链里的判断拆成可比较的字段,再利用双方真实产生的推理和行动提供中间反馈。论文消融显示,去掉这部分CoT训练信号后,MiniHanabi中的战略表现难以继续提升;直接使用未经归一化的原始分数,训练又会变得不稳定。

Strat-Reasoner以Qwen3-4B为基础模型,每项评估平均运行500局以上。论文报告,三个训练环境中的战略表现平均提升22.1%。在与训练行动顺序一致的Kuhn Poker评测中,它作为先手和后手的归一化得分分别为94.04和90.47,均高于论文表格中的GPT-5-mini与Gemini 2.5 Flash。这个优势只成立于该游戏和对应设置;论文对整体结论的表述是“达到可比水平”,而非全面领先闭源模型。

打开网易新闻 查看精彩图片

模型还被放进三个未参与训练的游戏:Connect Four、LeducHoldem和SimpleHanabi。结果显示它可以迁移部分策略,但在部分项目上仍落后于更强模型。Strat-Reasoner目前只研究双智能体,扩展到更多参与者还需要额外工程工作。

真实岗位当然比游戏乱得多,但“他者会改变”是共同的难点。酒店工作人员临时介入后,机器人是否需要暂停或改路;一台机器人占用电梯后,另一台是否应该调整任务队列。固定动作序列应付不了这些变化,RoboForge还要把人的反馈和其他机器人的状态纳入计划。

以酒店送物为例,系统收到任务后,需要读取库存、门禁和电梯状态,再根据机器人位置、电量、载荷及末端工具选择本体。目标物品缺失时,它还要区分定位错误、库存变化和技能失效,决定等待、改路、重新规划,还是把任务转给另一台机器人。这里既有POLIA所强调的环境证据,也有Strat-Reasoner试图训练的意图判断。

03

从论文能力到真实任务

POLIA和Strat-Reasoner使用了不同的实验环境,却都把训练信号放到了最终结果之前。模型依赖了哪些视觉对象,可以检查;对方的意图和行动是否判断准确,也能在训练中评价。对机器人来说,任务成功只是终点记录。中间一旦看错对象或误判参与者,动作仍可能执行得很流畅,只是方向已经错了。

这也解释了RoboForge为何被云蝶定义为“系统级具身大脑”。基础模型负责理解环境与任务,VLA生成动作,控制器保证动作稳定执行;RoboForge贯穿任务过程,处理任务拆解、上下文组织、模型与技能选择、执行验证、异常诊断和重新规划。它不替代底层模型,而是把分散的能力组织成一段能被检查、能从失败中恢复的工作流程。

打开网易新闻 查看精彩图片

在本届WRC上,云蝶正式发布RoboForge,并披露了EmbodiedBench和LaRA两项公开基准的评测结果。按照云蝶提供的数据,RoboForge加入不同基础模型后,在EmbodiedBench的EB-ALFRED、EB-Habitat、EB-Navigation和EB-Manipulation上均带来提升,综合成绩列首位;LaRA的32k与128k长上下文任务得分也位居其对照设置首位。前一项基准包含1128个测试任务,覆盖高层语义任务、导航和操作;后一项用于比较长上下文与RAG路线,含定位、比较、推理和幻觉检测等任务。

WING是云蝶面向真实岗位的本体产品,也是RoboForge验证软硬件协同的参考本体。云蝶可以据此共同设计接口,围绕岗位优化可靠性、续航、成本和维护效率。与此同时,RoboForge仍要适配第三方机器人。只有换了本体还能复用任务上下文、技能和评价方法,“跨本体”才不是一句架构描述。

据云蝶介绍,公司已与凤悦及苏适酒店、固生堂、久邦善心等客户推进合作,涉及客房送物、清洁、医疗导诊、药房作业和标本取送,相关项目正从签约进入部署和验收。现场会留下公开基准无法提供的数据:机器人能连续运行多久,多少次任务需要人工接管,异常后能否自行恢复,完成一项任务究竟花多少钱。

两篇ICML论文说明特定训练方法在实验环境中有效,公开基准考察RoboForge的系统能力,客户现场再判断这些能力能否稳定兑现。云蝶接下来要回答的问题也因此很具体:RoboForge换任务、换本体后能否复现表现,WING进入岗位后的任务成功率、连续运行时间和人工接管率是多少。大脑与本体是否形成可复制的产品,最终要由这些运行结果来判断。

论文信息:

POLIA: Policy Optimization with Visual-Object-Level Intrinsic Advantage for Multimodal Reasoning

作者:Yiran Zeng、Da Chen、Hangyu Mao、Yuanxing Zhang、Pengfei Wan、Mengchen Zhao

会议:ICML 2026

Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games

作者:Yidong He、Yutao Lai、Pengxu Yang、Jiarui Gan、Jiexin Wang、Yi Cai、Mengchen Zhao

会议:ICML 2026

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。