打开网易新闻 查看精彩图片

公司情报专家《财经涂鸦》获悉,近日,大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布全新人–场景交互重建研究HSImul3R,打破三维视觉长期存在的“感知—仿真鸿沟”,推动三维重建从“视觉正确”走向“物理可执行”。

据悉,该成果已被全球计算机视觉顶级会议 ECCV 2026 正式接收。

在推动机器人能力从“视觉正确”到“物理成立”方面,HSImul3R不仅把重力稳定性、真实接触和交互稳定性纳入重建过程,还同步提出物理闭环(Physics-in-the-Loop)双向优化机制,让仿真反馈直接参与重建。

其中,正向过程优化人体,反向过程修正场景,令物理仿真器由最终的“裁判”,转变为整个重建过程中的主动监督者。

实习物理闭环的第一步,是让恢复出来的人体运动真正适应当前场景。为此,HSImul3R 提出面向场景的强化学习(Scene-targeted Reinforcement Learning),在运动跟踪基础上进一步加入场景交互约束。

这意味着,其优化的不是一条抽象意义上“符合动力学”的人体轨迹,而是一段能够在特定场景中真正成立的物理交互。比如,“坐下”的最终结果是人必须真实坐到这把椅子上,而不是只在空间中复现一个相似动作。

针对结构较细场景中图像生成三维模型容易产生结构缺失或几何畸变的问题, HSImul3R 在反向过程中提出直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),直接利用物理仿真的交互结果作为监督信号,反向优化三维物体生成模型。评价标准也由“物体自己能不能站稳”,进一步提升为“人与它交互之后还能不能稳定”。

这一过程中,团队将仿真反馈划分为从“物体在重力下失稳”到“人与物体实现稳定交互”的四种状态。只有当物体自身稳定、交互后仍保持稳定,并且人与物体之间确实形成有效接触时,重建才被认为真正成立。

为验证这一新的评价体系,团队还进一步构建了面向人–场景交互的HSIBench,直接检验重建结果能否在物理仿真中稳定交互。

该数据集包含19个场景物体、超过50段人体动作序列和300个独立交互实例,由3名参与者完成,每个案例均从16个视角同步采集。

与传统三维重建基准更多关注几何误差不同,HSIBench 将人–场景交互稳定性(Stability-HSI)作为核心指标之一,要求整个交互进入仿真后保持稳定,并保留有意义的人–物接触。

在 Easy、Medium、Hard三档任务中,HSImul3R的交互稳定率分别达到53.68%、30.56%和13.92%,显著高于HSfM 的10.52%、4.50%和2.66%,并将人–场景三维穿模率从69.51%降至22.90%。

此外,为进一步将经过物理优化的人体动作迁移到真实人形机器人上,团队首先将优化后的人体运动重定向至Unitree G1,再以这些动作作为先验,在仿真环境中训练全身控制策略,最终直接部署到真实 G1 上,使机器人能够在现实环境中复现相应的人–场景交互。

团队表示,这条路线仍处于早期阶段,复杂交互、多物体场景和动态环境依然存在大量挑战。但 HSImul3R 已经给出一个重要方向:机器人从人类视频中学习的,不应只是“人看起来怎么动”,更应该是这个动作为什么能够在真实物理世界中成立。

从视觉重建到可仿真重建,从人体动作到人–场景交互,再从真实世界到仿真、最终回到真实机器人,HSImul3R 正在推动人类视频从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产