⾯向Physical AI的Reality-to-Sim具身智能基础设施公司景立构(ScanArk),宣布完成Pre-天使轮融资,至此,公司在4个月内已完成种子轮、种子+轮及Pre-天使轮三轮融资,累计融资数千万元人民币,投资方包括小苗朗程、国海创新资本、头部具身机器人公司及知名产投机构等。
具身智能与世界模型的发展,正面临数据供给在规模与质量上的双重挑战。互联网图像和人类第一视角视频记录了丰富的视觉信息,却往往缺少准确的空间结构、物理状态和动作反馈;真机采集能够提供真实交互经验,但成本高、效率有限,难以充分覆盖复杂任务和长尾环境。如何持续获得既贴近真实世界、又能支撑机器人学习的数据与经验,成为行业需要突破的关键瓶颈。
与此同时,GPT-6 Astra等通用大模型在复杂推理、工具使用和多步骤任务执行上的进展,正在拓展AI参与实际工作的能力边界,这也为具身智能和世界模型提出了新的命题:随着模型能力提升,训练体系需要进一步支持机器人通过行动获得反馈,在探索、试错和策略更新中持续积累经验。交互学习,有望成为具身智能下一阶段的重要学习范式。
支撑这一范式,需要一种新的基础设施:将真实人类世界转化为可执行、可交互、可反复试错的数字环境,让机器人能够主动产生训练经验。这样的环境既要保留真实空间的布局、物体关系与复杂分布,也要能够反馈动作带来的物理变化,并通过真机验证持续校准。让真实世界成为机器人可以反复进入、持续学习的数字训练场,正是景立构的核心方向。
据公司介绍,景立构(ScanArk)开创了一种全新的3DGS形态,让原生3DGS从“看起来像世界”,进化为“机器人可以进入、行动和学习的世界”。通过自研模型,将真实环境生成为具有物理与交互信息的原生3DGS场景,在还原视觉与空间结构的同时,生成物体属性、部件关系和交互状态。机器人由此能够在真实世界的数字副本中执行动作、观察结果、探索不同策略,在成功与失败中积累经验,再通过真机验证将能力带回现实。围绕这一技术路线,景立构正在构建面向机器人交互学习与世界模型训练的真实数字环境基础设施。
从原生3DGS到可交互世界,构建人类世界的数字副本
机器人面对一扇门,需要知道的不只是“这是一扇门”。门框、把手与墙是什么关系,铰链在哪里,朝哪个方向、用多大的力才能打开,动作失败后又该如何调整,都关系到它能否完成任务。
据景立构介绍,其创新之处在于探索一种新的原生3DGS形态:在生成视觉与空间结构的同时,生成物理与交互信息,让场景从“看起来像世界”,走向机器人能够在其中执行动作、观察结果的可交互环境。
这条路线首先强调,训练环境应从真实世界出发。传统人工建模通常从已有资产中挑选桌椅、柜子和家电,再按规则排列组合。这样的房间可以看起来完整、合理,却难以保留真实生活中物品的摆放、遮挡、磨损,以及它们与空间、任务之间的关系。
景立构希望将真实的生活和工作环境作为整体,保留其几何尺度、布局、通行关系,也保留光照、反射、杂乱和使用痕迹。机器人最终需要面对的,正是这些不整齐、充满例外的环境。以现实为基础,才能让仿真中的经验更有机会迁移到真实部署。
在此基础上,数字副本还需要能够响应动作。景立构将真实观测组织为视觉、几何、语义、物理和场景关系,支持碰撞、接触、关节运动及状态变化的模拟,进而用于导航、抓取、操作和策略评测,最后通过真机执行、失败诊断与现实校准检验效果。
因此,客户得到的不只是可观看的三维资产或一次性数据集,还包括可供机器人反复进入、尝试和学习的环境。工程团队可以重设初始状态、改变任务条件,比较不同动作的结果,检查失败原因,并将仿真表现与真机结果对照。
随着新的真实观测和部署中的失败不断回流,数字世界也能持续更新。景立构希望由此形成从现实到仿真、再回到现实的闭环,让数字副本成为机器人积累经验的空间。
3DGS场景案例展示
交互学习带来下一次跃迁
机器人仿真赛道正在升温。随着具身模型能力提升,行业对数字环境的要求也在变化:既要还原真实世界的视觉与空间结构,也要能够响应动作、反馈结果,让机器人在其中持续积累经验。
围绕这一目标,不同公司形成了各具特点的技术路径。在景立构看来,行业大致可以按四种切入点理解,但这些路线的边界正在逐渐融合。
第一类从真实空间采集与三维重建出发。以其域创新为例,其LCC工作流已将真实场景重建、3DGS渲染与引擎应用连接起来,并提供结合碰撞几何的仿真接入能力。这类路线的优势在于保留真实环境的布局、外观与空间细节;进一步服务机器人操作训练,则需要完善对象状态、交互机制和任务定义。
第二类以世界模型的生成能力为切入口。World Labs已通过Marble和Atlas探索从图像、视频等输入生成或重建三维环境,并展示了机器人视角观测生成及操作仿真。生成模型为减少采集量、补全未观测区域和扩展场景变化提供了新的路径,而生成内容的几何精度、物理一致性及任务有效性,仍需要结合具体应用检验。
第三类以物理资产与仿真工具链为基础。光轮智能围绕SimReady资产、物理校准和机器人评测构建产品体系,其官网已披露服务吉利人形机器人训练与部署的案例。这类路线重视物体结构、接触和动力学的准确性,适合对操作精度要求较高的任务;规模化扩展时,需要进一步平衡资产精度、制作成本与场景丰富度。
第四类是景立构选择的重建与生成融合路线。据公司介绍,其以真实环境为基础,通过自研模型,在还原视觉与空间结构的同时生成物理属性和交互信息,探索面向机器人学习的原生3DGS可执行世界。其关注点,是保留真实世界的环境分布,并让机器人能够在其中采取动作、获得反馈和积累经验。
从公开实践看,不同路线已经开始相互借力。英伟达通过NuRec将真实场景重建接入Isaac Sim,同时利用Cosmos扩展环境变化;光轮也与World Labs合作,将生成式场景与物理资产、任务执行和评测体系结合起来。竞争正在围绕几个共同目标展开:环境是否足够真实,物理反馈是否可信,生产成本能否降低,以及仿真经验能否有效迁移到真机。
3DGS在其中受到关注,源于它对视觉质量与计算效率的兼顾。2023年提出时,这项技术就展示了高质量重建和实时渲染的潜力。它以显式的三维高斯表示空间,能够保留真实场景丰富的纹理、光照和外观细节,并高效生成不同位置与视角下的画面。
对于以视觉为核心的机器人模型,环境的视觉保真度直接影响它接收到的学习信号。当机器人接近桌子、绕过柜子时,相机看到的物体大小、遮挡关系和背景会持续变化。以真实观测为基础的3DGS,能够随机器人视角生成相应画面,为缩小训练与部署之间的视觉差异提供条件。高效渲染则有助于降低反复试验中的观测生成成本,使高保真环境更适合持续交互。
这项技术走向商业应用,也经历了持续的工程积累。早期方案对采集质量、相机位姿和计算资源要求较高;随后,训练加速、显存优化、抗锯齿和曝光补偿等技术不断改善效率与重建表现。Web、移动端和XR工具链的适配进一步扩大了应用范围,例如PICO已开放针对移动GPU优化的3DGS渲染组件。这些进展,让真实空间的数字化同时服务于人的沉浸式体验和机器人的感知与训练。
在景立构看来,视觉重建与工程效率的提升,为下一步探索创造了条件:让数字世界成为机器人通过行动获得经验的学习环境。
景立构看好的路径,是先利用人类示范等数据训练基础模型,再让机器人进入可反复试错的数字环境,通过行动、反馈和策略更新继续学习。示范数据提供初始能力,机器人自己的尝试则帮助它发现新的问题、比较不同做法,并学习如何应对示范中未曾覆盖的情况。
以抓取杯子为例,握持力度不足可能导致滑落,抓取姿态不合适可能引发碰撞。如果环境能够可信地反馈这些结果,学习系统就可以据此调整策略。杯子的位置、材质和任务条件还可以改变,场景也可以重置,让机器人在可比较的条件下探索不同动作,积累成功、失败与恢复经验。
这使学习持续发生在“观察状态—执行动作—获得结果—更新策略”的循环中。人类数据仍然重要,而交互环境进一步提供了由机器人自身行为产生的新经验。
仿真适合承载这一过程,是因为现实中的反复试错需要设备、场地和时间,失败还可能造成物理损失。数字环境通过重置、并行运行和条件控制,可以扩大试验范围,并让困难状态得到反复练习。但这些经验必须与现实保持可信的联系:视觉、碰撞、接触和动力学需要校准,策略的进步也需要通过真机验证。机器人在仿真中发现的问题,应能指导现实中的改进;真机暴露的失败,也应反过来更新数字环境。
人类的许多能力,来自长期与环境互动的积累。大语言模型也不再局限于海量文本的被动预训练,而是在交互式任务和结果反馈中不断修正与进化,由此释放出新的能力边界。这给具身智能带来的启发,是让机器人在已有示范的基础上,获得更充分的行动、探索和学习机会。
交互学习有望成为具身智能下一阶段的重要学习范式。这是景立构构建数字世界的核心判断,也仍需更大规模的跨场景、跨任务和真机实验验证。当前,许多递归自我改进(RSI)方法,以及前沿的测试时训练(Test-Time Training),都把交互式学习视为关键机制。景立构所押注的,是让机器人在已有示范之外,获得亲自尝试的机会:采取行动、经历失败、调整做法,并在持续的交互中形成新的能力。
机器人与3DGS场景交互案例展示
从机器人足球赛场走出来的同济创业团
景立构的核心技术团队,成长于同济大学机器人与人工智能实验室(RAIL)。这支年轻创业团队的背后,是三十余年的机器人研究积淀。实验室始于1990年,是国内最早开展机器人与人工智能研究的实验室之一,长期深耕自主移动机器人、仿人机器人、三维视觉与多传感器融合等方向,承担过国家863计划、国家科技支撑计划、国家自然科学基金重点项目等科研任务,相关成果曾获国家科技进步奖、上海市科技进步一等奖、上海市自然科学一等奖等荣誉。
实验室负责人陈启军教授是科技部重点研发计划首席科学家、享受国务院政府特殊津贴专家、上海市领军人才,现任中国自动化学会具身智能专业委员会主任委员,曾任同济大学电子与信息工程学院院长。他长期从事人工智能与机器人研究,主持国家级及省部级科研项目,曾两次获得上海市科技进步一等奖,并获上海市自然科学一等奖、上海市技术发明一等奖、教育部科技进步一等奖等荣誉。
实验室的研究积累,也在国际机器人赛场上得到检验。RAIL实验室的TJArk(同济方舟)团队,曾在RoboCup机器人世界杯中国赛标准平台组实现十一连冠,并于2018年获得该组别国际赛季军,创下当时中国队在这一项目上的最好成绩。从动态环境感知、自主定位到运动控制与多机器人协作,赛场成为团队将算法转化为机器人实际能力的重要试验场。
景立构创始人彭云与两位技术联合创始人,既是同一实验室、同一导师门下的博士生,也是RoboCup赛场上并肩作战的队友。从共同调试机器人、打磨算法,到携手创业,这段合作经历为团队建立了技术默契。如今,他们将研究与竞赛中积累的空间感知、三维重建和机器人系统经验,延伸到一个更大的目标:把人类生活的真实世界,转化为机器人能够持续交互、学习和成长的数字世界。
创始人兼CEO彭云博士出生于1998年。他的技术经历涵盖工业三维视觉、三维空间理解和仿真数据生产,曾在华为2012实验室三维栅格算法团队主导核心项目,并以第一作者发表多篇三维视觉相关论文。2020和2021年,他随TJArk团队获得RoboCup中国区标准平台组和家庭组冠军。
联合创始人兼CTO苏帅博士主要负责硬件架构与算法研发,在SLAM和三维重建方向积累了研究与工程经验。他曾参与蔚来多传感器融合标定算法的早期研发,以及OPPO XR基于轻量化深度学习的视觉SLAM研究,并以第一作者在ECCV Workshops、ICRA、IROS等会议发表多篇学术论文。
联合创始人兼联席CTO刘创伟博士主导3DGS重建算法与生成模型研发,研究方向集中于三维视觉和双目深度感知,最早将视觉基础模型引入双目立体匹配领域,并多次在场景重建榜单KITTI Benchmark上登顶。并以第一作者在TIP、TCSVT、TIV等期刊发表多篇学术论文。
这支团队的共同经历,也留在了公司名字里。ScanArk中的“Ark”沿用了TJArk的队名,既有“方舟”之意,也呼应同济“同舟共济”的含义。
面向未来,景立构希望构建原生4D世界模型所需要的基础设施,将三维空间、时间演化与物理交互纳入统一建模,融合真实世界的重建、生成与模拟。公司将以真实环境和交互数据为基础,逐步探索从少量观测恢复与补全空间、理解物体运动与物理关系、预测交互引发的状态变化,让模型能够生成具有空间一致性、物理可信度和持续交互能力的动态数字世界。在这一蓝图中,真实世界的外观、结构与变化规律将成为模型共同学习和表达的对象,仿真与真机反馈则持续推动模型与现实对齐。景立构希望由此为机器人及具身智能团队提供可生成、可编辑、可交互的训练环境与评测基础,让真实世界成为机器可以理解、推演并持续获取经验的数字世界,为具身智能进入物理世界提供基础能力。
图片来源|Unsplash
热门跟贴