北京潜界科技有限公司(以下简称“LatentVerse(潜界科技)”)成立于2026年5月,是一家具身基座模型公司,由来自清华大学交叉信息研究院的具身智能研究团队创立。团队成员来自清华大学、北京大学、南洋理工大学,以及字节跳动Seed、阿里巴巴Qwen、小米等大模型与具身智能团队,长期围绕具身模型预训练、世界模型、灵巧操作、数据基础设施与端侧部署等方向开展研究。
投资界8月12日消息,近日,LatentVerse(潜界科技) 宣布完成数亿元种子轮融资,投资方包括高瓴创投、清流资本、英诺天使基金,以及智元机器人、星动纪元等产业投资方。
在机器人逐渐从实验室走向真实世界的过程中,一个核心问题变得越来越清晰:会“看”、会“想”、会“做”还不够,机器人还需要在持续变化的环境中不断感知反馈,并实时调整自己的动作。这也是LatentVerse希望解决的问题。
早期的视觉动作(VA)模型,主要解决如何让机器人根据视觉信息直接完成动作;随后,视觉语言动作模型(VLA)进一步加入语言理解能力,使机器人能够听懂人的指令;世界动作模型(WAM)则尝试让模型预测一个动作发生之后,真实世界可能发生怎样的变化。
LatentVerse团队长期参与这一技术演进。团队成员此前提出的DP3聚焦3D具身策略学习;HiRT探索视觉、语言与机器人动作之间的协同;VPP进一步研究如何预测动作带来的未来状态。此后,团队又持续探索世界模型与VLA的融合,以及灵巧手通用模型等方向。
LatentVerse创始人兼CEO胡钰承为清华大学交叉信息研究院博士,曾在字节跳动Seed参与具身智能基座模型研究。其研究长期关注VLA与世界动作模型的融合,希望让机器人不仅根据当前环境生成动作,还能够理解:如果这样做,接下来会发生什么。
沿着这一研究路径,LatentVerse提出了 UTAM(Unified Tactile Action Model)具身全模态世界模型。
简单来说,UTAM希望让机器人形成一种类似“边想、边做、边修正”的能力。
LatentVerse将机器人进入真实世界所需要的能力概括为两个层面:认知智能与接触智能。
认知智能解决的是机器人如何理解任务、适应环境变化,并把已有技能重新组合起来。例如,当桌面布局发生变化时,机器人不能只机械重复训练过的动作,而需要重新判断执行顺序和路径。
接触智能解决的则是动作真正发生之后,机器人能否感受到现实世界的反馈。物体是否滑动、有没有发生形变、抓取力度是否合适,都需要机器人在执行过程中不断感知并调整。
在人类完成复杂操作时,“思考”与“触觉反馈”并不是两个孤立过程。LatentVerse希望在统一模型中,把这两种能力结合起来。
UTAM:把触觉加入统一模型
UTAM由多个协同工作的模块组成。其中,视觉语言模块负责理解环境与人的任务意图;世界模型根据学习到的物理规律与技能,预测不同动作可能带来的未来结果;动作模块生成机器人执行计划;而触觉模块则持续感知接触力、滑移和物体形变,对动作进行高频调整。
由此形成一个闭环:
先理解任务、预测结果,再执行动作;动作过程中持续接收真实世界反馈,并及时修正。
相比把触觉仅仅作为动作执行末端的一项传感器信息,LatentVerse希望将其作为模型的原生模态之一,与视觉、语言、机器人状态和动作共同参与模型训练。
目前,团队已经完成UTAM多模态数据基础设施和训练管线建设,打通视频、语言、机器人状态、动作及触觉等数据的采集、清洗、同步、对齐和训练链路,并正在推进各模块联合训练。
团队目前重点验证三类能力:在未见过的物体和环境中的泛化能力,多步骤长程任务的持续执行能力,以及面对滑移、形变和受力异常时的实时修正能力。
本轮融资将主要用于UTAM模型研发、多模态具身数据体系、模型训练基础设施,以及机器人在真实场景中的技术验证。
LatentVerse创始人兼CEO胡钰承表示:“泛化、长程与灵巧不是三个彼此独立的技术指标,而是机器人商业化必须同时满足的能力条件。UTAM希望让机器人不仅能够理解任务和生成动作,也能够在真实接触过程中感知变化、快速修正并持续完成复杂操作。”
高瓴创投项目负责人表示:“具身智能从技术验证走向更多真实场景,仍需要持续解决泛化、长程任务执行和灵巧操作等关键问题。潜界科技团队在具身模型、世界模型与灵巧操作等方向有长期积累,UTAM进一步将触觉作为原生模态纳入统一架构,尝试让机器人形成‘边想、边做、边修正’的闭环能力。高瓴创投长期关注具身智能领域的技术与产业进展,期待团队持续推进具身基座模型的研发与工程验证,在真实场景中不断迭代模型能力。”
热门跟贴