9月1日,3D生成大模型公司影眸Hyper3D正式发布世界生成模型WorldGen,将3D生成从“单个资产”推进到“完整场景”。

用户上传一张场景图片后,系统可以自动识别其中的主要物体,也可以由用户手动框选生成对象;前景中需要编辑和交互的物体由Hyper3D Rodin生成独立Mesh资产,背景则以3D Gaussian Splatting表达。通过团队自研CAST架构,WorldGen会进一步重建物体之间的位置、尺度、朝向和基础物理关系,生成由多个独立资产组成的3D场景。

网易科技也和影眸Hyper3D创始人、CEO吴迪,以及联合创始人、CTO张启煊进行了交流。吴迪表示,WorldGen是公司在场景生成方向的最新进展,“它把3D生成从单物体推进到多物体、可交互的场景级生成”。

据介绍,当单个3D资产生成逐渐可用后,资产如何进入完整场景是当前面临的主要问题。吴迪举例称,传统做法如果直接把整个会议室作为一个模型生成,“所有内容容易被合并为不可拆解的整体,场景很难继续使用”。WorldGen要做的是把场景拆解为可单独操作的资产,同时保持它们之间的空间与物理关系。

在张启煊看来,场景生成比单物体生成更难。这是因为模型“不仅要生成物体,还要理解物体之间的支撑、悬挂、接触和遮挡关系”。他提到,CAST研究完成后,产品化仍用了约一年时间,原因在于多模块系统会产生错误累积,“即使每个模块成功率都很高,级联后的整体成功率也会显著下降”。

物理属性是WorldGen强调的另一项能力。开启SimReady后,系统会为资产补充碰撞体,并估计质量、摩擦系数、恢复系数等仿真所需属性。但张启煊也明确表示,这些属性来自推断,“是用于仿真的估计值,不是测量值,不能当作精密工程数据使用”。当前WorldGen主要生成刚体,关节化资产、柔性体和动态交互仍是后续方向

这种边界也决定了WorldGen的落点并不只在具身智能。张启煊表示,具身是重要应用方向,但不是唯一方向,“这个产品严格意义上不是为具身行业做的,它是通用产品”。在他看来,场景生成同时对应游戏、XR、视频生成和机器人仿真等需求。

在游戏场景中,张启煊认为,如果只把3D生成理解为降本,“这是相对次要的增益”。更重要的是让UGC成为更有表现力的游戏机制,并让小团队在没有完整美术配置的情况下制作高质量资产。吴迪则判断,“3D生成如果不能更深入地衔接用户workflow,上限会很低”。

影视制作是另一个典型场景。吴迪提到,如果导演要把画面左侧盘子里的苹果移到右侧盘子,纯视频生成很难稳定控制;但在3D场景中,移动物体会直接得多。他认为,视频模型擅长最终视觉呈现,3D擅长记录空间状态、结构关系和可控操作,“Hybrid一定会发生”。

对于外界关注的“世界模型”概念,吴迪保持了相对明确的区分:“我们不会把公司定位为世界模型公司。”他表示,行业对世界模型尚无统一定义,影眸Hyper3D长期关注的仍是3D生成及其衍生能力如何服务3D从业者,并降低普通用户的使用门槛。

从这个角度看,WorldGen并不是把“图生3D”换一个更大的名字,而是把3D生成的问题从单个资产推进到资产之间的关系、物理约束和生产流程。而张启煊则把行业变化概括为一句话:竞争点正在从“能否生成一个看起来不错的模型”,转向“能否控制、编辑、拆分、进入工作流并稳定交付”。(袁宁)