李飞飞创办的 World Labs 刚发布多模态世界模型 Atlas,试图把AI从“生成画面”推进到“生成可进入、可操控的世界”。 Atlas原生理解相机位姿、3D深度和空间关系,只需1—6张普通照片,输入运镜轨迹,就能生成最长1分钟、1440p视频,镜头角度和运动路线可直接控制,甚至能“脑补”原图没拍到的区域。 更夸张的是,2—25张游客照片即可重建3D场景,普通手机拍的视频还能自由切换视角,实现“子弹时间”。
李飞飞World Labs发布全球首个多模态世界模型
李飞飞创办的 World Labs 刚发布多模态世界模型 Atlas,试图把AI从“生成画面”推进到“生成可进入、可操控的世界”。 Atlas原生理解相机位姿、3D深度和空间关系,只需1—6张普通照片,输入运镜轨迹,就能生成最长1分钟、1440p视频,镜头角度和运动路线可直接控制,甚至能“脑补”原图没拍到的区域。 更夸张的是,2—25张游客照片即可重建3D场景,普通手机拍的视频还能自由切换视角,实现“子弹时间”。
热门跟贴