打开网易新闻 查看精彩图片

专业导演,不靠抽卡

—— updream 预演台实测:把"脑子里那一帧"从文字翻译里抢回来

【编者按】AI 视频走到今天,"抽卡"几乎成了创作者共同的隐痛:提示词写得越细,反而越发现文字表达空间和调度的精度太低,模型读到的与你脑中的那帧始终隔着两道翻译。updream 近期上线的"预演台(Previs Studio)"把这件事往前推了一步——不用学建模,上传一张场景参考图,几分钟生成可操控的 3D 白模场景,镜头与人物走位可视化调度,把"碰运气"变成"确定性创作"。

导筒编辑部专注于AI方向的导演王鹏用一系列真实 Case(一镜到底、多机位切换、复杂空间调度)完成了一次完整实测,以下是他的上手过程与诚实体验。

开篇,先开门见山,带来一个实测案例:一镜到底。

一镜到底:舞厅穿行(17 秒,无对白)

一镜到底是纯文生视频的重灾区——它要求镜头在一段连续时间里完成多次空间关系的转换,提示词里每多写一个调度,模型就多一次理解偏差的可能。故事设定为一个女人的复仇前夜:穿旗袍的女人走进 1930 年代上海舞厅,穿过用餐宾客与舞池,一路瞥见二楼回廊落座的老板、舞台上的爵士乐队、幕帘后端托盘出来的男服务员;歌舞升平里她一步没停,最后停步落幅,眼眶泛红、下颌绷紧,浮出悲愤与复仇交织的神情。全片靠环境与视线完成叙事。

调度上是三个主要人物+三组群演。女人是唯一运动主线,路径为"入舞池边缘→沿餐桌横向穿行→绕过舞池慢舞者→掠过舞台前区→停步",是一条不回头、不折返的单向长线。镜头始终附着在女人侧方,用她的行走带动全部信息:先侧跟横移带出餐桌,借她抬眼的动作微微上仰带出二楼老板,再随她绕行 舞池时自然摇向舞台带出乐队,最后由跟随收为推进、从中景压到近景落幅——一镜到底最典型的写法:人带镜,而非镜找人。

一、痛点:文字到画面,丢了两道信息

在技术爆发的临界点,AI 影视化正迎来一种可能。以 Seedance 为代表的 AI 视频生成模型,诞生刚过半年,似乎已经具备制作精品化影视作品的可能。即便它能极大缩减成本,但目前最强的视频大模型仍然需要一遍遍抽卡。抽卡的根源在于:自然语言描述空间和调度关系的精度太低,视频生成大模型难以精准理解,这难免产生不低的算力成本。

问题可以拆成三层:

痛点 A|白模是最有效的空间控制方式,但制作白模学习成本高。学 Blender 建模,或在 ComfyUI 里搭 ControlNet 节点工作流,普通 AI 视频创作者要投入大量时间精力。

打开网易新闻 查看精彩图片

△传统三维软件Blender

痛点 B|文+图控不住模型。提示词和静态参考图定不住画面的空间布局、人物姿态和构图。创作者脑子里的镜头是具体的,交到模型手上却要过两道翻译——先由创作者写成文字,再由 AI 把提示词润色一遍,每一道都在丢信息,而第二道创作者插不上手。

痛点 C|抽卡成本太高。Seedance 2.5 生成一条 30 秒视频大约需要 70 元左右;即使专业创作者,一颗复杂镜头平均也要抽 2—3 次。对个体创作者而言,这是一笔持续消耗。

ControlNet 论文明确指出:纯文本提示词难以精确表达画面的空间布局、人物姿态和构图;因为文生视频系统缺乏空间锚定,物体放置、摄像机位、走位调度和画面连续性都难以用文字控制。粗糙的 3D 场景恰恰可以作为视频生成的空间锚点——不需要精细建模,就能保持纯文字方法无法实现的空间和时序一致性。updream 预演台把这套流程迁移到画布上,将原本需要大量时间学习的操作压缩到最简单的方式完成。

二、预演台:功能亮点与差异化

打开网易新闻 查看精彩图片

△updream的预演台界面

预演台(Previs Studio)的功能核心总结为一句话:不用学建模,现在只需上传场景参考图,就能快速生成高还原度的 3D 白模场景;创作者可以直接在预演台控制镜头和人物运动,用白模参考替代文字描述,把"抽卡碰运气"变成"确定性创作"。它包含三项关键能力:

图片生成 3D 白模场景(独家功能):一张图搭出一整个 3D 场景。上传概念图、气氛图或参考图,预演台自动解析空间结构,生成带深度信息的 3D 白模场景,空间层次、物体比例、遮挡关系都能还原,基础用户不需要打开任何 3D 软件。

镜头与走位可视化调度(亮点功能):在 3D 白模场景里直接设置虚拟摄像机的机位和运动轨迹,推拉摇移跟都支持,人物走位也能直接拖拽控制;过去只能靠文字和静态图沟通的信息,现在全部变成可视化操作,所见即所得,支持单机位一镜到底,也支持多机位切换成片。

白模视频一键录制、回到画布生成(亮点功能):从生成白模、调整机位、操控走位到录制导出,全程在预演台内完成,录制完成后白模视频一键回到画布,直接作为参考素材送进模型生成。

白模参考分粗粒度与细粒度两层:粗粒度白模主要提供动作、动线、站位、运镜、切镜、光影和声音等时序信息,由预演台自动生成;细粒度白模已具完整结构,主要用于材质、色彩、人物、场景和视觉风格的重渲染,支持用户自己导入(支持obj/glb/gltf等格式的模型导入)。对应不同精细度,模型会提供不同层级的参考——这是理解"什么时候用哪类白模"的前提。

三、上手实录:五步把白模视频送进模型

在 updream 的项目中,鼠标右键即可选择"新建预演台"。下面是我实际操作的五步流程。

步骤 1|新建预演台并生成场景

相比其他工作台,updream 有一个十分便利的一键生成场景功能:只需上传场景图片,几分钟内即可生成对应场景的白模,无需手动搭建。注意点:参考图最多传三张,推荐用广角图、鸟瞰图、全景图、纵深图这类空间信息丰富的画面,因为它需要读取的是空间结构。若制作内容的精确度要求特别高或者包含复杂的空间和人物关系,强烈建议在已生成的场景中创建角色、机位并分别绘制运动路径;而如果只是涉及普适的室外环境或不复杂的人物关系,也可直接在空白预演台中新建角色和机位,后期再搭配场景资产图给seedance参考。

打开网易新闻 查看精彩图片

步骤 2|新建人物与机位

点击左侧竖条菜单栏新建人物和机位,可更改人物的颜色、身高、默认动作,也可调整摄影机的型号、镜头、焦段、光圈、画幅等参数。人物和摄影机均可自由移动、旋转;选中后选择移动或旋转按钮,三维坐标中的一个轴变为黄色时即在对应轴上产生作用。摄影机被选中后可在右上角小预览窗口直接拖动角度,右侧机位选项卡里也能设定"看向"某个目标——这个功能在做跟拍和环绕时非常关键,设定"看向"之后,机位无论怎么走,主体都会锁在画面里。

打开网易新闻 查看精彩图片

△新建人物和修改属性

打开网易新闻 查看精彩图片

△新建和调整机位

打开网易新闻 查看精彩图片

△在场景中调整人物和机位关系(建议直接在场景中新建和布置人物与机位)

步骤 3|设置运动路径(核心)

人物和机位都可以绘制轨道,有三种绘制方式:长按鼠标左键画线绘制轨道、逐点单击鼠标左键绘制、打关键帧。这是预演台的核心环节:把"谁在什么时间出现在什么位置、镜头如何运动"全部在三维空间里摆出来。

打开网易新闻 查看精彩图片

△打关键帧设置人物和机位运动路径

步骤 4|录制导出

点右上角录制,白模视频就输出到画布下游节点。到这一步,你手上有了一段"运镜和调度完全正确、只是长得像灰模型"的视频。

打开网易新闻 查看精彩图片

步骤 5|编写白模提示词并生成

当有了白模视频和角色图、场景图之后,可参考 Seedance 2.5 官方手册的提示词模板编写。一个可复用的骨架如下:

@视频1 是粗粒度白模参考,仅提供 <动作路径、人物站位、机位、运镜、切镜、光影变化、空间关系> ,不采用其中的白模外观、材质和空白场景。

@视频1 中的 <白模主体a> 对应 <主角> ;@视频1 中的 <白模主体b或几何道具> 对应 <配角或关键道具> 。

@图片1 定义 <主角> 的 <外貌、服装或结构> ;@图片2 定义 <关键道具或场景> 的 <指定属性> 。 <主体> 在 <场景> 中完成 <主要动作或事件> 。保持@视频1 中的 <动作路径、站位、运镜、切镜、光影或声音节奏> 。最终画面采用 <人物、场景、材质和视觉风格> 。

打开网易新闻 查看精彩图片

四、 Case 实测:

在文章开篇的“一镜到底”案例中,白模里我把整段运动的速度曲线定死了(前段慢推、中段平移加速、结尾减速停稳),这个节奏在成片里被完整保留。值得注意的是,在白模视频中最后 4 秒我认为没有新的信息看点,所以在生成视频时提示词里写了摄影机环绕女人后推到面部表情和特写——最终结果既遵循了前半段的白模演示,又实现了新增的提示词文本想要的描述,效果不错。

除了开篇已经展示的“一镜到底”案例,我挑了另外2个纯提示词很难精确抽卡的镜头类型来测试。

多机位切换:绿皮火车硬座(20 秒)

多机位的难点不在单个镜头,而在轴线和空间连续性——切镜之后观众要能瞬间明白"这还是刚才那个空间、这还是刚才那两个人",一旦越轴或空间关系对不上,观感立刻就散了。故事发生在绿皮火车硬座车厢:削苹果的大姐搭话对面并排坐的大衣男和西装男,全程列车员在过道反复提醒防盗,最后广播播报即将通过九公里的长隧道——20 秒里没有紧张动作,张力全靠信息和即将到来的黑暗。测试这个案例时特意对比了两种方案,一种是拿掉了火车白模,只在空白的三维空间中放置角色和机位,交由seedance参考;另一种是加上火车白模,将人物和机位按照火车白模的空间正确放置。

调度上是五个人物,但只有一个人在走动。大衣男、西装男并排坐,削苹果大姐坐对面,瘦子圆头男双手插兜坐着,四人全是固定座位关系。唯一的运动路径属于列车员:沿过道由景深处向前,穿过交谈的三人之间,随后走远,声音也随之由近及远—— 她实质上是这场戏的"节拍器"和转场依据。

镜头是分段式的机位与景别推进、靠切换而非跟随:0—2 秒全景缓推建立车厢与五人关系,3—5 秒切到大姐问话的对话景别,6—8 秒抬升拍大衣男掏口香糖,9—11 秒推进到圆头男的背身近景,12—14 秒借列车员横穿画面完成一次自然遮挡换镜,15—20 秒落在圆头男身上收尾。

对比有火车白模和没有火车白模两次参考生成的结果,第一次生成的白模不含火车场景模型,而只上传标注人物特征的下图,这导致 AI 理解位置关系和透视出了偏差,圆头男人的位置和一个分镜中列车员的方向出现了错误。

打开网易新闻 查看精彩图片

△无场景的位置关系参考图

后来重新引用包含火车场景的白模,生成出的结果更加精确。由此可见在多人物和多机位的复杂场景中,要想实现精确的控制,场景建模是必不可少的,而这也让updream中上传图片生成场景的功能显得便捷和珍贵。

打开网易新闻 查看精彩图片

△加入场景后的位置关系参考图

复杂空间调度:雪夜古寺潜入(22 秒)

故事描述:雪夜,年轻刺客翻越古寺围墙潜入,弓身沿回廊逼近佛堂,途中抽出匕首;推门而入时,敲木鱼的和尚先开口——"你终于来了。"刺客握刀的手一紧,低声反问:"你知道我要来?"两人一坐一立僵在同一画面里。全片靠两句台词把动作片瞬间转成对峙。

调度上只有两个人物,但空间层级复杂。刺客的路径跨越三个空间:墙外(攀爬)→墙内地面(跳落缓冲)→木构回廊(弓身快走)→佛堂门内,是垂直+水平的复合运动。和尚全程静止,盘坐佛像前敲木鱼。

打开网易新闻 查看精彩图片

镜头的核心难点在于一个硬约束:摄影机始终正面拍男主。这意味着 4—15 秒回廊段是长时间的正面倒退跟拍,廊柱只能短暂虚焦掠过、不得完全遮挡。真正的调度关卡在第 16 秒:摄影机必须先于人物退进门内,在同一镜内完成前后景关系的整体翻转——退到位后,和尚从"看不见的目标"变成镜头的前景,刚推门进来的刺客变成面朝镜头的后景,两人一前一后;随后机位固定,17—22 秒完成对话。这是典型的靠机位移动而非剪辑来重构人物关系的做法,冷暖光在门缝处的对撞也正好卡在这个转折点上。全局动作和局部动作的分层在这里派上用场:除和尚的朝向出了一点偏差,其余人物的相对位置、遮挡关系、进出画的时间点,基本都和白模一致。且开头年轻刺客翻越围墙的戏,仅仅靠在updream预演台中简单设置人物穿模而过,再加提示词说明,AI也最终清楚理解创作意图。经过几个实例测试,可窥见预演台在AI创作上的优势是结构性的:它可以极低成本实现复杂美术场景的搭建、高难度动作或特效创意;也可以通过在同一个三维空间的设置,精确实现对人物和摄影机的调度规划;另一个好处是切点可以精确到秒,不需要生成完再去花大把时间在剪辑台里对齐(由于白模场景中设置摄影机路线速度不一致导致需要后期调整的除外)。

三组 Case 的实测对照小结

Case

调度难点

白模带来的具体变化

一镜到底·舞厅

连续时间内多次空间关系转换

速度曲线(前慢—中加速—尾减速停稳)被成片完整保留;人带镜的视线动机可逐段落地

多机位·火车

轴线与空间连续性、切点对齐

所有机位共享同一三维空间,切点可精确到秒;未放场景关系时 AI 透视出现偏差(已知边界)

复杂空间·古寺

垂直+水平复合运动、前后景翻转

机位先于人物退进门内重构人物关系的镜内翻转可实现;人物相对位置/进出画时间点基本与白模一致

表:三组 Case 的调度难点与白模实测表现对照

五、几条实测踩出来的经验

经过实测,有以下几点经验供参考。

复杂的人物位置关系,最好建立模型场景。让空间锚点先行,再交给模型重渲染。updream的上传图片生成场景功能此时就能低成本高效发挥作用。同时还可以在引用白模的基础上,再次文本描述角色之间的位置关系。

除非特别需要,那么在有白模的时候,建议删掉提示词里的镜头语言。白模已经把运镜锁死,如果提示词里还写着"镜头后拉""仰摇""特写",两套指令会打架,可能导致出来的结果反而比不用白模还乱。

要明确写出每份素材"用什么"和"不用什么"。比如"@视频1 是粗粒度白模参考,仅提供动作路径、人物站位、机位、运镜、切镜、光影变化、空间关系,不采用其中的白模外观、材质和空白场景"。不写这句,模型可能真的把灰模型的材质学过去。人物参考图注明"不采用图片背景",场景参考图注明"不采用图中人物"。

白模里的每个几何体,要单独映射到具体主体。不要写"@图片1 至 4 分别定义四个角色"这种偷懒的绑定,一个一个点名:"@视频1 中的白模主体A 对应 主角"。多主体场景里,这一步做不做,串脸率差别很大。

也要诚实地说个人觉得目前有待优化的地方:希望预演台新增复制角色、摄影机、模型的功能,另外批量选择关键帧的功能也可补上——这些是高频操作里的真实摩擦点。

六、它解决的是什么:可控性、成本与适用场景

预演台的功能亮点与差异化,在于把"空间锚定"这件事从专业 3D/CG 工作流(Blender 建模或 ComfyUI+ControlNet 节点)迁移到画布上,让没有建模基础的个体创作者也能用可视化方式完成镜头与走位调度。它解决的创作者痛点很具体:把原本靠文字两道翻译、靠反复抽卡来逼近的画面控制,转成"在三维空间里直接摆出来"的确定性输入;随之而来的是可控性的提升与抽卡次数的下降——是降低抽卡次数、提高可控性,而非消灭抽卡。

从成本角度看,以 Seedance 2.5 生成一条约 30 秒视频约 70 元为参照,复杂镜头若不靠白模常需 3—5 次甚至更多次抽卡;用预演台把运镜、站位、切点先锁定后再生成,有机会把多数镜头的抽卡次数压到 1 -2次左右(具体因镜头复杂度而异)。对个体创作者而言,这并不是"零失败率",而是把不可控的抽卡成本变得可预估。

那在什么场景下它能发挥其最大价值?一是纯文生视频难以精确抽卡的镜头——一镜到底的长线运动、多机位切换的轴线与空间连续、复杂空间里的复合运动与前后景重构;二是需要把"导演意图"准确传递给模型的协作场景;三是需要精确切点、希望减少后期在剪辑台对齐成本的制作流程。反过来,简单、静态、对空间调度要求不高的镜头,直接写提示词往往就够了。

七、现在正是上手的时候

总体来看,updream 为目前精准化解决 AI 制作中的分镜和调度问题,提供了一种高效且极具性价比的方案。它更像是在"能生成"和"能导演"之间补上了控制精度这一步——而这一步,过去一直被专业 3D/CG 工作流把守着。

打开网易新闻 查看精彩图片

创作不易,感谢支持