打开网易新闻 查看精彩图片

上面这八张灰白图,从左到右分别是《黑客帝国》的子弹时间、《盗梦空间》的旋转走廊、《卧虎藏龙》的竹林、《泰坦尼克号》的船头、迈克尔·杰克逊《Smooth Criminal》的群舞、《闪灵》里丹尼骑三轮车穿走廊、一段街舞、还有一段我自己生成的空翻。

八段视频里的人长什么样、穿什么衣服、什么颜色,全没了。剩下的只有形体、走位,和镜头怎么绕着他们转。

这种图其实只记了一样东西:画面里每个点离镜头有多远,近的亮、远的暗,颜色、材质、脸一概不存。所以它天然就是一段「只有几何、没有外观」的视频。

打开网易新闻 查看精彩图片

这是我这两天在LibTV上做的事,用的是他们刚上线的「深度动作捕捉」。而拿到这八张图之后我做的第一件事,是把子弹时间那段的动作,装进了一幅水墨画里。

打开网易新闻 查看精彩图片

同一时刻的三帧:左边是原片里基努·里维斯往后仰,中间是提取出来的深度图,右边是生成的成片。白衣剑客的后仰角度、张开的手臂、镜头绕着他转的弧度,跟原片对得上;连横着飞过去的子弹拖尾,都变成了水墨的飞白线条。

打开网易新闻 查看精彩图片

我写的提示词是「水墨风格,白衣剑客,竹林,宣纸质感,大面积留白」——一个动作词、一个运镜词都没有。

为什么非得先拆一道

做AI视频的人应该都干过这事:找到一段动作和运镜都合适的参考视频,喂给模型,然后发现AI学走的不只是动作。但这次实测下来,真正卡人的地方比这个更靠前。

我最早想拿一段真人跳舞的免费素材直接当参考,结果生成失败了。

打开网易新闻 查看精彩图片

点开节点上的「查看详情」,话说得很清楚:

打开网易新闻 查看精彩图片

而同样这段素材提取成深度图之后一路畅通,九次提取九次全过——那张灰白图里已经没有人脸,也没有服装。

至于纯靠提示词描述复杂运镜,我试过很多回,人物走位、镜头环绕、推拉跟拍这些你写得出来但写不准,你脑子里那个画面是有具体角度和节奏的,落差补不上。

完整走一遍

操作路径比我想的简单。把视频拖进LibTV的画布,选中那个视频节点,顶上工具栏会出来一排功能,鼠标移到「逐帧拉片」上,下拉菜单里有一项就是「深度动作捕捉」。

打开网易新闻 查看精彩图片

这个菜单是鼠标悬停展开的,不是点击,我第一次找它的时候在工具栏上来回扫了好几遍。

点进去会弹出一个新节点,让你选清晰度,480P或者720P。选完点确认提取,等两分钟左右,深度视频就出现在画布上了,是个独立节点。

打开网易新闻 查看精彩图片

然后把这个节点连到下游的视频生成节点上,选模型、写提示词、生成。我这次全程用的Seedance 2.5,8秒,720P。

打开网易新闻 查看精彩图片

参考位上那个小方块就是深度视频,下面的提示词框从头到尾只有那五个词。右下角标着这次生成要花427积分——记住这个数,下面那条才有对照。

深度提取不花积分。 我跑了九次一分没扣,意味着同一段素材你可以反复试480P和720P,试错成本是零。

素材长度上,480P能吃三分钟以内的,720P是三十秒以内,做一个镜头够用了。

还有件让我有点意外的事。我顺手去问了画布自带的Agent,想让它替我把这一步跑掉。

打开网易新闻 查看精彩图片

它找到了节点、分析完了视频,然后告诉我这不在剪辑引擎的能力范围内,改推荐我用视频转绘或者关键帧提取。

所以这一步现在只有网页上手动点。对习惯把整条流水线交给agent的人来说,这里算是个断点。

直接参考和深度参考,差的到底是什么

为了让两边都能跑通,我先用LibTV生成了一段素材:穿红色运动服的年轻人在空旷体育馆里起跳转体落地,侧面跟拍带环绕。两组只差一个变量,一组直接拿它当参考,另一组先提深度再当参考,提示词、模型、时长、比例、分辨率全都一样。

打开网易新闻 查看精彩图片

第一行是原素材,第二行是直接参考,第三行是深度参考。

先说相同的:动作两组都跟上了,起跳、空中横躺、滞空、落地,四个时刻逐帧对得齐,所以「直接参考学不到动作」这说法在Seedance 2.5上并不成立,它学得挺准。

差别在质感。直接参考那组,人物像一个实拍的白衣人被贴在水墨背景前,脸和衣服还是照片的质地;深度参考那组,人物本身就是水墨笔触,落在宣纸底色上,整张画面是一幅画。

原因在前面那句话里:直接参考时模型看得到原视频每一个像素,皮肤的反光、布料的褶皱、顶灯的色温,这些外观信息它没理由不用;而深度图里没有纹理可看,它只能照提示词去造。所以被带走的不是红色运动服,也不是体育馆,是那段素材的拍摄质地。

还有个细节,直接参考那组的第三个时刻画面里莫名多出来一个人,深度参考那组从头到尾只有一个。这两条我只跑了一组对照,算不上定论,你自己试的时候留意一下。

深度图只管怎么动,长什么样得你从零写

这条是我这次最想告诉你的。

我做了个故意打架的实验:深度参考还是子弹时间那段翻滚,提示词我写成「一个人笔直站立不动,双手自然下垂,镜头完全固定不动,写实风格」。

结果前七秒,人老老实实跟着深度图翻滚,最后一秒才站直。动作和运镜这一层,深度参考赢了提示词。

但真正有用的发现在另一半:成片是一段纯黑白剪影。

打开网易新闻 查看精彩图片

我提示词里只写了「写实风格」,没给颜色、没给场景、没给材质,模型就顺手把深度图本身的黑白灰当成了画面。

所以这个功能的分工挺清楚:深度图管几何,提示词管外观,而且外观得你从零写满。你少写一样,它就拿灰度顶上一样。回头看我第一次那句「水墨风格,白衣剑客,竹林,宣纸质感,大面积留白」,五个信息点没有一个是多余的。

提一次,可以用很多次

深度节点在画布上是独立存在的,可以往下接多个生成节点。

打开网易新闻 查看精彩图片

这是我那张画布现在的样子。左上角是子弹时间原片,往下一个是提出来的深度节点,从它出发的四条线各自接着一次生成:水墨、冲突实验、像素游戏、粘土定格。画面里另外两段没接线的,是同一张画布上的别的素材。

打开网易新闻 查看精彩图片

第一行是深度图,往下依次是水墨、16位像素游戏、粘土定格动画。三个时刻的姿态全都对得上,连第三个时刻背景里站着的那个路人,三版都保留着——它带走的不只是主角怎么动,还有画面里有几个人、各自站在哪、谁在前谁在后,这些都是几何。

对做系列内容的人,这个用法比单次生成有价值得多,一段满意的动作可以存成资产反复用。

什么样的素材抽不出来

什么素材好用,其实从那张图记的是远近就能推出来:画面里得有明确的前后差别,而且这个差别得能从明暗上看出来。

回头看开头那八张图,效果最好的是《闪灵》那条走廊,纵深完整,三轮车和人的前后层次分明。

打开网易新闻 查看精彩图片

而《泰坦尼克号》那张逆光加海雾,两个人糊成了一团,边缘还有一圈黑色噪声条带;MJ的夜店群舞和《卧虎藏龙》的竹林更明显,背景整片塌成黑色,只剩人物剪影,动作还在,空间信息基本没了。

所以选素材真正该看的不是动作幅度,是明暗里有没有前后关系。 走廊、房间、有纵深的街道最合适;夜戏、逆光、大雾这几种,提出来大概率只剩一个影子。

最后

这两年我们对AI视频提的要求一路往里走:先是画面得好看,然后是人物得长得一致,再然后是镜头得听话。而这个功能干的事,是把一段视频里的几何——人怎么动、站在哪、镜头怎么走——从它的外观里单独抠出来,存成一个能反复用的节点。

它没让模型变得更聪明,只是在素材进模型之前,先把不该看的那部分删干净了。想多控制一点,办法是少给一点,这件事我觉得挺有意思。

功能已经上线,可以直接去试:

https://www.liblib.tv/