大家做 AI 视频的时候,有没有遇到过这样的情况?

给了一段参考视频,本来只是想让 AI 学里面的动作和运镜,结果生成出来一看,

原视频角色发型或者脸部五官什么的都被一起带过来了,动作倒是参考到了,但片子也废了。。。

打开网易新闻 查看精彩图片

几秒钟的视频还好,大不了重新抽一次。到了二三十秒,事情就开始变得难受。视频越长,前后越要稳,中间只要突然冒出原人物的脸,或者服装、背景开始乱窜,前面好不容易做好的内容也很难接着用。

我最近看到了一个挺好用的邪修玩法。

先把原视频转成深度视频,再把深度视频交给模型生成新的视频。

打开网易新闻 查看精彩图片

这样处理以后,原片中的动作、运镜人物站位和空间关系还能留下来,人脸、衣服、背景和画风的干扰会少很多。我们给模型的参考变干净了,新视频也更容易做成自己设定的角色和场景。

就比如刚刚的视频,我做了深度视频,再参考这个深度视频去生成之后,明显人脸都更稳定了。

深度视频这个东西,我以前一般是把原视频丢到 Codex 里处理,等深度视频生成以后再传到其他平台继续做后面的内容。

每一步单独看都不难,但也确实有点麻烦。

然后前两天做素材的素材的时候,突然发现LibTV 悄悄更新了深度提取的功能,可以直接用了,

打开网易新闻 查看精彩图片

非常简单,把原始视频放到画布里选中,然后一键转成深度视频,

打开网易新闻 查看精彩图片

深度视频的画面会变成灰阶。人物和环境按远近与轮廓分层,谁站在前面,谁在后面,人物怎么移动,镜头怎样跟,这些信息还都能透过颜色的深浅轮廓呈现出来。但原人物的五官、服装纹理和场景色彩已经看不到了。

然后,再把新生成的深度节点接到后面的视频生成节点,再把需要做的人物或者场景连到新节点上,写好提示语,生成就完事了。

一次就得到了我想要的效果。

其实,我们平时说让 AI 参考一段视频,里面一般混着两类信息。

一类是想留下的,动作怎么发生,人物站在哪里,镜头朝哪边走,前后景怎样变化。

另一类信息反而会限制新视频,比如原视频中的人物是谁,穿了什么,身后的环境长什么样,整段片子的颜色和质感又是什么。

之前直接参考原视频生成是把这些东西装在一起交给模型,模型通过提示语只能自己猜该学多少。

但深度视频先做了一次筛选,让动态与空间信息更突出,也把人物身份和画面风格这些干扰信息去掉,出来的画面就会更准确。

我自己的感受也是这样,

视频生成的可控性,很多时候就是这样一点点抠出来的,我现在更倾向先让输入材料更明确,再去看模型能不能把后面的内容做好,比反复增加提示词省心。

毕竟,复杂动作和运镜也确实很难用文字说准。

一个人怎样转身,转到哪个位置停,镜头跟着他走还是留在原地,主体靠近镜头时前后景怎样变化。把这些全写进提示词,字会越来越多,模型读到的也未必和我们脑子里的画面一样。

直接用一段真实视频表达,信息完整得多。深度处理又把其中容易污染角色和画风的部分减掉,这样组合才有实际价值。

后面我又测了几个 case,主要想看深度视频究竟能参考哪些东西。

首先测了少人的追逐打斗,

这种片段的麻烦在于变化特别快。人物一边移动,一边出招和闪避,身体重心也在不停地换。单看某一帧很容易觉得差不多,连起来以后,速度和节奏只要慢半拍,打斗感就会减弱很多。

实际上能看到所有的场景和人物替换做的都很好,人物的动作重心、场景变化、镜头机位以及追逐感都复刻出来了,中间人脸都没有出现迁移原视频的画面。

接着我又试了试经典运镜的电影镜头,

主要是看人物慢动作、以及环绕拍摄的运镜方式能不能保留下来,我还做了一个画风的转换,

那看效果就能感受到了,无论是人物慢动作、切镜节奏,还是整个大环绕运镜镜头都1:1的复刻下来了,得出结论——运镜复刻没问题,全程在线。

最后一组测空间运动,

主要想看主体大小有没有跟着空间变化,位置移动是否一致,整个空间展开和收缩的过程能不能接住。

这组测试选用了我几年前很喜欢玩的纪念碑谷,那从结果来说也是基本复刻了这整个游戏的精髓,空间的开合基本没啥问题,暗黑金属的风格还挺酷的。

测到这儿时,我设想了一下,如果不用深度视频,我该怎么去描述画面右下角那个回型体快在每次移动时出现的回弹效果?

我想了10秒,就懒得想了,因为现在一个深度视频就解决了。

所以深度视频的使用,动作只是其中一部分,人物关系、镜头运动和空间变化,也能放进深度视频的测试范围里。

当然,深度参考也有自己的边界。

空间感明显、动作幅度比较大的真人视频更适合拿来做,因为远近层次和位移足够清楚,深度信息才有东西可以展现。如果是动作太小、人物几乎没有移动,或者画面本身是很扁平的动漫表达,处理完未必能带来明显变化。

顺着 LibTV 的画布再聊一个我最近顺手测到的功能,它还上线了智能剪辑里的口播创作。

打开网易新闻 查看精彩图片

因为我平时也有在做短视频,经常会录一些口播,其实真实的拍摄素材里就会有水词、停顿、重复和卡壳。但其实之前如果全流程用AI去处理口播的话,是先用一个Skill可以帮我把比较大段的停顿和重复剪掉、拼接,等到剪完之后还要再找skill去做一些花字动画等等,但现在LibTV里可以直接处理全流程了。

我把一段平时拍的原始口播视频放到LibTV的画布里,LibTV 会先理解素材,标出并去掉这些多余片段,给出一版粗剪。效果是这样的,基本上一些卡壳、重复、停顿都处理干净了。

然后我们确认内容和结构以后,画布里加入「智能剪辑」节点,选择「口播视频」,上传素材,写清楚希望怎样剪,再设置目标时长,系统就会唤起剪辑子 Agent 开始处理,接着做文字动画和动态花字,

然后继续审片。哪里不合适,也可以用自然语言让它改字体、调整元素上屏时间或修改剪辑起点。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

我很喜欢中间流程中粗剪确认和自动审片,

口播里的某句话听着有点磕巴,其实我们可能想保留下来,想留出一些人感。或者另一句话语法完整,放进整条视频却拖节奏想要删掉,或者中间可能有些重复表达AI并没有删干净,所以我们最好在精剪包装前看一遍,确认没问题再进行下一步。

再就是自动审片可以帮我先处理掉一大部分一眼就能看出来的毛病,减少我挑低级错误的时间,确实很省事。

自动化先帮我做完重复劳动,内容判断还靠我们自己,这个分工就比较舒服。

写到这里,我突然发现,

这次最让我舒服的,其实是工具更一体化了,

以前做一条 AI 视频,我的桌面上经常躺着一排名字差不多的文件。原片、深度版、生成版、重做版、最终版、最终版 2……浏览器还开着好几个页面,

脑子里得一直记着,哪段素材在哪儿,下一步又该传去哪里。

这活干久了,人真麻了。

现在一个工具就能做视频的这些步骤串起来,

深度处理、生成、剪辑、审片,这些原本散在各处的步骤都在慢慢靠到一起。

以后我们大概还是会同时用很多模型,也还是会经历失败和返工,但平台之间跳来跳去的感觉会越来越少。

这个变化听着没那么惊天动地,

但是真的在改变我们做东西的感受。

我会更沉浸在一个创作思路里,

不用分神考虑我需要变换哪些工具。

只需要想用什么能把我这段表达的更精彩,

就够了。

@ 作者 / 卡尔 & 阿汤

最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论

如果想要第一时间收到推送,不妨给我个星标

如果你有更有趣的玩法,欢迎在评论区聊聊

更多的内容正在不断填坑中……

打开网易新闻 查看精彩图片