大家好,我是梧桉,这是更新的第406篇文章!

点击名片,一起拆爆款、建认知、破焦虑

大家好,我是梧桉。

最近网上很火的一个邪修 AI 视频玩法:不靠一大段动作提示词,靠的是把真人动作变成深度白模,再让 AI 角色参考深度白模生成视频。

以前做 AI 视频,经常卡在一些复杂动作上。画面能做得很好看,角色也能换风格,但只要一到打斗、舞蹈、武术这种复杂动作,提示词就开始不够用了。你想让两个人对打,一个出拳一个闪避,镜头还要跟着移动,写半天,模型最后可能只理解了个大概。

更麻烦的是,直接拿原视频做参考时,AI 学到的往往不只是动作。它会把原视频里的人物、衣服、背景、画风一起带进去。你明明只是想参考怎么动,结果它连长什么样也学走了。

这次我试了 LibTV 新上线的 深度动作捕捉。它的逻辑很简单:先把视频里的动作、走位、运镜和空间关系提取成一个深度参考,也就是大家看到的那种 3D 白模/黑白深度视频,再把这个参考接到后面的视频生成里。这样可以尽量避免参考视频中的人物、服饰、颜色、背景等信息污染新的片段。

PART 01

实测 4 个 case

这篇不单讲功能,直接把自己跑过的几个案例整理出来。

这 4 个 case 全部都在 LibTV 画布内完成,包括导入参考视频、裁剪片段、深度动作捕捉、高清处理、参考生视频,以及最后的口播智能剪辑(这个功能也挺实用,且不消耗积分)。

我主要想验证一件事:

这个深度白模到底能不能帮 AI 视频创作者解决复杂动作里的可控问题。

PART 02

Case 1:双人对打,最能看出动作参考的价值

第一个我跑的是双人对打。这个素材难度挺高,因为双人动作不是单纯一个人挥手。它里面有出拳、闪避、身体重心变化、两个人之间的距离,还有镜头对动作的跟随。

如果只靠提示词写,基本会变成这样:A 出拳,B 闪避,镜头跟随,保持打斗节奏。听着没问题,但模型真正生成时,很容易两个人粘在一起,或者动作顺序乱掉。

我先把双人对打视频素材拖进 LibTV 画布,选中视频后,打开「逐帧拉片」下拉菜单,选择 深度动作捕捉。处理完成后,画布里会生成一个深度动作参考节点。

打开网易新闻 查看精彩图片

这个白模视频不追求好看,它的作用是先把动作关系提出来。后面再拿它参考生视频,相当于给 AI 一个动作学习素材,让它看清视频中这两个人怎么动,而不是照着原视频的画面去抄。这个点对做 AI 短剧、动作分镜、武打视频的人很有用,因为复杂动作最难的就是空间关系。

Tips:参考视频最长支持 15 秒,如果素材太长,可以先在 LibTV 画布里裁成 15 秒以内的小片段,再转成白模视频。这个过程不用来回导入剪映再导出,能省不少时间。

打开网易新闻 查看精彩图片

把生成好的角色资产和白模视频片段一起接到新的视频节点里,再简单说明角色设定即可。

打开网易新闻 查看精彩图片

生成的打斗效果我挺满意的。这类动作如果全靠提示词写,差不多要写成小论文,抽卡也不一定能出来。我把原素材、白模素材、生成素材拼在一起,效果如下:

PART 03

Case 2:女生独舞,动作清楚比画面漂亮更重要

第二个跑的是女生独舞。舞蹈很适合测试深度动作捕捉,因为它的身体节奏、手臂摆动、转身、脚步变化都比较明显。只要动作线条清楚,白模出来以后,观众一眼就能看懂它抓住了什么。

但这里我也踩到一个小坑。如果参考视频里穿裙子,或者衣服遮挡身体太多,深度白模的效果就没那么理想。因为模型看不清楚身体边界,后面参考生视频时,动作也会受影响。

所以建议大家做舞蹈 case 时,尽量选动作清晰、身体轮廓明显、不穿大裙摆的素材。如果提示白模分辨率不够,也可以先在 LibTV 画布里高清处理到 1080P,再继续接参考生视频。

打开网易新闻 查看精彩图片

这一点我觉得挺实用。因为你不用把素材下载出来换软件处理,直接在画布里接着做就行。动作素材不是越漂亮越好,越清楚越好。来看效果:

PART 04

Case 3:武术动作,长视频先裁成 15 秒以内

第三个跑的是武术动作。武术素材的问题是动作快,身体姿态变化大。比如起势、转身、出掌、踢腿、收势,中间任何一段断掉,味道就没了。

这个功能对新手很友好。你看到一段素材,不用先去剪辑软件里切片,再导出,再上传。直接在画布内裁剪,选中片段,继续做深度动作捕捉。

跑完这个 case,我的感受是:深度动作捕捉最适合处理动作逻辑明确的素材。动作越干净,白模越清楚,后面的参考价值越高。

PART 05

Case 4:口播智能剪辑,把案例素材自动剪成一条视频

前面三个 case 解决的是动作可控,第四个我测的是 LibTV 的 智能剪辑 - 口播创作。

没有现成口播素材,所以我先用 AI 生成了一组 13 个 5 秒左右的口播片段,作为 A-roll,最后组合成一个 60 秒左右的视频。口播素材的内容主题就是:AI 视频最难的不是画面,是动作可控。

打开网易新闻 查看精彩图片

然后把前面 case1 的素材也加进去,当作 B-roll。也就是原始视频、深度白模、最终生成结果这些画面。接着在画布里添加智能剪辑节点,选择口播视频,把口播片段和案例素材都接进去,再输入剪辑提示词。它会先理解这些片段,再按照我的要求去设计剪辑结构。

打开网易新闻 查看精彩图片

这个过程我觉得比想象中更像一个剪辑助理。它不是简单把视频拼起来,Agent 会根据我选中的素材和剪辑要求做分析,先判断哪段是口播主线,哪段适合当素材插入,再做粗剪和精剪包装。像字幕、重点花字、BGM、素材穿插,都可以在这个流程里完成。

下面这整条视频基本都是 Agent 在画布里自动完成的,字幕、花字、素材都是自动剪进去的。

做教程号、测评号、科普号,或者电商卖货、直播切片,都可以先用这个方式做粗剪和包装,后面再人工微调。这个功能挺有用,因为我们平时最费时间的,经常不是生成素材,而是把一堆素材整理成一条能发的视频。

PART 06

感受

LibTV 让我比较有感的地方,是它把 AI 视频创作中几个很散的步骤放到一个画布里了。以前我们做一个案例,可能要先找参考视频,去别的软件裁剪,再上传到生成工具,生成完再下载,最后丢进剪辑软件。中间只要素材多一点,人就开始乱。

这次我跑下来,流程基本是:参考视频 → 画布内裁剪 → 深度动作捕捉 → 高清处理 → 参考生视频 → 智能剪辑成片。这条链路对内容创作者来说,比单个功能更重要。因为最后发布的是一条完整内容。

尤其是深度动作捕捉这个功能,它解决的不是让画面更好看,而是让人物动作、运镜和空间关系更容易被 AI 参考。说人话就是:你可以先让 AI 学会怎么动,再让它换成你想要的角色、场景和风格。

PART 07

给新手的几个小建议

第一,别一上来做长视频。先用 5 到 15 秒素材测试,动作跑通了再延长。

第二,素材动作要清楚。舞蹈尽量别选大裙摆,武术和打斗尽量选身体轮廓明显的片段。

第三,复杂动作要看空间关系。尤其是双人对打,不要只看姿势像不像,还要看两个人的距离、方向和节奏有没有保住。

第四,遇到提示参考分辨率低时,可以先在画布里高清处理到 1080P,再继续参考生成。

第五,生成完别急着结束。把原视频、深度白模、最终结果放在一起对比一下效果,这样才看得出功能到底有没有帮到你。

PART 08

一直觉得,AI 视频接下来拼的不是谁画面更炫,是谁能把流程控住。画面好看当然重要,但如果角色不听话,动作乱,镜头乱,最后还是很难做成一条真正能发的内容。

这次 LibTV 的深度动作捕捉,给大家一个比较实用的中间层:先把动作从参考视频里提出来,再拿去生成新的角色和场景。不需要复杂的提示词,直接点一下按钮就可以得到白模参考视频。

它不是万能的,也不是每个素材都能一次成功。但对于打斗、舞蹈、武术、跑酷这类复杂动作,它确实能少走很多弯路。

如果你也在做 AI 视频,可以先找一段 10 秒以内的动作素材试一下:看了不等于会了,重在实践。先跑通一个小 case,你就知道这个功能适不适合自己的创作流程。