大家好,我是袋鼠帝

我最近在某音上刷到很多 ”AI 也有演技了”的视频,而且点赞量贼高。

网友直呼AI进步太快,演员都达不到这个水平,还有个评论说:"理科生联手文科生抢走了艺术生的饭碗"。

确实,AI视频对演员的冲击还挺大的,我之前经常刷的一个横店跑龙套的博主“张二要自律”,他都说横店现在也开始慢慢落寞了。

AI 的演技到底到了什么水平?刚好 Vidu 上线了新一代视频旗舰模型 Vidu Q4 的首个预览版:Vidu Q4 Preview。

我看了一下官方给它的定位是「传神表现力」,主打人物演技更细腻、镜头更有张力、特效更有冲击力。于是,我第一时间专门测了测它的演技。

首先,我用 Vidu Q4 Preview 复刻了新海诚《你的名字》真人版的最后一幕,效果比我预想的好不少。1080P 直出,光影和人物动作都很有电影感,连日语台词配音都是模型一起生成的。

特别是这个 BGM 我超喜欢,当这个旋律再次响起,配上这个画面,再到结尾,仿佛又找回了大学时第一次看《你的名字》动漫版的那种感动。

然后是,让同一个美女用五种不同的情绪跟你说:“我喜欢你”,准备好接受表白了吗

这情绪拿捏的非常到位啊。说实话,那些年轻的靠脸吃饭的演员真可以跟AI学学演技。。

整体体验下来,Vidu Q4 Preview 有这几个让我眼前一亮的地方:

演技非常传神:表情细腻、情绪饱满、动作自然,同一句台词能演出完全不同的感觉。

形声入戏:最多支持 3 段参考音频,角色音色稳定统一;最多 15 张参考图,人物、道具、场景都能组合进同一个创意。

画质拉满了:除了 720P、1080P,还能直出 2K、4K,单次最长 16 秒。

价格是真香:0.09 元/秒起,同样的预算最多能多拍 5 倍的戏,我只能说,普通人终于能玩得起AI短片啦!

ok,话不多说,直接上教程。

PS:结尾有彩蛋哦,还分享了另外两个有趣的玩法(以及两个Skill)。感兴趣的朋友自取~

1、复刻《你的名字》真人版最后一幕

看过《你的名字》的朋友,应该都记得最后那一幕:两个人在楼梯上擦肩而过,走过去之后又回头,问出那句“你的名字是?”

这次我用 Vidu Q4 Preview 把这一幕拍成了真人版,整条1分33秒。

整个视频长达1分半钟,整体画面效果还是非常不错的,平常看习惯了 720P 清晰度的AI视频,这次 Q4 Preview直出1080P的画质看起来真的如同看蓝光高清电影一般。而且 Q4 Preview 这次对于人物运动、光线照射和阴影效果都十分优秀,真人角色的表演也十分到位。

目前Q4 Preview 最高能直出 2K 和 4K的视频,要上大屏的片子可以直接选更高的分辨率。

打开网易新闻 查看精彩图片

具体怎么做的?

制作这类复刻动画转真人电影的AI视频,第一步是要找想要复刻的动画原片视频下载到本地,然后导入视频剪辑软件中,导出原片中每一个关键分镜的静态帧画面。因为原片中的分镜构图和运镜已经做的很好了,咱们只需要直接拿原片的分镜截图进行转换复刻真人版的分镜即可。

打开网易新闻 查看精彩图片

第二步:准备好两位主角的真人版人设图(可以在vidu人生图里面生成)。

打开网易新闻 查看精彩图片

如果担心每个镜头生成的声音不统一,可以给角色上传参考音频。Q4 Preview 最多支持 3 段参考音频,同一个角色的声音就能稳定下来。

打开网易新闻 查看精彩图片

第三步:将真人版人设图和动画原片分镜截图一起发给生图模型。

注意这里的提示词不能简单地说“将动画分镜转换为真人拍摄镜头”这样出来的效果可能会不太理想而且没法统一每个分镜的色调和画面质感。

打开网易新闻 查看精彩图片

这里关键的转换风格提示词可以参考这样写,把下面【】中的文字替换为你想要的画面风格效果即可:

将动画分镜截图重新拍摄为【2020年代高预算日本现代青春爱情电视剧】的真人实拍分镜剧照

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

这样就可以得到非常接近真人实拍电影质感的分镜图。

打开网易新闻 查看精彩图片

最后就是把生成好的分镜图上传到 Q4 Preview图生视频模型中,参考动画原片的剧情生成相应片段的提示词。

最后用「参考生视频」模式一个个生成,再剪到一起。

打开网易新闻 查看精彩图片

另外,这里角色的日语台词配音也是 Q4 Preview 根据参考图和提示词内容生成的,配音效果相当贴合角色的形象气质,声情并茂,看着听着完全不会出戏 ,实测下来非常适合用来生成仿真人类型的AI短剧。

2. 同一句“我喜欢你”,五种情绪(附skill)

成片:

同一个角色,同一句“我喜欢你”,用五种不同的情绪说出来。有害羞、委屈、故作淡定、情绪崩溃、心灰意冷。靠的都是细节:动机+眼神+呼吸+脸部+身体+声音+收尾=一个完整情绪。

Q4 Preview 在这些微表情和语气上处理得挺细,1080P 下皮肤、头发的质感非常接近实拍。

五段视频里能一直保持同一个人,靠的是参考图。

Q4 Preview 最多能放 15 张参考图,不过我这次只用了一张参考图,分别去跑的,五段跑下来脸完全没变。声音也一样,配上参考音色,五段的音色是统一的,变的只有情绪。

怎么做?

这个视频最难的其实是写提示词。像“他很伤心地说我喜欢你”这种写法,AI基本演不出来。你得告诉它,伤心的时候眼睛在看哪、手在干嘛、说到哪个字停一下。

打开网易新闻 查看精彩图片

这部分我做成了一个「情绪表演」skill(emote-skill)。

你可以把它发给豆包工作、WorkBuddy 或者 Codex 装上,告诉它角色要说什么话、心里是什么感受,它就会把情绪翻译成AI视频能看懂的动作和表情描写,复制到 Vidu 里就能用。

skill开源到GitHub了(我的导演Skill合集),可以直接把链接丢给Agent安装:

https://github.com/kangarooking/director-skills

打开网易新闻 查看精彩图片

3. 魔法学院学生骑扫帚撞上了限高杆

前面两个是文戏,这次来点动作戏。

设定是这样的:一个哈利波特世界观里的魔法学院女学生,骑着扫帚在中国南方一座城市的商场门口低空飞,结果光顾着冲镜头比耶,一头撞上了地下停车场入口的限高杆 整条按路人用手机偶然拍到的伪纪录片来做。

A版

B版

这类视频最近在X上还挺火的,难在动作要连贯。飞过来、撞上、和扫帚分开、摔到地上,前后得对得上,不能还没碰到就弹开。

镜头也得像个路人在拍,手持跟拍,看到人摔下去,镜头慌慌张张往下摇,失焦一下再对上。声音这块,路人喊的那句“小心”,撞上横梁那一声金属响,Q4 Preview 也一起生成了出来。

上面放了 A、B 两个版本,是同一套提示词跑出来的。

说实话,这种带复杂动作的视频,基本都得多跑几次挑最好的。就像导演实拍也要多保几条,选一条最合适的。

这时候价格就很关键了。Q4 Preview 首发 0.09 元/秒起,3分钟的视频只要16元。这次真是普通人也能玩得起了。

怎么做的?

用的是「参考生视频」模式。女学生的形象是图1,扫帚是图2,提示词里用 @图1、@图2 指定谁是谁,人物和道具就不会跑偏。

打开网易新闻 查看精彩图片

提示词写得比较长,但结构并不复杂:

我给大家拆解一下,先写人设、道具、画面风格和场景,再按时间轴把 0—3 秒、3—6 秒、6—10 秒分别发生什么写清楚,最后加一段全局约束,比如一镜到底、不切镜、必须完整拍出撞杆过程。动作越复杂,越要按秒拆开写,AI才不容易乱。

完整提示词放在下面,可以直接拿去改,换个人物、换个场景,又是一个新脑洞。

提示词参考:

一镜到底,拍摄场景为2020年代中国南方一线城市 CBD 商圈,一段由普通路人使用新款 iPhone 手机后置主摄偶然拍到的离奇现场视频:一名《哈利·波特》系列世界观启发的英伦魔法学院女学生,骑着同一世界观下的传统飞行扫帚低空飞行,经过商场地下停车场入口前的地面道路与车行引道区域时,因未注意前方障碍,正面撞上固定钢制限高架横梁,随后失去平衡,从扫帚上摔落到地面。
整体为现代手机纪实拍摄感、真实偶发现场感、轻微荒诞但不夸张。不出现手机本体,不做影视分镜式剪辑,不使用多机位。
人设
一名英伦魔法学院女学生@图1:年轻成年女性,白皙肤色,脸型小巧,五官清秀自然,神情安静、聪明,略带学生气。 发型为深棕色长发半披半束,发丝自然蓬松,有细碎刘海与鬓发。 整体服装体系与气质: 白色衬衫、深灰针织背心、酒红与深色条纹领带、深灰百褶短裙、黑色学院长袍、及膝深灰袜、黑色皮鞋,肩背旧皮质斜挎书包。整体气质是英伦寄宿制魔法学校学生,飞行时头发、领带、袍摆和裙摆会被气流向后吹起,衣物有真实重量,不是轻飘烟雾感。
道具
相同世界观风格的传统木质飞行扫帚@图2: 细长天然木质扫帚杆,表面可见木纹、手工打磨痕迹与轻微磨损;尾部为扎束式枝条刷尾,收束整齐,带有低调皮革缠带、金属箍环和实用加固结构。整体造型轻巧、结实、可信,具有英伦魔法世界传统工艺感。女学生以常见骑乘方式跨坐在扫帚上飞行,扫帚与身体同步移动。
画面风格
整体成像应符合最新款 iPhone 后置主摄纪录突发现场的视频观感:画面清晰度较高,细节比老式 DV 更锐利; 色彩自然真实,略带手机 HDR 的高光压制特征;白天城市环境光线干净,中性略暖,不做浓烈电影调色; 玻璃幕墙、浅色混凝土、金属栏杆和车辆漆面会有现代城市真实反光。快速摇拍时允许出现轻微运动模糊、滚动快门造成的轻微形变、自动曝光快速调整、对焦短暂漂移。整体仍以普通人偶然拍到不合理事件的真实感为核心。
场景
2020年代中国南方一线城市 CBD 商圈地面环境,地点是大型商场或综合体外侧的地下停车场入口前方道路与车行引道区域。 周围环境应明显体现现代一线城市商业区特征:玻璃幕墙商场外立面、整洁的人行铺装、城市绿化带、现代路灯、停车场导视牌、地下停车场坡道入口、混凝土挡墙、交通标线、减速带、路缘石、广告灯箱、少量停靠或驶过的轿车、SUV、新能源汽车。 画面中可见清晰的停车场识别元素,如地下停车场入口``P标识、车行箭头、限高标识牌等。在停车场入口前方立着一座固定钢制限高架,两侧为粗钢立柱,横梁横跨车行引道,属于商场地下停车场前常见的固定限高设施。横梁离地高度应符合现实城市地下停车场入口常见尺度,约 2.2—2.4 米,表面可有黄黑警示漆、轻微磨损和日常使用痕迹。现场不安排围观群众特写,不重点拍摄其他人的反应,画面重点始终是女学生飞行—撞杆—坠地的完整过程。
飞行路线与障碍关系
女学生骑扫帚沿着商场外侧道路和车行引道方向低空飞来,高度略高于正常车辆车顶,约 2.4—2.8 米。 她飞入停车场入口前方时,因注意力分散,没有及时观察前方的限高横梁。画面需要明确让观众看懂: 限高架是固定存在的高位障碍物,扫帚飞行高度不足以安全通过。她本可以提前降低高度、减速或绕开,但因为飞行中分神,没有及时规避,导致与横梁发生清楚明确的碰撞。人物、扫帚、限高架、车辆与环境尺度关系始终稳定可信。
拍摄方式
摄影者是一名在商圈地面道路附近路过的普通人,使用最新款 iPhone 后置主摄手持横向拍摄。机位为正常成年人站立高度,拍摄者站在停车场入口外侧不远处,拍摄者的位置固定不动,只用过摇镜跟拍骑飞行扫帚的女学生。使用智能手机主摄的自然透视与成像逻辑,接近 24mm—28mm 等效广角,但不过分夸张变形。
画面具有明显的手机视频现场感:手持跟拍、轻微自然抖动、自动曝光与自动对焦反应、轻度数码锐化、HDR 高光控制、快速摇拍时少量运动模糊与滚动快门感。 全程为同一镜头连续拍摄,不切镜、不插入慢动作。
画面内容
【0—3s:路人偶然拍到低空飞行】
开场是商场外侧地面道路与地下停车场入口周边的日常构图,首帧为空镜,画面中能看到现代 CBD 商圈环境、停车场入口标识与部分车行引道。摄影者原本随意拍摄或记录现场,一名英伦魔法学院女学生骑着扫帚从画面左侧低空快速飞行入镜,速度明显快于正常步行与骑行,但不是超高速特效冲刺。 她从现代都市商业环境中掠过,形成强烈反差。她的长发、领带、袍摆、裙摆随气流后扬,书包在身体侧后方轻微摆动。摄影者站在原地摇镜跟拍,摄影者明显被这件事吸引,构图不够完美,主体偶尔偏离中心后再修正。
【3—6s:摄影者先看到障碍并紧张呼喊小心,随后女学生撞上限高架】
摄影者继续手持摇镜跟拍,女学生飞行方向前方的停车场入口限高架此时进入画面。摄影者先意识到危险并用紧张焦急地声音对女学生喊出小心!。 但女学生没有留意前方障碍,她此次正侧头望向镜头并举手向镜头比耶手指,导致没有及时减速或低头避让。随后她与固定钢制限高架发生清楚可见的碰撞,她的头部上缘撞到横梁,同时扫帚前进动作被打断,发出清脆而结实的金属撞击声。 碰撞后,她身体猛然失衡,向侧后方被甩开,与扫帚分离。同时失控下坠落地的扫帚因惯性继续沿原本前进滑出一小段距离,限高横梁可有极轻微震动,但不会断裂、倒塌或夸张晃动。不能出现人物提前穿模,不能出现尚未接触就被弹开。
【6—10 秒:摄影者慌忙下摇镜头,拍到女学生坠落与落地】
摄影者迟半拍反应过来,手忙脚乱地向下摇镜追拍,画面出现自然的手持晃动与短暂失焦。女学生从扫帚上脱离后连续坠向地面,身体侧转,头发与袍摆翻起。 她重重摔在停车场入口前方的混凝土地面或车行引道边缘,肩背或身体侧面先着地,然后顺势翻滚半圈或一小段,衣物散落贴地,扬起少量灰尘。落地动作要有真实重量和冲击感,不缓慢飘落,不卡通弹跳。 摄影者的镜头下摇短暂拍到地面或偏离主体,再重新抬回到倒地人物身上。自动对焦短暂迟疑后恢复清晰。扫帚则落在她前方数米位置,方向应符合之前继续向前滑出的惯性轨迹。女学生没有昏迷,她痛得皱眉,先缓一下,再用手撑地坐起,另一只手摸额头或后脑,神情懊恼、狼狈。 她抬头看向高处的限高架,意识到自己是因为没注意障碍才撞上去。
全局约束:全程一镜到底,手机后置摄像头现场拍摄感,现代中国南方一线城市 CBD 商圈真实环境,明确是商场地下停车场入口前的固定钢制限高架 主体必须是英伦魔法学院女学生骑飞行扫帚。必须完整呈现飞行接近—撞上限高架—与扫帚分离—坠落摔地的连续因果过程。

4、国庆拍的旅游照片,做成一条文旅宣传片(附skill)

这是用 6 张澳门旅拍照片做出来的文旅样片:

国庆刚过,大家手机里应该存了不少旅游照片。与其让它们一直躺在相册里,不如做成一条像文旅宣传片那样的视频,发朋友圈也好看。

打开网易新闻 查看精彩图片

素材就是上面这 6 张照片(为了演示,这几张是用AI生成的,换成你自己拍的照片一样能用)。每张照片当首帧,用 Vidu Q4 Preview 各生成一段,最后拼起来。

打开网易新闻 查看精彩图片

风景类视频,清晰度很重要。Q4 Preview 除了常规的 720P、1080P,还能直接选 2K、4K。以前我不太敢用高分辨率,主要是贵;这次首发价格压得很低,0.09 元/秒起,2K、4K 也是几毛钱一秒,可以放心多抽几次卡。

这次是用照片当首帧,所以选「图生视频」。我的经验是一次只传一张照片、一段一段生成,效果最稳,提示词也最好写。

打开网易新闻 查看精彩图片

成片里可以注意一下细节:香火的烟、被风吹动的灯笼和树叶、水面的倒影,都挺自然,颜色也很正。拿第一个镜头举例,我的提示词是这样写的:

首帧0秒镜头聚焦前景石碑和石砖路面,远景处天后宫和庙宇深度虚化处理,香烟轻柔漂动,树叶和灯笼随微风自然轻动;约2秒后镜头焦点缓慢移焦至远景处天后宫和庙宇,前景石砖路面逐渐虚化。
打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

生成视频中的运镜也非常准确地实现了提示词中要求的“移焦运镜”的拍摄效果。

为了让大家少走弯路,我把这套做法整理成了一个「文旅宣传片导演」skill。同样是发给豆包、WorkBuddy 或者 Codex 装上,然后上传你的旅游照片、告诉它拍摄地点,它会给你一套分镜方案和每一段的视频提示词。照着提示词一段段丢给 Vidu 生成就行,没剪过片的人也能做出来。

skill 文件在这里:

https://github.com/kangarooking/director-skills

打开网易新闻 查看精彩图片

「最后」

体验下来,我对 Q4 Preview 印象最深的还是演技。同时运镜也很稳,画面质感好。

前两年大家聊AI视频,聊的是动作是否连贯、人会不会变形、手指对不对。

现在这些问题好了很多,大家开始挑更细的毛病:这个角色演得像不像,台词有没有感情,镜头有没有节奏。AI视频确实往前走了一大步。

还有就是价格。做AI视频的朋友都知道,好片子基本是抽卡抽出来的,同一个镜头跑五六次很正常。模型再好,一秒好几块钱,大部分人也舍不得多试。0.09 元/秒起这个价格,对我这种要反复试的人来说,确实香。

当然,它毕竟还是 Preview 版。我挺期待正式版能做得更好。

国庆刚过,相册里的照片、脑子里一直想拍的画面,都可以拿来试试。成本低,完全可以多尝试~

你最想用AI拍一个什么样的片段?欢迎评论区聊聊~

我是袋鼠帝,一个致力于帮你把AI变成生产力的博主。我们下期见~

能看到这里的都是凤毛麟角的存在!

如果觉得不错,随手点个赞、在看、转发三连吧~

如果想第一时间收到推送,也可以给我个星标⭐

谢谢你耐心看完我的文章~