作为一个爱唱歌、听歌的人,我也曾研究过AI歌曲和AI MV。

这几天又手痒了,就抽空做了一个Suno歌词创作技能,实现了在Suno无脑做歌。为了能用最新的模型生成品质更好的歌曲,还开了一个Suno会员。

有感于周杰伦《太阳之子》的叙事风格,我做了一首欧洲中世纪吸血鬼与狼人题材的黑暗哥特风格歌曲,感趣的兄弟可以听一听。

歌有了,但有点索然无味。这都6202年了,AI小说和AI视频都能霸榜了,不用AI做首MV就感觉自己不是研究AI的。

我决定要为这首歌做个MV,做完还能上传到好久没更新的抖音。

你看,人就是这样,喜欢向更高维度追求更美好的事物。估计等MV制作出来了,我还会想能不能把它扩展成一个AI漫剧。

打开网易新闻 查看精彩图片

要用AI做MV,首先得选个好用的视频模型。毕竟是自娱自乐,就没必要上高端大气的Seedance 2.5了。虽然它的指令遵从、长叙事、真人感都有大幅提升,虽然它的API也在火山引擎正式上线了,奈何预算有限。

不过最近Seedance2.0 Fast模型降价了,720P降到了0.6元/秒。据说不但效果接近Seedance 2.5,某些性能甚至压倒MiniMax的H3。

所以,就用Seedance2.0 Fast这个模型来搞这个MV,顺便跟H3做个对比,看看哪个模型更适合做MV。

我又构建了一个song to mv技能,增加了双端输出,把在火山引擎Seedance2.0 Fast模型的API和MiniMax的H3模型的API都设置好,生图模型顺便在火山引擎调用了seedream-5-0-pro模型。

倒是有即梦会员,为了让技能用起来更加丝滑,还是直接调用了seedream 5.0 Pro的API。以后有空了,再试试即梦的CLI。

我构建的song to mv是一个流程技能,只要把歌词输入进去,就能自动根据歌词生成分镜图片。确定分镜图片没有问题了,可以根据图片并结合歌词,生成分镜图片的视频提示词,然后调用模型API出双端视频。

这些操作是可以自动完成的,不过我们要进行一步一步的对比测试,所以咱们需要逐个来。

我用技能根据歌词生成11张分镜图片,也就是11个场景,接下来就用这些分镜图片来分别测试两个模型的能力。

S1、一致性、简单prompt图形补齐

第一个分镜视频,输入分镜图片S1和一张钱币参考图片,同样的提示词喂给两个模型,生成的视频如下:

点击右下角放大看全尺寸视频

这个视频,主要评测简单prompt在视频能否自然补齐,人物的脸与定妆照是否一致,银币稳定不漂移。可以看到,两个视频都实现了推镜头,最后实现人物的近景,发型、对装都保持的很好,也都有一定的粒子特效。

但是在妆容方面,Seedance2.0 Fast(后文简称Fast)从头到尾保持分镜图片中的人物妆容,实现了银币在手上翻转,镜头主体始终是人物。MiniMax H3模型(后文简称H3)生成的视频,镜头拉近以后妆容有些改变,人物一致性差了一些。

两个视频,最后的主体差不多都落到了银币上。H3来了一个背景虚化,重点给大家看银币。Fast却在最后几十帧时来了一个渐变,银币变成了手拿人物近景,银币和脸都给了特写,这种手法会给人以叙事感。

视频参数方面,Seedance2.0 Fast生成的视频分辨率为1280×720P,码率4833kbps,生成耗时166.9s。H3生成的视频分辨率为1344×768,码率只有1424kbps,生成耗时329.9s。当然H3也支持直接生成1280P视频,价格也会高一些。

本文中的评测视频,Seedance2.0 Fast默认使用720P,H3默认使用768P,这样才有可对比性。视频具体参数与前面说的一致,后面的对比不再赘述。

另外,测评用的视频要做成MV,每段视频的输入带上了一段歌曲音频,好在两个模型输入音频文件都不耗积分。

S2、人物与道具稳定性

分镜2主要是看人物、道具等的稳定性,其实跟后面的分镜10有些类似。

两个模型输入同样的提示词,再加上分镜图片和妆容、银币的参照图片,最后生成的视频如下。

点击右下角放大看全尺寸视频

可以看到,两个视频的角色一致性、道具一致性都是不错的。H3基本按照指令生成,人物把玩着银币从走廊一头走向另一头,墙壁图腾跟着点量。有点遗憾的是,丢失了开头一帧,人物直接就走起来了。

Fast模型有时候会不太遵从指令,但正式这种不遵从,造就了另一种故事感,顺便也把银币和妆容细节展示了一下,都很稳定。

S3、物理真实感

这个分镜,主要是检测下两个模型的物理真实感。比如金属反光、手指皮肤等等。同样的提示词喂给两个模型,再加来那个张图片和相关的定型照,最终生成的视频如下。

点击右下角放大看全尺寸视频

两个模型对于金属质感的表现没得说,币面纹理和金属光泽都在线,都很真实。当然手指皮肤也很真是,应该是提示词的原因,导致这厚涂二次元的风格出现了真人手指皮肤,倒是都很精致和真实。

区别是Fast一边摸银币一边拉镜头,镜头最后落点到分镜图片,等于是把它动作尾帧来处理。最后人物不是摩挲银币,而是拿着银币望向天空,带有一种故事感。可惜中间直接用了个特效翻转了银币,如果是翻转就更真实了。

H3生成的视频,主角就用手指一直在那摩挲银币,摸啊,摸啊,一只摸到最后,全程对面有张僵硬的脸在那看着,中间还用蒙太奇手法,银币后面出现了月亮外景。

前者有故事有叙事,后者更真实但有点亡灵气息,大家可以根据需要选择。

S4、长镜头与表情

镜头4主要为了看看两个模型的长镜头表现力,比如人物的表情是否自然等。相同的提示词喂给两个模型,主要是要求这个视频有旋转运镜。

两个模式生成的视频如下。

点击右下角放大看全尺寸视频

Fast模型生成的视频保持了90度旋转,因为为了三张不同角度参考图,反而造成了运镜有一些卡顿,有点剪辑感,整体一致性保持的非常好,表情也维持的很好。

H3模型生成的视频只有了分镜图片,旋转运镜反而更流畅,当然它把指令也理解成了360度旋转镜头。镜头旋转到最后,侧面人脸些许变形,整体一致性还不错。

在服装方面,因为分镜图片时黑色的啥也看不清,所以后面的服装就靠模型自己脑补了。在画质和光效方面,相对要更柔和一些。

S5、物理真实感

这个分镜设计了一个复杂的动作,让主角吸血鬼来一段动感舞蹈,看看它的物理真实感,顺便看看节奏是否同步。

两个模式生成的视频如下。

比较来看,Fast生成的视频更有舞动感,人物是在跳舞,脚下的光点符合物理表现,并且大差不差的能卡上鼓点,360度旋转让镜头更有节奏感和感染力。美中不足的是,拿到手里的大银币,到了手里就消失了。

H3中的人物不是在跳舞,更像在摆pose,动作略略显僵化,不过pose确实很帅。至于动作卡鼓点,是半点也没看出来。光电特效,符合物理规律。视频也用了旋转运镜,整体的电影感还是有的。

S6、文字表现

分镜S6让两个模型在视频中生成一句话歌词,一是看看中文字在视频中的表现,二是看看歌词能不能卡时间轴,再就是看看角色的一致性会不会因为出现文字而崩掉。

同样的提示词给到两个模型,下面生成的视频。

点击右下角放大看全尺寸视频

可以看到,两个视频都出现了字幕,但都没有在正确得到时间点出现歌词,没与人声对齐。

H3的歌词文字在第一句时就出现了,Fast的歌词文字在第二句和声时出现的。文字还算清晰,就是有点糊,好像有了某种提效,其中Fast的歌词中 盟 字错了。

两个视频都用了推镜头,最后给吸血鬼面部特写,相对分镜图片的人脸,都有不同程度的变现,妆容一致性受到了影响。

这应该也跟这个视频只用了分镜图片,没用定妆照进行参考有关系。

S7、长指令执行与双角色稳定性

分镜7也是要生成双角色视频,使用两张分镜图和一段比较长的结构化提示词,生成画面动作细节更丰富的画面。

两个模型生成的视频,如下。

后面有分镜8,点击右下角放大看全尺寸视频

可以看到,两个视频基本都遵从了指令,按照时间节点,从中景推近到了头部特写。

只是H3在镜头推进过程不很流程,视频1/3处突然切成了全景镜头,还出现了燃烧蜡烛的画面,缓慢推进着突然又切成头部特写,有很强的剪辑感,应该是卡了提示词的时间节点强制执行。

两个视频的电闪雷鸣也都实现了,就是月亮仍然还在,这种情况应该是所谓的只有头上一块云,哈哈,两个模型的想法很一致。

冷风吹过两个模型也都做到了,H3的寒气从窗口沿着地上吹,细节表现更好一些,同时窗外还有下雨的细节,只是天上还有月亮啊,可谓奇观。

最后狼人的发狠细节,一个表情狰狞流下了口水,一个张大了嘴巴。哪个更真实一些,我就不说而来,大家可以主观判断,

整体上,对于结构化指令,两个模型都完成的不错,只是运镜有所差异。两个角色在视频运镜中比较稳定,侧面脸也没有太大的妆容变化。

S8、720P vs 2k 视频质量

镜头8主要看看Seedance2.0 Fast的720P视频与MiniMax H3的2K视频质量差距有多大。同样的提示词,分别用两个模型生成720P和2K,视频见上面分镜7-8。

不得不说,H3生成的2K视频在细节方面确实增加了很多,视频看起来也更细腻。比如背景中时刻在动的云和闪电,还有人物在进入中景后头发就开始飘动。

有意思的是,月光出来的时候正好卡上“月光穿云照”这句歌词,不知是因为巧合,还是因为它参考了歌曲音频。美中不足的是,运镜的时候稍微有点抖动,略卡。

Fast生成的视频,背景基本是静止的,只有一只蝙蝠在缓缓飞行,主角的头发是在进入近景之后才开始飘动。画面云层、光影包括建筑细节略显锐利。

但是在视频的平滑度上,我感觉Fast的镜头过度也很自然,不输于H3。

S9、连续叙事

第9个分镜是吸血鬼与狼人对峙的视频,对人物一致性的要求相对高一些。但这个分镜主要考察连续的叙事,比如动作逻辑是否合理等。

输入的物料只有一张图片,还有几张参考人物参考图片,下面是生成的视频。

后面有分镜10,点击右下角放大看全尺寸视频

可以看到,两个视频在妆容、服装的一致性上保持的不错。但在动作上就有了明显不同,H3模型生成的视频,两个人物始终处于对峙状态,然后加了一个旋转运镜,人物位置保持的不错,没有乱跳,月亮等景物稍有变化,场景一致性基本保持住了。

Fast模型生成的视频,为两个角色添加了很多动作,人物在对峙时有位置的移动变化,整个视频中两个角色都在移动。镜头主要是左右移动和拉远视角,最后又推到两人的表情特写。人物一致性和场景一致性很稳定。

但有两个动作出现了跳动:一是人物开始左手拿剑,走了几步忽然变成了右手拿剑;二是角色对峙转动位置,狼人和吸血鬼背影重合后,两人突然变换了位置,变成狼人背影对着镜头。再继续转,两个人的位置就没问题了。这倒不算什么硬伤,剪辑中很好处理。

对比两个视频可以发现,在15秒视频中,Fast的对峙叙事相对更连贯一些,没有断裂点,让观众能看到两个人的动作及心理表现,最后还有表情的加入。动作逻辑基本合理,不足的就是有两处动作跳转。

不过瑕不掩瑜,整体表现要比H3好上一些

10、道具一致性

第10个分镜,为了适应歌词意境,加了一段银币的多角度展示。其实在第一个分镜就有展示,这里通过近景和特写展示金币的细节。视频见上面分镜视频9-10。

可以看到,两个视频都保证了人物一致性和道具一致性,体现出了金币的金属质感,图案图形完全符合参考图,都展示出了银币的细节。道具的多角度一致性都完成的不错。

区别是Fast更注重道具的展示动作,多了一次银币的旋转;H3则更强调细节,最后几十帧画面给了一个超近的大特写。

但在视频的开头,H3犯了一个低级错误,人物左手拿着银币,就像变了一个魔术,在右手抛出了金币,不符合物理规律。

对于抛到空中的金币,Fast的镜头跟进银币,从上移到推进放大金币,画面过渡更加自然,镜头更合理一些。H3则更像剪辑,突然就切到了银币的特写。

这种道具表现和自然过渡,非常适合电商场景中的商品展示。

S11、多模态与动作迁移

最后为了让MV好看,再来个跳舞视频的参考输入。图片、舞蹈视频、歌曲片段同时输入,让人物跟着舞蹈视频跳舞,再次测试下两个模型的多模态输入和动作迁移能力。

在技能中调用API费了很大的劲,也没能正常输入运镜的参考视频。所以,这个分镜分别在即梦和海螺调用两个模型生成了以下视频。

这个视频,中间是输入的真人跳舞视频。对比起来,人物一致性都保持的可以,看到Fast模式的人物舞动动作基本遵循原视频,标准完成了动作迁移,没有加太复杂的运镜。

H3就完全自由发挥了,没有按照原有视频生成舞蹈动作,也加了很多运镜配合人物的舞蹈动作,舞蹈很丝滑,整体看起来很有电竞镜头感。

但想要在视频中尽量保持输入的舞蹈动作,Fast更适合一些。

把这些分镜视频在剪映中合成一下,Seedance 2.0 Fast生成视频攒的半成品MV是这样的,来感受一下。

前面只做了两个模型的功能维度的评测,再来聊聊它的成本。这里我先贴一下两个模型的参数和价格对比。

打开网易新闻 查看精彩图片

Seedance 2.0 Fast降到0.6 元 / 秒,综合性价比还是不错的。我生成这11个720P的分镜视频都是15秒的,Fast大概8-9元一个视频,H3生成的768P视频大概7-8元一个视频。但是Fast的抽卡次数要少于H3容易,总体费用还是低一些的。

这11个分镜从抽卡到合成整体视频,从调试API开始调用Seedance 2.0 Fast大概耗了578万token,总成本在180元左右。多耗费的一些,主要是开始的模型测试和后面分净土有问题耗费了一些,实际用于抽卡的费用还要低一些。

150-160元左右的成本能制作一个MV,这个性价比还能接受。

现在视频模型的价格都不算便宜,一些朋友总问我要不要搞本地部署。

本地部署的话,搞一个起步级的4060显卡+32G内存。就现在这行情,动辄要1W+起步,还需要Webui\Comfyui以及拉取各种本地模型。自己不懂得话找人部署和调试服务又是一笔费用,可能部署完还需要交个学习的费用。

其实相对于本地部署,直接调API算是比较划算可。不用怎么考虑设备配置,用最便宜的笔记本都能把这活儿干了,如果再配合即梦等平台的打折月付会员,费用可以控制的更低。

配合客户端应用开箱即用,配合各种技能还能实现自动化出视频。

像我构建的这个song to mv技能,已经实现了全自动出两个模型的双端视频。当然现在还欠点火候,必须要人工审核分镜图片之后才能出分镜视频,用有问题的分镜图片出废视频,就是白白的浪费了。

好了,关于这两个模型的评测,就到这里了。后面我把这个MV搞完,大家有空可以到我的抖音或者视频号瞅一瞅。

看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。