今年的8月,热潮属于视频模型。
最近,除了备受关注的Seedance 2.5,还有Flux 3.0、Minimax H3、Wan 3.0、Sand.ai、Grok Imagine Video等等,集中发布。
像被人按了快进键,让我想起2023年大语言模型疯狂发版的夏天。
只不过这次换成了视频生成。
先看Seedance2.5的成片效果。
光影质感、细腻程度,人物眼神的表现力,虚实变焦的的呼吸感,Seedance 2.5处理得相当自然了。
在电影级质感的长片生成、多参考对象等要求更可控的专业场景中,Seedance 2.5的实拍级效果,可以说独一档。
但除了Seedance 2.5以外,我发现其实还有不少模型,有着不错的水准,性价比更高。拥挤的发版季,我们来盘盘性价比之王。
我选了国内 720P 画质下,同一价位的几个模型,今天就来实测一下。
01
选择的有三款模型:MiniMax H3、Seedance 2.0 fast、Wan 3.0。
都是最近人气很高,而且最有口碑和关注度的,拿他们跑了几轮同题对比测试。
测试方法很简单:用同一组提示词、同一组参考图,分别让三款模型生成,然后对比输出质量、稳定性、生成速度和成本。
先说结论:
Seedance 2.0 fast生成速度很快、画质细节好,实际表现最接近Seedance 2.0,抽卡率也最少;
MiniMax H3擅长动效,但有些高精度场景会失真;Wan 3.0较为均衡,但亮点不突出。
像下面这组案例,我主要关注的,是人物动作细节、人物之间的复杂互动、以及是否有不符合物理逻辑的地方。
最左边是H3。它的优势在于画面字体和后期能力。
面对复杂指令时,H3倾向于少拓展,但保住视觉完整性。像这个功夫足球主题的片段,对运镜精度有严格要求,H3的意图理解和场景设计相对一般。
2.0 fast的人物一致性保持和表现力最强,运镜和人物动作也最符合物理规律。在提示词理解方面相当精准,只生成一次就能完整呈现指令中要求的全部运镜和画面内容。
同时,2.0fast的生成速度最快,仅用了一分钟就可以生成5秒画面,2到3分钟可以生成10秒视频,不用排队。
Wan 3.0在这一组测试里和H3接近,动作更夸张一点。
02
再给大家看一组:动画视觉短片,包含了趣味性的剧情理解。
H3的饱和度稍高,画面更明亮,但有种小参数视频模型的伪人感;
2.0 Fast会让我不由自主想起他们家的2.5,也是营造的那种电影叙事光影的感觉,看起来比较有味道,但是细看玻璃会有点小瑕疵;
最后的Wan 3.0完成度也不错,但在人物和场景的设计上,这一次明显逊于前两者。
如果是论情节的展开,画面逻辑的匹配,故事的连贯性和戏剧性,我会觉得Seedance 2.0 fast明显更好。
比如这一组小猫捞月亮,希望是在小猫把水里月亮捞起来的那一刻,天空变暗,大的月亮消失,有种让人意外的感觉。
这一点H3和Wan 3.0表现的都不太到位。
这一组里,Seedance 2.0 fast也是抽卡次数最少的,一次性就有了很高的完成度。
03
这一组是「中式美学」主题。
提示词:
一个辉煌悬浮的天宫,中式美学,太空宫殿,辽阔苍茫,有云海有望不到尽头的建筑和无尽的阶梯,仙人居住的地方
最上面的MiniMax H3,比较有科幻感,但有点像是短剧的画风,不够唯美。
Seedance 2.0 fast还是那个全能型选手,画质、速度、风格的保持和延展,各方面表现都不错。
Wan 3.0这次生成速度很快,运镜看起来也挺舒服,画面有种似曾相识的感觉,像游戏场景,不太有真实细节。
04
这一组希望调整一下传统电影工业级的特效,真实大片质感——
纽约中央公园霸王龙出没。
基本上都没有明显的物理问题或者穿模,但有的是电影感,有的偏塑料感。
特别对比了一下恐龙出来的镜头,MiniMax H3对恐龙面部细节、眼神、动作的呈现,略显粗糙;
而Seedance 2.0 fast和Wan 3.0这次不分伯仲,让我觉得已经有大片的视觉张力了。
Seedance 2.0 fast和MiniMax H3三次抽卡区别不大,每一次都很稳定;
Wan 3.0有时候色彩会更鲜艳,不同版本差别稍大,需要根据偏好认真来挑。
05
这次是科幻场景,宇宙太空主题。
还是各测三次选最优,我试了一下月球便利店的场景,宇航员跟店员买东西。
这一次可能因为提示词比较细致,三者镜头语言的相似度最高。
MiniMax H3还是色彩饱和度略高,显得不够真实自然;
Seedance 2.0 fast 宇航员的表情虽然藏在头盔后面,但人物表现力和真人感还挺好的。不得不说,Seedance 2.0 fast 出视频明显快一点,抽卡效率一如既往高
Wan 3.0运镜比较流畅。
06
再看看动态海报实测。
主要看动态海报的文字处理,以及特效的细节呈现。
横向看起来,没有很明显的代际差距;Wan 3.0在特效场景稍显单薄。
这几组例子测下来,我会觉得几个模型都是不会出错的选项。但如果只用一个,我会选Seedance 2.0 fast。
倒不是因为名气最大、用的人多,还是风格质感比较让我满意。而且如果有想要未来升级Seedance 2.5、进一步精品化的需求,2.0 fast也可以提前打个样,用更一致性的调性,让人花小钱看到结果。
对于需要每天产出几十条视频的电商团队、漫剧团队来说,能便宜一点、抽卡效率高一点,少些回炉重造,省下来的都是利润。
07
到这里,我会觉得视频模型里的六边形战士,已经有结果了。
Seedance 2.0 fast给我的感觉,最接近过去半年的SOTA模型Seedance2.0,综合表现最均衡,没有短板,抽卡率显著低,抽卡速度也最快。
不知道是不是因为有着和Seedance 2.0、Seedance 2.5同源的数据和训练方式,最拟合真实世界多模态数据的分布,效果最好。
对了,拥挤的模型发版季,如果需要把视频生成能力产品化,比如开发一个Skill来降低特定场景的成本,那部署开源模型是一个选择。
可以针对特定场景做优化,把成本压到比API更低。
选模型这件事,没有最好,只有最合适。
像MiniMax H3、Wan 3.0,我也很乐于去尝试,时而也会收获意外之喜。
在他们身上能看到国产视频模型明显的进步,也让我对国产模型更有信心。
视频生成的下半场才刚刚开始。这个行业会越来越卷,模型会越来越强。
但对创作者来说,更好玩的故事,才刚刚开始……
朋友圈会发一些具体的案例和商业化日常~
热门跟贴