最近一个月,搞 AI 视频的人大概都有一种熟悉的感觉:刚用完一个模型,下一款又挤进了测试列表。

新模型越来越多,介绍也越来越长,但真正使用时,很多人还是会回到同一个问题:眼前这一堆视频生成模型,到底哪个更适合自己?

这个问题,有经验的创作者都知道要根据场景选。如果遇到适合同场景的模型打擂台,光看官方信息不够,还得自己上手一试。

先说这个8月的旗舰款 Seedance 2.5。它单次可以生成最长 30 秒的音视频,支持连续延长;一次最多输入 30 张图片、10 段视频和10段音频作为参考,还能按照时间点修改指定的视频和声音内容。

我自己测了一轮,又围观了半个月各路大神的作品,发现 Seedance 2.5 这套能力指向一个很明确的目标:尽量让一段高质人物、场景、运镜、光影和声音的长镜头叙事,在一次抽卡里成立。

放些对比会更直观。

像下面两组 Seedance 2.0 和 Seedance 2.5 的同任务对比,就能看出后者在剧情丰富度、画面细腻度和人物真实感上的进步。

这类案例网上还有很多。

总之经过各路大神快一个月的验证,Seedance 2.5 在镜头表现力要求很高的内容上,是目前的标杆。它的指令遵循也是最好的,很适合专业影视公司使用。

但到了营销视频、微短剧和漫剧的量产现场,这套判断系统就不一定 work 了 —— 专业影视剧组会盯着画面上限、叙事完整度和镜头表现力;追求量产的团队每天重点会看能生成多少条,要返工几轮,单条视频最终花了多少钱。

按这套标准,Seedance 2.5 肯定不算性价比高的。那么,在这些需求已经被狠狠验证的场景里,现在应该选什么模型?

带着这个问题,我按价格和风格适配度筛了一轮,最后把 Seedance 2.0 fast 和 MiniMax H3 拉到了一起 PK。前者是 Seedance 2.0 的加速版本,后者重点覆盖广告、电商和游戏 UI 等商业内容。

打开网易新闻 查看精彩图片

接下来就实测看看,它们谁能挺到最后。

以稳定量产为名的对决

关于这轮对决的评测渠道,我拉出了经常使用的老朋友 LibTV,怒充649元高级版会员。

打开网易新闻 查看精彩图片

测评题咱也按商业需求来,把微短剧、营销视频和动漫都搞一遍。

所有测评里,两款模型都使用相同的核心提示词和参考素材,分辨率 Seedance 2.0 fast 选 720P,H3 没有 720P,选了最接近的 768P。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

至于标准,既然目标是找出来最能稳定量产的模型,那我只关心这几个维度:

  • 输出的画面和声音效果;

  • 生成效率是否足够高;

  • 素材的综合成本情况。

Case 1:微短剧+营销视频

第一组测评我就整了个大活,设计一套有反转的剧情让 Seedance 2.0 fast 和 MiniMax H3 制作,最后还植入了一个产品营销。

参考图我拿 ChatGPT 和豆包生成,和提示词一起按同规格输给两个模型。

打开网易新闻 查看精彩图片

经过一段时间的制作,我用两个模型搞出了成品

*Seedance 2.0 fast

*MiniMax H3

先提前说明一下,这个时长和脚本,这两个模型都得先抽几次素材再做拼接。

单看第一次抽出的素材,Seedance 2.0 fast 在人物角色和环境场景上的表现力更细腻。

像男主着急找寻女主的过程里,Seedance 2.0 fast 的男主能清晰看到表情波动,以及头上的汗珠。

打开网易新闻 查看精彩图片

H3 的这个男主,虽然像磨皮了而且表情管理更帅,但怎么看都不比前者着急。

打开网易新闻 查看精彩图片

还有画面的动态效果。

Seedance 2.0 fast 的簪花落地的确是从女主的头发上脱落,但 H3 的簪花没有从头上脱落的过程,同时女主头上还出现了另一个簪花,逻辑上也不合理。

打开网易新闻 查看精彩图片

*左MiniMax H3,右Seedance 2.0 fast

指令遵循也是 Seedance 2.0 fast 赢了。

像这个细节,剧本设定男主在路边捡到簪花后,紧接着听到了女主的手机铃声所以推开门。Seedance 2.0 fast 的演绎蛮细致,但 H3 这里处理的比较粗。

打开网易新闻 查看精彩图片

*左MiniMax H3,右Seedance 2.0 fast

如果说两个模型都存在的 Bug,就是它们的物理规律和群像生成都不够优秀,有概率需要重抽素材。

但对比下来,H3 在修正提示词后成功率依然更低一些,比较费事。

拿群像来说,H3 生成的群像人脸可能会糊和变形,Seedance 2.0 fast 有重复人脸。但经过专门制作关键帧参考图,H3的调整依然不一定很快达到理想状态。

最后再感受一下两个视频的画面对比。由于 H3 我删减了几个没有意义的镜头,所以最后成片少了几秒。

Case 2:酷炫打斗动漫

测完复杂任务,接下来我试了几个比较简单的case。

动漫也是这两个模型的主打场景。这次我复刻了一个喜欢的海外博主的动漫视频风格。

按博主的提示词搞下来,总共有整整9000+个字符...不过我发现 H3 只能输入7000个字符,所以它的输入做了删减。

成片画面效果对比

这两个视频都是两段15秒的素材直接拼接的,没经过二次剪辑。Seedance 2.0 fast 和 MiniMax H3 的风格刻画都很精准,人物和场景也都能抓住眼球。

H3 在武打动作设计上更酷。但可能是因为 H3 的提示词输入长度有限,它这版的剧情在女主演绎穿越飞船结构的过渡剧情时,有些割裂。

打开网易新闻 查看精彩图片

*H3 看不太出来在穿越飞船结构

Seedance 2.0 fast 配上了人声,在配音上也有优势。2个模型的完整音效版如下,大伙可以对比听听。

*Seedance 2.0 fast

*MiniMax H3

Case 3:商品图营销

接下来我搞了个实用的,让 Seedance 2.0 fast 和 H3 基于参考图做电商营销视频。

这是我从家里顺手摸出来的盐罐。我拿它做了一组盐罐商品参考图,然后让两个模型以它为原型做营销视频。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

这次两个模型在音效上拉开了差距,我直接单独放效果

*Seedance 2.0 fast

*MiniMax H3

能看出这次两个模型的风格抓得不错,都按要求搞了比较明亮、活泼的画风。视频里的盐罐素材也保持了原样。

最明显的差别在音效和配乐上。煎锅里的声音,撒盐的声音,以及 BGM,Seedance 2.0 fast 的层次更丰富,氛围感更强。

纯粹对比画面,视频最重要的前三秒也是 Seedance 2.0 fast 更灵动一些。

打开网易新闻 查看精彩图片

一些初步结论

花一整晚兢兢业业做了3轮测评,已经能得出一些初步结论。

首先在比较难的任务里,这两款模型都出现过物理逻辑混乱,人物群像场景也都没有稳定到可以闭眼提交。它们的画质和运镜上限与 Seedance 2.5 还存在距离。

但如果把画面效果、返工次数和音效全部算进去,Seedance 2.0 fast 在各类难度不一的测试里,输出更稳定。

先看钱。

单看官方价格,现在这两款模型都不算贵。在实际场景中真正拉开差距的是,每得到一条可用视频的实际生成次数。

在我的实测中,如果需求相对复杂,H3 会需要更多次抽卡,便宜下来的 API 费用又被素材和返工吃掉了不少。

后续制作剧情简单、时长15秒左右的视频时,H3 的抽卡成功率比起复杂任务有所提升。整体看下来,不同复杂度的任务中,Seedance 2.0 fast 的输出相对更稳定。

再看生成时间。

Seedance 2.0 fast 的单次生成时间约为 H3 的二分之一到三分之一。像最后一个创意广告的 case,同为 15 秒、720P 分辨率的视频,前者耗时3分45秒,后者耗时6分49秒。

画面和声音效果,刚刚这些案例里已经看到,Seedance 2.0 fast 大多数时候在剧情细腻度、人物表现力上占优,音效更丰富一些。H3 打斗场景中的动作设计比较抓眼。

所以,现阶段比较靠谱的视频模型选择策略大致是:

  • 专业影视创作、广告概念片和复杂镜头,优先试 Seedance 2.5;

  • 针对营销、微短剧和漫剧的稳定量产,Seedance 2.0 fast 更均衡;

  • 如果对微调素材很有经验,H3 依然有吸引力。

另一方面,H3 和 Sand.ai 发布的 MAGI-2 Preview 这类开源模型,还带来一道选择题。就是模型权重开放以后,到底应该自己部署,还是继续调用 API?

两条路径大家讨论的很热,但其实没有绝对高下,关键是看团队掌握的算力资源和对数据的要求。

首先是资源。

下载开源模型到本地部署,前提是有能跑的起来的硬件资源。

如果只考虑消费级显卡,有网友反馈,目前 H3 能跑起来的最低规格大概需要 2 张 RTX 5090 搭配大约 384 GB 的内存。社区推出的量化版本要好一些,一般 16 GB 显存单卡加上 32 GB 内存就能跑,只是生成速度会慢一些。

打开网易新闻 查看精彩图片

Sand.ai 在 8 月推出开源的 MAGI-2 Preview,参数量是 114B。这个规格的部署,资源消耗更高。

打开网易新闻 查看精彩图片

另一个现象是,现在一些开源模型暂时还没有把最高质量的模型版本提供给社区,还在计划做好更多适配后再推出。

所以现阶段更适合尝试开源模型的团队,大概率要有充足且可长期使用的算力资源,能承担维护成本。如果有比较严格的数据合规或私有化要求,会更刚需。但假如目标是尽快把视频生成接进工作流程,直接使用 API 的路径肯定还是更稳的。

聊了这么多,总结下来,现在选视频模型其实选的是一条个性化生产线。

这条线里,如果真要算投入产出比,我们不仅要看生成的画面效果 —— 还要把抽卡成功率、返工次数、等待成本和资源成本一起算进账里。