打开网易新闻 查看精彩图片

视频模型沉寂了大半年,最近突然热闹了起来。

一天内,Seedance 推出 2.5,升级新版本,而 MiniMax 也发布了新模型 H3。

这操作属实不常见,世超看了看 Articifial Analysis 的三个视频榜,发现 MiniMax H3 直接凑了个 1,2,3。

打开网易新闻 查看精彩图片

好家伙,隔这儿收集奖杯呢?

而且更牛的是,这模型还是开源的,在海外创作者里也引起了不小的讨论,大伙儿纷纷下场测试。

有说它指令遵循精准的,视频模型终于能在黑板上正确写字了。

打开网易新闻 查看精彩图片

还有说它一致性出色的,电影叙事和商品广告的效果很好。

打开网易新闻 查看精彩图片

搞这么热闹,那我得尝尝味道如何了。

搓了一堆视频后,先省流一波,这模型确实有点东西,2k 画质下,细节和稳定性都很在线。

尤其是它 AI 后期的效果,美术风格确实带感,一度让我惊讶这种文字加排版的复杂视频,居然是模型搓出来的。

打开网易新闻 查看精彩图片

还有定价,768P 分辨率五毛一秒,2K 则是八毛,大概是之前一些旗舰模型三分之一的价格,性价比这块儿相当能打了。

打开网易新闻 查看精彩图片

话不多说,咱先跑一下刚刚的案例验验货,只给一句话,让它写个欧拉公式看看成色。

这任务听着简单,就画几个符号的事儿,但实际上无数视频模型都翻过车,不是不晓得公式为何物,就是还没落笔,字儿就凭空出现了。

这次 MiniMax H3 的表现不赖,你不能说它完美,但这物理因果基本是对的。

起码手,粉笔,字迹看上去合理,不漂移,粉笔写出来的质感和敲击黑板的配音也都没毛呲。

接下来再瞅瞅光影表现,甩给它一张 3A 射击游戏的截图,让它还原一下战场氛围。

看这效果,你不说我以为又开了一把了呢,这光追我平时搁自己电脑上都舍不得开。。。

大伙儿也可以关注一些细节,比如左上角的小地图,在人物转动视角的时候,它是会跟着一起转的。还有开枪的时候,枪声和抛壳的频率也是一致的。

这就是原生多模态的好处了,它能更逼真地模仿物理世界,画面声音和物理规律会相对统一,不容易穿帮。

不过右下角的备弹数量还是漏了点马脚,这些小纰漏或许等模型能力再迭代几轮才能搞定。

当然,多模态还有个好处,就是生视频的时候,你有啥素材只管往里丢就行,什么图片,视频,音频,都能当参考。

打开网易新闻 查看精彩图片

比如这里来个大杂烩,先放个视频当运镜参考,再来点人物和分镜图,最后加俩音频当他们说的话,可以说是能喂的都喂了。

视频里它倒也能接得住,猫狗的毛发都挺有质感,一致性也稳到了最后。

尤其是指令遵循上,提示词里五花八门的要求基本都满足了,切镜,神态,以及精准卡点的一声叫,都很带感。

唯一的遗憾是我忘加背景 BGM 了,为了省点儿积分,手动加了一下,味道更足了,进军二创视频指日可待。。。

但话说回来,整活儿只是稍带的,MiniMax 更强的地方其实是视频编辑,别忘了,编辑相关的跑分它干到了 AA 榜的第一位。

我直接对着桌面来了个实拍,配合中年帕金森的轻微手抖,看看它能怎么拯救视频效果。

结果相当 Amazing 啊,虽然没什么炫酷的特效,但加的这个手绘小玩意儿还挺灵动。

它从空中飞到鼠标上,顺着镜头爬了两圈,一个蓄力跳到了键盘上,跳跃的动作跟手抖的部分正好吻合,也是让我运上镜了。

接下来我又试了试多模态的编辑,说人话就是把音频也放进来一起处理。之前可能就需要另外找个音频模型,先提取音色,然后生成配音,最后再回到视频模型这儿融合。

但 H3 处理起来要简单些,克隆声音就顺手的事儿。咱素材复用,让写公式的老教授开口念几句诗,把一段美式口音丢进去让他克隆,再换成英音朗诵。

打开网易新闻 查看精彩图片

老教授台风很稳,扎好架子就开读,声音克隆的很还原,正宗老伦敦读莎士比亚,味道就是正,口型没毛病,肢体小动作也是话剧演讲的那套,镜头一拉很专业好吧。

测试到这儿,也能感觉出来,MiniMax H3 真正值得聊的,其实不在于能不能搓个以假乱真的镜头。

因为真实感是个慢工出细活儿的差事,需要大量数据和算力喂养,一眼看不到尽头。

它或许是视频生成模型的主线,但肯定不是唯一,因为一条真正拿去用的视频,除了画面真实感,还要有文字排版,剪辑转场,乃至音效和独特的视觉风格,这些都得打磨。

打开网易新闻 查看精彩图片

而 MiniMax H3 的特别之处就在于,它试图参与到片子的后期制作当中。先是点了多模态的技能,又在文字一致性上下功夫,配合不俗的世界知识,整体的编辑可控性比起之前就强了太多。

所以接下来,我准备从基础的文字开始,一步步加码,看看它到底能把 AI 后期做到什么程度。

先看文字,直接扔一段歌曲进去,让它做一段歌词的 MV。

以前老模型做这种视频,先不说字体字形的准确性,一旦运动起来,即使前面几帧对了,后面也有可能模糊掉。

打开网易新闻 查看精彩图片

但 MiniMax H3 的处理精准的多,它提取了 Prompt 中的主要描述词,先统了一下风格,明确要搞成旧杂志拼贴的样式。

然后将歌词,人像和线条融合进报纸碎片中,文字不只是字幕,会参与进视觉设计,随着音乐缩放。背景也不是无关元素的堆砌,词里有蓝色,报纸上是真会甩几滴蓝色油漆。

再细点看的话,倒是有一处拼写错误,刚开始的「try」它拼成了「ttr」,得微调一下,不过整体文字的动态排版还是挺靠谱的。

作为歌词的 MV,这套东西完全可以批量合成,演唱的时候就能直接放大屏幕上,维持风格的同时每场还能整点花活儿。

文字站稳后,我又给他上了一张橙子汽水的静态海报。

打开网易新闻 查看精彩图片

这次,我想看它在稳定文字的基础上,能不能往专业剪辑的方向靠,给产品加动态镜头,处理好空间关系。

成片效果不错,汽水罐从平面中央逐渐靠近,罐体,冰块,水花冲出原本的海报画框。

这个前后景的对比很取巧,它不是那种简单的图片转动图,而是用线框划分开空间,突脸给你来个 3D 效果,既维持了原来的视觉特征,又能把汽水的冲击力渲染出来。

不过,一张海报再怎么冲出屏幕,本质上还是一个镜头。真正的广告片,还得会组织多个画面。

我们请出编辑部老员工火锅 ( 幼年版 ) 当模特,拿起汽水罐,做一条逻辑完整的汽水广告试试。

打开网易新闻 查看精彩图片

设计是这样的,开头让火锅打开汽水喝一小口,然后给特写,人物不断换装,然后整体的元素随主题变换。考验的是 H3 的资产调度和多镜头的连续性。

来看成片,15 秒的时间叠加了 4 套主题,但无论怎么转场,火锅以及橙子汽水罐的特征都没变形,整套橙色视觉系统也延续了下来。

特别是动效组合的不错,汽水罐旋转时有变速,周围配饰以及上方字体弹出也有惯性,配合 BGM 相当丝滑。

这种效果比起拿 AE 手搓可能差点细节,但都这个速度了,还要啥自行车。

况且我也就抽了一次,一批两个视频,第一个汽水罐是上下转的,第二个则是左右转,考虑的还挺全。。。

打开网易新闻 查看精彩图片

当然,说到 AE,比较常见的就是 MG 动画,这个其实是更偏后期的视频类型。

它比看上去要难得多,因为上面的宣传视频有角色和产品可以当现实参考,但 MG 动画里,文字怎么拆,粒子怎么飞,怎么组合都得自己来设计。

咱直接拿差评前沿部的 Logo 交给它,让 MiniMax H3 做个动画瞧瞧。

你别说,整得还挺花里胡哨,整体特效围绕粒子和线条构成,先散开延展出去,然后在三维空间中旋转,最后又收束重组回来。

21:9 的宽幅比例下,视觉重心也没跑偏,尤其中间一闪而过的黑白效果,看着还挺酷炫的。

最后,咱把前面这些东西打包塞一起,给它上个更难的任务,让它模拟一下游戏的菜单选人界面。

结果视频效果非常利索,整体街头涂鸦的风格很耐看,跟友情客串的火锅也正好匹配。

菜单文字没跑偏,光标点击也有反馈,甚至还能换装,安装不同配件,这些变化都会实时反馈在火锅本体上。

菜单到游戏的转场也很流畅,报纸糊住屏幕再撕开,火锅就蹿到了街区上。

虽然这本质还是段动画,但对于游戏制作而言,这玩意儿已经能被拿去当概念设计,或者提案的 Demo 了,应用价值非常明确。

打开网易新闻 查看精彩图片

一堆测试跑下来,MiniMax H3 的长板其实已经很清楚了,就是它非常来劲的 AI 后期能力。

除了生成漂亮的镜头,它还想帮你剪完整的片子。

虽然没强到指哪打哪,但它缩短了普通人跟成片之间的距离,你不用学太多剪辑技巧, 靠描述也能搓个及格的作品出来。

22 年的时候,Stable Diffusion 1.5 模型的开源引爆了 AI 绘画的热潮,社区里大伙儿 DIY 得火朝天,各种微调工具层出不穷。

而这次的 H3 视频模型也选择了开源,那它未来会被大家折腾成什么样子呢?

这个我是真想看看。。。

撰文 :风华

编辑:江江&面线

美编:素描

图片、资料来源

Artificial Analysis,X,MiniMax官网,海螺AI;

汽水转场动画灵感参考BV1QGKb6EE1d;

模特火锅友情贡献数字形象。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片