打开网易新闻 查看精彩图片

除了做短剧,AI视频还有其他更高价值的场景了吗?

除了Seedance 2.0,还有谁称得上视频模型头号玩家?

一定有,而且已经出现。

在广告、电商、游戏、UI等领域,多模态模型的实现,似乎可以有更广阔的应用场景。

先给大家看几个我拿MiniMax H3做的视频效果。

游戏化的UI、赛博朋克世界,直接一键生成,视觉观感很有Steam游戏的感觉。

故事广告片头,魔法书的奇幻时刻,质感审美也很细腻,有种娓娓道来的电影感。

还有这个我很喜欢的搞怪动画,有点无厘头,但特别适合作为吸引人的钩子。

再给大家看看我拿Seedance 2.0用同样的提示词做的,效果明显有所不及,让我觉得接下来Seedance 2.0会受很大影响。

打开网易新闻 查看精彩图片

这个拿Seedance 2.0做的效果,卡通的搞怪程度、脑回路的清奇度,相比之下就显得平庸无趣了。

另外这个例子,同一个空山基角色,Seedance 2.0的面部处理AI味更强,长提示词的指令遵循也略逊一筹,比起前面的版本,中间游戏化的交互有所不足。

打开网易新闻 查看精彩图片

还有下面书店的这个例子也是。

Seedance 2.0有种短剧感,而之前MiniMax H3的效果明显更有细节,有一种电影叙事的呼吸感,更接近真实具体的场景,让人能代入。

打开网易新闻 查看精彩图片

所以今天,我很想特别介绍一下MiniMax H3。

它是一个全模态视频模型,支持文本、图像、音频、视频的混合输入与原生视听输出,同时支持灵活部署和私有化。

用下来我的感觉挺不一样,MiniMax H3的优势,在于把原生多模态理解,和精准的编辑控制融为一体了。

打开网易新闻 查看精彩图片

指令遵循、品牌信息呈现,完成度很高,而且还有很高级的审美表现。

商业成片,品味和质感,是我更想要追求的,也是希望能让人眼前一亮的。

这一次,我觉得MiniMax H3做到了。

01MiniMax H3三个能力,打通商业化任督二脉

按MiniMax的说法,H3不再把图片、视频、声音的生成、编辑、参考拆成彼此独立的任务。

它是面向由文本、图像、视频、声音共同组成的多模态上下文,统一理解创作意图。

H3把这些所有的视频要素当成拼图,一次性给你拼好。我觉得很有意思。

官方把H3的能力概括成三点:原生多模态理解与生成、多模态精准编辑与控制、商用级多场景内容生成。

实测了一下,特点还是挺鲜明的。

比如像这个墨镜广告片,基于一张模特戴着墨镜的图,给出的结果有种时尚大片感。

因为H3能同时处理文字、图片、音频、视频四种输入,还能get到素材中的人物、产品和表达意图。

现在喂图给H3,相比之前的垫图,能感觉到对于文字Prompt以及图片风格的把握,都很到位。

打开网易新闻 查看精彩图片

从效果看,已经不是简单的多模态拼接,开始有了融合理解的意思。

多模态精准编辑和控制,也是体感很明显的进步。

和以前的随机抽卡不一样,现在H3支持对人物、物体等进行多维度编辑,创作者可以在已有内容基础上持续修改和迭代。

比如说这个游戏化的UI界面,主人公我做了调整,头部显示屏上的英文名,也可以自定义修改。

实际操作很简单,基本就是傻瓜式的导演模式。

先出一个基础版本,然后告诉H3哪里要改、怎么改就行,可以像导演指导演员一样去调整每一个细节。

这对商用级的视频创作,尤其友好。

我还注意到,对于文字的控制、信息的处理,以及人和文字的组合,H3的处理很丝滑。

上传一张平面静态海报,输入简单的提示词,一张广告图就变成了视频广告片。

文字的动画效果、人物的动态动作,我都挺满意;之前需要调很久、抽卡很多次,但现在一遍出成品。

打开网易新闻 查看精彩图片

H3对文字字幕、品牌信息、创意特效的支持,能带来更多好玩的排列组合。

像广告、品牌视觉、游戏,这些特别靠脑洞、靠创意的领域,

很多审美好、艺术风格独特的设计师,让他们去做AI短剧,匹配度很低、品味发挥不出来;但是用MiniMax H3,更多的创意发挥和艺术类型创作,以及商业化的视觉呈现,都会非常大的新可能性。

我还试了一下科幻电影的预告片,也是画面和文字结合的。

理解镜头语言、节奏控制、情绪表达,这些是电影工业的核心要素。

MiniMax H3也已经有了院线级的影视taste。

而这样的taste,用在广告视觉、模特动态等等领域,尤其效果不俗。

可以说,在最高价值的商业化场景里,MiniMax H3都有不错的表现。

打开想象力之后,用MiniMax H3,完全可以创造新需求,实现商业化场景的真正落地

02技术参数背后,审美是生产力

MiniMax H3的输出时长是5到15秒。这个区间很有意思。

它不是那种追求一次生成长片的模型,15秒刚好是一个镜头或者一个场景的合理长度,也是目前AI视频模型在质量和可控性之间能找到的平衡点。

分辨率默认就是2K,输出24FPS,这是电影级的标准,已经超过很多专业视频素材的分辨率要求。

能看出来,MiniMax H3走的是精品路线,也给了高要求的商业用户更多的想象空间。

说实话,AI漫剧很多挺粗糙的,人脸都长得一样,也时常穿模;但在消费型娱乐场景,容错比较高,对审美的和视觉质量的要求是低的。

打开网易新闻 查看精彩图片

但MiniMax H3给了更有前瞻性的视觉可能。

用轻量级的全模态视频模型,实现更好的观感,对于商用需求的用户,性价比、效率都是更高的。

还想特别说一下,输入条件。

全能参考模式下,可以扔进去最多9张图片、3段视频、3段音频,混合输入的总上限是12个文件。

打开网易新闻 查看精彩图片

这个上传容量,让MiniMax H3的多模态融合效果,是实打实看得见的,它是真的在同时处理多种类型的素材。

而且基于素材,根据具体的商业场景,实现了对需求的很好表达。

打开网易新闻 查看精彩图片

这个能力上,相比Seedance 2.0优势非常明显。

对比下面这个Seedance 2.0做出来的,效果还行,但是更接近动图拼接,和之前的图生视频没有本质区别。转场、人物动作、文字效果,明显是差一些。

打开网易新闻 查看精彩图片

做视频的人都知道,音画同步有多重要。

比如这段侦探和嫌疑人的对话,主要靠台词人声来体现戏剧张力,口型和情绪都很有表现力。

以前的AI视频生成要么没声音,要么声音是后期硬配上去的,节奏对不上、情绪不匹配,一看就是AI做的。

MiniMax H3能做到原生音画同步输出,把音频和视频当作一个整体来建模,快节奏的广告片、电影预告片,非常有视听惊喜。

03AI视频行业,不止一条路

MiniMax在视频生成领域,本来就很有积累。

海螺AI,之前已经在角色一致性和流畅度上做出了口碑。

这次MiniMax H3相当于把海螺的能力做了全面升级,再加上原生多模态融合和精准编辑这两个差异化能力,确实能在当前的竞争格局里撕开一道口子。

AI视频生成的下一个阶段,一定是从生成单条内容转向资产驱动的内容生产。

也就是说,模型不再只是一个生成器,而是一个能够理解、组织、编辑、迭代的创作伙伴。

打开网易新闻 查看精彩图片

MiniMax H3模型的定位和功能设计,是朝着差异化的应用场景去的,也是基于需求痛点出发的。

从特化任务模型到通用多模态智能,这条路一定会有人走通。

区别只在于谁先走到终点,以及走到终点的时候手里还剩下多少筹码。

MiniMax这次押注的,是让AI真正理解创作意图、真正进入真实的商业场景。

AI视频的决赛枪已经打响,接下来就看谁能在牌桌上坐到最后了。

打开网易新闻 查看精彩图片

朋友圈会发一些具体的案例和商业化日常~

AI交流,欢迎加我本人微信:FrankGPTs