今天,AI短片越来越酷炫,一句话就能生成视频的错觉正在蔓延。但在APPSO的实测中,那些被当作样片的“AI大片”,绝大多数都是靠模型生成一大堆素材,再丢进剪辑软件里靠人工修剪、配乐、精细调整才拼凑出来的。换句话说,AI负责了画面,人类负担了后期——它离所谓的“一步成片”还很远。
真正对视频有海量需求的广告、电商、游戏、产品发布、UI展示和品牌包装市场,其实并不执着于奥斯卡级别的镜头,却对另外几件事格外苛刻:读懂创意意图、精准操控画面、把分散在生成、剪辑、字幕、动效和声音等环节的工序,汇聚成一套可以直接交付的成片。这恰恰是多数视频生成模型没能跨过的那道坎。
MiniMax刚刚发布的开源视频模型H3,直接把自己的定位押在了“Seedance级别”“全模态精准控制”和“AI原生后期”上。我们决定跑一遍真实商业场景,看看它到底能不能把那些冗余的后期工作,一并吞掉。
H3本质上是一款开放通用多模态视频模型,同时接纳文字、图片、视频和音频混合输入,单次最多可使用9张图片、3段视频和3段音频,混合文件上限为12个。这种输入自由度,已经为“带着素材直出成片”铺好了路。
第一轮测试很简单:把我们前阵子用Vibe Coding随手写的一个浏览器标签页总结扩展的7张截图,连同Google发布的Material 3设计介绍视频一起扔给H3,只给一句极简提示词——根据这些内容制作一个工具介绍视频。我们没有写任何转场、动效指令,结果模型自己就安排了最合适的呈现方式。两个视频方案同时生成,速度很快,完全不用抽卡。产品主视觉和要表达的内容在两个版本间保持高度一致,主要文字也都能准确渲染。不过当遇到较小、密集的字符时,H3还是会偶发乱码。这也让我们意识到一个朴素规律:上传截图的清晰度,在很大程度上决定了模型生成的准确性,只要原始素材足够锐利,模型的出错率就会大幅下降。
如果只是能根据截图生成宣传视频,那H3覆盖的充其量还是一些轻度包装需求。我们决定进一步测试它的精确可控性,于是临时编了一个名字叫NULO的AI设计工具——没有真实产品,没有现成的Logo和UI,只有一段推敲过的文字分镜。这一次,我们不再用极简提示词,而是用更详细的描述框定画面序列:0–2秒,石墨黑背景,三张分别写着IMAGE、VIDEO、AUDIO的卡片从画面边缘沿节拍进入,吸附组合成NULO字标;2–5秒,字标通过形状变形展开为极简产品界面,只出现IMAGE、VIDEO、AUDIO、EXPORT四个英文标签,当前选中框变为荧光橙;5–8秒,界面切换为最终海报预览,一条荧光橙色轨迹穿过各节点,同步清晰的点击或滑动音效;8–10秒,所有UI组件收拢回NULO Logo,结尾标语“MAKE IT MOVE.”停留1秒。我们还附加了严格要求:所有文字清晰、拼写完全正确、各只出现一次,不新增单词、按钮、Logo或人物,品牌色仅限石墨黑、暖灰、荧光橙,转场只用形状变形、遮罩、卡片伸缩与颜色扩散,音乐原创极简电子,动画节点必须跟鼓点和音效同步。
H3不仅完成了所有约束,还自动补上了一块带节点连线的抽象界面,让卡片、字标、轨迹和片尾看起来属于同一套设计语言。四个英文单词拼写全部正确,三种颜色从始至终牢固锁定。这已经是非专业用户用它提交可交付成片的水平了——以往这类包装,至少需要一个人在剪辑软件里反复调整。
那如果换成专业视频工作者的习惯呢?不给提示词,也不让模型自行发挥,直接塞给它一套完整分镜图会怎样?我们先用GPT Image 2生成一张机车图片,再据此生成一张15秒机车TVC的分镜图。这张分镜图其实比较模糊,而且是横向展开的,完全不符合标准分镜的布局。但H3依然读取到了该呈现的信息,对画面进行了重新布局。更值得注意的是,需要显示的文字不仅做到了完整还原,H3还会进一步理解文字与画面的关系,把机车名称和Logo等文字作为视觉设计元素融入场景,而不是简单叠加、生硬照搬——它将文字从分镜左侧移到了机车下方,反而更符合视频的观看体验。我们用同样的方式,又让H3给iPhone Fold做了一支10秒广告视频,同样经得起直接交付。
随后的一轮测试,我们继续用H3生成一段虚构的时尚品牌片,指定了模特、包袋、汽车以及荒漠公路背景。如果去掉视频右下角的水印,已经很难从画面上判断这是AI生成的。模型把指定的人物、包袋、汽车和荒漠公路都做到了自然融合,最后还用一个快速的平移,准确展示了所有文本信息。
反复测试下来,H3给人的感觉并不是一个单纯的视频生成器,而更像内置了一个懂设计的“AI后期组”。随着多模态理解、指令遵循等能力的提升,它可以更好地理解视频内容和用户意图,自动完成特效包装和视觉设计的增强。这些特性让H3在几乎所有测试场景下,所生成的结果都更接近一条成片,而非一堆需要二次加工的素材。
这个差异对市场的意义远比技术参数更直接。过去用AI生成视频,本质上是在给剪辑师“增加找素材的工作量”,而H3的做法是把后期直接做进生成过程。它不但能兼容专业视频工作者的工作流,更关键的是,让那些非视频专业但经常要和视频打交道的人,能以极低的门槛做出优秀的Demo和提案素材,并在后续协作中显著缩小非专业用户与专业团队之间的沟通鸿沟。再加上技术积累带来的更具竞争力的使用成本,视频生成“不可控”“离成片远”的老问题,正在被这种全模态、强编控的路线切实破解。除了融合产品UI和动态包装,H3在广告、电商、游戏、UI设计等广泛场景中,都呈现出一种难得的实用性:不是给创意工作打下手,而是直接交付结果。
热门跟贴