7 月 31 日,MiniMax 正式推出新一代视频生成模型 H3,它跳出了传统 AI 视频工具只靠提示词生成画面的局限,是一款真正意义上的通用多模态视频大模型。
和以往模型后期拼接音频不同,H3 可以原生输出双声道立体声视频,把文本、图片、视频、音频全部当成输入上下文统一解读,理解各类素材之间的关联,直接输出音画同步的完整成片。
8 月 3 日官方直接放出开源权重,一经放出就在开发者圈子掀起不小反响,不少玩家把这次事件称作开源视频领域的 “DeepSeek 时刻”。
过去高质量 AI 视频基本被闭源方案牢牢把持,想要出片就得按秒花钱充值点数。MiniMax H3 开源之后,普通用户可以直接把模型部署在自己电脑本地,依靠显卡算力完成生成,不再需要持续消耗云端积分。更让人惊喜的是它的硬件门槛放得很低,8GB 显存显卡就能够跑通基础的视频生成,大大降低普通玩家上手多模态视频生成的门槛。
开源首日 ComfyUI 就快速完成适配,官方配套三套现成工作流:文生视频、首尾帧图生视频,还有自由度最高的多参考生视频。多参考模式最多支持 12 份参考素材,其中图片最多 9 张,视频、音频各 3 条;单份音视频素材控制在 2‑15 秒,全部参考素材总时长不能超过 15 秒。但也要客观看到,导入的参考素材数量越多,显卡压力会明显上涨,生成耗时也会跟着拉长。
输出方面,本地版本生成视频时长区间为 4‑15 秒,默认短边 768 像素;2K 高分辨率生成则需要使用官方云端接口。想要本地拿到高清成片,更务实的做法是先生成默认分辨率素材,再借助超分工具提升清晰度。视频时长拉得越长、分辨率调得越高,显存、内存的消耗会呈明显上升,低配显卡直接硬跑高规格参数很容易出现报错、生成失败。
不少玩家拿闭源 Seedance 2.5 和本地部署的 H3 做过对照测试,用同一张参考图生成角色形象。Seedance 2.5 生成出来的人物会更加贴合原始设定,但每秒需要付出 1.3 元的调用成本;MiniMax H3 本地生成角色偏差控制同样不错,零点数成本,二者各有取舍。
当然 H3 本地部署并不是毫无门槛,显存依旧是绕不开的硬约束。8GB 只能勉强体验,想要流畅体验,低显存显卡要搭配量化、裁剪版模型,再叠加加速 LoRA 插件降低硬件压力。新一代 RTX50 系 Blackwell 架构显卡还支持 FP4 特殊优化,对 H3 做了针对性适配。综合大量玩家实测反馈,12GB 显存是勉强可用的起步,16GB 显存才是体验 H3 绝大部分能力的甜点配置。
总的来说,MiniMax H3 的开源,直接把多模态音视频生成从付费云端,带到普通消费级 PC 设备上。虽然本地生成速度比不上云端,2K 能力依旧依赖官方接口,但它已经实实在在拓宽了普通创作者的玩法边界。
热门跟贴