智东西7月31日报道,今日,MiniMax发布通用全模态生成模型MiniMax H3。该模型能够统一理解文本、图像、视频和声音,并生成带原生双声道的音视频,最高支持15秒、2K分辨率输出。
MiniMax称,该模型在指令遵循、文字与品牌信息呈现、视频到视频动作迁移(V2V Motion Transfer)等方面表现出色,可用于广告、品牌、电商、产品设计、UI/UX和游戏等场景。
价格方面,MiniMax称其有能力提供行业内最优的性价比,模型在2K分辨率下每秒价格不到主流模型的1/3,768P分辨率下不到1/2,具体价格暂未公布。
目前,MiniMax H3在第三方评测机构Artificial Analysis的文生视频有声榜单中排名第二,Elo得分为1242分,略低于谷歌Gemini Omni Flash的1245分。
MiniMax计划在未来几天内,在符合相关法律法规的前提下,开放模型权重,推动开源生态和国产芯片适配。
一、文本、图片、视频、声音一起输入,最高输出15秒2K音视频
真实创作一般需要融合不同模态的复杂信息,用户使用MiniMax H3创作时,可以同时输入参考视频、人物图片和声音,要求模型进行复杂创作。
MiniMax给出的案例中,要求模型“参考视频1的希区柯克镜头运动,让图2中的人物唱歌,歌声参考音频3”。
参考视频:
参考图片:
H3会分别提取视频中的镜头运动、图片中的人物身份和音频中的声音特征,再根据自然语言描述组合成新视频。
在输出侧,H3最高支持15秒、2K分辨率,并能联合生成人声、音效和音乐,音频默认为原生双声道。除上述案例外,MiniMax还展示了H3生成电影片头、游戏UI、动态海报以及广告电商内容的效果。
游戏UI:
视频中,角色打开装备,进入零部件选择、配置确认和加载界面,最终切换到霓虹灯街道中的游戏画面。整个交互过程衔接流畅,界面反馈自然,营造出色彩丰富的赛博朋克游戏氛围。
动态海报:
画面开始时,人物以较小比例出现在粉色矩形底部,随后绿色标题文字从背景中显现,人物快速放大并向镜头伸手,形成冲出海报的立体效果,整体色彩和视觉风格较为统一。
广告电商:
电商广告视频先后展示模特佩戴银色护目镜的面部特写和侧脸,随后切换至黑白服装模特的全身镜头、眼镜产品特写及双人定妆画面。不同镜头之间的光影、服装和银黑配色保持一致,镜片反光和金属材质较为突出,已经具备商业广告的基本质感。
二、统一生成、参考和编辑任务,用自然语言连接不同模态
在H3之前,MiniMax先后研发了Hailuo 01和Hailuo 02两代视频模型。其中,Hailuo 01主要完成视频生成系统的从0到1搭建,Hailuo 02则重点提升架构效率、数据质量和模型规模。
研发H3时,MiniMax将重点从单项能力提升转向任务统一和泛化。
过往生成模型通常在任务上具有局限性:图片生成通常被拆分为文生图、图片编辑、主体参考、动作参考和风格参考等任务;声音生成又被分为人声、音效和音乐;视频生成则进一步细分为文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考和视频编辑。
MiniMax认为,这些边界虽然方便产品定义,却限制了用户自由组合素材的能力,也会让模型在训练阶段过早适应有限的任务形式。H3因此在预训练阶段就混合图像、视频、音频以及多种参考和编辑数据。
H3的预训练任务包括文生图、文生视频和文生音频。其中,视频训练同时覆盖音频联合生成和多镜头建模;音频训练不再区分人声、音效和音乐,而是进行统一建模。
参考和编辑任务则覆盖图片到图片、图片到视频、音频到音频以及音视频到音视频等组合。不同素材之间的参考、保留和修改关系,均通过自然语言描述,不被限制在少数预定义任务中。
在数据选择上,H3的广义参考和编辑训练主要采用真实自然数据,以提高数据扩展能力。MiniMax将语言视为连接不同模态和任务的桥梁,希望模型借助语言理解开放式创作意图,而不是只识别固定功能标签。
训练策略上,MiniMax选择尽早融合不同类型的数据和任务,并通过调整数据配比,让模型在预训练阶段就形成多模态上下文理解与生成能力。
三、四项技术降低训练和2K生成成本,后续将融合M系列能力
为实现多模态上下文理解,MiniMax首先构建了Contextual Omni Representation(上下文全模态表示),用语言同时描述目标视频、参考素材以及不同素材之间的关系。MiniMax通过定制模型和全模态理解管线,大部分素材需要消耗约10万Token的推理,最终压缩为平均约4K的Token。
H3-VAE则通过提高视觉信息压缩率,带来4倍的序列长度收益,大幅降低训练和推理成本,并为2K分辨率输出提供技术支持。
架构方面,MiniMax没有沿用Hailuo-02架构,而是采用更通用的H3-Omni Transformer。面对扩大3倍的序列长度方差,以及理解和生成任务之间不同的计算负载,H3采用异构训练架构并优化样本间负载均衡,MiniMax称其端到端训练吞吐提升近30%。
生成2K视频时,H3也没有使用独立超分辨率模块,而是通过In-context Regeneration(上下文再生),让基模结合原始多模态上下文重新生成高分辨率画面。MiniMax称,这种方式能够复用基模已有能力,并更好地还原小文字和局部细节。
MiniMax也提到,H3在复杂多模态理解、模型规模和部分场景的画面精细度上仍有提升空间。后续H系列将进一步融合M系列模型能力,并继续扩大模型规模、提高画面分辨率和细节表现。
结语:全模态视频生成走向统一模型
MiniMax H3试图用统一的全模态生成架构,取代过去被拆分为文生图、图生视频、音色参考、动作迁移等彼此隔离的任务管线。
随着模型开始同时接收语言、图片、视频和声音,视频生成工具的产品形态也可能从“输入提示词、生成一段视频”,逐步转向理解完整创作意图,并参与内容生产全过程。
H3能否兑现这一方向,仍要看其在复杂多模态指令稳定性、2K分辨率画面精细度、音画同步质量、真实生成成本等方面的实测表现。
来源:MiniMax
热门跟贴