IT时代网7月31日消息,稀宇科技今天推出通用多模态视频模型MiniMax H3。按照模型社区页面的信息,这款模型将在北京时间8月3日0点正式开源。

H3的定位是“统一理解”。文本、图像、视频、声音这四类输入被放进同一个多模态上下文里处理,输出则是带原生双声道的音视频,最高支持15秒的2K分辨率内容。

支撑这套能力的是几项自研技术,官方点名了Contextual Omni Representation、H3-VAE、H3-Omni Transformer以及In-context Regeneration。稀宇科技强调的卖点是性价比:H3默认输出2K分辨率,在这一档位下每秒价格不到主流模型的三分之一;如果换成768P,成本约为主流模型720P的一半。

官方总结的亮点有三块。原生多模态理解与生成方面,模型能读懂不同素材中的人物、动作、声音、情绪、镜头、风格和表达意图,并把多种参考信息自然融合到一起。

编辑控制方面,人物、物体、场景、声音、节奏都可以做多维度调整,官方称其具备精细化的指令遵循能力。

场景覆盖方面,H3瞄准的是影视、广告、品牌、电商和游戏这些真实商业需求,文字字幕、品牌信息、创意特效、产品展示、UI与UX动态演示、游戏视觉及风格化表达都在射程之内。

开源这一步值得留意。把一个定位商用级的多模态视频模型直接放出来,等于把这类能力的门槛又往下压了一截。

打开网易新闻 查看精彩图片

注:本文中包含AI辅助创作的内容。