8月3日,稀宇科技宣布新一代多模态生成模型MiniMax H3正式开源。作为MiniMax最新一代视频生成模型,H3进一步提升了AI在视频创作、多模态理解以及内容编辑方面的能力,推动高性能视频生成技术向开发者和企业开放。
MiniMax H3是一款全模态生成模型,支持文本、图片、视频和音频等多种输入形式,并能够生成包含画面与原生双声道音频的视频内容。官方表示,H3最高支持生成2K分辨率、最长15秒的视频,同时具备视频生成、视频编辑、视频重构以及视频到视频动作迁移等能力。
相比传统AI视频模型主要依靠文字提示生成内容,MiniMax H3更加注重多模态信息理解。用户可以输入文字描述、参考图片、视频素材甚至声音信息,让模型完成更加复杂的视频创作任务,例如角色保持、场景变化、品牌元素植入以及视频风格转换等。
在应用场景方面,H3针对广告营销、电商内容生产、影视创作、游戏开发以及产品设计等领域进行了优化。稀宇科技表示,H3在文字生成、复杂场景理解、主体一致性以及视频编辑能力方面进行了增强,能够帮助企业降低视频内容生产成本,提高创作效率。
值得关注的是,此次MiniMax选择开源H3模型,将进一步推动AI视频生成技术生态发展。过去,高质量视频生成模型大多采用闭源方式,开发者只能通过接口调用,而开源模型则能够让更多研究人员和企业基于模型进行二次开发、优化和应用探索。
近年来,随着AI大模型竞争从文本走向多模态,AI视频生成已经成为全球科技公司的重点赛道。从OpenAI的视频模型,到字节跳动、快手以及MiniMax等国内企业的持续布局,AI视频正在从简单的内容生成工具,逐渐发展为能够理解、创造和编辑真实世界内容的新型生产力。
MiniMax H3的开源,也意味着国产AI模型竞争进一步进入生态化阶段。未来,模型能力、开放程度以及商业落地速度,将成为AI企业竞争的重要方向。
热门跟贴