智象未来(HiDream.ai)把一款新模型推到了台前。这家公司正式发布HiDream-O1-Video-1.0,模型简称HD-V1,定位是首个原生全模态视频生成模型。
它采用智象自研的原生全模态架构,支持文本、图片、视频等多种模态输入。用户可一键直出5–20秒的1080p高保真视频,不需要在多套工具之间来回切换。
打开网易新闻 查看精彩图片
四个维度的升级
打开网易新闻 查看精彩图片
HD-V1的升级集中在四个方向,覆盖从理解到生成的完整链路:
- 意图理解:更准确地读懂输入到底想要什么
- 物理规律理解:让画面里的运动符合现实逻辑
- 自主规划叙事:模型自己安排镜头与情节走向
- 音画一体化生成:声音和画面同步产出
其中“物理规律理解”被写进了模型的核心能力清单。视频生成长期被诟病的一点,就是物体运动失真、受力关系错乱,而HD-V1把这一项单独列为升级维度。
全模态输入意味着什么
文本、图片、视频都能作为输入,意味着同一个模型可以承接不同起点的创作需求。给一段文字,或者给一张图,甚至给一段已有视频,都能进入同一条生成流程。
打开网易新闻 查看精彩图片
原生全模态架构是智象自研的技术路线。与拼接多个专用模型的做法不同,它把多种模态的处理放在同一套架构里完成。
输出规格上,5–20秒的时长区间和1080p分辨率,覆盖了短视频素材、广告片段、概念演示等常见场景的基本要求。一键直出的产品形态,则把使用门槛压到了最低。
智象未来此次发布的是1.0版本,模型简称HD-V1。
热门跟贴