智象未来(HiDream.ai)把一款新模型推到了台前。这家公司正式发布HiDream-O1-Video-1.0,模型简称HD-V1,定位是首个原生全模态视频生成模型。

它采用智象自研的原生全模态架构,支持文本、图片、视频等多种模态输入。用户可一键直出5–20秒1080p高保真视频,不需要在多套工具之间来回切换。

打开网易新闻 查看精彩图片

四个维度的升级

打开网易新闻 查看精彩图片

HD-V1的升级集中在四个方向,覆盖从理解到生成的完整链路:

  • 意图理解:更准确地读懂输入到底想要什么
  • 物理规律理解:让画面里的运动符合现实逻辑
  • 自主规划叙事:模型自己安排镜头与情节走向
  • 音画一体化生成:声音和画面同步产出

其中“物理规律理解”被写进了模型的核心能力清单。视频生成长期被诟病的一点,就是物体运动失真、受力关系错乱,而HD-V1把这一项单独列为升级维度。

全模态输入意味着什么

文本、图片、视频都能作为输入,意味着同一个模型可以承接不同起点的创作需求。给一段文字,或者给一张图,甚至给一段已有视频,都能进入同一条生成流程。

打开网易新闻 查看精彩图片

原生全模态架构是智象自研的技术路线。与拼接多个专用模型的做法不同,它把多种模态的处理放在同一套架构里完成。

输出规格上,5–20秒的时长区间和1080p分辨率,覆盖了短视频素材、广告片段、概念演示等常见场景的基本要求。一键直出的产品形态,则把使用门槛压到了最低。

智象未来此次发布的是1.0版本,模型简称HD-V1。