9月15日,智象未来(HiDream.ai)发布首个原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1)。该模型支持文本、图片、视频等多模态输入,可一键直出5—20秒1080p视频。

发布同期,HD-V1在两份国际评测榜单中进入前列:在Artificial Analysis Image to Video Leaderboard(With Audio)上取得全球第四,在Arena.ai Image-to-Video盲测评测中位列第8。前者为独立的AI基准测试平台,后者为专注AI视频生成模型的盲测平台。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

据介绍,HD-V1采用智象自研原生全模态架构,对文本、视频、音频信号联合建模,实现音画一体化生成——画面运动牵引声音节奏,台词与音效反哺镜头情绪。与前代多数模型"先逐帧生成画面、再后期配音"的路线不同,三者在同一生成过程中相互约束、对齐。模型还前置多模态意图理解模块,对镜头时长、场景、角色动作与台词音效等字段进行结构化规划,并将重力、碰撞、惯性等物理规律写入生成逻辑。此外,HD-V1将时长决策交还内容本身,由模型根据叙事节奏自行规划生成时长,而非按提示词固定填充。

智象未来CTO姚霆表示,视频生成的代际进化不仅是像素提升与时长延续,更在于模型是否真正理解创作者意图与真实世界的物理规律。

HD-V1是智象"原生全模态世界模型矩阵"的最新一环。今年4月,智象发布原生全模态世界模型架构HiDream-O1,此后基于同一架构陆续推出图像生成模型HiDream-O1-Image(商用版1.5在Artificial Analysis文生图榜单取得中国第一、全球第二,开源版第二)、交互式世界模型HiDream-O1-World(WBench综合总榜第一)、具身世界模型HiDream-O1-Embodied(RoboColiseum扰动适应与空间推理子榜登顶)。随着视频模型发布,智象方面称,业内首个原生全模态世界模型闭环已成型。

HD-V1发布同期,智象未来宣布完成C+轮融资,投资方为新微资本、交子资本、工银资本。据介绍,新微资本由上海新微科技集团、上海科创投集团及管理团队共同发起成立,管理基金规模近百亿元;交子资本为成都交子金控集团旗下全资国有股权投资平台,管理基金规模超1700亿元。(袁宁)