出品 | 《态度》栏目
作者 | 纪川
编辑 | 定西
一年前,中国视频模型在国际权威模型评测竞技场上还只是零星出现。到2026年9月,字节Seedance2.0/2.5、MiniMax H3、阿里Wan 3.0和智象HiDream-O1-Video-1.0(下文简称HiDream V1)已相继进入全球视频生成模型头部方阵。三个月内,四款模型密集上新,意味着中国力量正从单点突围转向集群式上行。
但进入同一梯队,并不意味着走的是同一条路。当画质、时长和人物一致性逐渐成为基础能力,竞争焦点开始从“生成得像不像”转向“是否理解真实世界”。有人押注效率,有人依托规模与生态;智象选择的切口,则是更懂物理规律与事件逻辑。HiDream V1由此成为观察其“原生全模态世界模型”路线的一扇窗口。
1、四支力量,三种路线,同一个梯队
沿着各自的技术路线向下看,四家公司呈现出不同的资源禀赋与竞争逻辑。
字节Seedance背靠大厂完整的算力、工程和产品体系;MiniMax H3依托大模型基座与用户积累,向多模态持续延伸;阿里Wan 3.0则嵌入通义、阿里云等构成的技术生态。智象走的是另一条路:作为AI创业公司,它没有大厂的资源和入口优势,选择押注“原生全模态世界模型架构”,推动图像、视频、3D交互与具身智能在统一底座上演进。HiDream V1补上的,正是其中关于“时间与变化”的关键一环。
不同背景、不同路线的团队同时进入国际主流榜单头部,意味着中国视频模型正在从单点突围转向集群竞争。其优势不只是玩家更多,更在于大厂、AI独角兽等玩家从不同方向探索技术边界,降低了产业对单一路线的依赖。
这也引出一个问题:当市场已有多款高画质、长时长且成本不断下降的视频模型,为什么还需要HiDream V1?
答案不在于“多一个模型”,而在于“多一条路”。当前视频生成仍面临一个核心难题:模型可以把每一帧画得足够逼真,却未必理解事件应该如何发生。例如物体运动是否符合物理规律、动作与声音能否准确同步、前后事件是否具有因果关系。这些问题无法仅靠提升分辨率和延长时长解决。
HiDream V1试图把竞争向前推进一步:在生成之前强化对动作持续时间、物体关系、事件逻辑和音画对应的理解,让视频模型从“会生成”走向“懂世界”。这并非对其他技术路线的替代,而是一种补充:当画质、时长和效率逐渐成为基础能力,对真实世界的理解将成为新的分水岭。中国视频模型的集群优势,恰恰在于多条路线能够同时向前探索。
2、双榜前列,HiDream V1进入全球头部阵营
HiDream V1的首次亮相,先被放进了全球视频模型竞争的公开坐标系。
发布同期,在 Artificial Analysis Image to Video Leaderboard(With Audio)榜单中,HiDream V1位列全球第4;Arena.ai Image-to-Video 榜单暂列第8。
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
值得注意的不只是智象一家。同一张榜单上,MiniMax H3、字节 Seedance 也都在头部区间——中国名字密集出现在国际视频模型排行里,这本身就是一种产业信号。
榜单不是全部,但它提供了一个外部参照:HiDream V1已经进入全球头部视频模型的同场比较,而中国视频模型作为一个整体,正在这张榜单上形成存在感。
回到产品本身。HiDream V1支持文本、图片、视频等多种模态输入,可生成5至20秒1080p高保真视频,在意图理解、物理规律、动态时长、叙事连贯性、人物一致性和音画同步上完成系统优化。它是智象首个原生全模态视频生成模型。
更值得看的,是 HiDream V1的竞争力并非来自某一个单点能力。画面高保真只是基础,真正拉开差距的,是它试图把意图理解、物理规律、时长规划和音画同步放进同一条生成链路里。换句话说,HiDream V1要让视频里的事件更合理。
智象未来技术合伙人、算法科学家潘滢炜博士告诉网易科技,智象希望做的是"带脑子的、更智能的模型",不是简单把提示词和图片丢进去,让画面动一动。这解释了为什么智象会把视频模型能力的竞争,放到"智能水平"的维度上,而非单纯追逐生成效果。
3、真正拉开差距的,是demo里的细节
物理规律,是整个视频模型行业最难啃的骨头,不只是智象的挑战。
当前不少视频模型已经能生成相当精致的画面,也能按照指令做简单动作。但一旦进入更复杂的物理场景,违和感就会出现:柔性物体不按受力方向运动,物体凭空出现或消失,碰撞反馈不自然,动作完成后镜头仍被强行拉长。这些问题在四家头部模型身上都不同程度存在,区别只在于谁犯得更少。
接下来,从几个看似日常、却很能暴露模型短板的任务,看 HiDream V1的完成效果。
首先是推倒多米诺骨牌。
这个画面考验的不是“骨牌倒下”这一个动作,而是一整条因果链能不能成立。每一块骨牌都必须先接触下一块,下一块才能倒下,同时还要配合清晰的点击声。
实测下,部分模型会在中途断掉,或出现骨牌还没发生接触就自行倒下的情况。HiDream V1的处理更接近真实连锁反应:第一块被推倒后,碰撞一块块传递,骨牌数量、倒下顺序和拐角处的运动关系都保持得更稳定。
同时,对“时长”的理解在这里也很关键。多米诺的时间不是被硬塞进一个固定窗口,而是由事件自己决定:第一块何时倒下,第二块何时被碰到,声音何时出现,都要跟碰撞节奏一致。HiDream V1在这里做的,是让镜头时长服从内容本身。
多米1
打开网易新闻 查看更多视频
多米1
多米2
打开网易新闻 查看更多视频
多米2
多米3
打开网易新闻 查看更多视频
多米3
图注:此视频为HiDream V1生成
提示词:Live-action low angle, one take. The fingertip taps the first domino, and the twelve dominoes fall in order around the right-angle corner, ending beside the blue mug. Each tile must contact the next before it falls; keep exactly twelve alternating red and ivory tiles, the mug upright, and no jump cuts. Add twelve distinct clicks with correct timing.
再看,高速赛车。
这个任务同时考验画面高保真、指令遵循、运动方向和音画同步。赛车高速掠过镜头时,模型要维持车身结构稳定,不能在运动中变形;声音也不能只是一段泛泛的引擎噪音,而要随着车辆接近、掠过和远离发生变化。
实测下,部分模型会出现车身形态漂移,甚至尾部突然变成车头的情况。HiDream V1的赛车主体保持得更稳定,运动方向清晰,引擎声也随车辆位置变化产生了更自然的音调落差。
效果的实现主要源于背后的架构。HiDream V1采用文本、视频和音频信号联合建模,而不是先生成画面、再后期配音。潘滢炜说,音画同步和原生全模态“天然耦合”,相比割裂生成,联合建模的对齐程度会更高,感知上也更自然。
也就是说,HiDream V1生成的不是一段带声音的视频,而是一段声音和画面共同成立的运动事件。
赛车1
打开网易新闻 查看更多视频
赛车1
赛车2
打开网易新闻 查看更多视频
赛车2
赛车3
打开网易新闻 查看更多视频
赛车3
图注:此视频为HiDream V1生成
提示词:一辆高速赛车以极快的速度从镜头前由左向右疾驰而过。音频:引擎声必须表现出逼真的多普勒效应,从极高音调开始,在经过镜头的瞬间音调显著下降。
最后看线稿上色。
这个任务考验的是模型能不能真正听懂复杂指令。它不只是生成一张漂亮插画,而是要理解顺序、边界和接触关系:先后顺序不能乱,颜色不能提前出现,画笔没碰到的地方不能自己变色,原有线稿结构也要保持稳定。
实测下,部分模型会出现上色突变、颜色溢出,或者没有严格按照指令推进。HiDream V1的画面更稳定:颜色跟随画笔移动,线稿边界保持清晰,最终形成的是同一张图从黑白线稿到彩色插画的连续变化。
这也是“懂意图”的另一种体现。难点不在画得像,而在听得懂。模型需要把一句复杂提示词拆成可执行的动作序列,再在连续生成中保持一致。
线稿1
打开网易新闻 查看更多视频
线稿1
线稿2
打开网易新闻 查看更多视频
线稿2
线稿3
打开网易新闻 查看更多视频
线稿3

图注:此视频为HiDream V1生成

提示词:Top-down live-action art process, one continuous take. A blue brush gradually fills the line drawing: first the green tree, then red bicycle, yellow sun and blue windows, leaving black contours crisp. Color follows brush contact and never spills outside the drawn shapes; by the end the same drawing is a coherent colored illustration. Show wet paint texture and brush sounds, no morphing or new objects.
此外,网易科技还测试了几组更贴近日常物理世界的场景,包括冰块掉入水中、倒水、纸张折叠等。实测结果显示,HiDream V1在这些场景里也能较好维持物体状态和动作连续性。
把这些实测放在一起看,HiDream V1把一条能力链清晰地展示了出来:从物理因果,到动作时长,到音画因果,再到复杂指令理解和过程控制,模型正在把视频生成从画面能力推向状态推演能力。
4、为什么它能做到:理解、生成、对齐
这背后,不是给视频模型多喂一些物理数据这么简单,也不是在生成后再做规则修补。
智象技术合伙人潘滢炜博士告诉网易科技,HiDream V1的技术路径可以拆成三步:先理解,再生成,再对齐。
打开网易新闻 查看精彩图片
图注:HiDream V1技术路径示意——理解→生成→对齐
第一步,是在生成前先做理解。
过去很多视频模型更像是"把图动起来":用户给一张图、一句话,模型直接进入生成。但 HiDream V1会先通过多模态理解模块,对输入图片和文本进行结构化拆解,判断画面中的场景、主体、动作、物理关系、镜头时长、运镜方式以及声音设计。
这一步的意义在于,模型会先把用户意图翻译成更适合视频生成的内部规划。比如苹果抛接,它要先理解这是一个短促动作;乒乓球弹跳,它要先理解弹跳高度、频率和撞击声之间存在物理关联;穿针引线,它要先判断红线、手指、针眼之间的受力关系。
第二步,是把这些理解结果灌进原生全模态生成过程。
潘滢炜提到,物理规律不能只停留在"知道"层面,还要变成跟视觉内容匹配的信号。"你重力落下来,几秒钟之后会在什么地方,这些精准的、跟视觉内容匹配的信号,是要给到模型里的。"
HiDream V1的关键,正是在生成过程中纳入物理规律、动作节奏和音画关系,让画面、动作、声音和时间彼此约束。
第三步,是用后训练进一步对齐合理性。
在预训练之后,智象还会用 Reward 机制强化物理规律、音画同步和整体观感。潘滢炜将其类比为一种 human preference:哪些结果更符合重力、碰撞、光影、空间连续,哪些结果看起来违和,模型会从这种强弱对比中继续学习。
这也是 HiDream V1的能力可以跨越多个场景的原因。穿针测试里,它要处理柔性物体的受力形变;苹果测试里,它要判断事件应该持续多久;乒乓球测试里,它要同时对齐画面运动和声音反馈。这几件事表面上不同,底层都指向同一个能力:模型开始推演一个事件如何发生。
更进一步,这套机制之所以能成立,也和智象的原生全模态底座有关。
5、一个UiT底座,四大模型同源演进
HiDream V1并不是一个孤立的视频模型。它和 HiDream-O1-Image、HiDream-O1-World、HiDream-O1-Embodied 同源,都是从 O1原生全模态架构上长出来的不同任务形态。视频模型多了音频和时序信号,因此更重、更难,但也正因为它接入同一个底座,文本、图像、视频、音频之间才能在同一生成过程中互相约束,而不是各做各的。
所以,HiDream V1能做出这些效果,不只是因为视频能力增强了,而是因为智象试图把"理解世界、表达世界、反馈世界"放进同一套模型逻辑里。

智象在视频生成领域有着深厚技术积累。2024年1月率先实现超15秒视频生成技术突破,同年7月推出全球首个商用DiT大模型HiDream 2.0,12月发布采用扩散自回归架构的HiDream 3.0,持续推动视频模型从生成能力向深层理解演进。今天发布的HiDream-01-Video-1.0,则实现了在面向世界模型方向的新一代UiT 架构上的再次升级。

打开网易新闻 查看精彩图片

图注:智象未来视频模型发展历程

潘滢炜用了一个更形象的比喻:O1-Image、O1-World、O1-Embodied 和 O1-Video,是"一个架构上面长出来的几朵不同的花"。它们的基础架构通用,只是不同任务灌入的数据、后训练方式、条件设计不同。视频任务因为多了音频和时序信息,也更重、更消耗算力。
这与行业里其他几条路线形成了有趣对照。
字节 Seedance 和 MiniMax H3走的是"先把视频生成做强"的路线,在单点任务上建立优势,再向多模态外扩。阿里 Wan 3.0依托通义体系,把视频模型嵌入大模型+云服务的整体方案。这些路径都很重要,本质上是从一个任务向外延展。
智象的选择不同:先押注原生全模态 UiT 底座,再让图像、视频、世界模型和具身模型在同一架构下同源演进。
潘滢炜说,这不是"做完A再做B,做完B再做C"的串行关系。原生全模态架构出来后,多个任务是并行推进的,只是视频模型更重,所以发布节奏更慢。
这条路线的代价是,单看一个任务,投入更大、周期可能更长;但好处也很清楚:一旦底座打好,不同模型之间可以互相促进,后续能力迭代会更快。
"对一个人来说,认识世界就是听觉、视觉,包括触觉等等一体的。"潘滢炜说。越接近 AGI 时代的世界模型,模态越齐、对齐程度越高,天花板也会越高。
6、视频之后,世界模型闭环初现
从这个角度看,HiDream V1的节点意义非常清晰。
单看模型本身,HiDream V1是智象未来多年视频模型积累在新一代 UiT 底座上的升级;放在HiDream O1系列中,它连接的则是静态图像、动态视频、空间交互与现实行动,使智象“一个原生全模态底座、四大模型同源演进”的技术版图初步闭环。
按照智象的规划,图像模型负责静态表达,视频模型处理时间与运动,交互式世界模型理解空间及交互,具身世界模型进一步将行动与真实反馈纳入体系。四类模型并非彼此割裂,而是在统一底层架构上共享和迁移能力。相比单点推进视频生成,这一路线的核心价值不在于模型数量,而在于不同模态能否相互增强:图像沉淀视觉表征,视频引入时间与物理变化,世界模型和具身智能再将这些能力推向空间理解与现实行动。
但闭环初现,不等于世界模型已经成熟。正如潘博士所言,目前没有任何模型能够完全解决物理规律问题,复杂因果推理、长时一致性、可控交互与算力成本,仍是全行业共同面对的难题。HiDream V1的真正意义,是把竞争向前推进了一步:视频模型比拼的不再只是画质、时长和价格,还包括对运动、因果与真实世界规则的理解。
这也是中国视频模型集群竞争的下一站。字节、MiniMax、阿里和智象依托不同资源、选择不同路径,却都在从“生成画面”走向“理解世界”。其中,智象提供了一种底层模型架构创新先行的路线样本:视频模型不是孤立的一环,而是通向世界模型的关键接口。
过去,视频生成模型证明了AI可以生成足够逼真的画面;接下来,它们需要证明自己理解画面为何如此发生。HiDream V1补上的不仅是智象原生全模态世界模型版图中的视频一环,更是从“生成世界”迈向“构建世界”的关键一步。
目前,HiDream-O1-Video-1.0已开放内测申请。感兴趣的读者可以扫描下方二维码,申请测试模型能力。
打开网易新闻 查看精彩图片