打开网易新闻 查看精彩图片

最近,两个 AI 视频榜单同时更新。

一个是 Artificial Analysis,圈内人叫它 AA 榜。

我查了一下,Artificial Analysis图生视频赛道前四名:MiniMax H3和H3 Max占了前两席,第三是谷歌Gemini Omni Flash,第五是字节的Seedance 2.0 720p。

第四个名字很多人愣了一下:中国AI公司HiDream智象元一(以下简称智象)的HiDream-O1-Video-1.0(下文简称HiDream V1)。

打开网易新闻 查看精彩图片

另一个AI模型盲测评测平台Arena.ai Image-to-Video 中,这个模型排名第八。

问题来了。

如果你没听过“智象或者HiDream”这名字,很正常,这家公司过去两年几乎不在C端声量里出现,很少有蹭热点的发布会,它更像一个藏在幕后、闷头跑模型的技术团队。

但就是这样一家公司,在全球 AI 视频最硬核的两个榜单上,把一批名字更响的对手甩在了身后。

今年9月15日,智象(HiDream.ai)发布首个原生全模态视频生成模型HiDream V1,并宣布完成C+轮融资,本轮投资方包括新微资本、交子资本、工银资本。

HiDream V1 到底有多好?

我也学着生成了一个视频:用HiDream V1生成了抽书本视频,突然抽走最下面的支撑书,观察中间的书和橡皮如何下落。这个过程很考验模型对重力与受力变化的理解,也是模型最容易露出破绽的地方。

打开网易新闻 查看精彩图片

当模型真正理解物理规律,运动轨迹、物体交互和前后状态才会自然连贯。视频生成也将不止于“看起来真实”,而是“真的会这样发生”。

这才是决定模型能力上限的关键。

当前,国内AI视频赛道逐步转向世界模型,但视频模型本身依然处于大规模商业化节点。截至目前,智象Agent产品已覆盖全球100多个国家和地区,全球用户突破7000万,形成了从技术研发到产品商业化的闭环。

随着 AI 视频真正走入下半场,国内AI视频模型“四小龙”座次再次重排:MiniMax H3、字节Seedance、阿里万相和智象(HiDream)。而在此其中,智象走了一条完全不一样的路。

本文重新研究,Sora宣布关停半年多之后,为什么国内AI视频模型公司都开始做起了视频模型和物理世界模型“双赛道”的新生意。

有了世界模型,

AI视频模型如何突破“天花板”

进入2026年,AI视频生成市场原本有三类实力雄厚的竞争者:OpenAI、字节Seedance和其他中国初创公司。

但今年3月,OpenAI宣布全面关停人工智能视频生成工具 Sora,曾被视为AI视频标杆的产品正式退出市场,引发全球AI视频行业震动。

此次停运主要是由于该产品在财务上难以为继:

Sora 的日运营成本约为 100 万美元,但总收入仅约 210 万美元,活跃用户数也从接近 100 万的峰值骤降至不足 50 万。

Sora突然停止运营,凸显出依赖缺乏可持续商业模式的 AI 视频产品可能会给企业带来风险,而且也让国内多模态大模型领域迎来新的思考:在企业技术领域,最好的产品未必总是最终的赢家。外部标杆退场,但并非可以“躺平”的理由,反而意味着行业需要迅速转变。

而仍在坚守赛道的,是很多中国AI视频领域的公司。

因此,我们看到国内AI视频模型的公司出现了两个新变化:

第一,视频模型公司都纷纷加注世界模型的研发和落地。

比如,智象陆续发布了基于自研原生全模态UiT架构的模型家族,包括交互式世界模型HiDream-O1-World、具身世界模型HiDream-O1-Embodied等系列,并正在构建下一代原生全模态视频生成;字节层面,据报道,字节跳动创始人亲自督战研发Seedance的实时“世界模型”,最早可能在下个月推出。

这意味着,随着国内世界模型赛道热潮汹涌,拥有天然优势的AI视频公司全面转向世界模型已成定局,也是接下来行业发力的重点。

第二,AI视频生成类型公司正在加速商业化和C端的视频工具落地。

8月20日,字节的剪映推出剪映Hub、AI助手“小映”等功能,并推出“AI Ultra”订阅制,打造全场景智能创作平台。这意味着,AI已经进入到视频剪辑、视频生成、短剧在内的各个落地场景,并且已经形成商业化。

更早之前,字节Seedance、MiniMax H3等多模态产品加速在短剧、视频等场景落地。MiniMax财报显示,今年上半年MiniMax总收入约1.17亿美元,同比增长283.1%。其中,B端收入同比增长703.1%。

MiniMax创始人闫俊杰指出,视频等多模态模型将成为继编程之外,AI领域的第二大市场,他预计多模态模型未来会进入广告、电商、游戏、设计、影视等更完整的内容生产流程,从内容生成走向理解、修改和最终交付。

智象联合创始人兼首席运营官王科近期表示,目前,AI视频工具大致有两类交互方式:一类是画布式或节点式工作流,强调专业控制和自由度。另一类是对话式交互,试图降低操作门槛。随着Agent承担任务拆解和执行,创作者可以更多地表达目标,复杂的模型调用和制作流程则由系统在后台完成。

打开网易新闻 查看精彩图片

在王科看来,创业公司的融资规模和资源体量与大厂相比确实存在很大差距,竞争主要有三点:

第一,认知要快。对于模型架构、下一代模型的技术方向以及技术选型,要尽可能做出更早、更准确的判断。有时候只要比大厂提前半个身位,甚至提前三个月,就可能出现机会窗口。

第二,落地速度要快。方向确定之后,要尽快完成模型迭代,同时推进产品化和商业化,在窗口期形成产品壁垒或者用户壁垒。

第三,组织调整要快。创业公司的一个优势是组织更加扁平,决策链条更短,可以根据技术和产品变化快速调整方向。

“智象也有比较明确的生态位。比如我们与TikTok等平台,以及影视产业龙头上影集团,华策影视等都有比较紧密的合作,大厂拥有流量和资本优势,我们更希望依靠底层模型创新和工程落地速度参与竞争。在这个市场里,我们不会和大厂在所有方向全面竞争,而是希望在关键节点抓住技术和产品窗口。我们公司的核心策略依然是在图片和视频等多模态模型上持续投入,希望长期保持在全球第一梯队,这也是我们最核心的竞争力。”王科表示。

实际上,最近一年多,随着Sora关停,多家腰尾部AI视频公司选择退出或转型,AI视频赛道出现了“头部效应”,除了字节、阿里、快手、MiniMax等大厂和上市公司,智象这类AI视频赛道的头部也开始瞄准“通用多模态”领域,同时押注视频模型和多模态模型。

很多人认为“世界模型是更高级的视频模型”,那么,为什么有了物理世界模型,智象还会重视视频模型的迭代?

智象联合创始人兼CTO姚霆指出,因为真实世界本身就是全模态的,多模态大模型正经历一场从“多模态”到“全模态”的进化。图像记录状态,视频记录变化,空间提供结构,动作带来交互,语言承载意图和知识。“智象自研的原生全模态UiT架构,就是希望在同一个Transformer里,把多种原始信号端到端对齐,实现任意模态输入、任意模态输出。”

一位AI行业人士向智能纪元AGI解释称,世界模型的目标是输出符合物理规律的状态变化,本质是交互系统,而且主战场是具身智能与交互,包括机器人抓取、自动驾驶决策、VR 沉浸式交互、工业仿真等,核心是让 AI 理解并干预真实物理世界。

但视频模型不一样,它的本质是内容生产工具,存在更大的商业价值,主战场是内容产业,包括影视制作、短视频创作、广告营销、教育课件、游戏 CG 等,核心是降本增效地生产视觉内容,商业化成熟、价值链更大。

因此,如何突破视频模型的“天花板”,把物理世界的技术与视觉模型相结合,形成新的价值链体系,或许是一个新的技术趋势。

智象HiDream V1视频模型就是如此。

在 AI 视频这张牌桌上,大部分玩家还在比谁画得更清楚、谁生成得更长、谁的运镜更炫。

而智象已经在做一件更底层的事:让模型理解这个世界运行的规律。

该模型基于原生全模态世界模型架构HiDream-O1,支持文本、图片、视频等多种模态输入,可一键输出5–20秒1080p高保真视频。

同时在意图理解、物理规律理解、自主规划叙事、以及音画一体化生成等维度,智象新的模型均全面升级,发布同期,在多个国际权威评测榜单中,该模型均位居世界前列。

不仅如此,HiDream V1 对文本、视频、音频信号进行联合建模,Diffusion RL 后训练+多模态 Reward 模型,对画面保真、叙事连贯、身份一致、物理合理性与音画同步联合打分;DMSampler(ICML 2026)、DiffusionCompass(ECCV 2026)、EvoID(CVPR 2026)构成「低成本采样—质量锚定—身份保持」链路。

这个是 HiDream V1 生成的一个打碎咖啡杯的倒流画面。

打开网易新闻 查看精彩图片

让桌子上有一滩打翻的咖啡和碎裂的马克杯,重新让液体倒流回杯里,杯子碎片自动拼合,最终变成一个完好无损的马克杯稳稳落在桌上。而智象的HiDream-O1-Video完整的诠释了这一切。

打开网易新闻 查看精彩图片

模型A同一个提示词生成的视频,倒流的视频出现了几帧的正流咖啡的画面。

打开网易新闻 查看精彩图片

这个则是模型B生成的画面,杯子和咖啡直接跳了起来,甚至还有冒水的画面,不符合客观物理事实和规律。

相比之下,智象的HiDream V1更加可靠。

简而言之,高保真画面、1080P高清输出、5–20秒任意时长,指令遵循、人物与视频一致性等视频生成核心质量的全面优化,以及模型“因果”能力让画面不只「会动」,更知道「为什么这样动」。

这是智象的HiDream V1的最大优势,也是它能挤进全球第一梯队的真正原因。

对视频创作者而言,真正消耗时间和成本的,往往不是生成本身,而是动作变形、人物漂移和叙事断裂带来的反复尝试。

HiDream V1通过更稳定的指令遵循与人物一致性,让复杂动作能够演完整、关键细节接得上,事件也能按照合理的因果关系自然推进。它未必意味着每次生成都能直接成片,但能让结果更接近可用素材,减少无效生成和抽卡,提高制作效率。

一个底座长出四个模型,

和其他“三强”的牌不一样

早在2023年2月,ChatGPT刚席卷全球,Sora还没到来之际,梅涛创立了智象这家公司。

在梅涛看来,基于物理与数字世界融合的生成式AI多模态大模型,比ChatGPT更具挑战性,也具有更大的创业机遇,且彼时头部企业尚未建立起明显的技术壁垒优势。这对于当时大家追逐大语言模型的来说,无疑是有着与行业主流截然不同的判断。

成立三年来,智象证明了一切,坚持底层架构自研,走出了一条从多模态到原生全模态、从数字内容生成到物理世界交互的技术路线。

如果只看HiDream V1这一个模型,智象挤进全球视频模型第一梯队,似乎只是因为“视频做得比别人好一点”。

但把视线拉远,你会发现,这不是一个单点模型的胜利,而是一条全新全模态模型路线的兑现。

目前国内AI视频“四小龙”里,MiniMax、字节 Seedance、阿里万相,基本上都是从视频生成这个单点切入,再逐步往其他模态外扩,先把视频做透,再补 3D、补世界模型、补具身。

这是一条自然生长的路线,也是大多数玩家的选择。

但智象完全走的是另一条路。

从最早发布的图像模型开始,智象就在铺一个叫 UiT 的统一底座。图像、视频、3D 交互、具身 —— 这四个模型不是先后长出来的,而是从同一个底座里同源演进的,形成原生全模态世界模型矩阵。

打开网易新闻 查看精彩图片

用姚霆的话说,是“在同一个 Transformer 里,把多种原始信号端到端对齐,实现任意模态输入、任意模态输出”。

目前,智象已发布基于UiT架构的模型家族:图像生成模型HiDream-O1-Image系列、视频模型HiDream V1系列,交互式世界模型HiDream-O1-World、具身世界模型HiDream-O1-Embodied等。

打个比方。

其他AI视频公司的路线像是盖楼,先把一楼(视频)盖好,再往上加二楼(图像)、三楼(3D)、四楼(具身),每加一层,都要重新考虑和下面楼层的承重、管道、动线怎么衔接。

而智象的路线,更像是先把地基和结构骨架一次性浇好,再在这个骨架上同时长出不同楼层 —— 每层之间的水电、动线、承重从一开始就是打通的。

这意味着,别人是在做“更好的视频模型”,而智象是在做“理解世界的底座”,视频只是这个底座当前对外输出的一个窗口。当底座足够大,图像、视频、3D、具身之间的能力会互相反哺,这种复利是单点路线很难追上的。

回到开头那个问题:智象凭什么挤进来?

它不是凭某一个爆款 Demo,不是凭某一次融资,也不是凭某一项参数领先,而是凭从一开始就不局限于单一视频模型,以原生全模态为底座,持续向世界模型演进。

姚霆认为,HiDream V1是智象原生全模态世界模型矩阵的关键组成部分。“我们相信,视频生成的代际进化不仅仅是像素的提升和时长的延续,重点在于模型是否真正理解创作者的意图和真实世界的物理规律。”

近三个月内,智象已完成三轮融资,累计融资额超过21亿元,投后估值突破10亿美元,跻身独角兽行列。

“下一代大模型竞争的关键,不在于单一模态能力的增长,而在于从单模态走向多模态,并走向原生统一的全模态。”梅涛表示,智象正以原生全模态技术为核心,持续迈向世界模型,向着全球领先的全模态人工智能企业稳步迈进。