打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

编辑:前沿在线 编辑部

你觉得视频大模型接下来会卷什么?

更高的分辨率?更长的时长?更逼真的画质?

这些当然还会继续卷。而且卷得很凶。就在过去三个月里,头部模型已经从 1080P 卷到了原生 4K,时长从十几秒卷到了三十秒。

影视级内容、广告、短剧这些场景,就是需要更高清、更长、更逼真的生成能力,这条路还远没到尽头。

打开网易新闻 查看精彩图片

但我想说的是,除了画质和时长,一个新的竞争维度正在打开。

这个新维度叫:实时交互。

是 AI 不再是一段你只能看的视频,而是一个能跟你面对面聊天的角色。

这件事,已经发生了。

今年 WAIC 上,生数科技展台前排队的人绕了三圈。有人玩了十分钟不想走,有人反复测各种指令,连路过的老外都停下来看了两眼。

打开网易新闻 查看精彩图片

最火的一个测试,是让 AI 角色 "把眼镜摘下来"。

打开网易新闻 查看精彩图片

很多人第一次看到这个动作的时候,都愣了一下。不是因为这个动作有多难,而是因为它居然真的能摘。

很多 2D 数字人方案里,眼镜是贴在脸上的贴图,跟脸是两层东西,自然摘不下来。

它能摘,说明它真的理解 "眼镜" 是什么,理解眼镜和脸的关系,理解 "摘" 这个动作的物理逻辑。

一个简单的动作,背后是两套完全不同的技术路线。

而这,就是视频大模型第二条战线的起点。

打开网易新闻 查看精彩图片

画质这仗,还远没打完

先说清楚,画质、时长、一致性,这些基础能力依然非常重要,而且还在快速进步。

过去半年,整个行业在这条战线上的进步可以用 "狂飙" 来形容。

打开网易新闻 查看精彩图片

分辨率上,头部模型已经从 1080P 卷到了原生 4K,不是后期超分,是从底层直接生成 4K 画面。

时长上,从十几秒卷到了三十秒,简单场景甚至能拉到几分钟。一致性、物理合理性、镜头逻辑,也都在快速提升。

前沿在线梳理,目前国内至少有三家能做到原生 4K 输出,能做到 1080P、30 秒稳定生成的团队就更多了。

更重要的是,AI 视频正在告别 "抽卡时代"。

打开网易新闻 查看精彩图片

前两年做 AI 视频,提示词是个高度玄学的东西。同样的指令生成十次有十个结果,能用的素材全靠碰运气,业内戏称 "AI 视频生产 = 抽卡"。

但现在不一样了,随着多条件控制能力的跃升,模型已经能按分镜脚本精准控制镜头语言,生成过程越来越可控。

"能生成" 早就不是壁垒了,"能不能稳定产出好内容" 才是。

但问题也来了,当头部模型的基础能力都到了很高的水平,再往上卷,边际收益就开始递减了。

从 480P 到 720P,人人都能看出区别;从 720P 到 1080P,仔细看能看出来;

从 1080P 到 4K 呢?在手机屏幕上、在短视频场景下,大部分人其实感知不到明显差异。

打开网易新闻 查看精彩图片

不是说 4K 没用。恰恰相反,影视级内容、高端广告、大屏展示这些场景,对画质的追求是无止境的。

4K、8K、120fps、物理级渲染,这些方向依然有巨大的价值空间,而且会一直卷下去。

但对大部分通用场景来说,短视频、社交媒体、日常创作,720P、1080P 已经 "够用" 了。

当所有人都过了 "够用" 这个门槛,竞争就会自然地往新的维度延伸。

这其实是所有行业的规律,任何一条增长曲线,都会有边际收益递减的一天。真正厉害的公司,会在第一条曲线还没到顶的时候,就开始布局第二条曲线。

打开网易新闻 查看精彩图片

视频大模型行业,现在正处在这个节点上。第一条战线还在打,而且打得很凶;但第二条战线已经悄悄开打了。

打开网易新闻 查看精彩图片

第二条战线为什么不一样?

那这条新战线到底是什么?很多人第一反应是,生成得更快了。

但我得说,这个理解还是浅了。实时交互不是 "更快的生成",是生成范式变了。

打开网易新闻 查看精彩图片

第一条战线上的视频生成是什么样的?

你输入一段提示词,模型算几十秒,给你返回一段固定的视频。

整个过程是单向的、一次性的、不可干预的。就像去照相馆拍照,摄影师按快门,你等结果,不满意就重拍。

第二条战线上的实时交互是什么样的?

你边说它边生成,你随时打断它随时调整,你换个话题它马上跟着变。

整个过程是双向的、持续的、可干预的。

就像跟一个真人视频通话,对话是流动的,反应是即时的,过程是共创的。

这两种模式的差别有多大?就像唱片和现场演出的差别。唱片再高清也是固定的,现场演出再粗糙,它是活的。

Vidu S1 负责人张金涛在一次专访中说过一个判断我很认同:视频生成未来的关键变化,不只是从 "生成得不够好" 变成 "生成得更好",而是从 "生成一段内容" 走向 "生成一种体验"。

打开网易新闻 查看精彩图片

离线视频生成对应的是高质量内容生产,电影、广告、短片、精准剪辑。

但人类还有很多需求,本质上是实时发生的。

比如你喜欢一个人,你不会只满足于每天看他的照片,或者看他提前录好的视频;你会想和他说话,想见到他,想看到他对你产生即时反应。

游戏也是一样,真正吸引人的不是看一段提前录好的内容,而是在一个世界里行动,并且立刻得到反馈。

打开网易新闻 查看精彩图片

从这个角度看,流式视频生成不是简单地让视频生成更快,而是让视频模型从 "一次性生成内容" 变成 "持续生成交互体验"。

新维度会带来什么变化?我觉得至少三个本质不同。

首先是商业模式变了。

打开网易新闻 查看精彩图片

以前卖的是内容,按条收费,一锤子买卖。以后卖的是时间,按分钟收费、按订阅收费,持续性收入。

一个工具卖 99 块钱一年用户觉得贵,一个能陪你聊天的 AI 角色一个月收 29 块,用户觉得便宜。价值逻辑完全不一样。

从工具到陪伴,用户付费的心理账户完全不同。这不是定价的问题,是价值感知的问题。

然后是用户规模变了。

打开网易新闻 查看精彩图片

以前的用户是创作者,做视频的、做广告的、做短剧的,几千万的规模。以后的用户是所有人,只要你需要跟 AI 交互就是潜在用户,几十亿的规模。

从生产工具到消费入口,用户量级差了好几个数量级。

这个变化有多重要?你看看大语言模型的发展路径就知道了。

最早的大模型也是给开发者用的工具,后来 ChatGPT 出来,变成了人人能用的产品,用户规模直接涨了一百倍。

视频大模型也会走同样的路,从创作者工具,到大众消费产品。

最后是核心壁垒变了。

打开网易新闻 查看精彩图片

第一条战线比的是谁的数据多、谁的模型大、谁生成得好看。

第二条战线比的是谁的推理快、谁的延迟低、谁的部署成本低、谁的长时稳定性好。算法的权重在下降,工程化的权重在快速上升。

这个变化最容易被忽略,但可能是最根本的。

第一条战线是算法驱动的时代,谁有新算法谁就领先。第二条战线是工程驱动的时代,谁能把成本压到最低、把体验做到最好,谁就能赢。

这就是为什么说这是一条新战线。

不是说它比画质更高级,而是说它是一个完全不同的赛场,比的东西完全不一样。你在第一条战线上积累的优势,到了第二条战线上可能根本用不上。

打开网易新闻 查看精彩图片

真正的壁垒在哪?

目前在这条新战线上,已经有不少玩家在布局。

海外的 HeyGen 等数字人公司在往 AI 生成方向转型,国内其他视频模型公司也在探索实时交互的可能性,传统数字人厂商也在升级技术路线。

在第一批跑出来的玩家中,生数的 Vidu S1是最受关注的一个。

7 月 3 日,在 2026 全球数字经济大会上,生数科技创始人朱军正式对外发布了这款全新的实时交互模型

打开网易新闻 查看精彩图片

它由朱军教授的 00 后博士生张金涛担任负责人,带领团队完成全链路研发。

Vidu S1 面向的是一类全新的使用场景:让视频模型从离线成片,走向可对话、可响应、可持续在线的实时交互。

它的核心能力包括语音实时控制视频生成内容、无限长实时生成、540P+25FPS 实时交互,以及自定义初始图像与音色。

打开网易新闻 查看精彩图片

它为什么能先跑出来?

答案可能跟你想的不一样,不是靠堆 GPU,不是靠模型更大,是靠全栈工程优化。

Vidu S1 最狠的一点是什么?

它单张高端消费级显卡(如 RTX 5090)就能跑 540P、25FPS 的实时交互,最高支持 42FPS。

什么概念?

相比传统高端定制数字人方案,动捕加建模加服务器集群,成本下降了一到两个数量级

打开网易新闻 查看精彩图片

以前做一个高质量数字人几十万起步,现在一张显卡的成本,就能跑一个能实时对话的数字角色。门槛被大幅拉低了。

有意思的是,这很像那些颠覆性技术的经典路径。

一开始画质差、效果糙、主流玩家看不上,但成本低一个数量级,体验是全新的,然后慢慢往上爬,最后把主流市场给颠覆了。

它是怎么做到的?

不是某一个技术点的突破,是一整套体系的协同。

如果把生数的技术能力拆开来看,你会发现它的壁垒不是某一层,而是从底到顶一整条链。

最底层是算子层,就是SageAttention,一个 8 位整数量化(INT8)注意力加速方案

传统注意力运算都是 FP16 浮点,SageAttention把Q和K矩阵量化成INT8,同时保留V矩阵的高精度,在几乎不损失生成质量的前提下,实现了 2 到 3 倍的加速。

而且是即插即用的,不需要重新训练模型。

打开网易新闻 查看精彩图片

据张金涛在公开采访中透露,SageAttention 已被 Nvidia、AMD、Google、华为、Meta、字节跳动、腾讯等约 200 家企业在产品中使用或集成,某种程度上已经成了行业标准。GitHub 上 3000+ 星标。

一个做视频模型的公司,先做出了一个全行业都在用的加速算子

这就是底层实力。很多人只看到了 Vidu S1 这个产品,没看到底下这一层又一层的积累。

中间层是模型层,TurboDiffusion,一个扩散模型推理加速框架

这一层的加速来自四个方向的协同:注意力加速把 SageAttention 和 SLA 稀疏线性注意力结合起来,通过稀疏化剪掉 90% 的计算量,同时保持生成质量基本无损;步数蒸馏,用 rCM 正则化一致性模型方法,把扩散模型原本几十上百步的去噪过程,蒸馏到 3 到 4 步就能完成,这是提速最核心的一步;

还有 W8A8 全局 8 位整数量化,把权重和激活值都压缩到 INT8,显存占用减半,计算速度翻倍。

打开网易新闻 查看精彩图片

四个方向叠在一起,最终实现了 100 到 200 倍的端到端加速。GitHub 上也是 3.6K 星标,行业里广泛在用。

这里有个很有意思的观察。很多人以为,把注意力剪得越稀疏,效果会越差。

但实际情况是,传统注意力机制里有大量计算是冗余的、是浪费的。

找到那些真正重要的计算,把资源投上去,反而能又快又好。这就是工程优化的魅力,不是简单地做减法,是找到规律之后的精准优化。

最上层是系统层,TurboServe,一个流式推理部署引擎

实时交互跟离线生成不一样,它是持续的、流动的,不能断不能卡不能崩。这就需要专门的调度引擎,动态分配算力,管理用户状态,保证服务稳定。

打开网易新闻 查看精彩图片

三层优化全栈打通,才跑出了单卡实时生成这个结果。

所以你看,真正的壁垒是什么?

不是我有多少张 A100,不是我模型参数有多大。

打开网易新闻 查看精彩图片

真正的壁垒是你能不能用更少的资源跑出更好的效果,是从算子到模型到部署的全链路工程能力。

算法可以抄,论文可以复现。但一套打磨了好几年的全栈工程体系,抄不走。

张金涛说过一句话我觉得很到位:推理速度本身就是智能水平的一部分

如果给足够的时间,很多复杂任务都不难解决。但如果要在实时交互的约束下做到又快又好,那就是另一回事了。

支撑这套能力的,是自回归扩散模型(AR+Diffusion)路线。

模型并非一次性产出完整片段,而是基于已经生成的历史画面,结合用户当前的语音、指令等上下文信息,实时预测并生成下一帧内容。

这种逐帧生成的方式,天然具备可被实时打断和改写的特性。

用户随时发出的新指令,都能被模型实时理解并体现在后续画面中,不必等待一整段视频生成完毕再重新开始。

论文里的数据也能说明问题。

根据生数发表在 arXiv 上的技术论文,Vidu S1 在两个基准上做了测试:一个是公开的HDTF数据集,三项指标CSIM 0.9192、Sync-D 7.847(音视频同步误差,越低越好)、DOVER 0.5660,在对比的商业系统中均处于第一梯队;

另一个是生数自建的 Vidu-StreamBench 人类偏好测试,在 "主体可控性" 这个指标上,Vidu S1 对另外两家海外主流方案的偏好率达到了 100%。

打开网易新闻 查看精彩图片

这个数字看起来很夸张,但其实很好理解:路线差异带来的代差。很多 2D 数字人方案,主要聚焦于口型驱动和上半身微动作,动作生成能力相对有限,对自由指令的跟随能力天然较弱。

而 Vidu S1 是端到端生成的,理解指令后实时生成动作,这是两种技术范式的差距。

当然,这里必须说明:Vidu-StreamBench 是生数自己构建的 benchmark,不是第三方独立测试。

自建 benchmark 难免有偏向性,这个 100% 的数字也有路线差异放大的因素。但即使打个折,也能说明问题,在指令跟随这个维度上,Vidu S1 确实有明显优势。

打开网易新闻 查看精彩图片

更关键的是,这些成绩是在 RTX 5090 上、3 步配置下最高 42FPS 的推理速度下取得的,超过了 30FPS 的实时播放阈值。

值得一提的是,Vidu S1 还具备一定程度的场景理解能力。

当用户开启摄像头,模型能识别画面中的人物数量、动作状态等信息,并据此给出实时反馈,而不只是被动响应语音指令。

这让交互不再局限于对话本身,也延伸到了对物理环境的感知。

自定义角色方面,Vidu S1 支持用户上传任意图片创建角色。

无论是真人形象、动漫人物、萌宠,还是游戏角色和其他虚拟形象,都可以作为初始角色使用;

声音层面,用户也可以选择系统音色,或录制自己的声音进行定制。上传图片并完成基础设置后,新角色几乎可以立即进入对话状态。

打开网易新闻 查看精彩图片

这意味着,数字人的创建门槛被进一步降低了。

普通用户可以用宠物、插画或自创人物生成互动角色;企业则可以通过 API,将品牌IP、虚拟客服、数字主播、游戏 NPC 或教育陪练接入自己的业务。

生数的做法也很坦诚。

他们没有只剪几个精美的 demo 做宣传,而是把前端和 API 都开放出来,让用户自己去试、去感受。

这意味着模型的缺点会非常直接地暴露在所有人面前,但他们觉得值得。一个新方向刚开始出现时,它不一定是完美的,更重要的是它能不能让大家看到一种新的可能性。

更深一层看,Vidu S1 并不是一个孤立的产品。它是生数通用世界模型布局中的一环。

朱军在央视专访里讲过一个判断:视频并非简单的像素序列,而是对现实世界动态变化的记录。

人物、物体、环境、动作和事件,都以时空变化的方式包含在视频之中。

通过大规模视频训练,模型不仅能够生成画面,也在逐步学习物体如何运动、环境如何变化,以及不同动作可能带来怎样的结果。

所以在生数的技术路线里,从视频生成到实时交互再到机器人行动,底层是一体的。

Vidu 在像素空间生成动态内容,学习世界如何变化;Vidu S1 引入实时输入,让模型能够持续理解指令、更新状态并作出响应;Motubrain 则把对环境的理解和对未来的预测,转化为机器人可以执行的动作。

三者分别对应世界模型能力的逐步演进:生成世界、与世界实时交互,并最终行动于世界。

这也是为什么生数能从视频模型自然延伸到机器人领域。不是跨界追热点,是视频模型技术路线的自然延伸。

当你的模型已经通过海量视频学会了世界如何运转,下一步自然就是让它在物理世界里行动起来。

打开网易新闻 查看精彩图片

实时交互的下一步

Vidu S1 跑出来了,实时交互这条新战线也正式打开了。

但这只是一个开始。接下来,这个方向还有很大的进化空间,整个行业都在往几个方向同时推进。

打开网易新闻 查看精彩图片

画质和实时性能的平衡是第一个方向。

现在能做到实时交互的,分辨率普遍还在 540P 左右;画质好的方案,又做不到实时。

接下来的关键突破点,是在保持实时帧率的前提下,把分辨率逐步提升到 720P、1080P 甚至更高。

这不是某一家的问题,是整个行业共同的技术方向。谁能先做到 1080P 实时,谁就能拿下对画质有要求的场景。

打开网易新闻 查看精彩图片

动作范围和场景复杂度的扩展是第二个方向。

目前的实时交互主要还是上半身、小动作、简单场景。接下来,全身动作、复杂场景、多人交互、环境互动这些能力,都会逐步解锁。

打开网易新闻 查看精彩图片

从 "坐着聊天" 到 "自由活动",从 "单角色对话" 到 "多角色互动",交互的丰富度会不断提升。

长时一致性的持续验证是第三个方向

"无限时长" 是一个很吸引人的概念,Vidu S1 已经实现了连续数小时的稳定生成。

但真正的长时一致性,几天、几周、甚至更长时间的连续交互,角色记忆、性格、成长轨迹的持续保持,还需要更大规模、更长时间的验证。

实验室里跑通和千万级用户天天用,是两个量级的挑战。

打开网易新闻 查看精彩图片

杀手级应用的探索是第四个方向

技术跑出来了,接下来就是找场景。虚拟陪伴、互动游戏、虚拟主播、智能客服、在线教育、语言陪练…… 现在大家都在试,各种方向都有团队在跑。

哪个场景能最先跑通商业模式、能跑出大规模用户,是接下来一两年最值得关注的事。

打开网易新闻 查看精彩图片

这些都是整个赛道正在快速推进的方向。

技术路线是对的,基础能力已经跑通了,接下来就是不断迭代、不断扩展、不断找场景的过程。

打开网易新闻 查看精彩图片

两条战线,两种未来

这两条战线,会分别走向哪里?

我觉得可以分开来看。

第一条战线(画质/时长),走向的是 "内容生产的革命"。

这条战线上的玩家,目标是把 AI 视频生成的质量做到影视级,把时长做到电影级,最终替代传统的影视制作流程。

打开网易新闻 查看精彩图片

受益的是内容行业。

短剧、广告、影视、动画,这些需要大量视频内容的行业,生产效率会大幅提升,成本会大幅下降。

以前需要几十人团队几个月做的事情,以后可能几个人几周就能做完。

这件事已经不是未来时了,是正在发生的现在进行时。

今年有个很有意思的现象,二手视频相机价格崩了。

打开网易新闻 查看精彩图片

索尼 A7S3 这种曾经的视频神机,二手价格半年跌了五千多。

闲鱼上挂着大量 99 新的视频机,转手理由清一色是 "闲置吃灰"。为什么?因为以前拍短剧、拍短视频、拍电商素材,都得买台好相机。现在呢?很多团队直接用 AI 生成了,连相机都不用了。

上游的变化更夸张。据中国网络视听协会的数据,2026 年一季度全行业上线的微短剧里,AI 生成的已经占了 95% 以上,真人短剧上线量还不到 AI 短剧的二十分之一。

多地影视基地真人剧组大幅缩减,演员劳务行情腰斩,重金打造的实景棚在闲置。

有业内人士形容:"提示词取代了摄影机。"

以前拍一部 20 集短剧,需要组几十人的摄制组,搭场景、找演员、拍素材、做后期,至少三个月,单集成本三五万。

打开网易新闻 查看精彩图片

现在用 AI,十个人的小团队二十天就能做三十集,单集成本最低能压到几百块,成本降幅超过 90%。

冲击还传导到了教育端。

今年 3 月,中国传媒大学一口气停招了翻译、摄影、漫画等 16 个本科专业和方向,其中摄影专业并入了影视摄影与制作专业,强化 "前期 + 后期 + AI" 一体化培养

不是个例,广西艺术学院、湖北美术学院等也相继撤销了摄影本科专业。

信号很明确,只会按快门的传统摄影师,已经撑不起一个独立的本科专业了。

但话说回来,AI 不是来抢饭碗的,是来搭梯子的。

工业级的影视制作,天然对应着漫长的周期和高昂的成本。

创意的每一次修正,都要换算成实打实的人力、时间与资金投入。

AI 的出现,相当于给这套笨重的生产流程装上了加速器。

打开网易新闻 查看精彩图片

大量基础生成与调优工作被工具承接,团队不用再把时间耗在流程周转上,能把精力真正放回创意与品质本身。

它没有抢走谁的导演身份,反而让每一个有表达欲的人,都拥有了把想法落地的可能。

十九世纪英国经济学家杰文斯提出过一个悖论:当技术进步提高资源使用效率时,该资源的消费量不仅不会减少,反而可能增加

因为效率提升导致使用成本下降,进而刺激了更广泛的应用需求。

这个原理同样适用于影视行业。

单位内容的制作成本每下探一个数量级,能够入场的创作者规模至少会增长一个数量级,最终落地的作品总量则会迎来至少两个数量级的爆发

打开网易新闻 查看精彩图片

这不是简单的 "降价走量",而是原本被高成本堵在门外的创意产能,被一次性释放了出来。

承压的是传统内容制作公司和整个上游产业链。

如果你的核心竞争力是 "能拍片子"" 能做特效 ",那 AI 生成的方案很快就能追上甚至超过你。相机、灯光、场地、器材租赁,这些曾经的刚需,需求都在萎缩。

这条战线的终局,是AI 成为内容生产的基础设施。

就像现在的 PS、PR 一样,人人都能用,人人都能用它做出专业级的内容。

第二条战线(实时交互),走向的是 "人机交互的革命"。

这条战线上的玩家,目标是把 AI 从一个工具变成一个 "角色",从 "你用它" 变成 "你跟它对话"。

打开网易新闻 查看精彩图片

受益的是交互行业。

虚拟陪伴、互动游戏、智能客服、在线教育,这些需要高频人机交互的场景,体验会有质的飞跃。以前是打字聊天、语音聊天,以后是面对面视频聊天,完全不是一个维度的体验。

承压的是传统数字人公司。如果你的技术路线还是 2D 驱动、预设动作,那 AI 生成的方案会从根本上颠覆你。

这条战线的终局,是AI 成为新的人机交互入口。以前的入口是键盘、鼠标、触摸屏、语音助手,以后可能就是一个站在你面前的 AI 角色。

两条战线,两种未来,都有巨大的想象空间。

而且有意思的是,这两条战线不是完全分开的,它们最终可能会汇合。当实时交互的画质也做到了影视级,当离线生成的内容也能实时交互,那时候就不分什么第一条第二条战线了。

那时候的 AI 视频,既是高质量的,又是可交互的。

就像手机行业,当年大家分屏卷芯片卷拍照,最后所有功能都汇合到了一台手机上。

打开网易新闻 查看精彩图片

视频大模型也会走这条路,先分头突破,最后汇合到一个统一的形态。

当然,这都是比较远的事了。短期来看,两条战线还会各自发展一段时间,各自有各自的玩家、各自的赛道、各自的竞争逻辑。

打开网易新闻 查看精彩图片

我们在哪?

中国公司在这两条战线上,分别处于什么位置?

我的判断是:在第一条战线上,中国跟海外处于并跑甚至局部领先的状态。各有优势,各有特色,整体差距不大。

海外有 Sora 这样的标杆,我们有 Seedance、Kling、Vidu 等一批模型,在 4K、时长、多模态参考等某些维度上甚至做得更好。

打开网易新闻 查看精彩图片

在第二条战线上,在落地速度和工程化实践上,中国公司暂时走在前面。不是某一家公司领先,是整个生态领先。

为什么这么说?三个原因。

首先我们有最丰富的应用场景。

打开网易新闻 查看精彩图片

全球最发达的短剧产业,每天需要海量内容;全球最活跃的直播生态,虚拟主播需求旺盛;全球最大规模的短视频用户,对新内容形态接受度最高;全球最卷的电商客服,对数字人降本增效的需求最迫切。

模型做出来马上就能拿到真实场景里去用,用户反馈马上就能回来,然后快速迭代。

这就是技术落地的飞轮。

海外呢?海外是先有模型后找场景,我们是先有海量场景再用模型去放大。落地速度根本不在一个量级。

打开网易新闻 查看精彩图片

据前沿在线观察,中国 AI 视频的落地速度,确实比海外快很多

海外很多公司还在研究技术、发论文,我们这边已经在各种场景里试错、迭代、赚钱了。这种场景驱动的迭代,速度是非常快的。

然后我们有最完整的产业链。

上游有生数、字节、快手这样的模型公司做底层能力,中游有万兴这样的工具公司做全链路产品,下游有灵河、长信这样的内容公司做场景落地,平台有抖音快手做分发和商业化闭环。

从模型到工具到内容到发行,整条链路都跑通了。

这不是单点优势,是体系优势。单点优势容易被追上,体系优势很难被打破。

更深一层看,当 AI 影视的基础生成能力快速同质化,赛道的胜负逻辑已经悄然生变。

不少人以为 AI 影视的核心竞争力还停留在拼模型、卷画质、比时长,但当主流产品都能实现稳定的工业级输出,"能做出好内容" 就不再是某一家的独家壁垒。

此时,真正能拉开差距的,是工具之外的生态承载力。打通从创作、分发到变现的完整链路,才能留住创作者、形成持续的内容供给。

工具解决的是 "怎么拍" 的效率问题,生态解决的是 "为什么拍" 的动力问题。

打开网易新闻 查看精彩图片

AI 影视要真正成为内容行业的主流生产方式,不能只靠技术迭代推着走,更要靠正向的商业循环养着走。

而中国,恰恰是生态最完整的地方。

最后我们的工程师文化更适合工程化竞争

第一条战线比算法比论文,海外有先发优势。但第二条战线比工程化、比落地速度、比迭代效率,这是我们的强项。

打开网易新闻 查看精彩图片

你看 SageAttention、TurboDiffusion 这些底层优化工作,都是中国团队做出来的。而且不是在实验室里做的,是在真实产品的压力下磨出来的。这种从实战中长出来的工程能力,往往最扎实。

但也不能太乐观。我们有优势,也有明显的不足。

打开网易新闻 查看精彩图片

基础研究积累相对薄弱。

原创性的算法、开创性的理论,还是海外做得多。我们更多是在工程化和落地上领先,底层原创性的东西还不够多。

高端算力依赖进口。

芯片这个东西,是卡脖子的环节。人家不给你芯片,你工程能力再强也没用。这是整个 AI 行业的共同问题,不是某一家公司的问题。

全球化能力弱。

中国公司做国内市场很厉害,但出海能力普遍不强。海外市场那么大,能不能拿下来,是个问号。

所以我的判断是:我们有不错的起点,有生态优势,但领先幅度不大,而且优势主要在应用和工程层面,不是在底层技术层面。海外大厂一旦发力,追赶速度会很快。

真正的胜负手,是谁能先把场景跑通、把生态建起来。技术可以追,生态一旦建起来,就很难被颠覆了。

打开网易新闻 查看精彩图片

说了这么多,最后给几个我比较确定的判断,再留几个我也没想明白的悬念。

比较确定的是:

视频大模型正在从单维度竞争走向多维度竞争。

打开网易新闻 查看精彩图片

画质这条战线还会继续打,而且远没到尽头;同时实时交互这条新战线已经打开,会越来越热闹。

以后的视频大模型公司,两条腿走路的会比单腿蹦的走得稳。

工程化的权重在快速上升。

第一条战线是算法驱动为主,第二条战线是工程驱动为主。整体来看,整个行业的竞争重心正在从 "谁的算法新" 转向 "谁的工程强"。

谁能把成本压到最低、把体验做到最好、把稳定性做到最高,谁就更有可能赢。

中国在实时交互这个方向上有不错的起点,有生态优势。能不能把这个优势保持住、放大,就看接下来两三年的落地速度了。

还有一个判断我越来越坚定:数据范式的变化,很多时候会比单纯改模型结构更本质。

模型结构像智商,150 和 140 当然有差距,但当模型已经足够强之后,更大的差别可能来自 "老师" 和 "教材"。

打开网易新闻 查看精彩图片

数据就像老师和教材,同一个知识点,好老师十分钟就能讲明白,因为他知道怎么组织信息、怎么拆步骤;但如果教材很差、讲法很乱,你可能看十个小时也学不会。

这个逻辑放到视频生成里也一样。尤其是未来的实时交互视频,模型不能只学 "最后生成什么画面",还要学 "过程如何连续发生"。

它要理解状态变化、动作反馈、上下文延续和多模态交互。

谁能把人类的视觉偏好、娱乐偏好和实时交互过程更好地组织成可学习的数据,谁就更可能推动下一阶段的突破。

往更远了看,实时交互也不是终点。

视频模型的终极形态,可能不只是生成视频,而是理解世界。

打开网易新闻 查看精彩图片

当一个模型能够通过海量视频学会物体如何运动、环境如何变化、动作带来什么结果,它就不只是一个内容生成工具了,而是一个能够理解和预测世界的智能体。

从生成内容,到实时交互,再到行动于物理世界。这是一条清晰的技术演进路线,也是很多公司正在走的路。今天屏幕里的 AI 能听懂指令做动作,明天可能就是机器人在真实世界里听懂指令干活。

还不确定的是:

打开网易新闻 查看精彩图片

两条战线什么时候会汇合

画质和实时性能不能兼得?什么时候能做到 1080P 实时?什么时候能做到影视级的实时交互?这些都是技术问题,但需要时间来回答。

实时交互的杀手级应用是什么?

是虚拟陪伴?是互动游戏?是虚拟主播?还是现在还没人想到的什么场景?一个新的技术范式,往往会催生出大家预想不到的杀手级应用。

最终的市场格局会是什么样?

是一家通吃,还是多家并存?是模型公司赢,还是应用公司赢?是垂直场景的公司跑出来,还是通用平台跑出来?

海外大厂什么时候进场?

会带来什么变化?OpenAI、Google、Meta 这些公司,一旦把注意力转到实时交互视频上来,会是什么局面?我们的领先优势能保持多久?

世界模型的终局到底是什么样?

AI 真的能像人一样理解和行动于这个世界吗?还是说,它永远只是一个高级的模拟系统?

这些问题,现在都没有答案。

任何新技术的发展都有它的节奏。从技术触发,到热度攀升,到泡沫破裂,到稳步爬升,最后走向成熟。

打开网易新闻 查看精彩图片

现在的实时交互视频生成,还处在热度刚开始攀升的阶段,离真正成熟还有很长的路要走。

Vidu S1 不是终点,它是实时交互这条新战线上第一个真正被大规模体验的产品。

但这只是开始。接下来的一两年,会有更多玩家进场,竞争才真正开始。

而这场多维度的竞争,才刚刚拉开序幕。

打开网易新闻 查看精彩图片
前沿动态前沿大会前沿人物
打开网易新闻 查看精彩图片
前沿动态前沿大会前沿人物

「在看」,给前前加鸡腿