文 | 阑夕

刚刚过去的国庆长假,中国人民有没有玩好我不知道,中国的视频模型,已经加班加得芯片冒烟,又双叒叕杀疯了。

先是在临近放假前,字节为Seedance 2.5推出了Draft模式,使用者可以先用480P快速生成样片,在满意之后再输出1080P成片,痛点非常明确:

抽卡次数越多,越能节省成本。

再就是可灵4.0的内测,这可是阔别半年以上的版本更新,快手重回牌桌,依然靠的是差异化,用「影视级工作流」,以及多关键帧控制能力,主打专业化场景,扬长避短。

这似乎也和抽卡的行业痛点密切相关,可灵更侧重于搭建「摄影棚」,把随机发散的生成变成高度可控的排片。

最后——也是意料之外的——到了还有高手的环节,Vidu发布了新一代视频模型Q4 Preview,直接把首发价格打到了每秒不到1毛钱,这是前沿视频模型市场从没见过的价格带。

不到1毛钱只是起步价,真正有分量的是成片档位,就算直接出1080P,每秒也只要几毛钱,等于把高清成片带进了「角时代」,以前要掂量着点的生成按钮,现在可以放开了点,视频生产力的上限,也就跟着被抬了上去。

如果说Seedance是在设法让抽卡不那么烧钱、可灵是在让抽卡次数尽可能的变少,那么Vidu就是在反其道而行之:

只要成本够低,大家就不会那么在意抽卡,甚至可以为了追求完美,「应抽尽抽」。抢占了下一阶段的生产力入口。

这几天,从 OpenAI 到 Anthropic,前沿模型公司都在把竞争推向同一个方向:模型不只要更强,还要更便宜、更快、更可规模化。视频模型当然不会例外。Vidu Q4 Preview 的 0.09 元/秒,真正值得讨论的不是「便宜」,而是 AI 视频的价格性能曲线开始被重新改写。

虽然有点王八拳的意思,但好像还真是这个道理⋯⋯

Vidu的「掀桌价」,很容易让人以为这是一个次级模型,所以先看演示是最直接的,这是官方放出来的部分案例,为了排版流畅,我都转成GIF了:

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

从我自己的实测来看,说它已经领先行业了,可能有些过头,但在同等开销的限制条件下,Vidu用起来确实是最不心疼的:

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

Vidu Q4 Preview最高支持4K输出,最多支持15张参考图,在光影、美学与画面质感上对齐了第一梯队,而且镜头运动已经非常自然了,很少出现空间上的错乱感。

如果正式版的上线,也能维持Preview版的价格,那我觉得Vidu这波就是真的能打了,完全可以进入包括广告、创意、特效在内的很大一部分生产力场景。

我在之前几次测试视频模型的时候,就说过成本是最大的拦路虎,看似成千上万的积分,稍微「贪」一些,就能在几个小时内轻易用光,这是相当不友好的。

况且我还只是一个测试者,那些以此为生的创作者只会更加敏感,普惠生产的爽感始终可望不可及。

更关键的在于,这并非只会拖累创作端,消费侧的体验也会受到劣化,比如因为抽不起卡,很多AI短剧公司会对影片细节降低要求,只要不影响剧情,运镜的失误、人物的错漏、动作的变形都是可以容忍的。

这是视频模型整个行业共同面对的一题三问:

能力要往上走,效率持续提高,这些进步最后还得让更多的使用者负担得起。

而Seeddance、可灵和Vidu在这个国庆档组成的「三叉戟」,已经在各自擅长的优势层面,给出了解法——工业级、专业级、普惠级。

Seedance已经吃掉了绝大部分AI短剧的生产市场,以致于2.5版本的迭代都没有太大的震动,因为对于很多从业者来说,2.0就已经够用了,而且在效率上很难有同级别的对手。

这就是SOTA的「高处不胜寒」。

可灵有点憋屈,属于「起早赶晚集」,明明是最早杀进前沿阵营的国模代表,却再一次被字节摘了桃子,在外网,可灵4.0被吹爆的程度,和它憋着的那股劲儿,相映成趣。

某种意义上,可灵4.0代表模型向上走的天花板能有多高,频繁赞助各大电影节的动作,也体现了可灵想要打入导演——而不只是创作者——作为供应链上游的野心。

相较之下,Vidu是实打实的一只黑马,在很长一段时间里,它藏在排成长队的追随者队列里,并未露出爪牙,Q4 Preview的鲜明表现力,乘以亲民价格力,得出的是AI视频行业苦求多年的「生成自由」。

如果我们相信AGI是一个大周期——而不是平均一个月要降临三四次的那种——那么技术红利的「后劲儿」只会越来越大,能做视频,只是模型还原物理世界的途径点罢了,越到深水区,积累就越重要。

这就是为什么多模态已经成为各家模型的标配了,所有抄的近道,都还是要一比一甚至加倍的还回去,Vidu一直留在桌上的根基,离不开它创下的那些「第一」:

2022年,率先提出U-ViT架构,2024年,第一个出来对标Sora,首创参考生视频和多主体一致性,从Vidu 2.0开始,就把生成耗时也视为核心能力,从价格成本到时间成本全方位输出普惠价值⋯⋯

打开网易新闻 查看精彩图片

什么叫「生成自由」?

就是不用每分每秒都在心里算着点一次生成按钮就要被扣掉多少钱,钱的多少或许没那么重要,重要的是这种心态,会折磨每一个想要尽善尽美、却不得不一再妥协的现实主义人格。

「DeepSeek时刻」之所以直到今天——已经过去了接近两年——还被念念不忘,是因为它真的用一种极致的简单粗暴,让每个人都毫无负担的用上最好的模型。

当你猛猛蹬上一整天、消耗完几十亿Token之后,发现账单上就多了十块钱,这种体验但凡经历了一次,即为永恒,是任何「核爆瘫坐」都换不来的价值感。

不夸张的说,Vidu刚刚就把视频模型,推到了这么一个时刻,从「用得起」,到「用得多」。

AI行业从来不缺竞争,只是视频模型打到今天,多少有些中国军团在乒乓球、游泳等赛事上迎战世界的意思:

放到世界赛场都能争金夺银的顶级选手,回到国内,还得为一个出线名额拼命。

是的,中国的视频模型,就是如此饱和式的包围了全球,如同「国家队」般的存在。

我还记得这条赛道刚刚开始的样子:

Runway从2023年开始领跑,Gen-3曾是公认最强的一代视频模型;

然后Pika又以别出心裁的AI特效刷了一波屏,成为媒体关注的焦点;

接着就是横空出世的Sora,尽管最后放了一个大烟花,但前半年里真是让所有同行都感到绝望;

最后是谷歌的Veo系列视频模型,配合Nano Banana,一度成为多模态领域的王者,是如今难以想象的风评;

到了现在呢?

Sora已经查无此人,Pika已经停止更新,谷歌正忙着解决语言模型掉队的大问题,而Runway虽然还活着,却已经在官网开始卖中国视频模型的API了⋯⋯

当一个视频模型要靠销售竞争对手来实现盈利,一切就都尽在不言中了。

用「国家队」来形容中国视频模型的外战之横扫和内战之激烈,贴切之处就在于,值得关注的核心选手名字响亮,而且打法不一样,彼此之间的竞争又足够激烈,很难靠一次领先就躺下来吃老本。

打开网易新闻 查看精彩图片

选择多了之后,用户也就有了自由,是选Seedance的成熟,还是可灵的艺术,抑或Vidu的量大管饱,都意味着可以拥抱一种完整的能力布局,一个创作者完全可以在不同任务里选择不同模型,今天适合自己的工具,也未必包办明天的全部需求。

这正是「国乒」式竞争最有意思的地方,大家都很强,彼此还在逼着对方继续变强。

在我看来,Vidu,或者说它背后的生数,值得重视的原因有两个。

第一,AGI 时代强大的技术红利优势。伴随大语言模型公司上市进程,原生模型公司独有的顶尖人才和技术前沿积累,一次次爆发出了超预期潜力。

先前大家对「清华系」模型公司有「学术」刻板印象,但事实证明,AI和互联网还真不太一样,它对产品、营销、运营等「术」的依赖,远远不足以追上「道」的份量,而认认真真、踏踏实实的做学问,就是AI的「道」。

在智谱作为大语言模型头部代表出线之后,大家的目光纷纷投向世界模型赛道头部代表的生数——在朱军教授提出的 L1到L5 世界模型发展路线图中,从视频生成到走向物理世界,生数都有好牌在手上,这对同出清华系的硬核技术兄弟公司,分别从语言模型和世界模型出发攀爬 AGI 南北坡。

是的,生数的定位,是世界模型,而不仅仅是视频模型,这是第二个原因。

作为世界生成模型的Vidu Q4 Preview只是生数的模型路线之一,同时在做的还有实时交互模型Vidu S2、世界动作模型Motubrain,叠在一起,就是要找出把数字世界和物理世界统一起来的基座模型。

一个通晓万物、洞察未来、自主行动的AI系统。

前段时间,李飞飞把自己的世界模型实验室World Labs卖给了AMD,交易价格是82亿美金,很多人为这个天文数字感到震惊,并称赞李飞飞身为大女主拿到了大结果。

这话,只对了一半,在世界模型这条厚雪长坡,光有人是不够的,还要有AMD这样的巨头在后面支持,并给技术明确定价,才可以长久的跑下去。

所以才说要给那些愿意往世界模型这条看不到尽头的道路快马扬鞭的公司多一些注意,这里不存在「百万撤离」的机会,只有「不成功,便成仁」的决断。

不过只此世间的风景,总不只在终点才有,在沿途,AI公司都在释放着各自的价值,生数也不例外,Q4 Preview带来的「生成自由」,既不是一次冲量的促销,也没有亏本赚吆喝的心思,它是把商业级视频的普惠能力,交到了每一个创作者的手上,无论富贵与否,蹬起来就完事儿了。

毕竟,当一流的模型允许海量的用户报以海量的尝试,变化迟早会从工具传导到内容,那些原本只能留在文档里的想法,也就多了一次被拍出来的机会。

而这些尝试,都将成为通向世界模型的伟大燃料。