S2-Editing 帧对齐稀疏注意力是关键S2-Avatar 720P实时 状态不丢视频生成进入实时编辑时代 创作者少了哪些苦从S1到S2仅69天 生数的节奏说明什么

打开网易新闻 查看精彩图片

距上一代S1才69天,生数科技又甩出Vidu S2。这次主打的不是生成一段视频,而是对正在播放的视频流实时动刀:换风格、换装、换角色、换背景,运动轨迹还不穿帮。S2-Avatar更是720P实时输出,随时追加参考图还保留状态。视频生成的玩法,正在从一次性生产,变成可编辑的实时流。创作者手里那把剪刀,第一次长在了播放键上。过去这一年,国内外视频模型集体爆发,但大多数还停留在抽卡式生成,Vidu这次把重点放在了编辑,思路明显不一样。它赌的是创作者真正每天的痛点,而不是一次性的惊艳。

S2-Editing借助帧对齐稀疏注意力,可以对正在播放的视频流实时换风格、换装、换角色、换背景,运动轨迹不穿帮。传统视频生成是生成完就定格,想改只能重跑一整段,耗时又烧卡。视频最难的是时序一致性,人物动作、镜头运动一旦改动,很容易前后对不上,出现穿帮。Vidu把编辑动作前置到播放过程中,相当于给视频装上了可随看随改的图层,靠帧对齐技术保住动作连贯。发布即开放体验,意味着这类实时编辑不再停留在演示视频里,而是能真上手玩,对短视频二创尤其有用。

打开网易新闻 查看精彩图片

S2-Avatar升级到720P、25至42帧实时输出,支持随时追加参考图并保留状态信息。自研SRF训练技术专门抑制长时流式生成的漂移与崩坏。对数字人来说,这解决了最头疼的两个问题:一是清晰度够不上直播和短视频门槛,二是聊久了脸就糊、动作就乱。状态可保留,意味着Avatar能记住你刚给的参考,连续对话和连续创作不至于越聊越歪。720P加二十多帧的实时水位,已经够撑起一场轻量的直播或一段口播视频,不再只是玩具级演示。

过去做一条AI视频,往往是抽卡式生成,十几次里挑一条能看的,想微调只能整段重来。Vidu把编辑从成品之后,挪到了播放之中,二创和定制的门槛被明显压低,电商换肤、教育动画、个人vlog都能更快出片。当然新能力也带来新问题:实时换脸换装一旦被滥用,版权和水印的边界会更模糊,深度伪造的治理难度跟着上升。工具越强,平台和个人越得想清楚,什么能改、什么不能乱改。技术把剪刀递到每个人手里,怎么用,终究是另一堂课。

两代之间只隔69天,这个节奏本身就很能说明问题。视频生成赛道太挤,国内外对手都在提速,慢一步就可能被淹没。生数选择不在参数上硬刚,而在编辑体验和实时性上找差异化,等于主动换了一条赛道。69天不是炫技,是被迫的快:用户耐心有限,融资环境有限,窗口期更有限。对创业公司来说,比一次生成更惊艳的,是持续小步快跑、每次都踩在创作者真痛点上的能力。Vidu这波把实时编辑做成卖点,也是在用产品节奏回答一个问题,模型强不算赢,用得顺才算。

要是能一边看一边给视频换脸换装,你最想拿它来整什么活?是给vlog换个赛博朋克皮肤,还是给自家猫配个Avatar?聊聊你的脑洞。

【参考来源】腾讯研究院 | AI速递 20260916 | 2026-09-16