如果让 AI 生成的视频,能听懂你说的话,还能当场接住你的指令,画面会变成什么样?
比如,你随时和视频里的角色聊天,话说到一半打断它,它能迅速接住;临时让它拿起桌上的咖啡,它也会改变动作。与此同时,剧情、背景和声音继续往前走,人物不变形,画面也不崩。
这种听起来有点科幻的感受,就是现在实时互动视频想做到的效果。
过去一年,我陆续看过一些团队在探索这个方向,产品形态也越来越丰富。但讲真,把对话、动作、画面和声音同时放进实时生成里,依然是一件挺难的事:延迟高一点,交流就容易卡顿;连续生成的时间一长,人物、背景和动作也可能逐渐跑偏。
不过就在这几天,我又看到一家成立一年多的 AI 公司 —— Vivix,发布了两款实时交互多模态模型 A1 和 W1。
等于这家公司一上来就搞了两款模型,底层是统一多模态参考、原生交互与流式音视频生成的基座模型,就是冲着实时互动场景来的。
刷到这个消息,一直对这个方向挺好奇的我专门找 Vivix 的朋友交流了下,看到了更多这两款模型的演示视频,还听他们讲了一些模型架构和 Infra 上的工作。
整个了解完,我最强烈的感受是,AI 视频离真正“活”起来,确实又近了一些。
两款模型带来的互动时刻
先说最先戳中我的 A1 模型。
这个模型主要面向数字角色互动。它生成的视频里,用户可以直接和角色实时交流,语言、表情、肢体反馈自然,延迟很低。我放个案例大家感受一下
除此之外,还能用指令临时改变角色正在做的事。
能看到,这段视频里的角色形象很完整。用户和她互动时,她会拿起咖啡、挪动身体,动作比较自然,没有太强的出戏感。整段互动持续 30秒,不算短,人物和背景也一直比较稳定。
我还看到了一个猫咪和用户互动的视频。
这个对话和用户一来一回,也很有梗。整个过程里,猫咪会走路、抬爪、弓背,动作也蛮真的。
还有下面这个文物,能按用户要求全身扭动起来,对话还不停。
看完这几个案例,感觉 Vivix 这个 A1 模型,确实和大家印象里的数字人完全不同。
首先是数字人的形象,我之前用过的很多产品只能看到半身,甚至很多只能看到脸。它们的面部虽然越来越精致,声音和口型也能匹配,但上肢能做出的动作往往比较简单,多少有点机械。
但 A1 这几个视频里的形象,不仅精致、能说话,肢体的展示度也更充分。像移动、拿东西,甚至全身跳舞这种动作都能拿下。
还有交互体验的优化,AI 不只是能和用户持续对话,而是可以一边说、一边听、一边理解。
在口语教学的场景中,当用户还没说完一句英文,它就已经发现发音或表达问题,随时插话纠正;纠正结束后,又能自然回到原来的教学节奏,整个过程几乎没有等待和抢话的感觉。
看完了 A1 ,我又看了看 W1 的效果。
W1 更像一个可以持续生成的互动世界。视频开始播放后,用户可以继续和场景互动、推动故事发展,后面的内容会根据用户的要求实时生成。
Vivix 给了我一段样例帮助理解。
这个视频里,乐高小人儿身处的剧情在不断变化。这些变化,都是由屏幕外的小男孩通过鼠标点击、提示词输入、语音指令等方式持续下达的。
用户还能直接贴图,把新角色贴进实时生成的剧情里。
和 A1 比,W1 侧重于在互动叙事体验的优化场景和元素更加宏大丰富,能互动方式也更五花八门的。
Vivix 是这么定义 W1 的:在这里,用户影响的对象包括人物、物体、环境、镜头、声音和事件。文字、图片、声音或视频可以决定故事怎么开场,也可以在故事已经播放后继续加入,改变接下来会发生什么。
单看这些视频的效果,就感觉做互动短剧、游戏、电影这种内容,沉浸感一定很强。
类似的案例还有不少,我就不一一放了,大家可以去他们官网扒。
查看更多W1演示:vivix.ai/vivix-w1它们改变了什么,又难在哪?
看完 A1 和 W1 这两个模型的产出,我的感受有点复杂。
首先我真觉得,如果互动视频能做到这个效果,那能影响的行业也太多了。但同时,我也知道要稳定输出这种效果,对团队的技术水平有挑战。
先说它会带来的变化。
以我有限的想象力,能感到像游戏、影视、电商、陪伴(生活助手)、教育、接待这种场景,几乎都能被互动视频渗透。
游戏最直接。视频里已经展示了,用户说一句话、拖一下鼠标,或者临时上传一张图片,都能改变画面里的情节、物品和人物。放进游戏里,NPC 也能听懂玩家的话,再顺着玩家的意思做出反应。这不比脚本刺激得多。
影视也差不多。以后观众可以自己决定剧情走向,看到不同版本的故事,能直接和里面的角色互动。
还有陪伴,像开头那段 A1 生成的视频,角色形象可以由用户自己选择和上传。从一开始,这段“关系”就是个性化的。
电商、教育和接待这类更偏生产力的场景,如果有更能自然互动的主播、老师和服务人员,一定也能提升客户的体验。
捋完 A1 和 W1 可能带来的变化,我也很自然地想到另一个问题:这样的效果是怎么做出来的?
这可能是整件事里我最好奇的一部分。
按照我之前使用类似产品的体验,实时视频很容易遇到延迟、画面变形等问题。
当时一些朋友告诉我,像这种流式视频生成,最难解决的问题之一是画面会随生成时间而变形。当模型生成下一段画面时,需要参考前面已经生成的内容。时间越长,前面产生的误差越容易不断累积,最后就可能出现人物漂移、背景变化和动作断裂等问题。
另外,流式视频还要兼顾质量和生成速度。相比传统 Diffusion 架构可以反复去噪打磨,难度更大...等等不同的问题。
当时听完,我就感觉这个事需要团队把模型架构、Infra 系统、成本优化等问题全部搞定,真的很不容易...
那么,Vivix 是咋干的呢?
首先他们调整了模型架构,设计了原生多模态的流式生成架构。
这种架构会把画面、声音拆成连续、颗粒度比较细的音视频 Token 流,一小段一小段地持续生成。
与此同时,Vivix 将低延迟编码服务和实时解码循环拆分部署,并通过原生流式调度、模型级抢占和优先级机制处理新的指令。也就是说,当用户中途改变要求时,系统不必等上一轮内容完整结束,新指令可以更快地影响接下来的生成结果。
同时,他们从一开始就做了原生多模态的设计,不需要让多模态信息先转化为语言再让大语言模型处理。这样一来,用户能直接用文本、图像、声音等信息实时交互。W1 里的效果就是这样出现的。
关于视频的时延和成本, Vivix 设计了一套 Infra 架构来优化。
他们说,现在自己流式视频生成的首帧延迟(TTFF)达到了300—600毫秒,算上网络通信等全链路首次反应延迟 TTFR 需要1.7秒左右。现在 GPT-Realtime 的语音交互已经是百毫秒级低延迟,但这个是纯语音,和音画同出还不太一样。
成本这块,官方报告里说实时视频的推理成本已在过去一年内降低了两个数量级,目前接近云游戏、音乐会员和流媒体服务的成本区间。
这里面的细节,涉及低精度计算、稀疏注意力、KV Cache 管理、通信、计算等等 Infra 基建,感兴趣的朋友可以翻翻官方报告细节,这里就不展开了。
当然,Vivix 也没有回避目前模型的能力边界,在一些复杂场景下,A1 和 W1 仍存在持续优化的空间。
不过整体看完案例后,我还是觉得互动视频模型能做到 Vivix 现在展示出的效果,已经超过了我几个月前的想象。
接下来,我更想看它连续运行十几分钟后的表现,开发者又会用它做出什么产品。
热门跟贴