一个人对着屏幕说话。屏幕里也有个人,看着他,点头,接话。
说到一半,他忽然改主意:"算了,你别站着了,坐下说。"屏幕里的人真就顺势坐了下去,动作接得很自然,像是本来就打算坐。
没有卡顿,没有重新加载,也没有那个转个不停的"正在生成"。
奇怪的地方在这儿。屏幕里这段画面,此前并不存在。它不是提前拍好、剪好、等着被点开的成片。
它是在他开口的那一瞬,才被一帧一帧地,长出来的。
这台机器叫 Vidu S1,清华教授朱军的生数科技做出来的。
它把一条所有人都默认了规矩,悄悄拆了:视频,为什么非得先有、再放?
第一幕 · 从前的"数字人",是根提线木偶
你在直播间、在客服窗口见过的那些会说话的虚拟形象,运作方式其实很朴素。
先有一段音频,机器听这段音频,驱动嘴唇一开一合对上口型;至于身子怎么动、手往哪儿摆、什么时候点头,都从一个"预设动作库"里挑现成的调出来。
说白了就是根提线木偶。声音是那只拉线的手,动作是几根早就绑好的线。它能对上你的嘴,却接不住你的话。你临时改个主意,让它坐下、让它别笑了、让它把刚说的收回去,它做不到,木偶身上没有这根线。
它像点唱机:曲库里的歌都能放,可你现场哼一段新调子,它跟不上。
所以过去的 AI 视频,本质都是"离线成片"。你给一句提示、一张图,它闷头算上十几秒甚至几分钟,吐给你一段几秒到一分钟的片子。
是作品,是结果,是拍完的东西。你只能看,不能插嘴。
第二幕 · 语音,从"驱动嘴"变成了"下命令"
Vidu S1 动的是最底下那块地基。
它不再把你的声音当成一段驱动口型的音频信号,而是当成一句实时指令,你说的每句话,是在给画面下命令。它一边接收你的语音,一边看着当前这一帧的画面状态,一边把下一帧算出来、渲染出来。逐帧地长,边听边长。
这套逻辑,更像评书。老先生不是在放一段录好的评书,他是听着台下的追问,就着你脸上的反应,把下一句现编出来。你喊一声"这段慢点讲",他下一口气就慢了下来。
于是那件从前做不到的事成了:你可以随时打断它。话说到一半改口,让它换个动作、换个态度、换个方向,它下一帧就跟着改,不用推倒重来。视频头一回不是放给你看的,是跟你来回搭话的。
朱军给这套东西起的名字挺大,叫"通用世界模型",说它要推动数字世界和物理世界走向统一。
名字听着悬,落到桌面上其实就一句话:屏幕里那个人,第一次能对当下正在发生的事做出反应,而不是照着早就写死的剧本演完。
第三幕 · 无限时长,一分钟不到三块钱
从前的 AI 视频卡在两个地方:一是短,几秒到一分钟就到头;二是贵,也慢。
Vidu S1 把时长这道墙推没了——既然是边说边长,你不停它就不停,理论上能一直聊下去,无限时长的双向对话。画面是 540P、每秒 25 帧,比电影那 24 格还稍富余一点,看着是连贯流畅的动态,不是一顿一顿的皮影。
价钱也降到了。跑一分钟,成本两块八。差不多一瓶矿泉水,或者地铁起步价。上传一张照片,随手挑个音色,就能把任意一张脸、一只萌宠、一个动漫角色变成能跟你实时对话的对象。
从"算好一段给你看",到"你说着它就活着",中间隔的不是画质,是主动权换了手。
屏幕看了我们这么多年,如今它不光会看回来,还开始等着我们先开口了。
参考资料
- 生数科技发布 Vidu S1,推动视频生成迈向「实时交互」新时代 | 爱范儿
- Vidu S1 深度评测:实时交互模型,能否征服世界? | 腾讯新闻
热门跟贴