打开网易新闻 查看精彩图片

1962 年,MIT 林肯实验室的伊万・萨瑟兰发表了一篇题为《Sketchpad:一个人机交互通信的图形系统》的论文。

里面首次用了 「计算机图形学」这个名词,很久以后人们才发现,这个词定义了我们所看到的,用图标、模块、点击等可视化的互动系统来组织并且呈现信息,完成人机交互的方式。

人和计算机的交互,过去60多年,依然延续着「计算机图形学」开创的很多范式。

打开网易新闻 查看精彩图片

但近两年,随着视频模型、世界模型的迭代,似乎更直观、更即时、更加摆脱计算机本身屏幕限制的交互形态,正在诞生。

AI的触手,已经伸进了物理世界,可以和现实中的我们产生连接。

我在想,如果视频不再只是被观看,还可以被进入、可以实时交互,会发生什么?

看到形界智能「Era」系列的原生模型Rise正式发布了,用500ms的端到端响应延迟,让人机交互,有了新的变量。

第一时间测试了一下,给大家介绍介绍。

打开网易新闻 查看精彩图片

01全域沉浸,一种全新的视频交互形态

如果把现有的视频生成模型,按交互方式分类,大致可以分成三种。

第一种是离线视频生成。这是比较主流的形态,Seedance 2.5、MiniMax H3等都属于这一类。

交互方式是输入到输出,用户给一个指令,模型按指令生成一段视频。你说什么,它呈现什么。

第二种是实时视频生成。爱诗科技、生数科技往这个方向有一些尝试。

他们把渲染速度做到了实时,你输入 prompt,画面几乎同时出来。可以在一定程度上,支持实时数字人视频通话,还有语音控制视频走向。

速度变了,但输入和输出的映射关系没变。本质还是对提示词的执行,你说什么、它呈现什么,只是会更快。

第三个是全域沉浸式生成。

这是在输入侧增加了一层感知层,模型不再只是被动等待 prompt,而是主动接收用户的实时指令、表情、环境和动作等多模态信号。

输出的内容会基于用户的状态变化而有所不同,不再是 prompt 到结果的单一映射。

前两类,解决的是怎么让视频生成得更快、更好。

现在,形界智能Rise,希望探索的是怎么让用户进入一段视频,现实中的人挥动双手,视频中可以实时发生变化。

到这里,现实和屏幕世界的边界,第一次模糊了。

打开网易新闻 查看精彩图片

人和视频、人和计算机的交互,似乎也第一次有了新的味道。

有了摄像头的理解能力,随时随地和虚拟世界里面的物体、人,甚至环境进行互动,很神奇。

02Rise模型,从技术到体验,不一样
特意研究了一下,目前主流的互动视频技术,实际上是两阶段串行系统:

先由一个视频理解模型解析用户的交互信号,生成渲染指令,再由一个视频生成模型根据指令生成画面。

但这存在两个很难绕过去的问题。

第一个是智能上限的问题。

用户的交互信号没办法被生成模型直接 Scaling,理解模型和生成模型各跑各的,Representation 没办法在同一个空间里联合优化。

说白了就是两个模型之间隔着一堵墙,理解侧再聪明,生成侧也接不住。

第二个是延迟的问题。

GenZ 时代的互动内容消费者,能接受的端到端响应耗时平均在 500 毫秒。

但两阶段串行系统从用户动作到画面响应,体感端到端时延在 4 秒左右。

理解模型生成指令要时间,生成模型接收指令再渲染也要时间,两个阶段串起来,4 秒已经算快的了。

4 秒是什么概念?在互动场景里,4 秒的延迟基本等于断联。

做一个动作,等 4 秒才看到反馈,那种沉浸感早就碎了。

这套两阶段的双工视频生成系统,是互动视频技术的中间形态。它代表了上一个时代能触碰的互动体验上限——不是技术做不到更好,是架构决定了天花板就在那里。

形界智能选择了另一条路。

他们把视频理解和视频生成做到一个模型里,在时序上把输出的每一帧和用户摄像头输入的每一帧统一建模。

没有理解模型和生成模型的分立,没有两阶段的串行等待,输入和输出在一个模型里端到端地流动。

这条路难在哪里?难在 Representation 的对齐。

视频理解需要的是语义层面的抽象,视频生成需要的是像素层面的细节,这两套东西要在同一个空间里共同优化,对模型架构和训练方法的要求极高。

打开网易新闻 查看精彩图片

但这条路走通之后的好处也是结构性的。

没有了串行等待,端到端延迟被压到了 500 毫秒以内。

这个数字刚好卡在人类感知实时交互的临界点上,超过 500 毫秒,人会感觉到卡顿;低于 500 毫秒,交互是流畅的。

形界智能今天发布的 Rise 模型,是 Era 系列第二个原生全双工视频生成基础模型。

基于约 300 小时的赛车视频的后训练数据,Rise 模拟了高速赛车场景的真实物理引擎反馈。

打开网易新闻 查看精彩图片

但真正让我觉得有意思的不是赛车本身,是 Rise 在理解侧展现出来的泛化性。

不需要专业的方向盘控制器。

对着摄像头用任意形状的东西比划:垫子、手机、甚至空手,模型都能理解你的转向意图,实时生成对应的驾驶画面。第一人称可以,第三人称也可以。

也就是说,进入这个虚拟世界的交互成本,被降到了几乎为零。

只要做出日常的真实的动作,模型就能理解你。

这才是这件事最核心的变化。

过去几十年,我们和虚拟内容之间的交互一直需要一层中介。

键盘、鼠标、手柄、方向盘,每一种外设都是一层翻译器,把我们的意图翻译成机器能理解的信号。

但现在,摄像头加上模型的理解能力,让这层翻译器变得多余了。

可以直接用手势、用动作、用任何你觉得自然的方式和虚拟世界沟通。

就像在乔布斯带来iPod、iPhone之前,人们很难想象没有物理按键的手机一样;

今天,也许我们更习惯的手势、动作等等,也可以成为更自然的人和计算机、人与模型的交互方式。

03内容的新定义

我一直在想:视频生成这个赛道,最终的终局是什么?

是生成一段无限长的视频吗?是生成 4K 甚至 8K 的画面吗?是让物理模拟真实到分不清真假吗?

这些都很重要,但肯定都不是终点。

现在的所有视频生成模型都在走一条路径,叫把视频生成得更好、更快。

但它本质都还是在执行 prompt。用户给什么指令,模型出什么结果,中间没有变量。

但有了感知层之后,输出的内容可以基于用户的状态变化而有所不同。

它不再仅仅是 prompt 到结果的一一映射,还可以有更多的智能和现实体验,体现在里面。

这让我想起形界智能上一个模型 Genesis 发布时提出的一个概念,叫体验优先计算。

形界智能Rise模型,让我看到了全新的交互
打开网易新闻 查看更多视频
形界智能Rise模型,让我看到了全新的交互

他们关心的不是这段视频生成得有多快多好,而是用户有没有真正进入其中。

这两个问题的差别,就是两个时代的差别。

从订单逻辑,到现制逻辑,再到实时响应,接下来,人和模型的关系,人和内容的关系,也会发生变化。

Rise 想做的,就是让内容可以根据你的状态实时变化。

人动一下,画面就跟着动一下。换一种方式进入,画面就换一种方式响应。

是不是已经有了点《头号玩家》的样子?

还有一个细节。

Rise 的每一次真实交互,都是模型进化的燃料。

用户交互信号进入模型,模型实时生成体验,用户给出反馈,这些交互视频数据积累下来,又反过来优化模型。

而且这个飞轮的转动速度会比传统的内容平台快得多,因为每一次交互产生的不是静态的数据点,还包含了用户意图、模型响应、用户反馈的完整闭环数据。

我在想,这个「流式理解+流式生成」的双流架构的意义,除了单次体验的提升,更在于它形成了一个新的数据闭环。

Rise 目前跑通的场景是赛车。300 小时的赛车视频数据,让模型学会了高速场景的物理反馈和实时响应。

打开网易新闻 查看精彩图片

但这只是开始。

作为一个通用的双流视频模型架构,后续会在其他场景持续释放能力。

如果同样的架构,被应用到虚拟陪伴、互动娱乐、虚拟角色这些场景,事情也会很快就不一样了。

你对着摄像头笑一下,屏幕里的Ta就跟着笑。你皱一下眉头,Ta就问你怎么了。你做一个手势,Ta就知道你想要什么……

生成一个能感知你、理解你、回答你的世界,就好像,对宇宙的所有呼唤,都有了具象的回应。

04一点思考

我不喜欢用颠覆、炸裂这样的词汇,但似乎,能改变世界的模型,一定会先从改变交互体验开始。

当我们和视频的交互和相应有了不同,一种全新的内容形态、消费体验,甚至是虚拟互动的世界,即将开启。

Rise 已经把理解和生成揉进一个模型里,让用户用最自然的方式进入虚拟世界。

这条路肯定难,但似乎跳出了雕花的、重复的漩涡。

了解了一下,创始人王裕鑫,是很年轻有想象力的一位技术大牛。

2023年博士毕业,应届拿了华为、腾讯、字节、快手等多家头部企业的顶尖人才计划,最后选择投身大模型赛道创业。

打开网易新闻 查看精彩图片

在元石科技期间,他牵头组建了国内首批 MoE 架构大模型预训练团队,主导了 200B+ MoE 模型的训练工作。

其团队曾被 Django 联创 Simon Willison 评选为 2025 年中国 Top 6 大模型团队之一。

他们是明星团队,但更让我兴奋的,是他们在尝试定义,未来的内容交互范式。

随时随地,和一个虚拟世界里面的物体、人、环境,进行即时互动,产生新的创意和体验。

这可能是未来几年世界模型、视频生成赛道更值得看的方向。

现在,Rise 非常有诚意,没有 waiting list,官网能直接体验。

打开网易新闻 查看精彩图片

官网:https://www.frame-x.ai/models/rise?ref=rsh_a77729dy19d2qn03

感兴趣的朋友,抓紧去试试!

用手比划一下,就能感受这种新的交互方式!

也许有一天,我们看到人们都在自己家里,对着空中手舞足蹈,别奇怪,也许那就是更好玩的未来模样……

打开网易新闻 查看精彩图片

朋友圈会发一些具体的案例和商业化日常~