打开网易新闻 查看精彩图片

你有没有玩过这样的游戏:走进一个房间,往前探索了很久,然后决定原路返回。等你走回起点的时候,那个房间还是原来的样子吗?

这个问题听起来很简单,但对于现在最先进的AI视频生成模型来说,答案往往是否定的。你走出去再走回来,AI生成的"起点"可能已经变了模样,墙上的画换了个角度,家具挪了位置,甚至整个房间的光线都不一样了。这不是bug,这是几乎所有交互式世界模型都绕不开的结构性难题。

**世界模型**:一种能根据用户的动作实时生成环境画面的AI系统,你按下"前进"键,它就生成你往前走看到的画面,像一个会自己画画的游戏引擎。

这篇来自香港科技大学(广州)和阿里巴巴团队的论文,题目叫《ReWorld: An Interactive World Model with Long-Horizon Memory》,直译过来是"一个具有长程记忆的交互式世界模型"。他们要解决的,正是这个"走出去,还能不能找到回家的路"的问题。

三个愿望,为什么很难同时实现

先说说这件事到底难在哪。

一个合格的交互式世界模型,理论上要同时做好三件事。第一,反应要快,你按下按键,画面得立刻响应,不能卡顿也不能答非所问。第二,记性要好,你之前去过的地方,回去看应该还是那个样子,墙还在那儿,画还挂在那儿。第三,跑得要久,不能生成个十几秒就崩溃或者卡死,得能持续生成很长时间的视频。

这三件事听起来都不难,难就难在它们互相打架。

想让模型反应快,最简单的办法是让它只看最近发生的事情,就像你跟人聊天,只需要记住对方刚才说的那句话就能接话,不需要记住十分钟前聊了什么。但想让模型记性好,恰恰相反,它必须能看到很久以前发生的事情,不然它拿什么去"回忆"你走过的房间长什么样?

这就是论文里说的"控制想要短窗口,记忆想要无限长窗口"的结构性矛盾。你不可能既让模型只盯着眼前三步远的地方,又让它同时记住十分钟前的每一个细节,至少用同一套简单粗暴的办法是做不到的。

论文里还提到一个更扎心的实验发现:当他们把"直接注入动作指令"这种能显著提升控制精度的方法加进模型里之后,模型的动作跟随确实变准了,但是回访场景的还原能力却明显下降了。这说明控制和记忆这两种能力如果混在一起训练,会互相抢资源,一个学好了另一个就学坏了。

这就好比一个人同时要做两件需要不同注意力模式的事情:一边要眼疾手快地接住迎面飞来的球(对应"快速响应当前动作"),一边还要记住半小时前谁把车钥匙放在了哪里(对应"长期记忆")。如果你强迫大脑用同一套注意力资源同时处理这两件事,很可能两件事都做不好,接球会慢半拍,钥匙的位置也想不起来。如果不做区分训练,你会发现模型学会了灵敏地对按键做出反应,但一旦你走远了再走回来,它已经完全"失忆"了,好用的部分被记忆能力挤占了资源。

ReWorld团队的思路是:既然两种能力天生需要不同的"注意力窗口",那就干脆在训练阶段把它们拆开学,各自用各自需要的窗口长度去练,然后在实际部署的时候,再想办法把两种能力塞进一个统一的、大小固定的"记忆容器"里。

拆开训练:一部分脑子负责眼前,一部分脑子负责回忆

具体怎么拆?

ReWorld的做法叫"混合式分头注意力窗口",简单说就是给模型的注意力机制分了工。

**注意力机制**:AI模型内部用来决定"该重点关注哪些信息"的核心组件,你可以理解为模型的"专注力分配系统"。在ReWorld的Transformer结构里,每一层有24个"注意力头",相当于24条并行的信息处理通道。

论文的设计是:这24个头里,18个是"本地头",只能看最近12帧画面里发生的事,专门负责让模型对当前指令做出精准反应;剩下6个是"全局头",可以看到从视频开始到现在的全部历史画面,专门负责记住很久以前的场景长什么样。

这个分工听起来挺合理,但马上会遇到一个新问题:如果每次训练都固定让这6个头当"记忆担当",那么部署上线之后会出大麻烦。因为实际使用时,模型根本没有办法保留完整的历史画面,它只能读取一个容量有限的缓存,所有的注意力头读到的都是同一份被压缩过的历史记录。如果训练时死死地让某几个头专门负责"看全部历史",那么部署时给它们的却是被压扁的历史,这几个头就懵了,它们学到的记忆能力根本发挥不出来。

论文给出的解法叫"随机头路由"。

也就是说,不是固定哪几个头是"全局头"哪几个是"本地头",而是每一次训练迭代,都从一个包含12种随机分组方案的池子里,随机抽一种分组方式来决定这次谁是全局头谁是本地头。这样一来,24个头里的每一个头,在训练过程中都会轮流当过"负责眼前"的角色和"负责回忆"的角色。

**随机头路由**:每完成一次模型参数更新,就从预先准备好的一批随机分组方案中切换到下一种,让不同的注意力头轮流承担"看近处"和"看远处"的任务,防止某种能力被固化在特定的头上。

这个设计的巧妙之处在于,它保证了控制能力必须能在"短窗口"内独立完成,因为每个头大部分时间都是本地头,只能看到最近的画面,如果控制能力做不好就会一直练不出来;而记忆能力则始终"活在"当下这次训练轮到的全局头里,不管这次是哪几个头当全局头,记忆能力都能被训练到。等到部署时,即便所有头读到的都是压缩过的历史缓存,控制能力也不会受影响,因为它压根不依赖长历史,而记忆能力则可以通过后面要讲的"检索"机制去弥补。

这就像一家餐厅培训服务员,不是固定让张三永远端菜、李四永远收银,而是每天轮岗,今天张三收银明天李四端菜。这样做的好处是,哪怟某天李四请假了,张三照样能顶上收银的活,因为他之前轮岗练过。如果不轮岗,只让张三收银,一旦哪天收银台的电脑坏了只能用手写单子,张三从没练过,立刻就抓瞎。ReWorld的随机头路由,本质上就是给注意力头做"轮岗培训",确保任何一个头都具备基础的双重能力,不会因为部署环境和训练环境不一致而全盘失效。

论文里专门设计了一个实验验证这个思路是否成立。他们对比了三种方案:只用姿态编码不加动作注入、加了动作注入但不做头路由、以及完整的路由方案。结果显示,不做路由光加动作注入,虽然控制误差从17.66度降到13.21度,但回访场景的相似度评分却从0.3898跌到0.3376。而加上路由之后,控制误差进一步降到12.94度,回访相似度也回升到0.3752。这组数据清楚地说明,路由机制确实是"鱼与熊掌兼得"的关键。

记忆不能无限增长,怎么办:地标银行机制

拆开训练解决的是"怎么学"的问题,但还有一个更现实的问题摆在眼前:即便模型学会了记忆能力,实际跑起来的时候,历史画面是会越积越多的。你视频生成的时间越长,模型见过的画面就越多,如果每次生成新画面都要把所有历史画面搬出来对比一遍,显存很快就会爆掉。

论文给出的数字很直观:在720p分辨率下,如果不设上限地保留所有历史信息,还没跑到能真正检验"长程记忆"的视频长度,显卡内存就先耗尽了。

这就引出了ReWorld的第二个核心设计,一套叫做"记忆巩固"的机制,本质上是给模型的记忆设了一个"容量上限",但又想办法让它在有限的容量里尽可能保留有用的信息。

具体的做法是这样的。模型在生成视频的过程中,维持一个大小固定为12个"块"的缓存。

**缓存/KV Cache**:AI生成连续内容时用来存储"之前生成过什么"的临时记忆区,块(chunk)则是这里划分出的最小记忆单位,每个块对应几帧画面。

这12个块里,1个是"锚点块",永远保留视频最开始的画面,用来锚定整个场景的基本布局;5个是"最近窗口",保留刚刚生成的几个块,负责短期的连贯性;剩下6个是"检索到的地标",从一个更大的、容量上限为30个块的"地标银行"里,根据当前摄像机的位置动态挑选出最相关的6个历史片段拿出来用。

关键在于这个"地标银行"是怎么运作的。当一个画面块从"最近窗口"里"老化"出去的时候,它不是被直接丢弃,而是要经过一道筛选:只有当摄像机相对于上一次存入银行的位置,已经走过了足够远的距离,这个块才会被存进银行。这个规则用论文里的说法叫"里程表规则",意思是按走过的路程记账,而不是按时间记账。

为什么要这么设计?因为如果摄像机在同一个地方来回晃悠,短时间内产生大量高度重复的画面,把这些画面全部塞进银行,只会浪费宝贵的存储位置,却没有增加任何新信息。只有真正走出一段新距离之后产生的画面,才值得被当作一个新的"地标"存起来。

一旦银行存满了30个位置,每次要往里塞新地标,就得先踢出一个旧的。踢谁呢?规则是踢出"和银行里其他成员最相似、最多余的那个",专业说法是"冗余度最高的成员"。这样就保证了银行里存的地标始终保持多样性,覆盖的是场景里彼此不同的区域,而不是挤在同一片地方反复存档。

有一个细节值得专门说一下:这个"按路程存档"的规则,是完全不管这个地方之前是不是已经存过的。也就是说,哪怕摄像机是第二次、第三次走到同一个地点,只要走过的路程够了,这个地点的画面依然会被重新存档一次。为什么要这样,而不是"发现这个地方已经存过了就不用再存"?论文里给出了一个反直觉的实验数据:如果按"这个地方是否已经在银行里"来判断要不要存,模拟测试显示只有大约64%的远距离回访情况能被正确覆盖到。换句话说,如果贪图省事只按"有没有存过"来筛选,会漏掉超过三分之一的关键回访场景,因为摄像机走的路径千变万化,第一次路过存的角度和后来实际需要用到的角度可能根本对不上。

这就好比你在陌生城市自驾游,用手机拍照记录路过的地标。如果你的规则是"只要这个地标之前拍过就不再拍",那么第一次路过某个路口时匆忙拍的一张模糊照片,就成了你手机里关于这个路口的唯一记录。等你后来又开车经过这个路口,想找一张清晰的参考照片核对方向时,翻遍相册只有那张糊照片能用。而如果换一个规则,只要你确实开车走出了足够远的新路程,哪怕路过同一个路口,你也会重新拍一张,那手机里关于这个路口的照片就会越来越丰富、越来越清晰,等你真正需要参考的时候,才更有可能找到一张角度合适的。

论文的检索机制也很直接:每生成完一个新的画面块之后,系统就去地标银行里找出离当前摄像机位置最近的6个地标,把它们请回缓存,参与到下一步的画面生成过程中。这个检索完全靠"姿态",也就是摄像机在三维空间里的位置和朝向来做匹配,论文管这个叫"姿态索引"。

**姿态索引/MRoPE**:一种让AI通过摄像机的空间位置(而不是时间先后顺序)来查找相关历史画面的技术,你可以理解成给每个历史画面贴上了一个"GPS坐标标签",回访某个地点时就按坐标去找,而不是按"是第几秒拍的"去找。

传统的位置编码方式(业内叫RoPE)主要是按时间和空间顺序给信息打标记,这意味着如果你十分钟前路过某个地方,十分钟后又走回来,从模型的"时间坐标"角度看,这两次经过隔得非常远,模型很难自动意识到"这其实是同一个地方"。ReWorld引入的MRoPE则是直接把摄像机的三维姿态编码进注意力机制的索引里,让"相似的观察视角"能够互相靠近,不管这两次观察之间隔了多久。这就相当于给记忆检索装上了一个不依赖时间顺序、只认空间坐标的导航系统。

训练时也要学会"应付残缺记忆"

光有地标银行还不够。因为地标银行给模型提供的历史信息,本质上是稀疏的、不连续的,这12个块里,可能第1块是视频最开始的画面,第2到6块是刚生成的最近5个块,第7到12块则是从很久以前不同时间点抽取出来的6个地标,中间隔着大量没有保留下来的画面。

但如果模型在训练阶段,从来没有见过这种"残缺不全、七拼八凑"的历史记录,只见过完整连续的历史,那么真正部署上线之后,突然要处理这种拼凑起来的稀疏缓存,效果大概率会很差。论文里管这个叫"训练和推理之间的不匹配",表现出来的症状就是画面模糊、场景漂移。

解决办法叫"块丢弃训练",做法是在训练过程中,故意随机丢弃一部分历史块,只保留一个固定的锚点块加上随机抽取的5个其他块,让模型强制学会"就算只给你半份历史,你也得把当前画面生成对"。这样训练出来的模型,遇到部署时那种东拼西凑的稀疏缓存,就不会觉得陌生了。

这有点像消防员的模拟演习。真实火灾现场往往是浓烟弥漫、能见度极低、通讯时断时续的,如果消防员平时的训练只在能见度完美、通讯畅通的理想环境里进行,真到了火场,遇到烟雾遮蔽视线、对讲机信号时有时无的情况,很可能一下子就慌了神,判断失误。而如果平时训练就故意模拟浓烟和通讯中断的场景,让消防员习惯在信息残缺的情况下依然做出正确判断,真正遇到火灾时,反而能更从容地应对。块丢弃训练就是给AI模型做的这种"残缺信息适应性训练"。

让实时交互成为可能:四步蒸馏

前面讲的都是怎么让模型"记得住",但一个交互式系统还得"跑得快"。传统的视频扩散模型生成一段视频,往往需要几十步甚至上百步的"去噪"计算,这个过程放在离线渲染没问题,但要做成实时交互,玩家按下按键之后要等上老半天才看到反应,体验肯定崩溃。

**扩散模型**:一类通过"从噪声中逐步还原出清晰画面"来生成内容的AI模型,想象成先往一张照片上撒满雪花噪点,再教模型一步步把噪点擦掉、还原出原图的过程,生成时反过来,从纯噪声开始一步步"擦"出画面。

ReWorld采用的加速方案叫"分布匹配蒸馏",配合一个叫LoRA的轻量化适配器,把原本需要多步计算的生成过程压缩到只需要4步。

**LoRA**:一种给大模型做"轻量化外挂升级"的技术,不需要重新训练整个庞大的模型,只需要训练一个小得多的附加模块,就能让模型获得新的能力,这个附加模块通常只有几个GB大小,而完整模型的参数量要大得多。

具体做法是让原本训练好的"多步模型"充当老师,再单独训练一个体积很小的LoRA模块作为学生的"加速器",插在冻结不动的原模型上。训练完成后,同一套骨干网络就有了两种运行模式:把LoRA摘掉,是画质更精细的多步模式,适合离线高质量渲染;装上LoRA,就变成了四步就能出图的实时交互模式。整个LoRA模块只有2.6GB大小,论文里还提到它甚至可以跨着不同的基础模型版本迁移使用,重新蒸馏只需要两三千步训练。

这个设计的聪明之处在于,负责处理动作指令和姿态信息的那部分网络结构,完全没有加装LoRA,也就是说控制能力在这次加速蒸馏过程中完全没有被触碰,不会因为追求速度而牺牲精度。

数据从哪儿来:让虚拟世界和真实世界说同一种语言

讲完了模型结构,还有一个容易被忽略但极其关键的问题:这么复杂的一套系统,靠什么数据训练出来?

ReWorld团队用了一个八源混合数据集,总共22万多条带姿态标注的视频片段,来源包括他们自己用虚幻引擎(Unreal Engine)渲染的场景、真实世界拍摄的视频,以及各种游戏录屏。

**虚幻引擎(UE)**:一款广泛用于游戏和影视制作的三维实时渲染引擎,可以精确控制虚拟摄像机在三维场景里的每一步移动轨迹,论文里用它来生成"标准答案"级别精确的摄像机轨迹数据。

这里遇到的一个棘手问题是,不同来源的数据,摄像机移动的"尺度"完全对不上。虚幻引擎渲染出来的画面里,摄像机移动的距离单位是精确的厘米数;而从真实拍摄视频里靠算法反推出来的摄像机轨迹(用了VIPE、MegaSaM这类姿态估计工具),本身是"尺度不确定"的,也就是说算法只能告诉你摄像机移动的相对比例,却不知道这个移动到底对应现实世界里的多少厘米。

如果不做处理,直接把这些来源不同的数据混在一起训练,会出现一个荒谬的结果:同样是按一次"前进"键,在虚幻引擎数据里对应移动了30厘米,在真实视频数据里可能对应移动了3米,模型学到的"前进一步等于多少距离"就会乱套,控制精度自然无从谈起。

论文的解决方案是做"度量尺度对齐",把虚幻引擎渲染的数据当作"锚点",也就是标准尺,然后测量每个其他数据源里,摄像机每移动一个训练步长的中位数距离,除以虚幻引擎锚点对应的中位数距离(论文里给出的具体锚点数值是0.3667),算出一个缩放系数,再用这个系数去统一缩放该数据源的所有平移数值。这样处理之后,不管画面来自虚幻引擎、真实拍摄还是游戏录屏,按一次"前进"键,在物理意义上移动的距离都是一致的。

这就像国际贸易里统一度量衡的历史故事。假如没有统一的公制标准,一个国家用英尺计价,另一个国家用市尺计价,做生意的双方各说各话,交易的公平性根本无从谈起。ReWorld做的这套尺度对齐,本质上就是给来自不同"国家"(不同数据源)的摄像机移动数据,换算成同一种"货币",只有这样,模型才能学到一个放之四海而皆准的"移动感",不会因为某段训练数据来自真实世界、某段来自虚拟引擎,就产生认知混乱。

除了尺度对齐,数据管线里还有一个巧妙的设计叫"回文轨迹"(palindrome trajectory),也就是让摄像机故意走一条"去了再原路返回"的路径,专门用来给模型提供"回访监督信号"。这类似于给学生出练习题时,专门设计一道"你走出去再走回来,起点应该长什么样"的考题,如果训练数据里从来没有这种"走出去又走回来"的样本,模型压根不知道自己需要具备这种能力。

实验结果说话:ReWorld到底表现如何

说了这么多设计思路,最终还是要看数据说话。论文设计了一套涵盖三个维度的评测体系:动作跟随精度、长程记忆能力、以及整体视频生成质量,对比了六个近期的交互式世界模型基线,包括SANA-WM、DreamX、HY-WorldPlay、Matrix-Game 3.0、LingBot-World和Yume-1.5。

在动作跟随精度的测试里,团队用40张起始图片配合6种标准运动轨迹(比如推近、平移、弧形转弯等),一共构造了240段测试片段,让每个方法都执行同样的摄像机运动意图。评测结果显示:

| 方法 | 整体旋转误差(度)↓ | 整体平移误差↓ | 相机运动一致性↓ |

| SANA-WM | 13.02 | 0.123 | 0.388 |

| DreamX | 13.10 | 0.114 | 0.381 |

| HY-WorldPlay | 14.66 | 0.114 | 0.427 |

| Matrix-Game 3.0 | 15.45 | 0.075 | 0.394 |

| LingBot-World | 12.59 | 0.107 | 0.354 |

| Yume-1.5 | 14.24 | 0.131 | 0.428 |

| **ReWorld** | **11.95** | 0.102 | **0.332** |

可以看到,ReWorld在整体旋转误差和相机运动一致性两项上都拿到了最好成绩,11.95度的旋转误差意味着模型执行摄像机转向指令时的偏差是所有方法里最小的。

真正体现这篇论文核心贡献的,还是长程记忆的测试。研究团队设计了一个"大海捞针"式的测试,让摄像机走出去再原路返回,测量"起点画面"能不能在回来的时候被正确还原,测试长度覆盖了48到384个潜在帧(大约8秒到超过一分钟)。结果发现一个很有意思的现象:

| 方法 | 执行路径长度(k=96) | SSIM↑ | LPIPS↓ | DINO↑ | ORB↑ |

| SANA-WM | 499 | 0.313 | 0.528 | 0.700 | 0.161 |

| DreamX | 454 | 0.194 | 0.627 | 0.603 | 0.159 |

| HY-WorldPlay | 210+ | 0.427 | 0.247 | 0.942 | 0.460 |

| Matrix-Game 3.0 | 724 | 0.275 | 0.478 | 0.850 | 0.247 |

| LingBot-World | 834 | 0.251 | 0.635 | 0.509 | 0.162 |

| Yume-1.5 | 332 | 0.269 | 0.586 | 0.661 | 0.152 |

| **ReWorld** | 615 | **0.384** | **0.332** | **0.932** | **0.379** |

注意看HY-WorldPlay这一行,它的各项相似度评分看起来相当亮眼,但论文特别指出了一个隐藏的猫腻:它执行的实际移动路径长度只有210像素,远远短于其他方法的332到834像素。也就是说,HY-WorldPlay之所以"记得住",很大程度上是因为它压根没敢走多远,摄像机基本在原地附近晃悠,这种情况下"记住起点"自然容易得多。而ReWorld在移动路径长度达到615像素(属于中等偏长的水平)的情况下,依然能在SSIM、DINO、ORB三项指标上拿到最好成绩,这说明它是真正做到了"走得远,还能记得住",而不是靠"不敢走远"来投机取巧。

**SSIM/LPIPS/DINO/ORB**:这四个都是用来衡量"两张图片有多相似"的技术指标,分别从像素结构、人眼感知的图像特征、深度学习提取的场景语义特征、以及具体特征点匹配这四个不同角度去打分,组合起来用能更全面地判断"回访画面和当初的画面是不是同一个地方"。

除了这组核心数据,论文还做了VBench通用视频质量评测,覆盖成像质量、美学质量、主体一致性、背景一致性、时序闪烁、动态程度、运动平滑度七个维度,ReWorld拿到了七个方法里的最高平均分0.850,虽然没有在每一个单项上都拿第一,但在需要"既要画面稳定又要有足够动态"的综合表现上最为均衡。论文特别提醒读者,"动态程度"这个指标需要和前面的记忆测试结合起来看,因为一致性和回访相似度这两类指标天生偏爱"动作幅度小"的方法,如果一个模型压根不怎么动,这两项指标会显得特别漂亮,但这种漂亮是有水分的。

消融实验:拆开来看每个部件到底有没有用

为了验证前面讲的每一个设计决策是不是真的都发挥了作用,论文还做了详细的消融实验(也就是把某个部件拿掉,看看效果会变差多少)。

针对训练配方的消融实验里,对比了"什么都不加的基础版"、"只加块丢弃训练"、"只加随机头路由"、以及"两者都加(也就是完整版ReWorld)"这四种配置,在k=384这个最长、最有挑战性的测试长度上,回访相似度分别是0.3387、0.3463、0.3565、0.3752。数字一路上升,说明两个训练技巧不是简单的叠加,而是互相配合、共同起作用的。

针对推理阶段缓存策略的消融实验则更能说明问题。研究团队对比了五种不同的缓存管理方式:完全不设限的全量缓存(理论上限,但实际会因内存耗尽而在更长测试上直接报错)、传统滑动窗口(只保留最近的画面,忘掉更早的)、简单的均值池化压缩、没有检索能力的静态地标(固定保留几个画面而不做智能检索)、以及完整的地标银行方案。

在k=384这个最考验长程记忆的测试长度上,滑动窗口方案的回访相似度只有0.3476,简单均值池化方案是0.3541,而完整的地标银行方案达到了0.3752。这组对比清楚地展示出,简单粗暴地"忘掉旧的、只留新的"或者"把旧的都压缩成模糊平均值",都不如"精心挑选、完整保留几个关键地标"来得有效。

写在后面

读完这篇论文,最让我意外的其实是HY-WorldPlay那组数据背后的猫腻。一个模型在测试指标上表现很漂亮,未必是因为它真的解决了问题,很可能只是因为它悄悄回避了难题,走得慢、动得少,自然容易"记得住"。这提醒我,看任何AI系统的评测数字时,都得多问一句"这个高分是靠真本事拿的,还是靠某种取巧的方式拿的",光看单一指标很容易被误导。

另一个让我反复琢磨的细节是那个64%的覆盖率数据,如果按"这个地方是否存过"来决定要不要存档,会漏掉超过三分之一的回访场景。这个数字背后其实藏着一个更普遍的道理:直觉上看起来最省资源的做法(不重复存档),实际执行起来反而会造成信息缺口。很多工程决策里"看起来聪明的优化",未必经得起真实场景的检验,这大概是所有做系统设计的人都该记住的一课。

论文最后也坦诚承认了局限:现在这套记忆机制完全靠摄像机的空间位置来做检索,只能应付"探索静态场景"这类导航式的交互,如果场景里的物体是会动的、会变化的,比如你离开房间时门是关着的,回来时希望门还是关着的(除非有人开过它),这套纯粹靠姿态检索的机制就不够用了。动态场景下的记忆该怎么做,会是一个更难啃但也更有意思的问题。

Q&A

Q1:ReWorld是什么?

A:ReWorld是由香港科技大学(广州)和阿里巴巴团队研发的交互式世界模型,能根据用户输入的摄像机动作实时生成连贯视频,核心特点是即便摄像机走远了再走回来,也能准确还原之前看过的场景。

Q2:ReWorld怎么解决"记不住"的问题?

A:它把控制和记忆两种能力在训练时用不同的注意力窗口分开学,部署时再用一个叫"地标银行"的机制,把走过路程中挑选出的关键画面存进一个容量固定的缓存里,靠摄像机位置去检索最相关的历史片段。

Q3:ReWorld能实时运行吗?

A:能。团队用了一种叫分布匹配蒸馏的技术,配合轻量化的LoRA适配器,把原本需要几十步的生成过程压缩到只需4步,同一套模型既能做高质量的多步渲染,也能切换到四步的实时交互模式。