你有没有玩过这样一款游戏,Boss明明离你十万八千里,却突然放了个近战大招,或者你刚躲到墙角喘口气,它又莫名其妙地放了个远程技能,仿佛完全不知道你在哪里?
这不是你运气不好,这是当前所有游戏世界模型的一个共同软肋。
2024到2025年这两年,游戏世界模型这个方向突然火了起来。所谓游戏世界模型,简单说就是用AI直接"生成"游戏画面,你按下按键,AI实时画出下一帧该有的样子,不再依赖传统的游戏引擎渲染。这类模型在画面流畅度和操控响应上确实取得了让人惊讶的进展,Genie、Oasis、Matrix-Game这些名字如果你关注这个领域应该不陌生。
但一个问题一直被悬置在那里:这些模型画得出玩家的动作,却搞不定NPC(非玩家角色,也就是游戏里那些Boss、怪物、路人)该怎么"反应"。
问题出在哪?两条死路
现有方案基本分两派。
第一派叫"隐式生成",说白了就是让AI在生成画面的同时,顺带把NPC的行为也"编"出来。这种做法的问题在于,NPC的行为完全是从训练数据里学到的视觉模式里"长"出来的,AI并不真正理解当前打斗的距离、角度、Boss技能冷却情况,它只是在模仿"看起来差不多"的画面。这就是文章开头那个近战大招乱放的场景,AI压根不知道玩家在哪,它只是觉得"这里应该出现一个技能动作"。
第二派叫"显式外部控制",也就是把NPC该做什么这件事,甩给一个外部信号去指定,模型只负责根据这个信号画画面。这看起来更可控,但本质上是把决策权彻底移出了世界模型本身,模型自己依然不理解游戏状态,只是被动执行外部下发的指令。
这两条路都绕开了一个核心矛盾:一个称职的游戏世界模型,理应同时干三件事,理解当前发生了什么,判断NPC接下来该做什么,把这个决定画出来。可现在的模型要么把这三件事混在一起囫囵吞枣,要么干脆放弃中间那一步。
这就好比让一个厨师同时闻着味道、想着菜谱、颠着勺炒菜,还要求他脑子里同时想清楚"这道菜现在火候到哪了、该加盐还是该出锅",三件事挤在一个脑子里同时处理,效果可想而知会打折扣。如果不把"判断火候"这件事单独拎出来当一个清晰的决策环节,厨师很容易凭手感乱来,做出的菜时好时坏,正如现在的NPC时而合理时而离谱。
Tencent和新加坡国立大学的研究团队想明白了这一点,他们提出的WorldMind,核心思路就一句话:把"理解状态"和"决定动作"这两件事,从"画面生成"里彻底剥离出来,单独做成两个独立环节,再用一个闭环把它们串起来。
四层架构:让每个环节各司其职
WorldMind把整个交互过程拆成四层,理解层、决策层、控制层、生成层。
理解层(Understanding Layer)*:负责从生成的画面和历史动作记录里,提炼出一个"精简状态",比如Boss和玩家的距离、朝向、上一个技能是什么、当前哪些技能还在冷却。
这一层其实是两条支线并行工作的。一条叫"技能分支",它不需要看画面,纯靠记录Boss之前放过什么技能、什么时候放的,就能算出每个技能还剩多久冷却完,这条线完全是确定性的计算,不依赖AI猜测。另一条叫"几何分支",专门负责搞清楚Boss和玩家的空间关系,比如两者相距多远、面朝哪个方向。这条线没法靠历史记录推算,只能从最近生成的几帧画面里,用一个卷积网络加GRU(一种处理序列数据的循环神经网络结构)去识别。
这里有个细节值得琢磨。研究团队专门做了实验对比,如果用现成的、没有针对这个任务微调过的通用视觉模型(比如DINOv2或者VideoMAE,都是目前视觉领域很有名的预训练模型)去做这件事,效果会差多少?答案是差得不轻。以Isaac这款游戏为例,距离预测的误差从他们自己训练的模型的8.187,直接飙到DINOv2的31.17,差了将近4倍。这说明"看懂游戏里的距离和角度"这件事,并不是随便拿个通用视觉模型糊弄一下就行的,它需要针对这个具体任务专门训练。
决策层(Decision Layer)*:拿到理解层给出的精简状态之后,负责推理Boss接下来该干什么,这一层由一个通用语言模型(Gemma-4-E2B-it)来承担。
有意思的是,研究团队特意没有用他们收集的数据集去微调这个语言模型。为什么?因为一旦用具体的Boss战录像去微调,语言模型很可能只是记住了"这种情况下数据集里的Boss通常这么做",而不是真正理解"这个技能的机制决定了它在这种局面下更划算"。他们更想让语言模型靠纯粹的推理能力去做判断,而不是死记硬背。
为了验证这一点是不是真的做到了,团队设计了一个挺巧妙的实验。他们把技能的名字全部换成中性代号(比如把"猛击"改成"技能A"),然后测试两种情况:如果把技能的机制说明整个删掉,模型的选择会不会变;如果把两个技能的机制说明互相调换,模型是不是会跟着说明走,而不是死守着原来的代号。结果显示,删掉说明后,模型的首选技能改变率在52%到90%之间,调换说明后改变率高达80%以上,并且模型更倾向于"跟着说明走"而不是"守着原代号不放"。
这个结果说明什么?说明模型确实是在理解"这个技能能干什么",而不是单纯记住"看到这个名字就选它"。这就好比你去一家新开的餐厅,菜单上把"红烧肉"改名叫"招牌菜一号",你点菜的依据应该是菜品描述本身,而不是这个陌生的编号。如果你还是习惯性地点"看起来眼熟的编号",那说明你根本没看懂菜单,只是在凭记忆瞎点。WorldMind的决策层显然是"看懂了菜单"的那一种。
控制层(Control Layer)*:把决策层给出的完整动作,比如"放一个突进技能,同时向右移动",翻译成生成层每一帧都能理解的、按时间对齐的提示词序列。
生成层(Generation Layer)*:真正负责把这些提示词变成画面的视频扩散模型(一种通过逐步去噪生成图像或视频的AI生成技术),团队用的是Wan 2.2 TI2V-5B模型,并且做了蒸馏加速,让它能以大约20帧每秒的速度实时运行。
生成完的画面会重新流回理解层,形成一个闭环,Boss下一步该怎么做,永远建立在它刚刚"看到"自己上一步动作造成了什么后果的基础上。
这个闭环设计其实很关键。如果没有这个反馈回路,Boss的决策就变成了开环的,也就是提前想好一套剧本按部就班地演,完全不管玩家中途做了什么反应。这就像你跟人下棋,如果你不看对方每一步怎么走,只是提前把自己接下来十步全部想好死板地执行,那对手随便一个变招就能让你满盘皆输。WorldMind的做法是每走一步就重新观察一次棋盘,再决定下一步,这才是真正意义上的"对局",而不是"演戏"。
数据从哪来:BOSS-140K
要训练和验证这么一套系统,光有游戏画面和玩家按键记录是远远不够的,你还需要知道游戏内部那些"看不见"的状态,比如Boss当前血量、技能冷却、精确坐标。
于是团队搭建了一个叫BOSS-140K(Boss-fight Observations with States and Skills)*的数据集,涵盖三款游戏(其中一款代号Game A,另外两款是知名独立游戏《空洞骑士》和《以撒的结合》),一共14个Boss,超过14万个片段,总时长超过200小时。
这个数据集最特别的地方在于,它不是靠人工一遍遍打游戏录出来的,而是用了一个"状态感知型游戏智能体"去自动打游戏,这个智能体能读取游戏引擎内部状态,并针对每款游戏的具体机制调整打法,从而在自动运行的情况下也能触发丰富多样的战斗场景。这解决了一个很实际的问题,如果靠人工录制,玩家很可能下意识地重复几种固定打法,导致数据集里的场景高度雷同,覆盖不了各种边缘情况。这就好比你想统计一个城市所有红绿灯路口的车流规律,如果只派一个司机开车绕圈录像,他大概率只会走自己熟悉的几条路,很多冷门路口永远不会被记录到。用一个能主动探索、覆盖各种情形的智能体去跑,才能拿到真正全面的数据。
结果好不好:数据说话
理解层的状态重建准确度如何?团队用了几个指标,距离误差、角度误差、以及按区间分类的准确率。结果显示在三款游戏里,距离和角度的重建误差都保持在较低水平,比如《空洞骑士》里角度误差只有2.96度,分类准确率高达99.6%。
决策层的机制理解能力前面已经提到,删除或调换技能说明后,模型的选择会随之明显变化,证明它是真的在"读懂"技能机制,而不是死记硬背技能名字。
最关键的是整个闭环系统跑起来之后到底行不行。团队请了两个大语言模型裁判(GPT-5.5和Gemini-3.1-pro)对WorldMind和两种基线方案(隐式生成、外部控制)做了一分钟游戏片段的两两对比评测。结果显示,WorldMind在大约70%的成对比较中被裁判认为更胜一筹,动作合理性评分和整体连贯性评分也都排在第一位。具体数字上,GPT-5.5给WorldMind打的动作有效率是74.0%,明显高于两个基线的63.6%,序列连贯性评分(满分5分)WorldMind拿到3.85分,基线只有3.2分出头。
方法 GPT-5.5胜率 动作有效率 序列连贯性
隐式生成(无NPC控制) 71.5% 63.6% 3.28
外部控制(有NPC控制) 70.9% 63.6% 3.22
WorldMind N/A(作为对照基准) 74.0% 3.85
跨游戏泛化能力上,团队还在一个公开的WildWorld数据集上做了测试,发现决策层能部分迁移到新游戏上,依然保持对状态变化的敏感度,但状态重建这部分(也就是理解层的几何分支)需要针对新游戏重新适配训练,没法直接照搬。这也提示我们,让AI理解"空间关系"这件事,很大程度上还是依赖于对特定视觉场景的学习,还没到真正意义上"举一反三"的程度。
写在后面
读这篇论文的时候,最让我停下来想了想的地方,是那个"故意不微调语言模型"的决定。
大部分做AI应用的思路是有什么数据就往上怼,微调总归能让效果看起来更好看。但WorldMind的团队反其道而行,宁愿牺牲一部分"在这个具体数据集上表现得更像"的效果,也要保住语言模型靠纯推理做判断的能力。这背后其实是一个更深的取舍,你到底是想要一个"记住了这批Boss怎么打"的系统,还是一个"理解了打斗逻辑,遇到没见过的Boss也能大概推理出该怎么应对"的系统。前者短期分数好看,后者才有走向真正通用的可能。
另一个让我意外的细节是,团队专门测试了"给决策层多加一张画面"会不会有帮助,结果发现在两款游戏上反而是负增长,加了画面之后机制遵循率下降了6到8个百分点。这说明那个被压缩出来的"精简状态"文本本身已经把该有的信息都提炼干净了,多塞进去的图像信息反而成了噪音干扰。这多少推翻了一个直觉,很多人会下意识觉得"信息越多越好",但这个实验提醒我们,有时候把信息精炼到刚刚好,比什么都往里塞更管用。
如果Boss真的能理解玩家在做什么,理解自己技能的机制,那它和玩家之间的关系还只是"程序和用户"吗,还是已经悄悄变成了某种更接近博弈的东西?
Q&A
Q1:WorldMind是什么?
A:WorldMind是由Tencent和新加坡国立大学团队提出的游戏世界模型框架,它把NPC(非玩家角色)的行为决策拆分成理解游戏状态、规划下一步动作、转换控制信号、生成画面四个独立环节,让Boss等角色能根据实时战况做出有针对性的反应,而不是靠AI瞎猜或外部硬性指定。
Q2:WorldMind和之前的游戏世界模型有什么不同?
A:之前的模型要么让NPC行为完全隐藏在画面生成过程里,模型自己也不清楚NPC为什么这么做;要么把NPC动作交给外部信号强制指定。WorldMind则专门设计了一个"理解层"和"决策层",让NPC的每个动作都建立在对当前距离、角度、技能冷却等真实状态的推理之上,实验显示这种做法在约70%的对比测试中被裁判认为表现更好。
Q3:BOSS-140K数据集是怎么收集的?
A:BOSS-140K涵盖三款游戏、14个Boss、超过200小时的录像,由一个能读取游戏内部状态并自动调整打法的智能体全自动收集完成,而不是靠人工反复录制,这样能覆盖更多样化的战斗场景,避免数据集里出现大量重复雷同的打法。
热门跟贴