人眼对画错的影子几乎是瞎的,却能一眼识破一次假眨眼。这两件事放在一起,基本就是这个问题的答案。

游戏厂商这几年把预算堆在光追、4K、毛孔级贴图上,玩家照样一眼看出"这是游戏"。问题出在人眼根本就没在看厂商花钱的那些地方。

打开网易新闻 查看精彩图片

分辨率这条路早就到头了

先弄清楚一个很朴素的问题:4K到底比1080p真实多少。这个问题在视觉科学里有定量答案。

人眼中央视野的分辨极限,工程上常用的阈值是60像素/度。2024年那篇Resolution limit of the eye用实测数据把这条线画得更细,20度偏心处中位观察者只有约22像素/度,95分位也就35像素/度。

换算到客厅,3米外看55吋电视,多数人已经分不出1080p的单个像素,4K往8K走的收益接近于零。

也就是说像素早就过剩了。电视厂商还在卖8K,游戏UI里还有原生4K选项,但人眼这一端的带宽十年前就填满了。

GTA VI上个月底那场扩展演示是个很好的反例材料。Digital Foundry给的评价是"大概是我们见过的实时渲染里最震撼的一次演示"。

可它在标准PS5上跑的是原生1440p、30帧,没用FSR也没用任何超采样,30帧的上限还是Zen 2的CPU卡出来的。震撼全场的画面,分辨率停在七年前的水平。

它赢在光线追踪的全局光照和反射,那分辨率之外的下一个嫌疑人,自然就是光。

那光影呢?人其实看不出光照错了

这一段是判断改得最大的地方。最早以为出戏的第一来源就是光照,毕竟所有关于画面进步的宣传都在讲光追,Lumen、路径追踪、神经渲染,钱也都花在这。

翻到感知心理学那一摞论文才发现,人对光照错误的敏感度低得离谱。

Ostrovsky、Cavanagh和Sinha在2005年做过一组实验,Perceiving illumination inconsistencies in scenes,结论用的词是"人对场景里的光照不一致惊人地迟钝"。

Nightingale等人2019年把题目收窄到影子和反射的错误,结果是被试的整体检出率很差,错误细微的时候接近瞎猜。影子方向画反了、水面的反射少了半张脸,多数人过场就过去了。这跟大多数人想的正相反。

那光追的钱是白花了吗,倒也不是。光照对真实感的贡献走的是另一条路,它管的是"材质有没有活过来",而人对材质对不对是有感觉的。

皮肤是最典型的例子,GPU Gems 3第14章给的数是皮肤反射光里约94%来自次表面散射,光线钻进皮肤几毫米再散出来,直接从表面反射的只占约6%。不做次表面散射,多边形再多也是塑料。

这项技术在2015年被Jimenez那篇屏幕空间方案压到了全高清一帧0.5毫秒,所以今天的3A角色脸上都有它。

UE5的Lumen解决的是同一类问题,间接光。房间里没被灯直接照到的角落是什么颜色,桌子底下有没有从地板弹回来的光,这些在过去靠美术手工烘焙,Lumen让它全动态。

但它也有自己的穿帮预算,软件光追模式下Lumen Scene默认只覆盖相机周围200米,相机跑快了间接光会慢半拍跟上来。Nanite那边则不支持骨骼动画角色和半透明,也就是说场景可以有电影级几何精度,走在场景里的人还是老办法。

把这两段合起来看,光照的作用是把材质的可信度托住。能让人在半秒之内判定"这是游戏"的东西,得去人眼配了专用硬件的地方找。

出卖游戏的是脸和动作

1973年Gunnar Johansson做了一个后来被引用了几千次的实验,point-light walker。他在人的关节上贴十几个光点,关灯,只放这些光点的运动给被试看。被试瞬间就能认出有人在走路,还能判断性别、情绪,甚至认出是熟人。十几个点,没有轮廓也没有材质。

后来的脑成像研究把这件事落到了具体脑区。Grossman和Blake 2002年发在Neuron上的实验显示,看光点行走者时颞上沟会特异激活,连梭状回面孔区都跟着亮。

也就是说大脑给"生物运动"和"面孔"各配了一套专用电路,处理速度和敏感度都远超通用视觉。这两套电路就是游戏最容易被抓包的地方,因为它们从来不看多边形数,只看动作对不对、脸活不活。

脸这边最具体的证据是《死亡搁浅2》。2025年英国《在线安全法》上线之后,有玩家用照片模式里Sam的脸去过面部年龄验证,过了;PC Gamer拿水獭帽版本复现也过了。机器已经分不出这张脸是不是真人,人还是能。差别在动起来之后,眨眼频率、眼球微跳、视线焦点、口型和音素对不对得上,这些是脸部专用电路每天在真人身上校准的量。

《赛博朋克2077》用的JALI系统把口型和面部动画做到了十种语言程序化生成,已经是业内顶尖。它反而更能说明凝视为什么重要:对上视线时,玩家会专门发帖夸角色像在跟自己说话;Johnny低头或把焦点落在别处时,人也会立刻读出"他没有看我"。这未必是动画错误,但大脑对眼神方向的判断,显然比对影子方向苛刻得多。

动作这边的敏感点更土,脚。动画混合的时候不锁脚的接触点,角色的脚就会在地面上滑,业内叫foot sliding,解决办法是脚部IK把脚钉在地上。问题在于IK有预算,MoCap Online那份指南给的数是两骨骼IK可以同时跑几十个几乎不花钱,全身IK在主机上只够前景1到4个角色用。所以主角走路是稳的,街上第五个路人开始滑冰。玩家未必说得出IK这个词,但他的颞上沟看得一清二楚。

Naughty Dog在GDC 2021讲过《最后生还者2》的Motion Matching,思路是放弃动画状态机,从动捕数据库里实时搜最接近当前姿态的下一帧,让角色从跑到停之间没有那种切状态的顿挫。这套技术之所以被反复提,说明它解决的是一件人眼特别在意的事。动作对了,脸对了,画面再粗糙也能过关;反过来,动作和脸不对,画面越精细越糟。这就到了这个问题最核心的一层,为什么越像越假。

越像越假,机制叫感知不一致

恐怖谷这个词大家都知道,它是森政弘1970年在《Energy》杂志上写的一篇随笔,2012年才有正式英译。原文只有一条手画的曲线,横轴是像人的程度,纵轴是亲和感,在快要像真人的地方猛跌一下。这条曲线四十多年来一直是个假说,真正的实证工作是最近十年做出来的,而且结论比原版精细得多。

MacDorman和Chattopadhyay 2016年在Journal of Vision上那篇Familiar faces rendered strange用了365名被试,变量控制得很干净。他们把人脸的各个特征分别调节真实度,皮肤、眼睛、眉毛、嘴,然后对比两种情况,一种是所有特征一起降低真实度,一种是只降其中几个。结果只有后者,也就是"特征之间真实度不一致"的脸,才引发被试的诡异感。后来同一组人用548名被试重跑,进一步确认这种感觉来自不一致本身,跟这张脸是不是难以归类没关系。Kätsyri等人2015年在Frontiers in Psychology的综述把此前几十项恐怖谷研究过了一遍,分类困难那条假说几乎找不到支持,感知不匹配这条得到支持。

这就解释了为什么老游戏没有恐怖谷,PS2时代的角色皮肤、眼睛、动作全都一样假,特征之间是一致的,大脑把它归到"画"这一类就不再计较。今天的角色皮肤做到毛孔级,次表面散射一应俱全,眼睛却还在按30秒眨一次的频率机械眨动,大脑把皮肤归到真人那一类之后,紧接着就在眼睛上撞了车。

跨模态的不匹配也是同一回事。有一组实验把真人脸配上合成语音、机器人脸配上真人语音,两种搭配都比各自一致的版本更诡异。所以真实感是一个AND关系,皮肤、眼睛、动作、声音、物理,任何一项掉队,其余的都白做。

至于大脑为什么这么干,预测编码给的解释最省事。Rao和Ballard 1999年的模型说视觉皮层一直在自上而下地预测接下来会看到什么,感觉输入进来只是拿来和预测做减法,剩下的差值叫预测误差,往上层传的只有这个差值。2025年Rideaux等人在Journal of Vision上的实验进一步显示,被违反的预期不光会被注意到,还会被优先处理,表征精度反而更高。

把这个机制套到游戏上,逻辑就通了。角色越接近真人,大脑调用的预测模型就越接近对真人的模型,而对真人的模型精度极高,眨眼间隔、重心转移、说话时眉毛的位置全都在里面。模型越精,容差越窄,同样一个小错,在卡通角色身上不产生误差,在照片级角色身上就是一个尖峰。

逼真是一种诅咒,它把玩家的容差压到了最低。

公平起见还得说另一面。恐怖谷曲线本身的形状一直有争议,Bartneck等人2007年用真人照片和各种机器人做对比,发现真人照片的好感度还不如一些玩偶型机器人,提出恐怖悬崖模型,认为曲线右端根本不回升。这一点对游戏的启发反而更直接,它意味着追求照片级本身可能没有终点线,一致性才是能拿到手的东西。

16毫秒砍掉了什么

游戏的假有一部分来自预算层,跟感知无关。皮克斯那个The Science Behind Pixar项目公开过《Luca》的渲染数据,某个场景一帧要渲50小时。游戏引擎在60帧下的预算是16.6毫秒一帧,30帧也只有33毫秒。50小时是18万秒,除以0.0166,两边差约1000万倍。

这个数解释了很多穿帮的来源。屏幕空间反射在物体移出画面时反射跟着消失,环境光遮蔽在物体边缘留一圈黑边,远处植被突然换模型,这些都是在16毫秒里主动砍掉的东西,工程上叫近似,感知上叫穿帮。DLSS 4和FSR 4是2025年这一轮的新解法,NVIDIA说Transformer超分模型比旧CNN快40%、省30%显存,AMD的FSR 4也第一次转向机器学习时序模型。但帧生成的代价也很具体,快速移动的元素和UI文字会出现重影和闪烁,基础帧率越低越明显。AI生成的帧本身又引入了一种新的不一致。

这条路的尽头是Genie 3。DeepMind 2025年8月发布的这个模型可以从一句文字生成一个能实时走动的世界,官方数据是这样的:在720p分辨率下能维持几分钟的一致性。24帧每秒,记忆约一分钟,超过这个时间走回头路场景会变。TechTalks的评测里记录了人物倒着走这类物理错误。同一段官方演示里,向前移动时完整的公路和护栏也会在几秒内退化成一整块泥面,再变成开阔水面。这里掉的不是分辨率,而是对象身份和空间关系。这个极端样本很干净,画面在像素级别很真,但底层缺少传统物理引擎那种刚性的一致性约束,一眼假来得比任何传统渲染都快。

世界不回应你的时候

到这一步如果收尾,结论会是真实感取决于脸和动作,我当时确实差点就这么记下来。但有一类游戏不符合这个结论。