打开网易新闻 查看精彩图片

这项由香港科技大学与华为诺亚方舟实验室、香港城市大学联合开展的研究,以预印本形式于2026年7月13日发布在arXiv平台,论文编号为arXiv:2607.10995。研究成果命名为AsySplat,聚焦于如何让计算机更高效地从一组照片中"脑补"出完整的三维场景。

设想你手头有32张从不同角度拍摄的同一个房间的照片,现在你希望让计算机根据这些照片,生成出你站在任意其他角度时应该看到的画面——这就是所谓的"新视角合成"。这项技术在虚拟现实、数字孪生、影视制作、自动驾驶地图构建等领域都有广泛应用,可以说是让计算机真正"理解"三维世界的一把关键钥匙。

然而,要让计算机做到这件事并不容易。主流的做法是把照片切成一小块一小块的图像碎片,然后让神经网络反复处理这些碎片之间的关系,推断出每一处场景的三维结构和外观。问题在于,照片越清晰、数量越多,这些碎片就越多,计算量就会爆炸式增长。一张960P的高清照片已经包含大量细节,32张叠加在一起,计算机需要处理的信息量让很多现有方法望而却步。

研究团队发现,现有方法在这件事上存在严重的"资源浪费"——他们把有限的计算力平等地分配给了本不需要同等精力的两件事,导致整个系统臃肿而低效。AsySplat的核心贡献,就是找到了这种浪费的根源,并提出了一套"因材施教"的解决方案。

一、为什么现有方法在"大材小用"

要理解AsySplat的创新,先得明白它要解决的具体问题出在哪里。

现有的主流方法,包括AsySplat主要对标的LongLRM,采用的是一种"一刀切"的处理方式:把所有照片切成尽可能细小的图像碎片,然后让网络层层叠加地处理所有碎片之间的关系。为了保留足够的画面细节,碎片必须切得很小;碎片越小,数量就越多;碎片越多,处理它们之间关系的计算量就越大——这是个近乎无解的死循环。

更关键的问题在于,这套方法把所有的计算资源同等地投入到了两件性质截然不同的任务上:一是弄清楚场景的三维结构(也就是"这里是墙、那里是桌子、东西离我多远"这类几何信息),二是决定每个位置的外观细节(也就是"这块墙是什么颜色、这张桌子的纹理是什么样的"这类外观信息)。把资源平等分配给这两件事,听起来很公平,但实际上是一种巨大的浪费,因为这两件事的难度根本不在同一个水平线上。

研究团队通过仔细观察发现了两个关键事实。第一个事实是:三维重建要做得很精确,并不是高质量渲染的必要条件。3D高斯泼溅技术的工作原理有点像用无数个彩色气泡填满空间,最终的画面效果来自这些气泡叠加融合的结果,而不是要求每个气泡都精确地贴在真实的物体表面上。就像一幅印象派画作,近看是零散的色块,远看却栩栩如生——只要气泡的位置和颜色大致对了,渲染出来的新视角就足够逼真。这意味着,在三维重建这一步,我们不需要追求极致的精度,"够用就好"。

第二个事实是:外观信息其实比几何信息容易处理得多。一旦我们大致知道了场景的三维结构,要给每个位置涂上正确的颜色,本质上只是一个"对号入座"的工作——把原始照片中对应位置的颜色信息搬过来就行,不需要在不同视角的照片之间做复杂的比对和匹配。这就好比,你已经拼出了一幅拼图的大致轮廓,那么往上面涂颜色就是相对简单的工序了。

正是这两个观察,催生了AsySplat的核心设计理念:既然两件事的难度不同、精度需求不同,为什么要用同样的资源去处理它们?

二、不对称的智慧:把对的钱花在对的地方

AsySplat的解决方案可以用一个厨房的比喻来理解。假设你要准备一顿大餐,厨房里有两位厨师:一位负责处理食材(切菜、备料、控制火候),另一位负责最后的摆盘装饰。处理食材的工作复杂、费时,需要有经验的主厨;而摆盘虽然需要精细,但有了好食材,一个熟练的帮厨就能胜任。AsySplat做的事情,就是把厨房资源合理分配给这两位厨师,而不是让两个同等级别的大厨都去做同样繁重的工作。

具体来说,AsySplat将整个处理流程拆分成两条并行的"流水线"。

第一条叫做"几何分支",专门负责推断三维结构。这条流水线使用较大的图像碎片——碎片大,意味着每张照片被切成的块数少,总碎片数量就少,处理起来计算量大大降低。由于前面提到的第一个观察(几何不需要极致精确),用这种"粗粒度"的碎片来重建三维结构完全够用。但是,由于多视角三维重建本身是件很难的事——需要在不同角度的照片之间找到对应关系,就像把来自不同方向拍的照片中的同一个点对应起来——这个任务本身就需要强大的网络能力。因此,AsySplat把模型中90%的参数都集中到了几何分支,让这条流水线拥有最强的"大脑"来解决这个难题。

第二条叫做"外观分支",专门负责推断颜色和纹理等外观信息。这条流水线使用较小的图像碎片——碎片小,意味着能保留更多细节,而高质量渲染确实需要这些细节。但正因为前面提到的第二个观察(外观信息的推断只需要处理单张照片内部的信息,不需要在不同视角之间做复杂匹配),这条流水线不需要处理所有视角碎片之间的关系,只在每张照片内部处理就够了。这让外观分支的计算量不会随着照片数量增加而爆炸。同时,由于任务本身相对简单,外观分支只需要全部参数的10%,使用的网络也更轻量。

两条流水线并非各自为政,它们之间有三次"双向交流"的机会,研究团队称之为"双边连接模块"。在每个处理阶段结束时,几何分支会把当前推断出的深度信息传给外观分支,告诉它"这里的东西离我们有多远";而外观分支则把细节信息传给几何分支,帮助它更好地理解场景。这种双向信息交流的设计,让两条流水线各取所长、互相补充。

从整体结构来看,几何分支经历三个层次递进的处理阶段,网络的"宽度"(也就是处理信息的通道数量)在三个阶段中分别设置为192、512和896,逐级增加,以便在后期进行更精细的几何推断。外观分支同样经历三个阶段,但通道数始终保持在256,设计更为简洁均匀。最终,两条流水线的输出通过一个简单的融合操作合并,然后预测出每个位置的三维高斯参数,完成整个场景的重建。

三、一个让训练不那么痛苦的小发明

即便有了不对称架构的帮助,几何分支内部依然面临一个棘手的问题:要做好跨视角的三维匹配,就需要大量的"注意力层"(一种能让每个图像碎片"看到"所有其他碎片的网络机制),而注意力层的计算量随着碎片数量呈平方增长——碎片数翻倍,计算量就要变成原来的四倍。

研究团队最初的设计是在几何分支中混合使用两种机制:一种叫做Mamba的高效序列处理工具(计算量随碎片数量线性增长,比注意力层友好得多),以及前面提到的注意力层。但他们发现,过度依赖Mamba会损害三维重建的质量。这并不奇怪——Mamba擅长处理有顺序关系的信息(比如文字序列),但三维匹配需要在空间上任意两点之间直接建立联系,Mamba在这方面的能力不如注意力层直接。

因此,研究团队决定在几何分支中保留更多的注意力层。但这样做的代价是训练时间大幅增加。为了解决这个矛盾,他们设计了一个"稀疏注意力模块"。

这个模块的工作原理有点像一种聪明的"抽样检查"策略。假设你要检查一幅巨大的地图上所有地点之间的关联,如果逐一检查每两个地点的关系,工作量会大到无法完成。稀疏注意力模块的做法是:先把地图划分成一个均匀的网格,然后从每个网格中抽取一个代表点,只检查这些代表点之间的关系。但在此之前,先用卷积操作(一种能汇聚局部信息的工具)让每个代表点充分"了解"它周围邻居的情况,这样每个代表点就不只是代表自己,而是代表了它所在区域的综合信息。

这个设计让需要进行注意力计算的序列长度大幅缩短,训练时间因此显著减少。以最高分辨率的训练阶段为例,这一模块让每次迭代的时间从10.5秒降到了6秒,缩短了将近40%。同时,由于卷积步骤确保了每个代表点携带了足够丰富的上下文信息,这种"精简"并没有明显牺牲模型性能。

四、实验结果:数字背后的故事

研究团队在多个数据集上对AsySplat进行了全面测试,结果从多个维度展示了这套不对称架构的实际效果。

在与传统优化方法(也就是针对每个新场景从头花时间优化的方法)的对比上,AsySplat展现出了惊人的速度优势。传统的3D高斯泼溅方法需要对每个场景优化30000次迭代,大约耗时13分钟,才能得到PSNR(图像质量指标,数值越高越好)约为23.6的结果。AsySplat只需不到1秒,就能得到PSNR为24.0的结果——在速度上快了将近800倍,质量上还略胜一筹。如果再给AsySplat10次快速的后优化(整个过程只需18秒),PSNR可以进一步提升到25.2,超过了另一个精心设计的优化方法Scaffold-GS的24.8。

与它最直接的竞争对手LongLRM相比,AsySplat的表现更加全面而均衡。在训练效率上,AsySplat的参数量从142M降到了98M(减少了约30%),在最高分辨率阶段的每次迭代时间从8.5秒缩短到6秒(减少了约30%),GPU内存占用从52G降到48G。累计整个训练过程,AsySplat大约需要54小时,而LongLRM需要76小时。

在推理(也就是实际使用时)的效率上,AsySplat的计算量从20.2万亿次浮点运算(TFLOPs)降到16.2万亿次,GPU内存从26G降到22G,预测出的高斯数量从800万个减少到400万个。高斯数量减少的意义在于,后续的快速优化阶段变得更快——从LongLRM的50秒缩短到AsySplat的18秒,快了将近两倍。

在零样本泛化能力(也就是在训练时从未见过的场景类型上的表现)方面,AsySplat表现出了明显的优势。在Tanks&Temples数据集上,AsySplat在不做任何优化的情况下就全面优于LongLRM。在MipNeRF-360数据集上,AsySplat的PSNR比LongLRM高出约0.7。在深度混合(Deep Blending)数据集上,AsySplat在各项条件下均优于LongLRM,其中在给定相同时间预算的条件下,AsySplat的PSNR比LongLRM高出将近1.0。最为显著的差异出现在合成场景数据集Replica上:在不做任何优化的情况下,AsySplat的PSNR(27.46)就已经超过LongLRM做了10次优化后的结果(28.37接近,但要注意LongLRM优化了10次而AsySplat是0次);而当两者都做10次优化时,AsySplat(30.83)比LongLRM(28.37)高出了超过2.5个PSNR——这是一个相当显著的差距。

研究团队还额外测试了AsySplat在稀疏视角场景下的表现——也就是只给两张照片来重建场景的极端情况。在RealEstate10K数据集的这项测试中,AsySplat的PSNR(28.27)超过了参数量比它大三倍多的DepthSplat(27.47,354M参数)和GS-LRM(28.10,300M参数),再次印证了不对称架构带来的参数效率提升。

五、拆解设计:每个决策都有它的道理

研究团队并没有满足于展示整体结果,他们还做了大量细致的拆解实验,逐一验证每个设计决策的必要性。这些实验在256×256的低分辨率下进行,以节省时间,但已经足以说明问题。

关于最终如何把几何分支和外观分支的信息合并来预测三维高斯参数,团队验证了"两者都需要"的结论。如果只用几何分支的粗粒度信息来预测,PSNR会下降约0.7;如果只用外观分支的细粒度信息,由于缺乏来自几何分支的深度信息指导,效果同样不理想。只有把两者融合,才能达到最好的效果。

关于双边连接模块中的双向信息交流,实验表明两个方向的交叉注意力都不可或缺。单独去掉任何一个方向(无论是几何到外观的方向,还是外观到几何的方向),都会导致性能下降。

关于不对称设计本身的合理性,研究团队设计了一个三方对比实验。第一种是单分支设计,使用细粒度碎片处理所有信息(包括几何和外观),计算量最大(6104 GFLOPs);第二种是双分支设计,但两个分支都使用相同的细粒度碎片(pc=pf=8),计算量依然较大(5892 GFLOPs);第三种是AsySplat的不对称双分支设计,几何分支用粗粒度碎片(pc=16),外观分支用细粒度碎片(pf=8),计算量大幅降低(2033 GFLOPs)。从渲染质量来看,三种设计的PSNR相同(19.24、19.24、19.24),但从几何精度来看,双分支设计确实比不对称设计更精确(AbsRel分别为0.44和0.55)——这直接验证了研究的第一个核心观察:更高的几何精度并不带来更好的渲染质量。不对称设计用大约三分之一的计算量实现了相同的渲染质量,印证了整个方法的核心逻辑。

关于几何分支中Mamba和注意力层的比例,团队通过系统实验发现存在一个"甜蜜点"。当每个阶段8层网络中有6层是注意力层、2层是Mamba时(2m6a),模型在渲染质量和几何精度上均表现最佳;随着Mamba层比例增加,性能单调下降;纯Mamba的配置(8m0a)表现最差。这些实验同时报告了深度估计精度,数据显示Mamba比例越高,深度估计越不准确,这说明Mamba在多视角匹配任务上确实存在天然的局限性。

关于参数在几何分支和外观分支之间的分配比例,团队测试了从90%/10%到50%/50%的多种方案。结果表明,90%的参数给几何分支、10%给外观分支时性能最好;随着外观分支比例增加(即几何分支比例降低),模型性能特别是在零样本场景上的泛化能力明显下降。这背后的逻辑是:几何重建是一件本质上困难的任务,即便不需要极致精度,网络也需要足够的容量来隐式地完成跨视角匹配——这一点容不得吝啬。

关于稀疏注意力模块中的卷积步骤,实验证明这一步骤至关重要。去掉卷积块后,模型性能下降超过1.0 PSNR,说明在进行稀疏注意力计算之前,必须先让每个代表点充分汇聚周围的局部信息,否则"抽样检查"的代表性就会严重不足。

为了进一步证明"紧凑的AsySplat"之所以有效,不是因为参数少的模型本来就够用,团队还与几个参数量相近的LongLRM变体进行了对比。无论是把LongLRM削减到18层(103M参数),还是减小特征维度(99M参数),还是引入与AsySplat相同的层次化参数设计(102M参数),这些变体的性能都明显低于AsySplat(98M参数)。这说明,紧凑模型取得好性能并非偶然,而是不对称架构带来的参数效率提升在发挥作用。

归根结底,AsySplat证明的是一件听起来简单但在实践中需要大量工程智慧才能落地的事情:当你真正理解不同任务的难度和需求,把资源精准地投放到最需要的地方,你就能用更少的资源做到同样甚至更好的事情。这个道理说起来人人都懂,但在复杂的神经网络设计中真正实现它,需要的不只是直觉,更需要大量严谨的实验验证和设计迭代。

研究团队也坦诚地指出了这项工作目前的局限性。AsySplat在感知质量指标LPIPS上仍然落后于传统优化方法——这是大多数前馈式通用三维重建模型的通病,因为它们无法像传统方法那样根据渲染误差动态增加高斯数量来修补细节薄弱的区域。研究团队认为,将AsySplat节省下来的参数预算用于引入这种动态致密化机制,是一个值得探索的未来方向。

从更大的视角来看,AsySplat所代表的"按任务难度和需求分配计算资源"的设计哲学,或许会为整个计算机视觉领域的模型设计提供一种新的思路——与其追求更大、更深、更均匀的网络,不如先想清楚每个子任务真正需要什么,然后有的放矢地设计。

Q&A

Q1:AsySplat比传统3D高斯泼溅方法快多少?

A:AsySplat处理一个场景只需不到1秒,而传统3D高斯泼溅方法需要大约13分钟,速度差距将近800倍。更重要的是,AsySplat不做任何优化时的画质(PSNR 24.0)已经略好于传统方法优化30000次后的结果(PSNR 23.6)。

Q2:AsySplat的两条处理流水线分别负责什么,为什么不能合成一条?

A:几何分支负责推断场景的三维结构(物体的位置和深度),使用粗粒度图像碎片和大量网络参数;外观分支负责推断颜色纹理等细节,使用细粒度碎片但参数量只有前者的约十分之一。之所以要分开,是因为这两项任务的难度和精度需求差异悬殊——合在一条流水线里处理,要么浪费了大量计算资源,要么无法兼顾两者的不同需求。

Q3:AsySplat为什么在从未见过的场景上表现反而更好?

A:这很可能与不对称架构带来的参数效率提升有关。由于每组参数都专注于特定任务(几何推断或外观建模),而不是笼统地处理所有信息,模型学到的特征更具泛化性,而不是过拟合到训练数据的特定外观上。在合成场景Replica数据集上,经过10次优化后AsySplat的PSNR比LongLRM高出超过2.5,进一步说明其内部表征质量更高。