打开网易新闻 查看精彩图片

本文刊发于《现代电影技术》2026年第6期

专家点评

金小刚

二级教授

中浙江大学-腾讯公司智能图形与互动娱乐创新技术联合实验室主任

浙江省虚拟现实产业联盟理事长

立体电影可通过双目视差为观众营造深度沉浸式体验,但传统立体视频制作依赖人工深度图,周期长、成本高,且大视角易产生遮挡缺失。深度学习方法虽提升了自动化水平,却囿于二维回归范式,缺乏三维显式建模。3D高斯泼溅(3DGS)将场景表达为可微分三维高斯椭球,实现了单图重建物理真实体积空间,为立体电影制作开辟了一条新路径。苹果公司推出的SHARP模型以前馈神经网络从单帧回归百万高斯基元,绕开多视角采集局限,使“单目输入、立体输出”自动化流程具备工程可行性。未来,3D高斯泼溅需向时序连贯、实时交互创作及生理舒适度评价发展演进,方能从离线渲染模式走向电影工业化常态,推动后期制作从手工修补迈入智能驱动时代。《基于三维高斯泼溅的立体电影制作技术质量评价框架与SHARP模型适应性研究》一文以电影摄影美学为参照,构建AI立体视频制作评价框架,融合感知指标与光学、影调、空间三大变量,系统评估SHARP模型在广角、浅景深、运动模糊、低照度、黑白影像、雾气、复杂遮挡等场景表现。实验表明,SHARP模型在黑白影像和低照度下表现优异,因深度预测依赖亮度梯度;但在散焦语义、细碎遮挡结构及时序一致性上存在局限。本文有助于读者理解算法适应边界,为立体视频制作工程选型及优化提供了美学参照。

项目信息

中国传媒大学校级科研项目“草图驱动生成的高可控人工智能动画技术流程开发”(CUCAI2516)。

作者简介

打开网易新闻 查看精彩图片

王 雷

博士,教授,中国传媒大学动画与数字艺术学院院长、博士生导师,中国传媒大学英特尔人工智能生成艺术创作实践中心主任,主要研究方向:动画艺术创作、三维动画技术、AI生成艺术。

郑媛月

中国传媒大学动画与数字艺术学院2024级博士研究生,主要研究方向:动画与数字艺术创作。

打开网易新闻 查看精彩图片

摘要

本文围绕3D高斯泼溅(3DGS)在立体电影制作中的应用,研究基于SHARP模型的单目到立体视频生成方法及工程化实现,提出面向人工智能(AI)立体电影制作技术质量的评价框架,将传统图像质量指标与感知指标相结合,并引入电影摄影逻辑框架中光学、影调与空间美学变量,构建结构化测试体系。研究实验覆盖典型摄影条件,深入分析了SHARP模型在不同场景下的适应性边界,为相关研究提供了实验参照。研究表明,前馈式3DGS技术在立体电影制作中具备应用潜力,本研究提出的技术质量评价框架为三维高斯泼溅技术在立体视频制作中的应用提供了可解释的评价路径。

关键词

3D高斯泼溅(3DGS);SHARP模型;立体电影制作;电影质量评价;体积视频

1

引言

2025年,电影《超人》(Superman)在制作中引入3D高斯泼溅(3D Gaussian Splatting, 3DGS)技术,用于构建主角超人的氪星父母全息影像等关键视觉段落。该方法通过多视角数据或体积捕获,将动态场景表示为可微分的三维高斯集合[1],从而支持在后期任意视角下进行高质量新视图渲染,实现具有真实摄影质感的体积视频(Volumetric Video)生成,营造“剧场环绕式观看般”的体验[2]。3DGS技术的行业应用,加速了电影制作从模型驱动向数据驱动的范式跃迁,使电影制作开始摆脱对复杂几何重建的依赖、提升复杂场景的重建效率,也在真实感表达上达到了新的高度,转向一种更符合光学传播规律的空间表示方式。

在单目到立体视频生成领域,传统流程高度依赖人工逐帧遮罩(Rotoscoping)与深度图绘制(Depth Painting),制片周期长、成本高昂,且在时序一致性方面容易引入误差。基于深度图像的渲染(Depth Image⁃Based Rendering,DIBR)技术提高了立体视频生成的自动化程度[3],但在大视角偏移条件下仍存在遮挡缺失与几何拉伸问题。近年来,基于单目图像的深度学习(Deep Learning, DL)方法在深度估计任务中取得进展[4],但其本质仍属于从二维到深度的回归范式,缺乏对完整三维结构的显式建模能力,因此难以支持自由视点生成与复杂摄影机运动,在真实感与几何一致性方面存在局限。

在此背景下,3DGS为立体电影制作和立体视频生成提供了新的技术路径,通过显式三维高斯场实现直接多视角渲染[5]。为解决传统优化驱动型3DGS依赖多视角输入进行优化训练、难以直接应用于单目视频立体生成任务的问题,苹果公司提出并开源单帧图像高精度实时视差(Single⁃image High⁃accuracy Real⁃time Parallax, SHARP)模型,通过前馈神经网络从单张图像直接回归约120万组高斯基元(Gaussian Primitive)的空间位置、协方差矩阵、颜色球谐系数与不透明度参数,从而绕过多视角采集与优化过程,实现单图像到三维高斯场的快速重建,并支持自由视角渲染[6]。其可自由放置虚拟摄影机并生成具备高度空间一致性的新视角图像,为解决传统3DGS“每场景一组参数”的可泛化性局限提供了新的路径启示。

本研究通过分析SHARP模型的底层逻辑及其开源实现框架ml⁃sharp在立体视频生成中的具体管线,完成左右分屏(Side⁃by⁃Side, SBS)立体视频生成实验,并提出一套面向人工智能(AI)立体视频生成的电影级评价框架,重点探讨立体视频生成方法在不同镜头类型与空间结构条件下的表现差异,并进一步讨论3DGS技术在电影后期自动化流程中的应用潜力。

2

SHARP模型及ml⁃sharp实现方法

2.1 从隐式神经场到显式高斯基元的范式演进

3DGS的出现标志着神经渲染从以神经辐射场(NeRF)为代表的以体积积分为核心的隐式表达[7],转向了以可微分、光栅化为核心的显式表达。这种范式转向在电影后期制作中具有重要意义,在保证照片级质量的同时,赋予了创作者对场景资产的直接物理操纵权。

在数学定义上,3DGS将空间建模为数百万个各向异性的三维高斯分布。每个高斯基元携带位置均值、由缩放和旋转矩阵定义的协方差矩阵、用于捕获视角相关色彩的三阶球面谐波(Spherical Harmonics)系数(SH)和不透明度参数[8]。这种显式表征使3DGS能够捕捉金属反射、次表面散射等细微光场变化,为单目视图合成提供物理基础。

传统3DGS属于“优化驱动型”算法,通过梯度下降不断优化高斯参数集合,以降低渲染误差,其依赖多视角约束,且需对每个场景独立迭代,难以满足立体电影制作管线的大规模自动化需求。为此,前馈式(Feed⁃forward)3DGS方法逐渐成为重要发展趋势,其通过引入神经网络预测器,将传统逐场景优化过程转化为一次前向推理。近年来,如pixelSplat[9]、GS⁃LRM[10]、LGM[11]与FreeSplat[12]等基于多视图输入的前馈式重建方法,利用多视图几何约束,通过学习跨视角特征关联,实现对3D高斯参数的直接预测。当前绝大多数需要完成3D制作的电影素材采用单目方式拍摄,而上述方法需依赖多视角输入条件,因此难以得到实际应用。此外,如Splatter a Video[13]、SplineGS[14]、Video⁃3DGS[15]及NutWorld[16]等研究从时间维度出发,通过显式建模高斯基元的时间演化或引入跨帧约束,在缓解帧间闪烁方面取得显著效果,但通常伴随着更高的计算复杂度与系统开销。

电影制作迫切需要真正实现“单张图像输入、3D高斯场处理、任意新视角输出”这一完整闭环的实用方法。SHARP模型通过引入基于深度学习(DL)的前馈回归范式,不再依赖针对特定素材的反复迭代,不再将重建视为针对特定场景的优化问题,而是通过在大规模3D资产库上进行预训练,学习到从2D像素特征到3D空间结构的统计先验,将其转化为一个基于大规模数据驱动的回归问题,其逐帧独立推理路径无需维护跨帧状态或执行序列级优化,具备天然的并行性,适用于分布式渲染与离线批处理流程。该方法使每帧的空间结构完全由当前图像驱动,有利于避免误差在时间维度上的累积扩散,且与传统电影后期的镜头级处理工作流高度兼容,便于与现有工业管线集成。

2.2 SHARP模型:单目视图合成的前馈回归范式

SHARP模型突破了3DGS的冷启动问题,其核心逻辑在于利用预训练的深度神经网络,学习二维像素特征与三维空间拓扑间的非线性映射关系(图1)。

打开网易新闻 查看精彩图片

图1 SHARP模型工作流程示意图

模型采用了基于Transformer的视觉编码器(如ViT⁃L/B)[17]提取全局语义与几何先验,对输入图像(I)编码得到多尺度特征(F),为后续三维参数预测提供上下文信息,如式(1)所示。

F=Encoder(I) (1)

SHARP的核心架构是一个高效的解码器,其在特征图的每个像素位置处回归出一组高斯参数,直接预测位置回归、形状与各向异性、辐射度量等高斯基元的所有属性。其中,位置回归(Δμ)指在预测深度图D的基础上,通过反投影算子确定高斯球的空间中心;形状与各向异性(S, R)为回归各向异性的缩放和旋转参数,使高斯球能够自适应地贴合场景中诸如细小的发丝或锐利的建筑轮廓等物体的边缘;辐射度量(SH, α)预测球面谐波系数(SH)和不透明度(α)。这种全参数回归的能力,使SHARP模型的生成结果具备更稳定的空间层次与更高的真实感。

SHARP模型在训练过程中引入了强有力的几何约束,实现了对场景结构的形状感知,对前馈式3DGS研究领域做出了方法论层面的关键贡献。凭借大规模预训练与自监督微调机制,模型能够利用自身生成的伪标签对真实图像进行适配,在对模型陌生的电影素材上表现出良好的泛化能力,即使面对极端摄影条件也能利用学习到的几何先验推断出合理的空间结构。此外,SHARP模型通过在具有真实尺度标注的数据集(如MVImgNet[18,19])上进行训练,使生成的三维高斯场具备近似度量化的空间尺度。这一特性使虚拟摄影机的位移可直接对应真实空间距离,为立体视频生成中的视差幅值控制提供了无需额外标定的物理锚点;相比基于深度图的传统方法,有助于实现更稳定且符合人类生理视差的立体效果,降低大银幕放映时的视觉不适风险。

需要指出的是,尽管SHARP模型在技术架构上展现了极高的工业化潜力,但其发布的研究权重遵循非商业使用许可。因此,本文侧重于在实验环境下验证该技术路径在立体电影制作任务中的适用性及性能边界,为未来可商业化系统的开发提供实验参照和评价基准。

2.3 ml⁃sharp框架:用于电影级立体视频制作的新范式

苹果公司在发布SHARP模型的同时,开源了其完整应用框架ml⁃sharp。该框架遵循“逐帧三维化、虚拟双目拍摄、SBS合成”的核心思路,全程无需任何帧间运动分析或时序一致性后处理,由5个关键处理阶段构成[20]:

(1)视频输入标准化与解析。输入视频首先被解析为逐帧RGB图像序列,统一至模型推理所需的数值范围。必要时执行重采样与色彩空间转换,以保证不同来源素材在推理阶段的一致性。对于低分辨率或历史影像,此阶段额外执行分辨率的双三次插值(Bicubic Interpolation)对齐。

(2)单帧三维高斯场推理。图像序列的每一帧独立输入SHARP模型的前馈式网络。特征编码器提取输入图像的多层级密集视觉特征;深度解码器从多层次特征中解算出致密深度图;高斯解码器以深度图和特征图的级联表示为条件,同时回归约120万个高斯基元的完整参数。该过程不引入跨帧特征传递或隐状态建模,使每一帧的空间结构完全由当前图像决定。

(3)双虚拟摄影机配置。在生成的三维高斯空间中,立体视频生成的核心操作转化为虚拟摄影机的视点布置。ml⁃sharp框架构建了一个精密受控的虚拟立体摄影机系统,通过定义左、右眼摄影机的相对变换矩阵TL→R,可精准模拟电影摄影中的平行轴和汇聚轴立体成像模式。其中平行轴模式保持左右摄影机光轴平行,主要用于后期调整无穷远处的汇聚感,汇聚轴模式通过调节旋转矩阵Rconv,使左右视角在特定深度交汇,实现对“入屏/出屏”效果的把控,实现美学层面的深度构图与构图需求。由于高斯场为显式场景表示,新视角的渲染仅需执行一次前向泼溅与α混合操作,无需额外优化过程。

(4)实时泼溅渲染。渲染过程采用了基于块的各向异性高斯光栅化,对左右视点分别调用1次泼溅渲染器,输出具有水平视差的双目图像。为消除新视角合成中的走样问题,ml⁃sharp框架引入了椭圆加权平均滤波技术[21]。其投影过程通过协方差矩阵的仿射变换实现,如式(2)所示。

Σ'=JWΣWTJT (2)

式(2)中,Σ表示三维空间中高斯基元的三维协方差矩阵,决定了高斯基元在三维空间中的各向异性特征,是重建场景体积感的核心;W表示观察变换矩阵,负责将高斯基元从世界坐标系转换到虚拟摄影机的观察坐标系中,实现了三维空间位置与摄影机视点的对齐;J表示透视投影变换的雅可比矩阵(Jacobian Matrix),描述了空间点到像素坐标映射的局部线性化过程,是确保投影形状准确的关键;(·)T表示矩阵的转置运算(Transpose Operator),用于确保协方差矩阵在变换过程中的对称性与正定性;Σ'则表示投影后的二维屏幕协方差矩阵(Projected 2D Covariance Matrix),直接决定了高斯基元在图像平面上所覆盖的椭圆形足迹(Footprint)的大小、形状与朝向。这种渲染方式能较好地还原电影中的光学模糊与运动模糊,这是传统DIBR算法通过2D像素拉伸所无法达到的物理真实性。

(5)立体合成。ml⁃sharp框架处理完所有帧后,通过异步并行计算,将渲染出的双路视点序列进行时序对齐,并合并为SBS格式。为保证色彩一致性,系统在输出前会对左右视角进行感知色彩平衡校正,确保即便在高动态范围(HDR)场景下,左右眼画面在亮度和对比度上也能保持绝对同步,减少视觉冲突与疲劳。

SHARP模型通过将DL的前馈推理能力与3DGS的显式渲染效率相结合,开创了立体视频制作的新范式。其不仅将原本需要数小时的重建工作缩短至秒级,更通过形状感知机制突破了单目素材空间信息缺失的顽疾。其实现框架ml⁃sharp是构建立体影视内容制作的关键理论支撑,将电影2D画面从像素阵列转化为可编辑的辐射场资产,为自动化、高保真的立体电影制作提供了新的技术路径。

3

面向立体视频生成的电影级评价框架构建与实验设计

3.1 电影摄影美学框架下的实验变量构建

本文提出一种面向AI立体视频生成的电影级评价框架,其核心在于将计算机视觉(CV)的图像重建问题,映射为电影摄影语境下的视觉还原问题。为系统评估基于SHARP模型的立体视频生成性能,本实验引入电影摄影领域成熟的影像控制框架,将来源于ASC StEM2[22]、Netflix Open Content[23]、Pexels[24]等开源素材库及《铁路的白蔷薇》(La Roue)等黑白电影的共32个视频物料,按照光学与镜头变量、影像表现变量和空间构成变量三个维度进行结构化划分[25],将CV的图像恢复问题转化为电影制作的摄影美学还原问题,强调视觉生成机制与模型响应间的内在关联,从而构建具有解释力的变量体系。所有原始素材均以单目RGB视频形式输入,不提供任何深度真值或多视角参考帧。

光学透视是立体感生成的几何基础。光学与镜头变量维度主要反映镜头成像机制对空间几何恢复的影响。因此,在此维度下,实验素材涵盖三种子类型。

(1)焦距特征素材包含广角镜头与长焦镜头。广角镜头具有显著的透视扩张效应,强调线性透视形变;而长焦镜头则呈现空间压缩特性,深度层级趋于扁平。两者在深度线索的可信度上形成对照,可测试模型在不同透视压力下对高斯基元分布的预测精度,比较空间透视变形与空间压缩感对高斯场回归的影响。

(2)景深分布素材,涵盖纵深镜头和浅景深特写。浅景深场景中,部分信息以散焦形式存在,其本质为低频模糊信号。此测试特别观测SHARP模型对失焦模糊的处理能力,检验模型是否会将光学模糊误识别为几何不确定性。

(3)运动动态素材选取包含剧烈镜头运动或主体高速运动的视频。动态模糊会降低图像局部对比度与结构清晰度,是点云拟合的巨大挑战。因此,此测试关注ml⁃sharp框架在帧独立推理条件下对动态边缘的深度归因稳定性。

影像的影调结构直接影响深度估计的准确性,影像表现变量维度关注的是图像信号本身的统计特性。因此本维度下的实验素材分为以下三种子类型。

(1)对比度与影调素材包含极端局部高亮与极端低照度场景。极端局部高亮场景亮度横跨0.001~1000 nit量级,以评估高亮区域是否因辐射度量异常而导致空间位置错乱。极端低照度场景信噪比极低,对亮度驱动的深度推断构成挑战,考察模型在暗部噪声干扰下的鲁棒性。

(2)色彩感知素材包括缺失色彩通道、仅依赖亮度信息进行结构表达的黑白影像,使SHARP模型仅依靠亮度信息进行深度解算、推断场景结构,对依赖颜色分割线索的预训练模型发起挑战。

(3)画面退化素材观测胶片颗粒或数字噪点对高斯高频细节重建的干扰。霉斑与垂直划痕等高频噪声可能被误解释为几何细节,从而影响高斯分布的空间拟合。此测试判断这些2D伪影是否被SHARP模型的深度解码器错误地提升为三维几何起伏。

空间构成变量主要考察场景几何复杂度,下设两个子类型。

(1)遮挡关系素材,重点选取具有复杂前后景遮挡关系的场景、由于遮挡关系而形成了非自然负形空间的视频,以及包含高频率重复纹理遮挡的视频,这些场景中的复杂前后景关系是传统立体视频生成中“空洞填充”与“深度污染”的高发区域,此实验用于检验SHARP模型对空间分层的表达能力。

(2)大气透视素材,关注视频中半透明雾气结构与消散感,测试模型在非刚体表面的深度还原能力,观察模型对对比度衰减与深度关系的耦合推断。

在素材选择上,本实验以摄影变量为驱动[26],避免单一因素主导实验结果,使后续分析能关联到电影制作实践中的具体应用场景。

3.2 实验流程与评价指标

本实验基于苹果公司提出的ml⁃sharp单目图像到立体视频生成方法,首先对三大维度内8个子类型的电影原始素材进行处理。在此基础上,依照ml⁃sharp立体视频生成管线的五个阶段,基于开源实现进行系统搭建,集成了ml⁃sharp的两种社区优化方案:其一为iVideoGameBoss实现的可视化交互界面版本[27],其二为Gabriel Roldán开发的SBS格式输出工具[28]。

实验采用客观评价方式,提出一套面向AI立体视频生成的电影级评价框架,将传统图像质量指标与视觉感知指标相结合,并引入电影摄影影像控制框架中的光学、影调与空间三大构成变量,构建了基于电影摄影逻辑的结构化测试集,为AI立体视频生成方法提供具有解释力的评测基准,实现了从“图像重建评价”向“摄影美学还原评价”的转化。

图像质量指标衡量立体视频生成结果的视差图像在像素和结构层面与原始帧的一致性[29],包括峰值信噪比(Peak Signal⁃to⁃Noise Ratio, PSNR)、结构相似性(SSIM)。其中,PSNR在像素强度层面测量左右视图合成后与原始单目基准帧的偏差,数值越高表示像素级重构越精确[30];SSIM从亮度、对比度和结构三方面出发,衡量生成结果对原始画面结构信息的保留程度。

视觉感知指标基于DL特征提取,模拟人类视觉系统(HVS)对边缘伪影、空间畸变的感知灵敏度,包括学习感知图像块相似度(Learning Perceptual Image Patch Similarity, LPIPS)、深度图像结构与纹理相似性(Deep Image Structure and Texture Similarity, DISTS)。其中LPIPS利用预先训练的深度网络特征空间中的距离来模拟人类对图像失真的感知敏感性[31],数值越低表示生成画面越接近人类认知的真实;DISTS则结合了传统结构相似度与深度特征纹理表征[32],对纹理变形和结构畸变更为敏感。这两项指标作为补充,能捕捉到PSNR和SSIM难以反映的几何扭曲。

3.3 实验结果数据及分析

图2及图3汇总了各摄影逻辑下具有显著影像特征的实验素材在LPIPS、DISTS、PSNR和SSIM四项指标的得分,并表明该模型在处理不同光学条件、影像属性与空间结构的影像时,表现出较稳定的结构一致性与感知稳定性。我们将根据实际数据、依据电影影像控制框架,考察各变量维度下的指标表现,对实验结果进行系统性的横向对比与纵深分析。

打开网易新闻 查看精彩图片

图2 显著实验素材立体视频生成的质量评估数据

打开网易新闻 查看精彩图片

图3 评价指标的数据密度分布图

3.3.1 光学与镜头变量的影响

在焦距特征方面,长焦镜头的立体视频生成结果以更高的SSIM与更低的LPIPS值优于广角镜头。广角画面中的桶形畸变与边缘拉伸增加了几何复杂度[33],使模型在边缘区域产生非线性高斯分布,进而在新视角渲染时引入几何偏移与视差不稳定〔图4(a)〕。相比之下,长焦镜头因透视压缩与景深趋于扁平,降低了深度估计歧义,使立体效果更平稳可控〔图4(b)〕。为防止画面中线性透视线索运动过于剧烈时,单目前馈网络对消失点约束的拟合偏离物理合理的相机模型,在实际应用中,需根据焦距动态调整虚拟摄影机的瞳距(IPD)参数,以维持合理的视差分布。

打开网易新闻 查看精彩图片

图4 广角镜头与长焦镜头的高斯空间

在浅景深特写镜头中,模型在焦外成像(Bokeh)区域的深度归属出现错误,立体视角下前景和背景发生粘连。浅景深场景中的散焦区域本质上缺乏清晰的结构信息,其频谱以低频为主,这与3DGS依赖局部高频信息进行空间拟合的机制存在冲突。模型在遭遇摄影虚化时,对散焦摄影的语义理解不足,倾向于将模糊梯度当作需拟合的纹理,而非深度过渡区域。这也表明在实际立体视频生成时,浅景深镜头可能需额外人工干预或针对性优化。

运动动态类型的素材中包含横向拍摄与高速物体等样本,均表现出高于静态场景的感知损失。运动模糊削弱了图像梯度信息,使模型难以准确定位空间结构,将方向性模糊错误收敛为静态清晰边缘,削弱运动特征。同时,由于相邻帧模糊程度变化,模型预测的高斯参数缺乏一致性,导致轻微的帧间闪烁现象,在快速运动场景中尤为明显。

3.3.2 影像表现变量的影响

在实验素材中,低照度组的立体视频生成表现出较佳的效果,整体呈现出较高的PSNR与SSIM、较低的DISTS指标。低照度图像整体信号幅度较低,像素误差的绝对值相对较小,同时大面积暗区降低了纹理复杂度,使高斯基元更易拟合为平滑的密度分布。在SBS图像生成过程中,这种特性还带来一定的视觉降噪与深度平滑效果,从而降低了重建难度。实验结果表明,SHARP在低信噪比环境下具有良好的鲁棒性,未出现将暗部噪声误判为几何结构的现象,对高ISO或弱光摄影条件具有一定适应能力。

极端局部高亮的实验素材组整体SSIM表现尚佳,未对原始素材产生结构性破坏,但PSNR和LPIPS却呈现出较为明显的内部分化。对于焊接火花等高速运动、面积较小且存在过曝的高亮区域,局部梯度剧烈变化可能导致高斯基元分布不稳定,从而引发空间位置偏移(图5);而烛焰、荧光灯等面积较大、变化相对平缓的高亮区域则为模型提供了更稳定的拟合目标,这表明极端点状过曝仍是前馈式3DGS方法的薄弱环节。

打开网易新闻 查看精彩图片

图5 焊接火花画面的SBS图像有轻微位置偏移

黑白影像素材的立体视频生成以突出表现成为实验中亮眼的一部分。在缺少色彩通道的情况下,此类素材的DISTS和LPIPS指标均达到了极低数值,而PSNR和SSIM则取得了全部实验的较高数值,4项指标均表现突出,优于大多数彩色素材(图6)。这一结果表明SHARP框架的深度预测并非过度依赖颜色分割信息,底层逻辑更倾向于捕捉物体的特征边缘与亮度梯度。模型能在亮度梯度变化处自适应聚集高斯基元,从而有效恢复空间层次。此外,双三次插值等针对低分辨率历史影像的预处理,在一定程度上平滑了噪声,降低了划痕与颗粒被误识别为几何结构的风险。这提示了在立体电影制作的实际应用中,该技术足以完成早期经典黑白电影修复或低饱和度风格化影像3D制作。在历史影像的修复与立体视频生成中,SHARP模型可能成为一个极具潜力的工具。

打开网易新闻 查看精彩图片

图6 黑白影像素材的SBS图像

3.3.3 空间构成变量的影响

在实验中,半透明雾气类素材的指标表现优异,PSNR和SSIM指标都取得了优质数值。烟雾的密度场是连续渐变体[34],本质上更接近高斯表示的优势场景,大量半透明椭球体的叠加本身就是对连续密度场的自然逼近。而与之形成鲜明对比的是,在几何空间构成方面,当画面中角色做出如手臂弯曲产生空隙的复杂动作时,SHARP模型的“形状感知先验”将其误判为一个整体,因而产生立体视图中局部区域的深度跳变、漂浮感,以及边缘频繁且明显的闪动。实验结果表明,SHARP模型在处理高复杂度几何结构时仍存在改进空间。

在含有大量非规则遮挡的视频素材中,模型也未能较好恢复空间层级,存在较为严重的深度混叠问题。对于风向标、发丝、树枝树叶等极细碎、镂空的非规则遮挡画面内容,SHARP模型的前馈预测容易产生“深度污染”。3D高斯基元在拟合这种边界时缺少足够的表达能力,在深度轴上发生了混叠,相邻帧间的基元分配稍有扰动就会触发可见的二值闪变,这也是未来模型领域适配需要重点突破的方向。

4

结论

基于SHARP模型的3DGS方法通过前馈推断实现了从单目影像到三维体积场的高效映射,在立体电影制作中的静态资产构建展现出显著的工程化应用潜力。本文提出了一套面向AI立体视频制作的电影级技术质量评价框架。该框架突破了单纯的计算机视觉评估范畴及传统图像重建评价中对单一信号指标的依赖,将信号保真度指标与感知指标进行联合建模,并引入电影摄影中的三类核心美学维度变量,实现了从像素一致性评价向摄影语义与美学一致性评价的方法论拓展。为AI视觉生成算法在电影垂直领域的性能验证提供了具备行业美学参照的评估标准,以及具有解释力与可迁移性的分析工具。

基于构建的评价体系,本文设计了覆盖多维度典型摄影条件的结构化实验,并对SHARP模型在立体视频生成任务中的表现进行了系统性分析。3DGS显式表达使模型能够超越简单的像素位移,在三维空间中重构出符合电影摄影透视规律的几何特征。尽管SHARP模型在单帧重建上表现卓越,但本文也从电影摄影机制出发,对实验结果进行了跨变量维度的归纳分析,指出当前立体视频生成方法在处理光学模糊语义、非规则遮挡结构与时序一致性方面仍存在结构性挑战。

总体而言,SHARP模型通过将前馈式深度学习推断与3D高斯显式表示相结合,为立体电影制作提供了一种具备自动化潜力的新技术路径。本文所提出的评价框架与实验范式,则进一步为该类方法在实际生产环境中的落地应用建立了系统性的分析评估基础。未来,随着时序建模机制与复杂场景表达能力的持续提升,基于高斯泼溅的立体电影制作生成方法有望推动电影后期制作流程向更高程度的自动化与物理一致性演进,结合人类立体视觉的生理反馈与电影美学先验,促使创作者回归到影像叙事与视觉创意本身,推动立体电影制作从手工修补时代进入智能模型驱动时代。

参考文献

(向下滑动阅读)

[1] Radiance Fields. Gaussian Splatting in Superman[EB/OL].(2025⁃09⁃04)[2026⁃03⁃23]. https://radiancefields.com/gaussian-splatting-in-superman/.

[2] SEYMOUR M. Superman with Framestore: Krypto, Crystals & Cutting⁃edge Gaussian Splats[EB/OL].(2025⁃08⁃18)[2026⁃03⁃23]. https://www.fxguide.com/fxpodcasts/fxpodcast-superman-with-framestore-krypto-crystals-cutting-edge-gaussi an-splats/.

[3] FEHN C. Depth⁃Image⁃Based Rendering (DIBR), Compression, and Transmission for a New Approach on 3D⁃TV[C]// Proceedings of SPIE Stereoscopic Displays and Virtual Reality Systems XI. San Jose: SPIE, 2004: 93⁃104. DOI:10.1117/12.524762.

[4] 胡堃, 解沛. 基于深度学习的电影智能化摄制技术研究[J]. 现代电影技术, 2024(3): 12⁃19. DOI:10.3969/j.issn.1673-3215.2024.03.002.

[5] 李梦甜,姚声祥,杨洋.面向电影制作的三维数字人生成和编辑系统设计与应用研究[J].现代电影技术,2025(8):12⁃20.

[6] MESCHEDER L, DONG W, LI S, et al. Sharp Monocular View Synthesis in Less Than a Second[EB/OL]. (2026⁃02⁃27)[2026⁃03⁃23].https://arxiv.org/abs/2512.10685. DOI:10.48550/arXiv.2512.10685.

[7] MILDENHALL B, SRINIVASAN P P, TANCIK M, et al. NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis[EB/OL].(2020⁃08⁃03)[2026⁃05⁃12]https://arxiv.org/pdf/2003.08934v2.

[8] KERBL B, KOPANAS G, LEIMKÜHLER T, et al. 3D Gaussian Splatting for Real⁃Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 42(4):1⁃14. DOI:10.48550/arXiv.2308.04079.

[9] CHARATAN D, LI S L, TAGLIASACCHI A, et al. pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Seattle: IEEE, 2024: 1⁃11. DOI:10.48550/arXiv.2312.12337 .

[10] ZHANG K, BI S, TAN H, et al. GS⁃LRM: Large Reconstruction Model for 3D Gaussian Splatting[C]//Computer Vision – ECCV 2024: 18th European Conference, Italy, 2024, Proceedings, Part XXII. Cham: Springer, 2024: 1⁃19. DOI:10.1007/978-3-031-72670-5_1.

[11] TANG J, CHEN Z, CHEN X, et al. LGM: Large Multi⁃view Gaussian Model for High⁃Resolution 3D Content Creation[C]//Computer Vision – ECCV 2024: 18th European Conference, Milan, Proceedings, Part IV. Cham: Springer, 2024: 1⁃18. DOI:10.1007/978-3-031-73235-5.

[12] WANG Y S, HUANG T X, CHEN H L, et al. FreeSplat: Generalizable 3D Gaussian Splatting Towards Free⁃View Synthesis of Indoor Scenes[C]//Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS 2024). Vancouver: NeurIPS, 2024: 1⁃8. DOI:10.52202/079017-3409.

[13] SUN Y T, HUANG Y H, MA L, et al. Splatter a Video: Video Gaussian Representation for Versatile Processing[EB/OL]. (2024⁃06⁃26)[2026⁃03⁃23].https://arxiv.org/abs/2406.13870. DOI:10.48550/arXiv.2406.13870.

[14] PARK J, BUI M Q V, BELLO J L G, et al. SplineGS: Robust Motion⁃Adaptive Spline for Real⁃Time Dynamic 3D Gaussians from Monocular Video[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Nashville: IEEE, 2025: 1⁃10. DOI:10.48550/arXiv.2412.09982.

[15] SHIN I, YU Q H, SHEN X H, et al. Enhancing Temporal Consistency in Video Editing by Reconstructing Videos with 3D Gaussian Splatting[EB/OL].(2025⁃04⁃04)[2026⁃03⁃23].https://arxiv.org/abs/2406.02541. DOI:10.48550/arXiv.2406.02541.

[16] SHEN Q H, YI X Y, LIN M B, et al. Seeing World Dynamics in a Nutshell[EB/OL], (2025⁃03⁃17)[2026⁃03⁃23].https://arxiv.org/abs/2502.03465. DOI:10.48550/arXiv.2502.03465.

[17] DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale[C]//Proceedings of the 9th International Conference on Learning Representations (ICLR 2021). Vienna: ICLR, 2021. DOI:10.48550/arXiv.2010.11929.

[18] YU X G, XU M T, ZHANG Y D, et al. MVImgNet: A Large⁃scale Dataset of Multi⁃view Images[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Vancouver: IEEE, 2023: 1⁃10. DOI:10.48550/arXiv.2303.06042.

[19] HAN X G, WU Y S, SHI L Y, et al. MVImgNet2.0: A Larger⁃scale Dataset of Multi⁃view Images[J]. ACM Transactions on Graphics, 2024, 43(6): Article 1. DOI:10.1145/3687973.

[20] Apple Inc. ml⁃sharp: Sharp Monocular View Synthesis in Less Than a Second[EB/OL].(2025⁃12⁃19)[2026⁃03⁃23]. https://github.com/apple/ml-sharp.

[21] ZWICKER M, PFISTER H, VAN BAAR J, et al. EWA volume splatting[C]//Proceedings of the conference on Visualization '01 (VIS '01). Los Alamitos: IEEE Computer Society, 2001: 29⁃36. DOI:10.1109/VISUAL.2001.964490.

[22] American Society of Cinematographers. ASC StEM2 (Standard Evaluation Material II) — The Mission[EB/OL].(2022⁃08⁃08)[2026⁃03⁃23].https://theasc.com/society/stem2.

[23] Netflix Inc. Netflix Open Content[EB/OL].(2022⁃04⁃26)[2026⁃03⁃23].https://opencontent.netflix.com/.

[24] Pexels. Free Stock Photos & Videos[EB/OL].(2025⁃05⁃01)[2026⁃03⁃23].https://www.pexels.com.

[25] BORDWELL D, THOMPSON K. Film Art: An Introduction[M]. New York: McGraw⁃Hill, 2010.

[26] 布莱恩·布朗. 电影摄影:理论与实践[M]. 丁亚琼, 译. 北京: 世界图书出版公司, 2015.

[27] iVideoGameBoss. ml⁃sharp: Gaussian Splatting from Apple by iVideoGameBoss. Sharp Monocular View Synthesis in Less Than a Second[EB/OL].(2026⁃01⁃31)[2026⁃03⁃23]. https://github.com/iVideoGameBoss/ml-sharp.

[28] ROLDÁN G. ml⁃sharp: Gaussian Splatting from Apple by iVideoGameBoss (Customized by me). Sharp Monocular View Synthesis in Less Than a Second[EB/OL].(2026⁃01⁃10)[2026⁃03⁃23]. https://github.com/luisgabrielroldan/ml-sharp.

[29] WANG Z, BOVIK A C, SHEIKH H R, et al. Image Quality Assessment: From Error Visibility to Structural Similarity[J]. IEEE Transactions on Image Processing, 2004, 13(4): 600⁃612. DOI:10.1109/TIP.2003.819861.

[30] HUYNH⁃THU Q, GHANBARI M. Scope of validity of PSNR in image/video quality assessment[J]. Electronics Letters, 2008, 44(13): 800⁃801. DOI:10.1049/el:20080522.

[31] ZHANG R, ISOLA P, EFROS A A, et al. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Salt Lake City: IEEE, 2018: 586⁃595. DOI:10.1109/CVPR.2018.00068.

[32] DING K, MA K, WANG S, et al. Image Quality Assessment: Unifying Structure and Texture Similarity[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44(5): 2567⁃2581. DOI:10.1109/TPAMI.2020.3045810.

[33] KINGSLAKE R. Optical System Design[M]. New York: Academic Press, 1983.

[34] NARASIMHAN S G, NAYAR S K. Vision and the Atmosphere[J]. International Journal of Computer Vision, 2002,48(3):233⁃254.DOI:10.1023/A:10163 28200723.

期刊导读 |《现代电影技术》2026年第6期

程絮森等:人工智能驱动下元宇宙技术赋能电影科技创新提质研究

孙立军等:人工智能(AI)影像生成技术与传统影视制作的融合路径及流程标准化研究

打开网易新闻 查看精彩图片