作者丨吴思梦
编辑丨岑 峰
如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大? 这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。 过去几年,3D Gaussian Splatting(3DGS)让“从一堆照片里恢复出可以实时渲染的 3D 场景”这件事,第一次变得既真实又快速。今天的 AI 已经非常擅长从多视角图像中重建 3D 世界,而且这个世界的视觉质量已经接近照片级。
你拿着手机围着一个房间拍了一圈照片。AI并没有把这些照片简单拼起来,而是从它们之间的关系推断出一个三维表示。然后你把“虚拟摄像机”放到原来没有拍过的位置,AI依然可以给你渲染出一张看起来像真实照片的画面。这就叫Novel View Synthesis,新视角合
01
高斯的代价:越真实,就越重
要理解 PointSplat 在做什么,必须先理解 3DGS 在做什么。 3DGS 的基本想法是把一个 3D 场景拆成大量“高斯椭球”。每一个高斯都记录着自己的位置、尺度、旋转方向、透明度,以及外观信息。成千上万、几十万个这样的高斯一起渲染,就构成了一个看起来真实的 3D 世界。 这种表示有三个非常突出的优点:真实、可渲染、速度快。 它让神经辐射场(NeRF)时代的“高质量但慢”第一次变成了“高质量且实时”。 但它也带来了一个非常直接的代价。 高斯数量越多,显存占用越大,计算开销越高,存储体积越大,传输带宽要求也越严格。当场景从一栋楼变成一个城市,从一个静物变成一个需要实时跟着动的人,这些成本都会被迅速放大。
02
从视角中心,到“围绕一个人只建一次”
过去一段时间里,一种非常流行的做法是 view-centric(以视角为中心) 的 3DGS 预测。它的逻辑非常直觉化:给定一张图像,模型预测出一批高斯;换一个视角,再预测一批;多视角的高斯融合在一起,组成并呈现最终的 3D 表示。 这种做法的好处是模块清晰、训练稳定。 但它有一个非常隐蔽的问题。 同一个人,明明只有一个身体。 然而在 view-centric 框架下,每一个视角都被要求“独立地”预测一遍这个人的高斯。这意味着:肩膀被编码了一次,侧面被编码了一次,背后又被编码了一次;同一个主体的几何和外观信息,被不同视角的模型反复存了好几份。 论文里把这个现象叫做 inter-view redundancy,跨视角冗余。这是 PointSplat 真正想解决的事情。它不是来单纯地“压一压”高斯的,而是来改变“高斯到底是怎么被预测出来的”这件事。 它的核心思路可以浓缩成一句话:从 view-centric 转向 human-centric(以人为中心)。
03
一项工作与一个方向:3DGS 的范式迁移
如果只看 PointSplat 这一篇论文,很容易把它当成一次“压缩算法的工程改进”。但如果把它放进 3DGS 整个技术演进的时间线里,会看到一个更有意思的趋势。 过去几年里,3DGS 的主流使用方式是 per-scene optimization(单场景优化)。也就是说,对每一个场景、每一段视频、每一组照片,都要单独跑一遍优化流程,最终才能得到一份高斯表示。这种方式质量很好,但代价是“一个场景训练一次”,难以泛化,也很难实时。 而 PointSplat 走的是另一条路:feed-forward reconstruction framework(前馈式重建框架)。给定稀疏的多视角图像,模型不需要为这一组输入专门训练,而是直接预测出一份紧凑的 Gaussian representation。 这件事的意义不在于“它比单场景优化快了”,而在于它代表了一个方向的转向。 过去的范式是“拍照片 → 单场景优化 → 得到 3DGS”。 现在的范式开始变成“多视角输入 → 模型直接预测 → 得到 3D 表示”。 用更直白的话讲:3DGS 正在从一种“场景级别的优化结果”,变成一种“模型级别的生成能力”。 这是一个非常关键的差别。 前者意味着每个场景都是孤岛,要重建就要重新算一遍。 后者意味着模型学会了“如何从图像里读出 3D”,这件事可以泛化到新的主体、新的视角、新的设备。 而 PointSplat 在这个转向里,又叠加了一层自己的判断:即便模型已经可以前馈式预测 3D 了,预测的方式也要从 view-centric 改成 human-centric,否则跨视角冗余会白白吃掉大量的表示空间。 把这两件事合在一起看,能看到一条线: per-scene optimization → feed-forward prediction → human-centric / subject-centric prediction 3D 表示正在从“每个场景算一遍”慢慢走向“模型学会如何表示 3D”,而 PointSplat 是这条线上一个非常具体的、针对人体的回答。 这也是为什么这次工作的署名名单值得单独看一眼。 浙大这边,是长期深耕 3D 视觉、计算机图形学和几何方向的团队,包括 Hujun Bao、Sida Peng、Xiaowei Zhou 等研究者,他们在 3DGS、可微渲染、点云学习这一串技术栈上有非常深的积累。 字节跳动这边,Jing Zhang、Xianchao Shen 等作者参与了这篇工作,但公开材料里并没有给出明确的业务部署信息。我们可以合理地把字节的参与理解为它在 3D / 数字人 / 直播相关技术上的投入。港中大(深圳)的 Lingteng Qiu 同样参与其中,这也是港中深近年来在图形学、3D 视觉方向上比较活跃的一个侧写。 需要诚实地说一句:三方在这篇工作里共同瞄准的,是论文里写得很清楚的那个应用场景——immersive live streaming(沉浸式直播)。至于未来这套方法能不能走进数字人、VR/AR、远程交互、空间智能,仍然是值得讨论的产业想象。
04
更轻的表示:3D 的未竟之问
如果把视角再拉长远一点,会发现 PointSplat 其实不只是关于“压缩了多少高斯”。它指向的是一个更普遍的问题:当 3D 表示开始成为 AI 基础设施的一部分,它应该用什么样的方式存在? 3DGS 的第一个阶段解决的是“如何让机器快速生成一个看起来真实的 3D 世界”。这件事已经基本完成了。从几张照片到一个可以实时渲染的场景,从静物到城市,从离线到准实时。 但 AI 不只是需要“看见”世界。它还需要保存、传输、理解和生成世界。 这就意味着,3D 表示开始同时面对一组相互拉扯的指标: • 质量:看起来够不够真。 • 数量:能不能表示足够复杂的世界。 • 计算:能不能在普通设备上跑得动。 • 传输:能不能在合理带宽下流动。 • 泛化:能不能不靠每个场景单独训练。 过去这些指标往往是分别被讨论的。PointSplat 把其中的“紧凑性”和“泛化能力”绑在了一起——通过 human-centric 的预测方式,让同一组多视角输入生成的 Gaussian 表示既更小,又更集中于真正的主体。 而这,只是其中一个非常具体的问题。围绕“3D 表示到底应该长什么样”,正在形成一个越来越密集的研究和工程地带。 沿着这条线再往前想一步,会发现一个更大的画面正在浮现:图像曾经是互联网的“通用语言”,视频是它的延伸。今天,文本和图像是大型模型训练和推理的主要载体。而 3D 表示,无论是高斯、点云、网格、还是它们的混合体,都很可能正在成为下一阶段 AI 基础设施的一部分。 到那个时候,问题就不只是“AI 能不能生成 3D”。 或许是“AI 究竟应该用什么方式,保存一个世界”。 PointSplat 没有回答这个问题,它只是把这个问题从一个抽象的担忧,变成了一个具体可做的工程方向。它也没有改变 3D 产业,更没有让“3D 危机”被某个中国团队一夜解决。
05
最后
3DGS 把世界变成了可以实时渲染的高斯。PointSplat 进一步追问:如果这个世界真的要被大规模传输、理解和交互,它能不能更轻一点?这个问题其实提前触碰到了 3D 表示的下一阶段:当画质和渲染速度逐渐逼近瓶颈,竞争的焦点也会从“把世界还原得多逼真”,转向“如何用更少、更合理的表示,把一个 3D 世界组织起来”。而在这场竞赛刚刚开始的时候,中国的研究力量已经站在了一个非常具体的位置上,用一篇 ECCV 2026 的正会论文,认真回答一个工程上绕不开的小问题。 小问题,往往才是大趋势真正开始的地方。论文链接:https://arxiv.org/abs/2606.32036?utm_source
为了方便大家抱团交流、互通会议消息,雷峰网专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」?
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
热门跟贴