一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向
7339点击    2026-07-27 15:49

过去三年,3D Gaussian Splatting(3DGS)几乎成为实时3D场景重建与新视角合成的“默认答案”。


与需要沿每条光线反复查询神经网络的NeRF不同,3DGS使用数百万个可学习的各向异性高斯显式表示场景,再通过可微、分块式光栅化器直接生成图像,在视觉质量与实时渲染之间取得了难得的平衡。


但当场景从一个房间扩展到城市级环境,从静态走向4D动态,从桌面GPU走向移动端、机器人和边缘设备,问题也随之改变:系统不仅要“重建得出来”,还要在有限显存、带宽和功耗下稳定跑起来。


此时,真正限制3DGS上限的,往往不只是高斯表示本身,而是投影、分块、排序、混合和梯度回传组成的整条光栅化流水线


为回答“3DGS的瓶颈究竟在哪里”,香港科技大学(广州)3DAgentWorld Lab、南洋理工大学、阿里巴巴集团和其域创新科技近日联合发布《3D Gaussian Splatting Rasterization: A Survey》。这项工作不再按照传统综述数字人、自动驾驶、SLAM等下游任务简单分析,而是把可微光栅化器视为3DGS的核心计算引擎,从底层数据流重新组织快速增长的技术版图。


一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向


从“做什么”转向“在哪里改”:重新理解3DGS技术演进


已有3DGS综述大多围绕应用场景展开。这种方式便于寻找特定任务的解决方案,却容易掩盖不同工作背后的共同问题:稀疏视角重建、抗锯齿、几何致密化、大场景渲染,看似属于不同赛道,实际都可能反复遭遇相同的投影误差、可见性排序、透明度混合和梯度传播难题。


联合团队因此提出一种“光栅化中心”的分类方式:不再只问一种方法用于什么任务,而是追问它究竟改动了流水线的哪个位置、缓解了哪类系统瓶颈,以及这些改动如何影响画质、速度、显存和存储成本。


一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

论文提出的三层光栅化分类体系:表示与优化、光栅化流水线、场景驱动扩展。


整套技术版图被划分为三个层次。


  • 第一层是表示与优化,包括高斯内核参数化、几何投影、致密化、正则化、剪枝和压缩;
  • 第二层直接进入光栅化流水线,关注α混合、特征场与着色、硬件线程调度、可见性和排序;
  • 第三层讨论这些底层改动如何支持4D动态场景、超大规模环境、稀疏视角、无位姿输入以及3DGS-SLAM。


拆开实时渲染“黑盒”:五个环节,五类瓶颈


标准3DGS之所以能够实现高速渲染,核心在于一条经过高度优化的、基于瓦片的可微光栅化流水线。3D高斯基元首先被投影到二维屏幕,系统随后判断它会覆盖哪些图像分块,并将其复制到对应的“瓦片”中。


接下来,每个瓦片内的高斯按照深度排序,再由CUDA线程块逐像素完成α混合。进入训练阶段后,图像损失还需要沿着同一路径反向传播,最终更新高斯的位置、尺度、旋转、不透明度和球谐函数颜色等参数。


一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

基于瓦片的光栅化流程:投影后复制到多个瓦片,按深度排序,再进行逐像素α混合。


这条流水线中的每个环节,都对应着不同的工程难题。投影阶段需要处理混叠和几何畸变。瓦片分配会带来大量的高斯复制和内存访问。逐瓦片深度排序不仅增加计算延迟,还可能导致画面出现“跳变”。α混合除了处理透明度,还需要兼容语义特征和物理材质。反向传播则依赖大规模梯度累积,并频繁使用原子操作。


论文的一项关键价值,就是把散落在不同研究中的优化方法重新放回一个统一的框架中,系统比较它们的作用位置、性能收益和额外代价。


四个典型问题,光栅化优化如何落地


投影与深度:二维化并不等于问题消失


把3D高斯压缩为二维可以增强表面表达,但也会引入深度近似误差。相机旋转可能改变光线方向上的相对次序,造成可见性翻转和跳变。


一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

3D高斯压缩为2D splat后的深度简化问题。


瓦片分配:减少无效复制和访存


宽松的包围区域会把大量并未与椭圆相交的高斯复制到瓦片中。Speedy-Splat通过SnugBox和AccuTile逐步收紧候选区域,从源头减少无效分配与访存。


一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

不同瓦片分配策略。SnugBox与AccuTile逐步缩小候选区域,减少无效高斯复制。


α混合:从采样值走向体渲染一致性


传统3DGS用高斯在采样点的函数值近似不透明度。Vol3DGS改为沿相机光线积分一维高斯密度,使α与真实覆盖更一致,对半透明结构和几何表面也更稳定。


一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

Vol3DGS沿相机光线积分高斯密度,计算体渲染一致的α。


致密化:高斯并非越多越好


标准致密化容易让像素数量快速膨胀。Taming 3DGS结合多视角显著性、梯度和高斯属性进行评分,并用可预测增长曲线控制新增数量,让模型预算在训练前就可设定。


一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

Taming 3DGS通过显著性评分和可预测增长曲线控制致密化预算


统一评测:不寻找“万能冠军”,找到效率-质量的共赢


为了让不同设计能够在同一坐标系中比较,联合团队在Mip-NeRF 360、Tanks&Temples和Deep Blending三个常用基准数据集的11个场景上,使用统一的3DGS光栅化实现评估27种代表性方法,并报告了对应的指标及其可视化图表。


实验结果证明团队不应该也无法在所有指标上找到通吃的“冠军”,但可以找到某些子方向的专精:


  • 更灵活的几何内核通常能改善重建质量;
  • 多种效率方法可以在质量损失较小的情况下显著减少高斯数量;
  • 部分代表性方法把训练时间压缩到5分钟以内;
  • 一些压缩方法在特定数据集上实现超过8倍的高斯数量压缩,同时仍获得正向重建指标变化。


从整体趋势看,多数效率导向方法可将像素数量减少约40%—70%,但极端压缩仍会带来明显质量风险。存储方面,标准3DGS的典型全分辨率场景可能需要约700—800MB。论文汇总的代表性方法中,HAC++、PyramidGS等可在特定设置下实现约15—20倍压缩,层级或锚点式方案通常可达到约3—5倍缩减。


从论文走向可复现的系统比较


为了降低复现和横向比较的门槛,团队同步开源Github仓库,面向代表性3DGS方法提供统一的训练、渲染和评测流程,支持数据集路径配置、GPU与系统资源检查、场景级/数据集级/方法级指标汇总,并持续接入新的方法和开源实现。


对于研究者,这套框架可以帮助快速定位一种工作究竟改动了表示、投影、排序、混合还是存储;对于工程团队,它提供了一份更接近部署现实的检查清单:不能只看重建指标,还要同时考察训练时长、峰值显存、高斯数量、排序延迟、模型体积和设备能耗。


3DGS的未来:从“看起来更好”走向“系统跑得更好”


基于整套光栅化分析,论文提出五个值得关注的方向:


  • 摆脱逐瓦片强制排序的免排序(Sort-free)或顺序鲁棒可见性建模;
  • 原生支持4D与在线更新的动态可见性光栅化;
  • 面向移动GPU、张量核心和专用加速器的硬件感知像素;
  • 一次前向同时输出颜色、深度、法线、语义和材质的统一多输出高斯点;
  • 覆盖显存、排序延迟、压缩率和能耗的系统级标准评测。


如果说3DGS技术的第一阶段证明了显式点基表示能够以实时速度逼近高质量神经渲染,那么下一阶段的竞争极有可能下沉到系统层:谁能用更少排序、更少访存、更稳定的梯度,在同一硬件预算下承载更大的场景、更多的属性和更复杂的动态。


这无疑也是这篇综述试图回答的核心问题:3DGS的未来,不只取决于“高斯还能如何设计”,更取决于光栅化器如何与算法、内存和硬件协同演进。


作者团队


这篇论文由一支横跨3D视觉研究、基础模型研发和产业化部署的联合团队完成。作者单位包括香港科技大学(广州)、南洋理工大学、阿里巴巴集团和其域创新科技。


详细介绍:


  • 赵北震(Beizhen Zhao),香港科技大学(广州)信息枢纽人工智能学域博士生,研究方向为3D/4D重建与大规模场景重建算法压缩与加速。
  • 付博亦(Boyi Fu),香港科技大学(广州)信息枢纽人工智能学域硕士生,研究方向为空间智能与3D/4D场景重建。
  • 于思成(Sicheng Yu),香港科技大学(广州)信息枢纽人工智能学域博士生,研究方向为3D/4D场景重建和生成。
  • 王子建(Zijian Wang),香港科技大学(广州)信息枢纽人工智能学域硕士生,研究方向为3D重建/生成与世界模型。
  • 赵开勇(Kaiyong Zhao),深圳市其域创新科技有限公司创始人兼CEO,国家级创业人才、珠江人才、深圳市海外高层次人才,中国计算机学会分布式专委会常委。曾任大疆部门负责人、达闼首席架构师兼研发副总裁、浪潮GPU负责人。拥有16年AI与三维空间计算经验,出版50余篇论文及专著,持有国际国内专利100余项,是国内最早的CUDA推广者之一。长期推动3D重建、空间智能与3DGS产业化。
  • 吴鹏程(Pengcheng Wu),新加坡南洋理工大学计算与数据科学学院高级研究科学家,曾在新加坡管理大学和南洋理工大学从事研究工作,并参与创办计算机视觉公司DeepIR。其研究覆盖机器学习、计算机视觉、数据挖掘、强化学习和联邦学习。
  • 王浩(Hao Wang),香港科技大学(广州)人工智能学域助理教授,曾在TikTok和地平线机器人从事研究,主要研究兴趣在于开发基于人工智能的多模态数据感知和生成算法,包括文本、图像、视频和3D形状,涉及研究可控视觉内容生成、视觉到文本生成和跨模式检索的各种深度学习方法,并且与工业界保持广泛合作。近年已在TPAMI、IJCV、CVPR、NeurIPS、ICLR等发表50余篇论文并担任多个顶会/顶刊的审稿人。
  • 许主洪(Steven Hoi),阿里巴巴集团副总裁、新加坡管理大学计算机科学教授,IEEE Fellow、ACM杰出会员。曾任全球最大企业软件厂商Salesforce集团副总裁、Salesforce Research Asia创始董事总经理,并创立多模态基础模型公司HyperGAI。曾在南洋理工大学和新加坡管理大学任教,其研究覆盖机器学习、多模态人工智能、计算机视觉、自然语言处理和大规模数据分析,近年已发表论文300余篇。曾任Neurocomputing主编、IEEE TPAMI副主编、亚洲机器学习会议ACML程序委员会共同主席、ACM SIGMM社交媒体研讨会大会共同主席,并长期担任NeurIPS、ICLR、ICML等国际顶级会议的领域主席,以及CVPR、ICCV、AAAI、KDD、SIGIR、WWW等会议的程序委员会成员。
  • 熊辉(Hui Xiong),香港科技大学(广州)讲座教授、人工智能学域主任、AI+实验室主任;曾担任美国罗格斯-新泽西州立大学杰出教授、罗格斯信息安全中心主任、美国罗格斯大学-科大讯飞大数据联合实验室主任。获AAAS(美国科学促进会) Fellow、IEEE Fellow、ACM杰出科学家等荣誉。曾任百度研究院副院长并主管5个实验室。主要研究方向为人工智能、信息安全、数据科学。主持国家自然科学基金2项,主持美国NSF基金10项。与众多世界知名科技企业开展产学研合作,包括Citrix Systems Inc.、IBM、SAP、华为、科大讯飞、腾讯、阿里、OPPO、百度等。近年已在国际顶级期刊会议发表论文300余篇,任国际计算机学会数据挖掘及知识发现专委会秘书长(ACM SIGKDD Secretary),Encyclopedia of GIS共同主编、ACM TKDD和ACM TMIS编委。曾任ACM SIGKDD和IEEE ICDM 2015等多个国际顶级会议(共同)程序委员会主席或大会主席。


论文:https://www.preprints.org/manuscript/202607.0776
代码:https://github.com/3DAgentWorld/Advanced3DGS
Github仓库:https://github.com/3DAgentWorld/Advanced3DGS


文章来自于"量子位",作者 "3DGS团队"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
OWL

【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。

项目地址:GitHub:https://github.com/camel-ai/owl

2
数字人

【开源免费】Fay开源数字人框架是一个AI数字人项目,该项目可以帮你实现“线上线下的数字人销售员”,

“一个人机交互的数字人助理”或者是一个一个可以自主决策、主动联系管理员的智能体数字人。

项目地址:https://github.com/xszyou/Fay

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales