三分钟导读:AsySplat通过解耦几何与外观建模的非对称架构,利用粗粒度token处理几何、细粒度token处理外观,显著降低了长序列3D高斯泼溅中的计算冗余。
英文题目:AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling
论文出处:arXiv 每日论文精选 · arXiv:2607.10995
原始论文:PDF / 论文页面
对应视频标题:AsySplat:解耦几何与外观的高效长序列3D高斯泼溅|推荐指数:★★★★★
这篇论文解决什么问题?
现有的可泛化3D Gaussian Splatting模型在处理高分辨率长序列输入时,存在巨大的计算冗余,导致参数需求高且训练/推理开销大。
核心创新
- 非对称架构:根据几何和外观的学习难度及精度需求,分别分配粗/细粒度token和不同的计算/参数资源。
- 稀疏注意力模块:将token序列重塑为2D地图并分块进行自注意力,大幅减少训练时间同时保持性能。
- 双边连接模块:允许几何分支吸收外观的高频线索,外观分支接收几何深度线索,实现互补。
方法概览
提出AsySplat,包含两个分支:几何分支使用粗粒度token和大部分参数进行跨帧交互以恢复几何;外观分支使用细粒度token且仅进行帧内交互以捕获细节。两分支通过双边连接模块交互,并引入稀疏注意力模块以减少训练时间。
逐图理解论文
AsySplat非对称架构设计

AsySplat提出了一种非对称架构,解耦了几何与外观建模。几何分支使用粗粒度Token和大部分参数,专注于跨帧交互以恢复整体结构;外观分支则使用细粒度Token,仅进行帧内交互以捕获高频细节。这种设计基于观察:高精度几何并非高质量渲染的必要条件,而一旦几何确定,外观建模相对容易。
稀疏注意力模块机制

为了进一步降低计算开销,AsySplat引入了稀疏注意力模块。该模块将Token序列重塑为2D地图,通过两个卷积块保持上下文完整性,随后按均匀网格分块并重组为缩短的序列进行自注意力计算。这一过程大幅减少了训练时间,同时避免了全注意力机制带来的巨大计算负担。
主要数据集性能对比

在DL3DV-140数据集上,AsySplat在10次迭代后达到PSNR 25.20,优于LongLRM的24.99。在MipNeRF-360零样本基准上,AsySplat的PSNR为23.34,同样超越LongLRM的22.49。定性比较显示,AsySplat在复杂场景下能保持更清晰的纹理和更准确的几何结构,证明了其泛化能力。
效率与资源消耗分析

AsySplat的参数量为98M,比LongLRM的142M减少了30%。训练时间从76小时缩短至54小时,推理TFLOPs从20.2降至16.2。尽管推理时间略长于LongLRM的3次迭代版本,但考虑到其更高的迭代次数和更优的质量,AsySplat在整体效率上具有显著优势,特别是在无需后优化的场景下。
稀疏视图设置下的表现

在RealEstate10K数据集的稀疏视图设置下,仅使用2个输入视图,AsySplat依然表现出色,达到PSNR 28.27和SSIM 0.892。这表明非对称架构在信息受限的情况下,仍能通过高效的几何-外观解耦,利用有限的视角信息重建出高质量的新视角图像,展现了其在极端稀疏视图下的鲁棒性。
实验与关键结果
- 在DL3DV-140、Tanks&Temples、MipNeRF-360、Deep Blending和Replica数据集上与优化方法和可泛化模型对比。
- 在RealEstate10K上进行稀疏视图(2视图)设置下的实验。
- 模型消融实验,包括分支设计、注意力配置和预测源分析。
- 在DL3DV-140上,AsySplat (10 iter) PSNR 25.20, SSIM 0.817, LPIPS 0.241; 推理时间18s (vs LongLRM 15s for 3 iter, PSNR 24.99)(第 7 页)
- 在MipNeRF-360上,AsySplat (0 iter) PSNR 23.34, SSIM 0.653, LPIPS 0.352; 优于LongLRM (0 iter) PSNR 22.49(第 7 页)
- 参数98M,比LongLRM (142M) 减少30%; 训练时间54小时 vs 76小时; 推理TFLOPs 16.2 vs 20.2(第 8 页)
- 在RealEstate10K (2 views) 上,PSNR 28.27, SSIM 0.892, LPIPS 0.105(第 8 页)
阅读时需要注意
- 主要关注已知相机位姿的长序列输入,未与无位姿方法直接比较(见附录A)。
- 消融实验在较低分辨率(256×256)下进行,可能无法完全反映高分辨率下的细微差异。
- LPIPS指标略低于部分优化方法,这是可泛化3DGS方法的常见现象,因为缺乏基于误差的细化。
- 稀疏注意力模块中的卷积块对保持上下文完整性至关重要,移除会导致性能显著下降。
关联工作
- LongLRM:主要对比方法,本文指出其存在计算冗余并提出了更高效的非对称架构。(第 3 页)
- 3DGS:基础表示方法,本文旨在加速其可泛化版本。(第 2 页)
- Mamba:用于几何分支的状态空间模型,但本文指出其在全注意力替换下性能下降,需结合稀疏注意力。(第 5 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
AsySplat: 用于长序列场景建模的高效非对称 3D Gaussian Splatting
Yingji Zhong1 Dave Zhenyu Chen2 Fuzhao Ou3 Youyu Chen2 Zhihao Li2 Lanqing Hong2 Dan Xu1 1HKUST 2Huawei Noah’s Ark Lab 3CityU
摘要
最近的可泛化 3D Gaussian Splatting 模型推动了长序列新视角合成(NVS)的发展,但代价是产生了大量的冗余计算。我们发现,基于以下两点观察,这种冗余可以得到缓解:(i) 高质量的 NVS 并不严格要求高精度的几何结构;(ii) 外观学习通常比几何恢复更容易。受这些见解的启发,我们提出了一种非对称架构,将几何和外观建模解耦。几何分支处理粗粒度 token,利用大部分参数进行多视图重建;而外观分支处理细粒度 token,以显著更少的参数捕捉细节。这两个分支通过双边连接进行交互,从而为各自的任务提供相互指导。这种任务感知的非对称性减少了计算冗余,并更审慎地分配计算资源,从而提高了参数效率,使较小的模型也能实现强大的性能。在 32 视图 960P 输入下,我们的模型达到了与基于优化的方法相当的性能,同时实现了近 800 倍的加速,并以显著更少的参数和降低的训练/推理开销,超越了最先进可泛化模型的零样本性能,实现了整体效率的提升。项目页面位于 https://zhongyingji.github.io/asysplat/。[cs.CV]
1 引言
3D Gaussian Splatting (3DGS) [30, 59, 37] 已成为新视角合成(NVS)的一种有效表示方法。最近的研究转向了可泛化的 3DGS 模型 [5, 14, 8, 43, 54, 63, 52],也称为高斯重建模型(Gaussian Reconstruction Models),它们通过网络预测 3D 高斯参数,通过数据驱动的先验绕过逐场景优化。虽然大多数方法专注于稀疏输入,但现实世界的捕获通常由长序列组成,这使得该设置更具实用性。随着高分辨率设备的兴起以及对视觉细节期望的增长,将可泛化的 3DGS 方法扩展到处理高分辨率、长序列输入变得越来越重要 [71]。
大多数当前方法,如 LongLRM [71],堆叠了大量层 [46, 20],直接从分块 token 预测深度和高斯外观属性。这种设计将所有计算集中在帧间 token 交互上。这种昂贵的过程源于为了获得高质量渲染而需要小 patch 尺寸的需求。这引出了一个根本性问题:这种简单的堆叠是否引入了导致参数需求增加的计算冗余?在本工作中,我们探讨了是否可以通过更审慎地分配计算来提高 NVS 中的参数效率,从而使紧凑模型能够实现具有竞争力的性能。
在本工作中,我们强调了两个对计算分配至关重要但在先前的可泛化 3DGS 方法中被忽视的观察:(i) 高精度几何并非高质量渲染的必要条件。虽然几何结构很重要,但高保真 3DGS 渲染主要源于泼溅过程中的高斯 alpha 混合,而非高度精确的几何结构。这与尽管表面重建性能一般但仍能获得高渲染质量的报告一致。
预印本。
第 2 页
观察结果 长序列输入 旧方案(冗余计算) 高斯重建与新视角合成 细粒度 几何
…
… 细粒度 令牌 外观 堆叠网络层 (i) (ii) 估计几何 非对称方案(计算重新分配) 粗粒度令牌 -> 几何分支 非对称性 跨 分支 ↑ 2.46 开销 性能 长LRM 粗粒度 (PSNR) … … … 65k 几何 ↑0.12 ours 142 260k ↓30% 易于建模 1.01 ↑ 0.76 ↑ 98 20 76 0.24 ↑ ↓20% ↓30% 80% 16 90% 54 20% 细粒度 8 ↓50% … 10% 4 外观 5 ↓60%2 参 FLOPs 参 eters 训练 Gaussia 后优化 Mip360 细粒度 令牌 -> 外观 分支令牌 Replica DL3DV TnT DB TFLOPs (M) (h) ns(M) (s/iter) 高斯 外观 属性 图1:我们的 AsySplat 通过将长序列高斯重建模型解耦为非对称的几何和外观分支,减少了计算冗余。这种非对称性体现在令牌粒度、计算分配和参数分布上,其动机来自两个观察结果:(i) 高精度几何并非高质量渲染所必需。(ii) 一旦几何被估计,通过将像素对齐的 RGB 证据分配给高斯,高精度外观属性易于建模。这种设计使得显著更小的模型在减少训练和推理开销的同时实现强大性能。
重建 [21, 25],如图 1 所示。(ii) 高精度外观属性是必要的,而它们通常比几何恢复更容易建模。一旦建立了多视图深度,将 RGB 图像映射到高斯外观属性就相对直接,因为它主要涉及将像素对齐的 RGB 证据分配给高斯。这一特性也在场景生成工作中得到探索 [58]。这些见解促使我们重新考虑那些将相同计算盲目地分配给几何和外观建模的现有设计 [63, 71]。
受这些见解的启发,我们提出了一种非对称高斯泼溅(AsySplat)模型,通过解耦几何和外观的建模为两个分支,并将每个分支与其精度需求和难度对齐,从而重新分配计算。这种解耦设计是非对称的,体现在输入粒度、计算和参数分配上。(i) 几何分支处理使用大补丁尺寸进行分块的粗粒度令牌,这反映了一个观察结果:高精度几何并非新视角合成(NVS)所必需。由于多视图重建本质上更难——需要详尽的帧间对应关系来进行深度估计,我们将大部分参数分配给该分支,以确保足够的几何恢复容量。由于令牌数量较少,计算密集的帧间令牌交互成本大大降低。(ii) 外观分支使用小补丁尺寸进行分块的细粒度令牌来建模高斯外观属性。细粒度令牌对于保留细节至关重要,因此对于高保真 NVS 是必要的。由于外观预测相对容易,我们使用更精简的特征
通道数更少,参数量也远少于几何分支(仅占总量的约 10%)。这两个分支通过双边连接进行通信:外观分支将细粒度细节注入几何分支,而几何分支则提供深度线索以指导高斯属性的预测。这种非对称结构解决了先前工作中存在的一个关键困境,即不可避免地会将细粒度 token 拖入计算昂贵的帧间 token 交互中。相比之下,我们保留细粒度 token 用于细节渲染,同时将其排除在这些重型交互之外。AsySplat 不仅提供了一种通过更审慎地分配计算来消除计算冗余的实用方案,还提高了每参数的效率,使得较小的模型也能实现强大的性能。
我们在几何分支中采用混合结构 [22, 71] 来控制训练开销。然而,过度依赖 Mamba [20] 会导致性能下降 [71],因为状态空间模型对于多视图深度估计所需的显式匹配效果较差。因此,我们将非对称设计所节省的计算资源重新投入到额外的注意力 [46] 层中,以更有效地捕捉上下文线索,这对于紧凑模型至关重要。然而,增加更多的注意力层会增加训练时间。为了减轻这一开销,我们引入了一个稀疏注意力模块,该模块基于 2D 网格结构对每个 token 的上下文进行划分。这一精心设计的模块不仅显著减少了训练时间(例如,在计算最重的阶段减少了 40% 的时间),还保持了具有竞争力的性能。
我们的贡献总结如下:
2
第 3 页
• 我们引入了一种非对称设计,以解决通用 3DGS 在处理高分辨率和长序列输入时的计算冗余问题。这种非对称性使得计算和参数分配更加审慎,从而实现了高参数效率。 • 我们设计了一个稀疏注意力模块,使我们能够保留更多的注意力层以获得更高的性能,同时不产生巨大的训练开销。 • 实验表明,在给定 32 视图 960P 输入的情况下,AsySplat 达到了与基于优化的方法相当的性能,速度提升了 800 倍。它在三个基准测试上的零样本性能超越了先前的通用 3DGS,参数减少了 30%,训练时间减少了 30%,推理 FLOPs 减少了 20%,高斯球数量减少了 50%,并且后优化速度提升了 60%。
2 相关工作
用于新视角合成的 3D 高斯泼溅。近年来,3D 高斯泼溅 (3DGS) [30, 59] 已成为新视角合成 (NVS) 中一种非常有效的场景表示方法。虽然神经辐射场 (NeRFs) 能够生成高质量的渲染图像 [38, 2–4],但 3DGS 不仅在渲染保真度上超越了它们,在优化效率和实时渲染性能上也更胜一筹。与 NeRF 的发展类似 [39, 7, 65, 67, 64, 40, 1],随后的 3DGS 研究已扩展到多个方向,包括减少优化时间 [37, 13]、处理稀疏输入视图 [70, 61, 66, 10]、大规模场景重建 [33, 31, 49]、动态场景建模 [51, 19]、无姿态优化 [18],以及改进几何结构以进行网格恢复 [9, 50, 25]。
通用 3D 高斯泼溅。为了规避传统 3DGS 所需的耗时逐场景优化,最近的研究探索了通用的方法,这些方法以前馈方式直接从多视图图像预测场景表示。与通常输出 3D 体积 [57, 48, 6] 或三平面 [24] 以供光线步进期间进行点查询的通用 NeRF 方法不同,通用 3DGS 通常采用像素对齐的反投影 [5, 42]。该技术利用估计的深度,将预测于 2D 图像平面上的高斯属性映射到 3D 空间中。为了增强多视图深度估计,引入了几种策略,例如利用极线几何 [5]、构建代价体积 [14, 15] 或结合预训练的深度模型 [52]。一些研究 [63] 进一步消除了所有 3D 归纳偏置,允许模型完全从数据中学习几何约束。随着依赖姿态的通用 3DGS 的进展,越来越多的研究探索无姿态的通用 3DGS [56, 53, 28, 26]。
然而,上述所有方法都专注于稀疏视图,通常使用不超过 16 个视图。最近的工作 [71, 29] 将通用 3DGS 扩展到高分辨率、长序列输入,在已知相机姿态下对多达 32 个视图、960P 分辨率的场景进行建模。由于其在实际应用中的重要性,我们采用了这一设置。LongLRM [71] 采用堆叠架构,并指出从高分辨率、长序列输入中分块产生的大量 token 导致训练和推理期间产生巨大的计算开销,这主要是由于密集的 token 交互所致。为了缓解这一问题,LongLRM 集成了状态空间模型 Mamba [20],以更有效地处理长距离依赖。在本工作中,我们通过识别 token 交互中的计算冗余,超越了 LongLRM。我们引入了一种非对称架构,通过计算重新分配来减轻这种冗余,该分配由 NVS 的几何和外观建模的精度要求和难度所指导。这种更审慎的分配提高了参数效率,使我们能够使用较小的模型实现强大的性能。
3 方法论
3.1 动机
给定长序列、高分辨率的输入,大多数通用 3DGS 方法将图像分块为 token,并堆叠许多层以建模 token 交互,从而预测深度和外观属性 [71]。为了满足高保真 NVS 的要求,分块必须很小以保留细节,这带来了沉重的计算负担,因为 token 交互的成本随 token 长度呈二次方 [46] 或线性 [20] 增长。这种高计算需求促使我们探索由简单层堆叠引入的冗余,这不仅增加了计算
3
第 4 页
几何分支 – 基于粗粒度标记的大计算量与参数 × Nb × Na × Nb × Na × Nb × Na
pc H ⋅Wpc … pc … V Head Linear Linear Merge GS Tokens Patchify B-Mamba Sp-Attn BilateralBilateral B-Mamba Sp-Attn Bilateral … B-Mamba Sp-Attn Bilateral & Embedding Coarse-Grained
Gaussian Reconstruction … … (V ⋅Hpc ⋅Wpc ) × dc (V . pcH . Wpc ) × d1 (V . pcH . Wpc ) × d2 (V . pcH . Wpc ) × d3 W ) × ds pc H ⋅Wpc … H pc > pf Stage-1 Stage-2 Stage-3 V × ( … ……… … Cross-Attn V … Reshape V × ( Hpf ⋅Wpf ) × df V × ( Hpf ⋅Wpf ) × df V × ( Hpf ⋅Wpf ) × df V × ( Hpf ⋅Wpf ) × df Reshape Long-Sequence Input … … H pf ⋅Wpf pf ………… Mamba Mamba Mamba Vision Vision Vision ………… Cross-Attn Patchify Self-Attn Tokens Embedding … Fine-Grained V × Nv × Nv × Nv … Appearance Branch – Small Computation & Params with Fine-Grained Tokens Bilateral Connection Module 图2:AsySplat 的框架概览。针对长序列输入的 Gaussian 重建,AsySplat 通过将几何和外观的建模解耦为两个分支来重新分配计算资源,使每个分支与其精度需求和难度相匹配。几何分支通过三个层级阶段处理粗粒度标记,网络容量逐步增加,利用双向 Mamba [69] 和稀疏注意力模块(图3)来建模完整的帧间标记交互。外观分支使用轻量级的 MambaVision [22] 处理细粒度标记,其标记交互仅限于帧内。双边连接模块实现了跨分支交互,两个分支的最终输出合并用于 Gaussian 预测。分支间的非对称性体现在标记粒度、计算量和参数分布上。
开销,还会加剧参数需求。因此,本研究旨在通过策略性的计算重新分配来减少此类冗余,从而提高参数效率,并使紧凑模型能够实现强大的性能。
我们的计算分配受通用 3DGS 中两个观察结果的指导:(i) 高精度几何并非高保真 NVS 所必需。关于表面重建的研究 [21, 25] 表明,尽管几何结构不完美,3DGS 仍能渲染良好,如图1所示,这主要归功于大量 Gaussian 的 alpha 混合。我们的实验进一步支持了这一观点,表明即使几何(图5)由粗粒度标记输出,我们的模型也能达到与最先进方法相当的渲染质量。(ii) 高精度外观属性是必要的,而它们通常比几何更容易建模。直观地说,一旦建立了多视图深度,网络只需从2D像素对齐的线索映射到外观属性 [58],而无需帧间交互。这些见解启发我们通过将几何和外观解耦为两个专用分支来重新分配计算资源,每个分支与其精度需求和难度相匹配。这种设计导致了图2所示的非对称架构,非对称性体现在输入粒度、计算分配和参数分布上。
3.2 非对称 Gaussian Splatting 模型
给定 V 张输入图像 {Ii}Vi=1 (Ii ∈ RH×W ×3) 及其相机内参和外参,我们的目标是预测 N 个 3D Gaussian [30] 来表示整个场景:{(µn, αn, sn, qn, SHn)}Nn=1,分别对应每个 Gaussian 的中心、不透明度、尺度、四元数和球谐函数。AsySplat 的非对称性从标记化阶段开始。我们首先将图像与其相关的 Plücker 射线连接,然后以两种不同的粒度对输入进行标记化。对于几何分支,输入使用较大的块大小 pc 进行标记化,产生粗粒度标记 C0 ∈R(V HW/p2c)×dc,遵循第3.1节中的观察 (i)。相比之下,外观分支使用较小的块大小 pf,其中 pf < pc,以保留高保真渲染所需的细节,产生细粒度标记 F0 ∈RV ×(HW/p2f)×df。这两组标记分别输入到几何分支和外观分支中。随后对这些标记的非对称处理和融合将在下文详细介绍。
几何分支。几何分支旨在实现多视图一致的深度恢复。实现这一目标需要在不同视图之间进行详尽的匹配以建立对应关系。因此,该分支处理长度为 V HW/p2c 的整个粗粒度标记序列。为了平衡准确性和效率,该分支被构建为三个层级阶段,标记维度通过 {ds}3s=1 逐步增加。在每个阶段内,我们采用混合架构 [22, 71]
4
第 5 页
该模块将 Mamba [20] 与注意力 [46] 层相结合,通过高效的 token 交互实现长程上下文的快速获取。给定前一阶段 $s-1$ 的输出 $\mathbf{C}^{s-1}$(其中 $s \in \{1, 2, 3\}$),阶段 $s$ 执行以下操作:
\begin{equation} \label{eq:geom} \begin{split} \mathbf{B}_0^{s} &= \mathbf{C}^{s-1}, \ \mathbf{B}_{l}^{s}=\operatorname{Mamba}_{l}(\mathbf{B}_{l-1}^{s}), l=1,…,N_b,\\ \mathbf{T}_{0}^{s} &= \mathbf{B}_{N_b}^{s}, \mathbf{T}_{l}^{s}=\operatorname{SparseAttn}_{l}(\mathbf{T}_{l-1}^{s}), l=1,…,N_a, \end{split} \end{equation}
其中 $N_b$ 和 $N_a$ 分别表示每个阶段中 Mamba 层和注意力层的数量。$\mathbf{B}_l^s$ 和 $\mathbf{T}_l^s$ 的形状均为 $(V HW/p^2) \times d_s$。我们采用双向 Mamba [69],通过前向和后向扫描为每个 token 提供完整的上下文,并采用稀疏注意力模块(第 3.3 节)以提高计算效率。
总之,几何分支在三个分层阶段中堆叠层以恢复场景几何结构。在每个阶段结束时,我们引入一个双边连接模块,与外观分支交换信息。鉴于多视角几何推理的内在难度,我们将 AsySplat 的大部分参数分配给该分支。需要注意的是,第 3.1 节中的观察 (i) 指出“高精度几何并非必需”,这并不与将更多参数分配给几何分支的设计相矛盾。这是因为,即使对于粗略的深度预测(来自粗粒度 token 的输出),网络仍需隐式地执行具有挑战性的跨视角匹配和多视角立体视觉,这需要大量的网络容量。我们在消融研究中验证了该设计的合理性。
外观分支。遵循第 3.1 节中的观察 (ii),估计外观属性无需帧间交互。因此,我们将 token 交互限制为帧内交互,使得计算过程中的有效序列长度受限于每帧的 token 数量,而不是 $V$ 帧的总数。虽然输入到外观分支的细粒度 token 序列 $\mathbf{F}_0$ 比几何分支的序列长得多,但其计算成本并不随视角数量的增加而显著增长。这使得能够在不产生高昂多视角开销的情况下实现高保真外观建模。与几何路径类似,外观分支也组织为三个阶段。每个阶段堆叠多个 Mamba 层以增强每帧的外观建模。给定前一阶段的输出 $\mathbf{F}^{s-1}$,阶段 $s$ 应用以下操作:
\begin{equation} \label{eq:app} \mathbf{M}_0^{s } = \mathbf{F}^{s-1}, \mathbf{M}_{l}^s=\operatorname{MambaVision}_{l}(\mathbf{M}_{l-1}^s), l=1,…,N_v, \end{equation}
其中 $N_v$ 表示每个阶段的层数。$\mathbf{M}_l^s$ 保持形状 $V \times (HW/p^2) \times d_f$,且公式 (2) 中的所有操作均在帧内进行。与几何分支的分层宽度不同,外观宽度 $d_f$ 在各阶段保持恒定。我们在该分支中采用 MambaVision [22],它用标准卷积替换因果卷积,并添加了一个非选择性扫描分支。这种设计增强了全局建模能力,同时比双向 Mamba 更高效。
在每个阶段结束时,细粒度 token 通过双边连接模块与粗粒度 token 交换信息。与第 3.1 节中的观察 (ii) 一致,即外观属性通常更容易建模,我们为该分支分配了显著更少的参数(例如,约占总参数的 10%),其设计类似于 SlowFast [17] 网络。
双边连接模块。两个分支通过双边连接进行通信。粗粒度 token 吸收来自细粒度 token 的高频线索,而细粒度 token 则接收几何上下文以辅助外观属性预测,例如,高斯球的尺度通常与其深度相关。如图 2 所示,通信过程可以表述为:
\begin{equation} \label{eq:bilat} \begin{aligned} \widetilde{\mathbf{C}}^s &= \operatorname{Reshape}(\mathbf{T}_{N_a}^s), \widetilde{\mathbf{F}}^s=\mathbf{M}_{N_v}^s,\\ \mathbf{C}^s &= \operatorname{Reshape}(\operatorname{CrossAttn}(\widetilde{\mathbf{C}}^s,\widetilde{\mathbf{F}}^s)),\\ \mathbf{F}^s &= \operatorname{SelfAttn}(\operatorname{CrossAttn}(\widetilde{\mathbf{F}}^s,\widetilde{\mathbf{C}}^s)), \end{aligned} \end{equation}
其中 $\mathbf{T}_{N_a}^s$ 和 $\mathbf{M}_{N_v}^s$ 分别是公式 (1) 和公式 (2) 的输出。两个 Reshape 操作在形状 $(V HW/p^2) \times d_s$ 和 $V \times (HW/p^2) \times d_s$ 之间转换张量,反之亦然。公式 (3) 中的所有计算均以帧内方式进行。
合并与高斯预测。为了结合两个分支的互补信息,我们合并两组 token 以预测最终的高斯球。在将它们重塑为 $C_{out}$ 和 $F_{out}$ 的 2D token 图后,我们使用步长卷积将它们融合以得到输出图:
\begin{equation} \mathbf{O}^{\rm out } = \mathbf{C}^{\rm out } \operatorname{Conv}_{3\times\operatorname{stride}=p_c/p_f} \mathbf{F}^{\rm out }, \end{equation}
5
第 6 页
× 2
… … …… … … 3 GELU × Reshape Rearrange Self-Attn Rearrange Conv Rearrange 3 BatchNorm V × pcH × pcW × ds p2g × (pcV ⋅H⋅pg)⋅W 2 × ds V × pc H × pcW × ds Figure 3: 稀疏注意力模块示意图。输入标记序列被重塑为 2D 标记图,并通过两个卷积块进行处理以保留上下文完整性。细化后的标记图被划分为大小为 $p_g \times p_g$ 的均匀网格,随后重新排列成较短长度的序列以进行自注意力计算。为了清晰起见,此图中的 $p_g$ 设置为 2。
其形状为 $V \times (H/p_c) \times (W/p_c) \times d_3$。每个像素通过线性解码器映射到 $p_{2f}$ 个高斯分布。重新排列该输出得到一个形状为 $V \times (H p_f/p_c) \times (W p_f/p_c) \times z$ 的张量,其中 $z$ 表示每个高斯分布的参数数量。该张量可用于对下采样因子为 $p_c/p_f$ 的图像执行像素对齐预测,从而产生总共 $V H W (p_f/p_c)^2$ 个高斯分布。对于 $p_c > p_f$ 的配置,高斯分布的数量大幅减少。
两个分支之间的非对称性体现在三个方面:输入粒度、计算分配和参数量。我们的方法通过在粗粒度标记上执行帧间交互,同时将细粒度标记限制在帧内处理,从而减少计算冗余。这与之前的工作 [71] 形成对比,后者将细粒度标记卷入昂贵的帧间计算中。这种更合理的计算分配促进了专业化,即参数专门用于特定任务,从而提高了参数效率。
3.3 稀疏注意力模块
所提出的非对称结构通过更谨慎地分配资源来减少计算冗余。节省下来的计算资源可以重新投入以增强模型的能力。然而,正如 LongLRM [71] 所指出的,过度依赖 Mamba 会严重降低性能,因为状态空间模型在多视图深度估计所需的密集匹配任务中效果较差。因此,我们在几何分支的每个阶段保留了更多的注意力层。尽管这些额外注意力层带来的计算增加是可以接受的,但它导致训练时间大幅增加。这主要是由于粗粒度标记序列长度的二次复杂度:$O((V H W/p_c^2)^2)$。
受 MaxViT [45] 的启发,该模型引入了网格注意力以减少单帧处理的计算开销,我们将这一思想扩展到多视图输入,开发了一种用于帧间标记交互的稀疏注意力模块。
Table 1: 各阶段的训练开销。* 表示用全注意力替换稀疏注意力。 Image Batch Train Iteration GPU Size Method Size Step #Param Time Memory As depicted in Fig. 3, the input token sequence 256×256 LongLRM 8 60k 142M 2.7s 27G is first reshaped into 2D token maps. We then 512×512 AsySplat (Ours) 2 10k 98M 2.2s 25G apply convolutional blocks to each frame’s to- LongLRM 10k 142M 8.5s 52G 540×960 AsySplat (Ours) 2 10k 98M 6.0s 48G ken map independently to aggregate local in- AsySplat∗ 10k 95M 10.5s 48G formation. This step is crucial for preserving rich contextual details for every token. The refined token maps are partitioned using a uniform grid of size $p_g \times p_g$, which are subsequently rearranged into a structured sequence of shape $p_{2g} \times (V H W/(p_g p_c)^2) \times d_s$, on which self-attention is performed. Finally, the self-attention out- put is rearranged back to the original input token sequence shape. Experiments demonstrate that applying self-attention on this reduced-length sequence significantly shortens training time, while the convolutional refinement is also essential for context integrity and thus critical to performance.
4 实验
4.1 数据集
DL3DV [34] 是一个大规模数据集,拥有超过 1 万个训练场景和 140 个用于基准测试的场景。我们在 DL3DV 训练集上训练 AsySplat,并在其基准测试集上报告大多数结果。为了评估模型的零样本泛化能力,我们在四个数据集上进行测试,其中包括三个
6
第 7 页
表2:与基于优化的3DGS方法(第一块)和前馈式LongLRM的比较。‘#Iter’表示后优化迭代次数。该细化过程从模型预测的高斯分布开始。‘Time’表示总推理运行时间。图像分辨率为540×960。
DL3DV-140 [34] Tanks&Temples [32] MipNeRF-360 [3] Deep Blending [23] Method #Iter Time↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓
3DGS [30] 30k 13min 23.60 0.779 0.213 18.10 0.688 0.269 21.25 0.617 0.255 21.00 0.713 0.396 Scaffold-GS [36] 30k 16min 24.77 0.805 0.205 18.41 0.691 0.290 21.53 0.630 0.254 21.73 0.739 0.361
LongLRM [71] 3 15s 24.99 0.809 0.243 18.69 0.623 0.360 22.49 0.601 0.388 21.38 0.715 0.456 10 50s 25.60 0.826 0.233 18.90 0.642 0.350 23.13 0.632 0.373 21.84 0.725 0.450
- <1s 24.10 0.783 0.254 18.38 0.601 0.363 21.54 0.529 0.417 20.91 0.701 0.464
3 6s 24.67 0.803 0.248 18.76 0.641 0.349 22.81 0.630 0.363 21.96 0.728 0.446 AsySplat (Ours) 10 18s 25.20 0.817 0.241 18.96 0.654 0.342 23.34 0.653 0.352 22.39 0.736 0.440 20 36s 25.55 0.826 0.231 19.08 0.664 0.335 23.71 0.669 0.341 22.77 0.743 0.434 28 50s 25.72 0.830 0.226 19.14 0.669 0.330 23.89 0.678 0.333 22.95 0.746 0.430
- <1s 24.00 0.785 0.255 18.51 0.627 0.351 22.20 0.597 0.376 21.58 0.721 0.450
广泛采用的3DGS基准测试,包括Tanks&Temples [32]、MipNeRF-360 [3]和Deep Blending [23],以及合成Replica数据集 [41]。
4.2 实现细节
本研究专注于针对长序列输入的通用化3D高斯泼溅(3D Gaussian Splatting)。除非另有说明,所有实验均使用32个输入视图,并在540×960分辨率下进行评估。
架构。标记化的块大小,即 $p_c$ 和 $p_f$,分别设置为16和8。初始嵌入维度 $d_c$ 和 $d_f$ 分别设置为192和256。在几何分支中,标记维度在三个阶段中遵循分层设计。我们将 $\{d_s\}_{s=1}^3$ 设置为 $\{192, 512, 896\}$。在每个阶段,$N_b$ 和 $N_a$ 均设置为4。在三个连续阶段中,稀疏注意力层中的扩展比分别设置为1、2和3。在外观分支中,我们将 $N_v$ 设置为2,并保持 $d_f$ 在各阶段固定为256。对于稀疏注意力层,我们将均匀网格大小 $p_g$ 设置为2。
训练。我们采用逐步增加分辨率的训练策略:256×256、512×512和540×960。每个分辨率阶段的批量大小分别设置为256、64和64。训练持续时间分别为60k、10k和10k次迭代。为了提高训练效率,我们采用了FlashAttention-2 [16]、梯度检查点 [12] 以及使用BFloat16的混合精度训练。我们在3DGS渲染过程中利用延迟反向传播 [62] 以减少GPU内存消耗。有关更多训练细节,请参阅补充材料。
4.3 与当前方法的比较
与基于优化的方法的比较。我们在四个数据集上将AsySplat与基于优化的3DGS方法 [30, 36] 进行比较。在DL3DV-140上,AsySplat的推理速度比3DGS [30] 快近800倍(<1s vs. 13min),且PSNR更高(24.0 vs. 23.6)。仅经过10次后优化迭代(耗时18秒),PSNR进一步提升至25.2,超过了Scaffold-GS [36] 的24.8。在其他三个数据集上也观察到了类似的PSNR优势。在这些数据集上,AsySplat在LPIPS指标上略逊一筹,这是由于缺乏基于误差的密度细化,这在通用化3DGS方法中很常见。总体而言,AsySplat以显著更低的运行时间达到了与基于优化的方法相当的性能。
与通用化3DGS方法的比较。下文将我们的AsySplat与最先进的方法LongLRM进行比较。
表3:在合成Replica上的比较。图像分辨率为540×744。未应用剪枝。
| Method | #Iter | #Param | #GS | PSNR↑ | SSIM↑ | LPIPS↓ | | :— | :— | :— | :— | :— | :— | :— | | LongLRM | 0 | 142M | 12M | 25.89 | 0.866 | 0.204 | | AsySplat (Ours) | 0 | 98M | 3M | 27.46 | 0.891 | 0.174 | | LongLRM | 10 | 142M | 12M | 28.37 | 0.921 | 0.145 | | AsySplat (Ours) | 10 | 98M | 3M | 30.83 | 0.897 | 0.179 |
(i) AsySplat取得了与LongLRM相当的性能。如表2所示,在前馈时间少于1秒的情况下,两个模型在DL3DV-140上均取得了相似的性能。图4中类似的渲染质量证实了这一点。当后优化迭代次数固定时,LongLRM产生的结果更好。然而,由于AsySplat预测的高斯数量较少(见表4),在相似的时间预算下,它可以承受更多的迭代次数。在下文中,为了清晰起见,我们使用下标表示后优化迭代次数,括号内表示运行时间。表2显示,在总运行时间相当或更低的情况下,AsySplat仍然具有竞争力。
7
第 8 页
32 个视角的输入图像 LongLRM AsySplat 真实值 (Ground Truth)
28.15 28.27 DL3DV-140 …
27.62 27.72
25.42 26.31
…基准 (Benchmark)
26.00 26.73 (零样本 (Zero-shot)
24.14 27.37 MipNeRF-360
…
27.94 30.52 图 4:与 LongLRM 的定性比较。给定分辨率为 540×960 的 32 个输入视角, 两个模型在 DL3DV-140 基准(第一个场景)上均能达到相当的质量,而 AsyS- plat 在 MipNeRF-360 等零样本基准(其余场景)上表现出更优越的性能。请参阅演示文稿以获取更多可视化结果。
表 4:推理开销。‘+post-optim’ 表 5:在稀疏视角设置下与通用 配置包括 10 次后优化迭代, 3DGS 方法的比较,输入视角为 以模型预测的高斯分布为初始化。 两个视角,基于 RealEstate10K [68]。
图像 GPU 方法 参数量 时间 TFLOPs 高斯数量 (#GS) 方法 参数量 PSNR↑ SSIM↑ LPIPS↓ 尺寸 显存 pixelSplat [5] 125M 25.89 0.858 0.142 LongLRM <1s 20.2 26G 540×960 142M 8M MVSplat [14] 12M 26.39 0.869 0.128 +post-optim 50s – 31G GS-LRM [63] 300M 28.10 0.892 0.114 AsySplat (Ours) <1s 16.2 22G 98M 4M DepthSplat [52] 354M 27.47 0.889 0.114 540×960 +post-optim 18s – 27G AsySplat (Ours) 98M 28.27 0.892 0.105
正向传播:AsySplat10 (18 秒) 优于 LongLRM3 (15 秒),AsySplat20 (36 秒) 与 LongLRM10 (50 秒) 相当, 并且在相同的时间预算下,AsySplat28 (50 秒) 优于 LongLRM10 (50 秒)。
(ii) AsySplat 表现出更优越的零样本能力。如表 2 所示,在 Tanks&Temples 数据集上, 我们的模型在单次前向传播中比 LongLRM 取得了更好的性能,所有指标得分均更高。此外, 在后优化迭代次数相同的情况下,AsySplat 不仅提供了更高的质量,而且所需的总运行时间更短。 在 Deep Blending 数据集上,无论在后优化迭代次数相同还是时间预算相似的情况下, AsySplat 均保持了优越的性能。值得注意的是,AsySplat20 比 LongLRM10 高出近 1.0 的 PSNR。 在 MipNeRF-360 上也观察到了类似的優勢,AsySplat 在单次前向传播中比 LongLRM 高出近 0.7 的 PSNR。 值得注意的是,在合成数据集 Replica 上,我们的方法在有和无后优化的情况下均明显优于 LongLRM。 特别是,在使用 10 次后优化迭代时,它比 LongLRM 高出超过 2.5 的 PSNR。定性比较如图 4 所示。
8
第 9 页
表 6:在 256×256 分辨率下使用 32 个输入视图的模型分析。所有实验均在 DL3DV-140 上进行。
| 方法 | 参数量 | PSNR↑ | SSIM↑ | LPIPS↓ | 方法 | 参数量 | PSNR↑ | SSIM↑ | LPIPS↓ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | AsySplat | 98M | 19.24 | 0.53 | 0.49 | AsySplat (4m+4s) | 98M | 19.24 | 0.53 | 0.49 | | 来自细粒度特征的预测 | 98M | 19.02 | 0.52 | 0.50 | 7m+1s | 88M | 18.74 | 0.50 | 0.52 | | 来自粗粒度特征的预测 | 95M | 18.54 | 0.47 | 0.54 | 7m+1t | 87M | 18.78 | 0.50 | 0.52 | | 带细粒度到粗粒度的交叉注意力 | 89M | 19.10 | 0.52 | 0.49 | 4m+4t | 95M | 19.19 | 0.52 | 0.50 | | 带粗粒度到细粒度的交叉注意力 | 89M | 17.33 | 0.44 | 0.54 | 8t | 105M | 19.16 | 0.52 | 0.49 | | 无 MambaVision | 94M | 19.06 | 0.51 | 0.51 | 4m+4s (无卷积) | 95M | 17.78 | 0.44 | 0.58 |
(a) 高斯预测源(粗粒度或细粒度 token)、双边连接模块中的交叉注意力链接以及外观分支中的 MambaVision 的消融实验。
| 方法 | PSNR↑ | δ < 1.25 ↑ | AbsRel↓ | GFLOPs↓ | 方法 | 参数量 | PSNR↑ | SSIM↑ | LPIPS↓ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 单分支 | 19.11 | 0.32 | 0.69 | 6104 | AsySplat-30 | 98M | 19.24 | 0.53 | 0.49 | | 双分支 | 19.24 | 0.49 | 0.44 | 5892 | LongLRM-18 | 103M | 18.39 | 0.48 | 0.53 | | 非对称分支 (Ours) | 19.24 | 0.41 | 0.55 | 2033 | LongLRM-24 | 99M | 18.39 | 0.48 | 0.53 | | | | | | | LongLRM-24# | 102M | 17.71 | 0.43 | 0.59 |
(c) 非对称分支设计的验证。输入 patch 大小:单分支 p = 8,双分支 (pc, pf)=(8, 8),以及非对称分支 (pc, pf)=(16, 8)。
(d) 相似参数量的模型比较。数字表示总层数。# 表示跨阶段使用分层参数。
(iii) AsySplat 表现出更低的训练开销。AsySplat 和 LongLRM 均采用逐步策略进行训练,图像分辨率逐渐增加。我们在每个阶段测量训练开销,如表 1 所示。由于更高效的计算资源分配和更紧凑的模型设计,AsySplat 在整个训练过程中持续减少迭代时间和 GPU 内存使用。例如,在 540×960 的分辨率下,与 LongLRM 相比,AsySplat 的迭代时间减少了近 30%。
通过累加所有训练阶段的迭代时间,LongLRM 的总估计训练时间为 76 小时,而 AsySplat 仅需 54 小时。需要注意的是,表 1 中的迭代时间不包括节点间通信时间,后者随模型参数规模而变化。因此,在实际的分布式训练设置中,AsySplat 带来的实际时间减少将更加显著。
(iv) AsySplat 表现出更低的推理开销。表 4 显示,AsySplat 在 TFLOPs、GPU 内存使用和高斯数量方面均有所减少。这些改进源于更紧凑的模型设计和更审慎的计算资源分配。此外,由于 AsySplat 仅预测一半的高斯,其后优化过程完成得更快。总之,这些因素共同使 AsySplat 在推理过程中成为一种更高效、更轻量的解决方案。
(v) AsySplat 表现出强大的稀疏视图性能。尽管我们的设计主要侧重于重新分配长序列输入的计算资源并提高整体效率,但我们的框架在稀疏视图设置下也取得了优异的性能,例如在 RealEstate10K [68] 上使用 2 视图输入时。结果如表 5 所示。值得注意的是,AsySplat 不仅提供了强大的性能,还在参数效率方面具有明显优势。
4.4 模型分析
我们在表 6 中展示了全面的模型分析。由于资源限制,本节中的所有实验均在 256×256 分辨率的 32 个输入视图上进行,模型以 24 的批量大小训练 10k 次迭代。
架构消融实验。在本部分中,我们对架构设计的三个方面进行了消融实验,即用于高斯预测的合并操作、用于跨分支交互的双边连接模块以及用于外观建模的 MambaVision。如表 6a 所示,仅使用几何分支中的粗粒度 token 或仅使用外观分支中的细粒度 token 进行预测会导致性能下降。具体而言,仅依赖粗粒度 token 会导致 PSNR 明显下降 0.7。相反,仅使用细粒度 token 而缺乏几何指导也会产生次优结果。这表明两个分支的输出对于高斯预测是互补的。我们进一步通过移除图 2 中的一个交叉注意力链接来评估双边连接。移除任一交叉注意力链接也会损害性能,证实了
第 10 页
图 5:AsySplat 在测试视角上的渲染和深度预测结果。该模型展示了其重建场景整体正确几何结构的能力,其中粗粒度 token 作为几何分支的输入。
双边设计中每个连接的作用。最后,在外观分支中移除 MambaVision 所观察到的性能下降证实了其对外观建模的贡献。
各阶段的层配置。AsySplat 通过三个阶段处理不同粒度的 token,每个阶段由 8 层组成。我们研究了不同层配置对性能的影响,结果如表 6b 所示。增加双向 Mamba 层的比例(‘7m+1s’ 或 ‘7m+1t’)会导致性能下降,这与 LongLRM [71] 中的发现一致。用全注意力替换稀疏注意力(‘4m+4t’)会产生相似的精度,但显著增加了训练时间,如表 1 所示,迭代时间从 6 秒增加到 10.5 秒。仅使用全注意力(‘8t’)进一步减慢了训练速度,且未带来精度提升。正如第 3.3 节所述,稀疏注意力模块中的卷积块对于上下文完整性至关重要,这一点通过 ‘4m+4s (no conv)’ 变体超过 1.0 PSNR 的下降得到了证实。
设计原则验证。非对称设计源于第 3.1 节中的两个观察结果。我们在表 6c 中通过渲染和几何指标对其进行了验证。(i) 尽管 ‘Two branches’ 比 ‘Asymmetric branches’ 实现了更准确的几何结构,但它并未提升 NVS 质量,且需要更高的 FLOPs,这支持了粗几何结构已足够充分的观点。(ii) ‘Two branches’ 和 ‘Asymmetric branches’ 在外观分支中均仅使用帧内交互,而 ‘Single branch’ 对几何和外观均使用帧间交互。它们更强的性能表明,精细外观更容易建模,且可以仅依赖帧内交互。
参数量相似的模型。本研究通过计算重新分配探索冗余减少,使紧凑模型能够实现强大性能。为了证明设计有效的紧凑模型并非易事,我们将 AsySplat(98M,包含 24 层几何分支和 6 层外观分支)与 LongLRM [71] 的几个参数量减少变体(官方 142M、24 层模型)进行了比较。这些变体包括一个较浅的 18 层模型、一个特征维度降低的 24 层模型,以及一个在三个阶段使用与 AsySplat 相同分层参数的模型。表 6d 显示,AsySplat 优于所有这些变体,证实了其更合理的计算分配能更有效地将参数专门用于特定任务,从而以更高的参数效率实现高性能。
5 结论
本研究探讨了长序列、高分辨率新视角合成(Novel View Synthesis)中可泛化 3D Gaussian Splatting 方法的计算冗余问题。我们提出了一种非对称架构,将几何和外观的建模解耦为两个分支,并根据其各自的精度需求和学习难度分配计算和参数。该设计提高了参数效率,从而使较小的模型能够实现强大性能。大量实验表明,我们的方法以明显更少的参数和更低的开销匹配了当前的可泛化模型,同时表现出卓越的零样本性能。
10
第 11 页
参考文献
[1] Dejan Azinovi´c, Ricardo Martin-Brualla, Dan B Goldman, Matthias Nießner, 和 Justus Thies。 神经 rgb-d 表面重建。发表于 CVPR,2022。
[2] Jonathan T Barron, Ben Mildenhall, Matthew Tancik, Peter Hedman, Ricardo Martin-Brualla, 和 Pratul P Srinivasan。Mip-nerf:用于抗锯齿神经辐射场的多尺度表示。发表于 ICCV,2021。
[3] Jonathan T Barron, Ben Mildenhall, Dor Verbin, Pratul P Srinivasan, 和 Peter Hedman。 Mip-nerf 360:无界抗锯齿神经辐射场。发表于 CVPR,2022。
[4] Jonathan T Barron, Ben Mildenhall, Dor Verbin, Pratul P Srinivasan, 和 Peter Hedman。 Zip-nerf:基于网格的抗锯齿神经辐射场。ICCV,2023。
[5] David Charatan, Sizhe Lester Li, Andrea Tagliasacchi, 和 Vincent Sitzmann。pixelsplat:用于可扩展可泛化 3D 重建的图像对 3D 高斯泼溅。发表于 CVPR,2024。
[6] Anpei Chen, Zexiang Xu, Fuqiang Zhao, Xiaoshuai Zhang, Fanbo Xiang, Jingyi Yu, 和 Hao Su。Mvsnerf:从多视图立体视觉快速重建可泛化辐射场。发表于 ICCV,2021。
[7] Anpei Chen, Zexiang Xu, Andreas Geiger, Jingyi Yu, 和 Hao Su。Tensorf:张量辐射场。发表于 ECCV,2022。
[8] Anpei Chen, Haofei Xu, Stefano Esposito, Siyu Tang, 和 Andreas Geiger。Lara:高效大基线辐射场。发表于 ECCV,2024。
[9] Danpeng Chen, Hai Li, Weicai Ye, Yifan Wang, Weijian Xie, Shangjin Zhai, Nan Wang, Haomin Liu, Hujun Bao, 和 Guofeng Zhang。Pgsr:基于平面的高斯泼溅用于高效高保真表面重建。IEEE 可视化与计算机图形学汇刊,2024。
[10] Kangjie Chen, Yingji Zhong, Zhihao Li, Jiaqi Lin, Youyu Chen, Minghan Qin, 和 Haoqian Wang。量化和缓解稀疏视角 3D 高斯泼溅中的协同适应。arXiv 预印本 arXiv:2508.12720,2025。
[11] Qifeng Chen 和 Vladlen Koltun。使用级联细化网络进行摄影图像合成。发表于 ICCV,2017。
[12] Tianqi Chen, Bing Xu, Chiyuan Zhang, 和 Carlos Guestrin。以亚线性内存成本训练深度网络。arXiv 预印本 arXiv:1604.06174,2016。
[13] Youyu Chen, Junjun Jiang, Kui Jiang, Xiao Tang, Zhihao Li, Xianming Liu, 和 Yinyu Nie。 Dashgaussian:在 200 秒内优化 3D 高斯泼溅。发表于 CVPR,2025。
[14] Yuedong Chen, Haofei Xu, Chuanxia Zheng, Bohan Zhuang, Marc Pollefeys, Andreas Geiger, Tat-Jen Cham, 和 Jianfei Cai。Mvsplat:从稀疏多视图图像高效进行 3D 高斯泼溅。发表于 ECCV,2024。
[15] Yuedong Chen, Chuanxia Zheng, Haofei Xu, Bohan Zhuang, Andrea Vedaldi, Tat-Jen Cham, 和 Jianfei Cai。Mvsplat360:从稀疏视角进行前馈 360 场景合成。发表于 NeurIPS,2024。
[16] Tri Dao。Flashattention-2:具有更好并行性和工作划分的更快注意力机制。arXiv 预印本 arXiv:2307.08691,2023。
[17] Christoph Feichtenhofer, Haoqi Fan, Jitendra Malik, 和 Kaiming He。Slowfast 网络用于 视频识别。发表于 ICCV,2019。
[18] Yang Fu, Sifei Liu, Amey Kulkarni, Jan Kautz, Alexei A Efros, 和 Xiaolong Wang。无需 Colmap 的 3D 高斯泼溅。发表于 CVPR,2024。
[19] Quankai Gao, Qiangeng Xu, Zhe Cao, Ben Mildenhall, Wenchao Ma, Le Chen, Danhang Tang, 和 Ulrich Neumann。Gaussianflow:用于 4D 内容创建的高斯动力学泼溅。arXiv 预印本 arXiv:2403.12365,2024。
11
第 12 页
[20] Albert Gu 和 Tri Dao。Mamba:具有选择性状态空间的线性时间序列建模。在首次语言建模会议,2024。
[21] Antoine Guédon 和 Vincent Lepetit。Sugar:用于高效 3D 网格重建和高质量网格渲染的表面对齐高斯泼溅。在 CVPR,2024。
[22] Ali Hatamizadeh 和 Jan Kautz。Mambavision:一种混合 Mamba-Transformer 视觉骨干网络。在 CVPR,2025。
[23] Peter Hedman, Julien Philip, True Price, Jan-Michael Frahm, George Drettakis 和 Gabriel Brostow。Deep blending:用于自由视角基于图像的渲染。ACM 图形学汇刊 (ToG),37(6):1–15,2018。
[24] Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan Sunkavalli, Trung Bui 和 Hao Tan。Lrm:用于单图像到 3D 的大规模重建模型。arXiv 预印本 arXiv:2311.04400,2023。
[25] Binbin Huang, Zehao Yu, Anpei Chen, Andreas Geiger 和 Shenghua Gao。2d gaussian splatting:用于几何精确辐射场的 2D 高斯泼溅。在 ACM SIGGRAPH 2024 会议论文,2024。
[26] Lihan Jiang, Yucheng Mao, Linning Xu, Tao Lu, Kerui Ren, Yichen Jin, Xudong Xu, Mulin Yu, Jiangmiao Pang, Feng Zhao 等。Anysplat:来自无约束视角的前馈 3D 高斯泼溅。arXiv 预印本 arXiv:2505.23716,2025。
[27] Justin Johnson, Alexandre Alahi 和 Li Fei-Fei。Perceptual losses:用于实时风格迁移和超分辨率的感知损失。在 ECCV,2016。
[28] Gyeongjin Kang, Jisang Yoo, Jihyeon Park, Seungtae Nam, Hyeonsoo Im, Sangheon Shin, Sangpil Kim 和 Eunbyung Park。Selfsplat:无需位姿和无需 3D 先验的可泛化 3D 高斯泼溅。在 CVPR,2025。
[29] Gyeongjin Kang, Seungtae Nam, Seungkwon Yang, Xiangyu Sun, Sameh Khamis, Abdelrahman Mohamed 和 Eunbyung Park。ilrm:一种迭代式大规模 3D 重建模型。在 CVPR,2026。
[30] Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler 和 George Drettakis。3d gaussian splatting:用于实时辐射场渲染的 3D 高斯泼溅。ACM 图形学汇刊,42(4):139–1,2023。
[31] Bernhard Kerbl, Andreas Meuleman, Georgios Kopanas, Michael Wimmer, Alexandre Lanvin 和 George Drettakis。A hierarchical 3d gaussian representation:用于超大规模数据集实时渲染的分层 3D 高斯表示。ACM 图形学汇刊 (TOG),43(4):1–15,2024。
[32] Arno Knapitsch, Jaesik Park, Qian-Yi Zhou 和 Vladlen Koltun。Tanks and temples:大规模场景重建基准测试。ACM 图形学汇刊 (ToG),36(4):1–13,2017。
[33] Jiaqi Lin, Zhihao Li, Xiao Tang, Jianzhuang Liu, Shiyong Liu, Jiayue Liu, Yangdi Lu, Xiaofei Wu, Songcen Xu, Youliang Yan 等。Vastgaussian:用于大规模场景重建的超大规模 3D 高斯泼溅。在 CVPR,2024。
[34] Lu Ling, Yichen Sheng, Zhi Tu, Wentian Zhao, Cheng Xin, Kun Wan, Lantao Yu, Qianyu Guo, Zixun Yu, Yawen Lu 等。Dl3dv-10k:用于基于深度学习的 3D 视觉的大规模场景数据集。在 CVPR,2024。
[35] Ilya Loshchilov 和 Frank Hutter。Decoupled weight decay regularization:解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101,2017。
[36] Tao Lu, Mulin Yu, Linning Xu, Yuanbo Xiangli, Limin Wang, Dahua Lin 和 Bo Dai。Scaffold-gs:用于视图自适应渲染的结构化 3D 高斯泼溅。在 CVPR,2024。
[37] Saswat Subhajyoti Mallick, Rahul Goel, Bernhard Kerbl, Francisco Vicente Carrasco, Markus Steinberger 和 Fernando De La Torre。Taming 3dgs:有限资源下的高质量辐射场。arXiv 预印本 arXiv:2406.15643,2024。
12
第 13 页
[38] Ben Mildenhall, Pratul P Srinivasan, Matthew Tancik, Jonathan T Barron, Ravi Ramamoorthi, 和 Ren Ng. Nerf: Representing scenes as neural radiance fields for view synthesis. In ECCV, 2020.
[39] Thomas Müller, Alex Evans, Christoph Schied, 和 Alexander Keller. Instant neural graphics primitives with a multiresolution hash encoding. ACM Transactions on Graphics (ToG), 41(4): 1–15, 2022.
[40] Albert Pumarola, Enric Corona, Gerard Pons-Moll, 和 Francesc Moreno-Noguer. D-nerf: Neural radiance fields for dynamic scenes. In CVPR, 2021.
[41] Julian Straub, Thomas Whelan, Lingni Ma, Yufan Chen, Erik Wijmans, Simon Green, Jakob J Engel, Raul Mur-Artal, Carl Ren, Shobhit Verma, 等. The replica dataset: A digital replica of indoor spaces. arXiv preprint arXiv:1906.05797, 2019.
[42] Stanislaw Szymanowicz, Chrisitian Rupprecht, 和 Andrea Vedaldi. Splatter image: Ultra-fast single-view 3d reconstruction. In CVPR, 2024.
[43] Jiaxiang Tang, Zhaoxi Chen, Xiaokang Chen, Tengfei Wang, Gang Zeng, 和 Ziwei Liu. Lgm: Large multi-view gaussian model for high-resolution 3d content creation. In ECCV, 2024.
[44] Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timo- thée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, 等. Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971, 2023.
[45] Zhengzhong Tu, Hossein Talebi, Han Zhang, Feng Yang, Peyman Milanfar, Alan Bovik, 和 Yinxiao Li. Maxvit: Multi-axis vision transformer. In ECCV, 2022.
[46] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, 和 Illia Polosukhin. Attention is all you need. In NeurIPS, 2017.
[47] Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, 和 David Novotny. Vggt: Visual geometry grounded transformer. In CVPR, 2025.
[48] Qianqian Wang, Zhicheng Wang, Kyle Genova, Pratul P Srinivasan, Howard Zhou, Jonathan T Barron, Ricardo Martin-Brualla, Noah Snavely, 和 Thomas Funkhouser. Ibrnet: Learning multi-view image-based rendering. In CVPR, 2021.
[49] Zipeng Wang 和 Dan Xu. Hyrf: Hybrid radiance fields for memory-efficient and high-quality novel view synthesis. arXiv preprint arXiv:2509.17083, 2025.
[50] Yaniv Wolf, Amit Bracha, 和 Ron Kimmel. Gs2mesh: Surface reconstruction from gaussian splatting via novel stereo views. In ECCV, 2024.
[51] Guanjun Wu, Taoran Yi, Jiemin Fang, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Qi Tian, 和 Xinggang Wang. 4d gaussian splatting for real-time dynamic scene rendering. In CVPR, 2024.
[52] Haofei Xu, Songyou Peng, Fangjinhua Wang, Hermann Blum, Daniel Barath, Andreas Geiger, 和 Marc Pollefeys. Depthsplat: Connecting gaussian splatting and depth. In CVPR, 2025.
[53] Jiale Xu, Shenghua Gao, 和 Ying Shan. Freesplatter: Pose-free gaussian splatting for sparse- view 3d reconstruction. In ICCV, 2025.
[54] Yinghao Xu, Zifan Shi, Wang Yifan, Hansheng Chen, Ceyuan Yang, Sida Peng, Yujun Shen, 和 Gordon Wetzstein. Grm: Large gaussian reconstruction model for efficient 3d reconstruction and generation. In ECCV, 2024.
[55] Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, 和 Hengshuang Zhao. Depth anything v2. In NeurIPS, 2024.
[56] Botao Ye, Sifei Liu, Haofei Xu, Xueting Li, Marc Pollefeys, Ming-Hsuan Yang, 和 Songyou Peng. No pose, no problem: Surprisingly simple 3d gaussian splats from sparse unposed images. arXiv preprint arXiv:2410.24207, 2024.
13
第 14 页
[57] Alex Yu, Vickie Ye, Matthew Tancik, 和 Angjoo Kanazawa。pixelnerf: Neural radiance fields from one or few images. In CVPR, 2021.
[58] Hong-Xing Yu, Haoyi Duan, Charles Herrmann, William T Freeman, 和 Jiajun Wu。Wonder- world: Interactive 3d scene generation from a single image. In CVPR, 2025.
[59] Zehao Yu, Anpei Chen, Binbin Huang, Torsten Sattler, 和 Andreas Geiger。Mip-splatting: Alias-free 3d gaussian splatting. In CVPR, 2024.
[60] Biao Zhang 和 Rico Sennrich。Root mean square layer normalization. In NeurIPS, 2019.
[61] Jiawei Zhang, Jiahe Li, Xiaohan Yu, Lei Huang, Lin Gu, Jin Zheng, 和 Xiao Bai。Cor- gs: sparse-view 3d gaussian splatting via co-regularization. In ECCV, 2024.
[62] Kai Zhang, Nick Kolkin, Sai Bi, Fujun Luan, Zexiang Xu, Eli Shechtman, 和 Noah Snavely。 Arf: Artistic radiance fields. In ECCV, 2022.
[63] Kai Zhang, Sai Bi, Hao Tan, Yuanbo Xiangli, Nanxuan Zhao, Kalyan Sunkavalli, 和 Zexiang Xu。Gs-lrm: Large reconstruction model for 3d gaussian splatting. In ECCV, 2024.
[64] MI Zhenxing 和 Dan Xu。Switch-nerf: Learning scene decomposition with mixture of experts for large-scale neural radiance fields. In ICLR, 2022.
[65] Yingji Zhong, Lanqing Hong, Zhenguo Li, 和 Dan Xu。Cvt-xrf: Contrastive in-voxel trans- former for 3d consistent radiance fields from sparse inputs. In CVPR, 2024.
[66] Yingji Zhong, Zhihao Li, Dave Zhenyu Chen, Lanqing Hong, 和 Dan Xu。Taming video diffusion prior with scene-grounding guidance for 3d gaussian splatting from sparse inputs. In CVPR, 2025.
[67] Yingji Zhong, Kaichen Zhou, Zhihao Li, Lanqing Hong, Zhenguo Li, 和 Dan Xu。Empowering sparse-input neural radiance fields with dual-level semantic guidance from dense novel views. arXiv preprint arXiv:2503.02230, 2025.
[68] Tinghui Zhou, Richard Tucker, John Flynn, Graham Fyffe, 和 Noah Snavely。Stereo magnifi- cation: Learning view synthesis using multiplane images. arXiv preprint arXiv:1805.09817, 2018.
[69] Lianghui Zhu, Bencheng Liao, Qian Zhang, Xinlong Wang, Wenyu Liu, 和 Xinggang Wang。 Vision mamba: Efficient visual representation learning with bidirectional state space model. arXiv preprint arXiv:2401.09417, 2024.
[70] Zehao Zhu, Zhiwen Fan, Yifan Jiang, 和 Zhangyang Wang。Fsgs: Real-time few-shot view synthesis using gaussian splatting. In ECCV, 2024.
[71] Chen Ziwen, Hao Tan, Kai Zhang, Sai Bi, Fujun Luan, Yicong Hong, Li Fuxin, 和 Zexiang Xu。Long-lrm: Long-sequence large reconstruction model for wide-coverage gaussian splats. In ICCV, 2025.
14
第 15 页
AsySplat:用于长序列场景建模的高效非对称 3D 高斯泼溅
补充材料
A 实现细节
架构。AsySplat 中的所有 Transformer 块,包括几何分支中的稀疏注意力模块和双边连接模块中的全注意力层,均在查询和键投影后应用 RMSNorm [60] [44]。几何分支使用状态维度为 256 的双向 Mamba [69] 层,而外观分支采用状态维度为 16 的 MambaVision [22] 层。对于高斯属性预测,我们将球谐函数的阶数设置为 3。
训练。我们采用渐进式训练策略,依次提高分辨率:256×256、512×512 和 540×960。模型使用 AdamW 优化器 [35] 进行训练,所有阶段的权重衰减均为 0.05。这三个阶段的峰值学习率分别设置为 4e-4、4e-5 和 4e-5,并遵循余弦调度进行衰减。此外,在初始阶段的前 2k 次迭代中,对学习率应用线性预热。
训练开销。在论文中,为了在 256×256 和 512×512 分辨率下与 LongLRM [71] 进行开销比较,由于缺乏这些分辨率的 LongLRM 检查点,我们基于随机初始化的参数报告开销,并取前 20 次迭代的平均值。一般来说,随着训练的进展,LongLRM 的计算开销比 AsySplat 增加得更显著。这是因为预测 4 倍数量的高斯会导致 GPU 内存消耗和迭代时间更陡峭地上升。对于 540×960 分辨率下的开销,我们使用官方发布的 LongLRM 检查点。我们通过继续训练 20 次迭代,将其与我们的最终模型进行比较,并报告平均开销。
推理开销。我们在 540×960 分辨率下比较了 AsySplat 与 LongLRM 的推理开销。主论文中报告的评估指标包括推理时间、TFLOPs、GPU 内存使用量和高斯数量。对于推理时间,我们在排除最长耗时作为异常值后,计算 DL3DV-140 基准测试 [34] 上的平均值。对于 TFLOPs,我们使用 thops 库测量网络的计算成本。该测量不包括泼溅过程中的计算。请注意,在 540×960 分辨率下,LongLRM 最初预测的高斯数量是我们的方法的 4 倍,但随后根据预测的不透明度将其从 1600 万修剪至 800 万。
评估设置。我们遵循 LongLRM 确定所有评估的输入和测试划分,无论是在 DL3DV-140 基准测试上还是在其他零样本数据集 [32, 23, 3, 41] 上。对于给定的一组场景图像,我们从序列中均匀采样每第 8 张图像作为测试集。输入视图是从剩余图像中根据相机位置和观察方向使用 K-means 聚类选择的,旨在实现最佳场景覆盖。聚类数量设置为等于输入视图的数量,并选择最接近聚类中心的相机作为输入集。在 DL3DV-140 上以 256×256 分辨率进行的消融实验中,我们使用每个视频序列的前 96 帧。每第 8 帧被均匀选为测试集,并从剩余帧中均匀采样 32 个输入视图。关于在 Replica 数据集上的比较,我们按照 [66] 选择场景。
后优化。为了确保与 LongLRM 的公平比较,我们使用相同的超参数应用相同的后优化过程。具体而言,我们从预测的高斯渲染输入视图,并计算渲染图像与真实图像之间的均方误差 (MSE) 损失。然后反向传播该损失以更新高斯参数。中心和球谐函数的学习率分别设置为 5e-4 和 1e-3,而不透明度、尺度和四元数的学习率设置为 0。
15
第 16 页
表 A1:使用官方推理代码与 AnySplat 的对比。
| | 输入视图 | 给定位姿 | DL3DV-140 PSNR↑ | DL3DV-140 SSIM↑ | DL3DV-140 LPIPS↓ | 显存 (G) | 参数量 (M) | 时间 (s) | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | AnySplat [26] | × | | 13.91 | 0.392 | 0.609 | >32 | 1190 | 7.13 | | AsySplat (Ours) | 32 | ✓ | 24.00 | 0.785 | 0.256 | 22 | 98 | 0.27 | | AnySplat [26] | × | | 13.98 | 0.405 | 0.613 | >56 | 1190 | 24.74 | | AsySplat (Ours) | 64 | ✓ | 19.84 | 0.688 | 0.362 | 26 | 98 | 0.47 |
表 A2:各阶段 Mamba 比例的消融实验。每个阶段包含 8 层,涉及 Mamba 和注意力层。未使用稀疏注意力。深度指标作为跨视图匹配能力的指示。
| #Mamba | #Attn | 缩写 | 参数量 (M) | DL3DV-140 PSNR↑ | DL3DV-140 SSIM↑ | Mip-NeRF360 PSNR↑ | Mip-NeRF360 SSIM↑ | ScanNet++ AbsRel↓ | ScanNet++ δ<1.25↑ | | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 8 | 0 | 8m0a | 93.6 | 18.24 | 0.47 | 16.65 | 0.30 | 0.64 | 0.21 | | 7 | 1 | 7m1a | 96.6 | 18.80 | 0.49 | 16.91 | 0.29 | 0.57 | 0.35 | | 6 | 2 | 6m2a | 99.6 | 19.04 | 0.51 | 16.92 | 0.29 | 0.55 | 0.36 | | 4 | 4 | 4m4a | 95.0 | 19.19 | 0.52 | 17.06 | 0.30 | 0.44 | 0.39 | | 2 | 6 | 2m6a | 99.9 | 19.30 | 0.52 | 17.49 | 0.32 | 0.39 | 0.44 | | 0 | 8 | 0m8a | 105.0 | 19.16 | 0.52 | 17.42 | 0.29 | 0.43 | 0.40 |
训练目标。为了对 AsySplat 进行监督,我们从 $V_t$ 个目标位姿渲染预测的高斯球,得到 $\{\hat{I}_i\}_{i=1}^{V_t}$,并将其与相应的真实图像 $\{I_i\}_{i=1}^{V_t}$ 进行比较。遵循先前的工作 [63, 71],我们使用均方误差项和感知损失 [27, 11]: $$ L_{image} = \frac{1}{V_t} \sum_{i=1}^{V_t} \text{MSE}(\hat{I}_i, I_i) + \lambda_p \cdot \text{Perceptual}(\hat{I}_i, I_i) $$ 其中 $\lambda_p$ 是加权因子。遵循 LongLRM [71],我们还采用来自单目视差估计 [55] 的几何监督以提高训练稳定性: $$ L_{depth} = \frac{1}{V_t} \sum_{i=1}^{V_t} \text{SmoothL1}(\hat{D}_i, D_i) $$ 其中 $\hat{D}_i$ 和 $D_i$ 分别表示归一化的预测视差图和单目估计视差图。两个图都通过因子 $p_c/p_f$ 进行下采样。因此,总体目标函数为:
$$ \mathcal{L} = \mathcal{L}_{image} + \lambda_d \cdot \mathcal{L}_{depth} \quad (5) $$
其中 $\lambda_d$ 平衡深度监督。请注意,尽管我们引入了单目深度监督,但由于粗粒度输入标记,AsySplat 仍然建模粗粒度几何结构。此外,下采样的输出 $\hat{D}_i$ 提供了对整体场景几何结构的更粗粒度表示,因为场景几何结构是通过像素对齐预测建模的。加权因子 $\lambda_p$ 和 $\lambda_d$ 分别设置为 0.5 和 0.01。
B 更多对比
与无位姿方法的对比。我们的方法侧重于给定位姿的可泛化 3DGS 建模,因此我们在正文中没有报告与当前无位姿可泛化 3DGS 方法的对比。设置的不匹配可能导致巨大的性能差距,并可能产生误导。为了证明这一点,我们在表 A1 中展示了与当前最先进的无位姿方法 AnySplat [26] 的对比。性能差距表明直接进行对比是不公平的。此外,我们的方法与 AnySplat 有不同的研究重点。AnySplat 将预训练的 VGGT [47] 微调为 3DGS 模型,而我们强调通过从头开始训练参数高效模型,以显著降低训练/推理开销来实现效率。由于我们的方法优先考虑效率,无论使用 32、64 甚至更多输入视图,与 AnySplat 相比,我们的方法都保持了显著更低的内存占用和更快的推理速度(例如,64 个视图时快 50 倍)。
C 更多消融实验
Mamba 比例的消融实验。在正文中,我们声称“过度依赖 Mamba 会降低性能,因为状态空间模型对于多视图深度估计所需的显式匹配效果较差”。为了证实这一主张,我们在本节中通过改变每个阶段的 Mamba 比例并保持总参数量相似来进行实验。结果如表 A2 所示。对于新视角合成,我们在 2m6a 处观察到一个最佳点,超过该点后,增加 Mamba 比例(从 2m6a 到 8m0a)会导致 NVS 性能单调下降,这与我们关于“过度依赖 Mamba 会降低性能”的断言一致。为了进一步
第 17 页
表 A3:几何分支与外观分支之间参数分配的消融实验,总参数量相似。
| | 几何分支比例 | 参数量 | DL3DV-140 | | MipNeRF-360 | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | | | | PSNR↑ | SSIM↑ | PSNR↑ | SSIM↑ | | | 90% | 98M | 19.24 | 0.53 | 17.52 | 0.30 | | | 80% | 96M | 19.16 | 0.52 | 17.30 | 0.31 | | | 70% | 98M | 19.20 | 0.52 | 16.34 | 0.27 | | | 60% | 98M | 19.22 | 0.53 | 16.65 | 0.27 | | | 50% | 96M | 18.97 | 0.51 | 16.50 | 0.27 |
为了证明这种性能下降与 Mamba 在显式匹配中的无效性有关,我们还报告了深度估计指标,因为深度准确性是匹配质量的可靠指标。随着 Mamba 比例超过 2m6a,深度准确性下降,其趋势与 NVS 指标相似。几何准确性的恶化强烈表明,过度依赖 Mamba 会损害几何分支内的跨视图匹配能力。
参数分配消融实验。我们的方法采用非对称结构。在本部分中,我们对几何分支和外观分支之间的参数比例进行消融实验。我们在保持总参数量大致不变的情况下,改变各分支的比例。实验结果如表 A3 所示。结果表明,将 90% 的参数分配给几何分支可以在各个基准测试中取得良好的性能。
D 讨论
本研究调查了长序列、高分辨率新视角合成(Novel View Synthesis)中可泛化 3D 高斯泼溅(3D Gaussian Splatting)方法的计算冗余性。尽管提出的 AsySplat 以显著更少的参数量和更低的开销,实现了与最先进的可泛化 3DGS 方法相当或更优的性能,但其视觉保真度仍可能落后于基于优化的方法,例如产生更高的 LPIPS 值。这种局限性在可泛化 3DGS 方法中很常见,这些方法通常缺乏用于稠密化的误差驱动反馈机制,而该机制对于恢复细节至关重要。整合此功能可以有效利用 AsySplat 节省的参数,我们将此留作未来工作。
17