ATSplat:自适应Token扩展实现紧凑前馈3D高斯泼溅

三分钟导读:ATSplat通过从稀疏3D锚点Token开始并自适应扩展困难区域的Token,实现了场景复杂度感知的紧凑3D高斯表示,在保持SOTA渲染质量的同时显著减少了高斯数量并实现了实时渲染。

英文题目:ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

论文出处:arXiv 每日论文精选 · arXiv:2607.20417

原始论文:PDF / 论文页面

对应视频标题:ATSplat:自适应Token扩展实现紧凑前馈3D高斯泼溅|推荐指数:★★★★★

这篇论文解决什么问题?

现有的前馈3D Gaussian Splatting (3DGS) 方法通常采用像素对齐(pixel-aligned)的公式,将高斯原语的数量和位置绑定到输入图像网格上,导致在简单区域产生冗余,而在复杂区域容量不足,无法像优化型3DGS那样根据场景复杂度自适应分配表示能力。

核心创新

  • 提出ATSplat框架,通过自适应3D锚点Token恢复前馈设置中3DGS的场景自适应容量分配能力。
  • 引入Adaptive Token Expansion (ATE) 模块,通过预测不确定性分数并选择性扩展Token,在无需直接访问渲染误差的情况下识别并细化困难区域。
  • 实现了稀疏到自适应的分配机制,使高斯数量比密集像素对齐方法减少5.7倍以上,同时保持SOTA渲染质量。

方法概览

ATSplat提出了一种基于自适应3D锚点Token的前馈框架:1) 稀疏初始化:将粗略的patch级深度和相机信息反投影为稀疏3D锚点Token,形成场景的紧凑支架;2) 自由放置:每个Token被解码为一组局部高斯,其位置通过相对于锚点的3D偏移量预测,从而解耦原语位置与输入像素网格;3) 自适应分配:引入自适应Token扩展(ATE)模块,通过预测Token级不确定性分数并选择高不确定性Token进行扩展,将表示能力集中在困难区域。

逐图理解论文

ATSplat核心思想:稀疏到自适应

ATSplat核心思想:稀疏到自适应
Fig. 1. ATSplat reconstructs compact 3D Gaussians from multi-view captures in a single forward pass. Unlike dense pixel-aligned feed-forward methods that place Gaussians according to input image grids, ATSplat starts from sparse 3D anchor tokens and adaptively expands tokens associated with challenging regions. This sparse-to-adaptive allocation concentrates representational capacity according to scene complexity, enabling high-quality novel-view rendering with only 311K Gaussians. With 12 images at 512 × 960 resolution, ATSplat completes reconstruction in less than a second, which can be rendered at 1136 FPS.

ATSplat提出了一种基于自适应3D锚点Token的前馈框架,旨在恢复前馈设置中3DGS的场景自适应容量分配能力。该方法从稀疏3D锚点Token开始,通过自适应扩展困难区域的Token,形成场景的紧凑支架。这种稀疏到自适应的分配机制,使得高斯数量比密集像素对齐方法减少5.7倍以上,同时保持SOTA渲染质量。

方法概述:稀疏初始化与自由放置

方法概述:稀疏初始化与自由放置
Fig. 2 (a) illustrates an overview of the framework. Given multi- view images, a multi-view encoder first extracts coarse patch fea- tures and predicts patch-level depths. The depths are unprojected

ATSplat框架首先通过多视图编码器提取粗略的patch级特征并预测patch级深度,将这些深度反投影为稀疏3D锚点Token,形成场景的紧凑支架。随后,每个Token被解码为一组局部高斯,其位置通过相对于锚点的3D偏移量预测,从而解耦原语位置与输入像素网格,实现自由放置。

创新点:自适应Token扩展模块

创新点:自适应Token扩展模块
Fig. 3. Visualization of expanded tokens. The coordinate of each ex- panded token is computed as the mean center of its decoded Gaussians.

为了解决复杂区域容量不足的问题,ATSplat引入了自适应Token扩展模块。该模块通过预测Token级不确定性分数,并选择高不确定性Token进行扩展,将表示能力集中在困难区域。这一机制无需直接访问渲染误差,即可有效识别并细化复杂结构,显著提升了渲染质量。

实验设置:数据集与评估指标

实验设置:数据集与评估指标
Table 1. Quantitative results on RealEstate10K at 256 × 256 resolution with 2 input views. Inference times for GS-LRM and LongLRM are omitted, due to the absence of public codes for this setting.

我们在RealEstate10K数据集(256×256分辨率,2输入视图)和DL3DV数据集(256×448分辨率,2/4/6输入视图)上进行定量和定性评估。此外,还在DL3DV数据集(512×960分辨率,12输入视图)上进行高分辨率新视角合成评估。评估指标包括PSNR、SSIM和LPIPS,以全面衡量渲染质量。

定量结果:DL3DV表现

定量结果:DL3DV表现
Table 2. Quantitative comparisons on DL3DV at 256 × 448 resolution. *: reported only at 6 views, as both code and pretrained weights are not publicly available for the other setups. iLRM predicts pixel-aligned Gaussians at 2× downsampled resolution, which results in 4× fewer Gaussians.

在DL3DV数据集(256×448分辨率,6视图)上,ATSplat取得了PSNR 27.28,SSIM 0.868,LPIPS 0.138的成绩,使用120K个高斯。与DepthSplat相比,ATSplat的高斯数量减少了5.7倍(120K vs 688K),同时保持了相当的渲染质量,展示了其在大规模场景中的优势。

实验与关键结果

  • 在RealEstate10K数据集(256×256分辨率,2输入视图)上进行定量和定性评估。
  • 在DL3DV数据集(256×448分辨率,2/4/6输入视图)上进行定量和定性评估。
  • 在DL3DV数据集(512×960分辨率,12输入视图)上进行高分辨率新视角合成评估。
  • 进行消融实验,分析3D锚点设计和ATE模块的有效性。
  • 评估不同视角重叠度、零样本迁移、外推视图以及统一模型训练的效果。
  • 在RealEstate10K数据集(256×256分辨率,2输入视图)上进行定量和定性评估。
  • 在DL3DV数据集(256×448分辨率,2/4/6输入视图)上进行定量和定性评估。
  • 在DL3DV数据集(512×960分辨率,12输入视图)上进行高分辨率新视角合成评估。
  • 进行消融实验,分析3D锚点设计和ATE模块的有效性。
  • 评估不同视角重叠度、零样本迁移、外推视图以及统一模型训练的效果。

阅读时需要注意

  • ATE模块在扩展Token时未进行冗余Token的剪枝(pruning),可能导致解码器效率未达最优。
  • 当前架构针对特定分辨率和输入视图数量进行了优化,虽然证明了统一模型的可行性,但扩展到大场景、更多视图或更高分辨率可能需要架构改进。
  • 目前仅支持已知相机位姿(posed)的输入,未扩展至无位姿(unposed)设置。
  • 与优化型基线(如3DGS)相比,前馈方法在极端复杂场景下的几何保真度可能仍有差距,尽管ATSplat已显著缩小这一差距。
  • 在视角重叠度极大(large overlap)的设置下,由于目标视图内容直接可见,像素对齐方法可能表现相当或略优,ATSplat的优势在视角重叠度小(small overlap,即大基线)时更明显。

关联工作

  • 3DGS:基础方法,提供自适应容量分配的设计原则,但需要每场景优化。(第 2 页)
  • pixelSplat:前馈3DGS基线,采用像素对齐公式,高斯数量绑定于输入像素。(第 3 页)
  • MVSplat:前馈3DGS基线,使用平面扫描代价体积改进像素对齐方法。(第 3 页)
  • DepthSplat:前馈3DGS基线,连接多视图深度估计与高斯预测,本文主要对比对象。(第 3 页)
  • iLRM:前馈3DGS方法,通过低分辨率网格预测高斯以减少数量,但均匀下采样导致复杂区域容量不足。(第 3 页)
  • GS-LRM:大型重建模型,基于像素对齐范式,本文在RealEstate10K上作为对比。(第 5 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

ATSplat:具有自适应Token扩展的紧凑前馈3D高斯泼溅

IN CHO,韩国延世大学 JEONGHWAN CHO,韩国延世大学 MIJIN YOO,韩国延世大学 GIM HEE LEE,新加坡国立大学,新加坡 SEON JOO KIM,韩国延世大学

多视角相机捕获 稀疏 自适应 3D中的高斯 初始化 扩展 单 前向传播 ATSplat 自适应分配困难区域的高斯 均匀分配,受像素约束 2026

实时渲染

NVS22 [cs.CV]

紧凑3D高斯(311K) 渲染的新视角 真实值

图 1. ATSplat 通过单次前向传播从多视角捕获中重建紧凑的3D高斯。与根据输入图像网格放置高斯的密集像素对齐前馈方法不同,ATSplat 从稀疏的3D锚点Token开始,并自适应扩展与具有挑战性区域相关的Token。这种从稀疏到自适应的分配根据场景复杂度集中表示能力,仅使用311K个高斯即可实现高质量的新视角渲染。对于12张分辨率为512 × 960的图像,ATSplat 在不到一秒的时间内完成重建,渲染速度可达1136 FPS。

3D高斯泼溅(3DGS)通过在3D中优化自由放置的图元并在重建不足的区域自适应地增加密度,实现了高质量的新视角合成。然而,这种场景自适应的容量分配能力在现有的前馈3DGS方法中大多丢失,这些方法通常将高斯回归到输入像素并沿相机射线提升。这种像素对齐的公式使得图元的数量和位置取决于图像分辨率和输入视角,而不是场景复杂度,从而导致密集且往往冗余的高斯集合。我们提出了ATSplat,这是一种前馈3DGS框架,通过自适应3DToken恢复了3DGS优化的自适应分配能力。ATSplat 首先将粗略的块级深度和相机线索提升为稀疏的3D锚点Token,形成场景的紧凑支架。然后,每个Token通过可学习的3D偏移量回归为局部高斯,将图元放置与输入图像网格解耦。自适应Token扩展(ATE)模块预测Token级的不确定性分数,由渲染误差图监督,并通过可学习的扩展层选择性地扩展高不确定性Token。这种从稀疏到自适应的公式使ATSplat能够在保持紧凑表示的同时,将图元集中在具有挑战性的区域。在两个代表性数据集RealEstate10K和DL3DV上的实验表明,ATSplat 实现了最先进的渲染质量,同时与密集前馈3DGS方法相比,高斯数量减少了5.7倍以上。对于12张分辨率为512 × 960的输入图像,ATSplat 使用单个商用GPU在不到一秒的时间内完成重建,并仅使用311K个高斯以1136 FPS(512 × 960)渲染高质量的新视角。我们的项目页面位于:https://join16.github.io/page-atsplat

作者联系方式:In Cho,韩国延世大学;Jeonghwan Cho,韩国延世大学;Mijin Yoo,韩国延世大学;Gim Hee Lee,新加坡国立大学,新加坡;Seon Joo Kim,韩国延世大学。

第 2 页

2 • 赵正焕 (Cho, Jeonghwan Cho), 柳珉静 (Mijin Yoo), 李 Gim Hee, 金善珠 (Seon Joo Kim)

CCS 主题分类:• 计算方法 → 渲染;重建;神经网络。 关键术语:3D 高斯泼溅,多视图捕获,新视角合成,前馈模型

在单次前向传播中,渲染误差并非直接可观测。我们的自适应 Token 扩展模块通过为每个 token 学习不确定性分数来解决这一问题,该分数通过渲染不确定性图进行监督,以匹配实际的渲染误差。结合基于锚点的灵活 3D 放置,自适应扩展使我们能够将表示能力集中在具有挑战性的区域。

得益于灵活且自适应的锚点设计,ATSplat 比密集的像素对齐前馈 3D 高斯泼溅方法更高效地利用其表示预算。在两个代表性数据集 RealEstate10K [Zhou et al. 2018] 和 DL3DV [Ling et al. 2024] 上的实验表明,ATSplat 在将高斯数量减少 5.7 倍以上的同时,实现了最先进的渲染质量。这些结果表明,高质量的前馈 3D 高斯泼溅源于表示能力的分配方式,而非采样的密集程度。通过恢复 3D 高斯泼溅的核心设计原则,ATSplat 以更紧凑的表示和实时渲染实现了最先进的质量。

我们的主要贡献总结如下:

  • 我们提出了 ATSplat,这是一种以前馈设置中自适应 3D 锚点 Token 为核心的 3D 高斯泼溅框架,恢复了 3D 高斯泼溅的场景自适应容量分配特性。
  • 我们引入了自适应 Token 扩展模块,该模块能够在不直接访问渲染误差的情况下,识别并逐步扩展具有挑战性的区域中的 Token。
  • ATSplat 在比先前密集的像素对齐方法少使用 5.7 倍以上高斯数量的情况下,实现了最先进的渲染质量,证明了场景自适应容量分配对于紧凑的前馈 3D 高斯泼溅的重要性。

1 引言

3D 高斯泼溅 (3DGS) [Kerbl et al. 2023] 已成为新视角合成的一种强大表示方法,实现了具有实时渲染能力的高质量重建。该流程的优势在于其表示的灵活性:从稀疏点云作为粗略初始化开始,图元可以自由放置在 3D 空间中的任何位置,自适应细化将表示能力重定向到重建不足的区域。这种场景自适应的容量分配——根据场景复杂度放置和细化图元——确立了 3D 高斯泼溅作为新视角合成领先表示方法的地位。

然而,这些优势是以每场景优化为代价的,限制了 3D 高斯泼溅在许多应用中的实用性。因此,越来越多的工作试图通过利用学习到的先验,直接从多视图捕获中重建高斯图元,从而绕过这一成本。这些前馈 3D 高斯泼溅框架中的主导设计是一种像素对齐的公式 [Charatan et al. 2024; Chen et al. 2024a; Kang et al. 2025; Xu et al. 2025]:在每个输入像素处回归一个高斯,并沿其相机射线提升,将图元放置简化为深度估计。虽然这种公式简化了重建问题并取得了令人印象深刻的结果,但它也产生了大量密集的、每像素的高斯。随着图像分辨率和输入视图数量的增加,图元数量也随之增长,这些方法往往面临显著的渲染低效和存储成本问题。

更根本地说,这种低效源于表示能力的参数化和分配方式。通过将高斯绑定到输入图像网格,像素对齐框架使图元放置依赖于相机采样而非重建难度。因此,它们牺牲了优化 3D 高斯泼溅的一个关键优势:根据场景复杂度自适应分配容量的能力。填补这一空白需要一个前馈设计,其中高斯放置反映场景复杂度而非图像结构。

我们提出了 ATSplat,这是一种以前馈 3D 高斯泼溅框架,通过自适应 Token 恢复了 3D 高斯泼溅优化的场景自适应容量分配。我们的框架将每场景 3D 高斯泼溅优化的三个核心设计原则——稀疏初始化、3D 自由放置和自适应容量分配——重新解释为围绕我们自适应锚点 Token 的前馈操作。首先,ATSplat 将粗略的块级深度和相机信息提升为稀疏的 3D 锚点 Token,形成场景的紧凑支架。其次,每个 Token 被解码为一组局部高斯,其位置相对于 Token 锚点进行预测,从而将图元放置与输入图像网格解耦。第三,ATSplat 逐步扩展与具有挑战性的区域相关的 Token,在场景需要的地方集中表示能力。总之,这种从稀疏到自适应的公式产生了一组根据场景复杂度分布的紧凑高斯集合。

自适应分配中的核心挑战是在无法访问渲染误差的情况下识别重建不足的区域,因为这些误差在单次前向传播中并非直接可观测。我们的自适应 Token 扩展模块通过为每个 Token 学习不确定性分数来解决这一问题,该分数通过渲染不确定性图进行监督,以匹配实际的渲染误差。结合基于锚点的灵活 3D 放置,自适应扩展使我们能够将表示能力集中在具有挑战性的区域。

得益于灵活且自适应的锚点设计,ATSplat 比密集的像素对齐前馈 3D 高斯泼溅方法更高效地利用其表示预算。在两个代表性数据集 RealEstate10K [Zhou et al. 2018] 和 DL3DV [Ling et al. 2024] 上的实验表明,ATSplat 在将高斯数量减少 5.7 倍以上的同时,实现了最先进的渲染质量。这些结果表明,高质量的前馈 3D 高斯泼溅源于表示能力的分配方式,而非采样的密集程度。通过恢复 3D 高斯泼溅的核心设计原则,ATSplat 以更紧凑的表示和实时渲染实现了最先进的质量。

我们的主要贡献总结如下:

  • 我们提出了 ATSplat,这是一种以前馈设置中自适应 3D 锚点 Token 为核心的 3D 高斯泼溅框架,恢复了 3D 高斯泼溅的场景自适应容量分配特性。
  • 我们引入了自适应 Token 扩展模块,该模块能够在不直接访问渲染误差的情况下,识别并逐步扩展具有挑战性的区域中的 Token。
  • ATSplat 在比先前密集的像素对齐方法少使用 5.7 倍以上高斯数量的情况下,实现了最先进的渲染质量,证明了场景自适应容量分配对于紧凑的前馈 3D 高斯泼溅的重要性。

2 相关工作

2.1 3D 表示与新视角合成

神经辐射场 (NeRF) 将场景表示为连续的辐射密度场,并通过体积渲染合成新视角 [Mildenhall et al. 2020]。大量工作从多个方面改进了 NeRF,包括抗锯齿 [Barron et al. 2021]、训练速度 [Müller et al. 2022]、显式分解 [Chan et al. 2022; Chen et al. 2022] 以及可泛化的辐射场 [Chen et al. 2021; Wang et al. 2021; Yu et al. 2021]。

尽管保真度高,但许多神经场方法需要密集的射线采样和/或昂贵的每场景优化。3D 高斯泼溅 (3DGS) [Kerbl et al. 2023] 则使用一组各向异性高斯图元来表示场景,并通过可微光栅化对其进行优化,从而实现高质量实时渲染。大量后续工作沿多个方向扩展了它,包括表面重建 [Guédon and Lepetit 2024; Huang et al. 2024; Yu et al. 2024b]、抗锯齿渲染 [Yu et al. 2024a]、动态场景建模 [Wu et al. 2024; Yang et al. 2024] 以及紧凑的结构化表示 [Lu et al. 2024]。基于优化的 3D 高斯泼溅的一个关键优势在于基于场景复杂度的自适应图元分配,这得益于高斯的 3D 放置和自适应密度控制。

2.2 前馈 3D 高斯泼溅

与针对每个场景优化高斯不同,最近的前馈 3D 高斯泼溅方法直接从多视图

第 3 页

ATSplat: 基于自适应Token扩展的紧凑前馈3D高斯泼溅 with Adaptive Token Expansion • 3

从而解决了昂贵的每场景优化成本。Splatter Image [Szymanowicz et al. 2024] 展示了使用高斯图元(Gaussian maps)进行单视图物体重建,而 pixelSplat 通过将像素对齐的预测沿相机射线提升,从配准图像对(posed image pairs)中预测3D高斯 [Charatan et al. 2024]。MVSplat [Chen et al. 2024a] 进一步利用平面扫描代价体(plane-sweep cost volume)改进了这一前馈框架,DepthSplat [Xu et al. 2025] 则利用深度先验将多视图深度估计与高斯预测连接起来。后续工作将前馈3DGS框架扩展到了360度 [Chen et al. 2024b]、未配准 [Hong et al. 2024] 和无约束设置 [Jiang et al. 2025]。大型重建模型(LRM)进一步利用大型Transformer骨干网络扩展了这一像素对齐范式 [Tang et al. 2024; Xu et al. 2024; Zhang et al. 2024a]。最近,iLRM [Kang et al. 2025] 将视角Token与输入图像解耦,并在单独的、低分辨率的网格中预测高斯,从而产生更紧凑的高斯集合。然而,这种均匀的空间下采样无视场景复杂度,在整个场景中减少了图元数量。这导致复杂区域的高斯分配不足,并降低了这些区域的渲染质量。

尽管这些方法实现了令人印象深刻的重建速度和渲染质量,但大多数方法遵循密集的像素对齐公式:图元的数量与图像分辨率和视图数量紧密相关。因此,简单且纹理较少的区域会产生许多冗余的高斯,而具有挑战性的区域无法获得其所需的额外容量。ATSplat 通过稀疏到自适应的容量分配克服了这一限制,我们的自适应锚点Token根据重建难度被选择性扩展。由于这种扩展在解码器内部进行,扩展后的Token进一步通过与输入图像进行交叉注意力机制进行细化,不仅为具有挑战性的区域分配图元,还分配计算资源。

2.3 紧凑前馈3D高斯泼溅

最近的一些工作试图解决密集像素对齐高斯预测的局限性。FreeSplat 和 FreeSplat++ 融合跨视图的重叠像素对齐高斯,并移除冗余或漂浮的图元,用于室内3D场景重建 [Wang et al. 2024, 2025b]。Gaussian Graph Network 对高斯组之间的跨视图关系进行建模,并将它们池化为更高效的表示 [Zhang et al. 2024b],而 Fuse-and-Refine 在细化之前将像素对齐的图元聚合到规范3D空间中 [Wang et al. 2026]。Generative Densification [Nam et al. 2025] 采取了一个互补的方向:它不是减少图元,而是学习一个前馈细化模块,通过上采样特征为高频细节生成精细高斯。这些方法大多在重建的像素对齐高斯之上运行,并引入后处理阶段。

与我们的工作同时,新兴的一系列工作更直接地超越了像素对齐公式。VolSplat [Wang et al. 2025a] 用体素对齐预测取代了图像网格对齐,SparseSplat [Zhang et al. 2026a] 根据局部信息丰富度自适应采样高斯。几项工作从图像网格中自适应采样高斯,采用多粒度高斯 [Kim et al. 2026] 或图像内的自适应位置。其他并发方法使用3D锚定特征体将高斯预测与像素解耦 [Zhang et al. 2026b],或使用全局可学习Token [An et al. 2025; Itkin et al. 2026; Ren et al. 2026]。

ATSplat 符合这一新兴方向,但在自适应容量的分配方式上有所不同。ATSplat 不从密集的像素对齐高斯集合、固定体素网格或纯粹可学习的全局Token开始,而是从粗略深度和相机构建场景条件的稀疏3D锚点Token支架。每个锚点被回归为一组具有可学习3D偏移量的局部高斯,允许图元自由放置在相机射线之外。自适应Token扩展(Adaptive Token Expansion, ATE)模块识别重建不足的Token并选择性扩展它们。这种从稀疏到自适应的公式旨在填补前馈3DGS中缺失的部分:根据重建难度分配表示和计算容量,而不是输入图像结构。

3 问题表述

我们的目标是在单次前向传播中从配准的多视图图像重建场景的3D高斯表示,避免标准3DGS所需的昂贵每场景优化。给定带有相机位姿的 $V$ 个多视图图像 $\{I_v, \boldsymbol{\pi}_v\}_{v=1}^V$,前馈3DGS模型预测一组高斯属性:

$$ f_\theta: \{I_v, \boldsymbol{\pi}_v\}_{v=1}^V \mapsto \{(\boldsymbol{\mu}_g, q_g, s_g, \alpha_g, SH_g)\}_{g=1}^G, \quad (1) $$

其中每个高斯由其中心 $\boldsymbol{\mu}_g$、旋转四元数 $q_g$、尺度 $s_g$、不透明度 $\alpha_g$ 和球谐函数 $SH_g$ 参数化。

许多前馈方法以像素对齐的方式回归高斯,其中每个图元的中心由预测的深度和相应的相机射线确定:

$$ \boldsymbol{\mu}_v(x) = o_v + d_v(x) \mathbf{r}_v(x), \quad (2) $$

其中 $o_v \in \mathbb{R}^3$ 和 $\mathbf{r}_v(x) \in \mathbb{R}^3$ 分别是像素 $x$ 处的相机原点和射线方向。这将中心预测简化为逐像素深度估计,但将每个图元绑定到输入像素:总的高斯预算及其空间分布由输入像素网格决定,而不是由底层场景决定。因此,像素对齐公式在平凡区域产生许多冗余图元,而在具有挑战性的区域分配不足。因此,我们将这种低效视为公式层面的问题:前馈3DGS模型应根据场景的重建难度分配表示,而不是输入像素网格。

4 ATSplat 框架

我们介绍了 ATSplat,这是一个前馈3DGS框架,它恢复了每场景3DGS优化的场景自适应高斯放置。我们的核心思想是将3DGS的三个指导原则——稀疏初始化、自由3D放置、自适应容量分配——重新表述为以一组3D锚点Token为中心的前馈操作。具体而言,稀疏初始化是通过对粗略块进行逆投影到3D实现的,自由3D放置是通过从每个锚点回归局部图元偏移量实现的,自适应容量分配是通过在解码过程中扩展高不确定性锚点实现的。

图2 (a) 说明了框架的概览。给定多视图图像,多视图编码器首先提取粗略块特征并预测块级深度。深度被逆投影

第 4 页

4 • In Cho, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, and Seon Joo Kim

(a) Framework Overview sparse scaffold initialization

Image-to-3D Decoder DINO Multi-view coarse tokens head coarse Encoder × 𝐿𝐿𝑑𝑑 ATE multi-view image tokens CA CA sparse 3D module images Gaussian anchor tokens coarse depth Linear fine 3D Gaussians image tokens

(b) Adaptive Token Expansion (c) Anchors to local Gaussians

Uncertainty supervision ATE module 0.2 head 𝑳𝑳𝒖𝒖𝒖𝒖𝒖𝒖 head 0.3 intermediate rendered Uncertainty Gaussian error maps uncertainty maps 0.7 Decoded Gaussians with anchor tokens 3D offsets

图 2. (a) 框架概览。给定具有位姿的多视图图像,多视图图像编码器提取粗略的块特征并估计块级深度。 预测的深度和块特征用于初始化一组稀疏的 3D 锚点 Token,作为稀疏的场景骨架。图像到 3D 解码器 通过 𝐿𝑑 解码块细化这些锚点,并包含一个自适应 Token 扩展(ATE)模块,该模块为重建不足的区域分配额外的容量。高斯头随后将每个细化后的锚点解码为一组局部 3D 高斯。 (b) 自适应 Token 扩展。在每个解码块中, 一个轻量级 MLP 预测每个锚点的不确定性分数,该分数由从中间高斯计算出的 2D 误差图进行监督。具有高不确定性分数的锚点被扩展为多个 Token,从而在需要的地方增加表示容量。 (c) 锚点到局部高斯。每个细化后的锚点 Token 被回归为 𝐾 个局部高斯基元,其中心相对于锚点作为 3D 偏移放置,将基元位置与输入像素网格解耦。

与相机射线结合,将粗略的块特征分配给形成锚点骨架的稀疏 3D 位置。图像到 3D 解码器 然后通过交叉注意力细化这些锚点 Token,以细粒度 图像特征。在解码器内部,自适应 Token 扩展 (ATE) 模块选择性地扩展与重建不足区域相关的 Token, 仅在需要的地方增加表示容量。最后,每个细化后的 Token 被解码为一组 局部高斯,其中心预测为相对于其锚点的 3D 偏移, 将基元放置与输入像素网格解耦。 以下段落描述每个组件的细节。 多视图图像编码器。编码器从输入图像中提取粗分辨率下的跨视图块特征。每个视图 首先使用冻结的 DINO 主干网络将视图标记化为粗略的块。 我们还向块 Token 添加 Plücker 射线图嵌入以 注入相机几何信息。多视图 Transformer 然后展平所有视图上的 块 Token 并应用全局自注意力以 产生跨视图图像特征。 = MLP(ˆf𝑖), (4) (Δ𝝁𝑖,𝑘, q𝑖,𝑘, s𝑖,𝑘, 𝛼𝑖,𝑘, SH𝑖,𝑘) 𝑘=1𝐾 初始化稀疏锚点 Token。然后,我们通过为每个编码的块计算 3D 坐标来初始化稀疏 3D 骨架,这些坐标作为初始锚点 Token。对于每个在视图 𝑣𝑖 中像素 x𝑖 处的块特征 f𝑖∈R𝐶, 我们使用轻量级 MLP 从 f𝑖 预测块级深度 ˆ𝑑𝑖,并沿相应的射线反投影: p𝑖= o𝑣𝑖+ ˆ𝑑𝑖r𝑣𝑖(x𝑖). (3) 5 自适应 Token 扩展 对 (p𝑖, f𝑖) 定义了一个 3D 锚点 Token——锚定在 p𝑖 处 并携带编码特征 f𝑖。我们进一步注入局部 3D 上下文 与每场景优化不同,前馈模型在解码期间无法直 接访问渲染误差或梯度,这使得 通过将其与 𝑘 个最近邻 (kNN) 聚合 via 一个 PointNet 风格的算子 [Qi et al. 2017]。 图像到 3D 解码器。解码器通过交叉注意力细化锚点 Token, 将细粒度图像信息投影。对于 每个视图,我们使用轻量级的每视图特征提取器提取两倍于粗略分辨率的细粒度块特征。这添加了 Plücker 射线图嵌入到块中,并应用两个每视图自注意力层。解码器然后应用由 𝐿 个块组成的堆栈,每个块由一个 ATE 模块和交叉注意力层组成。 ATE 模块选择性地扩展与重建不足区域相关的锚点,逐步增加表示 容量。我们在第 5 节中描述 ATE 的细节。 锚点到局部 3D 高斯。每个细化后的锚点 Token ˆ𝑓𝑖最终被回归为一组 𝐾 个局部高斯基元。一个轻量 高斯头,由 2 层 MLP 组成,将锚点 特征映射到 𝐾 组高斯属性: 初始化稀疏锚点 Token。然后,我们通过为每个编码的块计算 3D 坐标来初始化稀疏 3D 骨架,这些坐标作为初始锚点 Token。对于每个在视图 𝑣𝑖 中像素 x𝑖 处的块特征 f𝑖∈R𝐶, 我们使用轻量级 MLP 从 f𝑖 预测块级深度 ˆ𝑑𝑖,并沿相应的射线反投影: p𝑖= o𝑣𝑖+ ˆ𝑑𝑖r𝑣𝑖(x𝑖). (3) 5 自适应 Token 扩展 对 (p𝑖, f𝑖) 定义了一个 3D 锚点 Token——锚定在 p𝑖 处 并携带编码特征 f𝑖。我们进一步注入局部 3D 上下文 与每场景优化不同,前馈模型在解码期间无法直 接访问渲染误差或梯度,这使得

第 5 页

ATSplat: 紧凑的前馈式3D高斯泼溅 结合自适应Token扩展 • 5

识别重建不足的区域并非易事。因此,我们通过一个轻量级MLP来估算与每个锚点相关的渲染误差,并利用这些预测结果,有选择地扩展那些需要额外表示能力的锚点。

在每一个解码器块中,我们通过轻量级MLP $g_\phi$ 为每个锚点Token $f_i$ 估计一个不确定性分数:

$u_i= g_\phi(f_i) \in \mathbb{R}$. (6)

我们选取得分最高的前 $\rho_l$ 比例的锚点作为扩展目标。每个被选中的特征通过一个线性投影,生成 $M$ 个残差特征,从而产生 $M$ 个子Token,它们共享父锚点坐标 $p_i$:

$[\Delta f_{i,1}, \dots, \Delta f_{i,M}] = W f_i, \quad f_{i,m}= f_i+ \Delta f_{i,m}$. (7)

扩展后的Token与未被选中的Token拼接后,传递给下一个解码器块。这种设计在单次前向传播中即可识别出重建不足的区域,无需在推理阶段进行辅助渲染或反向传播。

在2D空间中学习不确定性。为了使预测的不确定性与实际的重建难度对齐,我们使用2D重建误差对 $g^{(l)}_\phi$ 进行监督。在第 $l$ 个解码器块之后,我们将高斯头应用于当前的锚点,以获得中间高斯集合 $G^{(l)}$。对于每个锚点 $i$,分数 $u^{(l)}_i$ 作为标量属性附加到其 $K$ 个高斯上,并通过标准alpha混合进行光栅化,生成2D不确定性图 $\hat{U}^{(l)}$。

我们将 $\hat{U}^{(l)}$ 与 $G^{(l)}$ 的误差图 $U^{(l)}$ 进行监督:

$L^{(l)}_{unc} = \| \hat{U}^{(l)} – \text{sg} U^{(l)} \|_1$, (8)

其中 $\text{sg}(\cdot)$ 阻止梯度流入高斯参数,使得该损失仅更新 $g^{(l)}_\phi$。误差图 $U^{(l)}$ 是使用渲染结果 $G^{(l)}$ 和真实图像计算的。我们经验性地使用D-SSIM来计算这些中间误差图。

6 训练 我们以端到端的方式训练ATSplat,使用最终渲染损失、中间渲染损失和不确定性监督。最终渲染损失结合了MSE与感知项:

$L_{\text{render}} = L_{\text{MSE}} + \lambda_p \cdot L_{\text{perceptual}}, (9)$

其中我们使用 $\lambda_p= 0.5$。为了训练中间解码器块中的不确定性头,我们额外使用辅助渲染损失 $L^{(l)}_{\text{interm}}$ 对每个中间高斯集合 $G^{(l)}$ 进行监督。为了效率,我们在中间渲染损失中用 $L_{\text{D-SSIM}}$ 替换感知项。完整的目标函数为

$\mathcal{L} = L_{\text{render}} + \sum_{l=1}^{L} \lambda_{\text{int}} \cdot L^{(l)}_{\text{interm}} + \lambda_{\text{unc}} \cdot L^{(l)}_{\text{unc}}, . (10)$

其中我们在所有实验中使用 $\lambda_{\text{interm}} = 0.5$ 和 $\lambda_{\text{unc}} = 0.1$。

7 实验 7.1 实验设置 数据集。我们在两个广泛用于前馈式新视角合成的数据集上训练和评估ATSplat:RealEstate10K [Zhou et al. 2018] 和 DL3DV [Ling et al. 2024]。RealEstate10K 由从YouTube收集的家居游览视频组成,主要包含受限的室内场景。DL3DV 提供了更大规模的室内外环境捕获,覆盖更大的空间范围、更多样化的场景布局和复杂的几何结构。遵循之前的工作 [Charatan et al. 2024; Chen et al. 2024a; Xu et al. 2025],我们使用相同的预处理步骤和训练/测试划分。

评估协议。我们报告PSNR、SSIM和LPIPS [Zhang et al. 2018] 以评估渲染质量,并通过高斯数量和推理运行时间来衡量效率。除非另有说明,运行时间是在单个RTX 3090 GPU上测量的。对于RealEstate10K,我们使用pixelSplat [Charatan et al. 2024] 中提供的评估视角索引。对于DL3DV,我们遵循DepthSplat [Xu et al. 2025] 的协议,并在2、4、6输入视角设置下进行评估。我们还按照NoPoSplat [Ye et al. 2025b] 在补充材料中评估了不同视角重叠下的结果。

基线。我们将ATSplat与最近的前馈式3DGS方法进行对比,包括pixelSplat [Charatan et al. 2024]、MVSplat [Chen et al. 2024a]、DepthSplat [Xu et al. 2025]、NoPoSplat [Ye et al. 2025b] 和 iLRM [Kang et al. 2025](如适用)。对于定量比较,当方法遵循相同的评估协议时,我们使用其报告的数据;否则,我们在相同的评估设置下评估可用的公共检查点。对于DL3DV上的定性比较,我们主要与DepthSplat进行对比,因为它是该设置下唯一拥有公共检查点的前馈式3DGS基线。对于高分辨率评估,我们进一步与3DGS [Kerbl et al. 2023] 和 Mip-Splatting [Yu et al. 2024a] 作为基于优化的基线进行对比。这些方法使用输入视角的稀疏SfM [Schonberger and Frahm 2016] 点进行初始化,并优化30K次迭代。

实现细节。ATSplat包含一个具有12层全局自注意力层的多视图编码器,后接一个具有4个块的解码器。我们在所有解码器块(除了第一个块)中采用冻结的DINOv2-B [Oquab et al. 2023] 主干网络进行粗粒度特征提取。ATE模块的Token选择比例 $\rho_l$ 分别为0.5、0.5和0.25,扩展比例为2。每个锚点Token最终被解码为 $K=16$ 个局部高斯。ATSplat首先在RealEstate10K上使用2个输入视角在4块RTX 4090 GPU上训练约两天,作为基础模型。随后,它在DL3DV上使用6个输入视角在4块H200 GPU上训练两天。对于高分辨率设置,我们进一步使用10个输入视角在8块H200 GPU上微调该模型,耗时不到两天。更多细节请参阅补充材料。

Table 1. RealEstate10K 在 256 × 256 分辨率下、使用2个输入视角的定量结果。由于缺乏该设置的公开代码,省略了GS-LRM和LongLRM的推理时间。

Method PSNR↑ SSIM↑ LPIPS↓ #Gauss.↓ Time(s)↓ PixelSplat [Charatan et al. 2024] 25.89 0.858 0.142 131K 0.127 MVSplat [Chen et al. 2024a] 26.39 0.869 0.128 131K 0.044 GS-LRM [Zhang et al. 2024a] 28.10 0.892 0.114 131K – DepthSplat [Xu et al. 2025] 27.47 0.889 0.114 131K 0.067 LongLRM [Ziwen et al. 2025] 28.54 0.895 0.109 131K – iLRM [Kang et al. 2025] 28.65 0.900 0.110 131K 0.025 TokenGS [Ren et al. 2026] 28.41 0.903 0.135 262K 0.066 Ours 28.46 0.894 0.118 23K 0.022

第 6 页

6 • 赵正焕 (Cho, Jeonghwan Cho), 柳美珍 (Mijin Yoo), 李 Gim Hee (Gim Hee Lee), 金善宙 (Seon Joo Kim)

表 2. DL3DV 数据集在 256 × 448 分辨率下的定量比较。*: 仅在 6 个输入视角下报告,因为其他设置下的代码和预训练权重均未公开。iLRM 在 2 倍下采样分辨率下预测像素对齐的高斯,这导致高斯数量减少 4 倍。

2 个输入视角 4 个输入视角 6 个输入视角

方法 PSNR↑ SSIM↑ LPIPS↓ #高斯↓ PSNR↑ SSIM↑ LPIPS↓ #高斯↓ PSNR↑ SSIM↑ LPIPS↓ #高斯↓

MVSplat [Chen et al. 2024a] 17.54 0.529 0.402 229K 21.63 0.721 0.233 458K 22.93 0.775 0.193 688K DepthSplat [Xu et al. 2025] 19.31 0.615 0.310 229K 23.12 0.780 0.178 458K 24.19 0.823 0.147 688K iLRM* [Kang et al. 2025] – – – – – – – – 25.60 0.830 0.168 172K TokenGS [Ren et al. 2026] 19.35 0.609 0.440 262K 23.02 0.747 0.326 262K 23.69 0.766 0.311 262K SparseSplat* [Zhang et al. 2026a] – – – – – – – – 24.20 0.817 0.168 150K ours 20.07 0.630 0.332 40K 25.67 0.827 0.172 80K 27.28 0.868 0.138 120K

表 3. DL3DV 数据集在 512 × 960 分辨率下与 100 帧基线方法的定量比较。顶部组列出基于优化的方法,底部组列出前馈 3DGS 方法。*: 由于内存溢出,DepthSplat 的运行时间是在单个 A6000 GPU 上测量的。 expanded-0 parent expanded-1

方法 PSNR↑ SSIM↑ LPIPS↓ #高斯↓ 时间(s)↓

3DGS [Kerbl et al. 2023] 22.87 0.758 0.229 553K > 10 m Mip-Splatting [Yu et al. 2024a] 22.52 0.746 0.240 676K > 10 m

DepthSplat* [Xu et al. 2025] 21.33 0.740 0.270 5898K 0.758 s expanded-1 iLRM [Kang et al. 2025] 24.35 0.781 0.256 1474K 0.700 s parent expanded-0 ours 24.85 0.794 0.241 311K 0.677 s

渲染结果 父节点 扩展 高斯

7.2 结果 图 3. 扩展 Token 的可视化。每个扩展 我们首先在许多先前工作中采用的通用基准设置上评估 ATSplat 扩展 Token 的坐标计算为其解码高斯的质心。 [Charatan et al. 2024; Chen et al. 2024a; Kang et al. 2025; Xu et al. 2025]。其中包括在 RealEstate10K 上使用两个输入视角在 256 × 256 分辨率下的比较,以及 在 DL3DV 上使用不同输入视角设置在 256 × 448 分辨率下的比较。我们进一步鼓励读者查看补充材料以获取更多定性结果和视频比较。

RealEstate10K。表 1 报告了 RealEstate10K 上的双视角结果。 ATSplat 实现了与最先进的前馈方法相当的渲染质量,同时仅使用 23K 个高斯,与密集的像素对齐公式相比减少了 5.7 倍。图 5 进一步证实了这一点,显示了对细部和几何结构的准确重建。通过从稀疏锚点分配图元并选择性地扩展它们,ATSplat 与密集的像素对齐基线相比,以更小的表示保持了高质量的结果。我们在补充材料中进一步提供了不同视角重叠率的评估,这突显了我们 3D 锚点设计的有效性。

DL3DV。接下来我们在 DL3DV 上评估 ATSplat,该数据集包含具有复杂几何结构的更具挑战性的场景。表 2 报告了使用 2、4 和 6 个输入视角在 256 × 448 分辨率下的结果。在所有输入视角设置下,ATSplat 优于先前使用显著更少高斯数量的前馈基线,证明了稀疏到自适应的公式在更大且更多样的场景中仍然有效。图 6 也支持这一观察结果,纤细结构和复杂几何结构被忠实恢复。特别是,iLRM [Kang et al. 2025] 通过在较低的空间分辨率下预测高斯来减少高斯数量。然而,这种均匀减少降低了整个场景的高斯密度,导致细部结构或复杂几何结构区域分配不足。

7.3 高分辨率新视角合成 我们进一步在 DL3DV 上以 512 × 960 分辨率评估 ATSplat,以证明我们的稀疏到自适应设计可扩展到高分辨率渲染。为了效率,我们将粗略补丁分支(即 DINO)使用的图像下采样 2 倍。我们还增加了第一个 ATE 块的选择比率 $\rho_1$,从 0.5 增加到 0.8,因为在此分辨率下暴露的更细细节受益于更多的扩展。我们将可用前馈 3DGS 方法与基于优化的 3DGS 基线进行比较。对于 DepthSplat [Xu et al. 2025],我们使用在 448 × 768 分辨率下训练的公开检查点,这是唯一适用于此设置的发布权重的配置。

如表 3 所示,ATSplat 在单次前向传播中重建高分辨率场景,并在不到一秒内完成推理。它实现了令人印象深刻的渲染结果,同时使用的 Gaussians 数量远少于以前的密集像素对齐前馈方法,这一点也可以在图 7 中看到。这种效率在高分辨率下变得尤为重要,因为在高分辨率下,像素对齐方法通常会产生超过一百万个高斯。

7.4 分析 为了更好地理解我们核心组件的行为,我们对扩展 Token 和不确定性预测提供了分析。

第 7 页

ATSplat: 紧凑的前馈式 3D 高斯泼溅 结合自适应 Token 扩展 • 7

表 4. 3D 锚点设计的消融实验结果。 表 5. ATE 模块的消融实验结果。

锚点初始化 高斯中心 PSNR↑ SSIM↑ LPIPS↓ 方法 PSNR↑ SSIM↑ LPIPS↓

无 射线 + 深度 27.35 0.874 0.138 随机 27.97 0.888 0.126 可学习 直接 xyz 24.62 0.802 0.204 最远点采样 (FPS) 27.98 0.888 0.125 无 直接 xyz 20.87 0.650 0.364 全可学习 (STE) [Yin et al. 2019] 27.93 0.887 0.125 无扩展 27.02 0.868 0.153 图块深度 锚点 + 偏移 28.46 0.894 0.118 不确定性 28.46 0.894 0.118

场景特定的几何结构。第三种方法直接回归绝对 3D 高斯中心,而不是围绕粗略锚点的局部偏移。 如表 4 所示,提出的锚点-偏移设计实现了 最佳的重建质量。像素对齐变体将 高斯约束在输入像素上,这限制了我们的自适应 扩展的灵活性。后两种变体缺乏场景特定的几何 先验,使得高斯放置在没有空间 指导的情况下被学习。这些结果表明,粗略的 3D 锚点提供了 有意义的场景结构,而局部偏移保留了精 确高斯放置所需的灵活性。

图像 误差图 不确定性 选定的 Token ATE 模块。我们进一步对 ATE 中的选 择策略和扩展进行消融。所有基于选择的变体都使用相同的扩展 图 4. 最后一个块中不确定性分数和选定 Token 的可视化。 比率并生成相同数量的高斯。如表 5 所示, 我们可视化了实际误差图 (D-SSIM)、预测的不确定性 随机选择和 FPS 提供的增益有限,因为它们分配 图,以及从选定 Token 解码出的高斯的 alpha 图。 容量时未针对困难区域。我们还与 直通估计器 (STE) [Yin et al. 2019] 进行了比较,遵循 先前的上采样设计 [Nam et al. 2025],但发现它并没有 扩展 Token 的行为。我们首先分析 ATE 如何增加 比简单的启发式选择有改进。完全移除 Token 扩展 局部表示容量。对于每个扩展的 Token,我们通过平均该 Token 解码出的高斯的中心 来计算一个代表性的 3D 位置。虽然 ATE 在扩展期间没有显式 更新锚点坐标,但扩展的 Token 8 结论与未来工作特征产生不同的局部高斯偏移和特征。如 所示,子 Token 在其父 Token 周围扩散,并 我们展示了 ATSplat,一种前馈式 3D 高斯泼溅框 覆盖不同的邻近区域,而不是坍缩到相同 架,恢复了 3DGS 管道中的场景自适应容量分配。 位置。这支持了 ATE 学习基于详细场景内容来细化局部几何和 与其将高斯密集地分配给输入 外观。 图像网格,ATSplat 构建了一组稀疏的自适应 3D 锚点 预测的不确定性和选定的 Token。我们进一步分析 Token,将它们解码为一组具有 3D 相对 学习的确定性是否为重建难度提供了有意义的代理 偏移的局部高斯,并逐步选择并扩展与 。如 Fig. 4 所示,预测的不确定性 困难区域相关的 Token。这种从稀疏到自适应的公式化 在渲染误差较大的区域周围较高,包括 将高斯放置与输入像素解耦,并允许我们 精细结构和视觉复杂区域。选定的 Token 集中 根据场景复杂性分配表示容量。 在这些不确定区域,表明 ATE 成功 ATSplat 以前馈框架重新解释了 3DGS 的核心设计原则, 识别了哪里需要额外的高斯,并将 以超过 5.7 倍更少的高斯数量实现了最先进的质量。 更多容量分配给这些区域,并通过多样化的扩展 Token。 虽然 ATSplat 解决了前馈式 3DGS 中的场景自适应容量分配 问题,但仍有几个方向有待未来工作 7.5 消融实验 探索。首先,ATSplat 自适应地扩展 Token,但不修剪 我们通过消融实验检查了两个核心组件的效果: 在解码过程中变得冗余的 Token。类似于 3DGS 的修剪 3D 锚点设计和基于不确定性的选择。所有 机制可能是提高解码器效率和更有效的容量分配的关键。其次, 消融实验均在 RealEstate10K 上进行,使用两个输入视图。 可以进行几项架构改进以实现更具可扩展性的 3D 锚点设计。我们将我们的锚点-偏移公式化 设计,将 ATSplat 扩展到更大规模的场景、更多的输入视图 与三种替代方案进行比较。第一种是像素对齐的射线-深度公 和更高的分辨率。最后,将 ATSplat 扩展到无位姿设置 式化,其中高斯绑定到输入像素并沿 将扩大其在野外图像中的适用性。 相机射线提升。第二种使用可学习的初始 Token,而没有粗略

第 8 页

8 • 在 Cho, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, 和 Seon Joo Kim

参考文献 Seungtae Nam, Xiangyu Sun, Gyeongjin Kang, Younggeun Lee, Seungjun Oh, 和 Honggyu An, Jaewoo Jung, Mungyeom Kim, Chaehyun Kim, Minkyeong Jeon, Jisang Eunbyung Park。2025。生成式致密化:学习对高斯进行致密化以实现 Han, Kazumi Fukuda, Takuya Narihira, Hyunah Ko, Junsu Kim, Sunghwan Hong, 高保真可泛化3D重建。在计算机视觉与模式识别会议论文集(CVPR)中。26683–26693。 Yuki Mitsufuji, 和 Seungryong Kim。2025。C3G:使用2K高斯学习紧凑3D表示。arXiv预印本 arXiv:2512.04021 (2025)。 Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Jonathan T. Barron, Ben Mildenhall, Matthew Tancik, Peter Hedman, Ricardo Martin- Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Brualla, 和 Pratul P. Srinivasan。2021。Mip-NeRF:用于抗锯齿神经辐射场的多尺度表示。在IEEE/CVF国际 等。2023。Dinov2:无监督学习鲁棒视觉特征。arXiv 计算机视觉会议(ICCV)论文集。 Charles R Qi, Hao Su, Kaichun Mo, 和 Leonidas J Guibas。2017。Pointnet:用于3D分类和分割的点集深度学习。在 Eric R Chan, Connor Z Lin, Matthew A Chan, Koki Nagano, Boxiao Pan, Shalini IEEE计算机视觉与模式识别会议论文集。652–660。 De Mello, Orazio Gallo, Leonidas J Guibas, Jonathan Tremblay, Sameh Khamis, 等。 Jiawei Ren, Michal Jan Tyszkiewicz, Jiahui Huang, 和 Zan Gojcic。2026。TokenGS: 2022。高效的几何感知3D生成对抗网络。在IEEE/CVF计算机视觉与模式识别会议论文集。16123–16133。 使用可学习Token将3D高斯预测与像素解耦。arXiv David Charatan, Sizhe Lester Li, Andrea Tagliasacchi, 和 Vincent Sitzmann。2024。 预印本 arXiv:2604.15239 (2026)。 pixelSplat:来自图像对的3D高斯泼溅,用于可扩展的可泛化3D重建。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集。19457–19467。 Johannes L Schonberger 和 Jan-Michael Frahm。2016。重新审视运动恢复结构。 在IEEE计算机视觉与模式识别会议论文集。4104– Anpei Chen, Zexiang Xu, Andreas Geiger, Jingyi Yu, 和 Hao Su。2022。TensoRF: 4113。 张量辐射场。在欧洲计算机视觉会议(ECCV)上。 Stanislaw Szymanowicz, Chrisitian Rupprecht, 和 Andrea Vedaldi。2024。Splatter Anpei Chen, Zexiang Xu, Fuqiang Zhao, Xiaoshuai Zhang, Fanbo Xiang, Jingyi Yu, 和 图像:超快单视图3D重建。在IEEE/CVF Hao Su。2021。Mvsnerf:从多视图立体视觉快速重建可泛化辐射场。在IEEE/CVF国际计算机 计算机视觉与模式识别会议论文集。10208–10217。 视觉会议论文集。14124–14133。 Jiaxiang Tang, Zhaoxi Chen, Xiaokang Chen, Tengfei Wang, Gang Zeng, 和 Ziwei Yuedong Chen, Haofei Xu, Chuanxia Zheng, Bohan Zhuang, Marc Pollefeys, Andreas Liu。2024。LGM:用于高分辨率3D内容创建的大型多视图高斯模型。在欧洲计算机视觉会议(ECCV)上。 Geiger, Tat-Jen Cham, 和 Jianfei Cai。2024a。MVSplat:从稀疏多视图图像高效3D高斯 泼溅。在欧洲计算机视觉会议(ECCV)上。 Qianqian Wang, Zhicheng Wang, Kyle Genova, Pratul P Srinivasan, Howard Zhou, Yuedong Chen, Chuanxia Zheng, Haofei Xu, Bohan Zhuang, Andrea Vedaldi, Tat- Jonathan T Barron, Ricardo Martin-Brualla, Noah Snavely, 和 Thomas Funkhouser。 Jen Cham, 和 Jianfei Cai。2024b。Mvsplat360:从稀疏视图前馈式360场景合成。神经信息处理系统进展 37 (2024), 2021。Ibrnet:学习基于多视图图像的渲染。在IEEE/CVF计算机视觉与模式识别会议论文集。4690–4699。 107064–107086。 Weijie Wang, Yeqing Chen, Zeyu Zhang, Hengyu Liu, Haoxiao Wang, Zhiyuan Feng, Antoine Guédon 和 Vincent Lepetit。2024。Sugar:用于高效3D网格重建和高质量网格渲染的表面对齐高斯泼溅。在IEEE/CVF计算机视觉与模式识别会议论文集。5354–5363。 Wenkang Qin, Feng Chen, Zheng Zhu, Donny Y. Chen, 和 Bohan Zhuang。2025a。 Sunghwan Hong, Jaewoo Jung, Heeseong Shin, Jisang Han, Jiaolong Yang, Chong Luo, VolSplat:重新思考基于体素对齐预测的前馈式3D高斯泼溅。arXiv预印本 arXiv:2509.19297 (2025)。 和 Seungryong Kim。2024。Pf3plat:免位姿前馈式3D高斯泼溅。 Yiming Wang, Lucy Chai, Xuan Luo, Michael Niemeyer, Manuel Lagunas, Stephen arXiv预印本 arXiv:2410.22128 (2024)。 Lombardi, Siyu Tang, 和 Tiancheng Sun。2026。学习高效融合与细化 Binbin Huang, Zehao Yu, Anpei Chen, Andreas Geiger, 和 Shenghua Gao。2024。用于几何精确辐射场的2D 以用于前馈式3D高斯泼溅。神经信息处理系统进展 38 (2026), 76311–76341。 高斯泼溅。在ACM SIGGRAPH 2024会议论文中。1–11。 Yunsong Wang, Tianxin Huang, Hanlin Chen, 和 Gim Hee Lee。2024。Freesplat: Roni Itkin, Noam Issachar, Yehonatan Keypur, Xingyu Chen, Anpei Chen, 和 Sagie 面向室内场景自由视角合成的可泛化3D高斯泼溅。 Benaim。2026。GlobalSplat:通过全局场景Token实现高效前馈式3D高斯泼溅。arXiv预印本 arXiv:2604.15284 (2026)。 神经信息处理系统进展 37 (2024), 107326–107349。 Lihan Jiang, Yucheng Mao, Linning Xu, Tao Lu, Kerui Ren, Yichen Jin, Xudong Xu, Yunsong Wang, Tianxin Huang, Hanlin Chen, 和 Gim Hee Lee。2025b。Freesplat++: Mulin Yu, Jiangmiao Pang, Feng Zhao, 等。2025。Anysplat:从非受限视图前馈式3D 用于高效室内场景重建的可泛化3D高斯泼溅。arXiv 高斯泼溅。ACM图形学汇刊 (TOG) 44, 6 (2025), 1–16。 预印本 arXiv:2503.22986 (2025)。 Gyeongjin Kang, Seungtae Nam, Xiangyu Sun, Sameh Khamis, Abdelrahman Mohamed, Guanjun Wu, Taoran Yi, Jiemin Fang, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu 和 Eunbyung Park。2025。iLRM:一个迭代式大型3D重建模型。arXiv预印本 arXiv:2507.23277 (2025)。 Liu, Qi Tian, 和 Xinggang Wang。2024。用于实时动态 Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis, 等。2023。 场景渲染的4D高斯泼溅。在IEEE/CVF计算机视觉与模式识别会议论文集。20310–20320。 用于实时辐射场渲染的3D高斯泼溅。ACM图形学汇刊 42, Haofei Xu, Songyou Peng, Fangjinhua Wang, Hermann Blum, Daniel Barath, Andreas 4 (2023), 139–1。 Geiger, 和 Marc Pollefeys。2025。DepthSplat:连接高斯泼溅与深度。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集。16453–16463。 Injae Kim, Chaehyeon Kim, Minseong Bae, Minseok Joo, 和 Hyunwoo J. Kim。2026。 Yinghao Xu, Zifan Shi, Wang Yifan, Hansheng Chen, Ceyuan Yang, Sida Peng, Yujun F4Splat:用于前馈式3D高斯泼溅的前馈式预测致密化。arXiv预印本 arXiv:2603.21304 (2026)。 Shen, 和 Gordon Wetzstein。2024。GRM:用于高效3D重建与生成的 Lu Ling, Yichen Sheng, Zhi Tu, Wentian Zhao, Cheng Xin, Kun Wan, Lantao Yu, Qianyu 大型高斯重建模型。在欧洲计算机视觉会议(ECCV)上。 Guo, Zixun Yu, Yawen Lu, 等。2024。Dl3dv-10k:用于基于深度学习的3D视觉的大规模场景数据集。在IEEE/CVF计算机视觉与模式识别会议论文集。22160–22169。 Zeyu Yang, Hongye Yang, Zijie Pan, 和 Li Zhang。2024。使用4D高斯泼溅进行 Botao Ye, Boqi Chen, Haofei Xu, Daniel Barath, 和 Marc Pollefeys。2025a。YoNoSplat: 实时照片级真实感动态场景表示与渲染。在 你只需要一个模型用于前馈式3D高斯泼溅。arXiv预印本 国际学习表征会议,卷 2024。9142–9159。 arXiv:2511.07321 (2025)。 Botao Ye, Sifei Liu, Haofei Xu, Xueting Li, Marc Pollefeys, Ming-Hsuan Yang, 和 Ilya Loshchilov 和 Frank Hutter。2017。解耦权重衰减正则化。arXiv预印本 arXiv:1711.05101 (2017)。 Songyou Peng。2025b。无需位姿,没有问题:来自稀疏无位姿图像的 Tao Lu, Mulin Yu, Linning Xu, Yuanbo Xiangli, Limin Wang, Dahua Lin, 和 Bo Dai。2024。 惊人简单的3D高斯泼溅。在国际学习表征会议, Scaffold-gs:用于视图自适应渲染的结构化3D高斯。在IEEE/CVF计算机视觉与模式识别会议论文集。20654–20664。 卷 2025。54009–54033。 Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik, Jonathan T. Barron, Ravi Ra- Penghang Yin, Jiancheng Lyu, Shuai Zhang, Stanley Osher, Yingyong Qi, 和 Jack Xin。 mamoorthi, 和 Ren Ng。2020。NeRF:将场景表示为用于视图合成的神经辐射场。在欧洲计算机视觉会议(ECCV)上。 2019。理解训练激活量化神经网络中的直通估计器。在国际学习表征会议。 Arthur Moreau, Richard Shaw, Michal Nazarczuk, Jisu Shin, Thomas Tanay, Zhensong Alex Yu, Vickie Ye, Matthew Tancik, 和 Angjoo Kanazawa。2021。pixelnerf: Zhang, Songcen Xu, 和 Eduardo Pérez-Pellitero。2025。Off The Grid:检测前馈式3D高斯泼溅的基元。arXiv预印本 arXiv:2512.15508 来自一张或少数几张图像的神经辐射场。在IEEE/CVF计算机视觉与模式识别会议论文集。4578–4587。 (2025)。 Zehao Yu, Anpei Chen, Binbin Huang, Torsten Sattler, 和 Andreas Geiger。2024a。 Mip-Splatting:无混叠3D高斯泼溅。在IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集。19447–19456。

Thomas Müller, Alex Evans, Christoph Schied, 和 Alexander Keller。2022。Instant Neural Graphics Primitives with a Multiresolution Hash Encoding. ACM Transactions on Graphics (SIGGRAPH) 41, 4 (2022), 102:1–102:15. doi:10.1145/3528223.3530127

Zehao Yu, Torsten Sattler, 和 Andreas Geiger。2024b。Gaussian opacity fields: Efficient adaptive surface reconstruction in unbounded scenes. ACM Transactions on Graphics (ToG) 43, 6 (2024), 1–13.

第 9 页

ATSplat: 紧凑的前馈式3D高斯泼溅 结合自适应Token扩展 • 9

Kai Zhang, Sai Bi, Hao Tan, Yuanbo Xiangli, Nanxuan Zhao, Kalyan Sunkavalli, 和 Zexiang Xu. 2024a. GS-LRM: 用于3D高斯泼溅的大型重建模型。 在欧洲计算机视觉会议 (ECCV) 上。 Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, 和 Oliver Wang. 2018. 深度特征作为感知度量的不合理有效性。在 IEEE 计算机视觉与模式识别会议论文集。586–595。 Shengjun Zhang, Xin Fei, Fangfu Liu, Haixu Song, 和 Yueqi Duan. 2024b. 高斯图网络:从多视图图像中学习高效且可泛化的高斯表示。神经信息处理系统进展 37 (2024), 50361–50380。 Xiaoxue Zhang, Xiaoxu Zheng, Yixuan Yin, Tiao Zhao, Kaihua Tang, Michael Bi Mi, Zhan Xu, 和 Dave Zhenyu Chen. 2026b. AnchorSplat: 结合3D几何先验的前馈式3D高斯泼溅。arXiv 预印本 arXiv:2604.07053 (2026)。 Zicheng Zhang, Xiangting Meng, Ke Wu, 和 Wenchao Ding. 2026a. SparseSplat: 迈向具有非像素对齐预测的实用前馈式3D高斯泼溅。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)。 Tinghui Zhou, Richard Tucker, John Flynn, Graham Fyffe, 和 Noah Snavely. 2018. 立体放大:使用多平面图像学习视图合成。arXiv 预印本 arXiv:1805.09817 (2018)。 Chen Ziwen, Hao Tan, Kai Zhang, Sai Bi, Fujun Luan, Yicong Hong, Li Fuxin, 和 Zexiang Xu. 2025. Long-lrm: 用于宽覆盖高斯泼溅的长序列大型重建模型。在 IEEE/CVF 国际计算机视觉会议论文集。4349–4359。

第 10 页

10 • 在 Cho, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, 和 Seon Joo Kim 的研究中

输入 MVSplat DepthSplat iLRM ours 真实值

图 5. 在 RealEstate10K 数据集上,使用 2 个输入视图、分辨率为 256 × 256 的定性比较。ATSplat 在重建几何结构的同时,能够重建挑战性区域的精细细节,与密集的像素对齐基线相比,使用的 3D 高斯泼溅图元数量减少了 5.7 倍。

输入图像 DepthSplat ours 真实值

图 6. 在 DL3DV 数据集上,使用 6 个输入视图、分辨率为 256 × 448 的定性比较。ATSplat 仅使用 120K 个 3D 高斯泼溅图元即可生成高保真渲染结果,比 DepthSplat 少 5.7 倍。它还忠实地重建了薄结构、复杂细节以及视图依赖的外观。

第 11 页

ATSplat:基于自适应Token扩展的紧凑前馈3D高斯泼溅 • 11

输入图像 3DGS DepthSplat 本文方法 真实值

图 7. 在 DL3DV 数据集上,使用 12 个输入视图,在 512 × 960 分辨率下的定性比较。ATSplat 在不到一秒的时间内恢复了精细细节和薄结构,且高斯数量显著减少;而 3DGS 需要超过 10 分钟的场景级优化才能获得这些结果。

第 12 页

12 • In Cho, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, and Seon Joo Kim

A Additional Implementation Details Table 6. Token and Gaussian counts under our experimental configura- tions. Each anchor token is decoded into 𝐾= 16 Gaussians, and the total In this section, we provide additional details on the model archi- number of Gaussians is 𝐺= 𝐾𝑁final. *: the first ATE block uses a selection tecture and training configuration used in our experiments. These ratio of 0.8 instead of 0.5 in this setting. implementation details are included to facilitate reproducibility.

Dataset Resolution Views 𝑁init 𝑁final 𝐺 A.1 Training Details RE10K 256 × 256 2 512 1440 23040 We train our models with the PyTorch framework. To improve DL3DV 256 × 448 2 896 2520 40320 DL3DV 256 × 448 4 1792 5040 80640 memory efficiency during training, we employ the native scaled dot- DL3DV 256 × 448 6 2688 7560 120960 product attention implementation provided by PyTorch. ATSplat DL3DV 512 × 960* 12 5760 19440 311040 is trained in BF16 precision, which reduces memory consumption while maintaining stable optimization in our experiments. We opti- mize the model using AdamW [Loshchilov and Hutter 2017] with a 𝑁init initial anchor tokens, the number of final tokens is weight decay of 0.05. The initial learning rate is set to 2 × 10−4 and is scheduled using cosine annealing after an initial warm-up phase. 𝐿ATE We use a batch size of 8 per GPU except for 256 × 448 DL3DV [Ling 𝑁final = 𝑁init Ö 1 + 𝜌𝑙(𝑀−1) , (11) et al. 2024] experiments, which results in a total batch size of 32 for 𝑙=1 RealEstate10K [Zhou et al. 2018] and 64 for DL3DV experiments. where 𝐿ATE denotes the number of decoder blocks equipped with an ATE module and 𝑀is the expansion ratio. Each token is then A.2 Architecture Details decoded into 𝐾local Gaussians, which yields 𝐺= 𝐾𝑁final primitives in total. Tab. 6 lists the resulting token and Gaussian counts for everyWe use a feature dimension of 768 throughout the model. The fine configuration used in our experiments. We emphasize that fixedbranch uses a patch size of 8, while the coarse branch uses a patch ratios are not the only choice at inference, and we further reportsize of 14, following the resolution of DINO backbone. To ensure per-scene dynamic budgets obtained by uncertainty thresholdingthat the coarse and fine branches operate at a consistent relative in Sec. C.1.resolution, we first downsample the input images before passing them to the DINO encoder in the coarse branch. This makes the B Additional Resultsspatial resolution of the fine patch grid twice that of the coarse patch grid. Each decoder block leverages standard cross-attention layers. B.1 Results with Varying Viewpoint Overlaps Each of these layers consists of a cross-attention, a self-attention, We further evaluate ATSplat under varying input viewpoint over- and a feed-forward module. We employ one such layer in the first laps, following the evaluation protocol of [Ye et al. 2025b]. Small two blocks, and two layers in the others. overlap typically corresponds to wider camera baselines, whereas In addition to DINO features, we additionally patchify the raw large overlap corresponds to narrow baselines where most target images using a patch size of 16 and fuse the resulting image patch viewpoints are placed close to the input views. Tab. 7 reports PSNR, features to the corresponding DINO features through concatenation SSIM, and LPIPS on RealEstate10K across the resulting overlap bins. and a linear projection layer, after projecting them to the model ATSplat attains the strongest performance in the small-overlap dimension. For the fine branch, before feeding to the decoder, we regime by a clear margin, becomes comparable to pixel-aligned also inject the encoder output features as coarse-level context, into baselines under medium overlap, and eventually falls behind in the fine-resolution patch features. The final coarse patch features the large-overlap setting. This trend is a direct consequence of the are upsampled to the spatial resolution of the fine patch grid and differing formulations of ATSplat and pixel-aligned methods. Pixel- added to the fine patch features. aligned methods predict per-pixel Gaussians anchored on input The coarse depth head and the Gaussian head are both imple- camera rays, and are therefore well-suited to large-overlap settings mented using two-layer MLPs. Before each MLP head, we apply where most of the target content is directly observable from the LayerNorm to stabilize the feature distribution. For the uncertainty input views. As overlap decreases, however, an increasing portion of head, we apply a softplus activation to the output. We empirically the target view lies away from the input rays, and ray-constrained found this parameterization to be more stable in our setup. We placement becomes a fundamental limitation. Our 3D anchor-offset also normalize the input camera poses before feeding them to the effectively addresses this issue and achieves compelling results in network. Given the input camera sequence, we compute the aver- the more challenging setup, thanks to our anchor-offset design that age camera pose and transform the camera coordinate system such can place primitives freely in 3D space beyond input camera rays. that the average pose is aligned with the identity pose, following previous works [Kang et al. 2025]. B.2 Results with Square-Cropped Inputs

We further compare ATSplat with YoNoSplat [Ye et al. 2025a], a A.3 Total Gaussian Budgets concurrent feed-forward method evaluated on square-cropped im- All results reported in the main paper are obtained with the fixed ages. To match its configuration, we train and evaluate ATSplat on selection ratios 𝜌𝑙. Under this setting, the number of tokens after DL3DV at 224×224 resolution with 6 input views, where both input the decoder is mainly determined by the input configuration. Given and target images are square-cropped. As shown in Tab. 8, ATSplat

第 13 页

ATSplat:具有自适应Token扩展的紧凑前馈3D高斯泼溅 • 13

表7. 在RE10K上不同视角重叠度下的定量比较。较小的视角重叠意味着较大的相机基线范围。

| | 小 | 中 | 大 | 平均 | | :— | :—: | :—: | :—: | :—: | | 方法 | #高斯↓ PSNR↑ SSIM↑ LPIPS↓ | PSNR↑ SSIM↑ LPIPS↓ | PSNR↑ SSIM↑ LPIPS↓ | PSNR↑ SSIM↑ LPIPS↓ | | pixelSplat [Charatan et al. 2024] | 131K 20.28 0.719 0.265 | 23.73 0.811 0.180 | 27.15 0.880 0.121 | 23.86 0.808 0.184 | | MVSplat [Chen et al. 2024a] | 131K 20.37 0.725 0.250 | 23.81 0.814 0.172 | 27.47 0.885 0.115 | 24.01 0.812 0.175 | | DepthSplat [Xu et al. 2025] | 131K 22.82 0.798 0.193 | 25.38 0.851 0.145 | 28.32 0.900 0.104 | 25.59 0.852 0.145 | | iLRM [Kang et al. 2025] | 131K 23.82 0.813 0.184 | 26.54 0.864 0.139 | 29.43 0.910 0.103 | 26.70 0.864 0.140 | | ours | 23K 24.09 0.815 0.185 | 26.56 0.861 0.144 | 29.13 0.900 0.114 | 26.70 0.861 0.146 |

表8. 在DL3DV上224 × 224分辨率下使用6个输入视图的定量比较。*:由于基于不透明度的高斯剪枝,高斯数量是测试场景的平均值。

| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ | #高斯↓ | | :— | :—: | :—: | :—: | :—: | | YoNoSplat [Ye et al. 2025a] | 24.72 | 0.817 | 0.139 | 212K* | | ours | 27.97 | 0.882 | 0.118 | 52K |

表11. 单独训练的模型与在两个数据集及所有输入视图数量上联合训练的单一统一模型的比较。RE10K在256 × 256分辨率下评估,DL3DV在256 × 448分辨率下评估。

| 设置 | PSNR↑ | SSIM↑ | LPIPS↓ | PSNR↑ | SSIM↑ | LPIPS↓ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | 单独 | | | | 统一 | | | | RE10K, 2视图 | 28.46 | 0.894 | 0.118 | 28.11 | 0.890 | 0.125 | | DL3DV, 2视图 | 20.07 | 0.630 | 0.332 | 21.80 | 0.702 | 0.283 | | DL3DV, 4视图 | 25.67 | 0.827 | 0.172 | 25.73 | 0.830 | 0.169 | | DL3DV, 6视图 | 27.28 | 0.868 | 0.138 | 27.26 | 0.868 | 0.136 |

表9. 从RealEstate10K到DL3DV在256 × 256分辨率下使用2个输入视图的零样本迁移。所有方法均在RealEstate10K上训练,并在DL3DV上进行评估,无需微调。

| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ | #高斯↓ | | :— | :—: | :—: | :—: | :—: | | MVSplat [Chen et al. 2024a] | 16.18 | 0.459 | 0.441 | 131K | | DepthSplat [Xu et al. 2025] | 18.07 | 0.571 | 0.352 | 131K | | iLRM [Kang et al. 2025] | 18.82 | 0.588 | 0.352 | 131K | | ours | 19.17 | 0.584 | 0.371 | 23K |

表12. RealEstate10K上具有2个输入视图的场景动态预算。每个阈值三元组列出了在三个ATE块中应用的置信度阈值,替换了推理时的固定选择比例。

| 选择 | #高斯↓ | PSNR↑ | SSIM↑ | LPIPS↓ | 平均 | 最小 | 最大 | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 固定比例 | 28.46 | 0.894 | 0.118 | 23K | 23K | 23K | | 0.1 / 0.1 / 0.4 | 27.90 | 0.888 | 0.127 | 13K | 8K | 36K | | 0.05 / 0.05 / 0.2 | 28.35 | 0.895 | 0.118 | 19K | 8K | 55K | | 0.01 / 0.01 / 0.04 | 28.64 | 0.899 | 0.112 | 39K | 14K | 65K |

表10. 在DL3DV上使用6个输入视图的外推新视图合成。目标视图是从输入视图窗口前后放置的10帧中采样的。

| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ | | :— | :—: | :—: | :—: | | DepthSplat [Xu et al. 2025] | 19.22 | 0.687 | 0.265 | | ours | 22.11 | 0.747 | 0.246 |

来自输入射线。表10将ATSplat与DepthSplat [Xu et al. 2025]进行了比较。该设置与B.1节中的小重叠情况具有相同的难度,其中射线约束放置无法覆盖远离输入射线的内容。ATSplat在3D空间中自由放置图元,因此当目标视点远离输入视图时,它能取得更好的结果。

B.3 跨数据集泛化

接下来,我们考察我们的公式如何迁移到未见数据。我们在256 × 256分辨率下,使用2个输入视图,直接在DL3DV上评估在RealEstate10K上训练的所有模型,无需任何微调。表9报告了零样本迁移结果。ATSplat取得了最高的PSNR,并且SSIM和LPIPS具有可比性,同时使用了显著更少的高斯数量,这表明ATSplat很好地适应了未见数据的分布。

B.4 外推

外推视图位于输入视图窗口之外,比标准协议更具挑战性,在标准协议中,目标视图放置在输入视图之间。在具有6个输入视图的DL3DV上,我们渲染输入视图窗口前后放置的10帧,使得大部分目标内容无法直接观察到。

B.5 跨数据集和视图数量的统一模型

遵循之前的前馈方法 [Charatan et al. 2024; Chen et al. 2024a; Xu et al. 2025],我们为每个分辨率训练一个单独的模型。这一选择遵循公平比较的常见评估协议,并非ATSplat的特性,因为其任何组件都不绑定于特定的分辨率或输入视图数量。为了验证这一点,我们在两个数据集上联合训练一个单一模型,涵盖所有输入视图数量,并在每种设置下对其进行评估。表11比较了统一模型与单独训练的模型。统一模型取得了与单独训练模型相当的质量,验证了ATSplat可以在数据集和视图数量上联合训练。

第 14 页

14 • Cho, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, and Seon Joo Kim

渲染结果 真实值 渲染结果 真实值

无扩展 阶段 1 阶段 1, 2 阶段 1, 2, 3 无扩展 阶段 1 阶段 1, 2 阶段 1, 2, 3

图 8. 在解码器块中逐步启用 Token 扩展的效果。从所有解码器块均禁用扩展的配置开始,我们逐渐从最早的块到最晚的块启用扩展。随着更多块的激活,细粒度纹理和薄结构被逐步恢复。

表 13. 每个锚点 Token 的高斯数量 𝐾 对 表 14. 在具有 6 个输入视图的 DL3DV 上对 3D 锚点设计的消融实验 RealEstate10K(2 个输入视图)的影响。*: 我们在所有其他 实验中使用的默认设置。

锚点初始化 高斯中心 PSNR↑ SSIM↑ LPIPS↓ 𝐾 PSNR↑ SSIM↑ LPIPS↓ #高斯↓ 无 射线 + 深度 26.37 0.845 0.161 4 27.63 0.877 0.141 5K 可学习 直接 xyz 21.05 0.625 0.359 8 28.25 0.890 0.124 11K 无 直接 xyz 发散 16* 28.46 0.894 0.118 23K 补丁深度 锚点 + 偏移量 27.28 0.868 0.138 32 28.66 0.898 0.113 46K 64 28.73 0.899 0.111 92K 表 15. 在具有 6 个输入视图的 DL3DV 上对 ATE 模块的消融实验

方法 PSNR↑ SSIM↑ LPIPS↓ C 额外分析与消融实验 随机 26.31 0.846 0.154 C.1 通过不确定性阈值实现动态高斯预算 最远点采样 (FPS) 26.21 0.843 0.158 阈值 完全可学习 (STE) [Yin et al. 2019] 26.72 0.859 0.143 无扩展 25.17 0.810 0.200 使用固定的选择比例,ATSplat 在由输入配置决定的预算内自适应地分 不确定性 27.28 0.868 0.138 配图元,而不是选择预算本身。相反,该模型可以扩展所有不确定性超过 特定阈值的 Token,从而在推理时产生依赖于场景的预算,而无需重新训练 或更改架构。 为了更深入地了解 ATE 模块,我们通过逐步启用扩展来进一步分析其 C.2 扩展高斯预算 每个锚点 Token 解码出的高斯数量 𝐾 可以控制 ATSplat 的总高斯预算。我们在 RealEstate10K 上将 𝐾 从 4 变化到 64,输入视图为 2 个,保持其他设置不变。如表 13 所示,随着 𝐾 的增加,渲染质量持续提高,但在我们的默认设置 𝐾= 16 之后,收益递减。 从最早的块到最晚的块,同时保持所有其他设置完全相同。如表 12 所示,产生的预算在不同场景间变化高达 6.9 倍,这表明它现在遵循场景复杂度,而不是输入配置。较低的阈值会扩展更多的 Token 并提高质量,而只有最小的阈值达到了最先进的艺术质量,与 iLRM 相比,仍使用了少 3.4 倍的高斯。 图 8 显示了生成的渲染结果。当扩展完全禁用时,有限的表示能力导致一些细节缺失。随着在更多块中启用扩展,渲染结果逐渐细化,更忠实地恢复了细粒度纹理和高频细节。

C.3 在每个解码器块中进行扩展

C.4 在 DL3DV 上的消融实验 主论文中的消融实验是在具有 2 个输入视图的 RealEstate10K 上进行的。我们进一步在具有 6 个输入视图的 DL3DV 数据集上验证了我们的核心组件,以检查它们在更大、更复杂的场景上是否仍然有效。表 14 和表 15 报告了 3D 锚点设计和 ATE

第 15 页

模块,分别。在 DL3DV 数据集上,回归绝对高斯中心且不使用任何锚点初始化会导致无法收敛,这表明随着场景空间范围的扩大,粗略的 3D 锚点变得更为关键。

D 额外的定性结果

我们在 RealEstate10K 和 DL3DV 上提供了额外的定性比较。图 9 展示了 RealEstate10K 上的结果。图 10 和图 11 分别展示了 DL3DV 数据集在 256 × 448 和 512 × 960 分辨率下的结果。我们进一步建议读者参考补充视频以获取更全面的结果,其中包括 ATSplat 的渲染序列以及并排比较。

第 16 页

16 • 在 Cho, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, 和 Seon Joo Kim 的研究中

输入图像 MVSplat DepthSplat iLRM 本文方法 真实值

图 9. 在 RealEstate10K 数据集上,使用 2 个输入视图、分辨率为 256 × 256 的额外定性比较结果。

第 17 页

ATSplat:基于自适应Token扩展的紧凑前馈3D高斯泼溅 • 17

输入图像 DepthSplat 本文方法 真实值

图 10. 在 DL3DV 数据集上,使用 6 个输入视图、256 × 448 分辨率的额外定性比较结果。

第 18 页

18 • 在 Cho, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, 和 Seon Joo Kim 的论文中

输入图像 3DGS DepthSplat 本文方法 真实值

图 11. 在 DL3DV 数据集上,使用 12 个输入视图,在 512 × 960 分辨率下的额外定性比较结果。

发表评论