LocusGS:给前馈3D高斯泼溅的查询token装上空间锚点

快速导读:LocusGS为每个高斯查询token引入显式3D锚点状态(中心+支撑半径),在解码过程中逐步细化并用于引导跨视图特征聚合与锚点中心化高斯生成,从而提升前馈3DGS的重建质量与空间组织性。

LocusGS解决的是query-based前馈3D高斯泼溅(3DGS)中一个被忽视的结构性问题:同一个可学习查询token解码出的高斯,常常散布在场景中相距很远的区域。这意味着token并不对应任何可解释的空间角色,跨视图特征聚合也缺乏几何约束。论文的核心主张是,为每个token引入显式3D锚点状态(中心μ与支撑半径r),可以让查询从隐式特征向量变成空间锚定的重建单元。

锚点状态贯穿解码全程:它注入self-attention提供空间上下文,通过anchor-to-ray几何偏置引导cross-attention优先聚合几何一致的图像token,并在每层解码后被残差更新。最终高斯中心由锚点中心加半径缩放偏移解码,配合多层渲染监督,促使同一token的高斯形成紧凑局部组。实验在DL3DV和RealEstate10K上验证了重建质量与token级空间一致性的双重提升。

英文题目:LocusGS: Spatially Grounded Tokens for Feed-Forward 3D Gaussian Splatting

论文出处:arXiv 每日论文精选 · arXiv:2608.12825

原始论文:PDF / 论文页面

这篇论文解决什么问题?

前馈3DGS的目标是从稀疏输入视图直接预测3D高斯表示,避免逐场景优化。密集像素对齐方法(如PixelSplat、MVSplat)让高斯数量随图像分辨率和视图数增长,计算开销大。query-based方法(如TokenGS、GlobalSplat、C3G)用固定数量的可学习查询聚合多视图证据,使高斯预算与输入规模解耦,这是一个重要的效率优势。

但query-based方法有一个根本缺陷:查询的空间角色是隐式的。TokenGS中,一个token解码出的64个高斯可能散布在场景的各个角落,token级空间一致性极弱。这导致两个后果:一是重建缺乏结构组织性,二是cross-attention聚合图像特征时没有几何先验,只能依赖内容相似性,容易在纹理重复或遮挡区域聚合错误证据。

论文将根因归结为:查询仅用隐式latent特征表示,缺乏显式空间状态。这一诊断与DAB-DETR在2D目标检测中的思路形成呼应——DAB-DETR为object query引入动态细化锚框,LocusGS则将其推广到3D场景查询。同时,Scaffold-GS在逐场景优化中围绕稀疏3D锚点组织局部高斯的做法,也为LocusGS提供了概念参照。

核心创新

  • 为高斯查询引入显式3D锚点状态(中心+支撑半径),将隐式token转化为空间锚定的重建查询
  • anchor-to-ray几何偏置引导跨视图特征聚合,使查询优先关注几何一致的图像区域
  • 锚点状态跨解码层逐步细化,自适应调整空间位置与支撑范围
  • 锚点中心化、半径缩放的高斯解码,促使同一token的高斯形成紧凑局部组
  • 多层渲染监督直接正则化中间锚点细化过程

方法概览

LocusGS为每个高斯token增加显式3D锚点状态a=(μ,r),其中μ为3D中心、r为支撑半径。锚点状态贯穿解码全程:锚点位置编码注入self-attention;anchor-to-ray几何偏置加入cross-attention,使查询优先聚合射线靠近锚点的图像token;每层解码后由token特征预测残差更新锚点中心和半径;最终高斯中心通过锚点中心加半径缩放局部偏移解码,并采用多层渲染监督。

  • 锚点状态定义:每个高斯token携带a=(μ,r),μ为3D中心,r为标量支撑半径。锚点状态与token特征并行存在,初始可学习,并在解码过程中被逐步细化。
  • 锚点感知self-attention:锚点位置编码注入self-attention,使token之间的交互不仅依赖内容特征,还依赖空间距离。这促使空间邻近的锚点token建立更强的关联,形成类似粗粒度空间支架的结构。
  • anchor-to-ray几何偏置:在cross-attention中,基于锚点中心到相机射线(Plücker ray表示)的最短距离构造高斯型偏置,叠加到内容注意力分数上。查询因此优先聚合射线靠近锚点中心的图像token,实现几何引导的跨视图证据聚合。
  • 动态锚点细化:每层解码后,由token特征预测残差更新锚点中心和半径。半径的自适应调整使支撑范围随解码推进而收缩或扩张,适应不同尺度的场景结构。
  • 锚点中心化解码:高斯中心由锚点中心加半径缩放局部偏移得到,而非自由预测。这从解码端强制同一token的高斯围绕锚点形成紧凑局部组。
  • 多层渲染监督:不仅对最终层施加渲染损失,还对中间解码层施加渲染监督,直接正则化锚点细化过程,使中间锚点状态保持几何意义。
  • 可见性正则化:软惩罚投影在所有监督视图外的点,进一步约束锚点和高斯落在有效场景区域内。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 1: Spatial grounding improves both global Gaussian organization and token-level locality. The orange points highlight all 64 Gaussians decoded from a single representative token. Under the same input and Gaussian budget, TokenGS produces diffuse scene structures, with the Gaussians from one token scattered across a broad spatial region. LocusGS instead reconstructs Gaussians that better follow the scene geometry, and its learned anchors form a coarse spatial scaffold for organizing local Gaussian generation.

这张图是论文的核心动机可视化:橙色点标记同一token解码的全部64个高斯。TokenGS的高斯散布在广阔区域,而LocusGS的高斯沿场景几何分布,锚点形成粗空间支架。观察时应对比同一token高斯在两种方法中的空间散布范围。

研究缺口

研究缺口
Figure 2: Conceptual comparison of three feed-forward 3DGS paradigms. (a) Dense view-wise prediction decodes multi-view image features and uses a per-view head to produce view-dependent Gaussian splats. (b) Fixed-budget query-based generation introduces learnable queries to decode a set of Gaussians whose size is independent of image resolution and input view count. (c) Our spatially grounded query paradigm further equips queries with explicit spatial anchors, enabling anchor-aware decoding and more structured Gaussian generation.

问题的根因在于:query-based方法给了查询固定的预算和解码能力,却始终没有给查询一个显式的空间状态。密集像素对齐方法天然有像素位置作为锚,query-based方法反而丢掉了这个几何抓手。DAB-DETR在2D检测里已经证明,给query加一个可细化的锚框能显著提升定位能力,但3D场景重建里,这个思路一直没人系统做过。

方法贡献

方法贡献
Figure 3: From implicit Gaussian tokens to explicit anchor tokens. Left: standard query-based methods uses learnable 3DGS tokens as implicit embeddings, where self-attention and image-to-3DGS cross-attention are mainly driven by token and image features. Right: LocusGS augments each decoder token with a learnable 3D anchor state (µ, r). The anchor state provides spatial cues for token self-attention and guides cross-view feature aggregation through anchor-aware cross-attention. Across decoder layers, the anchor state is progressively refined and used for anchor-centered Gaussian prediction, turning Gaussian tokens into spatially grounded reconstruction queries.

这张图对比了隐式token与显式锚点token的架构差异。右侧显示锚点状态如何注入self-attention、引导cross-attention、逐层细化并用于锚点中心化高斯预测。理解这张图是把握方法全貌的关键。

验证与结论

验证与结论
Figure 5: Visualization of anchor supports and token-level Gaussian compactness. The first three rows show LocusGS: all projected anchors, selected projected radii, and Gaussian groups decoded from the selected anchor tokens. The last row shows Gaussian groups decoded from TokenGS tokens. LocusGS learns adaptive spatial supports and encourages each token to decode a more compact local Gaussian group.

这张图展示锚点支撑与token级高斯紧凑性。前三行显示LocusGS的投影锚点、自适应半径和对应高斯组,最后一行是TokenGS的高斯组。注意LocusGS的高斯组明显更紧凑,半径在不同区域自适应变化。

实验如何设计?

  • DL3DV数据集:以4视图训练,2/4/6视图评估,分辨率448×256,验证跨视图数泛化能力。
  • RealEstate10K数据集:以2视图重建,分辨率256×256,验证在标准前馈重建基准上的表现。
  • 受控对比:与TokenGS在相同token数和高斯预算下对比,隔离空间锚定机制的独立贡献。
  • 消融实验:逐项移除锚点中心、半径、逐层细化、锚点感知self-attention、cross-attention几何偏置、锚点中心化解码、多层渲染监督,评估各组件贡献。
  • 分析实验:token级高斯离散度、锚点分布与自适应半径、cross-attention与self-attention可视化、训练收敛曲线、推理延迟与模型规模。

关键结果与论文证据

  • DL3DV 2视图下,LocusGS的PSNR为20.90,较TokenGS的19.58提升1.32dB;4视图下24.80对23.44;6视图下25.78对24.16(第8页)。
  • RealEstate10K 2视图下,1024 token设置中LocusGS PSNR 28.50对TokenGS 28.02;4096 token设置中28.89对28.41(第8页)。
  • token级高斯离散度Ccentroid在RE10K上从TokenGS的5.1164降至0.1978,在DL3DV上从0.5881降至0.0433,降幅超过一个数量级(第9页)。
  • 消融显示,移除半径状态使PSNR从24.284降至23.640,静态半径降至23.979;content-only cross-attention降至22.751,自由高斯中心解码降至22.079,是影响最大的两个组件(第11页)。
  • 多层渲染监督消融:仅监督最终层PSNR为23.549,监督{6,12}层为24.284,监督{3,6,9,12}层为24.071,说明适度中间监督最优(第13页)。
  • cross-attention可视化显示,LocusGS的注意力模式更局部化且跨视图一致,集中在锚点投影区域附近(第11页)。
  • 训练收敛曲线显示LocusGS收敛更快,训练和验证PSNR均保持优势(第12页)。
  • 模型规模:LocusGS 241.5M参数对TokenGS 222.0M,纯前向延迟407.28ms对340.99ms,开销约9%参数和19%延迟(第17页)。

阅读时需要注意

  • 假设输入视图已标定,依赖已知相机参数构建射线,未扩展到pose-free场景。
  • 锚点状态仅用中心加标量半径,为各向同性描述,难以刻画细长结构或几何复杂区域。
  • RE10K与DL3DV使用不同场景归一化约定,离散度数值仅可在同一数据集内比较。
  • 推理延迟对比仅含编码器-解码器前向,不含渲染,因两模型高斯数相同。

关联工作

  • TokenGS是主要query-based基线,引入可学习高斯查询,提供受控对比设置。
  • DAB-DETR为object query引入动态细化锚框(2D),LocusGS将其推广到3D场景查询,是概念上的直接前驱。
  • Scaffold-GS在逐场景优化中围绕稀疏3D锚点组织局部高斯,LocusGS的锚点作为查询状态在前馈框架中细化,形成有趣的对照。
  • GlobalSplat与C3G是同期query-based方法,分别采用解耦几何与外观分支、预训练VGGT编码器,但均未引入显式空间锚点状态。

发表评论