三分钟导读:SPIN-4DGS通过显式时空位置估计和轻量级隐式网络预测高斯属性,解决了现有4DGS在快速运动和大帧间位移下属性坍塌和物体丢失的问题。
英文题目:Implicit 4D Gaussian Splatting for Fast Motion with Large Inter-Frame Displacements
论文出处:arXiv 每日论文精选 · arXiv:2607.12362
原始论文:PDF / 论文页面
对应视频标题:SPIN-4DGS:解决4D高斯泼溅快速运动模糊与物体消失的隐式网络方案|推荐指数:★★★★★
这篇论文解决什么问题?
现有4DGS方法(如可变形和显式参数化方法)在处理快速运动和大帧间位移时,高斯属性(颜色、不透明度等)容易坍塌,导致快速移动物体模糊或消失,且存在跨帧干扰问题。
核心创新
- 时空切片策略:显式分离不同时间步的高斯位置,避免跨帧干扰和属性坍塌。
- 隐式属性预测:使用轻量级前馈网络从时空位置预测高斯属性,实现共享表示和内存效率。
- 输入位置归一化:采用类似Mip-NeRF的收缩策略,将空间和时间坐标归一化到[0,1],稳定训练。
- 兼容性:可复用现有4DGS基线(如D3DGS, Realtime-4DGS)的预训练位置,仅替换属性优化模块。
方法概览
提出SPIN-4DGS,包含两个阶段:(a) 时空位置估计:利用显式基线(如Realtime-4DGS)获取初始位置,并通过光栅化损失进行帧级细化;(b) 隐式网络:将细化后的时空位置归一化,通过4D哈希编码器和多分支解码器预测高斯属性(尺度、旋转、颜色、不透明度),避免显式优化所有属性的内存开销。
逐图理解论文
SPIN-4DGS方法概述

SPIN-4DGS提出了一种两阶段框架,旨在解耦位置估计与属性优化。第一阶段利用显式基线获取初始时空位置,并通过光栅化损失进行帧级细化。第二阶段引入隐式网络,将细化后的位置归一化,通过4D哈希编码器和多分支解码器预测高斯属性,从而避免显式优化所有属性的内存开销。
时空切片策略

为了解决跨帧干扰,SPIN-4DGS采用时空切片策略,显式分离不同时间步的高斯位置。与统一4D优化不同,切片策略为每一帧分配独立的位置集合,避免了高斯在时间轴上的重叠与冲突。消融实验表明,这种显式分离显著提升了快速运动物体的重建质量,减少了面部模糊和物体扭曲。
隐式属性预测网络

SPIN-4DGS的核心创新在于使用轻量级前馈网络预测高斯属性。输入位置经过4D哈希编码后,通过多分支解码器输出尺度、旋转、颜色和不透明度。这种隐式表示实现了跨帧的属性共享,大幅降低了内存占用。实验显示,结合可训练位置和输入归一化,网络能稳定收敛并生成高质量属性。
位置细化与收敛

位置估计的初始质量至关重要。SPIN-4DGS通过少量光栅化损失迭代细化初始位置,即使仅0.5K次迭代也能保持物体结构稳定。随着迭代次数增加,模型能逐步恢复球体边缘和球拍网等精细细节。这种渐进式细化策略平衡了训练效率与重建精度,避免了早期位置稀疏导致的优化困难。
CMU Panoptic Sports定量结果

在CMU Panoptic Sports数据集的六个运动场景上,SPIN-4DGS展现了显著优势。在Basketball场景中,PSNR达到30.05 dB,比最强基线D3DGS高出1.83 dB。平均PSNR为30.11 dB,SSIM为0.93。定性可视化显示,相比基线方法中快速移动物体的消失或损坏,SPIN-4DGS能全程保持物体清晰且一致的重建。
实验与关键结果
- 在CMU Panoptic Sports数据集(6个运动场景)上与多种4DGS基线(显式、可变形、外部监督)进行定量和定性比较。
- 在Neu3DV和MeetRoom数据集上进行泛化能力评估。
- 消融实验:分析时空位置估计时长、细化迭代次数、时空切片有效性、隐式网络组件(可训练位置、归一化、激活函数)的影响。
- 与帧级3DGS(Frame-wise 3DGS)进行比较。
- Basketball场景PSNR 30.05 dB,比最强基线D3DGS高+1.83 dB(第 7 页)
- Panoptic Sports平均PSNR 30.11 dB,SSIM 0.93(第 7 页)
- Neu3DV平均PSNR 32.19 dB,SSIM 0.95(第 15 页)
- MeetRoom平均PSNR 32.04 dB,SSIM 0.96(第 15 页)
- Basketball场景LPIPS 0.14(第 14 页)
阅读时需要注意
- 在初始位置稀疏的大型户外或高杂乱场景中,需要更长的细化(densify/prune)调度,增加训练成本。
- 对于初始点极少的小物体或区域,即使多次细化迭代也难以恢复足够的高斯点。
- 该方法依赖于初始时空位置的密度和质量,若初始SfM结果不佳,性能可能受限。
- 训练时间随细化迭代次数增加而显著增加(如Basketball场景从45分钟到195分钟)。
关联工作
- Realtime-4DGS:作为时空位置估计的默认基线,并用于兼容性实验。(第 2 页)
- D3DGS:最强外部监督基线,用于比较和兼容性实验。(第 7 页)
- 4DGaussian:可变形基线,用于对比快速运动下的失败模式。(第 7 页)
- Grid4D:可变形基线,用于对比。(第 7 页)
- MoDec-GS:可变形基线,用于定性比较。(第 17 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
发表于 ICLR 2026 会议论文
隐式 4D 高斯泼溅用于大帧间位移的快速运动
Seung-gyeom Kim Areum Kim Yongjae Yoo Sukmin Yun∗ 汉阳大学应用人工智能系 {skkim3533, dkfma0817, yongjaeyoo, sukminyun}@hanyang.ac.kr
摘要
现有的 4D 高斯泼溅 (4DGS) 方法在大帧间位移的快速运动场景下往往表现不佳,因为在训练期间高斯属性学习不充分,且快速移动的物体经常从重建结果中丢失。在本工作中,我们引入了用于 4DGS 的时空位置隐式网络(Spatiotemporal Position Implicit Network for 4DGS),简称 SPIN-4DGS。该方法从显式收集的时空位置中学习高斯属性,而不是对时间位移进行建模,从而在大帧间位移的快速运动下实现更忠实的高斯泼溅。为了避免在所有时空位置上显式优化属性所带来的巨大内存开销,我们改为使用一个轻量级的前馈网络来预测这些属性,该网络在基于光栅化的重建损失下进行训练。因此,SPIN-4DGS 学习了高斯之间的共享表示,有效地捕捉了时空一致性,即使在具有挑战性的运动场景下也能实现稳定且高质量的高斯泼溅。在广泛的实验中,SPIN-4DGS 在 CMU-Panoptic 数据集的具有大位移的具有挑战性的体育场景中,一致地实现了更高的 PSNR 和 SSIM 保真度。例如,SPIN-4DGS 在 Basketball 场景上比最强的基线方法 D3DGS 显著优于 +1.83 的 PSNR。
4D高斯泼溅 Realtime-4DGS D3DGS 我们的方法
图 1:大帧间位移下快速运动的忠实重建。现有的 4DGS 方法通常会产生模糊或不完整的快速移动物体重建结果。相比之下,我们的方法成功重建了场景中清晰的准确细节,例如篮球。
1 引言
尽管对广泛的现实世界应用至关重要,但使用大帧间位移渲染快速运动仍然是动态场景重建中的一个挑战。4D 高斯泼溅 (4DGS) 的最新进展展示了显著的效率和质量,使其成为动态场景重建的一个有前景的框架。特别是,现有的 4DGS 方法 (Yang et al., 2024a; Duan et al., 2024; Wu et al., 2024; Xu et al., 2024) 在具有小位移的动态场景(例如 Neu3D (Li et al., 2022b))的视频帧中取得了良好的结果。然而,随着运动速度加快和帧间位移增大(例如 Panoptic Sports (Joo et al., 2015)),包括显式 4D 参数化 (Yang et al., 2024a; Duan et al., 2024) 和可变形方法 (Wu et al., 2024; Xu et al., 2024; Kwak et al., 2025) 在内的现有 4DGS 方法往往无法捕捉快速动态,产生模糊甚至消失的物体。具体来说,在可变形方法中,高斯定义在静态规范空间中,并通过学习到的形变随时间变换。然而,它们往往无法在规范空间中为快速移动的物体分配初始高斯,导致这些物体在形变过程中保持不可见。
∗通讯作者。同时也隶属于汉阳大学ERICA校区。
1
第 2 页
发表于 ICLR 2026 会议论文
(a) 左侧:15K 训练迭代,右侧:30K 训练迭代。 (b) 规范空间
图 2:在具有大幅帧间位移的快速运动下的失效模式。我们可视化了现有框架的失效模式;(2a) 显式参数化和 (2b) 可变形方法。图 (2a) 显示了训练迭代次数增加时(即 15K → 30K)的剧烈退化,而 (2b) 显示可变形初始化的规范空间无法为快速运动分配高斯点。
训练。另一方面,尽管显式参数化在训练初期大致跟踪了对应快速运动的高斯位置,但其属性(包括颜色、不透明度、尺度和旋转)在后期训练中迅速崩溃,导致剧烈退化。因此,如图 1 和图 2 所示,这两种方法都表现出模糊甚至消失的运动失效模式。
为此,我们专注于解决在具有大幅位移的快速运动物体中学习高斯属性的失败问题。尽管位置保持足够准确以捕捉运动,但其他属性更容易崩溃。这种退化源于重建损失主要由背景高斯主导;位于新位置的快速运动高斯会产生更高的重建误差,而静态背景则更容易拟合。因此,无论是可变形还是显式 4D Gaussian Splatting 方法,都倾向于将学习偏向于背景拟合,最终导致动态物体消失。此外,这种大幅位移可能导致逐帧光栅化过程中的跨帧干扰。尽管 Realtime-4DGS (Yang et al., 2024a) 可以在每个时间点以不同方式切片,但其参数是共享的,因此除非我们通过显式的时空位置 (x, y, z, t) 分离高斯点,否则针对某一帧的优化会使其他切片次优。这一观察结果促使我们利用快速运动高斯的显式时空位置作为生成其属性的输入,从而在大幅位移下实现更忠实的光栅化。
在本文中,我们引入了 SPIN-4DGS(Spatiotemporal Position Implicit Network for 4DGS),这是一个轻量级但有效的框架,旨在处理具有大幅帧间位移的快速运动。具体而言,我们首先估计高质量的高斯时空位置 (x, y, z, t),这些位置可作为后续属性预测的输入,最初在整个场景中收集它们,然后以逐帧方式对其进行细化。接着,我们利用这些位置通过轻量级前馈网络预测高斯属性,避免了在所有时空位置上显式优化属性所带来的巨大内存开销。这种设计在所有高斯点之间学习共享的隐式表示,并在光栅化损失下直接从位置解码属性。因此,学习的属性在位置间保持一致,即使在大位移下动态物体也能保持稳定。同时,属性隐式存储在网络参数中,而非为每个高斯点显式存储,这显著提高了大量时空位置上的内存效率。
为了验证所提出的 SPIN-4DGS 的有效性,我们在 CMU Panoptic Sports 数据集的各种体育场景上进行了实验,其中人体运动迅速,小物体在大幅帧间位移中移动。在六个体育场景中,SPIN-4DGS 取得了最佳性能,显著优于所有基线。例如,与最强基线 D3DGS (Luiten et al., 2024) 相比,SPIN-4DGS 实现了 +1.83 PSNR dB 的提升,在篮球场景上的 SSIM 达到 0.92。具体而言,图 4 和表 1 中的定性结果表明,先前的方法往往使高斯模糊或无法捕捉快速运动的物体(例如篮球),而 SPIN-4DGS 则以清晰且稳定的重建保留了它们。有趣的是,我们进一步观察到,当重用来自强基线(如 D3DGS 和 Realtime-4DGS)的预训练高斯位置时,SPIN-4DGS 的性能显著提升。
总体而言,我们的工作引入了 SPIN-4DGS,这是第一个直接从联合优化的逐帧位置学习高斯属性的框架,从而在大幅帧间位移下实现稳定且高质量的 4D Gaussian Splatting。这种 4D 重参数化使得我们的方法能够在快速运动下缓解时间失效模式,同时仍能捕捉丰富的时间外观动态。我们相信 SPIN-4DGS 通过在各种现实场景中实现稳定学习,解决了 4D Gaussian Splatting 的根本挑战,从而为动态场景表示的进步开辟了新方向。
2
第 3 页
发表于 ICLR 2026 会议论文
2 相关工作
学习三维高斯的时序动态。最近的进展表明,通过学习时序动态,将三维高斯表示扩展到四维领域取得了显著进展。早期的尝试(Luiten 等,2024;Javed 等,2024)从第一帧开始逐步传播三维高斯,展示了 4D Gaussian Splatting 的潜力,但由于每帧都需要大量迭代,导致序列效率低下且容易过拟合。然而,它们依赖外部监督信号(如分割掩码),这大大增加了训练成本和计算开销。与此同时,受 NeRF 方法(Cao & Johnson,2023;Fridovich-Keil 等,2023;Park 等,2021)的启发,可变形框架(Wu 等,2024;Yang 等,2024b;Lu 等,2024;Zhu 等,2024;Lin 等,2024;Xu 等,2024)转而构建一个规范空间来初始化高斯,然后学习旋转、缩放和位置上的时序位移。尽管这些方法在帧间位移较小的运动上表现稳健,但在具有大位移的快速运动上表现不佳,因为在规范化处理过程中,代表快速运动的高斯往往被遗漏,从而在后续的变形过程中保持不可见。相比之下,我们在无需外部监督的情况下解决了这些挑战,表明仅从原始视频输入即可实现快速运动的高保真捕捉。
显式四维高斯参数化。另一个有前景的方向是专注于从头开始直接对四维高斯进行参数化(Yang 等,2024a;Lee 等,2024;Duan 等,2024),而不是在三维域中单独优化每一帧。这种显式的四维建模将空间和时间统一为连续场,并将动态编码为四维高斯泼溅,与基于变形的方法不同,它可以进行时间切片以进行渲染。例如,Realtime-4DGS(Yang 等,2024a)在每个时间戳对四维高斯进行时间切片以获得动态三维高斯,然后将其投影到图像平面上。虽然显式四维参数化实现了更高的帧率(FPS)和更好的渲染质量,但它们需要更长的训练时间和更大的存储需求。此外,在具有大位移的快速运动下,我们观察到由于帧间干扰,相应的高斯属性逐渐模糊。单个四维高斯必须同时解释所有时间戳;然而,渲染是逐帧进行的,因此对某一帧的优化不可避免地会影响其他帧。这种渲染过程中的固有冲突使得在动态区域中保持时序一致性变得具有挑战性。相比之下,我们的方法通过以前馈方式直接在显式时空位置解码高斯,避免了这种帧间退化。这种设计显式地分离了每个时间戳下的大位移高斯,从而防止了帧间退化,并带来了稳定的训练和一致的渲染质量。
3 方法
在本节中,我们介绍了用于 4DGS 的时空位置隐式网络(SPIN-4DGS),这是一个用于重建具有大帧间位移的运动下动态场景的框架。我们首先在 3.1 节中回顾三维高斯泼溅作为预备知识。然后,3.2 节描述了如何获取显式的时空高斯位置,3.3 节详细介绍了如何通过前馈隐式网络预测其属性。整体框架如图 3 所示。
3.1 预备知识:三维高斯泼溅
三维高斯泼溅(3DGS;Kerbl 等 (2023))提供了一种可微的体渲染表示。它引入了各向异性高斯,其中每个高斯的参数(即位置、缩放、旋转、颜色和透明度)是为基于瓦片的渲染而定义和优化的。运动结构(Structure-from-Motion, SfM;Schonberger & Frahm (2016))技术从输入图像中估计高斯的初始位置和颜色。对于三维场景中的任意给定点 $\mathbf{x} \in \mathbb{R}^3$,高斯定义如下: $$ G_{3D}(\mathbf{x}) = \exp \left( -\frac{1}{2} (\mathbf{x} – \boldsymbol{\mu})^\top \boldsymbol{\Sigma}^{-1} (\mathbf{x} – \boldsymbol{\mu}) \right), \quad (1) $$ 其中 $G_{3D}(\mathbf{x})$ 表示任意点 $\mathbf{x}$ 处的高斯值。每个高斯的参数包括位置 $\boldsymbol{\mu} \in \mathbb{R}^3$、透明度 $o \in \mathbb{R}$、使用球谐系数表示的颜色 $\mathbf{c} \in \mathbb{R}^3$,以及协方差矩阵 $\boldsymbol{\Sigma} \in \mathbb{R}^{3 \times 3}$,其定义为基于对角
第 4 页
发表于 ICLR 2026 会议论文
y Position Refinement Estimation Slicing Density & Prune
t
x {𝑡𝑖 ∣𝑖= 0, 1, … , 𝑇} Input: Multi-view Dynamic Video (A) Spatiotemporal Position Estimation
4D Hash Encoder Attribute-aware Decoder Ours
x y (x, y, z) z t GT 𝑓enc 𝑓dec Rasterizer t=1 Normalization z
Scale Rotation Color Opacity 𝐿= 1 −𝜆𝐿𝑑𝑒𝑙 + 𝜆𝐿𝑟𝑎𝑠𝑡𝑒𝑟𝑖𝑧𝑒𝑟
t=0 t=1 t=2 t=T (B) Implicit Network for 4DGS
图 3: 整体框架示意图。SPIN-4DGS 包含两个阶段:(a) 时空位置估计和 (b) 用于 4DGS 的隐式网络。具体而言,(a) 我们沿时间轴对高斯进行切片以获得时空位置集,并通过光栅化损失对其进行细化。然后,(b) 细化后的位置经过归一化,并通过 4D 哈希编码器和多分支解码器来预测高斯属性(缩放、旋转、颜色和透明度)。
缩放矩阵 $S = \text{diag}(s_1, s_2, s_3)$ 和旋转矩阵 $R \in SO(3)$,由四元数获得。为确保协方差矩阵保持正半定,其计算如下: $\Sigma_{3D} = R S S^\top R^\top$. (2) 为了通过光栅化进行渲染,3D 高斯首先被投影到 2D 图像平面上。这是通过应用视图变换 $W$ 和雅可比矩阵 (Zwicker et al., 2001) $J$ 来计算 2D 协方差矩阵 $\Sigma_{2D}$,如下所示: $\Sigma_{2D} = J W \Sigma_{3D} W^\top J^\top$ (3) 在渲染过程中,像素值通过 alpha 混合计算。每个高斯的 alpha 值(即透明度)是通过将 3D 高斯 $G_i$ 投影为 2D 的 $G_{2D_i}$ 获得的。具体而言,对于每个像素,alpha 值 $\alpha'_i$ 和最终颜色 $C$ 计算如下:
$N$ $i-1$ $\alpha'_i = o_i G_{2D_i}(x), \quad C(x) = \sum_{i=1}^{N} c_i \alpha'_i \prod_{j=1}^{i-1} (1 – \alpha'_j),$ (4) 其中 $o_i$ 是第 $i$ 个高斯的固有透明度,$c_i$ 是其颜色,$N$ 是贡献给该像素的高斯总数。
3.2 时空高斯位置
在本节中,我们的目标是构建一个完全覆盖动态物体轨迹的高斯点集,确保有足够的覆盖以实现忠实重建。先前的方法在高斯密集聚集的区域表现尚可,但在较大的帧间位移下,它们往往无法在快速移动的物体周围保持足够的点。即使位置充足,属性仍然具有挑战性。具体而言,当跨越整个轨迹的高斯被联合优化时,特定帧的监督信号会相互干扰。由于光栅化是逐帧进行的,使高斯在某一时间戳最优的更新可能会使其在其他时间戳次优。这种跨帧干扰可能会削弱学习信号并降低重建质量。
为了克服这些问题,我们在每个时间步独立构建高斯集,通过时空位置显式地将它们分开。这种表述避免了跨帧干扰,并使得在较大位移下对快速移动物体的属性学习更加可靠。 $u_t = f_\theta(x, y, z, t), \quad c_t = g_\phi(x, y, z, t) \in \{0, \dots, 255\}^3, \quad t \in \{0, \dots, T\}.$ (5)
4
第 5 页
发表于 ICLR 2026 会议论文
在此,$f_\theta$ 和 $g_\phi$ 是时间轴的显式函数,用于预测对应于每一帧 $t$ 的位置和颜色。例如,显式方法(Duan 等人,2024;Yang 等人,2024a)通过沿时间轴进行时间切片来构建点,而可变形方法(Wu 等人,2024;Xu 等人,2024;Bae 等人,2024)的神经网络可以学习将其构建为随时间变化的结构。对于 SPIN-4DGS,我们默认采用显式方法(Yang 等人,2024a)来估计时空位置。最后,我们利用每一帧对应的颜色进行光栅化损失,以细化估计的位置,从而密集化显著点并修剪不必要的点。
$$ u_t \leftarrow \text{Refine}(u_t, c_t; t), \quad t = 0, \dots, T. \quad (6) $$
细化之后,每个时间戳 $t$ 的高斯点被固定为显式的时空位置,并直接输入到我们的隐式网络中以学习相应的属性。
3.3 用于 4D 高斯泼溅的隐式网络
在本节中,我们描述了一个端到端训练的隐式网络,该网络直接从从收集到的位置初始化的可学习时空高斯位置预测 4D 高斯参数。与需要先定义或预优化高斯属性(例如,尺度、旋转、不透明度、颜色)来建模时间动态的先前方法不同,我们的网络仅使用收集到的时空位置 $(\mu, t) \in \mathbb{R}^4$ 作为输入从头开始训练。给定 $(\mu, t)$,网络预测所有 4D 高斯参数,包括不透明度 $o \in \mathbb{R}^1$、球谐系数 $sh \in \mathbb{R}^{48}$、尺度 $s \in \mathbb{R}^3$ 以及表示为单位四元数的旋转 $r \in \mathbb{R}^4$。
输入位置归一化。在每一帧 $t$,时空高斯位置作为前馈网络的输入,用于学习其他高斯参数的隐式表示。由于场景上的原始 3D 高斯位置 $u \in \mathbb{R}^3$ 是无界的,我们应用归一化步骤以稳定学习并保留表示能力。具体而言,遵循 Mip-NeRF(Barron 等人,2021)的场景收缩策略,我们首先将坐标压缩到一个有限球体内,然后将其映射到归一化范围 $[0, 1]^3$,如公式 7 所定义。
$$ \text{contract}(\mu) = \begin{cases} \mu, & \|\mu\| \le 1, \\ \left(2 – \frac{1}{\|\mu\|}\right) \frac{\mu}{\|\mu\|}, & \|\mu\| > 1, \end{cases} \quad \bar{\mu} = \frac{1}{4} \text{contract}(\mu) + \frac{1}{2} \in [0, 1]^3. \quad (7) $$
为了保持空间和时间的尺度可比,我们将时间归一化为 $[0, 1]$ 以匹配空间嵌入的尺度。具体而言,我们使用当前时间戳除以总持续时间: $$ t_{\text{norm}} = \frac{t – t_{\min}}{t_{\max} – t_{\min}} \in [0, 1] \quad \text{且} \quad \tilde{x} = [\bar{\mu}^\top, t_{\text{norm}}]^\top \in [0, 1]^4. \quad (8) $$ 我们的网络采用编码器-解码器架构,其中编码器 $f_{\text{enc}}$ 将归一化输入 $\tilde{x}$ 映射到潜在嵌入 $f_{\text{enc}}(\tilde{x})$,解码器将其作为输入。我们注意到,位置 $u$ 也被参数化并与网络联合优化,类似于现有的框架(Wu 等人,2024;Xu 等人,2024)。
用于共享潜在表示的编码器架构。我们通过附加时间轴,直接将广泛使用的 3D Instant-NGP(Müller 等人,2022)多哈希网格扩展到 4D,为每个输入生成紧凑的潜在向量。给定归一化输入 $\tilde{x} = [\bar{\mu}^\top, t_{\text{norm}}]^\top$,我们通过单个时空编码器将其映射到统一的 4D 嵌入中。与低秩分解(例如,平面分解)相比,虽然低秩分解可能减少计算量,但随着高斯数量的增加会降低表达能力,并且会因每级哈希管理而产生额外成本,我们避免此类分解,而是直接采用 4D 哈希编码器(Chen 等人,2025),如下所示: $$ z = f_{\text{enc}}(\tilde{x}) \in \mathbb{R}^{LF} \quad (9) $$ 其中 $L$ 表示哈希级别的数量,$F$ 表示每级的通道数。我们将所有级别的特征连接起来形成 $z \in \mathbb{R}^{LF}$,我们将其用作潜在表示。
用于高斯属性预测的属性感知解码器。给定潜在向量 $z$,我们使用多分支解码器来生成高斯参数,包括尺度、旋转、球谐系数和不透明度。每个属性由一个单独的头部(三层 MLP)预测,该头部接收
第 6 页
作为 ICLR 2026 的会议论文发表
共享编码器输出 $z \in \mathbb{R}^L$ 作为输入。所有解码器头均使用 GELU (Hendrycks & Gimpel, 2016) 激活函数,而非 ReLU (Agarap, 2018)。
$$ (\hat{s}, \hat{r}, \hat{s}_h, \hat{o}) = f_{\text{scale}}(z), f_{\text{rot}}(z), f_{\text{sh}}(z), f_{\text{opacity}}(z) \quad . \quad (10) $$
我们使用属性特定的激活函数和后处理步骤将原始输出转换为有效的参数范围:
$$ (s, r, s_h, o) = \exp(\hat{s}), \frac{\hat{r}}{\|\hat{r}\|_2}, \hat{s}_h, \sigma(\hat{o}) \quad . \quad (11) $$
我们还遵循高斯后处理 (Kerbl et al., 2023) 流程,并增加了一些额外步骤以实现稳定训练。
缩放解码器。为了防止指数增长导致的梯度爆炸,我们在反向传播中对预缩放值进行裁剪:$\hat{s} \leftarrow \text{clip}(\hat{s}, \max = 20)$。我们还将最终层的偏置初始化为 $-5$,以便从较小的缩放比例开始,即 $\exp(-5) \approx 0.0067$,并保持其可训练。
旋转解码器。为了使预测的四元数在训练初期偏向单位四元数,我们将最终层的偏置设置为 $(1, 0, 0, 0)$,即第一个元素为 $1.0$,其余元素为 $0$,使得初始输出满足 $\hat{r} \approx (1, 0, 0, 0)$。这种初始化允许网络逐步学习旋转,同时保持稳定的初始结构。
不透明度解码器。为了稳定早期训练并鼓励接近透明的起始状态,我们将最终层的偏置设置为 $\text{logit}(0.1) \approx -2.197$(可训练),将 $\hat{o}$ 初始化为 $\approx 0.1$。随后,网络仅在有需要的地方学习增加不透明度,从而聚焦于信息丰富的点。
颜色解码器。解码器直接从编码器嵌入中回归颜色系数,无需特殊初始化,以捕获基于球谐函数(SH)渲染所需的高维颜色。
损失目标。最后,通过光栅化渲染帧图像,并使用标准的 3DGS 重建损失优化模型,如下所示:
$$ L = (1 – \lambda) L_1 + \lambda L_{\text{D-SSIM}} \quad . \quad (12) $$
其中 $\lambda$ 是超参数;我们遵循先前的工作 (Kerbl et al., 2023) 设置 $\lambda = 0.2$。
4 实验
在本节中,我们展示了所提出方法 SPIN-4DGS 的有效性。具体而言,我们选择在早期训练阶段采用最近公开的显式参数化方法 Realtime-4DGS (Yang et al., 2024a) 来估计时空高斯位置。这些位置随后在我们的框架中用于学习新的高斯属性。接着,我们在 CMU Panoptic Sports 数据集 (Joo et al., 2015) 的各种运动场景基准上评估其捕捉快速运动的能力,并与现有的 4DGS 基线方法进行比较。
实现细节。网络使用 $64$ 的隐藏维度,编码器配置为 $L = 16$ 层,每层 $F = 4$ 个特征;哈希表大小为 $2^{21}$。编码器和解码器中的参数组使用不同的学习率,因为高斯属性(如缩放和旋转)对超参数敏感,统一的学习率通常会导致优化不稳定。编码器学习率初始化为 $8 \times 10^{-3}$;解码器学习率分别为:颜色 $1 \times 10^{-3}$,缩放 $3 \times 10^{-4}$,旋转 $3 \times 10^{-5}$,不透明度 $8 \times 10^{-4}$。位置参数使用与 3DGS 相同的学习率。我们使用 Adam (Kingma & Ba, 2015) 优化器,并采用线性预热和余弦衰减调度,在此调度下,每个参数的学习率衰减至 $1 \times 10^{-7}$。实验在 RTX 4090 GPU (24 GB) 上进行,实现使用了 PyTorch (Paszke et al., 2019) 2.1 和 CUDA 11.8。默认情况下,我们以 $3$ 的批量大小训练 $40\text{K}$ 次迭代。我们使用 PSNR(峰值信噪比)、SSIM (Wang et al. (2004); 结构相似性指数) 和 LPIPS (Zhang et al. (2018); 学习感知图像块相似性) 进行定量评估,并额外报告每秒帧数 (FPS) 以评估渲染速度。
数据集。我们在实验中采用 CMU Panoptic Sports 数据集 (Joo et al., 2015) 来验证具有大幅帧间位移的快速运动场景。具体而言,Panoptic Sports 数据集是一个具有挑战性的基准,包含六个运动场景:杂耍 (juggle)、篮球 (basketball)、箱子 (boxes)、足球 (football)、垒球 (softball) 和网球 (tennis)。每个场景以 $30$ FPS 录制 $5$ 秒(每个场景 $150$ 帧)。
6
第 7 页
发表于 ICLR 2026 会议论文
表 1:CMU Panoptic Sports 数据集中动态体育场景的对比结果。我们在包含快速运动和大帧间位移的基准测试中,将我们的方法与现有的 4DGS 基线方法进行了评估。我们报告了所有基线方法在六个体育场景序列上的 PSNR 和 SSIM 指标。
方法 4DGS 类别 篮球 拳击 橄榄球 杂耍 垒球 网球 平均
PSNR↑ SSIM↑ PSNR↑ SSIM↑ PSNR↑ SSIM↑ PSNR↑ SSIM↑ PSNR↑ SSIM↑ PSNR↑ SSIM↑ PSNR↑ SSIM↑ FPS↑ 存储↓
Grid4D (Xu et al., 2024) 可变形 25.82 0.89 26.81 0.91 27.61 0.91 28.09 0.92 26.91 0.91 27.10 0.91 27.06 0.91 146 333 MoDec-GS (Kwak et al., 2025) 可变形 27.42 0.90 26.17 0.92 27.09 0.92 28.03 0.93 27.31 0.92 27.36 0.92 27.23 0.92 62 34 4DGaussian (Wu et al., 2024) 可变形 27.28 0.90 27.32 0.91 28.71 0.91 26.94 0.91 27.24 0.91 27.66 0.91 27.53 0.91 40 62 TC3DGS (Javed et al., 2024) 外部监督 27.92 0.89 28.28 0.89 28.00 0.89 29.15 0.90 27.96 0.89 25.97 0.89 27.88 0.89 890 49 D3DGS (Luiten et al., 2024) 外部监督 28.22 0.91 29.46 0.91 28.49 0.91 29.48 0.91 28.43 0.91 28.11 0.91 28.70 0.91 760 1994 4D-Rotor-Gaussians (Duan et al., 2024) 显式 27.76 0.90 26.94 0.89 26.54 0.92 27.62 0.92 27.03 0.92 27.09 0.91 27.16 0.91 100 94 Realtime-4DGS (Yang et al., 2024a) 显式 27.89 0.92 28.17 0.93 28.35 0.93 28.68 0.93 28.67 0.93 28.50 0.93 28.38 0.93 197 1293
我们的方法 30.05 0.92 29.91 0.93 29.99 0.93 30.31 0.93 30.24 0.93 30.14 0.93 30.11 0.93 104 1261
篮球
网球
垒球
橄榄球
4DGaussian Realtime-4DGS D3DGS 我们的方法 GT
图 4:CMU Panoptic Sports 数据集中动态体育场景的可视化结果。与早期的 4D 高斯基线方法相比,快速移动的物体(例如球、球棒和球拍)通常会消失或变得损坏,而我们的方法在整个序列中成功保留了这些物体,产生了更忠实且一致的重建结果。
共使用了 31 台摄像机,并保留了 640 × 360 的原生分辨率。评估参考了四个固定的测试摄像机(ID 为 0、10、15 和 30)。
4DGS 基线方法。我们将我们的方法与各种策略下的最新 4DGS 基线方法进行了比较,包括 (a) 4DGS 的显式参数化:Realtime-4DGS (Yang et al., 2024a)、4D-Rotor-Gaussians (Duan et al., 2024)1;(b) 可变形 4DGS:Grid4D (Xu et al., 2024)、4D Gaussian (Wu et al., 2024)、MoDec-GS (Kwak et al., 2025);以及 (c) 外部监督:D3DGS (Luiten et al., 2024)、TC3DGS (Javed et al., 2024)。我们注意到,D3DGS 和 TC3DGS 旨在处理大帧间位移,例如 Panoptic Sports 数据集。所有基线方法均按照其论文中指定的动态场景设置进行评估。
4.1 PANOPTIC SPORTS 上的实验结果
在本节中,我们在 CMU Panoptic Sports 数据集中的六个动态体育场景(篮球、拳击、橄榄球、杂耍、垒球和网球)上,将我们的方法与各种 4DGS 基线方法进行了评估,这些场景涉及快速的人体运动以及经历大帧间位移的小物体。
如表 1 所示,SPIN-4DGS 在所有六个场景上均取得了最佳的 PSNR 指标,平均值为 30.11 dB,比最强的显式基线 Realtime-4DGS (28.38 dB) 高出 +1.73 dB,比外部监督基线 D3DGS (28.70 dB) 高出 +1.41 dB。SSIM 也持续保持在 0.93 的高水平,证实了重建质量的稳定性。特别是,我们的方法甚至超越了使用外部监督(如分割图)训练模型(例如 D3DGS、TC3DGS),表明无需昂贵的先验知识即可实现高保真度。除了平均值之外,在具有极端运动的挑战性场景上,改进最为显著。在篮球场景中,SPIN-4DGS 提升了
1我们使用作者发布的官方 PyTorch 代码重新实现了该方法。
7
第 8 页
在最佳基线方法 D3DGS (Luiten et al., 2024) 的基础上,PSNR 提高了超过 +1.83 dB;而在网球场景中,由于球拍移动迅速且位移较大,我们的方法相比最佳基线 Realtime-4DGS (Yang et al., 2024a) 的优势也超过了 +1.64 dB。总体而言,这些结果凸显了我们的方法在面对快速运动场景时的鲁棒性,而先前的方法在这些场景中往往表现不佳。
图 4 中的定性比较进一步说明了这些差异。可变形基线(即 4DGaussian,第一列)的结果模糊了细粒度结构,显式的 Realtime-4DGS(第二列)结果经常丢失移动物体,即使是外部监督的(即 D3DGS,第三列)结果在网球拍等小而快的物体上也出现了退化。相比之下,SPIN-4DGS 在所有帧中都能保持清晰且稳定的重建效果,与真实值(ground truth)非常接近。
如图 4 所示,只有外部监督的基线方法(例如 D3DGS)能够表示这些体育场景中的快速移动物体(例如篮球)。尽管 D3DGS 实现了较高的渲染速度,但它在训练过程中需要外部监督,并且为了存储整个序列的大量高斯属性,产生了巨大的存储开销(1994 MB)。显式的 Realtime-4DGS 渲染速度比 SPIN-4DGS 更快,但仍然无法重建这些快速移动的物体,且 PSNR 较低。相比之下,SPIN-4DGS 通过仅存储高斯位置和神经网络,以较小的存储 footprint(1261 MB)实现了更高的保真度。这种基于网络的方法还使得无需存储整个序列的所有高斯点,即可仅重建选定的时间区间。与其他基于网络的形变基线方法相比,SPIN-4DGS 达到了 104 FPS 的帧率,显著高于 4DGaussian(40 FPS)和 MoDec-GS(62 FPS),而这些方法在表示快速移动物体方面仍然面临困难。这些观察结果表明,SPIN-4DGS 在快速运动体育场景中,在保真度、存储和速度之间提供了一个实际可用的权衡方案。
4.2 消融实验与分析
我们进行了一系列消融实验,以进一步证明所提出方法的有效性。首先,我们在表 2 和表 3 中分析了估计的时空位置质量及细化过程的影响。我们还在表 4 中考察了一个位置复用设置,其中提供了现有 4DGS 模型的位置,以验证我们属性学习方案的有效性。最后,我们在表 5 中验证了隐式网络中各个组件的效果。
表 2:时空位置的消融研究。我们对 (a) 从显式基线 Realtime-4DGS (Yang et al., 2024a) 估计时空高斯位置所使用的早期训练持续时间进行变化,并在不进行后续细化的情况下进行评估;以及 (b) 在位置估计后应用的逐帧细化迭代次数进行变化,进行了消融研究。
(a) 早期训练持续时间的效果 (b) 细化迭代次数的效果
迭代次数 PSNR↑ SSIM↑ LPIPS↓ 时间↓ 迭代次数 PSNR↑ SSIM↑ LPIPS↓ 时间↓ 0.5K 29.86 0.92 0.14 33分钟 15K 29.57 0.92 0.15 10分钟 1K 29.89 0.92 0.14 55分钟 30K 29.39 0.91 0.15 30分钟 2K 30.05 0.92 0.14 1小时 40分钟
时空位置的消融研究。我们研究了估计的时空位置的质量以及细化的程度对最终重建效果的影响。结果总结在表 2 中,评估基于篮球序列。
(a) 早期训练持续时间的效果。使用从 Realtime-4DGS (Yang et al., 2024a) 15K 次迭代后提取的位置,仅花费 10 分钟成本就取得了良好的性能(29.57 PSNR,0.92 SSIM)。将训练延长至 30K 次迭代不仅使运行时间增加了三倍,而且略微降低了质量,这表明一旦位置足够稳定,就不需要进行长时间的优化。
(b) 细化迭代次数的效果。随后,我们变化了位置估计后逐帧细化步骤的数量。将细化从 0.5K 次迭代增加到 2K 次迭代,使 PSNR 从 29.86 提高到 30.05,证实了适度的细化能带来一致的好处。在实践中,我们还在细化过程中剪枝冗余的高斯点,这减少了背景杂乱,并将更新集中在显著区域,进一步提高了效率。
输入位置公式的影响。我们进一步分析了表 3 和图 5 中时空切片的效果。为了公平比较,我们将批量大小固定为 1,并在所有实验中运行
第 9 页
作为 ICLR 2026 的会议论文发表
足球序列,仅改变位置设计。我们比较两种设置:(a) 无时空切片(w/o spatiotemporal slicing),其中所有高斯在无需切片的情况下联合优化;(b) 时空切片( ours),其中位置按帧切片并沿时间轴对齐。
如表 3 所示,在没有切片的情况下,高斯在统一的 4D 空间中联合优化。在这种公式中,单个高斯必须同时解释多个时间戳。然而,光栅化是按帧进行的,因此减少某一帧损失的优化不可避免地会使高斯在其他帧中次优。这种跨帧干扰削弱了监督信号,减慢了收敛速度,并增加了训练时间和内存使用量。相比之下,时空切片显式地按 $(x, y, z, t)$ 分离高斯,并在每一帧中过滤掉不相关的点。这避免了跨帧干扰,并确保优化专注于每个时间步的相关高斯。因此,切片既实现了更高的重建保真度,又显著降低了训练成本。
图 5 中的定性比较证实了这些发现。在统一的 4D 公式下,随着高斯试图描述其他时间戳,属性发生坍缩,导致面部模糊和快速移动物体(如场景中的足球)失真。我们的切片公式在时间上解耦高斯,显示出更清晰的细节和时间一致的重建。
表 3:时空切片的消融实验。我们比较了统一的 4D 公式(即无切片),其中高斯位置在时空上联合优化,与我们为每帧分配位置的时空切片策略。
| 时空切片 | PSNR↑ | SSIM↑ | 时间↓ | 训练成本↓ | | :— | :— | :— | :— | :— | | ✗ | 27.48 | 0.89 | 1h 20m | 18GB | | ✓ | 28.96 | 0.92 | 25m | 9GB |
图 5:时空切片的定性比较。没有切片时,高斯同时表示多个时间步,导致它们在光栅化期间的贡献重叠和冲突。这导致面部模糊和快速移动物体失真。我们的切片在时间上显式分离高斯,通过时间一致的重建提高质量。
隐式 4DGS 方案的影响。我们通过重用强基线的位置并仅使用我们的框架重新训练属性,进一步验证了所提出的隐式 4DGS 方案的影响。在这种设置中,我们从 D3DGS (Luiten et al., 2024) 和 Realtime-4DGS (Yang et al., 2024a) 中提取预训练的时空位置,但丢弃它们所有学习到的属性。SPIN-4DGS 随后通过其隐式网络学习新属性,同时保持导入的位置可学习,以便在训练期间进行细化。这种设置不仅突显了我们属性学习设计的有效性,还展示了其与现有 4DGS 管道的即插即用兼容性,无论底层位置估计器如何,我们的方案都能一致地提高重建质量。
如表 4 所示,即使使用外部位置初始化,SPIN-4DGS 也能一致地提高性能。使用 D3DGS 位置时,我们的方法在 Softball 场景中将 PSNR 提高了 +2.49 dB,SSIM 达到 0.95。值得注意的是,虽然 D3DGS 在 Tennis 上坍缩(28.11/0.91),但 SPIN-4DGS 仍能实现 30.51/0.95 的清晰重建。即使使用 4DGS 位置,我们的框架在整体上仍实现了一致的增益,证明了所提出方案的有效性。虽然 SSIM 在某些情况下偶尔略有下降,但我们发现这种微小的损失可以通过我们的细化步骤轻松解决,表明性能保持稳健和稳定。
我们发现,仅靠高质量的位置不足以实现稳定的重建,因为属性在保持大帧间位移下的保真度方面起着关键作用。我们还观察到
9
第 10 页
作为 ICLR 2026 的会议论文发表
表 4:与现有 4DGS 基线方法的兼容性。我们复用了来自 D3DGS (Luiten et al., 2024) 和 Realtime-4DGS (Yang et al., 2024a) 的预训练位置,并用我们提出的隐式网络训练替换了其属性优化过程。SPIN-4DGS 在所有场景中均一致地提高了 PSNR/SSIM 指标,突显了所提出的隐式 4DGS 方案的兼容性和有效性。
| Method | Basketball PSNR↑ SSIM↑ | Boxes PSNR↑ SSIM↑ | Football PSNR↑ SSIM↑ | Juggle PSNR↑ SSIM↑ | Softball PSNR↑ SSIM↑ | Tennis PSNR↑ SSIM↑ | | :— | :— | :— | :— | :— | :— | :— | | Realtime-4DGS (Yang et al., 2024a) | 27.89 0.92 | 28.17 0.93 | 28.35 0.93 | 28.68 0.93 | 28.67 0.93 | 28.50 0.93 | | Realtime-4DGS + Ours | 29.57 0.92 | 29.63 0.92 | 29.42 0.92 | 29.98 0.92 | 29.94 0.93 | 29.83 0.93 | | D3DGS (Luiten et al., 2024) | 28.22 0.91 | 29.46 0.91 | 28.49 0.91 | 29.48 0.92 | 28.43 0.91 | 28.11 0.91 | | D3DGS + Ours | 30.50 0.94 | 30.26 0.94 | 29.21 0.94 | 31.04 0.95 | 30.92 0.95 | 30.51 0.95 |
我们的隐式 4DGS 公式能够无缝推广到不同的基线方法,无论位置来源如何,均展现出强大的兼容性和一致的性能提升。综上所述,这些结果突显了 SPIN-4DGS 作为一种有效且可扩展的 4DGS 方案,能够增强广泛的动态场景重建任务。
表 5:关于隐式网络设计组件的消融实验。从原始的 4D 哈希编码器 (Chen et al., 2025) 开始,我们分析了使位置可训练、应用输入位置归一化以及更改激活函数的影响。每项修改都逐步提升了重建质量。所有实验均在 Basketball 场景上进行。
| Network Components | Results | | | | | | | :— | :— | :— | :— | :— | :— | :— | | Trainable position | Normalization | Activation | Hash Map Size | PSNR↑ | SSIM↑ | LPIPS↓ | | | ReLU | ReLU | 221 | 18.64 | 0.78 | 0.45 | | ✓ | | ReLU | 221 | 19.17 | 0.78 | 0.46 | | ✓ | ✓ | ReLU | 221 | 29.89 | 0.92 | 0.16 | | ✓ | ✓ | GELU | 221 | 30.05 | 0.92 | 0.14 | | ✓ | ✓ | GELU | 223 | 30.25 | 0.93 | 0.13 |
组件分析。我们对隐式网络的设计组件进行了消融研究,总结于表 5 中。从具有固定位置和 ReLU 激活函数的原始 4D 哈希编码器 (Chen et al., 2025) 开始,重建质量显著较差(18.64 PSNR,0.78 SSIM,0.45 LPIPS)。仅使位置可训练仅带来边际改善,表明在没有其他修改的情况下,位置细化是不足的。应用输入位置归一化带来了显著增益,将 PSNR 提升了超过 +10 dB,并将 LPIPS 从 0.45 降低至 0.16,突显了其在稳定训练中的重要性。用 GELU 替换 ReLU 进一步提高了保真度,而增大哈希映射大小则实现了最佳的整体性能(30.25 PSNR,0.93 SSIM,0.13 LPIPS)。这些结果证实,每个组件都对稳定性和准确性有所贡献,而它们的组合对于实现高质量重建至关重要。
5 结论
在本工作中,我们解决了在大帧间位移下快速运动动态场景重建的挑战。现有的 4DGS 方法,包括可变形和显式方法,往往在这种条件下无法维持高斯属性,导致物体模糊或消失。我们引入了 SPIN-4DGS,这是一种新框架,它通过前馈网络直接从显式时空位置学习高斯属性,而不是依赖于时序位移建模。通过将高斯位置估计与高斯属性学习解耦,SPIN-4DGS 为表示快速运动下的动态场景提供了一种简单而有效的设计原则。通过在 CMU Panoptic Sports 数据集的动态体育场景中进行大量实验,SPIN-4DGS 在大帧间位移下实现了快速运动物体的高质量重建。总体而言,我们认为 SPIN-4DGS 推动了 4D Gaussian Splatting 在具有挑战性的现实场景中的实际部署。
10
第 11 页
发表于 ICLR 2026 会议论文
致谢
本研究得到了韩国国家研究基金会(NRF)资助的韩国政府(MSIT)项目(RS-2025-24533937)的支持,以及由韩国科学技术信息通信部(MSIT)资助的“融合安全核心人才培养业务支持项目”(IITP-2024-RS-2024-00423071)的支持,该项目由信息通信技术规划与评估研究所(IITP)监督。
参考文献
Abien Fred Agarap. 使用整流线性单元(ReLU)进行深度学习。arXiv 预印本 arXiv:1803.08375,2018。
Jeongmin Bae, Seoha Kim, Youngsik Yun, Hahyun Lee, Gun Bang, 和 Youngjung Uh. 基于高斯嵌入的形变用于可形变 3D 高斯泼溅。在欧洲计算机视觉会议(ECCV),页码 321–335。Springer,2024。
Jonathan T. Barron, Ben Mildenhall, Matthew Tancik, Peter Hedman, Ricardo Martin-Brualla, 和 Pratul P. Srinivasan. Mip-nerf:用于抗锯齿神经辐射场的多尺度表示,2021。
Ang Cao 和 Justin Johnson. Hexplane:动态场景的快速表示。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,页码 130–141,2023。
Jie Chen, Zhangchi Hu, Peixi Wu, Huyue Zhu, Hebei Li, 和 Xiaoyan Sun. Dash:用于实时动态场景渲染的自监督分解和 4D 哈希编码。在国际计算机视觉会议(ICCV),2025。
Pinxuan Dai, Peiquan Zhang, Zheng Dong, Ke Xu, Yifan Peng, Dandan Ding, Yujun Shen, Yin Yang, Xinguo Liu, Rynson WH Lau 等。具有运动分层的高斯视频。ACM 图形学汇刊(TOG),44(4):1–14,2025。
Yuanxing Duan, Fangyin Wei, Qiyu Dai, Yuhang He, Wenzheng Chen, 和 Baoquan Chen. 4D-转子高斯泼溅:面向动态场景的高效新视角合成。在 ACM SIGGRAPH 2024 会议论文,页码 1–11,2024。
Sara Fridovich-Keil, Giacomo Meanti, Frederik Rahbæk Warburg, Benjamin Recht, 和 Angjoo Kanazawa. K-planes:空间、时间和外观中的显式辐射场。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,页码 12479–12488,2023。
Dan Hendrycks 和 Kevin Gimpel. 高斯误差线性单元(GELU)。arXiv 预印本 arXiv:1606.08415,2016。
Saqib Javed, Ahmad Jarrar Khan, Corentin Dumery, Chen Zhao, 和 Mathieu Salzmann. 用于动态场景的时间压缩 3D 高斯泼溅。arXiv 预印本 arXiv:2412.05700,2024。
Hanbyul Joo, Hao Liu, Lei Tan, Lin Gui, Bart Nabbe, Iain Matthews, Takeo Kanade, Shohei Nobuhara, 和 Yaser Sheikh. Panoptic studio:用于社交动作捕捉的大规模多视角系统。在 IEEE 国际计算机视觉会议论文集,页码 3334–3342,2015。
Bernhard Kerbl, Georgios Kopanas, Thomas Leimk¨uhler, 和 George Drettakis. 用于实时辐射场渲染的 3D 高斯泼溅。ACM 图形学汇刊,42(4),2023 年 7 月。
Diederik P. Kingma 和 Jimmy Ba. Adam:一种随机优化方法。在国际表征学习会议(ICLR),2015。
Sangwoon Kwak, Joonsoo Kim, Jun Young Jeong, Won-Sik Cheong, Jihyong Oh, 和 Munchurl Kim. Modec-gs:用于紧凑动态 3D 高斯泼溅的全局到局部运动分解和时间间隔调整。在计算机视觉与模式识别会议(CVPR)论文集,页码 11338–11348,2025。
11
第 12 页
作为会议论文发表于 ICLR 2026
Junoh Lee, ChangYeon Won, Hyunjun Jung, Inhwan Bae, 和 Hae-Gon Jeon. Fully explicit dynamic gaussian splatting. Advances in Neural Information Processing Systems, 37:5384–5409, 2024.
Minseo Lee, Byeonghyeon Lee, Lucas Yunkyu Lee, Eunsoo Lee, Sangmin Kim, Seunghyeon Song, Joo Chan Lee, Jong Hwan Ko, Jaesik Park, 和 Eunbyung Park. Optimized minimal 4d gaussian splatting, 2025. URL https://arxiv.org/abs/2510.03857.
Lingzhi Li, Zhen Shen, Zhongshu Wang, Li Shen, 和 Ping Tan. Streaming radiance fields for 3d video synthesis. Advances in Neural Information Processing Systems, 35:13485–13498, 2022a.
Tianye Li, Mira Slavcheva, Michael Zollhoefer, Simon Green, Christoph Lassner, Changil Kim, Tanner Schmidt, Steven Lovegrove, Michael Goesele, Richard Newcombe, 等. Neural 3d video synthesis from multi-view video. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 5521–5531, 2022b.
Youtian Lin, Zuozhuo Dai, Siyu Zhu, 和 Yao Yao. Gaussian-flow: 4d reconstruction with dynamic 3d gaussian particle. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 21136–21145, 2024.
Zhicheng Lu, Xiang Guo, Le Hui, Tianrui Chen, Min Yang, Xiao Tang, Feng Zhu, 和 Yuchao Dai. 3d geometry-aware deformable gaussian splatting for dynamic view synthesis. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 8900–8910, 2024.
Jonathon Luiten, Georgios Kopanas, Bastian Leibe, 和 Deva Ramanan. Dynamic 3d gaussians: Tracking by persistent dynamic view synthesis. In 2024 International Conference on 3D Vision (3DV), pp. 800–809. IEEE, 2024.
Jipeng Lyu, Jiahua Dong, 和 Yu-Xiong Wang. SCas4d: Structural cascaded optimization for boosting persistent 4d novel view synthesis. Transactions on Machine Learning Research, 2025. ISSN 2835-8856. Featured Certification.
Thomas Müller, Alex Evans, Christoph Schied, 和 Alexander Keller. Instant neural graphics primitives with a multiresolution hash encoding. ACM Transactions on Graphics, 41(4):1–15, July 2022. ISSN 1557-7368. doi: 10.1145/3528223.3530127.
Seungjun Oh, Younggeun Lee, Hyejin Jeon, 和 Eunbyung Park. Hybrid 3d-4d gaussian splatting for fast dynamic scene representation. arXiv preprint arXiv:2505.13215, 2025.
Keunhong Park, Utkarsh Sinha, Jonathan T. Barron, Sofien Bouaziz, Dan B Goldman, Steven M. Seitz, 和 Ricardo Martin-Brualla. Nerfies: Deformable neural radiance fields. ICCV, 2021.
Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, Alban Desmaison, Andreas Kopf, Edward Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, 和 Soumith Chintala. Pytorch: An imperative style, high-performance deep learning library. In Advances in Neural Information Processing Systems 32, pp. 8024–8035. Curran Associates, Inc., 2019.
Johannes L Schonberger 和 Jan-Michael Frahm. Structure-from-motion revisited. In Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 4104–4113, 2016.
Jiakai Sun, Han Jiao, Guangyuan Li, Zhanjie Zhang, Lei Zhao, 和 Wei Xing. 3dgstream: On-the-fly training of 3d gaussians for efficient streaming of photo-realistic free-viewpoint videos. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 20675–20685, June 2024.
Zhou Wang, Alan C Bovik, Hamid R Sheikh, 和 Eero P Simoncelli. Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing, 13(4):600–612, 2004.
Guanjun Wu, Taoran Yi, Jiemin Fang, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Qi Tian, 和 Xinggang Wang. 4d gaussian splatting for real-time dynamic scene rendering. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 20310–20320, 2024.
12
第 13 页
作为会议论文发表于 ICLR 2026
Jiawei Xu, Zexin Fan, Jian Yang, 和 Jin Xie。Grid4d:用于高保真动态高斯泼溅的4D分解哈希编码。《神经信息处理系统进展》,37: 123787–123811, 2024.
Zeyu Yang, Hongye Yang, Zijie Pan, 和 Li Zhang。使用4D高斯泼溅实现实时照片级真实动态场景表示与渲染。在《国际学习表征会议》(ICLR), 2024a.
Ziyi Yang, Xinyu Gao, Wen Zhou, Shaohui Jiao, Yuqing Zhang, 和 Xiaogang Jin。用于高保真单目动态场景重建的可变形3D高斯泼溅。在《IEEE/CVF计算机视觉与模式识别会议论文集》, 页码 20331–20341, 2024b.
Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, 和 Oliver Wang。深度特征作为感知度量的不合理有效性。在《IEEE计算机视觉与模式识别会议论文集》, 页码 586–595, 2018.
Ruijie Zhu, Yanzhe Liang, Hanzhi Chang, Jiacheng Deng, Jiahao Lu, Wenfei Yang, Tianzhu Zhang, 和 Yongdong Zhang。Motiongs:探索可变形3D高斯泼溅的显式运动引导。《神经信息处理系统进展》,37:101790–101817, 2024.
Matthias Zwicker, Hanspeter Pfister, Jeroen Van Baar, 和 Markus Gross。Ewa体积泼溅。在《可视化会议论文集》,2001. VIS’01., 页码 29–538. IEEE, 2001.
13
第 14 页
作为会议论文发表于 ICLR 2026
A 更多消融实验
感知质量比较。在感知质量(LPIPS)方面,SPIN-4DGS 在 CMU 数据集的所有六个场景中也提供了具有竞争力的性能。如表 6 所示,我们的方法实现了 0.14 的平均 LPIPS,显著优于最强的基线 D3DGS(0.18),同时与显式的 Realtime-4DGS(0.13)保持接近。这些结果表明,SPIN-4DGS 有效地抑制了快速运动物体周围的模糊和坍塌伪影,而没有牺牲感知保真度,并且结合 PSNR/SSIM 的提升,进一步证实了我们的方法在具有挑战性的快速运动场景下的鲁棒性。
表 6:感知质量比较。我们在 CMU Panoptic Sports 数据集的六个体育场景中报告了 LPIPS。分数越低表示感知质量越好。
模型 4DGS 类别 篮球 拳击 橄榄球 杂耍 垒球 网球 平均
D3DGS (Luiten et al., 2024) 外部监督 0.18 0.17 0.19 0.15 0.19 0.17 0.18 Realtime-4DGS (Yang et al., 2024a) 显式 0.14 0.12 0.13 0.12 0.12 0.13 0.13 我们的方法 – 0.14 0.14 0.14 0.13 0.13 0.13 0.14
训练预算。与最强的基线 D3DGS 相比,SPIN-4DGS 在重建质量和训练时间之间提供了更好的权衡,如表 7 所示。在无需优化的轻量级 15K 迭代配置下,SPIN-4DGS 在篮球场景上已达到 28.82 dB,优于 D3DGS(28.22 dB),同时将训练时间从 100 分钟减少到 45 分钟。增加一个短期的优化阶段(15K 位置迭代和 0.5K 优化迭代)进一步将 PSNR 提高到 29.13 dB,耗时 73 分钟,仍快于 D3DGS。使用更多的计算资源,更长的优化带来了额外的提升:15K + 2K 在 142 分钟内达到 29.51 dB,而完整的 40K + 2K 设置在 195 分钟内达到 30.05 dB,即比 D3DGS 高出 +1.83 dB。总体而言,我们的两阶段设计可以用显著更小的训练预算(即使没有外部监督)来匹配或超越 D3DGS,同时在有更多预算时提供通向更高保真度的平滑路径。
表 7:训练时间分解及篮球场景上的 PSNR。我们比较了不同 SPIN-4DGS 配置和 D3DGS 基线之间的 PSNR、位置估计时间、优化成本、网络训练时间和总训练时间。所有时间测量均以分钟为单位报告。
方法 设置 PSNR 位置 优化 网络 总时间
D3DGS 默认 28.22 — — — 100
我们的 15K, 无优化 28.82 10 0 35 45 15K, 优化 (0.5K) 29.13 10 33 30 73 15K, 优化 (2K) 29.51 10 100 32 142 40K, 优化 (2K) 30.05 10 100 85 195
Neu3DV 基准。我们还在 Neu3DV(Li et al., 2022b) 基准上评估了 SPIN-4DGS,该基准具有复杂的背景和较小的运动。在这个实验中,我们保持默认的 SPIN-4DGS 训练设置,不包含优化阶段,仅在预优化的时空位置上训练,并将哈希图大小超参数在整个训练过程中设置为 223。如表 8 所示,SPIN-4DGS 达到了最高的平均 PSNR 32.19 dB,略优于最强的显式 Realtime-4DGS(32.01 dB)+0.18 dB,并明显优于可变形方法,如 Grid4D(31.49 dB)提高了 +0.70 dB,4DGaussian(31.01 dB)提高了 +1.18 dB。此外,SPIN-4DGS 在平均 PSNR 上比外部监督的 D3DGS 基线(31.04 dB)提高了 1.15 dB,SSIM 也保持在 0.95 的高水平,匹配或超越了最佳竞争方法。图 9 中的定性比较显示,移动物体(例如钳子和刀)在显式 Realtime-4DGS 中显得模糊或涂抹,而 SPIN-4DGS 以更清晰的细节重建它们,证实了在复杂、较慢运动场景下的稳定重建质量。
MeetRoom 基准。我们进一步在 MeetRoom 基准(Li et al., 2022a)的三个场景(Discussion, Trimming, VR Headset)上评估了 SPIN-4DGS,这些场景包含杂乱
14
第 15 页
作为会议论文发表于 ICLR 2026
表 8:在 Neu3DV 场景上的比较。我们报告了 SPIN-4DGS 和基线方法在六个序列上的 PSNR(以及可用时的 SSIM)。
| Method | 4DGS Category | Coffee PSNR↑ SSIM↑ | Martini PSNR↑ SSIM↑ | Cook Spinach PSNR↑ SSIM↑ | Cut Roasted Beef PSNR↑ SSIM↑ | Flame Salmon PSNR↑ SSIM↑ | Flame Steak PSNR↑ SSIM↑ | Sear Steak PSNR↑ SSIM↑ | Avg. PSNR↑ SSIM↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Grid4D (Xu et al., 2024) | Deformable | 28.30 0.90 | 32.58 0.95 | 33.22 0.95 | 29.12 0.91 | 32.56 0.96 | 33.16 0.96 | 31.49 0.94 | | | 4DGaussian (Wu et al., 2024) | Deformable | 27.34 0.90 | 32.50 0.94 | 32.26 0.94 | 27.99 0.90 | 32.54 0.95 | 33.44 0.95 | 31.01 0.93 | | | D3DGS (Luiten et al., 2024) | External supervision | 27.32 – | 32.97 – | 31.75 – | 27.26 – | 33.24 – | 33.68 – | 31.04 – | | | Realtime-4DGS (Yang et al., 2024a) | Explicit | 28.33 – | 32.93 – | 33.85 – | 29.38 – | 34.03 – | 33.51 – | 32.01 – | | | Realtime-4DGS(re-impl.) (Lee et al., 2025) | Explicit | 27.92 0.92 | 33.58 0.96 | 33.96 0.96 | 28.72 0.92 | 33.96 0.96 | 33.61 0.96 | 31.96 0.95 | | | Ours | – | 28.42 0.92 | 33.61 0.96 | 34.05 0.96 | 28.97 0.92 | 33.96 0.96 | 34.14 0.96 | 32.19 0.95 | |
门背景以及相对较小的运动。使用与主实验相同的配置,我们仅在预细化时空位置上训练 SPIN-4DGS,并将哈希表大小在训练过程中固定为 $2^{23}$。表 9 显示,SPIN-4DGS 始终 achieves 比所有基线更高的 PSNR,包括 StreamRF (26.72 dB)、3DGStream (30.79 dB) 和显式 Realtime-4DGS (30.47 dB)。总体而言,它比显式 Realtime-4DGS 平均提高了 +1.6 dB。特别是,在 Trimming 场景中,SPIN-4DGS 达到了 32.41 dB,比显式 Realtime-4DGS (30.16 dB) 提高了 2 dB 以上,同时保持了 0.96 的高 SSIM。图 10 中的定性比较说明了这些效果:虽然 Realtime-4DGS 由于前景和背景中的噪声和伪影,往往无法忠实地重建物体,但 SPIN-4DGS 产生了更清晰的物体重建和更干净得多的背景。这些结果表明,即使在具有杂乱背景和相对较小运动的室内场景中,我们的模型也保持稳健。
表 9:在 MeetRoom 场景上的比较。我们报告了 SPIN-4DGS 和基线方法在三个序列及其平均值上的 PSNR 和 SSIM。请注意,StreamRF 和 3DGStream 仅提供平均 PSNR 分数。
| Method | Category | Discussion PSNR↑ SSIM↑ | Trimming PSNR↑ SSIM↑ | VR Headset PSNR↑ SSIM↑ | AVG PSNR↑ SSIM↑ | | :— | :— | :— | :— | :— | :— | | StreamRF (Li et al., 2022a) | Implicit | – – | – – | – – | 26.72 – | | 3DGStream (Sun et al., 2024) | Explicit | – – | – – | – – | 30.79 – | | Realtime-4DGS (Yang et al., 2024a) | Explicit | 31.51 0.96 | 30.16 0.94 | 29.74 0.95 | 30.47 0.95 | | Ours | – | 32.30 0.96 | 32.41 0.96 | 31.42 0.95 | 32.04 0.96 |
与逐帧 3DGS 的比较。为了验证我们的时间共享隐式表示相对于逐帧 3DGS(即每帧的一组 3DGS)的优势,我们在 CMU Panoptic Sports 基准上直接将 SPIN-4DGS 与逐帧 3DGS (Kerbl et al., 2023) 和 D3DGS (Luiten et al., 2024) 进行了比较,其中我们引用了 D3DGS 中报告的结果。表 10 显示,SPIN-4DGS 在所有六个 CMU Panoptic Sports 场景上取得了最佳性能,超越了逐帧 3DGS 和 D3DGS。定量上,SPIN-4DGS 在逐帧 3DGS 上平均提高了 1.9 dB,在 Basketball 上增益高达 +3.03 dB。这些显著的提升表明,我们的时间共享隐式场能更好地利用时间规律性和跨帧相关性,从而产生比一组独立优化的逐帧 3DGS 模型更连贯的 4D 表示。
B 更多定性结果
时空位置细化的定性结果。图 6 可视化了表 2 中位置细化的消融研究。仅使用 0.5K 细化迭代,SPIN-4DGS 就已经捕获了稳定的物体结构而没有坍塌,而将迭代次数增加到 1K 和 2K 进一步改善了球边缘和球拍网等细节。具体而言,我们的细化阶段采用高斯密度化,这既在缺乏细节的区域分配新的高斯,又修剪冗余的高斯,逐步填充缺失的结构同时减少不必要的高斯数量。这个过程可以减轻对初始收集位置的依赖,允许 SPIN-4DGS 在可靠的输入点集上进行训练。这些结果表明,即使细化预算很少,SPIN-4DGS 也是有效的,额外的迭代主要用于锐化细节而不是防止坍塌。
15
第 16 页
发表于 ICLR 2026 会议论文
表 10:与 CMU Panoptic Sports 基准测试上的逐帧 3DGS 的比较。我们报告了六种运动项目的 PSNR,表明 SPIN-4DGS 在所有序列中均持续优于 3DGS 和 D3DGS。
模型 篮球 盒子 橄榄球 杂耍 垒球 网球 平均
3DGS (Kerbl 等, 2023) 27.02 28.74 28.49 28.19 28.77 28.03 28.21 D3DGS (Luiten 等, 2024) 28.22 29.46 28.49 29.48 28.43 28.11 28.70 ours 30.05 29.91 29.99 30.31 30.24 30.14 30.11
网球
垒球
橄榄球
0.5K 1K 2K
图 6:时空位置优化的可视化。我们可视化了不同优化迭代次数(0.5K、1K、2K)的效果,对应表 2b。即使仅有 0.5K 次迭代,SPIN-4DGS 也能保持物体结构的一致性而不发生坍塌,而逐步增加迭代次数则能恢复球边缘和球拍网等细节。
与各种基线方法的定性结果。图 7 展示了 CMU Panoptic Sports 数据集上与表 1 中两种基线方法(MoDec-GS 和 4D-Rotor-Gaussians)的定性比较。对于 MoDec-GS,虽然背景保持相对稳定,但人物变得严重模糊,且快速移动的物体(例如篮球、网球拍)通常无法正确重建,这与之前的可变形 4DGS 方法类似。4D-Rotor-Gaussians 更可靠地保留了这些物体,但在快速运动下仍表现出人物明显的模糊和几何不稳定性。相比之下,SPIN-4DGS 以清晰且时间上稳定的几何结构重建了移动物体和人物,产生了比两种基线方法更视觉干净且一致的结果。
与现有 4DGS 基线方法兼容性的定性结果。图 8 展示了表 4 中兼容性研究的定性结果。在所有场景中,我们的方法重建了稳定的背景和更多时间上一致的细节,而原始基线方法通常会使快速移动的物体模糊或丢失。这些结果证实,所提出的方案能够有效地与现有的 4DGS 方法集成,并可能在较大的帧间位移下提高其重建保真度。
C 讨论
4DGS 的最新趋势。最近同时出现的 4DGS 方法(Dai 等, 2025; Oh 等, 2025; Lyu 等, 2025)已被引入,它们通常共享相似的架构组件,但追求的目标和设计约束与我们不同。4DGV(Dai 等, 2025)专注于减少模型
16
第 17 页
作为会议论文发表于 ICLR 2026
篮球
网球
杂耍
垒球
足球
MoDec-GS 4D-Rotor-Gaussians Ours GT
图 7:CMU Panoptic Sports 数据集中动态运动场景的可视化。我们可视化了表 1 中评估的方法,包括 MoDec-GS 和 4D-Rotor-Gaussians。这些 4DGS 基线通常表现出几何不稳定性和快速运动伪影,而 SPIN-4DGS 在整个序列中保持物体和球员几何形状的清晰锐利。
盒子
杂耍
足球
Realtime-4DGS Realtime-4DGS + Ours D3DGS D3DGS + Ours GT
图 8:与现有 4DGS 基线兼容性的可视化。我们可视化了表 4 中兼容性消融实验的结果,其中复用了来自 4DGS 和 D3DGS 的预训练位置,并使用 SPIN-4DGS 重新训练属性。与原始基线相比,我们的方法始终产生更清晰且更稳定的重建结果。
通过利用外部 2D 分割来增加复杂动态场景的大小,从而依赖外部监督。Hybrid 3D–4DGS (Oh et al., 2025) 建立在 4DGS 之上,通过将随时间几乎不变的 3D 高斯转换为 3D 来减轻静态区域的冗余;然而,动态高斯仍在多个帧之间共享,导致快速运动下的跨帧干扰问题仍未解决。SCas4D (Lyu et al., 2025) 基于 Dynamic3DGS,通过簇级共享变换加速在线 4D 重建,但这种设计将簇内的所有高斯耦合到单个运动模型中,并使该方法对初始 K-means 聚类敏感。相比之下,SPIN-4DGS 直接从显式时空位置预测逐帧属性
17
第 18 页
作为会议论文发表于 ICLR 2026
Spinach Cook
Beef Roasted Cut
Realtime-4DGS Ours GT
图 9:在 Neu3DV 基准上的定性比较。我们可视化了表 8 中报告的两个 Neu3DV 场景(例如,Cook Spinach 和 Cut Roasted Beef)的代表性结果。4DGS 模糊了运动物体的边界(例如,筷子和刀),而 SPIN-4DGS 实现了显著更清晰且高保真的重建。
Trimming
Headset VR
Realtime-4DGS Ours GT
图 10:在 MeetRoom 基准上的定性比较。我们可视化了表 9 中报告的两个 MeetRoom 场景(例如,Trimming 和 VR Headset)的代表性结果。4DGS 表现出明显的背景噪声,并且经常无法忠实地重建前景物体,而 SPIN-4DGS 实现了更锐利的物体重建,背景显著更干净。
使用隐式解码器,避免跨帧干扰,并能够在不需要外部监督或基于聚类的初始化的情况下,稳定重建快速运动。
与先前 4DGS 方法的关键区别。SPIN-4DGS 与先前 4DGS 方法之间的关键概念区别在于时间外观的参数化方式。SPIN-4DGS 从显式时空位置光栅化每一帧,并通过 $f_\theta(u, t)$ 将高斯属性预测为时空坐标的函数。这种设计保持位置显式,仅允许在训练期间进行轻微的逐样本调整,并解耦跨时间步的属性优化,因此不同的样本可以获得不同的属性,而无需在时间上直接共享单个属性向量。
相比之下,标准显式 4DGS(例如,Realtime-4DGS (Yang et al., 2024a)、4D-Rotor-Gaussians (Duan et al., 2024))通过对 4D 基元进行时间切片来生成每一帧,而可变形 4DGS(例如,4DGaussian (Wu et al., 2024)、Grid4D (Xu et al., 2024))则随时间变换规范高斯;在这两种情况下,多个时间步共享相同的底层高斯属性。因此,一组高斯属性(或变换)同时影响多个帧,在大的帧间位移下,由一帧驱动的更新很容易降低其他帧的质量,导致快速运动物体的时间坍塌。我们的时间参数化在属性层面打破了这种耦合,并将时间表示放在 $f_\theta$ 中,而不是放在逐点变形场中。如表 1 所示,这在大的帧间位移下导致更稳定的训练,并在快速运动场景上产生更高的重建质量(PSNR/SSIM)。
18
第 19 页
作为 ICLR 2026 的会议论文发表
此外,几种可变形 4D Gaussian Splatting 方法刻意避免随时间变化的颜色和透明度,因为允许这些属性随时间变化通常会导致在新视角下产生不稳定或不合理的表面,并使跟踪变得困难。通过 $f_\theta$ 从时空坐标预测颜色和透明度,同时保持底层高斯支撑稳定,SPIN-4DGS 能够在不牺牲时间稳定性的情况下对真正随时间变化的外观进行建模,这对于具有大帧间位移的快速运动物体至关重要。
局限性。我们经验性地观察到,当存在足够密集的时空位置集合时,我们的方法最为有效。在初始位置稀疏的大规模户外或高度杂乱场景中,要实现高重建质量可能需要更长的细化(致密化/修剪)调度以分配更多高斯,从而增加整体训练成本。此外,对于初始点非常少的小物体或区域,我们经验性地观察到,即使经过多次细化迭代,也难以生成或恢复足够的缺失点。
LLM 策略。LLM 仅用于编辑(语法和拼写错误),未参与想法生成、分析、实验设计或解释。
19