E3DGS:通过颜色即几何嵌入实现3D高斯泼溅的统一几何-光度等变性

三分钟导读:E3DGS提出了一种基于表示论的统一矩阵嵌入方法,将3D高斯泼溅中的几何属性与球谐函数光度系数映射到统一的gl(3)李代数载体中,实现了严格的SE(3)等变性,从而在物体识别和机器人操作的世界模型中显著提升了姿态鲁棒性和数据效率。

英文题目:E3DGS: Unified Geometric–Photometric Equivariance for 3D Gaussian Splatting via Color-as-Geometry Embedding

论文出处:arXiv 每日论文精选 · arXiv:2607.15536

原始论文:PDF / 论文页面

对应视频标题:E3DGS:通过颜色即几何嵌入实现3D高斯泼溅的统一几何-光度等变性|推荐指数:★★★★★

这篇论文解决什么问题?

现有的3D高斯泼溅(3DGS)学习方法在处理旋转对称性时存在表示瓶颈:几何属性遵循标准张量变换规则,而球谐函数(SH)系数遵循Wigner-D矩阵变换,这种异构性导致现有方法通常丢弃高阶SH系数或依赖昂贵的Clebsch-Gordan张量积,破坏了视图依赖外观的对称性。

核心创新

  • Color-as-Geometry: 首次将视图依赖光度视为等变几何对象,通过显式 intertwiner 将SH(0-2)系数映射到gl(3)载体,使外观和几何遵循单一共轭法则。
  • Unified Matrix Carrier: 构建了完整的矩阵载体家族,证明任意SH度数均可通过矩阵共轭精确表示,3×3载体是覆盖ℓ≤2的最小载体。
  • Adjoint-Equivariant Transformer: 设计了原生于gl(3)流形的等变性注意力机制和归一化模块,通过不变量标量门控混合矩阵通道,计算复杂度为O(1)每对,避免了Clebsch-Gordan张量积的高昂成本。
  • Parameter Efficiency: 通过保留矩阵结构而非将其视为独立标量通道,将可训练参数量减少了约2.4-2.6倍(例如预训练从29.44M降至12.05M)。

方法概览

提出“颜色即几何”范式,证明对于ℓ≤2的球谐函数,其系数空间与3×3矩阵空间gl(3)在共轭作用下代数同构。通过线性 intertwiner 将几何(均值、协方差)和光度(SH系数)统一提升(Lifting)到gl(3)载体中,所有属性均遵循单一的共轭变换规则 M ↦ RMR⊤。基于此构建基于Reductive Lie Neurons (ReLN) 的等变性Transformer骨干网络,包括ReLN-Attention和ReLN-LayerNorm,避免使用复杂的张量积。

逐图理解论文

方法核心:颜色即几何

方法核心:颜色即几何
Figure 1: Overview of E3DGS. 3D Gaussian primitives couple geometry (mean/covariance) and view-dependent photometry (SH), which transform under camera-frame changes by heterogeneous SO(3) rules. E3DGS lifts both into a unified matrix carrier and processes them with a rigid-body equivariant backbone, enabling robust object recognition and action-conditioned Gaussian world modeling.

E3DGS提出“颜色即几何”范式,证明对于ℓ≤2的球谐函数,其系数空间与3×3矩阵空间gl(3)在共轭作用下代数同构。通过线性intertwiner,将几何均值、协方差与光度SH系数统一提升(Lifting)到gl(3)载体中,所有属性均遵循单一的共轭变换规则M ↦ RMR⊤,实现了严格的SE(3)等变性。

架构设计:等变Transformer

架构设计:等变Transformer
Figure 2: Architecture of the Base E3DGS Gaussian Masked Autoencoder. We instantiate our framework as a Gaussian MAE for object vision tasks (Section 5.1). Input 3D Gaussians undergo Unified Matrix Lifting to embed geometry and photometry into a single carrier. Following Gaussian Feature Grouping, scalar invariants modulate the equivariant features via invariant gating (⊗). The tokens are partially masked, processed by an equivariant autoencoder (fθ, gϕ), and reconstructed via an Equivariant Projector to compute Lrecon.

基于此载体,构建基于Reductive Lie Neurons的等变性Transformer骨干网络。包括ReLN-Attention和ReLN-LayerNorm,通过不变量标量门控混合矩阵通道。该设计原生于gl(3)流形,计算复杂度为O(1)每对,避免了传统Tensor Field Networks中Clebsch-Gordan张量积的高昂计算成本,实现了高效的等变特征处理。

结果:ModelNet10分类性能

结果:ModelNet10分类性能
Table 1: Classification Accuracy on ModelNet10 (overall ↑[%]). ID and SE(3) denote Identity and Special Euclidean group. Baselines are reproduced under identical configurations for fair comparison.

在ModelNet10 ID/SE(3)设置下,使用SH(0,1,2)输入的E3DGS准确率达到94.79%。相比之下,基线Gaussian-MAE仅为12.89%。这表明,引入高阶SH系数后,非等变架构因无法处理其变换敏感性而严重过拟合姿态相关性,导致性能崩溃,而E3DGS保持了稳定的表征能力。

结果:ModelNet40与分割

结果:ModelNet40与分割
Table 2: Classification Accuracy on ModelNet40 (overall ↑[%]). ID and SE(3) denote the Identity and Special Euclidean group. Values for E3DGS-MAE and reproduced Gaussian-MAE baselines under spatial transformations are provided to highlight the pose consistency induced by our unified gl(3) carrier.

在ModelNet40 ID/SE(3)设置下,E3DGS准确率为93.17%(SH 0,1),基线仅为3.28%。在ShapeNet Part分割任务中,SE(3)/SE(3)设置下mIoU为80.81%(SH 0,1,2),基线降至29.52%。这证实了统一矩阵载体在复杂场景分割和大规模分类中均能维持姿态一致性,显著优于非等变基线。

结果:机器人操作性能

结果:机器人操作性能
Table 3: Multi-task Success Rate (%) on RLBench. We evaluate 25 episodes per task for the final checkpoint across 10 challenging tasks (166 variations). Our E3DGS equivariant world-model variant is compared against state-of-the-art baselines. Best results are bolded and second-best results are underlined.

在RLBench多任务操作中,E3DGS构建的世界模型平均成功率为50.4%,优于ManiGaussian基线的44.8%。动态损失曲线显示,E3DGS加速了刚体状态转换的学习,收敛更快且稳态损失更低。这表明等变性在刚性体 articulation 任务中优势明显,但在接触密集或长视界任务中略逊于基线。

实验与关键结果

  • 物体识别:在ShapeSplat数据集上预训练,并在ModelNet10和ModelNet40上进行分类评估,测试ID/ID、ID/SE(3)和SE(3)/SE(3)设置下的鲁棒性。
  • 部分分割:在ShapeNet Part数据集上进行分割评估,验证高阶SH输入下的姿态一致性。
  • 机器人操作:在ManiGaussian框架内构建动作条件高斯世界模型,并在RLBench基准上进行多任务操作成功率评估。
  • ModelNet10 ID/SE(3)准确率94.79% (SH 0,1,2),基线Gaussian-MAE仅为12.89%(第 10 页)
  • ModelNet40 ID/SE(3)准确率93.17% (SH 0,1),基线Gaussian-MAE仅为3.28%(第 13 页)
  • RLBench平均成功率50.4%,优于ManiGaussian的44.8%(第 14 页)
  • 预训练参数量从29.44M降至12.05M,减少约59%(第 28 页)
  • ShapeNet Part SE(3)/SE(3) mIoU为80.81% (SH 0,1,2),基线降至29.52%(第 29 页)

阅读时需要注意

  • 当前的gl(3)公式在数学上仅限于SH度数ℓ≤2,虽然覆盖了大部分实用光度子空间,但无法直接处理ℓ≥3的高阶球谐函数(需使用更大的载体如5×5)。
  • 虽然参数量显著减少,但由于矩阵收缩和双线性运算,计算成本(GMACs)高于基线,属于参数高效而非整体运行时高效。
  • 在包含隐式姿态偏差的规范数据集(如ShapeNet)上,严格等变性模型在规范设置(ID/ID)下的准确率可能略低于利用姿态偏差的非等变基线。
  • 基线方法(Gaussian-MAE)在引入高阶SH后性能急剧下降,这并非SH本身无效,而是非等变架构无法处理其变换敏感性,导致过拟合姿态相关性。
  • 评估中的变换协议需明确是主动旋转还是被动相机坐标变化,本文主要基于主动旋转约定,但框架兼容两种约定。
  • RLBench实验中,E3DGS在接触密集或长视界任务(如close jar, stack blocks)上略逊于基线,表明等变性在刚性体 articulation 任务中优势更明显。

关联工作

  • Gaussian-MAE [28]:主要基线,用于对比物体识别和预训练效果,本文在其基础上引入等变性。(第 3 页)
  • ManiGaussian [26]:机器人操作世界模型的基线框架,本文将其状态表示替换为等变矩阵载体。(第 3 页)
  • Tensor Field Networks (TFNs) [43]:传统等变架构,使用Clebsch-Gordan张量积,计算成本高,本文旨在避免此问题。(第 2 页)
  • TensorNet [39]:使用笛卡尔张量的相关工作,本文与其类似但不同,本文直接将SH系数映射到载体而非从几何特征构建张量。(第 4 页)
  • ReLN [21]:提供等变性构建模块(ReLN-Attention, ReLN-LayerNorm),本文将其应用于3DGS的gl(3)载体。(第 4 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

E3DGS:通过“颜色即几何”嵌入实现 3D高斯泼溅的统一几何-光度等变性

Chankyo Kim Maani Ghaffari 密歇根大学安娜堡分校,密歇根州安娜堡,美国 {chankyo, maanigj}@umich.edu

摘要

3D高斯泼溅(3DGS)通过将显式几何(位置、协方差)与视图依赖光度(球谐函数)耦合来捕捉场景。然而,在这些基元上构建SE(3)等变性架构存在根本性的表示瓶颈。颜色对称性长期以来被视为信号和外观,而非几何实体,使得相机帧变化难以处理。虽然平移变换相对简单,但旋转不匹配异构地作用于不同属性:$\Sigma \rightarrow R\Sigma R^\top$ 和 $f_\ell \rightarrow D_\ell(R)f_\ell$。这种不匹配使得严格跨属性的等变性变得复杂,导致现有方法要么丢弃或展平球谐函数系数,从而破坏了对称性。

我们提出了一种基于表示论的统一解决方案:对于球谐函数阶数 $\ell \le 2$,光度在代数上同构于一个秩为2的几何张量。我们证明,这些球谐函数系数上的Wigner-D作用可以精确地重构为对 $3 \times 3$ 矩阵的共轭作用。利用这一点,我们引入了统一矩阵嵌入(Unified Matrix Embedding),这是一种将所有高斯属性映射到统一载体空间 $\mathfrak{gl}(3)$ 的提升操作。

基于“颜色即几何”的公式化,我们提出了E3DGS,这是一种刚体(SE(3))等变性架构,它处理3D高斯时不需要Clebsch–Gordan张量积。在物体视觉和动作条件的高斯世界建模上的评估表明,我们的统一方法在相机帧变化下表现出强大的鲁棒性,并提高了数据效率。

1 引言

物理世界不仅仅是一系列形状的集合;它是几何与光线的相互作用。3D高斯泼溅(3DGS)[20]通过将球谐函数(SH)系数分配给每个基元以捕捉视图依赖的外观,显式地建模了这种二元性。然而,在深度表示学习的背景下,这种丰富的光度信息往往被丢弃。当前的最先进方法(例如 [28, 23, 26, 51])在其基于3DGS的学习框架中剥离了视图依赖的球谐函数系数,以避免旋转对称性的复杂性,将具有光泽和纹理的场景简化为哑光、彩色的点云。这种架构上的妥协本质上限制了模型区分具有相同几何形状但不同材质属性(例如,哑光塑料杯与闪亮金属马克杯)的物体的能力。

这种简化源于3D深度学习中的一个根本瓶颈:严格的SE(3)等变性。虽然平移等变性可以使用相对坐标优雅地实现,

第 2 页

图1:E3DGS概述。3D高斯基元将几何(均值/协方差)与视图依赖光度(SH)耦合,它们在相机帧变化下遵循异构的SO(3)规则进行变换。E3DGS将二者提升到一个统一的矩阵载体中,并使用刚体等变性主干网络进行处理,从而实现鲁棒的物体识别和动作条件的高斯世界建模。

旋转带来了严峻挑战。几何属性如位置 ($x$) 和协方差 ($\Sigma$) 在旋转 $R \in SO(3)$ 下遵循标准的张量变换规则,而SH系数则通过Wigner-D矩阵进行变换。将这些异构数据类型整合到单一等变性流水线中通常需要复杂的机制,例如张量场网络 (TFNs) [43]。对于由数百万个高斯基元参数化的场景,依赖Clebsch–Gordan张量积来处理这些混合表示在计算上是不可行的 [14]。因此,现有的3DGS学习框架缺乏统一的等变性公式。

为了实现旋转鲁棒性,先前的工作要么依赖大量的数据增强,要么通过丢弃所有视图依赖的SH系数(阶数 $\ell \ge 1$)来完全绕过对称性问题。通过将外观简化为仅0阶SH,他们将光度视为静态标量信号。这种简化从根本上无法对现实世界的视图依赖复杂性进行建模。

为了解决这种表示不匹配问题,我们提出了一种范式转变:将光度视为几何。对于阶数 $\ell \le 2$ 的球谐函数,其系数空间 $\mathbb{R}^{2\ell+1}$ 实现了与 $3 \times 3$ 矩阵空间 $\mathfrak{gl}(3)$ 在共轭作用下相同的不可约表示 ($V_0 \oplus V_1 \oplus V_2$)。我们构建了线性 intertwiner $\Phi_\ell$,将SH系数直接映射到这些对应的矩阵子空间中,用支配几何张量的简单共轭规则取代Wigner-D作用。通过将每个高斯基元提升为一堆 $3 \times 3$ 矩阵通道,所有具有旋转活跃性的属性——无论是几何还是光度——都通过单一的统一操作进行变换:$M \mapsto RMR^\top$。图1总结了这种统一性及其在物体识别和动作条件世界建模中的应用。

基于这种“颜色即几何” (Color-as-Geometry) 的公式,我们引入了E3DGS。据我们所知,这是第一个使3DGS的视图依赖外观成为等变性几何对象的公式,允许几何和光度在单一共轭定律下变换。我们的核心贡献如下:

1. 颜色即几何。我们表明,视图依赖光度本身就是一个等变性几何对象:一个显式的 intertwiner 将 SH(0–2) 系数与共轭载体 $\mathfrak{gl}(3)$ 对应起来,使得3D高斯的外观和几何通过单一规则 $M \mapsto RMR^\top$ 进行变换。

2

第 3 页

据我们所知,这是首次将视图依赖的外观视为等变张量,用于在 3D Gaussian Splatting (3DGS) 上进行学习。

2. 完整的矩阵载体族。我们证明,每个球谐函数阶数都可以精确地表示为载体 $\text{End}(V_k)$ 上的矩阵共轭,并确定了每个载体所覆盖的阶数。我们模型中使用的 $3 \times 3$ 矩阵是此类载体中最小的一个,覆盖了高达 2 阶的视图依赖外观;更高阶数则由同族中更大的载体处理。

3. 用于 3DGS 的伴随等变 Transformer。我们实例化了一个原生矩阵的刚体 (SE(3)) 等变编码器,采用伴随等变操作 (ReLN-Attention, ReLN-LayerNorm),其成对交互简化为具有 $O(1)$ 每对成本的 SO(3) 不变标量收缩,从而避免了其成本随表示阶数急剧增长的 Clebsch–Gordan 张量积。

4. 在 3DGS 基准测试上的验证。我们将编码器实例化为等变高斯 MAE 和动作条件高斯世界模型,并在物体级识别和动作条件操作上进行评估,展示了在相机帧变化下的旋转鲁棒性和标签效率。

2 相关工作

2.1 3D Gaussian Splatting 与表示不匹配

3D Gaussian Splatting (3DGS) 使用具有显式几何结构(均值、协方差)和视图依赖光度(Spherical Harmonics, SH)的各向异性高斯函数对场景进行参数化 [20, 29]。最近的直通模型直接从稀疏观测中预测这些基元,确立了 3DGS 作为下游感知和决策的可复用场景表示 [6, 40, 41]。然而,这种显式参数化在不同的相机位姿或空间变换下引入了表示不匹配:几何属性遵循标准的 SE(3) 或 SO(3) 张量规则,而 SH 系数通过 Wigner-D 矩阵进行变换 [45, 18, 32]。因此,直接融合这些属性要么会破坏旋转对称性,要么需要计算密集型的张量积流水线。

2.2 3DGS 上的表示学习与下游任务

越来越多的工作将 3DGS 基元作为场景理解的直接输入进行处理。以物体为中心和场景级的流水线,如 ShapeSplat 和 SceneSplat,使得直接在 Gaussian 上进行表示学习和视觉-语言预训练成为可能 [28, 23, 27]。同时,3DGS 通过嵌入语言对齐特征或优化提示驱动的图割,支持开放词汇分割、语义查询和交互式编辑 [37, 16, 31, 22, 38, 5, 7, 19, 36, 17]。动态 3DGS 也已集成到语言条件机器人操作框架中,例如 ManiGaussian [26]。尽管取得了这些进展,现有方法通常通过规避联合几何-光度旋转的复杂性来解决问题。它们要么将光度简化为视图无关分量 (SH0),丢弃高阶效应,要么依赖启发式数据增强来近似旋转鲁棒性。我们的工作提供了缺失的对称性约束,实现了几何和高阶光度的联合等变学习。

第 4 页

2.3 等变架构与基于矩阵的替代方案

当存在与任务相关的对称性时,等变性为鲁棒性和数据效率提供了归纳偏置,它已成为现代几何深度学习中的标准设计原则 [4, 8, 47, 46]。在3D深度学习中,标准方法使用不可约表示和 Clebsch–Gordan (CG) 张量积来实现 SE(3) 等变性 [43, 14, 48, 9, 15]。尽管这些方法具有高度表达能力,但这些张量积的计算成本随表示度数的增加而急剧上升,从而造成运行时和内存瓶颈 [42, 3, 50, 24]。为了提高可扩展性,替代框架探索了基于向量的模型、消息传递和李群卷积 [10, 35, 12]。

笛卡尔张量网络。一条互补且密切相关的研究路线用笛卡尔张量特征取代了球谐函数/CG机制。与我们的工作最直接相关的是 TensorNet [39],它使用秩-2笛卡尔张量表示原子环境,并将它们分解为标量、向量和对称无迹部分——这与 gl(3) 在共轭作用下所携带的相同不可约内容 $V_0 \oplus V_1 \oplus V_2$——并通过矩阵乘积处理它们。我们的构造在载体(carrier)中放置的内容上有所不同:笛卡尔张量势从几何(相对位置)特征构建张量,而我们通过显式 intertwiner(“颜色即几何”)将视图依赖的光度 SH 系数本身识别为载体,从而在单一共轭定律 $M \mapsto RMR^\top$ 中统一3D高斯的表观和几何。我们进一步证明(定理2),任何 SH 度数都可以通过在载体 $\text{End}(V_k)$ 上的共轭来实现,因此 $3 \times 3$ 笛卡尔张量情况是一个完整家族中最小的成员。

矩阵和李代数等变模型。除了笛卡尔张量之外,基于矩阵特征和伴随等变的李模型通过矩阵操作处理特征,以提高效率、数值稳定性或通用性:EMLP [13] 解决了任意矩阵群的等变线性层约束,而李神经元/约化李神经元 (ReLN) 构造 [25, 2, 21] 针对具有李代数特征的结构化操作,旨在实现精确的 GL(n)-等变性。我们的主干网络复用了 ReLN 风格的 Ad-等变原语,但 ReLN 框架本身 [21] 通过将表观简化为与视图无关(不变)的 SH0 分量来规避光度旋转。相比之下,我们的贡献是将高阶视图依赖光度 SH(0–2) 与 $3 \times 3$ 共轭载体进行表示论上的识别,并将其实例化用于3DGS;这是在将等变主干应用于标量颜色之上的非平凡步骤。

这些构造的基础是低阶球谐函数与低阶张量之间的经典对应关系——包括控制 Wigner-D 旋转和实际实数 SH 旋转公式的对称无迹分量 [44, 45, 18, 32]。我们通过构建从 SH(0–2) 到 gl(3) 的 intertwiner,使这种对应关系变得显式且可操作,从而在刚体 (SE(3)) 运动下统一且等变地处理几何和光度,而无需在特征管道中使用 CG 张量积。

3 通过约化李代数载体实现统一的几何-光度等变性

3D高斯基元将几何(均值、协方差)与视图依赖的光度(SH)耦合在一起。在相机帧变换 $g = (R, t) \in \text{SE}(3)$ 下,均值通过平移和旋转变换 ($\mu \mapsto R\mu + t$),协方差通过合同变换 ($\Sigma \mapsto R\Sigma R^\top$),SH 系数通过 Wigner-D 矩阵按度数变换 ($f_\ell \mapsto D_\ell(R)f_\ell$)。这些异构的 SO(3) 表示阻碍了单一等变处理管道的形成。在本节中,我们证明对于 SH 度数 $\ell \le 2$,

4

第 5 页

几何与光度均能在李代数 $\mathfrak{gl}(3)$ 下通过矩阵共轭实现精确、统一的表示。

3.1 3D高斯基元及其群作用

我们将3D高斯基元参数化为 $G_i = (\mu_i, \Sigma_i, \alpha_i, \{f_{i,\ell}^{(c)}\}_{\ell=0}^2)$,其中 $\mu_i \in \mathbb{R}^3$ 为均值,$\Sigma_i \in \text{SPD}(3)$ 为协方差矩阵,$\alpha_i \in \mathbb{R}$ 为不透明度,$f_{i,\ell}^{(c)} \in \mathbb{R}^{2\ell+1}$ 表示颜色通道 $c$ 的 $\ell$ 次球谐函数(SH)系数。

对于空间旋转 $R \in \text{SO}(3)$,几何属性变换为 $\mu_i \mapsto R\mu_i$,$\Sigma_i \mapsto R\Sigma_i R^\top$,且 $\alpha_i \mapsto \alpha_i$;而SH系数变换为 $f_{i,\ell}^{(c)} \mapsto D_\ell(R) f_{i,\ell}^{(c)}$。为了在SE(3)运动下隔离旋转分量,我们在中心坐标 $\bar{\mu}_i := \mu_i – \frac{1}{N} \sum_{j=1}^N \mu_j$ 上操作,确保 $\bar{\mu}_i \mapsto R\bar{\mu}_i$ [14, 15]。

3.2 几何与光度的统一 $\mathfrak{gl}(3)$ 载体

为了统一这些异构作用,我们采用配备标准共轭作用 $\text{Ad}_R(M) := RMR^\top$(其中 $R \in \text{SO}(3)$)的矩阵空间 $\mathfrak{gl}(3) = \mathbb{R}^{3\times3}$。在此伴随作用下,$\mathfrak{gl}(3)$ 分解为 $\text{SO}(3)$-不可约子表示:

$$ \mathfrak{gl}(3) = \langle I \rangle \oplus \mathfrak{so}(3) \oplus \text{Sym}_0(3), \quad (1) $$

其中 $\langle I \rangle = \{sI : s \in \mathbb{R}\}$ 表示标量矩阵,$\mathfrak{so}(3) = \{A : A^\top = -A\}$ 表示反对称矩阵,$\text{Sym}_0(3) = \{S : S^\top = S, \text{tr}(S) = 0\}$ 表示无迹对称矩阵。这种分解与最高至 $\ell=2$ 度的球谐函数所携带的 $\text{SO}(3)$ 不可约类型相匹配。

注($3\times3$ 载体的精确容量)。由于在共轭作用下作为 $\text{SO}(3)$-表示有 $\mathfrak{gl}(3) \cong \text{End}(\mathbb{R}^3) \cong V_1 \otimes V_1 \cong V_0 \oplus V_1 \oplus V_2$,因此不存在 $V_3$ 分量,故 $3 \times 3$ 载体恰好实现了 $\ell \le 2$ 的SH类型,且仅此而已。如下文所示(定理2),相同的共轭原理可扩展至每个SH度:每个有限度都实现为适当载体 $\text{End}(V_k)$ 上的共轭,而 $3 \times 3$ 载体只是最小的一个。

定理1($\ell \le 2$ 的SH度的等变矩阵实现)。固定一个标准正交球谐基,并令 $D_\ell(R)$ 表示相应的实Wigner-D矩阵。对于每个 $\ell \in \{0, 1, 2\}$,存在一个线性 $\text{SO}(3)$-等变映射 $\Phi_\ell: \mathbb{R}^{2\ell+1} \to V_\ell \subset \mathfrak{gl}(3)$,使得对于所有 $R \in \text{SO}(3)$ 和 $f_\ell \in \mathbb{R}^{2\ell+1}$,

$$ \Phi_\ell (D_\ell(R)f_\ell) = \text{Ad}_R (\Phi_\ell(f_\ell)) = R \Phi_\ell(f_\ell) R^\top. \quad (2) $$

因此,$\Phi_{\le 2} := \Phi_0 \oplus \Phi_1 \oplus \Phi_2$ 将 $\text{SH}(0\text{–}2)$ 识别为一个通过共轭变换的单一 $\mathfrak{gl}(3)$-值表示。

补充材料中给出了包括基约定在内的具体构造。

通用载体:每个SH度在共轭下均为矩阵。上述构造是通用原理的最小实例。对于具有Wigner矩阵 $D_k(R)$ 的任何 $k$ 度载体 $V_k$,$\text{End}(V_k)$ 上的共轭表示 $X \mapsto D_k(R) X D_k(R)^{-1}$ 分解为 $\text{End}(V_k) \cong V_k \otimes V_k \cong \bigoplus_{\ell=0}^{2k} V_\ell$。

5

第 6 页

定理 2(球谐函数的通用矩阵实现)。对于每个球谐函数阶数 $L$,存在一个载体空间 $V_k$,其中 $k = \lceil L/2 \rceil$,以及一个线性、$SO(3)$-等变的单射 $\iota_L : V_L \hookrightarrow \text{End}(V_k)$,在尺度变换下唯一,使得对于所有 $R \in SO(3)$ 和 $f_L \in V_L$,

$$ \iota_L D_L(R) f_L = D_k(R) \iota_L(f_L) D_k(R)^{-1}. \quad (3) $$

因此,Wigner-D 矩阵在任意球谐函数频带上的作用被精确地实现为矩阵共轭,无需在运行时使用 Clebsch–Gordan 张量积。本文使用的模型是 $k=1$ 的情况,即唯一的几何原生载体($D_1(R) = R$),它实现了 SH(0–2);下一个频带 SH3 在 $\text{End}(V_2)$($5 \times 5$)中实现。构造性证明和数值检查见附录 C。

因此,$3 \times 3$ 载体是一个完整的矩阵载体家族中最小的成员:它覆盖阶数 $\ell \le 2$ 的球谐函数,而更大的载体 $\text{End}(V_k)$ 覆盖更高的阶数。

3.3 高斯属性到 $\mathfrak{gl}(3)$ 的统一矩阵嵌入

利用定理 1,我们定义了一个提升映射,将高斯属性嵌入到相应的 $\mathfrak{gl}(3)$ 子空间中:

3.3.1 协方差提升。

令 $\text{Sym}(3) := \{S \in \mathbb{R}^{3 \times 3} : S^\top = S\}$ 和 $\text{SPD}(3) := \{S \in \text{Sym}(3) : x^\top S x > 0 \quad \forall x \neq 0\}$ 为对称正定矩阵空间。我们通过矩阵对数嵌入协方差:

$$ C_i := \log(\Sigma_i) \in \text{Sym}(3) \subset \mathfrak{gl}(3). \quad (4) $$

在空间旋转 $R \in SO(3)$ 下,协方差通过合同变换进行转换($\Sigma_i \mapsto R \Sigma_i R^\top$)。由于矩阵对数与正交变换可交换,提升后的协方差保持伴随等变性:

$$ \log(R \Sigma_i R^\top) = R \log(\Sigma_i) R^\top = \text{Ad}_R(C_i). \quad (5) $$

这种对数提升保持了精确的 $SO(3)$ 对称性,并将乘法流形 $\text{SPD}(3)$ 映射到平坦向量空间 $\text{Sym}(3)$,从而提高了网络前向传播期间的数值稳定性 [21]。

3.3.2 位置提升。

使用中心位置 $\bar{\mu}_i$(第 3.1 节),我们通过帽映射(hat map)提升平移分量:

$$ P_i := \widehat{\bar{\mu}_i} \in \mathfrak{so}(3),\text{其天然满足 } R \bar{\mu}_i d = R \widehat{\bar{\mu}_i} R^\top. \quad (6) $$

3.3.3 光度提升。

对于每个颜色通道 $c \in \{r, g, b\}$,我们将 SH 系数提升为单个矩阵

$$ S^{(c)}_i := \Phi_{\le 2} f^{(c)}_{i, \le 2} \in \mathfrak{gl}(3), \quad (7) $$

其中 $f^{(c)}_{i, \le 2} = (f^{(c)}_{i,0}, f^{(c)}_{i,1}, f^{(c)}_{i,2})$ 堆叠了阶数 $\ell \le 2$ 的系数。

6

第 7 页

3.3.4 等变特征与类型0不变标量特征。 我们将等变特征收集为 $H_i := [P_i, C_i, S(r)_i, S(g)_i, S(b)_i] \in \mathfrak{gl}(3)^{C_{eq}}$。除了这些张量通道外,我们还维护一个用于 $SO(3)$ 不变标量的独立类型0分支,定义为 $s_i := [\alpha_i, f(r)_{i,0}, f(g)_{i,0}, f(b)_{i,0}, E_{task}]^\top \in \mathbb{R}^{C_0}$,其中 $\alpha_i$ 是不透明度,$f(c)_{i,0}$ 表示漫反射颜色,$E_{task}$ 代表任务特定的语义(例如,语言指令嵌入)。在网络的前向传播过程中,由 $H_i$ 导出的不变标量(例如,$\tilde{B}$-收缩)用于对矩阵通道进行门控,而不会破坏等变性。

命题1(提升表示的等变性)。对于 $R \in SO(3)$,每个矩阵通道 $(H_i)_k \in \mathfrak{gl}(3)$ 变换为 $(H_i)_k \mapsto \text{Ad}_R((H_i)_k) = R(H_i)_kR^\top$,而 $s_i$ 是不变的。

证明。该主张源于公式 (6)、(5) 以及 intertwining 性质 (2)。

3.4 统一载体上的 ReLN 处理

给定 3D 高斯基元的提升表示 $(H, s)$,我们利用 $\text{Ad}$-等变约化李神经元 (ReLN) 构建模块 [21] 构建编码器 $F_\theta$。为了在不破坏对称性的情况下参数化非线性,我们使用 $\mathfrak{gl}(3)$ 上的非退化修正 Killing 形式构建 $\text{Ad}$-不变标量:$\tilde{B}(X, Y) = 6 \text{tr}(XY) – \text{tr}(X)\text{tr}(Y)$。通过堆叠等变线性层和非线性层,整个块与 $\text{Ad}$ 可交换。

定理3(神经编码器的等变性)。设 $H$ 和 $s$ 分别为输入 3D 高斯的等变特征和不变标量特征。由 $\text{Ad}$-等变 ReLN 基元和不变加权聚合组成的编码器 $F_\theta(H, s) = (H', s')$ 满足:

$$ F_\theta(\text{Ad}_R(H), s) = (\text{Ad}_R(H'), s') \quad \forall R \in SO(3), \quad (8) $$

其中 $\text{Ad}_R$ 表示通道共轭。

由于标量特征 $s$ 是 $SO(3)$ 不变的,用这些标量缩放或门控等变通道与伴随作用可交换:$s \cdot \text{Ad}_R(H) = \text{Ad}_R(s \cdot H)$。这种设计在利用标量上下文的同时,保证了精确的全局等变性。

4 用于 3D 高斯泼溅的伴随等变架构

基于统一的 $\mathfrak{gl}(3)$ 载体(第3节和图1),我们引入了 E3DGS,这是一种用于 3DGS 表示学习的端到端等变架构。我们在两种场景下实例化 E3DGS:用于大规模自监督预训练和物体识别的高斯掩码自编码器(图2),以及用于机器人操作的动作条件高斯世界模型。 E3DGS 包含三个阶段:(i) 统一提升,将每个基元嵌入单个 $\mathfrak{gl}(3)$ 矩阵载体中,同时收集用于门控的旋转不变标量;(ii) $\text{Ad}$-等变 ReLN 主干网络 $F_\theta$,用于混合矩阵通道并应用不变门控更新;(iii) 具有逆提升以获取几何输出的任务特定头。

4.1 通过 Ad-等变操作实例化主干网络

我们通过在对 $\mathfrak{gl}(3)$ 值特征施加 $\text{Ad}$-等变性来构建 E3DGS 主干网络,系统地替换违反旋转对称性的标准 Transformer 操作,采用李代数对应物。

7

第 8 页

图 2:Base E3DGS 高斯掩码自编码器的架构。我们将框架实例化为用于物体视觉任务的高斯 MAE(第 5.1 节)。输入 3D 高斯经过统一矩阵提升(Unified Matrix Lifting),将几何和光度嵌入到单一载体中。经过高斯特征分组(Gaussian Feature Grouping)后,标量不变量通过不变门控(⊗)调节等变特征。对令牌进行部分掩码处理,由等变自编码器 ($f_\theta, g_\phi$) 处理,并通过等变投影器(Equivariant Projector)重建以计算 $L_{recon}$。

4.1.1 ReLN-Attention。

在标准 Transformer 中,注意力分数依赖于内积,如果直接应用于几何坐标,这些内积在任意旋转下会失效。为了解决这个问题,我们提出了 ReLN-Attention,这是一种原生于 $\mathfrak{gl}(3)$ 流形的等变自注意力机制。我们将令牌化输入投影为 Ad-等变查询、键和值 ($Q, K, V \in \mathfrak{gl}(3)$)。我们使用修正的 Killing 形式 $\tilde{B}$ 作为查询和键矩阵之间的不变相似度度量来构建注意力权重 $a_{ij}$: $$ a_{ij} = \text{softmax}_j \tilde{B}(Q_i, K_j) \quad . \quad (9) $$

由于修正的 Killing 形式在共轭下是不变的 ($\tilde{B}(\text{Ad}_R Q, \text{Ad}_R K) = \tilde{B}(Q, K)$),计算出的标量权重 $a_{ij}$ 是不变的。因此,线性组合 $\sum a_{ij} V_j$ 在令牌混合过程中保留了值矩阵的 Ad-等变性。

4.1.2 等变层归一化 (ReLN-LayerNorm)。

为了在不破坏结构对称性的情况下稳定训练,我们将 VN-LayerNorm [1] 从 3D 向量推广到 $\mathfrak{gl}(3)$ 流形,引入了 ReLN-LayerNorm。我们使用 Frobenius 范数计算每个 $3 \times 3$ 通道的标量幅度——这是 $\mathfrak{gl}(3)$ 上的正定不变度量。我们仅对这些幅度应用标准 LayerNorm 并缩放原始矩阵: $$ X'_c = \frac{\text{LN} \|X_c\|_F}{\|X_c\|_F + \epsilon} X_c \quad , \quad (10) $$

其中 LN 在通道维度 $c$ 上操作。由于 $\|\text{Ad}_R(X_c)\|_F = \|X_c\|_F$,标量乘法在稳定方差的同时保留了几何方向。

8

第 9 页

4.1.3 等变性前馈网络(ReLN-Linear,ReLN-ReLU)。

我们使用 ReLN-Linear 和 ReLN-ReLU 操作 [21] 替换标准的前馈网络,以在保持对 Ad 作用等变性的同时引入逐点非线性。网络不再使用逐元素激活函数,而是通过基于修正的 Killing 形式 $\tilde{B}$ 的 Ad-等变线性混合(ReLN-Linear)和不变门控激活(ReLN-ReLU)来处理矩阵通道。堆叠等变线性和非线性层可以保持精确的旋转对称性。

4.2 任务头与逆几何提升

下游任务决定了预测头的对称性要求。

不变读出(Invariant Readout)。对于不变任务(例如分类、全局属性预测),我们通过基于 $\tilde{B}$ 的自收缩 [21] 从矩阵通道中提取标量不变量。这些不变量与标量分支 $s_i$ 拼接,经过池化处理后由标准 MLP 处理,从而产生旋转不变的预测结果。

等变预测与逆提升(Equivariant Prediction & Inverse Lifting)。对于几何预测(例如动力学),网络输出共轭矩阵 $H_{\text{out}} \in \mathfrak{gl}(3)$。为了将潜在的空间通道映射回物理 $\mathbb{R}^3$ 向量,我们将它们投影到 $\mathfrak{so}(3)$ 并应用逆 hat 映射($\vee$):

$$ \tilde{v}_i = \text{vee}(\text{skew}(H_{\text{out}}))_{\text{pos}} \in \mathbb{R}^3, \quad (11) $$

其中 $\text{skew}(A) = \frac{1}{2}(A – A^\top)$。由于 skew 投影和 vee 映射均与正交变换交换,该操作保证了精确的 SO(3)-等变性($\tilde{v}_i \mapsto R \tilde{v}_i$)。

5 实验

我们在两种应用 3D 高斯基元的场景下评估 E3DGS:物体级识别(第 5.1 节)和用于视觉运动控制的动作条件高斯世界建模(第 5.3 节)。我们遵循各自基准测试的标准评估协议,以确保受控的比较。

网络实现与可扩展性。我们通过将空间和光度属性提升为统一的 $3 \times 3$ 矩阵通道来实例化 E3DGS 主干网络。为了与底层 3D 载体对齐容量,我们使用隐藏宽度 $C/3$。这种设计在实际中减少了可训练参数,在报告的设置中减少了约 2.4–2.6 倍(附录表 4),因为矩阵值通道是沿通道轴混合的,而不是被视为九个独立的标量通道。同时,矩阵收缩和不变双线性运算增加了 GMACs,因此我们将该方法描述为参数高效,而非广泛的运行时高效。

物体视觉:Gaussian-MAE。为了评估从 3D 高斯泼溅中进行物体识别,我们使用 ShapeSplat 数据集和评估协议 [28] 评估我们的 E3DGS-MAE 架构。通过在既定的预训练-微调设置下训练我们的等变 Transformer 主干网络,我们隔离了可用 SH 自由度($\ell \le 0, 1, 2$)的贡献,并测量了(i)对坐标系偏移的鲁棒性以及(ii)在低数据 regimes 下的标签效率。

9

第 10 页

表 1:ModelNet10 上的分类准确率(整体 ↑[%])。ID 和 SE(3) 分别表示恒等变换和特殊欧几里得群。基线方法在相同的配置下复现,以确保公平比较。

方法 ID / ID ID / SE(3) SE(3) / SE(3)

Point-BERT [52] 94.82 × × Point-MAE [30] 94.93 × × Gaussian-MAE [28] 94.71 18.28 88.32 Gaussian-MAE; SH (0,1) 94.27 16.27 89.87 Gaussian-MAE; SH (0,1,2) 94.05 12.89 88.87

E3DGS-MAE; SH (0) 95.15 95.15 94.82 E3DGS-MAE; SH (0,1) 95.26 95.26 95.26 E3DGS-MAE; SH (0,1,2) 94.79 94.79 94.49

高斯世界模型:RLBench。为了确定等变表示是否改善了动作条件动力学建模,我们设计了一个基于 E3DGS 的世界模型,并在 ManiGaussian [26] 框架内对其进行评估。我们利用 RLBench 多任务设置(10 个任务,166 种变体)来衡量几何正则化对操作任务成功率的影响。

5.1 ShapeSplat 上的物体识别(Gaussian-MAE)

我们使用 Gaussian-MAE 预训练和微调管道 [28] 在 ModelNet10-4K 上评估物体分类。我们在完全微调(Full finetuning)设置下实例化我们的 E3DGS-MAE,以更新所有网络参数。 对于变换评估,我们使用主动场景旋转约定:将高斯场景旋转 R 会使方向 d 7→Rd 和 SH 系数 f(c)i,ℓ 7→Dℓ(R)f(c)i,ℓ,这与均值和协方差的变换保持一致。被动相机坐标变化则使用 Dℓ(R⊤)。

零样本鲁棒性和 SH 消融实验。表 1 展示了在三种姿态分布下的分类结果:ID/ID(规范姿态)、ID/SE(3)(零样本变换)和 SE(3)/SE(3)(姿态增强)。为了公平比较,基线方法使用相同的训练配方、轮数和架构容量进行复现。 在零样本变换(ID/SE(3))下,基线方法出现失败(例如,G-MAE 降至 18.28%)。相比之下,E3DGS-MAE 保持了稳定的准确率,证明了其等变性。在规范的 ID/ID 设置下,E3DGS-MAE 与先前的基于点的方法和复现的基于高斯的方法具有竞争力,而其主要优势体现在零样本变换评估中。 此外,将高阶光度信息连接到基线会由于过拟合到与姿态相关的外观而严重降低零样本性能(18.28% → 12.89%)。相反,E3DGS-MAE 成功吸收了视图依赖的光度信息以提高准确率,证实了球谐函数可以在群作用下被高效学习。

重建的定性分析。为了直观地验证这种鲁棒性,图 5 比较了来自测试集的 MAE 重建结果。虽然 G-MAE 在规范姿态下表现良好,但在任意空间旋转下会崩溃,表现出颜色损坏、结构几何扭曲和拓扑缺失等失败模式。然而,E3DGS-MAE 无论输入方向如何,都表现出一致的几何和光度重建。这种视觉稳定性

10

第 11 页

图 3:跨输入旋转的池化不变描述符相似度。针对旋转 0°–360° 的测试实例,在基于 $\tilde{B}$ 的收缩/读出后获得的池化不变描述符的成对余弦相似度。E3DGS(左)在不变读出后保持稳定,而 G-MAE(右)表现出严重的表征漂移。

这一结论在定量上得到了 consistently 更低的 Chamfer Distance (CD) 分数(图 5 中黑色插图)的支持,该分数衡量了与真实值(ground truth)的重建误差。

不变描述符稳定性分析。我们追踪从编码器特征中获得的、经过基于 $\tilde{B}$ 的收缩后的全局池化不变描述符,同时连续旋转测试实例从 0° 到 360°(图 3)。由于原始矩阵值通道是等变的,因此会随输入一起旋转,余弦比较是在提取不变描述符之后进行的。E3DGS-MAE 在此不变读出级别产生均匀的相似度矩阵,而非等变基线则表现出角度依赖的表征漂移。

通过等变归纳偏置提高数据效率。 等变性作为一种结构归纳偏置,通常 94 能降低样本复杂度。我们通过 92 在 ModelNet10-4K 训练集的受限子集 90 ({10%, 30%, 50%, 100%})上进行微调来评估 88 准确率 数据效率。如图 4 所示,E3DGS 在所有子集比例下 86 均优于基线。在低数据情况下, G-MAE (基线) 性能差距显著, 84 E3DGS-MAE ( ours) 表明当标签稀缺时,符合对称性的耦合防止了 10% 30% 50% 100% 网络对虚假姿态相关性过拟合。 训练数据比例

图 4:数据效率。E3DGS- MAE 在受限训练子集上 优于基线。

11

第 12 页

图 5:分布外变换下的定性比较。在测试时旋转(ID/SE(3))下,非等变基线(G-MAE)遭受严重的表示坍缩,表现出颜色失真、拓扑缺失和几何畸变(橙色虚线框)。相比之下,我们的等变 E3DGS-MAE 无论输入方向如何,都能保持结构保真度和视图依赖外观。插图中的数字表示 Chamfer Distance(↓)。

5.2 ModelNet40 上的物体识别

我们引入 ModelNet40 以测试当类别空间变大且物体几何形状更加多样化时,所提出的统一表示是否仍然有效。所有 ModelNet40 实验均使用与 ModelNet10 实验(第 5.1 节)相同的预训练和微调协议。

表 2 报告了规范评估和变换评估下的准确率。主要观察结果是,仅凭规范准确率并不能决定姿态鲁棒性:非等变模型在 ID/ID 评估下可能保持竞争力,但在变换评估下性能急剧下降,这表明其依赖于特定姿态的信息。相比之下,E3DGS 在所有评估分割中均保持稳定的性能,这与主动特征流中内置的对称性以及不变分类器一致。

对 SH 利用的解释。引入高阶 SH 系数,如 SH(0, 1) 和 SH(0, 1, 2),并不会降低 ModelNet40 上所提出的等变表示的性能。事实上,SH(0, 1) 变体在 E3DGS 配置中取得了最佳性能,在所有三个评估分割上均达到 93.17%。SH(0, 1, 2) 变体在规范评估中也优于 SH(0)

12

第 13 页

设置(92.57% 对比 92.25%),同时保持强大的姿态一致性。

启示。ModelNet40 的主要结论不仅是规范精度(canonical accuracy)的提升,还包括在不依赖特定姿态线索的情况下,在变换后的数据划分上保持性能的能力。这正是简单的特征空间拼接变得受限的情况:高阶球谐函数(SH)系数携带对变换敏感的信息,而在缺乏显式等变结构的情况下处理这些信息,会导致测试时姿态变化后鲁棒性下降。因此,当前的 ModelNet40 结果有力地支持了这一观点:统一载体(unified carrier)的优势在于高斯几何和外观的姿态一致学习。

表 2:ModelNet40 上的分类准确率(整体 ↑[%])。ID 和 SE(3) 分别表示恒等群和特殊欧几里得群。提供了 E3DGS-MAE 和复现的 Gaussian-MAE 基线在空间变换下的数值,以突显我们统一的 gl(3) 载体所诱导的姿态一致性。

方法 ID / ID ID / SE(3) SE(3) / SE(3)

仅监督学习

PointNet [33] 89.20 × × PointNet++ [34] 91.90 × × PTv1 [53] 90.60 × × PTv2 [49] 91.60 × ×

使用自监督预训练(FULL)

Point-BERT [52] 93.20 × × Point-MAE [30] 93.20 × ×

Gaussian-MAE [28]; SH (0) 92.21 6.81 90.09 Gaussian-MAE [28]; SH (0,1) 92.50 3.28 91.12 Gaussian-MAE [28]; SH (0,1,2) 92.31 4.90 90.39

E3DGS-MAE (Ours); SH (0) 92.25 92.25 92.02 E3DGS-MAE (Ours); SH (0,1) 93.17 93.17 93.17 E3DGS-MAE (Ours); SH (0,1,2) 92.57 92.57 92.25

5.3 ManiGaussian 上的动作条件高斯世界建模

虽然第 5.1 节展示了我们的 gl(3) 载体在物体感知方面的有效性,但机器人操作中的序列动作引入了对环境动态建模的挑战。在此,我们评估我们的统一几何-光度表示是否改善了预测性世界建模。我们在 ManiGaussian [26] 框架中实例化了我们的等变高斯世界模型,并在 RLBench 多任务基准测试上对其进行了评估。

提升空间中的等变动作条件世界模型。鉴于高斯世界状态 $G_t$ 被提升为等变矩阵通道 $H^{\text{state}}_t$,我们将操作动作嵌入到相同的代数空间中以保持对称性。操作动作 $a_t = (v_t, q_t, c_t)$ 包括 3D 平移 $v_t \in \mathbb{R}^3$、旋转四元数 $q_t$ 和不变夹爪张开度 $c_t \in \mathbb{R}$。我们将 $q_t$ 转换为轴角向量 $\omega_t \in \mathbb{R}^3$。动作在场景/世界坐标系中表达:

13

第 14 页

表 3:在 RLBench 上的多任务成功率 (%)。我们在最终检查点上对 10 个具有挑战性的任务(共 166 种变体)中的每个任务评估 25 个回合。我们将 E3DGS 等变世界模型变体与最先进的基线方法进行了比较。最佳结果加粗显示,次佳结果下划线标示。

| Method / Task | close jar | open drawer | sweep to dustpan | meat off grill | turn tap | slide block | put in drawer | drag stick | push buttons | stack blocks | Average | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | Variation Type | color | placement | size | category | placement | color | placement | color | color | color, count | – | | # Variations | 20 | 3 | 2 | 2 | 2 | 4 | 3 | 20 | 50 | 60 | 166 | | Keyframes | 6.0 | 3.0 | 4.6 | 5.0 | 2.0 | 4.7 | 12.0 | 6.0 | 3.8 | 14.6 | – | | PerAct | 18.7 | 54.7 | 0.0 | 40.0 | 38.7 | 18.7 | 2.7 | 5.3 | 18.7 | 6.7 | 20.4 | | PerAct (4 cameras) | 21.3 | 44.0 | 0.0 | 65.3 | 46.7 | 16.0 | 6.7 | 12.0 | 9.3 | 5.3 | 22.7 | | GNFactor | 25.3 | 76.0 | 28.0 | 57.3 | 50.7 | 20.0 | 0.0 | 37.3 | 18.7 | 4.0 | 31.7 | | ManiGaussian | 28.0 | 76.0 | 64.0 | 60.0 | 56.0 | 24.0 | 16.0 | 92.0 | 20.0 | 12.0 | 44.8 | | Ours (E3DGS) | 16.0 | 88.0 | 80.0 | 72.0 | 60.0 | 24.0 | 36.0 | 92.0 | 32.0 | 4.0 | 50.4 |

帧;在场景帧的全局旋转下,平移指令 $v_t$ 和轴角向量 $\omega_t$ 均变换为 $v_t \mapsto Rv_t$ 和 $\omega_t \mapsto R\omega_t$。由于 $v_t$ 和 $\omega_t$ 均作为标准向量变换($x \mapsto Rx$),我们使用 hat 映射将它们提升到 $\mathfrak{so}(3)$ 矩阵中:$H^{\text{act}}_t = [\hat{v}_t, \hat{\omega}_t]$。由于 $Rx = R x R^\top$,这些提升后的通道原生地通过伴随共轭进行变换。我们将状态矩阵和动作矩阵连接起来,形成联合等变输入。世界模型 $f^{\text{eq}}_{\text{wm}}$ 处理连接后的状态和动作矩阵,并由不变量夹爪状态 $c_t$ 调制,以预测状态变形矩阵 $\Delta H_{t+1}$:

$$ \Delta H_{t+1} = f^{\text{eq}}_{\text{wm}} \left[ H^{\text{stat}}_t, H^{\text{act}}_t \right], c_t \quad . \quad (12) $$

该公式保证了 $\text{SO}(3)$-等变动力学:$\Delta H_{t+1} \mapsto \text{Ad}_R(\Delta H_{t+1})$。预测的变形通过逆 hat 映射投影回 $\mathbb{R}^3$,并作为每个高斯分布的偏移量应用于高斯均值(位置),遵循 ManiGaussian 的方法;协方差和 SH 属性保持不变地传递。

第 15 页

等变动力学的影响。表3详细列出了RLBench的成功率。E3DGS实现了具有竞争力的整体平均成功率(50.4%对比44.8%)。E3DGS在精确的几何 articulation 和稳健的空间建模方面表现出色,在“抽屉内放置”(+20.0%)、“扫入簸箕”(+16.0%)、“打开抽屉”(+12.0%)和“从烤架上取下肉”(+12.0%)等任务中优于ManiGaussian。在这些刚体设置中,精确的SO(3)对称性防止了对虚假姿态相关性的过拟合。此外,如图6所示,这种结构正则化显著加速了训练步骤中的收敛速度,并产生了更低的动态损失($L_{dyna}$)。网络无需数据增强即可更准确地预测状态转换。

图6:动态损失。E3DGS加速了刚体状态转换的学习,比基线更快收敛到更低的稳态损失。

尽管在接触密集或长视程任务(如“关闭罐子”和“堆叠积木”)中,无约束基线表现更强,并在“滑动积木”和“拖动棍子”中持平,但E3DGS提高了平均成功率,并帮助了若干刚体或 articulation 密集的任务。结合图6中较低的动态损失,这些结果表明统一的等变表示提高了姿态一致的动力学建模。

6 结论

我们提出了E3DGS,这是一个将刚体(SE(3))等变性引入3D高斯泼溅的框架。其核心是统一矩阵提升(Unified Matrix Lifting),它将空间几何和视图依赖光度共同嵌入到单一的$gl(3)$载体中。通过识别球谐函数($\ell \le 2$)与矩阵共轭之间的同构,E3DGS绕过了昂贵的张量积,实现了高效的、原生于矩阵的等变学习。我们通过用于物体识别的高斯掩码自编码器以及用于机器人操作的动作条件世界模型验证了这一公式。我们的结果证实,符合对称性的3D高斯泼溅学习产生了卓越的零样本姿态鲁棒性、标签效率和空间推理能力。

范围与展望。我们的$gl(3)$公式在数学上局限于SH度数$\ell \le 2$。虽然原始的3D高斯泼溅设置通常使用高达3度的球谐函数,但SH(0–2)捕获了相当一部分光度子空间,并且是轻量级物理$3 \times 3$载体所允许的最大带宽。更高的频带可以通过定理2中描述的更大载体来处理,但我们将其经验评估留给未来的工作。

参考文献

[1] Assaad, S., Downey, C., Al-Rfou, R., Nayakanti, N., Sapp, B.: VN-Transformer: Rotation-Equivariant Attention for Vector Neurons. arXiv preprint arXiv:2206.04176 (2022)

[2] Batatia, I., Geiger, M., Munoz, J., Smidt, T., Silberman, L., Ortner, C.: A General Framework for Equivariant Neural Networks on Reductive Lie Groups. NeurIPS 36, 55260–55284 (2023)

15

第 16 页

[3] Batatia, I., Kovacs, D.P., Simm, G., Ortner, C., Cs´anyi, G.: MACE: Higher Order Equivariant Message Passing Neural Networks for Fast and Accurate Force Fields. NeurIPS 35, 11423–11436 (2022)

[4] Bronstein, M.M., Bruna, J., Cohen, T., Veliˇckovi´c, P.: Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges. arXiv preprint arXiv:2104.13478 (2021)

[5] Cen, J., Fang, J., Yang, C., Xie, L., Zhang, X., Shen, W., Tian, Q.: Segment Any 3D Gaussians 39(2), 1971–1979 (2025)

[6] Charatan, D., Li, S.L., Tagliasacchi, A., Sitzmann, V.: pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction pp. 19457–19467 (2024)

[7] Choi, S., Song, H., Kim, J., Kim, T., Do, H.: Click-Gaussian: Interactive Segmentation to Any 3D Gaussians pp. 289–305 (2024)

[8] Cohen, T., Welling, M.: Group Equivariant Convolutional Networks. In: ICML. pp. 2990–2999. PMLR (2016)

[9] Cohen, T.S., Geiger, M., K¨ohler, J., Welling, M.: Spherical CNNs (2018)

[10] Deng, C., Litany, O., Duan, Y., Poulenard, A., Tagliasacchi, A., Guibas, L.J.: Vector Neurons: A General Framework for SO(3)-Equivariant Networks pp. 12200–12209 (2021)

[11] Edmonds, A.R.: Angular momentum in quantum mechanics, vol. 4. Princeton university press (1996)

[12] Finzi, M., Stanton, S., Izmailov, P., Wilson, A.G.: Generalizing Convolutional Neural Networks for Equivariance to Lie Groups on Arbitrary Continuous Data pp. 3165–3176 (2020)

[13] Finzi, M., Welling, M., Wilson, A.G.: A Practical Method for Constructing Equivariant Multilayer Perceptrons for Arbitrary Matrix Groups. In: International conference on machine learning. pp. 3318–3328. PMLR (2021)

[14] Fuchs, F., Worrall, D., Fischer, V., Welling, M.: SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks. NeurIPS 33, 1970–1981 (2020)

[15] Geiger, M., Smidt, T.: e3nn: Euclidean Neural Networks. arXiv preprint arXiv:2207.09453 (2022)

[16] Guo, J., Ma, X., Fan, Y., Liu, H., Li, Q.: Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting. arXiv preprint arXiv:2403.15624 (2024). https://doi.org/10.48550/arXiv:2403.15624

[17] He, S., Jie, G., Wang, C., Zhou, Y., Hu, S., Li, G., Ding, H.: ReferSplat: Referring Segmentation in 3D Gaussian Splatting. arXiv preprint arXiv:2508.08252 (2025)

[18] Ivanic, J., Ruedenberg, K.: Rotation Matrices for Real Spherical Harmonics. Direct Determina- tion by Recursion. The Journal of Physical Chemistry 100(15), 6342–6347 (1996)

[19] Jain, U., Mirzaei, A., Gilitschenski, I.: GaussianCut: Interactive Segmentation via Graph Cut for 3D Gaussian Splatting. NeurIPS 37, 89184–89212 (2024)

16

第 17 页

[20] Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G.: 3D Gaussian Splatting for Real-Time Radiance Field Rendering. ACM Transactions on Graphics 42(4) (2023). https://doi.org/10.1145/3592433.3592553

[21] Kim, C., Zhao, S., Zhu, M., Lin, T.Y., Ghaffari, M.: Equivariant Neural Networks for General Linear Symmetries on Lie Algebras. arXiv preprint arXiv:2510.22984 (2025). https://doi.org/10.48550/arXiv:2510.22984

[22] Li, Q., Sun, J., An, L., Su, Z., Zhang, H., Liu, Y.: SemanticSplat: Feed-Forward 3D Scene Understanding with Language-Aware Gaussian Fields. arXiv preprint arXiv:2506.09565 (2025). https://doi.org/10.48550/arXiv:2506.09565

[23] Li, Y., Ma, Q., Yang, R., Li, H., Ma, M., Ren, B., Popovic, N., Sebe, N., Konukoglu, E., Gevers, T., Van Gool, L., Oswald, M.R., Paudel, D.P.: Scenesplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining. arXiv preprint arXiv:2503.18052 (2025). https://doi.org/10.48550/arXiv:2503.18052

[24] Liao, Y.L., Wood, B., Das, A., Smidt, T.: EquiformerV2: Improved Equivariant Transformer for Scaling to Higher-Degree Representations. arXiv preprint arXiv:2306.12059 (2023)

[25] Lin, T.Y., Zhu, M., Ghaffari, M.: Lie Neurons: Adjoint-Equivariant Neural Networks for Semisimple Lie Algebras pp. 30529–30545 (2024)

[26] Lu, G., Zhang, S., Wang, Z., Liu, C., Lu, J., Tang, Y.: ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation. In: ECCV. pp. 349–366. Springer (2024)

[27] Ma, M., Ma, Q., Li, Y., Cheng, J., Yang, R., Ren, B., Popovic, N., Wei, M., Sebe, N., Van Gool, L., Gevers, T., Oswald, M.R., Paudel, D.P.: SceneSplat++: A Large Dataset and Comprehensive Benchmark for Language Gaussian Splatting. arXiv preprint arXiv:2506.08710 (2025). https://doi.org/10.48550/arXiv:2506.08710

[28] Ma, Q., Li, Y., Ren, B., Sebe, N., Konukoglu, E., Gevers, T., Van Gool, L., Paudel, D.P.: ShapeSplat: A Large-scale Dataset of Gaussian Splats and Their Self-Supervised Pretraining. arXiv preprint arXiv:2408.10906 (2024). https://doi.org/10.48550/arXiv:2408.10906

[29] Mildenhall, B., Srinivasan, P.P., Tancik, M., Barron, J.T., Ramamoorthi, R., Ng, R.: NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis. vol. 65, pp. 99–106. ACM New York, NY, USA (2021)

[30] Pang, Y., Tay, E.H.F., Yuan, L., Chen, Z.: Masked autoencoders for 3D Point Cloud Self-supervised Learning. World Scientific Annual Review of Artificial Intelligence 1, 2440001 (2023)

[31] Peng, Q., Planche, B., Gao, Z., Zheng, M., Choudhuri, A., Chen, T., Chen, C., Wu, Z.: 3D Vision-Language Gaussian Splatting. arXiv preprint arXiv:2410.07577 (2024)

[32] Pinchon, D., Hoggan, P.E.: Rotation matrices for real spherical harmonics: general rotations of atomic orbitals in space-fixed axes. Journal of Physics A: Mathematical and Theoretical 40(7), 1597–1610 (2007)

[33] Qi, C.R., Su, H., Mo, K., Guibas, L.J.: PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation pp. 652–660 (2017)

17

第 18 页

[34] Qi, C.R., Yi, L., Su, H., Guibas, L.J.: PointNet++: Deep Hierarchical Feature Learning on Point Sets in a Metric Space. NeurIPS 30 (2017)

[35] Satorras, V.G., Hoogeboom, E., Welling, M.: E(n) Equivariant Graph Neural Networks pp. 9323–9332 (2021)

[36] Shen, Q., Yang, X., Wang, X.: FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally pp. 456–472 (2024)

[37] Shi, J.C., Wang, M., Duan, H.B., Guan, S.H.: Language Embedded 3D Gaussians for Open- Vocabulary Scene Understanding pp. 5333–5343 (2024)

[38] Siegel, P., Tombari, F., Pollefeys, M., Barath, D.: SegSplat: Feed-forward Gaussian Splatting and Open-Set Semantic Segmentation. arXiv preprint arXiv:2511.18386 (2025). https://doi.org/10.48550/arXiv:2511.18386

[39] Simeon, G., de Fabritiis, G.: Tensornet: Cartesian tensor representations for efficient learning of molecular potentials. In: Advances in Neural Information Processing Systems (2023)

[40] Szymanowicz, S., Rupprecht, C., Vedaldi, A.: Splatter Image: Ultra-Fast Single-View 3D Reconstruction pp. 10208–10217 (2024)

[41] Tang, J., Chen, Z., Chen, X., Wang, T., Zeng, G., Liu, Z.: LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation pp. 1–18 (2024)

[42] Th¨olke, P., De Fabritiis, G.: TorchMD-NET: Equivariant Transformers for Neural Net- work Based Molecular Potentials. In: ICLR (2022), https://openreview.net/forum?id= zNHzqZ9wrRB

[43] Thomas, N., Smidt, T., Kearnes, S., Yang, L., Li, L., Kohlhoff, K., Riley, P.: Tensor Field Networks: Rotation- and Translation-Equivariant Neural Networks for 3D Point Clouds. arXiv preprint arXiv:1802.08219 (2018)

[44] Thorne, K.S.: Multipole Expansions of Gravitational Radiation. Reviews of Modern Physics 52(2), 299–339 (1980). https://doi.org/10.1103/RevModPhys.52.299

[45] Varshalovich, D.A., Moskalev, A.N., Khersonskii, V.K.: Quantum Theory of Angular Momen- tum. World Scientific (1988)

[46] Wad, T., Sun, Q., Pranata, S., Jayashree, K., Zhang, H.: Equivariance and Invariance Inductive Bias for Learning from Insufficient Data pp. 241–258 (2022)

[47] Wang, D., Park, J.Y., Sortur, N., Wong, L.L., Walters, R., Platt, R.: The Surprising Effective- ness of Equivariant Models in Domains with Latent Symmetry. arXiv preprint arXiv:2211.09231 (2022). https://doi.org/10.48550/arXiv:2211.09231, iCLR 2023

[48] Weiler, M., Geiger, M., Welling, M., Boomsma, W., Cohen, T.S.: 3D Steerable CNNs: Learning Rotationally Equivariant Features in Volumetric Data. NeurIPS 31 (2018)

[49] Wu, X., Lao, Y., Jiang, L., Liu, X., Zhao, H.: Point Transformer V2: Grouped Vector Attention and Partition-based Pooling (2022)

18

第 19 页

[50] Xie, Y., Daigavane, A., Kotak, M., Smidt, T.: The Price of Freedom: Exploring Expressivity and Runtime Tradeoffs in Equivariant Tensor Products. In: ICML (2025), https://openreview. net/forum?id=EvIwwGYTLc

[51] Ye, M., Danelljan, M., Yu, F., Ke, L.: Gaussian Grouping: Segment and Edit Anything in 3D Scenes. In: ECCV. pp. 162–179. Springer (2024)

[52] Yu, X., Tang, L., Rao, Y., Huang, T., Zhou, J., Lu, J.: Point-BERT: Pre-training 3D Point Cloud Transformers with Masked Point Modeling pp. 19313–19322 (2022)

[53] Zhao, H., Jiang, L., Jia, J., Torr, P.H., Koltun, V.: Point Transformer pp. 16259–16268 (2021)

19

第 20 页

A 球谐函数次数 ℓ≤2 的显式 gl(3) intertwiner(等变映射)

我们在 3×3 矩阵载体空间 gl(3) 中提供了次数为 ℓ= 0, 1, 2 的实球谐函数的显式实现。在整个过程中,R ∈SO(3) 通过共轭作用在 gl(3) 上,即 AdR(M) := RMR⊤。 在此作用下, gl(3) = ⟨I⟩⊕so(3) ⊕Sym0(3), (13) 其中 ⟨I⟩= {sI : s ∈R},so(3) = {A : A⊤= −A},且 Sym0(3) = {S : S⊤= S, tr(S) = 0}。

A.1 次数 ℓ= 0 对于 f0 ∈R,定义 Φ0(f0) := f0I. (14) 由于 D0(R) = 1 且 AdR(I) = I,这是一个 SO(3)-等变映射。

A.2 次数 ℓ= 1 对于 f1 ∈R3,定义 Φ1(f1) := [f1]× ∈so(3). (15) 利用对于所有 v ∈R3 成立的 [Rv]× = R[v]×R⊤,我们得到

Φ1(D1(R)f1) = R Φ1(f1) R⊤. (16)

A.3 次数 ℓ= 2

选择 Sym0(3) 的以下 Frobenius-正交归一基:

0 1 0  0 0 1 0 0 0  1 1 1 B1 = √ 1 0 0 B2 = √ 0 0 0 B3 = √ 0 0 1 (17)  ,  ,  , 2 2 2 0 0 0 1 0 0 0 1 0

1 0 0  −1 0 0  1 1 B4 = √ 0 −1 0 B5 = √ 0 −1 0 (18)  ,  . 2 6 0 0 0 0 0 2

固定一个次数为 2 的 SH 基,其系数向量与该基中的系数相对应。1 对于 f2 = (a1, . . . , a5)⊤∈R5,定义

5 Φ2(f2) := X amBm ∈Sym0(3). (19) m=1

这些系数上的诱导作用正是 ℓ= 2 的 Wigner-D 作用,因此

Φ2(D2(R)f2) = R Φ2(f2) R⊤. (20)

1任何其他正交归一 SH 约定仅相差一个固定的正交基变换,因此下述等变性陈述保持不变。

20

第 21 页

3D高斯泼溅(3DGS)实球谐函数系数的实现约定。我们使用参考3DGS工具包中的实球谐函数系数排序。对于每个颜色通道,系数存储为

$$ g = [g_0, g_1, g_2, g_3, g_4, g_5, g_6, g_7, g_8]^\top. \quad (21) $$

其中 $g_0$ 是0阶系数。1阶槽位遵循代码顺序,与

$$ (g_1, g_2, g_3) \leftrightarrow (-y, z, -x), \quad (22) $$ $$ (g_4, \dots, g_8) \leftrightarrow (xy, yz, 2z^2 – x^2 – y^2, xz, x^2 – y^2) $$

成比例。

为简洁起见,记 $C_{2,j} := C_2[j]$。我们使用3DGS实球谐函数常数

$$ C_1 = 0.4886025, $$ $$ C_{2,0} = 1.0925484, \quad C_{2,1} = -1.0925484, \quad C_{2,2} = 0.3153916, \quad (23) $$ $$ C_{2,3} = -1.0925484, \quad C_{2,4} = 0.5462742. $$

在此约定下,$\Phi_1$ 使用的1阶向量为

$$ u = \begin{bmatrix} -C_1 g_3 \\ C_1 g_2 \\ -C_1 g_1 \end{bmatrix}, \quad \Phi_1(g_1, g_2, g_3) = [u]_\times. \quad (24) $$

我们采用叉积矩阵(hat-map)约定

$$ [u]_\times = \begin{bmatrix} 0 & -u_z & u_y \\ u_z & 0 & -u_x \\ -u_y & u_x & 0 \end{bmatrix}, \quad [u]_\times w = u \times w. \quad (25) $$

对于2阶,我们通过匹配二次型 $d^\top S d$,将3DGS系数顺序转换为公式(19)中使用的STF基系数 $a_1, \dots, a_5$:

$$ a_1 = \sqrt{\frac{C_{2,0}}{2}} g_4, $$ $$ a_2 = \sqrt{\frac{C_{2,3}}{2}} g_7, $$ $$ a_3 = \sqrt{\frac{C_{2,1}}{2}} g_5, \quad (26) $$ $$ a_4 = \sqrt{2 C_{2,4}} g_8, $$ $$ a_5 = \sqrt{6 C_{2,2}} g_6. $$

因此

$$ \Phi_2(g_4, \dots, g_8) = \sum_{m=1}^5 a_m B_m. \quad (27) $$

等价地,对于 $d = (x, y, z)^\top$ 和 $S = \Phi_2(g_4, \dots, g_8)$,此选择复现了渲染器端的2阶多项式

$$ d^\top S d = C_{2,0} g_4 xy + C_{2,1} g_5 yz + C_{2,2} g_6 (2z^2 – x^2 – y^2) \quad (28) $$ $$ + C_{2,3} g_7 xz + C_{2,4} g_8 (x^2 – y^2). $$

21

第 22 页

我们通过数值验证了使用相同的实球谐函数(Real-SH)约定进行系数旋转和提升时的完整提升过程。对于 $D_{\le 2}(R) = D_0(R) \oplus D_1(R) \oplus D_2(R)$,采样的旋转满足

$$ \epsilon(R, f) := \|\Phi_{\le 2} D_{\le 2}(R)f – \text{Ad}_R(\Phi_{\le 2}(f))\|_F, \quad (29) $$ $$ \epsilon(R, f) \approx 10^{-15}. $$

如果使用不同的 SH 排序或归一化,常数及索引排列应替换为相应的固定基变换矩阵。只要对 $D_\ell(R)$ 和 $\Phi_\ell$ 使用相同的约定,等变性陈述保持不变。

A.4 组合度 $\le 2$ 的提升

结合这三种情况可得 $$ \Phi_{\le 2} := \Phi_0 \oplus \Phi_1 \oplus \Phi_2, \quad (30) $$

其满足 $$ \Phi_{\le 2} D_{\le 2}(R)f_{\le 2} = R \Phi_{\le 2}(f_{\le 2}) R^\top. \quad (31) $$

这是本文通篇使用的 intertwiner(交换子/同态映射)。

B $3 \times 3$ 载体空间的精确容量及其与 $\text{SH}(0–2)$ 的对齐

令 $V_1 = \mathbb{R}^3$ 表示 $\text{SO}(3)$ 的标准不可约表示。在共轭作用下,$3 \times 3$ 矩阵空间被识别为自同态环:

$$ \text{End}(V_1) \cong V_1 \otimes V_1. \quad (32) $$

根据 Clebsch–Gordan 分解,该张量积分解为不可约子表示如下: $$ V_1 \otimes V_1 \cong V_0 \oplus V_1 \oplus V_2. \quad (33) $$

因此,$3 \times 3$ 共轭载体精确实现了对应于球谐函数度 $\ell= 0, 1, 2$ 的不可约类型。值得注意的是,此分解中不出现 $V_3$ 分量。因此,根据舒尔引理(Schur's Lemma),我们有:

$$ \text{Hom}_{\text{SO}(3)}(V_3, \text{End}(\mathbb{R}^3)) = \{0\}, \quad (34) $$

这形式化地证明了不存在从 3 度球谐函数到 $3 \times 3$ 共轭载体的非平凡 $\text{SO}(3)$-等变线性映射。$3 \times 3$ 载体覆盖了 $\text{SH}$ 度 $0 \le \ell \le 2$;实际 3DGS 系统中使用的更高阶度由定理 2 中的更大载体处理。

C 任意 $\text{SH}$ 度的通用矩阵载体

我们表明,主论文中使用的 $3 \times 3$ 实例化是一般构造的最小情况:对于任何有限的 $\text{SH}$ 度,Wigner-D 作用均可精确实现为适当载体 $\text{End}(V_k)$ 上的矩阵共轭。这确立了 $\text{SH}(0–2)$ 的范围是极小载体的属性,而非伴随矩阵原理的属性(定理 2)。

22

第 23 页

设置。令 $V_\ell$ 表示 $SO(3)$ 的实 $\ell$ 次不可约表示(等价于实 $\ell$ 次球谐函数系数),$\dim V_\ell = 2\ell + 1$,其变换方式为 $c_\ell \mapsto D_\ell(R)c_\ell$。在实标准正交球谐基下,$D_j(R)$ 是正交的,因此 $V_j^* \simeq V_j$ 且

$$ \text{End}(V_k) \simeq V_k \otimes V_k^* \simeq V_k \otimes V_k \simeq \bigoplus_{\ell=0}^{2k} V_\ell, \quad (35) $$

由 Clebsch–Gordan 规则 $V_{j_1} \otimes V_{j_2} \simeq \bigoplus_{\ell=|j_1-j_2|}^{j_1+j_2} V_\ell$ [45, 11]。本文使用的载体为 $k = 1$: $\text{End}(V_1) \simeq \mathfrak{gl}(3) \simeq V_0 \oplus V_1 \oplus V_2$,伴随作用为 $M \mapsto D_1(R)MD_1(R)^\top = RMR^\top$。

任意次数的等变注入。由 (35) 可知,对于任意有限的球谐函数次数 $L$,选择 $k \ge \lceil L/2 \rceil$ 可使 $V_L$ 出现在 $\text{End}(V_k)$ 中。具体而言,选择一个不可约张量算子基 $\{T^{( \ell,k)}_m\}_{\ell,m=-\ell}^\ell \subset \text{End}(V_k)$,满足标准变换规则 [45, 11]

$$ D_k(R) T^{(\ell,k)}_m D_k(R)^{-1} = \sum_{m'=-\ell}^{\ell} T^{(\ell,k)}_{m'} D^\ell_{m'm}(R), \quad (36) $$

这定义了一个等变注入 $\iota_\ell: V_\ell \to \text{End}(V_k)$,$\iota_\ell(c) = \sum_m c_m T^{(\ell,k)}_m$。直接计算可得 intertwining 性质

$$ D_k(R) \iota_\ell(c) D_k(R)^{-1} = \sum_{m,m'} c_m T^{(\ell,k)}_{m'} D^\ell_{m'm}(R) = \iota_\ell (D^\ell(R)c), \quad (37) $$

即 Wigner-D $\ell$ 作用被精确实现为矩阵载体上的共轭。这证明了定理 2。

示例:SH3。$V_3$ 不出现在 $\text{End}(V_1) \simeq \mathfrak{gl}(3)$ 中,但

$$ \text{End}(V_2) \simeq V_2 \otimes V_2 \simeq V_0 \oplus V_1 \oplus V_2 \oplus V_3 \oplus V_4, \quad (38) $$

因此 $V_3$ 以重数 1 出现;Clebsch–Gordan 基变换产生了一个等变包含 $\Phi_3: V_3 \to \text{End}(V_2)$,在尺度变换下唯一,满足 $\Phi_3(D_3(R)f_3) = D_2(R)\Phi_3(f_3)D_2(R)^{-1}$。因此,SH3 由 $5 \times 5$ 载体 $D_2(R)$ 上的共轭精确表示,而非物理上的 $3 \times 3$ 载体 $R$。一般而言,最高至 $L$ 次的球谐函数由 $\text{End}(V_{\lceil L/2 \rceil})$ 处理。

数值验证。我们将无穷小 intertwiner 方程作为健全性检查进行了求解。对于 $X \in \mathfrak{so}(3)$,其在 $\text{End}(V_k)$ 上的诱导作用为 $\rho_{\text{End}(V_k)}(X)M = \rho_{V_k}(X)M – M\rho_{V_k}(X)$,且 intertwiner $\Phi: V_3 \to \text{End}(V_k)$ 必须满足 $\rho_{\text{End}(V_k)}(X)\Phi = \Phi \rho_{V_3}(X)$。求解这些线性约束得到

$$ \dim \text{Hom}_{SO(3)}(V_3, \text{End}(V_1)) = 0, \quad \dim \text{Hom}_{SO(3)}(V_3, \text{End}(V_2)) = 1. \quad (39) $$

得到的 $V_3 \to \text{End}(V_2)$ 映射秩为 7,有限旋转测试得到的相对等变误差为 $1.68 \times 10^{-15}$,数值上证实了 SH3 在 $3 \times 3$ 载体中不可能实现,但在 $5 \times 5$ 伴随载体中是精确的。

23

第 24 页

D 统一提升与对称性性质

D.1 原始参数化与中心坐标

我们将 3D 高斯原始图元参数化为

c∈{r,g,b} Gi = µi, Σi, αi, {f(c)i,ℓ}2,ℓ=0 , (40)

其中 µi ∈R3, Σi ∈SPD(3), αi ∈R, 且 f(c)i,ℓ∈R2ℓ+1 表示颜色通道 c 的 ℓ 阶球谐函数 (SH) 系数。 对于识别任务,通过中心化去除全局平移:

N X µj. (41) ¯µi := µi −1 N j=1

在刚体运动 (R, t) ∈SE(3) 下,中心化的均值满足 ¯µi 7→R¯µi,因此活跃通道在旋转部分下成为齐次的。

D.2 几何提升

位置。我们通过叉积映射提升中心位置,

Pi := [¯µi]× ∈so(3), (42)

其满足 [R¯µi]× = R[¯µi]×R⊤. (43)

协方差。我们通过矩阵对数提升协方差,

Ci := log(Σi) ∈Sym(3) ⊂gl(3). (44)

由于矩阵对数与正交合同变换可交换,

log(RΣiR⊤) = R log(Σi)R⊤. (45)

这在将 SPD(3) 映射到线性空间 Sym(3) 的同时,保留了精确的 SO(3) 等变性。

D.3 光度提升

对于每个颜色通道 c ∈{r, g, b},定义

S(c)i := Φ≤2 f(c)i,≤2 ∈gl(3), f(c)i,≤2 := f(c)i,0 , f(c)i,1 , f(c)i,2 . (46)

由 (31) 可知,每个光度矩阵通道的变换遵循与几何通道相同的共轭规律。

24

第 25 页

D.4 等变特征流与不变特征流

我们将激活的矩阵值通道收集为

$$ H_i := [P_i, C_i, S^{(r)}_i, S^{(g)}_i, S^{(b)}_i] \in \mathfrak{gl}(3)^{C_{eq}}. \quad (47) $$

与此同时,我们维护一个独立的不变标量流

$$ s_i := [\alpha_i, f^{(r)}_{i,0}, f^{(g)}_{i,0}, f^{(b)}_{i,0}, E_{\text{task}}^\top] \in \mathbb{R}^{C_0}. \quad (48) $$

零阶外观系数在标量分支中被有意复制:尽管它们已经通过 $\Phi_0$ 在光度提升中表示,但显式的标量副本使网络能够直接通过门控和读出访问不变量。

命题 2(提升表示的等变性)。对于任意 $R \in SO(3)$,$H_i$ 的每个激活通道变换为

$$ (H_i)_k \mapsto \text{Ad}_R (H_i)_k = R (H_i)_k R^\top, $$

而 $s_i$ 是不变的。

证明。该主张由 (43)、(45) 和 (31) 得出。

D.5 统一载体上的等变处理

令 $\tilde{B} : \mathfrak{gl}(3) \times \mathfrak{gl}(3) \to \mathbb{R}$ 表示修正的 Killing 形式

$$ \tilde{B}(X, Y) := 6 \text{tr}(XY) – \text{tr}(X)\text{tr}(Y). \quad (49) $$

该双线性形式在共轭下是不变的:

$$ \tilde{B}(\text{Ad}_R X, \text{Ad}_R Y) = \tilde{B}(X, Y). $$

E3DGS 主干网络由 Ad-等变通道混合、不变门控非线性、ReLN-Attention 和 ReLN-LayerNorm 构建。由于每个原语都与逐通道共轭作用交换,且所有门控量均由 $SO(3)$-不变标量构建,因此主干网络在激活通道上保持精确的 $SO(3)$ 等变性。

定理 4(提升编码器的等变性)。设 $F_\theta(H, s) = (H', s')$ 为由 Ad-等变矩阵运算与不变标量调制组成的任意编码器。则

$$ F_\theta(\text{Ad}_R(H), s) = (\text{Ad}_R(H'), s') \quad \forall R \in SO(3), \quad (50) $$

其中 $\text{Ad}_R$ 在激活矩阵流上逐通道作用。

处理说明。提升载体中的精确齐次作用是针对旋转部分的。对于识别,中心化 (41) 产生全局平移不变性。对于动力学,平移量在 hat 提升之前通过中心化或相对向量特征处理,使得激活通道再次服从齐次 $SO(3)$ 作用。

D.6 任务特定的读出

用于识别的不变读出。对于分类,最终的矩阵值特征通过基于 $\tilde{B}$ 的收缩转换为不变标量,与不变分支连接,在集合上池化,并传递给 MLP 分类器。这种读出在构造上是姿态不变的。

25

第 26 页

动态的等变读出。对于向量值预测,输出矩阵通道被投影到 so(3) 并通过逆 hat 映射映射回 R3:

∨ vi = skew (Hout)pos , skew(A) := 2(A1 −A⊤). (51)

由于 skew 和 (·)∨ 均与正交共轭交换,该读出操作严格具有 SO(3) 等变性。

E 主动与被动旋转视角

在场景的主动旋转下,视图方向变换为 d 7→Rd,诱导

f(c)i,ℓ7→Dℓ(R) f(c)i,ℓ. (52)

在相机坐标系的被动变换下,方向变换为 d 7→R⊤d,诱导

f(c)i,ℓ7→Dℓ(R⊤) f(c)i,ℓ. (53)

在标准正交球谐函数 (SH) 基下,Dℓ(R) 是正交的,因此 Dℓ(R⊤) = Dℓ(R)−1。我们的矩阵载体兼容这两种约定:提升后的通道通过共轭相应的旋转参数进行变换。

F 高斯感知任务的实现细节

本节总结了高斯感知任务的实现细节。我们重点关注与所提公式特定的组件:刚体运动感知输入处理、SH(0–2) 提升、统一矩阵载体以及用于分类和分割的任务头。

F.1 识别骨干网与特征构建

从 Gaussian-MAE 出发,我们用双流表示替换了原始的欧几里得特征处理,该表示由:(i) 携带几何结构和高阶光度的主动矩阵流,以及 (ii) 携带不透明度、SH0 和辅助标量信息的不变标量流组成。

除非另有说明,每个输入高斯使用每个颜色通道最高至 2 次的球谐函数 (SH) 系数。因此,主动光度流包含提升后的 1 次和 2 次外观内容。局部分组、令牌混合和聚合直接在矩阵值通道上执行。标量流通过不变收缩和标量门控与矩阵流交互,从而在整个编码器中保持主动通道的规定变换律。

F.2 任务头

分类头。对于物体分类,最终矩阵特征使用基于 ˜B 的自收缩转换为不变标量描述符,并通过置换不变的全局池化在令牌间聚合。聚合后的不变描述符随后传递给标准的 MLP 分类器。我们不使用可学习的 [CLS] 令牌,因为预测旨在仅依赖于提升集合表示的不变摘要。

26

第 27 页

分割头。对于部件分割,我们替换了高斯令牌编码器和主干网络。 ReLN 编码器和 Transformer 生成矩阵值群特征,这些特征通过 Killing 形式自收缩转换为不变令牌描述符。这些不变的群特征随后通过标准特征传播模块传播到点级特征,并由逐点分类器解码以进行部件标注。

F.3 数据集与协议

为了评估表示质量,我们采用两阶段学习流程:大规模无监督预训练,随后是特定任务的微调 [28]。

预训练:ShapeSplat。我们使用 ShapeSplat 数据集 [28],这是一个源自 ShapeNet 的 3D 高斯资产库。对于每个 3D 对象,使用最远点采样提取 $N = 1024$ 个基元。模型在 60% 的随机掩码比率下训练以重建这些基元。

在 ModelNet10、ModelNet40 和 ShapeNet Part 上的下游评估。预训练编码器在 ModelNet10 和 ModelNet40 上进行物体分类的微调,并在 ShapeNet Part 上进行部件分割的微调。我们在所有方法中保持迁移配置固定,以便性能差异可归因于表示本身,而非优化设置的改变。

F.4 变换评估协议

我们报告在标准划分和变换划分上的准确率。对于识别任务,高斯均值在位置提升之前居中,因此激活通道具有旋转等变性,且整个管道在集合层面上具有平移不变性。 如果变换划分应用刚体运动,高斯参数更新为

$$ \mu'_i = R\mu_i + t, \tag{54} $$ $$ \Sigma'_i = R\Sigma_iR^\top, \tag{55} $$ $$ f(c)'_{i,\ell} = D_\ell(R) f(c)_{i,\ell}, \quad \ell \in \{0, 1, 2\}. \tag{56} $$

评估划分。我们在以下设置中报告准确率:

  • ID/ID:标准训练和标准测试。
  • ID/SE(3):标准训练和变换测试。
  • SE(3)/SE(3):变换训练和变换测试。

F.5 预训练收敛性

图 7 比较了基线 Gaussian-MAE 和 E3DGS 在 ShapeSplat 上的掩码预训练动态。在所有跟踪的损失中,E3DGS 在训练早期阶段收敛更快,并达到了比基线更低的最终误差。这一趋势在旋转、缩放、密度、Chamfer 距离、球谐函数重建和总训练损失中均保持一致。这些结果支持统一等变公式作为高斯表示学习的归纳偏置的作用。一旦各向异性几何形状和高阶外观通道被表示在

27

第 28 页

变换兼容的载体。优化过程在与数据对称性对齐的特征空间中进行,从而在整个训练过程中实现更稳定且持续更低的重建误差。

图 7:3D 高斯泼溅上的掩码预训练动态。在 ShapeSplat 上使用最高至 2 阶的球谐函数系数的 Gaussian 输入,在 300 个预训练轮次中比较基线 Gaussian-MAE [28] 与 E3DGS 的收敛情况。E3DGS 显示出更快的早期收敛速度,并且在所有跟踪指标(包括旋转、缩放、密度、Chamfer 距离、球谐函数和总训练损失)上均保持更低的损失。

网络容量与计算成本。为了评估比较的公平性,我们保持模型间的训练协议一致,并在表 4 中报告了可训练参数数量和计算统计信息。表 4 中的所有条目中,Gaussian-MAE 和 E3DGS 均使用最高至 2 阶的球谐函数系数,并且模型采用相同的训练计划:预训练 300 个轮次,以及在 ModelNet40 和 ShapeNetPart 上进行下游微调的 300 个轮次。

表 4 显示,E3DGS 在所有三种设置下的可训练参数数量均显著少于基线模型。例如,在预训练中,可训练参数数量从 29.44M 减少到 12.05M,在分类和部件分割中也观察到了类似的减少。这种减少是通过将潜在通道宽度缩小为原来的 1/3 来实现的。关键点在于,在提升到 so(3)- 和 gl(3)- 值载体后,我们并不将生成的矩阵条目视为独立的标量通道。相反,我们保留了其几何矩阵结构,并根据底层 3D 空间对通道预算进行归一化。因此,我们使用 C/3 的宽度,使得模型容量与基线相当。

同时,E3DGS 产生了更高的算术成本,这反映在更大的 GMAC 计数上。这种模式与矩阵值等变性处理的性质一致:虽然参数容量受到限制,但所需的矩阵收缩和双线性运算(例如,Killing 形式评估)比标准标量基线需要更多的浮点运算。

28

第 29 页

表 4:网络容量与计算量对比。预训练模型及下游微调模型(ModelNet40 分类和 ShapeNetPart 分割)的可训练参数量及计算成本(GMACs),在 NVIDIA H100 (Grace Hopper GH200) 96GB GPU 上测量。两种方法均使用 SH(0, 1, 2) 输入和相同的训练计划。

任务 模型 可训练参数 (M) ↓ GMACs

预训练 Gaussian-MAE [28] 29.44 2.05 预训练 E3DGS-MAE (Ours) 12.05 15.39

ModelNet40 分类 Gaussian-MAE [28] 22.10 4.79 ModelNet40 分类 E3DGS-MAE (Ours) 9.15 33.28

ShapeNetPart 分割 Gaussian-MAE [28] 26.76 14.25 ShapeNetPart 分割 E3DGS-MAE (Ours) 10.46 42.09

G 分割任务的扩展评估

我们进一步在 ShapeNet Part Segmentation 上评估所提出的表示方法,以评估其对密集几何预测的影响。与物体分类相比,部件分割更强调局部结构,因此提供了互补的测试,以检验当目标主要由形状驱动时,统一的几何-光度载体是否仍然有用。遵循基线 [28] 的方案,我们报告类别平均 mIoU (mIoUC)。

高阶光度对分割的影响。为了在更具挑战性的光度设置下测试该表示方法,除了 SH(0) 设置外,我们还使用完整的 SH(0, 1, 2) 输入对部件分割进行了评估。表 5 显示,高阶外观的影响很大程度上取决于其变换规律是否被显式处理。 对于 Gaussian-MAE,将输入限制为 SH(0) 时,在标准划分上获得 82.86 的 mIoUC,在变换评估下为 73.16。当输入扩展为 SH(0, 1, 2) 时,标准分数下降至 77.67,变换分数降至 29.52。因此,在我们复现的基线中,添加高阶外观并未改善分割,并且显著削弱了变换泛化能力。 对于 E3DGS,趋势则不同。使用 SH(0) 输入时,模型在 ID/ID 和 SE(3)/SE(3) 设置下均达到 80.59 的 mIoUC。使用 SH(0, 1, 2) 输入时,性能变化很小,在两种设置下均达到 80.81。由于此比较未隔离 1 阶和 2 阶通道的单独贡献,我们将其解释为证据,表明所提出的表示方法可以在不损失密集预测中姿态一致性的情况下,整合高阶视图依赖外观。 我们注意到,与基线的最佳 SH(0) 配置(80.81 对比 82.86)相比,E3DGS 在标准 ID/ID 划分上表现略差。这一差距突显了严格等变架构中已知的权衡:ShapeNet 等标准数据集包含隐式的姿态偏差(例如,物体始终面向标准方向),标准非等变网络可以利用这些偏差来最大化标准准确率。 部件分割结果提供了测试外观是否以几何兼容方式表示的手段。当外观被限制为 SH(0) 时,基线仍然具有竞争力,此时输入仅包含不变的颜色信息。然而,一旦引入高阶 SH 通道,相同的架构对姿态变化变得高度敏感。相比之下,E3DGS 在变换评估中保持了几乎不变的性能,并且在 SH(0, 1, 2) 设置中未表现出相同的性能下降。这些结果支持这样一种观点:统一的载体不仅对全局识别有用,而且在存在

29

第 30 页

视图依赖光度。

表 5:ShapeNet 上的部分分割结果(类别平均 mIoU ↑[%])。ID 表示规范划分,SE(3) 表示评估中使用的变换划分。当引入高阶 SH 输入时,基线方法性能显著下降,而 E3DGS 在变换评估中保持稳定的性能,并对 SH(0, 1, 2) 输入保持鲁棒性。

方法 输入特征 ID / ID SE(3) / SE(3)

Gaussian-MAE [28] SH (0) 82.86 73.16 Gaussian-MAE [28] SH (0,1,2) 77.67 29.52

E3DGS-MAE (Ours) SH (0) 80.59 80.59 E3DGS-MAE (Ours) SH (0,1,2) 80.81 80.81

H 动作条件的高斯世界建模

我们在 ManiGaussian 协议中实例化操作实验,并在尽可能多的地方保留其训练和评估设置。我们的修改集中在高斯状态表示和动力学模块上,它们被统一矩阵载体中的等变对应物所取代。

H.1 管道实例化

遵循 ManiGaussian,操作管道由两个耦合部分组成:(i) 高斯世界模型,根据当前观测和机器人动作预测下一步场景;(ii) 基于 PerceiverIO 的动作解码器,根据场景特征和语言指令预测末端执行器动作。在基线公式中,世界模型包括表示网络 $q_\phi$、高斯回归器 $g_\phi$、形变预测器 $p_\phi$ 和高斯渲染器 $\mathcal{R}$;动作解码器随后在学到的场景表示和指令嵌入上运行。在我们的适配中,我们保留了这种整体分解。关键区别在于,高斯状态首先被提升到统一的 $\mathfrak{gl}(3)$ 载体中,状态转换模块被提升空间中的等变动力学模型所取代。生成的等变特征在传递给 PerceiverIO 动作头之前被转换为不变标记特征,以便下游动作接口与 ManiGaussian 协议保持一致。

H.2 训练目标

我们遵循 ManiGaussian 的训练设计,优化动作预测、当前场景重建、未来场景一致性和语义蒸馏损失的加权和:

$\mathcal{L} = \mathcal{L}_{Act} + \lambda_{Geo}\mathcal{L}_{Geo} + \lambda_{Sem}\mathcal{L}_{Sem} + \lambda_{Dyna}\mathcal{L}_{Dyna}$. (57)

这里,$\mathcal{L}_{Act}$ 表示对离散化平移、旋转、夹爪开合度和避障输出的行为克隆损失。$\mathcal{L}_{Geo}$ 监督从预测的高斯状态重建当前场景,$\mathcal{L}_{Dyna}$ 监督在给定当前观测和机器人动作的条件下重建未来场景。当使用语义监督时,$\mathcal{L}_{Sem}$ 将高斯表示的投影语义特征与相应的基础模型特征进行匹配。

30

第 31 页

与基线相比,损失定义本身保持不变。修改之处在于潜在高斯状态及其动作条件转移的参数化方式:转移是在提升的等变空间中预测,然后解码回用于渲染和下游动作预测的高斯状态。

H.3 数据集与优化设置

我们使用与 ManiGaussian 相同的 RLBench 评估协议:10 个语言条件操作任务,共 166 种任务变体。视觉观测为分辨率 128 × 128 的单目前视 RGB-D 图像。对于高斯世界模型的多视图监督,我们使用与基线相同数量的相机视角。为了进行受控比较,我们保持优化配方不变。我们使用与动作解码器相同的 PerceiverIO 变体,一块 RTX 4090 GPU,10 万次训练迭代,批量大小为 1,LAMB 优化器初始学习率为 5 × 10−4,并采用带预热余弦调度。

31

发表评论