固定预算的高斯体数据编码:结构感知分配如何让压缩大小成为输入而非结果

快速导读:提出一种在固定预算下通过解析式结构感知分配各向异性高斯原语来编码科学标量体数据的方法,无需增密或剪枝即可实现可控压缩。

科学模拟产生的标量体数据规模持续超过存储与传输能力的增长,in situ数据压缩必须在严格的资源限制下运行。现有基于3D Gaussian Splatting的体数据编码方法通过误差驱动的增密或剪枝来控制原语数量,编码大小是优化过程的结果,而非预先设定的约束。本文提出一种固定预算的高斯体数据编码方法,在训练前通过解析式结构分析一次性分配全部高斯原语,使编码大小成为方法的输入参数。

方法的核心是一个三阶段流水线:首先基于梯度幅值和局部结构张量进行结构感知分配,55%的原语按梯度幅值采样、45%均匀采样,从局部结构张量初始化朝向和各向异性尺度;然后在相机无关的场空间中联合优化所有参数,原语数量在训练过程中保持不变;最后导出48字节/原语的全精度表示。截断感知评估器利用5σ核截断的稀疏性实现51×加速。

英文题目:Fixed-Budget Gaussian Volume Encoding with Structure-Aware Allocation

论文出处:arXiv 每日论文精选 · arXiv:2608.14112

原始论文:PDF / 论文页面

这篇论文解决什么问题?

直接体绘制是科学可视化的标准方法,但稠密网格的存储和渲染开销巨大。科学模拟产生的数据量增速超过存储与传输能力,in situ数据缩减成为必要手段。in situ场景的特殊性在于:压缩必须在模拟内存中运行,资源预算严格受限,且编码大小需要预先确定以便规划存储和传输。

现有神经场方法(如Compressive Neural Representations)通过PSNR评估压缩质量,但神经网络的参数数量与体数据分辨率的关系不直观,难以精确控制编码大小。3D Gaussian Splatting(Kerbl et al.)提供了灵活的原语表示,但其针对RGB辐射场设计,原语数量通过增密和剪枝动态调整。

VEG(Volume Encoding Gaussians)将高斯原语适配到科学体渲染,传递函数在渲染时应用,但通过增密/剪枝控制容量。W-VEG将监督移入世界空间,通过误差引导增密达到目标压缩比,但编码大小仍然是优化过程的副产品,且增密过程需要反复评估误差信号,计算开销较大。

本文的关键观察是:如果能在训练前从场的结构特征中推断出原语的最优分布,就可以将编码大小从优化结果转变为输入约束。这需要回答两个问题:如何从场结构推断原语分配,以及这种一次性分配在多大程度上能替代误差驱动的迭代增密。

核心创新

  • 固定预算解析式分配:在训练前从场结构一次性确定全部原语位置、朝向和形状,编码大小由预算直接决定(Eq. 7),而非优化副产品
  • 截断感知训练:利用5σ核截断的稀疏性(仅0.034%候选对非零),实现51×编码加速和峰值内存从20.5降至8.4 GiB
  • 标量属性保留:原语存储标量值而非烘焙外观,单一编码模型支持任意传递函数、颜色映射、光照和视角的后处理变更
  • 预编码结构统计量预测分配充分性:梯度集中度(top-10%占比)可提前识别一次性分配增益受限的界面主导场

方法概览

三阶段流水线:(1) 解析式结构分析一次性分配全部N个高斯原语——55%按梯度幅值采样、45%均匀采样,从局部结构张量初始化朝向和各向异性尺度;(2) 相机无关的场空间训练,在分层采样点上以1,500次迭代联合优化所有参数,原语数量保持不变;(3) 导出48字节/原语全精度表示(可选8位变体)。截断感知评估器通过按截断半径分箱和33邻域正则化实现51×加速。

  • 结构感知分配(第3页):对输入标量场计算梯度幅值,55%的原语按梯度幅值加权采样,45%均匀采样以保证覆盖。每个原语的位置确定后,从该位置的局部结构张量初始化朝向和各向异性尺度,使原语形状与局部场结构对齐。
  • 固定预算公式(Eq. 7):原语总数N由预算直接决定,分配过程一次性完成,训练过程中N保持不变。这使编码大小成为方法的显式输入参数,而非优化结果。
  • 场空间训练(第4页):在分层采样点上以1,500次迭代联合优化所有原语参数,监督信号来自相机无关的场空间查询,而非图像空间渲染。这使训练不依赖于特定视角或传递函数。
  • 截断感知评估(第4页):利用5σ核截断的稀疏性,仅0.034%的候选原语对非零,通过按截断半径分箱和33邻域正则化实现51×加速,峰值内存从20.5降至8.4 GiB。
  • 标量属性保留:原语存储标量值而非烘焙的颜色和不透明度,传递函数在渲染时应用。这意味着单一编码模型支持任意传递函数、颜色映射、光照和视角的后处理变更。
  • 导出格式:全精度表示每原语48字节,可选8位量化变体以进一步压缩。导出格式与训练过程解耦,便于部署。
  • 预编码结构统计量(第8页):梯度集中度(top-10%体素中梯度质量的占比)可在编码前计算,用于预测一次性分配在该场上的增益上限。
  • 缩减迭代模式:300次迭代的精修模式在质量损失有限的情况下大幅缩短训练时间,适用于时间预算严格的in situ场景。

逐图理解论文

失败案例:界面集中场的预算困境

失败案例:界面集中场的预算困境
Fig. 3: Richtmyer–Meshkov; identical transfer function and camera in both panels. Its gradient mass concentrates on the thin mixing interface (77.7% in the top decile of occupied voxels), the region Section V-F identifies in advance.

Richtmyer–Meshkov数据集的预算阶梯对比,梯度质量77.7%集中在薄混合界面。阶梯增益仅3.6 dB,是界面集中场的典型代表,验证了预编码结构统计量的预测能力。

结论与局限

结论与局限
Fig. 6: Quality improvement against relative budget, each ladder plotted against its own smallest budget (×1) over its compression-useful range; end labels give final absolute PSNR. Four datasets convert budget into 6.9–16.5 dB; Richtmyer–Meshkov stands apart at +3.6 dB, the case Table VI identifies in advance. Absolute levels differ because fields differ in complexity; the improvement curves are the comparable signal.

五个数据集的相对预算改善曲线,每个阶梯相对于自身最小预算归一化。四条曲线增益6.9–16.5 dB,Richtmyer–Meshkov单独为+3.6 dB,直观展示了结构集中度与预算转化效率的关系。

Fig

Fig
Fig. 1: Chameleon (8.7% occupancy); identical transfer function, camera, and lighting in both panels. Sparse concentrated fields convert budget most efficiently: this ladder gains 16.5 dB and is still improving at the largest budget.

Chameleon数据集的预算阶梯对比,占空比仅8.7%。观察同一传递函数和相机下不同预算的渲染质量差异,稀疏集中场将预算转化为质量的效率最高,阶梯增益达16.5 dB且在大预算时仍持续改善。

实验如何设计?

  • 五个科学标量数据集:Vortex、Bubble Plume、Miranda、Chameleon、Richtmyer–Meshkov,评估网格从210万到11亿体素,覆盖不同的占空比和复杂度分布。
  • 预算阶梯从1,000到140万原语,压缩比从2.2×到超过40,000×,覆盖从极端压缩到近无损的完整范围。
  • PSNR在500,000个均匀采样体素中心计算,作为压缩质量的主要评估指标。论文同时报告全字段指标和非空体素限制下的指标。
  • 训练成本在RTX 4090桌面GPU上测量,A100作为数据中心级参照,验证跨GPU一致性(21个配置,PSNR偏差≤0.17 dB)。
  • 缩减迭代时间预算模式以300次迭代评估,模拟in situ场景下的严格时间限制。
  • 预编码结构统计量与阶梯PSNR增益的相关性分析,验证梯度集中度作为预测指标的可靠性。

关键结果与论文证据

  • Chameleon(8.7%占空比)的阶梯PSNR增益为16.5 dB(19.2→35.7 dB),在140万原语时仍持续改善,说明稀疏集中场将预算转化为质量的效率最高(第6页)。
  • Bubble Plume在200,000原语达38.7 dB,2,000原语时27.2 dB(204×压缩),但其稀疏结构(125,787个可采样体素)限制了可支持的原语预算上限(约23万)(第6页)。
  • Richtmyer–Meshkov的阶梯增益仅3.6 dB(15.0→18.6 dB),其梯度质量77.7%集中在薄混合界面的top-10%体素中,是界面集中场的典型代表(第6、8页)。
  • Miranda的阶梯增益为6.9 dB(18.0→24.9 dB),复杂度分布接近均匀,一次性分配将预算稳定转化为质量(第6页)。
  • 截断感知评估将Miranda编码时间从218.8降至4.25分钟(51×),峰值内存从20.5降至8.4 GiB(第7页)。
  • 140万原语模型在RTX 4090上1,500次迭代精修耗时186.9–201.5秒,300次迭代仅42.6–52.8秒,RTX 4090比A100快1.33–1.39×(第8页)。
  • Vortex在140万原语达44.9 dB(最高保真度),但编码模型超过源体积(CR<1),超出压缩有用范围(第7页)。
  • 梯度集中度与阶梯增益呈负相关:Richtmyer–Meshkov的77.7%集中度对应最低增益+3.6 dB,验证了预编码结构统计量的预测能力(第8页)。

阅读时需要注意

  • 一次性分配在误差信号可用前固定容量,界面集中场(如Richtmyer–Meshkov)的额外预算增益有限,因为原语无法针对误差信号进行再分配。
  • Bubble Plume的稀疏结构限制了可支持的原语预算上限,当预算超过可采样体素数量时无法继续增加原语。
  • 耦合模拟中的in situ验证尚未完成,方法在实际模拟工作流中的表现有待确认。
  • 与先前编码器的受控同平台比较留待未来工作,当前结果无法直接与VEG或W-VEG进行公平对比。
  • 渲染性能的受控对比留待未来工作,编码模型的渲染开销尚未系统评估。

关联工作

  • 3D Gaussian Splatting(Kerbl et al.)提供了基础原语表示与优化框架,但针对RGB辐射场设计,原语存储的是外观属性而非标量值。
  • VEG将高斯原语适配到科学体渲染,传递函数在渲染时应用,但通过增密/剪枝控制容量,编码大小是优化结果。
  • W-VEG将监督移入世界空间,通过误差引导增密达到目标压缩比,本文沿用其场空间监督但改为固定预算解析分配。
  • Compressive Neural Representations是神经场体数据压缩的早期工作,确立了PSNR作为标准评估指标。
  • ECoNGS和ANTIC分别代表压缩神经高斯splat和自适应神经时间in situ压缩器,与本文的紧凑原语表示和in situ数据缩减目标相关。

发表评论