三分钟导读:本文提出FUTURESURF基准,通过解析定义的合成运动数据集和严格的协议,揭示了当前动态表面重建方法在预测未来几何形状时存在显著误差,且渲染质量指标与表面几何精度解耦。
英文题目:Future Rendering ≠ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed Window
论文出处:arXiv 每日论文精选 · arXiv:2607.21471
原始论文:PDF / 论文页面
对应视频标题:未来渲染≠未来表面:超越观测窗口的动态表面重建基准与数据集|推荐指数:★★★★★
这篇论文解决什么问题?
现有的动态场景重建评估仅在观测时间窗口内进行插值评估,缺乏对部署场景(如AR、机器人交互)所需的“未来表面”(即观测时间之后的几何形状)的标准化评估基准。
核心创新
- 首个标准化评估未来时间表面mesh的基准,填补了从插值到外推的评估空白。
- 引入解析定义的合成运动,提供精确的未来ground-truth mesh和证伪控制(如表面不变运动、纯刚性变换、静态未来)。
- 揭示渲染质量(NVS metrics)与未来表面几何精度之间的统计解耦现象。
- 提供可复现的评分脚本、数据集和benchmark card。
方法概览
提出FUTURESURF基准,包含:1) 8个解析定义的受控运动数据集(5个表面变化运动,3个证伪控制),提供精确的逐帧ground-truth mesh;2) 方法无关的评估协议,训练于前75%帧,在保留的25%未来帧上评估提取的mesh;3) 主要指标为绝对Chamfer Distance (CD) 和 未来/观测CD比率(Gap);4) 提供ground-truth-side recoverability oracle以验证可预测性。
逐图理解论文
背景:现有评估的局限性

现有动态高斯和神经场方法,通常在观测时间窗口内进行插值评估,报告PSNR或LPIPS等渲染指标。然而,AR或机器人交互等应用需要预测观测窗口之后的“未来表面”。目前缺乏针对未来几何精度的标准化评估基准,导致模型在部署时表现不可靠。
方法:FUTURESURF基准构建

FUTURESURF基准包含8个解析定义的受控运动数据集,提供精确的逐帧ground-truth mesh。评估协议规定:模型在前75%帧训练,在保留的25%未来帧上评估提取的mesh。主要指标为绝对Chamfer Distance及未来/观测CD比率,以量化外推误差。
实验:DG-Mesh与Deformable-3DGS评估

我们在DG-Mesh和Deformable-3DGS两个backbone上评估未来表面重建能力。在6个DG-Mesh资产场景和8个受控合成运动上进行定量评估。结果显示,模型在观测窗口内的低误差并不能保证未来外推的低误差,几何精度随时间显著下降。
发现:渲染质量与几何精度解耦

一个关键发现是,渲染质量与表面误差之间存在统计解耦。Spearman相关系数均值|ρ(LPIPS, CD)|仅为0.13。如图2所示,即使预测渲染保持可识别(PSNR = 17.9 dB),重建表面在运动区域(如划水的脚)误差极大。高渲染质量不保证未来几何准确。
Oracle分析:未来可预测性验证

我们使用ground-truth-side recoverability oracle验证合成运动的未来可预测性。结果显示,4/5的合成运动未来可被简单规则近乎完美恢复,表明这些运动在理论上是可预测的。然而,模型未能有效捕捉这些规律,特别是在traveling bump等复杂运动中。
实验与关键结果
- 在DG-Mesh和Deformable-3DGS两个backbone上评估未来表面重建能力。
- 在6个DG-Mesh资产场景和8个受控合成运动上进行定量评估。
- 使用ground-truth-side oracle验证合成运动的未来可预测性。
- 分析渲染指标(PSNR, LPIPS)与表面误差(CD)的相关性。
- DG-Mesh在受控运动上的未来/观测CD Gap为2.7–4.1×(第 6 页)
- Deformable-3DGS在资产场景上的Gap为2.0–6.6×(第 6 页)
- 渲染质量与表面误差的Spearman相关系数均值|ρ(LPIPS, CD)| = 0.13(第 7 页)
- 在frame 190,duck场景的CD为81.8 × 10−3,约为观测窗口误差的4倍(第 2 页)
- Oracle显示4/5的合成运动未来可被简单规则近乎完美恢复(第 7 页)
阅读时需要注意
- 数据集为合成数据,无法直接代表真实世界捕获的复杂性。
- 评估依赖于能够输出逐帧mesh的方法,限制了评估范围(如Deformable-3DGS需近似处理)。
- 仅评估了基于deformation-MLP的backbone,未涵盖物理先验或显式4D网格等方法。
- 单目轨道相机捕获设置限制了视角多样性。
- 渲染质量高(如PSNR)并不保证未来表面几何准确。
- 观测窗口内的低误差不能保证未来外推的低误差。
- Gap指标受观测窗口误差分母影响,需结合绝对CD解读。
关联工作
- DG-Mesh:作为主要评估的surface-extraction backbone(第 3 页)
- Deformable-3DGS:作为cross-backbone检查的deformation-MLP backbone(第 3 页)
- ReconPhys:最接近的工作,但评估点集而非mesh,且无标准化协议(第 3 页)
- Kubric:大规模合成数据集生成器,作为受控合成数据的先例(第 3 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
未来渲染 ≠ 未来表面:一个超越观测窗口的动态表面重建基准与数据集
Yukun Shi Minglun Gong 圭尔夫大学
已观测(训练,前 75%) 保留的未来(25%)
t=0.00 t=0.38 t=0.75 t=0.88 t=1.00
波浪 (周期性) 2026 7月 23 隆起 (局部) [cs.CV]
旋转 (刚性(控制))
图 1. FUTURESURF:重建的表面能否在观测窗口之外存活?我们八种受控运动中的三种,以真实网格序列展示(红色箭头:真实表面速度),分别隔离了周期性运动、局部变形和刚性运动控制。方法在前 75% 的时间戳(观测部分)上进行训练,并在保留的未来(25%)上对其提取的表面进行评分。由于这些未来场景是解析定义的,该基准可以测试学习到的动态重建是否将表面延续到了保留的未来时间。我们发布了数据集、划分、评分器以及真实侧的可恢复性预言机。
摘要 动态场景重建几乎总是在观测时间窗口内进行评估,然而增强现实叠加、机器人交互和前瞻性规划等部署场景需要未来表面:即那些未被捕捉到的时刻的几何结构。目前尚无标准基准对此进行衡量。我们引入了 FUTURESURF,这是一个面向未来时间表面重建的、控制严格的、与具体方法无关的基准和数据集。该基准通过牺牲场景多样性来换取精确的未来真实值和证伪控制。方法在序列的前 75% 观测部分进行训练;我们通过切弗距离对其提取的逐帧表面在保留的未来部分进行评分,将绝对未来切弗距离报告为主要分数,将未来/观测差距作为诊断指标。该数据集包含八种解析定义的受控运动,其中包括三种证伪控制,并配有精确的逐帧真实网格。我们还提供了
第 2 页
渲染结果偏离,表面误差增大 预测表面: 预测渲染:合理,但在运动处错误 真值图像,第190帧 (17.9 dB)
90 80 70 60 (×10 50 40 30 20 16.5 18.5 18.0 (dB) 17.5 17.0 CD 表面 PSNR 划水的脚 0.05 0.10 150 160 170 180 190 200 每顶点误差 (真值 vs 预测,规范单位) 未来帧 (视界 )
图 2. 未来渲染 ≠ 未来表面(鸭子,DG-Mesh,远视界未来帧 190)。左侧对:预测渲染仍是一只可辨认的鸭子(PSNR = 17.9 dB)。中间:在同一帧重建的表面在表面运动处存在显著错误(每顶点误差在划水的脚处达到峰值)。右侧:在整个未来窗口内,每帧渲染质量保持在狭窄范围内,而每帧表面误差增长数倍。在第 190 帧,切弗距离 (CD) 为 81.8 × 10−3,约为观测窗口误差的 4 倍;CD 越低越好。两种误差的秩相关性较弱(鸭子 Spearman ρ(LPIPS, CD) = +0.09),因此渲染指标无法追踪未来几何结构。
真值侧可恢复性预言机。发布内容包括拆分文件、CPU 评分代码、基准卡和 Croissant 元数据。在受控运动上,DG-Mesh 骨干网络即使对于原则上可预测的未来(五种可恢复运动中有四种可通过固定规则从观测运动恢复)也留下了 2.7–4.1 倍的差距,而证伪控制按设计表现(表面不变运动未显示差距)。除了贡献的数据集外,该差距在六个动画 DG-Mesh 资产场景和第二个骨干网络 Deformable-3DGS(2.0–6.6 倍;两者共享变形 MLP 时间模型)中持续存在。基准还显示,未来渲染质量和未来表面准确性在统计上是解耦的(平均每帧秩相关性 |ρ(LPIPS, CD)| = 0.13),因此该领域报告的视角合成指标无法追踪未来几何结构。未来误差具有结构性,集中在表面运动处。数据集、评估工具和评分代码已在 Hugging Face (https://huggingface.co/datasets/rickyshi/futuresurf) 和 GitHub (https://github.com/Ricky-S/futuresurf) 上公开。
1. 引言
从视频中重建动态 3D 场景已成为一个核心问题,变形高斯和神经场方法实现了高保真的新视角合成,并日益实现时间一致的表面。然而,标准的评估协议仅在观测时间窗口内衡量质量:它询问模型在训练过的时间点上插值的效果如何。许多下游应用从根本上说是关于未来的:增强现实系统必须在观察到表面之前的一刻在其上放置内容;机器人必须预测变形物体将位于何处;规划器必须对其尚未看到的几何结构进行推理。对于这些应用,相关的问题是未来表面准确性:给定直到时间 T 的帧,在时间 t > T 时重建的表面网格质量如何(图 2)?
据我们所知,这个问题尚未被测量。关于动态高斯的前沿工作预测外观并报告渲染指标(PSNR/SSIM/LPIPS);动态表面工作报告切弗距离或 F 分数,但仅限于观测窗口内。差距是具体的:没有标准化协议评估在保留时间上的重建未来表面网格,因此该领域缺乏一种受控方法来研究未来表面重建何时以及为何失败。
我们通过一项评估贡献来弥补这一差距。FUTURESURF(图 1)将保留的未来拆分和每帧切弗指标打包在共享规范帧中,这是一个由解析定义的运动组成的受控数据集,包含每帧真值网格和证伪控制,以及一份说明基准能够和不能支持哪些声明的基准卡。评估新方法所需的一切(数据、拆分和评分脚本)均已提供。
贡献。 1. 一个用于未来时间表面重建的数据集和基准:八个解析定义的受控运动(其中三个为证伪控制),具有精确的每帧真值网格、保留的未来拆分、一种与模型无关的切弗协议、发布的评分代码、基准卡和 Croissant 元数据。它
第 3 页
是首个在保留时间点上对重建的未来表面网格进行评分的标准化测试平台,而先前的未来几何工作通常对点云或渲染结果进行评分,而非提取的网格(§§3, 4)。
2. 基准所揭示的未来表面差距:即使在理论上可预测的运动上(五种运动中有四种可通过固定规则从观测运动中恢复),DG-Mesh 仍留下了巨大的差距(2.7–4.1倍);在两种变形 MLP 骨干网络上的资产场景中,这一差距同样存在(2.0–6.6倍),且伪造控制按设计行为运作(§5)。
3. 渲染与表面解耦的结果:该领域报告的 NVS 指标(PSNR、LPIPS)并未反映未来表面的准确性,因此未来渲染质量不足以作为未来表面质量的充分证据(§7)。
FUTURESURF 是一个受控的诊断基准。在大型数据集发布 [8] 最大化场景多样性的背景下,它提供了精确的未来真实值、伪造控制和可恢复性预言机:现有基准缺乏这些工具来隔离保留时间点的表面准确性。因此,它支持关于相对未来表面准确性、运动类型依赖性以及渲染-表面解耦的主张,并明确声称不涵盖所有动态场景或认证现实世界部署。合成、解析定义的运动是必要的:这是获得精确逐帧真实网格以及控制和预言机的唯一方法。该差距和可预测性结构在两种骨干网络上均得到验证;渲染-表面解耦和规范分解仅在 DG-Mesh 上报告,其表面提取支持这些分析。
未来几何与规范。基于物理先验的线路将重建与物理模拟器耦合,以推进或合成未来动力学 [3, 6, 24, 28],但报告的是在假设物理模型下的粒子/点或渲染误差,而非标准化的表面网格协议。最接近我们设置的工作是 ReconPhys [18],它通过前馈物理模型从单个视频预测高斯中心点集,并作为点进行评估,而非提取的表面网格,且没有标准化的表面网格协议或诊断。该线路中显式动力学先验的使用与我们在 (§5) 中的实证发现一致,即测试的变形 MLP 骨干网络在没有额外时间归纳偏置的情况下,无法可靠地将表面几何结构带入保留的未来时间点。此外,前馈 3D 预测通常在去除尺度/对齐(规范)歧义 [21] 后进行评估;我们的诊断明确将这种可移除的规范分量与非刚性核心分离开来。表 1 说明了该基准所填补的差距。
2. 相关工作
我们根据评估对象对先前的工作进行组织,因为我们的差距正在于此。
未来时间动态场景(外观)。越来越多的工作将动态高斯或辐射场预测到未来时间:潜在 ODE 外推器 [19]、高斯预测预报器 [26]、基于 4D 高斯的 learned dynamical-system models [2]、带不确定性的高斯过程时间外推 [11],以及用于时空预测的运动感知高斯分组 [13]。所有这些工作都评估未来渲染(通常是 PSNR/SSIM/LPIPS),从未评估未来表面网格;我们的解耦结果(§7)表明这两者不可互换。
动态表面重建(窗口内)。基于高斯溅射和变形场表示 [9, 10, 16, 17, 22],一系列方法重建动态表面并报告几何指标(切弗距离、F-score 或准确率/完整性)[4, 12, 20, 23, 27],但仅针对观测窗口:它们测量的是插值,而非外推。我们在观测窗口之外评估了两个动态高斯骨干网络:DG-Mesh [14](一种表面方法)和 Deformable-3DGS [25](一种变形 MLP 骨干网络)。从单目视频中提取一致的逐帧表面网格本身是一项新兴能力,而 DG-Mesh 是少数能做到这一点的方法之一,这就是为什么我们用其实例化表面提取骨干网络的原因。由于该协议仅对导出的逐帧网格进行评分,与方法的生成方式无关,因此它可以基准测试此类新兴中的任何方法(不仅仅是 DG-Mesh),并将适用于随着出现的新方法。
未来几何与规范。基于物理先验的线路将重建与物理模拟器耦合,以推进或合成未来动力学 [3, 6, 24, 28],但报告的是在假设物理模型下的粒子/点或渲染误差,而非标准化的表面网格协议。最接近我们设置的工作是 ReconPhys [18],它通过前馈物理模型从单个视频预测高斯中心点集,并作为点进行评估,而非提取的表面网格,且没有标准化的表面网格协议或诊断。该线路中显式动力学先验的使用与我们在 (§5) 中的实证发现一致,即测试的变形 MLP 骨干网络在没有额外时间归纳偏置的情况下,无法可靠地将表面几何结构带入保留的未来时间点。此外,前馈 3D 预测通常在去除尺度/对齐(规范)歧义 [21] 后进行评估;我们的诊断明确将这种可移除的规范分量与非刚性核心分离开来。表 1 说明了该基准所填补的差距。
2. 相关工作
我们根据评估对象对先前的工作进行组织,因为我们的差距正在于此。
未来时间动态场景(外观)。越来越多的工作将动态高斯或辐射场预测到未来时间:潜在 ODE 外推器 [19]、高斯预测预报器 [26]、基于 4D 高斯的 learned dynamical-system models [2]、带不确定性的高斯过程时间外推 [11],以及用于时空预测的运动感知高斯分组 [13]。所有这些工作都评估未来渲染(通常是 PSNR/SSIM/LPIPS),从未评估未来表面网格;我们的解耦结果(§7)表明这两者不可互换。
动态表面重建(窗口内)。基于高斯溅射和变形场表示 [9, 10, 16, 17, 22],一系列方法重建动态表面并报告几何指标(切弗距离、F-score 或准确率/完整性)[4, 12, 20, 23, 27],但仅针对观测窗口:它们测量的是插值,而非外推。我们在观测窗口之外评估了两个动态高斯骨干网络:DG-Mesh [14](一种表面方法)和 Deformable-3DGS [25](一种变形 MLP 骨干网络)。从单目视频中提取一致的逐帧表面网格本身是一项新兴能力,而 DG-Mesh 是少数能做到这一点的方法之一,这就是为什么我们用其实例化表面提取骨干网络的原因。由于该协议仅对导出的逐帧网格进行评分,与方法的生成方式无关,因此它可以基准测试此类新兴中的任何方法(不仅仅是 DG-Mesh),并将适用于随着出现的新方法。
基准实践。我们的打包遵循既定的数据集文档实践:基准卡片秉承 datasheets [7] 和 model cards [15] 的精神,数据集附带机器可读的 Croissant 元数据 [1]。
第 4 页
运动 时间因子隔离 位置:波,一种纯周期性的径向涟漪,返回 其起点(周期性);复合,相同的涟漪叠加 复合 叠加(周期性 + 趋势) 在单调伸长上,因此它永远不会返回(叠 拉伸 单调趋势 加);拉伸,在减速速度曲线上的平滑各向 隆起 空间局部性(行进中的凸起) 异性伸长(单调趋势);隆起,一个在极角 加速 加速度 方向扫过的行进高斯凸起(空间 扭曲† 表面不变运动 局部性);以及加速,与拉伸相同的伸长,但 旋转† 纯规范(刚性旋转) 在恒定加速度曲线上,仍在加速 停止† 静态未来(在 t=0.5 时冻结) 分裂(加速度)。拉伸和加速是有意成对: 它们共享一个静态形状但相反的速度曲线,因此 表 2. 我们贡献的数据集:八个构建的运动, 恒定速度猜测会超过其中一个并低于另一个。 每个运动包含 1,986 个真实顶点,200 帧(150/50 保留 没有单一的逐顶点外推规则能覆盖整 出拆分),每帧的真实网格,以及 Croissant 元 数据(图 3)。五个隔离了改变表面的时间因子(顶部); 套规则,这跨越了多个规则族(§6)。所有八个 三个是证伪控制(†,底部)。 映射的生成方程见补充材料;作为具体示例, 设 n 为单位径向方向,θ, ϕ 分别为方位角和极角,波和隆起映射为 3. FUTURESURF 数据集 wave : x + 0.22 sin(2πt + 1.2ϕ + θ) n, FUTURESURF 提供了未来时间点的每帧 bulge : x + 0.34 exp −(ϕ −πt)2/(2·0.282) n. 真实表面网格:这是任务所需的数据,而真实捕 获无法提供。它包含八个构建的受控运动,其中 未来在原理上是解析可知且可预测的。所有八个 运动共享一种捕获约定:在单目轨道相机下的 逐顶点纹理表面,200 帧,前 75%(帧 0–149) 被观测,后 25%(150–199)保留用于未来评分。 每一帧都包含精确的真实网格(表 2)。
为何使用受控合成数据。测量未来- 表面精度需要在未来时间点拥有精确的真实网格。 真实捕获产生未来图像,但不产生真实 表面;获取该表面需要另一个重建步骤,并带有 其自身的误差。因此,任务本身要求具有每帧 网格的动画或解析资产,这有助于解释为何该 数量尚未成为标准指标。我们故意利用这一要求: 每个构建的运动隔离一个时间因子或叠加, 控制项暴露协议本身,且在原理上可预测的未来 将“未来不可知”与“测试的主干未进行外推” 区分开来。这遵循了受控合成数据是一流评估工具 [8] 的既定先例,并且协议层面的现实检查无需引入新方法 即可成为贡献 [5]。
八个受控运动。每个构建的运动 通过一个解析的、时间参数化的映射 Fm(x, t) 变形一个共同的基 UV 球体(半径 0.9),因此未来表 面在每个 t 时刻都以封闭形式已知,挑战 在于运动的时间曲线,而非其静态形状 (某些运动在任意单帧中几乎无法区分,仅在 演化方式上不同)。五个改变表面的 运动各自隔离一个时间因子或叠加, 控制项暴露协议本身,且在原理上可预测的未来
三个证伪控制。另外三个运动 扩展了协议而非任何方法,因此有缺陷的 指标或对齐无法无声地通过。扭曲(表面不变) 是一种方位剪切,它使顶点发生显著位移 (均值 0.24,最大值 0.47),同时几乎不改变表面 (表面变化 0.014):正确的协议必须 报告一个单位间隙,将表面变化与参数 化运动分开。旋转(纯规范)是一个固定 不对称形状的刚性旋转,其设计的未来运动 是一个可移除的全局相似变换;它校准了 规范分解。停止(静态未来)是冻结在 t=0.5 时的波,因此保留的未来是静态且已观 察到的:正确的预测是“什么都不做”,而度 量暴露了主干是否仍然漂移。
额外的第三方评估场景。除了 贡献的数据集,仅为了形状多样性和 跨主干检查,我们还在六个来自动画 资产场景上进行评估,这些场景来自 DG-Mesh [14](鸭子、马、女孩行走、 环面→球体、鸟、比格犬)。
基准卡和元数据。发布中包含 数据表风格的基准卡。预期用途: 一个受控的诊断基准,用于在相同拆分下 测量和诊断未来时间表面重建。支持的声明: 方法间的相对未来表面精度;外推 难度对运动类型的依赖性;渲染与表面解耦。 不支持的声明:现实世界部署性能(数 据是合成的)以及作为主要基准目标的外观质量。假设: 每帧真实网格、单目轨道捕获和共享规范
第 5 页
波浪 拉伸 膨胀 扭曲 仅根据其表面位置进行评判。主要评分指标是 绝对未来切弗距离(Chamfer Distance),在固定场景下 不同方法间可直接比较;基于表面采样点的切弗距离检 周期性 单调性 局部化 表面不变性(控制) 查(不依赖于网格顶点密度)也得出了相同的定性结论。 诊断指标。差距(未来切弗距离 / 观测窗口切弗距离) 复合 加速 旋转 停止 将方法在未来窗口(外推)的误差与其在观测窗口(内插) 的误差进行比较。这是本文的核心诊断指标,全文均有 报告,但并非主要评分:作为比率,它继承了分母的逐次 周期+趋势 加速中 刚性(规范控制) 在 t=0.5 时冻结 运行的方差。经过 Sim(3) 对齐的切弗距离(“去除规范”: 每帧最佳旋转、平移和均匀缩放)是一种理想诊断指标, Figure 3. 受控运动数据集(代表性帧): 在相同的采集约定下(每顶点纹理表面、共享相机轨迹、 八种解析定义的运动(每帧真实网格)。五种表面变化运动 隔离了不同的时间因素;三种证伪控制测试了协议。 正式定义。设 $p, g$ 分别遍历第 $t$ 帧预测顶点集 $P_t$ 和真实顶点集 $G_t$(标准真实尺度帧),每帧评分为对称 切弗距离 Task 给定帧 $t \in[0, T]$,重建表面网格 在保留帧 $t > T$ 前 75% 的时间戳用于训练;剩余 25% 用于评估 $d(P_t, G_t) = \frac{1}{2}\text{mean}_p \min_g \|p-g\| + \frac{1}{2}\text{mean}_g \min_p \|g-p\|$. (1) Split 前 75% 的时间戳训练;剩余 25% 评估 Ground truth 每帧真实网格 Metric 主要指标:绝对每帧未来切弗距离(标准 设计原则。D1(方法无关):仅通过提取的每帧网格评估 帧,真实尺度) 方法;协议中未假设任何表示形式。D2(精确真实):每 Diagnostics 差距 = 未来/观测切弗距离(均值/中位数);Sim(3) 帧真实网格来自动画或解析定义,绝非来自传感器或拟合 代理。D3(可证伪):该套件包含旨在暴露协议本身的运动 (表面不变、刚性、冻结未来),因此有缺陷的度量或对齐 Artifacts 数据集、拆分文件、评分脚本、基准卡片 无法通过而不被发现。D4(可诊断):每个结果都附带分解 数据,而不仅仅是一个数字:多少误差是可移除的姿态/ Table 3. FUTURESURF 协议概览。方法通过在观测窗口上训练,并在保留的未来时间点上对其提取的网格进行评分进行评估;所有评分均由脚本驱动且与具体方法无关。 尺度偏移,多少是真实的形状误差(规范与非刚性),以及 误差集中的每顶点映射。因此,失败是可以解释的,而 frame for prediction and ground truth (no per-frame align- 不仅仅是被测量。D5(观测窗口前提):“未来表现差” ment). Responsible use: the constructed data is procedu- 只有在方法“观测窗口表现好”时才有意义,因此在评估 rally generated (no personal or human-subject data). The 其未来表现之前,我们要求其在观测窗口的切弗距离处于 constructed motions are released under CC BY 4.0 with 真实尺度:与同一场景上表面骨干网络的观测窗口切弗距 Croissant metadata; the benchmark is versioned and new 离处于同一数量级,而非高出数倍。报告的观测窗口切弗 motions are added as separate scene sets. 距离(表 4,表 5)证实了评估的骨干网络满足此要求; 如果某方法的观测重建偏离此尺度(Deformable-3DGS 的 4. Task, Protocol, and Metric 中心云位于构建表面上,图 4),则不属于其未来声明的 范围。 表 3 总结了协议;下文将详细说明。 任务与拆分。给定帧 $t \in[0, T]$,重建保留帧 $t > T$ 的表面网格;前 75% 的时间戳用于训练,剩余 25% 用于评估。度量。提取网格的顶点集与真实网格的顶点集之间的每帧双向切弗距离,表示在共享的标准坐标系中(一个固定的真实尺度坐标系,无每帧对齐)。切弗距离将每个顶点匹配到另一网格上的最近邻点,因此评分不需要预测网格和真实网格之间的顶点对应关系,也不需要共享拓扑结构:方法仅根据其在预测帧和真实帧(无每帧对齐)中的表面位置进行评估。负责任使用:构建的数据是程序化生成的(无个人或人类受试者数据)。构建的运动以 CC BY 4.0 许可发布,并附带 Croissant 元数据;基准已版本化,新运动作为单独的场景集添加。
实现与计算。每个骨干网络均使用其发布的调度进行训练(DG-Mesh 每帧提取一个网格;Deformable-3DGS 使用其 D-NeRF 调度);基准测试不改变训练过程,纯粹是一个评估协议。评分仅使用 CPU:给定每帧
第 6 页
wave stretch Scene Obs CD Fut CD Raw gap Non-rigid PSNR ρL,CD
duck 0.0205 0.0497 2.4× 1.9× 17.8 +0.09 horse 0.0152 0.0580 3.8× 2.8× 18.5 -0.11 girlwalk 0.0148 0.0565 3.8× 3.7× 21.0 -0.10 torus→sphere 0.0165 0.1099 6.6× 5.1× 13.5 -0.21 bird 0.0178 0.0917 5.2× 4.8× 17.8 -0.14 beagle 0.0207 0.0414 2.0× 1.4× 17.0 -0.16
Table 4. 六个 DG-Mesh 数据集场景的未来表面差距(Per-scene future-surface gap)。Obs/Fut CD 为观测/未来窗口每帧双向切弗距离(绝对值,规范单位);Raw gap bulge rotate = Fut/Obs CD(2.0–6.6×,来自未舍入均值);去除规范(非刚性)后的差距仍然很大(真实的表面误差,而非可移除的漂移);PSNR 为未来窗口渲染质量;ρL,CD = ρ(LPIPS, CD) 较弱(Spearman 相关系数),表明渲染质量并不能预测表面质量(渲染与表面解耦)。
motion character obs CD fut CD gap
wave periodic 0.0350 0.0945 2.7× compound period + trend 0.0278 0.0854 3.1× stretch monotonic 0.0228 0.0695 3.0× bulge localized 0.0286 0.0918 3.2× accel accelerating 0.0210 0.0861 4.1× GT surface DG-Mesh mesh D3DGS centers twist† surf.-invariant 0.0173 0.0173 1.0× rotate† rigid 0.0348 0.1189 3.4× Figure 4. 在解析表面上,第二个主干是一个点云,而不是表面网格。四种构造运动的横截面:DG-Mesh 的网格(绿色)位于地面 truth 表面(黑色)上;Deformable-3DGS 的高斯中心(红色)形成一个松散云团,距离表面比 DG-Mesh 的网格远 2–7 倍, 在所有八个场景上均如此(基于观测帧的中位数)。
Table 5. 在我们贡献的数据集(DG-Mesh 主干)上的受控运动结果:观测和未来窗口上的每帧双向切弗距离绝对值(GT 尺度;越低越好) 以及差距(未来/观测 CD;1 表示未来表面与观测窗口一样准确,越高越差)。前五项列出的是改变表面的运动;后三项带 † 的控制 follow。网格、受控运动差距和可恢复性数字由发布的脚本在几分钟内生成。
为什么受控研究使用 DG-Mesh。Deformable-3DGS 不导出表面网格:它输出每帧的高斯点云,而基准测试针对的是网格。在带纹理的资产场景上,其中心足够接近表面以作为代理,因此我们在交叉主干检查(§5)中报告了它。然而,在平滑的解析构造表面上,中心在表面周围形成一个松散云团,距离表面比 DG-Mesh 的网格远 2–7 倍(图 4)。将此云团评分为表面是不可靠的,因此需要精确地面真相控制的受控研究使用 DG-Mesh。
5. 未来表面差距
精确的观测重建,退化的未来表面。被评估的方法满足我们的观测窗口前提条件(D5:它们在 GT 尺度下重建观测表面),但它们提取的未来表面急剧退化。我们首先在六个 DG-Mesh 资产场景上确立这一现象,这些场景涵盖了多样的形状:DG-Mesh 的未来表面误差是其观测窗口误差的 2.0–6.6 倍(表 4)。同样的模式出现在第二个主干 Deformable-3DGS 上,其资产场景的高斯中心足够接近表面以作为代理:其观测窗口 CD 很小(0.012–0.026,规范 GT 单位,不同于图 4 中的解析表面),从而排除了严重的错位或观测窗口重建已经失败作为未来增加的解释。其差距随后相当(2.1–6.6×;补充材料中的逐场景值)。这些资产场景提供了形状和主干广度;下面的更深层诊断(证伪控制、可恢复性预言机、因子隔离)需要精确地面真相,只有我们的受控数据集能提供。
受控运动隔离了外推失败。在八个构造运动(§3)上,其未来原则上简单且可预测,DG-Mesh 证实了差距:该方法准确重建了观测表面,但对外推这些未来效果很差(表 5)。尽管观测窗口 CD 很小,但五个改变表面的运动
第 7 页
停止:静态未来,但主干网络在长视界下发生漂移。
| 运动类型 | 最佳规则 | 未来 CD | 对比冻结 | | :— | :— | :— | :— | | 波 | 谐波 K=2 | 0.0006 | 47× | | 复合 | 谐波 K=2 | 0.0014 | 15× | | 拉伸 | 三次方 | 0.0008 | 13× | | 加速 | 二次方 | 0.00001 | ∼1200× | | 隆起 | ≈冻结(速度) | 0.0173 | 1.0× |
表 6. 构建的未来在真值侧(oracle)的可恢复性:在观测到的真值顶点轨迹上拟合最佳未来规则,并针对未来真值表面进行评分。CD 是顶点集上的边界框归一化线性切弗距离,其尺度与表 5 中的绝对网格 CD 不同;比率是相对于“什么都不做”的冻结参考值。五种未来中有四种被几乎完全恢复;移动的隆起(bulge)击败了所有测试的逐顶点规则。
图 5. 停止控制对预测视界的影响。从 t=0.5 开始冻结运动后,逐帧未来 CD 在观测窗口水平上保持约 25 帧在 ∼2× 范围内,随后发生漂移:尽管观测到的运动已经停止,但变形场仍进行非恒定外推。
所有运动均显示出巨大的未来差距:均值差距为 2.7–4.1×,中位数差距为 3.2–4.6×,涵盖周期性、周期+趋势、单调、局部和加速运动。这些未来是解析定义的,因此通过构造可知;下一节测量真值侧 oracle 恢复了哪些未来。这些差距指出了所测试主干网络时间外推的局限性,而非这些构建未来的内在不可知性。† 三种控制(§3)按设计行为运作。twist 的单位差距证实协议测量的是表面变化,而非参数化运动(它平均使顶点位移 0.24,而表面本身仅变化 0.014)。rotate 的未来误差被规范分解正确归因于一个可移除的全局变换。stop 在 t=0.5 冻结运动,因此正确的预测是“什么都不做”:主干网络在主要运行中将冻结表面保持约 25 帧(均值差距 2.1×),然后在更长视界下从静态表面漂移。图 5 显示了停止控制对视界的影响。
6. 构建未来的可恢复性
真值侧 oracle。为了将“原则上可预测”转化为测量,我们将外推器套件(四种朴素规则,两种学习族)直接应用于五种表面变化运动的真值顶点轨迹,将预测的未来顶点与未来真值表面进行评分(表 6)。这些轨迹之所以定义良好,是因为每个受控运动都变形了一个固定拓扑模板,因此真值顶点在帧间保持其身份。我们的切弗度量不需要这种对应关系(§4):它在网格之间匹配最近点,而不是跟踪顶点。这故意是一种 oracle 评估,基于图像的方法无法获得:它是所测试时间规则族的乐观可恢复性参考,而非基线方法。五种构建的未来中有四种被简单的规则族几乎完全恢复,这些规则族与其解析构造相匹配,因此主干网络的 2.7–4.1× 差距出现在仅从观测运动即可恢复的未来上。例外是富有启发性的:隆起是一种传输现象(一个隆起在表面上移动),没有任何逐顶点时间规则能显著优于“什么都不做”的冻结(最佳:速度,低于它 1.3%)。其未来由构造决定,但恢复它需要超出我们 oracle 测试的逐顶点族之外的空间传输规则。因此,构建的运动涵盖了规则族以及运动类型。 wherever oracle 可恢复性得以确立,未来便从观测运动本身得出;剩余的差距反映了所测试主干网络表示和时间外推的局限性,而非内在不可知性。
简单的观测窗口外推也不能可靠地解决资产场景:留出选择可能会错过场景依赖的未来最优规则,且学习的逐顶点模型并未始终优于朴素规则(补充材料中的完整结果)。因此,FUTURESURF 既非不可能,也未被单个平凡的时间外推器解决。
7. 诊断:渲染–表面解耦与误差结构
渲染 ≠ 表面。逐帧未来 RGB 误差和表面误差在六个场景中统计解耦(表 4):它们的相关性较弱(均值 |ρ(LPIPS, CD)| = 0.13),且线性拟合解释的表面误差方差不足 6%。因此,该领域报告的新视角合成指标并未跟踪未来表面准确性:未来渲染质量不足以证明未来表面质量。
误差位于何处。未来误差并非均匀分布:它集中在表面移动的地方,并随着局部…
第 8 页
t=150 (split) t=170 t=190 受控研究使用表面提取骨干网络。此外,两种骨干网络共享一个时间条件变形 MLP,因此我们的证据仅限于该家族;一个时间上独立的表示(基于物理的、显式的 4D 网格或神经 SDF 流)是分离该家族偏差与更广泛难度的自然下一步。默认分割比例为 75/25,每帧曲线存在视域依赖性;在 60/40 和 85/15 时差距依然存在,且评分器支持任意分割。最后,本文诊断的是差距,而非提出新的重建方法:校正全局规范并未消除该差距,这与误差主要是非刚性且具场景结构性的结论一致。
bulgepred 对方法设计的启示。未来表面指标应伴随部署声明:仅凭 PSNR/LPIPS 无法可靠地追踪未来几何结构(第 7 节)。结果表明,时间外推而非观测窗口拟合是瓶颈:简单的逐顶点规则和学习的逐顶点模型无法可靠地预测未来,且从观测帧中选择模型可能会选错规则。未来方法可能需要更强的时间归纳偏置,例如动力学先验、周期性、物理约束,或针对静态未来漂移的正则化。
CD=36.5e-3 CD=108.7e-3 CD=101.4e-3
waveGT
伪影可用性。发布的基准包含受控运动数据集(CC BY 4.0,Croissant 元数据)、分割文件、评估代码和基准卡片,可在 Hugging Face 和 GitHub 上获取。GT 侧的可复现性数字无需重新训练或使用 GPU,通过 gt_oracle.py 从发布的真实数据中即可复现;DG-Mesh 的差距数字可通过在发布的数据集上使用公开的 DG-Mesh 代码对每个场景重新生成分帧预测,并使用 score.py 进行评分来复现。资产场景结果使用与公开 DG-Mesh 资产相同的协议。基准已版本化并维护,新增的运动作为向后兼容的场景集添加,因此现有的分割和报告的数字仍然有效。
CD=40.0e-3 CD=96.8e-3 CD=119.7e-3
wavepred
9. 结论 未来渲染 ≠ 未来表面。差距很大,并且在两种测试的变形 MLP 骨干网络上由运动类型结构化;在表面骨干网络上,它与渲染质量解耦,在构建的套件上,它指向该家族如何随时间外推,而非指向那些无法预测的未来。我们发布了 FUTURESURF,一个受控数据集和诊断基准,以使跨表示的未来表面预测可测量。
predicted-surface error (pred GT, normalized per scene)
Figure 6. 预测视域内未来表面的退化(两种构建的运动,膨胀和波浪;DG-Mesh)。对于每种情况:GT 网格(灰色)和按每顶点预测到 GT 距离着色的重建,在分割帧 t=150 和两个后续帧;标注了每帧 CD。误差在未来窗口内急剧增长,并集中在表面移动最大的地方(膨胀的移动突起,波浪的波峰)。
8. 讨论与局限性
局限性。真实未来几何需要合成资产和每帧网格;我们在构建的套件加上 DG-Mesh 资产集合上进行评估,并发布了与数据集无关的协议以供扩展。采集遵循单目轨道惯例。该协议与方法无关,但广度受限于哪些方法暴露每帧网格:在构建的套件上,Deformable-3DGS 的高斯中心形成表面外的云(图 4),因此将其作为表面进行评分是不可靠的。
8
第 9 页
参考文献 视频通过变分高斯过程。在 CVPR,2026。 arXiv:2604.02915。3 [1] Mubashara Akhtar, Omar Benjelloun, Costanza Conforti, [12] Minje Kim, Younghyun Noh, Jaesoon Kim, 和 Tae-Kyun Luca Foschini, Pieter Gijsbers, Joan Giner-Miguelez, Su- Kim。DySurface:通过桥接显式高斯和隐式函数实现一致的 jata Goswami, Nitisha Jain, Michalis Karamousadakis, 4D 表面重建。arXiv Satyapriya Krishna, Michael Kuchnik, Sylvain Lesage, 预印本 arXiv:2605.10360,2026。3 Quentin Lhoest, Pierre Marcenac, Manil Maskey, Peter [13] Junmyeong Lee, Hoseung Choi, 和 Minsu Cho。具有运动感知高斯 Mattson, Luis Oala, Hamidah Oderinwale, Pierre Ruyssen, 分组的动态场景时空预测。在 CVPR,2026。arXiv:2602.21668。3 Tim Santos, Rajat Shinde, Elena Simperl, Arjun Suresh, Go- [14] Isabella Liu, Hao Su, 和 Xiaolong Wang。动态高斯网格:从动态 effry Thomas, Slava Tykhonov, Joaquin Vanschoren, Susheel 场景中实现一致网格重建。在国际学习表征会议 Varma, Jos van der Velde, Steffen Vogler, Carole-Jean Wu, (ICLR),2025。arXiv:2404.12379。3, 4 和 Luyao Zhang。Croissant:一种用于机器学习 就绪数据集的元数据格式。在神经信息处理系统 进展 (数据集与基准测试轨道),2024。3 [15] Margaret Mitchell, Simone Wu, Andrew Zaldivar, Parker [2] Arnold Caleb Asiimwe 和 Carl Vondrick。4D 高斯 Barnes, Lucy Vasserman, Ben Hutchinson, Elena Spitzer, In- 点云作为学习到的动力系统。arXiv 预印 ioluwa Deborah Raji, 和 Timnit Gebru。模型报告卡。在公平、 [3] Junhao Cai, Yuji Yang, Weihao Yuan, Yisheng He, Zilong 性、问责和透明度会议论文集 (FAT* ’19),2019。3 Dong, Liefeng Bo, Hui Cheng, 和 Qifeng Chen。GIC: [16] Keunhong Park, Utkarsh Sinha, Peter Hedman, Jonathan T. 用于物理属性识别和模拟的高斯信息连续体。在神经信息处理 Barron, Sofien Bouaziz, Dan B. Goldman, Ricardo Martin- 系统进展 (NeurIPS),2024。arXiv:2406.14927。3 Brualla, 和 Steven M. Seitz。HyperNeRF:一种用于拓扑 [4] Weiwei Cai, Weicai Ye, Peng Ye, Tong He, 和 Tao Chen。 变化神经辐射场的更高维表示。ACM 图形学汇刊,2021。Proc. DynaSurfGS:基于平面的高斯点云的动态表面重建。arXiv 预印 SIGGRAPH Asia 2021。3 本 arXiv:2408.13972, [17] Albert Pumarola, Enric Corona, Gerard Pons-Moll, 和 2024。3 Francesc Moreno-Noguer。D-NeRF:用于动态场景的神经辐射场 [5] Hang Gao, Ruilong Li, Shubham Tulsiani, Bryan Russell, 在 CVPR,2021。3 和 Angjoo Kanazawa。单目动态视角合成: [18] Boyuan Wang, Xiaofeng Wang, Yongkang Li, Zheng Zhu, 一次现实检验。在 NeurIPS,2022。4 Yifan Chang, Angen Ye, Guosheng Zhao, Chaojun Ni, Guan [6] Yue Gao, Hong-Xing Yu, Bo Zhu, 和 Jiajun Wu。Fluid- Huang, Yijie Ren, Yueqi Duan, 和 Xingang Wang。Recon- Nexus:从单个视频进行 3D 流体重建和预测。在 CVPR,2025。arXiv:2503.04720。3 Phys:从单个视频重建外观和物理属性。arXiv 预印本 arXiv:2604.07882,2026。3 [7] Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jen- [19] Daniel Wang, Patrick Rim, Tian Tian, Dong Lao, Alex nifer Wortman Vaughan, Hanna Wallach, Hal Daum´e III, 和 Wong, 和 Ganesh Sundaramoorthi。ODE-GS:用于动态场景外推的 Kate Crawford。数据集数据表。ACM 通讯,2021。3 3D 高斯点云的潜在 ODE。在国际学习表征会议 [8] Klaus Greff, Francois Belletti, Lucas Beyer, Carl Do- 上 (ICLR),2026。arXiv:2506.05480。3 ersch, Yilun Du, Daniel Duckworth, David J. Fleet, [20] Shuo Wang, Binbin Huang, Ruoyu Wang, 和 Shenghua Dan Gnanapragasam, Florian Golemo, Charles Herrmann, Gao。用于在复杂动态场景下进行精确表面重建的 Thomas Kipf, Abhijit Kundu, Dmitry Lagun, Issam Laradji, 时空 2D 高斯点云。arXiv Hsueh-Ti Derek Liu, Henning Meyer, Yishu Miao, Derek 预印本 arXiv:2409.18852,2024。3 Nowrouzezahrai, Cengiz Oztireli, Etienne Pot, Noha Rad- [21] Shuzhe Wang, Vincent Leroy, Yohann Cabon, Boris wan, Daniel Rebain, Sara Sabour, Mehdi S. M. Sajjadi, Chidlovskii, 和 J´erˆome Revaud。DUSt3R:使 3D 几何视觉 Matan Sela, Vincent Sitzmann, Austin Stone, Deqing Sun, 变得简单。在 CVPR,2024。arXiv:2312.14132。3 Suhani Vora, Ziyu Wang, Tianhao Wu, Kwang Moo Yi, [22] Guanjun Wu, Taoran Yi, Jiemin Fang, Lingxi Xie, Xiaopeng Fangcheng Zhong, 和 Andrea Tagliasacchi。Kubric:一个可扩 Zhang, Wei Wei, Wenyu Liu, Qi Tian, 和 Xinggang Wang。 展的数据集生成器。在 CVPR,2022。3, 4 4D 高斯点云用于实时动态场景渲染。在 CVPR,2024。arXiv:2310.08528。3 [9] Binbin Huang, Zehao Yu, Anpei Chen, Andreas Geiger, 和 [23] Renjie Wu, Hongdong Li, Jose M. Alvarez, 和 Miaomiao Shenghua Gao。用于几何准确辐射场的 2D 高斯点云。在 SIGGRAPH 2024 会议论 Liu。4DSurf:高保真动态场景表面重建。在 CVPR,2026。arXiv:2603.28064。3 文集,2024。3 [24] Tianyi Xie, Zeshun Zong, Yuxing Qiu, Xuan Li, Yutao Feng, [10] Bernhard Kerbl, Georgios Kopanas, Thomas Leimk¨uhler, Yin Yang, 和 Chenfanfu Jiang。PhysGaussian:用于生成式动力学的 和 George Drettakis。用于实时辐射场渲染的 3D 高斯点云。ACM 图形学汇刊, 物理集成 3D 高斯。在 CVPR, 2023。3 2024。arXiv:2311.12198。3 [11] Mijeong Kim, Jungtaek Kim, 和 Bohyung Han。GP- [25] Ziyi Yang, Xinyu Gao, Wen Zhou, Shaohui Jiao, Yuqing 4DGS:来自单目的概率 4D 高斯点云。 Zhang, 和 Xiaogang Jin。用于
9
第 10 页
高保真单目动态场景重建。在 CVPR,2024。arXiv:2309.13101。3 [26] Boming Zhao, Yuan Li, Ziyu Sun, Lin Zeng, Yujun Shen, Rui Ma, Yinda Zhang, Hujun Bao, 和 Zhaopeng Cui。Gaus- sianPrediction:用于运动外推和自由视角合成的动态 3D 高斯预测。在 SIGGRAPH 2024 会议论文,2024。3 [27] Chengwei Zheng, Lixin Xue, Juan Zarate, 和 Jie Song。 GauSTAR:高斯表面跟踪与重建。在 CVPR,2025。arXiv:2501.10283。3 [28] Licheng Zhong, Hong-Xing Yu, Jiajun Wu, 和 Yunzhu Li。 使用弹簧质量 3D 高斯重建和模拟弹性物体。在欧洲计算机视觉会议 (ECCV),2024。arXiv:2403.09434。3
10