Rest2Art:仅凭静止状态,如何重建铰接物体的3D结构与运动?

从静止到运动:视频扩散模型提供假设

我们日常见到的柜子、抽屉、冰箱,大多处于闭合状态。如果只给你看一张闭合柜门的照片,你能准确说出里面有几个抽屉、门往哪边开吗?这正是Rest2Art要解决的核心问题:从物体的静止状态观测中,重建出完整的部件级几何和关节运动参数。现有方法要么需要多个运动状态作为输入,要么依赖已知的部件数量,而Rest2Art通过三个关键设计突破了这些限制:首先,让视觉语言模型和分割模型相互“挑错”,在迭代协同优化中自动发现部件;然后,利用视频扩散模型合成可能的铰接运动,从中提取运动轨迹;最后,用网格几何约束来筛选和精化关节参数。实验表明,该方法在合成和真实数据集上均能有效恢复铰接结构,但也存在视频生成可能失败、微

PanoLess:无需全景拍摄,从单侧反射重建高保真环境光照

PanoLess的贡献

传统3DGS难以处理镜面反射,且现有反射重建方法通常依赖密集的360度覆盖。PanoLess通过表面对齐的2D Gaussian Splatting提取精确法线,结合延迟着色查询神经立方体贴图,从单侧反射图像中恢复环境贴图。引入可见性掩码区分观测与推断区域。在Shiny Partial基准上显著优于MaterialRefGS等基线。注意:该方法对相机位姿敏感,且仅适用于高镜面反射表面。

Lumera:从单图重建引擎原生可编辑3D场景

方法:Lumera-Box

本文介绍Lumera流水线,通过SpatialLM解析对象3D框和参数化灯光,结合SAM3D网格重建与IntrinsicHDR环境估计,生成可直接导入Blender或UE5的结构化场景。实验显示Lumera-Box在检测指标上领先,但灯光定位F1仅为0.209。Agent精炼循环作为受限编辑器,防止错误传播。

Crowd4D:场景感知的单目4D人群重建,解决大场景深度歧义

Crowd4D框架概览

本文介绍Crowd4D框架,针对大场景单目人群重建中的深度歧义和尺度漂移问题,提出人类-场景交互代理(HSIP)和人群结构相干正则化(CSCR)。在VirtualCrowd和PANDA数据集上,PPDS达到91.43,MPJPE降至59.35,优于DyCrowd等基线。该方法为离线优化,计算成本较高,适用于城市管理和公共安全场景,需注意隐私保护。

Event3R:事件相机异步到全局3D重建,前馈式时空特征聚合

核心组件:Temporal Encoder

本文介绍Event3R框架,解决RGB前馈方法在快速运动或极端光照下的脆弱性问题。通过将异步事件流离散化为时空体素,并利用Temporal Encoder聚合时序线索,结合DUSt3R骨干网络直接预测全局对齐3D点云。引入Masked Bin Modeling (MBM)进行自监督预训练。实验显示在TartanAir和MVSEC数据集上优于EvGGS等基线。注意:推理需GPU资源,且点云可视化颜色仅用于展示,训练推理未使用RGB数据。

MAGiSt3R:首个多代理前馈3D重建框架,突破单目视频全局一致性难题

方法:MAGiSt3R框架概览

本文介绍MAGiSt3R,首个用于单目RGB视频的多代理前馈3D重建框架。针对现有NeRF/3DGS SLAM依赖每场景迭代优化导致速度慢,以及前馈3R模型缺乏全局优化易产生累积漂移的问题,MAGiSt3R通过MAGMA模块实现子图聚合,结合位姿图优化(PGO)减少漂移。实验显示,在ReplicaMultiagent和AriaMultiagent数据集上,其重建精度和轨迹跟踪(ATE RMSE)均优于SOTA前馈基线,推理速度约10 FPS。需注意,部分RGB-D SLAM基线使用RGB-D输入,对比时仅作为参考上限。

DGSfM:深度引导的尺度感知全局SfM,解决传统方法尺度模糊与初始化敏感问题

背景:全局SfM的局限

传统全局SfM依赖尺度模糊的对极几何,导致全局定位对噪声基线估计和弱视图图约束敏感。DGSfM通过将单目深度估计集成到全局SfM中,利用深度感知相对位姿求解、视图图过滤和深度引导初始化来解决尺度歧义和初始化敏感性问题。实验显示,在ETH3D和LaMAR数据集上,该方法显著提升了相机位姿估计精度。需注意,方法性能受单目深度模型质量影响,且严格过滤可能略降点云完整性。

Wat3R:无标注水下3D重建,VGGT水下适配新范式

Wat3R核心方法

水下环境存在光衰减、散射及视图依赖退化,且缺乏大规模高质量3D标注,导致现有基于陆地数据的Feed-forward 3D重建模型泛化能力差。Wat3R提出了一种跨域半监督学习框架,利用合成数据和未标注真实视频,无需水下3D标注即可将VGGT适配至水下场景,并引入跨视图一致性损失以应对水体退化。实验表明,Wat3R在Sea-thru、FLSea Stereo、SQUID、SeaThru-NeRF及Water3D上均显著优于基线。但需注意,处理高动态元素能力有限,且在极端退化条件下性能仍受限于可见性。