三分钟导读:Event3R提出了一种前馈框架,将异步事件流转换为时空体素,并通过引入Temporal Encoder和Masked Bin Modeling (MBM)策略,直接预测全局对齐的3D点云,实现了在挑战性条件下的高效、鲁棒重建。
英文题目:Event3R: Asynchronous-to-Global 3D Reconstruction from Event Camera via Spatial-Temporal Feature Aggregation
论文出处:arXiv 每日论文精选 · arXiv:2607.15727
原始论文:PDF / 论文页面
对应视频标题:Event3R:事件相机异步到全局3D重建,前馈式时空特征聚合|推荐指数:★★★★★
这篇论文解决什么问题?
现有的RGB前馈3D重建方法(如DUSt3R)在快速运动或极端光照下表现脆弱;传统事件相机重建方法多依赖迭代优化或局部深度预测,缺乏全局一致的前馈重建能力,且缺乏大规模标注数据集。
核心创新
- 提出Event3R框架,首次实现仅基于事件的前馈全局3D重建。
- 设计Temporal Encoder,通过patch-level自注意力捕获细粒度运动线索。
- 提出Masked Bin Modeling (MBM),一种基于体素掩码的自监督预训练策略,包含重建、对比和一致性损失。
- 实现了无需迭代优化或外部姿态估计的端到端全局对齐3D点云生成。
方法概览
1. 将异步事件流离散化为时空体素(Voxels)。2. 使用Temporal Encoder通过自注意力机制聚合时间片间的运动线索。3. 基于DUSt3R骨干网络进行空间编码和解码,预测全局对齐的3D点图。4. 引入Masked Bin Modeling (MBM)进行自监督预训练和辅助微调,以增强 temporal 表征并减少对标注数据的依赖。
逐图理解论文
方法概览:时空体素化

Event3R将异步事件流离散化为时空体素Voxels。这一表示保留了事件的高时间分辨率特性。随后,模型直接预测全局对齐的3D点图,整个过程无需外部姿态估计或迭代优化,推理速度约为0.2秒。
核心组件:Temporal Encoder

为了捕捉细粒度运动线索,我们设计了Temporal Encoder。它通过Patch级别的自注意力机制,在体素化的时间片之间聚合特征。这种设计在保持空间对齐的同时,有效学习了时序动态信息,这是传统卷积难以做到的。
3D重建精度分析

3D重建结果显示,在MVSEC上Acc为0.4915,NC为0.7569;在TartanAir上NC高达0.8886。这表明Event3R能够生成全局一致且几何准确的点云,优于依赖姿态估计的IncEventGS及DepthAnything+GT Pose组合。
局限性与注意事项

Event3R依赖体素化参数T的选择,需平衡分辨率与计算成本。虽然无需迭代优化,但推理仍需GPU资源。此外,预训练依赖合成数据,域差距可能影响泛化。注意:可视化中点云颜色使用了对应中心体素bin的RGB图像,但训练推理未使用RGB数据。
实验与关键结果
- 单目深度估计:在TartanAir和MVSEC数据集上与EvGGS, E2Depth, DepthAnyEvent, DERD-Net, EReFormer对比。
- 相机姿态估计:在TartanAir数据集上计算ATE,与IncEventGS, DEVO, E2Vid+Colmap对比。
- 3D重建:在MVSEC和TartanAir上评估重建精度(Acc, Comp, NC),与IncEventGS及DepthAnything+GT Pose对比。
- 消融实验:验证Temporal Encoder和MBM各组件(预训练、对比损失、一致性损失)的有效性。
- TartanAir AbsRel: 0.0514, δ<1.25: 0.9700; MVSEC AbsRel: 0.1805, δ<1.25: 0.7838(第 6 页)
- TartanAir ATE (cm): S1=0.402, S2=0.152, S3=0.116, S4=0.545, S5=0.293(第 6 页)
- MVSEC 3D Reconstruction: Acc=0.4915, Comp=0.6132, NC=0.7569; TartanAir: Acc=0.1097, Comp=0.1382, NC=0.8886(第 6 页)
- 消融:去除Temporal Encoder后,AbsRel升至0.1187,ATE升至0.4381cm(第 7 页)
阅读时需要注意
- 依赖体素化参数(如时间片数量T)的选择,需平衡分辨率与计算成本。
- 虽然无需迭代优化,但模型推理仍需要GPU资源,且对于极长序列可能需要分块处理。
- 预训练阶段依赖合成数据(MatrixCity)和未标注真实数据,虽然减少了标注依赖,但域差距可能影响泛化。
- 可视化中点云颜色使用了对应中心体素bin的RGB图像,但训练和推理过程中并未使用RGB数据,仅用于展示。
- 在TartanAir上模拟事件流使用ESIM模拟器,真实世界性能需结合MVSEC等真实数据集评估。
关联工作
- DUSt3R:骨干网络基础,Event3R扩展其以处理事件数据。(第 1 页)
- EvGGS:对比方法,基于高斯泼溅,依赖姿态估计。(第 3 页)
- IncEventGS:对比方法,无姿态高斯泼溅,但依赖优化。(第 3 页)
- Event-NeRF:相关工作,基于神经辐射场,需已知轨迹。(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Event3R:通过时空特征聚合从事件相机实现异步到全局的3D重建
黄健1,2∗,沈浩天2∗,楼新浩2∗,董成瑞1,2,李文浦2,刘培东2†
~0.2s
事件流 体素
图1:Event3R示意图。Event3R接收两个或多个短片段异步事件流,将其转换为时空体素表示,并在约0.2秒内直接预测全局对齐的3D点图。为了可视化,点云使用对应于中心体素bin的RGB图像进行着色,尽管在训练或推理过程中未使用任何RGB数据。2026
以及具身感知。最近的前馈方法,如DUSt3R,在密集3D重建方面取得了令人印象深刻的进展,实现了稠密3D重建的一致性和强大的RGB泛化能力。然而,将这种全局稠密3D重建扩展到事件相机仍然具有挑战性,因为事件相机具有异步、稀疏和高度动态的特性,并且缺乏大规模、标注良好的数据集。在本工作中,我们引入了Event3R,这是一个前馈框架,直接将异步事件流映射到全局一致的3D点云。Event3R将输入事件表示为时空体素,通过时间注意力模块实现时间感知特征集成,从而增强模块的时间特征学习。为了进一步加强时间表示学习并减少对标注数据的依赖,我们提出了一种掩码体素建模(MBM)策略用于自监督预训练,以最小的标注数据实现鲁棒的时间表示学习,并将其保留为辅助微调目标。此外,在微调过程中还结合了比对对齐和一致性正则化损失,以加强跨视图的结构对应关系和时间连贯性。在合成和真实世界基准上的大量实验表明,Event3R实现了鲁棒、时间一致且全局对齐的3D重建,显著优于现有的基于事件的方法。
I. 引言
鲁棒的3D重建是机器人、AR/VR和自主系统的一项基本任务,为导航、交互和场景解释提供稠密的几何理解。传统的基于优化的方法,如运动恢复结构(SfM)和多视图立体视觉(MVS),能够恢复准确的几何结构,但需要迭代优化,并且在动态或无纹理环境中容易失败。基于NeRF [1]和3D-GS [2]的方法实现了照片级真实的画质,然而,其每场景优化严重限制了效率和泛化能力。最近,前馈3D重建框架,如DUSt3R [3]、CUT3R [4]和VGGT [5],通过直接从RGB帧预测全局一致的3D结构,展示了显著的进展,无需迭代细化即可提供数量级更快的推理速度。然而,它们对基于帧的图像的依赖使其在快速运动或光照条件恶劣的情况下变得脆弱,在这些情况下,传统相机无法捕获足够的信息。这一局限性在图2中得到了说明,其中DUSt3R在挑战性光照条件下由于RGB观测质量下降而表现不佳,而Event3R则保持鲁棒。
事件相机提供了一种有前景的替代传感模式。与以固定速率记录绝对强度的传统相机不同,事件相机以微秒级的时间精度异步捕获每个像素的亮度变化,从而实现高动态范围、低延迟和无运动模糊的感知。这些特性使它们成为挑战性场景的理想选择,正如最近基于事件的3D重建方法,如EvGGS [6]、Event3DGS [7]和IncEventGS [8]所证明的那样。然而,大多数这些方法侧重于局部深度(GS)预测或依赖基于优化的渲染,缺乏全局的、前馈式的基于事件的重建方法。然而,将DUSt3R风格的推理扩展到异步、稀疏的事件流仍然是一个开放挑战,原因在于其独特的时空结构以及大规模标注数据的稀缺性。
∗ 同等贡献。 † 通讯作者。 1 黄健和董成瑞来自浙江大学,中国浙江杭州。 2 所有作者均来自西湖大学,中国浙江杭州。电子邮件:{huangjian39, shenhaotian, louxinhao, dongchengrui, liwenpu, liupeidong}@westlake.edu.cn
第 2 页
事件输入 RGB输入 Event3R DUSt3R 特征匹配和光束法平差,但在动态或无纹理场景中仍然计算密集且脆弱。 HDR 神经场景表示拓宽了设计 空间:神经辐射场(NeRF)及其后续工作(例如 mip-NeRF)通过每场景优化实现照片级真实的新视角合成 [1, 12],而基于显式点/特征的 Light Low 方案,如 3D 高斯溅射(3D-GS),加速了渲染并实现了高保真 Fig. 2: 在挑战性条件下与 DUSt3R 的定性深度估计比较 重建的实时性能 [2]。虽然 3D-GS 能够从已知相机姿态的多视图图像中实现高效且高保真的 DUSt3R 在零样本设置下进行评估,未在 PEOD [9] 数据集上进行训练。 重建 [2]。随后,一些工作开始放宽这一要求。 事件–深度–姿态数据集。 COLMAP-Free 3D-GS [13] 直接从输入帧中顺序生长 3D 为了填补这一研究空白,我们提出了 Event3R,这是一个前馈 高斯集合,无需预先计算姿态,简化了重建流程并减少了 框架,旨在将全局 3D 重建引入异步事件数据。我们的关键见解是重新解释 预处理开销。 事件流为结构化的时空体素,允许 几何重建骨干网络(即 DUSt3R)处理时间密集但空间稀疏的观察。在此基础上,时间注意力机制对体素化时间片中的运动信息进行建模,从而实现全局一致的点云重建。为了在标记数据有限的情况下进一步增强时间表示学习,我们引入了掩码体素建模(MBM)——一种自监督预训练目标,用于正则化微调并提高运动泛化能力。结合对比对齐和时间一致性损失以强制跨视图一致性,Event3R 展示了仅基于事件输入的全局一致 3D 重建的新范例,有效地弥合了异步传感与前馈 3D 重建之间的差距。 总之,我们的主要贡献如下: • 我们提出了 Event3R,一种新的前馈框架,能够从异步事件流中实现即时全局 3D 重建。 • 我们引入了一种时间注意力模块,实现了跨体素化时间片的时间感知特征集成。 • 我们提出了掩码体素建模(MBM),一种自监督预训练策略,改善了时间信息聚合并减少了对大量标记数据的依赖。 • 我们在多个具有挑战性的 3D 感知任务上验证了 Event3R,包括密集重建、深度估计和姿态估计,展示了下游性能的大幅提升和实际影响。
II. 相关工作 II. RELATED WORKS 我们回顾了先验工作的两个主要领域:基于 RGB 和基于事件的 3D 重建,这两者构成了我们研究最相关的组成部分。 基于 RGB 的 3D 重建。从 RGB 图像进行密集 3D 重建有着悠久的历史,从经典的优化流水线(运动恢复结构和多视图立体)到现代基于学习的系统。传统工具链 [10, 11] 通过稀疏恢复准确的几何结构。 II. RELATED WORKS 我们回顾了先验工作的两个主要领域:基于 RGB 和基于事件的 3D 重建,这两者构成了我们研究最相关的组成部分。 基于 RGB 的 3D 重建。从 RGB 图像进行密集 3D 重建有着悠久的历史,从经典的优化流水线(运动恢复结构和多视图立体)到现代基于学习的系统。传统工具链 [10, 11] 通过稀疏恢复准确的几何结构。 More recently, a new feed-forward paradigm has emerged that internalizes the SfM+MVS pipeline into a single inference pass: seminal works like DUSt3R [3] and subsequent models (e.g., MASt3R [14], CUT3R [4], VGGT [5]) employ dense correspondence learning, transformer-based global recon- struction, and pose-from-alignment mechanisms to jointly infer camera poses and dense geometry from unconstrained image sets [15]. This family achieves orders-of-magnitude speedups and improved robustness in low-texture scenarios by leveraging learned priors and large training corpora, but it also shifts the bottleneck from iterative geometric solvers to GPU memory, model scaling, and dataset scale/diversity. Crucially, these feed-forward methods are designed for synchronous, frame-based inputs; their reliance on intensity frames limits performance in extreme motion or challenging lighting conditions and leaves open the problem of bringing feed-forward global 3D reconstruction to asynchronous event streams. Event-based 3D Reconstruction. Early works on event- based 3D reconstruction primarily focused on probabilistic fil- tering and geometric mapping. Kim et al. [16] proposed a joint optimization framework using three decoupled probabilistic filters to estimate 6-DoF camera motion, scene intensity gradients, and inverse depth relative to a keyframe. Following this line, Rebecq et al. [17] introduced EMVS, a real-time event-based multi-view stereo pipeline that reconstructs semi- dense depth maps from asynchronous events. Subsequent semi-dense reconstruction and mapping systems such as EVO [18] and Stereo Event Reconstruction [19] further improved geometric accuracy and robustness by tightly coupling depth estimation with pose tracking. While these methods demonstrated the unique potential of event cameras for 3D perception, they remain fundamentally optimization- based, requiring iterative updates and handcrafted motion models that limit scalability and global consistency. To overcome these limitations, recent efforts have extended neural implicit representations to event-driven input. Klenk et al. [20], Hwang et al. [21], and Rudnev et al. [22] concurrently proposed Event-NeRF variants that recover neural radiance fields from event streams given known camera trajectories.
第 3 页
$$p_k \in \{+1, -1\}$$,表示亮度变化的符号。在此基础上,Event-GS [7, 23, 24] 将 3D Gaussian Splatting 适配到异步事件数据,而 IncEventGS [8] 进一步通过增量优化降低了对相机姿态估计的依赖。尽管这些方法成功地将现代神经表示迁移到事件数据,但它们仍然依赖显式或估计的相机姿态以及每场景优化,这阻碍了效率和泛化能力。
最近,一种无姿态且前馈的事件重建趋势正在兴起。EvGGS [6] 等前馈方法首先从事件输入中预测深度和局部高斯点云,然后使用真实相机姿态将这些高斯点云变换到统一坐标系中——这种设计限制了全局重建,并限制了在不同场景间的泛化能力。与此同时,EAG3R [25] 通过引入预训练的事件编码器来增强基于 RGB 的前馈管道在极端条件下的鲁棒性。然而,它既未充分利用事件流固有的时间动态,也未解决大规模标注事件数据集稀缺的问题。这些局限性凸显了对统一前馈框架的需求,该框架能够直接从异步事件数据生成全局一致的 3D 重建。
III. 方法
我们的方法直接从事件流执行前馈 3D 重建。它接收两个或多个($N > 2$)异步事件序列作为输入,并在不依赖迭代优化或外部姿态估计的情况下,在一秒内生成全局对齐的 3D 点云图。为了实现这一目标,我们提出了一种统一且高效的框架,以弥合稀疏、异步事件数据与密集几何重建之间的差距。
具体而言,我们首先将输入事件转换为结构化的时空体素张量,这些张量在保持细粒度时间动态的同时实现了并行处理。随后,采用时间注意力编码器来建模跨时间片依赖并聚合运动线索,从而捕捉局部动态和长程相关性。这些时间丰富特征进一步由基于 DUSt3R 的重建骨干网络处理,以推断具有强几何一致性的密集深度和相机对齐的 3D 点云图。
此外,我们引入了一种掩码体素建模(Masked Bin Modeling, MBM)策略,通过自监督促进时间特征学习,同时结合对比和一致性目标以增强空间连贯性并提高在不同场景中的泛化能力。这些设计共同实现了从事件流中进行高效、可扩展且标签高效的 3D 重建,且完全采用前馈方式。所提出流程的概述如图 3 所示,以下各节将详细介绍每个组件。
A. 事件到体素表示
每个事件 $e_k = (u_k, t_k, p_k)$ 在像素位置 $u_k = (x_k, y_k)$ 处异步触发,带有时间戳 $t_k$ 和极性 $p_k$。为了实现同步处理,我们将短时间窗口 $\Delta t$ 内的连续事件流离散化为大小为 $H \times W \times T$ 的体素网格,其中 $T$ 表示时间片数量。然后,根据每个事件的归一化时间戳,使用三线性插值将其 splat 到相邻的时间片中:
$$E(x, y, n) = \sum_k p_k \max(0, 1 – |n – t^*_k|), \quad (1)$$
其中 $t^*_k = \frac{t_k – t_0}{T \Delta t}$ 表示归一化时间坐标。这种体素化产生了一个密集但保留时间的时空表示,有效地弥合了异步事件流与前馈 3D 重建之间的差距。
B. 时间编码器 (Temporal Encoder, TE)
为了有效利用事件体素数据中的时间动态,我们引入了一个时间编码器,它在保持空间对齐的同时聚合多个时间片的信息。给定输入事件体素 $V \in \mathbb{R}^{B \times T \times H \times W}$,其中 $T$ 为时间片数量,该编码器生成与 DUSt3R 骨干网络兼容的时间丰富特征图。我们注意到 $T$ 被设置为奇数,以确保定义良好的中心时间片,该时间片作为预测最终点云图的时间参考框架。这种设计提供了围绕参考时间片的对称性,并实现了过去和未来事件信息的平衡聚合。
单时间片特征提取。每个时间片 $V_t \in \mathbb{R}^{B \times 1 \times H \times W}$ 被视为类似图像的帧,用于总结短时间、固定持续时间切片内的事件。与传统的 RGB 帧不同,这些时间片在时间上是严格有序的,保留了事件流固有的时间结构。这种排序对于时间推理至关重要,因为它允许编码器以时间一致的方式通过关注连续时间片来建模运动动态和亮度变化。
而不是将每个时间片坍缩为全局特征,我们将其分解为不重叠的空间图块,在降低时间计算成本的同时保留细粒度的几何细节,方法是将每个时间片表示为紧凑的图块令牌集合。形式上,每个时间片 $V_t$ 通过卷积层嵌入:
$$F_t = \text{ConvEmbed}(V_t) \in \mathbb{R}^{B \times C_e \times H_p \times W_p}. \quad (2)$$
这里,$C_e$ 是嵌入维度,$H_p = H/p$ 和 $W_p = W/p$ 表示图块网格的空间维度,其中 $p$ 为图块大小。生成的图块级特征图 $F_t$ 在保持局部空间连贯性的同时,为时间建模提供了高效的表示。
a) 时间注意力:为了捕捉跨时间片的时间信息,我们首先沿时间维度堆叠来自所有 $T$ 个时间片的图块序列:
$$X \in \mathbb{R}^{B \times N_p \times T \times C_e}, \quad N_p = H_p \cdot W_p. \quad (3)$$
然后我们将 $X$ 重塑为 $(B \cdot N_p, T, C_e)$,以便时间编码器独立处理每个空间图块。
第 4 页
对于每个补丁位置 $i$,编码器在 $T$ 个时间片上执行自注意力操作,从剩余可见的时间片中提取内容。与先前针对事件/令牌级自监督预训练的目标 [26] 不同,我们的掩码体素建模(MBM)执行的是体素级掩码,并旨在用于感知几何的表示学习。它显式地强制实施对深度和姿态估计至关重要的体素间时间建模。
令 $X_i = [F_{1i}, \dots, F_{Ti}] \in \mathbb{R}^{T \times C_e}$ 表示第 $i$ 个补丁的时间序列,(4) 中心体素(索引 $t_{\text{center}} = (T + 1)/2$)的聚合特征计算如下: $$F^*_{i,\text{center}} = \text{Attention}(Q = F_{t_{\text{center}}i}, K, V = X_i), \quad (5)$$ 其中 $K, V = X_i$ 是来自所有时间片的键和值。通过这种方式,中心体素特征 $F^*_{i,\text{center}}$ 聚合了其相邻体素的信息,有效地捕捉了体素间的时间动态。时间编码器由 $L$ 层多头自注意力和前馈网络组成。
这些补丁级特征现在丰富了时间上下文,直接传递给空间主干网络以进行进一步处理,从而实现高效且兼容的时空表示学习。
C. 掩码体素建模
为了进一步增强时间特征学习,我们采用了一种掩码体素建模(MBM)策略。给定来自时间编码器的时间聚合特征图 $F^* \in \mathbb{R}^{B \times C_e \times H \times W}$,MBM 随机掩码一个或多个体素的特征,并训练网络以重建被掩码的特征。不同于先前针对事件/令牌级自监督预训练的目标 [26],我们的 MBM 执行体素级掩码,并旨在用于感知几何的表示学习。它显式地强制实施对深度和姿态估计至关重要的体素间时间建模。
令 $M_t \in \{0, 1\}^{B \times 1 \times H \times W}$ 表示应用于体素 $t$ 的二进制掩码,并令 $F^*_{\text{masked}} = F^* \odot (1 – M_t)$ 为掩码特征图。一个轻量级的重建解码器 $D$ 预测掩码体素特征: $$\hat{F}_t = D(F^*_{\text{masked}}), \quad (6)$$ 带有重建损失 $$\mathcal{L}_{\text{MBM}} = \|\hat{F}_t – F^*_t\|_1. \quad (7)$$
该损失既应用于自监督预训练期间,也作为下游微调期间的辅助项。为了进一步强制补丁和体素之间的结构一致性,MBM 包括对比和一致性目标。
令 $f_{i,t}$ 表示体素 $t$ 中补丁 $i$ 的特征。对比损失鼓励来自相邻或增强体素的同一空间位置的特征比来自不同位置的特征更紧密: $$\mathcal{L}_{\text{contrastive}} = – \sum_{i,t} \log \frac{\exp(\text{sim}(f_{i,t}, f_{i,t'})/\tau)}{\sum_{j,t''} \exp(\text{sim}(f_{i,t}, f_{j,t''})/\tau)}, \quad (8)$$
图 3: Event3R 流程概述。(a) 完整流程:异步事件流被转换为时空体素($T$ 个体素),并由时间编码器处理以捕捉运动线索。生成的特征随后通过基于 DUSt3R 主干的空间编码器和解码器,以预测密集、全局对齐的 3D 点图。(b) 时间编码器:跨体素化时间片的自注意力实现了时间特征学习,同时保持空间对齐。(c) 为了进一步增强时间表示,掩码体素建模(MBM)分两个阶段应用:首先,自监督预训练教导模型学习时间线索,并缓解标注事件数据稀缺的问题;其次,MBM 在联合训练期间作为辅助损失,加强时间特征学习。
第 5 页
其中 $f_{i,t'}^+$ 是来自相邻或增强 bin 中相同空间位置的正特征,$\text{sim}(\cdot, \cdot)$ 表示相似度度量(例如余弦相似度),$\tau$ 是温度系数。
一致性损失确保预测在数据增强下的稳定性:
$$ \mathcal{L}_{\text{consistency}} = \sum_{i,t} \| \hat{f}_{i,t} – \hat{f}_{i,t}^{\text{aug}} \|_2^2, \quad (9) $$
其中 $\hat{f}_{i,t}^{\text{aug}}$ 是增强输入的预测特征。
D. 训练损失
我们采用两阶段训练策略,以利用自监督时间特征学习和特定任务的适应性。
在第一阶段,即 MBM 预训练阶段,时间编码器从大量无标签数据中学习 bin 间的动态变化,从而增强所学时间特征的泛化能力。整体预训练目标结合了重建损失、对比损失和一致性损失:
$$ \mathcal{L}_{\text{pretrainMBM-total}} = \mathcal{L}_{\text{MBM}} + \lambda_1 \mathcal{L}_{\text{contrastive}} + \lambda_2 \mathcal{L}_{\text{consistency}}, \quad (10) $$
其中 $\lambda_1$ 和 $\lambda_2$ 平衡辅助损失的贡献。
在第二阶段,联合微调阶段,MBM 作为辅助自监督项保留,同时整个网络(包括 DUSt3R 骨干网络)在 3D 重建任务上进行训练。
为了增强时间特征学习,MBM 随机掩码一个或多个时间 bin,并训练一个轻量级重建解码器,以从可见 bin 中预测缺失特征。MBM 损失定义为 L1 重建损失,并辅以空间 patch 上的对比损失以及输入增强下的一致性损失。对比损失使用温度 $\tau = 0.1$,辅助损失权重设置为 $\lambda_1 = 1.0$ 和 $\lambda_2 = 1.0$。在联合微调期间,MBM 作为辅助损失保留,权重为 $\alpha$,以在优化主要 DUSt3R 重建损失的同时强化对时间依赖关系的建模。
这种两阶段策略允许网络首先从无标签数据中构建鲁棒的时间表示,然后在保持结构和时间一致性的同时,有效地将其适应到特定任务的目标上。
E. 下游应用
Event3R 的输出是一个全局对齐的 3D 点图,可直接用于多帧 3D 重建、深度估计和相机位姿估计等下游任务。对于这些应用,我们采用与 DUSt3R 相同的后处理和全局对齐程序,利用预测点图提供的丰富 3D 内容和像素到 3D 的对应关系。重要的是,所有深度、位姿和点坐标的预测都对应于输入事件体素网格的中心体素 bin,从而确保帧间的时间一致性。这使得 Event3R 能够在无需额外修改的情况下支持标准下游任务。
IV. 实验
据我们所知,Event3R 是首个仅基于事件、前馈式的框架,能够执行全局一致的 3D 重建,因此与先前工作的直接比较并不简单。因此,我们在多个 3D 感知任务上对我们的方法进行了全面评估,包括深度估计、相机位姿估计和 3D 重建。对于每个任务,我们在可能的情况下与代表性的最先进基线进行比较,或者在没有直接对应方法的情况下提供定性分析。
A. 实验设置
a) 实现细节:我们在时间编码器和空间编码器/解码器中使用 ViT-Base 模型。空间编码器和解码器使用来自 DUSt3R 的预训练权重进行初始化。我们将事件块长度固定为 50 ms,并将其划分为 $T$ 个时间 bin。虽然较大的 $T$ 提供了更细的时间分辨率,但它增加了内存和计算成本。在平衡性能和效率后,我们选择 $T=5$。为了有效地捕捉 bin 间的依赖关系,时间编码器在大小为 $8 \times 8$ 的非重叠空间 patch 上运行。每个 patch 通过卷积层嵌入到 32 维特征空间中。时间注意力在 2 层上执行,具有 4 个注意力头和 4.0 的 MLP 比率,且不应用随机深度。
联合训练目标为
$$ \mathcal{L}_{\text{joint}} = \mathcal{L}_{\text{regr}} + \mathcal{L}_{\text{conf}} + \alpha \mathcal{L}_{\text{MBM}} + \lambda_1 \mathcal{L}_{\text{contrastive}} + \lambda_2 \mathcal{L}_{\text{consistency}}, \quad (11) $$
其中 $\mathcal{L}_{\text{regr}}$ 和 $\mathcal{L}_{\text{conf}}$ 表示来自 DUSt3R 骨干网络的 3D 回归和置信度感知损失。其余项是辅助目标:$\mathcal{L}_{\text{MBM}}$ 是用于自监督时间特征学习的掩码 bin 建模损失,$\mathcal{L}_{\text{contrastive}}$ 强制跨视图特征对齐,$\mathcal{L}_{\text{consistency}}$ 鼓励时间连贯性。超参数 $\alpha, \lambda_1, \lambda_2$ 平衡辅助目标的贡献。
我们采用两阶段训练策略。在第一阶段,使用 Adam 优化器进行 300 个 epoch 的 MBM 预训练,学习率为 $1 \times 10^{-4}$,权重衰减为 0.05,批量大小为 4,在 8 块 NVIDIA RTX A100 GPU 上运行。在第二阶段,整个网络在事件-深度-位姿配对数据集上进行联合微调,持续 300 个 epoch,使用 Adam 优化器,初始学习率为 $5 \times 10^{-5}$ 并采用余弦衰减调度。应用最大范数为 1.0 的梯度裁剪以保证稳定性。整个训练过程在 8 块 GPU 上大约需要 7 天。
b) 数据集:为了训练和评估所提出的方法,我们采用利用合成数据和真实世界事件数据的两阶段训练和评估策略。
在第一阶段,网络在多样化的合成和无标签真实世界事件数据集上使用提出的掩码体素建模(MBM)策略进行预训练。具体而言,我们利用大规模数据集,即 MatrixCity [27] 和 TUM-VIE [28]。由于 MatrixCity 不包含事件流,我们使用 ESIM 模拟器对其进行模拟
第 6 页
表 I:基于事件的深度估计结果。在 TartanAir 和 MVSEC 户外数据集上,将我们的方法与最先进的基于事件的深度估计方法进行比较。
| Method | TartanAir | | MVSEC | | | :— | :— | :— | :— | :— | | | Abs Rel ↓ | δ < 1.25 ↑ | Abs Rel ↓ | δ < 1.25 ↑ | | Ours | 0.0514 | 0.9700 | 0.1805 | 0.7838 | | EvGGS | 0.4553 | 0.5420 | 0.1972 | 0.7138 | | E2Depth | 0.7923 | 0.2484 | 0.3763 | 0.5073 | | DepthAnyEvent | 0.2751 | 0.6093 | 0.4100 | 0.3783 | | DERD-Net | 0.5651 | 0.2488 | 0.4367 | 0.2288 | | EReFormer | 0.2931 | 0.5323 | 0.4986 | 0.3799 |
表 II:基于事件的姿态估计结果(ATE,cm)。在 TartanAir 数据集上,将我们的方法与最先进的基于事件的姿态估计方法进行比较。S1:Hospital Easy P004,S2:Hospital Easy P008,S3:Hospital Easy P011,S4:Office Hard P006,S5:Office Easy P000。“-”表示该场景实验失败。
| Method | S1 | S2 | S3 | S4 | S5 | | :— | :— | :— | :— | :— | :— | | Ours | 0.402 | 0.152 | 0.116 | 0.545 | 0.293 | | DEVO | 1.25 | 0.457 | 0.891 | 2.02 | 0.861 | | E2Vid + Colmap | – | 0.550 | 0.828 | 1.87 | 1.18 | | IncEventGS | 1.16 | 0.307 | 0.261 | 1.56 | 1.03 |
[29] 基于可用的 RGB 序列。相比之下,TUM-VIE 提供真实世界的事件数据,尽管没有对齐的深度监督。这些数据集共同涵盖了合成和真实世界的环境,以及室内和室外场景,使模型能够在微调下游任务之前,学习跨不同事件域的泛化时空表示。
在第二阶段,网络在 TartanAir 和 MVSEC [30] 数据集上进行联合训练。与 MatrixCity 类似,TartanAir 的事件流是使用 ESIM 模拟器从可用的 RGB 序列模拟生成的,同时保留提供的真实深度和相机姿态。
C. 相机姿态估计
我们在 TartanAir 基准测试上使用绝对轨迹误差(ATE)计算来评估受控条件下的相机姿态估计,并使用 Evo 评估工具。定量结果报告在表 II 中。Event3R 与 IncEventGS [8]、DEVO [34] 以及两阶段 e2vid [35]+COLMAP [10] 基于事件的姿态估计流水线进行了比较。如表 II 所示,Event3R 在所有测试序列中始终取得最低的 ATE,表明其轨迹估计更准确、更稳定。这些增益突显了我们全局对齐的点图表示和 Temporal Encoder 从异步事件流中提取可靠运动线索的有效性。
B. 单目深度估计
我们在 TartanAirEvent 和 MVSEC 数据集上评估单目深度估计,使用与 DUSt3R 和 CUT3R [4] 相同的标准指标,即绝对相对误差(AbsRel ↓)和阈值精度 δ < 1.25(↑)。所有评估均使用官方 CUT3R 代码进行,以确保结果的一致性和可比性。
表 I 中的定量结果表明,Event3R 始终优于先前的基于事件的深度估计方法 [6, 31]–[33]。我们的方法实现了显著更低的 AbsRel 和明显更高的细粒度精度,表明从纯事件驱动线索中获得了更强的几何重建能力和更可靠的深度预测。这些改进源于我们全局对齐的点图表示与 Temporal Encoder 的结合,这使得时空聚合比现有基线更加稳定和连贯。
图 4 中的定性比较进一步证实了这些发现。Event3R 产生了更清晰的物体边界、更干净的平面区域和更全局一致的场景结构,而竞争方法通常表现出深度不连续、局部伪影或尺度不一致。总体而言,结果突显了 Event3R 在不同环境中的鲁棒性和泛化能力,验证了我们仅基于事件的 3D 重建框架的有效性。
D. 3D 重建
训练完成后,我们在来自不同数据集的几对两视图以及多视图序列(N > 2)上进行推理,并对估计的姿态进行全局对齐以评估生成的 3D 重建结果。我们展示了两视图和多视图(例如五视图)设置的定性结果。由于篇幅限制,定性结果提供在补充视频中。我们还在表 III 中展示了 3D 重建的定量结果。由于 Event3R 是一种新的前馈式基于事件的 3D 重建方法,因此没有直接的基线可供比较。为了进一步评估我们的方法,我们将其与 IncEventGS 和一个自实现的两阶段流水线(DepthAnything 后接真实姿态投影)进行比较。结果进一步证明了我们方法的优势。
表 III:3D 重建定量结果。
| Method | MVSEC | | | TartanAir | | | | :— | :— | :— | :— | :— | :— | :— | | | Acc ↓ | Comp↓ | NC ↑ | Acc ↓ | Comp↓ | NC ↑ | | Ours | 0.4915 | 0.6132 | 0.7569 | 0.1097 | 0.1382 | 0.8886 | | DepthAnyEvent | 0.5342 | 0.7539 | 0.6195 | 0.5110 | 0.5764 | 0.6576 | | E2Depth | 0.7987 | 0.6532 | 0.6332 | 0.6891 | 0.4952 | 0.4950 | | IncEventGS | 0.6879 | 0.6231 | 0.5332 | 0.3350 | 0.3609 | 0.6236 |
MVSEC 提供由安装在汽车和六旋翼飞行器上的 DAVIS346 相机在户外和室内环境中分别捕获的真实世界事件数据记录。这种设置使我们能够从泛化能力和现实适用性两个方面全面评估所提出的方法。
E. 消融实验
我们评估了 Temporal Encoder 和 Masked Bin Modeling (MBM)——包括其自监督预训练以及辅助对比和一致性
第 7 页
一致性损失——在深度和姿态估计上。移除时间编码器(即直接将体素化事件输入空间编码器,而不进行时间聚合)会导致深度(AbsRel:0.0514 → 0.1187)和姿态(ATE:0.1524 → 0.4381 cm)性能显著下降,这证实了为了捕捉细粒度运动线索,进行块级时间聚合的必要性。
MBM 预训练显示出特别显著的影响:禁用预训练会导致深度和姿态误差显著增加(AbsRel:0.0514 → 0.0825,ATE:0.1524 → 0.3095 cm),而进一步消融其对比或一致性目标会进一步降低性能。这些结果突显了 MBM 不仅在模块的时间特征学习期间,而且提供了鲁棒的初始化,大大减少了对标注数据的依赖。
总体而言,TE 和 MBM——包括预训练和辅助目标——共同实现了鲁棒且时间一致的时空表示,从而实现了更准确的事件驱动深度和姿态估计。
V. 结论
我们提出了 Event3R,这是一种新的仅基于事件的前馈框架,用于从异步事件流中进行全局一致的 3D 重建。通过将块级时间编码器与空间骨干网络相结合,我们的方法捕捉了编码细粒度
第 8 页
表 IV:Event3R 各组件的消融研究。 [15] W. Zhang, Y. Wu, S. Li 等,“前馈 3D 重建综述:从 DUSt3R 到 VGGT,” arXiv 预印本 arXiv:2507.08448, TE 和 MBM 都至关重要,尤其是自监督预训练—— 2025。 禁用 MBM 预训练或其对比/一致性目标会导致性能下降。 [16] H. Kim, S. Leutenegger, 和 A. J. Davison,“使用事件相机的实时 3D 重建和 6-DoF 跟踪,”在欧洲 计算机视觉会议 (ECCV) 上,2016 年,第 349–364 页。 模型 AbsRel ↓ δ < 1.25 ↑ ATE ↓ [17] H. Rebecq, G. Gallego, E. Mueggler 等,“EMVS:基于事件的 完整 Event3R 0.0514 0.970 0.1524 多视图立体视觉——使用事件相机进行实时 3D 重建,”《计算机视觉国际期刊》,第 126 卷,第 12 期,第 无 TE 0.1187 0.892 0.4381 1394–1414 页,2018 年。 无 MBM 预训练 0.0825 0.925 0.3095 [18] H. Rebecq, T. Horstschaefer, G. Gallego 等,“EVO:一种基于几何的 MBM 无对比 0.0621 0.961 0.1792 基于事件的 6-DOF 并行跟踪与建地图方法,”《IEEE 机器人与自动化快报》,第 2 卷,第 2 期,第 593– MBM 无一致性 0.0598 0.965 0.1675 600 页,2017 年。 运动和几何线索。掩码体素建模 (MBM) 进一步 [19] Y. Zhou, G. Gallego, H. Rebecq 等,“半密集 3D 重建 加强了时间学习,实现了自监督预训练,减少了对标注数据的依赖,并强制 使用立体事件相机,”在欧洲计算机视觉会议 (ECCV) 上, 体素间的结构一致性。在合成和真实世界数据集上的大量实验表明,Event3R 产生了 2018 年,第 235–251 页。 更清晰的深度图、更连贯的 3D 点云和更可靠的相机轨迹,验证了其鲁棒性和 [20] S. Klenk, L. Koestler, D. Scaramuzza 等,“E-NeRF:来自移动事件相机的神经辐射 泛化能力。Event3R 实现了高效、可扩展且无需标注的基于事件传感器的 3D 感知,在 场,”《IEEE 机器人与自动化快报》,第 8 卷,第 3 期,第 1587–1594 页,2023 年。 机器人、自主导航和实时场景理解方面具有广泛的应用前景。 [21] I. Hwang, J. Kim, 和 Y. M. Kim,“EV-NeRF:基于事件的神经辐射场,”在 IEEE/CVF 冬季应用 计算机视觉会议 (WACV) 论文集上,2023 年,第 837–847 页。 参考文献 [22] V. Rudnev, M. Elgharib, C. Theobalt 等,“EventNeRF:来自单个彩色事件相机的神经 辐射场,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上, [1] B. Mildenhall, P. P. Srinivasan, M. Tancik 等,“NeRF:将 2023 年,第 4992–5002 页。 场景表示为神经辐射场以进行视图合成,”《ACM 通讯》,第 65 卷,第 1 期,第 99–106 页,2021 年。 [23] T. Yura, A. Mirzaei, 和 I. Gilitschenski,“EventSplat:来自移动事件相机的 3D 高斯 [2] B. Kerbl, G. Kopanas, T. Leimk¨uhler 等,“用于实时辐射场渲染的 3D 高斯溅射,”《ACM 图形学事务》, 溅射用于实时渲染,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上, 第 42 卷,第 4 期,第 1–14 页,2023 年。 2025 年,第 26 876–26 886 页。 [3] S. Wang, V. Leroy, Y. Cabon 等,“Dust3R:简化几何 3D 视觉,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) [24] H. Han, J. Li, H. Wei 等,“Event-3DGS:基于事件的 3D 重建 论文集上,2024 年,第 20 697–20 709 页。 使用 3D 高斯溅射,”《神经信息处理系统进展》(NeurIPS),第 37 卷,第 128 139–128 159 页,2024 年。 [4] Q. Wang, Y. Zhang, A. Holynski 等,“具有持久状态连续 3D 感知 [25] X. Wu, Y. Yu, X. Lyu 等,“EAG3R:用于动态和极端光照场景的事件增强 3D 几何 模型,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上,2025 年,第 估计,”《神经信息处理系统进展》(NeurIPS),2025 年。 10 510–10 522 页。 [26] S. Klenk, D. Bonello, L. Koestler 等,“掩码事件建模: [5] J. Wang, M. Chen, N. Karaev 等,“VGGT:视觉几何接地 基于事件的自监督预训练,”在 IEEE/CVF 冬季应用计算机视觉会议 (WACV) 论文集上, 变换器,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上,2025 年,第 5294–5306 页。 2024 年,第 2378–2388 页。 [6] J. Wang, J. He, Z. Zhang 等,“EvGGS:用于基于事件的泛化高斯溅射的协同学习 [27] Y. Li, L. Jiang, L. Xu 等,“MatrixCity:一个用于城市规模神经渲染及更多的大规模城市数据集 框架,”arXiv 预印本 arXiv:2405.14959,2024 年。 [28] S. Klenk, J. Chui, N. Demmel 等,“TUM-VIE:TUM 立体 [7] T. Xiong, J. Wu, B. He, C. Fermuller, Y. Aloimonos, H. Huang, 和 视觉-惯性事件数据集,”在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上, C. Metzler,“Event3dgs:用于高速机器人自运动估计的基于事件的 3D 高斯溅射,”在机器人学习第 8 届年会上。 2021 年,第 8601–8608 页。 [8] J. Huang, C. Dong, X. Chen 等,“IncEventGS:来自单个事件相机的无姿态高斯溅射,”在 IEEE/CVF [29] D. Gehrig, M. Gehrig, J. Hidalgo-Carri´o 等,“视频转事件: 计算机视觉与模式识别会议 (CVPR) 论文集上,2025 年, 回收视频数据集用于事件相机,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上, 第 26 933–26 942 页。 2020 年。 [9] L. Cui, H. Liu, M. Liu 等,“PEOD:用于挑战性条件下目标检测的像素对齐事件-rgb [30] A. Z. Zhu, D. Thakur, T. ¨Ozaslan 等,“多车辆立体事件 基准,”arXiv 预印本 arXiv:2511.08140,2025 年。 相机数据集:一个用于 3D 感知的事件相机数据集,”《IEEE 机器人与自动化快报》,第 3 卷,第 3 期,第 2032–2039 页,2018 年。 [10] J. L. Schonberger 和 J.-M. Frahm,“重新审视运动恢复结构,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) [31] J. Hidalgo-Carri´o, D. Gehrig, 和 D. Scaramuzza,“从事件中学习单目密集深度,”在第三届 3D 视觉国际会议 论文集上,2016 年,第 4104–4113 页。 (3DV) 上,2020 年,第 534–542 页。 [11] Z. Xun, J. Huang, Z. Li 等,“CREPES:协作相对姿态估计系统,”在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) [32] D. Hitzges, S. Ghosh, 和 G. Gallego,“DERD-Net:从基于事件的射线密度中学习深度,”在《神经信息处理系统进展》(NeurIPS) 上, 上,2023 年,第 5274–5281 页。 2025 年。 [12] J. T. Barron, B. Mildenhall, M. Tancik 等,“Mip-NeRF:用于抗锯齿神经辐射场的多尺度 [33] X. Liu, J. Li, X. Fan 等,“基于事件的单目密集深度估计与循环变换器,”arXiv 预印本 arXiv:2212.02791, 表示,”在 IEEE/CVF 计算机视觉国际会议 (ICCV) 论文集上, 2022 年。 2021 年,第 5855–5864 页。 [34] S. Klenk, M. Motzet, L. Koestler 等,“深度事件视觉里程计,”在第三届 3D 视觉国际会议 (3DV) 上,2024 年,第 739–749 页。 [13] Y. Fu, S. Liu, A. Kulkarni 等,“无需 COLMAP 的 3D 高斯溅射,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) [35] H. Rebecq, R. Ranftl, V. Koltun 等,“事件转视频:将现代计算机视觉引入事件相机,”在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上, 论文集上,2024 年,第 20 796–20 805 页。 [14] V. Leroy, Y. Cabon, 和 J. Revaud,“使用 MASt3R 将图像匹配接地于 3D,”在欧洲计算机视觉会议 (ECCV) 上, 2024 年,第 71–91 页。
第 9 页
Event3R:通过时空特征聚合从事件相机实现异步到全局的3D重建 补充材料
视图 1 视图 2
图 5:全局多视角3D重建结果。我们展示了 Event3R 从多个视角(N = 5)重建全局一致3D场景的能力。估计的相机轨迹以视锥体的形式与点云一起可视化,展示了准确的全局对齐。
置信度图,然后通过最小化加权3D重投影误差的全局优化进行融合。这联合恢复了整个序列的绝对相机位姿、内参和深度图。重建结果如图 5 所示,展示了所有视角间准确的全局对齐和一致的几何结构。
VI. 额外的定性3D重建
在补充材料中,我们包含了一组扩展的定性结果,以说明我们的方法在不同视角配置下的3D重建性能。我们为双视角设置和多视角序列提供了额外的可视化。
为了可视化,重建的点云使用对应于中心体素bin的RGB图像进行着色。在训练或推理过程中不涉及任何RGB数据。
a) 双视角重建:在双视角设置中,我们的 Event3R 模型预测的点图已经表示在一致的全局坐标系中,因此不需要额外的后处理或全局对齐。合成数据集上的重建结果如图 6 所示。
b) 多视角处理:为了仅使用事件体素网格从 N 个视角重建一致的3D场景,我们遵循 DUSt3R 的全局对齐框架。我们构建一个连通图,其中每个节点对应一个视角,每条边表示具有足够重叠的一对视角。对于每条边,网络预测成对的点图,
第 10 页
视角 1 视角 2
图 6:在合成数据集上的双视图 3D 重建定性结果。我们从两个不同的视角(视角 1 和视角 2)可视化重建的点云。出于可视化目的,点云使用真实 RGB 图像进行着色。