几何基座统一3D感知:GeoUP如何让一个骨干同时支撑深度、检测与占用

快速导读:GeoUP将VGGT的重建导向潜在表示适配到标定流式多相机驾驶场景,通过时序-视角注意力分解与raymap注入,以单一架构支持深度估计、3D检测与语义占用预测。

GeoUP的核心主张是:深度估计、3D检测与语义占用预测并非三个独立问题,而是同一3D场景在表面级、实例级与体素级的三层读出。现有相机3D感知框架大多以语义识别预训练骨干(如DINOv2)为起点,几何信息只能由下游任务模块各自引入,共享表示缺乏显式度量几何与多视角时序一致性。GeoUP反其道而行,以多图重建基础模型VGGT为骨干,将其重建导向的潜在表示适配到标定流式多相机驾驶场景,让几何成为表示的基座而非下游的附加物。

英文题目:Geometry-Grounded Unified 3D Perception for Autonomous Driving

论文出处:arXiv 每日论文精选 · arXiv:2608.13147

原始论文:PDF / 论文页面

这篇论文解决什么问题?

在自动驾驶的相机3D感知中,深度估计、3D目标检测与语义占用预测长期被当作独立任务分别建模。深度估计关注表面几何,检测关注实例级边界框,占用预测关注体素级语义与占据状态。尽管三者在几何上高度相关,现有方法却各自在任务特定管线中引入几何先验,共享骨干只负责语义特征提取。这种割裂带来两个后果:一是几何一致性无法在任务间共享,二是每个任务都需要重复设计几何建模模块。

核心创新

  • 提出GeoUP统一框架,将VGGT重建导向潜在表示适配到自动驾驶,单一架构支持深度、检测与占用三个层级感知任务
  • 引入时序-视角注意力分解,替代VGGT全局交叉注意力,区分时序连续性与跨视角几何对应
  • 注入标定感知的Plücker raymap编码,为表示提供度量尺度与相机几何先验
  • 提出跨nuScenes、Argoverse 2、Waymo、KITTI、DDAD的联合多任务多数据集训练策略,利用异构标注增强几何基座表示

方法概览

GeoUP以VGGT为骨干,将图像patch token与Plücker raymap嵌入及camera token结合形成几何感知token,经自注意力、时序注意力、视角注意力分解的Transformer层处理后,由DPT深度头、RayDN检测头、OPUS-V2占用头及辅助相机位姿头解码。

  • GeoUP以VGGT为骨干,保留其重建导向的潜在表示与DINOv2语义特征,但将VGGT的全局交叉注意力替换为分解注意力,以适应流式多相机驾驶输入。
  • 输入侧将图像patch token与Plücker raymap嵌入及camera token结合,形成几何感知token。raymap由相机内参与位姿导出,为每个patch中心编码6D Plücker射线,提供度量尺度与相机几何先验。
  • Transformer层采用自注意力、时序注意力、视角注意力的分解结构:自注意力在单帧图像内建模,时序注意力跨同一相机的连续帧建模运动连续性,视角注意力跨同一时刻的不同相机建模几何对应。
  • 输出侧由DPT深度头、RayDN检测头、OPUS-V2占用头分别解码表面、实例与体素信息,camera token经辅助头预测相机位姿。
  • 训练采用跨nuScenes、Argoverse 2、Waymo、KITTI、DDAD的联合多任务多数据集策略,利用异构标注增强几何基座表示。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 4: Qualitative comparison of 3D detection results over consecutive frames. The red dashed regions indicate the corresponding vehicle areas in BEV, and the GT BEV region is linked to the associated vehicles in the front-camera image. Compared with RayDN [36], GeoUP maintains more stable predictions for the static vehicle and continuously detects the moving vehicle across all four frames.

该图对比GeoUP与RayDN在连续帧上的3D检测结果,红色虚线区域标出BEV中的车辆区域。重点观察GeoUP对静止车辆的稳定预测与对运动车辆的连续检测能力。

研究缺口

研究缺口
Figure 3: Illustration of the factorized attention in GeoUP Transformer layers. GeoUP applies self-attention within each image, temporal attention across frames from the same camera, and view attention across cameras at the same timestamp.

该图说明分解注意力的三种模式:自注意力在单帧内、时序注意力跨同相机帧、视角注意力跨同时刻相机。重点观察三种注意力各自作用的token范围,理解其如何替代VGGT的全局交叉注意力。

核心贡献与验证方式

核心贡献与验证方式
Figure 2: Overall pipeline of GeoUP. Given streaming multi-view inputs, GeoUP con- structs geometry-aware tokens Z by combining image patch tokens X, raymap embeddings R, and camera tokens C. The tokens are processed by a factorized backbone with self, tem- poral, and view attention. The output patch tokens are used for depth estimation, 3D object detection, and occupancy prediction, while camera tokens are decoded for auxiliary camera pose prediction.

该图展示GeoUP整体管线:流式多视角输入经raymap嵌入与camera token结合形成几何感知token,经分解注意力骨干处理后由三个任务头解码。重点观察raymap注入位置与三个输出分支的共享骨干结构。

最强结论

最强结论
Figure 6: Point maps reconstructed from the predicted depth. GeoUP preserves the 3D reconstruction capability inherited from VGGT [63].

该图展示从预测深度重建的点云图,证明GeoUP保留了VGGT的3D重建能力。重点观察点云的结构完整性与几何一致性,这是几何基座表示的直接证据。

实验如何设计?

  • 3D检测主实验在nuScenes、Argoverse 2、Waymo上进行,其中Waymo使用20%训练子集。
  • 语义占用预测在Occ3D-nuScenes上评估,对比OPUS-V2。
  • 深度估计在KITTI与DDAD上评估,对比StreamVGGT、DVGT、MapAnything等方法。
  • 规划迁移实验在NAVSIMv2上进行,将GeoUP作为DriveSuprim的视觉骨干,对比原DA-ViT-L骨干。
  • 消融覆盖骨干适配(全局/视角/时序注意力、Plücker ray)、输入帧数(1/2/4/8帧)、骨干配置(DINOv2-L/T、VGGT-12/24、GeoUP)与多任务联合训练。

关键结果与论文证据

  • nuScenes检测上GeoUP达到57.9 mAP / 64.4 NDS,GeoUP†多数据集模型达59.2 mAP / 65.3 NDS,超越RayDN 3.8 mAP(第8页)。
  • Argoverse 2上GeoUP†在960×640分辨率下超越1536×1536的Far3D,达43.6 mAP / 33.8 CDS(第8页)。
  • Occ3D-nuScenes占用预测GeoUP†达42.3 mIoU / 47.0 RayIoU,超越OPUS-V2-L‡(第9页)。
  • 深度估计KITTI上GeoUP达0.072 Abs Rel / 93.8 δ<1.25,DDAD上0.114 Abs Rel / 89.5 δ<1.25(第10页)。
  • NAVSIMv2规划迁移中GeoUP EPDMS达87.9/91.4(original/corrected),超越DA-ViT-L的87.1/90.5(第10页)。
  • 骨干适配消融显示全局注意力仅53.8 mAP/37.3 mIoU,加入时序、视角注意力与Plücker后达56.4 mAP/40.3 mIoU(第11页)。
  • 帧数消融显示4帧temporal heads达56.5 mAP/41.5 mIoU,8帧收益饱和(第11页)。
  • 效率分析显示GeoUP 4帧FPS仅0.81,骨干占87.8%延迟(第25页)。

阅读时需要注意

  • 视觉几何骨干计算量大,模型规模大、推理速度慢,4帧FPS仅0.81,骨干占87.8%延迟。
  • 感知头仍为任务特定设计,未实现统一解码器。
  • GeoUP†多数据集模型训练epoch为单数据集两倍,batch size 64,与单数据集设置不完全对等。
  • 深度估计中GeoUP单数据集模型在DDAD上优于GeoUP†(0.114 vs 0.123 Abs Rel),多数据集训练并非在所有深度指标上一致提升。

关联工作

  • VGGT是GeoUP的骨干基础,提供重建导向的多图几何潜在表示与DINOv2语义特征。
  • RayDN提供检测头设计,是nuScenes与Argoverse 2上的主要对比方法。
  • OPUS-V2提供占用头设计,是Occ3D-nuScenes上的主要对比方法。
  • StreamVGGT、DVGT、MapAnything是深度估计对比方法,分别代表流式视觉几何Transformer、VGGT风格驾驶适配与通用前馈度量重建。
  • DriveSuprim是NAVSIMv2规划迁移实验中使用的规划解码器框架,其原骨干DA-ViT-L基于Depth Anything预训练。

发表评论