快速导读:GeoUP将VGGT的重建导向潜在表示适配到标定流式多相机驾驶场景,通过时序-视角注意力分解与raymap注入,以单一架构支持深度估计、3D检测与语义占用预测。
GeoUP的核心主张是:深度估计、3D检测与语义占用预测并非三个独立问题,而是同一3D场景在表面级、实例级与体素级的三层读出。现有相机3D感知框架大多以语义识别预训练骨干(如DINOv2)为起点,几何信息只能由下游任务模块各自引入,共享表示缺乏显式度量几何与多视角时序一致性。GeoUP反其道而行,以多图重建基础模型VGGT为骨干,将其重建导向的潜在表示适配到标定流式多相机驾驶场景,让几何成为表示的基座而非下游的附加物。
英文题目:Geometry-Grounded Unified 3D Perception for Autonomous Driving
论文出处:arXiv 每日论文精选 · arXiv:2608.13147
原始论文:PDF / 论文页面
这篇论文解决什么问题?
在自动驾驶的相机3D感知中,深度估计、3D目标检测与语义占用预测长期被当作独立任务分别建模。深度估计关注表面几何,检测关注实例级边界框,占用预测关注体素级语义与占据状态。尽管三者在几何上高度相关,现有方法却各自在任务特定管线中引入几何先验,共享骨干只负责语义特征提取。这种割裂带来两个后果:一是几何一致性无法在任务间共享,二是每个任务都需要重复设计几何建模模块。
核心创新
- 提出GeoUP统一框架,将VGGT重建导向潜在表示适配到自动驾驶,单一架构支持深度、检测与占用三个层级感知任务
- 引入时序-视角注意力分解,替代VGGT全局交叉注意力,区分时序连续性与跨视角几何对应
- 注入标定感知的Plücker raymap编码,为表示提供度量尺度与相机几何先验
- 提出跨nuScenes、Argoverse 2、Waymo、KITTI、DDAD的联合多任务多数据集训练策略,利用异构标注增强几何基座表示
方法概览
GeoUP以VGGT为骨干,将图像patch token与Plücker raymap嵌入及camera token结合形成几何感知token,经自注意力、时序注意力、视角注意力分解的Transformer层处理后,由DPT深度头、RayDN检测头、OPUS-V2占用头及辅助相机位姿头解码。
- GeoUP以VGGT为骨干,保留其重建导向的潜在表示与DINOv2语义特征,但将VGGT的全局交叉注意力替换为分解注意力,以适应流式多相机驾驶输入。
- 输入侧将图像patch token与Plücker raymap嵌入及camera token结合,形成几何感知token。raymap由相机内参与位姿导出,为每个patch中心编码6D Plücker射线,提供度量尺度与相机几何先验。
- Transformer层采用自注意力、时序注意力、视角注意力的分解结构:自注意力在单帧图像内建模,时序注意力跨同一相机的连续帧建模运动连续性,视角注意力跨同一时刻的不同相机建模几何对应。
- 输出侧由DPT深度头、RayDN检测头、OPUS-V2占用头分别解码表面、实例与体素信息,camera token经辅助头预测相机位姿。
- 训练采用跨nuScenes、Argoverse 2、Waymo、KITTI、DDAD的联合多任务多数据集策略,利用异构标注增强几何基座表示。
逐图理解论文
失败案例与直觉

该图对比GeoUP与RayDN在连续帧上的3D检测结果,红色虚线区域标出BEV中的车辆区域。重点观察GeoUP对静止车辆的稳定预测与对运动车辆的连续检测能力。
研究缺口

该图说明分解注意力的三种模式:自注意力在单帧内、时序注意力跨同相机帧、视角注意力跨同时刻相机。重点观察三种注意力各自作用的token范围,理解其如何替代VGGT的全局交叉注意力。
核心贡献与验证方式

该图展示GeoUP整体管线:流式多视角输入经raymap嵌入与camera token结合形成几何感知token,经分解注意力骨干处理后由三个任务头解码。重点观察raymap注入位置与三个输出分支的共享骨干结构。
最强结论

该图展示从预测深度重建的点云图,证明GeoUP保留了VGGT的3D重建能力。重点观察点云的结构完整性与几何一致性,这是几何基座表示的直接证据。
实验如何设计?
- 3D检测主实验在nuScenes、Argoverse 2、Waymo上进行,其中Waymo使用20%训练子集。
- 语义占用预测在Occ3D-nuScenes上评估,对比OPUS-V2。
- 深度估计在KITTI与DDAD上评估,对比StreamVGGT、DVGT、MapAnything等方法。
- 规划迁移实验在NAVSIMv2上进行,将GeoUP作为DriveSuprim的视觉骨干,对比原DA-ViT-L骨干。
- 消融覆盖骨干适配(全局/视角/时序注意力、Plücker ray)、输入帧数(1/2/4/8帧)、骨干配置(DINOv2-L/T、VGGT-12/24、GeoUP)与多任务联合训练。
关键结果与论文证据
- nuScenes检测上GeoUP达到57.9 mAP / 64.4 NDS,GeoUP†多数据集模型达59.2 mAP / 65.3 NDS,超越RayDN 3.8 mAP(第8页)。
- Argoverse 2上GeoUP†在960×640分辨率下超越1536×1536的Far3D,达43.6 mAP / 33.8 CDS(第8页)。
- Occ3D-nuScenes占用预测GeoUP†达42.3 mIoU / 47.0 RayIoU,超越OPUS-V2-L‡(第9页)。
- 深度估计KITTI上GeoUP达0.072 Abs Rel / 93.8 δ<1.25,DDAD上0.114 Abs Rel / 89.5 δ<1.25(第10页)。
- NAVSIMv2规划迁移中GeoUP EPDMS达87.9/91.4(original/corrected),超越DA-ViT-L的87.1/90.5(第10页)。
- 骨干适配消融显示全局注意力仅53.8 mAP/37.3 mIoU,加入时序、视角注意力与Plücker后达56.4 mAP/40.3 mIoU(第11页)。
- 帧数消融显示4帧temporal heads达56.5 mAP/41.5 mIoU,8帧收益饱和(第11页)。
- 效率分析显示GeoUP 4帧FPS仅0.81,骨干占87.8%延迟(第25页)。
阅读时需要注意
- 视觉几何骨干计算量大,模型规模大、推理速度慢,4帧FPS仅0.81,骨干占87.8%延迟。
- 感知头仍为任务特定设计,未实现统一解码器。
- GeoUP†多数据集模型训练epoch为单数据集两倍,batch size 64,与单数据集设置不完全对等。
- 深度估计中GeoUP单数据集模型在DDAD上优于GeoUP†(0.114 vs 0.123 Abs Rel),多数据集训练并非在所有深度指标上一致提升。
关联工作
- VGGT是GeoUP的骨干基础,提供重建导向的多图几何潜在表示与DINOv2语义特征。
- RayDN提供检测头设计,是nuScenes与Argoverse 2上的主要对比方法。
- OPUS-V2提供占用头设计,是Occ3D-nuScenes上的主要对比方法。
- StreamVGGT、DVGT、MapAnything是深度估计对比方法,分别代表流式视觉几何Transformer、VGGT风格驾驶适配与通用前馈度量重建。
- DriveSuprim是NAVSIMv2规划迁移实验中使用的规划解码器框架,其原骨干DA-ViT-L基于Depth Anything预训练。