VGOcc:视觉-几何高斯驱动的高效3D驾驶占据预测

三分钟导读:VGOcc通过从冻结的基础模型中提取互补的视觉和几何线索,提出了一种名为Visual-Geometric Gaussians的新表示,用于以视觉为中心的3D语义占据预测。

英文题目:VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction

论文出处:arXiv 每日论文精选 · arXiv:2607.18078

原始论文:PDF / 论文页面

对应视频标题:VGOcc:视觉-几何高斯驱动的高效3D驾驶占据预测|推荐指数:★★★★★

这篇论文解决什么问题?

现有的以视觉为中心的3D占据预测方法在从具有深度模糊性的2D图像恢复完整3D语义场时,稀疏高斯原语主要依赖图像域特征,缺乏显式的几何信息以支持体素推理,特别是在遮挡和远距离区域。

核心创新

  • 提出Visual-Geometric Gaussians表示,将基础模型的视觉和几何线索融入高斯初始化和细化过程。
  • 设计VGBirth模块,通过射线深度假设和快速体素稀疏采样实现几何引导的高斯中心生成,以及视觉语义属性初始化。
  • 设计PFLearn模块,通过局部姿态条件化和跨视图聚合,解决射线深度歧义并增强多视图特征的一致性。

方法概览

VGOcc包含三个核心模块:1) Visual-Geometric Gaussian Birth (VGBirth),利用冻结VGGT生成的射线深度假设构建空间平衡的高斯中心,并用视觉语义特征初始化属性;2) Pose-Aware Feature Learning (PFLearn),将基础模型令牌与相机嵌入和校准射线信息结合,生成姿态感知的多视图特征;3) Gaussian Decoder,利用这些特征迭代细化高斯查询并渲染最终的语义占据场。

逐图理解论文

方法概述:Visual-Geometric Gaussians

方法概述:Visual-Geometric Gaussians
Figure 2: Overall architecture of VGOcc. Frozen VGGT provides complementary visual and geometric tokens. Visual- Geometric Gaussian Birth constructs Gaussian queries with geometry based initialization and visual semantic attribute priors, while Pose-Aware Feature Learning converts foundation tokens into pose-conditioned multi-view features. The Gaussian de- coder refines the queries and renders the final semantic occupancy field.

VGOcc提出了一种名为Visual-Geometric Gaussians的新表示,旨在从冻结的基础模型中提取互补的视觉和几何线索。该方法包含三个核心模块:Visual-Geometric Gaussian Birth用于生成高斯中心,Pose-Aware Feature Learning用于特征提取,以及Gaussian Decoder用于最终渲染。这种设计旨在解决稀疏高斯在几何建模上的不足。

实验设置与数据集

实验设置与数据集
Table 1: 3D semantic occupancy prediction results on nuScenes. † means supervised by dense occupancy annotations as opposed to original LiDAR segmentation labels. The best and second-best results are represented by bold and underline respectively.

我们在nuScenes数据集上进行3D语义占据预测实验,并与MonoScene、BEVFormer和GaussianFormer-2等SOTA方法进行对比。此外,在SurroundOcc数据集上进行定性分析,评估不同天气和光照条件下的鲁棒性。消融实验验证了VGBirth和PFLearn各组件的有效性。

定性结果:鲁棒性分析

定性结果:鲁棒性分析
Figure 3: Qualitative results of our method and GaussianFormer-2 on SurroundOcc dataset.

在SurroundOcc数据集上的定性结果显示,VGOcc在雨天、晴天、多云和夜间条件下均表现出良好的鲁棒性。与GaussianFormer-2相比,VGOcc在遮挡和远距离区域的预测更加准确,场景结构重建更为完整。

消融实验:组件有效性

消融实验:组件有效性
Figure 4: Qualitative results of ablation studies. Red and Green rectangular boxes highlight the differences.

消融实验进一步验证了VGBirth和PFLearn的有效性。移除VGBirth中的几何引导会导致SC IoU下降,而移除PFLearn中的姿态条件化会降低特征一致性。完整模型在所有指标上均表现最佳,证明了各组件的必要性。

相关工作对比

相关工作对比
Figure 1: From structured lifting to Visual-Geometric Gaus- sians. BEV, tri-plane, and voxel methods establish structured 3D representations, while sparse Gaussians reduce spatial redundancy. VGOcc learns Visual-Geometric Gaussians by grounding their initialization and refinement in complemen- tary visual and geometric cues.

与GaussianFormer相比,VGOcc通过显式几何建模提升了高斯初始化的准确性。与SurroundOcc相比,VGOcc在nuScenes上取得了更高的性能。VGGT作为基础模型,提供了冻结的DINO、frame和global tokens,用于提取互补线索,这是本方法的关键优势。

实验与关键结果

  • 在nuScenes数据集上进行3D语义占据预测实验,与MonoScene, BEVFormer, GaussianFormer-2等SOTA方法进行对比。
  • 在SurroundOcc数据集上进行定性分析,评估不同天气和光照条件下的鲁棒性。
  • 进行消融实验,验证VGBirth和PFLearn各组件的有效性。
  • nuScenes SC IoU: 34.07, SSC mIoU: 21.75(第 5 页)
  • 超越GaussianFormer-2 (SC IoU +3.51, SSC mIoU +1.73)(第 6 页)
  • 消融实验显示完整模型优于所有变体 (Full VGOcc: IoU 34.07, mIoU 21.75)(第 7 页)

阅读时需要注意

  • 依赖准确的相机标定。
  • 冻结的基础模型骨干网带来计算开销。
  • 缺乏时间建模能力。
  • VGGT等基础模型在训练过程中保持冻结,仅微调特定头部和模块。
  • 高斯预算固定为25.6k,包括19.2k几何引导查询和6.4k回退查询。

关联工作

  • GaussianFormer / GaussianFormer-2:主要对比方法,使用稀疏语义高斯,但初始化主要依赖学习到的先验或图像特征,缺乏显式几何建模。(第 2 页)
  • VGGT:作为视觉和几何基础模型,提供冻结的DINO、frame和global tokens,用于提取互补线索。(第 3 页)
  • SurroundOcc:对比方法之一,使用密集多尺度3D体积,VGOcc在nuScenes上超越其性能。(第 5 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

VGOcc:学习视觉-几何高斯以实现以视觉为中心的3D驾驶占据预测

林俊宏1,*, 郭曦丹2,*,†, 王康利1, 叶宇琦1, 梁晓宇1, 彭彦伦3, 高伟1,‡ 1 深圳国际研究生院,北京大学 2 武汉大学计算机学院 3 长城汽车 jhlin42in@stu.pku.edu.cn, xianda guo@163.com, gaowei262@pku.edu.cn

摘要 仅视觉占据预测需要从校准的环视图像中恢复语义3D占据场,其中每个视图沿相机射线提供具有深度歧义的观测。现有方法已从密集结构化表示进展到稀疏高斯基元,提高了3D场景表示的效率。然而,高斯学习仍然主要依赖于图像域特征,这些特征为体素推理提供的显式几何信息有限。我们的关键观察是,有效的高斯占据建模不仅需要稀疏基元,还需要更丰富的几何和语义学习线索。在本文中,我们提出了VGOcc,它从基础模型中学习视觉和几何线索,并将这些线索用于高斯初始化和建模细化,形成一种专为语义占据预测定制的表示形式,称为视觉-几何高斯(Visual-Geometric Gaussians)。具体而言,我们提出了视觉-几何高斯生成(VGBirth)模块,以从射线深度假设中形成空间平衡的高斯中心,同时视觉语义特征初始化基元属性。接下来,我们设计了姿态感知特征学习(PFLearn)模块,将基础模型令牌与相机嵌入和校准射线信息相结合。然后,在每次高斯细化阶段,将来自相邻视图的特征聚合到投影的3D位置。最后,高斯解码器利用姿态感知特征细化生成的高斯,并将其渲染为语义占据。在nuScenes数据集上的实验表明,VGOcc在仅视觉3D占据预测方面达到了最先进(state-of-the-art)的性能。代码将在 https://github.com/JHLin42in/VGOcc 上提供。

图1:从结构化提升到视觉-几何高斯。BEV、三平面和体素方法建立结构化3D表示,而稀疏高斯减少了空间冗余。VGOcc通过将初始化和细化建立在互补的视觉和几何线索上,学习视觉-几何高斯。

1. 引言 以视觉为中心的3D占据预测为自动驾驶提供了统一的场景表示。给定校准的环视图像,它在自车坐标系中估计一个密集的语义场,涵盖各种物体、路面、细薄结构和背景区域。此类表示还支持占据预测、协同感知、基于世界模型的场景预测和运动规划 (Wang et al. 2025b; Yang et al. 2025; Li et al. 2025; Zhu et al. 2026b,a)。然而,相机仅观测到可见表面,而非完整的3D场景。每个图像位置定义了一条射线,但并未揭示被占据的深度或隐藏在可见表面之后的结构。因此,仅视觉占据预测的关键挑战在于从具有深度歧义的2D射线观测中推断出完整的3D语义场。

现有的以视觉为中心的占据方法主要通过将图像特征提升到结构化3D空间来解决这一问题。基于BEV的方法,如FB-OCC (Li et al. 2023b),在鸟瞰图中聚合多视图特征,但高度压缩限制了精细的垂直建模。三平面方法将BEV特征扩展到多个正交平面,以保留更完整的空间结构 (Huang et al. 2023),而体素方法构建3D特征体以捕捉精细几何结构 (Wei et al. 2023; Zhang, Zhu, and Du 2023; Li et al. 2023a; Ma et al. 2024)。这些方法提供了显式的3D特征空间,但仍将大量计算分配给空域或弱观测区域。GaussianFormer (Huang et al. 2024) 和 GaussianFormer-2 (Huang et al. 2025) 则改用稀疏序列对场景进行编码。

  • 同等贡献。 † 项目负责人。 ‡ 通讯作者。

第 2 页

语义高斯,显著降低了空间冗余,并提高了3D场景表示的效率。然而,仅靠稀疏高斯基元无法解决图像域特征中显式几何信息有限的问题,如图1所示。高斯基元通常使用学习到的先验或图像特征进行初始化,随后通过在投影的3D参考点处采样图像特征来进行细化。尽管这种方法为高斯细化提供了视觉信息,但在投影位置进行采样并不能显式地对体素推理所需的几何关系进行建模。这一限制制约了体素结构恢复和语义建模,特别是在遮挡和远距离区域。

我们认为,提高占用预测不仅需要高效的3D高斯表示,还需要对几何和语义进行更丰富的学习。特别是,视觉和几何基础模型提供了丰富的语义和几何信息 (Oquab et al. 2024; Wang et al. 2025a)。然而,由于它们是为图像和表面理解而预训练的,其先验不能直接被高斯基元用于语义占用推理。因此,我们的目标是将它们的信息转化为对高斯基元有用的学习线索,从而产生一种我们称为“视觉-几何高斯”(Visual-Geometric Gaussians)的表示形式。

为此,我们提出了VGOcc,这是一个稀疏高斯占用框架,它从基础模型中学习视觉和几何线索,并将它们纳入基元的初始化和细化中。首先,视觉-几何高斯生成模块(Visual-Geometric Gaussian Birth, VGBirth)从当前场景构建初始高斯。它从冻结的几何特征中预测射线深度假设,并应用快速的体素稀疏采样以获得空间平衡的高斯中心。沿相应射线的视觉语义特征初始化基元属性,而学习到的回退查询则覆盖几何观测较弱的区域。其次,姿态感知特征学习模块(Pose-Aware Feature Learning, PFLearn)构建了用于迭代高斯细化的特征。它将DINO、帧和全局令牌与相机嵌入和校准射线信息进行条件化和融合。所得特征在每个细化阶段在投影的3D位置处沿相邻视图进行聚合。最后,高斯解码器利用这些特征细化生成的高斯,并将生成的视觉-几何高斯渲染为语义占用。通过这种方式,VGOcc保留了稀疏高斯建模的效率,同时将高斯生成和细化都建立在场景特定的视觉和几何线索之上。我们的主要贡献总结如下:

  • 我们引入了VGOcc,它从基础模型中学习互补的视觉和几何线索,用于高斯初始化和细化,从而产生一种称为“视觉-几何高斯”的表示形式,专门针对语义占用预测。
  • 我们提出了视觉-几何高斯生成模块(Visual-Geometric Gaussian Birth),它根据射线深度假设形成空间平衡的高斯中心,并使用视觉语义特征初始化基元属性。
  • 我们设计了姿态感知特征学习模块(Pose-Aware Feature Learning),它利用相机嵌入对基础令牌进行条件化和融合。

相关工作

以视觉为中心的占用预测

以视觉为中心的占用预测已从BEV感知发展到密集场景完成。BEVFormer利用BEV Transformer聚合多相机特征 (Li et al. 2022)。TPVFormer引入正交平面以保留垂直结构 (Huang et al. 2023)。SurroundOcc构建密集的多尺度3D体素 (Wei et al. 2023),而OccFormer采用双路径体素Transformer (Zhang, Zhu, and Du 2023)。VoxFormer在致密化之前生成深度引导的稀疏提议 (Li et al. 2023a)。COTR和SparseOcc等高效变体通过压缩令牌或稀疏潜在建模减少体素计算 (Ma et al. 2024; Liu et al. 2024)。Occ3D和OpenOccupancy为自动驾驶建立了语义占用基准 (Tian et al. 2023; Wang et al. 2023),而Humanoid-OmniOcc将全视角占用评估扩展到具身智能 (Guo et al. 2026)。

稀疏高斯方法遵循3D高斯溅射 (3D Gaussian Splatting) (Kerbl et al. 2023),用连续基元替换密集体素特征。GaussianFormer和GaussianFormer-2将语义3D高斯适应于以视觉为中心的占用预测 (Huang et al. 2024, 2025)。VG3T通过结构化采样和位置细化改进多视图高斯生成 (Kim and Lee 2025),而VG3S调整冻结的基础特征以用于高斯占用学习 (Yan, Pei, and Shen 2026)。与这些方法不同,我们学习互补的视觉和几何线索用于高斯初始化和细化。

视觉和几何基础模型

视觉和几何基础模型为下游3D感知提供了可迁移的信息。DINOv2通过大规模视觉预学习习得鲁棒的表观和语义特征 (Oquab et al. 2024)。DUSt3R直接从图像对预测密集点图 (Wang et al. 2024),而MASt3R通过密集局部描述符改进几何匹配和重建 (Leroy, Cabon, and Revaud 2024)。VGGT进一步在一个前馈多视图框架内统一了相机、深度、点图和点轨迹预测 (Wang et al. 2025a)。

最近的工作将这些模型适应于驾驶任务。DriveVGGT、DVGT、DVGT-2和DGGT将几何预测扩展到驾驶领域 (Jia et al. 2025; Zuo et al. 2025, 2026; Chen et al. 2025)。VGD将几何先验应用于环绕高斯重建 (Lin et al. 2025)。SURDS评估了驾驶中的空间推理能力 (Guo et al. 2025)。AutoDrive-P3统一了感知、预测和规划 (Ye et al. 2026)。OmniNWM研究了导航世界模型 (Li et al. 2026)。SparseOccVLA和VGGDrive将占用或几何与语言引导的规划相连接。

第 3 页

射线深度 快速体素稀疏化 DPT 构建 采样

D

随机 投影 DINO VGGT 锚点 采样

DINO C 拼接 高斯 S Softmax G2O 🔗 共享参数 解码器

🔗 🔗 全局注意力 PoseRayPE PoseRayPE 三流融合🔗 帧注意力 D 🔗 跨视图 PoseFiLM G S 注意力 ×L 次 模块 压缩 F 压缩 DINO 全局 帧 令牌 令牌 令牌 D G F

图 2:VGOcc 的整体架构。冻结的 VGGT 提供互补的视觉和几何令牌。视觉-几何高斯生成模块(Visual-Geometric Gaussian Birth)基于几何初始化和视觉语义属性先验构建高斯查询,而姿态感知特征学习模块(Pose-Aware Feature Learning)将基础令牌转换为姿态条件多视图特征。高斯解码器细化查询并渲染最终的语义占用场。

(Dang 等人 2026; Wang 等人 2026)。相比之下,我们专注于纯视觉语义占用,并将视觉和几何基础特征转换为稀疏高斯线索。因此,我们将视觉和几何线索融入稀疏高斯初始化和细化过程中。理想的高斯表示应获得几何引导的中心集 $C$、视觉语义属性集 $V$ 以及姿态感知的细化特征 $F$。视觉和几何基础模型提供几何特征 $Z_{geo}$ 和视觉语义特征 $Z_{vis}$。我们将此过程公式化为:

问题陈述 给定校准的环绕视图图像 $I = \{I_c\}_{c=1}^N$ 和相机参数 $P = \{K_c, T_{c \to e}\}_{c=1}^N$,纯视觉占用预测旨在估计自车坐标系下的语义场 $\hat{Y}$。我们通过其位置 $X$ 和属性状态 $A$ 来描述高斯占用表示,这些表示使用特征输入 $K$ 进行初始化和更新:

$$ R = \text{Learn}(X, A \mid K), \quad \hat{Y} = \mathcal{D}_\theta(R). \quad (1) $$

稀疏高斯方法通过 $M$ 个基元实例化 $R$,并通过在投影的 3D 参考点上采样相机特征来获取更新特征:

$$ Q = \{Q_q\}_{q=1}^M, \quad Q_q = (\mu_q, \Sigma_q, \alpha_q, s_q, f_q), \quad (2) $$

$$ k_q = \bigoplus_{c=1}^N \bigoplus_{j=1}^J F_c \pi_c(x_{\text{ref}qn}) . $$

这里,$x_{\text{ref}qn}$ 表示与基元 $q$ 相关的第 $n$ 个 3D 参考点。中心 $\mu_q$ 提供紧凑的 3D 位置,而 $\Sigma_q, \alpha_q, s_q$ 和 $f_q$ 分别编码形状、占用强度、语义和潜在内容。然而,通用的查询初始化提供的场景特定信息有限,而投影采样并未显式编码用于体积融合的校准射线和跨视图关系。因此,仅靠稀疏基元不足以实现有效的高斯占用建模。

$$ (Z_{geo}, Z_{vis}) = \Phi_{VG}(I), $$ $$ (C, V, F) = \Psi(Z_{geo}, Z_{vis}, P), \quad (3) $$ $$ G = \text{Learn}(C, V \mid F). $$

我们将 resulting 高斯集 $G$ 称为视觉-几何高斯(Visual-Geometric Gaussians)。这一公式总结了视觉和几何线索如何支持高斯初始化和细化。

整体设计 图 2 说明了 VGOcc 的流程。给定环绕视图图像 $I$,冻结的 VGGT 提取多级 DINO、帧和全局令牌作为视觉和几何特征,而相机参数 $P$ 提供校准的射线和姿态信息。冻结的几何特征通过一个可训练的 DPT 头产生射线深度假设。非空候选项被提升为 3D 并通过快速体素稀疏化采样选择,以形成空间平衡的中心 $C$。学习的后备查询覆盖弱观测区域,而相应的 DINO 特征初始化基元属性 $V$。$C$ 和 $V$ 共同构成出生高斯查询 $Q$。在细化阶段 $j$,基础令牌在融合之前以相机嵌入和校准补丁射线为条件。然后,在投影的 3D 位置聚合相邻视图特征以产生 $F^j$。四个阶段产生 $F =$

第 4 页

{F j}4j=1,引导高斯占据解码器将 Q 重新细化为最终集合 G,称为视觉-几何高斯(Visual-Geometric Gaussians)。最后,G 被渲染为语义占据 ˆY。

视觉-几何高斯生成 (Visual-Geometric Gaussian Birth)

我们设计 Visual-Geometric Gaussian Birth 来构建式 (3) 中定义的中心集合 C 和属性集合 V。通用的几何学习查询提供的场景特定位置有限,而置信度排名往往使图元集中在主要的可见表面上。我们使用射线深度假设来生成场景特定的候选点,使用快速体素稀疏采样来保持空间覆盖,并使用视觉特征来初始化图元属性。

射线深度假设构建。对于相机 c 中的图块 i,令 (oc, rci) 表示其校准后的自车坐标系射线。一个轻量级的 DPT 头从冻结的几何特征中预测带有空类别的深度后验概率 pray(b | c, i)。空类别抑制了没有占据结构的射线。每个非空深度箱产生:

xcib = oc + dbrci, wcib = pray(b | c, i), ξci = ϕDINO(c, i), b̸ = ∅. (4)

这里 xcib 是一个 3D 中心候选点,wcib 是其置信度,ξci 是来自同一条射线的 DINO token。将每个候选点与其视觉 token 配对,可以在不影响其位置的情况下,保持几何位置与视觉语义之间的对应关系。

快速体素稀疏采样。全局置信度排名有利于可见和靠近相机的区域。我们转而将候选点划分为粗粒度体素:

ν(xi) = (xi − pmin) / sv. (5)

非空体素被均匀采样,而每个选定体素内的候选点则根据其置信度 wi 进行采样。这平衡了空间覆盖和几何可靠性,产生了 Mg 个几何引导的查询。另外 Mp 个学习到的后备查询覆盖观察较弱的区域,其中 M = Mg + Mp。

姿态感知属性初始化。在几何确定中心后,视觉特征初始化非空间图元属性。对于几何引导的查询,Ωq 包含其源图块。对于后备查询,它包含进入可见相机的有效投影。相应的特征聚合如下:

⟨W qj hjci, Wkyjj c′ik⟩ ejc′k = ———- + λa log(γc′k + ϵ), √dh aq = abase + η ⊙MLPa(ˆξq). (6)

这里 aq = (αq, sq, fq) 包含不透明度、语义和潜在特征状态。MLPa 表示属性预测头,η 包含其残差尺度。协方差 Σq 从学习到的基中初始化。残差预测保留了基初始化,同时引入了场景特定的信息。

视觉-几何高斯生成因此使用几何进行高斯定位,平衡的空间覆盖分配,以及用于属性初始化的视觉语义。

姿态感知特征学习 (Pose-Aware Feature Learning)

Visual-Geometric Gaussian Birth 仅构建一次查询集合 Q,而四个解码器阶段在不同的特征层级上运行。原始基础 token 缺乏图块级别的射线身份和校准后的跨视图一致性。因此,我们在每个阶段 j 应用姿态感知特征学习 (Pose-Aware Feature Learning) 以生成特定阶段的特征图 F j。

图块局部姿态条件化。相机级别的嵌入为同一视图中的所有图块分配相同的姿态信息,尽管每个图块对应不同的射线。对于相机 c 中的图块 i,我们编码:

ρci = [rci, oc × rci, oc, ¯ui], tci = Eray(Γ(ρci)) , (8)

其中 ¯ui 是归一化的图块坐标,Γ 表示傅里叶编码。由此产生的 tci 通过其校准后的原点、方向和图像位置来区分每个图块。

阶段级三流融合。在阶段 j,基础层级 ℓj 提供 DINO、帧和全局 token zℓj,τci,其中 τ ∈{d, f, g}。这些流提供语义、局部几何和全局上下文线索。由于它们的贡献在不同细化阶段有所不同,每个流在融合前都经过投影并受局部姿态条件化:

˜zj,τci = PoseFiLMj,τ (Pτzℓj,τci, tci), hjci = Fusej ({˜zj,τci}τ, tci). (9)

这里 Fusej 是三个流上的姿态条件化 softmax 门。它保留了它们的互补信息,同时调整它们对每个阶段的贡献。

姿态引导的跨视图聚合。图块局部姿态识别了源射线,但并未解决其深度歧义。因此,我们采样度量点 Xcik = oc + δkrci 并将其投影到相邻相机中。令 yjc′ik 表示采样的目标特征,γc′k = max(r⊤circ′ik, 0) 为其射线兼容性。跨视图聚合定义为:

ˆξq = NormQ AvgΩq [PoseGate(ξci, ρci)] , ejc′k = (⟨W qj hjci, Wkyjj c′ik⟩) / √dh + λa log(γc′k + ϵ), ∆hjci = Σ c′,k ajc′kW vj yjc′ik, aj = softmax(ej). (10)

无效投影被掩码处理。结合特征相似性与射线兼容性,抑制了几何不一致的投影,并引入了深度感知的跨视图信息。

第 5 页

veh. cone suf. flat SC SSC barrier bicycle bus car const. motorcycle pedestrian traffic trailer truck drive. other sidewalk terrain manmade vegetation Method Venue IoU mIoU

MonoScene CVPR’22 23.96 7.31 4.03 0.35 8.00 8.04 2.90 0.28 1.16 0.67 4.01 4.35 27.72 5.20 15.13 11.29 9.03 14.86

Atlas ECCV’20 28.66 15.00 10.64 5.68 19.66 24.94 8.90 8.84 6.47 3.28 10.42 16.21 34.86 15.46 21.89 20.95 11.21 20.54

BEVFormer ECCV’22 30.50 16.75 14.22 6.58 23.46 28.28 8.66 10.77 6.64 4.05 11.20 17.78 37.28 18.00 22.88 22.17 13.80 22.21

TPVFormer CVPR’23 11.51 11.66 16.14 7.17 22.63 17.13 8.83 11.39 10.46 8.23 9.43 17.02 8.07 13.64 13.85 10.34 4.90 7.37 TPVFormer† CVPR’23 30.86 17.10 15.96 5.31 23.86 27.32 9.79 8.74 7.09 5.20 10.97 19.22 38.87 21.25 24.26 23.15 11.73 20.81

OccFormer ICCV’23 31.39 19.03 18.65 10.41 23.92 30.29 10.31 14.19 13.59 10.13 12.49 20.77 38.78 19.79 24.19 22.21 13.48 21.35

SurroundOcc ICCV’23 31.49 20.30 20.59 11.68 28.06 30.86 10.70 15.14 14.09 12.06 14.38 22.26 37.29 23.70 24.49 22.77 14.89 21.86

GaussianFormer ECCV’24 29.83 19.10 19.52 11.26 26.11 29.78 10.47 13.83 12.58 8.67 12.74 21.57 39.63 23.28 24.46 22.99 9.59 19.12

GaussianFormer-2 CVPR’25 30.56 20.02 20.15 12.99 27.61 30.23 11.19 15.31 12.64 9.63 13.31 22.26 39.68 23.47 25.62 23.20 12.25 20.73

VGOcc Ours 34.07 21.75 20.43 12.48 29.27 30.00 13.24 16.10 13.97 10.50 15.09 22.50 43.09 25.93 28.17 26.21 16.22 24.83

表 1:在 nuScenes 上的 3D 语义占据预测结果。† 表示使用密集占据标注进行监督,而非原始的 LiDAR 分割标签。最佳和次佳结果分别用粗体和下划线表示。

融合后的源特征和跨视图特征被转换为每个解码器阶段使用的地图: F cj = Mapj {LN(hjci + W oj ∆hjci)}i , 占据损失定义为: (11) Locc = 10 CE(ˆY, Y) + Lovasz( ˆY, Y). (14) F = {F c }Nc=1 j=1 . Lpix 监督使用射线深度目标 Yray 的射线深度后验 pray,而 Laux 表示应用于中间解码器阶段的辅助占据损失。我们使用 Adam 优化器在四块 NVIDIA H20 GPU 上以 4 × 10−4 的学习率训练 VGOcc 20 个 epoch。 因此,F 提供了特定阶段的姿态条件特征和跨视图特征,用于将 Q 细化为最终的 Gaussian 集合 G。 Gaussian 占据解码器 实验设置 解码器接收出生 Gaussian 查询 Q 和姿态感知特征 F = {F j}4j=1。在第 j 个阶段,当前的 Gaussian 中心被投影到相机视图中以采样 F j,从而细化其中心、协方差、不透明度、语义和潜在特征。经过四个阶段后,解码器生成最终的 Gaussian 集合 G 并将其渲染为语义占据: ˆY = GS2Occ(G). 实验设置 数据集。我们在 nuScenes (Caesar et al. 2020) 上进行了所有实验,该数据集包含在波士顿和新加坡记录的 1,000 个驾驶场景。官方划分包含 700 个训练场景、150 个验证场景和 150 个测试场景,并配有来自六个环绕摄像头的同步图像。遵循 SurroundOcc (Wei et al. 2023),我们使用其 3D 语义占据标签进行训练和评估。自车为中心的评估区域范围为 100 m×100 m×8 m,其中 X, Y ∈[−50 m, 50 m] 且 Z ∈[−5 m, 3 m]。以 0.5 m 进行离散化,生成一个 200 × 200 × 16 的体素网格,包含 16 个语义类别、一个空类别和一个未知类别。 我们保留标准的稀疏 Gaussian 细化和渲染过程,仅修改初始查询 Q 和特定阶段的特征 F。这保持了解码器的不变性,并将获得的性能提升归因于 Gaussian 生成和姿态感知特征学习。 训练细节 VGOcc 的训练中冻结了视觉几何基础模型。可训练组件包括 DPT 射线深度头、视觉属性头、Pose-Aware Feature Learning 模块、Gaussian 占据解码器和 GS2Occ 头。给定预测的语义占据场 ˆY 和真实值 Y,总体目标函数为: L = Locc + λpixLpix + λauxLaux. (13) 度量标准。遵循标准的语义占据评估方法 (Cao and de Charette 2022),我们报告语义场景完成平均交并比 (SSC mIoU) 和场景完成交并比 (SC IoU)。前者计算占据语义类别 Csem 上各类别 IoU 的平均值: 1 TPi mIoU = X . (15) |Csem| TPi + FPi + FNi i∈Csem 对于场景完成,所有非空类别被合并为一个占据类别 o: M centered evaluation region spans 100 m×100 m×8 m, with G = DSG(Q, F) = (¯µq, ¯Σq, ¯αq, ¯sq, ¯fq) q=1 , (12) X, Y ∈[−50 m, 50 m] and Z ∈[−5 m, 3 m]. Discretiza- ˆY = GS2Occ(G). tion at 0.5 m produces a 200 × 200 × 16 voxel grid with 16 semantic classes, one empty class, and one unknown class. We retain the standard sparse Gaussian refinement and ren- dering process, while modifying only the initial queries Q Metrics. Following standard semantic occupancy evalua- and stage-specific features F. This keeps the decoder un- tion (Cao and de Charette 2022), we report semantic scene changed and attributes the resulting gains to Gaussian birth completion mIoU and scene completion IoU. The former av- and pose-aware feature learning. erages class-wise IoU over occupied semantic classes Csem: 1 TPi Training Details mIoU = X . (15) |Csem| TPi + FPi + FNi VGOcc is trained with the visual geometry foundation i∈Csem model frozen. The trainable components include the DPT For scene completion, all non-empty classes are merged into ray depth head, visual attribute heads, Pose-Aware Fea- one occupied class o: ture Learning blocks, Gaussian Occupancy Decoder, and TPo GS2Occ head. Given the predicted semantic occupancy field IoU = . (16) TPo + FPo + FNoˆY and ground truth Y, the overall objective is: Here TP, FP, and FN denote true positives, false positives, L = Locc + λpixLpix + λauxLaux. (13) and false negatives.

第 6 页

多视图 GaussianFormer-2 VGOcc (本文) 真实标签 环绕图像 3D 高斯 占用预测 3D 高斯 占用预测 占用

可行驶路面 汽车 巴士 卡车 地形 植被 人行道 其他平坦区域 行人 自行车 摩托车 路障 工程车辆 拖车 交通锥

图 3:我们的方法与 GaussianFormer-2 在 SurroundOcc 数据集上的定性结果。

对比方法。我们在相同的 nuScenes 评估协议下,将 VGOcc 与代表性的纯视觉占用方法进行比较。结构化表示基线包括 MonoScene (Cao and de Charette 2022)、Atlas (Murez et al. 2020)、BEVFormer (Li et al. 2022)、TPV-Former (Huang et al. 2023)、VoxFormer (Li et al. 2023a)、OccFormer (Zhang, Zhu, and Du 2023)、SurroundOcc (Wei et al. 2023)、COTR (Ma et al. 2024) 和 SparseOcc (Liu et al. 2024)。我们进一步与稀疏高斯方法 GaussianFormer (Huang et al. 2024) 和 GaussianFormer-2 (Huang et al. 2025) 进行比较。所有结果均取自官方提供的纯视觉评估(如有)。

实现细节。VGOcc 使用冻结的 VGGT 提取多级 DINO、帧和全局 token (Wang et al. 2025a)。DINO token 为高斯属性和分阶段特征学习提供视觉语义特征 (Oquab et al. 2024)。基础特征网格大小为 21 × 37。我们将高斯基元预算固定为 25.6k,其中包括 19.2k 几何引导查询和 6.4k 学习到的后备查询。可训练组件包括 DPT 射线后处理头、视觉属性头、四个姿态感知特征学习 (Pose-Aware Feature Learning, PFLearn) 模块、稀疏高斯解码器以及高斯到体素头。除非另有说明,所有消融实验均保持相同的高斯预算和解码器。

定量结果 如表 1 所示,VGOcc 实现了 34.07 的 SC IoU 和 21.75 的 SSC mIoU,超越了非高斯基线 SurroundOcc 2.58 和 1.45 个点。在 16 个类别中的 12 个类别中排名第一。在大规模表面和前景物体上的显著提升表明,VGOcc 比 BEV、三平面和体素表示更好地捕捉了场景几何和语义内容。这表明视觉-几何表示在保留对象级语义的同时保留了全局布局。在路障、汽车、行人和交通锥上的较低分数表明,紧凑或细薄的类别对有限的图像支持和稀疏采样仍然敏感。总体而言,VGOcc 提供了更平衡的空间结构和语义细节表示。

与 GaussianFormer-2 相比,VGOcc 将 SC IoU 提高了 3.51 分,将 SSC mIoU 提高了 1.73 分,且在 16 个类别中的 14 个类别中得分更高。在大规模表面和前景物体上的广泛提升证明了整体视觉-几何设计在改善结构恢复和语义建模方面的有效性。跨类别的一致改进进一步表明,这些优势不仅限于背景布局或离散对象。由于两种方法都使用稀疏语义高斯和相同的解码器,结果证实,场景特定的视觉和几何线索比单纯的稀疏性能产生更强的 Gaussian 表示。

定性结果 图 3 比较了 VGOcc 与 GaussianFormer-2 在雨天、晴天、多云和夜间条件下的表现。所有高斯和占用结果均从同一视角渲染

第 7 页

A1 A2 A3 A4 ours

B1 B2 B3 B4 真实标签 (GT)

图 4:消融研究的定性结果。红色和绿色矩形框突出了差异。

表 2:消融研究的定量结果。所有变体 使用 FPS 采样 (A4) 使 IoU 和 mIoU 分别降低 使用相同的 Gaussian 预算和解码器。 0.33 和 0.52,验证了我们用于平衡中心 分配的采样策略。如图 4 所示,完整设计 变体 修改内容 IoU ↑ mIoU ↑ 比变体 A1-A4 保留了更清晰的路边和结构。 Visual-Geometric Gaussian Birth 总体而言,VGBirth 为稀疏高斯提供了有效的几何和 A1 无视觉残差初始化 33.64 21.09 语义初始化。 A2 GaussianFormer-2 查询初始化 32.42 20.24 A3 无姿态-射线属性门控 33.78 21.46 姿态感知特征学习 (Pose-Aware Feature Learning)。 第二组评估 A4 使用 FPS 代替快速体素稀疏采样 33.74 21.23 了高斯细化过程中的特征学习。移除局部补丁的姿态条件 (B1) 姿态感知特征学习 (Pose-Aware Feature Learning) 使 IoU 和 mIoU 分别下降 1.32 和 0.61,证实了特定于补丁的射线 B1 无局部补丁姿态条件 32.75 21.14 几何对于特征适应至关重要。移除 B3 所有层级的独立适配器 31.87 19.96 B4 无姿态引导的跨视图聚合 33.67 21.37 DINO 流 (B2) 导致下降 0.80 和 0.69,显示 视觉语义补充了几何和全局 完整 VGOcc 34.07 21.75 线索。在所有层级使用独立适配器 (B3) 产生了 最大的退化,降幅为 2.20 和 1.79,表明 共享适应提高了跨层级的特征一致性。 点。在第 2 行的晴天和第 3 行的阴天场景中, 移除姿态引导的跨视图聚合 (B4) 使 VGOcc 保留了更清晰的路边、人行道和 IoU 和 mIoU 分别降低 0.40 和 0.38,验证了校准 植被,产生了更完整的占据预测。 的相邻视图特征以解决射线-深度歧义 在第 1 行的雨天和第 4 行的夜间场景中, 性。图 4 还显示,完整设计比变体 GaussianFormer-2 遭受严重的结构故障和散射 错误,而 VGOcc 保持了连贯的 3D 几何 变体 B1-B4 产生了更清晰的语义边界 和更少的碎片化区域。总体而言,PFLearn 为高斯细化提供了有效的姿态感知 和场景布局。这些结果表明,Visual-Geometric 和多视图特征。 Gaussians 在各种条件下为语义占据提供了更强的表示。 结论 消融研究 (Ablation Studies) 我们提出了 VGOcc,这是一个以视觉为中心的 3D 占据框 我们进行消融研究,以验证 VGOcc 是否有效 架,它从冻结的视觉和几何基础特征中学习 Visual-Geometric Gaussians。首先,我们通过射线-深度假设和快速 学习视觉和几何线索以构建 Visual- Geometric Gaussians。所有变体均在相同的 体素稀疏采样形成场景特定的中心,同时使用同射线视觉特征初始化原始属性。然后,我们将多级 实验设置下进行评估,以确保公平比较。 Visual-Geometric Gaussian Birth。 表 2 评估了 基础令牌基于校准的姿态-射线信息进行条件设置,并在多个阶段聚合相邻视图特征以进行迭代细化。总之,这些设计改善了 提出的高斯生成策略。移除视觉残差 初始化 (A1) 使 IoU 和 mIoU 分别降低 0.43 场景结构恢复和语义建模,在 nuScenes 上实现了最先进的性能,并在各种成像条件下实现了鲁棒的预测。 和 0.66,证实了同射线视觉特征提供 了场景特定的语义先验。用 GaussianFormer-2 初始化 (A2) 替换 VGBirth 导致最大的 VGOcc 仍有几个局限性,包括其对精确相机的依赖、冻结主干的计算开销以及缺乏时间建模。未来的工作将致力于解决这些挑战。 下降 1.65 和 1.51,证明了射线-深度中心、视觉属性和平衡分配的共同贡献。移除姿态-射线属性门控 (A3) 使两项指标均降低 0.29,表明校准的相机和射线线索改进了属性初始化。用快速体素稀疏

第 8 页

致谢 Huang, Y.; Zheng, W.; Zhang, Y.; Zhou, J.; 和 Lu, J. 2024. GaussianFormer: 将场景表示为高斯分布以进行基于视觉的 3D 本研究得到了国家科技重大专项(2024ZD01NL00101)、中国 语义占用预测。在欧洲计算机视觉会议(ECCV)论文集 自然科学基金(62271013)、广东省超高清 中。 显示媒体技术重点实验室(2024B1212010006)、 广东省珠江人才计划 Jia, X.; Liu, Y.; Hong, Y.; Xia, R.; You, J.; Sun, B.; Hao, Z.; (2021QN020708)、广东省基础与应用基础 和 Yan, J. 2025. DriveVGGT: 用于多摄像头自动驾驶的 研究基金(2024A1515010155)、 校准约束视觉几何 Transformer。arXiv 预印本 arXiv:2511.22264. 深圳市科技计划 Kerbl, B.; Kopanas, G.; Leimkuehler, T.; 和 Drettakis, G. (JCYJ20240813160202004, JCYJ20230807120808017, 2023. 3D Gaussian Splatting for Real-Time Radiance Field SYSPG20241211173440004)、深圳市基础 Rendering. ACM Transactions on Graphics, 42(4): 139:1– 研究计划(GXWD20201231165807007- 139:14. 20200806163656003),并获得了 深圳市杰出人才培养基金的财政支持。我们也 Kim, J.; 和 Lee, S. 2025. VG3T: Visual Geom- 感谢长城汽车有限公司的支持。 etry Grounded Gaussian Transformer. arXiv preprint 参考文献 arXiv:2512.05988. Leroy, V.; Cabon, Y.; 和 Revaud, J. 2024. Grounding Im- Caesar, H.; Bankiti, V.; Lang, A. H.; Vora, S.; Liong, V. E.; age Matching in 3D with MASt3R. In Proceedings of the Xu, Q.; Krishnan, A.; Pan, Y.; Baldan, G.; 和 Beijbom, O. European Conference on Computer Vision (ECCV), 71–91. 2020. nuScenes: A Multimodal Dataset for Autonomous Li, B.; Ma, Z.; Du, D.; Peng, B.; Liang, Z.; Liu, Z.; Guo, Driving. In Proceedings of the IEEE/CVF Conference on X.; Zhu, Z.; Ma, C.; Jin, Y.; Zhao, H.; 和 Zeng, W. 2026. Computer Vision and Pattern Recognition, 11621–11631. OmniNWM: Omniscient Driving Navigation World Models. Cao, A.-Q.; 和 de Charette, R. 2022. MonoScene: Monoc- In Proceedings of the European Conference on Computer ular 3D Semantic Scene Completion. In Proceedings of Li, X.; Li, P.; Zheng, Y.; Sun, W.; Wang, Y.; 和 Chen, Y. the IEEE/CVF Conference on Computer Vision and Pattern 2025. PreWorld: Semi-Supervised Vision-Centric 3D Occu- Recognition, 3991–4001. pancy World Model for Autonomous Driving. In Interna- Chen, X.; Xiong, Z.; Chen, Y.; Li, G.; Wang, N.; Luo, H.; tional Conference on Learning Representations. Chen, L.; Sun, H.; Wang, B.; Chen, G.; 等. 2025. DGGT: Li, Y.; Yu, Z.; Choy, C.; Xiao, C.; Alvarez, J. M.; Fidler, S.; Feedforward 4D Reconstruction of Dynamic Driving Scenes Feng, C.; 和 Anandkumar, A. 2023a. VoxFormer: Sparse using Unposed Images. arXiv preprint arXiv:2512.03004. Voxel Transformer for Camera-Based 3D Semantic Scene Dang, C.; Wang, J.; Li, G.; Hou, Z.; You, Z.; Ye, H.; Ma, J.; Completion. In Proceedings of the IEEE/CVF Conference Chen, L.; 和 Wang, Y. 2026. SparseOccVLA: Bridging Oc- on Computer Vision and Pattern Recognition, 9087–9098. cupancy and Vision-Language Models via Sparse Queries Li, Z.; Wang, W.; Li, H.; Xie, E.; Sima, C.; Lu, T.; Yu, Q.; for Unified 4D Scene Understanding and Planning. arXiv and Dai, J. 2022. BEVFormer: Learning Bird’s-Eye-View preprint arXiv:2601.06474. Representation from Multi-Camera Images via Spatiotem- Guo, X.; Zhang, B.; Huang, C.; Chen, S.; Wang, R.; Duan, poral Transformers. In Proceedings of the European Con- Y.; Yang, C.; Zou, Q.; 和 Sui, W. 2026. Humanoid- ference on Computer Vision (ECCV), 1–18. OmniOcc: Stereo-Based Full-View Occupancy Dataset for Li, Z.; Yu, Z.; Austin, D.; Fang, M.; Lan, S.; Kautz, J.; 和 Embodied AI. arXiv preprint arXiv:2606.22971. Alvarez, J. M. 2023b. FB-OCC: 3D Occupancy Predic- Guo, X.; Zhang, R.; Duan, Y.; He, Y.; Nie, D.; Huang, tion based on Forward-Backward View Transformation. In W.; Zhang, C.; Liu, S.; Zhao, H.; 和 Chen, L. 2025. CVPR Workshop on End-to-End Autonomous Driving. SURDS: Benchmarking Spatial Understanding and Reason- ing in Driving Scenarios with Vision Language Models. Lin, J.; Wang, K.; Wang, S.; Fan, S.; Li, G.; 和 Gao, W. In Conference on Neural Information Processing Systems 2025. VGD: Visual Geometry Gaussian Splatting for Feed- (NeurIPS). Forward Surround-view Driving Reconstruction. arXiv preprint arXiv:2510.19578. Huang, Y.; Thammatadatrakoon, A.; Zheng, W.; Zhang, Y.; Du, D.; 和 Lu, J. 2025. GaussianFormer-2: Probabilistic Liu, H.; Chen, Y.; Wang, H.; Yang, Z.; Li, T.; Zeng, J.; Chen, Gaussian Superposition for Efficient 3D Occupancy Predic- L.; Li, H.; 和 Wang, L. 2024. Fully Sparse 3D Occupancy tion. In Proceedings of the IEEE/CVF Conference on Com- Prediction. In Proceedings of the European Conference on puter Vision and Pattern Recognition, 27477–27486. Computer Vision (ECCV). Huang, Y.; Zheng, W.; Zhang, Y.; Zhou, J.; 和 Lu, J. 2023. Ma, Q.; Tan, X.; Qu, Y.; Ma, L.; Zhang, Z.; 和 Xie, Y. 2024. Tri-Perspective View for Vision-Based 3D Semantic Occu- COTR: Compact Occupancy TRansformer for Vision-Based pancy Prediction. In Proceedings of the IEEE/CVF Confer- 3D Occupancy Prediction. In Proceedings of the IEEE/CVF ence on Computer Vision and Pattern Recognition, 9223– Conference on Computer Vision and Pattern Recognition, 9232. 19936–19945.

第 9 页

Murez, Z.; van As, T.; Bartolozzi, J.; Sinha, A.; Badri-Ye, Y.; Zhang, Z.; Lin, J.; Sun, S.; Peng, C.; and Gao, W. 2020. Atlas: End-to-End 3D Scene Reconstruction from Posed Images. In Proceedings of the European Conference on Computer Vision (ECCV), 414–431. Springer.

Oquab, M.; Darcet, T.; Moutakanni, T.; Vo, H. V.; Szafraniec, M.; Khalidov, V.; Fernandez, P.; Haziza, D.; Massa, F.; El-Nouby, A.; Assran, M.; Ballas, N.; Galuba, W.; Howes, R.; Huang, P.-Y.; Li, S.-W.; Misra, I.; Rabbat, M.; Sharma, V.; Synnaeve, G.; Xu, H.; Jegou, H.; Mairal, J.; Labatut, P.; Joulin, A.; and Bojanowski, P. 2024. DINOv2: Learning Robust Visual Features without Supervision. Transactions on Machine Learning Research.

Tian, X.; Jiang, T.; Yun, L.; Mao, Y.; Yang, H.; Wang, Y.; Wang, Y.; and Zhao, H. 2023. Occ3D: A Large-Scale 3D Occupancy Prediction Benchmark for Autonomous Driving. In Advances in Neural Information Processing Systems, Datasets and Benchmarks Track.

Wang, J.; Chen, M.; Karaev, N.; Vedaldi, A.; Rupprecht, C.; and Novotny, D. 2025a. VGGT: Visual Geometry Grounded Transformer. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 5294–5306.

Wang, J.; Li, G.; Huang, Z.; Dang, C.; Ye, H.; Han, Y.; and Chen, L. 2026. VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR).

Wang, S.; Leroy, V.; Cabon, Y.; Chidlovskii, B.; and Revaud, J. 2024. DUSt3R: Geometric 3D Vision Made Easy. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 20697–20709.

Wang, X.; Zhu, Z.; Xu, W.; Zhang, Y.; Wei, Y.; Chi, X.; Ye, Y.; Du, D.; Lu, J.; and Wang, X. 2023. OpenOccupancy: A Large Scale Benchmark for Surrounding Semantic Occupancy Perception. In Proceedings of the IEEE/CVF International Conference on Computer Vision, 17850–17859.

Wang, Y.; Huang, X.; Sun, X.; Yan, M.; Xing, S.; Tu, Z.; and Li, J. 2025b. UniOcc: A Unified Benchmark for Occupancy Forecasting and Prediction in Autonomous Driving. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). IEEE.

Wei, Y.; Zhao, L.; Zheng, W.; Zhu, Z.; Zhou, J.; and Lu, J. 2023. SurroundOcc: Multi-Camera 3D Occupancy Prediction for Autonomous Driving. In Proceedings of the IEEE/CVF International Conference on Computer Vision, 21729–21740.

Yan, X.; Pei, M.; and Shen, S. 2026. VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction. arXiv preprint arXiv:2603.06210.

Yang, Y.; Mei, J.; Ma, Y.; Du, S.; Chen, W.; Qian, Y.; Feng, Y.; and Liu, Y. 2025. Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 39, 9327–9335.

Zhang, Y.; Zhu, Z.; and Du, D. 2023. OccFormer: Dual-Path Transformer for Vision-Based 3D Semantic Occupancy Prediction. In Proceedings of the IEEE/CVF International Conference on Computer Vision, 9433–9443.

Zhu, H.; Li, B.; Guo, X.; Liu, H.; Peng, B.; Yuan, M.; Jin, X.; Zeng, W.; and Chen, C. W. 2026a. GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory. arXiv preprint arXiv:2607.05543.

Zhu, H.; Li, B.; Guo, X.; Peng, Y.; Zhu, Z.; Jin, X.; Zeng, W.; and Chen, C. W. 2026b. Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images. arXiv preprint arXiv:2607.01633.

Zuo, S.; Xie, Z.; Zheng, W.; Xu, S.; Li, F.; Jiang, S.; Chen, L.; Yang, Z.-X.; and Lu, J. 2025. DVGT: Driving Visual Geometry Transformer. arXiv preprint arXiv:2512.16919.

Zuo, S.; Xie, Z.; Zheng, W.; Xu, S.; Li, F.; Li, H.; Chen, L.; Yang, Z.-X.; and Lu, J. 2026. DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale. arXiv preprint arXiv:2604.00813.

发表评论