三分钟导读:VLM-IE3D通过融合来自RGB视频的隐式几何令牌(IGTs)和显式几何令牌(EGTs),增强了视觉语言模型在无需额外3D输入情况下的3D空间感知能力。
英文题目:3D-Aware VLMs with Implicit and Explicit Geometries
论文出处:arXiv 每日论文精选 · arXiv:2607.21595
原始论文:PDF / 论文页面
对应视频标题:VLM-IE3D:仅用RGB视频实现细粒度3D空间理解|推荐指数:★★★★★
这篇论文解决什么问题?
现有的仅基于2D输入的VLMs主要依赖隐式3D表示,这些表示通常提供粗糙的全局空间布局,缺乏处理需要细粒度几何理解和精确空间定位的任务所需的局部细节。
核心创新
- 提出IGTs和EGTs互补表示,分别提供全局空间先验和细粒度局部几何细节
- 设计3D感知适配器,利用隐式-显式注意力(IEA)模块动态融合隐式和显式3D几何表示
- 仅使用RGB视频输入,无需额外3D传感器数据即可实现强大的3D空间理解
方法概览
提出VLM-IE3D框架,包含:(1) 3D几何编码器生成IGTs以捕获高层3D先验;(2) 3D显式嵌入模块将重建的3D属性(如深度图)转换为EGTs以编码细粒度结构;(3) 3D感知适配器通过隐式-显式注意力(IEA)模块融合IGTs、EGTs和2D视觉令牌。
逐图理解论文
方法概览:VLM-IE3D框架

VLM-IE3D框架直接处理RGB视频,无需显式3D输入。它包含三个流:2D视觉编码器提取视觉令牌;3D几何编码器生成隐式几何令牌以捕获高层3D信息;3D显式嵌入模块将重建的3D属性转换为显式几何令牌,编码细粒度结构细节。
核心创新:IGTs与EGTs互补

本文提出隐式几何令牌与显式几何令牌的互补表示。IGTs提供全局空间先验,而EGTs通过重建的深度图和点云等属性,编码细粒度的局部几何细节。这种双路径设计旨在同时保留宏观布局与微观结构信息。
结果:Scan2Cap密集描述

在Scan2Cap任务中,VLM-IE3D在C@0.5指标上达到80.4。这一结果显著优于仅依赖隐式3D表示的基线模型,证明显式几何信息的引入有效提升了模型对3D场景细节的描述能力。
结果:ScanRefer视觉定位

在ScanRefer任务中,VLM-IE3D在IoU阈值0.25和0.50下分别达到43.2%和16.9%的准确率。相比Qwen2.5-VL-3B,Acc@0.25提升了9.2,展示了更优越的对象定位能力,缩小了与使用3D场景输入方法的差距。
结果:3D视频检测与推理

在3D视频检测任务中,F125指标达到42.8。虽然精度提升,但推理速度从基线的7 FPS降至6 FPS,这是由于增加了3D几何编码和融合计算的开销。实验在单张H100 GPU上进行。
实验与关键结果
- 3D密集描述 (Scan2Cap)
- 3D视觉定位 (ScanRefer)
- 3D视频检测 (EmbodiedScan subset)
- 空间推理 (VSI-Bench)
- 3D密集描述 (Scan2Cap)
- 3D视觉定位 (ScanRefer)
- 3D视频检测 (EmbodiedScan subset)
- 空间推理 (VSI-Bench)
阅读时需要注意
- 推理速度相比基线VG LLM略有下降(从7 FPS降至6 FPS)
- 依赖于3D几何编码器(如AnySplat)的重建质量
- 显式几何嵌入模块采用轻量级设计(单层Patch Embedding + MLP),避免使用重型3D骨干网络以防止特征冗余
- 训练时冻结2D视觉编码器和3D几何编码器
关联工作
- Qwen2.5-VL:作为VLM backbone和基线模型(第 4 页)
- VG LLM:作为主要的RGB-only基线模型进行对比(第 9 页)
- AnySplat:作为3D几何编码器使用(第 5 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
具有隐式和显式几何结构的3D感知视觉语言模型
Wenhao Li1, Xueying Jiang1, Quanhao Qian2,3, Deli Zhao2,3, Ran Xu2,3✉, Shijian Lu1✉, Gongjie Zhang4✉
1南洋理工大学 2阿里巴巴集团达摩院 3虎扑实验室 4阿里巴巴集团
摘要。尽管取得了快速进展,但大多数基于2D视觉输入构建的现有视觉语言模型(VLMs)在处理需要细粒度空间理解和推理的各种3D任务时往往力不从心。为了弥补这一差距,我们提出了VLM-IE3D,这是一个统一的框架,通过为VLMs配备从RGB视频中学到的隐式和显式3D几何结构,增强了VLMs的3D空间感知能力。我们的VLM-IE3D引入了隐式几何令牌(IGTs),用于从输入视频中捕获高层几何先验,以及互补的显式几何令牌(EGTs),用于编码从重建的3D属性中获得的详细几何结构。在此基础上,VLM-IE3D配备了一个3D感知适配器,该适配器有效地将这两种几何类型与2D视觉线索融合。这种设计为细粒度的空间理解和推理注入了强大的3D归纳偏置,而无需任何额外的3D输入。大量实验表明,VLM-IE3D在包括3D视频检测、3D视觉定位、3D密集描述和空间推理在内的各种3D任务中 consistently 实现了优越的性能。代码和模型可在 https://github.com/Vegetebird/VLM-IE3D 获取。[cs.CV] 关键词:视觉语言模型 · 隐式和显式几何结构
1 引言
视觉语言模型(VLMs)在具身导航 [48,51]、视觉-语言-动作(VLA)[23,29] 和3D场景理解 [18,46] 等各种空间理解和推理任务中展现了巨大的潜力。最近,一项有前景的研究 [11,17,40,50] 试图直接从2D视觉观察中学习3D表示,而不是使用显式的3D数据(例如,点云),从而减轻了对专用3D传感器的依赖,并增强了VLM在现实世界场景中利用更易获取的2D RGB数据的适用性。一种普遍的方法是通过引入3D几何编码器 [19,36] 来赋予VLMs 3D空间感知能力,从而从视频序列中学习隐式3D表示。然而,学习到的隐式3D表示通常只能捕获场景的粗略和全局空间布局,这对于处理各种
✉通讯作者。
第 2 页
2 李等人
大型视觉-语言3D编码器模型 大型视觉-语言3D编码器模型
适配器
2D编码器 3D编码器 2D编码器 3D编码器 3D嵌入
3D认知地图 3D重建地图 文本 图像 文本 图像 显式3D属性
(a) 现有VLMs (b) VLM-IE3D (本文) 图1: (a) 现有VLMs仅通过学习提供粗略“3D认知地图”的隐式几何表示来获取3D感知能力。(b) 提出的VLM-IE3D引入了从重建3D属性中提取的显式几何表示,提供了“3D重建地图”,其中包含与隐式表示互补的细粒度局部几何结构。这两种互补的表示随后与2D视觉线索融合,通过结合粗略的全局布局和细粒度的局部几何细节,增强了VLMs的3D感知能力。
需要细粒度场景结构和几何信息以进行精确空间定位和推理的3D理解任务。 这一局限性反映了认知科学的见解[21,22],即人类形成抽象的“3D认知地图”以获取粗略的场景感知,通常不包含几何细节。同样,当前VLMs中3D几何编码器的隐式表示提供了高层空间先验。然而,其压缩和潜在的性质使得语言模型难以解释定量的几何属性,即使这些信息在潜在层面被编码。这使得现有VLMs中的细粒度几何信息无法用于精确推理任务。 相比之下,机器人系统通常依赖于显式3D表示(例如深度图和点云),这些表示构成了结构化的“3D重建地图”,使得定量几何数据可直接用于导航和定位等细粒度空间任务。这种结构化和可解释的几何表示形式对于精确的空间理解至关重要,但在仅基于RGB的VLM框架中尚未得到充分利用。我们的工作旨在弥合这一差距:为VLMs配备“3D认知地图”(全局先验)的抽象空间感知能力,以及“3D重建地图”(细粒度结构)的细粒度结构化理解能力(见图1)。 为了解决这一差距,我们提出了VLM-IE3D,这是一个统一框架,为VLMs配备了从RGB视频中提取的隐式和显式3D几何表示。与仅依赖隐式3D表示的先前工作[11,17,40,50]不同,VLM-IE3D引入了两种互补的几何感知表示,以内在方式将强大的3D归纳偏置注入VLMs:(i) 隐式几何令牌 (IGTs),由3D几何编码器生成,捕获用于全局场景理解的粗略和高层空间信息;(ii) 显式几何令牌 (EGTs),由轻量级嵌入模块从重建的显式3D表示(例如深度图和点云)中编码,保留用于细粒度空间理解的详细结构信息。这两种类型的令牌自然互补:IGTs提供高层和粗略的全局几何先验,而EGTs捕获特定和细粒度的局部几何结构。此外,我们开发了一个3D感知
第 3 页
具有隐式和显式几何结构的3D感知视觉语言模型 3
适配器,以有效地将这些隐式和显式3D表示与2D视觉线索相集成,生成统一的3D感知视觉嵌入,使视觉语言模型能够在无需额外3D输入的情况下,在整体和细粒度层面上执行全面的3D空间理解和推理。 我们在多种3D理解和推理任务上进行了广泛的实验:3D视频目标检测、3D视觉定位、3D密集描述和空间推理。结果表明,VLM-IE3D在仅使用RGB的方法中达到了最先进的性能,验证了结合隐式和显式几何表示的有效性。 我们的主要贡献总结为三个方面。首先,我们提出了VLM-IE3D,这是一个统一的框架,利用隐式和显式几何表示,从纯RGB视频序列中为视觉语言模型内在注入强大的3D归纳偏置。其次,我们引入了两种互补的几何感知表示:隐式几何令牌(IGTs)编码高层3D先验,显式几何令牌(EGTs)提供详细的3D结构。我们还设计了一个3D感知适配器,以有效地将这些表示与2D视觉线索相集成。第三,广泛的实验表明,VLM-IE3D在多个3D场景理解和空间推理任务上取得了具有竞争力的性能,而无需额外的3D输入。
2 相关工作
视觉语言模型。视觉语言模型(VLMs)[1,27,28,30]在整合视觉和语言方面取得了显著成功。早期工作如CLIP [32]采用对比学习来对齐图像和文本表示,而随后的模型如BLIP [24]则通过更大的数据集和改进的训练策略增强了CLIP。最近的发展[25,26,44]已将VLMs从静态图像扩展到动态视频。例如,Qwen2.5-VL [2]通过动态分辨率机制和绝对时间编码增强了时序推理能力。尽管这些模型是在大规模图像-文本语料库上进行预训练的,但它们并未显式优化以捕捉3D几何信息,从而限制了其3D能力。 带有3D输入的3D视觉语言模型。VLMs的最新进展通过利用显式3D数据作为输入(例如深度图和点云)[9,12,31,35],将其能力从2D扩展到3D场景理解。例如,3D-LLM [13]将通过聚合多视图2D特征获得的3D场景表示注入到大语言模型中,用于3D推理。PointLLM [41]将点编码器与大语言模型相结合,以融合几何、外观和语言信息,用于点云理解。Video-3D LLM [49]将深度图中的每个像素反投影到3D坐标中,并将这些空间线索注入视频特征中。尽管取得了进展,但这些方法依赖于额外的显式3D输入。然而,获取高质量的3D数据需要昂贵的专用传感器,且难以部署,而在大多数现实场景中,只有2D数据(即图像或视频)可用。 仅带有2D输入的3D视觉语言模型。为了克服对显式3D数据的依赖,最近的工作[11,20,40,43,50]已转向
第 4 页
4 李等人
答案:大象的3D位置为 [x_center, y_center, z_center, x_size, y_size, z_size, yaw, pitch, roll]
大型视觉语言模型
T3D 重建的3D属性 3D感知适配器 令牌化 T2D TI TE 问题:大象的3D 位置是什么? 2D视觉令牌 隐式几何令牌 显式几何令牌
2D视觉 3D几何 3D显式 编码器 编码器 嵌入
图2:VLM-IE3D框架概述。VLM-IE3D直接处理RGB帧,无需显式3D输入,使用三个流:(1) 2D视觉编码器,用于提取2D视觉令牌;(2) 3D几何编码器,用于生成用于高层3D信息的隐式几何令牌 (IGTs);(3) 3D显式嵌入,将重建的3D显式表示(例如深度图和点云)转换为编码细粒度结构细节的显式几何令牌 (EGTs)。最后,3D感知适配器将这些互补的令牌融合为统一且富含几何特征的特征,供VLMs使用。
仅从RGB视频理解3D场景。这些方法通常采用3D几何编码器 [19,36],这些编码器在大规模2D-RGB和3D配对数据上进行预训练,以提取隐式3D表示,从而获得3D几何先验,并将其注入VLMs以增强其3D能力。这些隐式表示可以编码场景的全局3D结构关系,例如房间内家具的整体布局。在本工作中,我们认为这种范式并未充分利用3D几何编码器增强VLMs的潜力,因为此类隐式表示通常编码粗略的全局空间先验,难以应对细粒度3D理解任务。相比之下,我们的VLM-IE3D引入了一个新范式,通过联合利用隐式和显式3D几何表示,将全局3D空间先验和详细3D结构信息纳入VLMs。
3 方法
我们提出的VLM-IE3D的概述如图2所示。给定RGB视频序列 $I_i$ 和自然语言查询 $Q$,我们首先使用2D视觉编码器提取2D视觉令牌 $T_{2D} \in \mathbb{R}^{f \times n \times c}$。这里,$I_i \in \mathbb{R}^{h \times w \times 3}$,$f$ 是序列长度,$n = p \times p$,$p$ 是补丁大小,$c$ 是通道维度。视频序列也由3D几何编码器 [19] 处理,以产生隐式几何令牌 (IGTs) $T_I \in \mathbb{R}^{f \times n \times c}$ 以及相应的
第 5 页
具有隐式和显式几何结构的3D感知视觉语言模型 5
3D属性。重建的3D属性进一步通过3D显式嵌入模块进行变换,以生成显式几何令牌(Explicit Geometry Tokens, EGTs)$T_E \in \mathbb{R}^{f \times n \times c}$。随后,这三种类型的令牌通过3D感知适配器(3D-aware adapter)进行融合,产生增强的3D感知视觉令牌$T_{3D}$。最后,预训练的VLM主干网络[2]以$T_{3D}$和$Q$作为输入,生成最终响应。
3.1 隐式和显式几何令牌
我们观察到,现有的空间VLMs [11,17,40,50]仅依赖于由3D几何编码器提取的隐式3D表示(见图1 (a)),而忽视了显式3D表示的潜力。为了解决这一局限性,我们引入了隐式几何令牌(Implicit Geometry Tokens, IGTs)和显式几何令牌(Explicit Geometry Tokens, EGTs)。这两种表示形式本质上是互补的:IGTs提供高层和全局的隐式3D空间先验,而EGTs提供具体且细粒度的显式3D结构细节,从而实现更全面3D理解和推理。在下文中,我们将详细介绍所提出的IGTs和EGTs。
隐式几何令牌。3D几何编码器 [19,33,36,37] 在多样化的3D几何任务(例如深度估计和点云重建)上进行了预训练,已展现出从2D图像中学习和表示3D几何信息的强大能力。这些模型将场景编码为令牌序列以支持3D重建,通常包含三个关键组件:(1) 提取每帧特征图像编码器;(2) 采用交替帧级和全局自注意力机制以促进跨帧交互的融合解码器;以及 (3) 用于估计深度图等3D属性的任务特定预测头。
受这些进展的启发,我们采用 AnySplat [19] 作为我们的3D几何编码器,并利用其融合解码器输出的隐式3D表示作为我们的IGTs $T_I \in \mathbb{R}^{f \times n \times c}$。IGTs以隐式潜在向量的形式编码高层3D空间先验,具备对场景的全局理解范围,例如场景的整体布局(例如卧室的典型结构)以及物体之间的空间关系(例如“电视挂在墙上,沙发放在电视前面”)。通过学习此类表示,我们的方法实现了强大的泛化能力,使其能够在没有显式3D输入的情况下,快速适应不同场景的3D结构建模。
显式几何令牌。尽管IGs在学习全局场景表示方面具有优势,但其压缩和潜在的形式使得语言模型难以解释定量的几何属性,从而限制了其在定量空间理解和推理中的有效性。为了解决这一问题,我们引入了显式几何令牌(Explicit Geometry Tokens, EGTs),这些令牌从重建的显式3D属性中编码具有清晰几何可解释性的详细3D结构信息。
具体而言,我们直接从3D几何编码器 [19] 的相应预测头获取深度图、相机姿态和3D高斯泼溅(3D Gaussian splats)。点图是通过使用重建的相机姿态将重建的深度图反投影到3D坐标中得到的。定义明确的3D属性
第 6 页
6 Li 等人
Q 令牌 隐式几何令牌 (IGTs) 隐式-显式注意力 (IEA) 视觉 K 显式几何令牌 (EGTs) V 3D感知适配器
2D视觉令牌 图 3: 我们 3D感知适配器架构的示意图。它接收隐式和显式 3D几何令牌以及 2D视觉令牌作为输入,以生成最终的 3D感知视觉令牌。为了清晰起见,省略了令牌压缩操作。
$X_E \in \mathbb{R}^{f \times h \times w \times c'}$ 随后通过一个轻量级的 3D显式嵌入模块嵌入到 EGTs $T_E \in \mathbb{R}^{f \times n \times c}$ 中,其中 $c'$ 表示通道维度,该维度因不同的 3D属性类型而异。为了提高效率和可扩展性,我们避免使用重型且复杂的 3D骨干网络(如 DepthAnything V2 [42]),而是使用一个简单的单层 patch 嵌入,后接一个两层 MLP,结构变化和训练成本极小。因此,EGTs 作为具有空间定量测量的显式 3D结构数据的潜在表示,提供了由 IGTs 捕获的隐式先验所补充的显式几何先验。这些显式先验侧重于细粒度的 3D结构细节,可以为 VLMs 提供特定的位置信息,以更好地进行定量理解和推理任务。
3.2 3D感知适配器
经过上述过程,我们获得了三种类型的令牌:2D视觉令牌 $T_{2D}$、IGTs $T_I$ 和 EGTs $T_E$。然后,我们设计了一个 3D感知适配器来有效地整合这三种类型的令牌,如图 3 所示。具体而言,遵循 Qwen2.5-VL [2] 的空间合并策略,我们将每种令牌类型内空间相邻的 $2 \times 2$ 特征拼接起来,并输入到一个两层 MLP 中,产生压缩令牌 $\{\tilde{T}_{2D}, \tilde{T}_I, \tilde{T}_E\} \in \mathbb{R}^{f \times m \times c}$,其中 $m = \frac{h}{2^p} \times \frac{w}{2^p}$。
为了弥合隐式和显式 3D几何表示之间的差距,我们开发了一个隐式-显式注意力 (IEA) 模块来对齐和融合这些互补的表示。它通过多头交叉注意力 (MCA) 层在 IGTs 和 EGTs 之间执行交互。形式上,MCA 中的点积注意力 [34] 表示为:
$$ \operatorname{Attention}(Q, K, V) = \operatorname{softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V, \quad (1) $$
其中查询 $Q \in \mathbb{R}^{n_q \times d}$,键 $K \in \mathbb{R}^{n_k \times d}$,值 $V \in \mathbb{R}^{n_v \times d}$,$d$ 表示特征维度。
第 7 页
具有隐式和显式几何的 3D 感知视觉语言模型 7
对于每一帧 $i$,MCA 将压缩后的隐式几何令牌 $\tilde{T}^I_i$ 作为查询(queries),将压缩后的显式几何令牌 $\tilde{T}^E_i$ 作为键(keys)和值(values),并随后进行残差连接:
$$ \tilde{T}_{3D,i} = \text{MCA}(\tilde{T}^I_i, \tilde{T}^E_i, \tilde{T}^E_i) + \tilde{T}^I_i \quad (2) $$
其中 $\text{MCA}(\cdot)$ 表示多头交叉注意力函数,其输入分别为查询、键和值。
接下来,我们通过逐元素相加的方式将 3D 令牌 $\tilde{T}_{3D}$ 与压缩后的 2D 视觉令牌 $\tilde{T}_{2D}$ 进行融合:
$$ T_{3D} = \tilde{T}_{3D} + \tilde{T}_{2D} \quad (3) $$
通过 3D 感知适配器,我们的 VLM-IE3D 生成统一的 3D 感知视觉表示 $T_{3D}$,该表示与文本嵌入一起输入到预训练的 VLM 中进行最终预测。这种设计使模型能够联合利用隐式和显式的 3D 空间关系,同时保留 2D 视觉语义。
4 实验
4.1 实现细节
我们采用 Qwen2.5-VL-3B [2] 作为 VLM 主干网络,并采用 AnySplat [19] 作为 3D 几何编码器。2D 视觉编码器与 Qwen2.5-VL [2] 中的相同。我们使用 Adam 优化器训练模型一个 epoch,预热比例(warmup ratio)为 0.03。学习率逐渐增加至 $1e-5$,随后衰减至零。每个 GPU 的批次大小(batch size)设置为 1。在训练过程中,冻结 2D 视觉编码器和 3D 几何编码器,而 VLM 主干网络和 3D 显式嵌入保持可训练。所有实验均在 8 块 H100 80G GPU 上进行。
输入图像被重新缩放并裁剪为 $392 \times 518$。我们将补丁大小(patch size)设为 $p = 14$,通道维度设为 $c = 2048$,最大序列长度设为 $f = 32$。令牌数量为 $n = 1036$,压缩后的令牌数量为 $m = 252$。对于显式 3D 表示,我们探索了三种类型的 3D 属性:深度图($c' = 1$)、点图($c' = 3$)和 3D 高斯泼溅(3D Gaussian splats,$c' = 86$)。由于我们的方法不需要真实 3D 场景信息,我们遵循常见的 3D 几何编码器 [19,36],采用第一帧作为所有任务的参考坐标系,但在 3D 视觉定位任务中除外,其中边界框以每帧的局部坐标表示。我们在 EGTs 中使用深度图作为显式 3D 属性,因为它可以从 RGB-D 传感器中更轻松地获取,从而适用于大规模模型训练。
4.2 与最先进方法的比较
为了验证 VLM-IE3D 的有效性,我们在 3D 场景理解和空间推理任务上进行了大量实验,以全面评估其 3D 理解和推理能力。为了公平比较,针对这两类任务分别单独训练各个模型。
第 8 页
8 李等人
表 1:Scan2Cap 上的定量结果。
方法 3D 场景输入 C@0.5↑ M@0.5↑
Scan2Cap [10] ✓ 39.1 22.0 3DJCG [3] ✓ 49.5 24.2 D3Net [5] ✓ 62.6 25.7 Vote2Cap-DETR [8] ✓ 61.8 26.2 LL3DA [7] ✓ 65.2 26.0 Grounded 3D-LLM [9] ✓ 70.2 – LEO [15] ✓ 72.4 27.9 Chat-Scene [14] ✓ 77.1 – LLaVA-3D [52] ✓ 79.2 30.2 Video-3D LLM [49] ✓ 80.0 28.5
Qwen2.5-VL-3B [2] ✗ 58.0 26.9 VG LLM [50] ✗ 78.6 28.6 VLM-IE3D (Ours) ✗ 80.4 28.8
3D 场景理解结果。我们在组合数据集上使用多任务学习训练我们的模型,并在三个基本的 3D 场景理解任务上进行评估:
(i) 3D 密集描述涉及检测 3D 物体提议并基于物体坐标生成描述。我们在 Scan2Cap [10] 基准上进行评估。遵循之前的工作 [49, 50, 52],我们利用由 LEO [15] 提取的 Mask3D 检测到的物体提议,然后模型的任务是基于物体中心坐标生成描述。
(ii) 3D 视觉定位旨在定位目标物体出现的帧及其在相机坐标系中的 3D 边界框。我们使用 ScanRefer [4] 数据集,该数据集包含 36,665 个物体描述,这些描述与 562 个室内扫描中的轴对齐边界框配对。遵循 [45,50],我们通过将预测的边界框与预检测到的物体提议进行匹配来细化预测结果。
(iii) 3D 视频检测预测连续帧序列中所有可见物体的 3D 边界框。我们使用 [50] 从 EmbodiedScan [38] 整理的数据集,其中包含室内场景中连续帧序列及其对应的物体注释。每个样本由以 1 FPS 速率捕获的四帧连续帧组成。遵循 [50],我们将数据划分为 958 个训练场景和 243 个评估场景,分别从每个场景中随机选择 150 个和 10 个样本用于训练和评估。我们在日常生活中常见的 20 个物体类别上评估性能,并报告 IoU 阈值为 0.25 时的平均精度、召回率和 F1 分数,分别记为 P25、R25 和 F125。 我们的 VLM-IE3D 在所有三个 3D 场景理解任务中均表现出强大的性能,持续优于仅使用 2D 视觉输入的方法,同时取得了与使用 3D 场景输入的方法相竞争的结果。
对于 3D 密集描述(Scan2Cap),如表 1 所示,VLM-IE3D 在所有比较方法中取得了最佳的 C@0.5(80.4),并在 2D 视觉输入方法中取得了最佳的 M@0.5(28.8)。与基线相比,VLM-IE3D 在 C@0.5 上相比 Qwen2.5-VL-3B [2] 实现了 22.4 的显著提升,在
第 9 页
3D感知视觉语言模型与隐式和显式几何 9
表2:ScanRefer上的定量结果。“()”中的内容表示经过提议细化后的结果。
方法 3D场景输入 Acc@0.25 Acc@0.50
ScanRefer [4] ✓ 37.3 24.3 MVT [16] ✓ 40.8 33.3 ViL3DRel [6] ✓ 47.9 37.7 Grounded 3D-LLM [9] ✓ 47.9 44.1 Chat-Scene [14] ✓ 55.5 50.2 LLaVA-3D [52] ✓ 54.1 42.4 Video-3D LLM [49] ✓ 58.1 51.7
SPAR [45] ✗ 31.9 (48.8) 12.4 (43.1) Qwen2.5-VL-3B [2] ✗ 34.0 (50.7) 10.6 (44.7) VG LLM [50] ✗ 36.4 (53.5) 11.8 (47.5) VLM-IE3D (Ours) ✗ 43.2 (55.4) 16.9 (48.9)
表3:3D视频检测上的定量结果。每秒帧数(FPS)是在单张H100 GPU上计算的。
方法 参数量 (B) FPS P25 R25 F125
Qwen2.5-VL-3B [2] 3.09 14 32.1 30.1 30.9 VG LLM [50] 3.13 7 41.7 35.7 38.2
VLM-IE3D (Ours) 3.23 6 44.2 41.9 42.8
C@0.5 优于 VG LLM [50],表明我们的隐式几何令牌(IGTs)和显式几何令牌(EGTs)有效地增强了3D空间理解能力。 表2展示了3D视觉定位任务(ScanRefer)的结果。VLM-IE3D在IoU阈值为0.25和0.50时分别取得了43.2%和16.9%的准确率,优于所有不使用3D输入的方法。与Qwen2.5-VL-3B [2]相比,Acc@0.25提升了9.2,与VG LLM [50]相比提升了6.8,这证明了我们方法在物体定位能力上的优越性。经过提议细化后,我们的方法分别取得了55.4%和48.9%的准确率,缩小了与3D场景输入方法的差距。这表明,虽然显式3D输入为精确定位提供了优势,但我们提出的隐式和显式几何编码方法提供了一种具有竞争力的替代方案。 表3展示了3D视频检测任务的结果。VLM-IE3D取得了44.2%的P25、41.9%的R25和42.8%的F125,相较于基线Qwen2.5-VL-3B [2]分别提升了12.1、11.8和11.9,相较于VG LLM [50]分别提升了2.5、6.2和4.6。在所有指标上的一致提升表明,我们提出的隐式几何令牌(IGTs)和显式几何令牌(EGTs)有效地增强了模型在3D视频场景中检测和定位物体的能力。 效率与复杂度分析。我们的方法保持轻量且高效。如表3所示,VG LLM需要3.13B的可训练参数,而VLM-IE3D为3.23B。尽管引入了3D显式嵌入模块、3D感知适配器以及用于EGTs的3D属性重建步骤,VLM-IE3D仅增加了0.10B的参数(边际增长3.2%)。此外,与隐式基线VG LLM相比,我们的推理速度仅轻微下降了1 FPS(在单张H100 GPU上从7 FPS降至6 FPS)。这种轻微的速度下降是一个高度可接受的权衡
第 10 页
10 Li 等人
表 4:在 VSI-Bench 上与最先进方法的定量比较。
对象数量 绝对距离 对象大小 房间大小 相对距离 相对方向 路径规划 近似顺序
模型 平均 数值答案 多项选择答案
专有模型 (API) GPT-4o 34.0 46.2 5.3 43.8 38.2 37.0 41.3 31.5 28.5 Gemini-1.5-Flash 42.1 49.8 30.8 53.5 54.4 37.7 41.0 31.5 37.8 Gemini-1.5-Pro 45.4 56.2 30.9 64.1 43.6 51.3 46.3 36.0 34.6
开源模型 InternVL2-8B 34.6 23.1 28.7 48.2 39.8 36.7 30.7 29.9 39.6 InternVL2-40B 36.0 34.9 26.9 46.5 31.8 42.1 32.2 34.0 39.6 Qwen2.5-VL-3B 30.6 24.3 24.7 31.7 22.6 38.3 41.6 26.3 21.2 Qwen2.5-VL-72B 37.0 25.1 29.3 54.5 38.8 38.2 37.0 34.0 28.9 LongVA-7B 29.2 38.0 16.6 38.9 22.2 33.1 43.3 25.4 15.7 VILA-1.5-40B 31.2 22.4 24.8 48.7 22.7 40.5 25.7 31.5 32.9 VideoLLaMA3-7B 35.8 41.9 23.5 42.2 27.1 39.4 – 32.0 31.4 LLaVA-OneVision-72B 40.2 43.5 23.9 57.6 37.5 42.5 39.9 32.5 44.6 LLaVA-NeXT-Video-72B 40.9 48.9 22.8 57.4 35.3 42.4 36.7 35.0 48.6
空间增强模型 SAT-LLaVA-Video-7B – – – – 47.3 41.1 37.1 36.1 40.4 SPAR-8B 41.1 – – – – – – – – RynnEC-7B 45.8 58.5 25.4 54.9 42.7 44.2 – 38.7 30.5 VG LLM-4B 47.3 66.0 37.8 55.2 59.2 44.6 45.6 33.5 36.4 VLM-IE3D-4B (Ours) 47.6 67.5 38.5 55.0 58.7 47.7 45.1 36.6 31.9
考虑到一致的性能提升(例如,与 VG LLM 相比,3D 视频检测的 F125 提高了 4.6)。我们显式几何嵌入的轻量级特性(它依赖于简单的 MLP 而不是沉重的深度编码器)确保了计算开销保持可忽略不计,从而促进了在现实世界场景中的潜在部署。 定性结果分析。图 4 和图 5 分别展示了 Qwen2.5-VL [2]、VG LLM [50] 和 VLM-IE3D 在 3D 视觉定位和 3D 视频检测方面的定性比较。如图 4 所示,当给定一个引用视频中目标的复杂自然语言查询时,像 Qwen2.5-VL 和 VG LLM 这样的基线模型往往难以准确识别对象出现的第一个确切帧,并且无法在 3D 空间中精确定位它,产生的边界框偏离实际对象边界。相比之下,VLM-IE3D 正确地在地化目标的时间序列,并产生更紧密、更精确的 3D 边界框。同样,在 3D 视频检测任务中(图 5),VLM-IE3D 更好地捕捉细粒度局部几何结构,显著缓解了仅基于隐式方法的基线(VG LLM)中观察到的典型失败案例,如尺度不匹配或漂浮预测。这些定性结果直观地验证了用细粒度结构 EGTs 补充高层 IGTs 能有效提高 VLMs 的时空和 3D 几何感知能力。 空间推理结果。我们遵循 [50] 的训练协议以进行公平比较,利用 SPAR-7M [45] 的子集(234K 样本,完整数据集的 3%)和 LLaVA-Video-178K [47] 的 LLaVA-Hound 分割(63K 样本,原始数据的 25%)。然后,我们在 VSI-Bench 上评估 VLM-IE3D,这是一个评估自我中心-他中心转换和关系推理能力的空间推理基准。 表 4 展示了 VLM-IE3D 与 VSI-Bench 上最先进方法的全面比较。尽管仅使用 4B 参数,我们的方法实现了 47.6% 的最佳平均性能,优于所有基线
第 11 页
3D感知视觉语言模型与隐式和显式几何 11
问题:这是一把靠在墙上的椅子。它位于那把放着红色背包的椅子的右侧。 Qwen2.5-VL
LLM VG
VLM-IE3D
图4:Qwen2.5-VL、VG LLM与我们提出的VLM-IE3D在3D视觉定位方面的定性比较。该任务旨在定位视频中包含文本描述对象的第一帧。我们的VLM-IE3D实现了更优越的定位精度,并生成了更精确的对象边界框。
v
Qwen2.5-VL VG LLM VLM-IE3D Qwen2.5-VL VG LLM VLM-IE3D 图5:Qwen2.5-VL、VG LLM与我们提出的VLM-IE3D在3D视频检测方面的定性比较。我们的方法产生了更准确的3D边界框预测,具有更优越的形状对齐和空间定位能力,精确捕捉了对象几何结构。
包括专有模型如Gemini-1.5-Pro(45.4%),以及参数量显著更大的开源模型如LLaVA-NeXT-Video-72B(40.9%)。在数值回答任务中,我们的模型在对象计数方面表现尤为出色(67.5%),比之前最佳的空间增强模型VG LLM高出1.5。在多项选择题任务中,VLM-IE3D取得了具有竞争力的性能,特别是在需要高几何感知能力且显式结构至关重要的任务中。例如,在VSI-Bench(相对距离)上,我们相比VG LLM取得了显著的+3.1提升(47.7%对比44.6%)。这些改进表明,显式表示有效地捕捉了细粒度信息,以解决纯隐式基线(VG LLM)难以处理的复杂空间歧义,验证了我们的动机,即结合隐式和显式3D表示能够为全面的空间推理提供互补优势。
第 12 页
12 李等人
表 5:隐式和显式 3D 特征表示的消融研究。
方法 P25 R25 F125
基线 [2] 32.1 30.1 30.9
+ EGTs 36.1 33.7 34.7 + IGTs 41.8 39.7 40.5 + IGTs + EGTs 44.2 41.9 42.8
表 6:IGTs 和 EGTs 不同融合策略的消融研究。
方法 P25 R25 F125
VLM-IE3D, Concat 42.7 40.8 41.5 VLM-IE3D, Addition 43.4 41.9 42.4 VLM-IE3D, Weighted 42.3 40.4 41.2 VLM-IE3D, Proposed IEA 44.2 41.9 42.8
4.3 消融研究
为了验证所提模型中各个组件和设计的影响,我们在 3D 视频检测上进行了广泛的消融实验。 隐式和显式几何令牌。我们采用 Qwen2.5-VL-3B [2],该模型未包含任何 3D 几何信息,作为我们的基线模型,并进行消融研究以探讨所提出的 IGTs 和 EGTs 的效果。结果总结在表 5 中。结果表明,引入隐式或显式 3D 表示都能显著提高 VLM 的性能。具体而言,为基线配备 EGTs 将 F125 从 30.9 提升至 34.7,而引入 IGTs 则带来了更显著的提升,从 30.9 提升至 40.5。这些增益可归因于 IGTs 捕获的高层 3D 先验以及 EGTs 提供的详细结构信息,验证了我们的核心见解。值得注意的是,IGTs 带来的提升大于 EGTs,这是预期的,因为 IGTs 编码了更丰富、更通用的 3D 先验,提供了更全面的几何信息。当同时集成隐式和显式 3D 表示时,我们的方法实现了进一步的性能提升,F125 达到 42.8。这比基线(从 30.9 到 42.8)提高了 11.9,比仅使用 EGTs 的基线(从 34.7 到 42.8)提高了 8.1,比仅使用 IGTs 的基线(从 40.5 到 42.8)提高了 2.3。这些结果表明,隐式和显式 3D 表示是互补的,它们的联合集成有效地增强了 VLM 的 3D 能力,验证了我们的动机。 融合策略。为了探究隐式和显式表示(即 IGTs 和 EGTs)之间不同融合机制的效果,我们进行了如表 6 所示的消融研究。我们测试了以下融合策略:(i) Concat:特征拼接后通过线性投影对齐其维度。(ii) Addition:两个特征图的逐元素相加。(iii) Weighted:带有两个可学习权重的逐元素相加。(iv) Proposed IEA:我们提出的 IEA 模块,它在 IGTs 和 EGTs 之间动态交换信息。在这些策略中,所提出的 IEA 产生了最佳
第 13 页
具有隐式和显式几何结构的3D感知视觉语言模型 13
表7:不同显式3D属性的消融研究。
方法 P25 R25 F125
基线 [2] 32.1 30.1 30.9
+ IGTs 41.8 39.7 40.5 + IGTs + EGTs (点云) 44.3 41.7 42.6 + IGTs + EGTs (深度) 44.2 41.9 42.8 + IGTs + EGTs (高斯) 43.9 41.6 42.5
表8:3D显式嵌入不同设计选择的消融研究。
方法 P25 R25 F125
VLM-IE3D, 无 41.8 39.7 40.5 VLM-IE3D, 池化 43.6 41.0 42.0 VLM-IE3D, 位置嵌入 44.0 41.5 42.5 VLM-IE3D, 深层编码器 38.5 34.0 35.9
VLM-IE3D 44.2 41.9 42.8
性能,表明其在整合隐式和显式表示方面的有效性。我们还探索了如公式3所述的不同2D和3D令牌融合策略。实证结果表明,直接且非参数的加法操作足以实现强大的性能。因此,我们选择提出的IEA来融合IGTs和EGTs,并选择加法操作来融合2D和3D令牌。 显式3D属性。我们进一步研究了不同显式3D属性的影响,包括深度图、点图和3D高斯分布。如表7所示,引入任何一种这些显式3D表示都能在所有指标上持续提高性能,取得了高度可比的结果(F125分数在42.5%到42.8%之间)。这表明,只要显式表示提供了具有物理意义的空间测量,它就能有效地弥补IGTs中细粒度结构的缺失。因此,我们在默认设置中选择深度图,因为它是这三种表示中最易获取且参数效率最高的。这些结果验证了不同的显式3D表示可以作为IGTs的稳健几何补充,从而持续增强VLM的空间感知能力。 3D显式嵌入。表8展示了针对VLM-IE3D中3D显式嵌入模块的不同设计选择的消融研究。我们评估了四种用于嵌入显式几何的替代方法:(i) 无:完全移除3D显式嵌入和EGTs。(ii) 池化:用平均池化操作替换我们方法中的一层补丁嵌入。(iii) 位置编码:使用带有正弦位置嵌入 [34] 的平均池化。(iv) 深层编码器:将深度图视为图像,并利用DepthAnything V2 [42] 作为深层编码器。结果表明,我们简单且轻量级的3D显式嵌入模块设计是有效的,它仅引入了0.008B参数(占3.23B可训练参数的微不足道的0.25%),同时实现了显著的性能提升。令人惊讶的是,我们观察到深层
第 14 页
14 李等人
表 9:不同 3D 几何编码器的消融研究。
方法 P25 R25 F125
基线 [2] 32.1 30.1 30.9
VLM-IE3D, π3 43.6 41.2 42.1 VLM-IE3D, VGGT 43.1 40.9 41.7 VLM-IE3D, AnySplat 44.2 41.9 42.8 VLM-IE3D, AnySplat w. DepthAnything V2 43.8 41.5 42.5
编码器架构难以训练且性能次优。 我们假设,复杂的深度模型倾向于过度处理输入并 提取高层抽象语义特征。这本质上与 隐式几何令牌 (IGTs) 的作用重叠,导致特征冗余。相比之下,显式几何需要 空间坐标的直接映射。我们的轻量级设计精确地 保留了这些细粒度细节,避免了过度抽象,作为对抽象程度较高的隐式几何令牌 (IGTs) 的理想补充。 3D 几何编码器。为了评估我们的方法在不同 3D 几何编码器上的泛化能力, 我们使用 VGGT [36]、AnySplat [19] 和 π3 [39] 进行了消融研究。如表 9 所示,所有测试的编码器 均一致地提升了相对于基线模型 [2] 的性能。我们还用 DepthAnything V2 [42] 重建的深度图替换了 AnySplat 的深度图, 从而从不同的源模型中生成隐式几何令牌 (IGTs) 和显式几何令牌 (EGTs)。值得注意的是,该变体也 表现出强大的性能,表明隐式几何令牌 (IGTs) 和显式几何令牌 (EGTs) 可以从单独的模型中提取。为了效率和简洁性,我们在最终框架中使用单个 3D 几何编码器来获取隐式几何令牌 (IGTs) 和显式几何令牌 (EGTs)。这些结果 展示了我们 VLM-IE3D 框架强大的泛化能力,并突出了其与各种 3D 几何编码器无缝集成的灵活性,表明在利用未来 3D 几何编码器进步方面具有巨大潜力。
5 结论
本文提出了 VLM-IE3D,这是一个统一框架,通过整合来自纯 2D 视觉输入的隐式和显式 3D 几何表示,增强了视觉语言模型 (VLMs) 的 3D 空间感知能力。通过隐式几何令牌 (IGTs) 和显式几何令牌 (EGTs) 的互补设计以及 3D 感知适配器的有效融合,我们的方法将强大的 3D 归纳偏置注入到视觉语言模型 (VLMs) 中,并在不需要 3D 输入的情况下实现了整体和细粒度的 3D 理解与推理。在各种 3D 场景理解和空间推理任务上的实验验证了所提出的 VLM-IE3D 的有效性,显示出优于 2D 视觉输入方法且与 3D 场景输入方法具有竞争力的性能。
致谢。本研究由新加坡教育部资助, 在 Tier-2 项目计划下,项目编号为 MOET2EP20123-0003。
第 15 页
具有隐式和显式几何结构的 3D 感知视觉语言模型 15
参考文献
1. Alayrac, J.B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y., Lenc, K., Mensch, A., Millican, K., Reynolds, M., 等: Flamingo: 用于少样本学习的视觉语言模型。在: NeurIPS。第 35 卷,pp. 23716–23736 (2022) 2. Bai, S., Chen, K., Liu, X., Wang, J., Ge, W., Song, S., Dang, K., Wang, P., Wang, S., Tang, J., Zhong, H., Zhu, Y., Yang, M., Li, Z., Wan, J., Wang, P., Ding, W., Fu, Z., Xu, Y., Ye, J., Zhang, X., Xie, T., Cheng, Z., Zhang, H., Yang, Z., Xu, H., Lin, J.: Qwen2.5-VL 技术报告。arXiv 预印本 arXiv:2502.13923 (2025) 3. Cai, D., Zhao, L., Zhang, J., Sheng, L., Xu, D.: 3DJCG: 用于 3D 点云联合密集描述和视觉定位的统一框架。在: CVPR。pp. 16464–16473 (2022) 4. Chen, D.Z., Chang, A.X., Nießner, M.: ScanRefer: 使用自然语言在 RGB-D 扫描中进行 3D 物体定位。在: ECCV。pp. 202–221 (2020) 5. Chen, D.Z., Wu, Q., Nießner, M., Chang, A.X.: D{}^{\mbox{3}}net: 用于 3D 密集描述和视觉定位的统一说话者-听者架构。在: ECCV。pp. 487–505 (2022) 6. Chen, S., Guhur, P.L., Tapaswi, M., Schmid, C., Laptev, I.: 用于 3D 物体定位的语言条件空间关系推理。在: NeurIPS。第 35 卷,pp. 20522– 20535 (2022) 7. Chen, S., Chen, X., Zhang, C., Li, M., Yu, G., Fei, H., Zhu, H., Fan, J., Chen, T.: LL3DA: 用于全 3D 理解、推理和规划的视觉交互式指令微调。在: CVPR。pp. 26428–26438 (2024) 8. Chen, S., Zhu, H., Chen, X., Lei, Y., Yu, G., Chen, T.: 基于 Vote2Cap-DETR 的端到端 3D 密集描述。在: CVPR。pp. 11124–11133 (2023) 9. Chen, Y., Yang, S., Huang, H., Wang, T., Xu, R., Lyu, R., Lin, D., Pang, J.: 基于指代令牌的接地 3D-LLM。arXiv 预印本 arXiv:2405.10370 (2024) 10. Chen, Z., Gholami, A., Nießner, M., Chang, A.X.: Scan2Cap: RGB-D 扫描中的上下文感知密集描述。在: CVPR。pp. 3193–3203 (2021) 11. Fan, Z., Zhang, J., Li, R., Zhang, J., Chen, R., Hu, H., Wang, K., Wang, P., Qu, H., Zhou, S., 等: VLM-3R: 增强了指令对齐 3D 重建的视觉语言模型。在: CVPR。pp. 31054–31065 (2026) 12. Fu, R., Liu, J., Chen, X., Nie, Y., Xiong, W.: Scene-LLM: 扩展语言模型以进行 3D 视觉推理。在: WACV。pp. 2195–2206 (2025) 13. Hong, Y., Zhen, H., Chen, P., Zheng, S., Du, Y., Chen, Z., Gan, C.: 3D-LLM: 将 3D 世界注入大型语言模型。在: NeurIPS。第 36 卷,pp. 20482– 20494 (2023) 14. Huang, H., Chen, Y., Wang, Z., Huang, R., Xu, R., Wang, T., Liu, L., Cheng, X., Zhao, Y., Pang, J., 等: Chat-Scene: 使用物体标识符连接 3D 场景和大型语言模型。在: NeurIPS。第 37 卷,pp. 113991–114017 (2024) 15. Huang, J., Yong, S., Ma, X., Linghu, X., Li, P., Wang, Y., Li, Q., Zhu, S.C., Jia, B., Huang, S.: 3D 世界中的具身通用Agent。在: ICML (2023) 16. Huang, S., Chen, Y., Jia, J., Wang, L.: 用于 3D 视觉定位的多视图变换器。在: CVPR。pp. 15524–15533 (2022) 17. Huang, X., Wu, J., Xie, Q., Han, K.: MLLMs 需要 3D 感知表示监督以进行场景理解。arXiv 预印本 arXiv:2506.01946 (2025) 18. Jia, B., Chen, Y., Yu, H., Wang, Y., Niu, X., Liu, T., Li, Q., Huang, S.: Sceneverse: 扩展用于接地场景理解的 3D 视觉语言学习。在: ECCV。 pp. 289–310 (2024)
第 16 页
16 李等人
19. 蒋, L., 毛, Y., 徐, L., 卢, T., 任, K., 金, Y., 徐, X., 余, M., 庞, J., 赵, F., 等: AnySplat: 从非受限视角进行前馈式 3D 高斯泼溅。 ACM 图形学汇刊 44(6), 1–16 (2025) 20. 蒋, X., 李, W., 钱, Q., 赵, D., 卢, S., 张, G., 徐, R.: 迈向相机鲁棒的 3D 定位: 基于方程锚定的 MLLMs 工具使用。arXiv 预印本 arXiv:2605.19528 (2026) 21. 约翰逊-莱尔德, P.N.: 认知科学中的心理模型。认知科学 4(1), 71–115 (1980) 22. 约翰逊-莱尔德, P.N.: 心理模型:迈向语言、 推理与意识的认知科学。第 6 号,哈佛大学出版社 (1983) 23. 金, M.J., 珀奇, K., 卡拉梅蒂, S., 肖, T., 巴拉克里希纳, A., 奈尔, S., 拉菲洛夫, R., 福斯特, E., 林, G., 桑凯蒂, P., 等: OpenVLA: 一个开源的视觉- 语言-动作模型。在:CoRL (2024) 24. 李, J., 李, D., 熊, C., 霍, S.: Blip: 通过引导式语言-图像预训练实现 统一的视觉-语言理解与生成。在:ICML。第 12888–12900 页 (2022) 25. 李, K., 何, Y., 王, Y., 李, Y., 王, W., 罗, P., 王, Y., 王, L., 乔, Y.: Videochat: 以聊天为中心的视频理解。arXiv 预印本 arXiv:2305.06355 (2023) 26. 林, B., 叶, Y., 朱, B., 崔, J., 宁, M., 金, P., 袁, L.: Video-LLaVA: 通过投影前的对齐学习统一的视觉表示。在:EMNLP。 第 5971–5984 页 (2024) 27. 刘, H., 李, C., 李, Y., 李, Y.J.: 通过视觉指令微调改进基线。 在:CVPR。第 26296–26306 页 (2024) 28. 刘, H., 李, C., 吴, Q., 李, Y.J.: 视觉指令微调。在:NeurIPS。第 36 卷, 第 34892–34916 页 (2023) 29. 马, Y., 宋, Z., 庄, Y., 郝, J., 金, I.: 具身 AI 视觉-语言-动作 模型综述。IEEE 神经网络与学习系统汇刊 (2026) 30. 彭, Z., 王, W., 董, L., 郝, Y., 黄, S., 马, S., 叶, Q., 魏, F.: 将多模态大语言模型锚定到世界。在:ICLR。第 2024 卷,第 51575–51598 页 (2024) 31. 齐, Z., 张, Z., 方, Y., 王, J., 赵, H.: GPT4Scene: 利用视觉语言模型从视频中理解 3D 场景。在:ICLR (2026) 32. 拉德福德, A., 金, J.W., 哈莱西, C., 拉梅什, A., 高, G., 阿加瓦尔, S., 萨斯特里, G., 阿斯凯尔, A., 米什金, P., 克拉克, J., 等: 从自然语言监督中学习可迁移的视觉模型。在:ICML。第 8748–8763 页 (2021) 33. 唐, Z., 范, Y., 王, D., 徐, H., 兰詹, R., 施温格, A., 严, Z.: MV- DUSt3R+: 在 2 秒内从稀疏视角进行单阶段场景重建。在: CVPR。第 5283–5293 页 (2025) 34. 维斯科, A., 沙泽尔, N., 帕尔马尔, N., 乌斯科雷特, J., 琼斯, L., 戈麦斯, A.N., 凯撒, Ł., 波洛舒金, I.: 注意力即你所需要的一切。在:NeurIPS。第 5998–6008 页 (2017) 35. 王, H., 赵, Y., 王, T., 范, H., 张, X., 张, Z.: Ross3D: 具有 3D 感知能力的重建式视觉指令微调。在:ICCV。第 9275–9286 页 (2025) 36. 王, J., 陈, M., 卡拉耶夫, N., 韦达迪, A., 鲁普雷希特, C., 诺沃特尼, D.: VGGT: 视觉几何接地 Transformer。在:CVPR。第 5294–5306 页 (2025) 37. 王, S., 勒瓦, V., 卡邦, Y., 奇多夫斯基, B., 雷瓦, J.: Dust3R: 轻松实现几何 3D 视觉。在:CVPR。第 20697–20709 页 (2024)
第 17 页
具有隐式和显式几何结构的 3D 感知视觉语言模型 17
38. Wang, T., Mao, X., Zhu, C., Xu, R., Lyu, R., Li, P., Chen, X., Zhang, W., Chen, K., Xue, T., et al.: EmbodiedScan: A holistic multi-modal 3D perception suite towards embodied AI. In: CVPR. pp. 19757–19767 (2024) 39. Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., He, T.: π3: Scalable permutation-equivariant visual geometry learning. arXiv preprint arXiv:2507.13347 (2025) 40. Wu, D., Liu, F., Hung, Y.H., Duan, Y.: Spatial-MLLM: Boosting MLLM capabilities in visual-based spatial intelligence. In: NeurIPS. vol. 38, pp. 13569–13597 (2026) 41. Xu, R., Wang, X., Wang, T., Chen, Y., Pang, J., Lin, D.: PointLLM: Empowering large language models to understand point clouds. In: ECCV. pp. 131–147 (2024) 42. Yang, L., Kang, B., Huang, Z., Zhao, Z., Xu, X., Feng, J., Zhao, H.: Depth anything v2. In: NeurIPS. vol. 37, pp. 21875–21911 (2024) 43. Zhang, G., Li, W., Qian, Q., Wang, J., Zhao, D., Lu, S., Xu, R.: On the generalization capacities of MLLMs for spatial intelligence. In: ICLR (2026) 44. Zhang, H., Li, X., Bing, L.: Video-LLaMA: An instruction-tuned audio-visual language model for video understanding. In: EMNLP. pp. 543–553 (2023) 45. Zhang, J., Chen, Y., Xu, Y., Huang, Z., Mei, J., Chen, C., Zhou, Y., Yuan, Y.J., Cai, X., Huang, G., et al.: From flatland to space: Teaching vision-language models to perceive and reason in 3D. In: NeurIPS. vol. 38 (2026) 46. Zhang, T., He, S., Dai, T., Wang, Z., Chen, B., Xia, S.T.: Vision-language pre- training with object contrastive learning for 3D scene understanding. In: AAAI. vol. 38, pp. 7296–7304 (2024) 47. Zhang, Y., Wu, J., Li, W., Li, B., Ma, Z., Liu, Z., Li, C.: LLaVA-Video: Video instruction tuning with synthetic data. arXiv preprint arXiv:2410.02713 (2024) 48. Zhang, Y., Ma, Z., Li, J., Qiao, Y., Wang, Z., Chai, J., Wu, Q., Bansal, M., Kordjamshidi, P.: Vision-and-language navigation today and tomorrow: A survey in the era of foundation models. arXiv preprint arXiv:2407.07035 (2024) 49. Zheng, D., Huang, S., Wang, L.: Video-3D LLM: Learning position-aware video representation for 3D scene understanding. In: CVPR. pp. 8995–9006 (2025) 50. Zheng, D., Li, Y., Wang, L., et al.: Learning from videos for 3D world: Enhancing mllms with 3D vision geometry priors. In: NeurIPS. vol. 38, pp. 20560–20586 (2026) 51. Zhou, G., Hong, Y., Wu, Q.: NavGPT: Explicit reasoning in vision-and-language navigation with large language models. In: AAAI. vol. 38, pp. 7641–7649 (2024) 52. Zhu, C., Wang, T., Zhang, W., Pang, J., Liu, X.: LLaVA-3D: A simple yet effective pathway to empowering LMMs with 3D capabilities. In: ICCV. pp. 4295–4305 (2025)
第 18 页
18 Li 等人
补充材料
本补充材料涵盖以下细节: – 3D 场景理解任务的提示词(第 A 节)。 – 额外的可视化结果(第 B 节)。
A 示例提示词
三个 3D 场景理解任务的详细提示词见表 10。
B 额外可视化结果
我们在图 6 和图 7 中提供了定性结果,将 VLM-IE3D 与 Qwen2.5-VL [2] 和 VG LLM [50] 在 3D 视频检测和 3D 视觉定位任务上进行对比。给定自然语言查询,VLM-IE3D 能够实现更准确的物体定位,并生成边界更紧密的边界框,从而提升检测精度。这些可视化结果证实,通过隐式几何令牌 (IGTs) 和显式几何令牌 (EGTs) 引入隐式和显式 3D 几何先验,显著增强了视觉语言模型 (VLMs) 的 3D 能力,从而实现了更鲁棒的物体定位和检测性能。
第 19 页
具有隐式和显式几何结构的3D感知视觉语言模型 19
表10. 3D场景理解任务的提示词。
3D视觉定位 问题:帧-0: <image> 帧-1: <image> 帧-2: <image> 帧-3: <image> · · · 定位视频中显示文本所述对象的最清晰的第一帧。 文本:房间里有一个吊柜。它的右边有一个冰箱。
答案:
{"frame": 7, "bbox_3d": [-0.2, -0.07, 2.3, 1.23, 0.33, 0.84, -0.5, 1.53, -2.1]} ```
3D密集描述
问题:<image><image><image><image> · · ·
仔细观察视频并详细描述位于 [3.38, -0.19, 2.07] 的对象。
答案:该对象是走廊尽头房间右侧的一个柜子,墙边放着一把红色的椅子。它是白色的,前面放着一把转椅。
3D视频目标检测
问题:<image><image><image><image> · · ·
检测第一帧在相机坐标系中的3D边界框。
输出一个JSON列表,其中每个条目在“label”中包含对象名称,在“box_3d”中包含其3D边界框。
3D边界框格式应为 [x_center, y_center, z_center, x_size, y_size, z_size, yaw, pitch, roll]。
答案:
[ {"label": "socket", "bbox_3d": [0.85, -0.54, 0.5, 0.01, 0.11, 0.11, 1.34, 0.74, -3.11]}, {"label": "doorframe", "bbox_3d": [0.3, -0.62, 0.86, 0.1, 0.9, 2.08, 1.35, 0.74, -3.11]}, · · · ] “`
Qwen2.5-VL VG LLM VLM-IE3D Qwen2.5-VL VG LLM VLM-IE3D 图6:Qwen2.5-VL、VG LLM和我们提出的VLM-IE3D在3D视频检测方面的定性比较。
第 20 页
20 Li 等人
问题:有一个矩形显示器。它位于一张桌子上,右侧还有另一个显示器。 Qwen2.5-VL
LLM VG
VLM-IE3D
问题:有一个矩形显示器。它是离门最近的那一个。 Qwen2.5-VL Qwen2.5-VL LLM VG
LLM VG VLM-IE3D VLM-IE3D
问题:洗手池左侧是纸巾分配器。洗手池上方是浴室镜子。 Qwen2.5-VL
LLM VG
VLM-IE3D
问题:高亮显示的物体是房间内两张床之间的床头柜。床头柜中间有一盏灯。它的高度与床的高度大致相同。 Qwen2.5-VL
LLM VG
VLM-IE3D
图 7:Qwen2.5-VL、VG LLM 和我们提出的 VLM-IE3D 在 3D 视觉定位任务中的定性比较。该任务旨在定位视频中包含文本所描述对象的第一帧。