Qwen-3D:打破3D语言模型的几何信息瓶颈

快速导读:Qwen-3D通过3D旋转位置编码和基于掩码的解码器,将多视图几何信息直接融入Qwen视觉语言模型,在统一的架构中实现了领先的3D和2D视觉语言任务性能。

Qwen-3D 是通义千问团队提出的通用3D视觉语言模型,旨在解决一个核心矛盾:现有3D大语言模型虽然能理解场景语义,但在需要精确几何输出的任务(如指代表达定位和实例分割)上,仍显著落后于专用模型。作者将这一差距归因于“信息瓶颈”——语言推理与密集几何预测之间的信息传递受限。

Qwen-3D 的核心思路是将3D空间信息直接融入视觉语言主干网络,而非仅在解码阶段做表面处理。具体而言,它通过3D旋转位置编码(3D RoPE)让注意力机制在3D世界空间中操作,并通过基于掩码的解码器让语言直接定位到世界坐标,从而在统一的架构中同时实现领先的3D和2D视觉语言任务性能。

英文题目:Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

论文出处:arXiv 每日论文精选 · arXiv:2608.02980

原始论文:PDF / 论文页面

这篇论文解决什么问题?

当前视觉语言模型在长视频理解上受限于帧级标记化和有限的上下文窗口。利用深度和相机位姿将多视图映射到共享3D坐标系统,可以压缩长序列并保持空间一致性。这一思路在Video-3D-LLM等工作中已有初步探索。

然而,现有3D大语言模型在解码几何输出时普遍存在信息瓶颈。LLaVA-3D和Grounded-3D-LLM使用少量专用标记来解码3D边界框或掩码;Video-3D-LLM采用两阶段候选框选择;3D-LLM甚至直接在文本空间输出坐标。这些方法都限制了语言特征向几何空间的充分传递。

与此同时,以UniVLG为代表的专用3D定位模型在ScanRefer等基准上表现强劲,但它们缺乏通用视觉语言理解能力。如何在保持通用性的同时缩小与专用模型的差距,是Qwen-3D试图回答的问题。

Qwen-3D 选择基于Qwen2.5-VL构建,这是一个强大的2D视觉语言模型。作者的目标不是从头训练一个3D专家,而是通过最小但关键的架构修改,让通用模型获得3D空间推理能力。

核心创新

  • 提出几何感知的视觉语言主干网络,通过3D旋转位置编码和基于几何的标记压缩,实现多视图间的空间推理。
  • 设计统一的3D指代表达定位架构,采用基于查询的掩码解码器,将语言直接定位到世界空间,并共享完整的视觉标记表示,消除了信息瓶颈。
  • 建立通用的3D多模态联合训练框架,在2D和3D数据上共同学习,在提升3D空间推理和定位能力的同时,保持了强大的2D视觉语言能力。

方法概览

Qwen-3D基于Qwen2.5-VL构建,包含三个核心组件:1) 几何感知场景表示:将多视图视觉特征反投影到世界坐标系,并通过体素池化压缩冗余观测;2) 几何感知注意力:用3D旋转位置编码替换图像平面位置编码,使注意力在3D世界空间中操作;3) 几何感知解码:将视觉语言主干网络的全量上下文特征直接连接到基于查询的掩码分割解码器,实现语言到3D的密集对齐。模型在2D和3D数据上联合训练。

  • 几何感知场景表示:给定多视图RGB图像、深度图和相机位姿,Qwen-3D首先用Qwen2.5-VL的视觉编码器提取2D特征,然后利用深度和位姿将特征反投影到世界坐标系。为减少多视图间的空间冗余,采用体素池化(Voxel-pooling)对3D空间中的特征进行压缩,将数百个视图标记压缩为紧凑的3D场景表示(第4-5页)。
  • 3D旋转位置编码(3D RoPE):这是Qwen-3D最关键的创新之一。传统视觉语言模型在2D图像平面上使用2D RoPE编码位置,而Qwen-3D将其替换为3D RoPE,直接编码每个标记在世界坐标系中的XYZ位置。这使得注意力机制能够在3D空间中进行几何推理,而非在独立的2D帧之间操作(第4页,图1)。
  • 几何感知注意力掩码:除了位置编码,Qwen-3D还在注意力计算中引入基于3D距离的掩码机制,限制远距离标记之间的注意力交互,进一步提升计算效率和空间局部性(第5页)。
  • 基于掩码的全量标记解码器:这是打破信息瓶颈的关键设计。Qwen-3D将视觉语言主干网络的全量上下文特征直接连接到基于查询的掩码分割解码器(采用Mask2Former架构)。语言查询通过交叉注意力直接访问所有3D视觉标记,而非仅通过少数专用标记。这使得语言到3D的密集对齐成为可能(第5页,图3)。
  • 双任务头设计:Qwen-3D在共享的视觉语言标记上同时接入两个任务头——3D掩码解码器用于指代表达定位和实例分割,文本解码器用于开放域问答。两个头共享完整的视觉标记表示,确保信息充分流动(第5页)。
  • 参数高效微调:为保持2D能力不退化,Qwen-3D在Qwen2.5-VL的基础上仅通过LoRA进行参数高效微调,同时引入3D位置编码和掩码解码器等新组件。这种设计使得模型在获得3D能力的同时,2D性能几乎不受影响(第6页)。
  • 联合训练策略:模型在2D和3D数据上联合训练。3D数据包括ScanNet系列基准的指代表达定位、实例分割和视觉问答任务;2D数据包括RefCOCO系列定位和RealWorldQA问答。这种混合训练确保了跨维度的泛化能力(第6-7页)。
  • 训练细节:Qwen-3D提供3B和7B两个版本。训练分两个阶段——先在3D数据上训练新引入的组件,再在2D和3D混合数据上进行联合微调。所有实验使用8个A100 GPU完成(第6页)。

逐图理解论文

信息瓶颈:一个具体的失败直觉

信息瓶颈:一个具体的失败直觉
Figure 3. Qwen-3D architecture. Given a natural language query and multi-view RGB-D inputs, the Qwen2.5-VL vision encoder extracts multi-view 2D features, unprojects them into world-space XYZ coordinates, and voxel-pools them to reduce spatial redundancy. The resulting tokens are fused with text via Qwen vision–language attention layers augmented with 3D Rotary Positional Embeddings and LoRA adaptation. Two task heads operate on the shared tokens: a 3D mask decoder for referential grounding and instance segmentation and a text decoder for open-ended question answering.

图3是Qwen-3D的完整架构图。从左到右依次展示了多视图输入、视觉编码、反投影与体素池化、3D RoPE增强的视觉语言主干、以及两个任务头(掩码解码器和文本解码器)。这张图是理解整个方法流程的关键。

证据:3D定位追上专用模型,2D能力不退化

证据:3D定位追上专用模型,2D能力不退化
Table 1. Results on 3D Visual Grounding and VQA for both experts and LMMs. ∗2D VLM numbers obtained from prior works [3, 36, 43, 56]

表1汇总了3D视觉定位和视觉问答的主要结果。上半部分为专用模型,下半部分为通用模型。Qwen-3D在ScanRefer上接近UniVLG,在ScanQA和SQA3D上领先其他通用模型,清晰展示了其综合性能优势。

消融实验揭示的关键洞察

消融实验揭示的关键洞察
Table 5. Ablations of Qwen-3D

表5是消融实验的核心结果。逐行展示了移除掩码解码器、3D RoPE、几何注意力掩码和VLM微调后对ScanRefer和ScanQA性能的影响,直接量化了每个组件的贡献。

结论与局限

结论与局限
Figure 6. Failure cases of Qwen-3D on 3D grounding tasks. The red segmentation masks and boxes refer to Qwen-3D’s prediction and the green masks and boxes indicate the ground truth.

图6展示了Qwen-3D的典型失败案例。红色为模型预测,绿色为真值。这些案例揭示了模型在处理细长物体、遮挡严重或语义模糊场景时的局限性,与论文中讨论的静态场景假设和几何估计依赖等限制相呼应。

实验如何设计?

  • 3D指代表达定位:在ScanNet基准的SR3D、NR3D和ScanRefer三个子集上评估,使用Acc@25和Acc@50作为指标。同时评估域外泛化能力,在Locate3D ScanNet++上进行测试(第7页,表1-2)。
  • 3D实例分割:在ScanNet200上评估,使用mAP和mAP25指标,与Grounded-3D-LLM等基线对比(第8页,表3)。
  • 3D视觉问答:在ScanQA和SQA3D上评估,使用EM@1和CIDEr指标(第7页,表1)。
  • 2D能力保持:在RefCOCO、RefCOCO+、RefCOCOg和RealWorldQA上评估,验证模型在获得3D能力后2D性能是否退化(第8页,表4)。
  • 消融实验:系统分析几何感知解码、3D位置编码、注意力掩码和VLM微调等各组件的贡献(第8-9页,表5)。
  • 鲁棒性分析:测试模型对相机位姿噪声、深度噪声和输入视图数量的敏感度,并与专用模型UniVLG对比(第14页,图4-5)。

关键结果与论文证据

  • 3D定位性能接近专用模型:在ScanRefer上,Qwen-3D 3B版本达到62.2% Acc@25,7B版本达到62.8%,与专用模型UniVLG的差距大幅缩小。在域外Locate3D ScanNet++上,Qwen-3D显著超越Video-3D-LLM等通用模型基线(第7页,表1-2)。
  • 3D实例分割大幅领先通用模型:在ScanNet200上,Qwen-3D 3B版本达到25.3% mAP,相比Grounded-3D-LLM提升超过13个百分点,验证了全量标记解码器相对于专用标记解码的优势(第8页,表3)。
  • 3D视觉问答表现优异:在ScanQA上,7B版本达到31.5% EM@1和99.0 CIDEr;在SQA3D上达到59.6% EM@1,均处于通用模型中的领先水平(第7页,表1)。
  • 2D能力几乎无退化:在RefCOCO系列上,Qwen-3D 3B版本平均达到88.1/82.7/84.0,与原始Qwen2.5-VL持平。在RealWorldQA上达到60.4%,证明联合训练策略有效(第8页,表4)。
  • 几何感知解码是最大贡献者:消融实验表明,移除掩码解码器改用专用标记解码,ScanRefer Acc@25下降超过10个百分点,验证了全量标记接口对打破信息瓶颈的关键作用(第9页,表5)。
  • 3D RoPE和注意力掩码均有显著贡献:单独移除3D RoPE或几何注意力掩码均导致性能明显下降,但影响小于解码器设计,说明位置编码和注意力机制共同支撑了3D空间推理(第9页,表5)。
  • 对输入噪声具有鲁棒性:在相机位姿噪声和深度噪声的敏感性测试中,Qwen-3D的性能下降幅度小于专用模型UniVLG,表明通用模型的语义理解能力有助于缓解几何噪声的影响(第14页,图4)。
  • 视图数量影响可控:当输入视图从20帧减少到5帧时,性能下降约10个百分点,但仍保持可用水平,说明体素池化机制有效压缩了多视图冗余(第14页,图5)。

阅读时需要注意

  • 假设静态场景:Qwen-3D假设场景坐标系是静态的,无法处理动态环境中的非刚体运动、物体交互和拓扑变化。这限制了其在机器人操作等动态场景中的应用(第9页)。
  • 缺乏组合推理能力:当前模型主要处理单步定位任务,对需要多步推理的组合指令(如“把左边的椅子推到右边的桌子旁”)支持不足(第9页)。
  • 依赖外部几何估计:模型需要外部估计的深度图和相机位姿作为输入,这些估计的误差会传播到下游任务。尽管模型对噪声有一定鲁棒性,但在极端条件下仍会受影响(第9页)。
  • 2D能力验证范围有限:2D能力保持实验仅在RefCOCO系列和RealWorldQA上进行,可能无法完全覆盖所有2D视觉语言任务(第8页)。

关联工作

  • LLaVA-3D:同样通过修改位置编码将3D信息融入视觉标记,但使用专用标记解码。Qwen-3D的全量标记掩码解码器在性能上显著超越(第1页)。
  • Video-3D-LLM:采用两阶段候选框选择解码,Qwen-3D的单阶段掩码解码在域内和域外定位上均表现更优(第1页)。
  • Grounded-3D-LLM:使用专用标记解码,Qwen-3D在3D实例分割上大幅超越(+13% mAP),直接验证了全量标记接口的优势(第1页)。
  • UniVLG:当前领先的专用3D定位模型,Qwen-3D在ScanRefer上与其性能接近,并在域外泛化性上显著超越,证明了通用模型的泛化优势(第7页)。

发表评论