空间思维链:把3D几何蒸馏进VLM的潜在token,不加重推理负担

快速导读:提出 Space Tokens 框架,将场景级 3D 几何与物体中心空间属性蒸馏为连续潜在 token,在不增加推理模块的前提下提升 VLM 空间推理能力。

视觉语言模型在描述图像内容上已经相当成熟,但一旦涉及真实三维空间关系——比如判断物体之间的绝对距离、估计房间尺寸、理解相机朝向——性能往往大幅下降。根本原因在于,VLM的视觉编码器输出的是二维特征,缺乏对场景三维几何的显式建模。现有解决方案大致分两条路:要么依赖更大规模的模型和数据扩展,要么在推理时挂载专门的几何模块,前者昂贵,后者增加延迟。

本文提出的Space Tokens框架走的是第三条路:把场景级三维几何和物体中心空间属性蒸馏为保留词表token的连续潜在表示,让VLM在自回归推理中直接使用这些空间知识。训练完成后,推理时不需要任何额外的几何模块,空间理解已经内化在token的隐藏状态里。更重要的是,这些token可以解码回显式的三维场景和物体bounding box,为几何理解提供了可验证的证据。

英文题目:Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

论文出处:arXiv 每日论文精选 · arXiv:2608.10278

原始论文:PDF / 论文页面

这篇论文解决什么问题?

空间智能对机器人操作、具身导航和自动驾驶等下游任务至关重要。一个机器人如果无法判断目标物体离自己多远、朝向如何,就无法规划抓取路径。然而,当前VLM的空间推理能力远落后于其二维视觉理解能力。论文指出,现有方法可以归为三类:基础扩展方法如Qwen3-VL和SenseNova-SI,通过扩大模型规模和数据量来提升空间能力;显式空间架构方法如SpaceMind和GeoThinker,引入相机引导融合模块或几何编码器,在推理时额外计算;潜在token知识集成方法如CoVT和Mirage,从专家模型蒸馏视觉表示到潜在token中。

第三类方法最接近本文的思路,但已有工作只覆盖了二维视觉知识,尚未探索显式三维几何与物体中心空间属性的编码。CoVT从多个专家模型蒸馏视觉表示,Mirage用潜在视觉token表示心理意象,但都没有触及场景级三维重建和物体级三维bounding box这类显式几何信息。这正是Space Tokens要填补的空白。

一个具体的失败案例可以帮助理解这个问题:给定一张室内场景图,模型能准确列出所有物体,但当被问到'沙发和茶几之间的实际距离是多少'或'这个柜子相对于相机旋转了多少度'时,答案往往离谱。模型看到的是像素,而不是像素背后的三维结构。

核心创新

  • 提出 Space Tokens:无需架构修改或推理时额外模块,通过保留词表 token 将连续空间表示嵌入 VLM 自回归推理过程
  • 将场景级 3D 重建知识从 VGGT-Omega 蒸馏到 VLM 潜在空间,推理时不再需要大型 3D 重建模型
  • 引入物体级 3D bounding box token,编码位置、朝向、尺寸等物体中心空间属性
  • 学习到的空间 token 可解码为显式 3D 模态(场景重建、3D bounding box),实现几何理解的可视化验证
  • 提出 attention masking 实验替代 TRT,证明多图场景下空间 token 表示被因果性地使用

方法概览

三阶段训练管线:(1) 表示学习阶段,将 VGGT-Omega 的场景级 3D 几何(相机参数、深度图、点图)和物体级 3D bounding box 蒸馏到保留词表 token 的隐藏状态,仅回传对齐/重建损失;(2) SFT 阶段,冻结投影层,通过 teacher forcing 训练 VLM 在思维链中使用空间 token 进行推理,仅对 6 个精选帧推理;(3) GRPO 强化学习阶段,以 VSI-Bench 指标为奖励进一步优化。

  • Space Tokens的核心设计是使用保留词表token的隐藏状态来承载连续空间表示。这些token在词表中被保留但不对应任何离散语义,其隐藏状态可以被训练为编码任意连续信息。推理时,VLM在自回归生成过程中将这些token作为思维链的一部分,从中读取空间知识。
  • 第一阶段是表示学习。作者使用VGGT-Omega作为三维重建教师模型,对输入视频的6个精选帧进行推理,得到相机参数、深度图和点图等场景级几何表示。同时,物体级三维bounding box提供位置、朝向和尺寸等物体中心属性。这些信息被蒸馏到保留token的隐藏状态中,训练时只回传对齐损失和重建损失,不更新VLM主体参数。
  • 第二阶段是监督微调。投影层被冻结,VLM通过标准的next-token prediction训练,在思维链中使用第一阶段学到的空间token进行空间推理。这一阶段使用teacher forcing,即训练时强制使用真实标签作为下一步输入,帮助模型学会如何利用空间token。
  • 第三阶段是GRPO强化学习。以VSI-Bench的指标作为奖励函数,进一步优化模型的空间推理策略。GRPO是Group Relative Policy Optimization的缩写,通过组内相对比较来更新策略,避免了对价值函数的依赖。
  • 一个关键的设计选择是推理时只对6个精选帧进行推理,而不是全部视频帧。消融实验表明,6帧是性能与效率的最佳平衡点,更多帧数并不能带来额外收益。
  • 空间token的可解码性是本文的一个重要特性。训练一个轻量解码器,可以将空间token的隐藏状态解码为显式的三维场景重建和物体bounding box预测。这不仅提供了可视化验证手段,也证明了token中确实编码了可解释的几何信息。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 1: Space Tokens Overview. Our approach embeds interpretable scene-level and object-centric spatial represen- tations directly into the VLM for use during autoregressive reasoning. The learned tokens improve spatial reasoning and can be decoded into explicit spatial modalities to verify the model’s learned geometric understanding

这张概览图展示了Space Tokens的核心流程:场景级和物体中心的空间表示被嵌入VLM的自回归推理过程中,学习到的token可以解码为显式的三维场景和物体bounding box。观察这张图时,注意空间token在推理链中的位置,以及解码路径如何提供可验证的几何理解证据。

研究空白

研究空白
Figure 2: Overview of the proposed three-stage Space Tokens training pipeline. Stage 1 learns continuous spatial token representations by distilling scene-level 3D geometry from VGGT-Omega and object-centric spatial attributes into reserved output vocabulary tokens. Stage 2 supervises the VLM to reason with the learned spatial tokens through standard next-token prediction SFT. Stage 3 further refines spatial reasoning using reinforcement learning. After stage 1, all spatial reasoning is performed using the learned latent tokens without requiring additional model parameters.

三阶段训练管线的完整概览。Stage 1从VGGT-Omega蒸馏三维几何到保留token,Stage 2通过SFT训练VLM使用这些token推理,Stage 3用GRPO进一步优化。关键观察点是Stage 1之后所有推理都使用学习到的潜在token,不需要额外模型参数。

验证与因果证据

验证与因果证据
Figure 4: Qualitative comparison of generated 3D scenes (Top) and predicted 3D object bounding boxes (Bottom). (a.1) and (b.1) showcase the decoded 3D token predictions, while (a.2) and (b.2) depict the corresponding expert predictions from VGGT- Omega. In the bottom images, (c.1-4), the orange lines show the prediction and the green lines show the ground truth.

定性对比图。上半部分对比解码的三维场景重建与VGGT-Omega专家预测,下半部分对比预测的物体bounding box与真值。橙色线是预测,绿色线是真值。观察解码结果与专家预测的相似程度,可以判断token中是否真正编码了几何结构。

结论与意义

结论与意义
Table 1: Results on VSI-Bench full split. Methods are grouped by model type. Best results are shown in bold, second best results are underlined. “–” indicates results not reported. Space Tokens variants are highlighted blue and the pretrained checkpoints are highlighted orange.

VSI-Bench全量测试集的主结果表。方法按模型类型分组,Space Tokens变体以蓝色高亮。关注Space Tokens相对于各自基座模型的提升幅度,以及与其他方法类型的性能对比。

实验如何设计?

  • 主实验在VSI-Bench全量测试集上进行,对比对象包括专有模型、开源通用VLM、架构定制空间模型和纯训练方法。基座模型包括Qwen3-VL-8B和SenseNova-SI-1.3。
  • OOD泛化评估在BLINK、CV-Bench和NExT-QA三个基准上进行,分别测试视觉感知、空间理解和视频问答能力,以检验方法是否造成灾难性遗忘。
  • 消融实验包括:数据扩展消融(仅用VICA-322K微调 vs 加入Space Tokens)、空间任务消融(分别移除3D重建token和bounding box token)、帧数消融(0/4/6/32帧)。
  • 因果验证实验包括Token替换测试(TRT)和attention masking。由于TRT在多图架构下失效,作者设计了attention masking实验,通过屏蔽空间token的注意力来验证其因果作用。
  • 定性可视化实验将学习到的空间token解码为三维场景重建和物体bounding box预测,与VGGT-Omega的专家预测进行对比。

关键结果与论文证据

  • Qwen3-VL-8B加上Space Tokens后,VSI-Bench平均分从59.8提升到64.1,提升4.3个百分点(第6页)。SenseNova-SI-1.3变体从67.6提升到68.9,提升1.3个百分点(第6页)。
  • 在物体尺寸估计和房间尺寸估计两个子任务上达到SOTA,分别为79.2%和75.7%(第6页)。Qwen3-VL-8B变体在房间尺寸上提升最大,达到+15.8(第6页)。
  • OOD基准上,BLINK提升0.5,NExT-QA提升5.6,CV-Bench下降1.5,整体上保持了通用能力(第6页)。
  • 数据扩展消融显示,仅用VICA-322K微调反而使性能降至67.1,而加入Space Tokens后Stage 1&2达到68.6,Stage 3达到68.9(第7页),证明提升来自空间token而非数据量。
  • 空间任务消融显示,仅用bounding box token得67.8,仅用3D重建token得67.4,两者结合得68.4(第7页),说明两类空间知识互补。
  • Attention masking实验使VSI-Bench平均分从63.4降至55.3,物体尺寸下降15.3点(第13页),证明空间token在多图场景下被因果性地使用。
  • 帧数消融显示,0帧和32帧推理均为67.6,4帧为68.4,6帧为68.6(第12页),说明6帧是性能峰值,更多帧数无益。
  • 定性可视化显示,解码的三维场景重建和物体bounding box预测与VGGT-Omega专家预测高度一致(第7页),证明token中编码了可解释的几何结构。

阅读时需要注意

  • Stage 1蒸馏会暂时损伤模型的通用推理能力,有限的Stage 2训练未能完全恢复SenseNova-SI-1.3的原始性能。
  • GRPO奖励函数专为VSI-Bench设计,Stage 3模型不适用于评估OOD泛化,因此Stage 3模型在BLINK和CV-Bench上的表现未报告。
  • 解码的三维重建和bounding box精度有限,因为解码器的训练监督数据相对有限。
  • TRT在多图架构下失效,需要attention masking等替代方案来验证token的有效性,这增加了因果验证的复杂度。

关联工作

  • CoVT(Chain-of-Visual-Thought)是潜在token知识集成范式的代表,从多专家模型蒸馏视觉表示。Space Tokens将其扩展到显式三维空间知识,是这一范式的自然延伸。
  • VGGT-Omega作为Stage 1的三维重建教师模型,提供场景级几何表示。训练完成后,推理时不再需要这个大型模型,这是蒸馏的核心优势。
  • GeoThinker在VSI-Bench上达到72.6分,但使用显式几何编码器,推理时需要额外计算。Space Tokens以纯训练方式达到68.9分,在性能与效率之间取得了不同的平衡。
  • Mirage用潜在视觉token表示心理意象,与Space Tokens同属潜在token集成范式,但Mirage关注的是二维视觉知识,而Space Tokens关注显式三维几何。

发表评论