快速导读:提出 Space Tokens 框架,将场景级 3D 几何与物体中心空间属性蒸馏为连续潜在 token,在不增加推理模块的前提下提升 VLM 空间推理能力。
视觉语言模型在描述图像内容上已经相当成熟,但一旦涉及真实三维空间关系——比如判断物体之间的绝对距离、估计房间尺寸、理解相机朝向——性能往往大幅下降。根本原因在于,VLM的视觉编码器输出的是二维特征,缺乏对场景三维几何的显式建模。现有解决方案大致分两条路:要么依赖更大规模的模型和数据扩展,要么在推理时挂载专门的几何模块,前者昂贵,后者增加延迟。
本文提出的Space Tokens框架走的是第三条路:把场景级三维几何和物体中心空间属性蒸馏为保留词表token的连续潜在表示,让VLM在自回归推理中直接使用这些空间知识。训练完成后,推理时不需要任何额外的几何模块,空间理解已经内化在token的隐藏状态里。更重要的是,这些token可以解码回显式的三维场景和物体bounding box,为几何理解提供了可验证的证据。
英文题目:Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models
论文出处:arXiv 每日论文精选 · arXiv:2608.10278
原始论文:PDF / 论文页面
这篇论文解决什么问题?
空间智能对机器人操作、具身导航和自动驾驶等下游任务至关重要。一个机器人如果无法判断目标物体离自己多远、朝向如何,就无法规划抓取路径。然而,当前VLM的空间推理能力远落后于其二维视觉理解能力。论文指出,现有方法可以归为三类:基础扩展方法如Qwen3-VL和SenseNova-SI,通过扩大模型规模和数据量来提升空间能力;显式空间架构方法如SpaceMind和GeoThinker,引入相机引导融合模块或几何编码器,在推理时额外计算;潜在token知识集成方法如CoVT和Mirage,从专家模型蒸馏视觉表示到潜在token中。
第三类方法最接近本文的思路,但已有工作只覆盖了二维视觉知识,尚未探索显式三维几何与物体中心空间属性的编码。CoVT从多个专家模型蒸馏视觉表示,Mirage用潜在视觉token表示心理意象,但都没有触及场景级三维重建和物体级三维bounding box这类显式几何信息。这正是Space Tokens要填补的空白。
一个具体的失败案例可以帮助理解这个问题:给定一张室内场景图,模型能准确列出所有物体,但当被问到'沙发和茶几之间的实际距离是多少'或'这个柜子相对于相机旋转了多少度'时,答案往往离谱。模型看到的是像素,而不是像素背后的三维结构。
核心创新
- 提出 Space Tokens:无需架构修改或推理时额外模块,通过保留词表 token 将连续空间表示嵌入 VLM 自回归推理过程
- 将场景级 3D 重建知识从 VGGT-Omega 蒸馏到 VLM 潜在空间,推理时不再需要大型 3D 重建模型
- 引入物体级 3D bounding box token,编码位置、朝向、尺寸等物体中心空间属性
- 学习到的空间 token 可解码为显式 3D 模态(场景重建、3D bounding box),实现几何理解的可视化验证
- 提出 attention masking 实验替代 TRT,证明多图场景下空间 token 表示被因果性地使用
方法概览
三阶段训练管线:(1) 表示学习阶段,将 VGGT-Omega 的场景级 3D 几何(相机参数、深度图、点图)和物体级 3D bounding box 蒸馏到保留词表 token 的隐藏状态,仅回传对齐/重建损失;(2) SFT 阶段,冻结投影层,通过 teacher forcing 训练 VLM 在思维链中使用空间 token 进行推理,仅对 6 个精选帧推理;(3) GRPO 强化学习阶段,以 VSI-Bench 指标为奖励进一步优化。
- Space Tokens的核心设计是使用保留词表token的隐藏状态来承载连续空间表示。这些token在词表中被保留但不对应任何离散语义,其隐藏状态可以被训练为编码任意连续信息。推理时,VLM在自回归生成过程中将这些token作为思维链的一部分,从中读取空间知识。
- 第一阶段是表示学习。作者使用VGGT-Omega作为三维重建教师模型,对输入视频的6个精选帧进行推理,得到相机参数、深度图和点图等场景级几何表示。同时,物体级三维bounding box提供位置、朝向和尺寸等物体中心属性。这些信息被蒸馏到保留token的隐藏状态中,训练时只回传对齐损失和重建损失,不更新VLM主体参数。
- 第二阶段是监督微调。投影层被冻结,VLM通过标准的next-token prediction训练,在思维链中使用第一阶段学到的空间token进行空间推理。这一阶段使用teacher forcing,即训练时强制使用真实标签作为下一步输入,帮助模型学会如何利用空间token。
- 第三阶段是GRPO强化学习。以VSI-Bench的指标作为奖励函数,进一步优化模型的空间推理策略。GRPO是Group Relative Policy Optimization的缩写,通过组内相对比较来更新策略,避免了对价值函数的依赖。
- 一个关键的设计选择是推理时只对6个精选帧进行推理,而不是全部视频帧。消融实验表明,6帧是性能与效率的最佳平衡点,更多帧数并不能带来额外收益。
- 空间token的可解码性是本文的一个重要特性。训练一个轻量解码器,可以将空间token的隐藏状态解码为显式的三维场景重建和物体bounding box预测。这不仅提供了可视化验证手段,也证明了token中确实编码了可解释的几何信息。
逐图理解论文
失败案例与直觉

这张概览图展示了Space Tokens的核心流程:场景级和物体中心的空间表示被嵌入VLM的自回归推理过程中,学习到的token可以解码为显式的三维场景和物体bounding box。观察这张图时,注意空间token在推理链中的位置,以及解码路径如何提供可验证的几何理解证据。
研究空白

三阶段训练管线的完整概览。Stage 1从VGGT-Omega蒸馏三维几何到保留token,Stage 2通过SFT训练VLM使用这些token推理,Stage 3用GRPO进一步优化。关键观察点是Stage 1之后所有推理都使用学习到的潜在token,不需要额外模型参数。
验证与因果证据

定性对比图。上半部分对比解码的三维场景重建与VGGT-Omega专家预测,下半部分对比预测的物体bounding box与真值。橙色线是预测,绿色线是真值。观察解码结果与专家预测的相似程度,可以判断token中是否真正编码了几何结构。
结论与意义

VSI-Bench全量测试集的主结果表。方法按模型类型分组,Space Tokens变体以蓝色高亮。关注Space Tokens相对于各自基座模型的提升幅度,以及与其他方法类型的性能对比。
实验如何设计?
- 主实验在VSI-Bench全量测试集上进行,对比对象包括专有模型、开源通用VLM、架构定制空间模型和纯训练方法。基座模型包括Qwen3-VL-8B和SenseNova-SI-1.3。
- OOD泛化评估在BLINK、CV-Bench和NExT-QA三个基准上进行,分别测试视觉感知、空间理解和视频问答能力,以检验方法是否造成灾难性遗忘。
- 消融实验包括:数据扩展消融(仅用VICA-322K微调 vs 加入Space Tokens)、空间任务消融(分别移除3D重建token和bounding box token)、帧数消融(0/4/6/32帧)。
- 因果验证实验包括Token替换测试(TRT)和attention masking。由于TRT在多图架构下失效,作者设计了attention masking实验,通过屏蔽空间token的注意力来验证其因果作用。
- 定性可视化实验将学习到的空间token解码为三维场景重建和物体bounding box预测,与VGGT-Omega的专家预测进行对比。
关键结果与论文证据
- Qwen3-VL-8B加上Space Tokens后,VSI-Bench平均分从59.8提升到64.1,提升4.3个百分点(第6页)。SenseNova-SI-1.3变体从67.6提升到68.9,提升1.3个百分点(第6页)。
- 在物体尺寸估计和房间尺寸估计两个子任务上达到SOTA,分别为79.2%和75.7%(第6页)。Qwen3-VL-8B变体在房间尺寸上提升最大,达到+15.8(第6页)。
- OOD基准上,BLINK提升0.5,NExT-QA提升5.6,CV-Bench下降1.5,整体上保持了通用能力(第6页)。
- 数据扩展消融显示,仅用VICA-322K微调反而使性能降至67.1,而加入Space Tokens后Stage 1&2达到68.6,Stage 3达到68.9(第7页),证明提升来自空间token而非数据量。
- 空间任务消融显示,仅用bounding box token得67.8,仅用3D重建token得67.4,两者结合得68.4(第7页),说明两类空间知识互补。
- Attention masking实验使VSI-Bench平均分从63.4降至55.3,物体尺寸下降15.3点(第13页),证明空间token在多图场景下被因果性地使用。
- 帧数消融显示,0帧和32帧推理均为67.6,4帧为68.4,6帧为68.6(第12页),说明6帧是性能峰值,更多帧数无益。
- 定性可视化显示,解码的三维场景重建和物体bounding box预测与VGGT-Omega专家预测高度一致(第7页),证明token中编码了可解释的几何结构。
阅读时需要注意
- Stage 1蒸馏会暂时损伤模型的通用推理能力,有限的Stage 2训练未能完全恢复SenseNova-SI-1.3的原始性能。
- GRPO奖励函数专为VSI-Bench设计,Stage 3模型不适用于评估OOD泛化,因此Stage 3模型在BLINK和CV-Bench上的表现未报告。
- 解码的三维重建和bounding box精度有限,因为解码器的训练监督数据相对有限。
- TRT在多图架构下失效,需要attention masking等替代方案来验证token的有效性,这增加了因果验证的复杂度。
关联工作
- CoVT(Chain-of-Visual-Thought)是潜在token知识集成范式的代表,从多专家模型蒸馏视觉表示。Space Tokens将其扩展到显式三维空间知识,是这一范式的自然延伸。
- VGGT-Omega作为Stage 1的三维重建教师模型,提供场景级几何表示。训练完成后,推理时不再需要这个大型模型,这是蒸馏的核心优势。
- GeoThinker在VSI-Bench上达到72.6分,但使用显式几何编码器,推理时需要额外计算。Space Tokens以纯训练方式达到68.9分,在性能与效率之间取得了不同的平衡。
- Mirage用潜在视觉token表示心理意象,与Space Tokens同属潜在token集成范式,但Mirage关注的是二维视觉知识,而Space Tokens关注显式三维几何。