三分钟导读:ConsiSpace通过几何一致性记忆(GCM)和统一一致性自监督强化学习(UC-SSRL),有效解决了视频空间推理中的冗余证据聚合和跨视角稳定性问题,在多个基准测试中显著优于现有方法。
英文题目:ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
论文出处:arXiv 每日论文精选 · arXiv:2607.17599
原始论文:PDF / 论文页面
对应视频标题:ConsiSpace:几何一致性记忆与自监督强化学习提升视频空间推理|推荐指数:★★★★★
这篇论文解决什么问题?
现有的多模态大语言模型(MLLMs)在视频空间推理中主要关注语义,缺乏对视角几何和空间结构的建模,导致在处理长视频时面临计算效率低(冗余证据)和跨视角推理不稳定(答案不一致)的问题。
核心创新
- 提出几何一致性记忆(GCM),利用几何变化门控写入和基于语义相似度的几何一致性融合,减少冗余空间证据。
- 设计几何过滤的层次化检索,结合语义相关性和方向一致性选择关键帧证据。
- 引入UC-SSRL,通过自监督的一致性奖励(KL散度、度量误差、拓扑对称性)提升跨视角推理稳定性,无需额外人工标注。
- 构建nuScenes-10K室外合成数据集,补充室内训练数据,提升模型在开放世界场景下的泛化能力。
方法概览
提出ConsiSpace框架,包含:1) 几何一致性记忆(GCM):分离隐式证据token和显式几何线索(位姿、深度),通过几何门控写入、几何一致性融合和几何过滤检索来紧凑地组织证据;2) 统一一致性自监督强化学习(UC-SSRL):在SFT后,利用答案、度量和拓扑一致性奖励优化跨视角稳定性,仅更新LoRA参数。
逐图理解论文
方法概览:ConsiSpace框架

ConsiSpace框架旨在通过几何一致性记忆和自监督强化学习解决上述问题。其核心包括几何一致性记忆模块,用于组织视觉空间token和位姿深度线索;以及统一一致性自监督强化学习策略,用于优化跨视角稳定性。该框架通过紧凑地组织证据并检索查询相关线索,实现高效的空间推理。
创新点一:几何一致性记忆

几何一致性记忆通过分离隐式证据token和显式几何线索,实现证据的紧凑组织。具体而言,它利用几何变化门控写入机制,仅当几何变化显著时才更新记忆,并通过基于语义相似度的几何一致性融合,减少冗余空间证据的累积,从而提升记忆库的纯净度。
创新点三:自监督强化学习

统一一致性自监督强化学习在监督微调后引入,旨在优化跨视角稳定性。该策略利用答案一致性、度量误差和拓扑对称性作为自监督奖励,仅更新LoRA参数,无需额外人工标注。通过最大化不同视角下推理结果的一致性,显著提升了模型在复杂场景下的鲁棒性。
实验结果:VSI-Bench与OSI-Bench

在VSI-Bench基准上,ConsiSpace平均得分76.6,比最强基线SpaceMind高出7.0点。在OSI-Bench上,平均得分53.0,比VLM-3R高出12.7点。这些结果证明了GCM和UC-SSRL在室内和开放世界空间推理任务中的有效性,显著超越了现有方法。
实验结果:MMSI-Video-Bench

在MMSI-Video-Bench基准上,ConsiSpace在Sufficient-Coverage设置下平均得分57.5,在Uniform-50设置下平均得分58.1。该基准涵盖感知、规划、预测和跨视频推理,结果表明ConsiSpace在多模态空间智能任务中具备强大的泛化能力和综合性能。
实验与关键结果
- 在VSI-Bench、OSI-Bench和MMSI-Video-Bench三个空间推理基准上进行评估。
- 进行消融实验,分析GCM各组件(门控写入、融合、过滤检索)及UC-SSRL各奖励项的贡献。
- 评估模型对噪声几何估计的鲁棒性。
- 分析端到端效率、显存占用和推理时间随输入帧数增加的扩展性。
- 在Habitat ObjectNav任务上进行导航导向验证。
- VSI-Bench平均得分76.6,比最强基线SpaceMind高7.0点(第 9 页)
- OSI-Bench平均得分53.0,比VLM-3R高12.7点(第 10 页)
- MMSI-Video-Bench在Sufficient-Coverage设置下平均得分57.5,在Uniform-50设置下平均得分58.1(第 11 页)
- 在200帧输入下,ConsiSpace显存占用35.0GB,推理时间3.10秒,优于VLM-3R(78.5GB, 10.80s)且准确率更高(第 12 页)
- nuScenes-10K人工验证正确率91.6%(第 21 页)
阅读时需要注意
- 几何估计误差:在运动模糊、反射表面或无纹理区域,位姿和深度预测错误可能影响GCM性能。
- 基于阈值的记忆控制:虽然对阈值选择鲁棒,但自适应门控和融合可能进一步提升鲁棒性。
- 长视界扩展:极长视频可能需要更强的记忆压缩或学习到的驱逐策略以维持计算预算。
- UC-SSRL仅在LoRA参数上进行优化,基座模型和编码器保持冻结。
- GCM的性能依赖于VGGT等几何基础模型的准确性,噪声几何输入会导致性能逐渐下降(见Table 8)。
关联工作
- VLM-3R:基线模型,通过指令对齐的3D重建增强MLLM,ConsiSpace在OSI-Bench上显著超越。(第 10 页)
- SpaceMind:基线模型,相机引导的模态融合,ConsiSpace在VSI-Bench上超越。(第 9 页)
- Cambrian-S:基线模型,空间超感知,在VSI-Bench和MMSI-Video-Bench上作为强基线对比。(第 9 页)
- GeoThinker:基线模型,主动几何集成,在噪声几何鲁棒性实验中作为对比对象。(第 13 页)
- Spatial-SSRL:相关工作,依赖内在预训练任务,ConsiSpace的UC-SSRL不同,利用视频空间推理中的多视角一致性。(第 8 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
ConsiSpace:学习几何一致性 对视频空间推理至关重要
Ting Huang2, Zhenyu Zhang1†, Wenyuan Huang1, Jian Yang1, 和 Hao Tang2,3†
1 南京大学 智能科学与技术学院,中国南京 2 北京大学 计算机学院,中国北京 3 北京人工智能研究院,中国北京 † 通讯作者:zhangjesse@foxmail.com bjdxtanghao@gmail.com. https://believeht029.github.io/ConsiSpace/
…… 问题:床在哪里,它面向电视? VSI-Bench ConsiSpace ConsiSpace (SFT) (SSRL) Qwen3-VL-8B VLM-3R 对象计数 A: 左前 B: 右前 近似顺序 绝对距离 C: 左后 D: 右后 空间编码器 视觉编码器 视角 1 视角 2
几何一致性记忆 空间编码器 视觉语言模型 MMSI-Video-Bench U50 OSI-Bench 路径规划 对象大小 统一一致性 SSRL
预测答案 2026 SpaceMind 视角 1: B 视角 2: D 不一致 相对方向 房间大小 Cambrian-S 视角 1: D 视角 2: C 不一致 所有点(基线) 门控与融合( ours) 我们的方法 视角 1: D 视角 2: D 一致 MMSI-Video-BenchSC 相对距离 Jul (a) 效率 (b) 鲁棒性 (c) 性能 图 1:ConsiSpace 学习视频空间推理的几何一致性。 (a) 效率:几何一致性记忆通过门控写入和融合减少冗余的空间证据。 (b) 鲁棒性:统一一致性 SSRL 提高了跨视角的答案稳定性。 (c) 性能:ConsiSpace 在基准测试和 VSI 子任务中持续提高空间推理性能。
摘要。视频空间推理对于面向导航的感知和长视频问答至关重要,模型必须在视角变化的情况下推断长视野内的空间关系。然而,现有的多模态大语言模型(MLLMs)仍然主要以语义为中心,往往无法从冗余的视频观察中可靠地聚合一致的空间证据,导致推理效率低下或不稳定。为了解决这些问题,我们提出了 ConsiSpace,这是一个感知几何一致性的框架,用于对几何敏感的视频空间推理,将空间一致性既作为证据组织原则,又作为显式的后监督微调(SFT)学习信号。我们构建了包含隐式证据 token 和显式几何线索的几何一致性记忆(GCM),并利用高效的组织策略紧凑地保留与任务相关的空间证据。此外,我们在监督微调后利用统一一致性自监督强化学习(UC-SSRL)来提高跨视角稳定性,采用基于答案、度量和拓扑一致性的奖励。在三个空间推理基准测试 VSI-Bench、OSI-Bench 和 MMSI-Video-Bench 上的大量实验表明,性能持续提升,平均得分比最强基线高出 12.6 分。arXiv:2607.17599v1
关键词:视频空间推理 · 几何一致性 · 自监督强化学习
第 2 页
2 T. Huang 等
1 引言
视频空间推理是面向导航的感知 [10, 16, 24, 27, 28, 39] 和视频问答 [3, 33, 37, 48] 的核心能力。它要求智能体和模型在部分可观测性或长视频上下文中推断物体位置、场景连通性、方向以及空间关系。这些需求使得视频空间推理成为长上下文理解与物理空间推理交叉领域的一个实际挑战。
尽管多模态大语言模型 (MLLMs) [1, 11–13, 29–31, 53] 取得了快速进展,但近期的空间基准测试 [23, 44, 45] 表明,可靠的空间推理仍然是一个关键瓶颈。许多视频 MLLM 以语义为先:它们强调识别和语言条件推理,而对视角几何和空间结构的建模较弱。最近的工作通过空间数据、训练目标和推理格式来解决这一局限性,例如 SpaceR [26]、ViLaSR [43]、Cambrian-S [46] 和 RoboBrain [15]。另一个方向是将显式空间线索整合到 MLLM 中。前馈式几何基础模型,如 DUSt3R [36]、MASt3R [17] 和 VGGT [35],能够从 RGB 视频中提供位姿、深度和结构信号。基于这些几何先验,Spatial-MLLM [42]、VLM-3R [7]、SpaceMind [50] 和 GeoThinker [20] 将感知几何的 token 融合到 MLLM 中。其他方法利用显式的 3D 表示或地图以实现更强的接地能力和可解释性,包括 Video-3D LLM [52]、N3D-VLM [41]、GS-Reasoner [4] 和 Map2Thought [8]。
然而,视频空间推理仍面临两个实际挑战:效率以及在视角变化下的鲁棒性。相邻帧通常包含冗余的空间证据,因此存储或关注更多帧会增加内存和计算量,但收益不成比例,如图 1(a) 所示。此外,冗余或不匹配的证据可能导致不一致的空间接地,并在不同视角下产生不稳定的答案,如图 1(b) 所示。我们认为,这两个挑战都可以通过利用空间一致性来解决:在静态场景的平滑视角变化下,正确的空间关系应保持不变,这为紧凑的证据组织和稳定的推理提供了自然的信号。
为此,我们提出了 ConsiSpace,这是一个感知几何一致性的视频空间推理框架。ConsiSpace 将 3D 空间一致性既作为证据组织原则,又作为监督微调 (SFT) 后的学习目标。它引入了几何一致性记忆 (Geometry-Consistent Memory, GCM),用于存储带有显式位姿和深度线索的视觉空间证据,并通过几何引导的写入、融合和检索来组织这些证据,从而实现紧凑且鲁棒的推理。为了进一步提高视角稳定性,我们提出了统一一致性自监督强化学习 (Unified Consistency SSRL, UC-SSRL),它在监督微调锚定答案正确性后,优化成对视角间的答案、度量和拓扑一致性。在 MMSI-Video-Bench [23]、OSI-Bench [44] 和 VSI-Bench [45] 上的大量实验证明了 ConsiSpace 在空间构建、关系和度量推理任务中的有效性。总体而言,如图 1(c) 所示,ConsiSpace 的平均得分比最强基线高出 12.6 分。
第 3 页
ConsiSpace 3
我们的主要贡献如下:
– 我们提出了 ConsiSpace,这是一种感知几何一致性的视频空间推理框架,用于组织空间证据并提高视角稳定性。 – 我们引入了几何一致性双记忆(Geometry-Consistent Dual-Memory),具备几何引导的写入、融合和检索功能,并结合统一一致性自监督强化学习(UC-SSRL)进行监督微调(SFT)后的一致性学习。 – 在三个空间推理基准上的大量实验和分析表明,ConsiSpace 的平均得分比最强基线高出 12.6 分。
2 相关工作
多模态大语言模型。多模态大语言模型(MLLMs)[1,29,31] 推动了通用图像和视频理解的发展。最近的长视频 MLLMs [5] 和记忆增强智能体 [38] 通过更长的上下文、检索或外部记忆提高了时间可扩展性。然而,近期的空间基准测试 [6, 18, 23, 45, 47] 表明,可靠的空间推理仍然具有挑战性。通用 MLLMs 在语义感知和语言条件推理方面表现强劲,但往往缺乏跨视角和长时间上下文保持空间一致性的显式机制。我们的工作建立在 MLLMs 之上,同时专注于对几何敏感的视频空间推理,而非通用视频理解。
面向空间推理的空间感知 MLLMs。先前的工作通过 3D 线索、空间监督和以推理为中心的训练来改善空间推理。一些方法注入显式的 3D 信息,例如 Video-3D LLM [52] 和 N3D-VLM [41]。其他方法依赖于基于重建或一致性的监督,例如 RoSS3D [34] 和 VLM-3R [7],或者扩展空间数据和训练规模,例如 Cambrian-S [46]。以推理为中心的方法进一步通过强化学习(RL)、接地感知思维链(CoT)或以 3D 为中心的推理来增强复杂的空间推理,包括 SpatialLadder [21]、GS-Reasoner [4] 和 Think3D [49]。几种方法还设计了感知几何的集成模块,例如 SpaceMind [50] 和 GeoThinker [20]。尽管取得了显著进展,但这些方法主要关注表示设计或训练时的监督,对冗余视频证据的写入、融合和检索控制有限。相比之下,我们将几何一致性作为管理整个记忆生命周期的显式标准。
结合几何基础模型的 MLLMs。几何基础模型从单目或多目图像中提供强大的 3D 先验,使得无需完整 3D 监督即可实现感知几何。代表性例子包括 DUSt3R 风格的重建 [36]、基于 VGGT [35] 的前馈几何、置换等变几何学习 ($\pi^3$) [40] 以及深度基础模型如 Depth Anything 3 [22]。这些模型通常通过特征融合、蒸馏或对齐方式集成到 MLLMs 中,如 VG-LLM [51]、G2VLM [9]、3DRS [14]、Spatial Forcing [19] 和 Spatial-MLLM [42]。然而,几何
第 4 页
4 T. Huang 等
LoRA 视觉语言模型
文本解码器 参数 一致性感知查询融合网络 优化 答案: D
奖励计算 几何一致性记忆 检索到的 一致性奖励 证据 拓扑一致性 查询 𝑅topo = −𝛽(KL(𝑃!||𝑃")) 几何过滤检索 +KL(𝑃"||𝑃!)
度量一致性 隐式 空间 记忆 显式 空间 记忆 视角𝒊: 2.3m 关键帧 潜在 条目 几何 线索 2.4m 𝑅metric = −η )𝑑! −)𝑑" 视角𝒋:
双视角一致性 视角𝒊: D D 𝑅KL = −𝛼KL(𝜋!||𝜋") 视角𝒋: … … 双视角预测
双视角采样器
几何门控写入与几何一致性融合
视角! 视角"
UC-SSRL
视觉令牌 空间令牌 相机位姿 深度图 文本编码器
视觉 空间编码器 问题: 当站在桌子旁并面向床时, 编码器 电视出现在哪里? 哪里? A. 右前 B. 左后 C. 左前 D. 右后
图 2: ConsiSpace 概览。ConsiSpace 使用几何一致性记忆组织视觉-空间令牌和位姿-深度线索,检索与查询相关的证据以生成答案,并使用 UC-SSRL 提高视角稳定性。
先验知识主要被用作输入特征或训练信号,而它们在长视频证据管理中的作用尚未得到充分探索。相反,我们将几何视为一致性标准,用于决定在分层检索过程中何时写入、如何融合以及保留什么。
3 方法
3.1 概览
我们考虑视频空间推理任务,其中模型根据视频 $V = \{I_t\}_{t=1}^T$ 回答查询 $q$,并生成输出 $y$。此设置要求在较长的时间范围内进行可靠的空间推理,而观察结果往往是冗余的,且空间证据可能稀疏或依赖于视角。ConsiSpace 通过使用几何一致性来组织视频证据并稳定跨视角推理来解决这一问题。如图 2 所示,ConsiSpace 由双编码器、具有更新和读取
第 5 页
ConsiSpace 5
View!# View! Stored Memory Implicit Memory: Stored Memory !! = Pack($!, &!) Explicit Memory: (! = ()!, *!) cos(!!, !") RetrievalChunk Input Video ∆%! > '" ∆(! > '# View)(stored) Max# ∈%(') Retrieved Chunk … %(') ≠∅ +(,) WRITE SKIP View!⋆ ! + 2 … ∆/! ∆%! ≤'" ∆(! ≤'# )(*) FUSE ! −1 View# Frame Search Geometric Retrieval ∆.! ! + 1 ! −2 %(') = ∅ New View Retrieved Frame ! Camera Trajectory View!(new) APPEND View!"# View! Input Video & Camera Pose Geometry-Gated Writing Geometry-Consistent Fusion Geometry-Filtered Retrieval Fig. 3: Geometry-Consistent Memory (GCM) evidence lifecycle. GCM uses geometry-gated writing, geometry-consistent fusion, and geometry-filtered hierarchical retrieval to compact redundant views and retrieve query-relevant evidence.
operations, a query-conditioned fusion module, and a video language model for prediction. During training, we start from the supervised fine-tuned model and apply unified consistency self-supervised reinforcement learning (UC-SSRL) to refine viewpoint stability with self-supervised consistency rewards.
3.2 Feature Extraction
Visual tokens. Given each frame It, we extract patch-level visual embeddings using a frozen SigLIP2 [32] vision encoder Evis:
X _t = E_{\text{vis}}(I_t),\qquadX_t\in\mathbb{R}^{N\timesd}, (1)
where N denotes the number of visual tokens and d is the embedding dimension. These tokens provide semantic evidence for memory construction and retrieval. Spatial tokens and geometric cues. We extract geometry-aware representations with a frozen VGGT [35] geometry encoder Espa. Given a frame It optionally conditioned on preceding frames I<t, VGGT produces spatial tokens and explicit geometric cues:
S _t , G_t = E_{\text{spa}}(I_t\,;\,I_{<t}), (2)
where St denotes geometry-aware spatial tokens, and Gt includes camera pose Tt and per-frame depth map Dt. These cues provide geometric consistency signals for memory writing, fusion, and retrieval.
3.3 Geometry-Consistent Memory
ConsiSpace maintains a Geometry-Consistent Memory M with two complementary banks (Fig. 2). The Implicit Spatial Memory Mimp stores per-frame evidence tokens, including visual semantics and spatial tokens, for query-relevant retrieval. The Explicit Spatial Memory Mexp stores camera poses and depth cues, which provide geometry-based consistency signals for memory control. This separation decouples evidence representation from geometry-guided operations: Mimp supports evidence retrieval, while Mexp guides geometry-gated writing, geometry-consistent fusion, and geometry-filtered retrieval (Fig. 3).
第 6 页
6 T. Huang 等
记忆条目。对于每一帧 $t$,我们通过打包视觉 token $X_t$ 和空间 token $S_t$ 来构建隐式证据条目:
$$ e_t = \textsc{Pack}(X_t, S_t), \qquad g_t = (T_t, D_t), \quad (3) $$
其中 $T_t$ 是相机位姿,$D_t$ 是由空间编码器预测的逐帧深度图。$\textsc{Pack}(\cdot)$ 将视觉和空间 token 拼接并投影到固定长度的证据表示中。我们将 $e_t$ 存储在 $M_{\text{imp}}$ 中,并将对齐的几何线索 $g_t$ 以相同的时间戳存储在 $M_{\text{exp}}$ 中。
几何门控写入。相邻帧通常存在冗余,因此将每一帧写入内存效率低下。我们使用由几何编码器预测的几何变化来门控内存写入。设 $T_t$ 为相机位姿,$(p_t, v_t)$ 表示从 $T_t$ 导出的相机位置和观察方向。我们计算帧间运动和视角变化:
$$ \Delta p_t = \| p_t – p_{t-1} \|_2, \qquad \Delta \theta_t = \angle(v_t, v_{t-1}), \quad (4) $$
仅当可能出现新的空间证据时才写入条目:
$$ \textsc{write}(t) = \mathbb{I}\left[\Delta p_t > \tau_p \lor \Delta \theta_t > \tau_\theta\right] \quad (5) $$
这种几何门控策略在视角平滑变化时抑制冗余写入,同时保留信息丰富的转换。
几何一致性融合。当 $\textsc{write}(t) = 1$ 时,我们进一步整合几何一致的条目。我们为条目 $t$ 定义几何邻域:
$$ \mathcal{N}(t) = \left\{ j : \|p_t – p_j\| < r, \angle(v_t, v_j) < \theta \right\} \quad (6) $$
如果 $\mathcal{N}(t) \neq \emptyset$,我们基于证据空间中的语义相似度选择融合目标:
$$ \hat{j}^\star = \arg \max_{j \in \mathcal{N}(t)} \cos(k_t, k_j), \qquad k_t = W_k e_t, \quad (7) $$
其中 $k_t$ 是从证据条目 $e_t$ 投影出的键。然后我们将 $e_t$ 融合到 $e_{\hat{j}^\star}$ 中;否则,我们将 $(e_t, g_t)$ 作为新条目追加。这一步在保持几何一致性场景记忆的同时减少了重复证据。
几何过滤检索。给定查询 $q$,我们通过文本编码器 $E_{\text{text}}$ 获取文本嵌入 $q_e$ 并执行由粗到细的检索。我们首先基于语义相关性检索候选块:
$$ s_c(j) = \cos(q_e, k_j^c), \qquad C_{\text{topk}} = \textsc{TopK}\left(\{s_c(j)\}, K_c\right) \quad (8) $$
这以较低的成本优先保证召回率。
在候选块内,我们通过结合语义相关性和轻量级几何项来细化帧级选择:
$$ s_f(i) = \alpha \cos(q_e, k_i^f) + \beta \cos(Q_{\text{topo}}, e_i^{\text{dir}}), \quad (9) $$
其中 $Q_{\text{topo}}$ 是从 $q$ 导出的方向导向嵌入,$e_i^{\text{dir}}$ 编码从 $T_i$ 导出的观察方向。我们根据 $s_f(i)$ 选择前 $K_f$ 帧 $F_{\text{topk}}$ 并收集相应的证据。
第 7 页
ConsiSpace 7
除了检索到的证据外,我们还构建轻量级的摘要 token,以提供全局拓扑和度量上下文。给定 $q_e$,我们推导出两个查询向量:
$Q_{\text{topo}} = W_{\text{topo}}q_e,\qquad Q_{\text{metric}} = W_{\text{metric}}q_e,$ (10)
其中 $Q_{\text{topo}}$ 强调拓扑线索,如相对方向或连通性,而 $Q_{\text{metric}}$ 强调度量线索,如距离、大小和顺序。我们通过查询条件聚合计算摘要 token:
$z_{\text{topo}}=\mathrm{CA}(Q_{\text{topo}}, \mathcal{B}_{\text{topo}}),\qquad z_{\text{metric}}=\mathrm{CA}(Q_{\text{metric}},\mathcal{B}_{\text{metric}}),$ (11)
其中 $\mathrm{CA}(\cdot)$ 表示轻量级的查询条件聚合算子。$\mathcal{B}_{\text{topo}}$ 包含来自 $M_{\text{imp}}$ 的值,$\mathcal{B}_{\text{metric}}$ 包含来自 $M_{\text{exp}}$ 的嵌入几何线索。 最后,我们通过连接查询 token、摘要 token、检索到的证据 token 以及对齐的几何线索,为视频语言模型形成上下文:
$Z=\mathrm{Concat}\big( [\mathrm{TOK}(q)] ,\, z_{\text{topo}},z_{\text{metric}},\,\{z_i\}_{i\in F_{\text{topk}}},\,\{g_i\}_{i\in F_{\text{topk}}}\big)$ (12)
其中 $\{z_i\}$ 是来自 $M_{\text{imp}}$ 的证据 token,$\{g_i\}$ 是来自 $M_{\text{exp}}$ 的对齐几何线索。在实践中,几何过滤可以通过在评分期间降低不一致条目的权重或在连接之前屏蔽它们来实现。生成的序列 $Z$ 被投影到语言模型嵌入空间,并输入到视频语言模型中进行预测。
3.4 统一一致性自监督强化学习
虽然几何一致性记忆有效地组织了证据,但当从不同的时间窗口或检索到的证据集观察同一问题时,模型仍可能产生不同的答案。这种不一致性表明在视角变化下空间接地(spatial grounding)的脆弱性。因此,我们在监督微调(SFT)之后优化跨视角几何一致性,其中 SFT 提供任务对齐的初始化,而 UC-SSRL 进一步细化视角稳定性。与依赖内在预训练任务的 Spatial-SSRL [25] 不同,我们的目标从视频空间推理的多视角一致性中导出自监督奖励:如果潜在的 3D 关系是稳定的,来自不同视角的预测应该一致。 双视角采样器。给定训练样本 $(V, q)$,我们为同一问题构建两个观测值,例如两个时间窗口、两个检索上下文或两个证据集:
$o_i = \mathcal{S}(V ,q;\xi_i),\qquad o_j=\mathcal{S}(V,q;\xi_j),$ (13)
其中 $\mathcal{S}(\cdot)$ 表示双视角采样器,$\xi_i, \xi_j$ 是随机采样选择。将 $(o_i, q)$ 和 $(o_j, q)$ 输入模型会产生两个预测答案分布 $\pi_i, \pi_j$。
第 8 页
8 T. Huang 等
统一一致性奖励。我们设计了三种互补的自监督奖励,以优化跨视角的答案级、度量和关系稳定性。 双视角答案一致性。我们通过惩罚两个预测答案分布之间的差异,鼓励它们达成一致:
R _ { \mathrm {KL} } = -\alpha\,\mathrm{KL}(\pi_i || \pi_j), (14)
从而稳定不同视角下的答案。 度量一致性。对于与度量相关的问题,如距离和大小,令 \hat{d}_i 和 \hat{d}_j 表示从两个视角推断出的距离估计值。我们通过以下方式强制一致性:
R_{\mathrm{metric}} = -\eta\,|\hat{d}_i – \hat{d}_j|. (15)
拓扑一致性。对于关系推理,令 P_i 和 P_j 表示从两个视角导出的归一化关系分布。我们鼓励对称的一致性:
R_{\mathrm{topo}} = – \beta \left(\mathrm{KL}(P_i || P_j) + \mathrm{KL}(P_j || P_i)\right) (16)
我们将它们组合成一个统一奖励:
R = R_{\mathrm{KL}} + R_{\mathrm{metric}} + R_{\mathrm{topo}}, (17)
并使用策略梯度风格的目标函数优化模型。UC-SSRL 从 SFT 模型初始化,并在无需额外人工标注的情况下优化一致性;在我们的实现中,仅更新 LoRA 参数(图 2),使其轻量且与基于记忆的证据组织互补。
4 实验
4.1 评估基准
VSI-Bench。VSI-Bench [45] 评估来自室内场景视频的视觉空间智能,要求模型从连续观测中推断空间关系和度量。它包含来自 288 个真实世界室内视频的 5,000 多个问答对,涵盖配置、度量估计和时空任务。遵循其协议,我们报告多项选择题答案(MCA)任务的准确率(Accuracy)和数值答案(NA)任务的平均相对准确率(Mean Relative Accuracy, MRA)。对于预测值 \hat{y} 和真实值 y,MRA 是在容差阈值 \mathcal{C} = \{0.50, 0.55, \dots, 0.95\} 上计算的:
\mathrm{MRA} = \frac{1}{|\mathcal{C}|}\sum_{\theta\in\mathcal{C}}\mathbb{I}\left(\frac{|\hat{y}-y|}{y} < 1-\theta\right) (18)
OSI-Bench。OSI-Bench [44] 针对基于行人视角视频的开世界空间推理,其同步
第 9 页
ConsiSpace 9
表 1:VSI-Bench 结果。“Avg.”表示总体均值。加粗和下划线分别表示最佳和第二佳结果。
| | Count | Dist. | Size | Size | Dist. | Dir. | Plan | Order | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | Method | Avg. | Obj. | Abs. | Obj. | Room | Rel. | Rel. | Route | Appr. | | | | | | | | | | | | | Numerical (MRA) | | | | | | | | | | | Multiple-Choice (Acc.) | | | | | | | | | | | Proprietary Models (API) | | | | | | | | | | | GPT-4o | 34.0 | 46.2 | 5.3 | 43.8 | 38.2 | 37.0 | 41.3 | 31.5 | 28.5 | | Gemini-1.5 Flash | 42.1 | 49.8 | 30.8 | 53.5 | 54.4 | 37.7 | 41.0 | 31.5 | 37.8 | | Gemini-1.5 Pro | 45.4 | 56.2 | 30.9 | 64.1 | 43.6 | 51.3 | 46.3 | 36.0 | 34.6 | | Open-source Models | | | | | | | | | | | LLaVA-Video-7B | 35.6 | 48.5 | 14.0 | 47.8 | 24.2 | 43.5 | 42.4 | 34.0 | 30.6 | | LLaVA-Video-72B | 40.9 | 48.9 | 22.8 | 57.4 | 35.3 | 42.4 | 36.7 | 35.0 | 48.6 | | LLaVA-OneVision-7B | 32.4 | 47.7 | 20.2 | 47.4 | 12.3 | 42.5 | 35.2 | 29.4 | 24.4 | | Qwen2.5-VL-7B | 33.0 | 40.9 | 14.8 | 43.4 | 10.7 | 38.6 | 38.5 | 33.0 | 29.8 | | LLaVA-OneVision-72B | 40.2 | 43.5 | 23.9 | 57.6 | 37.5 | 42.5 | 39.9 | 32.5 | 44.6 | | Qwen3-VL-8B-Instruct | 57.4 | 66.7 | 38.9 | 74.1 | 53.5 | 59.0 | 65.4 | 32.0 | 69.4 | | Specialized Models | | | | | | | | | | | Spacer [26] | 45.5 | 57.8 | 28.2 | 59.9 | 47.1 | 40.1 | 45.4 | 33.5 | 52.1 | | ViLaSR [43] | 45.4 | 63.5 | 34.4 | 60.6 | 30.9 | 48.9 | 45.2 | 30.4 | 49.2 | | Spatial-MLLM [42] | 48.4 | 65.3 | 34.8 | 63.1 | 45.1 | 41.3 | 46.2 | 33.5 | 46.3 | | GeoThinker [20] | 50.5 | 69.5 | 38.5 | 57.9 | 62.2 | 45.2 | 46.2 | 31.4 | 52.6 | | VLM-3R [7] | 60.9 | 70.2 | 49.4 | 69.2 | 67.1 | 65.4 | 80.5 | 45.4 | 40.1 | | Map2Thought [8] | 61.0 | 70.8 | 55.0 | 70.1 | 69.4 | 56.9 | 69.8 | 38.1 | 57.4 | | Cambrian-S-7B [46] | 67.5 | 73.2 | 50.5 | 74.9 | 72.2 | 71.1 | 76.2 | 41.8 | 80.1 | | SpaceMind [50] | 69.6 | 73.3 | 61.4 | 77.3 | 74.2 | 67.2 | 88.4 | 44.3 | 70.6 | | ConsiSpaceSF T | 71.2 | 71.0 | 73.8 | 77.7 | 71.7 | 68.5 | 83.6 | 49.8 | 73.8 | | ConsiSpaceUC−SSRL | 76.6 | 77.9 | 78.9 | 82.2 | 76.3 | 72.1 | 90.1 | 54.7 | 79.9 |
多传感器捕获。它既包含定性关系推理,也包含定量度量或运动学理解,因此适合测试空间推理能力是否能在室内基准测试之外实现迁移。遵循其协议,我们报告 MCA 任务的准确率(Accuracy)和 NA 任务的 MRA,其中 MRA 检查相对误差是否低于一组容差值,并为接近零的目标设置一个小值下限。
MMSI-Video-Bench。MMSI-Video-Bench [23] 评估基于视频的空间智能,使用来自不同视频源的全人工标注问题。它包含 1,106 个问题,涵盖 1,278 个视频片段,涉及感知(Perception)、规划(Planning)、预测(Prediction)和跨视频推理(Cross-Video Reasoning)。遵循官方协议,我们在两种输入设置下报告精确匹配准确率(exact-match accuracy):Uniform-50,即每个片段输入恰好 50 个均匀采样的帧;以及 Sufficient-Coverage,即使用人类标注期间使用的完整帧集。这些设置分别评估在固定帧预算下和证据丰富输入下的空间推理能力。
4.2 数据集
有监督微调。对于 SFT,我们在室内和室外视频空间推理数据的混合集上对基础视频语言模型进行微调。对于室内空间推理,我们使用 VSI-590K [46] 作为主要的指令微调来源。为了提高室外覆盖范围,我们额外构建了 nuScenes-10K,这是一个基于 nuScenes [2] 合成的包含 10,000 个 QA 实例的室外数据集,使用自动化
第 10 页
10 T. Huang 等
表 2:OSI-Bench 结果。“Avg.”表示总体均值。加粗和下划线分别表示最佳和第二佳结果。 计数 位移 速度 EM EM 位置 距离 距离 方向 关系 关系 定性 物体 绝对 深度 绝对 绝对 数量 方法 平均 关系型 (MCA) 静态 度量 (NA) 动态 度量 (NA) 专有模型 (API) GPT-5 29.7 34.4 33.1 49.5 32.5 23.7 20.9 10.5 33.8 30.6 Gemini-2.5-Pro 37.2 50.0 28.1 52.5 37.4 28.1 37.9 26.8 31.1 40.8 开源模型 LLaVA-Video-Qwen2-7B 22.9 37.1 31.2 40.9 17.6 22.1 18.2 17.5 19.0 5.7 LLaVA-OneVision-7B 25.7 35.1 32.7 40.8 16.1 25.5 25.6 16.8 28.3 13.4 Qwen3-VL-8B-Instruct 31.2 38.3 31.2 49.3 21.0 15.1 33.3 21.3 34.3 37.8 专用模型 Spacer [26] 30.2 35.0 24.6 39.0 36.7 14.0 36.4 24.0 28.4 34.1 ViLaSR [43] 30.4 42.6 24.5 39.0 40.3 17.1 36.8 15.7 25.8 32.2 Spatial-MLLM [42] 31.3 36.0 25.0 41.5 41.5 17.3 38.3 23.0 28.4 30.3 VLM-3R [7] 40.3 57.0 43.6 52.3 44.6 24.6 42.0 34.2 38.5 26.2 ConsiSpaceSF T 45.8 58.1 44.2 60.1 44.4 35.5 46.0 34.7 41.7 47.7 ConsiSpaceUC−SSRL 53.0 66.5 51.3 68.7 51.6 41.7 52.7 41.8 48.5 54.4
以及基于自车位姿和 3D 标注的可编程验证管道。 我们对 22,518 个生成候选项应用几何有效性过滤、答案可解析性检查、一致性检查、MLLM 验证和去重,最终得到 10,000 个 QA 对。nuScenes-10K 与 OSI-Bench 没有共享视频或标注,除了通用物体类别的重叠。对随机抽样的 1,000 个 QA 对进行人工验证,正确率为 91.6%。更多细节和验证统计信息见补充材料 A。SFT 采用标准最大似然训练,将拼接的上下文映射到最终答案。
统一一致性自监督强化学习 (UC-SSRL)。UC-SSRL 不需要除 SFT 数据之外的额外人工标注。我们重用相同的训练池,并应用双视角采样器为每个 (V, q) 构建配对观测,例如两个时间窗口或两个检索上下文。然后,模型通过跨配对视角的答案、度量和拓扑一致性奖励进行优化。除非另有说明,在 UC-SSRL 期间仅更新轻量级 LoRA 参数,使其与 SFT 互补且运行高效。
4.3 实现细节
架构。ConsiSpace 基于 Qwen3-VL-8B-Instruct [1] 构建,采用 LoRA 适配和几何一致性记忆 (GCM)。我们使用冻结的 SigLIP2 [32] 作为视觉编码器,冻结的 VGGT [35] 作为几何编码器。视觉塔、对齐器和几何编码器保持冻结,仅在 SFT 和 UC-SSRL 期间更新 LoRA 参数。
记忆与检索。我们使用具有 M=64 个记忆 token 和 512 特征维度的双库几何一致性记忆 (GCM)。记忆组织为 4 个块,采用 8 头重采样器。分层检索在块和帧级别均使用 top-K=8,每个块有 8 个值 token,每帧有 4 个值 token。详细的记忆注入、门控、检索和后端设置见补充材料 B。
第 11 页
ConsiSpace 11
表 3:MMSI-Video-Bench 结果。“Avg.”表示总体均值。Attr.、Inst.、Cam.、Scen. 和 Inter. 分别代表属性(Attribute)、实例(Instance)、相机(Camera)、场景(Scene)和交互(Interaction)。MU. 和 MV. 分别代表记忆更新(Memory Update)和多视图集成(Multi-View Integration)。加粗和下划线分别表示每种设置下的最佳和第二佳结果。
| Method | Spatial Construction Attr. | Spatial Construction Inst.-Inst. | Spatial Construction Inst.-Scen. | Spatial Construction Scen.-Scen. | Spatial Construction Cam.-Inst. | Spatial Construction Cam.-Scen. | Spatial Construction Cam. | Spatial Construction Inst. | Motion Understanding Inter. | Cross-Video Plan. MU. | Cross-Video Pred. MV. | Avg. | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | (Sufficient-Coverage) Proprietary | | | | | | | | | | | | | | GPT-4o | 22.9 | 30.3 | 35.1 | 26.1 | 26.6 | 27.5 | 24.7 | 28.9 | 24.7 | 34.3 | 25.7 | 29.8 | 26.8 | 28.1 | | Gemini 2.5 Flash-Thinking | 43.4 | 38.2 | 41.6 | 24.6 | 34.2 | 36.2 | 44.1 | 34.4 | 35.8 | 36.3 | 38.6 | 36.3 | 31.7 | 36.7 | | (Sufficient-Coverage) Open-source | | | | | | | | | | | | | | Qwen2.5-VL-7B | 31.3 | 21.1 | 19.5 | 30.4 | 19.0 | 31.2 | 35.5 | 36.7 | 29.6 | 27.4 | 30.0 | 26.6 | 35.4 | 28.8 | | Qwen3-VL-8B | 27.8 | 31.5 | 33.3 | 26.9 | 23.1 | 22.4 | 27.3 | 29.6 | 41.0 | 28.4 | 29.9 | 26.5 | 32.0 | 29.1 | | (Sufficient-Coverage) Specialized Models | | | | | | | | | | | | | | Spacer [26] | 35.3 | 29.6 | 39.2 | 27.9 | 35.1 | 27.8 | 36.4 | 28.2 | 33.0 | 35.9 | 30.8 | 28.0 | 27.3 | 31.8 | | ViLaSR [43] | 35.2 | 29.5 | 39.1 | 27.8 | 35.0 | 27.7 | 36.3 | 28.1 | 32.9 | 35.8 | 30.7 | 27.9 | 27.2 | 31.7 | | Spatial-MLLM [42] | 37.4 | 31.7 | 41.3 | 30.0 | 37.2 | 29.9 | 38.5 | 30.3 | 35.1 | 38.0 | 32.9 | 30.1 | 29.4 | 33.9 | | VLM-3R [7] | 46.1 | 40.4 | 50.0 | 38.7 | 45.9 | 38.6 | 47.2 | 39.0 | 43.8 | 46.7 | 41.6 | 38.8 | 38.1 | 42.6 | | ConsiSpace$_{SF}^{T}$ | 51.8 | 46.3 | 55.6 | 44.6 | 51.6 | 44.5 | 52.9 | 44.9 | 49.6 | 52.4 | 47.4 | 44.7 | 44.0 | 48.4 | | ConsiSpace$_{UC-SSRL}$ | 61.4 | 55.2 | 65.7 | 53.3 | 61.1 | 53.7 | 62.2 | 54.0 | 58.8 | 62.0 | 56.8 | 53.4 | 52.9 | 57.5 | | (Uniform-50) Proprietary | | | | | | | | | | | | | | Gemini 2.5 Flash-Thinking | 43.4 | 25.0 | 42.9 | 23.2 | 32.9 | 47.5 | 38.7 | 28.9 | 38.3 | 31.4 | 28.6 | 40.3 | 31.7 | 35.2 | | GPT-5 | 44.6 | 38.2 | 44.2 | 39.1 | 40.5 | 41.2 | 37.6 | 28.9 | 42.0 | 33.3 | 28.6 | 34.7 | 28.1 | 36.8 | | Gemini 3 Pro | 44.6 | 39.5 | 44.2 | 33.3 | 29.1 | 43.8 | 35.5 | 40.0 | 38.3 | 34.3 | 37.1 | 38.7 | 35.4 | 38.0 | | (Uniform-50) Open-source | | | | | | | | | | | | | | LLaVA-Video-7B | 27.7 | 28.9 | 28.6 | 30.4 | 19.0 | 25.0 | 31.2 | 35.6 | 30.9 | 36.3 | 20.0 | 21.0 | 35.4 | 28.5 | | Qwen2.5-VL-7B | 26.5 | 25.0 | 29.9 | 34.8 | 20.2 | 37.5 | 33.3 | 31.1 | 34.6 | 24.5 | 22.9 | 34.7 | 28.1 | 29.7 | | Qwen3-VL-8B | 33.7 | 25.0 | 24.7 | 26.1 | 24.1 | 30.0 | 35.5 | 22.2 | 29.6 | 31.4 | 20.0 | 25.0 | 29.3 | 27.6 | | (Uniform-50) Specialized Models | | | | | | | | | | | | | | Spacer [26] | 36.4 | 31.1 | 36.3 | 30.9 | 32.3 | 39.5 | 30.5 | 32.2 | 34.0 | 28.1 | 29.2 | 32.1 | 27.5 | 32.3 | | ViLaSR [43] | 36.3 | 31.0 | 36.2 | 30.8 | 32.2 | 39.4 | 30.4 | 32.1 | 33.9 | 28.0 | 29.1 | 32.0 | 27.4 | 32.2 | | Spatial-MLLM [42] | 38.5 | 33.2 | 38.4 | 33.0 | 34.4 | 41.6 | 32.6 | 34.3 | 36.1 | 30.2 | 31.3 | 34.2 | 29.6 | 34.4 | | VLM-3R [7] | 47.2 | 41.9 | 47.1 | 41.7 | 43.1 | 50.3 | 41.3 | 43.0 | 44.8 | 38.9 | 40.0 | 42.9 | 38.3 | 43.1 | | ConsiSpace$_{SF}^{T}$ | 52.9 | 47.7 | 52.8 | 47.5 | 48.9 | 55.9 | 47.1 | 48.8 | 50.5 | 44.8 | 45.9 | 48.7 | 44.2 | 48.9 | | ConsiSpace$_{UC-SSRL}$ | 62.6 | 56.7 | 62.5 | 56.8 | 58.0 | 65.8 | 56.2 | 58.2 | 59.9 | 54.0 | 55.0 | 58.1 | 53.2 | 58.1 |
训练细节。我们首先使用标准最大似然训练在 VSI-590K 和 nuScenes-10K 上进行微调。我们使用秩为 16 且 $\alpha=32$ 的 LoRA,采用 bfloat16 精度和 DeepSpeed ZeRO-3。由于基础模型和编码器被冻结,可训练参数仅占全模型参数的一小部分。我们以 $1 \times 10^{-4}$ 的学习率训练 200 步,每设备批次大小为 1,梯度累积为 2,最大序列长度为 5,120。然后,我们从 SFT 检查点初始化 UC-SSRL,保持相同的优化设置以进行受控比较,并将整体 UC-SSRL 权重设置为 $10^{-2}$。所有实验均在 8 块 A100 80GB GPU 上进行。额外的优化器、LoRA 和运行时细节见补充材料 B。
4.4 主要结果
VSI-Bench。如表 1 所示,ConsiSpace 使用 UC-SSRL 达到了 76.6 的平均分(Avg.),比 SpaceMind(69.6 Avg.)高出 7.0 分,比 Qwen3-VL-8B-Instruct(57.4 Avg.)高出 19.2 分。这些提升涵盖了数值型和多项选择题任务,表明测量和关系推理能力有所提高。
OSI-Bench。表 2 显示,ConsiSpace 在 OSI-Bench 上使用 UC-SSRL 达到了 53.0 的平均分。它比 VLM-3R(40.3 Avg.)高出 12.7 分,比 Qwen3-VL-8B-Instruct(31.2 Avg.)高出 21.8 分。UC-SSRL 相比 SFT 进一步提升了 7.2 分,特别是在对度量要求较高的类别上,这表明在视角变化下具有更好的稳定性。
第 12 页
12 T. Huang 等
表 4:端到端效率与长视频扩展性。所有结果均在不同的输入预算下,于同一块 A100 80GB GPU 上测量。
方法 时长 帧数 显存 (GB)↓ 推理时间 (s)↓ VSI↑ OSI↑ MMSI-SC↑ MMSI-U50↑
Qwen3-VL-8B ~10–15s 50 19.4 1.32 57.4 31.2 29.1 27.6 VLM-3R ~10–15s 50 24.8 2.10 60.9 40.3 42.6 43.1 ConsiSpaceUC-SSRL ~10–15s 50 22.0 1.65 76.6 53.0 57.5 58.1
Qwen3-VL-8B ~20–30s 100 36.5 3.05 58.2 32.1 29.8 28.5 VLM-3R ~20–30s 100 42.0 4.20 68.0 42.0 48.2 49.1 ConsiSpaceUC-SSRL ~20–30s 100 28.5 2.25 71.6 45.8 53.1 53.8
Qwen3-VL-8B ~120–180s 200 71.2 7.45 57.8 31.5 29.3 27.9 VLM-3R ~120–180s 200 78.5 10.80 69.5 43.5 51.1 52.3 ConsiSpaceUC-SSRL ~120–180s 200 35.0 3.10 72.4 46.8 54.4 55.1
MMSI-Video-Bench。如表 3 所示,ConsiSpace 在充分覆盖(Sufficient-Coverage)下平均得分为 57.5,在均匀 50(Uniform-50)下平均得分为 58.1,分别比 VLM-3R 高出 14.9 和 15.0 分。UC-SSRL 在这两种设置下均持续优于 SFT,表明一致性学习既有利于证据丰富的输入,也有利于固定预算的输入。
4.5 效率与可扩展性分析
除了准确性之外,我们还评估了在输入预算增加情况下的峰值 GPU 显存、推理时间和准确性。所有测量均在同一块 A100 80GB GPU 上进行,如表 4 所示。在 50 帧设置下,ConsiSpace 的准确性显著高于 Qwen3-VL-8B 和 VLM-3R,同时其推理时间少于 VLM-3R。随着输入预算的增加,VLM-3R 积累了密集的证据,其显存和延迟迅速增长。在 200 帧时,VLM-3R 需要 78.5GB 显存和 10.80 秒推理时间,而 ConsiSpace 仅使用 35.0GB 显存和 3.10 秒推理时间,同时在 VSI、OSI 和 MMSI 上取得了更高的准确性。这些结果表明,几何一致性记忆(Geometry-Consistent Memory)通过选择性组织空间证据而非密集保留所有观测结果,提高了端到端长视频的扩展性,而不仅仅是保留条目的数量。
4.6 导航导向验证
为了将我们的视频空间推理设置与导航导向的动机联系起来,我们评估了 Habitat ObjectNav 的下一步预测。给定自历史(ego-centric history)和导航查询,模型预测下一个方向,测试的是导航导向的空间感知能力,而非端到端的具身控制。表 5 显示,ConsiSpace 优于 Qwen3-VL-8B,且 UC-SSRL 带来了进一步的提升。 表 5:ObjectNav 下一步 表 6:GCM 消融实验。MMSI-Video 是 预测。Acc.、Succ. 和 充分覆盖和均匀 50 的平均值。#Entries 表示归一化的保留显 Dist. 分别表示方向准确率、 存条目数。 距离缩减成功率和剩余距离。 变体 VSI↑ OSI↑ MMSI-Video↑ #Entries↓ 方法 Acc.↑ Succ.↑ Dist.↓ 完整 (ConsiSpaceSFT) 71.2 45.8 52.3 1.0× Qwen3-VL-8B 42.6 31.8 4.72 无门控写入 (w/o GateWrite) 69.8 44.5 47.2 2.3× ConsiSpaceSFT 47.9 36.5 4.31 无融合 (w/o Fusion) 70.3 45.0 47.9 1.8× ConsiSpaceUC-SSRL 50.8 39.7 4.05 无几何过滤 (w/o GeoFilter) 69.5 43.9 46.0 1.0×
第 13 页
ConsiSpace 13
… 2.7× 1.0×
Baseline Ours Fig. 4: 几何门控写入和融合的定性效果。密集更新 Fig. 5: UC-SSRL 的效果。UC- 会引入冗余点,而 GCM 生成更干净且更紧凑的 SSRL 在所有基准测试中均优于 SFT 基线, 点云。红色数字表示归一化保留的条目。 在 OSI-Bench 和 MMSI-Video 上提升更大, 因为这两个基准上的视角变化和度量关系更具 挑战性。
4.7 消融研究
几何一致性记忆的效果。表 6 和图 4 评估了 GCM 证据的生命周期。移除几何门控写入会使保留条目 增加至 2.3 倍,而移除几何一致性融合会使其增 加至 1.8 倍;这两种变体均降低了准确率,表明 抑制和合并冗余观测的重要性。移除几何过滤检 索保持条目数量不变,但降低了 OSI 和 MMSI- Video 的性能,表明检索质量取决于在视角变化 下过滤几何不一致的证据。定性上,与密集更新 相比,GCM 生成的点云更干净且更紧凑。总体 而言,写入、融合和检索对于紧凑且可靠的空间 证据组织是互补的。
UC-SSRL 的效果。图 5 评估了从 ConsiSpace_sft 开始的 UC-SSRL。UC-SSRL 在所有基准测试中 均带来提升,在视角变化和度量关系更具挑战性 的 OSI-Bench 和 MMSI-Video 上提升更大。由 于 UC-SSRL 是从 SFT 模型初始化的,这些提升 表明一致性奖励优化了视角稳定性,而非从头学 习任务正确性。
表 7: UC-SSRL 奖励消融。 表 8: 对噪声 VGGT 我们消融了答案级、度量和拓 几何的鲁棒性。我们在 GCM 扑一致性奖励。 操作之前扰动 VGGT 几何。
RKL Rmetric Rtopo VSI↑OSI↑MMSI-SC↑MMSI-U50↑ Method Noise VSI↑OSI↑SC↑U50↑ ✗ ✗ ✗ 71.2 45.8 48.4 48.9 GeoThinker Clean 72.6 44.5 48.2 49.1 ✓ ✗ ✗ 73.5 48.2 52.1 52.6 ConsiSpaceUC-SSRL Clean 76.6 53.0 57.5 58.1 ✗ ✓ ✗ 72.8 49.0 51.4 51.9 GeoThinker 10% 70.8 42.1 45.3 46.5 ✗ ✗ ✓ 72.9 47.1 51.7 52.2 ConsiSpaceUC-SSRL 10% 75.9 52.4 56.8 57.4 ✓ ✓ ✗ 75.1 51.6 55.4 56.0 GeoThinker 20% 68.4 38.8 41.6 42.8 ✓ ✗ ✓ 75.4 50.3 55.7 56.4 ConsiSpaceUC-SSRL 20% 74.9 51.3 55.6 56.1 ✗ ✓ ✓ 74.5 50.8 54.8 55.5 GeoThinker 30% 65.2 35.1 38.2 39.4 ✓ ✓ ✓ 76.6 53.0 57.5 58.1 ConsiSpaceUC-SSRL 30% 73.1 49.6 53.4 54.3
UC-SSRL 奖励消融。表 7 对三种 UC-SSRL 奖励 进行了消融。每种奖励均优于 SFT,成对组合带 来进一步增益,完整目标函数在 VSI、OSI 和 MMSI-Video 上表现最佳。这表明答案级、度量 和拓扑一致性是互补的,且 UC-SSRL 是从 SFT 初始化模型中优化跨视角稳定性,而非仅从一致 性中学习正确性。
第 14 页
14 T. Huang 等
对噪声几何的鲁棒性。表 8 评估了对扰动 VGGT 几何的鲁棒性。我们在 GCM 操作之前向深度、平移和旋转线索添加噪声,同时保持 RGB 输入和问题不变。随着噪声增加,性能逐渐下降,但 ConsiSpace 始终优于 GeoThinker,这表明 GCM 从几何线索中受益,而无需完美的几何估计。
摘要 vs. Top-K 读取。表 9:读取策略消融。 表 9 对读取策略进行了消融实验。我们在相同的骨干网络和内存预算下,比较了仅摘要、仅 Top-K 以及它们的组合。仅摘要读取缺乏细粒度的局部证据,而仅 Top-K 读取则遗漏了全局空间上下文。将摘要 token 与 Top-K 检索相结合取得了最佳的整体性能,表明全局摘要和稀疏证据选择是互补的。
| 变体 | VSI ↑ | OSI ↑ | MMSI-SC ↑ | MMSI-U50 ↑ | | :— | :— | :— | :— | :— | | Summary + Top-K | 71.2 | 45.8 | 51.8 | 52.9 | | Summary-only | 69.8 | 43.9 | 48.7 | 47.1 | | Top-K-only | 70.9 | 46.2 | 49.3 | 50.9 |
表 10:对写入阈值的敏感性。ConsiSpace 微调后在不同 $(\tau_p, \tau_\theta)$ 下的 VSI 和 OSI 平均值。默认设置为 $(0.15 \text{ m}, 15^\circ)$。
表 11:对融合阈值的敏感性。不同融合邻域 $(r, \theta)$ 下的 VSI 和 OSI 平均值。#Entries 表示保留的条目数,相对于默认值 $(0.40 \text{ m}, 30^\circ)$ 归一化。
| $\tau_p$ (m) | $\tau_\theta$ (deg) | VSI ↑ | OSI ↑ | | :— | :— | :— | :— | | 0.10 | 15 | 71.0 | 45.6 | | 0.15 | 15 | 71.2 | 45.8 | | 0.15 | 10 | 71.1 | 45.7 | | 0.15 | 15 | 71.2 | 45.8 | | 0.15 | 30 | 70.8 | 45.4 |
| $r$ (m) | $\theta$ (deg) | VSI ↑ | OSI ↑ | #Entries ↓ | | :— | :— | :— | :— | :— | | 0.20 | 30 | 71.0 | 45.5 | 1.18× | | 0.40 | 30 | 71.2 | 45.8 | 1.00× | | 0.60 | 30 | 70.9 | 45.4 | 0.92× | | 0.25 | 15 | 70.9 | 45.3 | | | 0.40 | 15 | 71.1 | 45.6 | 1.10× | | 0.40 | 30 | 71.2 | 45.8 | 1.00× | | 0.40 | 45 | 70.8 | 45.3 | 0.94× |
阈值敏感性。表 10 和表 11 评估了写入阈值 $(\tau_p, \tau_\theta)$ 和融合邻域阈值 $(r, \theta)$ 的敏感性。在默认设置附近,VSI 和 OSI 变化很小,表明几何门控写入和几何一致性融合对阈值选择具有鲁棒性。对于融合,保留的条目按预期发生变化:较小的邻域保留更多条目,而较大的邻域允许更激进的融合。总体而言,ConsiSpace 表现出广泛的稳定区域,并不依赖于精细调整的几何阈值。
4.8 定性结果
几何过滤检索。图 6 可视化了两阶段检索过程。在块级语义检索之后,GCM 利用方向一致性线索进行帧级选择。与推断视角冲突但匹配查询语义的帧会被抑制。
重访视角下的一致性。图 7 展示了 UC-SSRL 的重访视角示例。给定相同的视频和查询,基线模型在不同邻近视角下产生不同的答案,表明空间定位不稳定。相比之下,带有 UC-SSRL 的 ConsiSpace 在视角 A
第 15 页
ConsiSpace 15
如果位于电视 ……和床,面向什么方向 是柜子?
块 1 块 2 阶段 1:块检索 块 4
选择 块
柜子
床 床 床 块 2 语义得分:0.67 块 3 语义得分:0.78 块 4 语义得分:0.87
阶段 2:帧检索
方向 语义
选择 帧 图 6:几何过滤检索的定性可视化。GCM 首先检索语义相关的块,然后利用方向一致性选择帧。 灰色 ✗ 表示被抑制的帧,绿色 ✓ 表示选中的证据。
有多少个垃圾桶 ……. 在这个场景中?
视角 A 视角 B SpaceMind Cambrian-S ConsiSpace w/ UC-SSRL
视角 A 视角 B 视角 A 视角 B 视角 A 视角 B
答案:3 答案:4 答案:4 答案:2 答案:4 答案:4
不一致 不一致 一致 图 7:重访视角下的一致性。给定相同的查询,基线模型在两个重访视角下产生不一致的计数答案,而带有 UC-SSRL 的 ConsiSpace 给出一致的预测。 和视角 B。这表明 UC-SSRL 在 SFT 之后优化了视角稳定性, 而不是仅从一致性中学习任务正确性。 其他可视化。我们在补充材料 C 中提供了 VSI- Bench、MMSI-Video-Bench 和 OSI-Bench 上更多的定性示例。
5 结论
在本文中,我们提出了 ConsiSpace,这是一个用于视频空间推理的几何一致性框架。ConsiSpace 在通用视频编码器和 VLM 之上构建了几何一致性记忆(Geometry-Consistent Memory),并通过几何门控写入、几何一致性融合和几何过滤检索来管理证据,以减少冗余并检索与查询相关的空间线索。我们进一步引入了统一一致性自监督强化学习(Unified Consistency SSRL)目标,该目标鼓励监督微调后的跨视角空间一致性,从而在不增加额外人工标注的情况下提高视角稳定性。在三个具有挑战性的视频空间推理基准上的实验表明,ConsiSpace 始终优于强大的先前方法。我们希望我们的结果强调了几何一致性作为鲁棒视频空间推理的一种简单而有效的原则。 致谢。本研究得到了国家自然科学基金(Grant No. 62376121)、江苏省基础研究计划(Grant No. BK20251999)、姑苏创新创业领军人才计划(Grant No. ZXL2025319)以及江苏省科技重大专项(Grant No. BG2024042)的支持。
第 16 页
16 T. Huang 等人
参考文献
1. Bai, S., Cai, Y., Chen, R., Chen, K., Chen, X., Cheng, Z., Deng, L., Ding, W., Gao, C., Ge, C., 等: Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631 (2025) 2. Caesar, H., Bankiti, V., Lang, A.H., Vora, S., Liong, V.E., Xu, Q., Krishnan, A., Pan, Y., Baldan, G., Beijbom, O.: nuscenes: 自动驾驶的多模态数据集。arXiv 预印本 arXiv:1903.11027 (2019) 3. Chen, G., Liu, Y., Huang, Y., Pei, B., Xu, J., He, Y., Lu, T., Wang, Y., Wang, L.: CG-bench: 面向长视频理解的线索定位问答基准。在:第十三届国际学习表征会议 (2025) 4. Chen, Y., Qi, Z., Zhang, W., Jin, X., Zhang, L., Liu, P.: 通过世界定位进行空间推理。在:第十四届国际学习表征会议 (2026) 5. Chen, Y., Xue, F., Li, D., Hu, Q., Zhu, L., Li, X., Fang, Y., Tang, H., Yang, S., Liu, Z., 等: Longvila: 扩展长上下文视觉语言模型以处理长视频。在:国际学习表征会议。卷 2025,第 18227–18246 页 (2025) 6. Dongfang, Z., Zheng, X., Weng, Z., Lyu, Y., Paudel, D.P., Van Gool, L., Yang, K., Hu, X.: 多模态大语言模型是否准备好进行全向空间推理?在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 9759–9769 页 (2026) 7. Fan, Z., Zhang, J., Li, R., Zhang, J., Chen, R., Hu, H., Wang, K., Qu, H., Wang, D., Yan, Z., 等: Vlm-3r: 增强指令对齐 3D 重建的视觉-语言模型。arXiv 预印本 arXiv:2505.20279 (2025) 8. Gao, X., Zhang, Z., Chen, D.Z., Xu, S., Quan, L., Pérez-Pellitero, E., Jang, Y.: Map2thought: 通过度量认知地图进行显式 3D 空间推理。arXiv 预印本 arXiv:2601.11442 (2026) 9. Hu, W., Lin, J., Long, Y., Ran, Y., Jiang, L., Wang, Y., Zhu, C., Xu, R., Wang, T., Pang, J.: G2vlm: 具有统一 3D 重建和空间推理的几何基础视觉语言模型。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 9535–9546 页 (2026) 10. Huang, T., Li, D., Yang, R., Zhang, Z., Yang, Z., Tang, H.: Mobilevla-r1: 强化移动机器人的视觉-语言-动作。arXiv 预印本 arXiv:2511.17889 (2025) 11. Huang, T., Zhang, Z., Tang, H.: 3d-r1: 增强 3D 视觉语言模型中的推理以实现统一场景理解。arXiv 预印本 arXiv:2507.23478 (2025) 12. Huang, T., Zhang, Z., Tang, H.: 3d coca: 对比学习器是 3D 描述生成器。在:第十三届国际 3D 视觉会议 (2026) 13. Huang, T., Zhang, Z., Zhang, R., Zhao, Y.: Dc-scene: 面向 3D 场景理解的数据中心学习。arXiv 预印本 arXiv:2505.15232 (2025) 14. Huang, X., Wu, J., Xie, Q., Han, K.: 3drs: 多模态大语言模型需要 3D 感知表示监督以进行场景理解。arXiv 预印本 arXiv:2506.01946 (2025) 15. Ji, Y., Tan, H., Shi, J., Hao, X., Zhang, Y., Zhang, H., Wang, P., Zhao, M., Mu, Y., An, P., 等: Robobrain: 从抽象到具体的机器人操作统一大脑模型。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 1724–1734 页 (2025) 16. Krantz, J., Wijmans, E., Majumdar, A., Batra, D., Lee, S.: 超越导航图:连续环境中的视觉-语言导航。在:欧洲计算机视觉会议。第 104–120 页。Springer (2020)
第 17 页
ConsiSpace 17
17. Leroy, V., Cabon, Y., Revaud, J.: 基于 mast3r 将图像匹配锚定到 3D 空间。 在:欧洲计算机视觉会议。页码 71–91。Springer (2024) 18. Li, D., Li, H., Wang, Z., Yan, Y., Zhang, H., Chen, S., Hou, G., Jiang, S., Zhang, W., Shen, Y., 等:Viewspatial-bench:评估视觉-语言模型中的多视角空间定位。arXiv 预印本 arXiv:2505.21500 (2025) 19. Li, F., Song, W., Zhao, H., Wang, J., Ding, P., Wang, D., Zeng, L., Li, H:空间强制:视觉-语言-动作模型中的隐式空间表示对齐。 arXiv 预印本 arXiv:2510.12276 (2025) 20. Li, H., Cao, Q., Tang, T., Xiang, K., Guo, Z., Han, J., Xu, H., Liang, X:与几何思考:用于空间推理的主动几何集成。arXiv 预印本 arXiv:2602.06037 (2026) 21. Li, H., Li, D., Wang, Z., Yan, Y., Wu, H., Zhang, W., Shen, Y., Lu, W., Xiao, J., Zhuang, Y:Spatialladder:视觉-语言模型中空间推理的渐进式训练。arXiv 预印本 arXiv:2510.08531 (2025) 22. Lin, H., Chen, S., Liew, J., Chen, D.Y., Li, Z., Shi, G., Feng, J., Kang, B: Depth anything 3:从任意视角恢复视觉空间。arXiv 预印本 arXiv:2511.10647 (2025) 23. Lin, J., Xu, R., Zhu, S., Yang, S., Cao, P., Ran, Y., Hu, M., Zhu, C., Xie, Y., Long, Y., 等:Mmsi-video-bench:一个基于视频的空间智能综合基准。arXiv 预印本 arXiv:2512.10863 (2025) 24. Liu, Q., Huang, T., Zhang, Z., Tang, H:Nav-r1:具身场景中的推理与导航。arXiv 预印本 arXiv:2509.10884 (2025) 25. Liu, Y., Zhang, B., Zang, Y., Cao, Y., Xing, L., Dong, X., Duan, H., Lin, D., Wang, J:Spatial-ssrl:通过自监督强化学习增强空间理解。arXiv 预印本 arXiv:2510.27606 (2025) 26. Ouyang, K., Liu, Y., Wu, H., Liu, Y., Zhou, H., Zhou, J., Meng, F., Sun, X:Spacer: 强化多模态大语言模型在视频空间推理中的能力。arXiv 预印本 arXiv:2504.01805 (2025) 27. Ramakrishnan, S.K., Gokaslan, A., Wijmans, E., Maksymets, O., Clegg, A., Turner, J., Undersander, E., Galuba, W., Westbury, A., Chang, A.X., 等: Habitat-Matterport 3D 数据集 (hm3d):1000 个用于具身 AI 的大规模 3D 环境。arXiv 预印本 arXiv:2109.08238 (2021) 28. Savva, M., Kadian, A., Maksymets, O., Zhao, Y., Wijmans, E., Jain, B., Straub, J., Liu, J., Koltun, V., Malik, J., 等:Habitat:一个具身 AI 研究平台。 在:IEEE/CVF 国际计算机视觉会议论文集。 页码 9339–9347 (2019) 29. Singh, A., Fry, A., Perelman, A., Tart, A., Ganesh, A., El-Kishky, A., McLaughlin, A., Low, A., Ostrow, A., Ananthram, A., 等:OpenAI GPT-5 系统卡片。arXiv 预印本 arXiv:2601.03267 (2025) 30. Tang, H., Huang, T., Zhang, Z:3d coca v2:具有测试时搜索的对比学习器,用于通用空间智能。arXiv 预印本 arXiv:2601.06496 (2026) 31. Team, G., Anil, R., Borgeaud, S., Alayrac, J.B., Yu, J., Soricut, R., Schalkwyk, J., Dai, A.M., Hauth, A., Millican, K., 等:Gemini:一系列高度多模态模型。arXiv 预印本 arXiv:2312.11805 (2023) 32. Tschannen, M., Gritsenko, A., Wang, X., Naeem, M.F., Alabdulmohsin, I., Parthasarathy, N., Evans, T., Beyer, L., Xia, Y., Mustafa, B., 等:Siglip 2: 具有改进语义理解、定位和密集特征的多语言视觉-语言编码器。arXiv 预印本 arXiv:2502.14786 (2025) 33. Wang, C., Huang, T., Sun, C., Ning, X., Wang, D., Tang, H:让几何引导:多模态大语言模型中几何先验的分层展开。arXiv 预印本 arXiv:2604.05695 (2026)
第 18 页
18 T. Huang 等人
34. Wang, H., Zhao, Y., Wang, T., Fan, H., Zhang, X., Zhang, Z.: Ross3d: 具有3D意识的重建式视觉指令微调。在:IEEE/CVF 国际计算机视觉会议论文集。第 9275–9286 页 (2025) 35. Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: Vggt: 视觉几何基础 Transformer。在:计算机视觉与模式识别会议论文集。第 5294–5306 页 (2025) 36. Wang, S., Leroy, V., Cabon, Y., Chidlovskii, B., Revaud, J.: Dust3r: 轻松实现几何3D视觉。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 20697–20709 页 (2024) 37. Wang, W., He, Z., Hong, W., Cheng, Y., Zhang, X., Qi, J., Ding, M., Gu, X., Huang, S., Xu, B., 等: Lvbench: 一个极端长视频理解基准。在:IEEE/CVF 国际计算机视觉会议论文集。第 22958–22967 页 (2025) 38. Wang, X., Zhang, Y., Zohar, O., Yeung-Levy, S.: VideoAgent:以大语言模型作为 Agent 的长视频理解。在:欧洲计算机视觉会议。第 58–76 页。Springer (2024) 39. Wang, X., Wang, C., Xu, Y., Ye, M., Zhang, F.C., Tian, J., Zhan, X., Zhu, L., Lu, C., Yang, L.: Lamp: 利用3D场景流作为潜在运动先验学习视觉-语言-动作策略。arXiv 预印本 arXiv:2603.25399 (2026) 40. Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., He, T.: π3: 置换等变视觉几何学习。在:第十四届国际学习表征会议 (2026) 41. Wang, Y., Ke, L., Zhang, B., Qu, T., Yu, H., Huang, Z., Yu, M., Xu, D., Yu, D.: N3d-vlm: 原生3D定位使视觉-语言模型具备准确的空间推理能力。arXiv 预印本 arXiv:2512.16561 (2025) 42. Wu, D., Liu, F., Hung, Y.H., Duan, Y.: Spatial-mllm: 提升多模态大语言模型在基于视觉的空间智能方面的能力。arXiv 预印本 arXiv:2505.23747 (2025) 43. Wu, J., Guan, J., Feng, K., Liu, Q., Wu, S., Wang, L., Wu, W., Tan, T.: 通过交织思考与视觉绘图强化视觉-语言模型中的空间推理。arXiv 预印本 arXiv:2506.09965 (2025) 44. Wu, M., Wang, Z., Wang, F., Yang, J., Pollefeys, M., Zhang, T.: 从室内到开放世界:揭示多模态大语言模型中的空间推理差距。arXiv 预印本 arXiv:2512.19683 (2025) 45. Yang, J., Yang, S., Gupta, A.W., Han, R., Fei-Fei, L., Xie, S.: 在空间中思考:多模态大语言模型如何看、记和回忆空间。在:计算机视觉与模式识别会议论文集。第 10632–10643 页 (2025) 46. Yang, S., Yang, J., Huang, P., Brown, E., Yang, Z., Yu, Y., Tong, S., Zheng, Z., Xu, Y., Wang, M., 等: Cambrian-s: 迈向视频中的空间超感知。arXiv 预印本 arXiv:2511.04670 (2025) 47. Zhang, J., Chen, Y., Xu, Y., Huang, Z., Mei, J., Chen, C., Zhou, Y., Yuan, Y.J., Cai, X., Huang, G., 等: 从平面到空间:教导视觉-语言模型在3D中感知和推理。神经信息处理系统进展 38 (2026) 48. Zhang, L., Wan, W., Huang, T., Fang, Z., Zhang, H.: Multigranularity-3dqa: 用于3D问答的动态多粒度感知和门控双阶段编码器-解码器。专家系统与应用 p. 131676 (2026) 49. Zhang, Z., Wu, Y., Jia, L., Wang, Y., Zhang, Z., Li, Y., Ran, B., Zhang, F., Sun, Z., Yin, Z., 等: Think3d: 利用空间思考进行空间推理。arXiv 预印本 arXiv:2601.13029 (2026)
第 19 页
ConsiSpace 19
50. Zhao, R., Zhang, Z., Xu, J., Chang, J., Chen, D., Li, L., Sun, W., Wei, Z.: Space- mind: Camera-guided modality fusion for spatial reasoning in vision-language mod- els. arXiv preprint arXiv:2511.23075 (2025) 51. Zheng, D., Huang, S., Li, Y., Wang, L.: Learning from videos for 3d world: En- hancing mllms with 3d vision geometry priors. arXiv preprint arXiv:2505.24625 (2025) 52. Zheng, D., Huang, S., Wang, L.: Video-3d llm: Learning position-aware video repre- sentation for 3d scene understanding. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 8995–9006 (2025) 53. Zhi, H., Chen, P., Li, J., Ma, S., Sun, X., Xiang, T., Lei, Y., Tan, M., Gan, C.: Lscenellm: Enhancing large 3d scene understanding using adaptive visual prefer- ences. In: Proceedings of the Computer Vision and Pattern Recognition Confer- ence. pp. 3761–3771 (2025)
第 20 页
20 T. Huang 等
A 室外数据合成
本节描述我们用于合成 nuScenes-10K 的自动化流水线,这是一个源自 nuScenes [2] 的室外空间推理指令集。nuScenes-10K 补充了室内 VSI-590K 训练数据中的室外几何模式,例如长距离深度、大规模场景和动态智能体,同时保持监督信号与我们视频空间推理公式的兼容性。
A.1 数据源与表示
我们基于 nuScenes 序列构建,这些序列包含经过校准的多摄像头图像、自车位姿、3D 物体标注以及可选的基于 LiDAR 的几何验证。对于每个驾驶片段,我们采样短的时间窗口,并使用与训练相同的帧预算设置形成多视角视频输入 $V = \{I_t\}_{t=1}^T$。我们复用主流水线中的相同几何提取堆栈,包括位姿和深度线索,以便室外样本遵循与 ConsiSpace 相同的输入接口。
A.2 自动化指令与答案生成
对于每个片段,我们生成涵盖三个类别的问答对:
– 拓扑与关系:相对方向、相对顺序以及以自车航向为条件的空间关系。 – 度量:近似距离、大小比较以及最近或最远物体查询,答案形式为数值、分箱或多项选择。 – 运动与交互:智能体是否在时间窗口内靠近、远离、穿越或改变其相对状态。
问题通过受控词汇多样性的模板生成。答案由校准几何计算得出:我们将 3D 物体中心转换到自车坐标系,通过相对于自车前轴的方位角推导相对方向,并通过欧几里得距离计算度量量,辅以可选的深度验证。对于多项选择题,我们构建固定的选项集,并仅保留标签无歧义的样本。
A.3 质量控制与验证
我们生成了 22,518 个候选问答对,并应用多阶段过滤以提高标签可靠性。具体而言,我们根据几何有效性、答案可解析性、一致性检查、多模态大语言模型 (MLLM) 验证以及去重对候选项进行过滤,最终得到 10,000 个问答对。表 12 总结了过滤统计信息。 我们进一步检查了 nuScenes-10K 与 OSI-Bench 之间潜在的重复。nuScenes-10K 使用自动驾驶自车位姿和 3D 框标注,而 OSI-Bench 使用行人视角视频,具有独立的 3D 真值和问答协议。我们发现这两个数据集之间没有共享的视频或标注,仅存在通用的物体类别重叠。
第 21 页
ConsiSpace 21
表 12:nuScenes-10K 过滤统计。多阶段过滤将 22,518 个生成的候选样本减少至 10,000 个最终 QA 对。表 13:nuScenes-10K 的人工验证。对 1,000 个随机 QA 对进行人工验证显示正确率为 91.6%。
| 阶段 | #QA 候选 | 类别 | 比例 | 主要原因 | | :— | :— | :— | :— | :— | | 原始 | 22,518 | 正确 | 100% | 有效对象/关系/答案 | | 可解析 | 19,806 | 几何有效 | 88.0% | | | 一致性检查 | 17,932 | 歧义指代 | 79.6% | 多个可能的对象 | | MLLM 通过 | 14,516 | 遮挡/距离远 | 64.5% | 难以视觉验证 | | 去重 | 11,842 | 标注稀疏 | 52.6% | 缺失/不完整的 3D 框 | | 最终 | 10,436 | 错误 | 46.3% | 错误的关系/度量答案 | | | 10,000 | | 44.4% | |
为了估计标签质量,我们手动验证了 1,000 个随机采样的 QA 对。如表 13 所示,91.6% 的验证样本是正确的。剩余的错误主要来源于歧义指代、遮挡或距离歧义、标注稀疏以及错误的度量或关系答案。我们保持最终数据格式与室内指令微调一致,从而能够与 VSI-590K 进行混合 SFT 训练。
B 更多训练与实现细节
B.1 骨干网络与适配
我们在 Qwen3-VL-8B-Instruct 上构建 ConsiSpace,并对语言模型的线性层应用 LoRA。视觉编码器、对齐器和几何编码器在 SFT 和 UC-SSRL 期间均保持冻结。除非另有说明,所有训练均使用 bfloat16 精度和 DeepSpeed ZeRO-3。这种设计使训练保持轻量,并使 UC-SSRL 成为 SFT 后的微调阶段,而非全模型重训练。LoRA 使用秩 16 和缩放因子 $\alpha=32$。由于仅更新 LoRA 参数,可训练参数比例很小。
B.2 SFT 设置
我们使用下一个 token 预测在室内 VSI-590K 和室外 nuScenes-10K 的混合数据上对模型进行指令微调。默认配置如下:
– 优化:AdamW 优化器,学习率 $1 \times 10^{-4}$,每设备批次大小 1,梯度累积 2,以及 200 个训练步骤。 – LoRA:秩 16 和缩放因子 $\alpha=32$。 – 序列长度:最大序列长度 5,120,采用右截断。 – 效率设置:FlashAttention、无填充批次、梯度检查点和多进程数据加载。
B.3 GCM 配置
我们在 SFT 和 UC-SSRL 期间均启用几何一致性记忆(GCM)。记忆使用 $M=64$ 个记忆 token,维度 $d_{mem}=512$ 和 $n_{chunks}=4$ 个块。记忆 token 从起始位置开始,每隔 4 个 Transformer 层注入一次
第 22 页
22 T. Huang 等
第 8 层。检索采用融合的分层选择,包括 top-K 块检索和 top-K 帧检索,均设置为 K=8。每个块包含 8 个值 token,每个选定的帧贡献 4 个值 token。我们使用 FAISS 加速,并在可能时缓存检索键,以减少重复检索开销。
B.4 UC-SSRL 设置
UC-SSRL 从 SFT 检查点初始化,并仅更新 LoRA 参数。我们保持与 SFT 相同的批量大小、步数和优化器设置,以进行受控比较。UC-SSRL 的整体权重设置为 1×10−2。双视角采样器通过扰动时间窗口和检索上下文来构建配对上下文,同时保持底层场景和问题不变。此设置优化了跨视角一致性,而无需额外的人工标注。
B.5 推理协议
我们遵循每个基准的官方评估协议。对于 VSI-Bench 和 OSI-Bench,我们使用其官方的 MCA 和 NA 评估指标。对于 MMSI-Video-Bench,我们报告 Sufficient-Coverage 和 Uniform-50 两种设置。除非另有说明,所有方法均使用相同的解码参数和帧预算设置,以确保公平比较。效率和可扩展性实验均在相同的 A100 80GB GPU 设置下进行测量。
C 可视化
图 8、9 和 10 提供了 VSI-Bench、MMSI-Video-Bench 和 OSI-Bench 上的额外定性示例。这些示例涵盖了度量估计、相对方向推理、物体计数、导航以及与运动相关的问题。与基线相比,ConsiSpace 在不同的空间推理设置下产生的答案更接近真实值,这支持了几何一致性证据组织的有效性。
D 局限性
尽管 ConsiSpace 通过几何一致性提高了效率和鲁棒性,但仍存在若干局限性:
– 几何估计误差。ConsiSpace 使用预测的姿态和深度线索进行记忆控制。在运动模糊、反射表面或无纹理区域下的误差可能会影响写入、融合和检索的质量。 – 基于阈值的记忆控制。尽管我们的敏感性分析显示,在一定范围的阈值下性能稳定,但自适应的门控和融合可能会进一步提高在不同场景下的鲁棒性。
第 23 页
ConsiSpace 23
– 长视距扩展。极长视频可能仍需更强的记忆压缩或学习的驱逐策略,以在严格预算下保持有界计算量。
未来工作可能改进几何估计,开发自适应记忆控制,并将一致性学习扩展到更广泛的视频空间推理设置。
第 24 页
24 T. Huang 等
从每个对象的最近点测量,马桶和浴缸之间的距离是多少(米)?
GT: 0.4, Cambrian-S: 1.0, Ours: 0.6
浴缸最长维度(长度、宽度或高度)的长度是多少,以厘米为单位?
GT: 163, Cambrian-S: 150, Ours: 165
如果我站在电话旁并面向枕头,门是在我的左前方、右前方、左后方还是右后方? A. 左后方 B. 左前方 C. 右前方 D. 右后方
GT: B, Cambrian-S: C, Ours: B
如果我站在枕头旁并面向键盘,风扇是在我的左边、右边还是后面? A. 右边 B. 后面 C. 左边 D. 前面
GT: A, Cambrian-S: B, Ours: A
这个房间里有多少个沙发? GT: 3, Cambrian-S: 2, Ours: 3
这个房间里有多少把椅子? GT: 2, Cambrian-S: 4, Ours: 2
你是一台机器人,起始位置在冰箱旁并面向冰箱。你想导航到回收箱。 你将执行以下动作(注意:对于每个 [请填写],请选择“转身”、“左转”或“右转”):1. [请填写] 2. 向前走直到手提箱 3. [请填写] 4. 向前走直到打印机 5. [请填写] 6. 向前走直到回收箱。你已到达最终目的地。 A. 左转,左转,右转 B. 右转,左转,右转 C. 左转,右转,右转 D. 左转,左转,左转
GT: A, Cambrian-S: B, Ours: A
如果我站在炉灶旁并面向沙发,电视是在我的左前方、右前方、左后方还是右后方? A. 左前方 B. 右后方 C. 左后方 D. 右前方
GT: A, Cambrian-S: C, Ours: A
如果我站在炉灶旁并面向沙发,电视是在我的左边、右边还是后面? A. 后面 B. 右边 C. 左边
GT: C, Cambrian-S: B, Ours: C
图 8:VSI-Bench 上的定性结果。
第 25 页
ConsiSpace 25
这段视频是在一栋建筑内非顺序拍摄的,已知该建筑内只有两个卫生间和一个楼梯。目前,我面对着一个大型灰色冰箱。我想去卫生间,需要规划一条尽快到达卫生间的路线。接下来正确的步骤是什么? A. 向右转,直走进入新房间,然后向右转走出房间,打开楼梯对面的门并进入。 B. 向右转,直走进入新房间,然后向右转走出房间到达楼梯并上楼。 C. 向左转,直走进入新房间,然后向右转走出房间到达楼梯并上楼。 D. 向左转,直走进入新房间,然后向右转走出房间,打开楼梯左侧的门并进入。
真值: C, Cambrian-S: B, 本文方法: C
对于图中显示的黑色汽车,要离开这个方形停车区域,总共有多少条可达路线? A. 3 B. 4 C. 5 D. 2
真值: B, Cambrian-S: A, 本文方法: B
这是一段汽车行驶的视频。假设视频中道路上两条实心白线相同端点之间的距离为 3 米,那么在这段视频中汽车行驶了多少米? A. 21米 B. 18米 C. 19.5米 D. 18.5米
真值: C, Cambrian-S: A, 本文方法: C
这是一段室内场景漫游的视频。定义椅子的正面为正常使用时人坐着所面对的一侧。以进门时看到的第一个椅子的正面为 0 度正方向。场景中的落地镜位于何处? A. 顺时针 90 度 B. 逆时针 90 度 C. 顺时针 45 度 D. 逆时针 45 度
真值: C, Cambrian-S: B, 本文方法: C
假设你当前正对着绿色的砧板,如果你按照首次看到此类物体的顺序顺时针旋转,你会看到什么? A. 门、椅子、桌子、冰箱 B. 砧板、冰箱、红色沙发、椅子 C. 砧板、冰箱、椅子、门 D. 冰箱、水壶、盘子、门
真值: A, Cambrian-S: B, 本文方法: A
观察这段第一人称烹饪视频。在 26.50 秒时,当你转身时会看到什么? A. 餐厅餐桌 B. 餐厅里的椅子 C. 大型木门 D. 通往另一个房间的门
真值: D, Cambrian-S: C, 本文方法: D
图 9: MMSI-Video-Bench 上的定性结果。
第 26 页
26 T. Huang 等
从每个对象的最近点测量,以下哪个对象最接近带有蓝色屋顶的遮阳棚(id: 20):遮阳棚下的自行车排(id: 10)、遮阳棚结构(id: 19)、排水格栅(id: 08)还是摩托车(id: 21)? A. 遮阳棚下的自行车排(id: 10) B. 遮阳棚结构(id: 19) C. 排水格栅(id: 08) D. 摩托车(id: 21)
真实标签 (GT): B, Cambrian-S: C, 本文方法 (Ours): B
从每个对象的最近点测量,以下哪个对象最接近井盖(id: 13):遮阳棚结构(id: 19)、自行车排(id: 17)、遮阳棚下的摩托车(id: 07)还是排水格栅(id: 08)? A. 遮阳棚结构(id: 19) B. 自行车排(id: 17) C. 遮阳棚下的摩托车(id: 07) D. 排水格栅(id: 08)
真实标签 (GT): C, Cambrian-S: A, 本文方法 (Ours): C
穿着灰色衬衫的人(id: 16)在 6.2 秒到 18.7 秒之间的位移距离是多少米?
真实标签 (GT): 2.68, Cambrian-S: 1.4, 本文方法 (Ours): 2.51
在视频大约 8.3 秒时,白色标志牌(id: 11)距离摄像机的欧几里得距离是多少米?
真实标签 (GT): 4.25, Cambrian-S: 3.4, 本文方法 (Ours): 4.41
如果我站在婴儿车(id: 06)旁并面向婴儿车(id: 07),香奈儿标志(id: 11)是在我的左前方、右前方、左后方还是右后方? A. 左前方 B. 右前方 C. 左后方 D. 右后方
真实标签 (GT): A, Cambrian-S: C, 本文方法 (Ours): A
假设视频是从第一人称视角记录的,以下哪个选项最好地描述了该人在整个视频持续时间内的整体运动? A. 直行 B. 左转 C. 右转 D. U 型转弯
真实标签 (GT): B, Cambrian-S: A, 本文方法 (Ours): B
摄像机在整个视频持续时间内的行驶距离是多少米?
真实标签 (GT): 3.9, Cambrian-S: 2.4, 本文方法 (Ours): 3.5
黑色垃圾桶(id: 06)中心与旋转结构(id: 20)之间的距离是多少米?
真实标签 (GT): 11.10, Cambrian-S: 9.67, 本文方法 (Ours): 10.53
图 10: OSI-Bench 上的定性结果。