快速导读:Geo3R是一个无需训练的即插即用框架,通过从2D图像恢复多空间几何证据并构建结构化几何卡片,有效缓解MLLMs在透视、朝向和视点变化场景下的空间推理幻觉。
多模态大语言模型(MLLMs)在视觉理解任务中表现优异,但在涉及空间关系的推理中常出现‘幻觉’。Geo3R论文指出,这种幻觉并非单纯的语义错误,而是源于2D视觉表征与3D物理现实之间的结构性鸿沟。
该工作提出了一种无需训练的即插即用框架,通过从图像中恢复多空间几何证据,并构建World Card和Object-Local Card,为MLLM提供显式的空间约束。这种方法在不修改模型权重的前提下,有效缓解了透视、物体朝向和视点变化带来的推理错误。
英文题目:Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models
论文出处:arXiv 每日论文精选 · arXiv:2607.21085
原始论文:PDF / 论文页面
对应视频标题:MLLM空间推理幻觉怎么破?Geo3R用几何卡片给出答案|推荐指数:★★★★★
这篇论文解决什么问题?
现有研究多关注视觉-语义对齐或对象属性幻觉,缺乏对3D空间结构的显式建模。MLLMs通常基于2D像素位置判断空间关系,导致在透视变形、物体旋转或视角切换时产生严重误判。
例如,在透视场景中,远处的物体在图像中可能比近处物体更小,MLLM可能错误判断其大小或高度关系。在朝向场景中,物体正面方向的判断容易受图像裁剪影响。在视点场景中,相对位置关系随观察角度变化,MLLM难以建立稳定的空间参照系。
专门的空间理解模型通常需要额外训练且泛化性有限,而现有幻觉缓解方法如AdaptVis或Tri-HE主要针对语义一致性,对空间结构建模不足。
核心创新
- 定义了‘空间推理幻觉’概念,识别出透视效应、物体朝向和视点变化三个典型场景。
- 提出无需训练的即插即用框架,通过多空间几何表示桥接2D与3D差距。
- 设计结构化几何卡片(World Card/Object-Local Card),提供任务无关的显式几何证据。
方法概览
Geo3R包含三个阶段:(1) Visual Grounding识别关键对象;(2) Geometric Evidence Extraction利用预训练工具构建相机、世界(重力对齐)和物体局部坐标系的多空间3D表示;(3) Geometric-Augmented Spatial Reasoning将证据组织为World Card和Object-Local Card引导MLLM推理。
- Geo3R包含三个阶段:首先通过Visual Grounding识别关键对象并获取边界框。
- 其次进行Geometric Evidence Extraction,利用预训练工具(如DepthPro, GeoCalib)构建相机坐标系、重力对齐的世界坐标系和物体局部坐标系的多空间3D表示。
- 世界坐标系提供绝对高度和深度信息,物体局部坐标系提供相对位置和朝向信息。
- 最后构建Geometric-Augmented Spatial Reasoning,将证据组织为World Card和Object-Local Card。
- World Card包含重力对齐的世界坐标系下的几何信息,如绝对高度、深度和相机参数。
- Object-Local Card包含物体局部坐标系下的相对位置信息,如物体间的相对方向、距离和朝向。
- 这些卡片作为结构化提示输入MLLM,引导其进行基于几何证据的推理,而非依赖直觉或2D像素位置。
逐图理解论文
失效直觉

当物体因透视显得更小,或视角切换导致相对位置改变时,模型常基于2D像素位置做出错误判断。这种幻觉源于视觉表征与3D现实之间的结构性鸿沟,而非单纯的语义错误。
方法贡献

展示Geo3R整体流程:从图像输入到Visual Grounding,再到多空间几何证据提取,最后构建World Card和Object-Local Card辅助MLLM推理。注意三个阶段的数据流向和卡片结构。
实验验证

对比Geo3R与基线模型在18个任务上的性能。关注Geo3R+Gemini-3-Flash和Geo3R+Qwen3-VL的高亮结果,以及相比基线的显著提升。
结论与局限

定性展示Geo3R如何缓解三类幻觉:透视场景中World Card提供深度纠正误判;朝向场景中Object-Local Card揭示正确方向;视点场景中Object-Local Card解决视角依赖问题。
实验如何设计?
- 评估涵盖3DSRBench, ViewSpatial-Bench, CV-Bench共18个空间推理任务。
- 对比基线包括通用MLLMs(如GPT-5, Qwen3-VL)、空间理解模型(如SpatialThinker)及现有幻觉缓解方法(如AdaptVis, APC-VLM)。
- 进行组件消融实验,验证Grounding、SAM和Cards各模块的贡献。
- 测试噪声鲁棒性,向深度值和朝向信息注入高斯噪声或交换错误,评估框架稳定性。
关键结果与论文证据
- Geo3R+Gemini-3-Flash在平均准确率上达到72.40%,显著优于GPT-5的65.93%(第6页)。
- Geo3R+Qwen3-VL平均准确率为65.97%,相比基线提升10.90%(第6页)。
- 在视点变化场景下,Qwen3-VL提升13.57%,表明结构化证据对视角不变性至关重要(第7页)。
- 移除World Card和Object-Local Card导致整体性能下降10.0%,证明卡片的核心作用(第7页)。
- 消融实验显示,Grounding和SAM的准确性直接影响最终效果,但框架对上游误差具有一定鲁棒性。
- 噪声测试表明,即使几何证据存在轻微误差,MLLM仍能利用结构化卡片做出更合理的判断。
阅读时需要注意
- 性能上限受限于现有几何估计工具(如DepthPro, GeoCalib)的准确性,上游误差会传播至最终推理。
- 引入额外的推理时间开销,每个样本需执行多次工具调用和卡片构建。
- 对基础模型能力有依赖,较弱模型(如LLaVA-1.5)提升幅度较小,表明MLLM需具备基本空间理解能力才能有效利用几何证据。
- 在部分基准中,移除图像输入对Qwen3-VL反而有轻微提升,表明图像可能与几何卡片存在信息冲突。
关联工作
- 与SpatialThinker相比,Geo3R无需训练且泛化性更强,后者需针对特定任务微调。
- 与APC-VLM相比,Geo3R专注于空间几何证据,而非通用工具调用,针对性更强。
- 与AdaptVis相比,Geo3R解决的是空间结构建模问题,而非语义一致性幻觉。
- 与Tri-HE相比,Geo3R提供显式几何约束,而非仅通过关系推理缓解幻觉。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉
王明宇 金伟林 李文博∗ 北京大学 北京大学 未来智源 北京,中国 北京,中国 北京,中国
黄浩洋 贾桐† 李颖† 未来智源 北京大学 北京大学 北京,中国 北京,中国 北京,中国
摘要 尽管在视觉理解方面取得了显著进展,多模态大语言模型(MLLMs)在推理空间关系时仍容易产生幻觉,经常产生与场景真实3D结构相矛盾的判断。虽然已有几项工作提出缓解幻觉,但我们的分析表明,它们在空间推理方面的效果有限,因为它们未能弥合2D视觉表示与3D空间现实之间的根本差距。基于这一发现,我们将因空间结构建模不足而产生的幻觉定义为空间推理幻觉,这是现有缓解方法未能解决的关系幻觉的一个子类别。我们进一步确定了此类幻觉频繁发生的三种典型场景:透视效应、物体朝向和视角变化。为此,我们提出了Geo3R,这是一种无需训练、即插即用的框架,通过结合几何证据和结构化3D推理来缓解空间推理幻觉。在涵盖所有三种场景的18个任务的三个基准上的实验表明,Geo3R在不进行额外训练的情况下,显著降低了各种MLLM中的空间推理幻觉,优于现有的模型和方法。
CCS概念 • 计算方法 → 计算机视觉;自然语言处理。
关键词 空间推理,幻觉缓解,多模态大语言模型
1 引言 多模态大语言模型(MLLMs)在视觉理解、多模态问答和复杂推理任务方面取得了显著进展[15, 21, 23, 33]。然而,这些模型仍然受到幻觉的困扰,生成与视觉输入相矛盾的内容[1]。先前的工作通常将幻觉分为三类:存在性、属性和关系[26, 31]。其中,关系幻觉尤其具有挑战性,因为它需要理解物体之间的关系[31, 37]。此类幻觉会严重损害甚至完全破坏模型在现实世界应用中的可靠性,如具身导航、机器人操作和自动驾驶。
在关系幻觉中,空间关系引入了额外的挑战,要求模型从2D图像中推断3D空间关系。先前的研究表明,这一挑战导致MLLMs中出现严重的空间关系幻觉,在深度排序、物体朝向和相对距离任务中的幻觉率很高,而在依赖视角的判断任务中的准确率接近随机水平[12, 18]。如图1所示,根本原因是2D视觉表示与3D空间现实之间的差异。例如,透视投影可能导致物理上更高但更远的物体在图像中比近处的物体看起来更低,相机倾斜会扭曲物体的表观高度和位置,视角变化会改变物体之间感知的空间排列。这激发了专门针对空间理解开发的模型的发展[2, 7, 17]。然而,这些模型依赖于使用专门的空间数据进行额外训练,这产生了巨大的成本,限制了可扩展性,并且可能会在不同形式的空间推理中产生不一致的改进。
与这些专门模型相比,无需训练的幻觉缓解方法[6, 8, 31, 37]实现了轻量级部署,并易于与现有MLLMs集成。然而,这些方法在空间推理方面是否有效仍不清楚。为了检验这一点,我们在空间推理任务上评估了这些方法(第3节)。结果表明,这些方法产生的改进微乎其微,甚至产生负面改进,因为它们主要旨在改善视觉内容与生成文本之间的语义对齐,通常是通过基于现有
第 2 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Wang 等人
2D 视觉表示。因此,尽管它们可能有助于减少由视觉-语义不对齐引起的幻觉,但它们对于解决根植于 2D 视觉表示与 3D 空间现实之间差距的空间幻觉仍然不足。
受此分析启发,我们将空间推理幻觉定义为关系幻觉的一个子类别,它并非由视觉-文本不对齐引起,而是由空间结构建模不足引起。具体而言,我们确定了 2D 与 3D 之间差距尤为明显的三个代表性场景,即透视效应、物体朝向和视角变化。在所有三个场景中,关键挑战在于仅从 2D 视觉输入实现 3D 推理。
除了基于训练的方法外,免训练方法在不修改模型的情况下增强 3D 空间推理。基于提示的方法将空间任务分解为结构化的子问题,或通过相机轨迹等空间线索丰富输入 [13]。基于工具增强的方法构建 3D 表示或模拟替代视角,以实现显式的空间推理 [10, 28, 35]。然而,这些方法主要关注依赖于视角的推理,如参考系转换,而忽视了其他空间幻觉场景,如透视效应。此外,它们缺乏一个统一的框架来系统地解决多样化的空间推理幻觉。遵循这一免训练范式,我们提出的 Geo3R 作为一个统一的幻觉缓解框架,通过多空间几何表示涵盖了透视效应、物体朝向和视角变化。
为了解决这一挑战,我们提出了 Geo3R(Geometric 3D Reasoning,几何 3D 推理),这是一个免训练的即插即用框架,它通过从单张图像中提取显式的几何推理来增强任何 MLLM。其核心思想是从 2D 视觉输入中恢复 3D 几何证据,并将其作为结构化线索呈现,以引导 MLLM 得出基于空间的答案。Geo3R 包含三个连续阶段:视觉定位(Visual Grounding)、几何证据提取(Geometric Evidence Extraction)和几何增强空间推理(Geometric-Augmented Spatial Reasoning)。第一阶段识别与任务相关的物体。基于检测到的物体,第二阶段利用预训练的几何估计工具,构建跨越相机、重力对齐的世界(World Card)和物体局部(Object-Local Card)坐标系的多元空间 3D 表示。第三阶段随后将提取的证据组织成结构化的几何卡片,以指导 MLLM 的推理。在涵盖所有三个场景中 18 个任务的三个基准上的实验表明,Geo3R 使 Gemini-3-Flash 的平均准确率提高了 7.06%,Qwen3-VL-8B 提高了 10.90%,增强后的两者均超越了 GPT-5。
2.2 MLLM 中的幻觉缓解
MLLM 中的幻觉是指模型生成与视觉输入不符的内容,这仍然是一个关键挑战 [1]。此类幻觉通常分为存在、属性和关系类别 [26, 31]。早期研究主要关注物体幻觉,并建立了各种基准和缓解方法 [8, 14, 20, 36]。最近,注意力转向关系幻觉,即模型错误描述已正确识别实体之间的交互。与物体幻觉相比,关系幻觉更为普遍且难以缓解,因为它需要推理物体间的交互,而非识别单个实体。例如,Tri-HE [31] 报告称,LLaVA-1.5 的关系幻觉率达到 24.8%,几乎是其 12.4% 的物体幻觉率的两倍。
为了应对关系幻觉,人们提出了几种缓解方法 [6, 31, 32, 37]。Tri-HE [31] 将模型响应分解为结构化三元组,并执行自对齐以纠正关系幻觉。Reefknot [37] 检测低置信度的关系预测并对其进行重新校准。AdaptVis [6] 自适应地调整注意力分布以提高空间关系理解。然而,关于关系幻觉的研究仍处于早期阶段,有效的缓解方法仍然是一个开放性问题。
我们的贡献如下: • 我们分析了现有免训练幻觉缓解方法在空间推理任务上的失败,并定义了空间推理幻觉,确定了三个代表性场景,即透视效应、物体朝向和视角变化。 • 我们提出了 Geo3R,这是一个免训练的即插即用框架,它通过多空间几何表示和结构化几何卡片,弥合了 2D 视觉表示与 3D 空间现实之间的差距,使任何 MLLM 都能进行显式的空间推理。 • 在三个基准上的大量实验表明,Geo3R 显著提升了多种 MLLM 的性能,优于现有的模型和方法。
2 相关工作
2.1 MLLM 中的空间推理
尽管 MLLM 在视觉理解方面取得了显著进展,但空间推理仍然是一个重大挑战 [12, 18, 25]。人们提出了各种基于训练的方法来改善空间推理。一些方法整理大规模空间数据或设计分层课程以加强基础空间能力 [4, 5, 22],而另一些方法则注入几何归纳偏置,如深度特征 [7],或采用带有空间奖励的强化学习 [2, 17]。然而,这些方法依赖于使用专用空间数据进行额外的训练,限制了它们在不同空间推理场景中的泛化能力。
表 1:空间推理任务上幻觉缓解方法的准确率 (%)
| Method | Height | Closer | Viewpoint | Facing Left | Front | Avg | | :— | :— | :— | :— | :— | :— | :— | | Random | 50.00 | 50.00 | 25.00 | 50.00 | 50.00 | 50.00 | 45.83 | | LLaVA-1.5 | 51.40 | 58.60 | 24.80 | 41.20 | 40.20 | 50.60 | 44.47 | | OPERA | 52.80 | 57.60 | 23.20 | 43.60 | 40.20 | 52.20 | 44.93 +0.46 | | Tri-HE | -0.60 | 49.20 | 53.40 | 21.80 | 50.00 | 43.00 | 45.80 43.87 | | Reefknot | -0.67 | 51.00 | 58.40 | 25.40 | 39.40 | 39.00 | 49.60 43.80 | | AdaptVis | 50.60 | 58.60 | 23.40 | 57.80 | 41.40 | 44.60 | 46.07 +1.60 |
3 初步分析
尽管现有的幻觉缓解方法在减少物体和属性幻觉方面显示出有希望的结果,但它们在空间推理任务上的有效性仍不清楚。为了调查这一点,我们将一种通用方法和三种关系幻觉缓解方法 [6, 8, 31, 37] 应用于 LLaVA-1.5,并在六个
第 3 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉 会议缩写 ’XX,2018年6月3–5日,美国纽约伍德斯托克
一般场景 特殊场景 物体朝向。依赖于物体朝向的空间判断。回答诸如物体是否面对面或指向同一方向等问题,需要超越简单位置分析的显式朝向建模。 视角变化。依赖于观察者视角的空间关系。考虑物体在真实世界3D中的位置。哪个物体在观察者视角的更高处?
哪张描述最准确? 物体是人面向的 如果我站在猫的位置面向它,刀是在我前面还是后面? A. 扶手椅上的苹果 摩托车还是汽油箱? 位置? B. 扶手椅下的苹果 A.路灯在后面 B.火车 A. 摩托车 B. 汽油箱 A. 在前面 B. 在后面 D. 扶手椅右边的苹果
2D线索足以做出正确判断。 远处物体在2D中显得更低,但在3D中更高。 需要 需要 需要关于观察者参考系的推理。
图2:一般空间关系(左)与三种空间推理幻觉场景(a–c)。如图3所示,Geo3R是一个无需训练、即插即用的框架,它通过来自3DSRBench [18]的代表性空间推理任务,从单张图像中增强任何多模态大语言模型(MLLM)的显式几何推理能力,每个任务包含500个样本。核心思想是通过四个坐标系:图像空间 $P_I$、相机空间 $P_C$、重力对齐的世界空间 $P_W$ 和物体局部空间 $P_O$,逐步将2D像素观测提升为多空间几何证据,共同解决第3节中确定的所有三种空间幻觉场景。
结果总结在表1中。LLaVA-1.5本身在空间推理方面表现不佳,视角(Viewpoint)得分仅为24.80%,低于25%的随机基线,朝向(Facing)为41.20%,左侧(Left)为40.20%,也远低于其50%的随机基线。此外,应用现有的幻觉缓解方法未能解决这些缺陷。Tri-HE和Reefknot分别使整体性能下降了0.60%和0.67%,而OPERA仅带来0.46%的边际改善。尽管AdaptVis实现了最高的平均增益1.60%,但这种改善几乎完全由朝向任务驱动,而视角和前方(Front)等其他任务的性能反而下降。
为了理解这些结果,我们分析了根本原因。OPERA的无效性是可以理解的,因为它主要针对对象幻觉。然而,其余三种方法专门针对关系或空间幻觉,却仍未能产生一致的改进。因此,我们进一步分析幻觉模式,发现这些失败集中在需要理解3D空间结构而非表面视觉语义的任务中。如图2所示,对于2D图像线索足以处理的一般空间关系,现有方法可以有效缓解模型幻觉。然而,当2D视觉线索与真实3D空间关系(如透视效应、物体朝向和视角变化)不一致时,模型依赖于2D图像表示中的线索,而不是推理潜在的空间现实。这解释了为什么现有的幻觉缓解方法在空间推理任务上失败:它们改善了模型描述视觉感知实体及其交互的方式,但正确的空间判断需要超越2D像素的3D结构推理。
基于此分析,我们将空间推理幻觉定义为关系幻觉的一个子类别,源于空间结构建模不足,而非视觉-文本不对齐。与模型未能忠实描述其感知内容的普通幻觉不同,空间推理幻觉的发生是因为2D视觉线索本质上不足以确定真实的3D空间配置。具体而言,确定了这种幻觉的三个典型场景: 透视效应。由投影变换引入的失真,包括尺度变化和缩短。当透视线索与3D空间现实冲突时,模型可能会误判物体的相对大小、距离或空间位置。
Geo3R分为三个连续阶段:(a) 视觉定位,识别任务相关的物体及其图像区域;(b) 几何证据提取,使用几何估计模块构建多空间3D表示;(c) 几何增强的空间推理,将提取的证据组织成结构化卡片,以指导MLLM的最终答案。
4.1 视觉定位 给定图像 $I$ 和带有答案选项 $\{c_1, \dots, c_m\}$ 的空间推理问题 $Q$,视觉定位阶段提取任务相关物体及其图像区域的最小集合,产生三个输出:物体名称集合 $O = \{o_1, \dots, o_n\}$、像素坐标下的边界框 $B$,以及视觉观测 $s$,后者捕捉了MLLM基于2D视觉线索对场景的初始感知。具体而言,MLLM结合图像、问题和答案选项,联合提取物体名称 $O$、边界框 $B$ 和视觉观测 $s$。对于定位能力有限的MLLM,使用GroundingDINO [16] 获取边界框。
4.2 几何证据提取 本阶段通过渐进式转换链整合四个坐标系,构建多空间几何表示,将2D像素观测提升为结构化的几何证据。
4.2.1 坐标系定义。多空间几何表示建立在四个不同参考框架定义的坐标空间之上。 图像空间 $P_I \in \mathbb{R}^2$:图像平面中的2D像素坐标。 相机空间 $P_C \in \mathbb{R}^3$:以相机为中心的3D坐标。 世界空间 $P_W \in \mathbb{R}^3$:通过将相机空间旋转以与重力方向对齐而获得。 物体局部空间 $P_O \in \mathbb{R}^3$:以物体质心为中心,轴与物体的固有方向对齐。
4.2.2 反投影至相机空间。本阶段结合单目深度估计与相机内参校准,将2D像素观测提升为3D相机空间坐标。
第 4 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Wang 等人
空间推理任务 (a) 视觉定位 (b) 几何证据提取 识别关键物体,估计边界框,并描述视觉观测。工具:Grounding SAM Depth GeoCalib Orient
$K = \begin{bmatrix} f & 0 & c_x \\ 0 & f & c_y \\ 0 & 0 & 1 \end{bmatrix}$
$y_{(up)} = z_{cam} \frac{x_{cam}}{z_{cam}}$
考虑物体的真实世界3D位置 $z_{(left)}$。哪个物体的 $x_{(behind)}$ 位置更高? A. 背景中的路灯 B. 火车 火车:[151, 416, 561, 702] 背景中的路灯:[517, 737, 537, 853]
$P_{img}(u,v) \rightarrow P_{cam} \rightarrow P_{world} \ x_1,y_1,z_1 \rightarrow P_{obj} \ x_2,y_2,z_2 \rightarrow P_{ref} \ x_3,y_3,z_3$
回答3D空间问题 观测: 从单张2D图像来看,火车在图像空间中的位置比背景中的路灯高得多。
(c) 几何增强的空间推理
[世界卡片] 结合以下几何报告和图片回答问题。 火车:$y[3.519, 4.665]$,深度 = 15 路灯:$y[4.005, 22.159]$,深度 = 116 [几何报告] 答案:A 问题:哪个物体的位置更高? 证据:[物体局部卡片]:A. 背景中的路灯 B. 火车 [物体卡片] 在火车的局部坐标系中,路灯位于左侧、后方且更低。 回复:来自 路灯:红框 火车:蓝框 $p_{ox}=97.3, p_{oy}=45.2, p_{oz}=-33.6$ 世界卡片… 证据:[仅引用最相关的1-3项测量值]
图3:Geo3R概览。
具体而言,DepthPro [3] 生成逐像素的度量深度图 $D$,从中计算每个物体 $o_i$ 的深度 $z_i$。 $E_i = [x_{min}, x_{max}], [y_{min}, y_{max}], [z_{min}, z_{max}]$ . (5)
GeoCalib [27] 估计焦距 $f$,据此构建内参矩阵 $K$: $K = \begin{bmatrix} f & 0 & c_x \\ 0 & f & c_y \\ 0 & 0 & 1 \end{bmatrix}$ , (1) 其中 $(c_x, c_y)$ 是图像中心。结合由 SAM [9] 优化的分割掩码,每个深度为 $z$ 的像素 $(u, v)$ 被反投影到相机空间: $P_C = z \cdot K^{-1} \begin{bmatrix} u \\ v \\ 1 \end{bmatrix} = \begin{bmatrix} (u-c_x)z/f \\ (v-c_y)z/f \\ z \end{bmatrix}$ . (2)
4.2.3 重力对齐的世界变换。此阶段将相机空间坐标转换为重力对齐的世界坐标系,从而实现具有物理意义的垂直高度和深度比较。 GeoCalib 还估计相机相对于重力的方向,由横滚角 $\rho$ 和俯仰角 $\theta$ 参数化。我们构建旋转矩阵 $R$ 为: $R = R_z(-\rho) R_x(-\theta)$ , (3) 其中 $R_x$ 和 $R_z$ 分别表示绕 $X$ 轴和 $Z$ 轴的基本旋转矩阵。相机空间点随后被变换为重力对齐的世界坐标系 $P_W$: $P_W = R^\top P_C$ , (4) 其中 $Y_W$ 指向与重力相反的方向。 对于每个物体,我们将所有掩码像素投影到世界坐标中,并计算沿每个轴的修剪分位数范围(第10–90百分位),从而得到3D边界范围 $E_i$:
4.2.4 物体局部变换。此阶段估计物体方向,并在物体局部坐标系中表示相对物体位置。 我们使用 Orient Anything V2 [29] 估计每个物体的3D方向,获得编码物体在相机空间中局部轴的旋转矩阵 $R^{C}_{obj}$。然后将其转换为世界坐标系下的 $R^{W}_{obj}$: $R^{W}_{obj} = R^\top R^{C}_{obj}$ . (6) 给定一个参考物体,其世界空间质心为 $c_{ref}$ 且方向为 $R^{W}_{ref}$,目标物体在参考物体局部坐标系中的位置计算如下: $P_O = (R^{W}_{ref})^\top (P_{W,tgt} – c_{ref})$ . (7)
4.2.5 逐物体配置与成对关系聚合。此阶段将几何测量值聚合为逐物体配置和成对关系。 对于每个定位到的物体 $o_i$,我们编译统一的几何配置: $G_i = \{ P_{C,i}, P_{W,i}, z_i, E_i, \alpha_i, v_i \}$ , (8) 其中 $v_i$ 表示从估计的方位角 $\alpha_i$ 推导出的相机可见面。 对于每个有序对 $(o_i, o_j)$,我们从两个互补的坐标系中推导成对关系。世界坐标系关系捕捉全局空间结构,包括3D距离、垂直和深度顺序、相对于相机的方向以及物体间的航向关系。 物体局部关系捕捉相对于参考物体的空间结构。从目标的局部位置 $P_O$,我们推导出
第 5 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉 会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克
局部偏移、量化方向以及目标所朝向的参考面。当多个目标共享同一参考时,还会额外生成比较摘要。
4.3 几何增强的空间推理
SpatialThinker GPT-5 Qwen3 Gemini 90 85 +7.9 65 +4.0 70 +9.5 80 +10.2 60 +9.4 60 +13.6 75 55 50 70 50 65 45 40 60 SpatialThinker GPT-5 Qwen3 Gemini SpatialThinker GPT-5 Qwen3 Gemini 视角 朝向 视点
图4:多模态大语言模型(MLLMs)、空间理解模型与Geo3R在场景级平均准确率上的比较。
本阶段将几何证据组织为结构化卡片,并将其整合到MLLM提示中,以引导MLLM的空间推理。
基于卡片的设计源于两点考量。首先,不同的空间推理场景需要来自不同坐标系的证据。其次,以非结构化形式呈现所有原始测量值可能会使MLLM不堪重负,导致其选择不相关或相互矛盾的线索。因此,我们将提取的几何证据组织为三张结构化卡片,按坐标系分解证据,每张卡片均附带解释底层约定的字段说明。重要的是,所有卡片均与任务无关(task-agnostic),即针对每个问题提供相同的字段集,从而避免使用任务类型分类器,并允许MLLM灵活地跨卡片组合证据。此外,每个字段将连续测量值与离散的、人类可读的摘要配对,使MLLM能够利用摘要作为解释性线索,同时对照原始值验证推理过程。
物体卡片(Object Card)。该卡片将每个检测到的物体映射到标注图像上绘制的彩色编码边界框,将文本物体名称与视觉区域进行定位,并在所有卡片间建立一致的参考。
世界卡片(World Card)。对于每个物体,该卡片报告其在重力对齐的世界坐标系中的3D边界框范围 $E_i$、相机深度 $z_i$ 以及相机可见面 $v_i$。对于每对物体,它提供垂直顺序、深度顺序、3D距离 $d_{ij}$、方位关系 $h_{ij}$ 以及相对于相机的方向。
物体局部卡片(Object-Local Card)。对于每个参考-目标对,该卡片报告局部偏移向量 $P_O$、量化局部方向、目标所朝向的参考面,以及组合的垂直-俯视空间关系。当多个目标共享同一参考物体时,会包含三个局部轴上的比较摘要。
所有三张卡片及其使用指南均在第二阶段提示中提供。随后,MLLM将几何证据与其视觉理解相结合,生成最终答案。完整的提示模板、卡片示例和方法细节见附录。
5 实验
5.1 实验设置
5.1.1 数据集与任务。我们在三个基准测试的18个空间推理任务上评估Geo3R,共计17,493个样本。
根据第3节定义的三个场景,这些任务被分为视角(Perspective)、朝向(Orientation)和视点(Viewpoint)。视角涵盖7个任务,共6,698个样本;朝向涵盖6个任务,共5,422个样本;视点涵盖5个任务,共5,373个样本。
ViewSpatial-Bench (VSB) [12] 是一个多视角空间推理基准测试,旨在探测相机视角和人物视角的理解能力。我们评估了跨越朝向和视点场景的4个任务。
3DSRBench (3DSR) [18] 是一个基于真实世界图像构建的综合3D空间推理基准测试。我们在涵盖所有三个场景的12个任务上进行评估,包括位置和高度比较、朝向判断以及方向推理。
CV-Bench (CVB) [25] 是Cambrian-1中引入的一个以视觉为中心的基准测试,包含2D和3D子集。我们在包含2个视角任务的3D子集上进行评估,这些任务需要可靠的深度理解,涉及深度排序和距离估计。
5.1.2 基线。我们将方法与三类现有方法进行比较。
通用多模态大语言模型。我们包括七种MLLM,涵盖不同规模的开源和专有模型,包括LLaVA-1.5-7B [15]、LLaVA-OV-7B [11]、InternVL3-8B [38]、Qwen3-VL-8B [33]、Kimi-VL-A3B [24]、Gemini-3-Flash [23] 和 GPT-5 [21]。这些模型均在零样本设置下进行评估,无需任何特定于空间的适配。
空间理解模型。我们包括五种明确为空间推理训练或微调的模型,包括Space-LLaVA-7B [5]、SpatialRGPT-8B [7]、Spatial-SSRL-7B [17]、SenseNova-SI-7B [4] 和 SpatialThinker-7B [2]。这些模型结合了空间感知训练数据或学习范式,以增强3D理解能力。
幻觉缓解与工具增强方法。我们包括一种通用幻觉缓解方法OPERA [8],以及三种关系幻觉方法Tri-HE [31]、Reefknot [37] 和 AdaptVis [6]。大多数这些方法需要访问模型内部结构,如注意力权重或隐藏状态,这限制了它们对特定架构的兼容性。为了公平且统一的比较,所有四种方法均在LLaVA-1.5-7B上进行评估,这是唯一被其所有官方实现支持的模型。我们还与APC-VLM [10] 进行比较,这是一种无需训练的工具增强方法,因为其他空间推理方法要么需要额外训练,要么针对不同的任务,要么未公开可用。APC-VLM在Qwen3-VL上按照与Geo3R相同的协议进行评估。
5.1.3 实现细节。所有三个基准测试在我们评估的子集中均为多项选择题。对于所有实验,我们使用官方评估分割作为 ground truth。遵循标准协议,我们基于预测答案与 ground truth 答案之间的精确匹配报告准确率(Accuracy)。我们报告所有18个任务的简单平均值作为整体指标。详细的任务描述、场景映射和实现细节见附录。
第 6 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Wang 等人
表 2:与多模态大语言模型(MLLMs)在空间推理基准上的对比。最佳结果高亮,次佳结果下划线。𝑉VSB,𝑆3DSR,𝐶CVB。
视角 方向 视点 位置𝑆 高度𝑆 位置𝑆 位置𝑆 位置𝑆 任务 上方 更高 相机 下一个 物体 深度𝐶 距离𝐶 方向.相机𝑉 方向.位置𝑉 方向.𝑆视角 方向.𝑆朝向 同方向.方向.𝑆 方向.𝑆平行 方向.𝑆朝向 方向.𝑆左侧 方向.𝑆前方 相对方向.位置𝑉 相对方向.相机𝑉 平均
随机 50.00 50.00 50.00 50.00 50.00 50.00 50.00 25.00 25.00 25.00 50.00 50.00 50.00 25.00 50.00 50.00 25.00 25.00 41.67
通用多模态大语言模型 LLaVA-1.5 56.72 50.51 58.92 55.16 47.43 51.00 48.83 10.44 51.61 24.85 42.63 45.78 50.74 26.02 40.54 51.74 37.53 27.69 43.23 LLaVA-OV 64.23 59.28 74.12 55.16 53.86 51.67 54.17 23.29 36.24 37.54 60.98 50.87 52.21 24.85 38.83 56.25 32.54 40.78 48.16 InternVL3 63.80 56.67 85.03 57.37 61.71 86.00 71.17 26.41 38.35 42.57 65.32 52.91 57.37 25.07 34.53 63.95 35.87 51.95 54.22 Qwen3-VL 69.36 54.86 87.68 58.41 64.71 95.00 47.67 28.61 45.08 42.93 68.79 55.81 56.34 27.04 35.10 63.95 36.58 53.41 55.07 Kimi-VL 70.95 59.64 78.02 73.89 63.86 84.83 64.83 27.21 56.43 40.82 67.34 49.27 56.78 30.76 34.81 62.94 43.94 49.52 56.44 Gemini-3-Flash 70.09 53.26 80.90 73.60 68.43 91.67 88.50 35.54 42.57 57.14 73.55 65.84 69.17 42.64 62.46 82.41 57.36 60.97 65.34 GPT-5 72.25 72.90 87.17 74.63 77.57 92.33 90.67 30.02 41.37 54.59 70.23 62.79 65.49 40.67 56.59 80.96 52.97 63.45 65.93
空间理解模型 SpaceLLaVA 52.82 51.01 50.44 52.06 49.43 50.50 48.67 15.46 46.08 25.51 52.31 45.78 50.15 24.49 50.43 50.73 35.75 28.99 43.37 SpatialRGPT 59.54 59.28 70.35 68.14 58.00 77.17 61.33 27.21 38.15 34.91 56.07 54.65 53.39 24.56 39.54 58.14 33.85 41.57 50.88 Spatial-SSRL 57.66 53.33 82.23 61.36 64.14 90.00 76.83 29.62 41.87 37.68 64.16 52.62 54.72 21.57 34.67 61.92 38.84 42.81 53.67 SenseNova-SI 52.31 53.12 81.86 52.21 64.86 85.17 82.67 22.29 57.43 30.10 73.84 53.63 55.46 22.67 34.67 55.96 42.76 46.31 53.74 SpatialThinker 66.04 59.64 75.96 66.22 59.71 85.50 79.17 30.02 50.60 43.00 69.65 50.73 53.69 22.89 35.10 62.21 38.36 44.22 55.15
ours + LLaVA-1.5 56.58 51.23 55.09 56.78 45.71 56.67 51.17 10.64 67.77 29.59 46.82 53.20 52.95 25.87 49.57 52.91 35.99 31.19 46.10 + Qwen3-VL 69.51 71.30 88.42 84.96 74.14 90.83 70.17 32.53 55.52 64.87 70.66 63.52 67.11 45.19 45.70 72.24 60.81 60.01 65.97 + Gemini-3-Flash 69.15 71.96 88.05 80.38 85.71 93.83 92.83 39.26 43.78 72.23 77.75 67.01 67.99 65.01 78.94 79.65 74.47 55.27 72.40
表 3:与幻觉缓解方法在 LLaVA-1.5 上的对比(最佳结果高亮,次佳结果下划线),以及向 Qwen3-VL 和 Gemini-3-Flash 添加 Geo3R 的效果。
视角 方向 视点 位置𝑆 高度𝑆 位置𝑆 位置𝑆 位置𝑆 任务 上方 更高 相机 下一个 物体 深度𝐶 距离𝐶 方向.相机𝑉 方向.位置𝑉 方向.𝑆视角 方向.𝑆朝向 同方向.方向.𝑆 方向.𝑆平行 方向.𝑆朝向 方向.𝑆左侧 方向.𝑆前方 相对方向.位置𝑉 相对方向.相机𝑉 平均
随机 50.00 50.00 50.00 50.00 50.00 50.00 50.00 25.00 25.00 25.00 50.00 50.00 50.00 25.00 50.00 50.00 25.00 25.00 41.67
LLaVA-1.5 56.72 50.51 58.92 55.16 47.43 51.00 48.83 10.44 51.61 24.85 42.63 45.78 50.74 26.02 40.54 51.74 37.53 27.69 43.23 + OPERA 56.00 51.09 58.55 52.65 48.14 56.17 48.17 10.04 51.10 24.93 44.65 46.51 48.38 25.87 40.69 52.18 37.17 29.55 43.44 +0.21
+ Tri-HE 55.35 48.99 56.19 51.77 50.00 51.67 48.33 8.94 56.53 24.78 50.29 46.22 49.56 24.78 42.84 46.66 33.61 27.98 43.03 -0.20 + Reefknot 57.08 50.14 59.51 55.46 49.14 52.50 46.67 10.54 50.00 25.29 41.76 46.80 48.67 25.58 39.83 51.16 37.77 29.44 43.19 -0.04 + AdaptVis 46.46 49.49 55.53 55.01 48.71 60.50 50.50 9.14 59.24 23.54 57.23 48.55 50.59 27.26 41.83 45.49 35.04 26.45 43.92 +0.69 + Geo3R 56.58 51.23 55.09 56.78 45.71 56.67 51.17 10.64 67.77 29.59 46.82 53.20 52.95 25.87 49.57 52.91 35.99 31.19 46.10 +2.87
Qwen3-VL 69.36 54.86 87.68 58.41 64.71 95.00 47.67 28.61 45.08 42.93 68.79 55.81 56.34 27.04 35.10 63.95 36.58 53.41 55.07 + APC-VLM 49.42 45.43 48.97 41.30 53.00 74.17 61.17 22.49 45.88 22.45 61.42 51.45 51.33 22.81 53.44 45.93 40.97 57.08 47.15 -7.92 + Geo3R 69.51 71.30 88.42 84.96 74.14 90.83 70.17 32.53 55.52 64.87 70.66 63.52 67.11 45.19 45.70 72.24 60.81 60.01 65.97 +10.9
Gemini-3-Flash 70.09 53.26 80.90 73.60 68.43 91.67 88.50 35.54 42.57 57.14 73.55 65.84 69.17 42.64 62.46 82.41 57.36 60.97 65.34 + Geo3R 69.15 71.96 88.05 80.38 85.71 93.83 92.83 39.26 43.78 72.23 77.75 67.01 67.99 65.01 78.94 79.65 74.47 55.27 72.40 +7.06
5.2 与多模态大语言模型的比较 表 2 展示了所有模型在 18 个空间推理任务上的性能。空间理解模型显示出有限且不一致的提升。专为空间理解设计的模型在某些任务上有所改进,但无法在所有任务上实现泛化。通用多模态大语言模型缺乏稳健的空间推理能力。尽管 LLaVA 在合成空间推理数据上进行了微调,但在大多数任务上的准确率仅略高于随机基线,总体平均分为 43.37%。SenseNova-SI 和 SpatialThinker 在选定的 Perspective(视角)和 Orientation(方向)任务上取得了强劲的结果,其中 SenseNova-SI 在距离估计上达到 82.67%,SpatialThinker 在深度排序上达到 85.50%,但两者在 Viewpoint(视点)任务上得分急剧下降,在 towards object(朝向物体)任务上仅分别获得 22.67% 和 22.89% 的分数。这些结果表明,现有的空间理解模型往往只提升特定的空间技能,如深度估计,而忽略了其他技能,尤其是视点推理。
Geo3R 提升了基础模型的空间推理能力。 Geo3R 结合 Gemini-3-Flash 取得了最高的总体平均分 72.40%,比 GPT-5 高出 6.47%,并在 18 个单独任务中的 9 个任务上取得了最佳分数。这些增益在涉及更复杂 3D 推理的任务上最为显著,特别是方向理解和视点理解,这仍然是当前多模态大语言模型的一大挑战。
第 7 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉 会议简称 ’XX,2018年6月3–5日,纽约伍德斯托克
其中基线方法表现挣扎。例如,朝向视角从 57.14% 提升至 72.23%,朝向物体从 42.64% 提升至 65.01%,以及朝向左侧从 62.46% 提升至 78.94%。值得注意的是,尽管模型规模存在显著差异,Geo3R 配合 Qwen3-VL-8B 在 18 项任务的平均准确率上达到 65.97%,超越了 GPT-5 的 65.93%。观察到了类似的任务级提升,Qwen3-VL 的朝向视角从 42.93% 升至 64.87%,朝向物体从 27.04% 升至 45.19%。即使在 LLaVA-1.5 上,Geo3R 也将平均准确率从 43.23% 提升至 46.10%。由于 Qwen3-VL-8B 的规模与上述评估的大多数模型相当,这些一致的提升表明,几何增强比扩大模型规模或空间特定微调更有效,同时适用于 diverse 的基础架构。
表 4:Qwen3-VL 在 3DSR 上的组件消融实验。场景列报告各组内的宏平均准确率。Avg 为所有 12 项任务的宏平均值。
| Method | Perspective | Orientation | Viewpoint | Avg | | :— | :— | :— | :— | :— | | Qwen3-VL | 67.0 | 56.0 | 42.0 | 57.1 | | + Geo3R | 77.7 | 66.5 | 54.4 | 68.1 | | + Geo3R (a) | 73.2 | 66.1 | 51.0 | 65.3 (-2.8) | | + Geo3R (b) | 75.7 | 66.4 | 53.7 | 67.1 (-1.0) | | + Geo3R (c) | 69.2 | 55.2 | 59.4 | 62.1 (-6.0) | | + Geo3R (d) | 77.4 | 67.1 | 41.7 | 65.0 (-3.1) | | + Geo3R (e) | 69.1 | 55.3 | 43.4 | 58.1 (-10.0) |
图 4 可视化了场景级比较。所有三个场景在所有基础模型上均因 Geo3R 而受益。在 Qwen3-VL 上,Perspective 提升 10.24%,Orientation 提升 9.45%,Viewpoint 提升 13.57%。在 Gemini-3-Flash 上,相应的提升分别为 7.92%、4.04% 和 9.50%。最大的增益出现在 Viewpoint 上,其基线准确率较低,提升空间更大。
图 5 展示了定性示例,说明 Geo3R 如何缓解三个场景中的空间推理幻觉。在 Perspective 案例中,基线方法误判了从 2D 位置出发的物体深度,而 World Card 提供了用于正确判断的度量深度。在 Orientation 案例中,朝向目标被错误识别,但 Object-Local Card 揭示了正确的朝向方向。在 Viewpoint 案例中,关系是从相机视角回答的,而 Object-Local Card 在参考物体自身的坐标系中解决了该关系。
当应用于 Qwen3-VL 时,APC-VLM 使整体准确率下降 7.92%,从 55.07% 降至 47.15%。虽然它在某些与视角相关的任务(如朝向左侧和距离)上有所改善,但它降低了其他大多数任务的表现,其中“离相机更近”的位置下降了 38.71%,深度下降了 20.83%。这种退化主要归因于其设计,该设计专门针对视角变化任务,并严重依赖小型检测模型进行场景抽象,导致在非视角任务和检测失败时输出质量下降。相比之下,Geo3R 主要利用 VLM 自身的视觉定位能力,旨在解决所有空间推理场景,在所有场景中实现了稳健的提升。
Geo3R 随基础模型能力的提升而扩展。Geo3R 在所有三个基础模型上均产生了显著改进,LLaVA-1.5 提升 2.87%,Qwen3-VL 提升 10.90%,Gemini-3-Flash 提升 7.06%。与 Qwen3-VL 相比,Gemini-3-Flash 的提升较低,部分归因于其基线已经很强(65.34%),相比 Qwen3-VL 的 55.07%,其提升空间较小。由于无论基础模型如何,Geo3R 提供的几何证据都是相同的,增益的差异反映了每个模型将结构化 3D 线索与其自身视觉理解相结合的能力。像 Qwen3-VL 和 Gemini-3-Flash 这样更强的模型能够有效综合深度、朝向和相机参数与视觉上下文,将几何证据转化为正确的空间判断。相比之下,LLaVA-1.5 受限于有限的推理能力,使其不太能够利用额外的几何信息。这种扩展行为表明,几何增强的有效性紧密依赖于基础模型的整体能力,包括但不限于指令遵循、结构化输入整合以及对估计噪声的鲁棒性。
5.3 与其他方法的比较
表 3 比较了现有的幻觉缓解方法以及分别应用于 LLaVA-1.5 和 Qwen3-VL 的 APC-VLM,并报告了在三个基础模型中添加 Geo3R 的效果。
现有的幻觉缓解方法对空间推理无效。在 LLaVA-1.5 组中,OPERA、Tri-HE 和 Reefknot 对整体准确率的改变微乎其微甚至为负,增益或损失在 0.25% 以内。AdaptVis 实现了 0.69% 的适度整体增益,但表现出每任务行为不一致,将人物朝向从 51.61% 提升至 59.24%,同时将“位于上方”的位置从 56.72% 降至 46.46%。这些结果表明,现有的主要通过对解码调整或注意力重新分配来针对对象级或关系级幻觉的方法,并未解决空间推理幻觉的根本原因,即缺乏显式的 3D 几何信息。相比之下,Geo3R 将平均准确率提高了 2.87%,在 18 项任务中的 11 项上取得了最佳分数。最大的增益出现在人物朝向上,从 51.61% 升至 67.77%,其中结构化的几何证据提供了 MLLM 原本无法从 2D 视觉特征中获得的显式视角线索。如图 6 所示,这种优势贯穿所有三个场景,而现有方法显示出边际或不一致的改进。
与工具增强推理的比较。我们还与 APC-VLM [10] 进行了比较,这是一种并发方法,它渲染透视变换的视觉提示以增强空间推理。
5.4 消融实验
组件消融。表 4 报告了 Qwen3-VL 在 3DSR 上的消融结果。完整的 Geo3R 管道实现了 68.1% 的整体准确率。我们评估了五种消融变体:(a) 用 Grounding DINO 替换自定位。(b) 移除 SAM 分割。(c) 移除 World Card。(d) 移除 Object-Local Card。(e) 移除两张卡片。
用 Grounding DINO 替换自定位 (a) 将准确率降至 65.3%,Perspective 任务下降最大,从 77.7% 降至 73.2%,证实了更强基础模型内置的定位与其视觉表示更好地校准。移除 SAM 分割 (b) 导致较小的退化,降至 67.1%。
第 8 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Wang 等人
世界卡片 透视法 答案护栏:深度 = 4.374 考虑物体的真实世界 3D 位置。GPT-5 A 广告牌:深度 = 3.612 哪个物体离相机更近? Gemini-3-Flash A 田野较小注:意味着离相机更近。 A. 护栏 B. 广告牌 Qwen3-VL A 答案:B(广告牌) 证据:raw_depth = 3.612(广告牌)< raw_depth = 4.374(护栏) Qwen3-VL+Geo3R B → 广告牌离相机更近。
物体局部卡片 方向法 答案 在图片的局部坐标系中: 考虑物体的真实世界 3D 位置和方向 GPT-5 B 冰箱:方向 = 左前,可见面 = 前 哪个物体是面向墙壁的,冰箱还是微波炉? 微波炉: A. 冰箱 B. 微波炉 Gemini-3-Flash B 方向 = 左,可见面 = 左 Qwen3-VL B 答案:A(冰箱) Qwen3-VL+Geo3R A 证据:在图片的局部坐标系中,冰箱方向 = 左前, visible_side_to_target = 前→ 图片的正面朝向冰箱。
物体局部卡片 视角法 答案 在穿蓝衬衫男孩的局部坐标系中: 考虑物体的真实世界 3D 位置和方向 穿白衣服的男孩: 如果我站在穿长袖蓝衬衫的男孩 GPT-5 B 方向 = 左,可见面 = 左 的位置,面向它面对的方向,穿白衣服的 Gemini-3-Flash B 穿蓝衬衫的男孩: 男孩是在我的左边还是右边? visible_side_to_camera = 右 Qwen3-VL B 答案:A(在左边) A. 在左边 B. 在右边 Qwen3-VL+Geo3R A 证据:object_local_direction = 左 → 从穿蓝衬衫男孩的 视角来看,穿白衣服的男孩在他的左边。
图 5:Geo3R 缓解三种场景下空间推理幻觉的定性示例。
LLaVA-1.5 Tri-HE AdaptVis OPERA Reefknot Geo3R 以及物体间距离。值得注意的是,视角法略有提升, 54.5 +5.8 40 44 +2.4 可能是因为模型不再需要选择适当的 39 54.0 +0.7 43 42(%) 53.5 38 卡片,可以专注于剩余的物体局部卡片。移除 53.0 41 物体局部卡片 (d) 导致整体准确率下降 3.1%, 52.5 37 40准确率 52.0 39 36 但对视角法任务的影响不成比例地达到 12.7%,Avg 51.5 38 51.0 37 35 因为视角推理依赖于以物体为中心的方向线索。 50.5 36 34 透视法 方向法 视角法 移除两张卡片 (e) 导致整体性能下降 10.0%, 接近未增强基线的 57.1%,证实了 这两张卡片提供了互补的几何信息,并且Figure 6:幻觉缓解方法应用于 LLaVA-1.5 的场景级平均准确率。 共同负责 Geo3R 的大部分改进。 第 2 阶段图像输入的影响。表 5 考察了在推理阶段 表 5:移除第 2 阶段图像输入的影响 (w/o Img)。 是否必须使用标注图像,方法是移除它并仅 每个数据集列报告了其组成任务的宏平均值。Avg 是三个数据集级 依赖结构化几何卡片。所有三个基础 值的平均值。 模型均显示出约 1.5% 至 1.6% 的一致性整体性能下降。值得注意的是,影响因基准测试而异。在 3DSR 上, 模型 方法 3DSR VSB CVB Avg 准确率保持稳定甚至略有提升,Qwen3-VL 从 68.1% 提升至 69.1%,表明图像可能会在 Qwen3-VL 的推理中引入与几何卡片冲突的视觉线索,移除它消除了这种干扰。在所有其他模型-基准测试组合中,移除图像始终导致性能下降,因为标注图像中的视觉线索补充了几何测量,适用于需要透视比较或视角推理的任务。总体而言,这些结果证实了标注图像仍然有益,并为几何卡片提供了互补信息。 Qwen3-VL 完整 68.1 52.2 80.5 67.0 w/o Image 69.1 50.0 76.9 65.4 -1.6 LLaVA-1.5 完整 48.0 36.4 53.9 46.1 w/o Image 47.6 34.2 51.9 44.6 -1.5 LLaVA-1.5 的其他组件消融结果见附录。 透视法和视角法任务受影响最大,分别从 77.7% 降至 75.7% 和从 54.4% 降至 53.7%,因为掩码级边界直接影响用于深度、范围和质心计算的背投影点云的质量。方向法任务保持相对稳定,为 66.4%,因为方向估计依赖于裁剪后的图像区域,而不是精确的分割掩码。移除世界卡片 (c) 导致整体性能下降 6.0%,其中透视法下降 8.5%,方向法下降 11.3%,因为这些任务依赖于全局空间上下文,如相机相对深度。
6 局限性与结论 我们承认当前工作存在几个局限性。首先,Geo3R 依赖于现有的几何估计工具,其准确性上限决定了框架的性能。然而,模块化设计允许随着更准确估计器的出现进行 straightforward 替换。其次,该框架引入了额外的推理时开销,但我们的时序分析(提供
第 9 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉 会议缩写 ’XX,2018年6月3–5日,美国纽约伍德斯托克
(附录中)表明其性能与现有方法相当,且使用更轻量的组件可进一步降低幻觉。
第三,当前的评估集中于单图像空间推理,尽管鉴于该框架的几何基础,扩展到多视图或基于视频的场景是自然的下一步。
总之,我们将空间推理幻觉定义为多模态大语言模型(MLLMs)中关系幻觉的一个子类别,并提出了 Geo3R。这是一个无需训练、即插即用的框架,通过显式几何证据弥合 2D 视觉表示与 3D 空间现实之间的差距。大量实验表明,Geo3R 显著降低了多种 MLLM 的空间推理幻觉,使 Gemini-3-Flash 提升了 7.06%,Qwen3-VL-8B 提升了 10.90%。我们的结果表明,空间推理的一个关键瓶颈是缺乏结构化的 3D 几何信息,而这可以在推理时无需额外训练有效地提供。
参考文献
[1] Zechen Bai, Pichao Wang, Tianjun Xiao, Tong He, Zongbo Han, Zheng Zhang, 和 Mike Zheng Shou。2024。多模态大语言模型的幻觉:一项综述。arXiv 预印本 arXiv:2404.18930 (2024)。
[2] Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, 和 Ronald Clark。2025。SpatialThinker:通过空间奖励强化多模态大语言模型中的 3D 推理。arXiv 预印本 arXiv:2511.07403 (2025)。
[3] Aleksei Bochkovskii, Amaël Delaunoy, Hugo Germain, Marcel Santos, Yichao Zhou, Stephan R Richter, 和 Vladlen Koltun。2024。Depth pro:不到一秒内实现锐利的单目度量深度。arXiv 预印本 arXiv:2410.02073 (2024)。
[4] Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun 等。2025。利用多模态基础模型扩展空间智能。arXiv 预印本 arXiv:2511.13719 (2025)。
[5] Boyuan Chen, Zhuo Xu, Sean Kirmani, Brain Ichter, Dorsa Sadigh, Leonidas Guibas, 和 Fei Xia。2024。Spatialvlm:赋予视觉语言模型空间推理能力。在 IEEE/CVF 计算机视觉与模式识别会议论文集。14455–14465。
[6] Shiqi Chen, Tongyao Zhu, Ruochen Zhou, Jinghan Zhang, Siyang Gao, Juan Carlos Niebles, Mor Geva, Junxian He, Jiajun Wu, 和 Manling Li。2025。为什么空间推理对视觉语言模型来说很难?一种基于注意力机制对关注区域的视角分析。arXiv 预印本 arXiv:2503.01773 (2025)。
[7] An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang, Jan Kautz, Xiaolong Wang, 和 Sifei Liu。2024。Spatialrgpt:视觉语言模型中的接地空间推理。神经信息处理系统进展 37 (2024), 135062–135093。
[8] Qidong Huang, Xiaoyi Dong, Pan Zhang, Bin Wang, Conghui He, Jiaqi Wang, Dahua Lin, Weiming Zhang, 和 Nenghai Yu。2024。Opera:通过过度信任惩罚和回顾-分配缓解多模态大语言模型中的幻觉。在 IEEE/CVF 计算机视觉与模式识别会议论文集。13418–13427。
[9] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C Berg, Wan-Yen Lo 等。2023。Segment anything。在 IEEE/CVF 国际计算机视觉会议论文集。4015–4026。
[10] Phillip Y Lee, Jihyeon Je, Chanho Park, Mikaela Angelina Uy, Leonidas Guibas, 和 Minhyuk Sung。2025。视觉语言模型中的视角感知推理。
[11] Haotian Liu, Chunyuan Li, Yuheng Li, 和 Yong Jae Lee。2024。改进基线:通过视觉指令微调。在 IEEE/CVF 计算机视觉与模式识别会议论文集。26296–26306。
[12] Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su 等。2024。Grounding dino:将 dino 与接地预训练结合用于开放集目标检测。在欧洲计算机视觉会议。Springer, 38–55。
[13] Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, 和 Jiaqi Wang。2025。Spatial-ssrl:通过自监督强化学习增强空间理解。arXiv 预印本 arXiv:2510.27606 (2025)。
[14] Wufei Ma, Haoyu Chen, Guofeng Zhang, Yu-Cheng Chou, Jieneng Chen, Celso de Melo, 和 Alan Yuille。2025。3dsrbench:全面的 3D 空间推理基准。在 IEEE/CVF 国际计算机视觉会议论文集。6924–6934。
[15] Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, 和 Xu Sun。2025。Spacer:强化多模态大语言模型在视频空间推理中的能力。arXiv 预印本 arXiv:2504.01805 (2025)。
[16] Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns, Trevor Darrell, 和 Kate Saenko。2018。图像描述中的对象幻觉。在 2018 年自然语言处理实证方法会议论文集。4035–4045。
[17] Aaditya Singh, Adam Fry, Adam Perelman, Adam Tart, Adi Ganesh, Ahmed El-Kishky, Aidan McLaughlin, Aiden Low, AJ Ostrow, Akhila Ananthram 等。2025。OpenAI GPT-5 系统卡片。arXiv 预印本 arXiv:2601.03267 (2025)。
[18] Yihong Tang, Shenhao Wang, Ao Yunhan Qu, Zhaokai Zheng, Zhan Wang, Zhao Dingyi, 和 Zhuang Jinhua。2024。Sparkle:通过激发基本空间能力来增强视觉语言模型中的泛化能力,以进行组合空间推理。(2024)。
[19] Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican 等。2023。Gemini:一系列高度多模态模型。arXiv 预印本 arXiv:2312.11805 (2023)。
[20] Kimi Team, Angang Du, Bohong Yin, Bowei Xing, Bowen Qu, Bowen Wang, Cheng Chen, Chenlin Zhang, Chenzhuang Du, Chu Wei 等。2025。Kimi-vl 技术报告。arXiv 预印本 arXiv:2504.07491 (2025)。
[21] Shengbang Tong, Ellis Brown, Penghao Wu, Sanghyun Woo, Manoj Middepogu, Sai C Akula, Jihan Yang, Shusheng Yang, Adithya Iyer, Xichen Pan 等。2024。Cambrian-1:一种完全开放的、以视觉为中心的多模态大语言模型探索。神经信息处理系统进展 37 (2024), 87310–87356。
[22] Yahan Tu, Rui Hu, 和 Jitao Sang。2025。Ode:多模态大语言模型中幻觉的开放集评估。在计算机视觉与模式识别会议论文集。19836–19845。
[23] Alexander Veicht, Paul-Edouard Sarlin, Philipp Lindenberger, 和 Marc Pollefeys。2024。Geocalib:通过几何优化学习单图像校准。在欧洲计算机视觉会议。Springer, 1–20。
[24] Hengyi Wang, Ruiqiang Zhang, Chang Liu, Guanjie Wang, Zehua Ma, Han Fang, 和 Weiming Zhang。2026。Allocentric Perceiver:通过帧实例化解耦自我中心视觉先验中的自我中心推理。arXiv 预印本 arXiv:2602.05789 (2026)。
[25] Zehan Wang, Ziang Zhang, Jiayang Xu, Jialei Wang, Tianyu Pang, Chao Du, Hengshuang Zhao, 和 Zhou Zhao。2026。Orient Anything V2:统一方向与旋转理解。arXiv 预印本 arXiv:2601.05573 (2026)。
[26] Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, 和 Weidi Xie。2026。SpatialScore:迈向全面的空间智能评估。在 IEEE/CVF 计算机视觉与模式识别会议论文集。31029–31041。
[27] Junjie Wu, Tsz Ting Chung, Kai Chen, 和 Dit-Yan Yeung。2024。统一的大视觉语言模型三元组级幻觉评估。arXiv 预印本 arXiv:2410.23114 (2024)。
[28] Jiarui Wu, Zhuo Liu, 和 Hangfeng He。2025。通过约束感知提示缓解多模态空间关系中的幻觉。在计算语言学协会:NAACL 2025 论文集。3450–3468。
通过心理意象模拟。在 IEEE/CVF 计算机视觉国际会议论文集 [33] 杨安,李安峰,杨宝松,张北辰,惠斌源,张博, 计算机视觉。9241–9251。余博文,高畅,黄成恩,吕辰旭,等。2025。Qwen3 技术 [11] 李博,张元翰,郭栋,张任瑞,李峰,张浩,张凯晨,张培元,李彦伟,刘子维,等。2024。Llava-onevision:轻松 [34] 杨瑞,朱子宇,李彦伟,黄晶晶,严申,周思远,刘哲, 视觉任务迁移。arXiv 预印本 arXiv:2408.03326 (2024)。李翔泰,李双叶,王文倩,等。2025。视觉空间调优。arXiv [12] 李定明,李红星,王梓轩,严雨辰,张航,司奇 [35] 杨云聪,刘家庚,张哲远,周思远,Tan Reuben,张建伟 陈,侯桂阳,姜胜培,张文奇,沈永亮,等。2025。 [35] Yang,Yilun Du,和 Gan Chuang。2025。MindJourney:使用 Viewspatial-bench:评估视觉-多视角空间定位 世界模型进行空间推理的测试时扩展。arXiv 预印本 arXiv:2507.12508 (2025)。 语言模型。arXiv 预印本 arXiv:2505.21500 (2025)。 [13] 李鹏腾,宋品浩,李武阳,郭伟宇,姚惠在,徐一杰,杜刚 [36] 张佳瑞,Mahyar Khayatkhoei,Prateek Chhikara,和 Filip Ilievski。2025。 刘,熊辉。2025。See&trek:用于多模态大语言模型的免训练空间提示。arXiv 预印本 arXiv:2509.16087 (2025)。 [14] 李一凡,李一凡,杜一凡,周昆,王锦鹏,赵伟新,温继荣。2023。评估大型视觉-语言模型中的对象幻觉。 在 2023 年自然语言处理实证方法会议上。292–305。 [37] 郑可宁,陈俊凯,严一博,邹欣,周慧宇,胡旭明。 2025。Reefknot:多模态大语言模型中关系幻觉评估、 分析、缓解的综合基准。在计算语言学协会论文集:ACL 2025。6193–6212。
第 10 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Wang 等人
[38] 朱金国,王威云,陈哲,刘朝阳,叶圣龙,顾立新, 田浩,杜雨辰,苏伟杰,邵杰,等。2025。Internvl3:探索开源多模态模型的先进训练和测试时配方。 arXiv 预印本 arXiv:2504.10479 (2025)。
第 11 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉 会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克
附录
A 任务描述
表6:本工作评估的所有18项空间推理任务,按场景分组。缩写与主论文中使用的缩写一致。 表6列出了我们实验中评估的所有18项空间推理任务,按场景分组。每个任务均关联以下三个基准之一:3DSRBench (3DSR)[18]、ViewSpatial-Bench (VSB)[12] 或 CV-Bench (CVB)[25]。表中还提供了主论文中的缩写(括号内)以及每项任务的评估样本数量。
场景 任务 来源 样本数 location_above (Loc. Above) 3DSR 1,384 height_higher (Hgt. Higher) 3DSR 1,380 location_closer_to_camera (Loc. Cam.) 3DSR 1,356 Perspective location_next_to (Loc. Next.) 3DSR 678 multi_object_closer_to (Loc. Obj.) 3DSR 700 Depth (Depth) CVB 600 Distance (Dist.) CVB 600 cam_orientation (Cam. Orient.) VSB 996 person_orientation (Psn. Orient.) VSB 996 Orientation orientation_viewpoint (Orient. View.) 3DSR 1,372 multi_object_facing (Orient. Facing) 3DSR 692 multi_object_same_direction (Orient. Same-Dir.) 3DSR 688 multi_object_parallel (Orient. Parallel) 3DSR 678 multi_object_viewpoint_towards_object (Orient. Twd.) 3DSR 1,372 orientation_on_the_left (Orient. Left) 3DSR 698 Viewpoint orientation_in_front_of (Orient. Front) 3DSR 688 person_relative_dir (Psn. Rel-Dir.) VSB 842 cam_relative_dir (Cam. Rel-Dir.) VSB 1,773
表7:Geo3R中三个基础模型之间的实现差异。Grounding 指边界框提取方法。Geo card style 指示几何卡片是使用简洁还是冗长的摘要。
Qwen3-VL Gemini-3-Flash LLaVA-1.5 Grounding Native VLM Native VLM Grounding DINO SAM masks ✓ ✓ ✓ Stage 1 format Plain text JSON JSON Stage 2 format Plain text JSON JSON Geo card style Concise Concise Verbose
表7总结了三个基础模型之间关键的实现差异。
对于 Qwen3-VL 和 Gemini-3-Flash,每个卡片条目除了包含各个数值字段(如 extent_3d、local_offset)外,还包含一个简洁的摘要字段。该摘要提供简短的自然语言描述,例如“B 在世界坐标 Y 方向上更高,距离相机更远,且与 A 相比在俯视图中有偏移”,而各个字段则提供精确的参考值。
对于 LLaVA-1.5,我们使用冗长的摘要,将所有字段直接吸收进摘要文本中,而不是单独列出。该冗长摘要还额外包含相对字段,如航向关系、相机相对方向和物体局部方向。其理由是,LLaVA-1.5 作为较弱的基础模型,往往难以处理结构化的多字段输入。将所有信息整合到一个自包含的句子中,可以降低模型忽略关键线索的风险,并减轻推理负担。
B 实现细节
B.1 基础模型
我们在三个基础多模态大语言模型(MLLMs)上评估 Geo3R: • Qwen3-VL-8B[33]:利用原生视觉定位直接生成边界框,无需外部检测器。 • Gemini-3-Flash[23]:通过官方 API 访问。使用原生视觉定位进行边界框提取。 • LLaVA-1.5-7B[15]:使用 Grounding DINO[16] 进行边界框提取,并使用 SAM 进行掩码细化。
B.2 几何估计工具
几何证据提取阶段依赖于四个预训练工具: • DepthPro [3]:从单张图像生成深度图。 • GeoCalib [27]:估计相对于重力的焦距和相机姿态(滚转和俯仰)。 • SAM [9]:将边界框细化为分割掩码,以进行精确的点云提取。 • Orient Anything V2 [29]:从裁剪的图像区域估计 3D 物体姿态,提供与世界坐标系对齐的旋转矩阵。
所有实验均在 NVIDIA H20 和 B20Z GPU 上进行。
B.3 模型特定适配
B.4 基线
我们将与三组基线进行比较。除非另有说明,所有开源模型均在零样本设置下使用贪婪解码和默认设置进行评估。
通用多模态大语言模型。InternVL3[38] 使用动态分辨率(最多 12 个图块,每个 448 像素)。Qwen3-VL 禁用其思维模式以确保直接生成答案。Kimi-VL[24] 需要 2,048 个最大输出令牌以容纳其思维轨迹,该轨迹在评估前被剥离。
空间理解模型。SpatialRGPT[7] 支持可选的深度和掩码输入。我们将两者均设置为 None,使其仅依赖 RGB,与所有其他基线保持一致。SpatialThinker[2] 需要 1,024 个最大输出令牌以容纳其思维链轨迹。所有其他模型均使用默认推理设置。
第 12 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Wang 等人
表 8:World Card 和 Object-Local Card 的字段,关键比较,减少 MLLM 解释原始数字的需求。按它们捕获的空间方面进行分组。W = World Card,OL = Object-Local Card。图 8 展示了为此示例生成的完整几何报告。坐标约定:𝑌𝑊 轴向上对抗重力,因此较高的 𝑦 值表示物理位置较高的物体。较小的 raw_depth 值表示距离更近的物体。
| Aspect | Field | Card | Purpose | | :— | :— | :— | :— | | Position | extent_3d | W | 3D bounding box | | | raw_depth | W | Depth to camera | | | distance_3d | W | Distance between objects | | Orient. | local_offset | OL | Offset in ref. object’s frame | | | visible_side_to_camera | W | Face seen from camera | | | visible_side_to_target | OL | Face seen from other obj. & vis. | | Relative direction | heading_relation | W | Same/opposite direction | | | camera_relative_direction | W | Global-frame direction | | | object_local_direction | OL | Egocentric direction | | | spatial_relation | OL | Vertical (above/below) | | Summary | summary | Both | NL verbalization |
C.2 卡片选择策略
所有三张卡片始终包含在几何报告中。我们不是按任务类型过滤卡片,而是在 Stage 2 提示中提供使用指南,并让 MLLM 根据问题选择相关卡片。这避免了对任务类型分类器的需求,并允许 MLLM 在问题跨越多个空间推理方面时灵活组合证据。
C.3 八向方向量化
方位角通过将 360◦ 范围划分为以 0◦ 为中心的 45◦ bins 进行量化:
front [337.5◦, 22.5◦) back [157.5◦, 202.5◦) front-left [22.5◦, 67.5◦) back-right [202.5◦, 247.5◦) left [67.5◦, 112.5◦) right [247.5◦, 292.5◦) back-left [112.5◦, 157.5◦) front-right [292.5◦, 337.5◦)
这种量化同时应用于相机相对方向(通过物体质心在相机空间中的位移向量计算得出)和物体局部方向(通过参考物体局部帧中的目标位置计算得出)。
C.4 物体名称解析
如第 4.1 节所述,视觉定位阶段必须从问题中提取忠实保留消歧上下文的物体名称(例如,“后面的灯柱”而不是仅仅“灯柱”)。我们通过提示设计和后处理的组合来实现这一点。
提示设计。Stage 1 提示明确指示 MLLM “直接从问题文本或答案选项中复制每个物体名称。不要重命名、合并或改写。”这鼓励模型保留必要的区分修饰语,如空间描述符、序数词或视觉属性,以实现无歧义的定位。
后处理。MLLM 返回解析后的物体列表后,一个协调步骤通过词级匹配将每个名称与源文本(问题和答案选项)进行验证。无法与源文本中的任何短语匹配的名称将被丢弃,从而防止幻觉或伪造的物体引用。当多个提取的名称被更长的短语所包含时(例如,“car” 和 “red car”),保留更具体的名称。如果所有提取的名称都验证失败,系统回退到直接使用答案选项文本作为物体名称。
D 额外实验
D.1 定位消融实验 (LLaVA-1.5)
表 9 展示了 LLaVA-1.5 在所有三个基准上的定位消融结果。由于 LLaVA-1.5 缺乏原生视觉定位,默认配置使用 Grounding DINO 配合 SAM。我们比较了三种定位配置:
第 13 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉 会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克
输入:图像 𝐼,问题 𝑄: “考虑物体的真实三维位置。哪个物体的位置更高?”,选项:(A) 火车 (B) 背景中的路灯
阶段 1 — 视觉定位 MLLM 提取物体和观察结果
关键提示指令: – 直接从 𝑄 或选项中复制每个物体名称;不要重命名或改写。 – 仅返回回答 𝑄 所需的最小可见物体集合。 – 观察结果必须仅描述直接可见的事实(不包含几何或深度信息)。 输出:物体:火车:边界框 (151, 416, 561, 702),背景中的路灯:边界框 (517, 737, 537, 853) 观察结果:“火车在图像中的位置比背景中的路灯高得多。”
阶段 2 — 证据增强推理 MLLM 基于标注图像和几何报告进行推理
输入:标注图像、阶段 1 输出以及几何报告(表 8,8) 关键提示指令: – 使用 World Card 获取全局 3D 关系(深度、高度、距离)。 – 使用 Object-Local Card 获取自我中心关系(左/右、前/后)。 – 不要混合来自不同坐标系的卡片。 – 仅引用 1–3 个最相关的测量值作为证据。 输出:答案:(B) 背景中的路灯 证据:背景中的路灯:y[4.005, 22.159],火车:y[3.519, 4.665](World Card)。
图 7:Geo3R 在 3DSRBench 的 height_higher 示例上的两阶段流水线,内联显示了关键提示指令。 所有输出均来自实际的 Qwen3-VL 运行。
表 9:不同边界框提取配置对 LLaVA-1.5 在三个基准测试上的影响。GD = Grounding DINO。所有方法均在 12 个 3DSR 任务中的每个任务 60 个样本上评估,共 720 个样本。VSB = +AdaptVis,CVB = +APC-VLM,Avg = +Geo3R (VLM) / +Geo3R (GD)
| 配置 | 3DSR | VSB | CVB | Avg | | :— | :— | :— | :— | :— | | LLaVA-1.5 | 45.9 | 31.8 | 49.9 | 42.6 | | + Geo3R, GD+SAM | 48.0 | 36.4 | 53.9 | 46.1 | | + Geo3R, GD w/o SAM | 48.2 | 34.2 | 55.3 | 45.9 | | + Geo3R, VLM+SAM | 48.1 | 33.9 | 54.8 | 45.6 |
表 10:每个样本的推理时间(均值 ± 标准差,单位:秒) GD = 在单个 NVIDIA H20 GPU 上测量。
| 模型 | 3DSR | VSB | CVB | Avg | | :— | :— | :— | :— | :— | | LLaVA-1.5 | 3.51±1.38 | – | 5.46±1.76 | 4.23±0.56 | | Qwen3-VL | – | 7.93±6.28 | 8.15±1.90 | 5.76±1.39 |
使用 Grounding DINO 和 SAM 的完整流水线(GD+SAM)取得了 46.1% 的最佳整体准确率。移除 SAM(GD w/o SAM)将准确率略微降低至 45.9%,其中 VSB 显示出最大的性能下降,从 36.4% 降至 34.2%,而 3DSR 和 CVB 保持稳定。使用 LLaVA-1.5 的原生定位(VLM+SAM)得到 45.6%,低于 GD+SAM,这表明在 LLaVA-1.5 的情况下,原生定位产生的边界框不如 Grounding DINO 准确。所有三种配置均优于未增强的 LLaVA-1.5 基线(42.6%)。
D.2 推理效率 表 10 报告了 Geo3R 和两种对比方法的每个样本推理时间:AdaptVis 是在 LLaVA-1.5 上评估的幻觉缓解基线,APC-VLM 是在 Qwen3-VL 上评估的工具增强空间推理方法。
在 LLaVA-1.5 上,Geo3R 配合 Grounding DINO 实现了与 AdaptVis 相当的延迟(4.23秒对比 3.51秒),同时带来了显著更大的准确率提升。使用基于 VLM 的定位配合 SAM 将成本适度增加至 5.46秒,但完全避免了外部检测器。
在 Qwen3-VL 上,Geo3R (GD) 在 3DSR 上实现了 5.76秒的推理时间(标准差 ±1.39)和 65.3% 的整体准确率,仅比 VLM 定位变体(8.15秒时 68.1%)下降了 2.8%。两种配置均表现出稳定且可预测的运行时间,因为 Geo3R 恰好调用基础 VLM 两次,分别在阶段 1 和阶段 2 各一次。相比之下,APC-VLM 需要 7.93秒(标准差 ±6.28),因为其三个流水线阶段中的每一个都涉及多次 VLM 调用,其成本随检测到的物体数量增长。
作为无需训练的框架,Geo3R 实现的准确率远高于 SpatialThinker 等空间微调模型
第 14 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Wang 等人
对象卡片
- 训练:红色框
- 背景中的路灯:蓝色框
世界卡片
按对象:
摘要 = 在左 x=-5.437 到右 x=-0.041,下 y=3.519 到上 y=4.665,近 z=13.324 到远 z=18.373 范围内 在世界坐标系中,相机深度为 15.509,从相机前方可见侧面 extent_3d = x[-5.437, -0.041], y[3.519, 4.665], z[13.324, 18.373] raw_depth = 15.509; visible_side_to_camera = front
摘要 = 在左 x=36.417 到右 x=49.356,下 y=4.005 到上 y=22.159,近 z=99.589 到远 z=134.318 范围内 在世界坐标系中,相机深度为 116.225,从相机前方可见侧面 extent_3d = x[36.417, 49.356], y[4.005, 22.159], z[99.589, 134.318] raw_depth = 116.225; visible_side_to_camera = front 成对(参考 训练 → 目标 背景中的路灯): 摘要 = 与训练相比,背景中的路灯在世界 Y 方向上更高,距离相机更远,并且在俯视图中有偏移 distance_3d = 112.192 heading_relation = same-direction camera_relative_direction = front-right 字段说明: extent_3d: 世界坐标系,相机中心为原点,X=右,Y=上,Z=前。raw_depth: 越小表示离相机越近。 visible_side_to_camera: 最正对相机的一侧。distance_3d: 绝对 3D 距离。 camera_relative_direction: 在相机坐标系中,从参考对象到目标的方向。 heading_relation: 同向/反向 = 平行;交叉 = 垂直。
- 训练:
- 背景中的路灯:
物体局部卡片
在参考 训练 的局部坐标系中的目标 背景中的路灯: 摘要 = 在训练的局部坐标系中,背景中的路灯位于左侧、后方且低于训练 local_offset = po_x=95.614, po_y=45.557, po_z=-37.007 object_local_direction = back-left; visible_side_to_target = left; spatial_relation = below but not aligned
在参考 背景中的路灯 的局部坐标系中的目标 训练: 摘要 = 在背景中的路灯的局部坐标系中,训练位于右侧、前方且高于背景中的路灯 local_offset = po_x=-51.346, po_y=-99.200, po_z=10.485 object_local_direction = front-right; visible_side_to_target = front; spatial_relation = above but not aligned
字段说明: local_offset: 参考对象自身的坐标系;po_x = 左/右,po_y = 前/后,po_z = 上/下。 object_local_direction: 整体局部方向;spatial_relation: 垂直关系 + 俯视对齐。 visible_side_to_target: 参考对象面向目标的一侧;若 |po_y| >= |po_x| 则为前/后,否则为左/右。 不要将 local_offset 视为绝对世界位置、高度或相机深度。
图 8:为图 7 中的示例生成的几何报告。为简洁起见,世界卡片中仅显示一个成对方向;完整报告包含两个方向。
以及 SenseNova-SI [4],而其推理时间与推理时间相当。最后,由于每个几何估计工具都是一个 APC-VLM 且可以通过替换 Grounding 进一步减少,它可以被替换为更快或更准确的 DINO 用于基于 VLM 的定位,这也消除了 VLM 在阶段 1 的调用,并将管道减少为单个 VLM 推理 在阶段 2。此外,两种 Geo3R 变体都远低于密集 基于重建的透视推理方法,根据 APC-VLM 自己的评估,这些方法需要超过其
第 15 页
Geo3R:缓解多模态大语言模型中的空间推理幻觉 会议简称 ’XX,2018年6月3–5日,纽约伍德斯托克
表11:工具成功率与准确率。∗排除上游定位/SAM错误后。‡定位成功率包含带有反馈重试的VLM检测。
完整 (a) (b) (c) (d) (e) 工具成功率 (%) 准确率 (%) 自身准确率∗(%) 平均 68.1 66.5 66.0 66.1 66.2 61.2 定位‡ 100 96.4 96.4 SAM分割 100 94.4 97.9 表14:3DSRBench上的额外基线。平均值为 深度估计 100 89.2 94.8 所有12个任务的宏平均值。†新添加的模型。 方向估计 100 71.5 75.6
模型 视角 方向 视图 平均 表12:3DSRBench上噪声注入下的准确率 (Qwen3-VL)。D.𝜎向深度值添加高斯噪声;D.Swap交换两个物体间的深度值;O.Flip反转卡片中物体的朝向。 通用多模态大语言模型 Qwen3-VL 67.0 56.0 42.0 57.1 Gemini-3-Flash 69.3 66.4 62.5 66.6 GPT-5 76.9 63.3 59.4 68.0 Qwen3.5-9B† 71.7 60.8 53.6 63.5 Gemini-3-Pro† 77.1 66.6 65.7 70.8 Qwen3 Geo3R D.𝜎=10% D.𝜎=50% D.Swap O.Flip GPT-5.5† 74.7 71.6 72.8 73.2 平均 57.1 68.1 68.1 67.9 58.8 63.9 空间理解模型 SpatialThinker 65.5 54.3 40.1 55.4 SpaceR† 60.4 51.9 40.9 52.7 VST-7B-RL† 70.5 54.7 45.0 58.9 E 鲁棒性分析 为了分析Geo3R的鲁棒性,我们进行了三个层面的实验。首先,我们测量了LLaVA-1.5、Qwen3-VL和Gemini-3-Flash across 17,493个样本的工具成功率。其次,我们手动标注了Qwen3-VL上来自3DSRBench的100张图像(涵盖所有12个任务的196个任务实例),以验证工具正确性,超越仅看成功率。第三,我们在Qwen3-VL上的3DSRBench几何卡片中注入合成噪声,以测试鲁棒性。
这些噪声是合成注入的,在实践中很少发生,正如表11报告的工具成功率和准确率所证实的那样。表11报告了前两个层面的结果(GeoCalib被排除,因为其输出在没有真实校准的情况下难以验证)。就成功率而言,所有核心工具均达到100%,证实该流水线可靠地生成了几何卡片。
F 卡片格式消融 我们在Qwen3-VL上的3DSRBench上对几何卡片设计进行消融,以研究每个文本组件的影响。我们评估了五种变体:(a) 无使用前言,(b) 无字段注释(坐标解释),(c) 无自然语言摘要,(d) JSON格式中的所有字段,以及 (e) 所有非结构化文本形式的内容。
如表13所示,移除各个组件 (a–c) 每个都会导致1.6–2.1%的下降。变体 (d) 保留了显式字段名,仅下降1.9%,而 (e) 将所有值埋没在句子中且无字段标识符,导致6.9%的下降。这证实了具有清晰字段名的结构化格式有助于多模态大语言模型有效利用几何证据。
G 额外基线 我们进一步添加了最新的通用多模态大语言模型(Qwen3.5-9B、Gemini-3-Pro、GPT-5.5)和空间理解模型(VST-7B-RL [34]、SpaceR [19]),以提供更全面的比较,并在这些新的通用多模态大语言模型上评估Geo3R。
表14展示了我们原始提交中的代表性基线,以及3DSRBench上新添加的模型。在新添加的空间理解模型中,VST-7B-RL [34] 表现最佳,达到58.9%,超过了SpatialThinker(我们原始提交中最强的空间理解模型),并略高于Qwen3-VL基线,而SpaceR [19]
第 16 页
Conference acronym ’XX, June 03–05, 2018, Woodstock, NY Wang et al.
仅达到 52.7%。所有空间理解模型的表现仍远低于结合 Qwen3-VL 的 Geo3R。
我们进一步在 SpatialScore [30] 上评估 Geo3R,这是一个综合性的空间推理基准,整合了来自 OmniSpatial、SPAR-Bench 以及 20 多个其他空间基准的数据。在单图像空间子集(视角、深度估计、3D 感知)上,平均准确率从 43.7% 提升至 50.8%,进一步证实了我们的方法在本文三个主要基准之外也具有通用性。
对于通用多模态大语言模型(MLLMs),所有新加入的模型均显示出相对于其前代的整体提升。我们在此类模型上进一步评估了 Geo3R。结合 Qwen3.5-9B 的 Geo3R 达到 74.0%,提升了 10.5%,并超越了 Gemini-3-Pro 和 GPT-5.5。即使在准确率已经很高的最强模型上,Geo3R 仍能带来一致的提升,其中 Gemini-3-Pro 从 70.8% 提升至 76.0%,GPT-5.5 从 73.2% 提升至 77.0%,表明我们的方法在最新且最强的模型上依然有效。
Received 20 February 2007; revised 12 March 2009; accepted 5 June 2009