展示而非告知:生成像素评估空间认知

三分钟导读:本文提出ProVisE框架和SpatialGen-Bench基准,通过协议化视觉评估解决图像生成模型与文本输出VLM在空间任务上的接口不匹配问题,揭示了视觉外化与文本推理的互补优势。

英文题目:Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

论文出处:arXiv 每日论文精选 · arXiv:2607.21072

原始论文:PDF / 论文页面

对应视频标题:展示而非告知:生成像素评估空间认知|推荐指数:★★★★★

这篇论文解决什么问题?

现有空间推理基准主要面向文本输出VLM,要求坐标、选项或文本描述作为答案,导致图像生成模型无法在相同任务语义和指标下被评估,存在答案接口不匹配(answer-interface mismatch)。

核心创新

  • 提出ProVisE框架,实现图像生成模型在像素空间评估的同时保持与原始基准指标的兼容性。
  • 构建SpatialGen-Bench,提供分层能力诊断和多种答案形式的统一评估基准。
  • 引入Agentic Protocol Construction,自动化构建和验证跨基准的生成-解析协议。
  • 揭示视觉外化与文本推理在空间认知中的互补性,而非单一模态优势。

方法概览

提出ProVisE(Protocolized Visual Evaluation),一种基准无关的框架,通过协议约束图像生成模型的输出格式,并使用解析器将其转换为结构化预测以匹配原始任务指标。引入Agentic builder自动构建和验证任务特定的生成-解析协议。构建SpatialGen-Bench,包含14个子任务,覆盖感知、理解、推理和交互四个能力层级。

逐图理解论文

ProVisE框架:协议化视觉评估

ProVisE框架:协议化视觉评估
Figure 2 Overview of ProVisE. Text-output VLMs follow 2a and are scored directly by the original evaluator. Image- generation models follow 2b, where a routed protocol guides generation and parsing into structured answers. Both are scored by the same source-task metric under shared semantics.

本文提出ProVisE框架,一种基准无关的评估方法。通过协议约束图像生成模型的输出格式,并使用解析器将其转换为结构化预测,以匹配原始任务指标。文本输出VLM则直接由原始评估器评分,两者在共享语义下使用相同源任务指标进行公平比较。

Agentic协议构建:自动化与验证

Agentic协议构建:自动化与验证
Figure 3 Agentic protocol construction in ProVisE. A benchmark is normalized into task contracts; the Agent constructs a protocol for each task; and the resulting generation–parser pair is automatically validated before being applied unchanged to every target model.

引入Agentic Protocol Construction机制,将基准任务标准化为任务契约,由Agent自动构建生成-解析协议,并进行自动验证。该机制确保协议在应用于目标模型前已具备可执行性,实现了跨基准协议的自动化构建与复用。

SpatialGen-Bench:分层能力诊断

SpatialGen-Bench:分层能力诊断
Figure 5 Overview of SpatialGen-Bench. Tasks are organized into perception, understanding, reasoning, and interaction.

构建SpatialGen-Bench基准,包含14个子任务,覆盖感知、理解、推理和交互四个能力层级。该基准提供分层能力诊断,支持多种答案形式的统一评估,解决了现有基准如BLINK、MindCube和SpatialScore不支持共享语义评估的局限。

实验设置:跨模态模型对比

实验设置:跨模态模型对比
Table 2 Main results on SpatialGen-Bench (%). Capability scores macro-average their constituent tasks, and Overall macro-averages task scores. Bold marks the best model within each answer interface.

在SpatialGen-Bench上评估20个Text Answering系统和11个Visual Answering系统。通过Agentic协议构建,在六个外部空间基准上进行跨基准泛化测试。使用通用VLM解析器替换任务特定解析器,分析解析器敏感性,并对视觉回答失败案例进行归因分析。

跨基准泛化:互补优势显现

跨基准泛化:互补优势显现
Table 3 Paired sample-level outcomes on the shared benchmark items. Entries report counts and benchmark shares in parentheses. Visual rescue is Visual only/(Visual only + Neither): the fraction of text-incorrect items solved by the paired visual interface.

在跨基准评估中,GPT Image 2在SAT和RoboAfford基准上领先,但在其他基准上文本模型表现更好,平均得分56.33% vs 60.67%。视觉回答在部分任务上能“挽救”文本模型的错误,显示两者在空间认知中的互补性,而非单一模态优势。

实验与关键结果

  • 在SpatialGen-Bench上评估20个Text Answering系统和11个Visual Answering系统。
  • 通过Agentic协议构建在六个外部空间基准(EmbSpatial-Bench, OmniSpatial等)上进行跨基准泛化测试。
  • 使用通用VLM解析器(Qwen3-VL-8B, Qwen2.5-VL-72B, Llama 4 Scout)替换任务特定解析器,分析解析器敏感性。
  • 对视觉回答失败案例进行归因分析,区分生成失败、协议不合规、解析失败和错误预测。
  • GPT-5.4在Text Answering中Overall得分61.04%,GPT Image 2在Visual Answering中Overall得分54.49%,人类参考得分为87.79%。(第 9 页)
  • 在跨基准评估中,GPT Image 2在SAT和RoboAfford基准上领先,但在其他基准上文本模型表现更好,平均得分56.33% vs 60.67%。(第 11 页)
  • 使用通用VLM解析器导致排名变化,Qwen2.5-VL-72B将JoyAI-Image评为第一,而ProVisE特定解析器将GPT Image 2评为第一。(第 12 页)
  • 88.03%的视觉回答失败源于错误的空间预测,而非生成或解析失败。(第 13 页)

阅读时需要注意

  • Agentic协议构建依赖后端模型(如GPT-5.4和GPT Image 2),可能偏向这些模型能执行的视觉表示。
  • 文本和视觉回答的模型池在架构、规模和训练数据上存在差异,比较结果反映当前系统状态而非因果模态效应。
  • ProVisE目前主要针对静态图像基准,扩展到视频、仿真和闭环具身任务仍是未来工作。
  • 视觉回答的优势并非在所有空间任务上都存在,对于需要组合推理或精确状态更新的任务,文本模型仍占优势。
  • 通用VLM解析器并非统一的校准偏移,会改变模型得分和排名,需谨慎使用。
  • 视觉外化并不自动保证正确推理,像素空间输出仅改变答案表达方式,不替代推理过程。

关联工作

  • BLINK:对比基准,BLINK主要关注感知,不支持层级诊断和共享语义评估。(第 8 页)
  • MindCube:对比基准,MindCube关注心理建模,不支持共享语义评估。(第 8 页)
  • SpatialScore:对比基准,SpatialScore支持部分层级诊断,但不支持共享语义评估。(第 8 页)
  • Janus:相关工作,Janus是统一多模态理解与生成模型,本文将其作为Visual Answering系统进行评估。(第 3 页)
  • FLUX:相关工作,FLUX是图像生成模型,本文将其作为Visual Answering系统进行评估。(第 3 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

浙江大学ACES实验室OmniAI团队

浙江大学ACES实验室OmniAI团队

展示,而非告知:在生成像素而非大语言模型文本中评估空间认知

王旭∗,姚凯翔∗,潘淼,周晓鹤,刘轩宇,张文琦‡,张旭宏†‡

浙江大学 ∗共同第一作者,†项目负责人,‡通讯作者

空间智能对于Agent从静态语义理解迈向与物理世界交互至关重要。在现实世界中,许多空间任务植根于连续的视觉场景,其中位置、区域和路径通过指点、标记或绘制来表达,比报告精确坐标或离散文本符号更为自然。然而,现有的空间推理基准通常要求模型以坐标、选项或文本描述作答,这造成了图像生成模型的答案接口不匹配。这种接口差距使得在相同的任务语义下评估图像生成模型变得困难,尽管它们可以直接在像素空间中外化空间判断。为解决这一问题,我们提出了ProVisE(协议化视觉评估框架),这是一个与基准无关的框架,能够从图像生成模型中引出与原始评估指标兼容的协议约束预测。ProVisE还包含一个Agent协议构建器,用于构建新的基准,并验证了在14个空间子任务、四个能力层级和多样化答案形式上涵盖470个样本的精心策划的诊断基准SpatialGen-Bench。我们在统一设置下评估了代表性的文本输出VLM和图像生成模型,并在六个外部空间基准上验证了Agent协议构建。实验结果表明,当空间答案可以直接在像素空间中外化时,图像生成模型具有竞争力,而文本输出VLM在组合空间推理方面仍保持明显优势。这些发现揭示了像素空间表达和基于文本推理的互补优势与局限性,同时ProVisE和SpatialGen-Bench为生成式空间评估及未来对图像生成模型中空间认知的研究建立了指标兼容的测试平台。

项目:https://zju-omniai.github.io/ProVisE/ GitHub:https://github.com/ZJU-OmniAI/ProVisE Hugging Face:https://huggingface.co/datasets/wx91726/SpatialGen-Bench 邮箱:xuwang91726@gmail.com; zhangwenqi@zju.edu.cn; zhangxuhong@zju.edu.cn 日期:2026年7月

1 引言

空间智能是AI Agent超越静态语义理解并与物理世界安全交互的基础前提(Yu et al., 2025; Liu et al., 2026; Zheng et al., 2025)。它涵盖了一系列感知和推理能力,包括视觉定位、功能预测、目标区域定位以及针对位置、距离和方向的关系空间推理。随着视觉语言模型(VLM)(Achiam et al., 2023; Comanici et al., 2025; Bai et al., 2025a)能力的不断增强,大量工作致力于提升其空间感知和推理能力(Chen et al., 2024; Wu et al., 2025b; Cheng et al., 2024; Cai et al., 2025; Liu et al., 2025; Zhou et al., 2025; Yang et al., 2025b; Li et al., 2025b)。继视觉问答(VQA)和空间VLM评估(Yang et al., 2025a; Fu et al., 2024; Wang et al., 2026a; Yang et al., 2025c; Ray

第 2 页

图 1 空间评估中的答案接口不匹配。空间判断可以直接表达为一个可抓取的区域,而现有的基准测试通常要求提供精确的坐标列表。这给文本接口带来了精确序列化的负担,并导致生成的视觉答案与原始评估器不兼容。

et al., 2024; Jia et al., 2025; Li et al., 2025a; Tong et al., 2024; Du et al., 2024; Zhang et al., 2025b),现有的空间智能研究主要围绕文本输出型 VLM 展开。模型通常通过符号化或结构化的答案格式(如坐标、选项标签或文本描述)进行提示和评估。这种范式使得 VLM 的空间推理变得可测量,但也迫使连续的视觉判断转化为文本或基于坐标的输出,而这对于空间任务来说往往是不自然的。

生成式视觉模型的最新进展激励我们更紧密地评估其空间认知能力。与文本输出型 VLM 不同,图像生成模型直接在像素空间中运行,可以通过修改、标记或合成视觉内容来表达空间判断。这使得它们成为那些答案具有连续性或基于视觉的空间任务的天然候选者,而非纯粹符号化的任务。最近的研究表明,图像生成器可以为密集视觉任务(如分割、深度估计和表面法线预测)生成可解码的可视化结果 (Gabeur et al., 2026),而视频生成模型在感知、操作和早期视觉推理方面表现出零样本行为 (Wiedemer et al., 2025)。原生和统一的多模态生成方面的相关进展进一步表明,视觉生成可能编码了对理解和世界建模有用的表示 (Cui et al., 2025; Xie et al., 2025; Deng et al., 2025)。这些研究表明,生成式视觉模型正在超越图像合成,但当空间答案可以通过视觉方式表达时,其空间认知在很大程度上仍未被探索。

现有的评估路线未能解决这一空白。文本到图像基准测试评估提示保真度、组合对齐性或合成图像中的空间关系 (Hu et al., 2023; Ghosh et al., 2023; Huang et al., 2025; Li et al., 2024; Bakr et al., 2023; Gokhale et al., 2022; Wang et al., 2026b);它们评估生成的图像是否满足文本提示,而不是评估模型能否回答基于输入场景的空间问题。相反,针对 VLM 的空间推理基准测试侧重于文本输出型模型,并对符号化或结构化预测进行评分 (Liu et al., 2023; Wu et al., 2025c; Xu et al., 2026; Stogiannidis et al., 2025; Wu et al., 2025d)。目前缺失的是在共享空间任务语义下,以兼容指标的方式比较图像生成模型和文本输出型 VLM 的方法。

主要的障碍在于答案接口,如图 1 所示。现有的空间基准测试主要为文本输出型 VLM 设计,通常要求坐标、选项标签或文本描述作为最终答案 (Wu et al., 2025c)。对于涉及区域、路径、深度或方向的任务,这要求模型将空间判断表达为数值或符号化输出,例如边界框坐标 [x1, y1, x2, y2]、逐像素深度值或方向标签。这类似于要求一个人报告精确的像素坐标,而不是指向或勾勒出一个区域。这种接口对于必须将空间结构言语化的文本输出型 VLM 来说是不自然的,对于其原生响应为视觉形式的图像生成模型来说更是如此。尽管图像生成模型可以标记对象、高亮区域或绘制轨迹,但这些响应无法直接由期望文本或基于坐标预测的基准测试进行评分。因此,在原始任务指标下,无法系统地将其空间认知与文本输出型 VLM 进行比较。

一种自然的变通方法是使用辅助 VLM 裁判来读取生成的图像并推断最终答案 (Wu et al., 2025c; Wang et al., 2026b)。然而,基于裁判的评分取决于裁判模型自身的可靠性,并且可能反映的是裁判的不确定性,而非生成的空间答案本身 (Cho et al.,

2

第 3 页

2024)。它们也难以与用于文本输出视觉语言模型(VLM)的原始指标对齐,导致在共享任务语义下,VLM 与图像生成模型之间的受控比较不可靠。

为了使生成式空间认知可测量,我们引入了一套评估框架及诊断基准。ProVisE(协议化视觉评估框架)是一个与基准无关的框架,它从图像生成模型中引出受协议约束的视觉答案。ProVisE 不要求文本或基于坐标的响应,而是将生成的输出约束为预定义的视觉格式,并将其解析为与原始任务指标兼容的结构化预测。由于为每个新任务手动设计协议不具备可扩展性,ProVisE 还提供了Agent协议构建路径。它将新基准规范化为任务级契约,为每个任务构建适当的生成-解析协议,并在模型评估前验证生成的产物。我们进一步构建了 SpatialGen-Bench,这是一个针对图像生成模型空间认知的精心策划的诊断基准。它涵盖了感知、理解、推理和交互四个方面的 14 个子任务,提供了模型优势与劣势的能力层级视图。其多样化的答案形式还使我们能够考察 ProVisE 是否能够在不同的答案接口之间支持指标兼容的视觉评估。ProVisE 与 SpatialGen-Bench 的结合,使得在共享任务语义下对文本输出 VLM 与图像生成模型进行系统比较成为可能。

该套件的设计旨在超越单一基准或模型家族,具备可复用性。它可以应用于当前的图像生成模型,如 FLUX、Seedream 和 Janus(Labs 等,2025;Seedream 等,2025;Chen 等,2025),同时保持与面向 VLM 的空间基准(如 MindCube、SAT 和 VSR)(Wang 等,2026a;Ray 等,2024;Liu 等,2023)的兼容性。通过将视觉响应转换回与指标兼容的预测,ProVisE 实现了跨模型和跨基准的评估,而无需将事后 VLM 评判器作为默认评估者。

通过部署这套评估套件,我们对图像生成模型与文本输出 VLM 的空间认知进行了系统比较。当答案可以外化为可检查的像素空间证据时,图像生成模型最具竞争力;而当任务需要组合推理和精确的空间变换时,文本输出 VLM 则保持优势。额外的实验表明,通用的 VLM 解析会改变分数和排名,而大多数视觉失败源于错误的空间预测,而非生成、协议或解析器的故障。在六个外部基准上的实验进一步显示,Agent协议构建器可以将 ProVisE 适应于异构的任务和指标契约。综上所述,这些结果揭示了视觉外化与基于文本的推理之间的互补优势,并激励了它们的协同使用。

总之,我们的主要贡献如下:

  • 生成式空间评估中的模态不匹配:我们调查了图像生成模型的空间认知,并揭示了现有空间推理基准中存在的答案接口不匹配问题:将空间判断简化为文本或基于坐标的格式,可能会掩盖对文本输出 VLM 的评估,并阻止图像生成模型在相同的任务语义和指标下进行评估。
  • 用于图像生成空间评估的统一套件:我们提出了 ProVisE,这是一个与基准无关的框架,使图像生成模型能够在像素空间中进行评估,同时保持与原始基准指标的兼容性。此外,我们引入了 SpatialGen-Bench,这是一个精心策划的诊断基准,包含四个空间能力层级和多样化答案形式的 14 个子任务。
  • Agent协议构建:我们引入了一种Agent构建器,用于为之前未配置的基准构建和验证特定于任务的生成-解析协议。每个生成的协议都在目标模型间共享,从而将 ProVisE 的应用范围扩展到手动配置的任务之外。
  • 生成式模型与 VLM 的系统比较:通过广泛的实验,我们提供了图像生成模型与文本输出 VLM 在空间能力差异方面的定量画像。结果揭示了互补的优势:当答案可以直接外化为像素空间时,图像生成模型更具竞争力;而文本输出 VLM 在组合空间推理方面仍然更强。

3

第 4 页

图 2 ProVisE 概览。文本输出型 VLM 遵循 2a,由原始评估器直接打分。图像生成模型遵循 2b,其中路由协议指导生成过程,并将结果解析为结构化答案。两者均在共享语义下由相同的源任务指标进行评分。

2 协议化视觉评估

本节介绍 ProVisE 流水线,用于将图像生成模型适配到为文本答案设计的空间基准测试中,如图 2 所示。该流水线保留了源任务指标,仅将响应接口替换为受限的视觉协议。我们首先定义视觉协议和路由,然后描述Agent协议构建、协议执行与解析,以及与指标兼容的评估方法。

2.1 视觉协议与路由

视觉协议是 ProVisE 的基本单元。它将一个引导提示(约束模型在像素空间中表达答案的方式)与一个将生成图像转换为结构化预测的解析器配对。该协议还指定了预期的答案格式、无效输出条件及其到原始任务指标的映射。由于这些元素在模型评估之前就已固定,因此生成的响应可以在没有主观事后决策的情况下被解释。

为了覆盖不同的空间任务,我们构建了一个任务感知的协议池,其中每个视觉答案格式都与相应的解析器配对。该池涵盖实例和点标记、方向网格、相对深度图、区域掩码、状态匹配、轨迹绘制以及基于任务的证据渲染;附录 C.2 提供了操作性的解析器规则和无效输出边界。

协议路由在目标模型评估之前为每个任务确定一个协议。如果基准测试已有经过验证的配置,ProVisE 会直接使用它。否则,Agent构建器会根据基准测试的输入、答案和指标契约构建特定于任务的协议。接受的配置随后由所有被评估的模型共享,从而将协议设计与模型比较分离开来。

2.2 Agent协议构建

对于之前未配置的基准测试,ProVisE 按照图 3 总结的三个阶段进行。首先,它识别基准测试记录、输入媒体、任务标签、答案格式和评估指标,然后将它们规范化为任务级契约,而不改变任务语义或评分规则。

其次,Agent检查每个任务的代表性示例,并从三种构建路线中选择一种。复用(Reuse)选择一个现有的兼容协议,构建(Build)从注册的解析组件组装特定于任务的协议,而回退(Fallback)在可用的确定性组件无法恢复所需答案形式时使用受限的辅助解析器。每条路线都产生相同的声明式工件:生成提示、解析器配置、答案契约、无效输出规则和指标映射。Agent不生成可执行的评估代码。

第 5 页

图 3 ProVisE 中的Agent协议构建。基准被规范化为任务合同;Agent为每个任务构建协议;生成的生成器-解析器对在应用于所有目标模型之前会自动进行验证。

最后,ProVisE 在一组少量示例上测试每个候选方案。冒烟验证检查视觉生成的成功、解析的稳定性以及与原始指标的兼容性。失败的协议在被拒绝或转入回退(Fallback)之前,可修订一次。接受的配置随后以不变的形式应用于所有目标模型,从而防止针对特定模型的协议优化。附录 C.3 报告了规范化字段、路由定义、验证标准及任务级结果。

2.3 协议执行与解析

在协议路由或构建之后,ProVisE 应用所选协议来指导视觉生成,如图 2 中的 2b 分支所示。图像生成模型被指示在协议的结构约束下产生视觉响应,而非自由形式的图像。根据任务的不同,响应可能表现为标记实例、方向网格、二值区域掩码、接地(grounded)点、渲染的空间状态或绘制的轨迹。相应的解析器随后将该响应转换为由原始基准所需的结构化答案。优先采用确定性解析。当需要回退时,解析器仅接收生成的响应、固定的视觉证据合同、所需的答案格式以及候选选项;它不接收源图像或原始问题,因此无法独立重新解决基准项。

协议约束的响应提供了模型答案的显式中值表示。如图 4 所示,每列将基准输入与在特定协议下生成的视觉响应配对。这些示例说明了不同的答案形式如何以视觉方式表达,同时仍能被解析为标准化的预测。

图 4 ProVisE 的代表性协议执行案例。每列显示一个基准输入(顶部)、协议化输出(底部)以及恢复的结构化预测。

5

第 6 页

2.4 指标兼容评估

解析后,每个视觉响应被转换为原始基准所期望的答案空间,例如标签、计数、掩码、候选状态或轨迹。随后,使用原始任务指标对生成的预测进行评分。对于文本输出的 VLM,原始响应被直接规范化为所需的答案格式;对于图像生成模型,视觉响应在协议引导生成后被解析为该格式。因此,两种输出均通过相同的源任务指标进行评估,对应于图 2 中的评估阶段。通过这种方式,ProVisE 仅改变了图像生成模型的响应接口,同时保留了任务目标和评分规则。大多数协议使用确定性图像处理、几何或固定相似度模型。回退任务使用协议约束的仅生成图像解析器,我们在第 4.5 节中将其与无约束的事后 VLM 评判区分开来。

3 SpatialGen-Bench

为了在异构的空间答案接口上检验 ProVisE,我们构建了 SpatialGen-Bench,其任务涵盖离散决策、计数、区域、状态和轨迹。该基准在保持源任务语义和指标的同时,组织感知、理解、推理和交互层面的空间认知,为我们的诊断分析提供了基础。

3.1 能力层级

SpatialGen-Bench 将空间认知组织为四个递进层级,如图 5 所示。该层级从基本的空间属性识别开始,到视角理解和场景布局理解,再到复杂的空间推理,最终到面向行动的决策。

空间感知构成了层级的基础,涵盖基于直接视觉证据的基本空间属性:(1) 计数,(2) 相对深度估计,(3) 方向判断,以及 (4) 物体大小比较。这些任务总共包含 145 个样本。

空间理解超越了局部线索,转向场景级表示。它包括 (5) 关系验证,(6) 视角判断,(7) 空间心理建模,以及 (8) 空间定位,这些任务要求模型连接物体、调整视角、推断布局并定位所指目标。这些任务包含 140 个样本。

空间推理建立在场景表示之上,以推断未直接指定的变化或结论。它包括 (9) 多跳空间推理,(10) 空间状态预测,以及 (11) 几何可行性,涵盖组合关系、物理上合理状态变化以及适配或碰撞约束。这些任务包含 90 个样本。

空间交互代表了从空间理解向现实世界行动的过渡,包括 (12) 功能定位,(13) 导航,以及 (14) 轨迹规划,其中模型必须决定何处可以进行交互、朝向何种状态移动以及如何到达目标。这些任务包含 95 个样本。

这种分层设计支持从静态感知到面向行动的交互的广泛诊断评估,并为识别当前模型仍面临挑战的能力层级提供了可解释的基础。为了阐明 SpatialGen-Bench 的定位,表 1 将其与其他空间评估基准进行了比较。虽然先前的基准涵盖了重要的空间设置,如感知、定位、心理建模、推理和文生图生成,但 SpatialGen-Bench 联合支持分层能力诊断、多种答案形式以及文本输出 VLM 和图像输出生成模型的共享语义评估。

3.2 基准构建与评估

数据来源。SpatialGen-Bench 源自多个公开的空间评估基准 (Paiss et al., 2023; Fu et al., 2024; Liu et al., 2023; Jung et al., 2025; Li et al., 2025a; Wu et al., 2026; Wang et al., 2026a; Zhang et al., 2025a; Mao et al., 2016; Hao et al., 2025; Ji et al., 2025; Chow et al., 2025)。所选任务涵盖物体级感知、关系和视角推理、物体大小、空间定位、状态

6

第 7 页

图 5 SpatialGen-Bench 概览。任务按感知、理解、推理和交互进行分类。

建模、几何可行性、功能接地(affordance grounding)、导航和路径规划。它们的接口范围从离散选择和计数到点、掩码、候选状态和连续轨迹,为 ProVisE 提供了异构的答案契约(answer contracts)。

质量感知的样本选择。对于每个选定的任务,我们从相应的源数据中收集候选样本,并在纳入之前进行人工检查。仅当输入媒体、原始注释、任务指令和答案能够在源任务语义下被可靠地恢复和评分时,才保留这些样本。我们移除近重复项、视觉不清晰的案例、不一致的注释以及具有模糊或多个有效答案的样本。

空间能力映射。过滤后,每个实例根据其目标和所需的空间能力(而非其源基准)被分配到子任务和能力级别;该分配会与源注释和任务表述进行核对。生成的样本使用标准化的共享字段,同时保留特定于任务的评分元数据,详见附录 B.2。

数据完整性和审查。每个发布的项目都经过确定性的资产和模式检查,以及人工纳入审查。附录 B.3 记录了已检查的字段和审查覆盖率。

在评估方面,计数和大多数离散答案子任务在答案标准化后使用精确匹配准确率(exact-match accuracy),包括物体大小和几何可行性。空间接地(grounding)使用点-掩码准确率(point-in-mask accuracy)。功能接地(affordance)使用平均掩码精度(mean mask precision),预测使用附录 E.4 中定义的带有部分积分的端点得分(partial-credit endpoint score),轨迹规划使用基于离散弗雷歇距离(Discrete Fréchet Distance)的 DFD-success@0.4。

7

第 8 页

表 1 与代表性空间评估基准的比较。

| Benchmark | Main scope | Scale | Task organization | Hierarchy | Ans. types | Shared eval. | | :— | :— | :— | :— | :— | :— | :— | | BLINK (Fu et al., 2024) | Core visual perception | 3.8K MCQs; 14 tasks | Perception-oriented task suite | ✗ | ✗ | ✗ | | ViewSpatial-Bench (Li et al., 2025a) | Multi-perspective spatial localization | 5.7K+ QA pairs; 5 task types | Camera- and person-centric five-task taxonomy | △ | ✗ | ✗ | | MindCube (Wang et al., 2026a) | Spatial mental modeling from limited views | 21K+ questions; 3.2K+ images | Cognitive mapping, perspective taking, and mental simulation | ✗ | △ | ✗ | | OmniSpatial (Jia et al., 2025) | Comprehensive spatial reasoning for VLMs | 8K+ QA pairs; 50 subcategories | 4 spatial categories with 50 subcategories | ✓ | ✗ | ✗ | | SpatialScore (Wu et al., 2025c) | Comprehensive spatial intelligence | 5K verified samples; 30 tasks | Spatial tasks across data types and QA formats | ✓ | △ | ✗ | | SpatialTree (Xiao et al., 2025) | Hierarchical spatial ability evaluation | 6.3K records; 11 tasks | | ✓ | △ | ✗ | | SpatialGenEval (Wang et al., 2026b) | Spatial reasoning in generation | 1,230 prompts; 12,300 MCQs | Spatial domains with 10 sub-domains | ✓ | ✗ | △ | | SpatialGen-Bench | Spatial cognition generative evaluation | 470 samples; 14 subtasks | Four capability levels with curated subtasks | ✓ | ✓ | ✓ |

✓: 完全支持;△: 部分支持;✗: 非设计目标。Hierarchy: 分层能力诊断;Ans. types: 多种被评估的答案形式;Shared eval.: 在共享任务语义和指标下评估文本输出 VLM 和图像生成模型。

4 实验

我们将 SpatialGen-Bench 用作通过协议化视觉答案评估空间认知的诊断测试平台。实验在共享任务语义下比较文本输出 VLM 和图像生成模型,并考察 ProVisE 是否能为通用黑盒解析提供可靠的替代方案。我们关注五个问题:(1) 哪些任务特性区分了视觉与文本空间回答;(2) 这两种接口是解决相同的示例还是暴露互补的成功;(3) 将特定任务解析器替换为一个通用 VLM 解析器时,分数和排名的敏感程度如何;(4) 失败的视觉评估是源于生成或解析崩溃,还是源于错误的空间预测;以及 (5) ProVisE 是否支持在异构外部空间基准上进行可执行评估。

4.1 模型与评估设置

我们报告了 31 个模型-接口系统,按答案接口分组:20 个文本回答系统和 11 个视觉回答系统。它们涵盖了通用、空间专用、具身、统一和专用图像生成模型。当模型支持两种接口时,每种接口被视为一个单独的系统,因为它们暴露了不同的答案机制。

在目标模型评估之前,冻结每个任务的视觉协议。其生成提示、解析器、无效输出规则和指标映射由所有视觉回答模型共享,无需针对特定模型进行调整。文本系统以原始答案空间进行回答。缺失、不可读、格式错误或无法解析的输出保留在公共分母中,并得零分。

源任务指标产生 [0, 1] 范围内的样本级分数;分数在每个任务内平均,并在任务间进行宏平均,以得出能力和总体结果。附录 E 报告了完整的指标、任务级分数、运行时设置和引导不确定性。

第 9 页

4.2 SpatialGen-Bench 上的主要结果

表 2 SpatialGen-Bench 上的主要结果(%)。能力分数对其构成任务进行宏平均,Overall 对任务分数进行宏平均。粗体表示每个答案接口内表现最好的模型。

模型 感知 理解 推理 交互 总体

人类 97.41 85.71 77.92 87.60 87.79

文本回答 GPT-5.4 74.61 44.29 56.64 69.70 61.04 Cosmos3-Nano 76.82 45.00 55.20 63.15 60.17 RynnBrain-8B 67.05 45.71 44.21 44.13 51.15 RoboBrain2.5-8B-NV 58.39 34.29 47.76 50.03 47.43 SenseNova-Vision-7B-MoT 54.40 43.57 40.85 46.83 46.78 InternVL3.5-8B 51.70 36.43 62.45 35.87 46.25 SpaceR 61.04 31.43 53.24 37.38 45.84 SpaceOm 59.23 40.00 43.78 32.78 44.76 LLaVA-OV-1.5-8B 54.23 37.86 39.97 45.56 44.64 SpatialThinker-3B 57.65 41.43 39.75 36.37 44.62 Qwen3-VL-8B 59.79 37.14 47.00 31.43 44.50 GEM-2B 56.70 43.57 39.70 30.32 43.65 Cambrian-S-7B 68.01 21.43 47.09 32.22 42.55 GLM-4.6V-Flash 56.28 45.71 29.75 25.42 40.96 VLM-3R-7B 56.19 21.43 37.52 31.21 36.90 Spatial-MLLM 32.77 30.00 32.97 36.51 32.82 SpatialRGPT-8B 38.90 27.86 29.47 29.52 31.72 Janus-Pro-7B 39.20 26.43 35.75 24.13 31.58 Janus-1.3B 39.43 28.57 31.62 11.11 28.59 SpatialBot-3B 33.12 32.86 31.85 10.79 27.99

视觉回答 GPT Image 2 69.58 47.14 41.83 56.80 54.49 Nano Banana 2 72.92 42.14 24.92 48.61 48.63 GPT-5 Image Mini 64.40 33.57 26.89 29.13 40.00 Seedream 4.5 51.43 35.71 28.69 33.04 38.13 JoyAI-Image 41.90 35.00 19.50 42.61 35.28 FLUX.2 [klein] 9B 47.68 26.43 22.80 35.09 33.58 SenseNova-Vision-7B-MoT 32.44 45.71 12.44 35.93 32.70 FLUX.2 [klein] 4B 41.93 27.14 14.11 28.37 28.84 OmniGen-v1 29.85 25.00 26.36 25.21 26.72 Qwen-Image-Edit-2511 30.65 24.29 29.69 20.47 26.44 BAGEL-7B-MoT 27.38 23.57 24.44 26.32 25.44

当前模型仍远远落后于人类。如表 2 所示,GPT-5.4 在文本回答方面以 61.04 的总体得分领先,而 GPT Image 2 在视觉回答方面以 54.49 的得分领先;两者均远低于 87.79 的人类参考水平。相对于每列中表现最好的机器得分,最大的能力层面差距出现在理解方面(38.57 分),最宽的任务层面差距出现在视角(51.43)、关系(31.43)和心理建模(28.57)上,详见表 19。因此,主要瓶颈在于维持关系语义以及在视角之间转换空间表征,而不仅仅是通用的多步推理。

空间专用模型仍未能达到通用空间智能的水平。SpaceR 取得了最强的机器关系得分(57.14),而 RynnBrain-8B 和 RoboBrain2.5-8B 在接地(Grounding)和可供性(Affordance)方面表现尤为出色;RoboBrain2.5-8B 在尺寸(Size)方面也达到了 88.57 的得分。然而,它们在方向(Orientation)、视角(Perspective)、导航(Navigation)和轨迹(Trajectory)方面的表现差异显著。在 SpatialGen-Bench 广泛的任务覆盖下,这些不均衡的表现表明,当前的空间专业化改进了特定的几何或动作接地技能,但尚未产生通用的空间能力。

9

第 10 页

4.3 接口优势与互补性

(a) 群体画像 (b) 同系接口切换 20 个文本模型 vs. 11 个视觉模型 SenseNova 文本 vs. 视觉

计数 -20.9 -45.0

深度 +18.8 +50.0

方向 0.0 -30.0

大小 -31.5 -62.9

关系 +6.7 +5.7

视角 -8.1 -25.7

心智建模 +0.7 +14.3

接地 -9.4 +14.3

多跳 -10.2 +3.3

预测 -13.7 -45.7

可行性 -29.0 -42.9

功能特性 -6.8 -12.7

导航 +8.0 -6.7

轨迹 -5.8 -13.3

−30 −20 −10 0 10 20 −60 −40 −20 0 20 40 60

视觉优势 文本优势

图 6 展示(视觉回答)在何处有帮助?条形图报告了在相同源任务指标下视觉减文本的分数差异;正值有利于视觉回答。(a) 比较了文本模型和视觉模型的平均值。(b) 提供了 SenseNova-Vision-7B-MoT 的两个接口在相同项目上的部分同系比较。由于模型池或解码路径不同,这两种比较均为描述性的。

当目标可以保持为像素级空间状态时,视觉回答的效果最强。图 6 的两个面板均显示在深度(模型组比较中为 +18.85,SenseNova 为 +50.00)和关系(分别为 +6.74 和 +5.71)上存在视觉优势。这些任务允许答案保持直接可见:深度场保留了连续的近–远结构,而接地叠加层则使被引用的实体及其空间配置共同可见。因此,模型可以用与证据相同的空间媒介来表达其结论,而不是首先将其简化为符号表示。仅在模型组比较中导航有所改善,而在 SenseNova 中则出现逆转,因此视觉优势集中在可直接外化的、空间接地状态上,而非一般的视觉任务。

当解决过程需要超越可见证据的转换时,文本回答仍然更强。两个面板均显示在大小、可行性、预测和计数方面有利于文本回答,而文本模型在推理层面的平均值领先 17.63 分。这些任务需要超出局部视觉证据的操作:比较对象范围、测试几何兼容性、在空间动力学下更新状态,或聚合重复实例。像素提供了前提,但答案仅在中间关系或约束组合成离散决策后才出现。因此,当前的文本输出 VLM 在将视觉观察转化为推断的空间结论方面更强,而视觉生成在所需状态可以直接以像素外化时效果最强。

10

第 11 页

表 3 共享基准项上的配对样本级结果。条目报告了计数和括号内的基准占比。视觉救援(Visual rescue)为 Visual only/(Visual only + Neither):即配对视觉接口解决的文本错误项的比例。

| Pair | Both correct | Text only | Visual only | Neither | Visual rescue | | :— | :— | :— | :— | :— | :— | | GPT-5.4 / GPT Image 2 | 182 (38.7) | 96 (20.4) | 71 (15.1) | 121 (25.7) | 37.0% | | SenseNova (Text / Visual) | 73 (15.5) | 142 (30.2) | 78 (16.6) | 177 (37.7) | 30.6% |

当存在声明的二元结果时,正确性遵循该结果;Affordance 使用 precision ≥0.5,Prediction 要求精确的端点分数。此重叠诊断并不替代原生排行榜指标。

视觉和文本回答提供了互补的能力。表 3 列出了每个接口下最强评估模型在同一项上的预测配对结果,以及两种 SenseNova 模式的单独配对结果。GPT Image 2 解决了 GPT-5.4 遗漏的 71 项,恢复了其诊断失败中的 37.0%;SenseNova 的视觉模式解决了其文本模式遗漏的 78 项,尽管总分较低,仍恢复了 30.6%。因此,视觉成功并非仅仅是通过文本回答所取得成功的子集。配对结果确立了样本级的互补性,但并未确立独立的纯视觉任务领域或因果模态效应。附录 D 提供了代表性的纯视觉案例。

4.4 Agent跨基准泛化

我们测试 Agentic 构建器是否在 SpatialGen-Bench 之外也能泛化到 EmbSpatial-Bench (Du et al., 2024)、OmniSpatial (Jia et al., 2025)、Q-Spatial+ (Liao et al., 2024)、RoboSpatial-Home (Song et al., 2025)、SAT (Ray et al., 2024) 和 RoboAfford (Tang et al., 2025)。这些基准在数据模式、答案形式、任务组织和源指标方面各不相同。对于每个基准,构建器构建特定于任务的生成-解析器工件,随后 GPT Image 2 和文本基线在相同的任务平衡 50 条记录试点上进行评估。该实验测试的是端到端协议迁移,而非全基准模型排名;附录 C.3 和 C.4 报告了构建覆盖率和试点详情。

表 4 Agent协议构建后的匹配跨基准评估(%)。每个基准在答案合同审计后贡献一个任务平衡的 50 条记录子集,所有模型都在完全相同的记录 ID 上进行评估。这些试点测试的是端到端迁移,而非全基准排名。Avg. 是未加权的基准均值;粗体标记每列中的最佳分数。

| Model | Output | EmbSpatial | OmniSpatial | Q-Spatial | RoboSpatial | SAT | RoboAfford | Avg. | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | GPT Image 2 | Visual | 42.00 | 44.00 | 68.00 | 46.00 | 74.00 | 64.00 | 56.33 | | GPT-5.4 | Text | 82.00 | 38.00 | 72.00 | 58.00 | 66.00 | 48.00 | 60.67 | | Qwen3-VL-8B | Text | 84.00 | 46.00 | 74.00 | 46.00 | 50.00 | 50.00 | 58.33 | | InternVL3.5-8B | Text | 78.00 | 44.00 | 56.00 | 56.00 | 42.00 | 36.00 | 52.00 |

Agent构建器在 SpatialGen-Bench 之外实现了迁移。构建的协议支持在所有六个基准上对 GPT Image 2 进行端到端、指标兼容的评估,并与文本基线进行匹配比较。结果大致呼应了主要基准:文本模型在四个基准列中领先,而 GPT Image 2 在 SAT 和 RoboAfford 中领先,因此没有任何一种答案接口具有普遍优势。这一模式是支持性背景;主要结果是成功适应了异构的任务合同。由于每列都是任务平衡的试点,这些值并非全基准排行榜估计值。

4.5 通用 VLM 解析器敏感性

为了测量解析器敏感性,我们将 Qwen3-VL-8B (Bai et al., 2025a)、Qwen2.5-VL-72B (Bai et al., 2025b) 和 Llama 4 Scout 作为通用解析器应用于来自六个图像模型的相同保存输出,同时保持基准目标和源任务指标固定。ProVisE 使用每个任务声明的解析器;通用解析器接收生成的响应和特定于任务的解码请求,但不接收真实答案或 ProVisE 预测。每个解析器列使用相同的记录,不可用的工件和无效解析保留为零。表 5 报告了 resulting 分数和排名;附录 C.6 提供了输入异常、匹配覆盖率和任务级结果。

11

第 12 页

表 5 通用 VLM 解析器敏感性。每个解析器列对每个图像模型评分相同的固定记录。 ProVisE 使用每个声明的任务解析器;其他列则替换为一个通用 VLM 解析器。36 个不可用的生成产物和所有无效解析在分母中保留为零,出现在每一列中。分数对任务进行宏平均;上标表示列内排名。

图像模型 ProVisE Qwen3-VL-8B Qwen2.5-VL-72B Llama 4 Scout

GPT Image 2 51.63 1 45.67 1 44.95 2 40.31 3 Nano Banana 2 48.63 2 43.40 3 44.59 3 40.60 2 GPT-5 Image Mini 40.00 3 40.60 5 39.64 4 37.24 4 Seedream 4.5 37.89 4 42.86 4 37.06 6 41.15 1 JoyAI-Image 35.28 5 44.22 2 46.90 1 35.67 5 FLUX.2 [klein] 4B 28.84 6 38.34 6 39.07 5 34.63 6

解析器替换既改变了分数,也改变了排名。ProVisE 和 Qwen3-VL-8B 将 GPT Image 2 排在第一位,而 Qwen2.5-VL-72B 将 JoyAI-Image 排在第一位,Llama 4 Scout 将 Seedream 4.5 排在第一位。相对于 ProVisE,三个通用解析器的排名相关系数分别为 0.60、0.31 和 0.60,平均绝对分数变化分别为 5.87、5.63 和 5.26 分。它们的条件有效解析率仍然很高(99.54%、98.49% 和 91.96%),表明这些变化源于语义解释以及响应格式失败。由于解析器替换提高了某些模型的分数而降低了其他模型的分数,因此它不是统一的校准偏移。因此,该实验表明,通用黑盒解析器增加了一个依赖于模型的解释层;它并不对通用 VLM 或图像生成系统本身进行排名。

4.6 失败归因:为何展示会失败?

为了区分空间答案错误与视觉通信失败,我们将每个响应分配给五个互斥的结果之一:生成失败、协议不合规、解析器失败、预测错误或预测正确。只有在解析器恢复出有效答案后,才区分正确和错误的预测;此诊断并不替代主要结果中使用的原生任务指标。这些标签标识的是可观察到的失败阶段,而非模型的潜在推理,因为不合规和解析器失败可能各有多种原因。附录 C.7 给出了优先级规则以及没有明确执行状态的历史记录的处理方法。

大多数失败是有效但不正确的空间预测。在图 7 的非正确结果中,88.03% 产生符合诊断正确性标准的预测,相比之下,协议不合规占 8.46%,解析器失败占 3.45%,生成失败占 0.06%。因此,视觉通信通道通常完成:生成了图像并恢复了与任务兼容的答案,但表达的空间状态是错误的。这种区别解释了为什么“展示”并不自动足够。像素空间输出可以保留已形成的空间结论,但它不能替代推导该结论所需的比较、约束组合、视角变换或状态更新。视觉接口改变了答案的表达方式,而不是其必须遵循的推理过程。

剩余的失败揭示了不同的外部化和测量瓶颈。非答案失败在任务上高度局部化。对于 Size 和 Feasibility,54.64% 和 55.22% 的失败发生在恢复有效预测之前:模型必须在渲染比较比例或具有可见间隙或碰撞的合理放置时保留场景。Prediction 和 Grounding 暴露了不同的负担,27.02% 和 17.52% 的失败发生在答案恢复期间,因为端点和位置必须编码得足够精确以便解析。Depth 提供了相反的情况:基准坐标提供确定性测量锚点,其解析器没有解析器失败。因此,当答案自然地作为可检查的图像状态存在,且外部化和测量都很轻量时,展示是最可靠的。当求解需要隐藏变换、几何控制的反事实或用于下游恢复的精确视觉符号时,它变得脆弱。

12

第 13 页

正确预测 错误预测 协议不合规 解析器失败 生成失败

(a) 模型级归因 (b) 任务级归因

0.9 0.2 0.2 GPT Image 2 54 45 计数 (440) 36 64 0.6 2.6 深度 (330) 68 31 Nano Banana 2 49 49 3.0 3.0 方向 (440) 32 65 GPT-5 Image Mini 39 58 0.3 尺寸 (385) 50 23 27 4.7 0.2 0.2 Seedream 4.5 36 59 关系 (385) 43 57 3.4 1.6 0.3 透视 (385) 18 80 JoyAI-Image 35 61 2.1 6.0 心智建模 (385) 33 65 SenseNova-Vision-7B-MoT 32 46 16 接地 (385) 39 50 11 5.1 0.2 FLUX.2 [klein] 9B 32 63 多跳 (330) 22 77 1.5

4.9 0.2 FLUX.2 [klein] 4B 28 67 预测 (275) 10 66 24

可行性 (385) 30 31 38 OmniGen-v1 25 55 11 9 6.2 1.1 可供性 (385) 19 81 Qwen-Image-Edit-2511 24 68 导航 (330) 35 65 3.8 2.7 BAGEL-7B-MoT 25 63 8 轨迹 (330) 45 53

0% 25% 50% 75% 100% 0% 25% 50% 75% 100%

图 7 按视觉回答模型和任务划分的失败归因。条形图对所有响应进行分区,正确预测保留在分母中。这些类别仅用于诊断,并不替代表 2 中的原生指标;任务分隔符表示能力组。

4.7 局限性 Agent协议构建依赖于其规划和验证后端。在我们的设置中,我们使用 GPT-5.4 和 GPT Image 2 作为最强的可用后端,为所有生成器构建一个共享协议。这提高了构建质量和可比性,但可能有利于 GPT Image 2 能够执行的视觉表示,并使较弱或训练方式不同的生成器处于劣势。基于 VLM 的回退路线在现有配方或确定性算子无法表达任务时保留了评估覆盖率,但其在某些外部任务上的频繁使用揭示了库覆盖的不完整性,并引入了依赖于提供者的变异性。因此,扩展可复用的配方、算子和验证测试是开源框架的一个重要方向。文本和视觉回答池在架构、规模和训练数据上也存在差异,因此它们的比较表征的是当前系统,而非隔离出因果模态效应。最后,ProVisE 目前针对具有可恢复注释和指标的静态图像基准;将其扩展到视频、模拟和闭环具身任务仍是未来的工作。

5 结论

我们引入了 ProVisE 和 SpatialGen-Bench,以评估超越纯文本答案的空间认知。ProVisE 将协议引导的视觉响应转换为由原始任务指标评分的结构化预测,而其Agent构建器将此过程适应于新的基准。SpatialGen-Bench 实现了文本和视觉回答模型在多样化空间任务上的共享比较。 我们的结果显示了优势的划分,而非单一的赢家。当答案可以直接用像素表示时(例如深度场或接地位置),图像生成模型最具竞争力。生成随后保留了连续几何结构,并使证据易于检查。当可见证据必须通过约束组合、反事实推理或精确状态更新进行转换时,文本回答模型仍然更强。大多数失败的视觉响应仍然可解析,但编码了错误的答案,这表明视觉表达并不能替代推理。外部试点演示了协议迁移,而解析器敏感性实验表明,分数和排名取决于如何解码生成的证据。 综上所述,这些发现表明,空间系统不应将每个任务强行纳入文本或像素之中。文本或潜在状态可以处理约束和规划,视觉生成可以外化几何结构和接地状态,确定性算子可以验证结果。根据任务和推理阶段选择表示形式,将使“展示”和“告知”能够交换中间状态并相互交叉检查。

13

第 14 页

参考文献

Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, 等。Gpt-4 技术报告。arXiv 预印本 arXiv:2303.08774, 2023。

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, 和 Jiankang Deng。Llava-onevision-1.5:用于普及多模态训练的完全开放框架,2025。https://arxiv.org/abs/2509.23661。

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, 和 Ke Zhu。Qwen3-vl 技术报告,2025a。https://arxiv.org/abs/2511.21631。

Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, 和 Junyang Lin。Qwen2.5-vl 技术报告,2025b。https://arxiv.org/abs/2502.13923。

Eslam Mohamed Bakr, Pengzhan Sun, Xiaoqian Shen, Faizan Farooq Khan, Li Erran Li, 和 Mohamed Elhoseiny。 Hrs-bench:面向文本到图像模型的整体、可靠且可扩展的基准测试,2023。https://arxiv.org/abs/2304. 05390。

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, 和 Ronald Clark。Spatialthinker:通过密集奖励强化基于场景图的空间推理,2025。https://arxiv.org/abs/2511.07403。

Wenxiao Cai, Iaroslav Ponomarenko, Jianhao Yuan, Xiaoqi Li, Wankou Yang, Hao Dong, 和 Bo Zhao。Spatialbot: 利用视觉语言模型实现精确的空间理解。在 2025 IEEE 国际机器人与自动化会议 (ICRA) 上,第 9490–9498 页。IEEE,2025。

Boyuan Chen, Zhuo Xu, Sean Kirmani, Brain Ichter, Dorsa Sadigh, Leonidas Guibas, 和 Fei Xia。Spatialvlm: 赋予视觉语言模型空间推理能力。在 IEEE/CVF 计算机视觉与模式识别会议论文集上,第 14455–14465 页,2024。

Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, 和 Chong Ruan。Janus-pro: 通过数据和模型扩展实现统一的多模态理解与生成。arXiv 预印本 arXiv:2501.17811, 2025。

An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang, Jan Kautz, Xiaolong Wang, 和 Sifei Liu。 Spatialrgpt:视觉语言模型中的接地空间推理。神经信息处理系统进展,37:135062–135093,2024。

Jaemin Cho, Yushi Hu, Roopal Garg, Peter Anderson, Ranjay Krishna, Jason Baldridge, Mohit Bansal, Jordi Pont- Tuset, 和 Su Wang。Davidsonian scene graph:改进文本到图像生成的细粒度评估可靠性,2024。https://arxiv.org/abs/2310.18235。

Wei Chow, Jiageng Mao, Boyi Li, Daniel Seita, Vitor Guizilini, 和 Yue Wang。Physbench:基准测试并增强视觉语言模型以理解物理世界,2025。https://arxiv.org/abs/2501.16411。

Gheorghe Comanici, Eric Bieber, Mike Schaekermann, Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, 等。Gemini 2.5:通过高级推理、多模态、长上下文和下一代Agent能力推动前沿。arXiv 预印本 arXiv:2507.06261,2025。

Yufeng Cui, Honghao Chen, Haoge Deng, Xu Huang, Xinghang Li, Jirong Liu, Yang Liu, Zhuoyan Luo, Jinsheng Wang, Wenxuan Wang, 等。Emu3.5:原生多模态模型是世界学习者。arXiv 预印本 arXiv:2510.26583, 2025。

Ronghao Dang, Jiayan Guo, Bohan Hou, Sicong Leng, Kehan Li, Xin Li, Jiangpin Liu, Yunxuan Mao, Zhikai Wang, Yuqian Yuan, 等。Rynnbrain:开放具身基础模型。arXiv 预印本 arXiv:2602.14979,2026。 https://arxiv.org/abs/2602.14979。

14

第 15 页

Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, 等. 统一多模态预训练中的涌现特性. arXiv 预印本 arXiv:2505.14683, 2025.

Mengfei Du, Binhao Wu, Zejun Li, Xuan-Jing Huang, 和 Zhongyu Wei. Embspatial-bench:利用大型视觉语言模型对具身任务的空间理解进行基准测试. 在计算语言学协会第 62 届年会论文集(第 2 卷:短文)中,第 346–355 页,2024.

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, 等. VLM-3R:增强指令对齐 3D 重建的视觉语言模型,2025. https://arxiv.org/abs/2505.20279.

Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang, Xudong Lin, Dan Roth, Noah A Smith, Wei-Chiu Ma, 和 Ranjay Krishna. Blink:多模态大语言模型能看但不能感知. 在欧洲计算机视觉会议中,第 148–166 页. Springer, 2024.

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T Barron, 等. 图像生成器是通用视觉学习者. arXiv 预印本 arXiv:2604.20329, 2026.

Dhruba Ghosh, Hannaneh Hajishirzi, 和 Ludwig Schmidt. Geneval:一个以对象为重点的评估文本到图像对齐的框架. 神经信息处理系统进展,36:52132–52152, 2023.

Tejas Gokhale, Hamid Palangi, Besmira Nushi, Vibhav Vineet, Eric Horvitz, Ece Kamar, Chitta Baral, 和 Yezhou Yang. 基准测试文本到图像生成中的空间关系. arXiv 预印本 arXiv:2212.10015, 2022.

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, 等. 视觉作为统一的多模态生成,2026. https://arxiv.org/abs/2607.06560.

Xiaoshuai Hao, Yingbo Tang, Lingfeng Zhang, Yanbiao Ma, Yunfeng Diao, Ziyu Jia, Wenbo Ding, Hangjun Ye, 和 Long Chen. Roboafford++:一个由生成式 AI 增强的数据集,用于机器人操作和导航中的多模态功能学习. arXiv 预印本 arXiv:2511.12436, 2025.

Yushi Hu, Benlin Liu, Jungo Kasai, Yizhong Wang, Mari Ostendorf, Ranjay Krishna, 和 Noah A Smith. Tifa: 通过问答实现准确且可解释的文本到图像忠实度评估. 在 IEEE/CVF 国际计算机视觉会议论文集,第 20406–20417 页,2023.

Kaiyi Huang, Chengqi Duan, Kaiyue Sun, Enze Xie, Zhenguo Li, 和 Xihui Liu. T2i-compbench++:一个增强且全面的组合文本到图像生成基准. IEEE 模式分析与机器智能汇刊,47(5):3563–3579, 2025.

Yuheng Ji, Huajie Tan, Jiayu Shi, Xiaoshuai Hao, Yuan Zhang, Hengyuan Zhang, Pengwei Wang, Mengdi Zhao, Yao Mu, Pengju An, 等. Robobrain:一个从抽象到具体的机器人操作统一大脑模型. arXiv 预印本 arXiv:2502.21257, 2025.

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, 和 Li Yi. Omnispatial: 迈向视觉语言模型的综合空间推理基准. arXiv 预印本 arXiv:2506.03135, 2025.

Joy Future Academy, JD. Joyai-image:在统一的多模态理解和生成中唤醒空间智能. 技术报告,2026. https://joyai-image.s3.cn-north-1.jdcloud-oss.com/JoyAI-Image.pdf.

Ji Hyeok Jung, Eun Tae Kim, Seoyeon Kim, Joo Ho Lee, Bumsoo Kim, 和 Buru Chang. “正确”真的正确吗?通过自我中心指令微调增强多模态大语言模型中的对象方向理解. 在 2025 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 中,第 14257–14267 页. IEEE, 2025.

Black Forest Labs, Stephen Batifol, Andreas Blattmann, Frederic Boesel, Saksham Consul, Cyril Diagne, Tim Dockhorn, Jack English, Zion English, Patrick Esser, 等. Flux. 1 kontext:潜在空间中的上下文图像生成和编辑的流匹配. arXiv 预印本 arXiv:2506.15742, 2025.

Baiqi Li, Zhiqiu Lin, Deepak Pathak, Jiayao Li, Yixin Fei, Kewen Wu, Tiffany Ling, Xide Xia, Pengchuan Zhang, Graham Neubig, 等. Genai-bench:评估和改进组合文本到视觉生成. arXiv 预印本 arXiv:2406.13743, 2024.

Dingming Li, Hongxing Li, Zixuan Wang, Yuchen Yan, Hang Zhang, Siqi Chen, Guiyang Hou, Shengpei Jiang, Wenqi Zhang, Yongliang Shen, 等. Viewspatial-bench:评估视觉语言模型中的多视角空间定位. arXiv 预印本 arXiv:2505.21500, 2025a.

15

第 16 页

Hongxing Li, Dingming Li, Zixuan Wang, Yuchen Yan, Hang Wu, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, 和 Yueting Zhuang。Spatialladder:视觉语言模型中空间推理的渐进式训练。arXiv 预印本 arXiv:2510.08531,2025b。

Yuan-Hong Liao, Rafid Mahmood, Sanja Fidler, 和 David Acuna。带有参考对象的推理路径激发大型视觉语言模型中的 定量空间推理,2024。https://arxiv.org/abs/2409.09788。

Disheng Liu, Tuo Liang, Zhe Hu, Jierui Peng, Yiren Lu, Yi Xu, Yun Fu, 和 Yu Yin。视觉语言模型中的 空间智能:综合综述,2026。https://doi.org/10.21203/rs.3.rs-8919250/v1。

Fangyu Liu, Guy Emerson, 和 Nigel Collier。视觉空间推理。计算语言学协会汇刊,11:635–651,2023。

Yang Liu, Ming Ma, Xiaomin Yu, Pengxiang Ding, Han Zhao, Mingyang Sun, Siteng Huang, 和 Donglin Wang。 Ssr:通过基于原理的空间推理增强视觉语言模型中的深度感知。arXiv 预印本 arXiv:2505.12448,2025。

Junhua Mao, Jonathan Huang, Alexander Toshev, Oana Camburu, Alan Yuille, 和 Kevin Murphy。无歧义对象描述的生成 与理解。在 2016 IEEE 计算机视觉与模式识别会议 (CVPR) 中,2016。doi: 10.1109/CVPR.2016.9。https://doi.org/10.1109/CVPR.2016.9。

NVIDIA。Cosmos 3:用于物理 AI 的全模态世界模型。技术报告,2026。https://research.nvidia. com/labs/cosmos-lab/cosmos3/technical-report.pdf。

Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, 和 Xu Sun。Spacer:强化 MLLMs 在视频空间推理中的能力。arXiv 预印本 arXiv:2504.01805,2025。https://arxiv.org/abs/2504.01805。

Roni Paiss, Ariel Ephrat, Omer Tov, Shiran Zada, Inbar Mosseri, Michal Irani, 和 Tali Dekel。教 clip 数到 十。在 IEEE/CVF 国际计算机视觉会议论文集,第 3170–3180 页,2023。

Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A Plummer, Ranjay Krishna 等。Sat:多模态语言模型的动态空间能力训练。 arXiv 预印本 arXiv:2412.07755,2024。

Team Seedream, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang 等。Seedream 4.0:迈向下一代多模态图像生成。arXiv 预印本 arXiv:2509.20427,2025。

Chan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree, Yu Su, 和 Stan Birchfield。Robospatial:教 空间理解给用于机器人的 2D 和 3D 视觉语言模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,2025。口头报告。

Ilias Stogiannidis, Steven McDonagh, 和 Sotirios A. Tsaftaris。Mind the gap:基准测试视觉语言模型中的 空间推理,2025。https://arxiv.org/abs/2503.19707。

Huajie Tan, Enshen Zhou, Zhiyu Li, Yijie Xu, Yuheng Ji, Xiansheng Chen, Cheng Chi, Pengwei Wang, Huizhu Jia, Yulong Ao 等。Robobrain 2.5:深度在视野中,时间在脑海中。arXiv 预印本 arXiv:2601.14352,2026。 https://arxiv.org/abs/2601.14352。

Yingbo Tang, Lingfeng Zhang, Shuyi Zhang, Yinuo Zhao, 和 Xiaoshuai Hao。Roboafford:一个用于增强机器人操作中对象和空间 功能学习的数据集和基准。在第 33 届 ACM 国际多媒体会议论文集,第 12706–12713 页,2025。doi: 10.1145/3746027.3758209。https://doi. org/10.1145/3746027.3758209。

V Team, Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, Shuaiqi Duan, Weihan Wang, Yan Wang, Yean Cheng, Zehai He, Zhe Su, Zhen Yang, Ziyang Pan, Aohan Zeng, Baoxu Wang, Bin Chen, Boyan Shi, Changyu Pang, Chenhui Zhang, Da Yin, Fan Yang, Guoqing Chen, Jiazheng Xu, Jiale Zhu, Jiali Chen, Jing Chen, Jinhao Chen, Jinghao Lin, Jinjiang Wang, Junjie Chen, Leqi Lei, Letian Gong, Leyi Pan, Mingdao Liu, Mingde Xu, Mingzhi Zhang, Qinkai Zheng, Sheng Yang, Shi Zhong, Shiyu Huang, Shuyuan Zhao, Siyan Xue, Shangqin Tu, Shengbiao Meng, Tianshu Zhang, Tianwei Luo, Tianxiang Hao, Tianyu Tong, Wenkai Li, Wei Jia, Xiao Liu, Xiaohan Zhang, Xin Lyu, Xinyue Fan, Xuancheng Huang, Yanling Wang, Yadong Xue, Yanfeng Wang, Yanzi Wang, Yifan An, Yifan Du, Yiming Shi, Yiheng Huang, Yilin Niu, Yuan Wang, Yuanchang Yue, Yuchen Li, Yutao Zhang, Yuting Wang, Yu Wang, Yuxuan Zhang, Zhao Xue, Zhenyu Hou, Zhengxiao Du, Zihan Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, 和 Jie Tang。 Glm-4.5v 和 glm-4.1v-thinking:迈向可扩展强化学习的通用多模态推理,2025。 https://arxiv.org/abs/2507.01006。

16

第 17 页

Shengbang Tong, Ellis Brown, Penghao Wu, Sanghyun Woo, Manoj Middepogu, Sai C Akula, Jihan Yang, Shusheng Yang, Adithya Iyer, Xichen Pan, 等人。Cambrian-1:对多模态大语言模型进行全面开放的、以视觉为中心的探索。 神经信息处理系统进展,37:87310–87356, 2024.

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, 和 Manling Li。Mindcube:从有限视角进行空间心理建模,2026a。https://arxiv.org/abs/2506.21458.

Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, Zhaokai Wang, Zhe Chen, Hongjie Zhang, Ganlin Yang, Haomin Wang, Qi Wei, Jinhui Yin, Wenhao Li, Erfei Cui, Guanzhou Chen, Zichen Ding, Changyao Tian, Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Yuchen Duan, Xuehui Wang, Zhi Hou, Haoran Hao, Tianyi Zhang, Songze Li, Xiangyu Zhao, Haodong Duan, Nianchen Deng, Bin Fu, Yinan He, Yi Wang, Conghui He, Botian Shi, Junjun He, Yingtong Xiong, Han Lv, Lijun Wu, Wenqi Shao, Kaipeng Zhang, Huipeng Deng, Biqing Qi, Jiaye Ge, Qipeng Guo, Wenwei Zhang, Songyang Zhang, Maosong Cao, Junyao Lin, Kexian Tang, Jianfei Gao, Haian Huang, Yuzhe Gu, Chengqi Lyu, Huanze Tang, Rui Wang, Haijun Lv, Wanli Ouyang, Limin Wang, Min Dou, Xizhou Zhu, Tong Lu, Dahua Lin, Jifeng Dai, Weijie Su, Bowen Zhou, Kai Chen, Yu Qiao, Wenhai Wang, 和 Gen Luo。Internvl3.5:在通用性、推理和效率方面推进开源多模态模型,2025。https://arxiv.org/abs/2508.18265.

Zengbin Wang, Xuecai Hu, Yong Wang, Feng Xiong, Man Zhang, 和 Xiangxiang Chu。各就各位:基准测试文本到图像模型的空间智能。arXiv 预印本 arXiv:2601.20354, 2026b.

Thaddäus Wiedemer, Yuxuan Li, Paul Vicol, Shixiang Shane Gu, Nick Matarese, Kevin Swersky, Been Kim, Priyank Jaini, 和 Robert Geirhos。视频模型是零样本学习者和推理者,2025。https://arxiv.org/abs/2509. 20328.

Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng-ming Yin, Shuai Bai, Xiao Xu, Yilei Chen, 等人。Qwen-image 技术报告,2025a。https://arxiv.org/abs/2508.02324.

Chengyue Wu, Xiaokang Chen, Zhiyu Wu, Yiyang Ma, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, Chong Ruan, 和 Ping Luo。Janus:解耦视觉编码以实现统一的多模态理解和生成,2024。https://arxiv.org/abs/2410.13848.

Diankun Wu, Fangfu Liu, Yi-Hsin Hung, 和 Yueqi Duan。Spatial-mllm:提升多模态大语言模型在基于视觉的空间智能方面的能力。arXiv 预印本 arXiv:2505.23747, 2025b.

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, 和 Weidi Xie。Spatialscore:迈向全面的空间智能评估。arXiv 预印本 arXiv:2505.17012, 2025c.

Jialong Wu, Xiaoying Zhang, Hongyi Yuan, Xiangcheng Zhang, Tianhao Huang, Changjing He, Chaoyi Deng, Renrui Zhang, Youbin Wu, 和 Mingsheng Long。视觉生成通过多模态世界模型解锁类人推理,2026。https://arxiv.org/abs/2601.19834.

Qiucheng Wu, Handong Zhao, Michael Saxon, Trung Bui, William Yang Wang, Yang Zhang, 和 Shiyu Chang。Vsp: 诊断多模态大语言模型在空间规划任务中感知和推理的双重挑战。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集,第 2270–2280 页,2025 年 10 月 2025d.

Shitao Xiao, Yueze Wang, Junjie Zhou, Huaying Yuan, Xingrun Xing, Ruiran Yan, Chaofan Li, Shuting Wang, Tiejun Huang, 和 Zheng Liu。Omnigen:统一图像生成,2024。https://arxiv.org/abs/2409.11340.

Yuxi Xiao, Longfei Li, Shen Yan, Xinhang Liu, Sida Peng, Yunchao Wei, Xiaowei Zhou, 和 Bingyi Kang。Spatialtree: 空间能力在多模态大语言模型中如何分支扩展,2025。https://arxiv.org/abs/2512.20617.

Jinheng Xie, Zhenheng Yang, 和 Mike Zheng Shou。Show-o2:改进的原生统一多模态模型。arXiv 预印本 arXiv:2506.15564, 2025.

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, 和 Yunjian Zhang。Spatialbench:基准测试多模态 大语言模型的空间认知,2026。https://arxiv.org/abs/2511.21471.

Jihan Yang, Shusheng Yang, Anjali W Gupta, Rilyn Han, Li Fei-Fei, 和 Saining Xie。在空间中思考:多模态大语言模型如何看、记忆和回忆空间。在计算机视觉与模式识别会议论文集,第 10632–10643 页,2025a.

Shusheng Yang, Jihan Yang, Pinzhi Huang, Ellis Brown, Zihao Yang, Yue Yu, Shengbang Tong, Zihan Zheng, Yifan Xu, Muhan Wang, 等人。Cambrian-s:迈向视频中的空间超感知。arXiv 预印本 arXiv:2511.04670, 2025b。https://arxiv.org/abs/2511.04670.

17

第 18 页

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, 和 Jiangmiao Pang。Mmsi-bench:一个用于多图像空间智能的基准测试。在 ICLR,2025c。

Songsong Yu, Yuxin Chen, Hao Ju, Lianjie Jia, Fuxi Zhang, Shaofei Huang, Yuhan Wu, Rundi Cui, Binghao Ran, Zaibin Zhang, 等人。VLMs 距离视觉空间智能还有多远?一种基于基准测试的视角。arXiv 预印本 arXiv:2509.18905,2025。

Wenyu Zhang, Wei En Ng, Lixin Ma, Yuwen Wang, Junqi Zhao, Allison Koenecke, Boyang Li, 和 Lu Wang。Sphere: 通过分层评估揭示视觉语言模型中的空间盲区。ACL,2025a。

Yuyou Zhang, Radu Corcodel, Chiori Hori, Anoop Cherian, 和 Ding Zhao。Spinbench:以透视和旋转为 透镜审视 VLMs 中的空间推理。arXiv 预印本 arXiv:2509.25390,2025b。

Ruowen Zhao, Bangguo Li, Zuyan Liu, Yinan Liang, Junliang Ye, Fangfu Liu, Diankun Wu, Zhengyi Wang, Xumin Yu, Yongming Rao, Han Hu, 和 Jun Zhu。GEM:生成式监督有助于具身智能。arXiv 预印本 arXiv:2605.28548,2026。https://arxiv.org/abs/2605.28548。

Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, 等人。大模型时代的 multimodal 空间推理:一项调查与 基准测试。arXiv 预印本 arXiv:2510.25760,2025。

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, 等人。Roborefer:面向具有推理能力的视觉语言模型在机器人中的空间指代。 arXiv 预印本 arXiv:2506.04308,2025。

18

第 19 页

附录概述

附录提供了支持性背景、实现细节和完整结果:

• 附录 A 回顾了空间与生成模型评估。

• 附录 B 记录了数据来源、模式和质量控制。

• 附录 C 指定了解析器规则、Agentic 协议构建及验证分析。

• 附录 D 展示了具有代表性的纯视觉成功案例。

• 附录 E 报告了运行时设置、评分、完整结果及不确定性。

A 相关工作

空间推理基准与模型。空间评估已从单图像关系和感知测试(包括 VSR、BLINK 和 ViewSpatial (Liu et al., 2023; Fu et al., 2024; Li et al., 2025a))发展到更广泛的分类体系,如 SpatialBench、OmniSpatial 和 SpatialScore (Xu et al., 2026; Jia et al., 2025; Wu et al., 2025c)。规划与具身套件探测面向行动的推理 (Ray et al., 2024; Du et al., 2024; Wu et al., 2025d),而 VSI-Bench、MindCube 和 MMSI 将评估扩展至视频、稀疏视图和多图像 (Yang et al., 2025a; Wang et al., 2026a; Yang et al., 2025c)。与此同时,空间专用模型引入了几何监督、接地推理或空间聚焦的后训练 (Chen et al., 2024; Cheng et al., 2024; Wu et al., 2025b; Ouyang et al., 2025)。这些进展拓宽了空间覆盖范围,但其异构的答案模式和指标仍主要面向文本或坐标输出。

生成式与统一视觉系统。Janus、BAGEL、Emu3.5 和 Show-o2 等统一模型在单一系统内结合了视觉理解和生成 (Chen et al., 2025; Deng et al., 2025; Cui et al., 2025; Xie et al., 2025)。现有的生成式评估通过问答、检测器或学习到的评判器来衡量提示忠实度、对象组合或场景图一致性 (Hu et al., 2023; Ghosh et al., 2023; Huang et al., 2025; Cho et al., 2024)。它们并非旨在将生成的图像视为源基准的答案,而该源基准的原生指标期望的是选择、坐标、掩码或轨迹。我们的设置则研究在这些异构任务契约下指标兼容的视觉回答。

B 数据集构建与质量控制

本节记录了紧凑版 SpatialGen-Bench 划分的构建和质量评估。正文已在基准构建部分和表 1 中报告了基准规模、能力层次结构和任务覆盖范围。因此,我们在此重点关注来源溯源、任务映射、统一数据表示以及最终发布划分的质控。

B.1 数据来源、任务映射与许可证

SpatialGen-Bench 由涵盖对象级感知、场景级空间理解、多步推理和面向行动的交互的公共空间基准汇编而成。每个源任务根据其任务目标而非仅凭源基准名称进行映射。例如,面向对象的朝向被分配给感知,因为它是直接从图像中可观察到的;而视点选择被分配给理解,因为它需要从另一个视角进行推理。我们在此不重复层次结构图;相反,表 6 记录了每个子任务的发布样本数量、源基准、原始任务类型、能力映射以及许可证或使用条款。

所有样本均保留来源、source_id 和 metadata_json 中的溯源信息。我们报告了来自相应官方项目页面、仓库或 Hugging Face 数据集卡片的可用使用条款。由于仓库或数据集卡片的许可证可能未涵盖每个上游媒体资产,本表记录的是溯源信息,而非重新解释源权利。“N/A”表示在检查的官方来源中未识别出明确的许可证字段;这并不意味着没有限制。

19

第 20 页

表 6 SpatialGen-Bench 的来源出处、发布样本数量(N)、任务映射及使用条款。 来源链接指向已核验的官方项目、仓库或数据集说明卡。

| 任务 | N | 来源基准 | 原始任务类型 | 能力 | 条款 | 来源 | | :— | :— | :— | :— | :— | :— | :— | | 计数 | 40 | CountBench | 单图像中的对象/类别计数 | 感知 | CC-BY-4.0 | 项目 | | 深度 | 30 | BLINK | A/B 相对深度比较 | 感知 | Apache-2.0 | HF | | 方向 | 40 | EgoOrientBench | 自我中心物体朝向 | 感知 | MIT | HF | | 对象大小 | 35 | SPHERE-VLM (Zhang et al., 2025a) | 自然图像中的对象大小比较 | 感知 | COCO 条款 | HF | | 关系 | 35 | VSR | 视觉空间关系的真/假验证 | 理解 | Apache-2.0 | GitHub | | 视角 | 35 | ViewSpatial-Bench | 透视或视点方向选择 | 理解 | Apache-2.0 | HF | | 心智建模 | 35 | MindCube | 多视图心智建模与视角推理 | 理解 | MIT | HF | | 空间定位 | 35 | RefCOCOg (Mao et al., 2016) | 带有区域标注的指代表达式定位 | 理解 | N/A | HF | | 多跳推理 | 30 | VisWorld-Eval | 多跳空间操作与组合推理 | 推理 | N/A | HF | | 预测 | 25 | VisWorld-Eval | 空间动力学下的合成状态预测 | 推理 | N/A | HF | | 几何可行性 | 35 | SPHERE-VLM (Zhang et al., 2025a) | 对象操作、几何适配及放置可行性 | 推理 | COCO 条款 | HF | | 功能 | 35 | RoboAfford-Eval | 功能或空间区域定位 | 交互 | CC-BY-4.0 | HF | | 导航 | 30 | PhysBench | 运动下的候选未来视图选择 | 交互 | Apache-2.0 | HF | | 轨迹 | 30 | ShareRobot-Bench | 机器人操作轨迹规划 | 交互 | Apache-2.0 | HF |

总计 470 个样本,涵盖四个能力层级的 14 项任务

B.2 统一实例格式

每个选定的项目被序列化为发布 JSONL 中的一行。我们在标准化统一加载和评分所需的共享字段名称、相对媒体路径、选项标识符和表面标签的同时,保留了源答案的语义。因此,深度项保持为 A/B 比较,关系项保持为布尔验证,轨迹项保持为有序路径目标。该模式标准化了传输方式;它并未重新定义任务契约。

表 7 发布的 SpatialGen-Bench JSONL 模式。路径相对于数据集根目录。mask_path 和评估器元数据是评分目标,而非模型输入。

| 字段 | 类型 | 含义 | | :— | :— | :— | | id | string | 全局唯一的样本标识符。 | | capability | string | 感知、理解、推理或交互之一。 | | task | string | 14 个标准化子任务名称之一。 | | image_path | string | 主输入图像的相对路径。 | | media_paths | list[string] | 有序的模型输入媒体,包括任何所需的视图或候选项。 | | mask_path | string | 可选的仅限评估器的目标掩码路径;未使用时为空。 | | question | string | 显示给模型的标准化指令。 | | answer | string | 源任务答案空间中的规范序列化答案。 | | answer_type | string | 声明的答案模式,例如整数、选择、布尔值、点、掩码或路径。 | | choices | list[string] | 有序候选项;非基于选择的任务时为空。 | | source | string | 来源基准标识符。 | | source_id | string | 从来源基准保留的标识符。 | | metadata_json | string | JSON 编码的来源出处和任务特定的辅助元数据。 |

表 7 匹配的是公共发布版本,而非更丰富的内存中 Python 对象。media_paths 明确记录了有序的模型输入,而 mask_path 仅限评估器使用。额外的视图、候选状态、对象引用、起点、路径、来源注释和策展元数据保留在 metadata_json 中;加载器将该字符串解析为 JSON。这种扁平表示法在 JSONL 和基于表的托管格式之间保持可移植性。列表 1 重现了一个发布的计数记录。

20

第 21 页

表 1 代表性 SpatialGen-Bench JSONL 记录。

{ "id": "perception_counting_110", "capability": "perception", "task": "counting", "image_path": "perception/counting/110.jpg", "media_paths": ["perception/counting/110.jpg"], "mask_path": "", "question": "How many dice are there in the image?", "answer": "10", "answer_type": "integer", "choices": [], "source": "CountBench", "source_id": "perception_counting_110", "metadata_json": "{\"text\":\"d10 set of ten green dice\",\"source\":\"CountBench\"}" }

B.3 数据完整性与审查覆盖范围

确定性完整性检查覆盖整个发布的数据集划分,并验证唯一 ID、相对路径、可读的主要媒体、答案模式有效性、占位符类资产以及所需的任务特定输入或评估器注释;所有保留的记录均通过。手动纳入审查同样覆盖每一项,并检查源指令、视觉证据、注释和评分契约是否保持相互一致。

C 协议设计与解析

本节规定了评估中使用的协议约束、解析器规则、Agent协议(Agentic routes)和验证证据。确切的提示词(prompts)是发布代码中的可执行工件,而非重复的提示词目录。

C.1 协议设计

针对每个样本的提示词仅替换声明的基准字段,如问题、选项、对象引用、候选状态或轨迹起点。新构建的Agent协议遵循四个不变量:

• 任务锚定的证据。响应必须暴露对源任务有意义的地点、区域、关系、状态、测量值或路径。

• 最小干预。编辑协议保留无关的场景内容;合成协议保留任务的场景和视角约束。

• 可执行解析器。每个提示词都配有一个声明的确定性、固定辅助或仅生成图像的解析器,以及明确的无效输出条件。

• 无答案捷径。当选项字母、角落代码、判决符号或纯文本输出仅编码答案而没有空间证据时,构建器会拒绝这些输出。

SpatialGen-Bench 为心智建模(Mental Modeling)和多跳(Multi-hop)保留了固定槽位协议,并为预测(Prediction)保留了轨迹引导的端点协议。在后一种情况下,生成的响应绘制一条反射的黄色路径并圈出一个目标洞;随后,一个固定的辅助 VLM 仅从该图像中恢复所表达的洞索引和候选数量。这些评估协议与为外部基准构建的Agent协议不同。

图 2 和图 4 总结了协议池和代表性输出。完整的提示词规范和基准特定的 YAML 工件可在首页链接的项目仓库中找到。

21

第 22 页

C.2 解析器规则与阈值

表 8 将可复用的解析器与在Agent协议构建(Agentic Protocol Construction)过程中实例化或选择的解析器区分开来。它记录了每个操作规则、解码的答案类型以及无效输出的边界条件;CLIP、OCR 和 VLM 辅助均被明确命名,而非归入通用的“模型辅助解析器”标签下。

表 8 可复用协议与Agent协议的解析器规则。HSV 范围使用 OpenCV 色调值;明确命名了固定的辅助模型和仅针对生成图像的后备(Fallback)机制。

| 协议 | 解析器规则 | 预测结果 | 无效或不可靠条件 | | :— | :— | :— | :— | | 可复用的 SpatialGen-Bench 协议 | | | | | 实例标记 | 阈值化绿色像素(H=35–90, S/V≥80),应用 3 × 3 形态学操作,并根据面积和固实度保留合理的连通分量。 | 整数计数。 | 无有效组件、标记合并,或标记未对应于目标实例。 | | 方向网格 | 阈值化蓝色像素(H=100–130, S≥120, V≥50),聚合 3 × 3 网格中八个外围单元的证据,并要求至少 50 个蓝色像素。 | 方向标签。 | 无活动单元、中心单元标记,或单元间证据冲突。 | | 固定槽编码 | 在协议预定义的槽中阈值化洋红色像素(H=140–175, S/V≥80),并要求至少 30 个像素。 | 选择标签或数值槽。 | 缺少标记、多个活动槽,或标记位于代码布局之外。 | | 二元关系 | 使用固定的 HSV 范围和最小颜色支持恢复绿色主体和蓝色对象叠加层。 | 布尔标签。 | 标记了错误的实体、缺少必需的接地掩码,或场景颜色产生了不支持的信号。 | | 相对深度 | 在基准 A/B 位置采样 5 × 5 局部灰度均值,并选择较亮的位置作为较近处。 | A/B 深度标签。 | 深度图不可读、位置无效、局部值无法区分,或违反声明的亮度约定。 | | 区域掩码 | 调整大小至目标分辨率,在 > 127 处阈值化灰度,并将二值掩码传递给源指标。 | 二值掩码。 | 掩码为空或不可读、缺少目标元数据,或存在非二值伪影。 | | 状态匹配 | 使用固定的 CLIP ViT-B/32 对生成的状态和候选状态进行编码,并选择最大余弦相似度。 | 候选标签。 | 缺少候选项、图像不可读,或生成的状态与候选项不可比较。 | | 轨迹绘制 | 提取距起点最近的新型红色分量,进行骨架化并排序,然后采样 20 个归一化路径点。 | 归一化折线。 | 缺少或断开的路径、起点错误,或过多的红色伪影。 | | 轨迹引导端点 | 固定的辅助 VLM 仅从生成的黄色轨迹响应中读取蓝色圆圈包围的编号孔洞和孔洞总数。 | 索引端点。 | 缺少或模糊的圆圈、孔洞编号不可读,或端点/计数为非正数。 | | 点标记 | 阈值化新型青色像素(H=80–100, S/V≥70),选择一个紧凑分量,并归一化其质心。 | 归一化点。 | 缺少标记、多个同样显著的标记,或分量太小或过于弥散而无法定位。 | | Agent构建与后备解析器 | | | | | 标记对象选择 | 将输出对齐到源图像,减去预存的洋红色,恢复一个轮廓,裁剪封闭的源对象,并使用固定的 CLIP 将其与文本选择进行匹配。 | 选择标签。 | 缺少或模糊的轮廓、裁剪无效,或 CLIP 分离不足。 | | 接地尺寸 | 通过颜色差异恢复洋红色/青色锚点和黄色尺寸线;局部 OCR 解析相邻的标量-单位标签。 | 标量和单位。 | 缺少必需的锚点或尺寸线;OCR 失败;单位不受支持;或标签分离。 | | 双锚点关系 | 恢复角色颜色的主体和参考掩码,然后计算配置的水平、垂直、主导轴或距离关系。 | 选择标签。 | 任一锚点缺失或模糊,或恢复的几何形状无法唯一映射到选择项。 | | 关系区域布尔值 | 恢复主体、参考和有效关系区域掩码;当主体位于渲染的有效区域内时,预测为真。 | 布尔标签。 | 缺少锚点、关系区域退化,或使用仅判决符号而非空间证据。 | | 尺寸后备 | 受约束的解析器仅将生成响应中可见的对象比较或测量证据映射到 A/B 模式。 | A/B 尺寸标签。 | 仅有标签、缺少比较证据、标记矛盾,或引用的对象模糊。 | | 可行性后备 | 受约束的解析器仅读取所描绘的放置、间隙、重叠或碰撞状态。 | 布尔标签。 | 缺少尝试放置、尺度不切实际或模糊、判决符号,或无可见的适配/碰撞证据。 | | 通用后备 | 任务特定的解析器提示仅从生成响应中恢复声明的答案模式;选择项仅可将可见证据映射到标签。 | 特定于合同的<br>答案。 | 缺少或矛盾的证据、输出仅包含散文/标签,或阅读需要源图像或原始问题。 |

22

第 23 页

C.3 Agent协议构建细节与覆盖率

表 9 展示了在答案契约审计后,六个外部空间基准上的Agent协议构建情况。Records(记录数)、Tasks(任务单元数)、Routes(路由数)和 Smoke(冒烟测试)描述了当前的协议工件;Pilot(试点)和 Valid(有效)总结了每个基准存档的 50 条记录的 GPT Image 2 评估结果。无效的视觉输出仍保留在分母中,并得零分。Smoke 报告的是协议的可执行性,而非目标模型的准确性。

基准 记录数 任务数 复用 构建 回退 试点 有效 (%) 冒烟

EmbiSpatial-Bench 3,640 1 0 1 0 50 100.00 1/1 OmniSpatial 1,533 5 0 0 5 50 82.00 5/5 Q-Spatial+ 101 3 0 3 0 50 100.00 3/3 RoboSpatial-Home 350 3 1 2 0 50 100.00 3/3 SAT 150 8 0 5 3 50 92.00 8/8 RoboAfford 338 3 3 0 0 50 96.00 3/3

总计 6,112 23 4 11 8 300 95.00 23/23

构建契约。对于每个任务,构建Agent接收最多三个答案隐藏示例,以及观察到的输入和答案模式、候选选项、度量契约、已注册的协议和 Parser Ops 清单。它返回一个结构化配置,Python 将其编译为生成指导、可执行解析器、无效输出规则和度量映射。静态检查会拒绝未知算子、类型或度量不匹配、缺失媒体以及答案泄露;真值答案和正确性反馈在初始调用和修订调用中均被 withheld(保留/不透露)。

该实现注册了 11 个可重用的高级协议和 41 个类型的 Parser Ops,涵盖颜色、组件、差分、几何、点、掩码、路径、测量、OCR、选项映射和固定 CLIP 相似度。终端不支持状态保留给无法标准化或评分的输入,因此不产生评估结果。

冒烟门控。冒烟验证生成最多三个响应,并对每个响应解析两次。接受条件包括成功生成和解析、重复解析的一致性、可恢复的空间证据以及与度量兼容的预测;回退路由也必须产生至少一个有效预测。正确性是诊断性的,而非接受门控。解析器或契约失败允许一次修订,而生成或 API 失败则被推迟。接受的 YAML 和清单工件在目标模型之间复用,无需重新路由。

覆盖率。表 9 总结了基准级别的构建和试点有效性。经过答案契约审计后,所有 23 个任务单元均通过冒烟验证:四个复用路由和 11 个构建路由使用确定性或固定辅助解析器,而八个使用仅基于生成图像的回退。表 10 报告了每个任务级别的决策、构建原语、解析器、度量和接受阶段。

23

第 24 页

验证协议阶段 a (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) (初始) 每个 (修订) (修订) (修订) (过渡) 烟雾 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过 通过选定的,其中 通过 Agent报告 的 成功 成功 成功 阶段 指标 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 准确率 比率 比率 比率 掩码内点 掩码内点 掩码内点 掩码内点是否 烟雾 VLM VLM VLM VLM VLM VLM VLM VLM识别 (回退)。 CLIP OCR OCR OCR + + + + 几何 几何 质心 几何 几何 几何 几何 几何 质心 质心 质心路线 解析器 CV CV CV CV CV CV CV CV CV CV CV CV CV CV CV 合约审计。 仅生成 仅生成 仅生成 仅生成 仅生成 仅生成 仅生成 仅生成 解析器合约 对 对 对 对 对 对 对 对 后 选择 布尔 布尔 布尔 布尔 布尔 提示 提示 提示 提示 提示 维度 维度 维度 提示 提示 关系 提示 关系 标记 标记 标记 标记基准 仅生成图像

a 构建 标记对象 特定任务 特定任务 特定任务 特定任务 特定任务 接地 接地 接地 关系区域 关系区域 点 关系区域 特定任务 特定任务 关系区域 双锚点 特定任务 关系区域 双锚点 点 点 点 空间 发出 或 路线 构建 构建 构建 构建 构建 构建 重用 构建 构建 构建 构建 构建 重用 重用 重用 回退 回退 回退 回退 回退 回退 回退 回退外部 六 (构建), 5 23 4 30 23 7 26 124 114 100 1 98 2 105 123 122 32该 N 420 561 300 23 229 3,640 在 配方 结果。 解析器 (选择) 范围 精度 采取 (二元) (选择)构建 距离 逻辑 逻辑 一个 关系 推理 交互 (二元) (选择) 移动 可供性 参考 可供性 距离 接地 后果 后果 注册 目标 目标 不 合约 水平 移动 协议 是 它 任务 空间 识别 动态 视角 空间 复杂 复杂 (结构化/文本) 1-D 水平 垂直 兼容性 配置 上下文 动作 (二元) 动作 (选择) 自我 目标 目标 对象 视角 视角 对象 对象 空间 Agent 实例化 验证; 任务级 (重用),通过 10 基准 EmbSpatial-Bench OmniSpatial Q-Spatial+ RoboSpatial-Home SAT RoboAffordTable 协议 工件

24

第 25 页

C.4 跨基准评估细节

表 4 在每个基准中使用 50 个归档的 GPT Image 2 记录 ID,这些 ID 是通过确定性的任务平衡分配选定的,并在相同的 ID 上评估每个文本基线。解析成功率为 285/300 个视觉输出(95.00%):确定性或固定辅助路由恢复了 225/231(97.40%),回退(Fallback)恢复了 60/69(86.96%)。剩余的输出包括六个解析器失败和九个不符合协议的响应,均保留为零值;这些比率衡量的是协议的可执行性,而非答案的正确性。

OmniSpatial 是唯一的范围例外:其归档试点涵盖四个任务单元,而当前的构建覆盖范围包括第五个恢复单元。未匹配的全拆分文本分数被省略,因为它们的样本组成与视觉子集不同。

C.5 深度解析器路由消融实验

SpatialGen-Bench 为每个深度记录提供了归一化的 A/B 查询位置。它们指出了在哪里读取生成的深度图,而不揭示哪个点更近。形式化解析器在每个位置采样 5 × 5 局部灰度均值,应用提示中固定的“越亮越近”约定,并记录两项测量结果,无需调用 VLM。

表 11 比较了基准坐标灰度采样与先前混合路由在相同保存输出上的表现。先前路由在可用时使用缓存坐标,否则要求 VLM 直接从源标记图像和生成的深度图中判断 A/B。坐标采样产生了更高的解析率和基准准确率,支持将其用作形式化深度解析器,同时将最终决定与生成图中的显式证据绑定。

来自 FLUX.2 [klein] 变体的两个输出在两个位置都具有零值邻域,并标记为无效,因为它们没有提供可区分的深度证据。如表 12 所示,从 1 × 1 到 11 × 11 的内核聚合准确率仅相差 1.21 分;我们保留现有的 5 × 5 默认值,而不是事后选择内核。记录的灰度证据与解析器预测之间的 100% 一致性是一种实现检查,而非独立的准确率结果。

表 11 深度解析器路由比较。形式化路由在基准提供的 A/B 位置对生成的深度图进行采样。先前的混合路由在可用时使用坐标,否则要求 VLM 直接判断源标记图像和生成的深度图。两者均覆盖相同的 330 个模型-记录对;无效解析仍作为零值计入分母。

解析器路由 解析率 (%) 准确率 (%)

基准坐标灰度采样 (5 × 5) 99.39 68.18 先前混合坐标/VLM路由 78.48 55.45

表 12 深度采样内核敏感性。结果使用相同的 330 个模型-记录对;5 × 5 是协议默认值。

内核 1 × 1 3 × 3 5 × 5 7 × 7 9 × 9 11 × 11

解析率 (%) 98.79 99.39 99.39 99.39 99.39 99.39 准确率 (%) 68.79 68.18 68.18 68.18 69.09 69.39

C.6 通用 VLM 解析器敏感性细节

表 13 报告了在匹配可用性边界下,每个图像模型的全任务级别比较。

聚合要求基准与每个解析器缓存之间存在精确的任务 ID 匹配,拒绝重复或缺失的 ID、未解决的 API 错误、超出范围的分数以及不一致的生成图像路径。ProVisE 列使用附录 C.5 中的确定性深度结果,并在应用共享可用性掩码之前,将每个声明的任务分数复现至 0.005 分以内。

深度是唯一输入例外:归档的通用解析器缓存将源标记图像与生成的深度图配对,并直接询问 A/B。排除深度保留了敏感性结果(Spearman 0.71/0.43/0.43;平均绝对偏移 6.40/5.59/5.74 分),因此全任务发现并非由该路由驱动。

25

第 26 页

所需 轨迹 70.0 66.7 16.7 30.0 63.3 46.7 46.7 23.3 36.7 20.0 13.3 13.3 53.3 40.0 40.0 33.3 60.0 43.3 46.7 23.3 36.7 23.3 26.7 23.3 可供性; 的 可供性: 进入 导航 40.0 16.7 10.0 23.3 40.0 23.3 10.0 26.7 36.7 23.3 10.0 20.0 36.7 30.0 10.0 20.0 33.3 20.0 23.3 20.0 36.7 20.0 20.0 23.3

可供性 60.4 30.7 26.9 12.9 42.5 22.9 18.1 13.9 14.1 16.4 14.8 14.7 9.1 27.9 15.6 16.7 34.5 31.9 35.2 11.5 11.8 29.0 18.6 10.3 可行性;归一化 可行性 31.4 45.7 71.4 37.1 37.1 51.4 57.1 37.1 40.0 51.4 68.6 37.1 40.0 48.6 57.1 48.6 34.3 45.7 62.9 34.3 17.1 51.4 68.6 37.1 可行性: 记录 预测 54.1 56.3 50.1 58.1 21.0 19.2 30.1 39.3 30.7 35.3 35.1 42.5 36.1 41.9 32.9 51.5 14.2 20.6 30.7 31.8 18.5 30.8 30.1 26.6 预测; 0.0 0.0 0.0 0.0 16.7 30.0 33.3 16.7 10.0 33.3 36.7 20.0 6.7 36.7 20.0 20.0 10.0 30.0 36.7 20.0 6.7 30.0 26.7 23.3 M-跳期望 预测:所有 的 77.1 68.6 62.9 22.9 65.7 60.0 54.3 37.1 34.3 34.3 34.3 22.9 51.4 37.1 37.1 31.4 57.1 57.1 37.1 22.9 22.9 31.4 40.0 28.6 地面 多跳;分数 25.7 40.0 31.4 37.1 31.4 40.0 42.9 37.1 28.6 34.3 31.4 28.6 25.7 37.1 22.9 31.4 25.7 31.4 42.9 34.3 31.4 45.7 37.1 34.3 心理 是 M-跳: 个人 40.0 28.6 45.7 28.6 25.7 25.7 28.6 42.9 28.6 40.0 28.6 28.6 20.0 31.4 40.0 40.0 17.1 37.1 31.4 31.4 14.3 37.1 28.6 37.1 解析 相对 45.7 42.9 51.4 40.0 45.7 37.1 48.6 40.0 42.9 45.7 48.6 40.0 45.7 51.4 51.4 37.1 40.0 60.0 54.3 42.9 40.0 45.7 40.0 42.9 轨迹。 接地; 记录。 分数。 大小 80.0 80.0 82.9 74.3 60.0 77.1 77.1 60.0 54.3 68.6 62.9 57.1 45.7 82.9 74.3 74.3 54.3 74.3 77.1 68.6 68.6 71.4 65.7 57.1 轨迹: 任务 地面: 原始 52.5 40.0 55.0 52.5 62.5 50.0 55.0 50.0 77.5 50.0 52.5 77.5 40.0 35.0 32.5 37.5 5.0 45.0 60.0 42.5 32.5 20.0 37.5 45.0 零分 依赖 63.3 53.3 50.0 80.0 86.7 56.7 50.0 76.7 73.3 53.3 63.3 66.7 90.0 50.0 40.0 86.7 53.3 60.0 63.3 73.3 46.7 53.3 50.0 53.3 导航; 视角; 显式 导航: 计数 82.5 70.0 75.0 67.5 82.5 67.5 72.5 67.5 52.5 62.5 55.0 52.5 30.0 50.0 45.0 47.5 55.0 62.5 55.0 42.5 20.0 47.5 57.5 42.5宏观平均 仍然 – – – – – – 个人: 总体 解析 93.2 91.7 86.0 98.5 98.1 91.5 99.8 98.7 92.3 98.9 97.4 93.0 99.8 98.9 90.9 99.4 98.5 91.1

1 1 2 3 2 3 3 2 3 5 4 4 4 4 6 1 5 2 1 5 6 6 5 6 排名 响应 关系; 敏感性。 总体 51.63 45.67 44.95 40.31 48.63 43.40 44.59 40.60 40.00 40.60 39.64 37.24 37.89 42.86 37.06 41.15 35.28 44.22 46.90 35.67 28.84 38.34 39.07 34.63 无效 相对: 和解析器 侦察兵 侦察兵 侦察兵 侦察兵 侦察兵 侦察兵 方向; 4 4 4 4 4 4VLM图像 方向: 评分器 ProVisE Qwen3-VL-8B Qwen2.5-VL-72B Llama ProVisE Qwen3-VL-8B Qwen2.5-VL-72B Llama ProVisE Qwen3-VL-8B Qwen2.5-VL-72B Llama ProVisE Qwen3-VL-8B Qwen2.5-VL-72B Llama ProVisE Qwen3-VL-8B Qwen2.5-VL-72B Llama ProVisE Qwen3-VL-8B Qwen2.5-VL-72B Llama 通用 4B 深度; 2 Mini 不可用 2 4.5 [klein] 依赖: 图像 模型 图像 香蕉任务级 结构;13 图像 GPT Nano GPT-5 Seedream JoyAI-图像 FLUX.2 计数; 表答案 计数:

26

第 27 页

在每个解析器预期的 2,820 个模型-记录对中,有 2,784 个保留了缓存的生成产物,36 个没有: 34 个多跳、1 个单视角和 1 个尺寸记录,主要集中在 GPT Image 2(31 个)和 Seedream 4.5(5 个)。 这些记录在所有四个解析器列下均得分为零。

Qwen3-VL-8B 返回 2,771 个有效预测、13 个无效预测和 36 个不可用图像记录; Qwen2.5-VL-72B 和 Llama 4 Scout 的相应计数分别为 2,742/42/36 和 2,560/224/36。 表 13 中的有效解析率以所有预期记录为分母。在图像可用的条件下, 这些比率分别为 99.54%、98.49% 和 91.96%。因此,分数和排名的变化不仅限于响应格式失败。

C.7 失败归因详情

第 4.6 节中的分析仅使用缓存输出。标签遵循以下优先级:生成失败、协议不合规、解析器失败,然后是正确或错误的预测。当解析器执行但未找到可恢复的证据时,无效或模糊的回退结果被视为不合规;异常或解析失败则属于解析器失败。对于深度任务,精确的局部平局被视为不合规,因为生成的地图无法进行比较。历史性的空白固定辅助输出保守地归因于解析器失败,而空白确定性输出表明缺少协议证据。

当可用时保留明确的二元正确性;否则,诊断使用精度 ≥0.5(用于 Affordance)、DFD < 0.4(用于 Trajectory)以及归一化分数 ≥0.999(其他情况)。这些阈值仅影响归因,不影响原生基准分数。有 32 个记录需要上述保守推断;当缓存的预测和分数仍然可用时,缺失的历史图像不会被重新分类为生成失败。

表 14 和表 15 提供了图 7 背后的分解数据。

表 14 按视觉回答系统划分的失败归因。每个单元格报告计数(行百分比);每个系统都在相同的 SpatialGen-Bench 项目上进行评估。正确预测是一个诊断类别,而非原生基准分数。

正确预测 错误预测 协议不合规 解析器失败 生成失败 模型 N prediction prediction noncompliance failure failure

GPT Image 2 470 253 (53.8) 211 (44.9) 4 (0.9) 1 (0.2) 1 (0.2) Nano Banana 2 470 228 (48.5) 230 (48.9) 12 (2.6) 0 (0.0) 0 (0.0) GPT-5 Image Mini 470 183 (38.9) 273 (58.1) 14 (3.0) 0 (0.0) 0 (0.0) Seedream 4.5 470 167 (35.5) 279 (59.4) 22 (4.7) 1 (0.2) 1 (0.2) JoyAI-Image 470 165 (35.1) 289 (61.5) 16 (3.4) 0 (0.0) 0 (0.0) SenseNova-Vision-7B-MoT 470 151 (32.1) 218 (46.4) 73 (15.5) 28 (6.0) 0 (0.0) FLUX.2 [klein] 9B 470 150 (31.9) 295 (62.8) 24 (5.1) 1 (0.2) 0 (0.0) FLUX.2 [klein] 4B 470 133 (28.3) 313 (66.6) 23 (4.9) 1 (0.2) 0 (0.0) OmniGen-v1 470 117 (24.9) 260 (55.3) 52 (11.1) 41 (8.7) 0 (0.0) Qwen-Image-Edit-2511 470 115 (24.5) 321 (68.3) 29 (6.2) 5 (1.1) 0 (0.0) BAGEL-7B-MoT 470 117 (24.9) 296 (63.0) 18 (3.8) 39 (8.3) 0 (0.0)

所有模型-样本记录 5,170 1779 (34.4) 2985 (57.7) 287 (5.6) 117 (2.3) 2 (< 0.1)

27

第 28 页

表 15 SpatialGen-Bench 各任务下视觉回答系统的失败归因。每个单元格报告计数(行百分比)。任务总数不同,因为基准测试中每个任务包含 25–40 个样本。

| | | Correct | Incorrect | Protocol | Parser | Generation | | :— | :— | :— | :— | :— | :— | :— | | Task | N | prediction | prediction | noncompliance | failure | failure | | Perception | | | | | | | | Counting | 440 | 159 (36.1) | 281 (63.9) | 0 (0.0) | 0 (0.0) | 0 (0.0) | | Depth | 330 | 225 (68.2) | 103 (31.2) | 2 (0.6) | 0 (0.0) | 0 (0.0) | | Orientation | 440 | 139 (31.6) | 288 (65.5) | 13 (3.0) | 0 (0.0) | 0 (0.0) | | Size | 385 | 191 (49.6) | 88 (22.9) | 105 (27.3) | 0 (0.0) | 1 (0.3) | | Understanding | | | | | | | | Relationship | 385 | 164 (42.6) | 221 (57.4) | 0 (0.0) | 0 (0.0) | 0 (0.0) | | Perspective | 385 | 69 (17.9) | 309 (80.3) | 6 (1.6) | 0 (0.0) | 1 (0.3) | | Mental modeling | 385 | 128 (33.2) | 249 (64.7) | 8 (2.1) | 0 (0.0) | 0 (0.0) | | Grounding | 385 | 151 (39.2) | 193 (50.1) | 0 (0.0) | 41 (10.6) | 0 (0.0) | | Reasoning | | | | | | | | Multi-hop | 330 | 72 (21.8) | 253 (76.7) | 5 (1.5) | 0 (0.0) | 0 (0.0) | | Prediction | 275 | 27 (9.8) | 181 (65.8) | 0 (0.0) | 67 (24.4) | 0 (0.0) | | Feasibility | 385 | 117 (30.4) | 120 (31.2) | 148 (38.4) | 0 (0.0) | 0 (0.0) | | Interaction | | | | | | | | Affordance | 385 | 74 (19.2) | 311 (80.8) | 0 (0.0) | 0 (0.0) | 0 (0.0) | | Navigation | 330 | 116 (35.2) | 214 (64.8) | 0 (0.0) | 0 (0.0) | 0 (0.0) | | Trajectory | 330 | 147 (44.5) | 174 (52.7) | 0 (0.0) | 9 (2.7) | 0 (0.0) |

C.8 解析输出敏感性

主结果中的固定分母分数将每个无效输出视为零,以便所有系统都在相同的样本上进行评估。表 16 根据能够被原生指标消耗以产生预测的输出,对每个模型-任务分数进行条件化处理。GPT Image 2 和 Nano Banana 2 仍然保持第一和第二。最大的向上提升是 SenseNova-Vision-7B-MoT(从第 7 名升至第 3 名)和 OmniGen-v1(从第 9 名升至第 6 名),而 JoyAI-Image(从第 5 名降至第 7 名)和 FLUX.2 [klein] 9B(从第 6 名降至第 8 名)则排名下降。这些变化反映了保留子集的不同,而非能力的提升,因此该条件表仅用于诊断,而非替代排行榜。

28

第 29 页

theaccepted 25.7 31.4 33.3 28.1 25.7 45.7 37.1 31.4 42.9 34.3 37.1 Mental from Traj. 70.0 63.3 36.7 53.3 60.0 40.0 40.7 36.7 36.0 24.1 40.0 denominators itsprediction 8.6 9.4 14.3 5.7 15.2 14.3a Pers. 41.2 25.7 29.4 20.0 17.1 disappearing Understanding because macro-aggregation. thanreturns Nav. 40.0 40.0 36.7 36.7 33.3 36.7 20.0 36.7 40.0 33.3 33.3 rather before Rel. 45.7 45.7 42.9 45.7 40.0 40.0 48.6 40.0 48.6 31.4 40.0parser Interaction diagnostic; task zero this eachassigned from Size 80.0 65.6 57.6 59.3 76.0 69.7 80.0 75.0 75.0 73.1 55.6 remains the only within which Aff. 60.4 42.5 14.1 9.1 34.5 28.6 51.1 11.8 5.6 4.7 5.6 prediction omittedfor failures Ori. 52.5 64.1 79.5 40.0 5.0 20.0 14.3 32.5 10.0 17.6 20.0 are parse scorable nooutputs Perception prediction 0.0 35.3 71.4 56.5 56.0 withof Dep. 63.3 86.7 73.3 90.0 53.3 82.8 83.3 48.3 93.3 43.3 36.7 Feas. 35.5 44.8 43.8 60.9 41.4 71.4 excludes task Apercentage

〈think〉 The user wants me to translate a specific section of a PDF page (Page 29, part 2) into Simplified Chinese. The input text is a jumbled collection of table headers, row labels, and data values, likely extracted from a complex table in a computer vision paper. I need to preserve the structure as much as possible, although the input is not a coherent paragraph. I must follow the terminology guidance provided. I must output only the translation. I must preserve equations, symbols, citations, URLs, model names, dataset names, metric names, module names, abbreviations, and technical English that is clearer than forced Chinese. I must preserve full-width control-tag notation such as 〈think〉 and 〈answer〉 literally.

Let's break down the input text and identify the components. The text seems to be a mix of table headers, row labels, and data. It looks like a table comparing different methods or metrics.

Input text segments: 1. the Cnt. 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 score. Scorable-only metric-consumable 2. 0.0 a Pred. 54.1 21.0 30.7 36.1 14.2 16.5 100.0 18.5 61.3 28.6reports score; Reasoning yield Rank shift 1→1 2→2 3→4 4→5 5→7 6→8 7→3 8→9 9→6 leaderboard 10→10 11→11 notScorable 3. do that alternativeparses. 4. 40.0 17.9 10.7 10.0 10.0 23.3 33.3 6.9 33.3 23.3 33.3 an score 55.02 49.78 41.09 40.87 37.34 37.15 45.11 30.78 38.32 29.64 27.62 M-Hop fixed-denominator Scorable-only notinvalid Outputs is Summary official score score 54.49 48.63 40.00 38.13 35.28 33.58 32.70 28.84 26.72 26.44 25.44filtering the

This looks like a table with multiple sections. Let's try to reconstruct the table structure mentally to translate it better, but the output should preserve the "paragraph structure" of the input, which is essentially a list of strings. However, the input is very messy. It seems like OCR or PDF extraction artifacts. I will translate the text components and keep the layout as close as possible.

Key terms from guidance:

  • ProVisE: Protocolized Visual Evaluation,协议化视觉评估框架 (keep English)
  • SpatialGen-Bench: 空间生成基准 (keep English)
  • Agentic Protocol Construction: Agent协议构建 (keep English)
  • answer-interface mismatch: 答案接口不匹配 (keep English)
  • VLM: Vision-Language Model,视觉语言模型 (keep English)
  • DFD-success@0.4: Discrete Fréchet Distance成功率阈值0.4 (keep English)

Let's translate the visible text:

Segment 1: the Cnt. 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 score. Scorable-only metric-consumable

  • Cnt. -> Count (计数) or keep as Cnt.
  • score. -> 分数
  • Scorable-only -> 仅可评分
  • metric-consumable -> 指标可消费 (or metric-consumable)

Segment 2: 0.0 a Pred. 54.1 21.0 30.7 36.1 14.2 16.5 100.0 18.5 61.3 28.6reports score; Reasoning yield Rank shift 1→1 2→2 3→4 4→5 5→7 6→8 7→3 8→9 9→6 leaderboard 10→10 11→11 notScorable

  • Pred. -> Prediction (预测)
  • reports -> 报告
  • score; -> 分数;
  • Reasoning -> 推理
  • yield -> 产出
  • Rank shift -> 排名变化
  • leaderboard -> 排行榜
  • notScorable -> 不可评分

Segment 3: do that alternativeparses.

  • do -> 做
  • that -> 那个
  • alternativeparses. -> 替代解析。

Segment 4: 40.0 17.9 10.7 10.0 10.0 23.3 33.3 6.9 33.3 23.3 33.3 an score 55.02 49.78 41.09 40.87 37.34 37.15 45.11 30.78 38.32 29.64 27.62 M-Hop fixed-denominator Scorable-only notinvalid Outputs is Summary official score score 54.49 48.63 40.00 38.13 35.28 33.58 32.70 28.84 26.72 26.44 25.44filtering the

  • an -> 一个
  • score -> 分数
  • M-Hop -> M-Hop (keep English)
  • fixed-denominator -> 固定分母
  • Scorable-only -> 仅可评分
  • notinvalid -> 非无效 (or not invalid)
  • Outputs is -> 输出是
  • Summary -> 摘要
  • official -> 官方
  • score -> 分数
  • filtering the -> 过滤

The input is extremely fragmented. I will translate the text parts and keep the numbers and spacing as is.

Let's refine the translation.

the Cnt. 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 score. Scorable-only metric-consumable -> the Cnt. 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 score. Scorable-only metric-consumable (Keep English for technical terms if they are acronyms or specific names, but Cnt. is likely Count. score. is 分数. Scorable-only is 仅可评分. metric-consumable is 指标可消费.)

0.0 a Pred. 54.1 21.0 30.7 36.1 14.2 16.5 100.0 18.5 61.3 28.6reports score; Reasoning yield Rank shift 1→1 2→2 3→4 4→5 5→7 6→8 7→3 8→9 9→6 leaderboard 10→10 11→11 notScorable -> 0.0 a Pred. 54.1 21.0 30.7 36.1 14.2 16.5 100.0 18.5 61.3 28.6报告 分数; 推理 产出 排名变化 1→1 2→2 3→4 4→5 5→7 6→8 7→3 8→9 9→6 排行榜 10→10 11→11 不可评分

do that alternativeparses. -> 做 那个 替代解析。

40.0 17.9 10.7 10.0 10.0 23.3 33.3 6.9 33.3 23.3 33.3 an score 55.02 49.78 41.09 40.87 37.34 37.15 45.11 30.78 38.32 29.64 27.62 M-Hop fixed-denominator Scorable-only notinvalid Outputs is Summary official score score 54.49 48.63 40.00 38.13 35.28 33.58 32.70 28.84 26.72 26.44 25.44filtering the -> 40.0 17.9 10.7 10.0 10.0 23.3 33.3 6.9 33.3 23.3 33.3 一个 分数 55.02 49.78 41.09 40.87 37.34 37.15 45.11 30.78 38.32 29.64 27.62 M-Hop fixed-denominator Scorable-only notinvalid 输出是 摘要 官方 分数 分数 54.49 48.63 40.00 38.13 35.28 33.58 32.70 28.84 26.72 26.44 25.44过滤

Wait, the prompt says "Translate PDF page 29, part 2". The input is just a block of text. I should output the translation of that block. The input text is very messy, likely due to PDF extraction. I will translate the words and keep the structure.

Let's do a more careful translation of the words.

Cnt. -> Count (计数) score. -> score (分数) Scorable-only -> Scorable-only (仅可评分) metric-consumable -> metric-consumable (指标可消费) Pred. -> Prediction (预测) reports -> reports (报告) score; -> score; (分数;) Reasoning -> Reasoning (推理) yield -> yield (产出) Rank shift -> Rank shift (排名变化) leaderboard -> leaderboard (排行榜) notScorable -> notScorable (不可评分) alternativeparses. -> alternative parses. (替代解析。) an -> an (一个) score -> score (分数) M-Hop -> M-Hop (M-Hop) fixed-denominator -> fixed-denominator (固定分母) Scorable-only -> Scorable-only (仅可评分) notinvalid -> not invalid (非无效) Outputs is -> Outputs is (输出是) Summary -> Summary (摘要) official -> official (官方) score -> score (分数) filtering the -> filtering the (过滤)

I will combine these into the output format.

One thing to note: ProVisE, SpatialGen-Bench, Agentic Protocol Construction, answer-interface mismatch, VLM, DFD-success@0.4 are in the terminology guidance. I should check if they appear in the text. They do not appear in the provided text snippet. So I just translate the visible text.

Final check on the translation: the Cnt. 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 score. Scorable-only metric-consumable -> the Cnt. 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 score. Scorable-only metric-consumable (Keeping English for Cnt., score., Scorable-only, metric-consumable as they are technical terms or headers, but Cnt. is likely Count. I will translate Cnt. to 计数 if it's clear, but Cnt. is often kept. Let's translate Cnt. to 计数 and score. to 分数.)

Actually, the prompt says "Preserve … technical English that is clearer than forced Chinese." Cnt. is an abbreviation for Count. 计数 is clear. score. is 分数. Scorable-only is 仅可评分. metric-consumable is 指标可消费.

Let's translate the words.

the Cnt. 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 score. Scorable-only metric-consumable -> the 计数 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 分数. 仅可评分 指标可消费

0.0 a Pred. 54.1 21.0 30.7 36.1 14.2 16.5 100.0 18.5 61.3 28.6reports score; Reasoning yield Rank shift 1→1 2→2 3→4 4→5 5→7 6→8 7→3 8→9 9→6 leaderboard 10→10 11→11 notScorable -> 0.0 a 预测. 54.1 21.0 30.7 36.1 14.2 16.5 100.0 18.5 61.3 28.6报告 分数; 推理 产出 排名变化 1→1 2→2 3→4 4→5 5→7 6→8 7→3 8→9 9→6 排行榜 10→10 11→11 不可评分

do that alternativeparses. -> 做 那个 替代解析。

40.0 17.9 10.7 10.0 10.0 23.3 33.3 6.9 33.3 23.3 33.3 an score 55.02 49.78 41.09 40.87 37.34 37.15 45.11 30.78 38.32 29.64 27.62 M-Hop fixed-denominator Scorable-only notinvalid Outputs is Summary official score score 54.49 48.63 40.00 38.13 35.28 33.58 32.70 28.84 26.72 26.44 25.44filtering the -> 40.0 17.9 10.7 10.0 10.0 23.3 33.3 6.9 33.3 23.3 33.3 一个 分数 55.02 49.78 41.09 40.87 37.34 37.15 45.11 30.78 38.32 29.64 27.62 M-Hop fixed-denominator Scorable-only notinvalid 输出是 摘要 官方 分数 分数 54.49 48.63 40.00 38.13 35.28 33.58 32.70 28.84 26.72 26.44 25.44过滤

I will output the translation. </think>

the 计数 82.5 82.5 52.5 30.0 55.0 25.0 22.5 20.0 7.5 10.0 10.0 分数. 仅可评分 指标可消费 0.0 a 预测. 54.1 21.0 30.7 36.1 14.2 16.5 100.0 18.5 61.3 28.6报告 分数; 推理 产出 排名变化 1→1 2→2 3→4 4→5 5→7 6→8 7→3 8→9 9→6 排行榜 10→10 11→11 不可评分 做 那个 替代解析。 40.0 17.9 10.7 10.0 10.0 23.3 33.3 6.9 33.3 23.3 33.3 一个 分数 55.02 49.78 41.09 40.87 37.34 37.15 45.11 30.78 38.32 29.64 27.62 M-Hop fixed-denominator Scorable-only notinvalid 输出是 摘要 官方 分数 分数 54.49 48.63 40.00 38.13 35.28 33.58 32.70 28.84 26.72 26.44 25.44过滤

所有输出 不正确。 是 79.4 65.7 34.3 52.9 57.1 11.8 91.2 23.5 5.9 19.4 4.8之后 地面 或 (%) 98.7 97.4 97.0 94.9 96.6 94.7 78.5 94.9 80.2 92.8 87.9 理解 正确 仅可评分 评分器结果 所有输出 成为 任务, 指标。 可能 9B 4B 和 9B 4B 2 迷你 任务 2 迷你 2 2 4.5 预测 [klein] [klein] 模型视觉回答 4.5 [klein] [klein] 图像 香蕉 通过 原生 图像 香蕉 图像 图像16 可评分 的 模型 GPT Nano GPT-5 Seedream JoyAI-Image FLUX.2 SenseNova-Vision-7B-MoT FLUX.2 OmniGen-v1 Qwen-Image-Edit-2511 BAGEL-7B-MoT 模型 GPT Nano GPT-5 Seedream JoyAI-Image FLUX.2 SenseNova-Vision-7B-MoT FLUX.2 OmniGen-v1 Qwen-Image-Edit-2511 BAGEL-7B-MoT 一个不同 宏平均值。表格由

29

第 30 页

D 定性接口互补性

图 8、图 9 和图 10 补充了表 3 中的成对结果计数。每一组都将来自指定文本输出基线的错误响应与通过未更改任务度量的可视化响应配对。图注记录了完整的问题、答案空间、文本响应和基准答案。源输入和生成的响应均未经裁剪或纵横比归一化处理。

源输入 GPT Image 2 响应

图 8 深度。问题:哪个点离相机更近?选项:(A) A 更近;(B) B 更近。GPT-5.4:A。 真实标签:B。生成的深度场在基准坐标处支持 B;GPT Image 2 和所有 11 个视觉系统均通过此项。

源输入 GPT-5 Image Mini 响应

图 9 关系。问题:以下陈述是真还是假:汽车在猫的前面。选项:真;假。GPT-5.4:假。真实标签:真。GPT-5 Image Mini 将猫和前景车辆标记为不同的、可被解析器读取的区域;11 个视觉系统中有 8 个通过。

源输入 JoyAI-Image 响应

图 10 轨迹。问题:你是一台使用末端执行器控制的 Franka 机器人。任务是抓取蓝色塑料瓶。答案空间:归一化图像坐标中的五点轨迹折线(无离散选项)。GPT-5.4: (0.266, 0.465) →(0.330, 0.495) →(0.395, 0.525) →(0.455, 0.550) →(0.510, 0.575)。真实标签:(0.266, 0.465) → (0.278, 0.465) →(0.250, 0.422) →(0.209, 0.348) →(0.200, 0.320)。JoyAI-Image 的路径通过了 DFD 标准;11 个视觉系统中有 7 个通过。

其他任务示例。图 11、图 12、图 13 和图 14 涵盖了发布的尺寸、空间定位、几何可行性和方向任务;最后一个案例说明了方向网格协议。

30

第 31 页

源输入 GPT Image 2 响应

图 11 大小。问题:从右数第二只长颈鹿是最矮的吗?选项:(A) 否;(B) 是。GPT-5.4:A(否)。 真实标签:B(是)。GPT Image 2 圈出了被查询的长颈鹿并给出了肯定的视觉标记;11 个视觉系统中有 9 个通过。

源输入 GPT-5.4 文本点(叠加) GPT Image 2 响应

图 12 空间定位。问题:定位描述为“在其他车辆前面的公交车”的对象。返回目标对象内的一个归一化点。答案空间:一个归一化点(无离散选项)。真实标签目标是前景公交车的 RefCOCOg 分割掩码。GPT-5.4 预测坐标为 (0.677, 0.634),在源图像的副本上以洋红色显示;该点落在目标掩码之外。解析器从 GPT Image 2 的响应中读取坐标 (0.603, 0.768),将青色标记放置在掩码内部;11 个视觉系统中有 10 个通过。

源输入 GPT-5 Image Mini 响应

图 13 几何可行性。问题:滑雪缆车上是否有足够空间再坐一个人?选项:(A) 否;(B) 是。RoboBrain2.5-8B-NV:A(否)。真实标签:B(是)。GPT-5 Image Mini 在同一个长椅上放置了第二名乘客,并显示出可见的剩余间隙;11 个视觉系统中有 8 个通过。

源输入 Nano Banana 2 响应

图 14 方向。问题:从相机视角看,猫面向哪个方向?选项:(A) 前;(B) 前右;(C) 右;(D) 后右;(E) 后;(F) 后左;(G) 左;(H) 前左。GPT-5.4:C(右)。 真实标签:B(前右)。Nano Banana 2 填充了右下角的网格单元,确定性解析器将其映射为前右;11 个视觉系统中有 7 个通过。

E 实验设置与评分

本节规定了在基准划分和视觉协议固定后使用的评估接口。 它涵盖文本输出提示、模型运行时设置以及分数聚合。协议约束和

31

第 32 页

发布的生成提示位置记录在附录 C 中。

E.1 人工评估

人工评估涵盖整个基准测试,并使用与模型输出相同的任务特定指标进行评分。能力(Capability)和总体(Overall)值使用公式 5 中的相同宏聚合方法。该评估提供了结果表中的“Human”行数据,并独立于附录 B.3 中的源数据质量审计。

E.2 文本输出 VLM 提示格式

文本输出 VLM 被提示以原始基准测试的答案空间进行回答,不包含思维链或解释性文字。响应约束与目标答案类型相匹配:计数任务为单个整数,相对深度和物体大小任务为 A/B,方向和透视任务为归一化方向标签,关系和可行性决策任务为真/假,多项选择任务为选项标签,空间定位任务为归一化点,掩码或轨迹目标则采用对应原始评估器所需的结构化文本形式。这确保了文本基线与视觉协议针对相同的目标格式进行评分。

E.3 模型与评分设置

本地实验使用一块 NVIDIA RTX PRO 6000 GPU;API 系统使用列出的提供商兼容端点。本地 VLM 解码是确定性的,批量大小为 1。每个视觉系统为每个样本生成一个受协议约束的图像,不进行正确性重试或手动选择;缓存的输出被重用于重新评分。编辑请求保留源图像的宽高比,在支持的情况下目标分辨率约为 1K,并在解析前调整大小以匹配源分辨率。缺失或无效的输出获得声明的无效输出分数。表 17 记录了被评估的模型系列和运行时设置。

表 17 SpatialGen-Bench 评估的完整模型列表及运行时设置。

| 模型 | 运行时设置 | | :— | :— | | 文本输出 VLM | 在原始基准测试答案空间中直接回答。 | | Qwen3-VL-8B (Bai et al., 2025a) | 本地推理;确定性解码;批量大小 1;最多 512 个新 token。 | | InternVL3.5-8B (Wang et al., 2025) | 本地 BF16 推理;动态图像分块;确定性解码。 | | LLaVA-OV-1.5-8B (An et al., 2025) | 本地 BF16 推理;确定性解码。 | | GLM-4.6V-Flash (Team et al., 2025) | 本地 BF16 推理;确定性解码。 | | GPT-5.4 | OpenAI 兼容聊天 API;请求模型 gpt-5.4;直接结构化答案;在支持的情况下使用确定性请求设置。 | | Cosmos3-Nano; RynnBrain-8B; RoboBrain2.5-8B-NV (NVIDIA, 2026; Dang et al., 2026; Tan et al., 2026) | 本地多模态推理;模型原生预处理;确定性解码;批量大小 1。 | | SpaceR; Cambrian-S-7B; GEM-2B; SpatialThinker-3B (Ouyang et al., 2025; Yang et al., 2025b; Zhao et al., 2026; Batra et al., 2025); SpaceOm | 本地空间专用 VLM 推理;发布的检查点和处理器;确定性解码。 | | VLM-3R-7B; SpatialRGPT-8B; Spatial-MLLM; SpatialBot-3B (Fan et al., 2025; Cheng et al., 2024; Wu et al., 2025b; Cai et al., 2025) | 本地空间专用 VLM 推理;发布的检查点和任务兼容的提示格式。 | | SenseNova-Vision-7B-MoT; Janus-Pro-7B; Janus-1.3B (Han et al., 2026; Chen et al., 2025; Wu et al., 2024) | 本地统一模型文本接口;确定性解码;批量大小 1。 | | 输出处理 | 原始响应被规范化为原始答案格式;无效格式被评分为错误。 | | 图像输出生成模型 | 受协议约束的视觉响应被解析回结构化预测。 | | JoyAI-Image (Joy Future Academy, JD, 2026) | 本地图像编辑;种子 42;50 次推理步骤;引导系数 5.0;基础尺寸 1024。 | | FLUX.2 [klein] 4B | 本地图像编辑;种子 42;4 次推理步骤;引导系数 1.0;最大边长 1024。 | | FLUX.2 [klein] 9B | 使用 9B 检查点的本地图像编辑;每个样本生成一个受协议约束的图像。 |

32

第 33 页

表 17 续。

模型 运行时设置

SenseNova-Vision-7B-MoT; 本地统一模型视觉接口;每个样本一个受协议约束的图像。 BAGEL-7B-MoT (Han et al., 2026; Deng et al., 2025) Qwen-Image-Edit-2511 (Wu et al., 本地 BF16 图像编辑;模型卸载;种子 0;40 步;真实 CFG 4.0;最大边 2025a) 1024。 OmniGen-v1 (Xiao et al., 2024) 本地 BF16 图像编辑;种子 42;50 步;引导 2.5;图像引导 1.6; 最大边 1024。 Seedream 4.5 与提供商兼容的图像 API;请求路由 bytedance-seed/seedream-4.5; 每个样本一个受协议约束的图像。 GPT-5 Image Mini OpenRouter 图像路由 openai/gpt-5-image-mini;由提供商组成的请求 别名;每个样本一个受协议约束的图像。 Nano Banana 2 与提供商兼容的图像路由 google/gemini-3.1-flash-image-preview (过期别名 google/gemini-3.1-flash-image-preview-20260226);每个样本一个图像。 GPT Image 2 OpenAI 兼容的图像编辑 API;请求模型 gpt-image-2;返回别名 gpt-image-2-codex;源图像加上协议提示;每个样本一个图像。 输出处理:每个样本一个输出图像;如有需要,输出将调整大小以匹配源分辨率,并使用分配的协议自动解析。 缺失、无法读取或无法解析的输出标记为无效。

E.4 分数聚合

所有解析后的预测首先转换为每个样本的分数 $s_i \in [0, 1]$。计数、相对深度选择、方向、物体大小、关系、透视、心智建模、多跳推理、几何可行性和导航在答案归一化后使用精确匹配准确率。其余任务使用以下特定于任务的分数;所有报告的数字均为百分比。

对于空间定位,解析器从青色标记恢复一个归一化点 $\hat{p}$,源注释提供二值目标掩码 $M$。每个样本的分数保留源点是否在掩码内的契约: $$ s_{\text{ground}}(\hat{p}, M) = 1[M(\hat{p}) > 0]. \tag{1} $$

对于功能定位,$M$ 表示注释的目标区域。预测 $\hat{M}$ 是图像输出模型的解析二值掩码,或者是文本输出 VLM 的预测点集(光栅化为图像坐标)。每个样本的分数为精确率:

$$ s_{\text{aff}}(M, \hat{M}) = \frac{|\hat{M} \cap M|}{|\hat{M}| + \epsilon}, \tag{2} $$

其中 $\epsilon$ 防止空预测时的除以零错误。该分数衡量预测的可操作支撑有多少位于注释区域内;报告的基准分数使用样本间的平均精确率。

对于球状态预测,$\hat{y}$ 和 $y$ 分别是预测和真实洞索引,$H$ 是候选洞的数量。公式 3 仅对相邻洞的预测给予部分分数:

$$ s_{\text{pred}}(\hat{y}, y, H) = \begin{cases} 1, & |\hat{y} – y| = 0, \\ 0.8 – \frac{1}{H}, & |\hat{y} – y| = 1, \\ 0, & |\hat{y} – y| \ge 2, \end{cases} \tag{3} $$

精确预测获得满分,相邻洞错误获得由 $H$ 调整的较小分数,较大错误获得零分。

对于轨迹规划,令 $\hat{P} = (\hat{p}_1, \dots, \hat{p}_n)$ 和 $P = (p_1, \dots, p_m)$ 为归一化到图像坐标后的解析和真实点序列。我们计算离散弗雷歇距离(Discrete Fréchet Distance)并按公式 4 进行阈值处理: $$ d_{\text{DFD}}(\hat{P}, P) = \min_{C} \max_{(\hat{p}, p) \in C} \|\hat{p} – p\|_2, \quad s_{\text{traj}} = 1[d_{\text{DFD}}(\hat{P}, P) < 0.4], \tag{4} $$

33

第 34 页

其中 $C$ 遍历两个点序列之间的单调耦合。因此,轨迹得分是一个用于几何路径一致性的二元成功指示器。

公式 5 定义了聚合规则。对于任务 $t$,$N_t$ 是样本数量;对于能力 $c$,$T_c$ 是其子任务集合: $$ S_t = \frac{1}{N_t} \sum_{i=1}^{N_t} s_i, \quad S_c = \frac{1}{|T_c|} \sum_{t \in T_c} S_t, \quad S_{\text{overall}} = \frac{1}{14} \sum_{t=1}^{14} S_t. \quad (5) $$ 任务得分在样本上取平均,能力得分在每个能力的子任务上进行宏平均(macro-averaged),总体得分在所有 14 个子任务上进行宏平均。这防止了较大的源任务主导最终的基准得分。

E.5 统计不确定性

我们在完整的基准划分上估计样本选择不确定性。在 10,000 次重复中,每次在每个任务内对示例进行有放回重采样,重新计算任务均值,然后应用与排行榜相同的任务宏聚合方法。区间为固定缓存输出的 95% 百分位置信区间;它们不捕捉生成随机性或提供方的模型更新。

34

第 35 页

97.5th percentile estimates are presented as [2.5th, 97.5th] confidence intervals for all model-interface systems.

Entries are organized by capability: Overall, Perception, Understanding, Reasoning, and Interaction.

| Model | Overall | Perception | Understanding | Reasoning | Interaction | | :— | :— | :— | :— | :— | :— | | Mini | | | | | | | 2B | 61.04 [57.12, 64.94] | 74.61 [67.26, 81.58] | 44.29 [35.71, 52.86] | 56.64 [47.42, 65.42] | 69.70 [62.13, 76.71] | | 9B | 60.17 [56.45, 63.86] | 76.82 [70.15, 82.98] | 45.00 [37.86, 52.14] | 55.20 [46.22, 64.24] | 63.15 [56.09, 70.31] | | 4B | 51.15 [47.27, 54.93] | 67.05 [60.00, 73.81] | 45.71 [38.57, 52.86] | 44.21 [34.62, 53.60] | 44.13 [36.19, 52.54] | | 4.5B | 47.43 [43.87, 51.10] | 58.39 [51.93, 64.61] | 34.29 [27.86, 40.71] | 47.76 [38.61, 56.79] | 50.03 [42.01, 58.10] | | Bootstrap | 46.78 [42.63, 51.01] | 54.40 [46.93, 62.05] | 43.57 [36.43, 51.43] | 40.85 [31.42, 50.21] | 46.83 [37.62, 56.03] | | [klein] | 46.25 [42.55, 50.05] | 51.70 [45.45, 57.92] | 36.43 [29.29, 43.57] | 62.45 [53.76, 71.14] | 35.87 [27.30, 44.76] | | [klein] | 45.84 [41.81, 49.84] | 61.04 [53.51, 68.51] | 31.43 [24.29, 38.57] | 53.24 [43.71, 62.50] | 37.38 [29.13, 45.63] | | GPT-5.4 | 44.76 [40.68, 48.83] | 59.23 [51.64, 66.82] | 40.00 [32.86, 47.14] | 43.78 [34.79, 53.18] | 32.78 [24.21, 41.11] | | Cosmos3-Nano | 44.64 [40.68, 48.67] | 54.23 [47.50, 60.86] | 37.86 [30.00, 45.71] | 39.97 [30.91, 49.42] | 45.56 [37.30, 53.65] | | RynnBrain-8B | 44.62 [40.63, 48.73] | 57.65 [50.33, 64.91] | 41.43 [34.29, 49.29] | 39.75 [30.44, 49.16] | 36.37 [27.98, 44.92] | | RoboBrain2.5-8B-NV | 44.50 [40.51, 48.47] | 59.79 [52.17, 67.35] | 37.14 [30.00, 44.29] | 47.00 [37.94, 55.95] | 31.43 [23.33, 39.68] | | SenseNova-Vision-7B-MoT | 43.65 [39.57, 47.80] | 56.70 [48.84, 64.35] | 43.57 [35.71, 51.43] | 39.70 [30.96, 48.74] | 30.32 [22.22, 38.89] | | InternVL3.5-8B | 42.55 [38.67, 46.42] | 68.01 [60.65, 75.18] | 21.43 [15.00, 28.57] | 47.09 [38.41, 55.97] | 32.22 [23.81, 40.95] | | SpaceR | 40.96 [37.33, 44.73] | 56.28 [49.70, 62.92] | 45.71 [37.86, 53.57] | 29.75 [22.70, 36.95] | 25.42 [17.98, 33.42] | | SpaceOm | 36.90 [33.21, 40.60] | 56.19 [49.46, 62.86] | 21.43 [15.00, 28.57] | 37.52 [29.10, 46.25] | 31.21 [22.69, 39.75] | | LLaVA-OV-1.5-8B | 32.82 [29.20, 36.54] | 32.77 [27.53, 38.27] | 30.00 [22.86, 37.86] | 32.97 [24.55, 41.86] | 36.51 [27.94, 44.92] | | SpatialThinker-3B | 31.72 [28.05, 35.48] | 38.90 [32.38, 45.39] | 27.86 [20.71, 35.00] | 29.47 [21.43, 38.00] | 29.52 [22.06, 37.14] | | Qwen3-VL-8B | 31.58 [28.03, 35.21] | 39.20 [32.98, 45.09] | 26.43 [19.29, 33.57] | 35.75 [27.36, 44.09] | 24.13 [16.67, 31.75] | | GEM-2B | 28.59 [25.08, 32.14] | 39.43 [32.26, 46.61] | 28.57 [22.14, 35.00] | 31.62 [23.66, 39.66] | 11.11 [5.56, 17.78] | | Cambrian-S-7B | 27.99 [24.41, 31.61] | 33.12 [26.85, 39.55] | 32.86 [25.00, 40.71] | 31.85 [23.28, 40.53] | 10.79 [5.40, 16.98] | | GLM-4.6V-Flash | | | | | | | VLM-3R-7B | | | | | | | Spatial-MLLM | | | | | | | SpatialRGPT-8B | | | | | | | Janus-Pro-7B | | | | | | | Janus-1.3B | | | | | | | SpatialBot-3B | | | | | | | Visual GPT Nano | | | | | | | GPT-5 | | | | | | | Seedream | | | | | | | JoyAI-Image | | | | | | | FLUX.2 | | | | | | | SenseNova-Vision-7B-MoT | | | | | | | FLUX.2 | | | | | | | OmniGen-v1 | | | | | | | Qwen-Image-Edit-2511 | | | | | | | BAGEL-7B-MoT | | | | | |

| Model | Overall | Perception | Understanding | Reasoning | Interaction | | :— | :— | :— | :— | :— | :— | | Image | | | | | | | Banana18 | 54.49 [50.38, 58.62] | 69.58 [62.11, 76.76] | 47.14 [39.29, 55.00] | 41.83 [32.62, 51.25] | 56.80 [48.08, 65.80] | | Answering | 48.63 [44.56, 52.59] | 72.92 [65.74, 79.64] | 42.14 [34.29, 50.00] | 24.92 [16.95, 33.40] | 48.61 [39.52, 58.01] | | Model | 40.00 [36.02, 43.95] | 64.40 [56.73, 71.90] | 33.57 [25.71, 41.43] | 26.89 [18.85, 35.09] | 29.13 [21.04, 37.52] | | Text | 38.13 [34.27, 42.00] | 51.43 [44.29, 58.69] | 35.71 [27.86, 43.57] | 28.69 [20.86, 36.78] | 33.04 [24.79, 41.41] | | GPT-5.4 | 35.28 [31.40, 39.19] | 41.90 [34.37, 49.35] | 35.00 [27.86, 42.86] | 19.50 [12.07, 27.41] | 42.61 [33.71, 51.58] | | Cosmos3-Nano | 33.58 [29.74, 37.39] | 47.68 [40.54, 54.64] | 26.43 [20.00, 33.57] | 22.80 [14.70, 31.00] | 35.09 [26.37, 44.31] | | RynnBrain-8B | 32.70 [29.29, 36.13] | 32.44 [26.52, 38.33] | 45.71 [39.29, 52.86] | 12.44 [6.67, 18.89] | 35.93 [27.54, 44.59] | | RoboBrain2.5-8B-NV | 28.84 [25.15, 32.69] | 41.93 [34.61, 49.52] | 27.14 [20.71, 34.29] | 14.11 [7.32, 21.33] | 28.37 [20.29, 36.91] | | SenseNova-Vision-7B-MoT | 26.72 [23.42, 30.18] | 29.85 [25.56, 34.43] | 25.00 [18.57, 31.43] | 26.36 [17.86, 35.37] | 25.21 [17.52, 33.22] | | InternVL3.5-8B | 26.44 [22.70, 30.22] | 30.65 [23.84, 37.77] | 24.29 [17.86, 31.43] | 29.69 [21.03, 38.66] | 20.47 [13.38, 28.25] | | SpaceR | 25.44 [21.85, 29.20] | 27.38 [20.57, 34.55] | 23.57 [17.14, 30.00] | 24.44 [16.98, 32.54] | 26.32 [18.02, 34.59] | | SpaceOm | | | | | | | LLaVA-OV-1.5-8B | | | | | | | SpatialThinker-3B | | | | | | | Qwen3-VL-8B | | | | | | | GEM-2B | | | | | | | Cambrian-S-7B | | | | | | | GLM-4.6V-Flash | | | | | | | VLM-3R-7B | | | | | | | Spatial-MLLM | | | | | | | SpatialRGPT-8B | | | | | | | Janus-Pro-7B | | | | | | | Janus-1.3B | | | | | | | SpatialBot-3B | | | | | | | Visual GPT Nano | | | | | | | GPT-5 | | | | | | | Seedream | | | | | | | JoyAI-Image | | | | | | | FLUX.2 | | | | | | | SenseNova-Vision-7B-MoT | | | | | | | FLUX.2 | | | | | | | OmniGen-v1 | | | | | | | Qwen-Image-Edit-2511 | | | | | | | BAGEL-7B-MoT | | | | | |

35

第 36 页

几何 轨迹 90.00 83.33 90.00 20.00 56.67 50.00 40.00 66.67 53.33 80.00 60.00 36.67 46.67 46.67 23.33 46.67 60.00 63.33 50.00 16.67 16.67 70.00 63.33 36.67 53.33 60.00 40.00 36.67 36.67 30.00 23.33 40.00 2. 可行性: 表格 导航 83.33 83.33 23.33 26.67 13.33 26.67 26.67 26.67 40.00 30.00 43.33 16.67 16.67 30.00 16.67 33.33 33.33 16.67 16.67 16.67 6.67 40.00 40.00 36.67 36.67 33.33 36.67 20.00 36.67 40.00 33.33 33.33 在 交互 预测; 情感 89.48 42.43 76.13 85.71 80.08 63.81 40.95 18.81 5.00 26.67 5.77 40.95 27.62 20.00 36.27 13.64 16.19 8.57 5.71 0.00 9.05 60.40 42.50 14.05 9.12 34.51 28.61 51.13 11.79 5.63 4.74 5.63 出现 预测: 可行性 91.43 71.43 57.14 54.29 62.86 42.86 54.29 60.00 65.71 54.29 54.29 68.57 62.86 65.71 65.71 65.71 51.43 54.29 65.71 60.00 51.43 31.43 37.14 40.00 40.00 34.29 28.57 0.00 17.14 28.57 37.14 40.00 聚合 多跳; 预测 79.00 48.50 61.80 35.00 47.10 49.70 76.40 56.40 32.30 32.30 28.30 39.10 22.90 58.90 20.20 13.50 10.80 10.80 28.20 28.20 10.80 54.07 20.95 30.66 36.08 14.20 16.50 4.00 18.53 17.16 28.59 0.00 整体 推理 多跳: 和 多跳 63.33 50.00 46.67 43.33 33.33 30.00 56.67 43.33 33.33 33.33 36.67 33.33 33.33 16.67 3.33 33.33 36.67 23.33 13.33 6.67 33.33 40.00 16.67 10.00 10.00 10.00 23.33 33.33 6.67 33.33 23.33 33.33 轨迹. 接地; 能力 88.57 57.14 85.71 82.86 80.00 74.29 77.14 25.71 77.14 45.71 65.71 77.14 54.29 5.71 68.57 11.43 34.29 17.14 8.57 0.00 22.86 77.14 65.71 34.29 51.43 57.14 11.43 88.57 22.86 2.86 17.14 2.86 接地 所有 轨迹: 空间 心理 74.29 45.71 34.29 40.00 11.43 22.86 28.57 22.86 25.71 31.43 42.86 22.86 42.86 28.57 40.00 25.71 34.29 31.43 42.86 37.14 40.00 25.71 31.43 28.57 25.71 25.71 45.71 37.14 31.43 42.86 34.29 37.14 能力; 导航; 接地: 通过 理解 个人 91.43 31.43 37.14 22.86 20.00 34.29 20.00 20.00 25.71 31.43 20.00 25.71 22.86 22.86 25.71 25.71 25.71 37.14 17.14 22.86 31.43 40.00 25.71 28.57 20.00 17.14 8.57 8.57 14.29 5.71 14.29 14.29 导航: 分组 相对 88.57 42.86 22.86 37.14 25.71 42.86 20.00 57.14 31.43 42.86 37.14 22.86 54.29 28.57 48.57 22.86 25.71 25.71 37.14 54.29 37.14 45.71 45.71 42.86 45.71 40.00 40.00 48.57 40.00 48.57 31.43 40.00 视角; 是 功能; 个人: 情感: 任务 大小 97.14 74.29 91.43 85.71 88.57 74.29 94.29 80.00 88.57 88.57 91.43 80.00 74.29 82.86 94.29 91.43 88.57 71.43 74.29 48.57 60.00 80.00 60.00 54.29 45.71 54.29 65.71 11.43 68.57 8.57 54.29 42.86 (%). 原始 92.50 67.50 77.50 32.50 10.00 42.50 10.00 67.50 52.50 7.50 55.00 37.50 47.50 60.00 32.50 12.50 5.00 5.00 5.00 0.00 5.00 52.50 62.50 77.50 40.00 5.00 20.00 12.50 32.50 10.00 15.00 20.00 关系; 可行性; 结果 感知 依赖 100.00 76.67 83.33 80.00 80.00 33.33 70.00 36.67 43.33 63.33 36.67 66.67 40.00 46.67 73.33 53.33 10.00 16.67 10.00 56.67 10.00 63.33 86.67 73.33 90.00 53.33 80.00 83.33 46.67 93.33 43.33 36.67 关系:

结果 计数 7.50 10.00 10.00 100.00 80.00 55.00 70.00 55.00 67.50 32.50 60.00 52.50 57.50 47.50 55.00 65.00 82.50 25.00 67.50 27.50 62.50 67.50 52.50 57.50 82.50 82.50 52.50 30.00 55.00 25.00 22.50 20.00 方向; SpatialGen-Bench 方向: 9B 4B 深度; 迷你任务级 2 任务级 2 4.5 [klein] [klein] 依赖: 回答 图像 回答 图像 香蕉 文本 视觉 完整 模型 人类 GPT-5.4 Cosmos3-Nano RynnBrain-8B RoboBrain2.5-8B-NV SenseNova-Vision-7B-MoT InternVL3.5-8B SpaceR SpaceOm LLaVA-OV-1.5-8B SpatialThinker-3B Qwen3-VL-8B GEM-2B Cambrian-S-7B GLM-4.6V-Flash VLM-3R-7B Spatial-MLLM SpatialRGPT-8B Janus-Pro-7B Janus-1.3B SpatialBot-3B GPT Nano GPT-5 Seedream JoyAI-Image FLUX.2 SenseNova-Vision-7B-MoT FLUX.2 OmniGen-v1 Qwen-Image-Edit-2511 BAGEL-7B-MoT完整 计数; 19 计数: E.6 表

36

发表评论