快速导读:提出ComplexityWorld基准,通过390个任务评估VLM从多样化视觉场景中恢复约束并构建全局有效结构化决策的能力,揭示出显著的视觉到决策瓶颈。
现有的视觉语言模型(VLM)基准测试大多止于短答案或局部判断,无法评估模型从图像中恢复完整决策问题并构建满足全局约束的结构化解方案的能力。ComplexityWorld正是为填补这一空白而设计的基准,它包含39个视觉世界、29个决策类别、共390个任务,要求模型仅凭图像和指令输出一个完整的结构化决策,并由可执行验证器检查所有约束是否满足。
该基准的核心发现是:即使是最强的模型GPT-5.6-Sol,其验证器接受率(VAR)也仅为75.6%,而其他模型均低于40%。更重要的是,通过无答案显式结构记录和等价视觉呈现的对照实验,论文证明视觉信息的组织方式本身构成了一个显著的瓶颈——当视觉图像被替换为规范的JSON结构记录时,模型性能大幅跃升;同一问题以不同视觉形式呈现时,模型表现差异可达数十个百分点。
英文题目:ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making
论文出处:arXiv 每日论文精选 · arXiv:2608.07584
原始论文:PDF / 论文页面
这篇论文解决什么问题?
VLM在视觉感知任务上取得了长足进步,但许多现实应用要求模型利用视觉证据做出各部分需联合满足全局约束的完整决策。例如,根据一张地图规划配送路线,不仅需要识别道路和地点,还需要确保路线覆盖所有目标、满足时间窗口和容量限制。现有的基准测试如MMMU、MMMU-Pro以选择题等形式评估模型,无法捕捉这种全局约束下的结构化推理能力。
NPHardEval4V引入了可编程生成和验证的思路,但侧重于动态推理基准。VGRP-Bench、PuzzleBench、iVISPAR、MPCC等基准聚焦于生成式视觉推理、规划或谜题,但通常只覆盖少数视觉语言或交互轨迹。ComplexityWorld在此基础上进行了关键扩展:覆盖39个异构视觉世界,保持统一的评估目标,并引入了无答案显式结构记录和等价视觉呈现的对照实验,以分离视觉信息组织的影响。
论文提出的核心问题是:VLM能否从多样化的视觉场景中恢复约束,并构建满足全局约束的结构化决策?更重要的是,视觉信息的呈现方式在多大程度上影响了这一能力?
ComplexityWorld的设计哲学是“生成-渲染-验证”:首先生成器创建已知约束的可解问题,然后领域适配器将其渲染为不同的视觉场景,模型仅看到图像和指令并返回结构化决策,最后由可执行验证器检查所有约束。这一流水线确保了评估的精确性和可复现性。
核心创新
- 构建包含39个视觉世界、29个决策类别、390个任务的ComplexityWorld基准,要求模型输出完整结构化决策并由可执行验证器评分。
- 设计生成-渲染-验证流水线,支持多样化视觉形式、多个可行输出和精确的基于约束的评估。
- 通过无答案显式结构记录和等价视觉呈现的对照实验,分离并量化视觉信息组织造成的瓶颈。
方法概览
采用生成-渲染-验证流水线:生成器创建已知约束的可解问题,领域适配器将其渲染为不同视觉场景,模型仅见图像和指令并返回结构化决策,最后由可执行验证器检查所有约束。
- 生成器创建具有已知约束的可解问题实例,确保每个任务都有明确的全局约束和至少一个可行解。
- 领域适配器将抽象问题规范渲染为多样化的视觉场景,包括地图、图表、表格、示意图等39种视觉世界,保持底层约束不变。
- 模型接收图像和自然语言指令,输出完整的结构化决策(如JSON格式的分配方案、路径规划等),而非简单的短答案。
- 可执行验证器检查输出决策是否满足所有约束,计算验证器接受率(VAR)作为主要评估指标,确保评分的客观性和可复现性。
- 约束签名家族是对任务的描述性分组,根据主导约束形式和验证器检查的输出结构进行分类,共8个家族,帮助分析模型在不同约束类型上的表现差异。
- 无答案显式结构记录是一种用规范JSON描述实体、关系和约束但不含任何解信息的表示形式,用于与视觉图像进行对照实验,分离视觉信息组织的影响。
- 等价视觉呈现研究对6个任务模板,每个问题以三种不同的视觉形式呈现,保持底层规范、决策类型和验证器不变,以量化视觉组织对模型性能的影响。
- 智能体脚手架实验评估了Codex和MiMo Code两种多轮交互框架对模型性能的提升效果,允许模型使用工具和中间文件进行推理。
逐图理解论文
失败案例与直觉

图3展示了一个地图着色问题以三种等价视觉形式呈现的示例。尽管底层规范、决策类型和验证器完全相同,模型在不同呈现间的表现差异显著,揭示了视觉组织对推理的深刻影响。
研究空白与核心贡献

表2对比了视觉图像与无答案显式结构记录下的模型表现。Qwen3.7-Plus提升40.6个百分点,GPT-5.6-Sol提升21.4个百分点,直接量化了视觉信息组织造成的瓶颈。
关键证据

表1报告了直接VLM推理在冻结主面板上的验证器接受率(VAR)。GPT-5.6-Sol达到75.6%,而其他模型均低于40%,51.2个百分点的差距表明基准能有效区分模型能力。
结论与意义

图2展示了模型在8个约束签名家族上的性能剖面。各家族间差异显著,某些家族对视觉呈现的敏感性远高于其他,帮助识别模型的相对优势和弱点。
实验如何设计?
- 在冻结主面板上对GPT-5.6-Sol、Qwen3.7-Plus、Gemini-3.5-Flash和MiMo-v2.5进行直接推理评估,覆盖全部390个任务。
- 使用234个实例的诊断子集,对比视觉图像与无答案显式结构记录下的模型表现,以量化视觉信息组织造成的瓶颈。
- 对6个任务模板进行等价问题视觉呈现研究,每个问题以三种不同视觉形式呈现,评估模型在不同呈现间的一致性。
- 评估Codex和MiMo Code两种智能体脚手架对GPT-5.6-Sol和MiMo-v2.5的性能提升,分析多轮交互和工具使用的影响。
- 所有评估均使用可执行验证器检查约束满足情况,以VAR作为主要指标,确保评估的精确性和可复现性。
- 约束签名家族分析提供了模型在不同约束类型上的性能剖面,帮助识别模型的相对优势和弱点。
关键结果与论文证据
- GPT-5.6-Sol直接推理VAR达75.6%,其他模型均低于40%(Qwen3.7-Plus 39.5%, Gemini-3.5-Flash 32.3%, MiMo-v2.5 24.4%),51.2个百分点的差距表明基准能有效区分模型能力(第5页,表1)。
- 在显式结构记录条件下,Qwen3.7-Plus VAR提升40.6个百分点,GPT-5.6-Sol提升21.4个百分点,证明视觉信息组织是显著的瓶颈(第6页,表2)。
- 等价视觉呈现研究中,直接模型在不同呈现间VAR差距高达38.3个百分点,所有三种呈现均解决的比例远低于单一最佳呈现,表明模型对视觉组织高度敏感(第7页,表3)。
- Codex智能体使GPT-5.6-Sol VAR提升7.4个百分点至83.1%,MiMo Code使MiMo-v2.5提升3.8个百分点至28.2%,智能体脚手架带来适度但一致的提升(第8页,表4)。
- 约束签名家族分析显示,模型在不同约束类型上的表现差异显著,某些家族对视觉呈现的敏感性远高于其他家族(第6页,图2)。
- 视觉呈现C(如邻接板形式)显著优于呈现A和B,表明信息的空间组织和视觉编码方式对模型推理有实质性影响(第7页,表3)。
- 即使是最强的GPT-5.6-Sol,在等价视觉呈现研究中仍有大量问题无法在所有三种呈现下均解决,表明视觉鲁棒性仍是重大挑战(第7页)。
- 智能体对比同时改变了工具、交互、上下文和计算量,表征的是完整推理配置的效果,而非单个脚手架组件的因果效应(第8页)。
阅读时需要注意
- 使用领域启发的合成场景而非真实部署截图,性能在噪声更大的真实图像上可能不同。
- 主面板每个视觉世界仅含10个任务,实例数量有限,可能影响统计结论的稳健性。
- 所有评估问题均为可解,未测试模型对不可行问题的检测能力。
- 表示研究识别出敏感性但未隔离单个因果因素,视觉呈现研究同时改变了布局、图标、措辞和领域语义。
- 约束签名家族是描述性分组,未经独立验证为模型能力的有效维度。
关联工作
- NPHardEval4V引入可编程生成和验证,但侧重于动态推理基准;ComplexityWorld在此基础上增加了无答案显式结构记录和等价视觉呈现的对照实验。
- VGRP-Bench、PuzzleBench、iVISPAR、MPCC均为生成式视觉推理、规划或谜题基准,但通常聚焦于少数视觉语言或交互轨迹;ComplexityWorld覆盖39个异构视觉世界并保持评估目标一致。
- MMMU、MMMU-Pro是多学科多模态理解基准,但以选择题等形式评估;ComplexityWorld要求输出完整结构化决策并由验证器检查全局约束。