快速导读:提出See2Think框架,通过可控诊断基准和干预协议,系统评估多模态模型在推理过程中对自生成中间视觉状态的依赖性与效用。
当多模态大模型在推理过程中生成草图、标注或分割掩码时,我们通常默认这些中间视觉状态在帮助模型思考。但See2Think这篇工作提出了一个更根本的问题:模型真的在使用这些自生成的视觉信息吗?论文没有止步于最终准确率的比较,而是设计了一套受控诊断框架,将视觉推理拆解为动作选择、视觉执行和反馈使用三个阶段,并分别进行量化评估。
通过在1200个精心过滤的样本上对GPT-5.5、GPT-o3、Gemini 3.5 Flash和Qwen3-VL-32B-Instruct进行系统实验,论文揭示了一个令人警醒的发现:所有模型的渲染保真度得分普遍偏低,而动作相关性却接近饱和。更关键的是,正确的渲染带来的准确率提升微乎其微,但损坏的渲染却能造成显著的性能下降。这表明当前模型的中间视觉推理行为更像一种“仪式性”操作,而非真正的视觉信息依赖。
英文题目:See2Think: Do Multimodal Models Really Use Intermediate Visual States?
论文出处:arXiv 每日论文精选 · arXiv:2607.26769
原始论文:PDF / 论文页面
对应视频标题:多模态模型真的在看自己画的草图吗?See2Think的诊断与发现|推荐指数:★★★★★
这篇论文解决什么问题?
近年来,以视觉思维链为代表的多模态推理方法迅速发展。模型被鼓励在回答问题时生成中间可视化——比如在电路图上标注电流方向、在几何图形上画辅助线、在场景照片中框出目标物体。MIRA、ViC-Bench等基准已经证实,提供标注过的中间可视化可以提升推理性能。但一个关键问题被忽略了:当模型自己决定画什么、怎么画时,它后续的推理真的在“看”这些画出来的东西吗?
现有评估体系存在两个盲区。第一,它们主要衡量最终答案的正确性或视觉轨迹的表面质量,无法区分“模型因为看到了有用的视觉信息而答对”和“模型本来就能答对,只是顺便画了个图”。第二,它们缺乏对中间视觉状态的可控干预——如果不让模型看到自己画的图,或者给它看一张画错的图,它的行为会改变吗?这种反事实推理是判断因果依赖性的关键。
See2Think的核心洞察在于:视觉状态的效用(utility)和模型行为对其的依赖性(behavioral reliance)是两个不同的概念。一个正确的渲染可能对最终答案贡献甚微,但一个错误的渲染却可能导致答案翻转。如果不通过受控干预来分离这两个维度,我们就无法真正理解模型是否在“使用”视觉状态。
论文将这一问题形式化为三个可诊断的维度:动作相关性(Action Relevance)——模型请求的视觉操作是否针对任务相关证据;渲染保真度(Render Faithfulness)——返回的视觉状态是否正确实现了请求的操作;反馈采纳度(Feedback Uptake)——后续推理是否使用了返回视觉状态中实际存在的信息。这三个维度构成了从“想做什么”到“画得怎样”再到“是否真用”的完整诊断链。
核心创新
- 将真正的视觉状态使用形式化为一个受控诊断问题,区分视觉状态的效用与模型行为对其的依赖性。
- 构建了See2ThinkBench基准,通过仅标题可解性过滤减少文本捷径,统一答案格式以支持自由形式与结构化输出的评估。
- 引入VAoT协议,通过匹配的标准和损坏渲染条件,分离并诊断动作相关性、渲染保真度和反馈采纳度。
方法概览
提出See2Think框架,包含两个互补组件:(1) See2ThinkBench,一个经过文本捷径过滤的1200题视觉依赖推理基准,覆盖12个任务类别;(2) Visual Action-of-Thought (VAoT),一种可观察、可干预的推理协议,记录文本思考、视觉动作、渲染状态及后续推理,并通过CoT、VAoT-NoRender、VAoT和VAoT-WrongRender四种受控设置进行诊断。
- See2ThinkBench基准构建:从现有视觉推理数据集中收集候选样本,通过“仅标题可解性过滤”(caption-only solvability filtering)剔除仅靠文字描述就能回答的样本,确保每道题都真正需要视觉信息。最终保留1200个样本,均匀分布在12个任务类别中,涵盖2D结构化推理、3D场景推理和真实世界视觉推理三个层次。所有样本被统一为答案生成格式,并经过自动检查和人工验证。
- VAoT(Visual Action-of-Thought)协议设计:VAoT是一种可观察、可干预的推理协议。模型在推理过程中交替生成文本思考、视觉动作和渲染状态。视觉动作以结构化格式提出(如“在图像上标注所有并联支路”),外部渲染器执行该操作并返回修改后的图像,模型基于返回的视觉状态继续推理。这种设计使得每个视觉步骤的动作、渲染和后续使用都可以被独立记录和评估。
- 四种受控推理设置:论文设计了CoT(纯文本思维链,无视觉动作)、VAoT-NoRender(模型提出视觉动作但不接收渲染结果)、VAoT(标准VAoT,接收正确渲染)和VAoT-WrongRender(接收故意损坏的渲染)四种条件。通过对比VAoT与VAoT-NoRender可以衡量渲染的净收益,通过对比VAoT与VAoT-WrongRender可以衡量模型对反馈质量的敏感性。
- 过程级自动评估:对每条VAoT轨迹,自动选取一个关键视觉步骤,由评估模型在动作相关性、渲染保真度和反馈采纳度三个维度上给出{0, 0.5, 1}的评分。评估使用结构化提示,要求判断请求的动作是否针对任务相关信息、渲染是否正确实现了请求、以及后续推理是否引用了渲染中实际存在的信息。
- 人工验证机制:两名独立标注者对240条轨迹的关键步骤选择、动作相关性、渲染保真度和反馈采纳度进行审查。结果显示所有四个评估目标的“合理或部分合理”率均超过92.9%,验证了自动评估的可靠性。
- 损坏渲染生成:VAoT-WrongRender条件下的损坏渲染通过修改渲染参数或替换渲染目标来生成,确保损坏后的视觉状态在表面上仍与任务相关但包含错误信息。论文还进行了损坏质量审计,验证干预的有效性。
- 多维度结果分析:除了最终准确率,论文还分析了渲染保真度与收益/危害的关系、反馈采纳度与损坏敏感性的关系、以及不同任务类型下各诊断维度的表现差异。这种细粒度分析揭示了视觉状态使用的条件性特征。
- 与现有基准的系统对比:论文将See2Think与MIRA、ViC-Bench、TWI-PRMBench和TwiFF-Bench进行了详细对比(Table 1),突出了其在文本捷径过滤、自生成闭环视觉状态、阶段式诊断和任务相关损坏反馈干预方面的独特性。
逐图理解论文
一个反直觉的发现

图4展示了VAoT协议的工作流程:模型交替生成文本思考和视觉动作,外部渲染器执行动作并返回修改后的图像,模型基于返回的视觉状态继续推理。这种设计使得每个视觉步骤都可以被独立记录和诊断。
研究空白:效用不等于依赖

现有基准主要衡量视觉线索的有用性或最终答案的正确性,却无法回答一个更深层的问题:模型的行为是否真的依赖于这些中间视觉状态?一个正确的渲染可能对答案毫无贡献,但一个错误的渲染却可能导致答案翻转。如果不通过受控干预来分离“效用”和“依赖性”,我们就无法真正理解模型是否在使用视觉信息。
核心发现与结论

图6展示了过程级诊断结果:左图显示三个任务组的动作相关性、渲染保真度和反馈采纳度均值,右图显示正确与错误轨迹在各维度上的得分差距。渲染保真度在3D场景推理中差距最大,表明这是该任务类型的关键瓶颈。
意义与局限

这项工作的启示在于:设计多模态推理系统时,不能只关注模型是否“会画图”,更要诊断它是否“真看图”。一个诚实的局限是,评估仅覆盖了四个代表性模型,且VAoT协议依赖外部渲染器,可能无法完全反映模型原生的视觉推理能力。以上就是这篇论文的核心内容,感谢收听。
实验如何设计?
- 模型选择:在GPT-5.5、GPT-o3、Gemini 3.5 Flash和Qwen3-VL-32B-Instruct四个代表性多模态模型上进行评估,覆盖不同规模和架构的模型家族。
- 评估规模:所有四种推理设置(CoT, VAoT-NoRender, VAoT, VAoT-WrongRender)均在完整的1200个样本上运行,每个任务类别100个样本。
- 过程级诊断范围:对所有4800条VAoT轨迹(4个模型×1200样本)进行动作相关性、渲染保真度和反馈采纳度的自动评估。
- 损坏反馈分析:通过对比VAoT与VAoT-WrongRender在样本级别的准确率变化,量化模型对损坏视觉反馈的敏感性,并按任务组和反馈采纳度分层分析。
- 渲染收益分析:通过对比VAoT-NoRender与VAoT在样本级别的正确/错误转换,计算渲染的收益(从错到对)和危害(从对到错),并按渲染保真度分层。
- 人工验证:两名标注者独立审查240条轨迹,评估关键步骤选择、动作相关性、渲染保真度和反馈采纳度的合理性。
关键结果与论文证据
- 整体准确率无统一最优设置:GPT-5.5和Qwen3-VL-32B-Instruct在CoT下表现最好,GPT-o3在VAoT下最优,Gemini 3.5 Flash在VAoT-NoRender下最优(Table 2, p.7)。中间视觉推理并非通用的准确率提升器。
- 动作相关性接近饱和但渲染保真度普遍偏低:所有模型的平均动作相关性得分在0.958-0.985之间,而渲染保真度得分仅为0.594-0.630(Table 3, p.9)。模型很清楚该画什么,但画出来的东西经常不对。
- 渲染保真度差距在3D场景推理中最大:正确与错误轨迹的渲染保真度差距在3D场景推理中达到0.097,而在真实世界推理中动作相关性差距最大(0.044)(Figure 6, p.9)。不同视觉环境下的瓶颈环节不同。
- 损坏渲染的伤害远大于正确渲染的收益:在完全失真的渲染下,2D和3D推理的净收益为负(-6.1和-9.3个百分点),真实世界推理仅略为正(2.2个百分点)(Figure 7, p.10)。模型对错误视觉信息高度敏感。
- 反馈采纳度放大损坏敏感性:在3D场景推理中,当反馈采纳度从0升至1时,VAoT与VAoT-WrongRender的准确率差距从3.5个百分点扩大至15.5个百分点(Figure 8, p.10)。模型越“认真看”,被错误信息误导的风险越大。
- 高反馈采纳度不直接转化为准确率提升:模型可能使用了返回的视觉信息,但使用方式不正确。视觉状态的效用与行为依赖性不等价。
- 过程级评估的人工验证通过率超过92.9%:所有四个评估目标的“合理或部分合理”率均超过92.9%(Table 4, p.11),验证了自动诊断的可靠性。
- 任务类型决定视觉推理的适用性:在2D结构化推理中,原始图表已暴露大部分结构信息,渲染的边际收益有限;在3D场景推理中,渲染错误造成的危害最为显著。
阅读时需要注意
- 模型覆盖有限:评估仅覆盖四个代表性多模态模型,可能无法代表所有视觉语言系统的多样性,特别是开源社区中规模较小的模型。
- 外部渲染器依赖:VAoT协议依赖外部渲染组件执行视觉动作,渲染质量和能力边界可能影响诊断结果,尽管论文进行了人工验证。
- 损坏渲染的干预质量:VAoT-WrongRender的测量效果依赖于损坏渲染的质量,其准确率下降幅度在不同质量过滤标准下有所变化。
- 单步诊断的简化:过程级评估仅选取一个关键视觉步骤进行评分,可能遗漏多步视觉推理中的复杂交互效应。
关联工作
- MIRA:评估带标注的中间可视化对推理的益处,但未诊断自生成视觉动作的忠实度与使用,且依赖人工标注的视觉提示而非模型自生成的视觉状态。
- ViC-Bench:支持自由形式的视觉-文本交织推理轨迹评估,但缺乏对动作-渲染-使用阶段的联合诊断和可控反馈干预。
- TWI-PRMBench:专注于“以图思考”轨迹的过程奖励建模,但未进行可控的反馈干预来分离视觉状态的效用与依赖性。
- TwiFF-Bench:将视觉推理扩展到动态生成的未来帧,但未分离视觉状态的效用与行为依赖性,也未引入损坏反馈条件。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
See2Think:多模态模型真的使用了中间视觉状态吗?
Siyu Yan1,3,†, Zhuoran Yan2,†, Haiying Xu3,4,†, Panhao Zhou2, Jingyu Chen2, Chenhao Ji3, Shuo Cao3,5, Yongheng Zhang2, Haoze Liu3, Siyu Zhang3,6, Xiwen Gu7, Yihao Liu3, Alex Jinpeng Wang2,§
1香港科技大学 2中南大学 3上海人工智能实验室 4香港科技大学(广州) 5中国科学技术大学 6复旦大学 7武汉大学
摘要
多模态大语言模型在推理过程中越来越多地使用草图、标注、工具和中间图像,但它们是否真正依赖这些视觉状态仍不清楚。现有基准测试样本量有限,且评估侧重于最终答案,未能诊断中间视觉状态如何生成、渲染和使用。我们提出了See2Think,一个统一的评估框架,包含See2ThinkBench和视觉思维动作(Visual Action-of-Thought,VAoT)。See2ThinkBench包含1200个开放式、视觉依赖的问题,涵盖2D结构化、3D场景和现实世界推理等12个任务类别。VAoT在四种受控推理设置下记录文本思考、视觉动作、渲染状态和后续推理。通过评估代表性的闭源和开源多模态模型,我们发现视觉推理强烈依赖于模型和环境,没有单一设置能在所有任务中持续占优。过程分析进一步表明,模型通常能选择相关的视觉操作,但渲染保真度(Render Faithfulness)仍是最明显的瓶颈,且高反馈采纳度(Feedback Uptake)并不一定转化为准确率提升。在任务相关的损坏反馈下,模型表现出对视觉状态的行为依赖,3D场景中的准确率下降超过10个百分点。See2Think将视觉状态的效用与行为依赖分离开来,并提供了一个统一框架,用于评估多模态模型是否真正使用了中间视觉状态。
网站:https://sgysy.github.io/seetothink/ 代码库:https://github.com/CSU-JPG/See2Think
1 引言
思维链(Chain-of-Thought,CoT)推理通过外化中间文本步骤来提升语言模型的推理能力[22]。然而,许多多模态问题并不能仅通过文本自然解决。人类会画辅助线、标记相关区域、比较结构并绘制中间状态,以将空间和感知关系外化。近期的多模态系统同样会在推理过程中生成视觉草稿、调用视觉工具、高亮或裁剪图像区域,并构建中间图像[7, 19–21, 28, 30]。
基于这一思路,近期工作在视觉思维的方法和评估方面都得到了快速扩展。
† 同等贡献。 § 通讯作者。
第 2 页
传统评估方法 See2Think 基准
输入图像 文本思考 视觉渲染器 + 问题 输入图像 规划并推理 + 问题 需要做什么…… 文本思考 "action": [ { "type": 规划并推理 annotate", "target" …… 需要做什么…… 最终答案 ✓ 正确 / × 错误 多轮迭代 最终答案 ✓ 正确 / × 错误 过程级诊断 动作相关性 渲染保真度 反馈采纳度 从视觉轨迹到 后续推理中是否 真正的视觉 使用了该视觉状态? 状态使用 该视觉动作是否 绘制辅助线 A-B 与任务相关? 高亮 根据三角形 返回的渲染状态 高亮问题中 的角 内角和, 是否与动作匹配? 要求的目标角 显示…… 我们得到……
图 1 See2Think 与以往视觉推理基准的对比。以往基准主要评估最终答案或视觉轨迹质量。See2Think 诊断动作相关性、渲染保真度和反馈采纳度。通过受控干预测试模型是否依赖返回的视觉状态。
与图像结合。模型现在可以通过外部工具、交互式图像生成、连续视觉动作和反复视觉访问来裁剪、标注、绘制草图、操作或生成中间视觉状态 [6, 7, 11, 12, 19–21, 25, 29, 30]。MIRA、ViC-Bench、TWI-PRMBench 和 TwiFF-Bench 等基准评估了神谕式视觉线索、自由形式的交错状态、过程质量或动态未来帧推理 [14, 23, 31, 32]。近期的诊断研究进一步质疑工具调用或生成的思维图像是否对答案真正关键 [3, 24]。
然而,仍存在两个局限。在数据层面,现有任务集合的视觉多样性可能有限,且并非总能排除纯文本捷径。在评估层面,标准多模态基准强调最终答案 [17, 26],而多模态思维链评估主要考察文本推理 [8]。视觉思维基准引入了草图、工具或中间图像,但通常通过最终任务表现、神谕式提供的视觉线索或缺乏匹配干预的聚合过程分数来评估。因此,现有评估无法联合判断自生成的视觉动作是否与任务相关、返回的状态是否忠实地实现了该动作,以及后续推理是否在行为上依赖于返回的视觉证据。
我们提出 See2Think,一个用于评估多模态模型是否真正利用中间视觉状态进行思考的统一框架。See2Think 包含两个互补的组件。See2ThinkBench 提供了 1200 个视觉依赖推理问题,涵盖 12 个任务类别和三种视觉环境:2D 结构化推理、3D 场景推理和真实世界视觉推理。通过仅标题可解性过滤减少文本主导的捷径。大多数任务采用自由形式答案生成,而一小部分任务保留了从源基准继承的结构化候选集,当这些候选集构成推理问题的一部分时。视觉思维动作(VAoT)提供了推理时的协议:它记录交替的文本思考、视觉动作、渲染状态和后续推理。受控变体比较了思维链、无渲染的动作规划、标准闭环 VAoT 以及旨在探测行为依赖性的任务相关损坏反馈。这些组件共同支持结果级评估以及对动作选择、视觉执行和下游状态使用的诊断。
我们的贡献如下:
1. 我们将真正的视觉状态使用形式化为一个受控诊断问题,并引入 See2Think,
第 3 页
化学 物理 机器人状态变化 物理合理性
问:描述 Doritos与 高亮过渡态结构 之间的新关系。 问:识别该过渡态结构的SMILES。 问:比较t时刻两辆车的速度和距离。 问:描述水槽的新状态。
几何 空间谜题
常识场景 问:哪个 3D盒子可 以从展开 图折叠 而成? 问:从场景中推断骑行者的任务。 问:该图形有多少条对称轴?
抽象模式 科学问答 物体属性 问:哪个序列违反了物理规律?
问:数出 与灰色 圆柱体 材质相 同的物 体。 See Think2 问:选择完成视觉模式的选项。
机器人操作 组合3D
问:拿起1筒麻将牌。 问:是否存在与棕色校车尺寸相同的公路自行车?
图2 See2ThinkBench概览。来自12个任务类别的代表性示例,涵盖三个视觉推理层级:2D结构化推理、3D场景推理和真实世界视觉推理。
区分中间视觉状态是否有用,与模型行为是否实际依赖于它。
2. 我们构建了See2ThinkBench,这是一个包含1.2K个视觉依赖推理问题的基准,覆盖12个任务类别和三种视觉环境。仅标题可解性过滤减少了文本主导的捷径,而答案格式归一化支持对自由形式和结构化输出进行一致评估。
3. 我们引入了VAoT,这是一种可观察、可干预的协议,用于记录视觉动作、渲染状态及其下游使用。在四个代表性闭源和开源模型上的实验表明,不存在普遍最优的视觉推理策略,揭示了动作选择后持续存在的瓶颈,并暴露了渲染反馈何时有助于、有害于或仅仅是装饰推理过程。
2 See2ThinkBench
作为See2Think的数据组件,See2ThinkBench支持对多模态推理中中间视觉状态进行受控的结果级和过程级诊断。其构建遵循三个原则:每个问题应需要视觉证据,自然支持有意义的视觉操作,并允许匹配的结果级和过程级评估。
2.1 任务设计与数据来源
See2ThinkBench包含来自12个任务类别的1.2K个视觉依赖推理样本,每个类别100个样本。如图2所示,这些类别被组织为三个视觉推理层级:2D结构化推理、3D场景推理和真实世界视觉推理。
2D结构化推理。此层级包含六个任务类别:几何、空间谜题、物理、化学、
第 4 页
表1 与代表性视觉中间推理基准及评估框架的对比。 TWI-PRMBench 指代 ThinkWithImages-PRMBench。# Tasks 表示报告的任务类别或子类别数量。反馈干预指对中间视觉反馈进行受控修改。动作–渲染–使用诊断指对动作选择、视觉执行及下游视觉状态使用进行显式评估。
| 基准 | 样本数 | 任务数 | 生成式 IVS | 闭环评估 | 过程评估 | 反馈干预 | 动作–渲染–使用诊断 | |——|——–|——–|————|———-|———-|———-|———————| | MIRA [31] | 546 | 20 | ✗ | ✗ | ✗ | ✗ | ✗ | | ViC-Bench [23] | 2,751 | 4 | ✓ | ✓ | ✓ | ✗ | ✗ | | TWI-PRMBench [32] | 1,206 | 16 | ✓ | ✗ | ✓ | ✗ | ✗ | | TwiFF-Bench [14] | 1,078 | 3 | ✓ | ✓ | ✓ | ✓ | ✗ | | See2Think (Ours) | 1,200 | 12 | ✓ | ✓ | ✓ | ✓ | ✓ |
科学问答与抽象模式。这些问题暴露显式结构,如几何关系、符号图表、时序曲线、分子构型及视觉变换。有用的视觉操作包括绘制辅助线、标记交点、追踪关系及注释符号证据。
3D场景推理。该层级包含物体属性与组合式3D。模型必须识别目标物体,并推理属性、相对位置、计数、比较及多跳空间关系。有用的操作包括标记物体、隔离区域、追踪关系链及过滤干扰项。
真实世界视觉推理。该层级包含机器人操作、机器人状态变化、视觉常识及直觉物理。这些任务要求语义锚定、物体状态追踪、动作理解、物理合理性、可供性及场景级常识。有用的视觉操作较少聚焦于精确几何构建,而更多在于隔离感知证据并追踪跨观察的变化。
用于实例化这些类别的源数据集记录于附录A.1;正文按语义任务类别而非源数据集名称报告结果。
表1将See2Think与视觉中间推理的代表性基准进行了比较。MIRA评估带注释的中间可视化的益处,ViC-Bench支持自由形式的视觉交错轨迹,TWI-PRMBench聚焦于过程奖励建模,而TwiFF-Bench将视觉推理扩展至动态生成的未来状态。See2Think的差异在于结合了显式文本捷径过滤与自生成的闭环视觉状态、对动作、渲染和反馈使用的分阶段诊断,以及任务相关的损坏反馈干预。
2.2 数据构建
图3总结了构建流程。从现有视觉推理数据集收集的候选样本出发,我们过滤掉文本主导的案例,将剩余任务规范化为统一的答案生成格式,并应用自动与人工质量控制,以确保视觉依赖性、答案唯一性及图像–问题一致性。
视觉依赖性过滤。 多模态基准构建的一个核心关切是文本主导偏差:部分样本无需查看原始图像,仅凭问题、语言先验或足够详细的文本描述即可回答。此类样本不适合用于诊断中间视觉状态的使用。对于每个候选样本,我们使用一个强大的多模态模型,基于图像和问题生成详细的描述。描述器被指示仅描述视觉上可观察的证据,不得回答问题或引入无根据的推断。随后,我们向一个推理模型提供问题和描述,同时隐藏原始图像,并对其进行五次查询。对于被正确回答的样本,
第 5 页
图3 构建流程。候选样本经过仅标题作答过滤,转换为统一的答案生成格式,并接受自动检查与人工验证,以确保视觉依赖性和答案质量。
在至少三次试验中均正确作答的样本被视为标题可解并被移除;其余样本则作为更具视觉依赖性的候选保留。提示词与模型细节见附录。
答案格式转换。许多源基准包含选择题或模板化问题,可能引入猜测捷径、答案先验或选项排除行为。在可能的情况下,我们移除文本答案选项列表,并将问题改写为自由形式查询,同时保留确定唯一答案所需的证据。一小部分样本(1200个中的127个)保留了源自源任务的结构化候选集,因为候选集本身构成了推理问题的一部分;在某些情况下它们出现在问题文本中,在其他情况下则作为嵌入原始图像的面板出现。这些实例作为结构化答案任务进行评估,其余1073个则使用自由形式答案。对于自然和具身场景,我们额外验证每个问题是否始终基于视觉可观察的证据。
质量控制。转换后的问题应需要超越直接视觉查找的非平凡推理,承认唯一且可复现的答案,并与关联图像保持一致。我们使用语言模型生成候选改写,随后进行答案唯一性和图像-问题一致性的自动检查。每个保留的样本随后经过人工复核,检查其视觉依赖性、歧义性以及与视觉动作推理的兼容性。答案规定不明确、视觉引用模糊或视觉基础不足的样本将被修改或移除。
2.3 评估目标
See2ThinkBench支持两个互补的评估目标:最终答案正确性和过程级质量。具体的推理条件和干预比较在第4节中介绍;此处我们定义基准所支持的评估目标。
最终答案正确性。每个样本提供一个参考答案用于结果级评估。对于结构化答案格式,我们在标准归一化后使用精确匹配。对于自由形式预测,我们评估模型预测与参考答案之间的语义等价性。该目标支持跨模型和推理条件的常规基于准确率的比较。
过程级质量。对于完整的VAoT轨迹,我们额外评估中间视觉推理过程的质量。由于一条轨迹可能包含多个视觉动作调用,我们首先识别与最终推理过程最相关的关键视觉步骤。然后从三个维度评估这些步骤:动作相关性,衡量请求的视觉操作是否针对任务相关证据;渲染保真度,衡量返回的渲染状态是否正确实现了
第 6 页
(a) CoT (b) VAoT
输入图像 + 问题 文本思考 视觉渲染器
规划并推理该做什么 … 多轮 输入图像 文本思考 仅用文本推理 … + 问题 辅助线 高亮对象 裁剪 / 区域 视觉反馈在后续 最终答案 最终答案 推理中被使用
(c) VAoT-NoRender (d) VAoT-WrongRender
输入图像 + 问题 文本思考 输入图像 文本思考 + 问题 规划并推理 … 规划并推理 … 视觉渲染器 仅动作, "action": [ { "type": 错误渲染 "action": [ { "type": 无渲染 "annotate", "target": (损坏的 "annotate", "tar … ["jackrabbit" … 反馈) 多轮 最终答案 最终答案
图4 视觉思维动作。VAoT 交替进行文本思考、视觉动作和渲染的视觉状态。模型提出一个结构化动作,渲染器对当前图像执行受约束的编辑,并将结果状态返回用于后续推理。
请求的操作;以及反馈采纳度,衡量后续推理是否使用了渲染视觉状态中实际存在的信息。对于诊断分析,错误的轨迹还可以被分配一个主要的失败来源。详细的评分协议见附录C,人工验证结果见第4.5节。
3 视觉思维动作
作为See2Think的协议组件,视觉思维动作(VAoT)将中间的视觉推理记录为文本思考、基于图像的动作和渲染视觉状态交替出现的序列。由于每个动作都可以在外部执行和检查,该轨迹支持受控干预和过程级诊断。图4展示了这种闭环交互及其受控推理设置。
给定输入图像I和问题q,模型在当前视觉状态上生成文本思考Tt和结构化的视觉动作At。该动作指定一个操作、归一化的目标坐标以及可选的语义内容或风格。外部渲染器执行该动作并返回更新后的状态Rt。此交互重复进行,直到生成最终答案:
T = {Tt, At, Rt}Nt=1. (1)
将累积历史定义为Ht = {Ti, Ai, Ri}ti=1,下一个文本步骤为:
Tt+1 ∼M I, q, Ht . (2)
动作空间包括高亮对象、绘制辅助线、裁剪或放大相关区域,以及标注视觉关系。每个动作必须针对可见的图像内容或基于视觉的构造,使得操作可执行且可在外部检查。
渲染器原理。渲染器是一个受约束的外部视觉工作区,而非任务求解代理。给定当前视觉状态和一个结构化动作,它执行所请求的编辑,同时保持
第 7 页
表2 See2ThinkBench上的整体准确率。所有设置均在全部1200个样本上评估,每个任务类别包含100个样本。CoT、VAoT-NoRender和VAoT中的最佳结果以粗体突出显示;并列最佳则共同突出显示。VAoT-WrongRender不参与最佳分数突出显示。缩写:S-Puz. = 空间谜题,AbsPat = 抽象模式,ObjAttr = 物体属性,Comp3D = 组合3D,R-Man. = 机器人操作,R-State = 机器人状态变化,V-Comm. = 视觉常识,IntPhys = 直觉物理。
| 设置 | 几何 | 空间谜题 | 物理 | 化学 | 科学问答 | 抽象模式 | 物体属性 | 组合3D | 机器人操作 | 机器人状态变化 | 视觉常识 | 直觉物理 | 整体 | |——|——|———-|——|——|———-|———-|———-|——–|————|—————-|———-|——–|——| | GPT-5.5 | | | | | | | | | | | | | | | CoT | 81.0 | 69.0 | 48.0 | 26.0 | 68.0 | 40.0 | 59.0 | 46.0 | 1.0 | 39.0 | 56.0 | 69.0 | 50.2 | | VAoT-NoRender | 60.0 | 53.0 | 48.0 | 23.0 | 69.0 | 47.0 | 72.0 | 42.0 | 3.0 | 34.0 | 55.0 | 70.0 | 48.0 | | VAoT | 46.0 | 41.0 | 46.0 | 28.0 | 72.0 | 39.0 | 68.0 | 37.0 | 1.0 | 38.0 | 61.0 | 58.0 | 44.6 | | VAoT-WrongRender | 55.0 | 45.0 | 47.0 | 20.0 | 60.0 | 36.0 | 60.0 | 35.0 | 1.0 | 36.0 | 50.0 | 62.0 | 42.3 | | GPT-o3 | | | | | | | | | | | | | | | CoT | 35.0 | 32.0 | 42.0 | 30.0 | 67.0 | 37.0 | 72.0 | 55.0 | 1.0 | 30.0 | 58.0 | 63.0 | 43.5 | | VAoT-NoRender | 24.0 | 31.0 | 43.0 | 30.0 | 70.0 | 21.0 | 74.0 | 54.0 | 0.0 | 29.0 | 53.0 | 61.0 | 40.8 | | VAoT | 24.0 | 31.0 | 41.0 | 19.0 | 68.0 | 37.0 | 76.0 | 59.0 | 0.0 | 32.0 | 63.0 | 75.0 | 43.8 | | VAoT-WrongRender | 27.0 | 29.0 | 39.0 | 19.0 | 72.0 | 35.0 | 61.0 | 35.0 | 2.0 | 31.0 | 59.0 | 63.0 | 39.3 | | Gemini 3.5 Flash | | | | | | | | | | | | | | | CoT | 84.0 | 74.0 | 68.0 | 15.0 | 75.0 | 55.0 | 94.0 | 61.0 | 1.0 | 42.0 | 35.0 | 80.0 | 57.0 | | VAoT-NoRender | 77.0 | 73.0 | 70.0 | 16.0 | 75.0 | 57.0 | 92.0 | 69.0 | 3.0 | 40.0 | 39.0 | 87.0 | 58.2 | | VAoT | 77.0 | 73.0 | 63.0 | 16.0 | 75.0 | 58.0 | 91.0 | 64.0 | 2.0 | 40.0 | 36.0 | 79.0 | 56.2 | | VAoT-WrongRender | 76.0 | 71.0 | 63.0 | 20.0 | 73.0 | 52.0 | 75.0 | 54.0 | 4.0 | 42.0 | 33.0 | 84.0 | 53.9 | | Qwen3-VL-32B-Instruct | | | | | | | | | | | | | | | CoT | 30.0 | 20.0 | 29.0 | 20.0 | 63.0 | 31.0 | 69.0 | 51.0 | 2.0 | 35.0 | 49.0 | 65.0 | 38.7 | | VAoT-NoRender | 31.0 | 18.0 | 28.0 | 21.0 | 59.0 | 25.0 | 71.0 | 45.0 | 4.0 | 35.0 | 48.0 | 61.0 | 37.2 | | VAoT | 30.0 | 22.0 | 26.0 | 17.0 | 58.0 | 25.0 | 65.0 | 49.0 | 2.0 | 26.0 | 46.0 | 62.0 | 35.7 | | VAoT-WrongRender | 33.0 | 16.0 | 30.0 | 18.0 | 63.0 | 30.0 | 47.0 | 33.0 | 4.0 | 34.0 | 42.0 | 67.0 | 34.8 |
无关内容。它既不接收参考答案,也不接收推理目标。执行和干预条件在第4.1节中定义。
VAoT是一种推理时诊断协议,无需访问模型内部。
4 实验
4.1 实验设置
模型与覆盖范围。我们在完整的1200样本基准上,对所有四种设置下的GPT-5.5、GPT-o3、Gemini 3.5 Flash和Qwen3-VL-32B-Instruct进行评估。表2和图5报告了结果。表3和图6(a)覆盖了所有4800条VAoT轨迹。图6(b)、7和8使用了所有四个模型间完整的样本级对齐。更多统计数据见附录D。
推理设置。CoT基于原始图像进行文本推理。VAoT-NoRender生成结构化动作但不执行。VAoT执行动作并返回渲染状态,而VAoT-WrongRender作为诊断性干预,返回看似自然但与任务相关的损坏状态。
评估。我们对结构化答案使用归一化精确匹配,对自由形式预测使用语义等价评判器。对于每条VAoT轨迹,GPT-5.4选择一个关键视觉步骤,并在{0, 0.5, 1}上对动作相关性、渲染保真度和反馈采纳度进行评分。模型身份和显式正确性标签被隐藏。完整提示和验证协议见附录。
4.2 主要结果
表2报告了在完整1200样本基准上的类别级准确率。没有单一的推理设置占据主导:GPT-5.5和Qwen3-VL-32B-Instruct在CoT下表现最佳,GPT-o3在VAoT下表现最佳,Gemini 3.5 Flash在VAoT-NoRender下表现最佳。因此,中间视觉推理的效果取决于模型和任务。
第 8 页
(a) (b)
图5 不同任务组和模型的视觉动作推理。(a) 四种推理设置下的准确率,按任务组内模型平均计算。(b) 各模型和设置下的总体准确率。所有结果均基于完整的1.2K样本基准。
机器人操作是一个持续的低准确率异常值。这些任务需要精确的目标定位和即时的操作指令。选择附近物体、描述场景或返回多步计划均被视为错误,几乎没有留给视觉动作弥补定位错误的空间。
发现1 中间视觉推理是一种条件性能力,而非通用的准确率提升器:不同模型家族的最优设置各不相同。
4.3 视觉思维何时有帮助?
图5按广义任务组和模型总结了结果。
任务领域。结构化2D问题倾向于对原始图像进行直接推理,尤其在几何和视觉谜题中。在3D场景中,VAoT-NoRender平均最强,表明即使在动作渲染之前,显式选择物体和关系也能组织关系推理。在真实世界场景中,CoT、VAoT-NoRender和VAoT的平均表现几乎持平,显示单一推理策略没有明显的总体优势。
模型画像。GPT-5.5和Qwen3-VL-32B-Instruct表现出文本优先的画像,Gemini 3.5 Flash为规划优先画像,而GPT-o3则略有闭环偏好。因此,模型不仅在最终准确率上存在差异,在受益的视觉推理阶段上也各不相同。
发现2 视觉思维在不同环境中改变其作用领域:直接感知在显式2D图表上领先,动作规划在3D场景中略占优势,而在真实世界环境中,没有单一策略具有明显的总体优势。
VAoT-WrongRender通常会降低准确率,包括VAoT未超越VAoT-NoRender的情况。因此,模型可能依赖返回的视觉反馈,却未从正确渲染中获得净收益。
发现3 视觉状态效用与视觉状态依赖并不等同:正确渲染可能带来极少的净收益,而破坏返回状态仍可导致可衡量的性能下降。
8
第 9 页
表3 完整VAoT轨迹的过程级诊断。三个视觉推理组及总体的平均动作相关性、渲染保真度和反馈采纳度。每个维度针对每条轨迹中的一个关键视觉步骤,按{0, 0.5, 1}评分。每个模型贡献1200条轨迹。
模型 指标 2D结构化 3D场景 真实世界 总体
动作相关性 0.980 0.995 0.988 0.985 GPT-5.5 渲染保真度 0.595 0.550 0.681 0.616 反馈采纳度 0.723 0.785 0.837 0.772
动作相关性 0.994 0.992 0.948 0.978 GPT-o3 渲染保真度 0.588 0.593 0.664 0.614 反馈采纳度 0.812 0.843 0.852 0.830
动作相关性 0.974 0.988 0.972 0.976 Gemini 3.5 Flash 渲染保真度 0.599 0.705 0.639 0.630 反馈采纳度 0.656 0.812 0.691 0.694
动作相关性 0.958 0.978 0.949 0.958 Qwen3-VL-32B-Instruct 渲染保真度 0.563 0.593 0.641 0.594 反馈采纳度 0.832 0.913 0.909 0.871
图6 跨视觉环境的过程级诊断。(a) 三个任务组中,所有四个模型平均的动作相关性、渲染保真度和反馈采纳度。(b) 按结果分层的正确与错误轨迹在三个过程得分上的差异,所有四个模型平均。
4.4 通过过程级诊断解释结果模式
为定位结果差异的来源,我们将VAoT分解为三个阶段:规划、渲染和反馈使用。动作相关性衡量请求的操作是否针对相关的视觉证据;渲染保真度衡量操作是否正确实现;反馈采纳度衡量后续推理是否使用了返回视觉状态中的信息。
动作相关性始终接近饱和,而渲染保真度在所有模型和任务组中都显著较低。因此,观察到的最大退化发生在动作选择之后:一个合理的视觉计划仍需被准确渲染并融入后续推理。Qwen3-VL-32B-Instruct的总体反馈采纳度最高(0.871),尽管其最终答案准确率较低,这进一步说明使用返回的视觉信息与正确使用它是不同的。第4.5节的人工审计将评估这些自动判断的可靠性。
不同的视觉环境在不同阶段失败。图6(b)提供了所有四个模型平均的、按结果分层的过程分析。3D场景推理在渲染保真度上存在显著的正确-错误差距(0.097),远大于其动作相关性(0.011)和反馈采纳度(0.048)的差距。真实世界推理则主要通过动作相关性(0.044)最清晰地区分成功轨迹,而其渲染保真度差距为负(−0.065),反馈采纳度差距较小(0.022)。对于2D
第 10 页
图 7 按渲染保真度划分的渲染收益与损害。收益表示 VAoT-NoRender 错误到 VAoT 正确的转变,损害表示相反的转变。比率在四模型对齐子集中按任务组和渲染保真度区间归一化。 任务中,所有三个差距仍然很小(最大为 0.026),这与原始图表已暴露大部分所需结构的情况一致。
要点 4 主要瓶颈并非选择任务相关的视觉动作,而在于忠实地执行该动作并使用生成的证据,且主要失败阶段因视觉环境而异。
完整的正确性划分统计见附录 E。
渲染收益与渲染损害。为分离渲染反馈的相反效应,我们在每个渲染保真度组内比较对齐的 VAoT-NoRender 和 VAoT 轨迹。渲染收益是从错误到正确的转变,渲染损害是相反的转变。
在四模型对齐子集上,图 7 显示完全失真的渲染在 2D 和 3D 推理中产生负的转变平衡(分别为 −6.1 和 −9.3 个百分点),而真实世界组略为正(2.2)。更高的渲染保真度主要减少渲染损害。在得分为 1 时,转变平衡在 2D 中仍略为负(−1.2 个百分点),但在 3D(0.3)和真实世界推理(0.9)中变为轻微正向。
要点 5 渲染保真度主要决定执行是保留还是损害规划增益:失真的渲染在 2D 和 3D 推理中尤其有害,而更忠实的渲染主要减少干扰,并将净平衡转向中性或轻微正向的结果。
反馈采纳度与行为依赖性。为测试反馈采纳度是否对应于对返回视觉状态的可观察依赖性,我们对齐 VAoT 和 VAoT-WrongRender 轨迹,并按分配给 VAoT 轨迹的反馈采纳度得分进行分组。 我们报告 AccVAoT − AccWrongRender,其中较大的正值表示对损坏反馈的敏感性更高。总体准确率下降从反馈采纳度为 0 时的 −2.3 变化到 0.5 和 1 时的 3.4 和 3.1 个百分点。这种关系在 3D 场景推理中最强,下降幅度从 3.5 增长到 10.3 和 15.5 个百分点。
在 2D 和真实世界任务中,这种关联较弱或非单调,表明反馈采纳度的行为有效性仍依赖于环境。然而,损坏的反馈改变了
第 11 页
语义答案在32.7–54.2%的样本中发生改变,即使其净准确率影响较小。 完整的模型层面统计见附录8。
发现6 反馈采纳度在3D推理中最清晰地追踪了损坏反馈的敏感性,但这种关联仍依赖于环境。
4.5 过程评估的人工验证
由于过程分析依赖外部多模态评判器,我们进行了诊断性分层人工审计。两位人工标注员审阅了240条VAoT轨迹,这些轨迹来自一个4 × 3 × 4 × 5的设计,涵盖GPT-5.5、GPT-o3、Gemini 3.5 Flash和Qwen3-VL-32B-Instruct,涉及三个任务组、四个诊断层和每层五个样本。
表4 过程评估的人工一致性。比率汇总了两位独立标注员的数据(每个目标480个评分)。
| 标注目标 | 合理 | 合理或部分合理 | |———-|——|—————-| | 关键步骤选择 | 88.3% | 94.4% | | 动作相关性 | 74.8% | 96.9% | | 渲染保真度 | 70.2% | 92.9% | | 反馈采纳度 | 79.6% | 95.0% |
对于每条轨迹,标注员独立评估所选关键步骤和三个过程评分,判断其为合理、部分合理或不合理。汇总他们每个目标的480个评分,在所有四个目标中,92.9–96.9%的判断至少是部分合理的。
动作相关性和渲染保真度在严格与部分合理之间的较大差距表明,分歧主要在于完全支持与部分支持判断的边界;每个目标的汇总合理或部分合理比率均超过92.9%。抽样、标注细节以及每位标注员的人工验证结果见附录F.1。WrongRender质量审计结果及质量过滤子集上的配对准确率分析见附录F.2。在严格和宽松质量标准下,VAoT–WrongRender准确率差距均为正值,尽管其幅度随干预质量而变化。代表性的成功、诊断性和损坏反馈轨迹见附录G。
5 相关工作
多模态思维链与主动视觉推理。文本思维链已从语言推理扩展到多模态问题求解,评估涵盖推理质量、鲁棒性、效率和错误定位[8, 28]。一条快速发展的研究方向则将视觉视为主动推理工作空间。基于工具的方法对任务相关图像区域进行裁剪、缩放、标注、草图绘制或其他操作[7, 21, 30]。交互式和生成式方法通过图像编辑、视觉生成或交错的文本-视觉推理,在推理过程中构建中间视觉状态[12, 15, 19, 20]。近期工作进一步探索了多模态推理中的连续视觉动作和对视觉信息的重复访问[6, 29]。面向可靠性的方法处理噪声中间图像或文本计划与执行的视觉动作之间的差异[11, 25]。这些方法展示了主动视觉推理的潜力,但仅凭性能提升并不能证明返回的视觉状态忠实地实现了预期动作,或被模型后续使用。
视觉中间状态基准。MIRA研究中间可视化可促进推理的任务,而ViC-Bench评估自由形式的视觉交错推理轨迹[23, 31]。TWI-PRMBench专注于带图像思维轨迹的过程奖励建模,TwiFF-Bench则评估动态生成的未来帧推理[14, 32]。这些基准大幅拓宽了对中间视觉推理的评估。然而,它们主要衡量视觉轨迹的有用性、合理性或整体质量。它们并未联合诊断一个自生成的视觉动作是否
第 12 页
是任务相关的,返回的状态是否忠实地实现了该动作,以及后续推理行为是否依赖于返回的视觉证据。
诊断视觉状态的使用。 近期一些研究更接近于评估中间视觉信息是否保真或对答案至关重要。面向保真度的评估检查生成的视觉思考是否与预期的推理过程一致[16]。View Dropout 通过限制从原始视图到最终答案的直接信息流,鼓励统一多模态模型依赖生成的思考图像[24]。对基于工具和无工具智能体的系统比较进一步表明,产生工具调用轨迹并不一定意味着返回的工具输出扩展了智能体可解决的问题集[3]。See2Think 是对这些研究的补充。它没有引入训练目标或比较单独训练的工具和非工具智能体,而是提供了一个与模型无关的推理时框架,该框架记录了自生成的视觉动作、外部渲染的状态以及后续推理。匹配的标准条件和损坏渲染条件随后区分了动作相关性、渲染保真度、反馈采纳度、视觉状态效用和行为依赖性。
6 结论与局限性
我们引入了 See2Think,一个用于研究多模态模型在推理过程中是否真正使用中间视觉状态的统一框架。See2Think 结合了 See2ThinkBench(一个通过统一答案生成接口评估的视觉依赖推理问题基准)和 VAoT(一种可观察、可干预的协议,记录视觉动作、渲染状态和后续推理)。在 GPT-5.5、GPT-o3、Gemini 3.5 Flash 和 Qwen3-VL-32B-Instruct 上的实验表明,视觉推理是模型和环境依赖的,而非由单一普遍有效的策略支配。虽然模型通常能识别相关的视觉操作,但忠实地实现这些操作并使用返回的视觉证据仍然是重要的瓶颈。受控干预进一步表明,视觉状态效用和行为依赖性是截然不同的:一个视觉状态可能提供的直接益处有限,但在被损坏时仍会强烈影响模型决策。通过超越视觉轨迹的单纯存在和最终答案的准确性,See2Think 提供了一个受控框架,用于评估“用图像思考”何时是真实的、有用的或具有误导性的。
局限性。 首先,我们的评估集中在四个有代表性的多模态模型上,可能无法捕捉当前和未来视觉语言系统的全部多样性。其次,VAoT 依赖于外部渲染组件和自动过程评估,尽管我们进行了人工验证,但这仍可能引入错误。第三,VAoT-WrongRender 的测量效果取决于干预质量。在人工审核子集上的质量过滤分析保持了准确率下降的方向,但其幅度因过滤标准而异。未来的工作可以探索更广泛的模型覆盖、学习型渲染机制以及更细粒度的视觉推理过程监督。
参考文献
[1] Florian Bordes, Quentin Garrido, Justine T. Kao, Adina Williams, Michael Rabbat, and Emmanuel Dupoux. Intphys 2: Benchmarking intuitive physics understanding in complex synthetic environments, 2025.
[2] Qiguang Chen, Libo Qin, Jin Zhang, Zhi Chen, Xiao Xu, and Wanxiang Che. M3CoT: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8199–8221, Bangkok, Thailand, 2024. Association for Computational Linguistics. doi: 10.18653/v1/2024.acl-long.446. URL https://aclanthology.org/2024.acl-long.446/.
[3] Garvin Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, and Minpeng Liao. Do multimodal agents really benefit from tool use? a systematic study of capability gains. arXiv preprint arXiv:2606.02357, 2026.
[4] Meng-Hao Guo, Xuanyu Chu, Qianrui Yang, Zhe-Han Mo, Yiqing Shen, Pei-lin Li, Xinjie Lin, Jinnian Zhang,
第 13 页
Xin-Sheng Chen, Yi Zhang, Kiyohiro Nakayama, Zhengyang Geng, Houwen Peng, Han Hu, and Shi-Min Hu. Rbench-v: A primary assessment for visual reasoning models with multi-modal outputs, 2025.
[5] Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, and Yu Cheng. Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark, 2025.
[6] Lianyu Hu, Xiaoyu Ma, Zeqin Liao, and Yang Liu. TVI-CoT: Text-visual interleaved chain-of-thought reasoning for multimodal understanding. arXiv preprint arXiv:2606.08464, 2026.
[7] Yushi Hu, Weijia Shi, Xingyu Fu, Dan Roth, Mari Ostendorf, Luke Zettlemoyer, Noah A. Smith, and Ranjay Krishna. Visual sketchpad: Sketching as a visual chain of thought for multimodal language models. arXiv preprint arXiv:2406.09403, 2024.
[8] Dongzhi Jiang, Renrui Zhang, Ziyu Guo, Yanwei Li, Yu Qi, Xinyan Chen, Liuhui Wang, Jianhan Jin, Claire Guo, Shen Yan, Bo Zhang, Chaoyou Fu, Peng Gao, and Hongsheng Li. MME-CoT: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency. In Proceedings of the 42nd International Conference on Machine Learning, volume 267 of Proceedings of Machine Learning Research, pages 27793–27830. PMLR, 2025.
[9] Justin Johnson, Bharath Hariharan, Laurens van der Maaten, Li Fei-Fei, C. Lawrence Zitnick, and Ross Girshick. CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 1988–1997, 2017.
[10] Alexander Khazatsky, Karl Pertsch, Suraj Nair, Ashwin Balakrishna, Sudeep Dasari, Siddharth Karamcheti, Soroush Nasiriany, Mohan Kumar Srirama, Lawrence Yunliang Chen, Kirsty Ellis, et al. DROID: A large-scale in-the-wild robot manipulation dataset, 2024.
[11] Haobin Li, Yutong Yang, Yijie Lin, Xiang Dai, Mouxing Yang, and Xi Peng. Reliable thinking with images. arXiv preprint arXiv:2602.12916, 2026.
[12] Qingxiao Li, Lifeng Xu, QingLi Wang, Yudong Bai, Mingwei Ou, Shu Hu, and Nan Xu. S1-VL: Scientific multimodal reasoning model with thinking-with-images. arXiv preprint arXiv:2604.21409, 2026.
[13] Zhuowan Li, Xingrui Wang, Elias Stengel-Eskin, Adam Kortylewski, Wufei Ma, Benjamin Van Durme, and Alan Yuille. Super-CLEVR: A virtual benchmark to diagnose domain robustness in visual reasoning. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023.
[14] Junhua Liu, Zhangcheng Wang, Zhike Han, Ningli Wang, Guotao Liang, and Kun Kuang. TwiFF (think with future frames): A large-scale dataset for dynamic visual reasoning. arXiv preprint arXiv:2602.10675, 2026.
[15] Xu Liu, Yongheng Zhang, Qiguang Chen, Yao Li, Sheng Wang, and Libo Qin. Let's think with images efficiently! an interleaved-modal chain-of-thought reasoning framework with dynamic and precise visual thoughts. arXiv preprint arXiv:2603.21754, 2026.
[16] Zujing Liu, Junwen Pan, Qi She, Yuan Gao, and Guisong Xia. On the faithfulness of visual thinking: Measurement and enhancement. arXiv preprint arXiv:2510.23482, 2025.
[17] Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, and Jianfeng Gao. MathVista: Evaluating mathematical reasoning of foundation models in visual contexts. In International Conference on Learning Representations, 2024.
[18] Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, and Zhe Gan. Prism-bench: A benchmark of puzzle-based visual tasks with cot error detection, 2025. Withdrawn.
[19] Runqi Qiao, Qiuna Tan, Minghan Yang, Guanting Dong, Peiqing Yang, Shiqiang Lang, Enhui Wan, Xiaowan Wang, Yida Xu, Lan Yang, Chong Sun, Chen Li, and Honggang Zhang. V-thinker: Interactive thinking with images. arXiv preprint arXiv:2511.04460, 2025.
[20] Weikang Shi, Aldrich Yu, Rongyao Fang, Houxing Ren, Ke Wang, Aojun Zhou, Changyao Tian, Xinyu Fu, Yuxuan Hu, Zimu Lu, Linjiang Huang, Si Liu, Rui Liu, and Hongsheng Li. Mathcanvas: Intrinsic visual chain-of-thought for multimodal mathematical reasoning. arXiv preprint arXiv:2510.14958, 2025.
13
第 14 页
[21] Zhaochen Su, Linjie Li, Mingyang Song, Yunzhuo Hao, Zhengyuan Yang, Jun Zhang, Guanjie Chen, Jiawei Gu, Juntao Li, Xiaoye Qu, and Yu Cheng. Openthinkimg: Learning to think with images via visual tool reinforcement learning. arXiv preprint arXiv:2505.08617, 2025.
[22] Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc V. Le, and Denny Zhou. Chain-of-thought prompting elicits reasoning in large language models. In Advances in Neural Information Processing Systems, 2022.
[23] Xuecheng Wu, Jiaxing Liu, Danlei Huang, Xiaoyu Li, Yifan Wang, Chen Chen, Liya Ma, Xuezhi Cao, and Junxiao Xue. Vic-bench: Benchmarking visual-interleaved chain-of-thought capability in mllms with free-style intermediate state representations. arXiv preprint arXiv:2505.14404, 2025.
[24] Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, and Aishwarya Agrawal. How and what to imagine? visual thinking in unified multimodal models for cross-view spatial reasoning. arXiv preprint arXiv:2605.27310, 2026.
[25] Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, and Tat-Seng Chua. Walk the talk: Bridging the reasoning-action gap for thinking with images via multimodal agentic policy optimization. arXiv preprint arXiv:2604.06777, 2026.
[26] Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, and Wenhu Chen. MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024.
[27] Shiduo Zhang, Zhe Xu, Peiju Liu, Xiaopeng Yu, Yuan Li, Qinghui Gao, Zhaoye Fei, Zhangyue Yin, Zuxuan Wu, Yu-Gang Jiang, and Xipeng Qiu. VLABench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks, 2024.
[28] Zhuosheng Zhang, Aston Zhang, Mu Li, Hai Zhao, George Karypis, and Alexander J. Smola. Multimodal chain-of-thought reasoning in language models. arXiv preprint arXiv:2302.00923, 2023.
[29] Kesen Zhao, Beier Zhu, Junbao Zhou, Xingyu Zhu, Zhongqi Yue, and Hanwang Zhang. Thinking with images as continuous actions: Numerical visual chain-of-thought. arXiv preprint arXiv:2602.23959, 2026.
[30] Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, and Xing Yu. Deepeyes: Incentivizing “thinking with images” via reinforcement learning. arXiv preprint arXiv:2505.14362, 2025.
[31] Yiyang Zhou, Haoqin Tu, Zijun Wang, Zeyu Wang, Niklas Muennighoff, Fan Nie, Yejin Choi, James Zou, Chaorui Deng, Shen Yan, Haoqi Fan, Cihang Xie, Huaxiu Yao, and Qinghao Ye. When visualizing is the first step to reasoning: Mira, a benchmark for visual chain-of-thought. arXiv preprint arXiv:2511.02779, 2025.
[32] Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, and Sirui Han. What, whether and how? unveiling process reward models for thinking with images reasoning. arXiv preprint arXiv:2602.08346, 2026.
14
第 15 页
附录
附录目录
A 基准构建细节 … 16
A.1 源数据集收集与预处理 … 16
A.2 仅标题可解性过滤 … 16
A.3 答案格式转换 … 17
A.4 人工质量检查 … 18
B 推理提示与实现细节 … 18
B.1 实现设置 … 18
B.2 Text-CoT提示 … 18
B.3 VAoT提示 … 19
B.4 VAoT-NoRender提示 … 21
B.5 WrongRender干预提示 … 22
C 详细评估协议 … 24
C.1 最终答案评估 … 24
C.2 过程级评估 … 24
C.3 配对干预分析 … 25
D 完整结果与配对干预结果 … 26
D.1 完整1.2K结果 … 26
D.2 完整配对干预统计 … 26
E 完整过程统计 … 28
F 人工验证与WrongRender质量审计 … 28
F.1 过程标注的人工验证 … 28
F.2 WrongRender质量审计 … 29
G 定性轨迹 … 31
G.1 成功的视觉状态使用 … 31
G.2 过程级失败案例 … 31
G.3 WrongRender下的答案变化 … 32
15
第 16 页
A 基准构建细节
本节提供构建See2ThinkBench的额外实现细节。基准构建包含四个阶段:源数据集收集、仅标题可解性过滤、答案格式转换和人工质量检查。
A.1 源数据集收集与预处理
我们从RBench-V [4]、EMMA [5]、M3CoT [2]、PRISM-Bench [18]、CLEVR [9]、SuperCLEVR [13]、VLABench [27]、DROID [10]和IntPhys2 [1]收集候选样本。
为实现统一评估,源特定的任务名称被映射到See2ThinkBench中使用的语义类别:
• 2D结构化推理:几何、空间谜题、物理、化学、科学问答和抽象模式,分别实例化自RBench-V、EMMA、M3CoT和PRISM-Bench。
• 3D场景推理:对象属性和组合3D,分别实例化自CLEVR和SuperCLEVR。
• 真实世界视觉推理:机器人操作、机器人状态变化、视觉常识和直觉物理,分别实例化自VLABench、DROID、M3CoT和IntPhys2。
我们尽可能保留原始图像,仅修改文本问题和答案格式。在进一步处理之前,移除图像缺失、内容重复、引用无效、文件损坏或视觉证据不足的样本。
A.2 仅标题可解性过滤
我们应用仅标题可解性过滤,以移除无需直接访问原始图像即可解决的样本。对于每个候选样本,标题生成器接收图像和问题,但被指示仅描述视觉上可观察的证据,不回答问题或引入无依据的推理。
然后,推理模型仅接收问题和生成的标题,原始图像被保留。模型被查询五次。在至少三次试验中回答正确的样本被视为标题可解并被移除。其余样本保留用于后续处理。
此过程减少了文本主导的样本,同时保留了视觉依赖的问题。它并不假设所有保留的样本都无法通过语言先验解决,而是过滤掉文本替代品已足够的情况。
详细图像标题生成提示词
系统提示词:
你是一个精确的多模态描述模型。描述所提供图像中所有可能与回答相关问题相关的视觉可观察信息。
包括可见对象、属性、文本、几何结构、空间关系、图表元素和物理状态。不要回答相关问题,也不要推断无视觉依据的信息。
用户指令提示词:
与图像相关的问题:
{question}
生成图像的详细且客观的描述。
16
第 17 页
仅标题可解性测试提示词
系统提示词:
你正在解决一个视觉推理问题,但无法访问原始图像。你只能获得问题及文本形式的图像描述。仅使用所提供的信息。不要编造缺失的视觉证据。
用户指令提示词:
问题:
{question}
图像描述:
{caption}
仔细推理,并按以下格式返回简洁的最终答案:
最终答案:{answer}
A.3 答案格式转换
许多源数据集包含多项选择或基于模板的问题。在可能的情况下,我们移除文本形式的答案选项列表,并将问题改写为自由形式的查询,同时保留原始的视觉证据和推理要求。一小部分样本(1200个样本中的127个)保留了从源任务继承的结构化候选集,因为候选选项本身构成了推理问题的一部分;这些候选可能出现在问题文本中,或作为嵌入原始图像的面板出现。这些实例作为结构化答案任务进行评估,而其余1073个样本则使用自由形式答案。
对于被选为自由形式转换的样本,改写后的问题必须保持一个唯一且可复现的参考答案。转换过程不会引入额外证据、泄露正确答案或改变底层任务目标。
自由形式问题改写提示词
系统提示词:
你正在将一个视觉多项选择题转换为自由形式问题。
保留原始的视觉证据和推理要求。移除答案选项,并改写问题,使其具有唯一且简洁的答案。
不要引入新信息。不要泄露正确选项。不要改变底层任务。
用户指令提示词:
原始问题:
{original_question}
答案选项:
{options}
正确答案:
{correct_answer}
返回:
第 18 页
开放式问题:{rewritten_question}
参考答案:{reference_answer}
[提供原始图像。]
A.4 人工质量检查
自动处理后,保留的样本将接受人工审核。审核人员会验证改写后的问题是否仍然基于图像,参考答案是否得到唯一支持,以及视觉证据是否足以回答问题。
如果样本包含模糊的视觉引用、不明确的答案、不一致的图像-问题对或大量的纯文本捷径,则会进行修改或移除。
审核人员还会额外验证每个样本是否自然地支持有意义的视觉操作,包括高亮相关对象、裁剪区域、绘制辅助线或标注视觉关系。
B 推理提示词与实现细节
B.1 实现设置
我们评估了 GPT-5.5、GPT-o3、Gemini 3.5 Flash 和 Qwen3-VL-32B-Instruct。对于每个模型,所有四种推理设置均使用完整的 1.2K 样本基准、相同的原始图像、答案格式和交互预算。主要的类别级结果表和 Figure 5 使用了全部 1,200 个样本,而组级汇总数据见附录 D。过程评分使用每个模型全部的 1.2K 条 VAoT 轨迹,总计 4,800 条轨迹。GPT-5.4 被用作外部答案和过程评判器。
渲染器仅接收当前图像状态和结构化动作。为确保渲染保真度,它被约束为仅执行请求的操作并保留无关内容。VAoT 和 VAoT-WrongRender 使用相同的推理提示词和交互预算;WrongRender 仅改变返回的视觉状态。在所有主要实验中,干预使用 modify_key 条件来改变任务相关证据,同时力求保持自然外观和广泛的操作意图。推理模型不会被告知反馈已被破坏。如第 4.1 节所述,配对干预分析在所有四个模型的全部 1.2K 样本上使用完整的样本级对齐。
B.2 Text-CoT 提示词
Text-CoT 的提示词
角色与目标 你是一个多模态推理助手。 你的目标是通过显式分析给定的图像并生成完整的推理步骤及最终答案,来解决所提供的问题。
指令 仔细观察:
- 在推理前仔细检查所提供的图像。
- 描述你观察到的与问题相关的内容(例如,空间关系、几何形状、标签或数量)。
分析上下文:
- 回顾原始问题,并整合视觉和文本信息。
- 生成一个完整的逐步推理过程。
生成完整解决方案:
- 提供解决问题所需的所有逻辑步骤。
- 每一步都应建立在前一步的基础上。
- 以最终答案结束。
视觉推理要求:
18
第 19 页
- 你的推理必须明确引用图像中的视觉证据。
- 如果移除图像,你的推理应是不完整的。
- 每一步都应引用你在图像中看到的内容来驱动推理。
输出格式 你的输出必须包含以下部分:
完整解答:
步骤 1(文本): 视觉观察:[描述图像中与本步骤相关的内容] 推理:[对本步骤推理的简明解释] 计算/结果:[展示计算过程和中间结果]
步骤 2(文本): 视觉观察:[描述图像中与本步骤相关的内容] 推理:[对本步骤推理的简明解释] 计算/结果:[展示计算过程和中间结果]
[… 继续所有步骤 …]
最终答案: [最终的数值或符号结果,清晰框出或高亮]
特别说明
- 生成解决问题所需的所有推理步骤。
- 每一步必须明确引用图像中的视觉元素。
- 在适当的地方使用数学符号。
- 解答应自包含且逻辑完整。
示例输出 完整解答:
步骤 1(文本): 视觉观察:图像显示一个直角三角形,斜边标注为10厘米,一个锐角标注为30度。 推理:在直角三角形中,30度角所对的边是斜边长度的一半。 计算/结果:对边 = 10厘米 × sin(30度) = 10 × 0.5 = 5厘米
步骤 2(文本): 视觉观察:30度角的邻边可以通过勾股定理或余弦函数求得。 推理:使用余弦函数:邻边 = 斜边 × cos(30度) 计算/结果:邻边 = 10厘米 × cos(30度) = 10 × (√3/2) = 5√3厘米 ≈ 8.66厘米
步骤 3(文本): 视觉观察:三角形的三条边现在都已确定。 推理:周长是三条边的总和。 计算/结果:周长 = 10厘米 + 5厘米 + 5√3厘米 = 15 + 5√3厘米
最终答案: 三角形的周长为15 + 5√3厘米
上下文 {问题陈述}
你的任务 基于以上上下文,分析图像并生成包含最终答案的完整分步解答,确保你的推理明确依赖于视觉证据。
B.3 VAoT 提示词
VAoT 提示词
角色与目标 你是一位多模态思维链推理专家。你的目标是逐步解决问题,同时扮演逻辑推理者和视觉设计师的角色。
你拥有完全的自主权,可以决定何时视觉辅助在*教学上是必要的*——以及如何富有表现力地渲染它(例如,标注标签、手绘高亮),使用符合出版质量的惯例。
—
第 20 页
核心哲学
1. 逐步逻辑 每一步必须代表一个原子性推理。绝不要将多个想法合并。
2. 视觉必要性(关键) -> 仅当视觉操作能*独特地促成*纯文本无法提供的理解时,才生成视觉动作:
-> 跳过动作的情况:
- [是] 高亮特定区域(例如,‘"接头处的应力集中"‘)
- [是] 追踪不规则路径(例如,‘"流经毛细血管的血流"‘)
- [是] 放大不可读的细节
- [是] 展示空间关系
- [是] 消除重叠物体的歧义
- 纯计算(‘"力的求和:F1 + F2 = 10N"‘)
- 逻辑推理(‘"既然 A > B 且 B > C,则 A > C"‘)
- 无新视觉参考的总结/结论
3. 清晰且富有表现力的沟通
-> 但绝不要添加无目的的装饰。
- 标签必须具有语义性:‘"摩擦力"‘,而非‘"Box[200,300]"‘
- 当*确实*生成视觉内容时,利用增强样式(如果它们能提升清晰度):
- 对关键概念使用‘callout‘
- 对有机结构使用‘jitter‘
- 使用领域适配的‘theme‘(例如,对细胞使用‘biology‘)
指令
1. 分析上下文 回顾‘问题‘、‘原始图像‘和‘先前步骤‘。
2. 确定下一步 下一个*单一逻辑*步骤是什么?
3. 判断视觉必要性
‘action‘数组必须恰好包含一个项目。 在第1步中不要输出最终答案。
- 对于第1步:始终输出文本解释 + 恰好一个视觉动作对象。
- 对于第2步及以后:
- 默认仅输出文本解释。
- 仅当需要检查之前未展示的新区域、新物体、新路径或新空间关系时,才生成另一个视觉动作。
- 不要为纯计算、重述或结论再次绘图。
- 在整个解决方案中,除非问题明确需要更多,否则倾向于使用1-3个视觉动作。
4. 设计视觉动作(如果选择) 选择最有效的工具——以及可选的其表现样式:
| 用例 | 推荐工具 + 样式 | |———|————————–| | 需要强调的关键概念 | ‘annotate‘ + ‘"shape": "callout"‘ + ‘"shadow": true‘ | | 不规则结构(血管、河流) | ‘trace_highlight‘ + ‘"jitter": true‘ + ‘"feather": "gradient"‘ | | 假设边界 | ‘ellipse‘ + ‘"dash": "dashed"‘ | | 领域一致性 | 添加 ‘global_style: { "theme": "biology" }‘(一次) |
严格的内容规则
- 坐标:始终归一化到0-1000尺度。
- 标签:不包含坐标、括号、分数或单位。
- [否] ‘"力 [300,400]"‘, ‘"线粒体 (0.92)"‘
- [是] ‘"力"‘, ‘"线粒体"‘
- 安全性:如果‘style‘/‘shape‘字段无效 -> 渲染器会静默忽略它们。
可用的视觉动作
| 动作 | 必需字段 | 可选字段 | 备注 | |——-|———-|—————-|——-| | ‘annotate‘ | ‘target‘, ‘content‘ | ‘shape‘, ‘style‘ | ‘shape‘:‘"box"‘(默认), ‘"ellipse"‘, ‘"callout"‘ | | ‘trace_highlight‘ | ‘target‘, ‘content‘ | ‘style‘ | ‘target‘:3-5个脊柱点;‘style‘:‘{jitter, feather, opacity}‘ | | ‘highlight‘ / ‘mask‘ | ‘target‘ | ‘style‘ | ‘style‘:‘{feather, texture}‘ |
第 21 页
| ‘overlay_text‘ | ‘target‘, ‘content‘ | ‘style‘ | ‘style‘: ‘{font_weight, bg_adaptive}‘ | | ‘draw_line‘ | ‘target‘, ‘content‘ | ‘style‘ | — | | ‘ellipse‘ | ‘target‘, ‘content‘ | ‘style‘ | — | | ‘crop‘ / ‘zoom‘ | ‘target‘ | — | — |
全局样式(可选,顶层设置) 添加一次(例如,步骤1)以设定渲染上下文:
"global_style": { "theme": "biology", "enable_decor": true }
输出格式(严格遵循)
步骤 N(文本): [简洁的推理。解释做什么、为什么,以及*是否需要视觉操作*。可选地建议样式/主题。]
> *示例:* > *"毛细血管网络不规则且有方向性;边界框会错误地表示其流向。带渐变淡出的轨迹高亮更能传达血液流动。需要视觉操作来展示路径拓扑。"*
步骤 N(动作描述): *(仅在认为需要视觉操作时包含)*
{
"step": N,
"visual_rationale": "为什么使用此工具/样式?(例如,'使用标注强调关键术语')",
"global_style": { "theme": "biology" },
"action": [
{
"type": "trace_highlight",
"target": [[320,210], [380,240], [450,260]],
"content": "毛细血管流",
"style": { "jitter": true, "feather": "gradient" }
},
{
"type": "annotate",
"shape": "callout",
"target": [300,200,340,240],
"content": "氧气交换",
"style": { "corner_radius": 6 }
}
]
}
终止规则
最终答案: [答案]
- 持续进行,直到解答完成。
- 最后一步:
上下文 问题: {problem_statement}
之前的步骤: {previous_steps}
你的任务 基于上述上下文,生成下一个单一步骤。严格判断此步骤是否需要视觉动作。
B.4 VAoT-NoRender 提示词
VAoT-NoRender 的提示词
角色与目标 你是多模态思维链推理的专家。
这是 VAoT-NoRender 设置。你可以提出视觉动作,但系统不会渲染它们。因此,提出的动作仅为动作文本建议,不得视为新的视觉证据。
21
第 22 页
核心规则
1. 仅生成下一个单一步骤。 2. 每一步应进行一次原子性的推理动作。 3. 仅根据问题陈述、原始图像及之前的文本步骤进行推理。 4. 当视觉动作有助于推理时,你可以提出该动作,但不得声称其已被执行。 5. 除非原始图像中已存在高亮、缩放、裁剪、描边或标注等状态,否则不得声称某区域已被如此处理。 6. 不得将之前提出的动作作为证据使用。 7. 对于具身控制任务,仅预测下一个即时请求的动作。
何时提出视觉动作 仅当视觉动作明显有助于定位关键区域、追踪路径、展示空间关系、分离重叠物体或放大密集细节时,才提出视觉动作。
对于纯计算、逻辑推理、总结或最终答案,跳过视觉动作。
支持的视觉动作 仅使用以下动作类型: annotate、highlight、mask、trace_highlight、draw_line、ellipse、crop、zoom、overlay_text。
坐标必须归一化至0-1000。标签必须语义明确且人类可读。
输出格式
步骤 N(文本): [一个简洁的推理步骤。说明观察到了什么,为何重要,以及视觉动作是否有用。]
步骤 N(动作描述): 仅当视觉动作有用时才包含此块。
{
"step": N,
"render_policy": "no_render",
"visual_rationale": "说明为何提出此动作会有帮助,尽管它不会被渲染。",
"action": [
{
"type": "annotate",
"target": [300, 200, 340, 240],
"content": "关键证据"
}
]
}
准备结束时,以以下格式输出:
最终答案: [答案]
上下文 问题: {problem_statement}
先前步骤: {previous_steps}
你的任务 生成下一个单一步骤。请记住:提出的动作不会被渲染,且不得被用作视觉证据。
B.5 WrongRender 干预提示
VAoT-WrongRender 使用与标准 VAoT 相同的推理提示和交互流程。干预仅在渲染阶段引入:在推理模型提出视觉动作后,图像编辑器接收以下提示,以生成一个看似自然但被有意破坏的视觉状态。主要评估仅使用 modify_key 条件,该条件会改变与任务相关的视觉证据。本文报告的实验中未使用支持的 modify_non_key 条件。
第 23 页
错误渲染干预的提示词
你是一名图像干扰专家。你的任务是根据干扰类型修改所提供的图像。
原始问题:{problem}
干扰类型:{interference_type}
请根据干扰类型修改此图像:
1. 如果干扰类型为 modify_key,请修改图像中的关键区域,使其在影响问题解决的重要方面产生错误或误导信息。
2. 如果干扰类型为 modify_non_key,请修改图像中的背景或非关键信息,保持重要信息正确,但在次要细节上制造干扰。
请分析图像内容,识别解决问题所需的关键元素与非关键元素,并根据干扰类型进行适当修改。修改后的图像应看起来自然,但包含预期的干扰。
第 24 页
C 详细评估协议
C.1 最终答案评估
我们首先提取最终答案。结构化答案输出通过确定性规范化(大小写、空格、标点、单位格式和常见数字形式)后进行精确匹配评估。需要语义比较的自由形式预测,则使用以下生产提示与参考答案进行评判。
准确率/答案评估提示
你是一个多模态推理基准的严格答案评估器。判断模型的最终答案在语义上是否与参考答案一致。
问题: {row.get("question", "")}
参考答案: {row.get("ground_truth", "")}
模型最终答案: {row.get("final_answer", "")}
规则: 1. 忽略无害的格式差异、单位格式、LaTeX包装、标点和等效措辞。 2. 对于数学问题,当预期数量匹配时,接受代数等价表达式和数值等价答案。 3. 对于多项选择题,接受正确的选项字母或正确的选项文本。 4. 如果模型给出了与参考答案矛盾的额外声明,则标记为不正确。 5. 如果模型答案为空、回避或表示无法回答,则标记为不正确。 6. 对计数、方向、关系和命名实体保持严格。
仅返回一个JSON对象: {{ "correct": true 或 false, "reason": "简要解释" }}
C.2 过程级评估
对于每个VAoT轨迹,评判者会收到问题、参考答案、模型最终答案和完整轨迹。提供最终响应是因为Feedback Uptake需要评估来自渲染视觉状态的信息是否被纳入后续推理和模型的最终响应中。评判者选择一个关键视觉步骤,并在{0, 0.5, 1}上对Action Relevance、Render Faithfulness和Feedback Uptake进行评分。模型身份被隐藏,且不提供明确的正确/不正确标签。
关键步骤选择与过程评估提示
你是一个多模态推理轨迹的专家评估器。
你将评估一个视觉思维动作(VAoT)轨迹。模型通过交替进行文本思考、视觉动作、渲染视觉状态和后续推理来解决视觉推理问题。
你的任务是仅评估VAoT轨迹。不要将其与Text-CoT、VAoT-NoRender或VAoT-WrongRender进行比较。
问题: {question}
真实答案: {ground_truth}
模型最终答案: {final_answer}
轨迹: {trajectory_text}
第 25 页
请首先选择关键的视觉步骤,然后从三个维度评估所选步骤。
1. 关键视觉步骤选择: 找出与最终推理最相关或最直接暴露失败来源的单个视觉步骤。
如果没有有效的视觉操作,则使用 null。
1. 动作相关性: 模型是否选择了对解决任务有用的视觉动作? 评分 0 / 0.5 / 1。
- 1:视觉动作直接针对任务相关证据,且对解决问题有用。
- 0.5:视觉动作部分相关,目标性较弱,或包含不必要但无害的操作。
- 0:视觉动作不相关、通用、装饰性,或未能有意义地支持任务。
1. 渲染保真度: 渲染的视觉状态是否忠实于预期的视觉动作? 评分 0 / 0.5 / 1。
- 1:渲染的视觉状态忠实地执行了预期动作。
- 0.5:渲染结果与动作部分匹配,但存在明显的歧义、不精确或轻微错误。
- 0:渲染缺失、错误、具有误导性或与预期动作不一致。
1. 反馈采纳度: 后续推理是否实际使用了渲染的视觉状态? 评分 0 / 0.5 / 1。
- 1:后续推理明确将渲染的视觉状态用作证据。
- 0.5:后续推理较弱或隐式地使用了渲染状态,但仍主要依赖文本先验。
- 0:后续推理忽略了渲染状态,或独立于其继续进行。
仅返回以下格式的有效 JSON:
{{ "key_step_id": <步骤 id 或 null>, "key_step_reason": "<简短解释>", "action_relevance": {{ "score": <0, 0.5, 或 1>, "reason": "<简短解释>" }}, "render_faithfulness": {{ "score": <0, 0.5, 或 1>, "reason": "<简短解释>" }}, "feedback_uptake": {{ "score": <0, 0.5, 或 1>, "reason": "<简短解释>" }}, "overall_failure_source": "<action_relevance | render_faithfulness | feedback_uptake | none | unclear>", "summary": "<一句话诊断摘要>" }}
C.3 配对干预分析
我们对两种比较进行配对样本级分析:
• VAoT-NoRender →VAoT,用于分离渲染的益处与渲染的害处;
• VAoT →VAoT-WrongRender,用于衡量在损坏的视觉反馈下准确率的下降。
对于第一种比较,转移份额按每个渲染保真度组内所有匹配的轨迹进行归一化。对于第二种,轨迹按反馈采纳度分组,我们报告 AccVAoT − AccWrongRender。
25
第 26 页
D 完整结果与配对干预结果
D.1 完整的1.2K样本结果
表5报告了完整基准上所有四种设置的组级聚合结果。主论文报告了相同1200个样本上对应的12个类别结果;本表按视觉推理环境提供了紧凑的总结。
D.2 完整的配对干预统计
表6和表7提供了图7和图8背后的计数和同分母比率。表8报告了VAoT与VAoT-WrongRender之间的语义答案变化。这些配对统计使用了所有四个评估模型,并保留了完整的样本级对齐记录。
表5 完整1.2K样本基准上的准确率。
模型 设置 2D 3D 真实世界 总体
GPT-5.5 CoT 55.33 52.50 41.25 50.17 VAoT-NoRender 50.00 57.00 40.50 48.00 VAoT 45.33 52.50 39.50 44.58 VAoT-WrongRender 43.83 47.50 37.25 42.25 GPT-o3 CoT 40.50 63.50 38.00 43.50 VAoT-NoRender 36.50 64.00 35.75 40.83 VAoT 36.67 67.50 42.50 43.75 VAoT-WrongRender 36.83 48.00 38.75 39.33 Gemini 3.5 Flash CoT 61.83 77.50 39.50 57.00 VAoT-NoRender 61.33 80.50 42.25 58.17 VAoT 60.33 77.50 39.25 56.17 VAoT-WrongRender 59.17 64.50 40.75 53.92 Qwen3-VL-32B-Instruct CoT 32.17 60.00 37.75 38.67 VAoT-NoRender 30.33 58.00 37.00 37.17 VAoT 29.67 57.00 34.00 35.67 VAoT-WrongRender 31.67 40.00 36.75 34.75
表6 四模型对齐子集上的渲染收益与损害。收益和损害是每个任务组和渲染保真度区间内所有对齐轨迹的百分比;净值为收益减去损害。
任务组 RF n 收益 (%) 损害 (%) 净值 (pp)
2D 结构化 0 99 10.1 16.2 -6.1 0.5 1788 9.6 11.0 -1.4 1 513 9.4 10.5 -1.2 3D 场景 0 140 6.4 15.7 -9.3 0.5 344 12.8 12.2 +0.6 1 316 8.5 8.2 +0.3 真实世界 0 46 8.7 6.5 +2.2 0.5 1008 8.7 9.4 -0.7 1 546 8.4 7.5 +0.9
26
第 27 页
表7 在四模型对齐子集上对损坏反馈的敏感性。准确率下降 = AccVAoT − AccWrongRender。
任务组 | FU | n | VAoT准确率 (%) | 错误准确率 (%) | 下降 (pp) —|—|—|—|—|— 总体 | 0 | 607 | 42.2 | 44.5 | -2.3 | 0.5 | 786 | 42.9 | 39.4 | +3.4 | 1 | 3407 | 46.1 | 42.9 | +3.1 2D结构化 | 0 | 385 | 41.6 | 46.0 | -4.4 | 0.5 | 403 | 44.2 | 43.4 | +0.7 | 1 | 1612 | 43.1 | 42.0 | +1.1 3D场景 | 0 | 86 | 54.7 | 51.2 | +3.5 | 0.5 | 87 | 60.9 | 50.6 | +10.3 | 1 | 627 | 65.2 | 49.8 | +15.5 真实世界 | 0 | 136 | 36.0 | 36.0 | -0.0 | 0.5 | 296 | 35.8 | 30.7 | +5.1 | 1 | 1168 | 39.9 | 40.6 | -0.7
表8 损坏反馈下的语义答案变化。变化答案由语义答案变化判定器确定,而非直接字符串比较。
模型 | 变化数 | 变化率 (%) —|—|— GPT-5.5 | 624 / 1,200 | 52.0 GPT-o3 | 607 / 1,200 | 50.6 Gemini 3.5 Flash | 392 / 1,200 | 32.7 Qwen3-VL-32B-Instruct | 650 / 1,200 | 54.2
27
第 28 页
E 完整过程统计
表9报告了用于计算图6(b)中正确减错误差距的过程分数。计数对应于所有四个评估模型在完整基准上的VAoT最终答案结果。
表9 按最终答案正确性划分的过程分数。Action、Render和Feedback分别表示动作相关性、渲染保真度和反馈采纳度。结果使用完整的四模型基准。
模型 答案组 计数 Action Render Feedback
2D 272 0.9798 0.6085 0.7610 正确 3D 105 0.9952 0.5905 0.7905 真实世界 158 0.9937 0.6646 0.8734 GPT-5.5 2D 328 0.9802 0.5838 0.6921 错误 3D 95 0.9947 0.5053 0.7789 真实世界 242 0.9835 0.6921 0.8140
2D 220 0.9909 0.6091 0.8318 正确 3D 135 0.9963 0.6519 0.8815 真实世界 170 1.0000 0.6206 0.8529 GPT-o3 2D 380 0.9961 0.5763 0.8000 错误 3D 65 0.9846 0.4692 0.7615 真实世界 230 0.9087 0.6957 0.8522
2D 362 0.9820 0.5994 0.6657 正确 3D 155 0.9871 0.7097 0.8161 真实世界 157 0.9904 0.5987 0.7389 Gemini 3.5 Flash 2D 238 0.9622 0.5987 0.6408 错误 3D 45 0.9889 0.6889 0.8000 真实世界 243 0.9609 0.6646 0.6605
2D 178 0.9522 0.5843 0.8539 正确 3D 114 0.9912 0.6009 0.9386 真实世界 136 0.9779 0.5772 0.8824 Qwen3-VL-32B-Instruct 2D 422 0.9609 0.5533 0.8223 错误 3D 86 0.9593 0.5814 0.8779 真实世界 264 0.9337 0.6742 0.9223
F 人工验证与错误渲染质量审计
F.1 过程标注的人工验证
人工审计是一项诊断性可靠性检查,而非第二个完整的标注基准。两名标注员独立审查相同的240条VAoT轨迹,采用4 × 3 × 4 × 5设计,覆盖GPT-5.5、GPT-o3、Gemini 3.5 Flash和Qwen3-VL-32B-Instruct四个模型、三个任务组、四个诊断分层,每个单元格五条轨迹。四个分层为:
1. 动作相关性 = 1且VAoT答案错误;
2. 动作相关性 = 1且渲染保真度 = 0;
3. 动作相关性 = 1且渲染保真度 = 0.5;
4. 动作相关性 ∈ {0, 0.5}。
此构建覆盖了所有审计模型和环境中高动作/失败答案案例、渲染失败、部分渲染以及弱动作选择。
对于每条轨迹,标注员检查原始图像和问题、完整的VAoT轨迹、评判器选择的关键步骤、三个过程分数以及评判器解释。每个目标被标记为合理、部分合理或不合理。主论文报告了两名标注员合并的比率;每位标注员的汇总结果见表10。
28
第 29 页
表10 按标注员划分的人工验证结果。R表示合理;R/P表示合理或部分合理。 每位标注员独立审查相同的240条轨迹。
| 标注目标 | A1 R | A1 R/P | A2 R | A2 R/P | | :— | :— | :— | :— | :— | | 关键步骤选择 | 88.8% | 94.2% | 87.9% | 94.6% | | 动作相关性 | 87.1% | 96.7% | 62.5% | 97.1% | | 渲染保真度 | 83.8% | 93.3% | 56.7% | 92.5% | | 反馈采纳度 | 87.5% | 95.4% | 71.7% | 94.6% |
人工审查指南
你正在审查一条视觉推理轨迹的自动评估。对于关键步骤选择,判断所选步骤是否捕捉到了与最终推理最相关的视觉操作。对于每个过程维度,评估其评分和解释是否得到完整轨迹的支持。
合理:判断得到明确支持。 部分合理:判断捕捉到了主要行为,但不完整、不精确,或评分略高/略低。 不合理:判断与轨迹相矛盾,或遗漏了核心行为。
对于反馈采纳度,仅认可渲染状态中实际存在的信息;不要仅仅因为请求的动作相关就推断其被采纳。
标注员在动作相关性和渲染保真度的严格“合理”与“部分合理”边界上差异最大。对于每个目标,两位标注员仍将超过92%的判断标记为至少部分合理。
F.2 WrongRender质量审计
我们手动审计了120个VAoT-WrongRender案例。原始审计覆盖了90个案例,这些案例在GPT-5.5、GPT-o3和Gemini 3.5 Flash三个模型以及三个任务组中均匀采样,每个模型-任务组单元包含10个案例;我们额外使用相同的任务组覆盖范围审计了30个Qwen3-VL-32B-Instruct案例。审计检查了损坏状态是否以错误的方向改变了任务相关内容,同时作为同一渲染器的输出仍保持合理性。每个案例根据五个标准进行评估:损坏有效性、视觉合理性、操作一致性、任务相关性以及无关图像内容的保留。
WrongRender人工审计指南
检查原始图像、请求的视觉动作、正确的渲染状态和WrongRender状态。对于以下每个标准,评定为通过、部分通过或不通过,并简要解释不通过的标准。
• 损坏有效性:任务相关的视觉内容以错误的方向被改变。 • 合理性:结果类似于同一渲染器可能输出的合理结果。 • 操作一致性:请求的操作类型得以保留。 • 任务相关性:损坏可能影响对问题的推理。 • 内容保留:无关的图像区域基本保持不变。
当一个案例的五个标准均未被标记为不通过时,获得“严格通过”的综合标签。当至多一个标准被标记为不通过时,则被视为“可接受”。表11报告了添加30个Qwen案例前后的综合质量率。合并后的120个案例审计得出56.7%的严格通过率和78.3%的可接受率。新增的Qwen案例比原始三模型审计略为可靠,其严格通过率为76.7%,可接受率为86.7%。因此,我们将WrongRender视为一种综合诊断工具。
29
第 30 页
干预,而非假设每个损坏状态都能同样好地实现预期的修改。
表11 加入Qwen后的WrongRender质量审核总结。
子集 N 通过(0失败) 通过或部分通过(≤1失败)
原始审核 90 50.0%(45/90) 75.6%(68/90) Qwen新增 30 76.7%(23/30) 86.7%(26/30) 合并 120 56.7%(68/120) 78.3%(94/120)
在质量过滤子集上的配对分析。为检验所观察到的VAoT–WrongRender准确率差距是否主要由失败的损坏驱动,我们在合并的120个案例人工审核集上重新计算配对准确率差异。严格子集仅包含无任何审核标准失败的案例,而宽松子集允许最多一项标准失败。VAoT与VAoT-WrongRender在每个子集内的相同样本上进行比较。
表12 在人工审核的WrongRender子集上的配对准确率。Drop表示AccVAoT − AccWrongRender,单位为百分点。
子集 N VAoT准确率 WrongRender准确率 Drop
严格通过(0失败) 68 42.65 33.82 8.82 可接受(≤1失败) 94 41.49 38.30 3.19
仅Qwen的严格和可接受子集分别显示出8.70和7.69个百分点的准确率下降。合并所有四个模型后,严格子集表现出8.82个百分点的下降,而宽松子集仍保持3.19个百分点的正向下降。因此,行为依赖性结果并不局限于未通过质量审核的干预,但其估计幅度对干预质量仍然敏感。
30
第 31 页
G 定性轨迹
我们提供涵盖二维结构化、三维场景和真实世界视觉推理的代表性轨迹。所选示例旨在说明三种互补行为:成功的视觉状态使用、过程级失败,以及在损坏反馈下的答案变化。所有面板均使用模型生成的原始图像,未经重绘。
G.1 成功的视觉状态使用
图9展示了所请求的动作与任务相关、被忠实渲染,并在后续推理中被明确使用的案例。每条轨迹的Action Relevance、Render Faithfulness和Feedback Uptake得分均为1。
二维结构化推理:电阻网络比较(GPT-5.5)
原始图像 渲染的视觉状态
三维场景推理:基于关系的物体计数(GPT-o3)
原始图像 渲染的视觉状态
真实世界推理:活动识别(Gemini 3.5 Flash)
原始图像 渲染的视觉状态
图9 代表性的成功VAoT轨迹。上:高亮并联支路支持等效电阻推理。中:标记目标总线支持基于关系的计数。下:定位女性和笔记本电脑支持活动识别。
G.2 过程级失败案例
图10展示了在提出相关动作后出现的不同失败模式。二维案例仅被部分渲染且部分使用(1, 0.5, 0.5);三维案例标记了错误物体且未被可靠使用(1, 0, 0);而
第 32 页
机器人操作案例仅部分保真,且未获得可测量的采纳(1, 0.5, 0),导致连续动作预测错误。
2D结构化推理:凸包诊断(GPT-o3)
原始图像 模糊的渲染状态
3D场景推理:材质识别(Gemini 3.5 Flash)
原始图像 未对齐的渲染状态
真实世界推理:机器人操作(GPT-5.5)
原始图像 部分保真的渲染状态
图10 代表性的过程级失败案例。这些示例将相关动作提议与其执行质量和后续使用分离开来,说明了为何高Action Relevance并不能保证正确答案。
G.3 错误渲染下的答案变化
图11对比了每个环境中一个案例的原始图像、保真渲染和损坏渲染。这些干预保留了广泛的操作意图,同时改变了与任务相关的视觉内容:2D中的棱镜几何形状、3D中的目标关系,以及真实世界场景中领带上的品牌标识。在每个案例中,损坏的状态都改变了后续推理或最终答案。
第 33 页
2D结构化推理:棱镜几何(GPT-5.5)
原始 保真渲染 错误渲染
3D场景推理:关系性物体计数(GPT-o3)
原始 保真渲染 错误渲染
真实世界推理:品牌领带解读(Gemini 3.5 Flash)
原始 保真渲染 错误渲染
图11 代表性的WrongRender干预示例。 上:损坏的棱镜几何改变了推断的折射率。中:损坏的关系标记将物体数量从2改为5。下:将品牌领带替换为无品牌图案,使解读从促销展示变为装饰性人体模型。这些示例为定性说明;总体干预质量由附录F.2中的人工质量审核单独评估。
33