思考一次足矣:中间层证据路由如何让高分辨率VQA不再遗忘已捕获的细节

快速导读:提出一种无需训练的中间层证据路由方法Thinking-Once,在单次视觉编码和单次前向传播中,通过问题条件化的注意力分布保留核心实体令牌和压缩背景上下文,解决高分辨率VQA中已编码证据在后续推理中被稀释的问题。

高分辨率视觉问答(HR-VQA)要求模型从高分辨率图像中定位并理解细粒度视觉细节以回答问题。现有方法要么通过外部证据再获取(如裁剪、缩放、多轮搜索)引入额外视觉输入,要么通过压缩优先的令牌减少(如剪枝、合并)降低计算开销。然而,这两类方法都忽视了一个关键现象:模型在视觉编码的中间层往往已经激活了问题相关的证据区域,但这些证据在后续的深层推理中被冗余背景信息逐渐稀释或丢弃。

Thinking-Once提出了一种全新的证据路由范式,在单次视觉编码和单次多模态前向传播的约束下,于中间层利用问题条件化的交叉注意力分布,独立地为每个问题实体和全局问题查询执行最小覆盖证据选择,保留核心实体令牌;同时通过结构化网格池化将未选中的背景令牌总结为紧凑的上下文表示。这两部分证据按原始空间顺序合并后替换原视觉序列,路由至更深层网络。该方法无需训练,可即插即用于各类MLLM。

英文题目:Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

论文出处:arXiv 每日论文精选 · arXiv:2607.27830

原始论文:PDF / 论文页面

这篇论文解决什么问题?

HR-VQA的核心挑战在于高分辨率图像产生的海量视觉令牌(通常数千个)使得MLLM难以高效处理。现有解决方案分为两大范式:外部证据再获取方法(如DeepScan、DeepEyes、ViCrop)通过改变视觉输入管线获取额外细节,但需要多次视觉编码或重编码,计算开销大、推理时间长;压缩优先方法(如VisionZip、HiPrune)以通用冗余标准减少令牌数量,但可能丢弃关系推理所需的实体或上下文令牌。

论文通过一系列观察实验揭示了HR-VQA的一个关键失败模式。在V*Bench上的逐层预言机令牌干预实验(Figure 2, p.3)表明,在中间层保留问题相关的核心令牌能显著提升性能,而移除这些令牌则导致性能急剧下降——这说明中间层已经编码了有效的证据,问题在于这些证据在后续层中被稀释。渐进式背景掩码实验(Figure 3, p.3)进一步证实,随着背景掩码比例增加,性能持续下降,表明冗余背景确实在干扰证据的传递。

此外,论文引用了LongCat-Next的证据(Figure 1, p.15),表明冻结的视觉编码器输出仍保留可恢复的细粒度图像结构,这为单次视觉路由的可行性提供了理论支持。DeepEyes的消融实验(Table 3, p.16)也显示,纯文本思维链训练已能带来显著的HR-VQA提升,暗示部分改进来自推理行为的变化而非新增视觉输入。

这些观察共同指向一个核心洞察:HR-VQA的瓶颈不在于视觉编码器未能捕获证据,而在于已捕获的证据在后续推理中被稀释。因此,问题的关键不是“如何获取更多证据”,而是“如何有效路由已存在的证据”。

核心创新

  • 识别出HR-VQA的一个关键失败模式:中间层已激活的问题相关证据在后续推理中被稀释,而非完全缺失。
  • 提出Thinking-Once证据路由范式,将HR-VQA中的视觉信息选择重新定义为问题条件化的推理证据路由,在单次视觉处理流程中实现。
  • 设计独立的最小覆盖证据选择机制,为每个路由查询(实体和全局问题)分别保留至少ρ覆盖率的证据,避免查询聚合导致的信息抑制。
  • 引入结构化背景网格池化,在保留核心证据的同时,以紧凑的上下文摘要支持关系推理和属性比较,平衡了证据保留与上下文支持。

方法概览

Thinking-Once在推理时,于中间层L利用问题条件化的交叉注意力分布,为每个问题实体和全局问题查询独立执行最小覆盖证据选择,保留核心实体令牌;同时通过网格池化将未选中的背景令牌总结为紧凑的上下文表示。将这两部分证据按原始空间顺序合并,替换原视觉序列,路由至更深层网络,全程仅需一次全图编码和一次多模态前向传播。

  • 证据路由层选择:Thinking-Once在MLLM的中间层L(通常为总层数的1/3至1/2处)执行证据路由。该层的交叉注意力分布已被证明能有效定位问题相关区域,同时尚未被深层语义抽象过度稀释。
  • 问题实体提取与查询构建:首先使用同一MLLM以纯文本模式从问题中提取关键实体(如“左边的杯子”、“红色的标志”),为每个实体构建独立的路由查询,同时保留一个全局问题查询。这种独立查询设计避免了聚合查询中不同实体注意力相互抑制的问题。
  • 最小覆盖证据选择:对每个路由查询,利用其在层L的交叉注意力分布,按注意力分数从高到低累积选择视觉令牌,直到累积注意力达到覆盖率阈值ρ(默认0.5)。这确保每个查询都能获得足够的证据支持,而非仅选择top-k个令牌。独立查询路由的GT证据召回率达到85.26%,比聚合基线高14.13个百分点(Figure 5左, p.4)。
  • 注意力汇保留:论文发现MLLM中存在的注意力汇令牌(attention sink)虽然不携带具体视觉信息,但对下游推理的上下文聚合有重要作用。移除这些令牌导致跨基准平均性能下降4.4点(Table 3, p.7)。因此Thinking-Once显式保留这些注意力汇令牌。
  • 结构化背景网格池化:未选中的背景令牌通过空间网格池化(如2×2或3×3网格)总结为紧凑的上下文表示。这保留了空间布局信息,支持关系推理和属性比较。消融实验显示移除背景摘要导致平均性能下降3.3点(Table 3, p.7)。
  • 证据合并与路由:将核心实体令牌、注意力汇令牌和背景池化令牌按原始空间顺序合并,替换原视觉序列,路由至更深层网络。整个过程仅需一次全图编码和一次多模态前向传播,无需额外视觉输入或重编码。
  • 超参数配置:路由层L和覆盖率阈值ρ是两个关键超参数。论文在Qwen2.5-VL-7B上通过网格搜索确定默认配置(L=14, ρ=0.5),并在其他模型上验证了该配置的泛化性。
  • 计算效率:由于仅需单次视觉编码,Thinking-Once的推理时间远低于外部证据再获取方法。与DeepScan相比,V*Bench推理时间减少97.2%(Table 2, p.7),同时平均峰值内存降低约4GB。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 1: The base model gradually loses focus on the question-relevant region, whereas Thinking-Once more ef- fectively captures the relevant evidence at an intermediate layer and preserves it throughout subsequent reasoning.

图1对比了基础模型与Thinking-Once在推理过程中对问题相关区域的注意力变化。基础模型的注意力随层数加深逐渐分散到背景区域,而Thinking-Once在中间层捕获核心证据后,在后续层中始终保持聚焦。这直观展示了证据稀释问题及Thinking-Once的解决效果。

研究空白与核心区分

研究空白与核心区分
Figure 6: Overview of Thinking-Once. At a routing layer, question-conditioned queries independently select core evidence, while background grid pooling summarizes visual context before routing both to deeper layers within a single visual pass.

图6展示了Thinking-Once的整体架构。在路由层,问题条件化的查询独立选择核心证据,背景网格池化总结视觉上下文,两者合并后路由至更深层。该图清晰展示了单次视觉处理流程中的证据路由机制。

核心结论

核心结论
Table 1: Comprehensive results across five representative MLLMs. Mean averages the three benchmark averages. Average ∆is measured over the five base models against the corresponding base setting; higher accuracy and lower memory cost are better.

表1展示了五个MLLM上的综合结果。Thinking-Once在所有模型和基准上均取得一致提升,同时降低峰值内存。这证明了方法的通用性和效率优势。

实验如何设计?

  • 基础模型:在五个代表性MLLM上评估,包括Qwen2.5-VL-7B、Qwen3-VL-8B、ZwZ-4B/7B/8B,覆盖不同规模和架构。
  • 基准测试:主要基准为V*Bench(属性识别与空间推理)、HRBench-4K和HRBench-8K(高分辨率细粒度识别)。附录中补充了MME-RealWorld-Lite、ZoomBench、TreeBench、POPE等基准。
  • 对比方法:与11种开源HR-VQA方法全面对比,包括外部证据再获取方法(DeepScan、DeepEyes、ViCrop)和压缩优先方法(VisionZip、HiPrune、LongCat-Next等)。
  • 消融实验:在Qwen2.5-VL-7B上进行组件消融,验证背景摘要、注意力汇、实体查询和全局查询的独立贡献。
  • 分析实验:包括逐层预言机令牌干预、渐进式背景掩码、GT证据召回率分析、注意力汇抑制实验等,用于验证方法设计的合理性。
  • 效率评估:在V*Bench上测量端到端推理时间和峰值GPU内存,与各基线方法对比。

关键结果与论文证据

  • 主要结果(Table 1, p.6):在五个基础模型上,Thinking-Once平均提升V*Bench +3.1点、HRBench-4K +3.0点、HRBench-8K +2.7点,同时平均峰值内存降低约4GB。在Qwen2.5-VL-7B上,三个基准平均分从72.5提升至79.1(+6.6),V*Bench提升+9.9点。
  • 与SOTA对比(Table 2, p.7):在Qwen2.5-VL-7B上,Thinking-Once的跨基准平均分79.1超过DeepScan的77.8,同时推理时间仅为DeepScan的2.8%。与压缩优先方法相比,在相同33.3%令牌保留率下,Thinking-Once显著优于VisionZip和HiPrune。
  • 组件消融(Table 3, p.7):移除背景摘要导致平均分下降3.3点,去除注意力汇导致下降4.4点,仅用实体查询下降3.4点,仅用全局查询下降7.9点。这验证了各组件的重要性,尤其是全局查询和注意力汇。
  • 独立查询路由优势(Figure 5左, p.4):在匹配令牌预算下,独立查询路由的GT证据召回率达到85.26%,比聚合基线Average高14.13个百分点,比Max高9.56个百分点。这证实了独立查询设计能更有效地覆盖多个实体的证据。
  • 空间上下文覆盖(Figure 5右, p.4):结构化网格池化在相同总令牌预算下提供了更均匀的空间上下文覆盖,相比随机采样或均匀采样更好地保留了空间布局信息。
  • 注意力汇的作用(Figure 4, p.4):抑制注意力汇令牌导致跨模型和跨基准的一致性能下降,表明这些令牌在下游推理中提供有用的上下文或聚合信号。
  • 跨模型泛化性:Thinking-Once在五个不同架构的MLLM上均取得一致提升,表明该方法不依赖于特定模型架构或训练方式。
  • 效率优势:在max_pixel=1280的受控设置下(Table 9, p.22),Thinking-Once在保持性能优势的同时,推理时间显著低于外部证据再获取方法,且避免了压缩优先方法在低令牌预算下的性能崩溃。

阅读时需要注意

  • 方法无法恢复视觉编码器已不可逆丢失的信息,不适用于需要全新视觉观察的场景(如极度模糊或遮挡区域)。
  • 证据路由的效果依赖于中间层注意力分布能可靠地定位问题相关证据,当问题-实体对应关系弱或注意力分布噪声大时可能受限。
  • 背景网格池化虽保留了空间上下文,但可能丢失细粒度的背景纹理细节,对于极度依赖背景纹理的任务(如材质识别)可能有负面影响。
  • 路由层L和覆盖率阈值ρ等超参数的选择对性能有影响,论文未提供自动化选择策略,需要针对不同模型进行网格搜索。
  • 方法针对单次视觉编码设计,未探索与外部视觉工具(如裁剪、缩放)的集成,可能在某些需要多尺度观察的场景中受限。

关联工作

  • DeepEyes通过强化学习激励“用图像思考”,引入额外视觉输入和重编码,但计算开销大。Thinking-Once证明了在单次视觉编码内路由证据即可获得可比甚至更优的性能。
  • DeepScan通过多步视觉搜索获取额外证据,推理时间长。Thinking-Once在推理时间减少97.2%的情况下实现了更高的平均分。
  • VisionZip和HiPrune等压缩优先方法基于通用冗余标准减少令牌,但可能丢弃关系推理所需的关键令牌。Thinking-Once的问题条件化选择机制更精准地保留了证据。
  • LongCat-Next提供了冻结视觉编码器输出仍保留可恢复图像结构的证据,为Thinking-Once的单次视觉路由设计提供了理论支撑。

发表评论