思考一次足矣:中间层证据路由如何让高分辨率VQA不再遗忘已捕获的细节
高分辨率视觉问答中,模型在视觉编码阶段已经捕获的细粒度证据,为什么在后续推理时反而被丢弃了?这篇论文发现,问题不在于证据缺失,而在于已编码的证据被冗余背景信息稀释。Thinking-Once方法在中间层利用问题条件化的注意力分布,独立地为每个实体和全局查询选择最小覆盖的核心证据,同时用网格池化压缩背景上下文,将这两部分证据路由到更深层网络。在五个主流MLLM上,三个HR-VQA基准平均提升约3个点,峰值内存降低约4GB,推理时间仅为DeepScan的2.8%。但该方法无法恢复视觉编码器已不可逆丢失的信息,且效果依赖于注意力分布能可靠定位证据。