思考一次足矣:中间层证据路由如何让高分辨率VQA不再遗忘已捕获的细节

研究空白与核心区分

高分辨率视觉问答中,模型在视觉编码阶段已经捕获的细粒度证据,为什么在后续推理时反而被丢弃了?这篇论文发现,问题不在于证据缺失,而在于已编码的证据被冗余背景信息稀释。Thinking-Once方法在中间层利用问题条件化的注意力分布,独立地为每个实体和全局查询选择最小覆盖的核心证据,同时用网格池化压缩背景上下文,将这两部分证据路由到更深层网络。在五个主流MLLM上,三个HR-VQA基准平均提升约3个点,峰值内存降低约4GB,推理时间仅为DeepScan的2.8%。但该方法无法恢复视觉编码器已不可逆丢失的信息,且效果依赖于注意力分布能可靠定位证据。

少看快想:多模态大语言模型的联合Token-计算自适应推理

方法:SmartVL框架概述

多模态大语言模型推理成本高,现有方法如FastV或AdaLLaVA仅独立优化Token剪枝或层跳过,忽略视觉密度与LLM容量的耦合。本文提出SmartVL,联合控制视觉Token数、Transformer层数及注意力头组。通过可微延迟估计器和非对称损失,在VQAv2等基准上,50%预算下准确率显著优于基线。需注意不同任务最优配置差异,且FLOP节省需硬件支持才能转化为实际加速。

IQA-T1:用工具调用生成视觉证据,破解大模型图像质量评估的语义偏差难题

训练流程:SFT与强化学习

本文介绍IQA-T1框架,针对现有基于多模态大语言模型的图像质量评估方法中存在的语义偏差和低层感知退化捕捉不足问题,提出基于工具的视觉证据推理范式。通过构建Q-Tool数据集并进行监督微调与强化学习,模型能自适应调用噪声残差等分析工具生成显式证据。实验显示,该方法在KonIQ、SPAQ等七个基准上平均PLCC/SRCC达0.795/0.784,优于现有对比方法。需注意工具库覆盖范围及推理延迟限制。

读回:利用预训练MLLM的零样本奖励模型提升文本生成图像性能

方法:SpectraReward

本文提出SpectraReward,一种无需训练、利用预训练多模态大语言模型(MLLM)的图像条件提示词对数似然作为奖励信号的方法。通过冻结的预训练MLLM对生成图像进行条件化,并执行单次教师强制前向传播计算提示词token级别的似然分布(语义谱),取其平均对数似然作为标量奖励。Self-SpectraReward是其在统一多模态模型(UMM)中的特例,使用模型自身的理解分支作为奖励模型,实现闭环自我改进。实验表明,该方法在GenEval、TIIF-Bench等基准上显著优于基线,且奖励MLLM的规模扩大并不总是带来单调的性能提升,30B左右的模型可能已足够。