三分钟导读:IQA-T1通过引入工具调用生成结构化视觉证据,解决了现有MLLM在图像质量评估中因语义偏差导致的低层感知退化捕捉不足问题。
英文题目:IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment
论文出处:arXiv 每日论文精选 · arXiv:2607.12375
原始论文:PDF / 论文页面
对应视频标题:IQA-T1:用工具调用生成视觉证据,破解大模型图像质量评估的语义偏差难题|推荐指数:★★★★★
这篇论文解决什么问题?
现有基于MLLM的IQA方法主要依赖文本推理或基于裁剪区域的视觉推理,前者存在语义偏差,后者缺乏显式的感知解释,导致对低层感知退化(如噪声、模糊)不敏感。
核心创新
- 提出基于工具的视觉证据推理范式,通过专用分析工具(如噪声残差图、梯度分布)生成显式感知证据。
- 构建Q-Tool数据集,包含11k条由工具生成的视觉证据支持的 multimodal reasoning chains。
- 设计两阶段训练流程,结合SFT和基于GRPO的强化学习,实现自适应工具调用。
方法概览
提出IQA-T1框架,包含两个阶段:(1) 在Q-Tool数据集上进行监督微调(SFT),学习基于证据的推理和工具调用语法;(2) 使用强化学习(RL)优化自适应工具调用策略,通过奖励函数平衡评分准确性与工具使用效率。
逐图理解论文
核心方法:工具化视觉证据推理

IQA-T1提出基于工具的视觉证据推理范式。模型通过调用专用分析工具,如生成噪声残差图或梯度分布图,构建显式的感知证据。这种结构化证据将低层视觉特征与高层语义推理连接,使质量评估建立在可验证的视觉基础之上,而非仅依赖文本幻觉。
数据构建:Q-Tool数据集

为支持该范式,研究构建了Q-Tool数据集。流程包括构建感知工具库、基于人工先验合成视觉证据驱动的推理链,以及多级验证。该数据集包含一万一千条高质量样本,确保模型能学习到基于证据的推理逻辑和工具调用语法。
训练流程:SFT与强化学习

IQA-T1采用两阶段训练。首先在Q-Tool上进行监督微调,学习基础推理与工具语法。随后使用基于组相对策略优化的强化学习,优化自适应工具调用策略。奖励函数平衡评分准确性与工具使用效率,使模型能根据图像复杂度动态调整工具调用次数。
实验设置与对比基线

模型在KonIQ数据集上训练,并在KonIQ、SPAQ、LiveW、KADID、PIPAL、CSIQ、AGIQA七个基准上进行评估。对比对象包括手工特征方法、深度学习IQA方法、无推理多模态大语言模型及有推理多模态大语言模型如Q-Insight和Zoom-IQA。
定性分析:证据的可解释性

定性对比显示,现有方法常产生错误描述或模糊判断。IQA-T1通过展示具体的视觉证据,如噪声分布图,提供了清晰的推理路径。这种可解释性不仅提高了结果的可信度,还帮助诊断模型在特定退化类型上的表现,这是纯文本推理方法无法提供的。
实验与关键结果
- 在KonIQ数据集上训练,在KonIQ, SPAQ, LiveW, KADID, PIPAL, CSIQ, AGIQA七个基准上进行评估。
- 与手工特征方法、深度学习IQA方法、无推理MLLM方法及有推理MLLM方法进行对比。
- 进行消融实验,分析视觉证据、动态工具调用策略及奖励组件的有效性。
- 评估模型在不同MLLM骨干网络(Qwen3-VL-2B, InternVL3.5-4B, Qwen3-VL-4B)上的泛化能力。
- 平均PLCC/SRCC为0.795/0.784,优于所有对比方法。(第 12 页)
- 在KonIQ上PLCC/SRCC达到0.942/0.925。(第 12 页)
- 动态工具调用策略在KonIQ上达到0.942/0.925,平均工具调用次数为2.34次。(第 15 页)
阅读时需要注意
- 依赖预定义的工具库,工具的覆盖范围限制了可检测的退化类型。
- 推理过程需要调用外部工具,增加了计算开销和延迟。
- 工具输出经过下采样以平衡空间结构保留和视觉token效率,可能丢失部分细节。
- 强化学习阶段的奖励函数权重(如λscore=5)对最终性能影响较大。
关联工作
- Q-Insight:对比方法,基于文本推理,缺乏显式视觉证据。(第 4 页)
- Zoom-IQA:对比方法,基于区域裁剪推理,缺乏结构化感知解释。(第 5 页)
- VisualQuality-R1:对比方法,基于强化学习的文本推理。(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
IQA-T1:基于工具的视觉证据推理用于图像质量评估
Jinjian Wu1* , Jiaqi Tang2* , Wei Wei1B , Yingying Yan1 , Jianmin Chen1 , Botong Geng1, Lei Zhang1 , and Qifeng Chen2B
1 中国西安,西北工业大学计算机学院 wujinjian@mail.nwpu.edu.cn weiweinwpu@nwpu.edu.cn 2 中国香港特别行政区,香港科技大学 jtang092@connect.ust.hk cqf@ust.hk
摘要。开放世界环境中的图像质量评估(IQA)由于泛化能力和可解释性有限,仍然具有挑战性。最近基于多模态大语言模型(MLLMs)的方法引入了文本推理来进行质量预测,然而它们的判断严重依赖于存在语义偏差的内部表示,这使得它们对低层感知退化不敏感。我们提出了 IQA-T1,这是一种基于工具的视觉证据推理框架,通过显式的感知观察来增强 MLLM 的推理能力。在推理过程中,模型自主调用专门的工具来生成视觉证据,例如噪声残差分析图、梯度统计、结构-频率谱等,这些证据被逐步整合到推理过程中。为了支持这一范式,我们构建了 Q-Tool,这是一个包含 11k 条基于工具生成证据的多模态推理链的数据集。在七个 IQA 基准上的大量实验表明,IQA-T1 在数据集上实现了最佳的整体性能,同时产生了可解释且基于证据的质量评估。代码和数据集可在 https://github.com/zibuyu-02/IQA-T1 获取。
关键词:图像质量评估 · 多模态大语言模型 · 基于工具的推理
1 引言
图像质量评估(IQA)旨在预测与人类主观判断一致的感知图像质量。在图像复原 [13,17,26,38]、增强 [2,32,40,52]、压缩 [10,28,54] 以及各种下游视觉应用 [42] 中,图像质量评估不仅在算法性能方面发挥着重要作用,还直接影响开放世界环境中视觉系统的可用性和鲁棒性。 随着多模态大语言模型(MLLMs)[1,20,39,43,53] 的快速发展,研究人员开始探索利用其推理能力,将 IQA 从分数回归转向语言驱动框架。
- 同等贡献。 B 通讯作者:Wei Wei 和 Qifeng Chen。
第 2 页
2 J. Wu 等
纯文本推理 基于工具的视觉证据推理
问题:这张图片的整体质量评分是多少? 推理:〈think〉图像显示两只海鸥站在沙滩上,似乎正在相互互动, 这表明了一个有意义的野生动物时刻。由于阳光明媚的海边环境, 光线看起来明亮且平衡。鉴于主要主体清晰可辨且位于中心,图像可能 语义偏差 表现出〈answer〉良好的……锐度〈/answer〉和清晰度。 〈/think〉 视觉证据 ……
基于区域的视觉推理 问题:这张图片的整体质量评分是多少? 问题:这张图片的整体质量评分是多少? 推理:〈think〉图像显示沙滩上有两只鸟,但结构 推理:〈think〉场景展示了宁静的海边 细节不清楚。这反映在 <GradientMagnitudeMap> 时刻,有两只海鸥作为…… 。〈/think〉 中,梯度响应相对较弱,表明结构清晰度有限。此外,<FourierMagnitudeSpectrum> 〈answer〉评分:{"bbox_2d": [[0.17, 0.32, 0.52, 0.87]], 表明高频分量分散,暗示图像中存在明显的噪声,导致整体结构质量降低。 "评分": ……, "工具": "裁剪"} 〈/answer〉 梯度〈/think〉和明显的频率 裁剪与缩放 推理:〈think〉图像看起来光线良好, 非结构化 色彩鲜艳〈answer〉,评分:{"bbox_2d":和锐度。[……],…… 〈/think〉"评分":……,"工具": 视觉区域 "最终"} 〈/answer〉 〈answer〉 …… 〈/answer〉
图 1:我们的视觉证据推理框架的动机。现有的基于 MLLM 的 IQA 方法通常遵循两种推理范式:纯文本推理,容易产生语义偏差;以及使用裁剪图像块进行基于区域的视觉推理,缺乏明确的感知解释。相比之下,我们的框架引入了基于工具的视觉证据范式,通过专门的分析工具生成结构化的视觉证据,从而实现基于感知和参考证据的质量推理。
尽管这种转变通过文本理由提高了可解释性,并通过语义先验提高了泛化能力,但我们发现现有的基于 MLLM 的 IQA 方法存在一个根本性的局限性:它们的质量评估依赖于内部表示的、具有语义偏差的视觉特征,而不是低级退化的明确、可验证的证据。这种局限性体现在两种主要的推理模式中,如图 1 所示。 (1) 纯文本推理。这些方法 [21, 51] 生成结构化的质量描述来解释和预测图像质量。然而,推理过程依赖于 MLLM 的内部表示和预训练的语义先验。 (2) 基于区域的视觉推理。为了解决纯文本推理中缺乏视觉基础的问题,最近的方法 [22, 24] 在逐步推理过程中引入原始图像的裁剪或缩放区域,旨在引导模型关注可能退化的区域。然而,这些区域本质上是非结构化的像素块,缺乏与特定感知属性的明确关联,因此无法形成支持推理过程的视觉证据。 为了弥补这一根本性差距,我们引入了 IQA-T1,这是一个为 IQA 实例化视觉证据推理范式的新型框架。核心见解是利用外部专门工具生成的明确且结构化的视觉证据来增强 MLLM 的推理过程。在推理期间,模型自主调用预定义库中的工具,每个工具旨在隔离特定的感知属性,以生成中间视觉表示,如噪声残差图、梯度幅度分布和傅里叶幅度谱。这些证据图像随后作为额外的视觉观察结果纳入推理链中。这一过程转
第 3 页
IQA-T1 3
将质量评估从纯粹的语义推理任务转变为视觉 grounded 且由证据驱动的过程。 实现这一范式需要赋予模型两种互补的能力:理解如何调用工具,以及学习何时战略性地调用。我们通过两阶段训练流程来解决这一问题。首先,监督微调(SFT)灌输基础行为:结构化推理、标准化的工具调用语法,以及将视觉证据与质量判断关联的能力。其次,采用精心设计的奖励函数的强化学习(RL)优化工具调用策略。整体训练奖励由格式奖励、评分奖励、工具使用奖励和工具重复惩罚组成,这些共同提高了评分准确性,同时抑制了冗余或不恰当的工具调用。 由于现有的 IQA 数据集均不支持视觉证据推理,我们构建了 Q-Tool,其中包含 11k 条基于工具生成的视觉证据的多模态推理链。该数据集通过三个阶段构建:工具库构建、视觉证据推理链生成和推理链验证。 我们在七个多样化的 IQA 基准上进行了全面评估。实验结果表明,IQA-T1 取得了最佳的整体性能,平均 PLCC / SRCC 为 0.795 / 0.784,超越了基于传统深度学习的方法和最近的基于 MLLM 的方法。进一步的消融研究表明,引入结构化视觉证据显著提高了质量预测的稳定性和准确性,验证了视觉证据推理框架在提高评估可靠性和可解释性方面的有效性。总之,我们的贡献有三方面:
– 我们提出了 IQA-T1,一种基于工具进行视觉证据推理的图像质量评估框架。它使 MLLMs 能够自主调用专用工具,动态构建结构化证据库,使质量评估建立在明确的感知表示之上。 – 我们引入了 Q-Tool,包含超过 11k 条高质量的多模态推理链,具有标准化的工具调用格式和严格的验证。 – 我们在多个 IQA 基准上对 IQA-T1 进行了广泛评估,证明了其相比传统 IQA 方法和最近的基于 MLLM 的基线所具有的 SOTA 性能。
2 相关工作
2.1 图像质量评估
图像质量评估(IQA)旨在预测与人类主观判断一致的感知图像质量。传统方法对质量退化进行建模,并在全参考(FR-IQA)[48] 或无参考(NR-IQA)[31,33,34] 设置下输出分数。随着多模态大语言模型(MLLMs)[1,20,43,53] 的快速发展,研究人员利用其跨模态理解能力,将 IQA 从判别性回归
第 4 页
4 J. Wu 等
朝着更具泛化能力、语言驱动框架的方向发展。现有的基于多模态大语言模型 (MLLMs) 的图像质量评估 (IQA) 研究可归纳为三种不断演进的范式:(1) 分数导向范式。早期的基于 MLLM 的方法将质量预测构建为分类、分布回归或对比学习任务,以提高数值准确性 [29, 45, 50, 56, 63]。虽然这些方法实现了与人类判断的高度相关性,但其输出仅限于数值,无法解释图像为何获得特定分数。这种不透明性限制了它们在需要可解释决策的应用中的实用性。(2) 描述导向范式。为了增强可解释性,描述导向方法 [5, 49, 57, 58] 生成结构化或细粒度的自然语言质量分析。通过生成对感知失真的文本描述,这些模型提供了对其质量判断的洞察。然而,它们通常依赖于使用从合成失真构建的文本描述进行的监督微调 (SFT),这无法捕捉真实世界退化模式的多样性和复杂性。此外,它们的训练目标优先考虑文本连贯性而非数值准确性,往往导致质量分数不稳定或不精确。(3) 文本推理范式。最近的研究引入了显式的推理过程,形成了“先推理后评分”的联合优化框架。以 Q-Insight [21] 和 VisualQuality-R1 [51] 为例,这些方法在预测质量分数之前生成逐步的文本理由,通常结合强化学习 (RL) 以使推理与评分对齐。尽管取得了这一进展,它们的质量判断仍然基于 MLLM 的内部表示,而这些表示本质上偏向于高层语义。正如我们在引言中所论证的,这种语义偏差使得这些方法难以捕捉低层退化线索,且其纯文本推理缺乏可验证的视觉锚点,导致生成的理由可能与实际的视觉证据脱节。
2.2 结合图像进行思考
认识到纯文本推理缺乏视觉 grounding(视觉基础),促使人们更广泛地探索图像积极参与推理过程的范式。这种新兴方向被称为“结合图像进行思考” (Thinking with Images) [36],它将视觉信息从被动输入转变为动态的认知工作区。最近的工作可分为三个渐进层次 [36]:(1) 工具驱动的视觉探索,其中模型调用外部工具(如裁剪和缩放)以获取细粒度的视觉证据 [27, 44, 47, 59, 62];(2) 程序化视觉操作,其中模型生成可执行代码以对图像进行结构化编辑 [7, 30, 46];以及 (3) 内在视觉想象,其中模型生成新的视觉内容作为中间推理步骤 [4, 12, 18, 61]。这些探索标志着从“关于图像的思考”向“结合图像的思考”的演变。
结合图像进行思考用于 IQA。将此范式应用于 IQA 代表了朝着解决纯文本推理中缺乏视觉证据这一问题的自然进展。Zoom-IQA [24] 和 Q-Probe [22] 等方法在推理过程中迭代地裁剪或缩放至证据区域,引导模型关注
第 5 页
IQA-T1 5
未验证 已丢弃 结构 清晰度 推理链 样本 工具设计 工具使用有效性 (完整性与正确性)
噪声 色彩 伪影
证据-文本对齐 工具库 (参考与解释)
亮度 自然度 (a) 工具库构建 逻辑连贯性 原始图像 问题 真实得分 (判断与推理流程) 分析 图像 质量 并提供 一个 最终 质量 <answer_start>{"score":4.49} 得分 从 1 (非常 差) 到 5 (优秀)。 <answer_end> 工具库推理链 人工策划的先验 图像 显示 该 图像的 清晰度 是 〈think〉极其锐利的叶片结构…… . 11k 高质量 这得到了 由 的 <GradientMagnitudeHistogram> 极其 高, 且 具有 非常 对叶脉的细致描绘 <image>,其中响应集中在较高的 视觉证据 幅度,在 叶片上。 颜色 <answer_start>{"score":4.49}<answer_end> 鲜艳且充满生机, 表明结构强健。…… .〈/think〉 推理链 Q-Tool …… GPT-4o (b) 视觉证据推理链构建 (c) 推理链验证
图 2: Q-Tool 数据集构建流程概述,包含三个关键 阶段:(a) 用于生成视觉证据的感知工具库构建;(b) 由人工策划先验引导的视觉证据 grounded 推理链合成;(c) 推理链的多级验证。
局部退化区域。尽管这些方法代表了重要的进展,但它们 仍存在根本性的局限:引入的区域是无结构的像素 补丁,仍然依赖模型的语义解释。它们不生成显式的、结构化的视觉证据,直接突出特定的感知 属性,如噪声特征、频率异常或结构 连贯性。因此,它们未能弥合语义推理与低级退化之间的表示差距,这促使我们提出基于工具生成视觉证据的 IQA-T1 框架。
3 数据集
现有的基于多模态大语言模型(MLLMs)的图像质量评估(IQA)方法存在一个根本性的局限:其 质量评估依赖于具有语义偏见的内部表示,而非 低级退化的显式、可验证证据。解决这一差距 需要一个数据集,在推理框架内显式建模感知 退化与结构化视觉证据之间的关系。然而,目前尚无此类数据集。为了支持视觉证据 推理模型的训练,我们引入了 Q-Tool——这是第一个专门为基于工具的视觉证据推理在 IQA 中设计的数据集。它包含 11k 高质量 多模态推理链,每条链都将显式的工具生成视觉证据与人类对齐的文本理由相结合。
第 6 页
6 J. Wu 等
Q-Tool 的构建由三个要求指导:(1) 数据集必须包含捕捉低级感知属性的显式视觉证据;(2) 推理链必须系统地整合这些证据与文本分析;(3) 整体结构必须支持对多模态大语言模型 (MLLMs) 进行监督微调 (SFT),以学习基于证据的推理行为。为了满足这些要求,我们设计了一个系统的三阶段构建流程,如图 2 所示。以下各节将详细描述每个阶段。
3.1 工具库构建
视觉证据推理的基础是生成低级感知属性的显式表示的能力。然而,正如第 1 节所述,多模态大语言模型 (MLLMs) 的内部表示本质上偏向于高级语义,无法捕捉噪声、模糊或频率异常等退化线索。为了克服这一限制,我们构建了一个专用感知工具库,每个工具都旨在隔离并可视化特定的质量相关属性。
设计原理。我们确定了图像质量评估 (IQA) 中关键的七个感知属性,包括结构、清晰度、噪声、伪影、亮度、色彩和自然度。基于这些属性,我们设计了 15 种相应的视觉证据类型。详细描述见补充材料。每个工具 $T_k$ 将输入图像 $I$ 映射为结构化视觉表示 $e_k = \psi(T_k(I))$,以突出标准多模态大语言模型 (MLLMs) 表示中不可见的退化模式。例如,NoiseResidualMap(噪声残差图)通过从原始图像中减去去噪版本来隔离传感器或压缩噪声;FourierMagnitudeSpectrum(傅里叶幅度谱)通过频域分析揭示周期性伪影;GradientOrientationCoherenceMap(梯度方向相干图)则暴露由模糊或过度平滑引起的结构不一致性。
实现考量。为了确保训练和推理的稳定性,所有工具共享三个特性。首先,它们采用统一的调用接口,允许多模态大语言模型 (MLLMs) 使用一致的语法调用任何工具。其次,输出经过适度下采样,以在保留空间结构和视觉标记效率之间取得平衡。第三,所有工具都是确定性的,保证在数据构建、监督微调 (SFT) 和强化学习 (RL) 阶段产生相同的输出——这是保持一致策略学习的关键要求。
该工具库为后续的推理链构建提供了感知基础,使得能够显式表示语义多模态大语言模型 (MLLMs) 表示中固有缺失的退化线索。
3.2 视觉证据推理链构建
在建立工具库之后,我们接下来构建多模态推理链,将视觉证据系统地整合到质量评估中。推理链包括:(i) 在适当的分析阶段显式调用工具,(ii) 对生成的视觉证据进行解释,以及 (iii) 基于累积证据逻辑推导出的最终质量判断。
第 7 页
IQA-T1 7
朴素生成的挑战。直接提示大语言模型自主生成此类推理链会导致语义幻觉、逻辑不连续以及工具使用不当。生成的推理链缺乏有效监督所需的、证据与判断之间结构化且可验证的关系。
人工构建的推理模板。为解决这一问题,我们首先开发了人工构建的推理模板,其中编码了关于感知分析的专家知识。这些模板定义了:将质量评估分解为各个阶段的逻辑(例如,“检查结构”、“分析噪声”、“评估色彩保真度”);从感知属性到合适工具的映射;以及观察到的证据与最终质量判断之间的因果关系。这些模板作为语义约束,确保生成的推理链遵循与人类对齐的感知逻辑。
利用 GPT-4o 进行约束生成。在这些约束下,我们利用 GPT-4o 生成完整的多模态推理链。对于每张图像,模型接收:图像本身、相应的推理模板以及对工具库的访问权限。在每个指定阶段,模型插入显式的工具调用,生成的视觉证据被整合到后续分析中。这一过程将纯文本推理转化为基于证据的程序,其中每个推理步骤都依赖于可观察的视觉信号。
通过结合人类感知先验与控制模型生成,我们产生了既具有逻辑结构又基于可验证证据的推理链。
3.3 推理链验证
Q-Tool 作为训练资源的可靠性取决于其组成推理链的质量。因此,我们进行系统的多级验证,以确保工具使用、视觉证据和推理逻辑之间保持一致的对齐。
验证协议。对每条生成的推理链沿三个维度进行检查。(1) 工具适宜性:工具调用是否与预期的推理阶段和分析目的相一致?我们验证工具既无冗余也未不当使用。(2) 证据 grounding(基于证据):生成的视觉证据是否被正确引用、解释并整合到文本推理中?我们确保每张证据图像都发挥真正的分析功能,而非仅作为装饰性元素。(3) 逻辑一致性:最终的质量判断是否得到先前证据积累的有力支持?我们拒绝那些结论缺乏充分证据支持或表现出逻辑不连续的推理链。
质量优化。任何不符合验证标准的推理链均被移除。一部分边缘案例经过人工优化,以纠正细微的不一致之处,同时保留整体结构。这一严格的验证过程最终产生了包含 11k 条高质量推理链的数据集,每条推理链均表现出:(i) 恰当的工具利用,(ii) 视觉证据的连贯整合,以及 (iii) 逻辑严密的质量判断。
第 8 页
8 J. Wu 等
证据 1 参考
证据 2 [ �� 模型 O1 … ] [ �� ] [ �� ] O2 工具调用 <E> 思维链结束 KL-损失 O3 视觉编码器 & 问题 问题: … 投影层 您对这张图片的整体质量如何评分?评分范围为 1(非常差)到 5(优秀)。 分析 图像 评分 策略 质量 and provide a of this picture? 输出 多模态 模型 最终质量 分数 大语言模型 from 1 (very poor) to 5 (excellent).
工具使用奖励 文本思维链① 文本思维链② 文本思维链③<E> 文本思维链③答案
原始图像 重复惩罚 �� �� 文本思维链����… 得分奖励 工具库 GT (a) 基于证据的推理学习�� (b) 自适应工具调用策略优化
图 3: 提出的 IQA-T1 框架概述。该模型分两个阶段运行:(1) 在 Q-Tool 数据集上进行监督微调 (SFT),以学习基于证据的推理和工具调用语法;(2) 使用定制的奖励函数进行强化学习 (RL),以优化自适应工具调用策略。在推理过程中,模型自主调用工具以获取视觉证据 $E_r$,并将其整合到推理链中,从而为质量评估提供依据。
生成的 Q-Tool 数据集为后续两阶段训练流程(第 4.3 节和第 4.3 节)中学习基于证据的推理行为提供了必要的监督,构成了本工作引入的视觉证据推理范式的基础。
4 方法论
在本节中,我们首先形式化基于多模态大语言模型 (MLLM) 的图像质量评估 (IQA) 问题,并强调标准视觉表示中固有的语义偏差(第 4.1 节)。随后,我们介绍提出的视觉证据推理框架(第 4.2 节),并描述由监督微调(第 4.3 节)和强化学习(第 4.3 节)组成的两阶段训练流程,旨在赋予模型基础推理能力和自适应工具调用策略。
4.1 问题形式化
基于 MLLM 的 IQA 作为序列生成。我们将基于多模态大语言模型 (MLLM) 的图像质量评估 (IQA) 形式化为条件序列生成问题。令 $I \in \mathbb{R}^{H \times W \times 3}$ 表示输入图像,$P$ 表示文本提示(例如,“评估这张图片的质量”)。目标输出是一个序列 $Y = \{y_1, y_2, . . . , y_T\}$,其中包括推理链和最终质量分数 $s \in \mathbb{R}$(通常归一化到 [1, 5])。标准 MLLM
第 9 页
IQA-T1 9
由视觉编码器 $E_\phi$、模态投影器 $M$ 和大语言模型(LLM)$G_\theta$ 组成。图像首先被编码并投影为与文本嵌入空间对齐的视觉标记序列:$z_v = M E_\phi(I) \in \mathbb{R}^{L \times d}$,其中 $L$ 是视觉标记的数量,$d$ 是嵌入维度。推理过程随后对基于多模态输入的条件输出序列的后验分布进行建模:
$$ p(Y \mid I, P) = \prod_{t=1}^{T} p_\theta(y_t \mid \mathbf{h}_p, y_{<t}), \label{eq:vlm_inference} \tag{1} $$
其中 $\mathbf{h}_p$ 表示提示嵌入,$y_{<t}$ 表示先前生成的标记。
视觉表示中的语义偏差。越来越多的工作 [3,23] 表明,由多模态大语言模型(MLLMs)产生的视觉表示 $z_v$ 高度偏向于高层语义内容,而对图像质量评估(IQA)至关重要的低层感知退化(如噪声、模糊或压缩伪影)的敏感性有限。形式上,考虑图像 $I$ 及其感知退化的对应物 $I_d$(例如,添加了噪声)。尽管人类观察者会分配显著不同的质量分数 $s(I)$ 和 $s(I_d)$,但相应的视觉表示往往几乎相同:
$$ \| \mathbf{z}_v(I) – \mathbf{z}_v(I_d) \|_2 \approx |s(I) – s(I_d)| \epsilon \label{eq:semantic_bias} \tag{2} $$
其中 $\epsilon$ 是一个小的容差值。这一观察结果表明,仅凭 $z_v$ 不足以捕捉准确质量评估所需的退化线索,从而促使引入互补的感知证据。
4.2 视觉证据推理
为了弥补 $z_v$ 中的信息损失,我们提出了一种框架,通过外部工具生成的显式、结构化的视觉证据来增强多模态大语言模型(MLLMs)的推理过程。令 $T = \{T_k\}_{k=1}^K$ 表示一组专门的感知分析工具库,每个工具将图像映射到面向退化的特征空间:$T_k : \mathbb{R}^{H \times W \times 3} \rightarrow D_k$,其中 $D_k$ 是输出域(例如,残差图、直方图或频谱)。图像 $I$ 的所有可能视觉证据集合定义为
$$ \mathbf{E} = \{ e_k \mid e_k = \psi(T_k(I)), \; k=1,\dots,K \}, \tag{3} $$
其中 $\psi(\cdot)$ 将工具输出投影到 LLM 的上下文空间中(例如,下采样和标记化)。
在推理过程中,模型并非预先访问整个集合 $\mathbf{E}$。相反,它在适当的推理步骤中调用相关工具,动态构建子集 $E_r \subseteq \mathbf{E}$。因此,生成过程同时基于原始视觉标记和逐步获取的证据进行条件建模:
$$ \hat{Y} = \text{parametrize} \left( \arg\max_{Y} \sum_{t=1}^{T} p_\theta(y_t \mid \mathbf{h}_p, \mathbf{y}_{<t}) \right). \label{eq:evidence_inference} \tag{4} $$
第 10 页
10 J. Wu 等
证据 $E_r$ 作为动态获取的感知补充,服务于 $z_v$,使模型能够将每个推理步骤锚定在可验证的低层视觉线索上。这种表述将图像质量评估(IQA)从纯粹的语义推理任务转变为基于证据的推理过程。
4.3 两阶段训练流程
实现视觉证据推理范式需要为多模态大语言模型(MLLMs)配备两种互补的能力:(i) 理解如何调用工具并解释生成的证据,以及 (ii) 学习何时战略性地调用工具,以在避免冗余的同时最大化评估准确性。我们通过两阶段流程来解决这些问题:在 Q-Tool 数据集上进行监督微调(SFT)以建立基础的推理行为,随后通过强化学习(RL)优化自适应工具调用策略。
阶段一:基于证据的推理学习
在此阶段,我们在 Q-Tool 数据集上训练模型,以学习结构化的、基于证据的推理链。每个训练样本由原始图像 $I$、一组工具生成的视觉证据 $V$(对应于真实标签的调用)以及整合了证据并最终得出质量分数 $s_{gt}$ 的文本推理链 $T$ 组成。
关键在于,模型不需要自行生成视觉证据,因为证据是由工具确定性生成的,并作为输入提供。在 SFT 期间,我们对表示证据图像的标记应用损失掩码,因为它们不是预测目标。目标是在给定完整上下文的条件下最大化推理标记的似然性:
$$ \mathcal{L}_{\text{SFT}} = \sum_{t=1}^{L} P_\theta(y_t \mid y_{<t}, I, V, T), \label{eq:sft_loss} \tag{5} $$
其中 $y_t$ 表示推理序列(包括最终分数)的第 $t$ 个真实标签标记,$L$ 为其长度。优化公式 (5) 植入了三种关键行为:(i) 遵循结构化推理模板的能力,(ii) 正确的工具调用语法,以及 (iii) 将视觉证据与质量判断关联起来的能力。此阶段初始化了一个策略 $\pi_{\text{SFT}}$,作为后续 RL 微调的基础。
阶段二:自适应工具调用策略优化
虽然 SFT 建立了正确的推理模式,但它并未显式优化何时调用哪个工具的策略。为了学习自适应调用策略,我们采用强化学习,其奖励函数旨在平衡预测准确性、证据效率和推理稳定性。
强化学习设置。我们采用组相对策略优化(GRPO)[9],这是 PPO 的一种变体,它通过组内比较来估计优势,从而无需单独的价值网络 [41]。给定提示 $x$,当前策略 $\pi_\theta$ 采样一组 $n$ 条推理链 $\{y_1, \dots, y_n\}$。目标函数为:
$$ \mathcal{L}_{\text{GRPO}}(\theta) = – \mathbb{E}_{x\sim\mathcal{D},\,y_i\sim\pi_\theta(\cdot|x)} \left[ \hat{A}_i \frac{\pi_\theta(y_i|x)}{\pi_{\text{ref}}(y_i|x)} – \beta D_{\mathrm{KL}}\left(\pi_\theta \| \pi_{\text{ref}}\right) \right] \label{eq:grpo} \tag{6} $$
第 11 页
IQA-T1 11
其中 $\hat{A}_i = (R_i – \mu_R)/\sigma_R$ 是组内的归一化优势,$\pi_{\text{ref}}$ 是第一阶段(Stage I)的参考策略,$\beta$ 控制 KL 惩罚以防止灾难性遗忘。
奖励设计。奖励函数 $R(x, y)$ 是四个组件的加权和:
(1) 格式奖励 $R_{\text{fmt}}$:强制输出符合预期的结构化格式(例如,包含工具调用标签和最终得分)。如果格式正确则为 1,否则为 0。
(2) 评分奖励 $R_{\text{score}}$:衡量预测质量分数 $s_{\text{pred}}$ 相对于真实值 $s_{\text{gt}}$ 的准确性:
$$ R_{\text{score}} = \exp(-\alpha|s_{\text{pred}} – s_{\text{gt}}|) \quad (7) $$
其中 $\alpha > 0$ 控制灵敏度。
(3) 工具使用奖励 $R_{\text{tool}}$:通过奖励适当数量的工具调用来鼓励高效地获取证据。令 $N = |E_r|$ 为收集到的不同证据项的数量。则
$$ R_{\text{tool}}(N) = \begin{cases} 0, & N=0, \\ 1, & 0 < N \le M, \\ -(N-M)^2, & N > M, \end{cases} \quad (8) $$
其中 $M$ 是预定义的最大值(在我们的实验中设置为 4),$\gamma$ 控制过度调用的惩罚。此奖励被有意设计为一种弱约束,而非严格的工具级监督信号,因为现实世界中的 IQA 图像通常涉及混合退化,并且可能允许多种有效的工具组合。因此,$R_{\text{tool}}$ 鼓励模型获取足够的视觉证据,同时保留自适应工具选择的灵活性。
(4) 重复惩罚 $R_{\text{rep}}$:防止模型在未取得新信息的情况下重复调用同一工具的退化行为:
$$ R_{\text{rep}} = \begin{cases} -1, & \exists k \in \{1, \dots, K\}: n_k > 1, \\ 0, & \text{otherwise}, \end{cases} \quad (9) $$
其中 $n_k$ 是工具 $T_k$ 的调用次数。
总奖励为
$$ R = \lambda_{\text{fmt}} R_{\text{fmt}} + \lambda_{\text{score}} R_{\text{score}} + \lambda_{\text{tool}} R_{\text{tool}} + \lambda_{\text{rep}} R_{\text{rep}}, \quad (10) $$
权重 $\lambda$ 用于平衡各部分的贡献(经验设置为 $\lambda_{\text{fmt}} = 1, \lambda_{\text{score}} = 5, \lambda_{\text{tool}} = 1, \lambda_{\text{rep}} = 2$)。通过这种奖励公式,强化学习(RL)阶段优化了工具调用策略,以在保持感知证据高效且非冗余使用的前提下最大化评分准确性,最终得到一个推理既准确又可解释的模型。
第 12 页
12 J. Wu 等
表 1:在我们的方法与其他具有竞争力的图像质量评估(IQA)方法之间,在分数回归任务上的 PLCC/SRCC 比较。除手工特征方法外,所有方法均在 KonIQ 数据集上训练。AVG. 表示在所有评估数据集上的平均 PLCC/SRCC。最佳结果加粗显示,次佳结果下划线标示。
野生图像 合成失真 AI 生成 方法 AVG. KonIQ [11] SPAQ [6] LiveW [8] KADID [25] PIPAL [14] CSIQ [16] AGIQA [19]
手工特征方法
NIQE [34] 0.533 / 0.530 0.679 / 0.664 0.493 / 0.449 0.468 / 0.405 0.195 / 0.161 0.718 / 0.628 0.560 / 0.533 0.521 / 0.481 BRISQUE [33] 0.225 / 0.226 0.490 / 0.406 0.361 / 0.313 0.429 / 0.356 0.267 / 0.232 0.740 / 0.556 0.541 / 0.497 0.436 / 0.369
非多模态大语言模型方法
NIMA [37] 0.896 / 0.859 0.838 / 0.856 0.814 / 0.771 0.532 / 0.535 0.390 / 0.399 0.695 / 0.649 0.715 / 0.654 0.697 / 0.675 HyperIQA [35] 0.917 / 0.906 0.791 / 0.788 0.772 / 0.749 0.506 / 0.468 0.410 / 0.403 0.752 / 0.717 0.702 / 0.640 0.693 / 0.667 DBCNN [60] 0.884 / 0.875 0.812 / 0.806 0.773 / 0.755 0.497 / 0.484 0.384 / 0.381 0.586 / 0.572 0.730 / 0.641 0.667 / 0.645 MUSIQ [15] 0.924 / 0.929 0.868 / 0.863 0.789 / 0.830 0.575 / 0.556 0.431 / 0.431 0.771 / 0.710 0.722 / 0.630 0.726 / 0.707 ManIQA [55] 0.849 / 0.834 0.768 / 0.758 0.849 / 0.832 0.499 / 0.465 0.457 / 0.452 0.623 / 0.627 0.723 / 0.636 0.681 / 0.658
基于多模态大语言模型的方法(无推理)
CLIP-IQA+ [45] 0.909 / 0.895 0.866 / 0.864 0.832 / 0.805 0.653 / 0.654 0.427 / 0.419 0.772 / 0.719 0.736 / 0.685 0.742 / 0.720 C2Score [63] 0.923 / 0.910 0.867 / 0.860 0.786 / 0.772 0.500 / 0.453 0.354 / 0.342 0.735 / 0.705 0.777 / 0.671 0.706 / 0.673 Q-Align [50] 0.941 / 0.940 0.886 / 0.887 0.853 / 0.860 0.674 / 0.684 0.403 / 0.419 0.671 / 0.737 0.772 / 0.735 0.743 / 0.752 DeQA [56] 0.953 / 0.941 0.895 / 0.896 0.892 / 0.879 0.694 / 0.687 0.472 / 0.478 0.787 / 0.744 0.809 / 0.729 0.786 / 0.765
基于多模态大语言模型的方法(含推理)
Q-Insight [21] 0.918 / 0.895 0.903 / 0.903 0.870 / 0.839 0.702 / 0.702 0.458 / 0.435 0.685 / 0.640 0.816 / 0.766 0.765 / 0.740 VisualQuality-R1 [51] 0.910 / 0.896 0.889 / 0.892 0.856 / 0.827 0.703 / 0.712 0.451 / 0.441 0.768 / 0.707 0.817 / 0.760 0.771 / 0.748 Zoom-IQA [24] 0.938 / 0.922 0.902 / 0.900 0.887 / 0.870 0.701 / 0.700 0.468 / 0.465 0.797 / 0.754 0.816 / 0.765 0.787 / 0.768 IQA-T1 0.942 / 0.925 0.905 / 0.908 0.888 / 0.860 0.686 / 0.708 0.480 / 0.490 0.850 / 0.840 0.816 / 0.754 0.795 / 0.784
5 实验
5.1 实验设置
数据集与指标。为了评估 IQA-T1 在各种退化情况下的鲁棒性,我们遵循先前的工作,在 KonIQ [11] 上训练模型,并在六个 IQA 基准测试上评估其跨分布泛化能力。KonIQ [11]、SPAQ [6] 和 LIVE-Wild [8] 代表真实世界的失真;KADID [25] 和 CSIQ [16] 包含合成失真;而 PIPAL [14] 侧重于算法引起的退化。我们进一步包含 AGIQA [19] 以评估 AI 生成内容。遵循常见的 IQA 实践,性能使用 PLCC 和 SRCC 进行衡量。
实现细节。我们的框架基于 Qwen3-VL-4B 构建,并采用两阶段训练流程。在第一阶段,我们使用交叉熵损失在我们的 Q-Tool 数据集上进行监督微调(SFT)。训练使用批量大小 1、16 次梯度累积步数、学习率 1 × 10−5 以及 0.05 的预热比例,持续两个 epoch。在第二阶段,我们应用组相对策略优化(GRPO)以进一步使模型与感知质量偏好对齐。GRPO 训练从 SFT 检查点初始化,全局批量大小为 12,每个 GPU 的微批量大小为 1。学习率设置为 1 × 10−6,每个提示生成 N = 8 个 rollout 样本。训练在六块 NVIDIA RTX 4090 GPU 上进行,KL 惩罚系数固定为 1 × 10−2。
基线方法。我们在图像质量分数回归任务上,将 IQA-T1 与四类基线方法进行评估。(1)传统手工特征 IQA
第 13 页
IQA-T1 13
〈think〉 这张图片似乎是一个军用级机器人,可能是 〈think〉该图像表现出明显的模糊,缺乏 原始图像 美国海军陆战队(USMC)的模型。图像的整体清晰度和锐利边缘,如 <GradientMagnitudeMap> 聚焦和清晰度较低,因为图像看起来模糊, 并且存在一些颗粒感或噪点。构图以 机器人为中心,但焦点的缺失 略微掩盖了细节。〈/think〉 其中弱边缘响应占主导地位,证实了结构清晰度的降低。图像中明显存在噪点, 〈think〉图像显示一个穿着 〈/think〉在 <NoiseResidualMap> 中表现为颗粒感 用户 细节丰富且结构化的服装的人物。 然而,它具有明显的模糊、 像素化和噪点。缺乏 问题 纹理的细颗粒感和锐度,使得视觉 视觉证据 工具库 您对这张图片的 这张图片的质量的 细节难以辨认。照明似乎充足, 整体评分? 焦点主要集中在中心 真实值:2.66 主体上。〈/think〉 这表明噪点水平被放大。总体而言,该图像 〈答案〉2.41〈/答案〉 表现出较低的感知质量。〈/think〉 <answer_start>{"score": 2.67}<answer_end>
图 4:IQA-T1 与竞争方法的定性比较。我们突出显示: 不正确的描述,以及我们模型独有的视觉证据推理。
指标,包括 NIQE [34] 和 BRISQUE [33]。(2)基于深度学习的 IQA 模型,如 NIMA [37]、HyperIQA [35]、DBCNN [60]、MUSIQ [15] 和 ManIQA [55]。(3)基于 MLLM 的分数预测方法,包括 CLIP-IQA+ [45]、 C2Score [63]、Q-Align [50] 和 DeQA [56]。(4)具有推理能力的基于 MLLM 的框架,如 Q-Insight [21]、VisualQuality-R1 [51] 和 Zoom-IQA [24]。
5.2 主要结果
表 1 展示了所有方法和数据集的 PLCC 和 SRCC 的全面比较。我们提出的 IQA-T1 在七个数据集上实现了最高的平均 PLCC(0.795)和 SRCC(0.784)。 与无推理的基于 MLLM 的方法的比较。诸如 Q-Align [50] 和 DeQA [56] 之类的方法仅专注于分数回归,并取得了强大的性能,特别是在 KonIQ [11] 等分布内数据集上。 然而,它们缺乏解释其判断的能力。IQA-T1 不仅在分数准确性方面保持高度竞争力,而且还能生成可解释的、基于证据的推理链,提供了精度和透明度的独特组合。 与基于 MLLM 的推理方法的比较。在同时生成分数和理由的方法中,IQA-T1 表现出强大的跨分布泛化能力(定性示例见图 4)。它在真实世界图像(例如 SPAQ [6])上表现出稳健的性能,在典型的合成和算法引起的失真数据集(分别是 CSIQ [16] 和 PIPAL [14])上建立了新的最高结果,并且在 AI 生成内容(AGIQA [19])上仍然具有高度竞争力。 这些结果为本文的中心论点提供了强有力的实证证据:通过用显式的、由工具生成的视觉证据增强 MLLM 推理,IQA-T1 有效地减少了标准 MLLM 表示中固有的语义偏差。
第 14 页
14 J. Wu 等
〈think〉图像看起来曝光平衡,亮度分布稳定,且<LuminanceHistogram> 图像看起来色彩自然,曝光可接受,但主要结构缺乏锐度,如<GradientMagnitudeHistogram>所示 原始图像 问题 进一步证实了大多数强度分布在合理范围内。色彩看起来鲜艳自然,<PerceptualColorfulnessMap> ,表明细节和纹理的丢失。背景显示出噪声迹象和清晰度降低。 您对这张图片的 <PerceptualColorfulnessMap>显示色彩强度一致,无 <NoiseResidualMap>进一步证实了背景区域存在明显的噪声,这降低了整体视觉 整体质量评分吗? 过饱和现象。基于稳定的曝光和自然的色彩外观,该图像被评估为具有高感知质量。〈/think〉 清晰度。总体而言,图像表现出中等质量。 <answer_start>{"score": 4.47}<answer_end> 〈/think〉 <answer_start>{"score": 3.97}<answer_end>
图 5:IQA-T1 与竞争方法的定性比较。
表 2:在 KonIQ 数据集上训练的所有模型的 PLCC 和 SRCC 测量的各组件消融研究。
工具 SFT Rtool Rrep KonIQ [11] SPAQ [6] LiveW [8] KADID [25] PIPAL [14] CSIQ [16] AGIQA [19] 平均 × ✓ × × 0.843 / 0.817 0.848 / 0.836 0.789 / 0.742 0.621 / 0.603 0.412 / 0.418 0.675 / 0.640 0.747 / 0.701 0.705 / 0.680 ✓ ✓ × × 0.915 / 0.901 0.891 / 0.890 0.826 / 0.774 0.660 / 0.705 0.464 / 0.455 0.768 / 0.730 0.770 / 0.712 0.756 / 0.738 ✓ ✓ ✓ × 0.933 / 0.917 0.903 / 0.904 0.881 / 0.858 0.684 / 0.704 0.479 / 0.481 0.841 / 0.835 0.811 / 0.739 0.790 / 0.777 ✓ ✓ × ✓ 0.935 / 0.919 0.902 / 0.902 0.874 / 0.840 0.689 / 0.708 0.481 / 0.485 0.838 / 0.832 0.804 / 0.742 0.789 / 0.775 ✓ ✓ ✓ ✓ 0.942 / 0.925 0.905 / 0.908 0.888 / 0.860 0.686 / 0.708 0.480 / 0.490 0.850 / 0.840 0.816 / 0.754 0.795 / 0.784
5.3 消融研究与分析
我们提供了一系列互补分析,以更好地理解 IQA-T1 的有效性和通用性。表 2 隔离了各个组件的贡献,表 3 比较了不同的工具调用策略及其推理成本,表 4 评估了所提出的框架在不同 MLLM 骨干网络上的鲁棒性。 视觉证据的有效性。我们首先通过比较两种 SFT 变体来检查工具生成的视觉证据的效果:一种变体中工具调用仅返回占位符而没有实际证据(表 2 第 1 行),另一种变体在推理过程中有视觉证据可用(表 2 第 2 行)。由于两种变体共享相同的训练目标和推理模板,这种差异隔离了视觉证据的影响。结果表明,在所有数据集上都有持续的提升,这表明结构化的视觉证据有效地补偿了 $z_v$ 中的低级信息损失,并缓解了第 4.1 节中讨论的语义偏差。 动态工具调用的有效性。我们在表 3 中将动态工具调用与所有、固定和随机工具选择策略进行了比较。与基础 Qwen3-VL-4B 相比,工具生成的证据带来了明显的提升,同时推理开销适中。然而,更多的证据并不一定更好,因为不相关的工具可能会引入冗余的视觉 token 和干扰线索。相比之下,动态调用为每张图像自适应地选择相关证据,以较少的工具调用实现了最佳性能。图 5 中的定性案例研究进一步表明,与主要退化对齐的工具为质量判断提供了更强的支持,表明 IQA-T1 受益于证据推理,而不仅仅是简单的分数拟合。 奖励设计的有效性。接下来,我们分析 RL 阶段奖励组件的贡献。从完整模型开始,我们在表 2 中分别消融了工具使用奖励 $R_{tool}$ 或重复惩罚 $R_{rep}$。移除
第 15 页
IQA-T1 15
表 3:在 KonIQ 数据集上不同工具调用策略的消融研究。
方法 PLCC SRCC 平均工具数 平均时间(s) 峰值内存(GB) Qwen3-VL-4B 0.785 0.744 0.00 4.62 8.52 IQA-T1 (全部工具) 0.865 0.841 15.00 6.06 9.13 IQA-T1 (固定-K) 0.895 0.869 3.00 5.32 8.70 IQA-T1 (随机-K) 0.871 0.854 3.00 5.42 8.74 IQA-T1 (动态) 0.942 0.925 2.34 5.09 8.67
表 4:IQA-T1 在不同 MLLM 骨干网络上的泛化能力。结果报告为 PLCC/SRCC。
方法 KonIQ [11] SPAQ [6] LiveW [8] KADID [25] PIPAL [14] CSIQ [16] AGIQA [19] IQA-T1 (Qwen3-VL-2B) 0.929 / 0.910 0.892 / 0.898 0.851 / 0.800 0.654 / 0.700 0.471 / 0.470 0.812 / 0.773 0.792 / 0.723 IQA-T1 (InternVL3.5-4B) 0.898 / 0.897 0.881 / 0.875 0.842 / 0.821 0.701 / 0.719 0.443 / 0.437 0.749 / 0.733 0.822 / 0.774 IQA-T1 (Qwen3-VL-4B) 0.942 / 0.925 0.905 / 0.908 0.888 / 0.860 0.686 / 0.708 0.480 / 0.490 0.850 / 0.840 0.816 / 0.754
任一组件的缺失都会导致性能下降,表明这两个奖励对于基于工具的推理的稳定性都是必要的。具体而言,$R_{tool}$ 鼓励模型获取充分的感知证据,而 $R_{rep}$ 则抑制冗余或重复的工具调用。它们的结合使模型能够在证据充分性和证据多样性之间取得平衡,从而产生更可靠的质量预测。 跨骨干网络的通用性。为了检验所提出的框架是否依赖于特定的 MLLM 架构,我们使用不同的骨干网络实例化了 IQA-T1,包括 Qwen3-VL-2B、InternVL3.5-4B 和 Qwen3-VL-4B。如表 4 所示,IQA-T1 在不同的模型规模和架构下均保持了强大的性能。尽管绝对性能随骨干网络容量和预训练特性的不同而变化,但在真实世界、合成、算法诱导和 AI 生成的图像质量基准测试中,整体趋势保持一致。这些结果表明,基于工具的视觉证据推理是一种增强基于 MLLM 的图像质量评估的通用机制,而非特定于骨干网络的设计。
6 结论
在本工作中,我们引入了 IQA-T1,这是一个基于工具的视觉证据推理框架,它将图像质量评估建立在明确的感知证据之上,而非语义偏差的内部表示。通过使 MLLM 能够自主调用专门的分析工具,我们的方法将 IQA 从纯粹的语义推理转变为基于证据的推理过程。在提出的 Q-Tool 数据集以及结合监督学习和强化学习的两阶段训练策略的支持下,IQA-T1 在多个 IQA 基准测试中取得了最佳平均性能,同时提供了基于视觉证据的可解释推理。我们希望这项工作能鼓励未来研究将结构化的视觉证据整合到多模态推理系统中,从而在多模态大语言模型中推动更可靠和可解释的感知能力。
第 16 页
16 J. Wu 等
致谢
本研究部分获得国家自然科学基金(项目编号:62472359,62372379)资助,部分获得西安市重点产业链核心技术突破项目资助(项目编号:Grand 24ZDCYJSGG0003,AI核心技术突破),以及香港科技大学资助(项目编号:WEB26EG02)。
参考文献
1. Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F.L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., 等:Gpt-4 技术报告。arXiv 预印本 arXiv:2303.08774 (2023) 2. An, S., Xu, L., Deng, Z., Zhang, H.: Hfm:一种用于水下图像增强的混合融合方法。Engineering applications of artificial intelligence 127, 107219 (2024) 3. Chen, B., Pan, S., Wu, D., Xie, L., Sui, X., Zhu, L., Zhu, H:缓解感知偏差:一种无需训练的方法以增强 LMM 用于图像质量评估。在:AAAI 人工智能会议论文集。第 40 卷,pp. 2760– 2768 (2026) 4. Chen, J., Xu, Z., Pan, X., Hu, Y., Qin, C., Goldstein, T., Huang, L., Zhou, T., Xie, S., Savarese, S., 等:Blip3-o:一系列完全开放的统一多模态模型——架构、训练与数据集。arXiv 预印本 arXiv:2505.09568 (2025) 5. Chen, Z., Zhang, X., Li, W., Pei, R., Song, F., Min, X., Liu, X., Yuan, X., Guo, Y., Zhang, Y:Grounding-iqa:用于图像质量评估的多模态语言定位模型。arXiv 预印本 arXiv:2411.17237 10 (2024) 6. Fang, Y., Zhu, H., Zeng, Y., Ma, K., Wang, Z:智能手机摄影的感知质量评估。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3677–3686 (2020) 7. Fu, X., Liu, M., Yang, Z., Corring, J., Lu, Y., Yang, J., Roth, D., Florencio, D., Zhang, C:Refocus:视觉编辑作为结构化图像理解的思维链。arXiv 预印本 arXiv:2501.05452 (2025) 8. Ghadiyaram, D., Bovik, A.C:Live in the wild 图像质量挑战赛数据库。在线:http://live. ece. utexas. edu/research/ChallengeDB/index. html [2017年3月] 2(5), 6 (2015) 9. Guo, D., Yang, D., Zhang, H., Song, J., Zhang, R., Xu, R., Zhu, Q., Ma, S., Wang, P., Bi, X., 等:Deepseek-r1:通过强化学习激励大语言模型的推理能力。arXiv 预印本 arXiv:2501.12948 (2025) 10. He, D., Yang, Z., Peng, W., Ma, R., Qin, H., Wang, Y:Elic:具有非均匀分组空-信道上下文自适应编码的高效学习图像压缩。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 5718–5727 (2022) 11. Hosu, V., Lin, H., Sziranyi, T., Saupe, D:Koniq-10k:一个用于盲图像质量评估深度学习的环境有效数据库。IEEE Transactions on Image Processing 29, 4041–4056 (2020) 12. Jiang, D., Guo, Z., Zhang, R., Zong, Z., Li, H., Zhuo, L., Yan, S., Heng, P.A., Li, H:T2i-r1:通过协作语义级和词元级思维链强化图像生成。arXiv 预印本 arXiv:2505.00703 (2025)
第 17 页
IQA-T1 17
13. Jiang, J., Zuo, Z., Wu, G., Jiang, K., Liu, X.: 全合一图像恢复综述:分类、评估与未来趋势。IEEE 模式分析与机器智能汇刊 (2025) 14. Jinjin, G., Haoming, C., Haoyu, C., Xiaoxing, Y., Ren, J.S., Chao, D.: Pipal:用于感知图像恢复的大规模图像质量评估数据集。在:欧洲计算机视觉会议。页码 633–651。Springer (2020) 15. Ke, J., Wang, Q., Wang, Y., Milanfar, P., Yang, F.: Musiq:多尺度图像质量Transformer。在:IEEE/CVF 国际计算机视觉会议论文集。页码 5148–5157 (2021) 16. Larson, E.C., Chandler, D.M.: 最明显失真:全参考图像质量评估与策略的作用。电子成像杂志 19(1), 011006–011006 (2010) 17. Li, B., Zhao, H., Wang, W., Hu, P., Gou, Y., Peng, X.: Mair:一种用于图像恢复的保持局部性和连续性的 Mamba 模型。在:计算机视觉与模式识别会议论文集。页码 7491–7501 (2025) 18. Li, C., Wu, W., Zhang, H., Xia, Y., Mao, S., Dong, L., Vulić, I., Wei, F.: 在空间中推理时想象:多模态思维可视化。arXiv 预印本 arXiv:2501.07542 (2025) 19. Li, C., Zhang, Z., Wu, H., Sun, W., Min, X., Liu, X., Zhai, G., Lin, W.: Agiqa-3k:用于 AI 生成图像质量评估的开放数据库。IEEE 电路与系统视频技术汇刊 34, 6833–6846 (2023) 20. Li, J., Li, D., Savarese, S., Hoi, S.: Blip-2:通过冻结图像编码器和大型语言模型引导语言-图像预训练。在:国际机器学习会议。页码 19730–19742。PMLR (2023) 21. Li, W., Zhang, X., Zhao, S., Zhang, Y., Li, J., Zhang, L., Zhang, J.: Q-insight:通过视觉强化学习理解图像质量。arXiv 预印本 arXiv:2503.22679 (2025) 22. Li, X., Li, X., Wang, Y., He, X., Hu, Z., Yu, W., Xie, C.: Q-probe:通过上下文感知代理探测将图像质量评估扩展至高分辨率。arXiv 预印本 arXiv:2601.15356 (2026) 23. Li, Y., Sun, Z., Chen, Y.J., Nishida, S:调查基于视觉-语言的图像质量评估中的低级视觉感知。arXiv 预印本 arXiv:2512.09573 (2025) 24. Liang, G., Wang, J., Wu, Z., Zhou, S.: Zoom-iqa:具有可靠区域感知推理的图像质量评估。arXiv 预印本 arXiv:2601.02918 (2026) 25. Lin, H., Hosu, V., Saupe, D.: Kadid-10k:大规模人工失真图像质量评估数据库。在:2019 第十一届多媒体体验质量国际会议 (QoMEX)。页码 1–3。IEEE (2019) 26. Lin, Y., Lin, Z., Chen, H., Pan, P., Li, C., Chen, S., Wen, K., Jin, Y., Li, W., Ding, X.: Jarvisir:通过智能图像恢复提升自动驾驶感知能力。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 22369–22380 (2025) 27. Liu, D., Wang, Z., Ruan, M., Luo, F., Chen, C., Li, P., Liu, Y.: 借助视觉抽象进行思考:通过视觉抽象增强多模态推理能力。arXiv 预印本 arXiv:2505.20164 (2025) 28. Liu, J., Sun, H., Katto, J.: 具有混合 Transformer-CNN 架构的学习型图像压缩。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 14388–14397 (2023) 29. Liu, K., Zhang, Z., Li, W., Pei, R., Song, F., Liu, X., Kong, L., Zhang, Y.: Dog-iqa:用于混合粒度图像质量评估的标准引导零样本多模态大语言模型。arXiv 预印本 arXiv:2410.02505 (2024)
第 18 页
18 J. Wu 等
30. Liu, Z., Zang, Y., Zou, Y., Liang, Z., Dong, X., Cao, Y., Duan, H., Lin, D., Wang, J.: 视觉智能体强化微调。arXiv 预印本 arXiv:2505.14246 (2025) 31. Ma, C., Yang, C.Y., Yang, X., Yang, M.H.: 学习用于单图像超分辨率的无参考质量度量。 Computer Vision and Image Understanding 158, 1–16 (2017) 32. Ma, L., Jin, D., An, N., Liu, J., Fan, X., Luo, Z., Liu, R.: 面向低光照图像增强的双层快速场景适应。International Journal of Computer Vision 133(11), 8234–8252 (2025) 33. Mittal, A., Moorthy, A.K., Bovik, A.C.: 空间域中的无参考图像质量评估。IEEE Transactions on image processing 21(12), 4695–4708 (2012) 34. Mittal, A., Soundararajan, R., Bovik, A.C.: 构建“完全盲”图像质量分析器。IEEE Signal processing letters 20(3), 209–212 (2012) 35. Su, S., Yan, Q., Zhu, Y., Zhang, C., Ge, X., Sun, J., Zhang, Y.: 由自适应超网络引导的野外图像质量盲评估。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3667–3676 (2020) 36. Su, Z., Xia, P., Guo, H., Liu, Z., Ma, Y., Qu, X., Liu, J., Li, Y., Zeng, K., Yang, Z., 等:通过图像进行多模态推理的思考:基础、方法与未来前沿。arXiv 预印本 arXiv:2506.23918 (2025) 37. Talebi, H., Milanfar, P.: Nima:神经图像评估。IEEE transactions on image processing 27(8), 3998–4011 (2018) 38. Tang, J., Chen, J., Zhai, Y., Wei, W., Liu, R., Zhao, M., Wu, X., Xiao, Q., Chen, Q.: Robust-u1:多模态大语言模型能否自我恢复受损视觉内容以实现鲁棒理解?在:第 43 届国际机器学习会议 (ICML) 论文集 (2026) 39. Tang, J., Lu, H., Wu, R., Xu, X., Ma, K., Fang, C., Guo, B., Lu, J., Chen, Q., Chen, Y.C.: Hawk:学习理解开放世界视频异常。Advances in Neural Information Processing Systems 37, 139751–139785 (2024) 40. Tang, J., Wu, R., Xu, X., Hu, S., Chen, Y.C.: 利用偏振先验学习去除褶皱透明薄膜。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。pp. 24987–24996 (2024 年 6 月) 41. Tang, J., Xia, Y., Wu, Y.F., Hu, Y., Yuhui, C., Chen, Q.G., Xu, X., Wu, X., Lu, H., Ma, Y., 等:Lpo:通过位置偏好优化实现准确的 GUI 智能体交互。在:计算语言学协会论文集:ACL 2026 的 Findings。pp. 14617–14628 (2026) 42. Tang, J., Yan, Y., Wang, Q., Xia, Y., Geng, B., Chen, J., Ma, K., Zhai, Y., He, Q., Shao, W., Sun, Y., Dai, J., Chen, C., Xu, X., Yao, K., Zhang, L., Wei, W., Chen, Q., Plaza, A., Zhang, Y:智能遥感智能体:一项综述 (2026), https://github.com/PolyX-Research/Awesome-Remote-Sensing-Agents 43. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.A., Lacroix, T., Rozière, B., Goyal, N., Hambro, E., Azhar, F., 等:Llama:开放且高效的基础语言模型。arXiv 预印本 arXiv:2302.13971 (2023) 44. Wang, H., Su, A., Ren, W., Lin, F., Chen, W.: Pixel reasoner:通过好奇心驱动的强化学习激励像素空间推理。arXiv 预印本 arXiv:2505.15966 (2025) 45. Wang, J., Chan, K.C., Loy, C.C.: 探索 CLIP 用于评估图像的观感。在:AAAI 人工智能会议论文集。vol. 37, pp. 2555–2563 (2023)
第 19 页
IQA-T1 19
46. Wang, Q., Ding, R., Zeng, Y., Chen, Z., Chen, L., Wang, S., Xie, P., Huang, F., Zhao, F.: Vrag-rl: Empower vision-perception-based rag for visually rich infor- mation understanding via iterative reasoning with reinforcement learning. arXiv preprint arXiv:2505.22019 (2025) 47. Wang, Y., Wang, S., Cheng, Q., Fei, Z., Ding, L., Guo, Q., Tao, D., Qiu, X.: Visuothink: Empowering lvlm reasoning with multimodal tree search. In: Proceed- ings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). pp. 21707–21719 (2025) 48. Wang, Z., Bovik, A.C., Sheikh, H.R., Simoncelli, E.P.: Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing 13(4), 600–612 (2004) 49. Wu, H., Zhang, Z., Zhang, E., Chen, C., Liao, L., Wang, A., Xu, K., Li, C., Hou, J., Zhai, G., et al.: Q-instruct: Improving low-level visual abilities for multi-modality foundation models. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 25490–25500 (2024) 50. Wu, H., Zhang, Z., Zhang, W., Chen, C., Liao, L., Li, C., Gao, Y., Wang, A., Zhang, E., Sun, W., et al.: Q-align: Teaching lmms for visual scoring via discrete text-defined levels. arXiv preprint arXiv:2312.17090 (2023) 51. Wu, T., Zou, J., Liang, J., Zhang, L., Ma, K.: Visualquality-r1: Reasoning-induced image quality assessment via reinforcement learning to rank. arXiv preprint arXiv:2505.14460 (2025) 52. Yan, Q., Feng, Y., Zhang, C., Pang, G., Shi, K., Wu, P., Dong, W., Sun, J., Zhang, Y.: Hvi: A new color space for low-light image enhancement. In: Proceedings of the computer vision and pattern recognition conference. pp. 5678–5687 (2025) 53. Yang, A., Li, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Gao, C., Huang, C., Lv, C., et al.: Qwen3 technical report. arXiv preprint arXiv:2505.09388 (2025) 54. Yang, R., Mandt, S.: Lossy image compression with conditional diffusion models. Advances in Neural Information Processing Systems 36, 64971–64995 (2023) 55. Yang, S., Wu, T., Shi, S., Lao, S., Gong, Y., Cao, M., Wang, J., Yang, Y.: Maniqa: Multi-dimension attention network for no-reference image quality assessment. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition. pp. 1191–1200 (2022) 56. You, Z., Cai, X., Gu, J., Xue, T., Dong, C.: Teaching large language models to regress accurate image quality scores using score distribution. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 14483–14494 (2025) 57. You, Z., Gu, J., Cai, X., Li, Z., Zhu, K., Dong, C., Xue, T.: Enhancing descriptive image quality assessment with a large-scale multi-modal dataset. IEEE Transac- tions on Image Processing 34, 8201–8215 (2025) 58. You, Z., Li, Z., Gu, J., Yin, Z., Xue, T., Dong, C.: Depicting beyond scores: Advanc- ing image quality assessment through multi-modal language models. In: European Conference on Computer Vision. pp. 259–276. Springer (2024) 59. Zhang, G., Zhong, T., Xia, Y., Liu, M., Yu, Z., Li, H., He, W., She, D., Wang, Y., Jiang, H.: Cmmcot: Enhancing complex multi-image comprehension via multi- modal chain-of-thought and memory augmentation. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 40, pp. 12430–12438 (2026) 60. Zhang, W., Ma, K., Yan, J., Deng, D., Wang, Z.: Blind image quality assessment using a deep bilinear convolutional neural network. IEEE Transactions on Circuits and Systems for Video Technology 30(1), 36–47 (2018) 61. Zhao, Q., Lu, Y., Kim, M.J., Fu, Z., Zhang, Z., Wu, Y., Li, Z., Ma, Q., Han, S., Finn, C., et al.: Cot-vla: Visual chain-of-thought reasoning for vision-language-
第 20 页
20 J. Wu 等
动作模型。在:计算机视觉与模式识别会议论文集。第 1702–1713 页 (2025) 62. Zheng, Z., Yang, M., Hong, J., Zhao, C., Xu, G., Yang, L., Shen, C., Yu, X.: Deepeyes:通过强化学习激励“图像思维”。arXiv 预印本 arXiv:2505.14362 (2025) 63. Zhu, H., Wu, H., Li, Y., Zhang, Z., Chen, B., Zhu, L., Fang, Y., Zhai, G., Lin, W., Wang, S:通过教导大型多模态模型进行比较来实现自适应图像质量评估。神经信息处理系统进展 37,第 32611–32629 页 (2024)