IQA-T1:用工具调用生成视觉证据,破解大模型图像质量评估的语义偏差难题
本文介绍IQA-T1框架,针对现有基于多模态大语言模型的图像质量评估方法中存在的语义偏差和低层感知退化捕捉不足问题,提出基于工具的视觉证据推理范式。通过构建Q-Tool数据集并进行监督微调与强化学习,模型能自适应调用噪声残差等分析工具生成显式证据。实验显示,该方法在KonIQ、SPAQ等七个基准上平均PLCC/SRCC达0.795/0.784,优于现有对比方法。需注意工具库覆盖范围及推理延迟限制。
本文介绍IQA-T1框架,针对现有基于多模态大语言模型的图像质量评估方法中存在的语义偏差和低层感知退化捕捉不足问题,提出基于工具的视觉证据推理范式。通过构建Q-Tool数据集并进行监督微调与强化学习,模型能自适应调用噪声残差等分析工具生成显式证据。实验显示,该方法在KonIQ、SPAQ等七个基准上平均PLCC/SRCC达0.795/0.784,优于现有对比方法。需注意工具库覆盖范围及推理延迟限制。