快速导读:提出FaithEyes多智能体自评判框架,通过将过程图像有用性判断注入工具观察并用于缩放工具奖励,解决agentic VLM的工具使用不忠实问题。
Agentic VLM 在视觉推理任务中常需调用裁剪等工具获取过程图像作为额外证据。然而,现有模型在答案正确且有工具调用时即获得统一奖励,不区分工具调用是否真正有用,导致模型产生大量装饰性调用,实际依赖先验知识而非工具输出进行推理,即工具使用不忠实问题。
FaithEyes 提出多智能体自评判框架,核心思路是让模型自身作为子智能体判断主智能体产生的每张过程图像是否有助于回答问题。判断结果以 JSON 格式(含 is_helpful 和 reason)注入工具观察以辅助推理,同时用于计算 helpful-tool ratio 缩放工具奖励。训练采用两阶段 SFT+RL(GRPO)流程,在多个感知和推理基准上取得最优性能,工具忠实度显著提升。
英文题目:FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification
论文出处:arXiv 每日论文精选 · arXiv:2607.28225
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有 agentic VLM 如 DeepEyes 和 Thyme 在训练中仅根据最终答案正确性给予奖励,不区分工具调用是否必要。这导致模型通过 reward hacking 产生大量无用调用,例如对不包含目标物体的区域反复裁剪,浪费计算资源且降低推理效率。
工具反馈仅返回图像本身,缺乏有用性信号。模型无法从工具观察中获知该图像是否包含问题所需信息,只能依赖自身先验知识进行判断,进一步加剧了工具使用不忠实。
初步分析(Table 1, p.5)显示,即使将外部判断注入 DeepEyes 和 Thyme 的工具观察,模型性能反而下降,说明仅靠推理阶段的信号注入不足以解决问题,必须从训练目标层面进行干预。
注意力分析(Figure 2, p.6)表明,现有模型的答案 token 对无用过程图像的注意力与对有用图像相当,进一步证实模型并未有效区分工具输出的质量。
核心创新
- 将过程图像有用性判断同时注入工具观察(提供显式反馈)和用于缩放工具奖励(抑制奖励黑客),联合解决工具不忠实的两个原因。
- 设计多智能体自评判框架,模型自身作为子智能体进行判断,无需外部模型,保证训练-测试一致性。
- 提出基于helpful-tool ratio的工具奖励,独立于答案正确性,避免工具调用退化或代码执行失败率飙升。
方法概览
FaithEyes框架让模型自身作为子智能体判断主智能体产生的每张过程图像是否有助于回答问题。判断结果(JSON格式,含is_helpful和reason)注入工具观察以辅助推理,同时用于计算helpful-tool ratio缩放工具奖励。训练采用两阶段SFT+RL(GRPO)流程,SFT冷启动代码编写、判断和交互推理能力,RL阶段结合准确率、格式、一致性和工具奖励进行优化。
- FaithEyes 框架包含主智能体和子智能体两个角色,均由同一模型担任。主智能体负责调用工具获取过程图像并进行最终推理,子智能体负责判断每张过程图像是否有助于回答问题。
- 子智能体的判断结果以 JSON 格式返回,包含 is_helpful 布尔值和 reason 文本解释。该判断被注入到主智能体的工具观察中,作为显式的有用性反馈信号。
- 基于子智能体的判断,计算 helpful-tool ratio,即轨迹中成功执行且被判断为有用的工具调用占总调用次数的比例。该比率用于缩放工具奖励,独立于答案正确性。
- 训练采用两阶段流程:SFT 阶段冷启动模型的代码编写、判断和交互推理能力,对工具观察和早期轮次响应进行损失掩码以确保训练稳定;RL 阶段使用 GRPO 算法,结合准确率奖励、格式奖励、一致性奖励和工具奖励进行联合优化。
- 工具奖励独立于答案正确性,避免模型为获取工具奖励而牺牲推理准确率,或为追求准确率而完全放弃工具调用。
- 整个框架无需外部模型参与判断,保证训练和测试阶段的一致性,避免引入外部模型带来的分布偏移和额外计算开销。
逐图理解论文
FaithEyes 的核心设计

FaithEyes 框架总览图,展示主智能体调用工具获取过程图像、子智能体进行有用性判断、判断结果注入工具观察的完整交互流程。注意观察判断信号如何同时流向工具观察和奖励计算两个路径。
训练与验证

主要结果表,展示 FaithEyes 在六个基准上的准确率,与 DeepEyes、Thyme、CodeV 等 agentic VLM 的对比。注意 FaithEyes 在所有基准上均取得最优或次优结果。
注意力证据

注意力调整分析,展示注入判断后答案 token 对有用/无用过程图像的注意力变化。注意有用图像注意力上升、无用图像注意力下降,且多数样本呈现此趋势,验证了判断信号的引导效果。
实验如何设计?
- 在 V*、HR-Bench 4K/8K、MathVista、MathVerse、MathVision 六个基准上评估感知和推理性能,覆盖视觉搜索、高分辨率理解和数学推理等任务。
- 通过外部强模型 Qwen3-VL-235B-A22B 评判正确轨迹中过程图像的有用性,计算工具忠实度比率作为核心评估指标。
- 消融研究包括:移除判断注入、移除奖励缩放、同时移除两者、替换为外部强判断模型,以及不同工具奖励系数 λtool 的影响。
- 通过 attention rollout 分析判断信号对答案 token 在有用/无用过程图像上注意力分布的影响。
- 分析 RL 训练过程中各奖励项、工具调用数和响应长度的动态变化,以及工具奖励独立于答案正确性的影响。
关键结果与论文证据
- FaithEyes 在 V* 上准确率 87.4%,HR-Bench 4K 上 77.8%,HR-Bench 8K 上 72.9%,MathVista 上 73.1%,MathVerse 上 51.0%,均超越所有对比的 agentic VLM(Table 2, p.9)。
- 工具忠实度比率在 V* 上达 86.7%,HR-Bench 4K 上 76.2%,HR-Bench 8K 上 53.1%,大幅优于 DeepEyes、Thyme 和 CodeV(Figure 3, p.9)。
- 同时移除判断注入和奖励缩放后,感知和推理平均准确率分别降至 76.2% 和 48.4%,工具忠实度比率在三个基准上分别降至 72.2%、33.5%、4.6%,验证了两个组件的必要性(Table 3, p.10)。
- 注入判断后,FaithEyes 对有用图像的 top-effective attention score 提升,对无用图像的注意力下降,表明判断信号有效引导模型关注真正有用的视觉证据(Table 4, p.11)。
- 工具奖励系数 λtool 过大(如 0.8)会导致推理准确率下降,需谨慎调节以平衡工具使用和推理性能(Figure 4, p.10)。
- 工具奖励独立于答案正确性时,工具调用数保持稳定且代码执行失败率不飙升;若依赖答案正确性,则工具调用数持续下降(Figure 6, p.17)。
- RL 训练过程中,工具奖励和准确率奖励同步提升,工具调用数先增后稳,表明模型学会了选择性调用有用工具(Figure 5, p.16)。
- SFT 和 RL 阶段消融显示,两阶段训练对最终性能均有显著贡献,缺一不可(Table 5, p.18)。
阅读时需要注意
- 在 MathVision 等密集数值逻辑推理基准上,视觉工具帮助有限,性能提升微小,表明该方法对视觉依赖型任务更有效。
- 自判断子智能体的判断能力上限低于外部强模型,替换为 Qwen3-VL-235B-A22B 可进一步提升工具忠实度,但会增加计算开销。
- 答案 token 对过程图像的绝对注意力仍远低于文本区域,模型对视觉证据的依赖程度有限,视觉-文本模态间的信息整合仍有提升空间。
关联工作
- DeepEyes 和 Thyme 是基于强化学习的 agentic VLM,分别使用裁剪和代码工具,但工具奖励不区分有用性,是 FaithEyes 改进的基线。
- CodeV 使用外部判断模型提供步骤级奖励以提升工具忠实度,但未将判断注入推理上下文,FaithEyes 进一步将判断同时用于观察和奖励。
- SCoT 采用自调用多智能体设计进行视觉查询分解,FaithEyes 同样使用自调用但目标为判断过程图像有用性,两者在多智能体设计思路上有相似之处。