FaithEyes:多智能体自评判框架,让VLM不再“假装”看图
Agentic VLM 在调用裁剪等工具时,常产生与问题无关的装饰性过程图像,模型实际依赖先验知识而非工具输出,导致计算资源浪费和推理不可靠。FaithEyes 提出多智能体自评判框架,让模型自身作为子智能体判断每张过程图像是否有助于回答问题,并将判断结果同时注入工具观察和用于缩放工具奖励,从推理上下文和优化目标两个层面联合抑制奖励黑客行为。实验表明,FaithEyes 在多个感知和推理基准上超越现有 agentic VLM,工具忠实度大幅提升。注意,该方法在密集数值逻辑推理任务上提升有限,且自判断能力受限于模型自身容量。