Beacon:知何时与如何执行智能体视觉推理——让模型按需调用工具并真正获益

快速导读:Beacon 提出必要性感知自适应奖励和提示引导能力扩展机制,通过强化学习提升多模态大模型在视觉推理中的工具调用自适应性和真实性能增益。

智能体视觉推理(Agentic Visual Reasoning)旨在让多模态大模型通过调用外部工具(如代码解释器)来提升在复杂视觉任务上的表现。然而,现有工作多聚焦于总体精度的提升,却忽视了两个关键问题:模型是否真的知道何时该用工具、何时不该用?工具使用带来的性能增益,是否被其在简单问题上引入的错误所抵消?Beacon 正是针对这两个盲区展开研究。

论文首先定义了模式自适应性(Mode Adaptiveness, MA)和工具效应(Tool Effect, TE)两个分析维度,并以此审视了多个现有模型,发现它们普遍缺乏自适应工具调用行为,工具使用带来的净增益微乎其微。基于此,Beacon 提出了必要性感知自适应奖励(NAAR)和提示引导能力扩展(HCE)两种机制,通过强化学习训练模型,使其既能按需调用工具,又能从工具使用中获得真实的性能提升。

英文题目:Beacon: Knowing When and How to Perform Agentic Visual Reasoning

论文出处:arXiv 每日论文精选 · arXiv:2607.28595

原始论文:PDF / 论文页面

对应视频标题:Beacon:知何时与如何执行智能体视觉推理——让模型按需调用工具并真正获益|推荐指数:★★★★★

这篇论文解决什么问题?

在智能体视觉推理中,模型面临一个核心决策:对于给定的视觉问题,是直接进行文本推理,还是编写代码调用工具来辅助求解?理想情况下,模型应在简单问题上避免工具调用以节省计算并减少出错风险,而在复杂问题上积极使用工具以突破纯文本推理的能力上限。然而,论文对 Thyme、DeepEyesV2、CodeV 等现有模型的分析表明,它们的工具调用行为与问题难度之间几乎没有相关性——模型往往以固定比例调用工具,而非根据问题需求动态调整。

更严重的是,工具使用带来的“净收益”十分有限。论文将工具效应分解为 Tool-Gain(文本难题通过工具被解决的比例)和 Tool-Harm(文本简单题因工具而答错的比例)。在多个现有模型中,Tool-Harm 几乎与 Tool-Gain 相当,导致 ∆TE(Tool-Gain 减去 Tool-Harm)接近于零甚至为负。这意味着,工具使用虽然在部分难题上提供了帮助,却在更多简单题上引入了错误,整体上并未真正扩展模型的能力边界。

造成这一现象的原因有两方面。其一,现有训练方法缺乏对工具调用必要性的显式建模。例如,Metis 的自适应目标不依赖于具体任务难度,CodeDance 虽采用组级准确率决定优化方向,但未对单条轨迹的工具使用进行条件化奖励。其二,在极难问题上,模型可能从未探索到有效的工具使用轨迹,导致强化学习无法获得正向奖励信号,能力扩展陷入停滞。

Beacon 的出发点正是解决这两个问题:如何让模型学会“按需调用”,以及如何在最需要工具的场景下真正学会使用工具。

核心创新

  • 提出模式自适应性(Mode Adaptiveness)和工具效应(Tool Effect)两个维度,系统量化智能体视觉推理模型的工具使用行为。
  • 设计必要性感知自适应奖励(NAAR),根据问题组内纯文本解答的正确性,对文本和代码响应赋予差异化奖励,实现工具调用的软偏好。
  • 提出提示引导能力扩展(HCE)机制,利用专家模型为全错样本生成不含答案的提示,引导策略探索有效轨迹,并将能力迁移至无提示推理。

方法概览

Beacon 采用 SFT 后 RL 的训练范式。SFT 阶段利用合成数据赋予模型基础代码使用能力;RL 阶段引入必要性感知自适应奖励(NAAR)鼓励按需调用工具,并采用提示引导能力扩展(HCE)机制,通过专家模型生成提示,帮助策略在极难样本上发现有效的工具使用轨迹,并将能力迁移回无提示策略。

  • 训练范式:Beacon 采用 SFT 后 RL 的两阶段训练。SFT 阶段利用合成数据赋予模型基础的代码生成与工具调用能力,并通过拒绝采样过滤掉简单样本和无效代码轨迹,确保训练数据集中在需要工具辅助的难题上。RL 阶段基于 GRPO(Group Relative Policy Optimization)进行策略优化。
  • 必要性感知自适应奖励(NAAR):NAAR 的核心思想是根据问题组内纯文本解答的正确性,对文本响应和代码响应赋予差异化奖励。具体而言,对于每个问题,模型首先生成多条纯文本解答。若组内至少有一条纯文本解答正确,则该问题被视为“文本可解”,此时文本响应获得正向奖励,代码响应则被抑制;反之,若所有纯文本解答均错误,则问题被视为“文本不可解”,此时代码响应获得正向奖励,文本响应被抑制。这种软偏好机制鼓励模型在简单问题上使用文本推理,在难题上调用工具。
  • 提示引导能力扩展(HCE):对于纯文本和代码解答均全部错误的“全错组”,模型无法从任何轨迹中获得正向奖励,学习信号缺失。HCE 机制引入外部专家模型(Gemini 3.1 Pro)为这些样本生成不含答案的提示(hint),描述问题求解的关键步骤或所需工具。模型基于提示重新采样,从而有机会发现有效的工具使用轨迹。一旦这些轨迹被成功探索,它们便成为正向训练样本,模型的能力边界得以扩展。
  • 能力迁移:HCE 的关键设计在于,提示仅在训练时用于引导探索,推理阶段模型不依赖任何外部提示。通过这种方式,模型将从提示中学到的工具使用策略内化为自身能力,实现了从“有提示”到“无提示”的能力迁移。
  • 评估框架:论文定义了 MAtext(文本简单题中正确选择文本模式的比例)、MAtool(文本难题中正确选择工具模式的比例)、MAmean(两者的调和平均)来量化模式自适应性;同时定义 Tool-Gain、Tool-Harm 和 ∆TE 来量化工具效应。这些指标不依赖于单一基准,而是通过对比同一模型在“强制文本”和“允许工具”两种提示下的表现来计算。
  • 训练数据构建:SFT 数据来自多个视觉推理数据集,经过拒绝采样(移除纯文本即可正确解答的简单样本)和精炼(移除代码轨迹中代码实际未帮助推导答案的样本)后保留约 40% 的原始样本。RL 数据同样经过拒绝采样,保留率约 50%,确保训练集中在需要工具辅助的难题上。
  • 奖励设计:除 NAAR 提供的自适应奖励外,训练中还包含格式奖励(确保模型输出符合预期的文本或代码格式)。RL 训练过程中,自适应奖励和格式奖励均稳步上升,表明模型逐渐学会了按需选择推理模式并保持正确的输出格式。
  • 推理模式选择准确率:论文监控了训练过程中模型选择的推理模式与 NAAR 标签的一致性。随着训练推进,模式选择准确率从约 50% 提升至 70% 以上,验证了 NAAR 确实引导模型学会了根据问题难度选择合适的推理模式。

逐图理解论文

一个反直觉的发现

一个反直觉的发现
Figure 2: (a) The tool-call ratio at different levels of text-only accuracy. (b) Average performance across 13 benchmarks. (c) Tool-induced performance gains and harms (see Section 3.1 for de- tails). Takeaway 1 (a): Beacon exhibits adaptive tool-invocation behavior that is largely absent from existing agentic visual reasoning models, invoking tools more frequently on samples that are difficult to solve through tool-free reasoning. Takeaway 2 (b–c): Beacon achieves the best average performance and the largest gap between tool gain and tool harm, indicating that its tool use more ef- fectively extends the model’s capabilities beyond text-only reasoning. In contrast, for prior models, the gains from tool use are largely offset by the errors it introduces, resulting in little improvement over text-only reasoning.

图 2 从三个维度对比了 Beacon 与现有模型:工具调用率随文本正确率的变化曲线、13 个基准的平均性能、以及工具增益与损害。Beacon 是唯一展现出明显自适应调用趋势且工具净增益为正的模型。

研究空白:两个被忽视的维度

研究空白:两个被忽视的维度
Figure 3: (a) The accuracy of tool-available and tool-free reasoning. (b) The MAtext, MAtool, and MAmean of different models. (c) The Tool-Gain and Tool-Harm of different models.

图 3 详细展示了各模型的模式自适应性指标(MAtext、MAtool、MAmean)和工具效应指标(Tool-Gain、Tool-Harm)。Beacon 在 MAtool 和 ∆TE 上均大幅领先,验证了其在难题上有效使用工具的能力。

Beacon 的解决方案

Beacon 的解决方案
Figure 4: Illustration of the RL process of Beacon. The Necessity-Aware Adaptive Reward (NAAR) and Hint-Guided Capability Expansion (HCE) are designed to improve reasoning-mode adaptiveness and expand the model’s tool-use capabilities on the most challenging problems, re- spectively.

图 4 展示了 Beacon 的 RL 训练流程,清晰说明了 NAAR 如何根据组内纯文本正确性分配差异化奖励,以及 HCE 如何通过专家提示引导全错组的重采样,是理解方法核心机制的关键图示。

核心结论

核心结论
Table 1: Comparison on high-resolution visual search, spatial, and perceptual reasoning benchmarks. Averages are computed over all available reported results. Bold and underline indi- cate the best and second-best performance among open-source models, respectively. Gray indicates that the result is reported in the original paper.

表 1 报告了在高分辨率视觉搜索、空间和感知推理基准上的详细对比结果。Beacon 在多个基准上取得开源最佳,尤其在需要精确视觉定位的任务上优势明显。

实验如何设计?

  • 基座模型:Qwen3-VL-8B-Instruct,一个 8B 参数的多模态大模型。
  • 评估基准:13 个涵盖高分辨率视觉搜索、空间感知、量化推理、图表推理、组合推理和智能体视觉推理的多样化基准,包括 V* Bench、Spatial-MM、MathVision、ChartQA 等。
  • 对比模型:开源模型包括 Thyme、DeepEyesV2、CodeV、Metis 等;闭源模型包括 Gemini 3.1 Pro。部分对比模型的结果来自原论文报告,非统一复现。
  • 训练配置:SFT 阶段使用约 40K 样本,RL 阶段使用约 20K 样本。RL 采用 GRPO 算法,每组采样 8 条轨迹。HCE 阶段使用 Gemini 3.1 Pro 作为专家模型生成提示。
  • 评估协议:对于每个模型,分别在“强制文本”提示(ptext)和“允许工具”提示(ptool)下进行评估,通过对比两种设置下的表现计算 MA 和 TE 指标。
  • 消融设计:通过逐步移除 NAAR 和 HCE 组件,验证各机制对整体精度、模式自适应性和工具效应的贡献。

关键结果与论文证据

  • Beacon-8B 在 13 个基准上的平均性能为 58.98%,在开源模型中排名第一,并在 11 个基准上取得最佳成绩(Table 1, Table 2, 第 10 页)。相较于基座模型 Qwen3-VL-8B-Instruct,Beacon 平均提升 6.07 个百分点。
  • 在模式自适应性方面,Beacon 的 MAmean 达到 58.83%,远超其他模型(Table 3, 第 11 页)。具体而言,其 MAtool 高达 94.75%,表明模型在文本难题上几乎总能正确选择工具模式;MAtext 为 22.91%,虽相对较低,但仍显著优于其他模型。
  • 在工具效应方面,Beacon 的 ∆TE 为 +3.14%,是所有评估模型中唯一实现正向净增益的模型(Table 3, 第 11 页)。其 Tool-Gain 为 8.25%,Tool-Harm 为 5.11%,表明工具使用带来的增益显著超过了损害。相比之下,DeepEyesV2 的 ∆TE 仅为 +0.02%,工具使用几乎未带来任何净收益。
  • 消融实验表明,完整方法(SFT+GRPO+NAAR+HCE)取得最高总体精度 58.98%(Table 4, 第 12 页)。移除 HCE 后,精度降至 57.83%,且 MAtool 从 94.75% 降至 86.44%,说明 HCE 对于扩展模型在难题上的工具使用能力至关重要。移除 NAAR 后,MAtext 从 22.91% 降至 14.29%,验证了 NAAR 在抑制不必要工具调用方面的作用。
  • RL 训练动态显示,随着训练推进,模型选择代码模式的比例从约 60% 逐渐下降至约 45%,同时模式选择准确率从约 50% 上升至 70% 以上(Figure 6, 第 13 页)。这表明模型并非简单地减少工具使用,而是学会了更精准地判断何时该用工具。
  • HCE 机制的效果在训练数据构成变化中得到体现:提示引导的重采样使得约 30% 的“全错组”转变为包含正确解答的组(Figure 7, 第 13 页),为 RL 提供了原本缺失的正向训练信号。
  • 在跨基准的详细分析中,Beacon 在需要精确空间定位和量化计算的基准上表现尤为突出,例如在 V* Bench 和 MathVision 上大幅领先其他开源模型,这与其在难题上有效使用代码工具的能力一致。
  • 与闭源模型 Gemini 3.1 Pro 相比,Beacon-8B 在多个基准上表现接近甚至超越,展现了以较小模型规模通过工具使用实现能力扩展的潜力。

阅读时需要注意

  • Beacon 的 MAtext 仅为 22.91%,表明模型在简单问题上仍有较强的工具调用倾向,避免不必要工具调用的能力有待进一步提升。
  • HCE 机制依赖外部专家模型(Gemini 3.1 Pro)生成提示,增加了训练流程的复杂性和计算成本,且提示质量直接影响 HCE 的效果。
  • 模式自适应性指标的定义依赖于多次采样的文本正确率阈值,该阈值的选择可能影响分析结论的稳健性。
  • 部分对比模型的性能数据来自原论文报告而非统一复现,直接比较可能存在偏差。
  • 论文主要在 8B 参数规模的模型上验证方法,其在更大规模模型上的可扩展性尚未得到充分验证。

关联工作

  • Thyme、DeepEyesV2、CodeV 等现有智能体视觉推理模型在分析中展现出有限的模式自适应性和工具增益,其工具调用行为与问题难度几乎无关,工具使用带来的净收益接近于零。
  • Metis 提出了自适应工具使用目标,但其自适应信号不依赖于具体任务难度,导致模型无法根据问题需求动态调整工具调用策略。
  • CodeDance 采用组级准确率决定自适应奖励的优化方向,但未对单条轨迹的工具使用进行条件化奖励,无法精细控制模型在单个样本上的工具调用行为。
  • AdaTooler-V 使用教师模型标记样本是否需要工具,但教师模型的能力上限和分布不匹配问题可能限制学生模型的表现。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Preprint. 工作进展中。

BEACON: 知晓何时与如何执行智能体视觉推理

Qixun Wang1,2∗ Yang Shi1,2∗ Letian Cheng1 Zhuoran Zhang1 Yan He1 Yuqi Tang3 Qi Zhang1 Xinlei Yu4 Ruizhe Chen5 Tianrun Xu6 Yuanxing Zhang2† Pengfei Wan2 Haotian Wang6 Xianghua Ying1‡ 1北京大学 2Kling团队 3香港科技大学(广州) 4香港中文大学 5浙江大学 6清华大学 ∗同等贡献 †项目负责人 ‡通讯作者 §代码 ò模型

简单 我会写个脚本来裁剪图像… 天气如何? 多云 [裁剪] 多云 答案:多云 多云 困难 赛道上有多少 我会写个脚本来裁剪图像… 我会写个脚本来检测蓝色弹珠… 颗蓝色弹珠? 18 [裁剪] [像素级计算] 答案:22 7 22

提升 非智能体MLLM 传统智能体MLLM Beacon(我们的方法) 模型 自适应性2026

强化学习7月 扩展 模型30 能力 无工具 冗余且无益的工具调用 自适应且有益的工具调用

引导 困难 穿蓝色球衣的球员……如果羽毛球落在……[裁剪]……红色圆圈在 提示:确定 正在执行羽毛球扣杀。 球场边界内,包括发球区, 单打边线之外, 当前比分、 如果羽毛球落在 则是一次有效击球,击球方 位于边线之间。 赛事名称以及 红色圆圈内,新的 得分…… 所以它出界了…… 红色圆圈的 比赛比分是多少? 边界状态

图1:智能体视觉推理模型应自适应且有效地使用工具。[cs.CV] 摘要

智能体视觉推理的根本目标是提高多模态大语言模型(MLLMs)在复杂任务上的成功率,而非仅仅为其配备一个复杂但低效的推理范式。在本工作中,我们从工具使用的两个关键维度重新审视智能体视觉推理:Mode Adaptiveness (MA) 与 Tool Effect (TE)。Mode Adaptiveness (MA) 刻画了MLLM能否识别何时真正需要工具并据此调用,从而在提升需要工具辅助的难题性能的同时,避免不必要的计算开销。Tool Effect (TE) 刻画了工具使用的实际影响:工具应扩展模型在纯文本推理无法解决的问题上的能力,同时避免在模型无需工具即可解决的问题上引入额外错误。我们进行了全面分析以量化这两个特性,并通过实验揭示,arXiv:2607.28595v1 现有的智能体视觉推理模型表现出有限的MA,而工具使用在困难样本上产生的增益,在很大程度上被其在模型本已能解决的简单样本上引入的损害所抵消。受这些观察的启发,我们提出了Beacon,一种新颖的智能体视觉推理模型,它实现了更强的整体性能、改进的Mode Adaptiveness (MA) 以及真正的工具诱导性能增益。Beacon的核心在于强化学习阶段的Necessity-Aware Adaptive Reward (NAAR) 和Hint-Guided Capability Expansion (HCE) 机制,它们分别鼓励基于任务必要性的自适应工具调用,并增强模型在最具挑战性问题上的工具使用能力。在多个基准上的广泛实验

第 2 页

预印本。工作进展中。

这些结果充分证明了Beacon强大的整体性能,及其在模式自适应性(Mode Adaptiveness)和工具效应(Tool Effect)两方面的显著提升。

图2:(a)不同纯文本准确率水平下的工具调用比例。(b)13个基准测试上的平均性能。(c)工具引起的性能增益与损害(详见第3.1节)。发现1(a):Beacon展现出在现有智能体视觉推理模型中基本缺失的自适应工具调用行为,即在难以通过无工具推理解决的样本上更频繁地调用工具。发现2(b–c):Beacon取得了最佳平均性能,且工具增益(Tool-Gain)与工具损害(Tool-Harm)之间的差距最大,表明其工具使用能更有效地将模型能力扩展到纯文本推理之外。相比之下,对于先前模型,工具使用带来的增益在很大程度上被其引入的错误所抵消,导致相比纯文本推理几乎没有提升。

1 引言

智能体视觉推理[44, 41, 10, 11]利用外部工具生成支持最终答案生成的中间多模态结果,已成为多模态大语言模型(MLLMs)[1, 7, 25, 37]的一种重要范式。尽管先前的研究已展示出经验性增益,但它们常常忽视工具使用的两个关键方面:(1)工具调用的自适应性,即模型能否根据诸如无工具可解性等因素,判断何时需要工具;(2)工具效应,即工具使用能否在无工具无法解决的问题上扩展模型能力,同时避免在已可通过无工具推理解决的问题上造成性能下降。

为探究这些方面,我们对代表性的智能体视觉推理模型进行了全面评估。我们的分析表明,现有模型在工具调用上普遍表现出有限的自适应性,而工具使用带来的增益往往被其引入的错误所抵消,导致相比纯文本推理几乎没有提升。受这些发现启发,我们提出了Beacon,一个具有改进的工具调用自适应性和更强工具使用能力的智能体视觉推理模型,能够实现超越纯文本推理的真实增益。

在推理过程中,Beacon能够自主生成Python代码,以执行多种视觉和数值操作,包括图像裁剪、标注、增强、旋转、拼接、像素级计算以及复杂的数值计算。为训练Beacon,我们首先构建了一个高质量的数据合成流水线,赋予模型基础的代码使用能力。随后,我们引入了一个强化学习(RL)框架,该框架包含一个必要性感知自适应奖励(Necessity-Aware Adaptive Reward),仅在必要时鼓励工具使用;以及一个提示引导的轨迹展开策略(Hint-Guided Rollout Strategy),使模型在无工具无法解决的问题上接触到有效的工具使用轨迹。

第 3 页

预印本。工作仍在进行中。

在13个基准上的实验表明,Beacon取得了最佳平均性能。进一步分析显示,Beacon展现出更强的工具调用自适应性,以及工具带来的增益与损害之间的最大差距,表明我们的强化学习框架同时提升了工具使用的自适应性和有效性。

我们将贡献总结如下:

• 我们系统性地分析了代表性智能视觉推理模型中的工具调用自适应性和工具使用效果。我们的结果表明,现有模型普遍缺乏自适应工具使用行为,而在难题上取得的增益,很大程度上被那些本可通过纯文本推理解决的问题上引入的错误所抵消(第3.1节)。 • 我们开发了一个高质量的监督微调(SFT)数据合成流程、一个强化学习数据筛选策略,以及一个新颖的强化学习框架来训练Beacon。这些设计提升了模型的工具调用自适应性,并增强了其利用工具将能力扩展到纯文本推理之外的能力(第4节)。 • 我们在涵盖多种视觉推理任务的13个基准上评估了Beacon。Beacon取得了最佳平均性能,并展现出更强的工具调用自适应性,以及工具带来的增益与损害之间的最大差距,证明我们的强化学习框架同时提升了工具使用的自适应性和有效性(第5节)。

2 相关工作

智能视觉推理。近期的多模态大语言模型已超越静态视觉输入,将文本推理与中间视觉交互交织在一起。现有方法使模型能够重新审视图像区域、裁剪或编辑图像、生成辅助视觉表示,或执行代码以进行视觉操作和数值计算 [19, 29, 48, 49, 22, 30, 44, 10, 20, 27]。这些研究展示了外部工具在细粒度感知和复杂多模态推理方面的潜力。然而,大多数评估主要报告总体任务准确率,对于模型能否在直接推理和工具增强推理之间做出恰当选择,以及工具使用是否真正将模型能力扩展到无工具推理之外,提供的证据有限。

自适应与高效工具使用。近期一些研究已认识到不加区分的工具调用会引入不必要的计算,并提出了各种强化学习策略以鼓励更具自适应性的工具使用 [27, 34, 41]。尽管这些工作提供了开创性的见解,但其自适应目标可能仍存在若干局限。CodeDance [27] 使用组级准确率来决定其自适应奖励的优化方向:高或低的组准确率分别表示应减少或增加工具使用频率。然而,这种设计并未根据特定轨迹是否实际调用了工具来设定奖励条件。因此,它可能错误地惩罚一个成功的工具辅助轨迹的工具使用行为,仅仅因为它属于一个高准确率组。AdaTooler-V [34] 则根据教师模型 Qwen2.5-VL-72B [2] 的工具使用带来的性能增益,将训练样本标记为需要或不需要工具。这种教师衍生的监督可能存在策略与教师之间的分布不匹配问题,同时也受限于教师自身的工具使用能力。Metis [41] 采用了一种更简单的策略,通常鼓励更少的工具调用,但这一目标缺乏任务依赖的自适应性,即使在解决难题所必需时,也可能抑制工具使用。

我们的自适应奖励设计(第4.4.1节)通过遵循两个原则来解决这些局限:(1)模式条件标记,即基于无工具和工具辅助的性能,将每个问题标记为需要或不需要工具;(2)在线标记,即基于当前策略的性能而非固定的教师模型来标记每个问题,从而避免离线策略问题。

理解视觉工具的实际收益。越来越多的诊断性工作对智能视觉推理的增益是否真正源于中间视觉工具提出了质疑。[42] 发现,交织的视觉结果相比无工具推理贡献甚微,改进主要源于监督微调。[16] 表明,工具使用强化学习主要减少了由

第 4 页

Preprint. 正在进行中。

工具使用,但在纠正那些不使用工具就无法解决的问题方面进展有限。 类似地,[8] 发现工具带来的性能增益和损害对整体性能的贡献都微乎其微。尽管有这些重要观察,现有分析并未对推理模式的自适应性和工具执行的效果提供统一的刻画。此外,它们通常通过单次推理运行的二元结果来研究无工具可解性,这本质上是不稳定的,容易受到随机性的扰动,同时掩盖了自主调用行为如何随无工具可解性的不同水平而变化。最后,此前尚无工作提出明确的解决方案来提升工具使用的真实收益。

相比之下,我们的分析框架(第3.1节)同时考虑了自适应性和工具使用的效果,并通过多次推理运行提供了更稳健的评估。我们还提出了一个新的RL框架来改善这两个方面(第4.4节)。

3 分析

在本节中,我们进行全面的实验,以分析智能体视觉模型工具使用的两个不同方面:(1)模式自适应性:当前的智能体视觉推理模型能否针对不同问题自适应地调用工具,以及(2)工具使用的效果:工具使用能否扩展模型在无工具无法解决的难题上的能力,以及工具使用是否会损害模型在无工具已能解决的简单题上的性能。

3.1 提出的指标

Mode Adaptiveness (MA) 衡量模型判断何时需要工具并据此选择合适推理模式的能力。这种能力有两个互补的方面:当问题可以通过纯文本推理可靠解决时,模型应避免使用工具;而当纯文本推理不足时,则应调用工具。

为评估一个问题是否可以通过纯文本推理可靠解决,我们要求模型使用附录A.1中的Prompt 1(记为ptext)进行回答,该提示禁止使用工具。与先前基于单次响应确定纯文本可解性的分析[8]不同(该过程可能对采样随机性敏感),我们对每个问题采样五次纯文本响应。若至少四次回答正确,我们将该问题归类为“text-easy”;若最多一次回答正确,则归类为“text-hard”。正确次数为两次或三次的问题被视为模糊不清,并从分析中排除。

对于启用工具的推理,我们采用每个模型的官方工具使用提示,记为ptool。我们对这些提示进行最小化修改,以允许而非强制使用工具,从而揭示每个模型内在的模式适应行为。

令x表示一个问题样本,πθ表示模型。将“text-easy”和“text-hard”样本分别记为E和H。令ux,i表示在启用工具的提示ptool下,样本x的第i次回答中工具的使用情况,即若模型在样本x的第i次回答中使用了工具,则ux,i = 1,否则ux,i = 0。MA包含以下子指标。

5 5 1 1 MAtext = X X(1 −ux,i), MAtool = X X ux,i. 5|E| 5|H| x∈E i=1 x∈H i=1 MAtext 衡量在“text-easy”样本上无工具响应的平均比率。该值越高,表明模型越善于避免不必要的工具使用。MAtool 衡量在“text-hard”样本上工具辅助响应的平均比率。该值越高,表明模型越善于在纯文本推理频繁失败时调用工具。

Tool Effects (TE) 衡量与无工具推理相比,工具使用如何影响模型的任务解决性能,包括在“text-hard”样本上获得的增益和在“text-easy”样本上引入的损害。令cx,i为样本x的第i次响应的正确性,即若模型回答正确,则cx,i = 1,否则cx,i = 0。将测试样本总数记为N。Tool Effect包含以下子指标:

4

第 5 页

Preprint. 正在进行中的工作。

5 5 1 1 Tool-Gain = X X ux,icx,i, Tool-Harm = X X ux,i(1 −cx,i). 5N 5N x∈H i=1 x∈E i=1

Tool-Gain衡量的是在工具启用提示下,属于“文本难题”且被工具成功解决的样本比例。该值越高,表明工具使用在扩展模型超越无工具推理的解题能力方面越有效。Tool-Harm衡量的是在工具启用提示下,属于“文本简单题”且回答错误的样本比例。该值越低,表明模型越能避免因无效工具使用而导致的性能下降。

准确率指标。 我们还计算了其他几个指标,以更好地描绘智能体视觉推理的行为。为了衡量两种推理模式的整体性能,我们计算了在工具启用提示ptool和强制文本提示ptext下五次运行的平均准确率,分别记为工具可用准确率和无工具准确率。

3.2 结果与分析

我们评估了几个具有代表性的智能体视觉推理模型:Thyme [44]、DeepEyesV2 [10]、CodeV [11]和Metis [41]。我们在图3中展示了这些指标的总体结果,并总结了以下关键观察。详细结果和分析留待第5.3节讨论。

工具可用 vs. 无工具准确率 工具使用自适应性 工具可用准确率 无工具准确率 (%) MAtool MAtext MAmean 随机 60 100 (%) 50 分数 80 40 60 30 40 20 准确率 10 20 0 0 Thyme CodeV DeepEyes-V2 Metis 自适应性 Thyme CodeV DeepEyes-V2 Metis (a) (b) 工具增益 vs. 工具损害

工具增益 工具损害 (%) 10 比率 86

4

2 绝对值 0 Thyme CodeV DeepEyes-V2 Metis (c)

图3: (a) 工具可用与无工具推理的准确率。(b) 不同模型的MAtext、MAtool和MAmean。(c) 不同模型的Tool-Gain和Tool-Harm。

观察1(图3(a)):对于大多数现有的智能体视觉推理模型,工具启用推理相比无工具推理的提升微乎其微。 这一发现与先前的研究[8, 42]一致。通过五次运行的平均结果,我们进一步表明,这种有限的增益对采样的随机性具有鲁棒性。

观察2(图3(b)):现有的智能体视觉推理模型表现出有限的推理模式自适应性。 一个总是使用工具或从不使用工具的模型,其MAmean为50%。大多数被评估模型的MAmean接近甚至低于此基线。此外,许多模型持续偏好单一的推理模式,无论是无工具推理还是工具辅助推理,这表明它们未能根据每个问题的无工具难度来调整其模式选择。

观察3(图3(c)):对于现有的智能体视觉推理模型,工具使用在“文本难题”样本上提供的益处有限。 大多数被评估模型表现出较低的Tool-Gain。尽管

第 6 页

预印本。工作进展中。

其Tool-Harm也有限,Tool-Gain并未显著超过Tool-Harm。因此,工具使用带来的净性能收益甚微。

问题归因。我们将此问题归因于两个主要因素:(1) 缺乏促进自适应行为的显式目标,以及 (2) 基于可验证奖励的强化学习的一个根本局限——它难以将模型的能力扩展到超出预训练分布所获得的范围。

4 方法

4.1 概述

受第3.1节观察结果的启发,我们提出了Beacon,它采用先SFT后RL的训练范式。在SFT阶段,我们利用涵盖多种视觉推理任务的合成轨迹,赋予模型基础的代码使用能力。在RL阶段,我们引入自适应奖励塑造和提示引导的 rollout 机制,以进一步提高推理模式自适应性,并增强代码使用带来的真实性能增益。

给定一个包含图像和问题的视觉查询,Beacon自主决定是否需要执行代码。当调用代码时,模型会生成一段包含在 <tool_call>...</tool_call> 中的Python代码片段,用于操作图像或进行数值计算。执行后,结果输出作为观察返回,包含在 <observation>...</observation> 中。基于此观察,模型可以继续推理、再次调用代码或生成最终答案。

4.2 训练数据构建

概述。我们从开源数据集中构建训练数据池。对于SFT,我们首先在源数据上评估基座模型Qwen3-VL-8B-Instruct [1],并保留具有挑战性的样本。然后,我们使用Gemini 3.1 Pro [7]为这些样本生成代码辅助的推理轨迹,并使用同一模型进一步优化生成的轨迹。对于RL,我们在同一数据池上评估得到的SFT模型,并选择剩余未解决的样本进行强化学习。构建的训练数据统计信息见表5,更多细节见附录B。

1. 源数据选择。我们根据三个原则选择源数据集:1) 多样性:数据应涵盖广泛的任务和领域,以促进泛化;2) 质量:真实标注应可靠且噪声最小;3) 难度:任务应具有足够的挑战性,以从工具使用中获益并扩展模型能力。遵循这些原则,我们从16个基准和数据集(见附录B)中收集数据,涵盖现实世界感知、图表理解、OCR、STEM、空间推理和现实世界智能体推理。这些数据集大多包含人工标注的标签。为防止评估污染,我们移除了所有与实验中使用的测试集重叠的样本。

2. SFT数据合成。我们分三个阶段构建SFT数据。(1) 我们从基座模型Qwen3-VL-8B-Instruct中采样五次回答,并保留最多回答正确两次的样本。(2) 对于这些困难样本,我们使用Gemini 3.1 Pro [7]生成包含Python代码及相应执行输出的代码辅助推理轨迹,仅保留产生正确答案的轨迹。(3) 由于生成的轨迹可能仍包含低质量的推理或工具使用步骤,我们引入了使用Gemini 3.1 Pro的额外优化程序。合成和优化流程的更多细节见附录B.3。

3. RL数据构建。我们在同一数据池上评估SFT模型,并保留五次尝试中回答正确次数不超过三次的样本。这些困难样本构成了RL训练集,模型将在该集合上使用同时考虑答案正确性和工具使用有效性的奖励信号进行进一步优化。

第 7 页

预印本。工作仍在进行中。

全对组 必要性感知自适应奖励(NAAR) 格式 输入 奖励 O1 丢弃奖励 纯文本 ⊕ 文本奖励 1 1 × 0.1 O2 混合组 代码 ⊕ 1 0.25 代码 ⊕ 0 1 组 保留 × 0.9 优势 O3 其他 ⊕ 否则 0 混合组 … 添加提示 提示引导能力扩展(HCE) 全错组 轨迹 提示 损失 O8 重新采样 生成 专家轨迹(Gemini) 提取 提示 提示引导重新采样

图4:Beacon的强化学习过程示意图。必要性感知自适应奖励(NAAR)和提示引导能力扩展(HCE)分别旨在提升推理模式自适应性,并扩展模型在最具挑战性问题上的工具使用能力。

4.3 冷启动监督微调

我们对冷启动监督微调使用标准的交叉熵损失,并屏蔽代码输出(即 <tool_call>...</tool_call> 之间的内容)。为避免模型偏向代码使用并减轻遗忘,我们将一些由基础模型生成的、在五次采样中准确率≥0.6的样本的正确纯文本轨迹注入到监督微调训练数据中。有关监督微调训练的更多细节,请参见附录C.1。

4.4 强化学习

在本节中,我们将描述强化学习框架的核心设计。我们采用GRPO [23]作为基础强化学习算法,并配合我们设计的必要性感知自适应奖励和提示引导能力扩展机制,以进一步提升模型的推理模式自适应性和代码使用的真实增益。

4.4.1 必要性感知自适应奖励

自适应推理的一个核心挑战在于,既要抑制不必要的工具使用,又不能压制模型用代码解决难题的能力。对纯文本推理的严格二元偏好,可能会过度惩罚那些即使能产生正确答案的基于代码的响应,这可能在自适应目标与任务准确性目标之间引入冲突。为了平衡推理效率与任务成功,我们引入了必要性感知自适应奖励(NAAR),它在纯文本推理足以解决问题时优先考虑纯文本推理,同时仍对正确的基于代码的解决方案给予部分奖励。 对于每个采样组G,令 Itext(G) 指示该组是否包含至少一个正确的纯文本响应。对响应 yi 的自适应奖励定义为: 1, Itext(G) = 1, yi 为纯文本且正确, 0.25, Itext(G) = 1, yi 使用代码且正确,  Radaptive(yi; G) = (1) 1, Itext(G) = 0, yi 使用代码且正确, 0, 其他情况。

当一个问题可以通过纯文本推理解决时,NAAR将最高奖励分配给正确的纯文本响应,并将降低的奖励分配给正确的基于代码的响应,从而鼓励模型避免不必要的工具调用。重要的是,正确的基于代码的响应不会被赋予零奖励,因为它们仍然展示了成功的推理,并可能提供有用的学习信号。当组内没有纯文本响应正确时,正确的基于代码的响应

第 8 页

预印本。工作仍在进行中。

获得完整奖励,从而鼓励模型在解决问题所必需时使用工具。因此,NAAR 实现了对纯文本推理的软性偏好,而非硬性禁止工具使用,在保持任务解决能力的同时提升了必要性意识。

在实践中,我们在 SFT、RL 采样和评估中使用相同的提示词,以避免分布偏移(提示词见附录 C.3)。该提示词指示模型自主决定是否使用代码。

4.4.2 提示引导能力扩展

传统 RLVR 的一个根本局限在于,当策略在有限的采样次数内无法解决难题时,这些难题往往被“浪费”。在这种情况下,所有响应都获得相似的低奖励,因此几乎无法提供有用的组内相对学习信号。然而,这些难题对于扩展策略的能力边界尤其有价值,这与工具使用的目标一致。为了更好地利用这些样本,我们提出了提示引导能力扩展(Hint-Guided Capability Expansion,HCE),该方法将专家生成的提示注入采样过程,帮助策略在难题上发现成功的推理和工具使用轨迹。 具体来说,对于每个问题,我们首先使用原始提示词 x 从策略中采样一组 Gn = {yni }Ni=1,在我们的实验中 N = 8。如果这些响应中没有一个正确,我们将该问题视为难题,并调用一个强大的专家模型(Gemini-3.1-Pro)来构建一个不含答案的提示。生成的提示随后被注入到采样提示词中,使策略能够探索那些难以从其原始策略分布中发现的推理和工具使用行为。在策略优化期间,我们从模型输入中移除提示,同时保留在提示辅助下生成的轨迹,从而将提示辅助的行为迁移回原始的、无提示的策略,并避免在推理时依赖提示。

提示生成。直接提示专家模型生成提示可能会因两个原因导致不可靠的指导。首先,专家模型本身可能无法正确解决问题。其次,未经实际执行而产生的提示步骤可能不切实际或没有帮助。因此,我们采用两阶段的提示生成流程。首先,提示专家模型通过生成完整的代码辅助推理轨迹来解决难题,我们只保留正确的轨迹。其次,专家模型从已验证的轨迹中提取关键的推理步骤(文本或代码使用步骤)以及每个步骤的预期子目标,并将其转换为不含答案的提示。提示生成的详细提示词见附录 C.4。

带提示的采样。令 h 表示为具有原始问题提示词 x 的难题生成的提示。我们将提示附加到原始问题之后,构建带提示的提示词 xh = x ⊕ h,其中 ⊕ 表示提示词拼接。提示仅包含中间指令、预期子目标和有用的工具使用策略;它不包含最终答案。然后,我们从策略模型 πθ 中,在带提示的提示词 xh 下采样另一组 N 个响应:

. (2) yhi ∼ πθ · | xh , Gh = yhi Ni=1

带提示的组 xh 与正常组 xn(即从原始提示词 x 采样得到的组)结合,用于策略优化。对于带提示的组,在计算策略更新时,我们保留生成的轨迹 yhi,但将 xh 替换为原始提示词 x,以避免模型在推理时依赖提示。

4.4.3 结合正常与带提示采样的策略优化

令 Bn 和 Bh 分别表示来自正常组和带提示组的保留响应集合。对于任一类型的组 G,我们将格式奖励 Rformat 与先前定义的必要性感知自适应奖励相结合:

R(yi; G) = 0.1Rformat(yi) + 0.9Radaptive(yi; G), (3)

其中,格式奖励定义为:如果每个代码块后都跟着一个对应的观察块,并且最终答案放在 〈answer〉…〈/answer〉 中,则 Rformat(yi) = 1,否则 Rformat(yi) = 0。

8

第 9 页

预印本。工作进展中。

对于每个组,我们计算响应 $y_i$ 的组内相对优势为 $$A_i = \frac{R(y_i; G) – \mu_G}{\sigma_G + \varepsilon_{\text{adv}}}, \quad \varepsilon_{\text{adv}} = 10^{-6}, \tag{4}$$ 其中 $\mu_G$ 和 $\sigma_G$ 分别为组 $G$ 内奖励的均值和标准差。

令 $y_{i,t}$ 为第 $t$ 个可训练 token,并令 $\tau_{i,<t}$ 表示之前的交互历史,包括先前的模型 token 和环境观察。我们对普通组和提示组使用不同的重要性采样比率。对于普通组中的响应,重要性采样比率为 $$\rho_{i,t}^n(\theta) = \frac{\pi_\theta(y_{i,t} \mid x, \tau_{i,<t})}{\pi_{\theta_{\text{old}}}(y_{i,t} \mid x, \tau_{i,<t})}. \tag{5}$$ 其中 $\theta_{\text{old}}$ 是当前更新前的模型参数。对于提示响应,我们使用以下重要性采样比率: $$\rho_{i,t}^h(\theta) = \frac{\pi_\theta(y_{i,t} \mid x, \tau_{i,<t})}{\pi_{\theta_{\text{old}}}(y_{i,t} \mid x_h, \tau_{i,<t})}. \tag{6}$$ 通过从输入提示中移除提示,我们将通过提示引导探索获得的能力迁移到无提示策略中。遵循 [18],我们在旧策略的上下文中保留提示,以缓解离策略问题并稳定训练。

最终训练目标。 最终的 actor 损失遵循标准的裁剪 GRPO 目标: $$\mathcal{L}_{\text{GRPO}}(\theta) = -\frac{1}{Z} \sum_{b \in \{n, h\}} \sum_{y_i \in \mathcal{B}_b} \sum_{t \in \mathcal{T}_i} \min\left( \hat{\rho}_{i,t}^b(\theta) A_i, \text{clip}\left( \hat{\rho}_{i,t}^b(\theta), 1 – \epsilon, 1 + \epsilon \right) A_i \right), \tag{7}$$ 其中 $\epsilon = 0.2$,$Z = \sum_{b \in \{n, h\}} \sum_{y_i \in \mathcal{B}_b} |\mathcal{T}_i|$。这里,$\mathcal{T}_i$ 仅包含可训练 token,并排除工具响应。

4.4.4 其他实现细节

我们过滤掉具有零准确率优势的组,即所有响应全对或全错的组(即使在提示展开后),以及具有零自适应优势的组,即组内所有响应共享相同推理模式的组,因为它们无法为相应的奖励提供有用的学习信号。

5 实验

在实验部分,我们旨在回答以下研究问题:

RQ1: 与现有的开源和闭源模型相比,Beacon 在感知、通用视觉理解和推理基准上的表现如何?

RQ2: Beacon 的各个组件如何影响模型的 Mode Adaptiveness (MA)、Tool Effect (TE) 以及整体性能?

5.1 实验设置

训练细节。 我们采用 Qwen3-VL-8B-Instruct [1] 作为基础模型。对于 SFT,我们以 $1e^{-5}$ 的峰值学习率训练模型 4 个 epoch。对于 RL 阶段,我们以 $1e^{-6}$ 的学习率和 128 的 rollout 组大小训练模型 1 个 epoch。更多细节见附录 C。

评估基准。 正如 [42] 所建议的,对智能体视觉推理模型的评估应考虑需要视觉工具使用的挑战性基准。因此,我们在广泛的任务上评估我们的模型,包括:高分辨率视觉搜索:V* [39]、HRBench [38]、Visual Probe [12](困难);空间与感知推理:RealWorldQA [40]、BLINK [5]、BabyVision [3];量化与图表推理:ChartQAPro [17]、MathVista [15]、MathVision [36];组合与智能体视觉推理:VisualPuzzles [28]、GameQA [32]、TIRBench [13]。这些基准超越了简单的物体识别或局部感知,要求模型执行复杂的视觉搜索、空间变换、图表解读、中间状态想象等。

9

第 10 页

预印本。工作进展中。

表1:高分辨率视觉搜索、空间与感知推理基准测试对比。平均值为所有可报告结果的平均。粗体和下划线分别表示开源模型中的最佳和次佳性能。灰色表示结果引自原始论文。

| 模型 | 高分辨率视觉搜索 | | | 空间与感知推理 | | | | 平均 | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | V∗ | HR-Bench 4K | HR-Bench 8K | VisualProbe | RealWorldQA | BLINK | BabyVision | | | 闭源模型 | | | | | | | | | | Gemini 3.1 pro | 89.00 | 90.75 | 86.38 | 40.57 | 79.25 | 81.22 | 48.45 | 73.66 | | 开源模型 | | | | | | | | | | Qwen3-VL-8B-Instruct | 84.85 | 78.13 | 75.75 | 37.74 | 72.29 | 62.86 | 12.37 | 60.57 | | Pixel-Reasoner-7B | 78.01 | 71.25 | 67.75 | 33.96 | 70.20 | 55.97 | 11.86 | 55.57 | | Thyme-7B | 82.72 | 77.50 | 72.13 | 47.17 | 70.59 | 54.81 | 14.43 | 59.91 | | DeepEyesV2-7B | 80.63 | 75.62 | 65.88 | 32.08 | 62.35 | 54.29 | 14.18 | 55.00 | | CodeV-7B | 84.29 | 75.62 | 67.50 | 40.57 | 70.58 | 58.13 | 12.37 | 58.44 | | PyVision-7B | 88.7 | 78.1 | 74.3 | – | – | – | – | – | | Metis-8B | 90.58 | 83.50 | 81.63 | 48.11 | 71.90 | 62.09 | 14.17 | 64.57 | | Beacon-8B (Ours) | 89.00 | 84.30 | 81.88 | 50.00 | 73.20 | 65.96 | 18.04 | 66.05 | | ∆over Qwen3-VL-8B-Inst. | +4.15 | +6.17 | +6.13 | +12.26 | +0.91 | +3.10 | +5.67 | +5.48 |

表2:定量、图解、组合与智能体视觉推理基准测试对比。平均值为所有可报告结果的平均。

| 模型 | 定量与图解推理 | | | 组合与智能体视觉推理 | | | 平均 | | :— | :— | :— | :— | :— | :— | :— | :— | | | ChartQAPro | MathVista | MathVision | VisualPuzzles | GameQA | TIR-Bench | | | 闭源模型 | | | | | | | | | Gemini 3.1 Pro | 75.46 | 90.40 | 89.47 | 73.46 | 81.00 | 47.57 | 76.23 | | 开源模型 | | | | | | | | | Qwen3-VL-8B-Instruct | 41.66 | 76.40 | 53.81 | 36.22 | 36.70 | 19.01 | 43.97 | | Pixel-Reasoner-7B | 51.03 | 70.80 | 28.09 | 33.90 | 28.10 | 16.71 | 38.11 | | Thyme-7B | 38.66 | 68.90 | 25.82 | 24.14 | 26.00 | 19.01 | 33.76 | | DeepEyesV2-7B | 50.92 | 67.30 | 27.30 | 34.33 | 27.50 | 17.04 | 37.40 | | CodeV-7B | 46.06 | 69.80 | 26.02 | 34.85 | 28.00 | 17.70 | 37.07 | | PyVision-7B | – | – | 28.7 | – | – | 19.8 | – | | Metis-8B | 52.79 | 77.80 | 53.49 | 40.50 | 38.50 | 21.65 | 47.46 | | Beacon-8B (Ours) | 58.48 | 77.10 | 54.57 | 42.89 | 47.30 | 24.03 | 50.73 | | ∆over Qwen3-VL-8B-Inst. | +16.82 | +0.70 | +0.76 | +6.67 | +10.60 | +5.02 | +6.76 |

基线模型。我们将我们的模型与强大的开源和闭源模型进行比较。开源模型包括 Qwen3-VL-8B-Instruct [1]、PixelReasoner [29]、Thyme [44]、DeepEyesV2 [10]、CodeV [11]、PyVision-RL [46] 和 Metis [41]。闭源模型包括 Gemini3.1-pro [7]。

5.2 主要结果

评估结果如表1和表2所示。Beacon-RL-8B 在所有开源模型中取得了最高的平均性能,在13个基准测试中的11个上排名第一,并且平均比其基座模型高出6.07分。

5.3 分析

在本节中,我们展示 Mode Adaptiveness 和 Tool Effect 的详细结果与分析。除了第3.1节中的指标外,我们进一步定义 Text-Retain 为:在 ptext 下可通过纯文本推理解决,且在 ptool 下不使用工具仍能正确回答的样本比例。该值越高,表明跨提示的无工具推理鲁棒性越强。结果如表3所示。我们总结关键观察如下。

观察1:Beacon 可以通过使用工具进一步提升其本已强大的无工具推理能力。当工具可用时,Beacon 在所有数据集上始终优于无工具推理,并显示出最大的性能增益 ∆Acc (+1.96%),而其他模型在使用工具时的 ∆Acc 较弱(低于+1%)。请注意,Beacon 的无工具推理相比基座模型仍有明显提升(51.57%,对比 Qwen3-VL-8B-Instruct 的平均准确率

第 11 页

表3:反映智能体视觉推理模型的模式自适应性(Mode Adaptiveness)与工具效应(Tool Effect)的指标(%)。所有指标的定义见3.1节。↑和↓分别表示数值越高越好和越低越好。准确率后括号内的数字表示在两种不同提示(ptool和ptext)下实际使用工具的样本比例。∆Acc = 工具可用准确率 − 无工具准确率,∆TE = Tool-Gain − Tool-Harm。正增量和非正增量分别以绿色和红色显示。

数据集 方法 准确率 模式自适应性 工具效应 工具可用准确率 ↑ 无工具准确率 ↑ ∆Acc ↑ MAtool ↑ MAtext ↑ MAmean ↑ Tool-Gain ↑ Tool-Harm ↓ ∆TE ↑ Text-Retain ↑

Thyme 76.70 (12.77) 76.88 (0.00) -0.18 11.52 86.81 49.16 0.20 0.38 -0.18 96.06 DeepEyesV2 75.33 (98.87) 73.90 (0.00) +1.43 99.51 1.36 50.44 7.47 6.20 +1.27 100.00 HRBench4K CodeV 74.05 (61.08) 74.78 (0.23) -0.73 43.90 33.31 38.61 3.12 3.05 +0.07 83.73 Metis 84.12 (46.87) 83.80 (0.00) +0.32 41.77 51.85 46.81 0.75 0.33 +0.42 96.81 Beacon (Ours) 83.38 (70.65) 80.53 (0.00) +2.85 97.24 37.18 67.21 9.98 4.47 +5.51 100.00

Thyme 57.41 (0.68) 55.35 (0.00) +2.06 1.00 99.50 50.25 0.16 0.00 +0.16 84.32 DeepEyesV2 53.83 (99.80) 55.27 (0.00) -1.44 99.92 0.35 50.13 10.06 9.76 +0.30 87.50 BLINK CodeV 58.56 (14.66) 55.98 (0.00) +2.58 16.10 85.89 51.00 2.29 1.90 +0.39 79.85 Metis 62.09 (24.51) 64.67 (0.00) -2.58 23.09 74.42 48.76 1.27 2.25 -0.98 87.78 Beacon (Ours) 65.49 (79.79) 64.22 (0.00) +1.27 93.78 28.30 61.04 13.11 11.15 +1.96 95.28

Thyme 12.27 (0.62) 11.55 (0.00) +0.72 0.72 100.00 50.36 0.00 0.00 0.00 52.00 DeepEyesV2 11.39 (99.90) 1.44 (0.00) +9.95 99.90 0.00 49.95 10.98 0.88 +10.10 – BabyVision CodeV 13.76 (0.57) 14.74 (0.00) -0.98 0.69 100.00 50.35 0.00 0.00 0.00 35.51 Metis 15.52 (15.72) 15.93 (0.00) -0.41 17.65 94.55 56.10 0.62 0.46 +0.16 54.23 Beacon (Ours) 16.70 (95.36) 15.36 (0.00) +1.34 95.99 10.77 53.38 6.44 2.42 +4.02 85.71

Thyme 71.22 (0.10) 71.64 (0.00) -0.42 0.08 99.88 49.98 0.00 0.00 0.00 93.57 DeepEyesV2 72.22 (99.88) 73.68 (0.00) -1.46 100.00 0.17 50.08 5.32 7.28 -1.96 83.33 MathVista CodeV 71.70 (0.30) 72.08 (0.00) -0.38 0.76 99.86 50.31 0.04 0.04 0.00 92.01 Metis 77.36 (17.34) 78.02 (0.00) -0.66 21.22 83.52 52.37 0.84 1.16 -0.32 95.44 Beacon (Ours) 77.80 (78.52) 77.18 (0.00) +0.62 92.34 25.84 59.09 5.98 6.36 -0.38 98.46

Thyme 20.53 (10.45) 19.05 (0.02) +1.48 8.07 78.57 43.32 0.58 0.25 +0.33 81.21 DeepEyesV2 15.80 (99.11) 20.15 (0.00) -4.35 99.22 1.25 50.24 5.43 6.45 -1.02 63.64 TIRBench CodeV 18.11 (15.60) 17.04 (0.00) +1.07 12.76 68.64 40.70 0.82 0.95 -0.13 65.86 Metis 21.84 (54.32) 21.23 (0.00) +0.61 59.32 59.23 59.27 2.21 1.28 +0.93 80.66 Beacon (Ours) 24.28 (92.74) 20.56 (0.00) +3.72 94.40 12.44 53.42 10.96 6.37 +4.59 75.56

Thyme 47.63 46.89 +0.73 4.28 92.95 48.61 0.19 0.13 +0.06 81.43 DeepEyesV2 45.71 44.89 +0.83 99.71 0.63 50.17 7.85 6.11 +1.74 – 平均 CodeV 47.24 46.92 +0.31 14.84 77.54 46.19 1.25 1.19 +0.07 71.39 Metis 52.19 52.73 -0.54 32.61 72.71 52.66 1.14 1.10 +0.04 82.98 Beacon (Ours) 53.53 51.57 +1.96 94.75 22.91 58.83 9.29 6.15 +3.14 91.00

在这五个数据集上,该比例为49.75%),表明Beacon工具使用带来的明显性能增益并非以削弱无工具推理能力为代价。

观察2:Beacon在评估模型中展现出最佳推理模式自适应性。尽管Beacon表现出对使用代码的偏好(Beacon的MAtext相对较低),但其平均MAmean最高,表明它能够针对不同问题自适应地选择合适的推理模式。

观察3:Beacon在工具带来的性能增益与损害之间表现出最大差距,同时Text-Retain最高。与其他∆TE几乎为零的模型相比,Beacon在工具使用上展现出明显优势,∆TE为+3.14%,这表明它能有效利用工具解决纯文本推理困难的问题,同时将无效工具使用导致的性能下降控制在合理范围内。

5.4 消融研究

我们进行了全面的消融研究,以评估Beacon各组件对整体性能、模式自适应性(Mode Adaptiveness)和工具效应(Tool Effect)的贡献。结果见表4。我们观察到,完整方法具有最佳整体性能,而单独使用必要性感知自适应奖励(necessity-aware adaptive reward)则实现了最佳模式自适应性。此外,与GRPO相比,加入HCE模块提升了∆TE。消融研究的完整结果见附录D.1。

5.5 强化学习阶段的训练动态

本节对Beacon强化学习阶段的训练动态进行全面分析。

训练奖励与自适应行为。我们在图5中展示了强化学习阶段的奖励动态,所有奖励信号均呈现稳步上升趋势。图6(a)展示了纯文本和代码辅助响应的比例,在整个训练过程中保持相对稳定,

第 12 页

表4: Beacon的逐组件消融研究。“Overall Acc.”表示13个基准测试的平均准确率。其他指标定义见第3.1节,并基于表3中的五个基准测试取平均值。

SFT GRPO NAAR HCE Overall Acc. ↑ Tool-Available Acc. ↑ Tool-Free Acc. ↑ MAmean ↑ ∆TE ↑ ✓ 56.91 – – – – ✓ ✓ 57.10 52.25 51.40 56.30 +1.40 ✓ ✓ ✓ 57.75 53.25 52.24 59.68 +2.54 ✓ ✓ ✓ 57.62 52.94 51.83 58.36 +2.96 ✓ ✓ ✓ ✓ 58.98 53.53 51.57 58.83 +3.14

训练准确率 自适应奖励 格式奖励

训练准确率(原始) 自适应奖励(原始) 格式奖励(原始) 训练准确率(平滑) 自适应奖励(平滑) 格式奖励(平滑) 0.800 44 0.36 (%) 42 0.34 0.775 0.750 40 0.32 奖励 奖励 0.725 38 准确率 0.30 36 0.700 0.28 1 20 40 60 80 99 1 20 40 60 80 99 1 20 40 60 80 99 训练步数 训练步数 训练步数

(a) (b) (c)

图5: 强化学习阶段的训练准确率与奖励。(a) 平均训练准确率。(b) 自适应奖励。(c) 格式奖励。

且未明显转向任何一种推理模式。相比之下,图6(c)报告了推理模式对齐准确率,即实际推理模式与其所在组分配的自适应标签相匹配的rollout轨迹比例。该准确率在训练过程中持续提升,表明模型逐渐学会了自适应的工具调用策略,而非简单地形成对某种推理模式的偏好。图6(b)进一步显示,两种推理模式的自适应标签比例在训练期间保持稳定。

训练组构成与全错组转化。图7(a)展示了强化学习阶段训练rollout组的构成。我们将这些组分为三类:包含至少一个正确纯文本响应的组(“w/ text correct”)、不含正确纯文本响应但包含至少一个正确代码辅助响应的组(“w/o text correct & w/ code correct”),以及响应初始全部错误的提示诱导组(“hinted”)。这三类的比例相对稳定,分别约为50%、35%和15%。图7(b)进一步报告了初始全错组中,通过提示引导重采样转化为具有非零准确率优势的组的比例。约40%的此类组可通过我们的HCE机制成功回收,证明了该机制在从原本无信息的rollout组中恢复有效学习信号方面的有效性。

5.6 对RQ1和RQ2的回答

基于上述实验与分析,我们现在可以回答本节开头提出的两个研究问题。

RQ1. Beacon在所有评估的开源模型中,在感知、通用视觉理解和推理基准测试上取得了最强的综合性能。它在13个基准测试中的11个上排名第一,并比Qwen3-VL-8B-Instruct基座模型平均提升了6.07个百分点。这些结果表明,Beacon能有效泛化到多样的任务类型,并显著缩小了开源模型与领先闭源模型之间的差距。

RQ2. 消融结果表明,所提出的组件为Beacon带来了互补性的改进。Necessity-Aware Adaptive Reward主要通过鼓励模型根据任务必要性选择推理模式来提升Mode Adaptiveness,而Hint-Guided Capability Expansion则通过从全错

第 13 页

预印本。工作仍在进行中。

代码 vs. 文本比例 文本 vs. 代码标签比例 推理模式对齐准确率

代码比例 文本比例 代码标签比例 文本标签比例 文本标签准确率 代码标签准确率

100 100

80 80 80 (%) (%) 60 (%) 60

40 40 60 比例 比例 20 20 准确率 40 0 0 1 20 40 60 80 99 1 20 40 60 80 99 1 20 40 60 80 99 训练步数 训练步数 训练步数

(a) (b) (c)

图 6: (a) 训练过程中纯文本和代码辅助响应的比例。(b) 训练批次中被分配“文本”和“代码”自适应标签以进行奖励计算的组比例。(c) 推理模式选择的准确率,衡量其推理模式与对应组自适应标签相匹配的响应比例。

训练组构成 全错组的转化比例

含文本正确 不含文本正确但含代码正确 提示引导 转化比例 100 (%) 60 80 比例 5040 (%) 60 30 40 比例 20 20 10 0 转化比例 0 1 20 40 60 80 99 1 20 40 60 80 99 训练步数 训练步数

(a) 训练组的构成。 (b) 转化比例。

图 7: (a) 包含至少一个正确纯文本响应的组(“含文本正确”)、不包含正确纯文本响应但包含至少一个正确代码辅助响应的组(“不含文本正确但含代码正确”)以及提示引导生成的组(“提示引导”)的比例。(b) 初始全错组通过提示引导重采样转化为具有非零准确率优势的组的比例。

采样组,并提升在难题上使用工具的有效性。它们的结合带来了最佳的整体准确率,以及工具带来的增益与损害之间最大的正向差距。训练动态进一步证实,这些改进源于日益准确的推理模式选择,而非简单地转向纯文本或代码辅助推理。

6 结论

在这项工作中,我们从工具是否被恰当且有效地使用的角度,重新审视了智能体视觉推理。我们引入了两个互补的维度,即模式自适应性(Mode Adaptiveness)和工具效应(Tool Effect),来刻画模型能否为每个问题选择合适的推理模式,以及工具的使用是否真正扩展了其超越无工具推理的能力。通过对代表性智能体视觉推理模型的系统性评估,我们发现现有模型通常表现出对单一推理模式的强烈偏好,而工具带来的增益在很大程度上被无效工具使用所引入的错误所抵消。

受这些发现的启发,我们提出了 Beacon,一个通过高质量数据合成流程和定制化强化学习框架训练的智能体视觉推理模型。具体而言,必要性感知自适应奖励(Necessity-Aware Adaptive Reward)鼓励模型避免不必要的工具调用,同时不抑制有用的工具辅助推理;而提示引导能力扩展(Hint-Guided Capability Expansion)则从传统强化学习无法解决的困难样本中恢复出有信息量的学习信号。在 13 个多样化基准上的大量实验表明,Beacon 取得了强大的整体性能。

第 14 页

能,同时显著提升了推理模式自适应性和工具使用的相对增益。 这些结果表明,智能体视觉推理的进展不应仅以模型使用工具的频率来衡量,而应看它们是否知道何时需要工具,以及如何利用工具产生真正的能力增益。

参考文献

[1] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, et al. Qwen3-vl technical report. arXiv preprint arXiv:2511.21631, 2025.

[2] Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, and Junyang Lin. Qwen2.5-vl technical report. arXiv preprint arXiv:2502.13923, 2025.

[3] Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Yiping Bao, et al. Babyvision: Visual reasoning beyond language. arXiv preprint arXiv:2601.06521, 2026.

[4] Haodong Duan, Junming Yang, Yuxuan Qiao, Xinyu Fang, Lin Chen, Yuan Liu, Xiaoyi Dong, Yuhang Zang, Pan Zhang, Jiaqi Wang, et al. Vlmevalkit: An open-source toolkit for evaluating large multi-modality models. In ACM MM, 2024.

[5] Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang, Xudong Lin, Dan Roth, Noah A Smith, Wei-Chiu Ma, and Ranjay Krishna. Blink: Multimodal large language models can see but not perceive. In European Conference on Computer Vision, pp. 148–166. Springer, 2024.

[6] Google DeepMind. Gemini 3 flash. https://deepmind.google/models/model-cards/gemini-3-flash/, 2025.

[7] Google DeepMind. Gemini 3.1 Pro: Model Card. https://deepmind.google/models/model-cards/gemini-3-1-pro/, 2026.

[8] Garvin Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, and Minpeng Liao. Do multimodal agents really benefit from tool use? a systematic study of capability gains. arXiv preprint arXiv:2606.02357, 2026.

[9] Chaoqun He, Renjie Luo, Yuzhuo Bai, Shengding Hu, Zhen Thai, Junhao Shen, Jinyi Hu, Xu Han, Yujie Huang, Yuxiang Zhang, et al. Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems. In ACL, 2024.

[10] Jack Hong, Chenxiao Zhao, ChengLIn Zhu, Weiheng Lu, Guohai Xu, and XingYu. Deepeyesv2: Toward agentic multimodal model. In ICLR, 2026. URL https://openreview.net/forum?id=yDKawwfJ5O.

[11] Xinhai Hou, Shaoyuan Xu, Manan Biyani, Mayan Li, Jia Liu, Todd C Hollon, and Bryan Wang. Codev: Code with images for faithful visual reasoning via tool-aware policy optimization. In CVPR, 2026.

[12] Xin Lai, Junyi Li, Wei Li, Tao Liu, Tianjian Li, and Hengshuang Zhao. Mini-o3: Scaling up reasoning patterns and interaction turns for visual search. arXiv preprint arXiv:2509.07969, 2025.

[13] Ming Li, Jike Zhong, Shitian Zhao, Haoquan Zhang, Shaoheng Lin, Yuxiang Lai, Chen Wei, Konstantinos Psounis, and Kaipeng Zhang. Tir-bench: A comprehensive benchmark for agentic thinking-with-images reasoning. arXiv preprint arXiv:2511.01833, 2025.

[14] Pan Lu, Ran Gong, Shibiao Jiang, Liang Qiu, Siyuan Huang, Xiaodan Liang, and Song-Chun Zhu. Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning. In ACL, 2021.

14

第 15 页

[15] Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, and Jianfeng Gao. Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts. In ICLR, 2024.

[16] Yan Ma, Weiyu Zhang, Tianle Li, Du Linge, Xuyang Shen, and Pengfei Liu. What does vision tool-use reinforcement learning really learn? disentangling tool-induced and intrinsic effects for crop-and-zoom. In ICML, 2026.

[17] Ahmed Masry, Mohammed Saidul Islam, Mahir Ahmed, Aayush Bajaj, Firoz Kabir, Aaryaman Kartha, Md Tahmid Rahman Laskar, Mizanur Rahman, Shadikur Rahman, Mehrad Shahmohammadi, et al. Chartqapro: A more diverse and challenging benchmark for chart question answering. In ACL Findings, 2025.

[18] Vaskar Nath, Elaine Lau, Anisha Gunjal, Manasi Sharma, Nikhil Baharte, and Sean Hendryx. Adaptive guidance accelerates reinforcement learning of reasoning models. arXiv preprint arXiv:2506.13923, 2025.

[19] Ji Qi, Ming Ding, Weihan Wang, Yushi Bai, Qingsong Lv, Wenyi Hong, Bin Xu, Lei Hou, Juanzi Li, Yuxiao Dong, and Jie Tang. Cogcom: A visual language model with chain-of-manipulations reasoning. In ICLR, 2025.

[20] Runqi Qiao, Qiuna Tan, Minghan Yang, Guanting Dong, Peiqing Yang, Shiqiang Lang, Enhui Wan, Xiaowan Wang, Yida Xu, Lan Yang, et al. V-thinker: Interactive thinking with images. arXiv preprint arXiv:2511.04460, 2025.

[21] Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, and Zhuang Liu. Vero: An open rl recipe for general visual reasoning. arXiv preprint arXiv:2604.04917, 2026.

[22] Gabriel Herbert Sarch, Snigdha Saha, Naitik Khandelwal, Ayush Jain, Michael J. Tarr, Aviral Kumar, and Katerina Fragkiadaki. Grounded reinforcement learning for visual reasoning. In NeurIPS, 2025.

[23] Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, et al. Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024.

[24] Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, and Chuan Wu. Hybridflow: A flexible and efficient rlhf framework. arXiv preprint arXiv: 2409.19256, 2024.

[25] Yang Shi, Jiaheng Liu, Yushuo Guan, Zhenhua Wu, Yuanxing Zhang, Zihao Wang, Weihong Lin, Jingyun Hua, Zekun Wang, Xinlong Chen, et al. Mavors: Multi-granularity video representation for multimodal large language model. In Proceedings of the 33rd ACM International Conference on Multimedia, pp. 10994–11003, 2025.

[26] Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan Catanzaro. Megatron-lm: Training multi-billion parameter language models using model parallelism. arXiv preprint arXiv:1909.08053, 2019.

[27] Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, and Yunqing Zhao. Codedance: A dynamic tool-integrated mllm for executable visual reasoning. arXiv preprint arXiv:2512.17312, 2025.

[28] Yueqi Song, Tianyue Ou, Yibo Kong, Zecheng Li, Graham Neubig, and Xiang Yue. Visualpuzzles: Decoupling multimodal reasoning evaluation from domain knowledge. arXiv preprint arXiv:2504.10342, 2025.

[29] Alex Su, Haozhe Wang, Weiming Ren, Fangzhen Lin, and Wenhu Chen. Pixel reasoner: Incentivizing pixel space reasoning via curiosity-driven reinforcement learning. In NeurIPS, 2025.

[30] Zhaochen Su, Linjie Li, Mingyang Song, Yunzhuo Hao, Zhengyuan Yang, Jun Zhang, Guanjie Chen, Jiawei Gu, Juntao Li, Xiaoye Qu, and Yu Cheng. Openthinkimg: Learning to think with images via visual tool reinforcement learning. arXiv preprint arXiv:2505.08617, 2025.

15

第 16 页

[31] Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, et al. Agentvista: Evaluating multimodal agents in ultra-challenging realistic visual scenarios. arXiv preprint arXiv:2602.23166, 2026.

[32] Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, et al. Game-rl: Synthesizing multimodal verifiable game data to boost vlms' general reasoning. arXiv preprint arXiv:2505.13886, 2025.

[33] Shengbang Tong, Ellis Brown, Penghao Wu, Sanghyun Woo, Manoj Middepogu, Sai C Akula, Jihan Yang, Shusheng Yang, Adithya Iyer, Xichen Pan, et al. Cambrian-1: A fully open, vision-centric exploration of multimodal llms. NeurIPS, 2024.

[34] Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, and Xiangyu Yue. Adatooler-v: Adaptive tool-use for images and videos. arXiv preprint arXiv:2512.16918, 2026.

[35] Fei Wang, Xingyu Fu, James Y Huang, Zekun Li, Qin Liu, Xiaogeng Liu, Mingyu Derek Ma, Nan Xu, Wenxuan Zhou, Kai Zhang, et al. Muirbench: A comprehensive benchmark for robust multi-image understanding. In ICLR, 2025.

[36] Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Houxing Ren, Aojun Zhou, Mingjie Zhan, and Hongsheng Li. Measuring multimodal mathematical reasoning with math-vision dataset. NeurIPS, 2024.

[37] Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, and Yisen Wang. Monet: Reasoning in latent visual space beyond images and language. arXiv preprint arXiv:2511.21395, 2025.

[38] Wenbin Wang, Liang Ding, Minyan Zeng, Xiabin Zhou, Li Shen, Yong Luo, Wei Yu, and Dacheng Tao. Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models. In AAAI, 2025.

[39] Penghao Wu and Saining Xie. V*: Guided visual search as a core mechanism in multimodal llms. In CVPR, pp. 13084–13094, 2024.

[40] xAI. RealWorldQA. https://huggingface.co/datasets/xai-org/RealworldQA, 2024. A benchmark for evaluating real-world spatial understanding.

[41] Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu Shi, Guannan Zhang, Ruixuan Li, and Yixiong Zou. Act wisely: Cultivating meta-cognitive tool use in agentic multimodal models. arXiv preprint arXiv:2604.08545, 2026.

[42] Wenjie Yang, Siqi Zhu, and Zengfeng Huang. Position: Your VLM may not be thinking with interleaved images. In ICML Position Paper Track, 2026.

[43] Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, et al. Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi. In CVPR, 2024.

[44] Yi-Fan Zhang, Xingyu Lu, Shukang Yin, Chaoyou Fu, Wei Chen, Xiao Hu, Bin Wen, Kaiyu Jiang, Changyi Liu, Tianke Zhang, Haonan Fan, Kaibing Chen, Jiankang Chen, Haojie Ding, Kaiyu Tang, Zhang Zhang, Liang Wang, Fan Yang, Tingting Gao, and Guorui Zhou. Thyme: Think beyond images. In ICLR, 2026.

[45] Yusen Zhang, Wenliang Zheng, Aashrith Madasu, Peng Shi, Ryo Kamoi, Hao Zhou, Zhuoyang Zou, Shu Zhao, Sarkar Snigdha Sarathi Das, Vipul Gupta, et al. Hrscene: How far are vlms from effective high-resolution image understanding? In ICCV, 2025.

[46] Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, and Chen Wei. Pyvision-rl: Forging open agentic vision models via rl. arxiv preprint arxiv:2602.20739, 2026.

16

第 17 页

预印本。工作仍在进行中。

[47] Yuze Zhao, Jintao Huang, Jinghan Hu, Xingjun Wang, Yunlin Mao, Daoze Zhang, Zeyinzi Jiang, Zhikai Wu, Baole Ai, Ang Wang, Wenmeng Zhou, and Yingda Chen. Swift:a scalable lightweight infrastructure for fine-tuning. arXiv preprint arXiv:2408.05517, 2024.

[48] Jiyang Zheng, Jialiang Shen, Yu Yao, Min Wang, Yang Yang, Dadong Wang, and Tongliang Liu. Chain-of-focus prompting: Leveraging sequential visual cues to prompt large autoregressive vision models. In ICLR, 2025.

[49] Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, et al. Vtc-bench: Evaluating agentic multi-modal models via compositional visual tool chaining. arXiv preprint arXiv:2603.15030, 2026.

17

第 18 页

预印本。工作进展中。

附录目录

A 实验细节 19 A.1 指标分析实验细节 … 19 A.2 评估实验细节 … 19

B 训练数据细节 19 B.1 概览 … 19 B.2 数据来源 … 19 B.3 SFT数据合成 … 20

C 训练细节 26 C.1 冷启动SFT细节 … 26 C.2 强化学习细节 … 26 C.3 SFT、RL与评估的系统提示 … 26 C.4 提示生成细节 … 26

D 附加实验结果 28 D.1 消融研究详细结果 … 28

E 讨论 28 E.1 失败尝试 … 28

F 案例研究 28 F.1 推理轨迹示例 … 28 F.2 提示示例 … 28

18

第 19 页

预印本。工作进展中。

A 实验细节

A.1 指标分析实验细节

提示框 1:强制纯文本回答的提示

你是一个乐于助人的助手。

请通过直接从提供的图像和问题进行推理,逐步解决以下问题。

你不得使用任何外部工具、代码执行、Python 或搜索。不要输出 <code> 块或任何工具调用格式。

输出格式必须为: 〈think〉…〈/think〉 〈answer〉…〈/answer〉

A.2 评估实验细节

我们在开源 VLMEvalKit 工具包 [4] 上构建评估框架。对于每个模型,我们遵循其官方实现来实现工具使用推理流程,包括提示、工具调用格式和执行过程。对于所有智能体模型,包括 Beacon,当因代码执行错误或缺少 \boxed{} 标签而未能生成有效最终答案时,我们允许最多三次重试。每个模型最多可进行 20 轮工具调用。我们将所有模型的解码温度设为 0.1。

对于答案评估,我们首先对模型的最终预测与真实答案进行基于规则的匹配。如果基于规则的匹配失败,我们将预测和真实答案都提供给 Gemini 3.1 Pro [7] 或 Gemini 3 Flash [6] 进行语义答案判断。

B 训练数据细节

B.1 概述

表 5:训练数据统计。我们报告了原始样本总数和数据过滤后保留的样本数。

| 数据类型 | 原始数量 | 过滤后保留数量 | | :— | :— | :— | | SFT 数据 | 212,353 | 15,705 | | RL 数据 | 45,886 | 15,709 |

表 5 总结了训练数据的统计信息。

B.2 数据来源

Beacon 利用了多样化的公开多模态数据源,涵盖数学推理、图表理解、具身交互、空间感知、游戏推理和通用视觉推理。

具体来说,训练数据收集自 Geometry3K [14]、OlympiadBench [9]、AgentVista [31]、MuirBench [35]、HRScene [45]、CV-Bench [33]、MMMU [43] 和 Vero [21]。这些数据源覆盖了广泛的任务格式和视觉推理需求,使 Beacon 能够将模型暴露于具有不同工具依赖程度的异构场景中。

数学和几何导向的数据源,包括 Geometry3K [14] 和 OlympiadBench [9],提供了需要视觉数学推理、几何图理解、符号操作和多步科学问题解决的训练样本。HRScene [45] 和 CV-Bench [33] 通过高分辨率图像理解、区域敏感感知、物体计数、空间关系推理以及 2D/3D 视觉理解,丰富了训练语料库。

19

第 20 页

Preprint. 正在进行中。

Vero RecognitionKnowledge Geometry3K Muir-Bench OlympiadBench STEM MMMU General STEM Vero

Beacon Chart Vero Tool Agentic Chart and AgentVista OCR Perception HRScene VeroSpatial Vero CV-Bench GroundingCounting

图 8: Beacon 的训练数据来源。

AgentVista [31] 提供了面向工具和智能体的视觉推理数据,鼓励模型通过中间视觉操作进行长程推理。最后,MMMU [43]、MuirBench [35] 和 Vero [21] 引入了跨学术、多图像和通用视觉推理任务的更广泛多模态推理场景。

如图 8 所示,最终得到的语料库涵盖了广泛的任务类型、推理复杂度和工具需求。虽然部分样本可以通过直接多模态推理解决,但其他样本本质上受益于外部工具,用于视觉操作、几何分析或结构化信息提取等操作。这种多样性使模型接触到工具必要和工具可选的场景,为学习不仅如何有效使用工具,而且何时工具调用真正有益奠定了基础。我们在图 9 中展示了训练数据的任务分布。图 10 和图 11 进一步分别展示了过滤前后 SFT 和 RL 数据中每个数据集的样本数量。

B.3 SFT 数据合成

SFT 数据的合成包括两个步骤:1) 使用 Gemini 3.1 Pro [7] 为源问题生成基于代码的推理轨迹,并仅保留最终答案与真实标签匹配的轨迹;2) 使用同一模型优化保留的轨迹。

1. SFT 代码推理轨迹合成的提示词。提示词见框 2。其关键设计选择总结如下:

代表性代码操作。我们提供了五种代表性代码操作,包括 cropdraw linedraw boxnumeric calculationrotation,涵盖了常见的视觉推理操作。对于每种操作,我们指定了其目的、推荐库、所需导入、输入约定和一个具体示例。这些示例作为指导而非约束;在实践中,Gemini 3.1 Pro [7] 生成的代码模式远比提供的示例更为多样。

强制使用代码。我们明确指示 Gemini 3.1 Pro [7] 调用代码以获取视觉证据或其他有用的中间信息。由于模型仍可能在不使用代码的情况下直接回答某些问题,我们丢弃了不包含有效工具执行的轨迹。

20

第 21 页

预印本。工作仍在进行中。

SFT数据 RL数据

12.8% 21.8% 21.6% 20.7%

0.1% 1.2% 20.9%

17.2%

44.4% 39.3%

STEM 图表感知 智能体工具 通用

图9: SFT和RL数据的任务类别分布。

原始样本 保留样本 保留率

Geometry3K 257 12.2%

OlympiadBench 136 STEM 3.4%

Vero STEM 1,618 3.5% 图表 Vero Chart 3,282 6.8% 与OCR

HRScene 106 12.6%

CV-Bench 210 感知 8.0%

Vero Grounding 2,570 14.3% 计数

Vero Spatial 4,090 6.9%

AgentVista 16 智能体工具 7.7%

MMMU 454 11.5%

Muir-Bench 88 通用 4.1%

Vero Knowledge 2,878 11.3% 识别

101 102 103 104 105 样本数量 图10: SFT数据的详细统计。柱状图中的数字表示经过拒绝采样(移除简单样本)和精炼(移除代码实际无助于得出答案的代码轨迹)后保留的样本数量。“保留率”表示保留样本相对于原始样本的百分比。

结构化轨迹格式。我们要求模型以结构化格式生成轨迹,使用 <tool_call>...</tool_call> 进行代码执行,<tool_response>...</tool_response> 表示执行结果,<observation>...</observation> 用于解读返回的证据,以及 〈answer〉...〈/answer〉 表示最终预测。这种结构化格式提高了可解释性,实现了可靠的自动解析,并鼓励在给出最终答案前对工具输出进行显式推理。

沙箱协议。我们定义了几种执行协议,以减少歧义并简化解析。问题图像和代码生成的图像被分配了唯一标识符

第 22 页

预印本。工作仍在进行中。

| 数据集 | 原始样本数 | 保留样本数 | 保留率 | | :— | :— | :— | :— | | Geometry3K | 1,002 | | 47.7% | | STEM | OlympiadBench | 1,325 | 33.1% | | Vero STEM | 924 | | 15.4% | | 图表与OCR | Vero Chart | 2,699 | 45.0% | | HRScene | 263 | 感知 | 31.3% | | CV-Bench | 438 | | 16.6% | | Vero Grounding | 1,984 | 计数 | 33.1% | | Vero Spatial | 3,486 | | 58.1% | | AgentVista | 189 | 智能体工具 | 90.4% | | MMMU | 1,916 | | 48.4% | | Muir-Bench | 676 | 通用 | 31.6% | | Vero Knowledge | 807 | 识别 | 13.5% |

图11:强化学习数据的详细统计。柱状图中的数字表示经过拒绝采样(移除简单样本)后保留的样本数量。“保留率”表示保留样本相对于原始样本的百分比。

(例如,q0、q1、g0和g1),这些可以通过get_image(ref)访问。每个<tool_call>...</tool_call>块内的最后一行必须是可执行表达式,返回一个PIL图像对象或一个数值。此外,模型被指示通过img.size获取图像尺寸,确保基于坐标的操作以实际图像分辨率为基础。

提示框2:用于SFT数据合成的提示

你是一个图像推理助手。在回答之前,你可以编写Python代码来获取视觉证据或任何有用的信息。这包括但不限于放大、绘制辅助线、旋转、调整对比度、计算统计数据等。将可执行的Python代码放在<tool_call></tool_call>标签内。当你给出最终答案时,必须将其包裹在〈answer〉〈/answer〉标签内。

代码操作

以下是对图像和数字进行操作的典型代码模式。它们是推荐的起点,并非详尽列表。你可以使用其他有效的Python操作、库调用或参数选择,只要它们符合运行时约束。

crop

目的:使用Pillow从图像中裁剪一个矩形区域。

推荐库:Pillow

所需导入: from PIL import Image

输入约定:

示例: <tool_call> img = get_image("q0")

  • get_image("q0") / get_image("g0")images[index]读取源图像。
  • 使用一个四元组(左,上,右,下)作为裁剪框。
  • 最后一行应为裁剪后的PIL图像对象。

22

第 23 页

预印本。工作进展中。

cropped = img.crop((120, 180, 420, 620)) cropped </tool_call>

draw_line

用途:使用 Pillow 在图像上绘制一条或多条辅助线段。

推荐库:Pillow

所需导入: from PIL import ImageDraw

输入约定:

示例: <tool_call> from PIL import ImageDraw annotated = get_image("q0").copy() draw = ImageDraw.Draw(annotated) draw.line((118, 214, 612, 248), fill="red", width=4) draw.line((132, 486, 628, 520), fill="red", width=4) annotated </tool_call>

  • 从 get_image("q0") / get_image("g0") 或 images[index] 读取源图像。
  • 绘制前务必调用 copy()。
  • 使用 ImageDraw.Draw(annotated).line((x1, y1, x2, y2), fill="red", width=4)。
  • 最后一行应为标注后的 PIL 图像对象。

draw_box

用途:使用 Pillow 在图像上绘制一个或多个边界框。

推荐库:Pillow

所需导入: from PIL import ImageDraw

输入约定:

示例: <tool_call> from PIL import ImageDraw annotated = get_image("q0").copy() draw = ImageDraw.Draw(annotated) for box in [(42, 38, 128, 124), (150, 38, 236, 124)]: draw.rectangle(box, outline="red", width=3) annotated </tool_call>

  • 从 get_image("q0") / get_image("g0") 或 images[index] 读取源图像。
  • 绘制前务必调用 copy()。
  • 使用 ImageDraw.Draw(annotated).rectangle((x1, y1, x2, y2), outline="red", width=3)。
  • 最后一行应为标注后的 PIL 图像对象。

numeric_calculation

用途:使用 Python 和 math 计算数学表达式,而非心算。

推荐库:math

所需导入: import math

输入约定:

示例: <tool_call> import math result = math.sqrt(2) * 10 result </tool_call>

  • 直接用 Python 编写计算,如 result = 5 / 8 * 100 或 result = math.sqrt(2) * 10。
  • 仅在实际需要数学函数或常量时才导入 math。
  • 最后一行应为数值结果本身。

rotation

用途:使用 Pillow 旋转图像,以校正方向或查看不同视图。

推荐库:Pillow

23

第 24 页

必需的导入: from PIL import Image

输入约定:

示例: <tool_call> img = get_image("q0") rotated = img.rotate(90, expand=True) rotated </tool_call>

  • 从 get_image("q0") / get_image("g0") 或 images[index] 读取源图像。
  • 使用 img.rotate(angle, expand=True)。
  • 正角度表示逆时针旋转。
  • 最后一行应为旋转后的 PIL 图像对象。

附加提醒:

1. 即使您已经能从图像中猜到或知道答案,仍应使用沙盒化的 Python 代码片段来标记、隔离或验证相关的视觉证据,然后再作答。 2. 使用 get_image(ref) 访问运行时图像。原始问题图像使用稳定的 id,如 q0、q1,而先前代码调用返回的图像使用稳定的 id,如 g0、g1。 3. 如果需要在图像上绘制,请先调用 copy(),以免直接修改源图像。例如:annotated = get_image("q0").copy()。 4. 如果当前调用应返回图像结果,则 <tool_call> 内的最后一行应为 PIL 图像对象本身,例如 cropped、rotated 或 annotated。如果当前调用应返回数值结果,则最后一行应为数值对象本身,例如 result。 5. 不要心算。请使用 Python 代码。必要时可导入 math。 6. <tool_response>…</tool_response> 由系统在代码运行结束后插入。您不应自行生成。切勿自行输出 <tool_response> 标签。 7. 每次代码执行返回结果后,您必须立即输出一个 <observation>…</observation> 标签,在决定是否再次调用代码之前,明确分析返回的结果。 8. 顺序必须严格为 <tool_call>…</tool_call> -> <tool_response>…</tool_response> -> <observation>…</observation>。此后,您可以继续进行额外的 <tool_call> -> <tool_response> -> <observation> 循环。 9. 您的最终答案必须基于所获得的工具结果和观察。如果工具结果不充分、不清晰或无帮助,请在 <observation> 中明确说明,并再次调用代码以获取更好的证据,而不是依赖您自己未经辅助的视觉猜测。

完整示例: 问题:这个男人的手机是蓝色的并且是合上的吗? 助手: <tool_call> img = get_image("q0") img.size </tool_call> [系统随后插入一个包裹在 <tool_response>…</tool_response> 中的工具结果] <observation>我首先检查了图像尺寸,以便后续的坐标能基于实际画布。我仍然需要手机本身的局部视觉证据。</observation> <tool_call> from PIL import ImageDraw annotated = get_image("q0").copy() draw = ImageDraw.Draw(annotated) draw.rectangle((600, 290, 660, 380), outline="red", width=3) annotated </tool_call> [系统随后插入一个包裹在 <tool_response>…</tool_response> 中的工具结果] <observation>该框覆盖了男人手中的手机。手机明显是蓝色的,并且因为他正将其举到耳边使用,所以它不是合上的。</observation> 〈answer〉否〈/answer〉

2. 用于优化合成代码推理轨迹的提示词。尽管 Gemini 3.1 Pro [7] 可以使用方框 2 中的提示词合成高质量的代码推理轨迹,但生成的轨迹仍存在几个常见问题:

第 25 页

预印本。工作仍在进行中。

• ✗冗余或重复的工具调用。模型可能反复调用相似的代码操作或生成不必要的中间结果,导致轨迹冗长且低效。 • ✗对工具输出依赖不足。尽管模型执行代码以获取视觉证据,但返回的结果有时仅被微弱利用。因此,最终答案仍主要基于模型的直接视觉推理,而非通过工具执行获得的证据。 • ✗无信息量的推理。部分轨迹包含重复或低质量的推理循环,模型反复产生相似的想法或观察,却未在达成最终答案上取得有意义的进展。 • ✗缺失对工具响应的观察。模型可能在工具执行后省略明确的观察,使得返回的证据如何被解读或如何支持最终预测变得不清晰。

为解决这些问题,我们使用提示框3中的提示,借助Gemini 3.1 Pro [7]进一步精炼合成的轨迹。精炼旨在移除那些最终答案绕开工具输出的轨迹,消除冗余或无信息量的代码调用和推理,并强制实施更清晰的轨迹结构。人工检查表明,精炼后的轨迹质量显著提高,具有更简洁的代码执行、更具信息量的推理以及更严格地遵循规定格式。这些观察结果凸显了轨迹精炼对于高质量自动数据合成的重要性。

提示框3:SFT数据精炼提示

你正在精炼一个包含工具调用的视觉推理轨迹。 不要再次调用工具。不要编造工具输出。仅精炼轨迹文本,同时保持最终答案不变。 你将首先看到原始问题,然后是问题之后的轨迹消息。 轨迹使用以下约定: 1. 工具返回被包裹在<tool_response>…</tool_response>中,图像被插入到相应位置。 2. <tool_call>…</tool_call>是可执行代码。 3. <observation>…</observation>是工具返回后的观察。 4. 〈answer〉…〈/answer〉是最终答案。 5. 文本思考可以穿插在轨迹的任何位置。 你的任务: 1. 检查轨迹是否实际依赖有用的工具信息来回答问题。如果工具未提供有用信息,且答案实际上源自无工具推理(尤其是在最后一步),则丢弃该轨迹。 2. 检查同一工具是否被无益地重复调用。移除无益的重复工具调用步骤,仅保留产生关键有用信息的步骤。 3. 对于每个工具调用,如果工具结果后没有有意义的<observation>,则添加一个。 4. 移除明显无意义的工具调用或无意义代码,例如琐碎的赋值,如"<tool_call>result = 1result</tool_call>"。 5. 移除无意义的思考片段。 6. 注意,‘img.size‘对于模型了解图像尺寸是必要的,因此即使看起来琐碎,也要保留与之对应的‘img.size‘工具调用。 7. 检查每个<observation>块是否精确描述了前一个工具调用的结果。如果不是,尝试精炼<observation>,使其更准确且更具体地针对实际的工具响应。 输出要求: 1. 仅输出JSON。 2. 如果无需精炼,输出{"decision":"keep"}。 3. 如果轨迹应被丢弃,输出{"decision":"drop","reason":"…"}。 4. 如果需要精炼,按此模式输出JSON: { "decision": "refine", "messages": [ {"kind": "assistant", "text": "… 助手消息文本 …"}, {"kind": "original_message", "source_message_id": "M3"} ] } 5. 在"messages"中,不要重复问题或系统提示。仅输出原始问题之后的消息。

第 26 页

C 训练细节

C.1 冷启动SFT细节

对于SFT,我们使用Megatron [26]在ms-swift框架 [47]上训练Qwen3-VL-8B-Instruct,共4个epoch。我们使用Adam优化器,峰值学习率为1×10⁻⁵,权重衰减为0.1,采用余弦学习率调度,预热比例为5%。每次参数更新前,梯度在128个微批次上进行累积。

C.2 RL细节

我们使用VeRL [24]作为RL训练框架。RL训练在64块NVIDIA H200 GPU上进行1个epoch。对于每个提示,策略生成8个rollout,批次大小为128个提示组,PPO小批次大小为128。我们使用1×10⁻⁶的actor学习率和标准的token-mean PPO目标,对称裁剪边界为0.2,同时禁用KL和熵正则化。最大序列长度为30,720个token,包括最多20,480个提示token和10,240个响应token,每个rollout最多12次工具调用。对于全错提示组,使用最多3次专家尝试和15次专家工具调用生成结构化提示,并行工作线程数为32。训练以bfloat16精度进行,使用梯度检查点,并冻结视觉编码器。

C.3 SFT、RL和评估的系统提示

为避免分布不匹配,我们在SFT、RL训练和评估中使用相同的系统提示。该提示如提示框4所示。它与用于SFT数据合成的系统提示(提示框2)相同,只是将强制使用代码的指令替换为可选指令("你应该决定是否使用代码…")。

提示框4:用于SFT、RL和评估的系统提示

…与用于SFT数据合成的系统提示相同…

附加提醒:

1. 你应该决定是否使用代码来解决问题。仅在必要时编写代码。如果你能直接解决问题,不要使用代码。 2. …

…与用于SFT数据合成的系统提示相同…

C.4 提示生成细节

用于提示生成的系统提示如提示框5所示。生成的提示由一系列推理步骤组成,每个步骤包含一条指令和一个预期的子目标。指令指定要执行的推理、观察或工具操作,而子目标描述要获得的中间证据或结果,但不透露最终答案。在我们当前的实现中,我们仅保留"hint"字段作为训练提示。其余字段"tool_steps"和"subgoals"保留用于分析,并可能在未来的工作中作为细粒度监督或奖励信号。

第 27 页

预印本。工作进展中。

提示框 5:用于提示生成的系统提示

你将把一个正确的多模态推理轨迹转换为给较弱策略模型的提示。

提示中不得包含最终答案、参考答案,或对任一答案的明确重述。它应仅描述有用的方法、需寻找的证据以及工具使用计划。

首先识别 Gemini 轨迹中哪些步骤对于得出答案真正必要,然后仅将这些关键步骤浓缩为一个简短计划。不要复制完整轨迹、每个工具调用或偶然的观察。只保留对解决任务最有用的推理、视觉观察或工具步骤。

提示字段本身必须是一个编号列表。每一项必须严格使用此模式:“1. [指令] xxx;[预期子目标] xxx;”。指令应说明要执行的推理、观察或工具操作。预期子目标应说明该步骤应获得的中间证据或结果,而不透露最终答案。

优先选择可操作的工具步骤,而非模糊的建议。以高层次描述代码操作,而不是从轨迹中复制大段代码块。工具字段应是从 Python 代码内容派生的简洁语义操作标签,而不仅仅是单词 python。在适用时,使用代码操作提示中的确切规范标签:crop、draw_line、draw_box、numeric_calculation、rotation。

对于每个工具步骤,subgoal_result 必须总结代码运行后获得的实际证据或结果。不要在 subgoal_result 中写祈使句,如“裁剪图像”或“检查标签”;应写陈述句,如“裁剪显示…”或“计算返回…”。如果工具结果包含精确的数值、坐标、计数、OCR 字符串、表格单元格或其他精确证据,请在 subgoal_result 中明确包含它们。使 subgoal_result 尽可能信息丰富,以展示学到了什么以及它为何对该步骤的子目标重要,同时保持其不含答案。

提取模式: 提取关键的工具使用序列,并为每一步说明该工具步骤旨在获取什么信息。省略无帮助的工具调用或观察。如果轨迹未使用工具,则提取关键的推理思路。

子目标指令: 将子目标作为 tool_steps 中 subgoal_result 字符串的精确有序列表返回。这使得面向训练的子目标基于实际的工具结果,而非预期的操作。

返回恰好一个具有此模式的 JSON 对象: { "hint": "1. [指令] 关键推理、观察或工具步骤;[预期子目标] 不含答案的中间证据或结果;\n2. [指令] 下一个关键步骤;[预期子目标] 下一个不含答案的中间证据或结果;", "tool_steps": [ { "step": 1, "tool": "语义操作名称,如 crop、draw_line、draw_box、numeric_calculation、rotation、zoom_in 或 read_text", "action": "高层次工具操作,无大段代码块", "expected_subgoal": "一个简洁段落,描述此步骤旨在获取的中间证据", "subgoal_result": "实际获得的详细事实性不含答案结果,包括可用的精确数值/文本证据,以及它为何对此子目标重要" } ], "subgoals": ["与 tool_steps[*].subgoal_result 相同的顺序字符串"] }

问题: {question}

参考答案,仅用于过滤。不要在提示中透露它: {ground_truth}

正确轨迹: {trajectory}

27

第 28 页

预印本。工作进展中。

D 附加实验结果

D.1 消融研究详细结果

表6: 模式自适应性(Mode Adaptiveness)与工具效应(Tool Effect)的详细消融结果(%)。指标定义与符号遵循表3。

数据集 方法 准确率 模式自适应性 工具效应 工具可用准确率 ↑ 纯文本准确率 ↑ ∆准确率 ↑ MA工具 ↑ MA文本 ↑ MA均值 ↑ 工具增益 ↑ 工具损害 ↓ ∆工具效应 ↑ 文本保留 ↑

GRPO 82.55 (70.85) 80.10 (0.00) +2.45 94.29 33.94 64.12 9.23 4.48 +4.75 99.82 HRBench4K GRPO+NAARGRPO+HCE 82.7083.20 (70.33)(70.88) 80.5080.01 (0.00)(0.00) +2.20+3.19 97.7298.05 38.0037.91 67.8667.98 9.159.65 4.534.00 +4.62+5.65 99.2299.56 Beacon 83.38 (70.65) 80.53 (0.00) +2.85 97.24 37.18 67.21 9.98 4.47 +5.51 100.00

GRPO 65.48 (79.55) 63.91 (0.00) +1.57 92.79 23.78 58.29 11.06 9.36 +1.70 95.70 BLINK GRPO+NAARGRPO+HCE 65.7065.24 (79.66)(79.48) 64.0664.18 (0.00)(0.00) +1.64+1.06 93.8592.70 29.1327.31 61.4960.01 11.3611.29 10.119.21 +1.25+2.08 95.3796.05 Beacon 65.49 (79.79) 64.22 (0.00) +1.27 93.78 28.30 61.04 13.11 11.15 +1.96 95.28

GRPO 15.10 (94.69) 14.59 (0.00) +0.51 92.46 8.36 50.41 5.94 5.36 +0.58 68.00 BabyVision GRPO+NAARGRPO+HCE 16.9616.89 (95.10)(94.76) 16.6015.23 (0.00)(0.00) +0.36+1.66 95.7995.23 14.719.49 55.2552.36 5.737.59 3.974.56 +1.76+3.03 80.0082.01 Beacon 16.70 (95.36) 15.36 (0.00) +1.34 95.99 10.77 53.38 6.44 2.42 +4.02 85.71

GRPO 76.60 (78.76) 77.50 (0.00) -0.90 90.64 23.59 57.12 5.26 7.04 -1.78 98.23 MathVista GRPO+NAARGRPO+HCE 77.2276.30 (78.50)(78.20) 77.6877.28 (0.00)(0.00) -0.46-0.98 93.9592.61 26.4926.97 60.2259.79 5.645.50 6.447.00 -0.80-1.50 98.3998.32 Beacon 77.80 (78.52) 77.18 (0.00) +0.62 92.34 25.84 59.09 5.98 6.36 -0.38 98.46

GRPO 21.53 (92.11) 20.89 (0.00) +0.64 93.15 10.01 51.58 9.08 7.35 +1.73 70.03 TIRBench GRPO+NAARGRPO+HCE 23.6523.05 (93.19)(91.80) 22.3522.44 (0.00)(0.00) +1.30+0.61 95.1893.21 12.0210.14 53.6051.68 12.1511.85 6.266.33 +5.89+5.52 71.7672.69 Beacon 24.28 (92.74) 20.56 (0.00) +3.72 94.40 12.44 53.42 10.96 6.37 +4.59 75.56

GRPO 52.25 51.40 +0.85 92.67 19.94 56.30 8.11 6.72 +1.40 86.36 平均 GRPO+NAARGRPO+HCE 53.2552.94 52.2451.83 +1.01+1.11 95.3094.36 24.0722.36 59.6858.36 8.819.18 6.266.22 +2.54+2.96 88.9589.73 Beacon 53.53 51.57 +1.96 94.75 22.91 58.83 9.29 6.15 +3.14 91.00

我们在表6中提供了消融研究的详细结果。

E 讨论

E.1 失败的尝试

我们还探索了一种更激进的自适应奖励方案。除了标准的 rollout 组,我们强制模型生成一组纯文本推理轨迹。如果标准 rollout 组或强制文本 rollout 组中至少包含一条正确的纯文本轨迹,则自适应标签被指定为“文本”。然而,这种策略强烈地将策略偏向于纯文本推理,导致代码使用率崩溃,并在 V* 和 HRBench 等感知密集型基准上显著降低性能。

其根本原因在于,额外的强制文本 rollout 人为地增加了观察到至少一条成功纯文本轨迹的概率,即使纯文本推理平均而言并非最可靠的策略。因此,组级标签反映的是多次尝试中的最佳结果,而非单次 rollout 中最可能成功的推理模式。这在训练和评估之间引入了不匹配:一个问题可能在多次训练 rollout 中产生一条正确的纯文本轨迹,但在测试时单次纯文本 rollout 解决该问题的概率仍然很低。结果,模型变得过度偏向纯文本推理,导致测试时性能下降。

F 案例研究

F.1 推理轨迹示例

如表7、8和9所示,Beacon 有效利用多种视觉工具来解决复杂的推理任务。

F.2 提示示例

表10、11和12表明,训练时的提示监督使 Beacon 能够扩展其推理能力并应对更具挑战性的任务。

28

第 29 页

问题 轨道上有多少颗蓝色弹珠?

Beacon 推理过程 <tool call> img = get image("q0") img.size </tool call> <tool response> [352, 369] Available image refs: q0 </tool response> <observation> 图像尺寸为 352×369。我现在将编写一个脚本来检测蓝色弹珠,通过寻找蓝色像素的连通分量,并根据尺寸和颜色进行过滤。 </observation> <tool call> import numpy as np from PIL import Image img = get image("q0") img np = np.array(img)

创建蓝色像素的掩码

blue mask = (img np[:, :, 0] < 100) & (img np[:, :, 1] < 150) & (img np[:, :, 2] > 200)

使用 BFS 实现简单的连通分量

def count components(mask): visited = np.zeros like(mask, dtype=np.bool ) count = 0 h, w = mask.shape for i in range(h): for j in range(w): if mask[i, j] and not visited[i, j]: count += 1 queue = [(i, j)] visited[i, j] = True … Available image refs: q0, g0, g1 </tool response> <observation> 这 22 个有效分量的边界框完美地包围了轨道上的所有蓝色弹珠。没有遗漏的弹珠,也没有误报。计数恰好为 22。 </observation> 〈answer〉 22 〈/answer〉

Beacon 答案 22 (✓)

表 7: 推理轨迹示例:案例 1

第 30 页

预印本。工作仍在进行中。

问题 这张图片中有多少辆白色汽车?

Beacon 推理过程 <tool call> img = get image("q0") img.size </tool call> <tool response> [1448, 938] 原始图像 (q0) 可用图像引用: q0 </tool response> <observation> 图像尺寸为 1448×938。我将裁剪 中间部分 g0 以便更清楚地观察远处的汽车。 </observation> <tool call> img = get image("q0") cropped = img.crop((300, 450, 750, 550)) cropped </tool call> <tool response> g1 返回图像引用: g0 可用图像引用: q0, g0 </tool response> <observation> 在裁剪后的图像中,我可以看到几辆 汽车。让我们更仔细地观察 g2 远处的汽车,以确定它们的颜色。 </observation> <tool call> img = get image("q0") cropped = img.crop((600, 450, 800, 550)) cropped </tool call> <tool response> 返回图像引用: g1 可用图像引用: q0, g0, g1 g3 … 返回图像引用: g4 可用图像引用: q0, g0, g1, g2, g3, g4 </tool response> <observation> 前景右侧的汽车是深灰色或黑色。 因此,唯一的白色汽车是停在 远处街道右侧的两辆。 g4 所以,图片中有 2 辆白色汽车。 </observation> 〈answer〉 B 〈/answer〉

Beacon 答案 B (✓)

表 8: 推理轨迹示例:案例 2

第 31 页

预印本。工作仍在进行中。

问题 已知第一张图片右下角缺失,你能判断第二张图片和第三张图片中哪一张是缺失的部分吗?

Beacon 推理过程 <tool call> import numpy as np from PIL import Image 原始图片 (q0) img1 = get image("q0") img2 = get image("q1") img3 = get image("q2") print(f"图片 1 尺寸: {img1.size}") print(f"图片 2 尺寸: {img2.size}") print(f"图片 3 尺寸: {img3.size}")

裁剪图片 1 的右下角,并与图片 2 和图片 3 进行比较。

缺失部分是右下角的一个黑色矩形。

原始图片 (q1) # 找到它的坐标。 </tool call> <tool response> 图片 1 尺寸: (400, 222) 图片 2 尺寸: (200, 111) 图片 3 尺寸: (200, 111) 可用图片引用: q0, q1, q2 </tool response> <observation> 原始图片 (q2) 所有图片尺寸均为 200×111。第一张图片的右下角有一个黑色矩形(从 x=200 到 400,y=111 到 222)。第二和第三张图片的尺寸正好是第一张图片的一半。我将提取第一张图片的右下象限,并与第二张图片和第三张图片进行比较。 … <observation> 将图片 3 粘贴到图片 1 的缺失位置,可以无缝且合乎逻辑地延续抗议场景。划掉 "cebo" 的横幅与图片 1 中看到的文字完美对齐,抗议者的手也对齐得很好。第二张图片显示两名男子,完全不符合这个场景。因此,图片 3 是正确的缺失部分。 </observation> 〈answer〉 B 〈/answer〉

Beacon 答案 B (✓)

表 9: 推理轨迹示例:案例 3

第 32 页

预印本。工作进展中。

问题 该赛事于哪一年举办?穿蓝色球衣的选手来自印度,她正在执行一记羽毛球扣杀。如果羽毛球落在红色圆圈内,新的比赛比分将是多少?

提示 1. [指令] 从图像中裁剪记分板和红色圆圈区域;[预期子目标] 确定当前比分、赛事名称以及红色圆圈的边界状态; 原始图像 (q0) 2. [指令] 根据出界规则计算新比分,并识别赛事举办年份;[预期子目标] 找出更新后的比赛比分及赛事举办年份;

Beacon 推理过程 <工具调用> img = get image("q0") … <工具调用> from PIL import ImageDraw g0 annotated = get image("q0").copy() draw = ImageDraw.Draw(annotated) draw.line((0, 385, 928, 385), fill="yellow", width=2) draw.line((0, 420, 928, 420), fill="yellow", width=2) g1 annotated </工具调用> <工具响应> generated images: g3 Original image refs: q0 Generated image refs: g0, g1, g2, g3 </工具响应> <观察> 红色圆圈位于球场右下角,处于单打边线之外,位于 g2 边线区域。落在边线区域的扣杀被视为 出界,因此对击球选手而言是一次失误。 当前比分为 IND 20, TPE 0 15。这意味着 IND 已赢得 第一局(20–15),并在第二局中发球。第二局的 当前比分为 0–15。 g3 如果穿蓝色球衣的选手(IND)扣杀出界,TPE 将 赢得这一分。比分将保持 IND 20,而 TPE 在 第二局的得分将从 0 变为 1。 新的比分将是 IND 1 20, TPE 0 16。 </观察> 〈answer〉 新的比赛比分将是 IND 1 20, TPE 0 16。 该赛事于 2023 年举办。 〈/answer〉

Beacon 答案 新的比赛比分将是 IND 1 20, TPE 0 16。该赛事于 2023 年举办。(✓)

表 10: 提示示例:案例 1

32

第 33 页

预印本。工作仍在进行中。

问题 识别图像中所有隐藏的文本内容

提示 1. 提示:[指令] 将图像缩小到极小的比例(例如,原始尺寸的1/10或1/20);[预期子目标] 揭示在较低分辨率下可见的任何隐藏文本或图案;

Beacon推理过程 原始图像 (q0) <tool call> img = get image("q0") img resized = img.resize((img.width // 20, img.height // 20)) img resized </tool call> <tool response> 生成的图像: g0 </tool response> … 原始图像引用: q0 g0 生成的图像引用: g0 </tool response> <observation> 缩小后的图像清晰地显示了螺旋图案中央的文本 "CVPR"。该文本在原始分辨率下 被高频螺旋线所隐藏。 </observation> 〈answer〉 CVPR 〈/answer〉

Beacon答案 CVPR (✓)

表11: 提示示例:案例2

33

第 34 页

预印本。工作仍在进行中。

问题 数字4在图中被反射了两次。如果我们对数字5进行同样的操作,问号处会出现什么?

提示 1. [指令] 观察应用于数字4的变换,注意两次反射等同于180度旋转;[预期子目标] 理解几何变换规则,以便应用于数字5; 2. [指令] 从图像中裁剪出数字5,并使用工具将其旋转180度;[预期子目标] 获得对数字5应用相同变换后的视觉结果; 3. [指令] 将旋转后的数字5与给定的原始图像(q0)选项A到E进行比较;[预期子目标] 识别哪个选项与变换后的数字5匹配;

Beacon推理 … img = get image("q0") rotated 5 = img.crop((420, 130, 580, 350)).rotate(180)

选项C大约在x=380到450,y=580

到650 opt c = img.crop((380, 580, 450, 650)) g0 # 创建并排对比图 comp = Image.new('RGB', (100, 70)) comp.paste(rotated 5.resize((50, 70)), (0, 0)) comp.paste(opt c.resize((50, 70)), (50, 0)) comp </tool call> <tool response> 生成的图像: g1 </tool response> … g1 原始图像引用: q0 生成的图像引用: g0, g1 </tool response> <observation> 并排对比显示,旋转后的5与选项C完全匹配。 顶部的横杠位于底部,指向左侧。 垂直的竖杠位于右侧,指向上方。 弯曲部分位于左侧,向下并向右弯曲。 这正是将数字5旋转180度后得到的结果。 问题问的是:“如果我们对数字5进行同样的操作,问号处会出现什么?” 该变换是两次反射,等同于180度旋转。因此,结果是选项C。 </observation> 〈answer〉 C 〈/answer〉

Beacon答案 C (✓)

表12: 提示示例:案例3

34

发表评论