AdaTurn:预算感知测试时扩展,解决视觉代理截断难题

三分钟导读:AdaTurn通过引入预算条件化代理和强制回答强化学习策略,解决了视觉代理在有限交互轮次下因截断导致无法回答的问题,显著提升了低预算场景下的性能。

英文题目:AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

论文出处:arXiv 每日论文精选 · arXiv:2607.14547

原始论文:PDF / 论文页面

对应视频标题:AdaTurn:预算感知测试时扩展,解决视觉代理截断难题|推荐指数:★★★★★

这篇论文解决什么问题?

现有视觉代理通常将 rollout 预算视为隐式约束,当可用预算小于代理预期的轨迹长度时,会导致“灾难性截断”(catastrophic truncation),即代理在产生有效答案前被强制终止;反之,在预算充足时可能过早停止。

核心创新

  • 提出预算感知的主动视觉感知范式,将 rollout 预算作为任务规范的一部分。
  • 设计 FA-DAPO 策略,显式训练预算边界的最终答案决策,将截断转化为可训练的监督信号。
  • 引入负载均衡的 rollout 调度器,解决动态预算导致的计算资源不均问题,提升训练吞吐量。

方法概览

提出 AdaTurn 框架,将最大 rollout 预算 $T_{max}$ 作为输入条件化代理决策;引入强制回答 DAPO (FA-DAPO) 强化学习策略,当代理在预算边界请求工具时,不将其视为错误,而是回滚到有效前缀并强制生成最终答案;使用动态 rollout 预算训练,并配合负载均衡调度器优化多引擎推理效率。

逐图理解论文

问题:灾难性截断

问题:灾难性截断
Figure 1: Turn-aware reasoning under limited rollout budgets. Existing visual agents can stop too early when extra turns remain or suffer catastrophic truncation when the allocated budget is smaller than the rollout they implicitly expect, yielding no valid answer. AdaTurn conditions the agent on the turn budget and teaches it to switch from tool use to answer generation before the budget is exhausted, which leads to much stronger low-budget performance while preserving high-budget gains.

现有视觉代理通常将Rollout预算视为隐式约束。当可用预算小于代理预期的轨迹长度时,会导致灾难性截断,即代理在产生有效答案前被强制终止。反之,在预算充足时可能过早停止,造成资源浪费。

方法:预算条件化代理

方法:预算条件化代理
Figure 2: Overview of AdaTurn. The left panel shows the turn-aware agent loop: the model receives the image, the user question, and the maximum rollout budget Tmax, then decides at each turn whether to call a visual tool or emit the final answer. If a tool request would exceed the budget, AdaTurn blocks the tool call and forces the model to answer using the evidence already collected. The right panel illustrates a concrete rollout in which the agent gathers several observations and then produces a budget-aware final answer at the last turn.

AdaTurn框架将最大Rollout预算T_max作为输入条件化代理决策。模型在每个轮次决定是调用视觉工具还是生成最终答案。如果工具请求会超出预算,AdaTurn会阻止调用并强制模型基于已收集的证据生成答案。

创新:FA-DAPO策略

创新:FA-DAPO策略
Figure 3: Training behavior at the budget boundary. Prior methods either treat over-budget rollouts as wrong and penalize them, or mask them and discard the learning signal. Forced-Answer DAPO instead rolls back to the last valid prefix and explicitly trains the model to produce a final answer when the next tool request would exceed the budget.

传统方法将超预算轨迹视为错误并惩罚,或掩码处理丢弃信号。AdaTurn引入强制回答DAPO策略,回滚到有效前缀,显式训练模型在预算边界生成最终答案。这使得截断转化为可训练的监督信号。

创新:负载均衡调度器

创新:负载均衡调度器
Figure 4: Load-balanced rollout assignment. Dynamic rollout budgets create large differences in per-sample rollout cost. Instead of uniformly splitting requests across engines, we sort requests by assigned budget and greedily place each one on the engine with the current lowest accumulated load, which keeps the rollout workers much better balanced.

动态Rollout预算导致样本计算成本差异巨大。AdaTurn引入负载均衡调度器,按预算排序请求并贪心地分配给当前负载最低的引擎。这保持了Rollout工人的平衡,显著提升了训练吞吐量。

实验:低预算性能提升

实验:低预算性能提升
Table 1 reports the main quantitative comparison. AdaTurn performs particularly well in the low- budget regime, where catastrophic truncation is most consequential. At four turns, AdaTurn improves over Mini-o3 [Lai et al., 2025] by +12.5% on VisualProbe-Hard, +10.9% on VisualProbe-Medium, +6.0% on V*, +6.8% on HR-Bench 4K, +7.9% on HR-Bench 8K, and +13.9% on MME-RealWorld.

在VisualProbe等基准上,AdaTurn在低预算下表现优异。在VisualProbe-Medium上,4轮时准确率从36.7%提升至47.6%。相比Mini-o3,在VisualProbe-Hard上提升12.5%,在MME-RealWorld上提升13.9%。

实验与关键结果

  • 在 VisualProbe, V* Bench, HR-Bench, MME-RealWorld 等视觉感知基准上进行定量对比。
  • 在不同 backbone 规模(Qwen3-VL-4B, Qwen3-VL-8B)上进行迁移实验。
  • 进行消融实验以验证 FA-DAPO 各组件的有效性。
  • 评估 AdaTurn 对通用多模态能力(OCR, 推理)的影响。
  • 在 VisualProbe-Medium 上,4 turns 时从 36.7% 提升至 47.6%(第 1 页)
  • 在 VisualProbe-Hard 上,4 turns 时比 Mini-o3 提升 +12.5%(第 8 页)
  • 在 MME-RealWorld 上,4 turns 时比 Mini-o3 提升 +13.9%(第 8 页)
  • rollout 生成吞吐量平均提升 1.34x(第 7 页)
  • 在 Qwen3-VL-8B-Instruct 上,4 turns 时 VisualProbe-Hard 达到 45.9%(第 9 页)

阅读时需要注意

  • 在极度拥挤的场景中,若收集的证据不足以确定目标,强制回答可能导致幻觉(如将不同人物误认为目标)。
  • 主要关注视觉搜索任务,虽然验证了通用能力保留,但核心优化针对特定工具调用模式。
  • FA-DAPO 中的格式奖励(format reward)实验表明,额外的格式约束可能分散对准确性的关注,默认设置仅使用准确性奖励效果最佳。
  • 截断前缀的掩码处理会削弱性能,说明预算感知行为是轨迹级别的属性,而非单步修正。

关联工作

  • Mini-o3:主要基线,展示了长轨迹视觉搜索的优势,但未解决预算截断问题。(第 2 页)
  • DeepEyes:主要基线,通过 RL 训练多轮视觉工具使用,但在预算边界处理上存在缺陷。(第 2 页)
  • DAPO:AdaTurn 使用的强化学习基础算法,是 GRPO 的更稳健变体。(第 5 页)
  • Qwen2.5-VL:AdaTurn 使用的主要 backbone 模型。(第 7 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

AdaTurn:面向主动视觉感知代理的预算感知测试时扩展方法

Susan Liang1 Chao Huang1 Filippos Bellos2 Jing Bi1 Jason J Corso2 Chenliang Xu1 1罗切斯特大学 2密歇根大学

摘要

主动视觉代理通过在多轮交互中将推理与基于图像的 grounding 动作交错执行,来解决细粒度的图像任务。然而,部署时的 rollout 预算(Rollout Budget)很少是固定的:某些请求允许较长的 rollout,而其他请求则要求代理在严格的轮次限制下行动。现有方法在训练策略时,仿佛 rollout 预算是一个隐藏变量;因此,当可用预算小于代理偏好的轨迹长度时,交互往往在产生任何有效答案之前就被强制终止;我们将这种失败模式称为灾难性截断(Catastrophic Truncation)。为了克服这一挑战,我们提出了 AdaTurn,这是一个预算感知框架,其代理行为受限于允许的轮次数量。我们的核心组件是强制回答 DAPO(Forced-Answer DAPO, FA-DAPO),它将超出预算的事件从被掩码或惩罚的失败转化为一个可训练的最终决策步骤,教导模型在无法进一步使用工具时综合部分证据。我们还在训练和推理阶段对 rollout 预算进行随机化,并引入了一种负载均衡调度器,使此类操作变得切实可行。AdaTurn 显著提高了低预算下的准确率,例如在四轮交互中将 VisualProbe-Medium 的准确率从 36.7% 提升至 47.6%,同时在较大预算下保持了强大的扩展能力,并有效地迁移到多种骨干网络及通用多模态基准测试中。

总轮次=4

DeepEyes (SOTA 1): 过早停止 T1 T2 无答案截断 +60% 工具 答案 浪费的轮次 ☹ 47.6 +70% 47.8 50.8

Mini-o3 (SOTA 2): 灾难性截断 T1 T2 T3 T4 T5 29.8 29.8 工具 工具 工具 工具 x 工具 😣

AdaTurn (本文方法) 轮次感知代理 T1 T2 T3 T4 工具 工具 工具 答案 😁 T=4 T=8 DeepEyes Mini-o3 AdaTurn (本文方法) (a) 现有最先进方法与我们的 AdaTurn 之间的比较。 (b) VisualProbe 基准测试准确率(Medium)。

图 1:在有限 rollout 预算下的轮次感知推理。现有的视觉代理在剩余额外轮次时可能过早停止,或者在分配的预算小于其隐式预期的 rollout 时遭受灾难性截断,从而无法产生有效答案。AdaTurn 根据轮次预算对代理进行条件约束,并教导其在预算耗尽之前从工具使用切换到答案生成,从而在保持高预算增益的同时,显著提升了低预算下的性能。

预印本。

第 2 页

1 引言

多模态语言模型不仅被用作单次图像预测器 [Liu et al., 2024a, Xu et al., 2024, Bai et al., 2025b, Chen et al., 2024],还被用作主动视觉智能体,在多轮交互中将推理与基于图像的 grounding 动作交织在一起 [Wu and Xie, 2024b, Wang et al., 2024, Zhang et al., 2025c, Shen et al., 2024, Zheng et al., 2025b, Wang et al., 2025a, Lai et al., 2025]。模型不再仅从单一编码的图像中作答,而是可以检查局部区域、收集新的观察结果,并在多轮交互中完善其决策。

这种转变使得测试时扩展(test-time scaling)在视觉推理中重新变得相关 [Snell et al., 2024, OpenAI, 2024, Agarwal et al., 2025, Wang et al., 2025b]。最近的系统如 DeepEyes [Zheng et al., 2025b]、Pixel Reasoner [Wang et al., 2025a]、Chain-of-Focus [Zhang et al., 2025c] 和 Mini-o3 [Lai et al., 2025] 表明,“与图像一起思考”在高分辨率和视觉杂乱的任务上优于标准的单次预测。当允许智能体进行更多轮次时,它可以更仔细地搜索、拒绝干扰项,并在最终确定答案之前验证暂定答案。

然而,这种成功掩盖了一个重要的部署不匹配问题。在实际场景中,Rollout 预算是一个外部资源约束,而非模型的固定属性 [Wen et al., 2025, Nogueira et al., 2025]。由于延迟要求,一个请求可能只允许四轮交互,而另一个请求可能允许三十二轮。现有的视觉智能体通常针对固定的 rollout 机制进行训练,而不是将部署时的预算作为显式输入 [Zheng et al., 2025b, Wang et al., 2025a, Lai et al., 2025]。因此,当可用预算小于策略所偏好的预算时,智能体可能会继续请求工具,直到系统在没有产生任何有效答案的情况下终止 rollout。我们将这种失败模式称为灾难性截断。例如,当我们将最大 rollout 轮数限制为 4 时,Mini-o3 在 VisualProbe-Hard 基准上的性能从 48.0% 降至 26.5%。同样的预算盲点也在相反极端造成计算浪费:当有额外轮次可用时,智能体可能在找到一个合理的答案后立即停止,而不是利用剩余预算进行验证。

AdaTurn 通过将 rollout 预算纳入学习问题来解决这一不匹配。核心理念很简单:一个强大的视觉智能体不应学习单一的 rollout 风格,而应学习一系列校准到可用预算的行为模式。这一视角带来了三个设计要求。首先,策略必须以最大允许轮数为条件,以便短预算和长预算的行为能够系统性地不同。其次,模型必须在预算边界处接收学习信号,因为正是在这里标准训练会失效。第三,如果训练和推理期间的 rollout 预算发生变化,底层基础设施也必须具备预算感知能力;否则,最慢的工作节点将主导训练吞吐量。

我们通过 AdaTurn 满足了这些要求,AdaTurn 是一个具有动态 rollout 深度的主动视觉感知智能体。除了预算条件视觉智能体外,我们还引入了强制回答 DAPO (FA-DAPO),这是一种基于 DAPO [Yu et al., 2025] 的强化学习策略,DAPO 是 GRPO [Shao et al., 2024] 更稳健的变体,它将超出预算的工具请求转换为可训练的最终答案决策。AdaTurn 不惩罚或掩盖边界情况,而是教导策略在无法进一步使用工具时如何综合目前已收集的证据。我们进一步使用动态 rollout 预算进行训练,并将其与负载均衡调度器配对,尽管 rollout 长度异构,但仍能保持工作节点利用率稳定。

该系统在不同的 rollout 预算和基准测试中均表现出色。在四轮交互下,与 Mini-o3 [Lai et al., 2025] 相比,AdaTurn 将 VisualProbe-Medium [Lai et al., 2025] 从 36.7% 提升至 47.6%,将 MME-RealWorld [Zhang et al., 2024] 从 50.1% 提升至 64.0%。图 6 显示,这些增益集中在部署约束最重要的领域,即低预算机制,而随着预算增加,模型依然表现强劲。我们还发现,该方法可迁移至 Qwen3-VL 4B 和 8B 骨干网络 [Bai et al., 2025a],并在 OCR 和推理基准测试中保留了广泛的多模态能力。

总之,我们的贡献如下:

  • 我们制定了预算感知的主动视觉感知,并将灾难性截断确定为部署受限视觉智能体的核心失败模式。
  • 我们提出了 AdaTurn,一种预算条件视觉智能体,以及强制回答 DAPO (FA-DAPO),它在预算边界处显式训练最终答案决策。

2

第 3 页

• 我们引入了一种负载均衡调度器,该调度器在训练和推理期间均减少了 rollout 的不平衡性,并将 rollout 吞吐量提高了 1.34 倍。

• 我们证明 AdaTurn 在低预算场景下带来了显著的性能提升,在较大预算下依然表现强劲,可迁移至多种骨干网络,并保留了通用的多模态能力。

2 相关工作

2.1 高分辨率图像理解

早期的视觉-语言模型(如 LLaVA [Liu et al., 2024a])依赖固定的低分辨率输入,这往往会丢弃那些通常决定细粒度视觉任务成败的细微细节。最近的高分辨率模型,包括 LLaVA-UHD [Xu et al., 2024]、Qwen2.5-VL [Bai et al., 2025b] 和 InternVL 2.5 [Chen et al., 2024],通过动态分块、图像切片或更强的视觉骨干网络改进了图像编码。然而,这些方法仍然主要在单次传递中执行推理,因此无法在推理过程中自适应地将注意力分配给变得相关的区域。这种局限性催生了主动感知方法,如 SEAL [Wu and Xie, 2024b]、DC2 [Wang et al., 2024]、Chain-of-Focus [Zhang et al., 2025c] 和 ZoomEye [Shen et al., 2024],这些方法显式地分多步检查图像。AdaTurn 处于这种主动感知范式之中,但关注的是不同的问题:当可用的 rollout 预算在不同请求间变化时,此类代理应如何行为。

2.2 代理式视觉感知

最近的研究表明,多轮视觉搜索可以直接在类语言模型的动作循环中进行学习。DeepEyes [Zheng et al., 2025b] 证明了仅通过强化学习即可涌现出基于图像的工具备用,而 DeepEyesV2 [Hong et al., 2025]、VISTA-R1 [Lu et al., 2025] 和 Agent0-VL [Liu et al., 2025] 则扩展了工具空间或训练环境。Mini-o3 [Lai et al., 2025] 尤为相关,因为它表明视觉代理可以从更长的 rollout 和更丰富的交互模式中大幅受益。我们的工作侧重点不同——我们主要不询问如何获得更长的轨迹;我们询问的是当部署时允许的轨迹长度发生变化时,同一代理应如何行为。AdaTurn 将 rollout 预算视为显式的条件变量,并直接优化最终回合的决策,这解决了先前视觉代理在很大程度上未解决的一种失败模式(即灾难性截断)。

2.3 VLM 的强化学习与测试时扩展

组相对策略优化(GRPO)[Shao et al., 2024] 已成为训练推理模型的标准配方,始于 DeepSeek-R1 [Guo et al., 2025],并迅速扩展到 VLM-R1 [Shen et al., 2025]、R1-VL [Zhang et al., 2025b] 和 Visionary-R1 [Zhang et al., 2025a] 等多模态设置。除了单次推理外,最近的序列级强化学习公式也开始更直接地研究多轮工具集成推理 [Xue et al., 2025, Zheng et al., 2025a]。与此同时,测试时扩展已成为推理系统的主导观点:额外的推理时间计算通常能提高性能,但前提是模型知道如何有效地利用这些额外预算 [Snell et al., 2024, OpenAI, 2024, Agarwal et al., 2025, Wang et al., 2025b]。先前的预算感知方法主要关注单次生成内的令牌级控制,例如通过预算令牌或基于置信度的提前停止 [Wen et al., 2025, Nogueira et al., 2025]。AdaTurn 解决的是不同的设置,即多轮代理,其动作空间在最终回合发生变化,因为不再可用工具执行。因此,我们的贡献不仅是预算条件化,还包括边界感知的强化学习以及高效训练所需的系统支持。

3 方法

AdaTurn 基于一个简单的假设:对于主动视觉代理而言,rollout 预算不是一个干扰变量,而是任务规范的一部分。因此,策略不仅应依赖于图像和问题,还应依赖于可用的交互回合数。我们首先在 3.1 节中形式化这种预算感知设置。然后我们在

3

第 4 页

输入 智能体 Rollout 轨迹 图像 问题 最大轮次 智能体($T_{max}$) 输入:

什么 是 下面的 “SINCE”? 数量 $T_{max} = 4$ 下面的“SINCE”是什么?数量 $T_{max} = 4$

智能体内部过程 智能体第 1 轮: 工具结果: 视觉-语言智能体 (AdaTurn) 1. 思考 〈think〉用户输入是寻找下面数字中的“SINCE”。扫描 在 右侧 的 框架 中 有 显著的 标志。我 认为结构将 放大 到 公寓 综合体 和 摩天轮 视觉 语言 区域 以检查 历史 标记 或 店面。〈/think〉 编码器 模型 2. 决定下一步

〈think〉观察 1 未揭示任何包含“SINCE”的文本。 重新评估 原始 图像, 在 最 左侧 有一排 密集的 商店 无 决策: 和 餐馆。 这个 区域 更 可能 有 思考 智能体循环 调用 工具? (回答) “Established” 或 “Since” 日期

  • 直接回答 <grounding>{"bbox_2d":"observation_0"}</grounding>[0.519, 0.598, 0.917, 1.0], "source": 问题,或者
  • 调用工具以获取更多 智能体第 2 轮: 工具结果: 视觉 细节

其店面。我将转向 (下一轮) 是 裁剪左侧木板路部分。〈/think〉 并且 (调用工具) <grounding>{"bbox_2d": [0, 0.689, 0.311, 1.0], "source": "observation_0"}</grounding> 否 是 回答 轮次) (在…之内) 当前轮次 (超过…) 工具拒绝: “数量 低于 代理轮次 N: < 𝑇!"# SINCE 是 1934。” 〈think〉在此视图中,我检测到单词“SINCE”的两个实例。在 您已用完所有 右侧,有一个 Nathan's menZons “SINCE 1916”的标志,并且 🚫 轮次,无法 成功调用工具 无法调用工具 思考 le[,verifya circularthe numbergold onlogotheonRuby'sRuby'ssignalsospecifically.contains "SINCE."I'll zoomI needin on to 进一步请提供调用工具。 在图像上执行工具(例如,裁剪/ 当前轮次超过 红色店面以确认。〈/think〉 回答并停止。 放大)图像。 🚫 (𝑇≥𝑇!"#) <grounding>{"bbox_2d": [0.089, 0.481, 0.317, 0.712], "source": "observation_2"}</grounding>

工具结果 被迫回答 代理轮次 N(被迫回答): 〈think〉我 已经 耗尽 我的 工具调用 预算 并且 必须 生成 最终 返回 新图像 问题 使用 信息 我 已经 获得 的 信息 即使 我 回答并 停止。 观察 到代理 可能 会 犯错 由于 缺乏 数据。〈/think〉 代理。 思考

〈answer〉1934〈/answer〉 决策 工具与结果 被迫回答 最终答案 代理思考

(a) AdaTurn 代理循环。 (b) AdaTurn 代理展开轨迹。

图 2:AdaTurn 概览。左侧面板展示了回合感知代理循环:模型接收图像、用户问题和最大 rollout 预算 $T_{\max}$,然后在每个回合决定是调用视觉工具还是输出最终答案。如果工具请求会超出预算,AdaTurn 会阻止工具调用,并强制模型使用已收集的证据进行回答。右侧面板展示了一个具体的 rollout 示例,其中代理收集了若干观测结果,然后在最后一个回合生成一个预算感知的最终答案。

第 3.2 节提供了在最终回合边界处缺失的学习信号。最后,第 3.3 节描述了动态预算训练以及使此类训练在实践中高效的负载均衡 rollout 调度器。图 2 给出了概览。

3.1 问题表述与 AdaTurn 代理循环

令 $Q$ 表示用户问题,$I$ 表示输入图像,$T_{\max}$ 表示最大 rollout 预算,$g$ 表示真实答案。AdaTurn 解决一个预算感知的决策问题,其输入为 $$ x = (Q, I, T_{\max}). \quad (1) $$ 在第 $t$ 个回合,代理基于交互历史进行条件判断 $$ h_t = (Q, I, T_{\max}, (y_1, o_1), \dots, (y_{t-1}, o_{t-1})) , \quad (2) $$ 其中 $y_t$ 是在第 $t$ 个回合生成的 token 序列,$o_t$ 是环境返回的工具观测结果。在每个回合,策略 $\pi_\theta$ 输出一个调用工具序列 $c_t \in \mathcal{C}$ 或一个最终答案序列 $a_t \in \mathcal{A}$: $$ y_t \sim \pi_\theta(\cdot \mid h_t), \quad y_t \in \mathcal{C} \cup \mathcal{A}. \quad (3) $$ 如果 $y_t \in \mathcal{C}$ 且 $t < T_{\max}$,工具执行器 $\mathcal{E}$ 返回一个新的观测结果 $$ o_t = \mathcal{E}(I, y_t), \quad (4) $$ 该结果将成为下一回合历史的一部分。如果 $y_t \in \mathcal{A}$,则 rollout 终止,并根据 $g$ 对答案进行评分。关键的结构约束出现在最后一个回合:

$$ y_t \in \mathcal{Y}_t = \begin{cases} \mathcal{C} \cup \mathcal{A}, & t < T_{\max}, \\ \mathcal{A}, & t = T_{\max}. \end{cases} \quad (5) $$

在最终回合之前,代理既可以收集更多证据,也可以进行回答。在最终回合,只能执行回答动作。灾难性截断(Catastrophic Truncation)是指学习到的策略在该边界处仍然偏好工具动作的情况。

4

第 5 页

最大轮次 最大轮次 𝑇!"# = 4 𝑇!"# = 4 T1 T2 T3 T4 T1 T2 T3 T4

工具 工具 工具 答案 工具 工具 工具 答案 被拒绝 被拒绝 x x 工具 工具 工具 工具 工具 工具 工具 工具

答案 答案 答案

问题 … 问题 … 被拒绝 被拒绝 x x 工具 工具 工具 工具 工具 工具 工具 工具

答案 工具 答案 工具 答案

工具 工具 答案 工具 工具 答案

(a) 现有的视觉智能体训练方法 (b) 我们的新智能体训练方法。 (例如,DeepEyes, Mini-o3)。

图 3:预算边界处的训练行为。先前的方法要么将超出预算的 Rollout 视为错误并对其进行惩罚,要么将其掩码并丢弃学习信号。Forced-Answer DAPO 则回滚到最后一个有效前缀,并显式训练模型在下一个工具请求将超出预算时生成最终答案。

图 2 展示了由此产生的智能体循环。左图显示了基于预算的控制流:模型接收图像、问题和最大预算 $T_{max}$,然后反复决定是否花费另一轮次进行定位(grounding)还是终止并给出答案。这使得预算在整个 Rollout 过程中可见,而不是将其作为隐式的系统端约束。右图展示了一个具体的轨迹,其中连续的观察结果不断缩小搜索空间,直到策略在预算边界处发出最终答案。重要的点不在于 AdaTurn 仅仅在第 $T_{max}$ 轮停止,而在于它被训练以智能地做出这一边界决策。在大预算下,策略可以花费额外的轮次进行验证;在小预算下,它学会压缩搜索并利用部分证据做出承诺。

3.2 强制回答 DAPO

我们采用解耦裁剪与动态采样策略优化(Decoupled Clip and Dynamic Sampling Policy Optimization, DAPO)[Yu et al., 2025],这是 GRPO [Shao et al., 2024, Guo et al., 2025, Shen et al., 2025, Zhang et al., 2025b] 的一种更稳健的变体,作为强化学习算法。对于每个输入 $x$,我们从当前策略中采样一组 $G$ 个 Rollout $\{Y^{(i)}\}_{i=1}^G$,用奖励 $\{R^{(i)}\}_{i=1}^G$ 对它们进行评分,并计算归一化优势:

$$ \hat{A}^{(i)} = \frac{R^{(i)} – \frac{1}{G} \sum_{j=1}^G R^{(j)}}{\text{Std}(\{R^{(j)}\}_{j=1}^G) + \delta}, \quad (6) $$

其中 $Y^{(i)} = [y^{(i)}_1, \dots, y^{(i)}_{T_{max}}]$ 是第 $i$ 个 Rollout,$\delta$ 是一个用于数值稳定性的常数。 DAPO 随后优化基于 token 归一化的裁剪目标:

$$ \mathcal{L}_{\text{DAPO}}(\theta) = -\mathbb{E} \left[ \frac{1}{\sum_{i=1}^G |Y^{(i)}|} \sum_{i=1}^G \sum_{k} \min \left( \rho_{i,k} \hat{A}_{i,k}, \text{clip}(\rho_{i,k}, 1 – \epsilon_{\text{low}}, 1 + \epsilon_{\text{high}}) \hat{A}_{i,k} \right) \right] \quad (7) $$

其中对于 Rollout $Y^{(i)}$ 中的每个 token $k$,$\hat{A}_{i,k} = \hat{A}^{(i)}$,且 token 级别的比率(importance ratio)为:

$$ \rho_{i,k} = \frac{\pi_\theta(y^{(i)}_k \mid x, y^{(i)}_{<k})}{\pi_{\theta_{\text{old}}}(y^{(i)}_k \mid x, y^{(i)}_{<k})}. \quad (8) $$

通过不同的裁剪值($\epsilon_{\text{low}}$ 和 $\epsilon_{\text{high}}$ 分别用于正负优势)以及 token 级别的归一化,DAPO 可以在稳定训练的同时,允许策略从具有大优势的外样样本中学习。

核心难点在于,最后一轮的边界与 Rollout 的其余部分在性质上截然不同。在轮次 $t < T_{max}$ 时,策略决定是继续收集证据还是终止。

5

第 6 页

Rollout 请求数 ($N$)

每个请求 $r^*$ 具有不同的最大 Rollout 轮次 $T_{max}^*$

$r_1$ $r_2$ $r_3$ $r_4$ … $r_{N-3}$ $r_{N-2}$ $r_{N-1}$ $r_N$

Uniform Chunk Assignment Load-Balanced Assignment (Ours) $k= N//M$ Load Balancer Chunk 1 Chunk 2 … Chunk M Input: $r^*, M$ [0, $k$] [$k$, 2×$k$] [$M-1$ ×$k$, $M$×$k$] Goal: Minimize Rollout Cost

$r_5$ $r_6$ … $r_7$ $r_{N-7}$ $r_{N-6}$ … $r_{N-5}$ $r_{N-4}$ $r_{N-3}$ … $r_{N-2}$ $r_{N-1}$ $r_N$ … $r_{N+1}$ $r_{N+2}$ $r_{N+3}$ … $r_{N+4}$ $r_{N+5}$ $r_{N+6}$ … $r_{N+7}$

Rollout Max Turns $T_{max}^*$ Rollout Max Turns $T_{max}^*$ 8 5 … 6 20 9 … 5 15 30 … 10 31 18 … 6 26 24 … 5 25 19 … 10

Engine 1 Engine 2 Engine $M$ Engine 1 Engine 2 Engine $M$

Engine 1 57 Rollout Inefficiency Engine 1 61 Engine 2 45 (Idle Servers) Engine 2 62

Engine $M$ 75 Engine $M$ 59

Accumulated Rollout Cost Accumulated Rollout Cost

Figure 4: Load-balanced rollout assignment. Dynamic rollout budgets create large differences in per-sample rollout cost. Instead of uniformly splitting requests across engines, we sort requests by assigned budget and greedily place each one on the engine with the current lowest accumulated load, which keeps the rollout workers much better balanced.

在轮次 $t = T_{max}$ 时,该选择变得不可行:工具调用不再可行。图 3 显示现有策略未能很好地优化这一阶段。DeepEyes [Zheng et al., 2025b] 将超预算情况视为错误的 Rollout,这抑制了长程探索,并有效地将策略与训练预算绑定。Mini-o3 [Lai et al., 2025] 通过掩码截断案例来避免这种惩罚,但这同时也移除了预算意识最关键处的学习信号。在这两种情况下,边界行为都训练不足。

我们通过 Forced-Answer DAPO (FA-DAPO) 解决这一问题。假设一个 Rollout 达到轮次 $T_{max}$ 且策略仍偏好工具请求。我们不是将该样本视为错误或不相关,而是回滚到最后一个可执行前缀 $h_{-T_{max}}$ 并附加一条控制指令,声明工具预算已耗尽,模型必须提供其最佳最终答案。形式上,我们将每个采样的 Rollout 转换为

(Y^{(i)}, if Y^{(i)} 在 $T_{max}$ 内发出答案, $\tilde{Y}^{(i)}$ = (9) $h_{-(i)T_{max}}, \tilde{a}^{(i)}_{T_{max}}$ , if $y^{(i)}_{T_{max}} \in C$,

其中 $\tilde{a}^{(i)}_{T_{max}} \sim \pi_\theta(\cdot | h_{-(i)T_{max}}, b_{T_{max}})$ 且 $b_{T_{max}}$ 是预算耗尽的控制消息。然后我们使用以下公式对生成的答案进行评分: $R^{(i)} = \lambda_{acc} r_{acc}(\tilde{Y}^{(i)}, g) + \lambda_{fmt} r_{fmt}(\tilde{Y}^{(i)})$. (10)

从概念上讲,FA-DAPO 将灾难性截断从 Rollout 引擎的产物转化为策略的监督决策问题。这种设计使 AdaTurn 能够在严格预算下可靠运行,同时仍能从可用的额外轮次中受益。我们在第 4.3 节中考察了几种替代训练变体,包括掩码前缀优化、仅最终轮次强化学习和格式加权奖励。

3.3 动态 Rollout 预算与负载均衡调度

最大 Rollout 预算在训练或推理期间并非固定不变。在训练期间,我们从预定义的一组候选预算中采样 $T_{max}$ 并将其作为代理状态的一部分注入提示中。因此,同一任务会在短预算和长预算下出现,迫使策略学习进一步搜索与立即承诺之间的校准权衡。这一机制直接延续到推理中:从业者可以根据其延迟或计算预算设置 $T_{max}$,而无需切换模型或重新训练策略。

然而,动态预算造成了系统瓶颈。在多引擎 Rollout 生成中,批次延迟由最慢的引擎决定。如果长预算样本分配不均,快速

第 7 页

当一个过载的 worker 正在处理一组过长的轨迹时,其他 worker 处于空闲状态。图 4 展示了我们的解决方案。我们根据分配给请求的预算对请求进行排序,并将每个请求贪婪地分派给当前累积负载最低的引擎,从而在 worker 之间保持更平衡的 rollout 成本。附录 B 提供了完整的伪代码。每个请求 $r_n$ 携带一个分配的 rollout 预算 $T_n$。按 $T_n$ 降序对请求排序后,我们将每个请求贪婪地分配给当前累积负载最低的引擎。我们将 rollout 不平衡量化为分配后各引擎间最大和最小累积 rollout 预算之间的差距。

图 5 报告了其对实际训练运行的影响。该调度器持续降低最大 rollout 时间以及跨引擎的负载不平衡值(计算为各引擎间最大和最小累积 rollout 预算之间的差距)。这使得 rollout 生成平均加速 1.34 倍,这对于动态预算的训练和推理至关重要。

4 实验

4.1 实验细节

数据集。我们在 VisualProbe [Lai et al., 2025] 和 V* Bench [Wu and Xie, 2024a] 上评估 AdaTurn 的代理视觉搜索能力,在 4K 和 8K 分辨率下评估 HR-Bench [Wang et al., 2024] 的高分辨率感知能力,以及在 MME-RealWorld [Zhang et al., 2024] 上评估其现实世界多模态推理能力。为了评估所得策略在主要视觉搜索设置之外是否仍具有广泛的实用性,我们还报告了 OCRBench [Liu et al., 2024b]、ChartQA [Masry et al., 2022]、DocVQA [Mathew et al., 2021]、MathVista [Lu et al., 2023]、ScienceQA [Lu et al., 2022] 和 CV-Bench [Tong et al., 2024] 的结果。

Vanilla (max) Load-Balance (max) Min Min Max range 3000 avg speedup ×1.34 60 (s) 2400 Value Load 45 Time 1800 30 1200 Rollout Rollout Imbalance 15 600 0 2 4 6 8 10 12 14 16 18 2 4 6 8 10 12 14 16 18 Training Step Training Step 图 5:负载均衡 rollout 调度的效果。左图报告了各引擎间的最小、最大以及 min-max rollout 时间范围,显示该调度器降低了最大引擎时间并实现了平均 1.34 倍的加速。右图报告了各引擎间最大和最小累积 rollout 预算之间的差距,在负载均衡下该差距始终更小。

表 1:视觉感知基准上的定量比较。AdaTurn 在低预算模式下表现优异,并在 32 轮时保持竞争力,同时使用与先前开源代理基线相同的 7B 骨干网络规模。对于 VisualProbe 和 V* Bench,我们报告 Avg@32 以减少随机性引起的方差。对于 HR-Bench 和 MME-RealWorld,我们分别报告 Avg@8 和 Avg@1。

VisualProbe HR-Bench Model V* MME-RealWorld hard medium easy 4K 8K

GPT-4o [Hurst et al., 2024] 11.2 15.4 47.5 65.2 62.0 58.3 45.2 LLaVA-OneVision [Li et al., 2024] 13.4 12.5 36.2 70.9 61.2 54.0 57.4 Qwen2.5-VL-Instruct [Bai et al., 2025b] 23.9 26.0 39.1 75.5 68.2 62.7 57.3 SEAL [Wu and Xie, 2024a] – – – 75.4 – – – DyFo [Li et al., 2025] – – – 81.2 – – – Chain-of-Focus [Zhang et al., 2025d] – – – 88.0 – – – Pixel Reasoner [Wang et al., 2025a] 28.8 29.6 58.4 86.3 74.0 66.9 64.4 DeepEyes [Zheng et al., 2025b] (6 turns) 35.1 29.8 60.1 83.3 73.2 69.5 64.0 Mini-o3 [Lai et al., 2025] (4 turns) 26.5 36.7 42.4 79.2 68.9 63.2 50.1 Mini-o3 [Lai et al., 2025] (32 turns) 48.0 50.4 67.0 88.2 77.5 73.3 65.5 Ours (4 turns) 39.0 47.6 61.2 85.2 75.7 71.1 64.0 Ours (32 turns) 48.1 51.0 66.7 86.9 77.5 73.4 66.3

7

第 8 页

Qwen2.5-VL-7B-Instruct DeepEyes Mini-o3 Ours (AdaTurn)

VisualProbe (Easy) VisualProbe (Medium) VisualProbe (Hard) V* Bench 70.0 50.0 88.0 50.0 (%) 60.0 40.0 84.0 40.0 Score 50.0 30.0 80.0 30.0 40.0 76.0 20.0 4 8 16 24 32 4 8 16 24 32 4 8 16 24 32 4 8 16 24 32 # Frames # Frames # Frames # Frames

HR-Bench 4K HR-Bench 8K MME-RealWorld

66.0 76.0 72.0 (%) 60.0 72.0 Score 68.0 54.0 64.0 68.0 48.0 4 8 16 24 32 4 8 16 24 32 4 8 16 24 32 # Frames # Frames # Frames

图 6:性能与 rollout 预算的关系。在低预算条件下,AdaTurn 提供了比 Mini-o3 [Lai et al., 2025] 更有利的权衡,特别是在四轮和八轮时,而随着可用轮次的增加,其表现依然具有竞争力。

基线方法。我们与闭源和开源多模态模型进行了比较,包括 GPT-4o [Hurst et al., 2024]、LLaVA-OneVision [Li et al., 2024]、Qwen2.5-VL-7B-Instruct [Bai et al., 2025b]、DeepEyes [Zheng et al., 2025b]、Mini-o3 [Lai et al., 2025]、Pixel Reasoner [Wang et al., 2025a] 和 Chain-of-Focus [Zhang et al., 2025d]。最相关的基线方法是 DeepEyes [Zheng et al., 2025b] 和 Mini-o3 [Lai et al., 2025],因为它们也训练多轮视觉工具使用;因此,它们比通用 VLM 基线更直接地隔离了预算感知学习的贡献。

评估指标。我们报告基准测试的标准准确率。遵循相应的基准测试协议,VisualProbe 和 V* Bench 经过 32 次重复运行取平均以减少随机波动,而 HR-Bench 和 MME-RealWorld 分别使用 8 次和 1 次运行进行评估。

实现细节。除非另有说明,主要结果使用 Qwen2.5-VL-7B-Instruct 骨干网络 [Bai et al., 2025b],并比较不同最大 rollout 轮次下的推理效果。有关更多实现细节,包括训练超参数和消融变体,请参阅附录 A。

4.2 定量比较

表 1 报告了主要的定量比较结果。AdaTurn 在低预算条件下表现尤为出色,此时灾难性截断的影响最为显著。在四轮时,AdaTurn 在 VisualProbe-Hard 上比 Mini-o3 [Lai et al., 2025] 提升了 +12.5%,在 VisualProbe-Medium 上提升了 +10.9%,在 V* 上提升了 +6.0%,在 HR-Bench 4K 上提升了 +6.8%,在 HR-Bench 8K 上提升了 +7.9%,在 MME-RealWorld 上提升了 +13.9%。这些改进在 VisualProbe [Lai et al., 2025]、HR-Bench [Wang et al., 2024] 和 MME-RealWorld [Zhang et al., 2024] 中保持一致,表明这种优势并不局限于单一的基准测试家族。

同时,这些收益并未以牺牲高预算表现为代价。在三十二轮时,AdaTurn 在 VisualProbe-Hard、VisualProbe-Medium、HR-Bench 8K 和 MME-RealWorld 上匹配或超过了 Mini-o3 [Lai et al., 2025],而在 HR-Bench 4K 上持平。这表明强制回答 DAPO (FA-DAPO) 并非仅仅鼓励提前终止;相反,它教导模型在预算有限时做出适当的回答,同时在可用时仍利用更长的 rollout。

图 6 通过绘制性能随 rollout 预算变化的曲线,从互补的角度展示了相同的趋势。AdaTurn 在低预算区域提升了曲线,特别是在 4 和 8 轮时,同时在预算增长时保持了良好的扩展性。附录 G 和 H 节提供了额外的 rollout 可视化和失败案例分析。

8

第 9 页

表 2:跨骨干网络规模的迁移。在严格的预算限制下,AdaTurn 提升了 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct 的性能,并且在 Rollout 预算增加时仍保持竞争力。对于 VisualProbe 和 V* Bench,我们报告 Avg@32 以减少随机性引起的方差。对于 HR-Bench 和 MME-RealWorld,我们分别报告 Avg@8 和 Avg@1。

| Model | VisualProbe V* hard | VisualProbe V* medium | VisualProbe V* easy | HR-Bench 4K | HR-Bench 8K | MME-RealWorld | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | Qwen3-VL-4B-Instruct [Bai et al., 2025a] | – | – | – | 88.0 | 81.3 | 74.4 | – | | + Mini-o3 [Lai et al., 2025] (4 turns) | 24.7 | 44.3 | 54.9 | 87.0 | 77.2 | 72.4 | 61.2 | | + Mini-o3 [Lai et al., 2025] (32 turns) | 46.3 | 53.9 | 69.1 | 90.2 | 80.0 | 77.3 | 66.0 | | + Ours (4 turns) | 40.0 | 51.7 | 68.4 | 90.0 | 79.2 | 76.6 | 66.6 | | + Ours (32 turns) | 46.4 | 54.3 | 70.6 | 90.7 | 79.8 | 78.0 | 67.1 | | Qwen3-VL-8B-Instruct [Bai et al., 2025a] | – | – | – | 90.1 | 82.3 | 78.0 | – | | + Mini-o3 [Lai et al., 2025] (4 turns) | 24.9 | 44.6 | 58.7 | 87.6 | 78.3 | 75.8 | 60.0 | | + Mini-o3 [Lai et al., 2025] (32 turns) | 55.4 | 55.6 | 74.7 | 91.1 | 82.8 | 81.9 | 69.3 | | + Ours (4 turns) | 45.9 | 54.6 | 73.8 | 91.1 | 82.4 | 81.4 | 69.2 | | + Ours (32 turns) | 56.0 | 57.0 | 74.8 | 91.6 | 83.0 | 82.3 | 69.8 |

4.3 消融研究

图 7 隔离了强化学习设计的贡献。主要结论是,强制回答训练是性能提升的主要贡献者:每个 AdaTurn 变体在四轮交互时均优于 Mini-o3,这表明对预算边界进行显式监督对于缓解灾难性截断至关重要。在这些变体中,默认公式整体表现最佳,尤其是在预算超过八轮时。

附录 C 提供了详细的消融讨论。简而言之,掩码前缀轮次、将优化限制在最后的强制回答步骤,以及添加格式奖励,这些方法的表现均不如默认公式。

4.4 适用性

表 2 显示 AdaTurn 可以干净地迁移到其他骨干网络规模。在 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct [Bai et al., 2025a] 上,AdaTurn 在几乎所有视觉搜索基准测试的四轮交互中均优于 Mini-o3 [Lai et al., 2025],并且这些提升在三十轮交互时基本得以保持。这表明 AdaTurn 并不局限于单一的基础模型,而是反映了视觉代理更通用的训练原则。

通用多模态结果推迟至附录 D。结果表明,相对于底层 Qwen2.5-VL-7B-Instruct 骨干网络 [Bai et al., 2025b],AdaTurn 保持了广泛的 OCR 和推理能力,同时在与 Mini-o3 [Lai et al., 2025] 的竞争中保持竞争力。

5 结论

我们提出了 AdaTurn,这是一个针对受限测试时交互的主动视觉代理的预算感知框架。AdaTurn 将 Rollout 预算视为问题规范的一部分,引入 Forced-Answer DAPO 以显式优化最后一轮的边界,并结合动态预算训练与负载均衡的 Rollout 调度。这些组件共同解决了灾难性截断问题,同时保留了更长 Rollout 带来的收益。经验上,AdaTurn 在低预算范围内表现良好,在大预算下保持竞争力,可迁移至多种骨干网络规模,并保留了广泛的多模态能力。更广泛地说,我们的结果表明,视觉代理测试时扩展的下一阶段不仅仅是允许更多的计算,而是教导策略如何在实际获得的计算资源下智能推理。局限性和更广泛的影响在附录 I 中讨论。

9

第 10 页

参考文献

Aradhye Agarwal, Ayan Sengupta, 和 Tanmoy Chakraborty。《为大型语言模型扩展测试时计算的艺术》。arXiv 预印本 arXiv:2512.02008,2025。

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge 等人。《Qwen3-vl 技术报告》。arXiv 预印本 arXiv:2511.21631,2025a。

Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang 等人。《Qwen2.5-VL 技术报告》。arXiv 预印本 arXiv:2502.13923,2025b。

Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu 等人。《通过模型、数据和测试时扩展扩展开源多模态模型的性能边界》。arXiv 预印本 arXiv:2412.05271,2024。

Daya Guo, Dejian Yang, He Zhang, Junxiao Song, Runxin Zhang, Runqi Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi 等人。《DeepSeek-R1:通过强化学习激励大语言模型中的推理能力》。arXiv 预印本 arXiv:2501.12948,2025。

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, 和 Xing Yu。《DeepEyesV2:迈向代理式多模态模型》。arXiv 预印本 arXiv:2511.05271,2025。

Aaron Hurst, Adam Lerer, Adam P Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrom, Akila Welihinda, Alan Hayes, Alec Radford 等人。《Gpt-4o 系统卡片》。arXiv 预印本 arXiv:2410.21276,2024。

Xin Lai, Junyi Li, Wei Li, Tao Liu, Tianjian Li, 和 Hengshuang Zhao。《Mini-o3:扩展视觉搜索中的推理模式和交互轮次》。arXiv 预印本 arXiv:2509.07969,2025。

Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu 等人。《Llava-onevision:简易视觉任务迁移》。arXiv 预印本 arXiv:2408.03326,2024。

Geng Li, Jinglin Xu, Yunzhen Zhao, 和 Yuxin Peng。《Dyfo:一种无需训练的动态焦点视觉搜索方法,用于增强 LMMs 在细粒度视觉理解中的表现》。在《计算机视觉与模式识别会议论文集》中,第 9098–9108 页,2025。

Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee。《视觉指令微调》。《神经信息处理系统进展》,36,2024a。

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, 和 Huaxiu Yao。《Agent0-VL:探索用于工具集成视觉语言推理的自进化代理》。arXiv 预印本 arXiv:2511.19900,2025。

Yuliang Liu, Zhang Li, Mingxin Huang, Biao Yang, Wenwen Yu, Chunyuan Li, Xu-Cheng Yin, Cheng-Lin Liu, Lianwen Jin, 和 Xiang Bai。《Ocrbench:关于大型多模态模型中 OCR 隐藏奥秘的研究》。《中国科学:信息科学》,67(12):220102,2024b。

Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang 等人。《扩展 VLMs 中工具集成推理的代理式强化学习》。arXiv 预印本 arXiv:2511.19773,2025。

Pan Lu, Swaroop Mishra, Tony Xia, Liang Qiu, Kai-Wei Chang, Song-Chun Zhu, Oyvind Tafjord, Peter Clark, 和 Ashwin Kalyan。《学会解释:通过思维链进行多模态推理以回答科学问题》。在《第 36 届神经信息处理系统会议》中,2022。

Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, 和 Jianfeng Gao。《Mathvista:使用 GPT-4V、Bard 和其他大型多模态模型评估视觉语境下的数学推理》。arXiv 预印本 arXiv:2310.02255,2023。

10

第 11 页

Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, 和 Enamul Hoque。Chartqa: 一个用于图表问答的基准测试,结合视觉和逻辑推理。在《计算语言学协会第60届年度会议论文集》中,2022年。

Minesh Mathew, Dimosthenis Karatzas, 和 C. V. Jawahar。Docvqa: 一个用于文档图像视觉问答的数据集。在《IEEE/CVF计算机视觉应用冬季会议论文集》中,2021年。

João Paulo Nogueira, Wentao Sun, Alonso Silva, 和 Laith Zumot。大语言模型中的确定性引导推理:一种动态思维预算方法。arXiv预印本 arXiv:2509.07820,2025年。

OpenAI。使用LLM学习推理。OpenAI博客,2024年。URL https://openai.com/index/learning-to-reason-with-llms/。

Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, 等人。Deepseekmath: 推动开放语言模型中数学推理的极限。arXiv预印本 arXiv:2402.03300,2024年。

Haozhan Shen, Kangjia Zhao, Tiancheng Zhao, Ruochen Xu, Zilun Zhang, Mingwei Zhu, 和 Jianwei Yin。Zoomeye: 通过基于树的图像探索增强多模态LLM的人类缩放能力。arXiv预印本 arXiv:2411.16044,2024年。

Haozhan Shen, Peng Liu, Jingcheng Li, Chunxin Fang, Yibo Ma, Jiajia Liao, Qiaoli Shen, Zilun Zhang, Kangjia Zhao, Qianqian Zhang, Ruochen Xu, 和 Tiancheng Zhao。VLM-R1: 一种稳定且可泛化的R1风格大型视觉语言模型。arXiv预印本 arXiv:2504.07615,2025年。

Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, 和 Chuan Wu。Hybridflow: 一种灵活且高效的RLHF框架。arXiv预印本 arXiv: 2409.19256,2024年。

Charlie Snell, Jaehoon Lee, Kelvin Xu, 和 Aviral Kumar。最优扩展LLM测试时计算量比扩展模型参数更有效。arXiv预印本 arXiv:2408.03314,2024年。

Shengbang Tong, Ellis Brown, Penghao Wu, Sanghyun Woo, Manoj Middepogu, Sai C Akula, Jihan Yang, Shusheng Yang, Adithya Iyer, Xichen Pan, 等人。Cambrian-1: 一个完全开放的、以视觉为中心的多模态LLM探索。《神经信息处理系统进展》,37: 87310–87356,2024年。

Haozhe Wang, Alex Su, Weiming Ren, Fangzhen Lin, 和 Wenhu Chen。Pixel reasoner: 通过好奇心驱动的强化学习激励像素空间推理。arXiv预印本 arXiv:2505.15966,2025a。

Jian Wang, Boyan Zhu, Chak Tou Leong, Yongqi Li, 和 Wenjie Li。扩展中的扩展:探索大型推理模型中的测试时扩展平台。arXiv预印本 arXiv:2505.20522,2025b。

Wenbin Wang, Liang Ding, Minyan Zeng, Xiabin Zhou, Li Shen, Yong Luo, 和 Dacheng Tao。分解、征服与结合:多模态大语言模型中高分辨率图像感知的免训练框架。arXiv预印本 arXiv:2408.15556,2024年。

Hao Wen, Xinrui Wu, Yi Sun, Feifei Zhang, Liye Chen, Jie Wang, Yunxin Liu, Yunhao Liu, Ya-Qin Zhang, 和 Yuanchun Li。BudgetThinker: 使用控制令牌赋能预算感知LLM推理。arXiv预印本 arXiv:2508.17196,2025年。

Penghao Wu 和 Saining Xie。V?: 引导视觉搜索作为多模态LLM的核心机制。在《IEEE/CVF计算机视觉与模式识别会议论文集》中,第13084–13094页,2024a。

Penghao Wu 和 Saining Xie。V*: 引导视觉搜索作为多模态LLM的核心机制。在《IEEE/CVF计算机视觉与模式识别会议论文集》中,2024b。

Ruyi Xu, Yuan Yao, Zonghao Guo, Junbo Cui, Zanlin Ni, Chunjiang Ge, Tat-Seng Chua, Zhiyuan Liu, Maosong Sun, 和 Gao Huang。LLaVA-UHD: 一种感知任意宽高比和高分辨率图像的多模态模型。arXiv预印本 arXiv:2403.11703,2024年。

11

第 12 页

Zhenghai Xue, Longtao Zheng, Qian Liu, Yingru Li, Xiaosen Zheng, Zejun Ma, 和 Bo An。Simpletir: 用于多轮工具集成推理的端到端强化学习,2025。URL https: //arxiv.org/abs/2509.02479。

Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Weinan Dai, Tiantian Fan, Gaohong Liu, Lingjun Liu, 等人。Dapo: 一个大规模开源的大语言模型强化学习系统。 arXiv 预印本 arXiv:2503.14476,2025。

Jiaer Zhang, Bingqi Li, Wei Zhou, 和 Rui Zhao。Visionary-R1: 通过强化学习缓解视觉推理中的捷径问题。arXiv 预印本 arXiv:2505.14677,2025a。

Jingyi Zhang, Jiaxing Gao, Yankai Pang, Ruyi Zhao, Xi Wang, Jingqun Zhang, Peng Hou, Rong Luo, Bin Liu, 和 Haibin Huang。R1-VL: 通过逐步组相对策略优化学习使用多模态大语言模型进行推理。arXiv 预印本 arXiv:2503.12937,2025b。

Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, 和 Qing Li。通过动态视觉搜索和缩放实现自适应焦点链推理,以提高视觉语言模型效率。arXiv 预印本 arXiv:2505.15436,2025c。

Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, 等人。通过动态视觉搜索和缩放实现自适应焦点链推理,以提高高效视觉语言模型效率。arXiv 预印本 arXiv:2505.15436,2025d。

Yi-Fan Zhang, Huanyu Zhang, Haochen Tian, Chaoyou Fu, Shuangqing Zhang, Junfei Wu, Feng Li, Kun Wang, Qingsong Wen, Zhang Zhang, 等人。MME-RealWorld: 您的多模态大语言模型能否挑战那些对人类来说都难以处理的高分辨率真实世界场景?arXiv 预印本 arXiv:2408.13257,2024。

Chujie Zheng, Shixuan Liu, Mingze Li, Xiong-Hui Chen, Bowen Yu, Chang Gao, Kai Dang, Yuqiong Liu, Rui Men, An Yang, Jingren Zhou, 和 Junyang Lin。Group sequence policy optimization, 2025a。URL https://arxiv.org/abs/2507.18071。

Yaowei Zheng, Richong Zhang, Junhao Zhang, Yanhan Ye, Zheyan Luo, Zhangchi Feng, 和 Yongqiang Ma。Llamafactory: 100多种语言模型的统一高效微调。在计算语言学协会第62届年会论文集(第3卷:系统演示)中,泰国曼谷,2024。计算语言学协会。 URL http://arxiv.org/abs/2403.13372。

Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, 和 Xing Yu。DeepEyes: 通过强化激励“与图像一起思考”。arXiv 预印本 arXiv:2505.14362,2025b。

12

第 13 页

A 详细的训练设置

遵循 Mini-o3 [Lai et al., 2025],我们首先通过在 Mini-o3 冷启动数据集1上对 Qwen2.5-VL-7B-Instruct [Bai et al., 2025b] 进行监督微调来初始化 AdaTurn。随后,我们在 DeepEyes_train_4K2 和 VisualProbe_train3 上使用从 4 到 12 轮的动态 rollout 预算进行强化学习。我们使用 LLaMA-Factory [Zheng et al., 2024] 进行监督微调,使用 VERL [Sheng et al., 2024] 进行强化学习,并遵守我们在实验中使用的框架、数据集和预训练骨干网络的发布许可和使用条款。

表 3:我们实验中使用的训练配置。

| 配置项 | 监督微调 | 强化学习 | | :— | :— | :— | | 框架 | LLaMA-Factory | VERL | | 训练数据 | Mini-o3 冷启动数据集 | DeepEyes_train_4K + VisualProbe_train | | 批次大小 (Batch size) | 64 | 64 | | 组大小 (Group size) | – | 16 | | 小批次大小 (Mini-batch size) | – | 32 | | 学习率 | $1 \times 10^{-5}$ | $1 \times 10^{-6}$ | | 调度策略 | 10% 预热 + 余弦衰减 | 无 | | 轮数 (Epochs) | 3 | 1 | | KL 损失 | – | 无 | | 奖励权重 | – | 准确率 1.0, 格式 0.0 | | 最小图像像素数 | 40,000 | 40,000 | | 最大图像像素数 | 2,000,000 | 2,000,000 | | 动态 rollout 轮数 | – | 4 到 12 | | 冻结视觉编码器 | true | false | | 冻结投影层 | true | false | | 冻结 LLM | false | false | | 上下文长度 | 32,768 | 32,768 | | 计算资源 | 1 个节点,配备 8 张 A100 GPU | 2 个节点,每节点配备 8 张 A100 GPU | | 墙钟时间 (Wall-clock time) | 约 2 小时 | 约 3 天 |

B 负载均衡的 Rollout 分配伪代码

算法 1 给出了在启用动态 rollout 预算时 AdaTurn 使用的完整调度例程。其核心思想是根据分配的 rollout 预算对请求进行排序,并贪婪地将每个请求放置在当前累积负载最小的 rollout 引擎上。这种简单的策略减少了由异构 rollout 长度引起的空闲时间,并补充了第 3.3 节正文中的讨论。

C 详细的消融讨论

图 7 显示,在预算边界处的显式监督是性能提升的主要来源。掩蔽早期的前缀轮次会导致性能下降,这表明最终强制回答决策最好与前面的搜索轨迹一起学习,而不是孤立地学习。仅对最终强制回答轮次进行强化学习的表现更差,这表明预算感知行为是一种轨迹级属性,而非单步修正。

添加显式格式奖励也带来轻微的负面影响。在我们的设置中,答案提取已经施加了所需的结构约束,因此将奖励权重分配给格式并不会改善监督,反而可能分散对准确率目标的注意力。综上所述,这些结果支持默认的完整 rollout、仅基于准确率的 FA-DAPO 设计。

图 5 中的系统侧消融得出了类似的结论。左子图报告了各引擎之间的最小和最大 rollout 时间及其引发的范围,而

1 https://huggingface.co/datasets/Mini-o3/Mini-o3-Coldstart-Dataset 2 https://huggingface.co/datasets/Mini-o3/DeepEyes_train_4K 3 https://huggingface.co/datasets/Mini-o3/VisualProbe_train

13

第 14 页

算法 1:负载均衡的 rollout 分配 输入:提示词批次 $P$,rollout 服务器集合 $S$,rollout 轮次 $R$ 输出:拼接后的生成结果 $O$

if LoadBalance is False then Divide P into k equal chunks P1, . . . , Pk where k = |S|; for i = 1 to k do Oi ←Generate(Pi);

else Initialize server loads L ←[0, . . . , 0] for each s ∈S; Initialize server assignments A ←[∅, . . . , ∅]; Sort indices Idx of P by R[idx] in descending order; for idx ∈Idx do s∗←arg mins L[s]; Append idx to A[s∗]; L[s∗] ←L[s∗] + R[idx]; for server Si ∈S do if A[i] is not empty then Oi ←Generate(P[A[i]]);

Wait for all Oi and reorder results to match original indices of P; return Concat(O)

表 4:AdaTurn 训练后的通用多模态能力。与基础 Qwen2.5-VL-7B-Instruct 模型相比,AdaTurn 在广泛的 OCR 和推理基准测试中保持或提升了性能,表明预算感知的智能体训练并未以牺牲通用视觉-语言能力为代价。

OCR-Related General Reasoning Model OCRBench ChartQA DocVQA (val) CV-Bench MathVista (testmini) ScienceQA (img)

Qwen2.5-VL-7B-Instruct [Bai et al., 2025b] 81.5 79.6 94.6 73.9 68.2 89.0 DeepEyes [Zheng et al., 2025b] – – – – 70.1 – Mini-o3 [Lai et al., 2025] 83.8 77.4 94.8 74.4 68.8 84.5 Ours 85.5 80.0 93.0 77.6 68.1 83.7

右子图总结了负载最高和最低的引擎之间的差距。动态 rollout 预算在朴素分配下会造成显著的工作者不平衡,但所提出的调度器降低了这两项统计指标,并实现了平均 1.34 倍的 rollout 加速,使得预算感知训练在实践中更加高效。

D 通用多模态能力

表 4 考察了 AdaTurn 是否在主要研究中用于高分辨率视觉搜索基准测试之外,还保留了通用多模态能力。与基础 Qwen2.5-VL-7B-Instruct 模型 [Bai et al., 2025b] 相比,AdaTurn 在 OCRBench [Liu et al., 2024b]、ChartQA [Masry et al., 2022] 和 CV-Bench [Tong et al., 2024] 上有所提升,同时在 DocVQA [Mathew et al., 2021]、MathVista [Lu et al., 2023] 和 ScienceQA [Lu et al., 2022] 上保持竞争力。与 Mini-o3 [Lai et al., 2025] 相比,它在 OCRBench [Liu et al., 2024b]、ChartQA [Masry et al., 2022] 和 CV-Bench [Tong et al., 2024] 上表现更好。这些结果表明,预算感知的智能体训练并非仅仅将模型专门化用于狭窄的工具使用基准测试,而是可以与广泛的多模态能力相兼容。

E 性能评判提示词

为了评估模型预测是否与真实答案匹配,我们使用了一个外部评判模型。具体而言,我们使用 Qwen3-32B 作为二元评估器,比较问题、真实答案和模型预测,然后对正确返回 1 分,对错误返回 0 分。确切的系统提示词和查询提示词如下所示。

14

第 15 页

系统提示

你是一个专为评估问答对生成输出正确性而设计的智能聊天机器人。 你的任务是将预测答案与正确答案进行比较,并确定它们在意义上是否匹配。以下是完成任务的方法: —— ##说明:

  • 重点关注预测答案与正确答案之间的意义匹配。
  • 将同义词或改写视为有效匹配。
  • 评估预测相对于答案的正确性。

查询提示

我将向你提供一个与图像相关的问题以及以下文本作为输入:

1. 与图像相关的问题:{question} 2. 标准答案:{ground_truth} 3. 模型预测答案:{prediction}

你的任务是根据与图像相关的问题所提供的上下文,评估模型的预测答案与标准答案的对比情况。 考虑以下评估标准:

(1) 如果标准答案是开放式的,请考虑预测是否准确反映了标准答案中给出的信息,且未引入事实性错误。如果是,则预测应被视为正确。 (2) 如果标准答案是确定性答案,请严格将模型的预测与实际答案进行比较。注意长度和角度等单位转换。只要结果一致,模型的预测就应被视为正确。 (3) 如果模型的预测是不相关的字符串,例如标点符号、换行符、制表符、空格或空字符串等,且没有有意义的回答,则将分数设为 0。

  • 相关性:预测答案是否直接回答了所提出的问题,同时考虑到给定问题提供的信息?
  • 准确性:将预测答案与标准答案进行比较。你需要从以下三个角度进行评估:

输出格式: 你的回复应包含一个表示预测正确性的整数分数:1 表示正确,0 表示错误。请注意,1 意味着模型的预测与标准答案严格一致,而 0 意味着不一致。 格式应为“Score: 0 或 1”

F AdaTurn 智能体提示

AdaTurn 使用一组结构化的提示来控制智能体循环。我们提供了用于初始系统指令、工具观察、工具错误以及工具预算耗尽时的强制回答阶段的精确提示。

系统提示

你是一个乐于助人的助手。根据提供的图像回答用户的问题。 在 〈think〉 和 〈/think〉 标签内输出你的思考过程。每当发现任何不清楚的地方, 你都可以通过输出 <grounding>{"bbox_2d": [x0, y0, x1, y1], "source": " original_image"}</grounding> 来放大给定图像中的特定区域,以便更清楚地查看, 其中 (x0, y0) 和 (x1, y1) 分别是你想要放大的区域的左上角和右下角坐标( 假设图像的宽度和高度为 1.0),而 'source' 指的是你放大的图像,可以是 'original_image' 或 'observation_i'。 一旦确认最终答案,将其放在 〈answer〉 和 〈/answer〉 内。

15

第 16 页

工具观察响应

在上述动作 {action_turn} 之后,以下是放大后的图像(观察 {observation_turn}): [图片] 请在 〈think〉 和 〈/think〉 内继续你的推理过程。如果需要,你可以像之前一样,通过输出 <grounding> 和 </grounding> 继续放大原始图像或任何观察结果。如果最终答案已确认,请将最终答案放在 〈answer〉 和 〈/answer〉 内。

工具错误响应

请分析从函数工具获得的错误信息并调整你的响应。请在 〈think〉 和 〈/think〉 内继续推理过程。

强制回答提示

〈think〉我已经用完了工具调用预算,必须使用我已获得的信息来回答问题,尽管由于缺乏数据我可能会犯错。

G AdaTurn 展开轨迹可视化

图 8 和图 9 展示了在严格的四轮预算下的代表性成功轨迹,而图 10 和图 11 展示了在八轮预算下的成功轨迹。这些例子突出了 AdaTurn 鼓励的两种定性行为。首先,模型不会简单地终止于预算边界;相反,当不允许进一步定位时,它利用可用的观察结果综合出最终答案。其次,轨迹在不同的预算下保持适应性:在 Tmax = 4 时,模型基于有限的证据做出压缩决策,而在 Tmax = 8 时,它可以继续细化裁剪序列,直到目标细节变得可识别。

这些例子还说明 AdaTurn 学习了一种有用的预算感知证据聚合形式。在图 8 中,最终裁剪不如早期观察结果信息丰富,但模型仍然依靠在最后一轮之前收集的更清晰的证据正确回答。在图 9 中,模型重新访问原始图像,将注意力转移到之前被忽视的区域,然后在强制回答步骤正确回答。图 10 和图 11 显示,在预算较大的情况下,AdaTurn 可以维持更长的搜索轨迹,分别用于识别小型交通信号灯和细粒度场景文本。

H 失败分析

图 12 展示了四轮预算下的代表性失败案例。问题询问穿格子衬衫的人面向的方向,但可用的观察结果不足以提供足够的证据来自信地隔离出正确的个体。在用完工具预算后,模型被迫使用不完整的信息进行回答,反而锚定了场景中的另一个人,导致幻觉出的最终答案。

这种失败模式与 AdaTurn 的预期权衡一致。强制回答训练通过确保模型即使在搜索预算不足时也能产生有效答案,从而减轻了灾难性截断,但当收集的证据仍然模糊时,它不能保证正确性。在这种情况下,模型可能会通过过度承诺于不完美的假设而产生幻觉,特别是在拥挤的场景中,其中细微的身份区分在短展开中难以解决。

16

第 17 页

I 局限性与社会影响

局限性。我们的研究仅限于基于图像的代理,未涵盖视频场景,其中时序推理和显著更长的交互范围引入了额外的复杂性。我们还专注于图像裁剪工具,未探索更广泛的工具生态系统,如网络搜索、代码执行或 bash 交互。

社会影响。具备回合感知能力的视觉代理可以通过在严格的计算预算下生成有用的答案,使对延迟敏感的辅助感知、文档理解以及高分辨率检查系统受益。同时,更强大的视觉搜索代理可能被滥用于监控或大规模自动化图像检查,因此未来的发布应遵循负责任的部署实践和现有的使用限制。

17

第 18 页

原始图像 问题 智能体轮次

穿黄色上衣的人身后的文字颜色是什么? 𝑇!"# = 4

观察 1

观察 2

智能体轮次 4

〈think〉 用户正在询问穿黄色上衣的人身后的文字颜色。在观察 3 中,我可以看到一个穿橙色上衣的人,他们身后非常暗,但我似乎能看到红色背景上的一些白色字符。看起来像是文字。我将放大我认为有文字的区域以进行确认。 观察 3 〈/think〉

<grounding>{"bbox_2d": [0.3,0.0,0.9,0.6], "source": ”o bservation_3"}</grounding>

工具拒绝 🚫 您已用完所有轮次,无法进一步调用工具。

智能体轮次 4(强制回答)

〈think〉根据观察 3,我可以看到一个穿橙色衬衫的人。在这个人身后,还有其他人物,但光照条件太差,物体太暗且模糊,无法辨认出任何文字或颜色。然而,我可以依赖之前更清晰的观察结果。在观察 1 中,穿黄色衬衫的人身后的文字可见,其颜色为白色。观察结果的清晰度和放大倍数逐渐降低,但观察 1 中的关键信息最清晰、最详细。在该观察中,黄色人身后的文字显然是白色的。既然我必须基于某些内容作答,而之前更清晰的动作(观察 1)提供了白色文字的清晰视图,那一定是正确答案。〈/think〉

〈answer〉白色〈/answer〉

图 8:在四轮预算下的成功 Rollout。智能体定位了穿黄色上衣的行人,探索了他们身后的区域,然后在强制回答步骤中作答,依赖于之前更清晰的观察结果,该结果揭示了相关文字颜色为白色。此示例说明,即使最终裁剪图像提供的信息较少,AdaTurn 仍能保留并使用之前收集的证据。

18

第 19 页

原始图像 问题 智能体轮次

“EW”上方的文字是什么? 𝑇!"# = 4

观察 1

智能体轮次 4 观察 2 〈think〉 用户希望我找到写在 “EW”上方的文字。我一直在查看壁炉区域,但我仍然 Think 看不到任何写着“EW”的文字。我需要回到 原始图像,寻找文字的另一个潜在 位置。再次查看原始图像, 我看到图像左侧有一个壁炉,位于沙发后面。 让我们放大该区域,检查文字是否 可见。〈/think〉

<grounding>{"bbox_2d": [0.0,0.4,0.5,0.9], "source": "original_image"}</grounding>

工具拒绝 🚫 您已用完所有轮次,无法继续调用工具。 观察 3

智能体轮次 4(强制回答)

〈think〉 我一直在不同部分检查壁炉区域, 但我看不到任何带有 Think 字母“EW”的文字。之前的裁剪图像逐步 放大了壁炉,但并未揭示任何 可读的文字。这表明要么文字不可见, 要么我定位它的尝试是错误的。 由于我在可见区域看不到文字,我不得不 依赖现有的信息。然而,经过仔细 查看观察 3,我意识到这些字母 是可见的。这些字母位于 观察 3 的左上角,在墙上,写着字母“EW”。 在“EW”字母上方,有文字 “INTERIOR”。因此,我可以得出结论,写在 “EW”上方的文字是“INTERIOR”。〈/think〉

〈answer〉 INTERIOR 〈/answer〉

图 9:在四轮预算下的成功 Rollout。智能体最初搜索壁炉区域, 未能确认文字,然后将注意力转移到另一个合理的位置,并在生成强制回答之前识别出“EW”上方的文字为“INTERIOR”。此示例表明 AdaTurn 可以修正其搜索计划,而不是过早地坚持其第一个假设。

19

第 20 页

原始图像 问题 智能体回合

交通信号灯的颜色是什么? 𝑇!"# = 8 观察 1

… 观察 2

观察 7

观察 3

智能体回合 8

〈think〉 用户希望我识别图片中交通信号灯的颜色。在观察 7 中,我 Think 已成功放大交通信号灯,现在画面清晰。交通信号灯明显显示 绿灯。我还能隐约看到后面有黄灯。由于 问题问的是“显示了哪些颜色”,交通信号灯明显显示了 至少绿色和黄色。由于问题是单数形式,且绿色是交通信号灯中最突出 且清晰可见的颜色,我将回答“绿色”。用户可能是在询问所有颜色, 我能看到黄色,可能还有白色,但它们并不十分清晰。让我们重新检查观察 5, 在那里我也看到了显示多种颜色的交通信号灯。我将再次裁剪, 聚焦于似乎正在运作的交通信号灯。看起来我在放大时丢失了部分画面, 试图捕捉整个物体。让我们回顾观察 4,那里交通信号灯清晰可见,旁边 有一辆红色巴士的建筑物。〈/think〉

<grounding>{"bbox_2d": [0.6,0.3,1.0,0.7], "source": "observation_4"}</grounding>

工具拒绝 🚫 您已用完所有回合,无法继续调用工具。

Figure 10: 在八个回合预算下的成功 Rollout。智能体执行了更长的裁剪序列以隔离远处的交通信号灯,并最终回答信号灯为绿色。额外的预算使得能够进行更深入的搜索轨迹,而在更严格的回合限制下,这种轨迹很难可靠地完成。

20

第 21 页

原始图像 问题 智能体回合

“CINKER”下方的文字是什么 𝑇!"# = 8 R PICTURES”

观察 1

观察 7 观察 2

观察 3

智能体回合 8

〈think〉 用户希望识别“CINKER PICTURES”下方书写的文字。\n在观察 7 中, 思考 我可以看到左上象限有一个标牌,上面写着“CINKER PICTURES”。 我 可以看到其下方有一些较小的文字。为了更 清晰地阅读它, 我需要放大该特定区域。目标 智能体回合 8(强制回答) 文字似乎位于观察 7 左侧的一张蓝色海报上。 我将创建一个新的边界框以隔离该海报,以便 〈think〉 在观察 7 中,我可以清楚地看到左侧有一个标牌 进行更仔细的检查。 〈/think〉 上面写着“Cinker Pictures”。在该文字下方, 思考 似乎还有另一行文字。尽管文字有些模糊, 我 <grounding>{"bbox_2d": [0.0,0.4,0.5,0.9], "source": 可以辨认出“Shanghai”这个词。 "original_image"}</grounding> 例如,完整文字似乎是“CINKER PICTURES SHANGHAI”。因此,“CINKER 工具拒绝 PICTURES”下方的文字是“SHANGHAI”。 〈/think〉 🚫 您已用完所有回合,无法再调用工具。 〈answer〉 SHANGHAI 〈/answer〉

图 11:在八个回合预算下的成功 rollout。智能体逐步放大一个小店面海报,识别出标牌“CINKER PICTURES”,然后使用最终的强制回答步骤推断出其下方的文字为“SHANGHAI”。此示例说明了 AdaTurn 能够使用更长的轨迹进行细粒度文本阅读,同时仍能在预算边界处终止并给出有效答案。

21

第 22 页

原始图像 问题 智能体回合

穿着格子衬衫的人面向哪个方向? 𝑇!"# = 4

观察 1

观察 2

智能体回合 4

〈think〉 用户希望我识别穿着格子衬衫的人面向的方向。在观察 思考 3 中,我对公园里的人有了更清晰的视图。在这个观察的 中心,有一个穿着垂直条纹、多色衬衫的人。在他 的左侧稍远处,站着另一个男人。……,我应该尝试对穿条纹衫的男孩 进行更紧密的裁剪,以最终将他以及他所看的东西隔离出来。 〈/think〉

<grounding>{"bbox_2d": [0.3,0.3,0.9,1.0], "source": 观察 3 "observation_3"}</grounding>

工具拒绝 🚫 您已用完所有回合,无法继续调用工具。

智能体回合 4(强制回答)

〈think〉 根据观察 1、2 和 3,有一个穿着蓝橙条纹衬衫的男孩坐在树下。 思考 在这些观察中,男孩始终被看到坐着并向他的左侧看,看向另一个孩子。 基于多次观察,我对这个答案相当有信心。 〈/think〉

〈answer〉 穿着格子衬衫的人面向左侧。 〈/answer〉

图 12:四回合预算下的失败案例。智能体在拥挤的公园场景中搜索穿格子衬衫的人,但在预算耗尽之前,收集到的裁剪图像未能隔离出正确的目标。在强制回答步骤中,模型通过将其决策基于另一个人而产生了幻觉,并错误地回答目标面向左侧。

22

发表评论