快速导读:提出VC-Tooler,通过分层轨迹合成与两阶段训练(冷启动SFT+工具奖励RL),使视觉语言模型具备组合式与自适应视觉工具使用能力。
视觉语言模型正从被动理解图像转向主动式多模态推理,这要求模型能够调用外部视觉工具来获取和优化视觉证据。然而,现有方法大多局限于固定工具集和单一调用模式,缺乏组合多个工具并根据工具返回的观察结果自适应调整推理的能力。VC-Tooler正是针对这一核心缺口提出的解决方案。
VC-Tooler包含两个关键组件:一是分层轨迹合成管线,通过“先规划后执行”的策略生成覆盖单工具、多工具组合和多样化工具上下文三个层次的训练数据;二是两阶段训练框架,先以监督微调冷启动,再通过包含工具奖励的强化学习进行策略优化。实验表明,该方法在多个基准上显著优于现有开源方法,并展现出对未见工具的零样本泛化能力。
英文题目:VC-Tooler: Learning Compositional and Adaptive Visual Tool Use
论文出处:arXiv 每日论文精选 · arXiv:2608.02217
原始论文:PDF / 论文页面
这篇论文解决什么问题?
视觉工具使用要求模型不仅能根据视觉上下文调用单个工具,还能组合多个工具完成多步任务,并根据工具返回的观察结果动态调整后续行为。然而,现有方法面临严重的数据瓶颈:真实场景中难以获得覆盖多样化工具和多步交互的训练轨迹,导致模型在工具组合和自适应方面表现薄弱。
以V*基准为例,许多任务需要先放大图像查看细节,再根据观察结果决定是否需要进一步旋转或调整视角。现有方法往往只能执行第一步工具调用,无法根据返回的观察结果继续组合使用其他工具。这种“调用即结束”的模式严重限制了视觉推理的深度和准确性。
此外,现有方法的工具接口通常是固定的,模型在训练中见过的工具种类有限,面对新工具时往往无法正确调用。这要求训练数据不仅要覆盖多工具组合,还要引入工具接口的多样性,使模型学会理解工具的功能语义而非死记硬背接口格式。
核心创新
- 提出分层轨迹合成管线,生成覆盖单工具调用、多工具组合和多样化工具上下文三个层次的训练数据。
- 设计工具上下文重实例化方法,在不改变底层视觉操作的前提下变换工具接口,提升模型对未知工具的适应能力。
- 引入工具奖励作为RL的塑形信号,鼓励模型在推理中有效整合工具返回的观察结果,而非简单调用工具。
方法概览
VC-Tooler包含两个核心部分:(1) 分层轨迹合成管线,通过“先规划后执行”生成单工具和多工具组合轨迹,并通过工具上下文重实例化增加工具接口多样性;(2) 两阶段训练框架,首先在合成轨迹上进行监督微调(SFT)冷启动,然后使用包含工具奖励的强化学习(RL)进行策略优化,鼓励模型有效利用工具返回的观察结果。
- 分层轨迹合成管线采用“先规划后执行”策略:首先由规划模型根据问题和图像生成高层工具使用计划,然后由执行模型逐步调用工具并记录观察结果,形成完整的推理轨迹。这一过程可生成单工具调用轨迹和多工具组合轨迹。
- 工具上下文重实例化方法在不改变底层视觉操作的前提下,通过变换工具名称、参数格式和描述文本等方式重新实例化工具接口。这使得同一视觉操作可以对应多种不同的工具接口表示,显著增加了训练数据的多样性。
- 两阶段训练框架的第一阶段为监督微调冷启动:使用合成轨迹对基础VLM进行SFT,使其初步掌握工具调用的基本格式和推理模式。训练数据包含单工具、多工具和多样化工具上下文三个层次。
- 第二阶段为工具奖励强化学习:在SFT模型基础上,使用GRPO算法进行策略优化。奖励函数除标准答案奖励和格式奖励外,额外引入工具奖励——当模型在工具调用后能够有效利用返回的观察结果进行正确推理时给予正向激励。
- 工具奖励的设计核心理念是“调用工具不是目的,利用工具返回的信息才是”。这一塑形信号引导模型在RL过程中学会在合适的时机调用工具,并基于工具返回的观察结果调整后续推理,而非盲目调用或忽略工具输出。
- 整个训练流程的数据规模相对紧凑,但通过精心设计的数据层次和奖励结构,实现了高效的策略学习。轨迹合成管线共生成覆盖多种工具操作模式的训练样本,包括缩放、旋转、裁剪、颜色调整等常见视觉工具。
逐图理解论文
失败案例与直觉

该图对比了现有方法与VC-Tooler在工具使用上的差异。左侧显示现有方法仅能调用单个熟悉工具,右侧展示VC-Tooler能够组合多个工具并根据工具返回的观察结果自适应地继续推理轨迹。注意观察右侧轨迹中工具调用之间的逻辑衔接。
核心区分与研究缺口

该图详细说明了轨迹合成的“先规划后执行”策略和工具上下文重实例化方法。左侧展示规划与执行的分阶段流程,右侧展示同一视觉操作如何被重实例化为不同的工具接口表示。
方法贡献与验证

该图展示了VC-Tooler的两阶段训练框架全貌。上半部分为分层轨迹合成管线,下半部分为从SFT冷启动到工具奖励RL的策略优化流程。重点关注数据流从合成轨迹到模型训练的完整路径。
核心结论

该图展示了VC-Tooler的组合式与自适应工具使用案例。注意每个案例中工具调用的顺序和逻辑,以及模型如何根据前一步的观察结果决定下一步的工具选择。
实验如何设计?
- 评估基准包括通用基准V*、HRBench-8K、MME-RealWorld和智能体基准VTC-Bench,覆盖从细粒度识别到复杂推理的多种任务类型。
- 对比基线包括开源通用MLLMs、智能体推理模型(如Thyme、AdaReasoner)以及基于RL的视觉工具使用方法(如DeepEyes、PyVision-RL)。
- 工具可用性泛化实验设置四种配置:原始工具集、无工具、仅训练中见过的工具、混合新旧工具,以全面评估模型的鲁棒性和泛化能力。
- 消融实验分别考察SFT数据组成(单工具、多工具、多样化上下文)和RL奖励设计(标准奖励、工具存在奖励、工具奖励)的影响。
- 工具行为分析通过统计RL前后工具调用分布和平均调用次数,揭示训练对模型工具使用策略的影响。
关键结果与论文证据
- VC-Tooler在V*基准上达到95.8%的准确率,在VTC-Bench上达到35.3%,在HRBench-8K上达到83.8%,在MME-RealWorld上达到69.5%,均显著优于最佳开源基线(见Table 1,第5页)。
- 在VTC-Bench上,VC-Tooler比最佳开源基线高出5.3个百分点,验证了其在组合式工具使用任务上的优势(第6页)。
- 工具可用性泛化实验显示,VC-Tooler在仅提供训练中见过的工具时仍保持高性能,在混合新旧工具的场景下也能有效调用未见工具,展现出零样本泛化能力(Figure 5,第5页)。
- SFT数据消融表明,同时包含单工具、多工具和多样化上下文三个层次的数据组合效果最佳,缺少任一层级都会导致性能下降(Table 2,第7页)。
- RL奖励消融显示,工具奖励相比标准奖励和工具存在奖励带来显著提升,验证了“鼓励有效利用工具输出”这一设计理念的有效性(Table 3,第7页)。
- 工具行为分析表明,RL训练后模型在未见工具上的调用频率较低但成功率较高,说明模型学会了谨慎调用而非盲目尝试(Figure 7,第6页)。
- 案例分析显示,VC-Tooler能够在推理过程中自然地组合多个工具,例如先缩放查看细节,再根据观察结果决定是否需要旋转图像以获取更好的视角(Figure 6,第6页)。
- RL训练后,高层语义错误(如参数值错误、基于工具输出的推理错误)仍是主要失败模式,表明在语义理解和推理深度方面仍有提升空间(第6页)。
阅读时需要注意
- 轨迹合成和RL训练规模相对有限,进一步扩展数据量和训练步数可能带来性能提升,但当前实验未探索这一方向。
- 实验聚焦于有界工具空间和短交互轮次,未验证在更大规模工具集和更长推理链场景下的可扩展性。
- 模型在未见工具上的调用频率较低,虽然成功率较高,但在实际部署中可能需要额外的工具发现或推荐机制来辅助模型选择合适的工具。
关联工作
- DeepEyes是基于RL的视觉工具使用方法,与VC-Tooler共享RL训练范式,但缺乏对工具组合和自适应性的专门设计(第5页)。
- AdaReasoner和CodeDance分别从动态工具编排和可执行推理的角度探索视觉工具使用,但均未系统性地解决工具组合与观察自适应问题(第5页)。
- Thyme作为智能体推理模型,在多个基准上与VC-Tooler形成直接对比,其性能差距凸显了专门化工具使用训练的重要性(第5页)。