Beacon:知何时与如何执行智能体视觉推理——让模型按需调用工具并真正获益
现有智能体视觉推理模型常盲目调用工具,导致在简单问题上引入错误,工具带来的增益被损害抵消,净收益有限。Beacon 提出两个核心机制:必要性感知自适应奖励(NAAR)让模型学会只在必要时调用工具;提示引导能力扩展(HCE)则帮助模型在极难问题上突破能力边界。在13个基准上,Beacon 不仅取得开源最佳,更展现出最强的模式自适应性和最大的工具净增益。但该方法依赖外部专家模型生成提示,且模型在避免不必要工具调用方面仍有提升空间。