快速导读:GeoLens通过构建多工具视觉推理数据集GeoMTVR并提出强化工具注意力学习(RTAL)算法,实现了在超高分辨率遥感图像中超越单一缩放工具的多工具主动证据获取与推理能力。
超高分辨率(UHR)遥感图像为多模态大语言模型(MLLMs)带来了独特的挑战:任务相关证据不仅稀疏,而且在空间上高度分散。传统的单一缩放(zoom-in)工具虽然能放大局部细节,但在面对需要全局搜索、多区域比较或复杂空间推理的任务时,往往陷入性能饱和。
GeoLens通过构建GeoMTVR数据集和提出RTAL算法,首次实现了在UHR遥感场景下的多工具视觉推理。该方法不仅涵盖了crop_and_zoomin、grounding和line三种互补工具,还通过强化学习优化了模型对工具调用跨度的注意力分配,从而显著提升了复杂任务的推理能力。
英文题目:Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing
论文出处:arXiv 每日论文精选 · arXiv:2607.25993
原始论文:PDF / 论文页面
对应视频标题:遥感大模型为何需要多工具?GeoLens超越单一缩放|推荐指数:★★★★★
这篇论文解决什么问题?
现有UHR遥感VQA数据集多为静态问答或仅支持单一缩放交互,缺乏对多步骤、多工具协同推理的支持。通用领域的多工具指令数据存在严重的领域不匹配问题,直接迁移至遥感场景会导致性能下降。
单一缩放工具在处理局部易解任务后,对剩余困难任务的边际收益递减。这种现象被称为‘移动失败集效应’(Moving Failure Set Effect):随着训练进行,简单失败样本被解决,剩余动态失败样本需要更复杂的证据获取,而单一缩放工具无法提供。
因此,需要一种能够主动获取多源视觉证据并进行协同推理的方法,以突破单一工具的性能瓶颈。
核心创新
- 首次构建支持UHR遥感多工具视觉推理的大规模数据集GeoMTVR,覆盖三种互补视觉工具。
- 提出RTAL算法,将强化学习信号集中在工具调用相关的注意力模式上,而非均匀优化所有生成token,提升工具使用决策效率。
- 通过试点研究揭示了单一缩放工具的局限性(‘移动失败集效应’),证明了多工具协同在复杂遥感任务中的必要性。
方法概览
1. 构建GeoMTVR数据集:包含13K个UHR VQA样本,涵盖crop_and_zoomin、grounding和line三种工具,提供交错式推理轨迹。2. 提出RTAL(Reinforced Tool Attention Learning):一种聚焦于工具调用跨度(tool-call spans)的强化学习算法,通过优势加权散度目标优化关键工具决策的注意力分配。3. 开发GeoLens模型:基于Qwen2.5-VL-7B,先通过GeoMTVR进行SFT,再经RTAL优化。
- 构建GeoMTVR数据集:包含13K个UHR VQA样本,涵盖crop_and_zoomin、grounding和line三种工具,提供交错式推理轨迹。
- 提出RTAL算法:一种聚焦于工具调用跨度(tool-call spans)的强化学习算法,通过优势加权散度目标优化关键工具决策的注意力分配。
- 开发GeoLens模型:基于Qwen2.5-VL-7B,先通过GeoMTVR进行SFT,再经RTAL优化。
- RTAL的核心在于将强化学习信号集中在工具调用相关的注意力模式上,而非均匀优化所有生成token,从而提升工具使用决策效率。
逐图理解论文
失败案例

Figure 4揭示了‘移动失败集效应’。观察固定失败集与动态失败集之间的差距,理解单一缩放工具的局限性。
研究差距

现有方法多依赖单一缩放或通用领域数据,缺乏对多工具协同推理的支持。通用数据存在领域不匹配,而单一工具无法应对‘移动失败集效应’,即剩余困难任务需要更复杂的证据获取。
核心贡献

Figure 5展示了RTAL算法的流程。注意强化学习信号如何聚焦于工具调用跨度,优化注意力分配。
实验验证

Table 5展示了GeoLens在XLRS-Bench上的性能。注意其超越主流大模型的准确率。
结论与局限

多工具协同是突破UHR遥感推理瓶颈的关键。然而,目前仅针对光学图像,且依赖半自动标注。以上就是这篇论文的核心内容,感谢收听。
实验如何设计?
- 在XLRS-Bench、RSHR-Bench和LRS-GRO-eval基准上进行评估。
- 对比直接推理、单一缩放基线及多种开源/闭源MLLMs。
- 进行模块消融实验,验证SFT数据、RTAL模块及工具类型的有效性。
关键结果与论文证据
- GeoLens在XLRS-Bench平均准确率54.2%,超越Qwen3-VL-235B (51.1%)和Qwen2.5-VL-72B (50.2%) [Page 10]。
- 在LRS-GRO-eval平均准确率60.7%,达到SOTA [Page 11]。
- 在RSHR-Bench总体平均分48.8,排名第一 [Page 10]。
- 消融实验表明,RTAL模块显著提升了工具使用决策效率,而单一缩放工具在复杂任务上表现不佳。
阅读时需要注意
- 目前主要聚焦于光学卫星图像,尚未评估合成孔径雷达(SAR)或多光谱图像等其他传感器模态的适用性。
- GeoMTVR数据集构建依赖半自动标注流程,可能存在标注噪声或幻觉风险。
关联工作
- ZoomEarth [13] 和 GeoEyes [14] 主要依赖单一缩放工具,在UHR遥感任务中表现优于直接推理但低于GeoLens。
- ViLaSR [48] 引入工具调用和视觉过程标注,但主要针对通用领域。
- RAL [18] 提出强化注意力学习,但未处理代理式工具使用轨迹。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
超越缩放:面向超高分辨率遥感的多工具视觉推理学习
王峰翔1,*, 黄江南2,*, 陈明硕1, 李跃跃1, 施扬1, 罗军伟2, 王浩宇3,†, 李延生2, 张静2, 赵海燕3,†, 杨文静1 1 国防科技大学 2 武汉大学 3 清华大学
- 同等贡献 † 通讯作者
摘要
超高分辨率 (UHR) 遥感 (RS) 影像提供了城市尺度场景的细粒度地球观测证据,但这对多模态大语言模型 (MLLMs) 构成了根本性挑战:与任务相关的证据通常稀疏、局部且分散在极大的视觉上下文中。一种自然的解决方案是为 MLLMs 配备缩放工具以进行主动局部检查。然而,通过对 XLRS-Bench 的初步研究,我们发现缩放工具仅能部分恢复证据,且在简单和中等难度任务上效果饱和;它解决了局部搜索,但无法处理需要全局搜索、多区域比较、路径规划或分散证据推理的复杂任务。受此发现启发,我们超越了单一工具的缩放,引入了 GeoMTVR,这是一个基于广域卫星影像构建的大规模地理空间多工具视觉推理数据集。GeoMTVR 包含 13K 个 UHR VQA 样本,具有交错的推理轨迹、多样的视觉工具调用以及返回的视觉观测结果,使模型能够学习问题分解、工具选择、区域检查、对象级定位、辅助视觉推理以及跨工具证据整合。除了监督微调外,我们提出了一种以工具注意力为核心的强化学习算法,将优化集中在关键的工具使用决策上,包括何时调用工具、选择哪个工具、在哪里应用它以及如何解释工具输出。通过将 GeoMTVR 上的 SFT 与我们的 RL 算法相结合,我们开发了 GeoLens,这是一种用于 UHR RS 的多工具视觉推理 MLLM。实验表明,GeoLens 始终优于直接推理和单一工具缩放基线,实现了更高的准确率、更好的证据定位以及更高效的工具使用轨迹。我们的结果表明,UHR RS MLLMs 应从被动图像理解和单操作探索,演变为主动的、任务自适应的多工具视觉推理。数据集和代码已发布在 GeoLens。
1 引言
超高分辨率 (UHR) 遥感 (RS) 影像极大地增加了地球表面可观察的细节。与常规自然图像不同,单张 UHR 卫星图像通常覆盖城市尺度或区域尺度的区域,同时保留小物体、局部结构和长距离地理关系。这使得 UHR RS 影像成为多模态大语言模型 (MLLMs) [1–3] 的一个重要且具有挑战性的领域。
MLLMs 的最新进展显著提高了通用和遥感领域的视觉理解和推理能力 [4–7]。然而,UHR RS 理解仍未得到解决。核心瓶颈在于视觉证据获取:模型必须从极大的视觉上下文中识别与任务相关的证据,其中有用区域通常稀疏、局部且空间分散。直接将整个图像压缩为全局表示可能会丢弃
预印本。
第 2 页
图1:GeoLens概览。GeoLens支持超高分辨率遥感影像的多工具视觉推理。 细粒度细节,而穷举式的局部检查在计算上效率低下且难以学习[8, 1]。
一种自然的解决方案是为多模态大语言模型(MLLMs)配备视觉工具,特别是裁剪与缩放(crop-and-zoom),使其能够在推理过程中主动检查高分辨率的局部区域。给定一张图像和一个问题,模型将文本推理与视觉动作交错进行,并决定是继续推理还是调用缩放工具以获取更精细的局部证据[9–11]。这一范式近期在通用领域和遥感(RS)MLLMs中均引起了关注[12–14]。然而,近期针对通用领域的分析表明,缩放并非一种普遍有效的操作:其益处高度依赖于任务是否可通过局部证据恢复来解决,且无差别的缩放可能会引入噪声或不完整的证据[15–17]。相比之下,近期关于超高分辨率(UHR)遥感的研究强调,缩放是解决大型卫星图像中细粒度细节的关键机制[13, 14]。这种差异引出了一个核心问题:
单工具缩放是否足以支持超高分辨率遥感推理,或者超高分辨率遥感MLLMs是否需要更多样化的视觉工具来进行主动证据获取?
为了回答这个问题,我们首先在一个支持缩放的强化学习框架[18]下,在XLRS-Bench上进行了初步研究。我们的分析表明,缩放是有用的,但其益处高度依赖于任务。它主要提升了那些缺失证据可在局部恢复的简单和中等难度任务,如物体识别、局部计数和属性识别。然而,在需要全局搜索、多区域比较、长距离空间推理或异构感知操作的困难案例(如全局计数、路径规划和分散证据推理)上,其效果趋于饱和。这些结果表明,局限性并不仅仅是缩放调用次数不足。相反,单工具缩放仅提供了一种形式的证据获取方式,而超高分辨率遥感推理通常要求模型决定执行哪种视觉操作、在何处应用该操作,以及如何整合不同工具返回的证据。
受此发现启发,我们超越了单工具缩放,研究了超高分辨率遥感的多工具视觉推理。具体而言,我们考虑了三种互补的视觉工具:crop_and_zoomin用于渐进式局部检查,grounding用于精确的物体级定位,以及line用于空间关系和路径导向推理中的辅助线绘制[19–21]。为了支持这一设置,我们构建了GeoMTVR(地理空间多工具视觉推理数据集),这是一个源自广域卫星影像的大规模监督微调数据集。GeoMTVR中的每个样本都提供了文本推理、视觉工具调用和返回的视觉观察结果的交错轨迹。与现有的高分辨率遥感视觉问答(VQA)数据集不同,后者大多是静态问答数据集或仅支持缩放的工具交互数据集[1, 8, 13, 14],GeoMTVR使模型能够学习针对问题
2
第 3 页
分解、工具选择、区域检查、对象级定位、辅助视觉推理, 以及跨工具证据整合。
然而,仅靠监督学习可能仅模仿工具使用轨迹,而无法充分优化工具使用决策。在超高分辨率(UHR)遥感(RS)推理中,关键挑战不仅在于生成正确答案,还在于将模型注意力分配给关键的工具相关决策,包括何时调用工具、选择哪个工具、在哪里应用它以及如何解释返回的观察结果。为此,我们提出了强化工具注意力学习(RTAL),这是一种受注意力级后训练目标 [18] 启发的、专注于工具注意力的强化学习算法。RTAL 对与工具使用决策相关的 token 和注意力模式施加更强的优化重点。通过在工具调用和工具输出解释周围集中策略更新,RTAL 鼓励更具适应性和效率的证据获取,而不是均匀地强化所有生成的 token。
基于 GeoMTVR 和 RTAL,我们开发了 GeoLens,这是一个用于 UHR 遥感的面向多工具视觉推理的多模态大语言模型(MLLM)。GeoLens 首先通过监督微调(SFT)在多工具推理轨迹上进行训练,然后使用 RTAL 进一步优化。结果,该模型学会了主动选择视觉工具、检查相关区域,并整合来自异构观察的证据。在 UHR RS 推理基准上的实验表明,GeoLens 始终优于直接推理和单工具放大基线,实现了更高的准确性、更好的证据定位以及更高效的工具使用轨迹。
总之,我们的主要贡献如下:
(1) 我们系统地分析了单工具放大在 UHR RS 推理中的有效性和局限性。我们的初步研究表明,放大主要解决局部简单和中度任务,如对象识别、局部计数和属性识别,但在需要全局覆盖、多区域比较或结构化空间推理的困难案例上趋于饱和。
(2) 我们构建了 GeoMTVR,这是一个大规模的 UHR RS 多工具视觉推理数据集,包含交错的文本推理、三种类型的视觉工具调用以及返回的视觉观察结果。据我们所知,它是第一个支持 UHR RS 中多工具视觉推理的数据集,涵盖裁剪放大、定位和辅助线绘制。
(3) 我们提出了 RTAL 并开发了 GeoLens,这是一个用于 UHR 遥感的面向多工具视觉推理的 MLLM。通过在 GeoMTVR 上结合 SFT 与 RTAL,GeoLens 学会了主动选择视觉工具、检查相关区域并整合异构视觉证据,从而在直接推理和单工具放大基线上实现了持续改进。
2 相关工作
遥感大型多模态模型。大型多模态模型(MLLMs)的最新进展推动了遥感(RS)在多任务推理 [6, 7]、图像描述和检索 [22]、交互式对话 [5]、统一指令遵循 [4, 23, 24]、多传感器分析 [25–27]、接地理解 [28, 29] 以及混合专家建模 [30] 方面的理解。随着 RS 图像向超高分辨率(UHR)输入发展,视觉 token 数量庞大成为核心瓶颈。现有解决方案主要遵循两个方向。一条线通过剪枝或证据选择减少视觉 token,使用自适应聚类、注意力引导裁剪或参考引导检索来移除冗余区域 [1, 31]。这些方法提高了效率,但通常依赖于手工规则或静态选择策略,可能无法泛化到多样化的视觉问答(VQA)任务。另一条线为 RS MLLMs 配备视觉工具以进行迭代感知。代表性系统如 ZoomEarth [13]、VICoT-Agent [12] 和 GeoEyes [14] 逐步细化视觉证据,通常通过对感兴趣区域进行放大操作来实现。然而,当前的基于工具的 RS 模型仍主要依赖放大作为主导交互形式,使得复杂 UHR 场景下的证据分布在不同尺度、位置和语义上下文中的情况尚未得到充分探索。
遥感视觉语言数据集。RS 社区开发了多种视觉语言数据集以支持多模态学习,包括用于地理基础模型的大规模图像-文本资源 [32]。早期数据集如 RSVQA [33]、RS-IVQA [34] 和 EarthVQA [35] 从地理标注或自动生成问题中构建 VQA 样本,而 RSSA [36]、SkySenseGPT [37]、VHM [38] 和 VRSBench [39] 则扩展了指令遵循和
3
第 4 页
任务覆盖。然而,这些数据集的空间分辨率通常有限。最近的超高分辨率(UHR)数据集,包括 SuperRS-VQA [1]、HighRS-VQA [1]、LRS-VQA [8]、XLRS-Bench [2] 和 RSHR-Bench [3],将遥感评估推向了 8K 规模。工具增强型数据集,如 GeoEyes UHR-CoZ [14] 和 LRS-GRO [13],进一步将外部视觉操作引入遥感推理。尽管如此,现有数据集在 UHR 设置下对多步和多工具推理的支持仍然有限。大多数 UHR 数据集侧重于单步感知或评估,而当前的工具增强数据集主要依赖浅层的放大交互。通用领域的多工具指令数据也未针对遥感图像或 UHR 输入进行定制,导致在真实世界遥感场景中训练多模态大语言模型(MLLMs)使用视觉工具进行复杂思考存在差距。
结合图像的通用思考。思维链推理提高了视觉语言模型的推理能力,但仅基于文本的思维链仍依赖于单次图像感知,可能会遗漏细微的视觉证据。最近的“结合图像思考”方法通过允许模型在推理过程中与图像交互来解决这一问题 [40]。Visual Sketchpad [19] 引入了辅助线等图像操作工具,而结构化视觉表示进一步提升了空间推理能力 [21]。Visual Tool Agent [41] 和 SpaceTools [42] 表明,模型可以学习为多模态和空间推理选择工具。其他工作使用放大或基于裁剪的操作来提高小物体识别和细粒度感知 [43–45]。最近的智能体视觉语言模型进一步结合工具调用、视觉动作轨迹和强化学习,在推理过程中获取视觉证据 [9–11, 46, 47]。在遥感领域,视觉交错推理也开始将工具使用与地理空间解释联系起来 [12]。同时,几项研究表明,放大的有效性取决于训练数据、奖励设计和工具使用策略,而非操作本身 [15–17]。然而,现有方法大多是为自然图像或单工具设置设计的。它们未能充分解决 UHR 遥感图像的问题,其中有用证据稀疏、空间分散,且通常需要领域感知的多步视觉推理。
3 数据集
遥感多模态大模型的近期进展催生了大量的视觉问答(VQA)数据集,包括 SuperRS-VQA [1]、HighRS-VQA [1]、RSVQA-HR [33]、UHR-CoZ [14] 和 LRS-GRO [13]。然而,现有高分辨率遥感 VQA 数据集主要分为两类:静态问答数据集和以放大操作为中心的工具交互数据集。因此,它们对多样化视觉工具使用的支持有限,而在超高分辨率(UHR)场景中,推理通常需要在多个区域之间进行协调检查、定位和空间比较。表 1 将我们的数据集与现有数据集进行了比较。
表 1:与遥感 UHR VQA 数据集的比较。
数据集 平均分辨率 工具类型 VQA 数量
RSVQA [33] 512×512 无 111,134 RSVQA-HR [33] 1,024×1,024 无 1,066,316 LRS-GRO [13] 5,000×5,000 放大 13,245 UHR-CoZ [14] 2,178×2,051 放大 25,467 GeoMTVR 6,033×6,017 放大、定位、辅助线 13,078
为了填补这一空白,我们遵循 ViLaSR [48] 等近期范式,引入工具调用和视觉过程标注,并将其扩展到 UHR 卫星图像。我们设计了一种分阶段的、半自动的、过程驱动的标注框架,逐步将现有的 UHR 遥感 VQA 样本转换为可解释的工具使用推理轨迹。通过多阶段协作,该框架生成了涉及多样化视觉工具的高质量标注,包括裁剪放大、定位和辅助线操作。利用此流水线,我们构建了约 13K 个高分辨率 VQA 样本,平均分辨率约为 9K × 9K,每个样本都丰富了详细的视觉工具使用推理痕迹。
4
第 5 页
表 2:数据集的预实验。我们仅修改 SFT 数据。准确率基于 XLRS-Bench [2] 的结果报告。
SFT 数据 模型 准确率 数据来源 数量 平均分辨率 领域 工具
Qwen-2.5VL-7B SuperRSVQA [1] 1.3k 8,376×8,376 遥感 无 46.6
SuperRSVQA [1] 1.3k 8,376×8,376 遥感 无 vqa_cold_start [48] 10k 478×390 通用领域 对象映射器, 对象映射器 Qwen-2.5VL-7B maze_cold_start [48] 7.3k 588×588 通用领域 对象映射器, 对象映射器 42.7↓ GPT4Scene_cold_start [48] 6.1k 504×364 通用领域 对象映射器, 对象映射器 SR_91k_cold_start [48] 11.4k 504×364 通用领域 对象映射器, 对象映射器
数据集预实验。通用领域数据集最近提供了视觉工具使用的监督轨迹,这使其与高分辨率 RS VQA 数据结合以训练工具增强的 RS MLLMs 变得诱人。我们通过仅更改 SFT 阶段的混合数据来测试这一策略。如表 1 所示,仅使用 SuperRSVQA [1] 训练的 Qwen2.5-VL-7B [49] 在 XLRS-Bench [2] 上达到了 46.6% 的准确率,而添加几个通用领域工具交互数据集将准确率降低至 42.7%。这一结果表明,仅通过增加带有视觉工具使用轨迹的 SFT 数据并不能改善 UHR RS 推理。
大多数添加的数据集是基于低分辨率自然或合成图像构建的,其视觉尺度、对象分布和证据布局与 UHR RS 图像存在显著差异。因此,它们的工具使用轨迹可能为 RS 场景提供微弱甚至误导性的监督,在这些场景中,任务相关的证据稀疏、空间分散,且通常需要在多个区域之间进行协调探索。这些发现揭示了明显的领域不匹配,并激发了针对 UHR RS 的多工具交互数据的需求。
表 3:GeoMTVR 数据集的主要统计信息。
指标 值
总样本数 13,078 平均图像分辨率 6,033 × 6,017 平均问题长度 60.72 词 平均推理长度 126.92 词 使用工具的样本 97.09% 每个样本的平均工具调用次数 1.53 每个样本的平均工具类型数量 1.16
包含缩放操作的样本 78.36% 包含定位的样本 39.64% 包含线条的样本 5.31%
图 3:我们的数据集涵盖了 13 个子任务中的感知和推理维度。
数据来源选择。我们的数据集建立在现有高分辨率遥感 VQA 资源之上。我们整合多源图像并应用统一的重新标注,以提高数据多样性和训练效用。具体而言,我们使用高分辨率 VQA 来源,包括 SuperRSVQA [1] 和 LRS-GRO-train [13]。为了确保数据质量和公平评估,我们执行严格的图像级去重,并移除与现有基准(如 XLRS-Bench [2] 和 LRS-GRO-eval)重叠的样本。
标注。直接使用当前的 MLLMs(如 GPT-5.4 [50] 和 Claude 4.6 [51])对 UHR 卫星图像中的工具使用行为进行标注,往往会导致不可靠的结果。我们观察到明显的幻觉和不稳定性,特别是在初始问题区域裁剪阶段,局部定位偏移或目标错误识别可能会级联导致错误的边界框和辅助线标注。为了减少此类错误,我们采用了图 2 所示的分阶段标注框架。
5
第 6 页
给定问题、图像和答案,我们首先使用 Qwen3-VL-235B-A22B [52] 粗略裁剪出与问题相关的区域。随后,我们结合视觉问答(VQA)语义,并利用 GPT-5.2 [53] 生成工具增强的推理轨迹,遵循通过链式视觉操作构建详细视觉推理过程的一般思路 [54]。最后,应用 GroundingDINO [20] 精确定位问题涉及的对象,从而实现结构化视觉推理标注的渐进式构建。
统计信息。图 3 可视化了两个数据集的能力维度覆盖情况。可以看出,我们的数据集涵盖了更广泛的任务维度,与现实场景表现出高度的一致性。此外,我们在表 3 中总结了数据集的关键统计信息,包括平均问题/答案长度、标注对象的多样性和数量、平均分辨率以及其他相关属性。
4 方法
4.1 预研:MLLM 中单一放大工具的限制。
现有研究通过将文本推理与放大等视觉操作交错,将工具调用整合到高分辨率图像 VQA 中 [9–11, 40, 12]。给定图像和问题,模型决定是直接回答,还是通过视觉动作获取更高分辨率的局部证据。近期针对通用领域的研究对放大的广泛有效性提出质疑,认为其收益可能主要来自于对有效数据的强化学习,而非工具本身 [15, 16]。相比之下,GeoEyes 和 ZoomEarth 等遥感超高分辨率(RS UHR)研究报道了放大对于超高分辨率遥感理解的显著益处。这种差异引出了一个关键问题:在放大局限性显现的 RS UHR 场景中,放大是否真正有效,以及它能解决哪类问题。
为了检验这一问题,我们在 XLRS-Bench 上利用 Qwen3-VL-8B-Instruct 作为基础模型进行了预研。该模型使用 GRPO 进行训练,并仅配备放大工具 [55, 56]。训练数据包括来自原始 MED 训练集 [17] 的约 7K 个样本和来自 SuperRSVQA 的 6K 个样本,形成了用于超高分辨率遥感场景工具使用强化学习的混合语料库。我们使用 256 的批量大小,将 rollout 数量设置为 8,并在 220 个训练步骤中每 10 步评估一次模型。遵循 MED 的做法,我们将工具引起的性能变化分解为调用增益(Call Gain)、模式增益(Schema Gain)、调用损害(Call Harm)和模式损害(Schema Harm),并进一步将调用增益分解为规模(Mass)、策略(Policy)和质量(Quality)。我们重点关注质量项,即工具调用在失败样本上导致正确答案的概率。
我们考虑三个失败集:动态失败集 $D_{fail}(t)$,包含在检查点 $t$ 时无工具回答错误的样本;固定失败集 $D_{fail}(0)$,由强化学习前的基础模型定义;以及它们的交集 $D_{fail}(0) \cap D_{fail}(t)$,捕捉持续困难的样本。如图 4 所示,固定质量从 0.00 稳步增加到 0.25,表明强化学习在原始失败集上学到了有用的放大行为。然而,动态质量先增加后下降,峰值约为 0.15,最终降至 0.13。这种差异揭示了一种移动失败集效应:随着较简单的样本被解决并从 $D_{fail}(t)$ 中移除,剩余的失败变得更加困难,单一的放大操作无法再提供足够的证据。在最终检查点,固定质量几乎是动态质量的两倍,这表明在初始失败集上的评估严重高估了工具对当前困难案例的有效性。表 8 进一步解释了这一效应。
图 4:XLRS-Bench 上三种失败集定义下的质量因子。固定失败集与动态失败集之间的差距揭示了移动失败集效应:随着训练进行,较简单的失败被解决,而剩余的动态失败需要比单一放大工具所能提供的更复杂的证据获取。
6
第 7 页
Takeaway
多模态大语言模型(MLLM)中的放大工具主要解决具有局部证据的简单超高分辨率(UHR)遥感任务,如物体识别、局部计数和属性识别,但对于需要全局覆盖、多区域比较或长距离空间推理的困难任务仍显不足。
表8进一步解释了这一效应。已解决的样本通常依赖于来自单一局部区域的证据,例如识别车辆类型、在指定港口区域计数物体、识别屋顶颜色或确定附近地标之间的相对位置。在这些情况下,主要挑战是定位相关区域,而一次放大操作通常能提供足够的细节。相比之下,持续失败的样本涉及全局计数、路径规划、土地利用枚举、跨图像对的变更计数或基于空间分散线索的推理。这些任务需要系统性的空间覆盖、多区域比较或超出放大工具能力的异构感知能力。尽管该框架允许最多五次放大调用并在上下文中保留全局图像,但有限的覆盖范围和缺乏结构化探索仍阻止模型收集足够的证据。
表4:试点实验的更多细节。对由单工具放大解决的样本与持续失败的样本进行的定性分析。单次放大在获取局部证据方面有效,但在处理超高分辨率遥感图像中的全局覆盖、多区域比较和结构化空间推理时面临困难。
组别 代表性任务 关键观察结果
强化学习训练期间解决的样本
物体分类 车辆类型识别 对目标区域进行单次放大即可揭示具有区分度的视觉细节,例如卡车与公交车之间的差异。 区域计数 在指定港口计数船只 相关区域在空间上是局部的,放大后物体变得清晰可分。 属性识别 识别屋顶颜色 放大缓解了全局视图下采样导致的细粒度外观信息丢失。 局部空间关系 基于附近地标的推理 两个目标均可被单个局部裁剪覆盖,使其相对布局直接可见。
持续失败的样本
全局计数 在城市级图像中计数车辆 有限的放大调用无法系统性地覆盖整个超高分辨率图像,导致许多目标未被观察到。 路径规划 在远距离点之间寻找路线 全局视图缺乏道路级细节,而局部放大裁剪不足以形成连贯的长距离路径。 土地利用枚举 识别所有土地利用类型 答案依赖于多个异构区域,但有限的局部检查仅覆盖其中一小部分。 跨图像对变更计数 比较图像对中的物体数量 两张图像都需要多次局部检查,使得固定的工具预算不足以进行可靠比较。 复杂推理 基于分散线索推断条件 所需证据分布在遥远的区域,且“裁剪-放大”缺乏结构化探索机制。
4.2 GeoLens
GeoLens 的训练分为两个阶段。我们首先在 GeoMTVR 上进行监督微调(SFT),以初始化多工具视觉推理行为,使模型能够模仿推理、工具调用和视觉观察的交错轨迹。随后,我们使用以工具注意力为核心的强化学习目标对模型进行优化,以加强围绕关键工具使用决策的注意力路由。这种设计将行为获取与策略优化分离:SFT 教导模型如何使用不同的工具,而强化学习则改进何时以及如何调用这些工具。
7
第 8 页
图 5:强化工具注意力学习(Reinforced Tool Attention Learning, RTAL)概览。RTAL 将强化信号聚焦于工具调用片段,鼓励模型在多工具视觉推理过程中将注意力路由至与任务相关的上下文和工具观测结果。
4.2.1 强化工具注意力学习
在工具增强的超高分辨率(Ultra-High-Resolution, UHR)遥感推理中,挑战不仅在于生成正确答案,还在于将计算资源分配给正确的视觉证据获取过程。轨迹包含文本推理令牌、工具调用、返回的观测结果以及随后的解释令牌。标准的策略梯度方法在标量奖励下优化生成的令牌,因此对大多数令牌采用相似的目标。这对于多工具推理而言并非最优,因为决定性错误往往发生在少量与工具相关的决策周围:是否调用工具、调用哪个工具、在哪里应用它以及如何利用返回的观测结果。对所有令牌进行均匀强化会稀释这些决策的学习信号,并导致低效或同质化的工具使用。
最近的工作如 RAL [18] 表明,多模态大语言模型(MLLM)的后训练可以通过优化内部注意力分配而非仅优化下一个令牌似然获益。然而,现有的基于注意力的强化学习主要面向标准图像或视频问答,其中视觉输入在生成过程中保持固定。它并未显式处理代理式工具使用轨迹,其中每次工具调用都会改变可用证据,并影响后续推理和未来的工具选择。因此,我们针对多工具视觉推理重新构建了基于注意力的强化学习。我们不再优化所有生成令牌上的注意力,而是聚焦于思维链过程中与工具调用片段相关的注意力模式。通过加强这些与工具相关的注意力轨迹上的策略更新,我们的方法鼓励模型基于先前的工具输出来条件化后续推理和工具调用,从而产生更具适应性和基于证据的多工具策略。
形式上,强化工具注意力学习包含三个步骤。首先,我们从生成的轨迹中提取工具调用片段,并针对其有效上下文定义工具条件化的因果注意力策略。其次,我们应用优势加权的散度目标,以促进来自高奖励轨迹的注意力路由模式,并抑制来自低奖励轨迹的模式。第三,我们使用时步掩码,使得注意力级别的梯度仅通过工具调用子序列传播。这保留了普通语言生成,同时将优化集中在工具调用的因果敏感区域。
除非另有说明,$\theta$ 表示当前模型参数,$\tau$ 表示采样的推理轨迹,$D_{\text{JSD}}(\cdot \|\cdot)$ 表示 Jensen–Shannon 散度,$E[\cdot]$ 表示在指定采样过程中的期望。我们使用 $L_{\text{RL}}$ 表示标准的输出级强化学习目标,使用 $L_{\text{toolAttnRL}}$ 表示提出的工具聚焦注意力目标。
8
第 9 页
工具条件因果注意力策略。在我们的实现中,强化注意力学习仅应用于与工具调用相关的生成子序列,将原始的全序列注意力策略压缩为由工具触发的条件子空间。设完整序列为 $S = (x_1, \dots, x_T)$,其中 $x_{1:P}$ 是提示,$x_{P+1:T}$ 是生成的 token。定义
$$C = \{t \mid x_t \in \text{ToolsCall}\} \quad (1)$$
为工具调用跨度内的时间步集合(包括函数名、参数键值对和结构标记)。对于任意 $t \in C$,令 $\alpha_{t,i} (i < t)$ 表示来自最后一层的注意力权重。为了表征仅由工具调用驱动的信息路由,我们在有效的因果上下文上对注意力进行归一化,得到条件注意力策略:
$$\tilde{p}_\theta^t(i) = \frac{\alpha_{t,i}}{\sum_{j=1}^{t-1} \alpha_{t,j}}, \quad i \in \{1, \dots, t-1\}, t \in C, \quad (2)$$
其中 $T$ 是序列长度,$P$ 是提示长度,$x_t$ 是时间步 $t$ 的 token,$C$ 是工具调用时间步的集合,$i$ 索引先前的上下文 token,$\alpha_{t,i}$ 是从 token $t$ 到 token $i$ 的平均最后一层注意力权重,$\tilde{p}_\theta^t(i)$ 是当前参数 $\theta$ 下的归一化工具条件注意力概率。这种形式与标准定义一致,但优化仅在 $C$ 上进行,明确将策略语义约束为模型在工具调用期间如何整合提示和生成推理以做出可执行的结构化决策,而不对非工具文本跨度施加不必要的约束。
工具 Token 上的优势加权散度。为了在工具调用子空间中实现基于奖励的策略改进,我们将优势加权散度目标从全序列期望重写为对 $C$ 的条件期望,仅在工具相关步骤应用优化信号。令 $\tilde{p}_{old}^t$ 为旧策略,令 $A_\tau$ 为序列级或片段级优势(在实践中在 $C$ 上共享)。为了数值稳定性,使用对称且有界的 Jensen-Shannon 散度,注意力强化目标为
$$L_{\text{toolAttnRL},\tau} = \frac{1}{|C_\tau|} \sum_{t \in C_\tau} A_\tau \cdot D_{\text{JSD}}(\tilde{p}_\theta^t \parallel \tilde{p}_{old}^t). \quad (3)$$
在最小化此损失时,正优势 $A_\tau > 0$ 将当前工具注意力拉向成功的历史路由,而负优势 $A_\tau < 0$ 将注意力推离低效的路由模式。由于期望域限制在 $C$ 内,梯度不会在长的非关键跨度上被稀释,从而加强了结构化参数选择、字段对齐和跨步依赖建模的监督。最终目标与标准策略梯度线性耦合:
$$L_{\text{total}} = L_{\text{RL}} + \lambda_{\text{attn}} L_{\text{toolAttnRL}}, \quad (4)$$
其中 $\tilde{p}_{old}^t$ 是当前更新前的冻结注意力策略,$A_\tau$ 是轨迹 $\tau$ 的优势,$L_{\text{total}}$ 是最终训练损失,$\lambda_{\text{attn}}$ 平衡输出级优化和内部路由探索,有效范围限于工具调用跨度。
针对工具特定注意力的掩码梯度传播。在梯度层面,我们应用显式的时间步掩码,仅在工具调用跨度内反向传播,将分布级梯度精确投影到相应的注意力 logits 上。令
$$J_t = D_{\text{JSD}}(\tilde{p}_\theta^t \parallel \tilde{p}_{old}^t). \quad (5)$$
其中 $J_t$ 是工具调用步骤 $t$ 处的局部散度目标。其分布梯度 $\nabla_{\tilde{p}_\theta^t} J_t$ 遵循 JSD 的闭式解。令 $e_{t,i}$ 表示 softmax 归一化前的注意力 logit,并使用 $\tilde{p}_i$ 作为固定 $t$ 时 $\tilde{p}_\theta^t(i)$ 的简写。使用 softmax 雅可比矩阵
$$\frac{\partial \tilde{p}_i}{\partial e_j} = \tilde{p}_i(\delta_{ij} – \tilde{p}_j), \quad (6)$$
链式法则给出 logit 梯度:
$$\nabla_{e_{t,i}} J_t = \tilde{p}_\theta^t(i) \left( \nabla_{\tilde{p}_\theta^t(i)} J_t – \sum_j \tilde{p}_\theta^t(j) \nabla_{\tilde{p}_\theta^t(j)} J_t \right). \quad (7)$$
9
第 10 页
参数梯度变为
$$ \nabla_\theta L_{\text{toolAttnRL}} = \mathbb{E}_\tau \sum_{t=1}^{T-1} \sum_{i} \delta_{ij} \nabla_{e_{t,i}} J_t \cdot \frac{\partial e_{t,i}}{\partial \theta} \quad (8) $$
此处,$\delta_{ij}$ 为克罗内克 delta,$j$ 索引 softmax 雅可比矩阵中的上下文位置,$\partial e_{t,i}/\partial \theta$ 将 logits 层面的梯度映射回模型参数。在实践中,$L_{\text{toolAttnRL}}$ 对最后一层的所有注意力头进行平均。在公式 (8) 中,仅工具调用子序列内部的注意力路径接收强化信号。这种掩码反向传播在不改变前向图的情况下局部重塑内部信息路由,使模型在工具调用的因果敏感区域中学习奖励对齐的注意力分配和跨步依赖结构,同时保留语言生成的灵活性。
5 实验
实验设置 我们首先在新增标注的 GeoMTVR 数据集上使用 Qwen2.5-VL-7B 进行监督训练,采用交错的图文监督信号和显式的工具调用标注。具体而言,我们建模三种显式工具类型:crop_and_zoomin(裁剪与放大)、grounding(定位)和 line(连线)。在强化学习阶段,基于我们的 RTAL 方法,我们在清洗后的 SuperRS-VQA 和 LRS-GRO-train 数据上执行强化学习。评估方面,我们在 XLRS-Bench 和 LRS-GRO-eval 上进行测试。更多细节及扩展消融实验见附录。
表 5:XLRS-Bench 上感知与推理维度的实验结果,模型按平均性能排名。我们用红色标记最高分。
方法 | 感知 | 推理 —|—|— 子任务 (L-3 能力) | OC | RC | OLUC | RLUC | OCC | OCL | OMS | OSR | AD | ECR | RP | RCCD | CCR | Avg. 遥感 MLLMs GeoChat [4] | 16.7 | 29.0 | 2.0 | 23.0 | 21.1 | 16.8 | 35.0 | 24.2 | 33.0 | 43.0 | 10.0 | – | 21.0 | 22.9 ZoomEarth [13] | 30.0 | 38.0 | 8.0 | 63.0 | 35.1 | 33.9 | 65.0 | 31.4 | 66.0 | 73.0 | 22.0 | 28.3 | 40.0 | 41.1 GeoLLaVA-8K [1] | 26.7 | 38.0 | 49.0 | 69.0 | 41.6 | 31.6 | 65.0 | 35.0 | 67.0 | 78.0 | 66.0 | 50.0 | 52.0 | 51.5 闭源 MLLMs Claude 3.7 Sonnet [57] | 27.6 | 22.7 | 17.4 | 68.4 | 30.5 | 29.9 | 63.6 | 27.6 | 64.8 | 78.4 | 34.5 | 27.8 | 32.6 | 40.5 Gemini 2.5 Pro [58] | – | – | – | – | – | – | – | – | – | – | – | – | – | 45.2 GPT-5.2 [53] | 30.0 | 37.0 | 17.0 | 70.5 | 43.0 | 41.4 | 68.3 | 34.0 | 74.0 | 76.0 | 52.0 | 36.7 | 38.0 | 47.5 开源 MLLMs ViLaSR [48] | 28.3 | 38.0 | 17.0 | 72.0 | 31.1 | 33.1 | 65.0 | 39.4 | 70.0 | 76.0 | 27.0 | 41.7 | 47.0 | 45.1 InternVL3-8B [59] | 40.0 | 39.0 | 10.0 | 71.5 | 44.5 | 30.8 | 65.0 | 25.2 | 77.0 | 82.0 | 36.0 | 21.7 | 50.0 | 45.6 Qwen2-VL-7B [60] | 26.7 | 40.0 | 11.0 | 73.0 | 35.9 | 34.6 | 61.7 | 31.8 | 70.0 | 81.0 | 35.0 | 46.7 | 48.0 | 45.8 InternVL2.5-8B [61] | 38.3 | 37.0 | 10.0 | 77.0 | 33.4 | 35.5 | 65.0 | 21.6 | 73.0 | 83.0 | 34.0 | 50.0 | 43.0 | 46.2 Qwen2.5-VL-7B [49] | 33.3 | 40.0 | 31.0 | 77.0 | 40.6 | 40.5 | 66.7 | 36.2 | 68.0 | 72.0 | 27.0 | 38.3 | 45.0 | 47.4 InternVL3-78B [59] | 23.3 | 49.0 | 33.0 | 74.0 | 42.5 | 37.4 | 66.7 | 30.0 | 76.0 | 81.0 | 40.0 | 45.0 | 42.0 | 49.2 Qwen3-VL-8B [52] | 21.7 | 50.0 | 26.0 | 81.5 | 46.6 | 43.1 | 66.7 | 30.4 | 74.0 | 79.0 | 37.0 | 43.3 | 51.0 | 50.0
Qwen2.5-VL-72B [49] 33.3 47.0 39.0 80.0 45.3 42.1 65.0 34.0 71.0 74.0 37.0 43.3 42.0 50.2 Qwen3-VL-235B-A22B [52] 61.7 82.5 38.6 36.7 44.0 39.0 38.9 49.0 73.0 82.0 37.8 33.3 48.0 51.1 Intern-S1-mini [62] – – – – – – – – – – – – – 51.6
GeoLens (OURS) 35.0 40.0 37.0 76.5 46.5 45.6 65.0 36.8 72.0 82.0 62.0 51.7 55.0 54.2
表 6:RSHR-Bench 上的详细结果,模型按各类别内的平均性能排名。我们用红色标记最高分。
模型 感知 推理 高级 总体 指标 COL SHP DET OC REL OGD RG OCN RCN 平均 AD FP MRJC MRJCS OSJ 平均 MAD MTFP MOSJ 平均
遥感 VLMs EarthDial [26] 41.0 22.0 21.0 30.0 32.5 30.5 27.1 18.0 31.0 28.1 42.0 30.0 29.5 32.0 52.0 37.1 56.7 60.0 73.5 37.0 GeoChat [4] 32.5 22.0 24.0 29.5 40.0 25.0 22.9 22.5 29.0 25.9 30.0 24.0 25.5 30.0 32.0 28.3 48.3 46.0 62.9 32.1 VHM [38] 25.5 25.0 26.0 26.5 55.0 25.0 22.9 25.0 25.0 25.7 26.0 24.0 26.5 34.0 28.0 27.7 45.0 53.3 46.2 31.7 GeoLLaVA-8K [1] 25.0 24.0 25.0 25.0 25.0 25.0 21.4 25.0 25.0 24.5 24.0 0.0 0.0 34.0 22.0 16.0 25.0 24.7 47.7 23.4
开源 VLMs VILA-HD [63] 40.0 22.0 22.0 37.0 35.5 26.0 21.4 24.5 24.0 28.0 58.0 30.0 55.0 32.0 58.0 46.6 65.0 57.3 57.6 39.1 MiniCPM2 6 [64] 21.5 28.0 30.0 24.0 19.5 29.5 34.3 22.0 29.0 27.4 26.0 30.0 35.0 32.0 30.0 30.6 26.7 23.3 31.1 27.8 InternVL 3.5 8B [65] 21.5 28.0 18.0 21.5 29.0 28.5 30.0 26.5 25.0 25.3 20.0 16.0 29.0 34.0 26.0 25.0 30.0 22.7 40.2 26.2 Phi-3.5-Vision [66] 25.0 24.0 25.0 25.0 23.5 25.0 22.9 25.0 25.0 24.5 24.0 22.0 23.5 30.0 22.0 24.3 28.3 24.7 47.0 26.0 Deepseek-VL [67] 22.5 22.0 21.0 25.0 20.5 26.0 28.6 20.5 22.0 23.1 22.0 28.0 50.0 32.0 20.0 30.4 20.0 23.3 33.3 25.7 InternVL2.5-8B [61] 25.5 22.0 26.0 26.0 22.5 24.5 30.0 22.5 20.0 24.3 26.0 20.0 22.5 34.0 20.0 24.5 25.0 28.7 35.6 25.3 Qwen2.5-VL-7B [49] 29.5 25.0 22.0 28.0 25.0 24.5 24.3 26.5 22.0 25.2 26.0 28.0 25.0 10.0 20.0 21.8 21.7 24.0 10.6 23.1
闭源 VLMs GPT-4o [68] 49.5 23.0 15.0 35.5 30.5 28.0 27.1 22.5 41.0 30.2 68.0 56.0 30.5 32.0 64.0 50.1 70.0 72.0 84.1 44.0 GPT5 [50] 29.0 10.0 23.0 23.0 37.0 24.5 31.4 20.0 23.0 24.5 74.0 58.0 35.0 34.0 66.0 53.4 78.3 73.3 86.4 42.7 GPT-4o-mini [69] 41.5 16.0 29.0 31.5 31.5 32.0 28.6 19.5 32.0 29.1 54.0 54.0 31.5 48.0 54.0 48.3 78.3 68.0 75.0 42.6 Gemini-2.5-pro [58] 55.0 18.0 31.0 40.0 41.5 32.5 45.7 25.0 25.0 34.9 66.0 32.0 41.5 38.0 50.0 45.5 56.7 60.0 57.6 42.1
OURS GeoLens (OURS) 58.5 22.7 27.0 35.0 57.5 33.0 38.6 34.5 39.0 38.4 68.0 46.0 50.0 42.0 62.0 53.6 70.0 61.1 85.4 48.8
主要结果。如表 5、表 6 和表 7 所示,我们在 XLRS-Bench、RSHR-Bench 和 LRS-GRO-eval 上进行了系统评估。我们的方法在 XLRS-Bench 上取得了 54.2% 的平均准确率,达到了最先进性能,并在 RSHR-Bench 上达到了 60.7% 的最佳性能。
10
第 11 页
表 7:LRS-GRO-eval 基准上的结果。
Leaderboard LLM MaxSize Global Region Object Avg
LLaVA-OV-1.5 [70] Qwen3-7B [71] 2304×2304 62.43 36.18 39.92 45.33 IXC-2.5 [72] InternLM2-7B [73] 4096×4096 62.43 40.00 47.32 50.00 InternVL3 [59] InternLM3-8B [74] 3200×3200 71.60 44.58 47.80 53.67 GeoChat [4] Vicuna-1.5-7B [75] 504×504 62.43 36.79 40.72 45.88 Qwen2.5-VL (7B) [49] Qwen2.5-7B [49] 1024×1024 69.39 38.47 43.58 49.62 Qwen2.5-VL (3B) [49] Qwen2.5-3B [49] 1024×1024 59.01 31.91 37.46 42.25 VLM-R3 (w/ tools) [76] Qwen3-7B [71] 512×512 69.72 44.83 37.40 50.17 GeoChat* [4] Vicuna-1.5-7B [75] 504×504 58.78 37.25 42.83 46.09 ZoomEarth [13] Qwen2.5-3B [49] 512×512 63.09 46.11 51.80 53.76
GeoLens (OURS) Qwen2.5-7B [49] 1024×1024 79.0 48.9 57.6 60.7
在 LRS-GRO-eval 上,始终优于现有基线。在新增的细粒度 RSHR-Bench 评估中,GeoLens 获得了 48.8 的最佳总体平均分,在所有对比模型中排名第一,并在 COL 和 OGD 等具有挑战性的感知和推理维度上显示出明显优势。值得注意的是,在 XLRS-Bench 上,拥有 7B 主干网络的模型超越了 Qwen3-VL-235B (51.1%) 和 Qwen2.5-VL-72B (50.2%) 等更大规模的模型。它在 LRS-GRO-eval 上也实现了 SOTA,并在所有报告指标中排名第一。这些结果表明,与没有工具调用或仅使用单一工具的范式相比,多工具调用显著提高了超高分辨率遥感场景中的理解和推理能力,凸显了其在复杂视觉-语言分析中的重要性和未来潜力。
6 结论
在本文中,我们解决了超高分辨率遥感推理中的视觉证据获取挑战。通过对 XLRS-Bench 的初步研究,我们表明单一工具的放大操作对于局部可恢复的证据是有用的,但对于需要全局搜索、多区域比较和结构化空间推理的更难案例仍然不足。为了解决这个问题,我们引入了 GeoMTVR,这是一个 UHR RS 多工具视觉推理数据集,包含交错的推理轨迹、视觉工具调用和返回的视觉观测,涵盖了裁剪与缩放、定位和辅助线操作。我们进一步提出了强化工具注意力学习 (RTAL),将强化优化集中在关键的工具使用决策上,而不是均匀地优化所有生成的 token。基于 GeoMTVR 和 RTAL,我们开发了 GeoLens,这是一种用于 UHR 遥感的 Multi-Tool Visual Reasoning MLLM。GeoLens 在 XLRS-Bench 和 LRS-GRO-eval 上均取得了最先进的性能,优于直接推理和单工具基线,并产生了更有效的工具使用轨迹。这些结果表明,UHR RS 推理不仅受益于更大的模型,还受益于领域特定的交互数据和针对视觉工具使用的定向优化。局限性。我们主要关注光学卫星图像;在 GeoLens 上评估其他传感器模态(例如合成孔径雷达或多光谱图像)对于确保更广泛的应用至关重要。
参考文献
[1] Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, Hongzhen Wang, Wenjing Yang, Bo Du, and Jing Zhang. Geollava-8k: Scaling remote-sensing multimodal large language models to 8k resolution. arXiv preprint arXiv:2505.21375, 2025.
[2] Fengxiang Wang, Hongzhen Wang, Mingshuo Chen, Di Wang, Yulin Wang, Zonghao Guo, Qiang Ma, Long Lan, Wenjing Yang, Jing Zhang, et al. Xlrs-bench: Could your multimodal llms understand extremely large ultra-high-resolution remote sensing imagery? arXiv preprint arXiv:2503.23771, 2025.
[3] Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, and Yang Gao. A benchmark for ultra-high-resolution remote sensing mllms. arXiv preprint arXiv:2512.17319, 2025.
[4] Kartik Kuckreja, Muhammad Sohail Danish, Muzammal Naseer, Abhijit Das, Salman Khan, and Fahad Shahbaz Khan. Geochat: Grounded large vision-language model for remote sensing.
11
第 12 页
在 IEEE/CVF 计算机视觉与模式识别会议论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition)中, 第 27831–27840 页,2024 年。
[5] Wei Zhang, Miaoxin Cai, Tong Zhang, Yin Zhuang, and Xuerui Mao. Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain. IEEE Transactions on Geoscience and Remote Sensing, 2024.
[6] Yuan Hu, Jianlong Yuan, Congcong Wen, Xiaonan Lu, Yu Liu, and Xiang Li. Rsgpt: A remote sensing vision language model and benchmark. ISPRS Journal of Photogrammetry and Remote Sensing, 224:272–286, 2025.
[7] Yang Zhan, Zhitong Xiong, and Yuan Yuan. Skyeyegpt: Unifying remote sensing vision- language tasks via instruction tuning with large language model. ISPRS Journal of Photogram- metry and Remote Sensing, 221:64–77, 2025.
[8] Junwei Luo, Yingying Zhang, Xue Yang, Kang Wu, Qi Zhu, Lei Liang, Jingdong Chen, and Yansheng Li. When large vision-language model meets large remote sensing imagery: Coarse- to-fine text-guided token pruning. arXiv preprint arXiv:2503.07588, 2025.
[9] Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, and Xing Yu. Deepeyes: Incentivizing “thinking with images” via reinforcement learning. arXiv preprint arXiv:2505.14362, 2025.
[10] Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, and Xing Yu. Deepeyesv2: Toward agentic multimodal model. arXiv preprint arXiv:2511.05271, 2025.
[11] H. Shen, K. Zhao, T. Zhao, R. Xu, Z. Zhang, M. Zhu, and J. Yin. Zoomeye: Enhancing multimodal llms with human-like zooming capabilities through tree-based image exploration. In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP), pages 6613–6629, 2025.
[12] C. Wang, Z. Luo, R. Liu, C. Ran, S. Fan, X. Chen, and C. He. Vicot-agent: A vision-interleaved chain-of-thought framework for interpretable multimodal reasoning and scalable remote sensing analysis. arXiv preprint arXiv:2511.20085, 2025.
[13] Ruixun Liu, Bowen Fu, Jiayi Song, Kaiyu Li, Wanchen Li, Lanxuan Xue, Hui Qiao, Weizhan Zhang, Deyu Meng, and Xiangyong Cao. Zoomearth: Active perception for ultra-high-resolution geospatial vision-language tasks. arXiv preprint arXiv:2511.12267, 2025.
[14] Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, et al. Geoeyes: On-demand visual focusing for evidence-grounded understanding of ultra-high-resolution remote sensing imagery. arXiv preprint arXiv:2602.14201, 2026.
[15] Xinhai Hou, Shaoyuan Xu, Manan Biyani, Mayan Li, Jia Liu, Todd C Hollon, and Bryan Wang. Codev: Code with images for faithful visual reasoning via tool-aware policy optimization. arXiv preprint arXiv:2511.19661, 2025.
[16] Lai Wei, Liangbo He, Jun Lan, Lingzhong Dong, Yutong Cai, Siyuan Li, Huijia Zhu, Weiqiang Wang, Linghe Kong, Yue Wang, Zhuosheng Zhang, and Weiran Huang. Zooming without zooming: Region-to-image distillation for fine-grained multimodal perception. arXiv preprint arXiv:2602.11858, 2026.
[17] Yan Ma, Weiyu Zhang, Tianle Li, Linge Du, Xuyang Shen, and Pengfei Liu. What does vision tool-use reinforcement learning really learn? disentangling tool-induced and intrinsic effects for crop-and-zoom. arXiv preprint arXiv:2602.01334, 2026.
[18] Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, and Derek Zhiyuan Cheng. Reinforced attention learning. arXiv preprint arXiv:2602.04884, 2026.
[19] Yushi Hu, Weijia Shi, Xingyu Fu, Dan Roth, Mari Ostendorf, Luke Zettlemoyer, Noah A. Smith, and Ranjay Krishna. Visual sketchpad: Sketching as a visual chain of thought for multimodal language models. In Advances in Neural Information Processing Systems, volume 37, pages 139348–139379, 2024.
12
第 13 页
[20] Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, 等. Grounding dino:结合 Dino 与接地预训练以实现开放集目标检测。arXiv 预印本 arXiv:2303.05499,2023。
[21] W. Ma, S. Sun, T. Yu, R. Wang, Tat-Seng Chua, 和 J. Bian. 借助结构化对象表示,通过蓝图辅助视觉-语言模型进行空间推理,2026。
[22] J. D. Silva, J. Magalhaes, D. Tuia, 和 B. Martins. 用于标注和检索遥感图像的大语言模型,2024。
[23] Dilxat Muhtar, Zhenshi Li, Feng Gu, Xueliang Zhang, 和 Pengfeng Xiao. Lhrs-bot:赋能遥感,利用 VGI 增强的多模态大语言模型。在欧洲计算机视觉会议,页码 440–457。Springer,2024。
[24] Zhenshi Li, Dilxat Muhtar, Feng Gu, Xueliang Zhang, Pengfeng Xiao, Guangjun He, 和 Xiaoxiang Zhu. Lhrs-bot-nova:改进的多模态大语言模型,用于遥感视觉-语言解释。arXiv 预印本 arXiv:2411.09301,2024。
[25] Yan Shu, Bin Ren, Zhitong Xiong, Danda Pani Paudel, Luc Van Gool, Begum Demir, Nicu Sebe, 和 Paolo Rota. Earthmind:利用跨传感器数据,通过统一的多模态 LLM 进行高级地球观测解释。arXiv 预印本 arXiv:2506.01667,2025。
[26] Sagar Soni, Akshay Dudhane, Hiyam Debary, Mustansar Fiaz, Muhammad Akhtar Munir, Muhammad Sohail Danisho, Paolo Fraccaro, Campbell Watson, Levente J. Klein, Salman Khan, 和 Fahad Khan. Earthdial:将多感官地球观测转化为交互式对话。ArXiv,2025。
[27] J. Wang, Y. Zhong, Z. Chen, Z. Zheng, A. Ma, 和 L. Zhang. Earthvl:一种渐进式地球视觉-语言理解和生成框架,2026。
[28] P. Wang, H. Hu, B. Tong, Z. Zhang, F. Yao, Y. Feng, Z. Zhu, H. Chang, W. Diao, Q. Ye, 和 X. Sun. Ringmogpt:用于视觉、语言和接地任务的统一遥感基础模型。IEEE 地球科学与遥感汇刊,63:1–20,2025。
[29] Wei Zhang, Miaoxin Cai, Tong Zhang, Yin Zhuang, Jun Li, 和 Xuerui Mao. Earthmarker:一种用于遥感的视觉提示多模态大语言模型。IEEE 地球科学与遥感汇刊,2024。
[30] Xu Liu 和 Zhouhui Lian. Rsunivlm:一种通过粒度导向 MoE 实现的统一遥感视觉-语言模型。模式识别,179:113717,2026。
[31] Rotem Shalev-Arkushin, Rinon Gal, Amit H. Bermano, 和 Ohad Fried. Imagerag:用于参考引导图像生成的动态图像检索,2025。
[32] Zhenghang Yuan, Zhitong Xiong, Lichao Mou, 和 Xiao Xiang Zhu. Chatearthnet:赋能视觉-语言地理基础模型的全尺度图像-文本数据集。地球系统科学数据讨论,页码 1–24,2024。
[33] Sylvain Lobry, Diego Marcos, James Murray, 和 Devis Tuia. Rsvqa:遥感数据的视觉问答。IEEE 地球科学与遥感汇刊,58(12):8555– 8566,2020。
[34] Xiangtao Zheng, Binqiang Wang, Xingqian Du, 和 Xiaoqiang Lu. 用于遥感视觉问答的相互注意力 inception 网络。IEEE 地球科学与遥感汇刊,60:1–14,2021。
[35] J. Wang, Z. Zheng, Z. Chen, A. Ma, 和 Y. Zhong. Earthvqa:迈向可查询的地球,基于关系推理的遥感视觉问答。在 AAAI 人工智能会议论文集,第 38 卷,页码 5481–5489,2024。
[36] Chao Pang, Jiang Wu, Jiayu Li, Yi Liu, Jiaxing Sun, Weijia Li, Xingxing Weng, Shuai Wang, Litong Feng, Gui-Song Xia, 等. H2rsvlm:迈向有益且诚实的遥感大型视觉语言模型。arXiv 预印本 arXiv:2403.20213,2024。
13
第 14 页
[37] Junwei Luo, Zhen Pang, Yongjun Zhang, Tingzhu Wang, Linlin Wang, Bo Dang, Jiangwei Lao, Jian Wang, Jingdong Chen, Yihua Tan, 等。Skysensegpt:用于遥感视觉-语言理解的细粒度指令微调数据集与模型。arXiv 预印本 arXiv:2406.10100,2024。
[38] Chao Pang, Xingxing Weng, Jiang Wu, Jiayu Li, Yi Liu, Jiaxing Sun, Weijia Li, Shuai Wang, Litong Feng, Gui-Song Xia, 等。Vhm:用于遥感图像分析的通用且诚实的视觉语言模型。在 AAAI 人工智能会议论文集,第 39 卷,第 6381–6388 页,2025。
[39] Xiang Li, Jian Ding, 和 Mohamed Elhoseiny。Vrsbench:用于遥感图像理解的通用视觉-语言基准数据集。arXiv 预印本 arXiv:2406.12384,2024。
[40] Z. Su, P. Xia, H. Guo, Z. Liu, Y. Ma, X. Qu, J. Liu, Y. Li, K. Zeng, Z. Yang, 等。通过图像进行多模态推理:基础、方法与未来前沿。arXiv 预印本 arXiv:2506.23918,2025。
[41] Zeyi Huang, Yuyang Ji, Anirudh Sundara Rajan, Zefan Cai, Wen Xiao, Haohan Wang, Junjie Hu, 和 Yong Jae Lee。Visualtoolagent (vista):用于视觉工具选择的强化学习框架。arXiv 预印本 arXiv:2505.20289,2025。
[42] Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, 和 Jonathan Tremblay。Spacetools:通过双重交互式强化学习实现工具增强的空间推理,2025。
[43] Sunil Kumar, Bowen Zhao, Leo Dirac, 和 Paulina Varshavskaya。在资源约束下强化视觉语言模型使用工具进行详细视觉推理。arXiv 预印本 arXiv:2506.14821,2025。
[44] Miguel Carvalho, Helder Dias, 和 Bruno Martins。Cropvlm:学习缩放以实现细粒度视觉-语言感知。arXiv 预印本 arXiv:2511.19820,2025。
[45] Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, 和 Qing Li。通过动态视觉搜索和缩放实现自适应焦点链推理,以提高高效视觉语言模型的性能。arXiv 预印本 arXiv:2505.15436,2025。
[46] Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, 和 Lewei Lu。Sensenova-mars:通过强化学习赋能多模态代理推理与搜索。arXiv 预印本 arXiv:2512.24330,2025。
[47] Alex Su, Haozhe Wang, Weiming Ren, Fangzhen Lin, 和 Wenhu Chen。Pixel reasoner:通过好奇心驱动的强化学习激励像素空间推理。arXiv 预印本 arXiv:2505.15966,2025。
[48] Junfei Wu, Jian Guan, Kaituo Feng, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, 和 Tieniu Tan。通过交织思考与视觉绘图强化视觉语言模型中的空间推理,2025。
[49] Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, 等。Qwen2.5-vl 技术报告。arXiv 预印本 arXiv:2502.13923,2025。
[50] OpenAI。介绍 GPT-5.4。https://openai.com/zh-Hans-CN/index/introducing-gpt-5-4/,2026。访问日期:2026-05-06。
[51] Anthropic。Claude 4.6 模型系列。技术报告,Anthropic,2026。
[52] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng
14
第 15 页
Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, and Ke Zhu. Qwen3-vl technical report. arXiv preprint arXiv:2511.21631, 2025.
[53] OpenAI. Gpt-5.2: Advancing science and math. https://openai.com/zh-Hans-CN/ index/introducing-gpt-5-2/, 2025. Accessed: 2026-05-06.
[54] Ji Qi, Ming Ding, Weihan Wang, Yushi Bai, Qingsong Lv, Wenyi Hong, Bin Xu, Lei Hou, Juanzi Li, Yuxiao Dong, and Jie Tang. Cogcom: Train large vision-language models diving into details through chain of manipulations. arXiv preprint arXiv:2402.04236, 2024.
[55] DeepSeek-AI. Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024.
[56] DeepSeek-AI. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948, 2025.
[57] Anthropic. Claude 3.7 sonnet. https://www.anthropic.com, 2025. Accessed: 2026-05.
[58] Google DeepMind. Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and agentic capabilities. arXiv preprint arXiv:2507.06261, 2025.
[59] Jinguo Zhu, Weiyun Wang, Zhe Chen, Zhaoyang Liu, Shenglong Ye, Lixin Gu, Yuchen Duan, Hao Tian, Weijie Su, Jie Shao, et al. Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models. arXiv preprint arXiv:2504.10479, 2025.
[60] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, et al. Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution. arXiv preprint arXiv:2409.12191, 2024.
[61] OpenGVLab. Internvl 2.5: Scaling up vision-language models with enhanced visual encoding. https://internvl.github.io, 2024. Technical report.
[62] OpenGVLab. Intern-s1-mini. https://github.com/OpenGVLab, 2024. Lightweight multi- modal model.
[63] Baifeng Shi, Boyi Li, Han Cai, Yao Lu, Sifei Liu, Marco Pavone, Jan Kautz, Song Han, Trevor Darrell, Pavlo Molchanov, and Hongxu Yin. Scaling vision pre-training to 4k resolution, 2025.
[64] Yuan Yao, Tianyu Yu, Ao Zhang, Chongyi Wang, Junbo Cui, Hongji Zhu, Tianchi Cai, Haoyu Li, Weilin Zhao, Zhihui He, et al. Minicpm-v: A gpt-4v level mllm on your phone. arXiv preprint arXiv:2408.01800, 2024.
[65] Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, et al. Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency. arXiv preprint arXiv:2508.18265, 2025.
[66] Microsoft GenAI Team. Phi-3 technical report: A highly capable language model locally on your phone. arXiv preprint arXiv:2404.14219, 2024.
[67] Haoyu Lu, Wen Liu, Bo Zhang, Bingxuan Wang, Kai Dong, Bo Liu, Jingxiang Sun, Tongzheng Ren, Zhuoshu Li, Yaofeng Sun, et al. Deepseek-vl: towards real-world vision-language understanding. arXiv preprint arXiv:2403.05525, 2024.
[68] OpenAI. Hello gpt-4o. https://openai.com/index/hello-gpt-4o, 2024.
[69] OpenAI. Gpt-4o mini: advancing cost-efficient intelligence. https://openai.com/index/ gpt-4o-mini-advancing-cost-efficient-intelligence, 2024.
[70] Xiang An, Yin Xie, Kaicheng Yang, et al. Llava-onevision-1.5: Fully open framework for democratized multimodal training. arXiv preprint arXiv:2509.23661, 2025.
15
第 16 页
[71] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, Chujie Zheng, Dayiheng Liu, Fan Zhou, Fei Huang, Feng Hu, Hao Ge, Haoran Wei, Huan Lin, Jialong Tang, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxi Yang, Jing Zhou, Jingren Zhou, Junyang Lin, Kai Dang, Keqin Bao, Kexin Yang, Le Yu, Lianghao Deng, Mei Li, Mingfeng Xue, Mingze Li, Pei Zhang, Peng Wang, Qin Zhu, Rui Men, Ruize Gao, Shixuan Liu, Shuang Luo, Tianhao Li, Tianyi Tang, Wenbiao Yin, Xingzhang Ren, Xinyu Wang, Xinyu Zhang, Xuancheng Ren, Yang Fan, Yang Su, Yichang Zhang, Yinger Zhang, Yu Wan, Yuqiong Liu, Zekun Wang, Zeyu Cui, Zhenru Zhang, Zhipeng Zhou, and Zihan Qiu。Qwen3 技术报告。arXiv 预印本 arXiv:2505.09388,2025。
[72] Pan Zhang, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Rui Qian, Lin Chen, Qipeng Guo, Haodong Duan, Bin Wang, Linke Ouyang, et al。Internlm-xcomposer-2.5:一种支持长上下文输入和输出的多功能大型视觉语言模型。arXiv 预印本 arXiv:2407.03320,2024。
[73] 上海人工智能实验室。Internlm2 技术报告。https://github.com/InternLM,2023。 开源大型语言模型。
[74] 上海人工智能实验室。Internlm3。https://github.com/InternLM,2024。下一代 InternLM 系列。
[75] Wei-Lin Chiang, Lianmin Zheng, Ying Sheng, et al。Vicuna:一款开源聊天机器人,以 90% 的 ChatGPT 质量惊艳 GPT-4。arXiv 预印本 arXiv:2306.05685,2023。
[76] Chaoya Jiang, Yongrui Heng, Wei Ye, Han Yang, Haiyang Xu, Ming Yan, Ji Zhang, Fei Huang, and Shikun Zhang。Vlm-r3:用于增强多模态思维链的区域识别、推理与细化。arXiv 预印本 arXiv:2505.16192,2025。
[77] Xian Sun, Peijin Wang, Zhiyuan Yan, Feng Xu, Ruiping Wang, Wenhui Diao, Jin Chen, Jihao Li, Yingchao Feng, Tao Xu, et al。Fair1m:高分辨率遥感图像细粒度物体识别的基准数据集。ISPRS 摄影测量与遥感杂志,184:116–130,2022。
[78] Yansheng Li, Linlin Wang, Tingzhu Wang, Xue Yang, Junwei Luo, Qi Wang, Youming Deng, Wenbin Wang, Xian Sun, Haifeng Li, et al。Star:首个大规模卫星图像场景图生成的数据集与基准。IEEE 模式分析与机器智能汇刊,2(5):6,2024。
16
第 17 页
A 附录
A.1 附录概述
本附录补充了 GeoLens 及其数据集 GeoMTVR 的详细信息,这些内容因篇幅限制未包含在正文中。
附录结构如下:
• A.2 节:GeoLens 的更多实现细节。
• A.3 节:GeoLens 的消融研究。
• A.4 节:样本及困难案例的可视化。
• A.5 节:GeoLens 和 GeoMTVR 的潜在社会影响。
A.2 预实验与 GeoLens 的更多细节
附录中的表 8 进一步解释了这一效应。已解决的样本通常依赖于来自单一局部区域的证据,例如识别车辆类型、统计指定港口区域内的物体数量、识别屋顶颜色或确定附近地标之间的相对位置。在这些情况下,主要挑战在于定位相关区域,而一次放大操作通常能提供足够的细节。相比之下,持续失败的样本涉及全局计数、路径规划、土地利用枚举、跨图像对的变更计数或基于空间分散线索的推理。这些任务需要系统的空间覆盖、多区域比较或超出放大能力的异构感知能力。尽管该框架允许最多五次放大调用并在上下文中保留全局图像,但有限的覆盖范围和缺乏结构化探索仍阻止模型收集足够的证据。
表 8:预实验的更多细节。对由单工具放大解决的样本与持续失败的样本进行的定性分析。单次放大在超高分辨率 (UHR) 遥感图像中对于局部证据获取有效,但在处理全局覆盖、多区域比较和结构化空间推理时表现不佳。
组别 代表性任务 关键观察
强化学习训练期间解决的样本
物体分类 车辆类型识别 对目标区域进行单次放大即可揭示判别性视觉细节,例如卡车与公交车的区别。 区域计数 统计指定港口内的船只 相关区域在空间上是局部的,放大后物体变得清晰可分。 属性识别 识别屋顶颜色 放大缓解了全局视图下采样导致的细粒度外观损失。 局部空间关系 推理附近地标间的关系 两个目标均可被一个局部裁剪区域覆盖,使其相对布局直接可见。
持续失败的样本
全局计数 统计城市尺度图像中的车辆 有限的放大调用无法系统地覆盖整个超高分辨率 (UHR) 图像,导致许多目标未被观察到。 路径规划 在远距离点之间寻找路线 全局视图缺乏道路级细节,而局部放大裁剪不足以形成连贯的长距离路径。 土地利用枚举 识别所有土地利用类型 答案依赖于多个异构区域,但有限的局部检查仅覆盖其中一小部分。 跨图像对变更计数 比较图像对中的物体数量 两张图像都需要多次局部检查,使得固定的工具预算不足以进行可靠比较。 复杂推理 从分散线索推断条件 所需证据分布在遥远的区域,且裁剪放大缺乏结构化探索机制。
17
第 18 页
A.2.1 LRS-GRO 和 XLRS-Bench 数据集详情
LRS-GRO。遵循 LRS-VQA [8],LRS-GRO [13] 是从 FAIR1M-1.0 [77]、GLH-Bridge 和 STAR [78] 提供的高分辨率遥感图像中构建的。最终基准测试包含 1,224 张高分辨率图像,平均分辨率约为 5,000×5,000 像素,3,592 个边界框和 13,245 个问题。其中,1,000 个样本配备了详细的逐步思维链(chain-of-thought)注释,并用作 SFT 子集。LRS-GRO 强调主动感知:模型需要决定是否有必要进行区域裁剪,并在问题范围无法从全局视角解决时使用局部视觉证据。
该基准测试定义了 17 个主要问题类别,分为三个层次的空间级别。全局级别(Global level)包括计数、季节、城乡判断和场景类型。区域级别(Region level)包括计数、存在性、状态、视觉特征、功能和类别。对象级别(Object level)包括功能、材质/表面、类别、状态、相对位置、形状/结构和颜色/图案。对于区域级和对象级任务,提供参考边界框以支持监督和评估。这种分层设计使得能够评估模型是否能够将视觉证据获取策略自适应地匹配到问题的空间范围。
XLRS-Bench。XLRS-Bench [2] 用作我们实验中的主要超高分辨率遥感 VQA 基准测试。它评估在极大规模遥感图像上的感知和推理能力。如表 9 所示,该基准测试分为两个 Level-1 类别:感知(Perception)和推理(Reasoning),并进一步分解为 Level-2 和 Level-3 子任务。所有 Level-3 任务均表述为多项选择题 VQA 问题,共涵盖 3,080 个样本。
表 9:XLRS-Bench 的特征。该基准测试用于评估超高分辨率遥感 VQA 中的感知和推理能力。
L1-任务 L2-任务 L3-任务 缩写 注释格式 样本数量 答案类型
总体计数 OC VQA 60 多项选择 (A/B/C/D) 计数 区域计数 RC VQA 100 多项选择 (A/B/C/D)
总体土地利用分类 OLUC VQA 100 多项选择 (A/B/C/D) 场景分类 区域土地利用分类 RLUC VQA 200 多项选择 (A/B/C/D) 感知 对象空间关系 对象空间关系 OSR VQA 500 多项选择 (A/B/C/D)
对象分类 OCC VQA 800 多项选择 (A/B/C/D) 对象属性 对象颜色 OCL VQA 800 多项选择 (A/B/C/D)
对象运动状态 OMS VQA 60 多项选择 (A/B for Yes/No)
路线规划 路线规划 RP VQA 100 多项选择 (A/B/C/D)
异常推理 异常检测与解释 AD VQA 100 多项选择 (A/B/C/D) 推理 环境条件推理 ECR VQA 100 多项选择 (A/B/C/D) 复杂推理 复杂推理计数 CCR VQA 100 多项选择 (A/B/C/D)
时空推理 带变化检测的区域计数 RCCD VQA 60 多项选择 (A/B/C/D)
A.2.2 GeoLens 更多细节
模型架构。GeoLens 基于 Qwen2.5-VL 架构,具体为 Qwen2_5_VLForConditionalGeneration。语言主干包含 28 个 transformer 层,隐藏层大小为 3584,中间层大小为 18944,28 个注意力头,以及 4 个键值头。词汇表大小为 152,064。视觉编码器包含 32 层,隐藏层大小为 1280,16 个注意力头,补丁大小为 14,空间合并大小为 2。视觉特征被投影到 3584 维的语言隐藏空间中。总体而言,GeoLens 遵循标准的 Qwen2.5-VL 多模态设计,将 ViT 风格的视觉编码器与自回归语言模型耦合。
GeoLens 被表述为一个代理式遥感视觉语言模型。给定一张超高分辨率遥感图像和一个问题,模型生成由简要推理、结构化工具调用、视觉观察和最终答案组成的交错轨迹。它可以调用三个工具:crop_and_zoomin(裁剪与放大)、grounding(定位)和 line(画线)。这些工具支持渐进式局部检查、对象级定位和基于辅助线的空间推理。返回的观察结果被附加到上下文中,以便后续推理可以基于新获取的视觉证据进行条件判断。
监督微调阶段。RTAL 阶段从基于 Qwen2.5-VL-7B-Instruct 训练的监督检查点开始。SFT 阶段使用来自三个来源的 13,078 个冷启动多模态指令样本。这些样本提供了多工具推理轨迹,并教导模型工具调用的基本格式、证据解释和最终答案生成。
18
第 19 页
RTAL 阶段。随后,基于 SFT 检查点,使用 RTAL 对 GeoLens 进行优化。该实现基于 verl,使用 8 块 GPU、vLLM rollout 以及 FSDP actor/reference 执行。RTAL 训练数据包含来自 SuperVQA 和 LRS-GRO 的 9,979 个提示,并额外包含一个由 244 个 SuperVQA 样本组成的验证集。表 10 和表 11 分别总结了 SFT 和 RTAL 数据。
表 10: 用于 GeoLens 的 SFT 数据。表 11: 用于 GeoLens 的 RTAL 训练数据。 SFT 阶段使用 13,078 个冷启动多模态指令样本。 来源 样本数 来源 样本数 SuperVQA 清洗/接受的数据 9,211 SuperVQA 8,066 LRS-GRO 基于缩放的开放回答数据 3,479 LRS-GRO 1,913 route_visual_accepted_388 388 总计 9,979 总计 13,078
SFT 训练在语言模型的全微调设置下使用 LLaMA-Factory 执行。视觉塔和多模态投影器被冻结,而语言模型被更新。训练使用 8 块 GPU 配合 DeepSpeed ZeRO-3、bf16 精度、每设备批次大小 1 以及梯度累积 4, resulting in 全局批次大小为 32。学习率设置为 1×10−5,采用余弦调度器且预热比例为 0.1。模型训练 3 个 epoch,截断长度为 32768,最大图像像素为 2,359,296。最终 SFT 运行达到 1224 个优化步骤,训练损失约为 0.1199。表 12 和表 13 列出了主要的 SFT 和 RTAL 超参数。
表 12: GeoLens 的 SFT 训练配置。 表 13: GeoLens 的 RTAL 训练配置。
参数 值 参数 值 初始化 Qwen2.5-VL-7B-Instruct 算法 RTAL with GRPO-style policy optimization 训练框架 LLaMA-Factory 实现 verl 可训练模块 语言模型 Rollout 后端 vLLM 冻结模块 视觉塔和多模态投影器 Actor/reference 执行 FSDP GPU 8 GPUs 8 分布式策略 DeepSpeed ZeRO-3 Rollout 数量 n 8 精度 bf16 训练批次大小 32 每设备批次大小 1 PPO 小批次大小 32 梯度累积 4 Actor PPO 每 GPU 微批次 1 全局批次大小 32 最大提示长度 8192 学习率 1 × 10−5 最大响应长度 1024 调度器 Cosine Actor 学习率 1 × 10−6 预热比例 0.1 KL 损失 禁用 Epochs 3 熵系数 0 截断长度 32768 vLLM 张量并行大小 2 最大图像像素 2,359,296 vLLM GPU 内存利用率 0.6 优化步骤 1224 最大批次化 tokens 16384 最终训练损失 ≈0.1199 保存频率 每 10 步 检查点保留限制 2
RTAL 注意力正则化。在 RTAL 期间,注意力正则化通过注意力 JSD 项应用于与工具动作相关的片段和有效生成的响应 token。工具动作掩码由标记为 Action 的片段及其对应的闭合分隔符构建,旨在针对模型决定调用哪个工具以及如何参数化的区域。响应掩码覆盖有效生成的 token。这种设计将优化集中在高影响力的推理和工具使用区域,同时保留用于答案正确性的标准策略优化目标。
提示设置。RTAL 提示将 GeoLens 框架为能够调用 crop_and_zoomin、grounding 和 line 的遥感视觉推理助手。系统提示要求在工具调用前进行简要推理,坐标归一化在 [0, 1000] 范围内,最终答案位于〈answer〉…〈/answer〉内。用户提示要求模型使用视觉证据解决遥感问题,必要时可选调用工具,同时在初始证据充足时允许直接回答。
19
第 20 页
表14:XLRS-Bench上工具增强SFT的数据消融实验。'Avg.'表示子任务上的平均准确率。
SFT数据 OC RC OLUC RLUC OCC OCL OMS OSR AD ECR RP RCCD CCR Avg.
无工具数据 (SuperRSVQA) 31.7 39.0 37.0 76.0 41.2 38.0 63.3 30.0 72.0 80.0 33.0 45.0 50.0 48.9 ↓+0.7
SuperRSVQA + 缩放工具 31.7 36.0 43.0 73.5 42.5 32.0 60.0 30.0 75.0 79.0 52.0 40.0 50.0 49.6 ↓+0.7
SuperRSVQA + 完整工具数据 31.7 40.0 29.0 74.5 40.1 33.1 66.7 42.0 71.0 81.0 57.0 38.3 50.0 50.3
A.3 GeoLens的消融研究
工具增强SFT的数据消融。为了系统地分析监督微调期间工具相关数据的影响,我们基于SuperRSVQA构建了三种逐步增强的变体,如表14所示。第一种设置仅使用原始SuperRSVQA数据,表示为无工具数据。第二种设置在SuperRSVQA中进一步引入缩放局部裁剪操作,提供单工具主动感知监督。第三种设置使用完整的工具集增强SuperRSVQA,包括渐进式缩放、目标定位和基于辅助线的空间推理。在XLRS-Bench的相同评估协议下,随着工具信息的逐步引入,性能得到提升。缩放数据加强了局部区域感知,有利于细粒度识别和区域推理,而完整的多工具链进一步改进了多步推理和复杂决策。这表明工具增强数据不仅提供了额外的监督,还为学习如何获取和整合视觉证据提供了结构指导。然而,仅靠工具标注在复杂推理场景中的增益仍然有限,这表明需要有效的学习机制来充分利用工具使用数据的潜力。
表15:XLRS-Bench上训练阶段的模块级消融实验。'Avg.'表示子任务上的平均准确率。
训练阶段 OC RC OLUC RLUC OCC OCL OMS OSR AD ECR RP RCCD CCR Avg.
Qwen2.5-VL-7B 33.3 37.0 26.0 71.5 30.8 37.5 66.7 33.8 65.0 69.0 25.0 38.3 50.0 44.9 ↓+6.8
基础模型 + SFT 26.7 36.0 45.0 82.5 44.6 39.2 65.0 32.4 71.0 82.0 55.0 43.3 49.0 51.7 ↓+2.5
基础模型 + SFT + RTAL (GeoLens) 35.0 40.0 37.0 76.5 46.5 45.6 65.0 36.8 72.0 82.0 62.0 51.7 55.0 54.2
训练阶段的模块级消融。为了验证每个训练阶段的贡献,我们比较了表15中的三种设置:Qwen2.5-VL-7B基础模型、监督微调后的模型以及使用SFT和RTAL训练的GeoLens最终模型。引入SFT显著提高了任务对齐和基本视觉理解,表明监督训练为遥感工具使用提供了有效的初始化。在此基础上,RTAL通过优化推理过程中的内部信息路由和工具使用决策,进一步提升了性能。这证实了从基础建模到监督对齐,再到基于强化学习的注意力优化的渐进式训练范式的有效性。
表16:XLRS-Bench上RTAL相对于令牌级RL的有效性。'Avg.'表示子任务上的平均准确率。
RL方法 OC RC OLUC RLUC OCC OCL OMS OSR AD ECR RP RCCD CCR Avg.
基础模型 + SFT + GRPO 31.7 39.0 40.0 79.0 47.6 45.5 65.0 35.6 70.0 82.0 57.0 43.3 45.0 52.4 ↓+1.8
基础模型 + SFT + RTAL (GeoLens) 35.0 40.0 37.0 76.5 46.5 45.6 65.0 36.8 72.0 82.0 62.0 51.7 55.0 54.2
RTAL相对于令牌级RL的有效性。为了进一步验证RTAL,我们在相同的训练数据和初始化条件下,将其与标准的令牌级策略优化方法GRPO进行比较。如表16总结所示,RTAL在整体性能上始终优于令牌级RL。定性案例进一步表明,RTAL在工具调用期间鼓励更清晰、更结构化的推理路径,从而导致更合理的工具选择和参数生成。相比之下,令牌级优化更容易出现冗余调用或不稳定的决策。这些结果表明,优化模型的内部注意力分布比直接优化输出令牌分布能提供更有效的信用分配,从而提升复杂推理任务的性能。
20
第 21 页
A.4 GeoMTVR 样本可视化
图 6:GeoMTVR 样本可视化。该示例展示了 GeoMTVR 中的交错推理轨迹和视觉工具使用。
A.5 潜在的社会影响
潜在的社会积极影响。GeoLens 和 GeoMTVR 旨在提升对超高分辨率遥感影像的视觉证据获取和推理能力。此类能力可支持需要高效检查大面积场景的应用,例如环境监测、城市规划、土地利用分析、灾害评估、基础设施检查和生态观测。与直接的全局图像推理相比,多工具视觉推理范式鼓励模型通过放大、定位和辅助线操作暴露中间证据,这可能使遥感视觉问答系统更具可解释性且更易于审计。GeoMTVR 还可能为研究在极大图像分辨率下的主动视觉推理、工具使用行为以及可靠的多模态决策提供有价值的研究资源。
潜在的社会负面影响。所提出的模型和数据集旨在用于研究和决策支持场景,而非自主的高风险部署。与其他遥感分析系统一样,错误的预测可能源于云层覆盖、季节变化、过时的影像、低质量的标注,或传感器和地理区域之间的分布偏移。因此,在错误可能产生实质性后果的操作环境中,不应将 GeoLens 视为专家审查的替代品。此外,如果缺乏适当的治理或领域约束,对大面积影像的分析改进可能会被误用。因此,我们建议未来的版本包含清晰的预期用途、评估范围、已知限制和责任使用条款的文档。实际部署应保持人在回路中,使用外部证据验证重要输出,并遵循适用的法规及机构审查程序。
21