少即是多:无需架构修改,MLRS凭数据多样性在遥感VLM中登顶

三分钟导读:该论文提出MLRS,通过大规模多任务强化学习(GRTO)和多样化数据训练通用VLM(InternVL),无需修改架构即可在遥感任务中达到SOTA性能,证明数据多样性比架构创新更重要。

英文题目:More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe

论文出处:arXiv 每日论文精选 · arXiv:2607.15942

原始论文:PDF / 论文页面

对应视频标题:少即是多:无需架构修改,MLRS凭数据多样性在遥感VLM中登顶|推荐指数:★★★★★

这篇论文解决什么问题?

现有遥感VLM依赖复杂的专用架构设计(如特定编码器、融合模块),且往往在分布外(OOD)泛化能力上不足,难以统一处理多种输入类型和任务。

核心创新

  • 提出MLRS,无需修改VLM架构,仅通过数据扩展和RL训练实现遥感SOTA性能。
  • 首次将训练好的分割头(SAM3)与强化学习结合,通过GRTO实现端到端优化。
  • 实证研究证明数据多样性(训练源数量)比数据量更能驱动OOD泛化,且存在‘头部效应’(Base性能越低,增益越大)。

方法概览

使用通用VLM(InternVL3.5-8B)作为基础,结合SAM3作为分割工具。采用多任务强化学习框架GRTO(Group Relative Tool Optimization),通过自适应奖励函数(格式有效性+任务特定得分)联合优化VLM策略和SAM3工具,处理VQA、Caption、检测、分割等任务。

逐图理解论文

方法:MLRS与GRTO框架

方法:MLRS与GRTO框架
Fig. 2: A single language policy (InternVL [43]) handles all input types — ultra-high- resolution, multi-modal, multi-view, multi-temporal, visual prompting. The policy rea- sons in text, answers directly, or invokes a SAM3 segmentation tool via a textual prompt; components communicate only through text, with no task-specific encoders or fusion modules. Both components are optimized end-to-end with GRTO [26], using multi-task rewards: embedding similarity for captioning and free-form VQA, box IoU for detection, answer-set IoU for MC-VQA, and mask IoU for segmentation.

我们提出MLRS,以通用VLM InternVL3.5-8B为骨干,结合SAM3作为分割工具。核心创新在于采用多任务强化学习框架GRTO,即组相对工具优化。该框架通过自适应奖励函数,联合优化VLM策略和SAM3工具,处理VQA、Caption、检测和分割等任务,所有组件仅通过文本通信,无需任务专用编码器。

创新点:数据多样性驱动泛化

创新点:数据多样性驱动泛化
Fig. 1: Diverse multi-task training drives out-of-distribution generalization in remote sensing. (a) OOD gain over the base model during multi-task RL training, aggregated per task-domain. For robustness test the training is performed a second time with different seed and paraphrased prompts. (b) Final OOD gain vs. number of training sources per domain; for visualization, detection excludes a x7.6 gain outlier, XLRS- Bench. (c) Training mixture by task and input type; 80k samples balanced from a 2.3M pool.

MLRS的核心贡献在于实证研究。我们发现,训练源的数量,即数据多样性,比单纯的数据量更能驱动OOD泛化。此外,存在显著的“头部效应”:Base模型性能越低,通过多样性训练获得的增益越大。这一发现挑战了传统认为增加数据规模即可线性提升性能的观点。

实验设置:多基准评估

实验设置:多基准评估
Fig. 3: Performance vs training steps. Following metrics are used: aggregated accu- racy for multi-choice VQA, G-Eval for free-form VQA and caption, aggregated IoU for segmentation, Precision@0.5 for GEOBench-VLM detection, and Accuracy@0.5 for XLRS-Bench detection.

我们在多个ID和OOD基准上评估MLRS,包括XLRS-Bench、GEOBench-VLM、LaSeRS和DisasterM3等。实验分析了训练步数、数据规模、模型大小(2B vs 8B)以及随机种子对性能的影响,并对比了GRTO(微调SAM3)与GRPO(冻结SAM3)在分割任务上的表现,以验证工具优化的有效性。

结果:检测与分割性能飞跃

结果:检测与分割性能飞跃
Table 2: Caption, free-form VQA, and detection results. For each baseline, the model size closest to 8B is chosen. If multiple versions of the same baseline are reported, we take the one with the highest performance. If a baseline is fine-tuned on the corre- sponding benchmark, fine-tuned performance is reported and marked with an asterisk (*). Metrics in the [0, 1] range are rescaled to the [0, 100] range. In each column, the best, second-best, and third-best results are highlighted in gold, silver, and bronze, respectively. Zero-shot benchmarks are highlighted in blue.

实验结果显示显著性能提升。在GEOBench-VLM检测任务中,Precision@0.5从0.24提升至0.56;GeoSeg-Bench2分割IoU从0.41提升至0.70。在XLRS-Bench检测准确率从0.054大幅提升至0.409,提升7.6倍;LaSeRS分割IoU从0.31提升至0.67。这些结果证明了MLRS在复杂遥感任务中的强大能力。

结果:OOD泛化优势

结果:OOD泛化优势
Fig. 4: Performance comparisons. (a) Zero-shot performance: percentage difference between MLRS and the best-performing existing baseline for each dataset and task. For every comparison, we report the competing model and the evaluation metric used. (b) GRTO vs. GRPO ablation: IoU percentage difference between MLRS, where SAM3 is fine-tuned (GRTO), and keeping SAM3 frozen (GRPO) for segmentation datasets.

在零样本OOD基准上,MLRS表现优异,在7个OOD基准上排名第一,3个基准排名第二。图4展示了MLRS与现有最佳基线的零样本性能差异,表明其在未见分布上的泛化能力远超依赖专用架构的模型。这进一步验证了数据多样性对提升模型鲁棒性的关键作用。

实验与关键结果

  • 在多个ID和OOD基准上评估,包括XLRS-Bench, GEOBench-VLM, LaSeRS, DisasterM3等。
  • 分析训练步数、数据规模、模型大小(2B vs 8B)、随机种子对性能的影响。
  • 对比GRTO(微调SAM3)与GRPO(冻结SAM3)在分割任务上的表现。
  • 分析不同任务域(如多视角、多时相)的数据多样性与性能增益的相关性。
  • GEOBench-VLM检测Precision@0.5从0.24提升至0.56(第 9 页)
  • GeoSeg-Bench2分割IoU从0.41提升至0.70(第 9 页)
  • XLRS-Bench检测准确率从0.054提升至0.409(提升7.6倍)(第 9 页)
  • LaSeRS分割IoU从0.31提升至0.67(第 9 页)
  • 在7个OOD基准上排名第一,3个基准排名第二(第 11 页)

阅读时需要注意

  • 仅使用InternVL系列模型,未在其他VLM家族中验证趋势。
  • 数据多样性仅用‘训练源数量’粗略衡量,未深入分析嵌入空间内的有效样本多样性。
  • 多时相和多视角任务因数据源单一,性能提升有限甚至过拟合。
  • SAM3的微调可能导致部分OOD基准(如GEOBench-VLM)性能下降,存在过拟合风险。
  • 微调工具模块(如SAM3)需谨慎,可能牺牲零样本泛化能力以换取域内性能。
  • 数据多样性与Base模型性能存在共线性,需结合具体场景解读增益来源。
  • 统计检验受限于任务域数量(仅7个),部分相关性结论为观察性而非确证性。

关联工作

  • SAM3:作为外部定位工具,被MLRS调用以生成像素级掩码。(第 5 页)
  • GRTO:采用的强化学习优化框架,用于联合优化VLM和工具。(第 6 页)
  • InternVL:作为MLRS的基础VLM骨干网络。(第 5 页)
  • GeoChat, SkySenseGPT:作为现有遥感VLM基线,通常依赖专用架构。(第 3 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

少即是多: 一种基于简单配方的大规模遥感视觉语言模型

Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi, Luc Van Gool, 和 Danda Pani Paudel

INSAIT, 索非亚大学“圣克利门特·奥赫里德斯基” stefan.ailuro@insait.ai

(a) 多任务训练期间的分布外 (OOD) 增益 (b) 最终增益与训练数据多样性的关系 (c) 平衡的多任务训练混合比例 (%) 120 运行 AB 检测 140120 多选择 VQA 80k 唯一样本,从 2.3M 原始池中精心挑选 100 模型 80 分割 (%) 10080 分割 自由形式 VQA 超过 多模态 VQA 12 src Caption 12 src 超高分辨率 VQA Multi-modal VQA 60 增益 60 峰值 RGB 然后下降 2026 Caption RGB 0 0 超高分辨率 VQA OOD Multi-view VQA 40 40 多模态 VQA Caption 20 20 增益 平台期 Multi-view VQA 20 20 多模态 VQA Caption 0 0 检测 6 src + 源自分割 饱和 OOD Temporal VQA Jul 0 1k 2k 3k 4k 5k 1 2 4 8 16 0 1k 2k 3k 4k13 src 训练步骤 # 训练标签来源 每 1k 训练步骤的样本

按领域平均的分布外 (OOD) 基准增益。检测排除了 xlrsbench-det,这是一个 ×7.6 的异常增益。 通用 RGB 高分辨率 时间序列 SAR 多视角17

图 1:多样化的多任务训练驱动遥感中的分布外泛化。(a) 多任务强化学习训练期间相对于基础模型的分布外 (OOD) 增益,按任务-领域聚合。为了进行鲁棒性测试,使用不同的种子和改写后的提示词进行了第二次训练。(b) 最终分布外 (OOD) 增益与每个领域的训练来源数量之比;为了可视化,检测排除了 x7.6 的增益异常值,XLRS-[cs.CV] 基准。(c) 按任务和输入类型的训练混合比例;从 2.3M 池中平衡的 80k 样本。

摘要。遥感视觉语言模型 (VLM) 越来越被期望支持对地球观测数据和各种任务的开放式推理。该领域最近的进展主要由遥感特定的架构设计驱动,通常引入新的编码器、对齐模块或特定于任务的融合机制。在本工作中,我们挑战了这种架构专门化的必要性。我们表明,一个通用能力的视觉语言模型 (VLM) 可以在具有挑战性的遥感基准测试中实现具有竞争力或最先进的性能,前提是在多样化的数据和任务上进行足够规模的训练。我们的模型使用单一语言策略,可以直接以文本形式回答,也可以调用定位工具进行分割和接地。为了训练这种异质行为,我们采用了一个多任务强化学习框架,具有自适应任务奖励,涵盖多选择 VQA、自由形式 VQA、标题生成、检测和分割,适用于多种输入类型。我们的方法实现了

第 2 页

2 S.M. Ailuro 等

在包括高分辨率、多时相、多模态和多视角任务在内的广泛基准测试中取得了 具有竞争力的结果。此外,随着训练数据的扩展,我们的实验表明,在分布内和 分布外(OOD)的大多数任务中均取得了持续的性能提升,这与每个任务的数据 多样性相关。这些发现表明,对于遥感 VLM,数据规模比架构新颖性更重要。

关键词:遥感 · 视觉语言模型 · 强化学习

1 引言

遥感正成为大规模理解地球的核心手段。现代卫星、航空和多传感器观测系统 持续捕获关于土地利用、城市化、农业、交通、自然灾害、气候影响和环境变化 的信息。由此产生的图像数据规模庞大、异构且语义丰富:同一场景可能需要图 像级识别、细粒度目标定位、像素级分割、变化推理或开放式问答。随着地球观 察数据的数量和多样性不断增长,遥感越来越需要能够超越狭窄的特定任务预测 的模型,以支持与视觉和地理空间数据的灵活、语言驱动的交互。 因此,视觉语言模型的最新进展推动了一代新的遥感大型多模态模型 [18,30,37,39] 的诞生。这些系统旨在将遥感图像与自然语言指令连接起来,为描述、视觉问答 (VQA)、定位、检测、分割和对话等任务提供统一的接口。该文献中的一个共 同趋势是通过设计新的遥感特定架构、对齐模块、令牌处理策略或模态融合机制 来解决遥感的特殊性 [3,20,23,24,35,37,52,55]。这些工作 collectively 展示了遥感 VLM 的潜力,但也反映了一个主导假设:该领域的进步需要越来越专门的模型设 计。 在本工作中,我们重新审视了这一假设。我们没有引入新的遥感特定架构,而是 从一个通用能力的视觉语言模型出发,通过数据、任务和强化学习(RL)来扩展 其遥感适应能力。我们的核心假设很简单:对于遥感 VLM,广泛的任务覆盖范围 和大规模的训练数据可能比架构新颖性更重要。我们在大量且多样化的遥感数据 集和任务上训练单个模型,包括通过可提示交互与 SAM3 [4] 进行自由形式的视 觉问答、描述、检测、定位和分割。为了处理这些任务的异构性,我们采用了一 种具有自适应每任务奖励的强化学习策略,允许模型在不同的输出格式和评估标 准下优化跨任务性能。

第 3 页

少即是多:一种构建大规模遥感视觉语言模型的简单配方 3

我们的结果表明,这种简单的配方足以在广泛的遥感基准测试中实现具有竞争力或最先进的零样本性能,而无需修改底层 VLM 架构。更重要的是,我们观察到随着训练数据数量和多样性的增加,性能持续提升(见图 1),这表明遥感 VLM 的性能仍然具有强烈的数据可扩展性。这些发现将重点从架构工程转向数据和任务扩展:与其为每种遥感能力或模态设计新模型,不如通过让强大的通用 VLM 接触足够多样的遥感监督信号,并使用任务感知奖励对其进行优化,从而有效地适应它。

我们的贡献总结如下:

– 我们提出了 More with Less Remote Senser (MLRS),这是一种在不引入任何新模型架构的情况下构建的遥感 VLM。尽管其架构简单,但 MLRS 通过大规模多任务强化学习,在广泛的遥感任务和输入类型上实现了具有竞争力或最先进的零样本性能,证明了一个强大的通用 VLM 可以有效地适应遥感领域,以竞争或超越专门的 VLM。 – 我们提供了关于遥感 VLM 数据扩展的经验研究。在训练数据规模、模型规模和优化变体方面,我们发现性能随着数据规模和任务多样性的增加而提高,这表明以数据为中心的扩展是通向通用且强大的遥感视觉语言模型的一条有前景的路径。

2 相关工作

遥感 VLM。将视觉-语言模型适应于遥感已经产生了一个迅速增长的 RS-VLM 家族(见表 1)。早期的指令微调模型,如 GeoChat [18]、SkySenseGPT [23] 和 LHRS-Bot [20, 27],在光学图像上建立了对话式 VQA、图像描述和定位功能,随后的工作沿着两个轴扩展了覆盖范围:任务和输入数据类型。在任务轴上,模型增加了检测和视觉定位 [14, 23]、变化检测 [12, 14, 47] 以及分割 [28, 29, 31, 33, 47, 57]。在输入轴上,针对多时间序列(TEOChat [14], DVLChat [47], EarthDial [37])、多模态输入(EarthGPT [56], EarthDial [37], EarthMind [35], TerraScope [36])、超高分辨率场景(GeoLLaVA-8K [39], LRS-VQA [24], GeoVista [61], GeoPixel [33])和视觉提示(EarthMaker [55], EarthGPT-X [54])提出了专用架构。合并地面视图、街景全景图和卫星图像信息的多视图 VLM 正在单独开发,其根源在于地理定位 [44, 50],直到最近多视图模型才被应用于城市分析和更广泛的推理 [11, 60],使其更接近遥感 VLM。这些工作线的一个共同点是,每种新的输入类型都通过架构专业化来解决——时间编码器、特定模态的分支、用于视觉提示的几何编码器,或

第 4 页

4 S.M. Ailuro 等

表 1:现有 RS-VLM 的能力覆盖范围。UHR=超高分辨率;MM=多模态(光学、近红外、SAR);MT=多时相;VP=视觉提示;VQA=视觉问答;Cap=图像描述;Det=检测;Seg=分割;VG=视觉定位;CD=变化检测;TS=训练好的分割头;RR=强化推理;V=多功能,自动识别任务及所需的答案格式。‘✓’表示分割是在文本空间中以向量多边形形式执行,而非密集掩码。

任务类型 方法 输入类型 模型 VQA Cap Det VG Seg CD TS V RR MT MM UHR VP MV GeoChat [18] ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ SkySenseGPT [23] ✓ ✓ ✓ ✓ ✗ ✗ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ LHRS-Bot-nova [20] ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ SkyEyeGPT [52] ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✓ ✗ ✗ ✗ ✗ TEOChat [14] ✓ ✓ ✓ ✓ ✗ ✓ ✗ ✓ ✗ ✓ ✗ ✗ ✗ ✗ DVLChat [47] ✓ ✓ ✗ ✗ ✓ ✓ ✓ ✗ ✗ ✓ ✗ ✗ ✗ ✗ VHM [30] ✓ ✓ ✓ ✓ ✓ ✗ ✓ ✓ ✗ ✗ ✗ ✗ ✗ ✗ LISAt [31] ✓ ✓ ✗ ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ GeoPix [29] ✓ ✓ ✓ ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ GeoPixel [33] ✗ ✓ ✓ ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ ✓ ✗ ✗ SegEarth-R1 [19] ✗ ✗ ✗ ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ SegEarth-R2 [46] ✗ ✗ ✗ ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ UniGeoSeg [28] ✗ ✗ ✗ ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ Think2Seg-RS [57] ✗ ✗ ✓ ✓ ✓ ✗ ✗ ✗ ✓ ✗ ✗ ✗ ✗ ✗ RemoteReasoner [49] ✓ ✓ ✓ ✓ ✓ ✗ ✗ ✓ ✓ ✗ ✗ ✗ ✗ ✗ RSThinker [21] ✓ ✓ ✓ ✓ ✗ ✗ ✗ ✓ ✓ ✗ ✗ ✗ ✗ ✗ GeoZero [38] ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✓ ✓ ✗ ✗ ✗ ✗ ✗ GeoVLM-R1 [12] ✓ ✓ ✓ ✓ ✗ ✓ ✗ ✓ ✓ ✓ ✗ ✗ ✗ ✗ GeoEyes [40] ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✓ ✓ ✗ ✓ ✗ ✗ GeoVista [61] ✓ ✗ ✗ ✓ ✗ ✗ ✗ ✓ ✓ ✓ ✗ ✓ ✗ ✗ GeoLLaVA-8K [39] ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✓ ✗ ✓ ✗ ✗ LRS-VQA [24] ✓ ✗ ✗ ✓ ✗ ✗ ✗ ✓ ✗ ✗ ✗ ✓ ✗ ✗ UrbanLLaVA [11] ✓ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✗ ✓ EarthGPT [56] ✓ ✓ ✓ ✓ ✗ ✗ ✗ ✓ ✗ ✗ ✓ ✗ ✗ ✗ EarthGPT-X [54] ✓ ✓ ✗ ✗ ✗ ✗ ✗ ✓ ✗ ✗ ✓ ✗ ✓ ✗ EarthMaker [55] ✓ ✓ ✗ ✗ ✗ ✗ ✗ ✓ ✗ ✓ ✓ ✗ ✓ ✗ EarthDial [37] ✓ ✓ ✓ ✓ ✗ ✗ ✗ ✓ ✗ ✓ ✓ ✗ ✗ ✗ EarthMind [35] ✓ ✓ ✗ ✓ ✓ ✓ ✓ ✓ ✗ ✓ ✓ ✗ ✓ ✗ TerraScope [36] ✓ ✗ ✗ ✗ ✓ ✗ ✓ ✗ ✗ ✓ ✓ ✗ ✗ ✗ Falcon [16] ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✗ ✓ ✗ ✗ ✗ ✗ Earth-OneVision [3] ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✗ ✓ ✓ ✗ ✓ ✗ MLRS (Ours) ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓

分辨率处理模块。相比之下,我们表明,在足够多样化的多任务、多领域混合数据上训练的强通用基础模型,无需架构修改即可覆盖时相、多模态、高分辨率和多视角输入。据我们所知,我们的研究涵盖的任务和输入类型的组合比任何先前工作都更广泛。 后训练范式。大多数 RS-VLM 仅使用监督微调进行训练 [14, 18, 20, 23, 37, 47, 56]。然而,经过 SFT 训练的模型往往过度拟合其指令分布,并在保留基准测试中表现下降——这一模式在通用领域 [7] 和遥感领域 [1, 10] 中均被直接观察到。最近一波基于强化学习的 RS-VLM——RS-Thinker [21]、GeoZero [38]、GeoVLM-R1 [12]、RemoteReasoner [49]、Think2Seg-RS [57]、GeoEyes [40] 和 GeoVista [61]——报告了明显更好的泛化能力,我们的评估结果证实了这一点。因此,我们采用强化推理作为我们的后训练策略。 分割接口。RS-VLM 通过两种接口实现分割:以文本形式输出多边形(VHM [30]、Falcon [16]、Earth-OneVision [3])或附加一个训练好的分割头 [6, 17, 32],该头解码密集掩码

第 5 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 5

(DVLChat [47], UniGeoSeg [28], SegEarth [19, 46], LISAt [31], GeoPix [29], GeoPixel [33], EarthMind [35], TerraScope [36])。经过训练的密集掩码头更适合遥感应用,因为遥感中的目标通常较小、数量众多且形状不规则 [2,5,51]。然而,迄今为止,经过训练的分割头与增强的推理能力是互斥的:基于强化学习(RL)的模型要么省略分割功能,要么依赖冻结的掩码解码器 [49, 57]。我们的模型是首个将经过训练的分割头与强化学习相结合的遥感 VLM,通过组相对工具优化(GRTO)[26],同时获得了密集掩码质量和强化学习后训练带来的泛化优势。

3 方法

图 2:单一语言策略(InternVL [43])处理所有输入类型——超高分辨率、多模态、多视图、多时相、视觉提示。该策略通过文本进行推理,直接回答,或通过文本提示调用 SAM3 分割工具;组件之间仅通过文本通信,没有特定于任务的编码器或融合模块。两个组件均使用 GRTO [26] 进行端到端优化,采用多任务奖励:用于图像描述和自由形式 VQA 的嵌入相似度,用于检测的边界框 IoU,用于多项选择 VQA 的答案集 IoU,以及用于分割的掩码 IoU。

数据扩展。我们的核心实验旨在探究是什么推动了多任务遥感训练中的泛化能力。我们构建了一个混合数据集,涵盖了所有多项选择和自由形式的 VQA、图像描述、检测以及分割(接地分割和通用分割)任务,以及所有输入类型。根据设计,支持每个领域的数据源数量和异质性各不相同,从单一数据集(多视图)到十多个数据集(分割、通用 VQA)不等。随后,我们在保持任务组成固定的情况下,随着唯一数据点数量的增加进行大规模训练,并定期在分布内(ID)和分布外(OOD)基准测试上进行评估。这种设计使我们能够衡量收益如何随着训练曝光量的增加而演变,并且关键在于,能否观察每个领域轨迹的形状——是持续改进、停滞还是退化——

第 6 页

6 S.M. Ailuro 等

与其匹配数据的庞大数量或模型的初始性能相比,它与训练来源的多样性更为相关。 少数据多遥感模型(MLRS)。MLRS 是一种工具增强的遥感 VLM,它使用通用视觉语言模型作为中央控制器,并将 SAM 作为外部定位工具。该模型可以处理光学、假彩色、SAR 图像或混合输入。SAR 观测值被表示为灰度图像,从而允许它们通过光学图像相同的视觉接口进行处理。MLRS 还支持多图像(多时相、多视角)输入:当任务提供多张图像时,所有图像都作为上下文展示给 VLM,而空间输出则是相对于主图像生成的。最后,视觉提示直接叠加在主图像上。 给定图像或图像组以及自然语言指令,MLRS 必须决定任务是需要直接的语言响应还是空间预测。对于仅语言任务,如 VQA 和图像描述,它生成文本答案。对于定位任务,它则发出结构化的分割工具调用,该调用使用两个互补信号描述目标区域:名词短语和一个或多个边界框,这些信号被传递给 SAM3 [4],其输出通过传递的边界框进行过滤。通过这种方式,VLM 负责语义接地和粗略的空间定位,而 SAM3 负责生成最终的像素级掩码。这种接口在精神上类似于最近用于指代分割的 VLM-分割解码器系统 [26, 49, 57],但 MLRS 将其用作通用的遥感接口,用于文本回答和空间定位。 这种设计保持了 VLM 架构不变。模型仅通过文本与分割工具通信:它要么直接回答,要么写入一个有效的定位调用,该调用可以解析为 SAM 提示。因此,MLRS 不需要专门的遥感架构或单独的任务路由器。相反,VLM 本身决定是以语言响应还是调用定位工具,从而使得单个模型能够在同一接口中处理图像描述、VQA、检测、接地和分割。 自适应奖励强化学习。为了微调 MLRS,我们采用组相对工具优化(GRTO)[26],其中 VLM 使用组相对策略优化(GRPO)[34] 进行训练,同时对工具 SAM3 应用代理损失,从而实现策略和工具的联合训练。我们结合二元交叉熵和语义 IoU 作为 SAM3 的代理目标,遵循 [26]。 对于 GRPO 策略目标,我们设计了如下形式的自适应任务依赖奖励: R = \lambda_{\mathrm{fmt}}F + \lambda_{\mathrm{task}}S,\label{eq:reward_general} (1)

其中 F 是二元格式有效性项,S 是特定于任务的得分,我们在训练中使用 \lambda_{\mathrm{fmt}} = 0.1 和 \lambda_{\mathrm{task}} = 0.9。格式项鼓励模型使用正确的接口:文本任务必须生成答案响应,而定位任务必须生成有效的分割工具调用。得分项取决于任务。对于多项选择 VQA,我们解析预测的选项集,并计算其与目标选项集的集合 IoU,支持

第 7 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 7

单答案和多答案问题。对于自由形式的视觉问答(VQA)和图像描述,我们使用 Qwen3-Embedding-0.6B [58] 将提取的答案与参考答案进行比较,并将余弦相似度映射到 [0, 1] 区间。对于分割任务,我们将定位调用解析为短语级的 SAM 提示,并使用语义交并比(IoU)对生成的掩码与目标掩码进行评分;如果真值包含多个掩码,当预测掩码数量不匹配时给予零奖励,否则取平均 IoU。对于检测任务,我们解析预测的边界框,在必要时将其转换为图像坐标,贪婪地将其与真值边界框进行匹配,并通过平均匹配边界框的 IoU 进行评分。因此,所有任务使用相同的奖励模板,而正确性指标根据所需输出类型的不同而变化。每个奖励分量的详细定义见附录。框架概览如图 2 所示。

4 实验与结果

4.1 实验设计

基准测试。我们将评估分为分布内(ID)和分布外(OOD)基准测试。ID 基准测试提供训练语料库和保留测试集,以衡量在熟悉领域上的任务学习能力:DisasterM3 [42](双时相光学/SAR 灾害图像;描述、VQA 和分割),DynamicVL [47](长时序多时相城市场景;光学/SAR 图像上的描述、VQA 和分割),SARLANG-1M [45](SAR 描述和自由形式 VQA),EarthReason [19](推理分割),LaSeRS [46](具有不同粒度、多重性、语言变体和推理要求的指代分割),以及 Ni 等人提出的 GeoSeg-1M 的保留测试集 – GeoSeg-Bench [28](光学和假彩色图像上的视觉定位和推理分割)。OOD 基准测试与训练数据共享零图像或标注,旨在衡量跨所有输入类型的泛化能力:XLRS-Bench [41] 探测超高分辨率理解(图像高达 10,000×10,000 像素)、推理和视觉提示;RSHR-Bench [8] 增加了超高分辨率(UHR)多答案视觉问答(MC-VQA),包含经过对抗性过滤的问题,涉及时序推理;VLRS-Bench [25] 针对 UHR 图像上的多步复杂推理、多时相场景的理解和预测,并包含文本和视觉提示;UrBench [60] 评估配对街景和卫星图像上的多视角推理;GEOBench-VLM [9] 涵盖多模态输入(RGB、SAR、多光谱)上的所有五项任务,其变化检测子集还涵盖多时相推理;以及 Jiang 等人提出的 GeoSeg-Bench [15],评估不同难度级别下的推理分割——为避免与 ID 基准测试名称冲突,我们将其称为 GeoSeg-Bench2 或 GeoSeg2。 训练混合。为了研究每域数据多样性如何影响泛化能力,我们组装了一个多任务混合数据集,其域由不同数量的标签源支持:通用 RGB 任务利用 GeoZero 语料库 [38](11 个源用于 MC-VQA,8 个用于描述,6 个用于检测,4 个用于

第 8 页

8 S.M. Ailuro 等

自由形式 VQA)以及用于高分辨率 MC-VQA 的 GeoLLaVA [39];分割任务结合 GeoSeg-1M [28]、LaSeRS [46]、EarthReason [19]、DynamicVL [47] 和 DisasterM3 [42](共 13 个来源);SAR 任务使用 SARLANG-1M [45] 和 DisasterM3;多时相任务仅依赖两个相关来源(DynamicVL、DisasterM3);单源多视图任务则基于单一来源。我们从 CVG-Text [50] 构建多视图指令数据,这是一个由配准的地面全景图和卫星视图组成的跨视图地理定位语料库:全景图描述直接用于图像描述生成;我们确定性生成两种 MC-VQA 题型——基于全景图-卫星图对的城市识别,以及跨视图匹配,其中模型必须从四个卫星视图(包含同城市硬负样本)中选出描绘全景图位置的那一个。收集的训练数据原始池共计 230 万图像-提示-答案对,我们从中筛选出 8 万训练集,并在提供任务领域和题目难度信息的情况下平衡这些数据(见图 1c)。

训练设置。我们在八块 NVIDIA H200 GPU 上进行训练,VLM 的学习率为 1 × 10−6,SAM3 的学习率为 1 × 10−4。我们使用组大小为 8,全局批次大小为 16 个唯一样本,因此每个批次共有 16 × 8 = 128 次 rollout。我们将 GRPO 目标的 KL 散度权重设置为 β = 0.01。对于所有训练,我们使用秩为 64 的低秩自适应(LoRA)[13]。模型被提示进行思考,我们将最大输出长度设置为 1024 个 token。为了平衡多任务梯度,我们在每个批次中保持以下组成比例:25% MC-VQA,25% 图像描述,25% 自由形式 VQA 和检测,25% 分割。

实验。为了研究从通用 VLM 出发时,数据规模如何影响遥感性能,我们使用第 3 节描述的设置训练了多个 MLRS 变体。我们的主要运行使用 InternVL3.5-8B [43] 作为 VLM 骨干网络,并使用 GRTO 训练 5K 步,对应 80K 个唯一样本。为了检查运行间的鲁棒性,我们在相同设置下使用不同的随机种子和改写后的提示模板训练了第二个 8B 模型,训练 3K 步。为了测试观察到的趋势是否依赖于模型规模,我们还使用较小的 InternVL3.5-2B 骨干网络训练了一个 MLRS 变体。我们每隔 1K 步评估一次检查点,从而跟踪随着训练数据量增加的性能变化。最后,为了分离 VLM 和 SAM3 之间数据规模效应的影响,我们额外训练了一个 8B 模型,使用普通的 GRPO 而非 GRTO 训练 5K 步,同时冻结 SAM3。在所有运行中,VLM 被提示进行推理,判断任务是否需要文本响应或定位,并生成相应的输出格式。最终的 MLRS 模型指的是主要 8B GRTO 运行的最后一个检查点。

指标。只要可能,我们使用与相应基准一致的指标评估每个任务,仅在原始协议不足以支持我们的设置时引入替代指标。对于具有自由形式答案的任务,我们使用数据集特定的 LLM-as-judge 评估 [59]。具体而言,对于 DisasterM3 [42]、DynamicVL [47] 以及 SARLANG-1M [45] 的 VQA 划分,我们遵循数据集特定的 GPT 风格评分标准和提示。对于 GEOBench-VLM [9] 的图像描述,我们报告 BERTScore [53],遵循先前的

第 9 页

更少,更多:一种具有简单配方的大规模遥感视觉语言模型 9

工作。对于 SARLANG-1M [45] 和 XLRS-Bench [41] 中的图像描述任务,以往工作依赖于传统的基于参考重叠的 NLP 指标,我们改用 G-Eval [22] 重新评估所有基线模型。G-Eval 是一种结构化的“大语言模型即裁判”(LLM-as-judge)框架,它从下一个 token 的概率分布中推导得分,而非依赖单次采样的评分,并且已被证明比基于参考重叠的指标更好地与人类判断保持一致。我们使用 Qwen2.5-32B-Instruct [48] 作为裁判模型。对于多项选择视觉问答(VQA),我们报告准确率。对于分割任务,我们报告 gIoU,计算方式为每个样本交并比的均值。对于检测任务,我们遵循各自基准协议的规范,在 GEOBench-VLM [9] 上报告 PR@0.5,在 XLRS-Bench [41] 上报告 Acc@0.5。

4.2 结果

分布内基准测试 DisasterM3 DynamicVL SARLANG-1M EarthReason GeoSeg-Bench LaSeRS 运行 A 运行 B 基础模型

多项选择 VQA 自由形式 VQA RGB 图像描述 SAR 图像描述 分割 0.4 0.40 0.32 0.6 0.6 0.35 0.30 0.5 0.3 0.28 0.4 0.30 0.4

0.26 0.3 0.2 0.25 0.2 0.24 性能 0.2 0.20 0.22 0.1 0.1 0.0

0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k

分布外基准测试 GEOBench-VLM XLRS-Bench UrBench VLRS-Bench RSHR-Bench GeoSeg-Bench 2

非时间性 VQA 时间性 VQA RGB 图像描述 检测 分割 0.525 0.50 0.9 0.6 0.500 0.45 0.8 0.5 0.6 0.475 0.40 0.7 0.4 0.450 0.35 0.6 0.3 0.4 性能 0.425 0.30 0.5 0.2 0.2 0.400 0.25 0.4 0.1 0.375 0.20 0.0 0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k 0 1k 2k 3k 4k 5k 训练步数 训练步数 训练步数 训练步数 训练步数

图 3:性能与训练步数的关系。使用的指标如下:多项选择 VQA 的聚合准确率、自由形式 VQA 和图像描述的 G-Eval 评分、分割的聚合 IoU、GEOBench-VLM 检测的 Precision@0.5 以及 XLRS-Bench 检测的 Accuracy@0.5。

扩展训练数据的影响。图 3 报告了两个运行中各基准测试在训练过程中的性能表现。在分布内基准测试上,多任务训练改善了大多数任务族,且在基础模型最弱的任务上获得的绝对提升最大:SAR 图像描述的 G-Eval 得分从 0.09 提升至 0.38,EarthReason 上的指代分割 IoU 从 0.27 提升至 0.68,LaSeRS 上的 gIoU 从 0.31 提升至 0.67。关键在于,这些提升具有分布外泛化能力:在保留的基准测试上,GEOBench-VLM 上的检测精度翻了一倍多(0.24 → 0.56 Pr@0.5),GeoSeg-Bench2 上的分割 IoU 从 0.41 提升至 0.70,GEOBench-VLM 上的分割 IoU 从 0.08 提升至 0.16,且在超高分辨率 XLRS-Bench 上 VQA 准确率从 0.39 提升至 0.51,在 GEOBench-VLM 上从 0.39 提升至 0.50(+28%)。XLRS-Bench 检测性能提升了 7.6 倍(0.054 → 0.409 Acc@0.5)。然而,并非所有领域都同等受益:UrBench 上的多视角 VQA 仅略有改善

第 10 页

10 S.M. Ailuro 等

表 2:Caption、自由形式 VQA 和检测结果。对于每个基线,选择最接近 8B 的模型大小。如果报告了同一基线的多个版本,我们选取性能最高的一个。如果基线在相应基准上进行过微调,则报告微调性能并用星号 (*) 标记。范围在 [0, 1] 的指标被重新缩放至 [0, 100] 范围。在每一列中,最佳、次佳和第三佳的结果分别以金色、银色和青铜色高亮显示。零样本基准以蓝色高亮显示。

Caption Free-form VQA Detection

Method DM3 DVL SL-1M XLRS GEO DM3 DVL SL-1M GEO XLRS

Qwen 3.90* 3.03 3.58 39.21 58.95 3.11* 2.34 73.33* 15.18 15 GPT 2.57 4.36 10.40 47.49 64.18 3.19 2.75 – 0.87 46 GeoChat – – 6.13 3.96 43.95 – – – 11.51 14 EarthDial 1.53 1.215 12.04 11.06 53.78 2.42 1.07 – 24.29 –

Base (InternVL) 1.56 2.49 9.00 44.97 37.89 2.38 0.355 25.40 23.96 5.4 MLRS (InternVL) 1.54 2.80 38.24 45.92 86.88 2.27 0.810 33.20 55.74 40.9

表 3:MC VQA 和分割结果。对于每个基线,选择最接近 8B 的模型大小。如果报告了同一基线的多个版本,我们选取性能最高的一个。如果基线在相应基准上进行过微调,则报告微调性能并用星号 (*) 标记。范围在 [0, 1] 的指标被重新缩放至 [0, 100] 范围。在每一列中,最佳、次佳和第三佳的结果分别以金色、银色和青铜色高亮显示。零样本基准以蓝色高亮显示。

(a) MC VQA (b) Segmentation

Method DM3 DVL RSHR VLRS UR GEO GEO (chdet) XLRS Method EarthReason GeoSeg LaSeRS GeoSeg2 GEO Qwen 40.40* 23.30 23.06 35.90 – 40.0 40.05 47.40 LISA 60.88* 4.93 26.6* 39.5 – InternVL 41.70* 23.90 26.23 – 48.80 33.3 26.23 46.20 PixelLM 60.01* 4.07 29.3* 0.0 – LLaVA-OneVision 24.50 19.30 – – – 41.70 37.03 42.90 PSALM 68.30* 64.95* – – – GeoChat 10.70 – 32.12 33.10 – 30.40 – 22.9 SegEarth-R1 70.75* 66.51* – – – TEOChat 23.00 17.20 – – – – – – EarthDial 22.90 30.30 36.99 – – 37.80 42.00 – UniGeoSeg – 67.75* – – – DVLChat – 33.30* – – – – – – GlaMM – – 43.6* 0.0 14.11 GPT 42.30 34.10 44.04 43.90 61.20 41.10 44.04 38.10 SegEarth-R2 – – 57.2* – – Base (InternVL) 18.60 22.18 34.49 27.36 49.83 39.41 37.89 39.04 Base (InternVL) 27.43 26.2 31.06 41.29 0.08 MLRS (InternVL) 20.65 22.83 29.50 23.00 51.87 50.28 46.20 51.34 MLRS (InternVL) 67.78 47.06 66.93 69.84 15.71

(0.498 →0.519) 并在 3k 步后趋于平稳,而时序 VQA 在前 1k 步内达到峰值,随后性能下降,在 VLRS-Bench (0.274 →0.230) 和 RSHR-Bench (0.345 →0.295) 上最终低于基础模型。OOD 基准上的 Caption 指标保持平稳。最后,两个 8B MLRS GRTO 运行轨迹紧密跟随,表明其具有鲁棒性。 在我们的 2B 主干消融实验中,其 OOD 性能可视化于图 5,趋势保持一致:随着数据规模增加,分割和检测性能持续提升,Caption 性能饱和且保持相对平稳,受限于训练数据多样性的时序 VQA 出现过拟合,而非时序 VQA 总体呈上升趋势。非时序 VQA 中唯一的例外是 XLRSBench。 MLRS 与基线相比。我们在表 2 中展示了 MLRS 与通用及专用 VLM 在 Caption、自由

第 11 页

少而多:具有简单配方的大规模遥感视觉语言模型 11

(b) GRTO 与 GRPO 的消融实验 (a) 零样本性能

图 4:性能比较。(a) 零样本性能:MLRS 与每个数据集和任务中表现最好的现有基线之间的百分比差异。对于每次比较,我们报告了竞争模型和使用的评估指标。(b) GRTO 与 GRPO 的消融实验:在分割数据集中,微调 SAM3(GRTO)与保持 SAM3 冻结(GRPO)的 MLRS 之间的 IoU 百分比差异。

图 5:模型大小消融实验。主要数据规模训练的零样本性能与训练步数的关系,以 InternVL3-2B 为例复现。使用的指标如下:MC VQA 的聚合准确率、自由形式 VQA 和图像描述的 G-Eval、分割的聚合 IoU、GEOBench-VLM 检测的 Precision@0.5 以及 XLRS-Bench 检测的 Accuracy@0.5。

自由形式 VQA 和检测,以及表 3a 和 3b 中的 MC VQA 和分割结果。我们独立于评估曲线选择 MLRS 的检查点:报告的模型是主要训练运行的最终检查点,在所有任务和基准测试中统一进行评估。在图像描述任务中,MLRS 在 GEOBench-VLM 中排名第一,在 XLRS-Bench(两个零样本基准)中排名第二。在分布内(ID)基准中,它在 SARLANG-1M 中排名第一,但在 DisasterM3 和 DynamicVL 中被 GPT 和 Qwen 超越,其中 DisasterM3 使用了 Qwen 的微调版本。在自由形式 VQA 中,MLRS 被规模大得多的 GPT 和 Qwen 的微调版本所超越。在检测任务中(两个数据集均为零样本),MLRS 在 GEOBench-VLM 中排名第一,在 XLRS-Bench 中排名第二,几乎超越了 GPT。在 MC VQA 中,在六个零样本基准中,MLRS 在三个中排名第一,在一个中排名第二,仅在 RSHR 和 VLRS 中未能进入前三。在零样本设置下,它再次被微调基线和 GPT 所超越。最后,在分割任务中,MLRS 在两个零样本基准中均排名第一,在 LaSeRS 中排名第一,在 EarthReason 中排名第三,仅在 GeoSeg 中未能进入前三,且再次仅输给了微调基线。总体而言,MLRS 在 7 个分布外(OOD)基准中排名第一,在 3 个基准中排名第二,仅在 2 个基准中未能进入前三。在分布内(ID)基准中,它倾向于

第 12 页

12 S.M. Ailuro 等

不仅不如参数量大得多的 GPT,也不如仅在相应基准上微调的基线模型。图 4a 比较了 MLRS 的零样本性能与最强基线模型的性能。图 6 展示了 MLRS 在各种任务上的示例输出。 数据规模对解码器的影响。图 4b 比较了保持 SAM3 冻结的普通 GRPO 与在强化学习期间微调 SAM3 的 GRTO 在分割基准上的表现。GRTO 在更多基准上提升了性能,表明适配解码器通常是有益的。然而,冻结解码器的 GRPO 变体在 GEOBench-VLM 零样本基准上表现显著更好,这表明在某些设置下,解码器微调可能会降低泛化能力。由于 GRTO 在大多数分割基准上带来了增益,我们将使用经过 GRTO 训练的模型作为最终的 MLRS 变体。

5 讨论

通过扩展和多样化训练数据迈向最先进的遥感。在具有最多样化数据源的任务上,我们观察到相对于基础模型的改进随数据量的增加而良好扩展,并达到了具有竞争力或最先进的性能。学习轨迹的形状似乎与特定领域可用的训练数据的多样性有关(图 1b):由单一数据源支持的多视角 VQA 在 +4% 处趋于平稳;由仅两个紧密相关数据源支持的时序 VQA 在 1k 步后达到 +16% 的峰值,随后下降至基础模型以下,这与对不再具有泛化能力的狭窄时间分布过拟合一致;由三个或更多异构数据源支持的领域在整个训练过程中持续改进。只有 RGB 图像描述 由于基础模型已达到饱和而趋于平稳——没有提升空间。值得注意的是,当将数据扩展应用于 2B 主干网络时,这些趋势通常不会改变,唯一的例外是 XLRSBench VQA 性能下降。可能 2B 模型本身不足以处理高分辨率图像。总体而言,这表明结果并不依赖于 VLM 的大小。 MLRS:基于通用架构的全能遥感模型。MLRS 模型在大多数基准上取得了第一和第二名的成绩,除了多时间序列基准,这归因于训练数据多样性的缺乏。基线模型仅在专门针对相应基准进行训练时才优于 MLRS,但在 OOD 设置下从未优于 MLRS。唯一的例外是 GPT:一个规模大得多的通用模型。此外,GPT 在其标注过程中被大量使用的基准上表现更优,即 DynamicVL [47]、RSHR-Bench [8]、XLRS-Bench 描述子集 [41];因此,其在这些基准上的性能可能存在偏差。值得注意的是,MLRS 在所有基线中支持最多样化的输入数据类型和任务。 必须谨慎微调使用频率较低的组件。 尽管对 SAM3 进行 GRTO 微调在大多数分割基准上提升了性能,但它也导致 GEOBench-

第 13 页

少中求多:一种具有简单配方的大规模遥感视觉语言模型 13

图 6:MLRS 在五个通用任务上的示例输出:图像描述、目标检测、自由形式视觉问答、图像分割、多项选择视觉问答。对于目标检测,边界框可视化在输入图像上。对于图像分割,使用视觉语言模型的输出提示 SAM3,并将生成的掩码可视化在输入图像上。

第 14 页

14 S.M. Ailuro 等

VLM 零样本基准。这表明在适配特定任务工具时存在潜在的过拟合风险,与 B-GRTO [26] 中提出的担忧一致。与 VLM 不同,VLM 在所有任务中均被使用,因此接收广泛且多样化的监督信号;而 SAM3 仅被调用用于定位任务,并使用训练数据中范围窄得多的子集进行更新。因此,是否应对此类组件进行微调,不仅取决于可用数据的数量,还取决于激活它们的子集的多样性和代表性。 局限性与未来工作。本研究存在若干局限性。首先,我们的扩展实验使用了同一模型家族的骨干网络,因为在多个 VLM 家族上重复大规模训练在计算上成本高昂。评估相同趋势是否适用于其他通用 VLM 是未来工作的重要方向。其次,尽管我们对比了针对遥感设计的代表性 VLM 集合,但在单一受控环境下,架构中心和数据中心的直接比较尚未进行。第三,关于数据组成作用的更强证据需要针对不同数据混合比例进行额外的受控训练运行,但此类实验在此处考虑规模下成本高昂。最后,源数量仅是数据多样性的粗略代理指标。鉴于任务领域的数量有限,且某些领域可能比其他领域拥有更多的改进空间,我们关于多样性的趋势应被视为具有提示性而非结论性。未来工作应更直接地量化域内多样性,例如使用嵌入空间中的有效样本多样性,并测试此类指标是否能预测跨领域观察到的峰值-下降行为。

6 结论

我们的研究结果表明,给定一个强大的通用 VLM,在遥感领域实现具有竞争力的性能并不需要架构上的巧妙设计。MLRS 遵循一种刻意简单的配方:保留强大 VLM 的架构,使其接触广泛的遥感任务和模态混合数据,并训练其决定何时直接回答、何时调用定位工具。尽管简单,它在多样化的基准测试中实现了具有竞争力或最先进的零样本性能,这表明强大的通用 VLM 可以通过大规模多任务训练有效地适配到遥感领域。 更广泛地说,我们的结果表明,数据规模和任务多样性是遥感 VLM 性能的核心驱动因素。随着训练数据的数量和多样性的增加,性能持续提升,这支持了一种以数据为中心、替代日益专业化的架构设计的方案。同时,我们的实验表明,像 SAM3 这样的特定于工具组件应谨慎适配,因为在较窄的子集上对其进行微调可能会以牺牲零样本泛化能力为代价换取域内性能的提升。总体而言,MLRS 指向了一条构建通用遥感 VLM 的实用路径:从强大的

第 15 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 15

通用模型,扩展多样化的遥感监督数据,并使用简单的工具接口将模型扩展至空间任务。

参考文献

1. Ailuro, S.M., Markov, M., Mahdi, M., Boychev, D., Gool, L.V., Paudel, D.P.: Osmda: Openstreetmap-based domain adaptation for remote sensing vlms (2026), https://arxiv.org/abs/2603.11804 4 2. Blushtein-Livnon, R., Rafaeli, O., Ioffe, D., Boger, A., Esquenazi, K.S., Svoray, T.: On the effectiveness of textual prompting with lightweight fine-tuning for sam3 remote sensing segmentation (2026), https://arxiv.org/abs/2512.15564 5 3. Cai, M., Wang, G., Zhang, W., Zhou, G., Zhuang, Y., Zhang, T., Wang, H., Chen, H., Li, J.: Earth-onevision: Extending remote sensing multimodal large language models to more sensor modalities and tasks (2026), https://arxiv.org/abs/ 2606.10819 2, 4 4. Carion, N., Gustafson, L., Hu, Y.T., Debnath, S., Hu, R., Suris, D., Ryali, C., Alwala, K.V., Khedr, H., Huang, A., Lei, J., Ma, T., Guo, B., Kalla, A., Marks, M., Greer, J., Wang, M., Sun, P., Rädle, R., Afouras, T., Mavroudi, E., Xu, K., Wu, T.H., Zhou, Y., Momeni, L., Hazra, R., Ding, S., Vaze, S., Porcher, F., Li, F., Li, S., Kamath, A., Cheng, H.K., Dollár, P., Ravi, N., Saenko, K., Zhang, P., Feichtenhofer, C.: SAM 3: Segment anything with concepts (2025), https: //arxiv.org/abs/2511.16719 2, 6 5. Chen, T., Cao, R., Yu, X., Zhu, L., Ding, C., Ji, D., Chen, C., Zhu, Q., Xu, C., Mao, P., Zang, Y.: SAM3-Adapter: Efficient adaptation of segment anything 3 for cam- ouflage object segmentation, shadow detection, and medical image segmentation (2025), https://arxiv.org/abs/2511.19425 5 6. Cheng, B., Schwing, A.G., Kirillov, A.: Per-pixel classification is not all you need for semantic segmentation. In: NeurIPS (2021) 4 7. Chu, T., Zhai, Y., Yang, J., Tong, S., Xie, S., Schuurmans, D., Le, Q.V., Levine, S., Ma, Y.: SFT memorizes, RL generalizes: A comparative study of foundation model post-training. In: Forty-second International Conference on Machine Learn- ing (2025), https://openreview.net/forum?id=dYur3yabMj 4 8. Dang, Y., Zhu, M., Wang, D., Zhang, Y., Yang, J., Fan, Q., Yang, Y., Li, W., Miao, F., Gao, Y.: A benchmark for ultra-high-resolution remote sensing mllms. arXiv preprint arXiv:2512.17319 (2025) 7, 12, 35 9. Danish, M., Munir, M.A., Shah, S.R.A., Kuckreja, K., Khan, F.S., Fraccaro, P., Lacoste, A., Khan, S.: Geobench-vlm: Benchmarking vision-language models for geospatial tasks. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 7132–7142 (October 2025) 7, 8, 9 10. Doerksen, K., Kerner, H.: Earthshift: a benchmark for measuring robustness to real-world distribution shifts in earth observation (2026), https://arxiv.org/ abs/2605.29330 4 11. Feng, J., Wang, S., Liu, T., Xi, Y., Li, Y.: Urbanllava: A multi-modal large lan- guage model for urban intelligence. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 6209–6219 (October 2025) 3, 4 12. Fiaz, M., Debary, H., Fraccaro, P., Paudel, D., Gool, L.V., Khan, F., Khan, S.: Geovlm-r1: Reinforcement fine-tuning for improved remote sensing reasoning (2025), https://arxiv.org/abs/2509.25026 3, 4

第 16 页

16 S.M. Ailuro 等

13. Hu, E.J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W.: LoRA: 大型语言模型的低秩自适应。在:国际学习表征会议 (2022),https://openreview.net/forum?id= nZeVKeeFYf9 8 14. Irvin, J.A., Liu, E.R., Chen, J.C., Dormoy, I., Kim, J., Khanna, S., Zheng, Z., Er- mon, S.: Teochat: 用于时序地球观测数据的大型视觉语言助手。在:国际学习表征会议 (2025) 3, 4 15. Jiang, L., Pei, Y., oxi Wu, Zhao, Y., Wu, T., Yu, S., Zhang, L., Cai, D.: Geoseg: 遥感图像中无需训练的推理驱动分割 (2026), https://arxiv.org/abs/2603.03983 7 16. kelu, Y., Nuo, X., Rong, Y., Yingying, X., Zhuoyan, G., Titinunt, K., yi, R., Pu, Z., Jin, W., Ning, W., Chao, L.: Falcon: 遥感视觉语言基础模型 (2025) 4 17. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., Dollár, P., Girshick, R.: Segment anything. arXiv:2304.02643 (2023) 4 18. Kuckreja, K., Danish, M.S., Naseer, M., Das, A., Khan, S., Khan, F.S.: Geochat: 面向遥感的接地大型视觉语言模型。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。 pp. 27831–27840 (2024年6月) 2, 3, 4 19. Li, K., Xin, Z., Pang, L., Pang, C., Deng, Y., Yao, J., Xia, G., Meng, D., Wang, Z., Cao, X.: SegEarth-R1: 通过大型语言模型进行地理空间像素推理 (2025)。 https://doi.org/10.48550/arXiv.2504.09644, https://arxiv.org/abs/2504. 09644 4, 5, 7, 8, 28 20. Li, Z., Muhtar, D., Gu, F., He, Y., Zhang, X., Xiao, P., He, G., Zhu, X.: Lhrs- bot-nova: 改进的用于遥感视觉语言解释的多模态大型语言模型。ISPRS 摄影测量与遥感杂志 227, 539–550 (2025年9月)。https://doi.org/10.1016/j.isprsjprs.2025.06.003 2, 3, 4 21. Liu, J., Sun, L., Fu, R., Yang, B.: 迈向遥感的忠实推理: 面向视觉语言模型的感知接地地理空间思维链 (2026),https://arxiv.org/abs/2509.22221 4 22. Liu, Y., Iter, D., Xu, Y., Wang, S., Xu, R., Zhu, C.: G-Eval: 使用 GPT-4 进行具有更好人类对齐度的 NLG 评估。在:Bouamor, H., Pino, J., Bali, K. (编) 2023 年自然语言处理实证方法会议论文集。pp. 2511–2522。计算语言学协会,新加坡 (2023年12月)。https://doi.org/10.18653/v1/2023.emnlp-main.153, https:// aclanthology.org 9 23. Luo, J., Pang, Z., Zhang, Y., Wang, T., Wang, L., Dang, B., Lao, J., Wang, J., Chen, J., Tan, Y., Li, Y.: Skysensegpt: 面向遥感视觉语言理解的细粒度指令微调数据集 和模型。arXiv 预印本 arXiv:2406.10100 (2024)。https://doi.org/10.48550/arXiv.2406.10100 2, 3, 4 24. Luo, J., Zhang, Y., Yang, X., Wu, K., Zhu, Q., Liang, L., Chen, J., Li, Y.: 当大型视觉语言模型遇上大型遥感图像:基于文本引导的由粗到细的 Token 剪枝。在:IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集。pp. 9206–9217 (2025年10月) 2, 3, 4 25. Luo, Z., Wang, D., Wang, H., Guo, H., Zhang, J., Du, B.: Vlrs-bench: 面向遥感的视觉语言推理基准。arXiv 预印本 arXiv:2602.07045 (2026) 7, 36

第 17 页

以少胜多:一种具有简单配方的大规模遥感视觉语言模型 17

26. Markov, M., Ailuro, S.M., Mahdi, M., Van Gool, L., Paudel, D.P.: B-grto: Boot- strapped group relative tool optimization for referring segmentation. arXiv preprint arXiv:2605.23500 (2026). https://doi.org/10.48550/arXiv.2605.23500 5, 6, 14, 26, 27 27. Muhtar, D., Li, Z., Gu, F., Zhang, X., Xiao, P.: Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model. In: Leonardis, A., Ricci, E., Roth, S., Russakovsky, O., Sattler, T., Varol, G. (eds.) Computer Vision – ECCV 2024. pp. 440–457. Springer Nature Switzerland, Cham (2025) 3 28. Ni, S., Wang, D., Chen, H., Guo, H., Zhang, N., Zhang, J.: Unigeoseg: Towards unified open-world segmentation for geospatial scenes (2025), https://arxiv.org/ abs/2511.23332 3, 4, 5, 7, 8, 28, 38 29. Ou, R., Hu, Y., Zhang, F., Chen, J., Liu, Y.: Geopix: A multimodal large language model for pixel-level image understanding in remote sensing. IEEE Geoscience and Remote Sensing Magazine 13(3), 324–337 (2025). https://doi.org/10.1109/ MGRS.2025.3560293 3, 4, 5 30. Pang, C., Weng, X., Wu, J., Li, J., Liu, Y., Sun, J., Li, W., Wang, S., Feng, L., Xia, G.S., He, C.: Vhm: Versatile and honest vision language model for remote sens- ing image analysis. Proceedings of the AAAI Conference on Artificial Intelligence 39(6), 6381–6388 (Apr 2025). https://doi.org/10.1609/aaai.v39i6.32683, https://ojs.aaai.org/index.php/AAAI/article/view/32683 2, 4 31. Quenum, J., Hsieh, W.H., Wu, T.H., Gupta, R., Darrell, T., Chan, D.M.: LISAt: Language-instructed segmentation assistant for satellite imagery. In: The Thirty- ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2026), https://openreview.net/forum?id=X7CxMmmgkb 3, 4, 5 32. Ravi, N., Gabeur, V., Hu, Y.T., Hu, R., Ryali, C., Ma, T., Khedr, H., Rädle, R., Rolland, C., Gustafson, L., Mintun, E., Pan, J., Alwala, K.V., Carion, N., Wu, C.Y., Girshick, R., Dollár, P., Feichtenhofer, C.: SAM 2: Segment anything in images and videos. arXiv preprint arXiv:2408.00714 (2024), https://arxiv.org/ abs/2408.00714 4 33. Shabbir, A., Zumri, M., Bennamoun, M., Khan, F.S., Khan, S.: Geopixel: Pixel grounding large multimodal model in remote sensing. arXiv preprint arXiv:2501.13925 (2025) 3, 4, 5 34. Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Zhang, M., Li, Y., Wu, Y., Guo, D.: DeepSeekMath: Pushing the limits of mathematical reasoning in open language models (2024), https://arxiv.org/abs/2402.03300 6 35. Shu, Y., Ren, B., Xiong, Z., Paudel, D.P., Van Gool, L., Demir, B., Sebe, N., Rota, P.: Earthmind: Towards multi-granular and multi-sensor earth observation with large multimodal models. arXiv preprint arXiv:2506.01667 (2025). https: //doi.org/10.48550/arXiv.2506.01667 2, 3, 4, 5 36. Shu, Y., Ren, B., Xiong, Z., Zhu, X.X., Demir, B., Sebe, N., Rota, P.: Terras- cope: Pixel-grounded visual reasoning for earth observation. In: IEEE conference on Computer Vision and Pattern Recognition (2026) 3, 4, 5 37. Soni, S., Dudhane, A., Debary, H., Fiaz, M., Munir, M.A., Danish, M.S., Frac- caro, P., Watson, C.D., Klein, L.J., Khan, F.S., Khan, S.: Earthdial: Turning multi-sensory earth observations to interactive dialogues. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 14303–14313 (June 2025). https://doi.org/10.1109/CVPR52734.2025.01334 2, 3, 4

第 18 页

18 S.M. Ailuro 等

38. Wang, D., Liu, S., Jiang, W., Wang, F., Liu, Y., Qin, X., Luo, Z., Zhou, C., Guo, H., Zhang, J., Du, B., Tao, D., Zhang, L.: Geozero: Incentivizing reasoning from scratch on geospatial scenes (2026), https://arxiv.org/abs/2511.22645 4, 7, 28 39. Wang, F., Chen, M., Li, Y., Wang, D., Wang, H., Guo, Z., Wang, Z., Boqi, S., Lan, L., Wang, Y., Wang, H., Yang, W., Du, B., Zhang, J.: GeoLLaVA-8k: Scaling remote-sensing multimodal large language models to 8k resolution. In: The Thirty- ninth Annual Conference on Neural Information Processing Systems (2026), https: //openreview.net/forum?id=LTgUInLTbP 2, 3, 4, 8, 28 40. Wang, F., Chen, M., Li, Y., Yang, Y., Zhang, Y., Lan, L., Yang, X., Sun, H., Wang, Y., Wang, D., et al.: Geoeyes: On-demand visual focusing for evidence- grounded understanding of ultra-high-resolution remote sensing imagery. arXiv preprint arXiv:2602.14201 (2026) 4 41. Wang, F., Wang, H., Guo, Z., Wang, D., Wang, Y., Chen, M., Ma, Q., Lan, L., Yang, W., Zhang, J., Liu, Z., Sun, M.: Xlrs-bench: Could your multimodal llms understand extremely large ultra-high-resolution remote sensing imagery? In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion (CVPR). pp. 14325–14336 (June 2025) 7, 9, 12, 34 42. Wang, J., Xuan, W., Qi, H., Liu, Z., Liu, K., Wu, Y., Chen, H., Song, J., Xia, J., Zheng, Z., Yokoya, N.: Disasterm3: A remote sensing vision-language dataset for disaster damage assessment and response. In: The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2026), https://openreview.net/forum?id=sQO1ZEQGqX 7, 8, 28 43. Wang, W., Gao, Z., Gu, L., Pu, H., Cui, L., Wei, X., Liu, Z., Jing, L., Ye, S., Shao, J., et al.: Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency. arXiv preprint arXiv:2508.18265 (2025). https://doi. org/10.48550/arXiv/2508.18265, https://arxiv.org/abs/2508.18265 5, 8 44. Wang, Y., Liu, Z., Wang, Z., Hu, H., Liu, P., Rao, Y.: Geovista: Web-augmented agentic visual reasoning for geolocalization (2025), https://arxiv.org/abs/2511. 15705 3 45. Wei, Y., Xiao, A., Ren, Y., Zhu, Y., Chen, H., Xia, J., Yokoya, N.: Sarlang- 1m: A benchmark for vision–language modeling in sar image understanding. IEEE Transactions on Geoscience and Remote Sensing 64, 1–20 (2026). https: //doi.org/10.1109/TGRS.2026.3652099 7, 8, 9, 28 46. Xin, Z., Li, K., Chen, L., Li, W., Xiao, Y., Qiao, H., Zhang, W., Meng, D., Cao, X.: Segearth-r2: Towards comprehensive language-guided segmentation for remote sensing images (2025), https://arxiv.org/abs/2512.20013 4, 5, 7, 8, 28, 37 47. Xuan, W., Wang, J., Qi, H., Chen, Z., Zheng, Z., Zhong, Y., Xia, J., Yokoya, N.: DynamicVL: Benchmarking multimodal large language models for dynamic city understanding. In: The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2026), https://openreview. net/forum?id=zubCrOvUZ4 3, 4, 5, 7, 8, 12, 28 48. Yang, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Li, C., Liu, D., Huang, F., Wei, H., Lin, H., Yang, J., Tu, J., Zhang, J., Yang, J., Yang, J., Zhou, J., Lin, J., Dang, K., Lu, K., Bao, K., Yang, K., Yu, L., Li, M., Xue, M., Zhang, P., Zhu, Q., Men, R., Lin, R., Li, T., Xia, T., Ren, X., Ren, X., Fan, Y., Su, Y., Zhang, Y., Wan, Y., Liu, Y., Cui, Z., Zhang, Z., Qiu, Z.: Qwen2.5 technical report. arXiv preprint arXiv:2412.15115 (2024) 9 49. Yao, L., Liu, F., Lu, H., Zhang, C., Min, R., Xu, S., Di, S., Peng, P.: Remoterea- soner: Towards unifying geospatial reasoning workflow. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 40, pp. 11883–11891 (2026) 4, 5, 6

第 19 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 19

50. Ye, J., Lin, H., Ou, L., Chen, D., Wang, Z., Zhu, Q., He, C., Li, W.: Where am i? cross-view geo-localization with natural language descriptions (2025), https: //arxiv.org/abs/2412.17007 3, 8, 28 51. Yuan, Z., Mou, L., Hua, Y., Zhu, X.X.: Rrsis: Referring remote sensing image segmentation (2024), https://arxiv.org/abs/2306.08625 5 52. Zhan, Y., Xiong, Z., Yuan, Y.: Skyeyegpt: Unifying remote sensing vision-language tasks via instruction tuning with large language model. ISPRS Journal of Pho- togrammetry and Remote Sensing 221, 64–77 (2025). https://doi.org/https: //doi.org/10.1016/j.isprsjprs.2025.01.020, https://www.sciencedirect. com/science/article/pii/S0924271625000206 2, 4 53. Zhang*, T., Kishore*, V., Wu*, F., Weinberger, K.Q., Artzi, Y.: Bertscore: Eval- uating text generation with bert. In: International Conference on Learning Repre- sentations (2020), https://openreview.net/forum?id=SkeHuCVFDr 8 54. Zhang, W., Cai, M., Ning, Y., Zhang, T., Zhuang, Y., Lu, S., Chen, H., Li, J., Mao, X.: Earthgpt-x: A spatial mllm for multilevel multisource remote sensing imagery understanding with visual prompting. IEEE Transactions on Geoscience and Remote Sensing 63, 1–21 (2025). https://doi.org/10.1109/TGRS.2025. 3626941 3, 4 55. Zhang, W., Cai, M., Zhang, T., Zhuang, Y., Li, J., Mao, X.: Earthmarker: A visual prompting multi-modal large language model for remote sensing. IEEE Transac- tions on Geoscience and Remote Sensing (2024) 2, 3, 4 56. Zhang, W., Cai, M., Zhang, T., Zhuang, Y., Mao, X.: Earthgpt: A universal multi- modal large language model for multisensor image comprehension in remote sensing domain. IEEE Transactions on Geoscience and Remote Sensing 62, 1–20 (2024). https://doi.org/10.1109/TGRS.2024.3409624 3, 4 57. Zhang, X., Ge, J., Zheng, Y., Guo, K., Liang, J.: Bridging semantics and ge- ometry: A decoupled lvlm–sam framework for reasoning segmentation in op- tical remote sensing. ISPRS Journal of Photogrammetry and Remote Sens- ing 237, 217–235 (2026). https://doi.org/https://doi.org/10.1016/j. isprsjprs.2026.04.036, https://www.sciencedirect.com/science/article/ pii/S0924271626002091 3, 4, 5, 6 58. Zhang, Y., Li, M., Long, D., Zhang, X., Lin, H., Yang, B., Xie, P., Yang, A., Liu, D., Lin, J., Huang, F., Zhou, J.: Qwen3 embedding: Advancing text embedding and reranking through foundation models. arXiv preprint arXiv:2506.05176 (2025). https://doi.org/10.48550/arXiv.2506.05176 7, 25 59. Zheng, L., Chiang, W.L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E.P., Zhang, H., Gonzalez, J.E., Stoica, I.: Judging LLM-as-a-judge with MT-bench and chatbot arena. In: Advances in Neural Information Processing Systems. vol. 36, pp. 46595–46623 (2023) 8 60. Zhou, B., Yang, H., Chen, D., Ye, J., Bai, T., Yu, J., Zhang, S., Lin, D., He, C., Li, W.: Urbench: A comprehensive benchmark for evaluating large multimodal models in multi-view urban scenarios. AAAI (2025) 3, 7, 37 61. Zhu, J., Fu, R., Hu, J., et al., X.N.: Geovista: Visually grounded active perception for ultra-high-resolution remote sensing understanding (2026), https://arxiv. org/abs/2605.14475 3, 4

第 20 页

20 S.M. Ailuro 等

A 趋势分析

A.1 设置、指标与协变量

我们分析了三个训练运行:一个训练至 5k 步的 8B 模型,一个使用不同随机种子训练至 3k 步的第二个 8B 运行,以及一个训练至 3k 步的 2B 模型;所有模型每 1k 步在分布外 (OOD) 基准套件上进行评估,该套件分为七个任务领域。除非另有说明,统计信息均在第 3k 步的检查点处计算。

增益指标。基准测试使用异构指标,且几个基础模型的分数接近零,我们的主要度量是归一化增益

ta _{ \De l hrm{norm}}\frac{s_ts_0}{1s_0}, (2) \ m at

即训练恢复的剩余潜力份额;所有指标事先映射到 [0, 1]。绝对增益和对数比率(其中 ε = 0.005)用作敏感性检查,且从未改变任何报告效应的符号。

训练混合协变量。每个 OOD 领域都与具有相同任务类型和模态的训练行相匹配。每个领域衍生出两个协变量:nsmp,每 1k 步的训练样本总数;以及 nsrc,标签的唯一底层来源数量(数据集可能聚合多个来源)。跨任务共享的来源仅计算一次;检测任务还继承了 13 个分割来源,因为模型为两个任务生成边界框(nsrc = 19);并且多模态 VQA 行在来源层面高度重叠(DynamicVL、DisasterM3、SARLANG1、SARLANG2 包含 SAR,GeoSeg-1M 包含假彩色图像),尽管有 16 个名义条目,但仅产生 5 个唯一来源。 resulting 计数为:检测 19,分割 13,RGB 描述 11,多模态 VQA 5,超高分辨率 VQA 3,时序 VQA 2,多视图 VQA 1。我们注意到,nsmp 和 nsrc 仅存在轻微共线性(ρ = 0.39)。

领域并非统计独立:它们共享底层来源,且两个 8B 运行共享初始化。因此,我们对所有单变量秩相关使用置换检验,报告留一领域交叉验证 (LODO) 范围,在所有回归中按领域聚类标准误,并通过在每个领域内对基准×运行观测值进行自助法抽样,获得领域级均值的置信区间。除非另有说明,图 8–10 中的所有视觉误差线均为自助法 95% 置信区间。

我们进一步分析了随机种子、模型大小和基础模型性能的影响。假设为:H2 和 H1 – 行为与种子、模型大小和 nsmp 无关;H3 和 H4 – 来源多样性和基础模型性能影响行为。

A.2 H1:增益并非由采样量驱动

我们发现没有证据表明 nsmp 能预测各领域的增益(图 8,左侧)。在领域层面(n=7),Spearman ρ = 0.14(置换 p = 0.79;自助法 95%

第 21 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 21

图 7:按任务域划分的分布外(OOD)归一化增益轨迹(面板按源数量 nsrc 递减排序)。线条表示各域内基准测试的平均值,带状区域表示基准测试间的最小–最大范围;颜色表示三次运行。三种定性行为清晰可见:在源丰富的域(检测、分割、多模态视觉问答)中持续改善;在源贫乏的域中早期达到峰值随后停滞或下降(时间视觉问答在三次运行中均在 1k–2k 步达到峰值;多视角视觉问答的增益保持在 ≲0.04);以及在基础模型已饱和的域中呈平坦至负向变化(RGB 描述,BERTScore 基础值 ≈0.88)。

CI [−0.21, 0.36]);Pearson r = 0.10 (p = 0.82)。在 A.6 节的多变量模型中,在控制源多样性和基础性能后,log2 nsmp 的系数很小且不显著(每标准差 β = −0.015,p = 0.45),并且在所有敏感性设定中保持非正。

A.3 H2:种子和模型规模不改变行为

种子。在所有 25 个基准测试和任务上成对比较两个 8B 种子(图 10a),在任意共享检查点处得分差异均不显著(在 1k、2k、3k 步时,Wilcoxon 符号秩检验 p 值分别为 0.11、0.43、0.31),且平均绝对种子差异(0.014)仅为平均绝对训练增益(0.10)的 1/7.3。在 3k 步时,各基准测试的归一化增益在种子间几乎相同(Spearman ρ = 0.965,p < 10−6),即不仅增益的大小可复现,增益的模式也可复现。 模型规模。2B 模型在 OOD 套件上复现了与 8B 模型相同的增益结构(图 10b):各基准测试的增益与种子平均的 8B 增益的相关系数为 ρ = 0.77 (p = 0.003)。2B 的增益幅度略小(中位数差异 −0.048,Wilcoxon p = 0.052),这主要由检测和超高分辨率视觉问答驱动(图 7)。轨迹形状分类(持续型与峰值型,见 A.4 节)在 57% 的域中在种子间和规模间达成一致,所有分歧均发生在振幅较低的域中,这些域的分类受噪声限制。

第 22 页

22 S.M. Ailuro 等

图 8:第 3000 步时的域级归一化增益(基准测试 × 3 次运行的均值 ± 自助法 95% 置信区间)与两个训练混合协变量的关系。左侧(H1):对采样量无依赖。右侧(H3):对唯一源数量呈正依赖;可见的离群点是 RGB Caption,其负增益由基模型饱和(图 9)解释,而非缺乏多样性。

我们得出结论,种子(seed)和规模(scale)均不会在定性上改变依赖于混合的行为,因此在本分析的其他部分合并所有三次运行。

A.4 H3:增益和轨迹形状随源多样性增加而增加

整体相关性。第 3k 步时的增益与 nsrc 之间的域级关联为正且中等程度(图 8,右侧):Spearman ρ = 0.54(n=7 时置换检验 p = 0.24;自助法 95% 置信区间 [0.39, 0.64];LODO 范围 [0.31, 0.83])。单变量检验在七个域上功效不足,并且受到基模型饱和的混杂影响:RGB Caption 拥有 11 个源,但由于其基线分数平均已约为 0.67,因此增益为负。在控制基线性能后,偏秩相关系数仍为正(ρ = 0.26),并且在多元模型(第 A.6 节)中,log2 nsrc 具有最大的正标准化系数(β = +0.054 每 SD,p = 0.065;排除检测任务时为 +0.068;在 Huber 稳健回归下为 +0.050)——在我们尝试的每种设定中均一致为正,这表明具有显著性,尽管基线性能竞争了共享方差。将分析限制在两个 8B 运行中以消除任何模型规模效应,加强了这种关联:域级 ρ = 0.61(置换检验 p = 0.17;LODO [0.37, 0.94]),并且多元模型中的源系数变得显著(β = +0.069,p = 0.034)。 轨迹行为。我们使用最小-最大归一化分数对每个域×运行的轨迹进行分类:从峰值下降(峰值减去最终值)和单调性(分数与步数的 Spearman 相关系数)。源匮乏的域表现出故障模式:Temporal VQA(nsrc=2)在第 1/2k 步达到峰值,并在所有三次运行中下降(平均下降 0.42),而 Multi-view VQA(nsrc=1)仅略有改善。对七个域的检验在方向上是一致的,但尚未

第 23 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 23

图 9:第 3000 步时的归一化增益与基础模型得分的关系。小标记:每次运行的各个基准测试(圆形/方形/三角形 = 8B-s1/8B-s2/2B);大菱形:带有自助法 95% 置信区间的领域均值;虚线:基准测试均值的普通最小二乘法 (OLS) 拟合。检测基准测试(接近零的基础得分)和 RGB 图像描述(基础 BERTScore ≈ 0.88)锚定了增益空间的两个极端。

显著性(峰值保留率与源数据量 $n_{\mathrm{src}}$ 的相关性:$\rho = 0.52$,置换检验 $p = 0.24$;持续型与峰值型领域,单侧 Mann–Whitney 检验 $p = 0.57$),这再次受限于 $n=7$ 以及 RGB 图像描述,后者的下降是由饱和驱动的,而非由多样性驱动的。因此,我们将行为类型结果(图 7)呈现为一种定性的、在种子和规模上可复现的观察结果,而非确认性发现。峰值之后时间视觉问答 (VQA) 的下降尚待解释,例如由遗忘效应引起。

A.5 H4:增益随基础模型性能的增加而减少

增益与基础性能呈负相关(图 9):在领域层面,Spearman $\rho = -0.71$(置换检验 $p = 0.088$);在 12 个分布外 (OOD) 基准测试上,$\rho = -0.56$($p = 0.059$);在多变量模型中,$\beta_{\mathrm{base}} = -0.070$ 每标准差($p = 0.065$;排除检测基准时为 $-0.087$,$p = 0.003$;在 Huber 回归下为 $-0.069$)。然而,这种效应并非线性的,它在极端情况下最为明显:RGB 图像描述在基础阶段已饱和(BERTScore ≈ 0.88;所有运行中的增益约为 0 或为负),而检测基准测试从接近零开始,相对提升高达 7.6 倍。保守的解读是,基础模型的增益空间是混合驱动增益的必要条件。

A.6 多变量模型

为了分离三个协变量的影响,我们在基准测试层面(12 个 OOD 基准测试 × 3 次运行,$n = 36$)拟合了以下模型:

$$ \Delta_{\mathrm{norm}}^{(3k)} = \beta_0 + \beta_z\!\left(\log n_{\mathrm{src}}\right) + \beta_z\!\left(\log n_{\mathrm{smp}}\right) + \beta_z\!\left(s_0\right) + \epsilon \label{eq:mv} \quad (3) $$

第 24 页

24 S.M. Ailuro 等

图 10: (a) 种子比较:在步骤 1k–3k 的 25 个基准测试上,8B seed-1 与 seed-2 的得分对比(颜色 = 步骤);点落在恒等线上。(b) 规模比较:在 3k 时各 OOD 基准测试上,2B 与 8B(种子均值)的归一化增益对比(颜色 = 领域,同图 9);该模式得以保留,但 2B 的幅度略有减弱。(c) 多元模型(公式 3)的标准化系数,带有聚类稳健的 95% 置信区间,分别针对完整模型、排除检测基准的情况,以及在 Huber 稳健回归下:在所有设定中,源多样性呈正向贡献,基础性能呈负向贡献,而采样量无贡献。

标准误按领域聚类(7 个领域),其中 $z(\cdot)$ 表示标准化。结果展示于图 10c。仅使用这三个混合/基础协变量,该模型解释了基准级别增益方差的 $R^2 = 0.31$。源多样性和基础性能余量具有可比性但符号相反的权重,而采样量为零——这是假设 H1、H3 和 H4 的量化对应物。由于在我们的混合数据中,$n_{src}$ 和 $s_0$ 本身呈负相关(源丰富的领域恰好具有低分的基础模型),这两个系数共享方差,且在完整模型中各自仅具有边际显著性;然而,它们的符号和幅度在剔除异常值和稳健估计中始终保持稳定。

A.7 异常值处理与局限性

异常值。XLRS-Bench 检测(相对增益高达 ×7.6;2B 基础得分恰好为 0)和 GeoSeg-Bench2(2B 基础得分 0.004)会主导任何基于比率的分析;然而,归一化增益指标 $\Delta_{norm}$ 限制了它们的影响,并且所有结果均在排除检测基准以及采用 Huber 稳健回归的情况下重新检查,未出现符号变化。 主要局限性在于:统计功效——七个任务领域限制了所有领域级别单变量检验的分辨率,特别是行为类型关联应被视为观察性结果;领域之间的源共享依赖性,我们通过聚类误差、置换检验和留一法(LODO)来缓解这一问题;以及在此特定混合数据中,源多样性与基础性能余量之间的共线性,这阻碍了对 H3 和 H4 进行完全清晰的归因——通过固定任务类型并变化 $n_{src}$ 的针对性消融实验可以解决这一问题。最后,多样性需要比注释源数量 $n_{src}$ 更严格的度量。

第 25 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 25

B 详细的多任务奖励

对于每个采样的完成结果,我们分配一个标量奖励,该奖励结合了较小的格式奖励与特定任务的正确性得分:

$$R = \lambda_{\mathrm{fmt}}F + \lambda_{\mathrm{task}}S, \label{eq:reward_general} \quad (4)$$

其中 $F \in \{0, 1\}$ 指示输出是否遵循所需的接口,$S \in [0, 1]$ 是特定任务的得分,我们在训练中使用 $\lambda_{\mathrm{fmt}} = 0.1$ 和 $\lambda_{\mathrm{task}} = 0.9$。

对于多项选择视觉问答(VQA),模型必须使用严格的〈answer〉…〈/answer〉格式进行回答。该奖励支持基于字母的选项(如 A、B 和 C)以及基于文本的选项(如类别名称或真/假标签)。令 $\hat{A}$ 为解析出的预测选项集合,$A$ 为目标答案集合,$\Omega$ 为有效选项集合。仅当答案可被解析且所有预测选项均有效时,格式项才为 1:

$$F^{\mathrm{mc}} = \mathbbm{1}\left\{ \hat{A} \neq \emptyset \;\wedge\; \hat{A} \subseteq \Omega \right\} \label{eq:mc_format} \quad (5)$$

任务得分设定为预测答案集合与目标答案集合之间的交并比(IoU):

$$S^{\mathrm{mc}} = \frac{|\hat{A} \cap A|}{|\hat{A} \cup A|} \quad (6)$$

这同时处理单答案和多答案的多项选择题。

对于自由形式视觉问答(VQA)和图像描述(captioning),模型还必须在〈answer〉…〈/answer〉内生成非空答案。令 $\hat{a}$ 为提取的预测结果,$a$ 为参考文本。格式项为

$$F^{\mathrm{text}} = \mathbbm{1}\left[ \hat{a} \text{ 非空且正确包含在〈answer〉…〈/answer〉中} \right] \label{eq:text_format} \quad (7)$$

当答案有效时,我们使用 Qwen3-Embedding-0.6B [58] 对其进行评分。将预测和参考文本进行嵌入,取最后一个 token 的池化表示,进行 $\ell_2$ 归一化,并计算余弦相似度。我们将余弦得分从 $[-1, 1]$ 映射到 $[0, 1]$:

$$S^{\mathrm{text}} = \phi(\cdot) \quad (8)$$

其中 $\phi(\cdot)$ 表示冻结的 Qwen3-Embedding-0.6B 编码器。这为开放式语言输出提供了密集的语义奖励,而不是依赖于精确的字符串匹配。

对于分割任务,模型必须通过生成有效的 <segmentation>...</segmentation> 调用来调用定位工具,该调用包含一个名词短语以及每种对象类型的边界框列表。语言输出被解析为

第 26 页

短语级提示(phrase-level prompts),这些提示被传递给 SAM 以获取语义掩码。格式项是该工具调用的有效性:

$$ F^{\mathrm{seg}} = \mathbbm{1}\left[\text{the segmentation tool call is valid and yields SAM masks}\right] \label{eq:seg_format} \quad (9) $$

令 $\hat{M} = \{\hat{m}_k\}_{k=1}^P$ 为预测的短语级掩码,$M = \{m_k\}_{k=1}^T$ 为有序的目标掩码。如果工具调用有效且预测掩码的数量与目标掩码的数量匹配,我们计算有序的语义交并比(IoU):

$$ S^{\mathrm{seg}} = \begin{cases} \frac{1}{T} \sum_{k=1}^T \mathrm{IoU}(\hat{m}_k, m_k) & \text{if } P = T \\ 0 & \text{otherwise} \end{cases} \label{eq:seg_score} \quad (10) $$

因此,每个预测的语义掩码都与相同位置的目标掩码进行比较,产生错误数量掩码的补全结果将获得零分割分数。如果任务仅包含一个前景语义掩码,则简化为标准掩码 IoU:

$$ S^{\mathrm{seg}} = \mathrm{IoU}(\hat{m}, m) \label{eq:single_seg_score} \quad (11) $$

对于检测任务,模型使用相同的定位接口,并在 <segmentation>...</segmentation> 内部输出相同的结构化 JSON 对象。仅当 JSON 有效、包含必需的名词短语字段且每个对象都包含有效边界框时,格式项才为 1:

$$ F^{\mathrm{det}} = \mathbbm{1}\left[\text{the output is valid localization JSON with valid boxes}\right] \label{eq:det_format} \quad (12) $$

当预测的边界框以归一化坐标或 Qwen 风格的网格坐标生成时,它们会被转换为图像像素坐标。令 $\hat{B} = \{\hat{b}_p\}_{p=1}^P$ 为预测的边界框,$B = \{b_t\}_{t=1}^T$ 为真实边界框。我们通过 IoU 贪婪地匹配预测边界框和真实边界框,每个边界框最多使用一次,并对预测和目标边界框中数量较多的那个取平均值:

$$ S^{\mathrm{det}} = \frac{1}{\max(P, T)} \sum_{(i,j) \in M} \mathrm{IoU}(\hat{b}_i, b_j) \quad (13) $$

其中 $M$ 是匹配上的预测-目标对集合。在所有任务中,均使用公式 (4) 中的相同奖励形式,而任务特定的分数 $S$ 则根据提示类型而变化。这训练语言策略要么直接用文本回答,要么在需要空间输出时调用定位工具。

C 组相对工具优化 (Group Relative Tool Optimization)

我们使用组相对工具优化(GRTO)[26] 来联合适配语言策略和 SAM3 定位工具。标准的工具使用强化

第 27 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 27

仅更新策略而保持工具固定。相比之下,GRTO 将 VLM 和工具视为一个耦合系统:VLM 学习何时以及如何调用工具,而工具则根据 VLM 产生的有效工具调用进行更新。

令 $\pi_\theta$ 表示语言策略,$\psi_\omega$ 表示参数化工具。两者均从预训练参考模型 $\pi_{\theta_0}$ 和 $\psi_{\omega_0}$ 初始化。目标是优化 KL 正则化目标

$$ J_{\mathrm{KL-RL}}(\theta, \omega) = \mathbb{E}_{o \sim \pi_\theta} [R(o, \psi_\omega)] – \beta D_{\mathrm{KL}}\left(\pi_\theta \,\|\, \pi_{\theta_0}\right) \quad (14) $$

其中 $o$ 是生成的补全,$R$ 是依赖于策略和工具的任务奖励。

对于策略更新,我们使用 GRPO 目标。给定从旧策略 $\pi_{\mathrm{old}}$ 采样的 $G$ 个补全组 $\{o_i\}_{i=1}^G$,我们计算奖励 $\{R_i\}_{i=1}^G$、其组均值 $\mu$ 和标准差 $\sigma$。补全 $o_i$ 的相对优势为

$$ A_i = \frac{R_i – \mu}{\sigma} \quad (15) $$

策略目标为

$$ J_{\mathrm{GRPO}}(\theta, \omega_{\mathrm{old}}) = \frac{1}{G} \sum_{i=1}^{G} \sum_{t=1}^{|o_i|} \min\!\left(r_{i,t} A_i, \mathrm{clip}(r_{i,t}, 1-\epsilon, 1+\epsilon) A_i\right) – \beta D_{\mathrm{KL}}\left(\pi_\theta \,\|\, \pi_{\theta_0}\right) \quad (16) $$

其中

$$ r_{i,t} = \frac{\pi_\theta(o_{i,t} \mid o_{i,<t})}{\pi_{\mathrm{old}}(o_{i,t} \mid o_{i,<t})} \quad (17) $$

公式 (16) 中的奖励是使用当前冻结的工具副本 $\omega_{\mathrm{old}}$ 计算的,因此策略更新遵循通常的截断 GRPO 形式。

对于工具更新,GRTO 重用相同的采样补全。由于任务奖励通常不可微,因此工具通过有效工具调用上的可微代理损失 $\mathcal{L}(\psi_\omega)$ 进行优化。每次 rollout 的贡献由停止梯度的策略似然比加权,从而得到 GRTO 目标

$$ J_{\mathrm{GRTO}}(\theta, \omega) = J_{\mathrm{GRPO}}(\theta, \omega_{\mathrm{old}}) + \frac{1}{G} \sum_{i=1}^{G} \prod_{t=1}^{|o_i|} r'_{i,t} \mathcal{L}_i(\psi_\omega) \quad (18) $$

其中 $r'_{i,t} = \mathrm{stopgrad}(r_{i,t})$。因此,语言策略通过 GRPO 奖励信号进行更新,而 SAM3 工具则通过由策略生成的工具调用引起的监督辅助损失进行更新。

SAM3 辅助损失。我们使用与 B-GRTO [26] 相同的 BCE + soft-IoU 目标对 SAM3 的语义头进行微调。对于每个有效的定位调用,VLM 为 SAM3 生成名词短语和边界框提示。SAM3 语义头预测前景对数掩码 $\hat{M} \in \mathbb{R}^{H \times W}$,该掩码被转换为软概率掩码

$$ S = \mathrm{sigmoid}(\hat{M}) \in [0,1]^{H \times W}. \quad (19) $$

第 28 页

28 S.M. Ailuro 等

令 $M \in \{0, 1\}^{H \times W}$ 为二值真值前景掩码。辅助分割损失为 $$ \mathcal{L}_{\mathrm{sem}} = \mathcal{L}_{\mathrm{BCE}} + \mathcal{L}_{\mathrm{sIoU}}. \label{eq:sam_sem_loss} \quad (20) $$

二元交叉熵项为

$$ \mathcal{L}_{\mathrm{BCE}} = -\frac{1}{HW} \sum_{u=1}^{H}\sum_{v=1}^{W} \left[ M_{uv}\log(S_{uv}) + (1-M_{uv})\log(1-S_{uv}) \right] \label{eq:sam_bce} \quad (21) $$

软交并比项为

$$ \mathcal{L}_{\mathrm{sIoU}} = 1 – \frac{\sum_{u=1}^{H}\sum_{v=1}^{W} S_{uv}M_{uv}}{\sum_{u=1}^{H}\sum_{v=1}^{W} (S_{uv}+M_{uv}-S_{uv}M_{uv})} \label{eq:sam_siou} \quad (22) $$

该损失仅应用于有效的定位 rollout,即生成非空、可解析的 SAM3 提示且包含有效边界框的完成结果。无效的定位调用和纯语言完成结果不对 SAM3 辅助损失产生贡献。在我们的实现中,掩码 logits 在计算损失前由 VLM 提供的边界框进行过滤,确保工具更新在空间上与 VLM 选择的区域相关联。

D 训练数据混合

我们收集了多样化的任务和模态:GeoZero 语料库 [38],包含 Hard 和 Instruct 部分,用于通用 RGB;GeoLLaVA [39] 用于高分辨率;GeoSeg-1M [28]、LaSeRS [46]、EarthReason [19] 用于通用和假彩色分割;DynamicVL [47]、DisasterM3 [42] 用于时序任务;SARLANG-1M [45] 用于 SAR 图像。SARLANG-1M 包含来自两个来源的标题和自由形式 VQA:由预标注边界框生成的文本,以及由共配准 RGB 图像生成的文本——我们将它们分别称为 SARLANG1 和 SARLANG2。我们还从 CVG-Text [50] 构建了多视图指令数据,这是一个共配准地面全景图、地面视图标题和卫星图像的跨视图地理定位语料库:全景标题直接用于标题生成,我们确定性生成两种 MC-VQA 题型——基于全景-卫星对的城市场景识别,以及跨视图匹配,其中模型必须从四个卫星视图(包含同城市硬负样本)中选出描绘全景位置的那一个。收集的原始训练数据总池包含 230 万图像-提示-答案对。我们随机选取 8 万个子集,以确保训练期间所有样本唯一。为了平衡任务和来源,我们使用以下混合比例:

– 多项选择 VQA:GeoLLaVA、GeoZero Hard、GeoZero Instruct、DynamicVL、DisasterM3、由 CVG-text 构建的 VQA —— 各 3333 个样本; – 自由形式 VQA:GeoZero Hard、GeoZero Instruct、SARLANG1、SARLANG2、DynamicVL、DisasterM3 —— 各 2500 个样本; – 标题生成:GeoZero Hard、GeoZero Instruct、SARLANG1、SARLANG2、DynamicVL、DisasterM3、CVG-text —— 各 2857 个样本;

第 29 页

少即是多:一种构建大规模遥感视觉语言模型(RS-VLM)的简单配方 29

– 分割:GeoSeg-1M, LaSeRs, EarthReason, DynamicVL, DisasterM3 – 每个数据集各 4000 个样本; – 检测:GeoZero Hard, GeoZero Instruct – 每个数据集各 2500 个样本。

E 使用的提示词

在训练过程中,我们将特定于数据集的提示词替换为通用的任务模板,以避免人为地夸大模型的性能。具体而言,我们不希望模型利用基准测试特定的措辞作为决定如何回答的捷径。然而,某些数据集包含在多任务设置中变得模糊的提示词。例如,某些定位数据集仅提供目标对象的描述,而未明确指出该对象是应该被分割还是被检测。在这种情况下,我们通过添加任务线索(例如在开头加上“分割…”)来最小化地消除指令的歧义。这反映了预期的部署设置,即用户指定他们希望模型解决的任务,而不是仅提供一个未明确说明的陈述。 主要多模态遥感学习(MLRS)提示词。除了特定于任务的指令外,我们在模型在训练和推理期间看到的每个提示词前都添加了一个默认的系统指令。该指令定义了两个允许的输出模式:用于纯语言任务的文本答案,以及用于定位任务的分割工具调用,以及它们相应的输出格式。在所有设置中使用相同的指令提供了一个稳定的多任务接口,使预期行为明确,并允许强化学习专注于提高任务性能,而不是从头开始发现输出协议。

你正在解决视觉推理任务。 你可以用以下两种最终格式之一进行回复: 1. 如果任务要求分割/定位图像中的对象, 通过输出以下调用来调用分割工具: <segmentation>{"noun phrase": "…", "objects": [{"bbox": [x1, y1, x2, y2]}]}</segmentation> 分割 JSON 必须包含:

  • "noun phrase":恰好一个指代性名词短语,用于标识目标。
  • "objects":对象列表,每个对象包含一个 "bbox" 字段。
  • 坐标应使用 0-999 的图像坐标网格。

如果任务包含多张图像,分割工具使用最后一张 RGB 图像。

2. 如果任务要求文本答案且不需要 分割,则输出: 〈answer〉你的文本答案〈/answer〉

第 30 页

30 S.M. Ailuro 等

在最终标签之前,当推理有用时使用〈think〉…〈/think〉。 不要对分割使用〈answer〉。不要对非分割答案使用<segmentation>。

用于图像描述的 G-Eval 提示词。

你是一位评估卫星图像描述的专家评委。 你的任务是将预测描述(Predicted caption)与真实描述(Ground Truth, GT)进行比较,并根据对象准确性、计数和幻觉情况分配分数。 评估步骤: 1. 分析真实描述中的核心对象和数量。 2. 检查预测中是否存在真实描述中不存在的“虚构对象”(幻觉)。 3. 验证对象数量和空间关系是否与真实描述匹配。 4. 使用下面的评分标准分配 1-5 分的严格分数。

评分标准: 1(严重失败):存在严重幻觉(虚构对象)或场景分类完全错误。 2(差):场景类型正确,但在对象计数或对象属性方面存在严重错误。 3(一般):抓住了主要内容,但存在轻微幻觉或明显的计数错误。 4(好):对象和数量准确,仅有非常微小的语义差异或遗漏了细微细节。 5(完美):对象类型、数量和空间布局完全匹配,且无幻觉。

输入: 真实描述:{gt} 预测描述:{pred} 分数:

我们将真实描述和提供的描述分别插入到 {gt} 和 {pred} 的位置。 用于自由形式视觉问答(VQA)的 G-Eval 提示词。

你是一位评估视觉问答(VQA)输出的专家评委。 你的任务是将给定问题下的预测答案与真实答案(Ground Truth, GT)进行比较,并根据事实正确性、完整性和幻觉情况分配分数。 评估步骤: 1. 分析问题以了解所需的信息。 2. 检查真实答案中的关键事实、数值和约束条件。

第 31 页

少即是多:一种简单配方构建的大规模遥感视觉语言模型 31

3. 检查预测答案是否存在幻觉(即缺乏地面真值支持的信息)。 4. 验证预测答案的正确性、精确性和完整性。 5. 使用以下评分标准给出 1-5 分的严格评分。

评分标准: 1(严重失败):答案错误或存在严重幻觉;未回答问题。 2(差):部分相关但大部分错误;存在重大事实错误或缺失关键要素。 3(一般):捕捉到大致意思,但包含细微错误、歧义或不完整的细节。 4(好):大部分正确且完整;仅有非常细微的不准确或遗漏。 5(完美):与地面真值完全匹配;完全正确、精确,且无幻觉。

输入: 问题:{q} 地面真值答案:{gt} 预测答案:{pred} 评分:

其中我们将问题、地面真值和提供的答案分别替换 {q}、{gt} 和 {pred} 的位置。

F 各子任务结果

多个基准测试在推理和子任务维度上提供了细粒度划分,因此我们报告了基础模型和 MLRS 模型的性能,见表 4、5、6、7、8、9。

G 更多示例输出

图 11 和图 12 提供了 MLRS 输出的更多示例。

第 32 页

32 S.M. Ailuro 等

图 11:MLRS 在五个通用任务中的示例输出:图像描述、目标检测、自由形式 VQA、分割、多项选择 VQA。对于检测任务,边界框可视化于高分辨率输入图像上并进行了放大显示。对于分割任务,使用 VLM 的输出作为提示来调用 SAM3,并将生成的掩码可视化于输入图像上。

第 33 页

少即是多:一种简单配方构建的大规模遥感视觉语言模型 33

图 12:MLRS 在五个通用任务中的示例输出:图像描述、目标检测、自由形式视觉问答、图像分割、多项选择视觉问答。图像描述提示和模型输出已缩短。对于检测任务,边界框可视化在输入图像上。对于分割任务,使用视觉语言模型的输出提示 SAM3,并将生成的掩码可视化在输入图像上。多项选择视觉问答示例以视觉方式提示:目标在高分辨率输入图像中被放大显示。

第 34 页

34 S.M. Ailuro 等

表 4:XLRS-Bench [41] 多模态视觉问答(VQA)。从左到右顺序:OC=总体计数(Overall counting),RC=区域计数(Regional counting),OLUC=总体土地利用分类(Overall Land use classification),RLUC=区域土地利用分类(Regional Land use classification),OCC=物体分类(Object classification),OCL=物体颜色(Object color),OMS=物体运动状态(Object motion state),OSR=物体空间关系(Object spatial relationship),AD=异常检测与解释(Anomaly Detection and Interpretation),ECR=环境条件推理(Environmental condition reasoning),RP=路径规划(Route planning),RCCD=变化检测计数(Counting with changing detection),CCR=复杂推理计数(Counting with complex reasoning)。‘Avg.’表示子任务上的平均准确率。列最大值以粗体显示。

方法 感知 推理

子任务 (L-3) OC RC OLUC RLUC OCC OCL OMS OSR AD ECR RP RCCD CCR Avg.

遥感多模态大语言模型 (Remote Sensing MLLMs) GeoChat 16.7 29.0 2.0 23.0 21.1 16.8 35.0 24.2 33.0 43.0 10.0 – 21.0 22.9

闭源多模态大语言模型 (Closed-source MLLMs) GPT-4o 25.0 32.0 15.0 66.0 9.5 11.3 11.7 24.6 73.0 73.0 35.0 20.0 25.0 32.4 GPT-4o-mini 23.3 25.0 19.0 59.5 40.9 31.0 65.0 23.6 71.0 71.0 29.0 6.7 30.0 38.1 Claude 3.7 Sonnet 27.6 22.7 17.4 68.4 30.5 29.9 63.6 27.6 64.8 78.4 34.5 27.8 32.6 40.5 Gemini 2.0 Flash 41.7 45.0 38.0 73.5 34.6 27.6 61.7 32.0 73.0 82.0 43.0 30.0 51.0 48.7

开源多模态大语言模型 (Open-source MLLMs) InternLM-XComposer-2.5 21.7 42.0 7.0 68.0 31.8 27.8 6.7 26.0 72.0 81.0 41.0 36.7 47.0 39.1 LLaVA-Next 26.7 40.0 5.0 67.0 28.8 32.8 66.7 30.0 69.0 78.0 27.0 35.0 36.0 41.7 LLaVA-OneVision-7B 25.0 38.0 2.0 69.5 35.9 35.3 65.0 25.2 76.0 83.0 24.0 43.3 36.0 42.9 InternVL3-8B 40.0 39.0 10.0 71.5 44.5 30.8 65.0 25.2 77.0 82.0 36.0 21.7 50.0 45.6 Qwen2-VL-7B 26.7 40.0 11.0 73.0 35.9 34.6 61.7 31.8 70.0 81.0 35.0 46.7 48.0 45.8 LLaVA-OneVision-72B 33.3 38.0 15.0 72.5 36.3 36.3 66.7 35.6 74.0 83.0 28.0 36.7 43.0 46.0 InternVL2.5-8B 38.3 37.0 10.0 77.0 33.4 35.5 65.0 21.6 73.0 83.0 34.0 50.0 43.0 46.2 Qwen2.5-VL-7B 33.3 40.0 31.0 77.0 40.6 40.5 66.7 36.2 68.0 72.0 27.0 38.3 45.0 47.4 InternVL3-78B 23.3 49.0 33.0 74.0 42.5 37.4 66.7 30.0 76.0 81.0 40.0 45.0 42.0 49.2 Qwen2.5-VL-72B 33.3 47.0 39.0 80.0 45.3 42.1 65.0 34.0 71.0 74.0 37.0 43.3 42.0 50.2

Base 21.7 20.0 48.0 50.5 30.1 33.1 63.3 23.4 54.0 71.0 38.0 23.3 31.0 39.0 MLRS 38.3 39.0 47.0 78.0 35.8 33.5 66.7 31.8 70.0 80.0 52.0 43.3 52.0 51.3

第 35 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 35

表 5:RSHR-Bench [8] 多选择视觉问答(VQA)。从左到右顺序:感知——COL=颜色检测,SHP=形状识别,DET=检测,OC=物体分类,REL=物体空间关系,OGD=物体定位,RG=区域定位,OCN=物体计数,RCN=区域计数,Avg.=感知平均;推理——AD=异常(单轮),FP=未来预测(多图),MRJC=多区域联合对比(多图),MRJCS=多区域联合对比(单图,多框),OSJ=物体状态判断(单轮),Avg.=推理平均;多轮——MAD=异常,MTFP=未来预测,MOSJ=物体状态判断,Avg.=多轮平均。列最大值以粗体显示。

感知 推理 多轮 模型 平均 平均 平均 COL SHP DET OC REL OGD RG OCN RCN AD FP MRJC MRJCS OSJ MAD MTFP MOSJ

遥感视觉语言模型 EarthDial 41.0 22.0 21.0 30.0 32.5 30.5 27.1 18.0 31.0 28.1 42.0 30.0 29.5 32.0 52.0 37.1 56.7 60.0 73.5 63.4 GeoChat 32.5 22.0 24.0 29.5 40.0 25.0 22.9 22.5 29.0 25.9 30.0 24.0 25.5 30.0 32.0 28.3 48.3 46.0 62.9 52.4 GeoLLaVA-8K 25.0 24.0 25.0 25.0 25.0 25.0 21.4 25.0 25.0 24.5 24.0 0.0 0.0 34.0 22.0 16.0 25.0 24.7 47.7 32.5 VHM 25.5 25.0 26.0 26.5 55.0 25.0 22.9 25.0 25.0 25.7 26.0 24.0 26.5 34.0 28.0 27.7 45.0 53.3 46.2 48.2

开源视觉语言模型 InternVL2.5-8B 25.5 22.0 26.0 26.0 22.5 24.5 30.0 22.5 20.0 24.3 26.0 20.0 22.5 34.0 20.0 24.5 25.0 28.7 35.6 29.8 InternVL3.5-8B 21.5 28.0 18.0 21.5 29.0 28.5 30.0 26.5 25.0 25.3 20.0 16.0 29.0 34.0 26.0 25.0 30.0 22.7 40.2 31.0 MiniCPM2_6 21.5 28.0 30.0 24.0 19.5 29.5 34.3 22.0 29.0 27.4 26.0 30.0 35.0 32.0 30.0 30.6 26.7 23.3 31.1 27.0 Phi-3.5-Vision 25.0 24.0 25.0 25.0 23.5 25.0 22.9 25.0 25.0 24.5 24.0 22.0 23.5 30.0 22.0 24.3 28.3 24.7 47.0 33.3 Qwen2.5-VL-7B 29.5 25.0 22.0 28.0 25.0 24.5 24.3 26.5 22.0 25.2 26.0 28.0 25.0 10.0 20.0 21.8 21.7 24.0 10.6 18.8 Deepseek-VL 22.5 22.0 21.0 25.0 20.5 26.0 28.6 20.5 22.0 23.1 22.0 28.0 50.0 32.0 20.0 30.4 20.0 23.3 33.3 25.5 VILA-HD 40.0 22.0 22.0 37.0 35.5 26.0 21.4 24.5 24.0 28.0 58.0 30.0 55.0 32.0 58.0 46.6 65.0 57.3 57.6 60.0

闭源视觉语言模型 GPT5 29.0 10.0 23.0 23.0 37.0 24.5 31.4 20.0 23.0 24.5 74.0 58.0 35.0 34.0 66.0 53.4 78.3 73.3 86.4 79.3 GPT-4o 49.5 23.0 15.0 35.5 30.5 28.0 27.1 22.5 41.0 30.2 68.0 56.0 30.5 32.0 64.0 50.1 70.0 72.0 84.1 75.4 GPT-4o-mini 41.5 16.0 29.0 31.5 31.5 32.0 28.6 19.5 32.0 29.1 54.0 54.0 31.5 48.0 54.0 48.3 78.3 68.0 75.0 73.8 Gemini-2.5-pro 55.0 18.0 31.0 40.0 41.5 32.5 45.7 25.0 25.0 34.9 66.0 32.0 41.5 38.0 50.0 45.5 56.7 60.0 57.6 58.1

基础模型 50.5 35.0 27.0 36.0 26.0 22.0 22.9 12.0 43.0 30.5 60.0 14.0 10.0 12.0 58.0 30.8 41.3 66.7 50.0 52.7 最佳评估(1k步) 46.5 24.0 27.0 34.0 30.5 37.5 35.7 24.5 41.0 33.5 56.0 24.0 30.0 38.0 48.0 37.0 40.0 66.7 50.0 35.7 MLRS(5k步) 48.0 30.0 9.0 30.5 16.5 24.5 10.0 21.0 38.0 25.3 44.0 10.0 30.0 30.0 38.0 30.4 30.0 55.3 36.7 40.7

第 36 页

36 S.M. Ailuro 等.

表 6:VLRS-Bench [25] 多选择视觉问答(VQA)。从左到右顺序:CR=因果推理(Causal Reasoning),CFR=反事实推理(Counterfactual Reasoning),SIR=语义整合推理(Semantic Integration Reasoning),MIR=机制交互推理(Mechanistic Interaction Reasoning),ST-CFR=时空反事实推理(Spatiotemporal Counterfactual Reasoning),ST-CCR=时空因果链推理(Spatiotemporal Causal-Chain Reasoning),SR-ER=时空演化推理(Spatiotemporal Evolution Reasoning),ST-CR=时空一致性推理(Spatiotemporal Consistency Reasoning),PR=规划推理(Planning Reasoning),ER=评估推理(Evaluation Reasoning),ST-CS-PR=时空类别-状态预测推理(Spatiotemporal Category-State Prediction Reasoning),ST-M-PR=时空形态预测推理(Spatiotemporal Morphological Prediction Reasoning),ST-SU-PR=时空场景不确定性预测推理(Spatiotemporal Scenario Uncertainty Prediction Reasoning),ST-SQ-PR=时空序列预测推理(Spatiotemporal Sequence Prediction Reasoning)。列最大值以粗体显示。

模型 认知 决策 预测 平均分 CR CFR SIR MIR ST-CFR ST-CCR ST-ER ST-CR PR ER ST-CS-PR ST-M-PR ST-SU-PR ST-SQ-PR

通用多模态大语言模型(MLLMs) GPT-5.4 0.412 0.416 0.516 0.516 0.416 0.384 0.436 0.416 0.456 0.484 0.424 0.384 0.400 0.416 0.439 GPT-5-chat 0.424 0.400 0.472 0.316 0.276 0.352 0.380 0.368 0.388 0.388 0.388 0.276 0.280 0.292 0.356 GPT-4o-2024-11-20 0.376 0.432 0.420 0.332 0.360 0.352 0.400 0.364 0.286 0.334 0.416 0.352 0.284 0.340 0.361 GPT-4o-mini 0.428 0.416 0.428 0.328 0.400 0.356 0.352 0.336 0.248 0.304 0.424 0.372 0.280 0.304 0.355 Gemini-3.1-Pro-Preview 0.420 0.448 0.496 0.396 0.476 0.436 0.460 0.456 0.428 0.458 0.400 0.360 0.428 0.432 0.436 Gemini-2.5-flash 0.200 0.188 0.264 0.240 0.188 0.160 0.116 0.160 0.232 0.240 0.164 0.168 0.116 0.152 0.190 Claude-3.5-haiku 0.308 0.316 0.304 0.360 0.192 0.208 0.232 0.200 0.372 0.370 0.208 0.224 0.248 0.168 0.270 Claude-Opus-4.6 0.272 0.264 0.372 0.408 0.452 0.392 0.336 0.300 0.398 0.348 0.264 0.320 0.396 0.340 0.350 Grok-2-vision 0.188 0.216 0.288 0.368 0.232 0.240 0.240 0.280 0.252 0.300 0.220 0.196 0.172 0.148 0.240

Deepseek-vl2 0.372 0.392 0.452 0.344 0.144 0.216 0.200 0.148 0.416 0.446 0.096 0.128 0.064 0.080 0.250 GLM-4.5v 0.268 0.136 0.248 0.312 0.152 0.084 0.084 0.132 0.312 0.340 0.132 0.172 0.180 0.112 0.190 LLama-3.2-11B 0.232 0.228 0.244 0.264 – – – – 0.292 0.286 – – – – 0.110 LLama-3.2-90B 0.368 0.364 0.356 0.308 0.236 0.268 0.300 0.268 0.408 0.430 0.308 0.352 0.268 0.212 0.318 Qwen2.5-VL-7B 0.256 0.172 0.384 0.176 0.224 0.324 0.248 0.216 0.198 0.238 0.328 0.280 0.232 0.212 0.249 Qwen2.5-VL-32B 0.292 0.312 0.368 0.296 0.244 0.300 0.256 0.236 0.370 0.308 0.276 0.284 0.236 0.156 0.281 Qwen2.5-VL-72B 0.216 0.300 0.296 0.392 0.316 0.240 0.216 0.204 0.402 0.370 0.172 0.180 0.204 0.188 0.264 Qwen3-VL-2B 0.350 0.361 0.468 0.185 0.204 0.428 0.412 0.336 0.287 0.260 0.380 0.312 0.304 0.312 0.330 Qwen3-VL-8B 0.341 0.363 0.472 0.211 0.388 0.405 0.398 0.371 0.233 0.275 0.381 0.401 0.401 0.384 0.359 Qwen3-VL-32B 0.372 0.416 0.476 0.316 0.408 0.428 0.388 0.392 0.416 0.364 0.388 0.456 0.336 0.372 0.395

遥感多模态大语言模型(MLLMs) GeoChat 0.280 0.332 0.360 0.308 – – – – 0.352 0.356 – – – – 0.331 VHM 0.302 0.297 0.308 0.210 – – – – 0.324 0.332 – – – – 0.296 ScoreRS w/ SFT 0.403 0.367 0.421 0.345 0.294 0.310 0.288 0.284 0.382 0.419 0.341 0.320 0.313 0.295 0.347 ScoreRS w/ RL 0.313 0.338 0.382 0.295 0.399 0.335 0.367 0.392 0.409 0.371 0.338 0.313 0.382 0.342 0.355

基础模型(Base) 0.300 0.300 0.300 0.316 0.188 0.268 0.196 0.224 0.306 0.300 0.348 0.280 0.268 0.236 0.274 最佳评估(2k步) 0.296 0.268 0.272 0.300 0.196 0.328 0.272 0.312 0.276 0.294 0.336 0.320 0.296 0.260 0.288 MLRS(5k步) 0.248 0.180 0.224 0.240 0.176 0.232 0.236 0.244 0.250 0.250 0.236 0.264 0.252 0.188 0.230

第 37 页

少即是多:一种具有简单配方的大规模遥感视觉语言模型 37

表 7:UrBench [60] VQA。从左到右顺序:CR=城市检索,IR=图像检索,CL=相机定位,OR=方向,SR=场景识别,RU=道路理解,CO=计数,SC=场景比较,RBR=基于角色的推理,TSR=交通标志推理,VPR=视觉提示推理,OM=物体匹配,OG=物体定位,OAR=物体属性识别。列最大值以粗体显示。

地理 场景 场景 物体 定位 理解 推理 理解 模型 总体 CR IR CL OR SR RU CO SC RBR TSR VPR OM OG OAR

人类 30.0 92.6 82.9 85.7 59.2 87.2 94.1 85.1 87.4 85.7 88.2 95.2 95.5 61.6 69.9 随机 24.8 23.9 25.1 23.2 17.7 25.7 21.4 25.3 23.9 24.2 30.6 21.8 22.1 21.5 23.5

GPT-4o 79.2 85.9 35.3 30.7 65.0 66.3 40.1 79.0 79.6 68.2 77.9 28.0 46.5 50.1 61.2 Gemini-1.5-Flash 69.7 25.9 25.9 24.0 57.9 71.0 29.1 67.7 77.8 75.8 69.8 22.0 39.1 40.9 50.9 Claude-3.5-Sonnet 72.3 55.8 30.8 33.3 52.4 59.0 48.0 81.0 73.7 37.7 66.7 22.0 61.5 45.4 55.0

TinyLLaVA 51.9 23.2 24.7 27.9 8.6 9.3 9.5 27.6 40.3 32.7 48.6 22.9 41.1 18.8 29.9 InternVL2-2B 50.3 23.8 31.9 29.0 47.9 47.9 28.6 30.1 64.8 45.9 54.5 25.5 30.3 40.5 41.2 InternVL2-4B 55.0 24.2 27.4 23.1 52.3 53.1 22.1 39.4 73.0 56.6 62.6 30.6 30.2 40.2 43.5 XComposer2-4KHD 61.9 26.0 27.5 25.9 55.6 65.8 35.8 30.3 75.5 62.6 60.8 16.2 42.6 46.9 47.8 LLaVA-NeXT-7B-Mistral 51.6 25.9 24.2 24.0 55.6 47.3 34.1 28.4 59.2 42.7 45.5 43.9 33.1 30.0 39.2 LLaVA-NeXT-7B-Vicuna 51.2 24.6 27.2 23.3 56.1 20.2 34.3 25.9 49.6 51.5 54.5 31.8 27.2 31.9 37.1 InstructBLIP-Vicuna-7B 40.4 25.7 25.4 27.1 33.0 14.8 20.4 28.0 30.7 25.7 29.3 22.9 22.7 17.3 27.6 LLaVA-NeXT-Interleave-7B 57.9 41.6 27.6 25.5 52.6 50.7 37.3 48.4 65.8 55.9 63.1 37.3 37.6 41.5 40.4 Mantis-LLaMA3-SigLIP 67.0 32.4 27.0 27.2 59.2 44.5 27.4 52.4 67.6 41.6 57.7 25.2 34.2 38.6 45.3 Mantis-Idefics2 69.0 29.9 27.0 25.7 50.3 49.3 22.9 56.0 68.9 50.6 56.3 29.6 37.8 35.6 40.7 LLaVA-NeXT-8B 54.4 27.0 27.8 26.0 55.7 44.5 34.1 24.0 55.2 52.8 58.6 39.8 41.7 28.4 38.8 InternVL2-8B 50.8 26.6 31.8 25.2 53.0 52.6 43.0 51.4 74.9 54.8 62.6 30.3 32.0 41.3 48.8 Idefics-2-8B 65.5 23.8 26.0 24.1 52.3 47.9 25.9 27.8 64.7 60.4 42.8 24.8 21.1 27.4 42.7 LLaVA-NeXT-13B 52.0 24.5 27.7 26.7 53.9 50.7 33.8 25.1 54.0 52.1 52.3 31.8 34.8 26.3 46.5 VILA-1.5-13B 62.7 33.7 28.6 24.1 47.7 43.9 23.9 48.6 66.3 43.8 46.4 25.8 32.3 38.2 45.8 InternVL2-26b 61.3 23.0 32.3 24.7 65.0 41.1 30.1 52.6 77.9 63.8 71.2 26.1 37.3 48.4 46.0 LLaVA-NeXT-34B 58.4 26.0 28.5 27.8 58.3 49.0 21.6 53.9 65.6 59.3 56.8 28.7 40.5 24.1 43.7 VILA-1.5-40B 70.1 62.5 36.8 27.9 53.6 51.7 32.1 66.7 76.4 55.5 61.3 34.1 48.3 39.5 53.1

基础模型 54.2 34.7 29.9 23.6 95.8 53.1 31.1 60.0 75.3 64.2 72.5 29.2 31.4 42.6 49.8 MLRS 54.8 42.6 26.9 22.9 95.4 52.1 34.8 59.4 78.6 66.9 76.1 32.9 35.2 47.4 51.9

表 8:LaSeRS [46] 分割。指标为 IoU/cIoU。列最大值以粗体显示。

层次分割粒度 目标多重性 推理要求 语言变异性 模型 平均 语义 实例 部件 单一 多重 显式 隐式 短 长

LISA-7B 26.4/23.2 20.5/25.0 16.1/11.6 37.3/32.2 18.2/22.4 27.1/24.3 21.5/25.6 34.1/27.8 38.4/33.9 26.6/25.1 LISA-13B 27.0/24.5 22.3/25.6 17.7/13.1 38.4/34.2 19.9/23.5 27.1/25.5 22.6/25.8 35.2/28.0 38.4/34.3 27.6/26.1 PixelLM-7B 32.0/32.8 26.6/30.0 13.2/16.5 44.3/40.4 20.2/23.5 25.0/23.1 23.9/21.9 41.6/38.9 37.1/34.5 29.3/29.1 PixelLM-13B 31.6/34.0 27.5/30.2 15.8/17.6 42.2/40.5 20.9/22.4 26.3/24.4 25.9/22.1 42.0/39.1 37.1/34.5 29.9/29.4 GLaMM-ft-7B 44.8/47.9 41.2/48.3 32.6/42.7 47.3/50.3 32.2/41.0 59.1/60.3 42.6/44.8 50.4/54.8 42.6/44.8 43.6/48.3 M 2A-7B 30.1/33.0 23.0/24.8 18.6/17.2 45.4/37.6 20.9/24.8 35.8/30.4 23.3/26.7 35.8/32.8 41.5/36.7 30.5/29.3 GeoPixel-8B 51.4/57.2 44.1/49.3 43.9/52.4 55.0/45.8 49.2/49.7 66.5/61.3 41.1/58.3 51.1/59.3 51.4/63.2 50.4/55.2 SegEarth-R2-3B 60.2/71.8 65.4/70.3 64.8/68.3 55.1/69.2 38.3/56.2 78.4/80.4 42.8/59.7 60.2/69.9 50.1/65.7 57.2/67.9

基础模型 40.2/39.4 41.3/32.6 15.4/19.7 37.9/35.1 1.3/1.3 33.2/27.4 30.7/23.7 36.4/45.8 42.9/35.6 31.1/29.0 MLRS 71.1/70.7 72.2/70.0 51.3/63.1 67.3/59.2 59.5/58.7 67.4/65.6 68.1/67.0 70.1/74.5 75.2/77.9 66.9/67.4

第 38 页

38 S.M. Ailuro 等.

表 9: GeoSeg-Bench [28] 分割结果。最佳结果以粗体显示。

交互式 指代表达 推理 方法 cIoU gIoU cIoU gIoU cIoU gIoU

LISA 2.52 3.12 3.53 4.56 7.09 5.77 PixelLM 0.08 0.11 6.04 5.80 6.36 6.30 PSALM 6.35 10.83 31.77 18.91 11.88 9.27 HIPIE 6.01 12.06 29.25 39.14 7.90 11.76 SegLLM 8.97 17.72 15.90 35.27 11.06 16.41 Geopixel 17.21 18.71 37.34 40.14 27.36 26.71 Geopix 15.28 17.63 28.81 28.52 20.80 18.25 RemoteSAM 4.85 6.49 12.06 29.31 8.09 9.01 Earthmind 16.38 16.57 44.53 46.48 31.01 28.80 LISAT 4.27 5.52 37.87 40.14 22.06 20.09 Segearth-R1 4.88 5.28 14.65 9.39 12.72 11.97

PSALM-ft 70.78 74.10 68.70 71.15 47.53 49.59 Geopixel-ft 42.62 46.48 42.70 45.50 30.25 28.51 Earthmnind-ft 67.74 70.89 48.09 49.24 36.84 25.71 LISAT-ft 68.43 73.00 59.82 62.46 41.53 31.25 Segearth-R1-ft 72.09 75.00 70.76 72.98 53.31 51.56 UniGeoSeg-ft 74.44 75.56 72.93 74.58 58.35 53.12

Base 43.6 43.5 19.7 18.2 21.2 16.9 MLRS 42.3 46.5 53.0 57.0 35.0 37.7

发表评论