GeoChrono:重新定义遥感长期时序理解,超越商业模型20%

三分钟导读:本文提出了ChronoBench基准和GeoChrono模型,通过分解认知层级和构建位置时间轨迹,显著提升了多模态大语言模型在遥感长期时序理解中的表现。

英文题目:GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing

论文出处:arXiv 每日论文精选 · arXiv:2607.15768

原始论文:PDF / 论文页面

对应视频标题:GeoChrono:重新定义遥感长期时序理解,超越商业模型20%|推荐指数:★★★★★

这篇论文解决什么问题?

现有遥感理解方法多局限于静态快照或双时相对比,缺乏对连续长期时序演变的系统性评估,且现有MLLMs在长期记忆和时空推理方面存在严重瓶颈。

核心创新

  • 提出四级认知层级(土地覆盖感知、时间识别、长期记忆、时空推理)的ChronoBench基准。
  • 设计TempEnc模块,利用混合双向-因果注意力机制和文本引导语义聚焦,显式建模逐位置的时间演变轨迹。
  • 提出C2FComp模块,利用提示文本嵌入进行显著性评分,选择性保留动态区域的高分辨率token并压缩静态背景。
  • 构建包含104K样本的ChronoInstruct指令微调数据集,覆盖所有能力层级。

方法概览

提出ChronoBench基准(包含12个子任务和4级认知层级)和ChronoInstruct训练数据集;设计GeoChrono模型,核心包括Temporal Trajectory Encoder (TempEnc)用于解耦时空特征为逐位置时间轨迹,以及Coarse-to-Fine Token Compressor (C2FComp)用于基于文本引导的选择性压缩。

逐图理解论文

ChronoBench基准构建

ChronoBench基准构建
Figure 1: We propose ChronoBench, a multi-dimensional benchmark decomposing long-term remote sensing understanding into a four-level cognitive hierarchy. Built upon this foundation, GeoChrono constructs per-location temporal trajectories to model the long-term evolution of geographic parcels, enabling powerful long-term remote sensing comprehension. GeoChrono achieves state-of-the-art performance on ChronoBench, reaching human-level accuracy on several sub-tasks.

为填补这一空白,本文提出ChronoBench基准,将长期遥感理解分解为四个认知层级:土地覆盖感知、时间识别、长期记忆以及时空推理。该基准包含12个子任务,旨在全面评估模型从基础识别到复杂推理的能力,并构建了包含104K样本的ChronoInstruct指令微调数据集。

GeoChrono模型架构

GeoChrono模型架构
Figure 4: Overview of the GeoChrono framework. The middle panel illustrates the overall architecture. The right panel details the Temporal Trajectory Encoder (TempEnc), which decouples the spatio-temporal feature volume into per-location temporal trajectories via hybrid bidirectional-causal attention and text-guided semantic focusing. The left panel details the Coarse-to-Fine Token Compressor (C2FComp), which leverages text-guided saliency scoring to selectively preserve fine-grained tokens for task-relevant regions while compressing the background.

基于基准,我们设计了GeoChrono模型。其核心在于显式建模地理单元的时间演变轨迹。模型通过Temporal Trajectory Encoder解耦时空特征,并利用Coarse-to-Fine Token Compressor进行高效处理,确保模型能够聚焦于动态变化的关键区域,同时忽略静态背景冗余。

基准测试性能对比

基准测试性能对比
Table 1: Quantitative evaluation results on ChronoBench. We compare human expert performance against commercial MLLMs, open-source general MLLMs, remote sensing domain models, and our GeoChrono. All values are reported in percentage (%).

在ChronoBench上的实验显示,GeoChrono达到78.34%的整体准确率,超越领先商业多模态大语言模型超过20%。在长期记忆子任务上,得分68.10%,显著缩小了与人类专家91.73%得分的差距。这表明模型在理解复杂时序演变方面取得了实质性进展。

零样本泛化能力

零样本泛化能力
Table 2: Zero-shot evaluation on DVL-Bench [42] and CD- VQA [44]. All values are reported in percentage (%).

在DVL-Bench和CD-VQA上的零样本评估进一步验证了模型的泛化能力。GeoChrono在BCA-Single、BCA-Multi和CSE-Single任务上分别达到72.9%、42.1%和35.7%。这些结果证明,通过ChronoBench训练获得的时序理解能力能够有效迁移到其他遥感时序任务中。

效率与性能权衡

效率与性能权衡
Table 3 studies C2FComp under varying selection ratios, with the full model as the upper bound and 768×768 uniform resizing as a naive baseline. C2FComp demonstrates strong robustness across all compression levels, consistently retaining over 91% of the full model’s performance even at the most aggressive 1/64 ratio, which reduces the visual tokens by 73.83%. The 1/4 ratio further pro- vides over 56% token reduction while preserving 94.60% perfor- mance, surpassing the 768×768 resizing baseline in both compres- sion rate (56.25% vs. 43.75%) and performance retention (94.60% vs. 94.40%), confirming that instruction-guided selective compression is more effective than uniform downsampling.

C2FComp在1/4选择比例下减少了56.25%的视觉Token,同时保留了94.60%的性能。即使在1/64的激进压缩比例下,模型仍能保持超过91%的全模型性能。这证实了基于指令引导的选择性压缩比均匀下采样更有效,大幅提升了推理效率。

实验与关键结果

  • 在ChronoBench上与商业MLLMs、开源通用MLLMs及遥感领域模型进行对比。
  • 在DVL-Bench和CD-VQA上进行零样本泛化能力评估。
  • 分析C2FComp在不同压缩比例下的效率与性能权衡。
  • 对TempEnc和C2FComp的关键组件进行消融实验。
  • GeoChrono在ChronoBench上达到78.34%的整体准确率,超越领先商业MLLMs超过20%。(第 6 页)
  • C2FComp在1/4选择比例下减少56.25%的视觉token,同时保留94.60%的性能。(第 8 页)
  • 在长期记忆(Long-Term Memory)子任务上,GeoChrono得分为68.10%,显著缩小了与人类专家(91.73%)的差距。(第 6 页)
  • 在DVL-Bench上,GeoChrono在BCA-Single、BCA-Multi和CSE-Single任务上分别达到72.9%、42.1%和35.7%。(第 8 页)

阅读时需要注意

  • 在Object History Memory (OHM)任务上,模型倾向于省略中间的土地覆盖阶段,导致生成的演变链条比真实情况短。
  • 尽管性能提升显著,但与人类专家在长期记忆任务上仍存在约23%的差距。
  • HBB-Box定位变体的准确率普遍高于地理坐标定位变体,特别是在认知要求较高的任务上。
  • 模型参数规模的增加并不总是带来性能的一致提升,特别是在记忆和推理任务上。

关联工作

  • TEOChat:遥感领域模型,但在长期记忆任务上表现较差。(第 6 页)
  • DVLChat:遥感领域模型,在长期记忆任务上表现较差。(第 6 页)
  • Gemini-3-Flash:商业MLLM,在ChronoBench上表现最佳但仍远低于人类水平。(第 6 页)
  • Qwen3-VL-32B:开源通用MLLM,在ChronoBench上表现优于其他开源模型。(第 6 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

GeoChrono:长期遥感理解的多维度基准测试与重新思考

李宇杰 潘建诚 魏志伟 北京邮电大学 清华大学 湖南师范大学 海淀区,北京,中国 海淀区,北京,中国 湖南省,长沙市,中国 liyujie2003@bupt.edu.cn jiancheng.pan.plus@gmail.com trentonwei@whu.edu.cn

王九牛 彭梦根 徐文佳∗ 香港城市大学 北京邮电大学 北京邮电大学 香港,中国 海淀区,北京,中国 海淀区,北京,中国 wangjiuniu@gmail.com pmg@bupt.edu.cn xuwenjia@bupt.edu.cn

2026年7月17日 [cs.CV]

图 1:我们提出了 ChronoBench,这是一个将长期遥感理解分解为四个认知层级的多维度基准测试。在此基础上,GeoChrono 构建了每个位置的时间轨迹,以模拟地理地块的长期演变,从而实现强大的长期遥感理解能力。GeoChrono 在 ChronoBench 上取得了最先进的性能,并在多个子任务上达到了人类水平的准确率。

摘要 遥感为观察地球表面的长期演变提供了无与伦比的视角,但这要求模型不仅要感知孤立时刻的地表覆盖,还要追踪变化、记忆演变历史,并在时间和空间上进行推理。然而,现有研究缺乏对这些不同能力的系统性评估。为了填补这一空白,我们引入了 ChronoBench,这是一个多维度基准测试,将该任务分解为四个递进的认知层级(即:地表覆盖感知、时间识别、长期记忆和时空推理)。ChronoBench 包含 12 个子任务以及 17,689 个经过严格验证的问答(Question-Answer)对。广泛的评估表明,主流的多模态大语言模型(MLLMs)远远落后于人类专家,其中长期记忆(Long-Term Memory)成为最关键的瓶颈。受此发现启发,我们进一步提出了 GeoChrono,这是一种具有增强能力的 MLLM,能够追踪、记忆和推理长期的地理演变。利用地理地块空间位置固定而语义演变的物理先验,我们设计了一个时间轨迹编码器(Temporal Trajectory Encoder, TempEnc),为每个位置构建时间轨迹以专门用于地表覆盖演变建模,并引入了一种由粗到细的 Token 压缩器(Coarse-to-Fine Token Compressor, C2FComp),在压缩静态背景的同时自适应地保留动态区域。为了支持训练,我们还构建了 ChronoInstruct,这是一个涵盖所有能力层级的 10.4 万样本指令微调数据集。GeoChrono 在 ChronoBench 上取得了最先进的性能,超越了领先的商业 MLLMs。

∗ 通讯作者。

会议’17,华盛顿,美国,DC 2026. ACM ISBN 978-x-xxxx-xxxx-x/YYYY/MM https://doi.org/10.1145/nnnnnnn.nnnnnnn

第 2 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

超过 20%,而 C2FComp 在保持 GeoChrono 94.6% 性能的同时,将视觉 Token 减少了超过 56%。代码和数据将在 https://github.com/IntelliSensing/GeoChrono 提供。

CCS 概念 • 计算方法 → 场景理解。

关键词 多模态大语言模型,遥感,时间理解

1 引言 地球是一个沿两个基本轴——空间和时间——演变的动态系统。遥感提供了观察这种演变的无与伦比的视角,然而,绝大多数现有的解释方法局限于 i) 静态快照,即在单一时刻理解存在什么 [20, 24, 48];或 ii) 双时相对比,捕捉两个离散时间点之间的变化 [15, 36]。这留下了一个 largely untapped(很大程度上未被开发)的关键维度:景观转变、城市扩张和生态系统变化的连续长期时间轨迹。与此同时,多模态大语言模型(MLLMs)在长视频理解方面展示了卓越的能力 [27, 28, 40],表现出理解扩展时间上下文和对复杂视觉叙事进行推理的日益令人鼓舞的潜力。然而,长期遥感图像序列与自然视频存在根本差异:地理地块在空间上保持固定,而其语义随时间演变,且大面积场景包含大量的空间冗余,因为只有很小一部分区域在帧之间发生有意义的变化,如图 1 所示。这些独特的特征要求进行专门的调查。

最近的努力通过专门的基准测试探索了 MLLMs 在遥感中的时间解释。TEOChatlas [10] 整理了第一个涵盖时间场景分类、损害评估和变化检测等任务的时间遥感数据集,但受限于低分辨率图像(224 × 224)和短序列(最大长度为 8)。DynamicVL [42] 构建了跨越 42 个美国城市、包含 6 个城市理解任务的高分辨率多时间数据集,揭示了主流 MLLMs 在长期遥感理解方面的失败。尽管如此,其任务分类法围绕特定应用场景组织,而不是剖析模型进行长期时间理解所必须具备的底层认知能力。虽然这两项工作都表明现有 MLLMs 在长期遥感背景下表现不佳,但都没有建立结构化的能力框架来诊断这些模型在哪里以及为何表现不足。这促使我们重新思考:当前 MLLMs 在长期遥感理解中缺乏哪些能力,我们如何弥合这些差距?

为了严格调查这个问题,我们将长期遥感理解分解为四个层级的能力层次结构,如图 1 所示。Level 0 土地覆盖感知:在给定时间这里有什么?Level 1 时间识别:什么

has changed between two time points? Level 2 Long-Term Memory: what was here before, and what transitions have occurred throughout the observation period? Level 3 Spatio-Temporal Reasoning: given all perceived changes and memorized histories, what spatio-temporal relationships can be inferred? Inspired by human cognition [33], these four levels form a progressive hierarchy from basic perception, through change recognition and historical change events memorization, to high-level reasoning, together constituting the cognitive foundation for comprehensive long-term remote sensing understanding.

To this end, we introduce ChronoBench, a comprehensive, multi-dimensional, and multi-granularity benchmark for high-resolution long-temporal remote sensing understanding. ChronoBench is organized around the four competencies outlined above, encompassing 12 sub-tasks and 17,689 rigorously validated QA pairs derived from 3,469 high-resolution images (1024×1024) spanning 500 distinct regions across 39 major U.S. cities, selected for their rich and diverse land-cover dynamics over extended time spans. During construction, we first design structured question templates for each sub-task, then employ deterministic rule-based programs to traverse pre-existing manually annotated semantic change masks and automatically populate the templates at scale, followed by rigorous manual verification to ensure quality. We evaluate a broad spectrum of mainstream MLLMs, e.g., GPT-5 [22], Gemini-3 [31], Qwen3-VL [2], on ChronoBench, and additionally recruit three domain experts to establish a human-level baseline. The results reveal a substantial performance gap between current models and human-level understanding, particularly on tasks related to tracking long-term evolution histories, where existing models exhibit pronounced deficiencies in memorizing and retrieving temporal trajectories of geographic entities.

Motivated by these findings, we develop GeoChrono, an MLLM that enhances tracing, memorization, and reasoning over the long-term evolution of geographic entities. Leveraging the physical prior that each geographic parcel remains spatially fixed while its semantics evolve, we design a Temporal Trajectory Encoder (TempEnc) that explicitly constructs per-location temporal evolution trajectories, strengthening the model’s capacity for perceiving temporal changes, memorizing evolution histories, and reasoning across time. Furthermore, to alleviate the substantial computational overhead imposed by high-resolution long-temporal sequences, we exploit the spatial redundancy inherent in wide-area remote sensing scenes and introduce a Coarse-to-Fine Token Compressor (C2FComp). C2FComp leverages prompt text embeddings to assess the task relevance of each spatial region, selectively preserving full-resolution fine tokens for salient areas while condensing the static background into compact coarse representations, thereby drastically compressing the visual token sequence input to the LLM. To support training across all competency dimensions, we further construct ChronoInstr, a large-scale instruction-tuning dataset containing over 104K samples. Extensive experiments on ChronoBench demonstrate that GeoChrono outperforms previous MLLMs by a substantial margin, achieving an overall accuracy of 78.34%. Moreover, the C2FComp reduces the visual token count by over 56% while retaining 94.6% of the full model’s performance (74.11% vs. 78.34%), demonstrating

两个时间点之间发生了什么变化?Level 2 长期记忆:之前这里有什么,以及在观察期间发生了哪些转变?Level 3 时空推理:鉴于所有感知到的变化和记忆的历史,可以推断出哪些时空关系?受人类认知 [33] 的启发,这四个层级形成了一个从基本感知,经过变化识别和历史变化事件记忆,到高级推理的渐进层次结构,共同构成了全面长期遥感理解的认知基础。

为此,我们引入了 ChronoBench,这是一个用于高分辨率长时序遥感理解的全面、多维度和多粒度基准测试。ChronoBench 围绕上述四项能力组织,包含 12 个子任务和 17,689 对经过严格验证的问答对,这些数据源自 3,469 张高分辨率图像(1024×1024),涵盖了美国 39 个主要城市中的 500 个不同区域,这些区域因其跨越长时间跨度丰富多样的土地覆盖动态而被选中。在构建过程中,我们首先为每个子任务设计结构化的问题模板,然后采用确定性的基于规则的程序遍历预先存在的手动标注语义变化掩码,并大规模自动填充模板,随后进行严格的人工验证以确保质量。我们在 ChronoBench 上评估了一系列主流 MLLMs,例如 GPT-5 [22]、Gemini-3 [31]、Qwen3-VL [2],并额外招募了三位领域专家以建立人类水平基线。结果揭示了当前模型与人类水平理解之间的巨大性能差距,特别是在与追踪长期演变历史相关的任务上,现有模型在记忆和检索地理实体的时间轨迹方面表现出明显的缺陷。

受这些发现的启发,我们开发了 GeoChrono,这是一种 MLLM,增强了对地理实体长期演变的追踪、记忆和推理能力。利用每个地理地块在空间上保持固定而其语义演变的物理先验,我们设计了一个时间轨迹编码器(Temporal Trajectory Encoder, TempEnc),显式地构建每个位置的时间演变轨迹,加强了模型感知时间变化、记忆演变历史以及跨时间推理的能力。此外,为了减轻高分辨率长时序序列带来的巨大计算开销,我们利用了大面积遥感场景中固有的空间冗余,并引入了一种由粗到细的 Token 压缩器(Coarse-to-Fine Token Compressor, C2FComp)。C2FComp 利用提示文本嵌入来评估每个空间区域的任务相关性,选择性地为显著区域保留全分辨率细粒度 Token,同时将静态背景压缩为紧凑的粗粒度表示,从而极大地压缩了输入到 LLM 的视觉 Token 序列。为了支持所有能力维度的训练,我们进一步构建了 ChronoInstr,一个包含超过 10.4 万个样本的大规模指令微调数据集。在 ChronoBench 上的大量实验表明,GeoChrono 以显著优势优于之前的 MLLMs,整体准确率达到 78.34%。此外,C2FComp 将视觉 Token 数量减少了超过 56%,同时保留了完整模型 94.6% 的性能(74.11% vs. 78.34%),证明了

第 3 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月,美国华盛顿特区

指令引导的选择性压缩可以有效调和计算效率与长时序理解能力。我们的贡献如下:

  • 我们为长期遥感理解建立了全面的数据基础。具体而言,我们提出了一个四级认知层级,从土地覆盖感知到时序识别、长期记忆以及时空推理,并将其实例化为 ChronoBench,这是一个包含12个子任务和17,689个问答对的多维度基准测试。我们进一步构建了 ChronoInstruct,这是一个涵盖所有能力层级的大规模指令微调数据集,包含超过104K个样本,以支持高级模型的开发。
  • 我们设计了一个时间轨迹编码器(Temporal Trajectory Encoder, TempEnc)模块,该模块利用遥感影像中的地球静止轨道先验,将时空特征体解耦为按位置划分的时间轨迹,从而在遥感中实现专门的长期时序建模。
  • 我们提出了一种由粗到细的Token压缩器(Coarse-to-Fine Token Compressor, C2FComp),该模块利用时序变化的空间稀疏性,在提示文本嵌入的指导下选择性压缩视觉Token序列,从而在长时序的计算开销与模型性能之间实现显著平衡。
  • 在 ChronoBench 上的大量实验表明,GeoChrono 超越了领先的商业多模态大语言模型(MLLMs)20%以上,显著提升了长期遥感理解所有四个能力维度的性能。此外,C2FComp 在保留模型94.6%全性能的同时,将视觉Token数量减少了56%以上,验证了提示引导的选择性压缩的有效性。

2 相关工作

2.1 用于遥感的 multimodal 大语言模型

多模态大语言模型(MLLMs)[1, 13, 17, 18] 在广泛的视觉-语言理解任务 [4, 7, 39, 41, 43, 50] 中取得了显著性能。在遥感领域,已开发出 GeoChat [12]、EarthGPT [47] 和 LHRS-Bot [21] 等代表性工作,用于各种静态解释任务 [19, 32, 34, 45, 46],但它们主要关注单时相影像的空间理解,使得时序演化在很大程度上未被充分探索。最近的研究开始解决遥感的时序方面。ChangeChat [6] 和 BTCChat [14] 针对双时相变化理解。此外,TEOChat [10]、EarthDial [29] 和 DVLChat [42] 通过策划多时相指令跟随数据集并相应地训练 MLLMs,将此能力扩展到更长的时序。然而,这些模型是围绕特定的预定义时序任务开发和训练的,例如时序场景分类 [25]、建筑物损害评估 [36] 和变化检测 [16],而没有系统地分析和解决长期遥感理解本身提出的内在挑战。在本工作中,我们重新审视这一问题,并提出了 GeoChrono,这是一种用于长期地球观测的专用时间轨迹建模方法。

2.2 遥感中的多模态基准测试

遥感 MLLMs 的发展伴随着日益增长的基准测试生态系统,涵盖单图像理解 [9, 23, 26, 35, 49] 和双时相变化推理 [36, 44],但扩展到更长的时序仍处于起步阶段。TEOChatlas [10] 汇编了来自多个地球观测(EO)数据集的样本,涵盖从双时相到多时相的序列,而 DVL-Bench [42] 则针对高分辨率影像组织的六个城市理解任务,聚焦长期城市动态。尽管这些努力很有价值,但现有的基准测试主要面向任务导向,能够揭示 MLLMs 在特定长期遥感任务上表现不佳,但对于哪些底层认知能力存在缺陷,提供的见解有限。为了解决这些差距,我们构建了 ChronoBench,这是一个围绕四级认知层级组织的多维度、多粒度评估框架。

3 ChronoBench

为了全面评估 MLLMs 在长期地球观测中的能力,我们引入了 ChronoBench,这是一个高分辨率、长时序的遥感基准测试,它在多个粒度上探测时空智能,从类别级转换到对象级轨迹跟踪,贯穿四级认知层级。

3.1 任务分类

我们将长期遥感理解分解为四级认知层级,每一层级都由一个核心问题界定。第0级 土地覆盖感知:在给定时间这里有什么?第1级 时序识别:在指定的时间点之间发生了什么变化?第2级 长期记忆:变化何时发生,完整的演变历史是什么?第3级 时空推理:通过跨位置和时间的比较可以推断出什么?需要注意的是,第1级和第2级在一个关键方面有所不同:第1级将时间点作为给定输入,而第2级要求模型将时序信息作为输出进行回忆。受此层级指导,我们设计了12个子任务,如图2所示。

第0级:土地覆盖感知。我们设计了一个基本对象感知(Object Perception, OP)任务,以评估模型是否能够识别指定位置和时相的土地覆盖。为了确保稳健的空间锚定,我们采用两种定位模态:归一化水平边界框(HBB),其中坐标缩放至 [0, 999] 范围内,以及地理坐标,其中目标位置由其左上角和右下角坐标指定的图像范围内定义。

第1级:时序识别。我们在类别级和对象级粒度上评估此能力。在类别级,i) 双时相类别级变化识别(Bi-Temporal Class-Level Change Recognition, BCC)要求比较两个指定的时相,以识别给定土地覆盖类别经历的所有转换类型;ii) 双时相类别级面积变化识别(Bi-Temporal Class-Level Area Change Recognition, BCAC)要求确定其整体空间范围是扩大还是缩小。iii) 长时序类别级变化识别(Long-Temporal Class-Level Change Recognition, LCC)将其扩展到整个观测期,聚合指定类别在整个序列中经历的所有转换。在

第 4 页

会议’17,2017年7月,美国华盛顿特区 Trovato 等人

图 2:ChronoBench 中的任务分类法。除“跨序列对象构建排序”任务外,模型在所有其他任务中仅处理一个图像序列(来自序列 A 或序列 B)。请注意,任务提示前显示的标签“序列 A / 序列 B”仅用于概念说明。此外,[Prefix] 表示引入坐标系,以及输入图像左上角和右下角的地理坐标。

对象级别,iv) 双时相对象级变化识别 (BOC) 将范围缩小到由 HBB 框或地理坐标定义的局部区域,要求识别两个给定时间点之间该区域内所有土地覆盖类型的转换。 第 2 级:长期记忆。我们设计了三个复杂度递增的子任务。i) 对象出现记忆 (OAM) 询问指定的土地覆盖类型在给定位置首次出现的时间。ii) 对象变化记忆 (OCM) 询问给定位置的土地覆盖类型何时变为不同类别。iii) 对象历史记忆 (OHM) 提出了最具挑战性的要求,需要模型重建给定位置不同土地覆盖阶段的完整时间序列。 第 3 级:时空推理。我们设计了四个子任务,这些任务需要跨位置或跨时间的比较推理。i) 对象构建排序 (OCO) 呈现两个局部对象,并要求确定哪个对象构建得更早。ii) 跨序列对象构建排序 (CSOCO) 将此扩展到跨场景设置,其中两个对象位于具有独立图像序列的不同地理区域。iii) 区域发展比较 (RDC) 使用 HBB 框指定四个区域,并要求识别表现出最高程度城市发展的区域。iv) 类别级变化幅度估计 (CCME) 要求模型比较指定土地覆盖类别在所有连续时间间隔内的变化幅度,并识别变化最显著的时期。

3.2 数据统计与特征 ChronoBench 跨越美国 39 个主要城市的 500 个不同区域,捕捉了由快速城市化驱动的土地覆盖动态。该基准测试包含 3,469 张高分辨率图像(1024×1024)和总共 17,689 对经过严格验证的问答对,平均每张图像序列有 35.38 对问答对。问答对分布在四个层级:土地覆盖感知 (7.5%)、时间识别 (54.2%)、长期记忆 (26.0%) 和时空推理 (12.3%)。每个问答对平均使用 7.26 个时间帧作为视觉输入,

第 5 页

GeoChrono:基准测试与重新思考遥感中的长期时间理解 Conference’17, 2017年7月, 华盛顿特区, 美国

ChronoInstruct 的多选题和短文本答案组件共享相同的构建流程。对于自由形式的自然语言回答,我们进一步采用 Gemini-3-Flash [31] 从提取的地面真值信息中生成答案,随后采用相同的两阶段人工质量控制流程以确保可靠性。额外的标注细节见补充材料。

4 多模态大语言模型对长期遥感动态的理解能力如何? 4.1 评估设置 为了建立全面的比较,我们在三个不同类别中评估了代表性模型:i) 商业多模态大语言模型,即 Gemini-3-Flash [31]、Seed-1.6-Vision [3] 和 GPT-5.4 [22];ii) 开源通用多模态大语言模型,包括 InternVL-3.5 系列(4B、8B、14B)[38] 和 Qwen3-VL 系列(4B、8B、32B)[2];以及 iii) 具有时间遥感理解能力的遥感领域模型,即 TEOChat [10]、EarthDial [29] 和 DVLChat [42]。此外,我们招募了三位领域专家以建立人类水平性能,为评估模型能力提供上限参考。

图3:数据构建流程概览。 主要在6到8之间,最高达19。该基准测试还包含了跨序列的问答对,要求模型对来自不同地理区域的两个图像序列进行联合推理。为了适应不同难度的任务复杂度,我们采用了三种问题格式:单选题(62.9%)、多选题(32.1%)和需要按时间顺序忠实输出的有序序列问题(5.0%)。同时,我们构建了 ChronoInstruct,这是一个包含1,534个图像序列和104,949个问答对的大规模指令微调数据集,包含三种答案格式:多选题、短文本和自由形式自然语言回答。额外的统计分析见补充材料。

3.3 数据构建流程 为了确保标注的可靠性,我们采用完全基于规则的构建流程,该流程以人工标注的语义变化掩码为基础,如图3所示。ChronoBench 建立在 DynamicVL 团队 [42] 提供的元数据之上,其中包括在连续时间戳上标注的像素级语义变化掩码。这些人工标注的掩码为推断沿时间轴任意空间位置的土地覆盖状态和转换事件提供了可靠的基础。

对于每个子任务,我们设计了确定性的基于规则的程序,遍历语义掩码以提取地面真值答案,并将其与5种风格多样的提示模板配对,以确保语言多样性(图3)。所有提示模板都经过仔细校准,以消除潜在的歧义,并且答案选项的顺序完全随机化,以防止位置偏差。

自动生成的问答对经过两阶段人工质量控制流程。在第一阶段,多名独立的标注员对照源图像和语义掩码审查每个样本,标记出视觉证据模糊、地面真值标签错误或问题格式不当的条目。在第二阶段,领域专家主管对随机抽取的标记样本进行裁决,做出接受或拒绝的决定,以确保基准测试符合严格的质量标准。

4.2 在 ChronoBench 上对多模态大语言模型进行基准测试 ChronoBench 上的定量结果如表1所示,揭示了所有被评估模型面临的严重性能瓶颈。虽然商业模型相对领先,但所有三个类别在长期记忆任务上的表现都很差。这种普遍的短板反映的不仅仅是参数规模的限制,更是缺乏专门的时间建模。

巨大的人机差距:人类专家在此任务上的平均准确率(OA)达到92.28%,证实了基准测试任务明确且可解。相比之下,表现最好的商业模型 Gemini-3-Flash 仅达到57.48%。开源模型的最高分为46.73%(Qwen3-VL-32B),遥感领域模型的表现也不佳,DVLChat 为44.07%,而 TEOChat 和 EarthDial 分别仅为26.82%和30.11%。这一差距证实,长期遥感解释仍然是当前多模态大语言模型面临的开放挑战。

长期记忆是关键瓶颈:长期记忆是存在最大人机差距的维度。人类专家在此维度上的准确率达到91.73%,然而即使是表现最好的商业模型 Gemini-3-Flash,平均也只有47.52%。开源通用模型的表现更差(13.33%–24.06%),尽管专门针对时间遥感数据进行了训练,遥感领域模型的表现也相仿(14.64%–22.91%)。在对象历史记忆(OHM)上,差距进一步扩大,该任务要求重建完整的演变轨迹:开源模型几乎崩溃(0.45%–4.55%),遥感领域模型保持在2.50%以下,即使是 Gemini-3-Flash 也仅达到25%。这种普遍的失败表明,当前的多模态大语言模型缺乏准确记忆和回忆地理实体长期演变轨迹的能力。

通用多模态大语言模型中缩放效应不一致:虽然扩大模型参数通常能提高总体平均准确率(OA),例如 Qwen3-VL 从35.10%(4B)扩展到46.73%(32B),InternVL-3.5 从33.25%(4B)扩展到37.76%(14B),但这种好处在特定能力维度上并不一致。值得注意的是,在

第 6 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

表 1:ChronoBench 上的定量评估结果。我们将人类专家的表现与商业多模态大语言模型(MLLMs)、开源通用 MLLMs、遥感领域模型以及我们的 GeoChrono 进行了比较。所有数值均以百分比(%)报告。

土地覆盖感知 时间识别 长期记忆 时空推理 Method OP BOC OAM OCM OHM OCO CSOCO OA AVG BCAC BCC LCC AVG AVG CCME RDC AVG Coord Box Coord Box Coord Box Coord Box Coord Box Coord Box Coord Box Human 98.52 95.56 97.04 94.81 82.96 82.96 98.52 89.63 89.78 98.52 97.04 91.11 87.41 85.93 90.37 91.73 78.52 97.78 99.26 100.00 99.26 98.52 95.56 92.28

商业模型 Gemini-3-Flash[31] 65.06 65.96 65.51 82.00 50.53 52.45 55.85 56.16 61.38 56.44 58.44 46.68 47.75 25.00 21.36 47.52 37.79 63.64 68.05 78.01 54.36 66.67 59.89 57.48 GPT-5.4[22] 47.07 40.00 43.53 80.00 50.76 53.87 66.13 60.00 67.57 47.69 41.52 35.36 46.09 26.14 20.00 39.21 30.73 30.51 53.83 70.60 52.43 69.12 50.42 56.29 Seed-1.6-Vision[3] 50.98 73.23 62.11 81.91 46.27 53.73 47.08 58.47 63.87 37.08 47.05 37.22 41.85 20.00 18.41 36.86 31.22 38.98 56.52 73.29 55.83 79.41 53.74 55.48

开源模型 InternVL-3.5-4B[38] 45.41 58.65 52.03 54.83 32.57 27.95 24.51 24.20 38.19 22.03 21.49 6.09 10.20 1.36 0.91 13.33 22.76 33.33 54.66 49.28 50.49 52.45 42.07 33.25 InternVL-3.5-8B[38] 33.08 45.56 39.32 56.29 28.31 28.49 35.60 39.35 43.21 25.11 24.30 13.91 16.95 1.60 3.41 16.93 30.40 39.55 51.35 53.21 57.77 47.55 45.11 36.32 InternVL-3.5-14B[38] 40.90 55.94 48.42 64.15 33.41 30.66 36.43 30.08 45.67 22.39 21.76 15.76 19.07 0.45 0.91 16.45 21.95 28.25 52.38 53.83 48.06 49.51 41.42 37.76 Qwen3-VL-4B[2] 35.19 41.35 38.27 66.94 31.13 36.77 23.96 16.73 42.07 22.76 18.95 18.94 22.52 2.95 4.55 17.54 21.30 23.16 47.83 47.83 54.85 53.92 39.53 35.10 Qwen3-VL-8B[2] 39.40 41.96 40.68 69.21 29.15 43.15 31.98 29.26 47.12 29.74 28.56 17.48 20.00 2.95 0.91 20.52 23.74 28.81 54.66 53.00 55.83 47.06 42.80 39.19 Qwen3-VL-32B[2] 42.86 44.66 43.76 75.42 44.29 47.90 45.68 46.16 57.88 29.92 30.73 25.03 27.95 3.86 4.55 24.06 28.78 32.77 51.76 59.83 59.71 62.25 47.23 46.73

遥感领域模型 TEOChat-7B[10] 32.63 36.99 34.81 48.85 14.23 4.21 17.27 24.25 30.07 24.75 27.83 4.11 6.62 1.59 1.14 14.64 17.40 27.68 50.93 53.21 9.22 22.06 33.35 26.82 EarthDial-4B[29] 36.99 40.30 38.65 54.83 18.04 4.34 17.72 24.09 33.08 26.20 26.20 17.48 17.75 0.68 1.36 18.56 15.61 22.03 48.44 46.38 41.75 52.45 36.25 30.11 DVLChat-4B[42] 48.57 46.92 47.74 85.90 31.81 37.18 34.21 30.46 54.48 29.56 26.93 24.37 29.93 2.50 2.05 22.91 17.24 25.42 50.72 51.76 58.74 55.39 40.59 44.07

本文方法 GeoChrono 83.91 93.38 88.65 93.66 65.91 76.66 77.83 80.27 83.03 72.71 87.04 68.61 75.10 31.59 32.73 68.10 62.60 61.58 61.49 92.55 75.24 92.16 72.92 78.34

InternVL 系列中,参数规模的扩大并未带来均匀的性能提升;其在记忆和推理任务上的表现波动甚至随参数增加而下降。此外,即使存在正相关关系(如 Qwen3-VL),其绝对性能仍处于瓶颈状态。这强调了单纯依靠参数规模扩展并非万能药,弥合与人类认知之间的巨大差距需要方法论上的创新。

5 GeoChrono 如第 4.2 节所示,现有的 MLLMs 难以处理长期遥感动态,特别是在长期记忆方面。为了解决这一问题,我们引入了 GeoChrono,这是一种专为长期遥感解释设计的 MLLM。给定跨越 $T$ 帧的图像序列 $I_s = \{I_1, I_2, \dots, I_T\}$ 和文本提示 $Q$,GeoChrono 通过时空推理生成响应 $A$。

GeoChrono 包含四个核心组件:i) 视觉编码器 $E_v$,用于提取每帧的视觉特征;ii) 视觉-语言投影器 $E_p$,将视觉表示映射到语言嵌入空间;iii) 时间轨迹编码器(Temporal Trajectory Encoder, TempEnc),用于建模每位置的时间演化,以增强对土地覆盖变化历史的感知;iv) 大型语言模型(LLM)$E_l$,执行多模态推理并生成文本响应 $A$,如图 4 所示。具体而言,TempEnc 接收投影后的视觉特征 $F_{vis} \in \mathbb{R}^{T \times S \times D}$($T$:时间帧,$S$:每帧的空间 token 数,$D$:嵌入维度)以及文本指令嵌入 $E_{txt} \in \mathbb{R}^{L \times D}$,并输出时间增强的表示 $F_{te}$,随后输入到 LLM 中。除了核心架构外,我们还引入了由粗到细的 Token 压缩器(Coarse-to-Fine Token Compressor, C2FComp)$E_{C2F}$,通过自适应压缩静态背景同时保留与任务相关的动态特征,从而减轻长高分辨率序列的计算负担。第 5.1 节和 5.2 节分别详细介绍了 TempEnc 和 C2FComp。

5.1 时间轨迹编码器 与自然视频不同,时间遥感序列表现出独特的地球静止轨道先验:传感器的视角变化极小,因此跨帧的每个空间 patch 对应相同的地理位置。这使得任何位置处的语义演化可以建模为独立的 1D 时间轨迹,以追踪固定空间点处的土地覆盖变化。TempEnc 显式地利用这一先验,通过将纠缠的时空特征体解耦为每位置的时间轨迹来进行专门的时间建模。它包含三个阶段:空间上下文聚合(Spatial Context Aggregation),通过局部空间上下文丰富每个 token;混合时间注意力(Hybrid Temporal Attention),通过混合注意力建模每位置的动力学;以及语义聚焦(Semantic Focusing),利用文本引导的交叉注意力抑制与任务无关的时间信息。

空间上下文聚合。从孤立的 patch 构建轨迹忽略了遥感土地覆盖中固有的区域连续性。为了在形成轨迹之前注入局部空间上下文,我们在重塑为 2D 的特征上应用轻量级 3×3 深度可分离卷积,作为预归一化残差块:

$$ \tilde{F}_{vis} = F_{vis} + \text{Flatten}(\text{Conv}_{3\times3}(\text{Reshape}(\text{LN}(F_{vis})))) \quad (1) $$

其中 $\text{LN}(\cdot)$ 表示层归一化,$\text{Reshape}$ 将空间 token 转置为 2D 网格。

混合时间注意力。从增强后的特征 $\tilde{F}_{vis} \in \mathbb{R}^{T \times S \times D}$ 中,我们通过分组所有帧中具有相同空间索引的 token 来提取每位置的时间轨迹:

$$ z_s = [\tilde{F}_{1,s}^{vis}; \tilde{F}_{2,s}^{vis}; \dots; \tilde{F}_{T,s}^{vis}] \in \mathbb{R}^{T \times D}, \quad (2) $$

其中每个 $z_s$ 封装了单个地理位置的完整时间演化,$[\cdot]$ 表示拼接。

我们首先沿 $z_s$ 的时间轴注入 1D 旋转位置嵌入(RoPE)[30],以编码相对时间距离。然后,我们使用双流混合注意力对时间轨迹进行建模,其中 $H$ 个注意力头被划分为两个相等的流:前 $H/2$ 个头在全时间序列上应用双向自注意力 $G_{bi}$,以捕捉全局变化模式和长程相关性,产生 $A_{bi} = G_{bi}(z_s) \in \mathbb{R}^{T \times D/2}$,而剩余的 $H/2$ 个头应用因果自注意力 $G_{ca}$

第 7 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月, 华盛顿特区, 美国

图4:GeoChrono框架概览。中间面板展示了整体架构。右侧面板详细说明了时间轨迹编码器(Temporal Trajectory Encoder, TempEnc),它通过混合双向因果注意力(hybrid bidirectional-causal attention)和文本引导的语义聚焦(text-guided semantic focusing),将时空特征体解耦为每个位置的时间轨迹。左侧面板详细说明了由粗到细的Token压缩器(Coarse-to-Fine Token Compressor, C2FComp),它利用文本引导的显著性评分,为任务相关区域选择性保留细粒度Token,同时压缩背景。

为了保持时间顺序进展,生成 $A_{ca} = G_{ca}(z_s) \in \mathbb{R}^{T \times D/2}$。将这两个流拼接并投影,以产生每层的混合注意力输出 $H(z_s)$:

$$ H(z_s) = [A_{bi}; A_{ca}] W_O, \quad (3) $$

其中 $W_O \in \mathbb{R}^{D \times D}$ 是输出投影矩阵。经过 $L$ 层后,输出轨迹被重新组装为 $F_{temp} \in \mathbb{R}^{T \times S \times D}$,并通过残差连接组合:

$$ F_{traj} = F_{temp} + \tilde{F}_{vis}. \quad (4) $$

语义聚焦。遥感长时序不可避免地携带大量与任务无关的信息。我们采用交叉注意力机制,以 $F_{traj}$ 作为查询(Query),以 $E_{txt}$ 作为键(Key)/值(Value),使文本指令充当语义过滤器,有选择地放大与任务相关的时间线索:

$$ \text{CrossAttn}(F_{traj}, E_{txt}) = \text{softmax}\left(\frac{(F_{traj}W_Q)(E_{txt}W_K)^\top}{\sqrt{d_k}}\right)(E_{txt}W_V), \quad (5) $$

其中 $W_Q, W_K$ 和 $W_V$ 是可学习的投影矩阵。TempEnc 的最终输出 $E_{te}$ 为:

$$ F_{te} = F_{traj} + \text{CrossAttn}(F_{traj}, E_{txt}). \quad (6) $$

5.2 由粗到细的Token压缩器

高分辨率长时序遥感序列产生总共 $T \times S$ 个视觉Token,其数量随帧数线性增长,给大语言模型(LLM)带来沉重的计算负担。朴素的一致压缩(例如全局平均池化)会不加区分地丢弃对时序理解至关重要的细粒度细节。我们观察到遥感中存在一个关键的物理先验:变化稀疏性(change sparsity),即地物覆盖转换集中在场景的一小部分,而大部分区域保持静态。这启发了C2FComp($E_{C2F}$),这是一种选择性压缩模块,它为任务相关的动态区域保留全分辨率Token,同时将静态背景压缩为紧凑的粗粒度表示,从而在保留任务相关动态的细粒度细节的同时,大幅减少整体Token预算。具体而言,C2FComp通过三个级联阶段运行,即空间块划分(Spatial Block Partitioning)、提示感知评分(Prompt-Aware Scoring)和Token混合(Token Mixing)。

空间块划分。给定具有空间分辨率 $S = H \times W$ 的细粒度特征 $F_{vis} \in \mathbb{R}^{T \times S \times D}$,我们将每组 $b \times b$ 个空间相邻的特征向量划分为一个块, resulting in $S_c = \frac{S}{b \times b}$ 个块。每个块通过对其组成Token进行平均池化来表示:

$$ F_{t,j}^{coarse} = \frac{1}{b^2} \sum_{(i,k) \in B_j} F_{t,(i,k)}^{vis}, \quad (7) $$

其中 $F_{t,j}^{coarse}$ 是第 $t$ 帧的第 $j$ 个块 $B_j$ 的特征。这生成了一个块级别的粗特征图 $F_{coarse} \in \mathbb{R}^{T \times S_c \times D}$。

提示感知评分。一个轻量级的显著性模块对每个块与文本指令嵌入的相关性进行评分。粗特征通过一个交叉注意力层(视觉Token $F_{coarse}$ 作为查询,$E_{txt}$ 作为键/值),随后是一个经过LayerNorm的MLP评分头,产生显著性logits $l$。然后通过沿时间轴进行对数均值指数池化(log-mean-exp pooling),将这些logits聚合为统一的逐位置信号:

$$ \sigma_j = \log\left(\frac{1}{T} \sum_{t=1}^{T} \exp(l_{t,j})\right), \quad (8) $$

从而生成选择信号 $\sigma \in \mathbb{R}^{S_c}$。

Token混合。给定显著性信号 $\sigma$,我们选择得分最高的前 $K$ 个块,其中 $K$ 是一个控制整体压缩率的超参数。选择通过带有直通估计(straight-through estimation)的Gumbel-Softmax松弛 [11] 实现,以便进行可微训练,并在推理时简化为确定性的硬Top-K选择。生成的二进制掩码 $m \in \{0, 1\}^{S_c}$ 在所有 $T$ 帧之间共享,以确保空间一致的压缩。对于

第 8 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

表 2: 在 DVL-Bench [42] 和 CD- 表 3: 不同由粗到细选择比率对 VQA [44] 上的零样本评估。所有数值均以百分比 (%) 报告。 效率和性能的影响。

DVL-Bench 选择比率 FLOPS 视觉 Token 总体准确率 (OA) 性能比率 方法 CDVQA BCA-单模态 BCA-多模态 CSE-单模态 TEOChat[10] 35.1 8.7 17.0 50.0 无 C2FComp 100.00% 100.00% 78.34 100.00% EarthDial[29] 62.2 20.3 30.9 52.1 768 × 768 -48.75% -43.75% 73.95 94.40% DVLChat[42] 64.9 21.3 31.3 43.7 1/2 -39.22% -37.50% 74.58 95.20% GeoChrono 72.9 42.1 35.7 59.2 1/4 -56.53% -56.25% 74.11 94.60% 1/16 -68.49% -70.31% 72.60 92.67% 1/64 -71.34% -73.83% 71.56 91.35%

对于第 $t$ 帧的第 $j$ 个块,混合表示为:

表 4: 消融研究。DFT 表示直接微调。TAH、 ( 𝐹𝑡,𝑗𝑓𝑖𝑛𝑒∈R𝑏2×𝐷, if 𝑚𝑗= 1 (9) TAB 和 TAC 分别表示混合、仅双向和因果 𝐹𝑡,𝑗 𝑚𝑖𝑥𝑒𝑑= 𝐹𝑡,𝑗𝑐𝑜𝑎𝑟𝑠𝑒∈R1×𝐷, if 𝑚𝑗= 0 时间注意力。SAG 和 SFC 分别表示 空间上下文聚合和语义聚焦。LCP、TR、LTM 和 STR 分别表示 其中 𝐹𝑡,𝑗𝑓𝑖𝑛𝑒 表示第 $j$ 个块内的 $b^2$ 个细粒度 token。拼接所有块得到 𝐹𝑚𝑖𝑥𝑒𝑑∈R𝑇×𝑁𝑚𝑖𝑥𝑒𝑑×𝐷,其中 土地覆盖感知、时间识别、长期记忆和时空推理。 𝑁𝑚𝑖𝑥𝑒𝑑= 𝐾·𝑏^2+(𝑆𝑐−𝐾) ≪𝑆,然后将其输入 TempEnc 进行时间轨迹建模。

方法 LCP TR LTM STR OA 6 实验 DFT 82.03 79.08 59.23 65.82 72.52 我们首先描述实现设置(第 6.1 节),然后将 GeoChrono 与现有的多模态大语言模型 (MLLMs) 进行比较,并在外部基准上评估其泛化能力(第 6.2 节),随后对 C2FComp 的效率进行分析(第 6.3 节)并进行消融研究(第 6.4 节)。详细的训练配置、定性结果和案例研究见补充材料。

6.1 实现设置 我们还在两个外部基准上进一步评估泛化能力(表 2)。在 DVL-Bench [42] 上,GeoChrono 在零样本设置下的三个子任务上分别取得了 72.9%、42.1% 和 35.7% 的成绩, consistently surpassing DVLChat (64.9%, 21.3%, 31.3%),后者是在 DVL-Instruct 上训练的。在 CDVQA [44] 上,GeoChrono 达到了 59.2% 的零样本准确率,优于所有遥感领域基线。这些结果证实,GeoChrono 的时间建模能力有效地泛化到了未见过的任务和分布中。

GeoChrono 基于 Qwen3-VL-4B-Instruct [2] 构建。在训练过程中,视觉编码器和视觉-语言投影器被冻结;TempEnc 和 C2FComp 随机初始化并进行完全微调,而 LLM 主干通过 LoRA [8] 进行微调。TempEnc 和 C2FComp 均采用单层注意力架构。该模型在 ChronoInstruct 上使用 4 块 NVIDIA H100 80GB GPU 训练了一个 epoch。完整的超参数细节见补充材料。

6.3 C2FComp 的有效性 6.2 GeoChrono 的评估 表 3 研究了不同选择比率下的 C2FComp,以完整模型作为上限,以 768×768 均匀调整大小作为朴素基线。C2FComp 在所有压缩级别下都表现出强大的鲁棒性,即使在最激进的 1/64 比率下,仍能保留完整模型超过 91% 的性能,此时视觉 token 减少了 73.83%。1/4 比率进一步提供了超过 56% 的 token 减少,同时保留了 94.60% 的性能,在压缩率(56.25% vs. 43.75%)和性能保留(94.60% vs. 94.40%)方面均优于 768×768 调整大小基线,证实了指令引导的选择性压缩比均匀下采样更有效。

如表 1 所示,GeoChrono 的总体准确率达到 78.34%,领先于主要的商业 MLLMs 超过 20%,领先于所有开源和遥感领域模型的范围甚至更宽。GeoChrono 在所有四个维度上均领先,其中长期记忆(68.10%)的提升最为显著,大幅缩小了与人类专家(91.73%)的差距。这一改进归功于 TempEnc 的混合时间轨迹注意力:因果流沿每个空间轨迹保留时间顺序进展,以忠实回忆历史状态,而双向流捕获全局时间对比,以消除遥远时间步长中相似土地覆盖阶段的歧义。在时间识别(83.03%)和时空推理(72.92%)方面的一致优势,进一步验证了基于文本引导的语义聚焦的逐位置轨迹解耦的有效性。

6.4 消融研究 表 4 逐步消融了 GeoChrono 的关键设计。在 DFT 基线之上引入混合时间注意力带来了 3.02%

第 9 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17,2017年7月,美国华盛顿特区

OA增益,证实了显式逐位置时序建模的必要性,而空间上下文聚合则提供了进一步的适度提升。在配备文本引导语义聚焦的三种注意力变体(仅双向、仅因果和混合)中,仅双向注意力通过其全局时序视图在时空推理(73.80%)方面表现最佳,而仅因果注意力通过保持时间顺序在长期记忆中(65.62%)表现最佳;GeoChrono 中它们的混合组合以78.34%的整体准确率超越了两者,表明这两个流捕捉了互补的时序模式。与没有语义聚焦的变体相比,持续2.51%的增益进一步验证了其在过滤与任务无关的时序信息方面的有效性。

7 结论

这项工作通过提出 ChronoBench 重新思考遥感中的长期时序理解,该基准测试将此挑战分解为四个渐进的认知层级。在 ChronoBench 上的评估确定长期记忆是当前多模态大语言模型(MLLMs)最关键的瓶颈。我们进一步构建了 ChronoInstruct,这是一个涵盖所有能力层级的10.4万样本指令微调数据集,并提出了 GeoChrono,它利用遥感特有的物理先验,通过时间轨迹编码器进行逐位置演化建模,并通过由粗到细的Token压缩器进行选择性视觉Token压缩。GeoChrono 在 ChronoBench 上取得了78.34%的整体准确率,超越了领先的商业 MLLMs 20%以上,且 C2FComp 在保留94.6%全模型性能的同时将视觉Token减少了56%以上。我们希望这项工作能激励社区进一步探索这一具有挑战性的方向。

致谢

本研究得到了国家自然科学基金(Grant 62301063)的资助。

[9] Yuan Hu, Jianlong Yuan, Congcong Wen, Xiaonan Lu, Yu Liu, and Xiang Li. 2025. Rsgpt: A remote sensing vision language model and benchmark. ISPRS Journal of Photogrammetry and Remote Sensing 224 (2025), 272–286. [10] Jeremy Andrew Irvin, Emily Ruoyu Liu, Joyce Chuyi Chen, Ines Dormoy, Jinyoung Kim, Samar Khanna, Zhuo Zheng, and Stefano Ermon. 2024. Teochat: A large vision-language assistant for temporal earth observation data. arXiv preprint arXiv:2410.06234 (2024). [11] Eric Jang, Shixiang Gu, and Ben Poole. 2016. Categorical reparameterization with gumbel-softmax. arXiv preprint arXiv:1611.01144 (2016). [12] Kartik Kuckreja, Muhammad Sohail Danish, Muzammal Naseer, Abhijit Das, Salman Khan, and Fahad Shahbaz Khan. 2024. Geochat: Grounded large vision-language model for remote sensing. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 27831–27840. [13] Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. 2023. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In International conference on machine learning. PMLR, 19730–19742. [14] Yujie Li, Wenjia Xu, Yuanben Zhang, Zhiwei Wei, and Mugen Peng. 2025. BTC-Chat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model. arXiv preprint arXiv:2509.05895 (2025). [15] Chenyang Liu, Keyan Chen, Bowen Chen, Haotian Zhang, Zhengxia Zou, and Zhenwei Shi. 2024. Rscama: Remote sensing image change captioning with state space model. IEEE Geoscience and Remote Sensing Letters 21 (2024), 1–5. [16] Chenyang Liu, Rui Zhao, Hao Chen, Zhengxia Zou, and Zhenwei Shi. 2022. Remote sensing image change captioning with dual-branch transformers: A new method and a large scale dataset. IEEE Transactions on Geoscience and Remote Sensing 60 (2022), 1–20. [17] Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee. 2024. Improved baselines with visual instruction tuning. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 26296–26306. [18] Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. 2023. Visual instruction tuning. Advances in neural information processing systems 36 (2023), 34892–34916. [19] Sylvain Lobry, Diego Marcos, Jesse Murray, and Devis Tuia. 2020. RSVQA: Visual question answering for remote sensing data. IEEE Transactions on Geoscience and Remote Sensing 58, 12 (2020), 8555–8566. [20] Junwei Luo, Zhen Pang, Yongjun Zhang, Tingzhu Wang, Linlin Wang, Bo Dang, Jiangwei Lao, Jian Wang, Jingdong Chen, Yihua Tan, et al. 2024. Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding. arXiv preprint arXiv:2406.10100 (2024). [21] Dilxat Muhtar, Zhenshi Li, Feng Gu, Xueliang Zhang, and Pengfeng Xiao. 2024. Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model. In European Conference on Computer Vision. Springer, 440–457. [22] OpenAI. 2025. Introducing GPT-5.4. https://openai.com/index/introducing-gpt-5-4/. Accessed: 2026-03-22. [23] Ruizhe Ou, Yuan Hu, Fan Zhang, Jiaxin Chen, and Yu Liu. 2025. GeoPix: A multimodal large language model for pixel-level image understanding in remote sensing. IEEE Geoscience and Remote Sensing Magazine (2025). [24] Chao Pang, Xingxing Weng, Jiang Wu, Jiayu Li, Yi Liu, Jiaxing Sun, Weijia Li, Shuai Wang, Litong Feng, Gui-Song Xia, et al. 2025. Vhm: Versatile and honest vision language model for remote sensing image analysis. In Proceedings of the

参考文献 人工智能AAAI会议,第39卷。6381–6388。 [1] Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana [25] Charlotte Pelletier, Geoffrey I Webb, 和 François Petitjean。2019. 用于卫星图像时间序列分类的时序 Hasson, Karel Lenc, Arthur Mensch, Katherine Millican, Malcolm Reynolds, 等。 卷积神经网络。Remote Sensing 11, 5 (2019), 523。 2022. Flamingo: 一种用于少样本学习的视觉语言模型。神经信息处理系统进展 35 (2022), 23716–23736。 [2] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, [26] Akashah Shabbir, Mohammed Zumri, Mohammed Bennamoun, Fahad S Khan, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等。2025. Qwen3-vl 和 Salman Khan。2025. Geopixel: 在遥感中实现像素级定位的大型多模态模型。arXiv预印本 arXiv:2501.13925 (2025)。 技术报告。arXiv预印本 arXiv:2511.21631 (2025)。 [3] ByteDance Seed。2026. Seed 1.6。https://seed.bytedance.com/en/seed1_6。访问日期:2026-03-22。 [4] Keshigeyan Chandrasegaran, Agrim Gupta, Lea M Hadzic, Taran Kota, Jimming [27] Yan Shu, Zheng Liu, Peitian Zhang, Minghao Qin, Junjie Zhou, Zhengyang Liang, He, Cristóbal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, 和 Li Fei-Fei。 Tiejun Huang, 和 Bo Zhao。2025. Video-xl: 用于小时级视频理解的超长视觉语言模型。在计算机视觉与 2024. Hourvideo: 1小时视频-语言理解。神经信息处理系统进展 37 (2024), 53168–53197。 模式识别会议论文集。26160–26169。 [5] Tri Dao。2024. FlashAttention-2: 具有更好并行性和工作划分的更快注意力机制。在国际学习表征会议 (ICLR) 上。 [6] Pei Deng, Wenqian Zhou, 和 Hanlin Wu。2025. Changechat: 一种通过多模态指令微调进行遥感变化分析的交互式模型。在 ICASSP 2025-2025 IEEE 国际声学、语音和信号处理会议 (ICASSP) 上。IEEE, 1–5。 [7] Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan [28] Enxin Song, Wenhao Chai, Guanhong Wang, Yucheng Zhang, Haoyang Zhou, Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, 等。2025. Video-mme: Feiyang Wu, Haozhe Chi, Xun Guo, Tian Ye, Yanting Zhang, 等。2024. Moviechat: 从密集Token到稀疏记忆以实现长视频理解。在 IEEE/CVF 计算机视觉与模式识别会议论文集上。18221– 首个全面的视频分析多模态大语言模型评估基准。在 IEEE/CVF 计算机视觉与模式识别会议论文集上。24108–24118。 [8] Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean [29] Sagar Soni, Akshay Dudhane, Hiyam Debary, Mustansar Fiaz, Muhammad Akhtar Wang, Liang Wang, Weizhu Chen, 等。2022. Lora: 大型语言模型的低秩自适应。Iclr 1, 2 (2022), 3。 Munir, Muhammad Sohail Danish, Paolo Fraccaro, Campbell D Watson, Levente J Klein, Fahad Shahbaz Khan, 等。2025. Earthdial: 将多感官地球观测转化为交互式对话。在计算机视觉与 模式识别会议论文集上。14303–14313。 [30] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu。2024. Roformer: 增强型Transformer,采用旋转位置嵌入。Neurocomputing 568 (2024), 127063。 [31] Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican, 等。2023. Gemini: 一系列高度强大的多模态模型。arXiv预印本 arXiv:2312.11805 (2023)。

第 10 页

Conference’17, 2017年7月, 美国华盛顿特区 Trovato 等人

[32] Aakash Thapa, Teerayut Horanont, Bipul Neupane, 和 Jagannath Aryal。2023年。 深度学习用于遥感图像场景分类:综述与元分析。《遥感》15, 19 (2023), 4804。 [33] Barbara Tversky。2008年。空间认知:具身与情境化。剑桥大学出版社, 201–216。 [34] Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, 等。2025年。GeoLLaVA-8K: 将遥感多模态大语言模型扩展至8k分辨率。arXiv 预印本 arXiv:2505.21375 (2025)。 [35] Fengxiang Wang, Hongzhen Wang, Zonghao Guo, Di Wang, Yulin Wang, Ming- shuo Chen, Qiang Ma, Long Lan, Wenjing Yang, Jing Zhang, 等。2025年。Xlrs- bench:你的多模态LLM能否理解极大规模超高分辨率遥感影像?。在计算机视觉与 模式识别会议论文集。14325–14336。 [36] Junjue Wang, Weihao Xuan, Heli Qi, Zhihao Liu, Kunyi Liu, Yuhan Wu, Hon- gruixuan Chen, Jian Song, Junshi Xia, Zhuo Zheng, 等。2025年。Disasterm3: 用于灾害损害评估与响应的遥感视觉-语言数据集。arXiv 预印本 arXiv:2505.21089 (2025)。 [37] Junjue Wang, Yanfei Zhong, Zihang Chen, Zhuo Zheng, Ailong Ma, 和 Liangpei Zhang。2026年。EarthVL:一种渐进式地球视觉-语言理解与生成框架。arXiv 预印本 arXiv:2601.02783 (2026)。 [38] Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, 等。2025年。Internvl3. 5: 推进开源多模态模型在通用性、推理和效率方面的进展。arXiv 预印本 arXiv:2508.18265 (2025)。 [39] Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Ming Ding, Xiaotao Gu, Shiyu Huang, Bin Xu, 等。2025年。Lvbench:一个极端长视频 理解基准测试。在IEEE/CVF国际计算机视觉会议论文集。22958–22967。 [40] Yuetian Weng, Mingfei Han, Haoyu He, Xiaojun Chang, 和 Bohan Zhuang。 2024年。Longvlm:通过大语言模型实现高效的长视频理解。在欧洲计算机视觉会议。Springer, 453–470。 [41] Jiayang Wu, Wensheng Gan, Zefeng Chen, Shicheng Wan, 和 Philip S Yu。 2023年。多模态大语言模型:综述。在2023 IEEE国际大数据会议 (BigData)。IEEE, 2247–2256。 [42] Weihao Xuan, Junjue Wang, Heli Qi, Zihang Chen, Zhuo Zheng, Yanfei Zhong, Junshi Xia, 和 Naoto Yokoya。2025年。Dynamicvl:基准测试多模态大语言模型 用于动态城市理解。arXiv 预印本 arXiv:2505.21076 (2025)。 [43] Shukang Yin, Chaoyou Fu, Sirui Zhao, Ke Li, Xing Sun, Tong Xu, 和 Enhong Chen。2024年。多模态大语言模型综述。《国家科学评论》11, 12 (2024), nwae403。 [44] Zhenghang Yuan, Lichao Mou, Zhitong Xiong, 和 Xiao Xiang Zhu。2022年。变化 检测遇见视觉问答。《IEEE地球科学与遥感汇刊》60 (2022), 1–13。 [45] Yang Zhan, Zhitong Xiong, 和 Yuan Yuan。2023年。Rsvg:探索遥感数据上的 视觉定位数据与模型。《IEEE地球科学与遥感汇刊》61 (2023), 1–13。 [46] Ke Zhang, Peijie Li, 和 Jianqiang Wang。2024年。基于深度学习的遥感图像 描述综述:方法、模型、比较与未来方向。《遥感》16, 21 (2024), 4113。 [47] Wei Zhang, Miaoxin Cai, Tong Zhang, Yin Zhuang, 和 Xuerui Mao。2024年。Earth- GPT:一种用于遥感领域多传感器图像理解的通用多模态大语言模型。《IEEE地球科学与 遥感汇刊》62 (2024), 1–20。 [48] Siyuan Zhao, Qiang Wang, Xiaolin Zhao, Yong Kang, Chiben Zhang, 和 Ying Luo。 2026年。用于跨模态光学-SAR船舶重新识别的频率自适应解耦与拓扑图对齐。《IEEE 地球观测与遥感杂志精选专题》(2026)。 [49] Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, 等。2026年。DVGBench:基于大型视觉-语言 模型的无人机影像中隐式到显式视觉定位基准测试。《ISPRS摄影测量与遥感汇刊》232 (2026), 831–847。 [50] Heqing Zou, Tianze Luo, Guiyang Xie, Victor Xiao Jie Zhang, Fengmao Lv, Guang- cong Wang, Junyang Chen, Zhuochen Wang, Hansheng Zhang, 和 Huaijian Zhang。2025年。Hlv-1k:用于特定时间长视频理解的大规模小时级视频基准测试。在2025 IEEE国际多媒体 与博览会 (ICME)。IEEE, 1–6。

第 11 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月,美国华盛顿特区

附录

目录 A 数据构建细节 11 A.1 基于规则的元数据提取 11 A.2 所有子任务的提示模板 14 A.3 ChronoInstruct 的自然语言响应生成 19 B ChronoBench 和 ChronoInstruct 的统计分析 20 B.1 各任务问答分布 20 B.2 时序长度 22 B.3 答案格式组成 23 C 实验设置 23 C.1 评估设置 23 C.2 训练设置 25 D 实验结果 26 D.1 基准测试结果分析 26 D.2 计算效率分析 29 D.3 定性结果 29 D.4 失败案例研究 32 E 局限性与未来方向 32 F 对社区的贡献 32

A 数据构建细节 ChronoBench 和 ChronoInstruct 的构建依赖于确定性的基于规则的程序,从而实现可复现的大规模数据生成。该流程分为两个阶段:对于每个地理图块,我们首先执行基于规则的程序,系统地分析人工标注的变化语义掩码,提取形成元数据的结构化土地覆盖转换证据;随后,将提取的信息填充到为12个子任务量身定制的预设计提示模板中,以生成最终的问答对。图5以LCC任务为例,提供了该流程的具体端到端说明。在下文中,我们首先形式化基于规则的元数据提取过程,涵盖掩码编码方案、符号和提取算法(A.1节);然后介绍所有12个子任务的提示模板(A.2节);最后描述ChronoInstruct的自然语言响应生成过程(A.3节)。

A.1 基于规则的元数据提取 A.1.1 变化语义掩码编码。所有基准样本均源自语义变化掩码,这些掩码记录了连续时间戳之间的像素级土地覆盖转换,以及第一个和最后一个时间戳之间的总转换。如图6所示,变化掩码中的每个有效像素存储一个两位整数值 $v$,其中十位编码源(即变化前)土地覆盖类别,个位编码目标(即变化后)类别: $c_s= \lfloor v/10 \rfloor, c_d= v \mod 10,$ (10) 其中 $c_s$ 和 $c_d$ 分别表示源类别和目标类别索引。五个预定义的土地覆盖类别及其对应索引列于表5中。例如,像素值14编码了植被→建筑物的转换,而42编码了建筑物→非植被表面的转换。背景像素(即无变化)设置为零。在构建过程中,仅保留有效的转换像素,满足以下条件: i) $v$ 是两位代码,ii) $c_s \neq c_d$,以及 iii) $c_s, c_d \in \{1, 2, 3, 4, 5\}$。 A.1.2 符号与定义。为简洁起见,本节中采用以下任务缩写:对象感知(OP),双时相类别级变化识别(BCC),双时相类别级面积变化识别(BCAC),长时相类别级变化识别(LCC),双时相对象级变化识别(BOC),对象出现记忆(OAM),对象变化记忆(OCM),对象历史记忆(OHM),类别级变化幅度估计(CCME),区域发展比较(RDC),对象构建排序(OCO),以及跨序列对象构建排序(CSOCO)。 伪代码中使用的主要符号定义如下: • D:所有地理图块的集合。 • $M_d$:与图块 $d$ 关联的所有变化掩码的集合。 • $M_{total}$:总掩码,即跨越最长时间间隔的掩码,表示从第一个到最后一个时间戳的累积土地覆盖变化。 • $M_{inter} = \{M^{(1)}, M^{(2)}, …\}$:中间掩码,每个掩码覆盖连续的时间戳对 $[t^{(i)}_0, t^{(i)}_1]$,按时间顺序排序。这些掩码捕捉细粒度的、特定区间的转换。

第 12 页

Conference’17, 2017年7月, 美国华盛顿特区 Trovato 等人

图 5:数据构建流程的示意图,以长期时序类别级变化识别(Long-Temporal Class-Level Change Recognition, LCC)为例。

表 5:变化语义掩码中使用的土地覆盖类别索引映射。

| 索引 | 土地覆盖类别 | | :— | :— | | 1 | 植被 (Vegetation) | | 2 | 非植被表面 (Non-vegetated Surface) | | 3 | 水体 (Water) | | 4 | 建筑物 (Buildings) | | 5 | 运动场 (Playground) |

  • $v_p$:变化掩码中空间位置 $p$ 处的像素值。
  • $c_s(v), c_d(v)$:通过公式 (10) 从值 $v$ 解码出的源类别索引和目标类别索引。
  • CC(·):对二值掩码进行连通分量提取,返回一组空间上连续的区域。
  • Area($R$):连通区域 $R$ 的像素面积。
  • FR($R$) = Area($R$) / Area(BBox($R$)):区域 $R$ 的边界框填充率。
  • $\theta_a(c)$:用于保留候选区域类别依赖的最小面积阈值,对于空间分布广泛的类别(植被、非植被表面)设置较大,对于紧凑类别(水体、建筑物、运动场)设置较小。
  • $\theta_f$:用于区域过滤的最小边界框填充率阈值。
  • $\theta_t(c_s, c_d)$:用于保留类别级转换的类别对依赖的最小像素计数。

第 13 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月, 华盛顿特区, 美国

图 6:变化语义掩码编码示意图。每个有效像素存储一个两位数值,编码从源到目标的地表覆盖转换。背景像素(无变化)设置为零。

A.1.3 QA 元数据提取算法。这 12 个子任务共享一个通用的预处理阶段(算法 1),并根据其核心提取操作分为两类:i) 四个类别级任务(BCC、BCAC、LCC、CCME),这些任务分析转换像素数量,无需空间连通性,形式化于算法 2 中;ii) 八个对象级任务(OP、BOC、OAM、OCM、OHM、OCO、RDC、CSOCO),这些任务依赖于连通分量提取来识别离散的空间区域,形式化于算法 3 中。一个重要的设计维度是时间来源:评估长期累积变化的任务(LCC、OAM、OHM、OCO、RDC)在 $M_{total}$ 上运行,而针对特定区间转换的任务(BCC、BCAC、CCME、OP、BOC、OCM)在 $M_{inter}$ 上运行。

除了算法 3 之外,还有两个任务需要额外的后处理。区域发展比较(RDC)在 $M_{total}$ 上执行两次单独的区域提取:一次隔离建筑物/游乐场目标集群,另一次隔离植被/非植被表面/水集群。然后,它从候选池中组合四个区域的组合,需满足三个过滤标准:i) 空间非包含性,确保所选区域中没有被另一个区域包围的;ii) 平衡的面积比,要求 $\max(Area)/\min(Area) \le 4$,以便没有任何区域仅凭大小主导比较,以及变异系数($CV = \sigma/\mu$,即四个区域面积的标准差除以其均值)$\le 0.7$,以进一步确保四个区域规模相当;iii) 填充率判别约束,以保证答案清晰。填充率最高的建筑物侧集群被指定为发展程度最高的区域。跨序列对象构建排序(CSOCO)重用 OCO 的输出:它将所有保留的建筑物和游乐场对象跨图块汇集到一个全局集合中,然后配对来自不同图块且构建区间不重叠的对象。对于每一对,构建时间较早的对象被指定为ground truth。

算法 1 共享预处理 要求:图块数据集 $D$ 确保:每个图块的预处理掩码 $\{(M_{total}, M_{inter}, T)\}$ 1: for each tile $d \in D$ do 2: 收集所有变化掩码 $M_d = \{M_1, \dots, M_K\}$ 3: for each $M_k \in M_d$ do 4: 从文件名解析时间区间 $[t^{(k)}_0, t^{(k)}_1]$ 5: end for 6: $M_{total} \leftarrow \arg\max_{M_k} t^{(k)}_1 – t^{(k)}_0$ 7: $M_{inter} \leftarrow M_d \setminus \{M_{total}\}$,按 $t_0$ 排序 8: $T \leftarrow$ 从所有区间中排序的唯一时间戳 9: end for

第 14 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

算法 2 类别级任务构建 要求: 预处理后的图块, 任务类型 𝜏∈{BCC, BCAC, LCC, CCME} 确保: 类别级问答元数据 R 阶段 1: 转换像素计数 1: if 𝜏= LCC then 2: Mˆ ←{所有合并的 Minter} ⊲在整个序列上聚合 3: else ˆ 4: M ←Minter ⊲按区间处理 5: end if 6: for each mask 𝑀∈ Mˆ do 7: for each valid pixel 𝑝in 𝑀with 𝑐𝑠≠𝑐𝑑do 8: Γ[𝑀][ 𝑐𝑠(𝑣𝑝) →𝑐𝑑(𝑣𝑝) ] += 1 9: end for 10: end for 阶段 2: 任务特定提取 ⊲对阶段 1 中的每个 𝑀 应用 11: if 𝜏∈{BCC, LCC} then 12: for each (𝑐𝑠→𝑐𝑑) with Γ[𝑀][𝑐𝑠→𝑐𝑑] < 𝜃𝑡(𝑐𝑠,𝑐𝑑) do 13: Mark both 𝑐𝑠and 𝑐𝑑as invalid 14: end for 15: Remove all transitions involving any invalid class 16: for each valid source class 𝑐𝑠do 17: R.add 𝑐𝑠, {𝑐𝑑| 𝑐𝑠→𝑐𝑑valid}, [𝑡𝑀0 ,𝑡𝑀1 ] 18: end for 19: else if 𝜏= BCAC then 20: for each class 𝑐, each mask 𝑀do 21: Δ𝑐←Í𝑘Γ[𝑀][𝑘→𝑐] −Í𝑘Γ[𝑀][𝑐→𝑘] ⊲净面积变化 22: if |Δ𝑐| > 𝜃𝑠(𝑐) then 23: R.add(𝑐, 𝑀, Δ𝑐>0 ? “expanded” : “reduced”) 24: end if 25: end for 26: else if 𝜏= CCME then 27: for each class 𝑐do 28: 𝑆𝑐(𝑀) ←Í𝑐𝑑Γ[𝑀][𝑐→𝑐𝑑] for each 𝑀 ⊲变化量 29: Retain masks where 𝑆𝑐(𝑀) > 𝜃𝑚(𝑐); require ≥𝑛min retained 30: R.add 𝑐, argmax𝑀𝑆𝑐(𝑀) ⊲峰值区间 31: end for 32: end if

A.2 所有子任务的提示模板 在基于规则的程序提取上述结构化元数据记录 R 之后,每条记录通过从预定义的具有不同风格的提示集合中采样一个模板,并用元数据中的具体值填充所有占位符,转换为问答对。 为了确保语言多样性并减轻对表面模式的记忆,我们为每个子任务的每种接地变体设计了 5 个模板。答案选项的顺序在所有问题中完全随机化,以防止位置偏差。对于同时具有框接地和坐标接地变体的任务,坐标接地模板会在特定于任务的提问之前,添加一个指定坐标参考系统和图像角点坐标的空间参考前言。 以下占位符符号在所有模板中通用:

• {time_0}, {time_1}: 观测时间戳。 • {land_cover}, {land_cover_1}, {land_cover_2}: 土地覆盖类别名称。 • <{HBB_Box}>, <{HBB_Box_𝑁}>: 用于空间接地的水平边界框。 • {crs_system}, {crs_system_𝑁}: 坐标参考系统标识符。 • {coo_𝑁}, {coo𝑁_𝑀}: 用于基于点的空间接地的地理坐标。

所有 12 个子任务的完整提示模板集如下所示,按四个认知层级组织。

a. 土地覆盖感知:

第 15 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17,2017年7月,美国华盛顿特区

算法 3 对象级任务构建 要求:预处理后的图块,任务类型 𝜏∈{OP, BOC, OAM, OCM, OHM, OCO} 确保:对象级问答元数据 R 阶段 1:目标掩码选择 1: if 𝜏∈{OP, BOC, OCM} then ˆ 2: M ←Minter ⊲特定时间间隔的转换 3: else 4: M ˆ ←{𝑀total} ⊲累积终态 5: end if 阶段 2:区域提取 6: for each mask 𝑀∈ M,ˆ each target class 𝑐do 7: Define binary mask 𝐵per 𝜏: 8: OP: 𝐵←{𝑝| 𝑐𝑑(𝑣𝑝) =𝑐} ⊲按目标地类 9: BOC, OCM: 𝐵←{𝑝| 𝑐𝑠(𝑣𝑝) =𝑐} ⊲按源地类 10: OAM, OHM: 𝐵←{𝑝| 𝑣𝑝=10𝑐𝑠+𝑐𝑑} ⊲精确转换 11: OCO: 𝐵←{𝑝| 𝑐𝑑(𝑣𝑝) ∈{4, 5}} ⊲建筑物/操场 12: {𝑅𝑖} ←CC(𝐵); discard 𝑅𝑖if Area(𝑅𝑖) < 𝜃𝑎(𝑐) or FR(𝑅𝑖) < 𝜃𝑓 13: if 𝜏= BOC then 14: Collect all distinct 𝑐𝑑values within each retained 𝑅𝑖 15: end if 16: end for 阶段 3:时序定位 ⊲记忆与排序任务 17: for each retained region 𝑅do 18: if 𝜏∈{OAM, OCO} then 19: Scan Minter backward; find earliest interval with dst-coverage ≥𝜃cov 20: Record [𝑡(𝑗)0 ,𝑡(𝑗)1 ] as temporal anchor 21: else if 𝜏= OCM then 22: Verify ≥2 preceding intervals with no change in 𝑅 23: Record current interval as change timestamp 24: else if 𝜏= OHM then 25: Scan Minter chronologically over 𝑅’s pixels 26: At each interval, identify dominant transition code 27: Discard if non-dominant area > 0.1× dominant area or |chain| < 2 28: end if 29: end for 阶段 4:定位 30: for each retained region 𝑅do 31: Box: compute horizontal bounding box of 𝑅 32: Point: find interior pixel via distance transform; project to geo-coordinate 33: end for

地物感知 (OP)

边界框定位: (1) 对 {time_0} 时刻由 <{HBB_Box}> 定位的区域进行地物类型分类。 (2) 在 {time_0} 时刻,由 <{HBB_Box}> 定位的区域的地物类型是什么? (3) 识别 {time_0} 时刻由 <{HBB_Box}> 定位区域的地物类型。 (4) 在 {time_0} 时刻,由 <{HBB_Box}> 定位的区域属于哪个地物类别? (5) 提供 {time_0} 时刻由 <{HBB_Box}> 定义区域的地物分类结果。

坐标定位: (1) 坐标参考系统为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。对由 {coo_3} 定位的区域在 {time_0} 时刻的地物类型进行分类。 (2) 坐标参考系统为 {crs_system}。图像左上角位于 {coo_1},右下角位于 {coo_2}。在 {time_0} 时刻,由坐标 {coo_3} 定位的区域的地物类型是什么? (3) 图像定义在 {crs_system} 坐标参考系统下,{coo_1} 为左上角坐标,{coo_2} 为右下角坐标。识别 {time_0} 时刻由坐标 {coo_3} 定位区域的地物类型。

第 16 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

(4) 坐标系为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。现在 回答:在 {time_0} 时刻,由 {coo_3} 定位的区域属于哪种土地覆盖类别? (5) 已知图像使用 {crs_system} 坐标系,其中 {coo_1} 标记左上角,{coo_2} 标记右下角。 请提供 {time_0} 时刻由坐标 {coo_3} 定义区域的土地覆盖分类。

b. 时序识别: 双时相类别级变化识别 (BCC)

(1) {land_cover} 在 {time_0} 和 {time_1} 之间发生了哪些变化? (2) 比较 {time_0} 和 {time_1},{land_cover} 是如何变化的? (3) 在 {time_0} 和 {time_1} 之间,{land_cover} 中可观察到哪些变化? (4) 比较 {time_0} 与 {time_1},{land_cover} 中可识别出哪些变化? (5) 从 {time_0} 到 {time_1},{land_cover} 的两点增量是多少(仅考虑这两个时间戳)?

双时相类别级面积变化识别 (BCAC)

(1) {land_cover} 的面积在 {time_0} 和 {time_1} 之间是如何变化的?从“扩大”或“缩小”中选择。 (2) 对 {time_0} 和 {time_1} 之间 {land_cover} 面积的变化进行分类,仅选择“扩大”或“缩小”。 (3) 确定 {land_cover} 的面积在比较 {time_0} 和 {time_1} 时如何变化,你的答案必须是“扩大”或“缩小”之一。 (4) 比较 {time_0} 与 {time_1},{land_cover} 的面积是如何变化的?选择一个:扩大或缩小。 (5) 在 {time_0} 和 {time_1} 之间,{land_cover} 的面积是扩大还是缩小?仅选择一个。

长时序类别级变化识别 (LCC)

(1) 在 {time_0} 到 {time_1} 期间,{land_cover} 经历了哪些变化? (2) 在整个从 {time_0} 到 {time_1} 的时间跨度内,{land_cover} 经历了哪些变化? (3) 在跨越 {time_0} 到 {time_1} 的时间间隔内,{land_cover} 经历了哪些变化? (4) 在从 {time_0} 到 {time_1} 的时间范围内,{land_cover} 中观察到了哪些变化? (5) 在 {time_0}–{time_1} 期间,{land_cover} 表现出哪些变化?

双时相对象级变化识别 (BOC)

框定位: (1) 比较 {time_0} 和 {time_1},区域 <{HBB_BOX}>(原为 {land_cover})内的土地覆盖发生了哪些变化?注意 该区域的不同部分可能转变为不同的土地覆盖类型。选择所有适用的转换。 (2) 比较 {time_0} 和 {time_1},区域 <{HBB_BOX}>(原为 {land_cover})内发生了哪些土地覆盖转换?该区域 内的不同区域可能经历了不同的变化。选择所有适用的选项。 (3) 检查 {time_0} 和 {time_1} 之间的区域 <{HBB_BOX}>(原为 {land_cover})。该区域内发生了哪些类型的土地覆盖变化? 该区域的不同部分可能发生了多次转换。选择所有适用的变化。 (4) 对于区域 <{HBB_BOX}>(原为 {land_cover}),比较 {time_0} 和 {time_1}:发生了哪些土地覆盖转换?该区域可能 在不同区域包含多种类型的变化。选择所有适用的选项。 (5) 在 {time_0} 和 {time_1} 之间,区域 <{HBB_BOX}>(原为 {land_cover})内发生了哪些土地覆盖变化?由于该区域 可能覆盖具有不同变化的区域,请选择所有适用的转换。

坐标定位: (1) 坐标系为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。 现在回答:比较 {time_0} 和 {time_1},位置 {coo_3}(原为 {land_cover})处发生了哪些土地覆盖变化? 周围区域可能经历了不同类型的转换。选择所有适用的选项。 (2) 坐标系为 {crs_system}。图像左上角位于 {coo_1},右下角位于 {coo_2}。 现在回答:比较 {time_0} 和 {time_1},坐标 {coo_3}(原为 {land_cover})处发生了哪些土地覆盖转换?该区域可能 发生了多种类型的变化。选择所有适用的转换。 (3) 使用坐标系 {crs_system},图像从左上角的 {coo_1} 延伸到右下角的 {coo_2}。请回答: 在 {time_0} 和 {time_1} 之间,{coo_3}(原为 {land_cover})处发生了哪些类型的土地覆盖变化?该区域的不同部分可能 转变为不同的土地覆盖类型。选择所有适用的选项。 (4) 图像在坐标系 {crs_system} 下定义,其中 {coo_1} 标记左上角,{coo_2} 标记 右下角。现在回答:对于位置 {coo_3}(原为 {land_cover}),比较 {time_0} 和 {time_1} 时发生了哪些土地覆盖转换?该区域可能包含多种类型的变化。选择所有适用的选项。 (5) 在坐标系 {crs_system} 下,图像的左上角坐标为 {coo_1},右下角坐标为 {coo_2}。现在 回答以下问题:在 {time_0} 和 {time_1} 之间,{coo_3}(原为 {land_cover})处发生了哪些土地覆盖变化?由于该区域可能 覆盖具有不同变化的区域,请选择所有适用的转换。

c. 长期记忆:

第 17 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17,2017年7月,美国华盛顿特区

对象出现记忆 (OAM)

基于边界框 (Box-Grounded): (1) 在 {time_0} 时刻,由 <{HBB_Box}> 定位的 {land_cover} 当前持续存在是从哪个时间段开始的? (2) 在哪个时间窗口内,由 <{HBB_Box}> 定位的 {time_0} 时刻的 {land_cover} 当前持续存在开始? (3) 在时序观测中,由 <{HBB_Box}> 定位的 {time_0} 时刻的 {land_cover} 是在什么间隔开始其当前持续存在的? (4) 识别由 <{HBB_Box}> 定位的 {time_0} 时刻的 {land_cover} 开始其当前持续存在的时间间隔。 (5) 在 {time_0} 观测到的由 <{HBB_Box}> 定位的 {land_cover} 是在什么时间段开始维持其当前持续存在的?

基于坐标 (Coordinate-Grounded): (1) 坐标参考系统为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。在 {time_0} 时刻,由坐标 {coo_3} 定位的 {land_cover} 当前持续存在是从哪个时间段开始的? (2) 坐标参考系统为 {crs_system}。图像左上角位于 {coo_1},右下角位于 {coo_2}。现在回答:在 {time_0} 时刻,位于坐标 {coo_3} 的 {land_cover} 当前持续存在是在哪个时间窗口开始的? (3) 使用坐标参考系统 {crs_system},图像从左上角的 {coo_1} 延伸到右下角的 {coo_2}。在时序观测中,由坐标 {coo_3} 定位的 {time_0} 时刻的 {land_cover} 是在什么间隔开始其当前持续存在的? (4) 图像定义在坐标参考系统 {crs_system} 下,{coo_1} 标记左上角,{coo_2} 标记右下角。现在回答:识别由坐标 {coo_3} 定位的 {time_0} 时刻的 {land_cover} 开始其当前持续存在的时间间隔。 (5) 鉴于图像使用 {crs_system} 坐标参考系统,其中 {coo_1} 标记左上角,{coo_2} 标记右下角。在 {time_0} 观测到的由 {coo_3} 定位的 {land_cover} 是在什么时间段开始维持其当前持续存在的?

对象变化记忆 (OCM)

基于边界框 (Box-Grounded): (1) 在哪个确切的时间戳,由 <{HBB_Box}> 引用的 {time_0} 时刻的对象 {land_cover} 转变为其他土地覆盖类型? (2) 识别由 <{HBB_Box}> 定位的 {time_0} 时刻的 {land_cover} 转变为其他土地覆盖类型的时间间隔。 (3) 哪个时间范围涵盖了由 <{HBB_Box}> 定位的 {time_0} 时刻的对象 {land_cover} 的土地覆盖类型变化? (4) 在什么时间间隔内,标记为 {time_0} 时刻且由 <{HBB_Box}> 定位的对象经历向另一个土地覆盖类别的转变? (5) 指定 {time_0} 时刻的对象 {land_cover}(由 <{HBB_Box}> 定位)转变为不同土地覆盖类型的时间段。

基于坐标 (Coordinate-Grounded): (1) 坐标参考系统为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。在哪个确切的时间戳,由坐标 {coo_3} 引用的 {time_0} 时刻的对象 {land_cover} 转变为其他土地覆盖类型? (2) 使用坐标参考系统 {crs_system},图像从左上角的 {coo_1} 延伸到右下角的 {coo_2}。识别由坐标 {coo_3} 定位的 {time_0} 时刻的 {land_cover} 转变为其他土地覆盖类型的时间间隔。 (3) 坐标参考系统为 {crs_system}。图像左上角位于 {coo_1},右下角位于 {coo_2}。现在回答:由坐标 {coo_3} 定位的 {time_0} 时刻的对象 {land_cover} 的土地覆盖类型变化发生在哪个时间范围? (4) 图像定义在坐标参考系统 {crs_system} 下,{coo_1} 标记左上角,{coo_2} 标记右下角。现在回答:在什么时间间隔内,标记为 {time_0} 时刻且由坐标 {coo_3} 定位的对象经历向另一个土地覆盖类别的转变? (5) 鉴于图像使用 {crs_system} 坐标参考系统,其中 {coo_1} 标记左上角,{coo_2} 标记右下角。现在指定 {time_0} 时刻的对象 {land_cover}(由坐标 {coo_3} 定位)转变为不同土地覆盖类型的时间段。

对象历史记忆 (Object History Memory, OHM)

基于边界框 (Box-Grounded): (1) 按时间顺序,由 <{HBB_Box}> 定位的 {time_0} 时刻的 {land_cover} 经历了哪些不同的土地覆盖阶段? (2) 按时间顺序,列出由 <{HBB_Box}> 指示的 {time_0} 时刻的 {land_cover} 区域所经历的不同土地覆盖阶段。 (3) 提供由 <{HBB_Box}> 引用的 {time_0} 时刻的 {land_cover} 的不同土地覆盖阶段的 chronological sequence(时间顺序序列)。 (4) 由 <{HBB_Box}> 识别的 {time_0} 时刻的对象 {land_cover} 的不同土地覆盖阶段的时间顺序序列是什么? (5) 按时间顺序列出在 {time_0} 观测到的由 <{HBB_Box}> 定位的 {land_cover} 所经历的不同土地覆盖阶段。

基于坐标 (Coordinate-Grounded): (1) 坐标参考系统为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。现在回答:按时间顺序,由坐标 {coo_3} 定位的 {time_0} 时刻的 {land_cover} 经历了哪些不同的土地覆盖阶段? (2) 坐标参考系统为 {crs_system}。图像左上角位于 {coo_1},右下角位于 {coo_2}。按时间顺序,由坐标 {coo_3} 定位的 {time_0} 时刻的 {land_cover} 经历了哪些不同的土地覆盖阶段? (3) 图像定义在 {crs_system} 坐标参考系统下,{coo_1} 为左上角坐标,{coo_2} 为右下角坐标。提供由坐标 {coo_3} 引用的 {time_0} 时刻的 {land_cover} 的不同土地覆盖阶段的时间顺序序列。

第 18 页

Conference’17, 2017年7月, 美国华盛顿特区 Trovato 等人

(4) 鉴于图像使用 {crs_system} 坐标参考系统,其中 {coo_1} 标记左上角,{coo_2} 标记右下角。 由坐标 {coo_3} 标识的 {time_0} 时刻 {land_cover} 对象的各个不同土地覆盖阶段的 chronological sequence(时间顺序)是什么? (5) 鉴于图像使用 {crs_system} 坐标参考系统,其中 {coo_1} 标记左上角,{coo_2} 标记右下角。 按时间顺序列出在 {time_0} 观察到的由 {coo_3} 定位的 {land_cover} 所经历的不同土地覆盖阶段。

d. 时空推理 (Spatio-Temporal Reasoning): 类别级变化幅度估计 (CCME)

(1) {land_cover} 发生最显著变化的时间段是哪个? (2) {land_cover} 经历最剧烈变化的时间间隔是哪个? (3) 识别 {land_cover} 表现出最大变化程度的时间间隔。 (4) {land_cover} 显示出最明显转变的时间框架是什么? (5) 指定 {land_cover} 经历最显著变化的时间间隔。

区域发展比较 (RDC)

(1) 比较 Region1 <{HBB_Box_1}>、Region2 <{HBB_Box_2}>、Region3 <{HBB_Box_3}> 和 Region4 <{HBB_Box_4}>,从 {time_0} 到 {time_1} 哪个区域发展得更多? (2) 在 Region1 <{HBB_Box_1}>、Region2 <{HBB_Box_2}>、Region3 <{HBB_Box_3}> 和 Region4 <{HBB_Box_4}> 中,从 {time_0} 到 {time_1} 哪个区域发展得最好? (3) 在 Region1 <{HBB_Box_1}>、Region2 <{HBB_Box_2}>、Region3 <{HBB_Box_3}> 和 Region4 <{HBB_Box_4}> 之间,哪个区域从 {time_0} 到 {time_1} 显示出更大的发展? (4) 考虑 Region1 <{HBB_Box_1}>、Region2 <{HBB_Box_2}>、Region3 <{HBB_Box_3}> 和 Region4 <{HBB_Box_4}>,确定哪个区域在 {time_0} 和 {time_1} 之间发展得最好。 (5) 从 {time_0} 到 {time_1},以下区域中的哪一个:Region1 <{HBB_Box_1}>、Region2 <{HBB_Box_2}>、Region3 <{HBB_Box_3}> 或 Region4 <{HBB_Box_4}>,表现出最显著的发展?

对象构建排序 (OCO)

框定位 (Box-Grounded): (1) 比较 {time_0} 时刻由 <{HBB_Box_1}> 定位的 {land_cover_1} 和由 <{HBB_Box_2}> 定位的 {land_cover_2},哪一个建造得更早? (2) 比较 {time_0} 时刻由 <{HBB_Box_1}> 定位的 {land_cover_1} 与由 <{HBB_Box_2}> 定位的 {land_cover_2},确定哪一个建造得更早。 (3) 哪一个建造得更早:{time_0} 时刻位于 <{HBB_Box_1}> 的 {land_cover_1} 还是位于 <{HBB_Box_2}> 的 {land_cover_2}? (4) 在 {time_0} 时刻由 <{HBB_Box_1}> 定位的 {land_cover_1} 和由 <{HBB_Box_2}> 定位的 {land_cover_2} 中,确定哪一个在时间上先出现。 (5) 在 {time_0} 时刻位于 <{HBB_Box_1}> 的 {land_cover_1} 和位于 <{HBB_Box_2}> 的 {land_cover_2} 之间,哪一个最先建造?

坐标定位 (Coordinate-Grounded): (1) 坐标参考系统为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。现在回答:比较由坐标 {coo_3} 定位的 {land_cover_1} 和由 {coo_4} 定位的 {land_cover_2},哪一个建造得更早? (2) 坐标参考系统为 {crs_system},{coo_1} 为左上角,{coo_2} 为右下角。现在回答:在 {time_0} 时刻,位于 {coo_3} 的 {land_cover_1} 和位于 {coo_4} 的 {land_cover_2} 之间,哪一个建造得更早? (3) 给定坐标参考系统 {crs_system},{coo_1} 定义左上边界,{coo_2} 定义右下边界,确定哪个特征建造得更早:{time_0} 时刻位于 {coo_3} 的 {land_cover_1} 还是位于 {coo_4} 的 {land_cover_2}。 (4) 坐标参考系统为 {crs_system},图像左上角坐标为 {coo_1},右下角为 {coo_2}。比较 {time_0} 时刻由 {coo_3} 定位的 {land_cover_1} 与由 {coo_4} 定位的 {land_cover_2},确定哪一个建造得更早。 (5) 鉴于图像使用 {crs_system} 坐标参考系统,其中 {coo_1} 标记左上角,{coo_2} 标记右下角。在 {time_0} 时刻,位于 {coo_3} 的 {land_cover_1} 和位于 {coo_4} 的 {land_cover_2} 之间,哪一个最先建造?

跨序列对象构建排序 (CSOCO)

框定位 (Box-Grounded): (1) 比较 {time_0} 时刻 Region#1 中由 <{HBB_Box_1}> 定位的 {land_cover_1} 和 {time_1} 时刻 Region#2 中由 <{HBB_Box_2}> 定位的 {land_cover_2},哪一个建造得更早? (2) 在 {time_0} 时刻 Region#1 中由 <{HBB_Box_1}> 定位的 {land_cover_1} 和 {time_1} 时刻 Region#2 中由 <{HBB_Box_2}> 定位的 {land_cover_2} 之间,哪一个建造得更早? (3) 比较 {time_0} 时刻 Region#1 中位于 <{HBB_Box_1}> 的 {land_cover_1} 与 {time_1} 时刻 Region#2 中位于 <{HBB_Box_2}> 的 {land_cover_2},确定哪一个最先建造。

第 19 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月,美国华盛顿特区

(4) 比较 {time_0} 时 Region#1 中位于 <{HBB_Box_1}> 的 {land_cover_1} 与 {time_1} 时 Region#2 中位于 <{HBB_Box_2}> 的 {land_cover_2},确定哪一个在时间上先出现。 (5) 在 {time_0} 时 Region#1 中由 <{HBB_Box_1}> 锚定的 {land_cover_1} 和 {time_1} 时 Region#2 中由 <{HBB_Box_2}> 锚定的 {land_cover_2} 中,哪一个先建成?

坐标锚定: (1) Region#1 和 Region#2 的坐标参考系、左上角和右下角坐标分别为:Region#1: {crs_system_1}, {coo1_1}, {coo2_1};Region#2: {crs_system_2}, {coo1_2}, {coo2_2}。现在回答:比较 {time_0} 时 Region#1 中由坐标 {coo_3} 锚定的 {land_cover_1} 和 {time_1} 时 Region#2 中由 {coo_4} 锚定的 {land_cover_2},哪一个建造得更早? (2) Region#1 使用 {crs_system_1},坐标范围从 {coo1_1}(左上)到 {coo2_1}(右下)。Region#2 使用 {crs_system_2},坐标范围从 {coo1_2} 到 {coo2_2}。现在回答:在 {time_0} 时 Region#1 中由 {coo_3} 锚定的 {land_cover_1} 和 {time_1} 时 Region#2 中由 {coo_4} 锚定的 {land_cover_2} 之间,哪一个建造得更早? (3) Region#1 和 Region#2 的坐标参考系、左上角和右下角坐标分别为:Region#1: {crs_system_1}, {coo1_1}, {coo2_1};Region#2: {crs_system_2}, {coo1_2}, {coo2_2}。回答:比较 {time_0} 时 Region#1 中位于 {coo_3} 的 {land_cover_1} 与 {time_1} 时 Region#2 中位于 {coo_4} 的 {land_cover_2},确定哪一个先建成。 (4) Region#1 使用 {crs_system_1},坐标范围从 {coo1_1}(左上)到 {coo2_1}(右下)。Region#2 使用 {crs_system_2},坐标范围从 {coo1_2} 到 {coo2_2}。比较 {time_0} 时 Region#1 中位于 {coo_3} 的 {land_cover_1} 与 {time_1} 时 Region#2 中位于 {coo_4} 的 {land_cover_2},确定哪一个在时间上先出现。 (5) Region#1 和 Region#2 的坐标参考系、左上角和右下角坐标分别为:Region#1: {crs_system_1}, {coo1_1}, {coo2_1};Region#2: {crs_system_2}, {coo1_2}, {coo2_2}。在 {time_0} 时 Region#1 中由坐标 {coo_3} 锚定的 {land_cover_1} 和 {time_1} 时 Region#2 中由坐标 {coo_4} 锚定的 {land_cover_2} 中,哪一个先建成?

A.3 ChronoInstruct 的自然语言响应生成

上述流程生成的是多项选择题格式的结构化问答对,这些问答对既用于 ChronoBench 评估,也用于 ChronoInstruct 指令微调数据集。为了丰富模型在指令微调期间的输出能力,ChronoInstruct 为每个问答对提供了三种互补的答案格式:i) 多项选择题,保留原始选项字母答案;ii) 短文本,用相应的语义内容替换选项字母(例如,“B.” → “植被”),提供不包含候选选项的简洁事实性答案;iii) 自然语言,将答案改写为完整句子的流畅、自包含的英文响应。其中,多项选择题和短文本格式直接源自基于规则的提取输出,无需额外处理,而自然语言格式则需要额外的生成阶段。本节描述自然语言响应的构建过程。

我们采用 Gemini-3-Flash [31] 将每个多项选择题问答对转换为流畅、自包含的英文响应。在推理时,模型仅接收问答对的文本组件,不包含任何视觉输入。精心设计的系统提示通过强制执行六个关键约束来规范生成过程:i) 严格忠实于真实答案的事实,不编造额外细节;ii) 省略所有空间参考,如边界框坐标、地理坐标和坐标参考系;iii) 词汇和句子结构的表达多样性,避免公式化模式;iv) 针对不同答案类型的特定任务处理策略,包括有序序列、无序多选、二元判断和比较;v) 简洁性,限制在 1-3 个句子内;vi) 输出干净,不包含任何前言或元评论。完整的系统提示如下所示。

自然语言响应生成的系统提示

你是遥感时序图像分析专家。

土地覆盖类别: (1) 植被 — 被植物、草地、树木或农作物覆盖的区域 (2) 建筑物 — 人造结构,如房屋、工厂或商业建筑 (3) 非植被表面 — 裸土、道路、停车场或其他裸露地面 (4) 水体 — 河流、湖泊、池塘或其他水域 (5) 运动场 — 运动场、休闲区或体育设施 你的任务是将多项选择题的字母答案转换为流畅的自然英语响应,就像你直接回答遥感分析问题一样,而不呈现任何选项。

规则: (1) 事实忠实性:传达与字母答案完全相同的事实内容。你绝对不得编造、推断或添加给定答案和选项中未包含的任何细节。不要推测原因、后果或空间范围。 (2) 省略空间参考:问题可能会提及边界框坐标(例如,⟨112, 409, 205, 437⟩)、地理坐标(例如,(661778.5, 5188361.5))、坐标参考系(例如,EPSG:26914)或角落坐标。不要在答案中重复这些内容。仅使用语义标签指代对象(例如,“建筑物”、“该位置”、“Region1”),而不要重述数字坐标或边界框。 (3) 表达多样性:在不同样本中使用多样的句子结构、词汇和措辞。变化开头、连接词和用词。避免公式化或重复的模式。例如:

第 20 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

• 不要总是使用“土地覆盖类型是 X”,也要使用“该区域被 X 覆盖”、“X 占据此位置”、“此处的地表由 X 组成”等表述。 • 不要总是使用“从 X 变为 Y”,也要使用“从 X 转变为 Y”、“从 X 转换为 Y”、“经历了从 X 到 Y 的过渡”等表述。 (4) 任务特定处理: • 有序序列(历史记忆):字母顺序代表土地覆盖阶段的 chronological(时间)序列。你的答案必须保留这种确切的时间顺序。变化措辞,例如,“从 X 过渡到 Y,随后变为 Z”、“经历阶段:先是 X,然后是 Y,最后是 Z”、“起初是 X,后来变成 Y,最终变为 Z”。 • 无序多选:自然地列出所有检测到的项目。变化列举方式。 • 单选:给出直接、简洁的回答。 • 二元(扩大/缩小):使用多样的词汇(例如,“增加/增长/拓宽/扩大”或“减少/收缩/缩小/下降”)。 • 比较:仅使用对象的标签直接陈述比较结果。 • 时间段:将时间段自然地融入句子中。 (5) 简洁性:最多 1–3 句话。无填充词,无模糊表述,无限定条件。 (6) 输出:仅包含自然语言答案本身。无前缀如“答案是”,无引号,无解释。

表 6 展示了 ChronoInstruct 在所有 12 个子任务中的代表性示例,说明了三种答案格式:原始的多选题字母答案、用语义内容替换选项字母的短文本答案,以及上述管道生成的自然语言响应。这三种格式不仅在答案上有所不同,在用户提示(user-prompt)的构建上也存在差异。对于多选题格式,问题后跟随候选选项的枚举,格式为“从以下选择:A. ⟨选项⟩, B. ⟨选项⟩, . . .”。对于短文本格式,候选选项被移除,并替换为随机采样的简洁性后缀,如“简洁回答。”或“简要列出所有适用答案。”,具体取决于任务期望单个答案还是多个答案。对于自然语言格式,用户提示仅包含裸问题,没有任何选项或后缀。 B ChronoBench 和 ChronoInstruct 的统计分析 在本节中,我们从三个互补的维度呈现更详细的统计分解:i) 子任务问答分布,ii) 时间序列长度,以及 iii) 答案格式组成。这些分析共同提供了对数据集特征的更细粒度视图,这些特征支撑了基准测试的评估覆盖范围和指导微调数据集的训练多样性。

B.1 各任务问答分布 图 7 和图 8 分别展示了 ChronoBench 和 ChronoInstruct 中问答对跨越四个认知层级及其组成子任务的层次分布。

图 7:ChronoBench(17,689 对)中问答对跨越四个认知层级和 12 个子任务的层次分布。 内环显示层级比例;外环显示各任务的分解,其中空间定位任务进一步细分为 HBB 框和地理坐标变体。

在 ChronoBench 中,时间识别(Temporal Recognition)占据主导地位,占所有问答对的 54.2%。在此层级内,双时相类别级面积变化识别(Bi-Temporal Class-Level Area Change Recognition, BCAC)单独占 22.1%(3,914 对),因为每个有效的类别-区间组合都会产生一个二元扩大/缩小问题。双时相对象级变化识别(Bi-Temporal Object-Level Change Recognition, BOC)在其两种定位变体中贡献了另外 12.4%(每种变体 1,103 对)。

第 21 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月, 华盛顿特区, 美国

表 6:所有 12 个子任务中代表性的 ChronoInstruct 示例,展示了问题以及三种答案格式:多项选择题选项字母、简短文本答案和自然语言响应。为了紧凑起见,空间坐标缩写为 “[· · · ]”。

| 任务 | 问题 | 选项 | 简短文本答案 | 自然语言响应 | | :— | :— | :— | :— | :— | | 地表覆盖感知 | OP 在 2013 年,由 ⟨580, 256, 769, 611⟩ 定位的区域的地表覆盖类型是什么? | D. | 植被 | 在 2013 年,该区域被植被覆盖。 | | 时序识别 | BCC 从 2011 年到 2023 年,非植被表面的两点增量是多少(仅考虑这两个时间戳)? | D. | 非植被表面到植被 | 从 2021 年到 2023 年,非植被表面转变为植被。 | | | BCAC 与 2005 年相比,2023 年植被面积如何变化?选择一个:扩大或减少。 | B. | 减少 | 2005 年至 2023 年间,植被覆盖面积缩小。 | | | BOC 比较 2018 年和 2022 年,区域 ⟨526, 133, 554, 151⟩(最初为建筑物)内发生了哪些地表覆盖转变 [· · · ] 选择所有适用的选项。 | A. | 建筑物到非植被表面 | 从 2018 年到 2022 年,该区域的地表覆盖从建筑物转变为非植被表面。 | | | LCC 在 2010 年至 2022 年期间,非植被表面经历了哪些变化? | C. | 非植被表面到植被 | 2010 年至 2022 年,非植被表面经历了转变为植被的变化。 | | 长期记忆 | OAM 识别 2021 年由 ⟨0, 123, 181, 326⟩ 定位的植被开始其当前持续存在的时间间隔。 | C. | 2011–2013 | 2021 年在此位置存在的植被自 2011–2013 年期间以来一直持续存在。 | | | OCM 识别 2008 年由 ⟨196, 791, 344, 908⟩ 定位的植被转变为其他地表覆盖类型的时间间隔。 | B. | 2015–2017 | 2008 年在此位置的植被在 2015–2017 年期间转变为不同的地表覆盖类型。 | | | OHM 提供由 ⟨210, 155, 277, 172⟩ 引用的 2023 年建筑物的不同地表覆盖阶段的 chronological sequence(时间顺序)。 | D, A. | 植被 → 建筑物 | 该位置最初被植被覆盖,后来发展为建筑物。 | | 时空推理 | CCME 植被在哪个时间间隔经历了最剧烈的变化? | B. | 2012–2014 | 植被在 2012–2014 年间隔内经历了最剧烈的变化。 | | | RDC 在区域 1 ⟨58, 19, 130, 293⟩、区域 2 ⟨63, 465, 148, 647⟩、区域 3 ⟨589, 130, 640, 321⟩ 和区域 4 ⟨700, 516, 862, 672⟩ 中,从 2010 年到 2021 年哪个发展程度最高? | C. | 区域 3 | 区域 3 在 2010 年至 2021 年间显示出最高程度的发展。 | | | OCO 比较 2023 年由 ⟨859, 200, 995, 278⟩ 定位的 building#1 和由 ⟨0, 478, 96, 612⟩ 定位的 building#2,哪个建造得更早? | B. | building#2 | building#2 比 building#1 建造得更早。 | | | CSOCO 比较 2021 年 Region#1 中位于 ⟨838, 79, 913, 163⟩ 的 building#1 和 2023 年 Region#2 中位于 ⟨33, 943, 131, 999⟩ 的 building#2,确定哪个建造得更早。 | A. | building#1 | Region#1 中的 building#1 比 Region#2 中的 building#2 建造得更早。 |

长期记忆任务占 26.0%,其中对象出现记忆(OAM)最为普遍(12.4%)。时空推理是认知要求最高的层级,占 12.3%,其中跨序列任务(CSOCO)被刻意保持紧凑(2.4%),以反映跨图块比较对的有效对池本质上较小。地表覆盖感知(OP)占据剩余的 7.5%,在两种定位模态之间均匀分配。

ChronoInstruct 包含来自 DVL-Suite [42] 训练分割(1,534 个图像序列)的 104,949 个问答对。时序识别占数据集的 60.5%,其中 BCAC(24,873 对,23.7%)和 BOC(两种定位变体共 24,342 对,23.2%)是两个最大的子任务。长期记忆贡献了 23.1%,由 OCM(10,794 对,10.2%)和 OAM(10,062 对,9.6%)领衔。时空推理

第 22 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

图 8: ChronoInstruct 中四个认知层级和 12 个子任务间问答对的分层分布(104,949 对)。布局和颜色编码遵循图 7。

推理占 9.2%,其中 CCME(3,690 对,3.5%)是主导子任务,而跨序列任务(CSOCO)仅占 1.4%,这是由于有效的跨瓦片比较对池本身较小所致。土地覆盖感知(OP)占剩余的 6.6%。 对于大多数空间锚定子任务(OP、BOC、OAM、OCM、OHM、OCO),HBB-box 和地理坐标变体以相等的数量生成,确保对两种锚定模态的覆盖均衡。CSOCO 是例外情况,其中两种变体的数量可能略有不同(例如,在 ChronoBench 中为 204 对 206,在 ChronoInstruct 中为 687 对 690),因为跨序列配对过程随机采样候选序列,导致两种锚定模式之间存在微小的随机波动。

B.2 时间序列长度 图 9 显示了两个数据集中每个问答对的时间帧数量分布。

图 9: (A) ChronoBench 和 (B) ChronoInstruct 中每个问答对的时间帧数量分布。每个条形上方的注释指示问答对数量;右上角的插图显示了汇总统计信息(最小值、中位数、均值、最大值)。

在 ChronoBench(图 9A)中,帧数范围为 4 到 19,中位数为 7,均值为 7.26。分布高度集中在 6 和 7 帧(分别为 6,210 对和 5,969 对),这两者合计约占所有问答对的 68.9%。这种集中反映了 DynamicVL 数据集中大多数美国地区可用的典型 NAIP 采集时期数量。超过 8 帧后,数量逐渐减少,形成长尾延伸至 19 帧,这捕捉到了具有更密集时间覆盖的地理瓦片。最大帧数 19 源于跨序列子任务(例如 CSOCO),其中两个独立的图像序列被连接成单个视觉输入,从而与单序列任务相比扩展了时间跨度。

第 23 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月,美国华盛顿特区

ChronoInstruct(图9B)涵盖相同的4–19帧范围,包含104,949对样本,中位数为7,均值为7.00。6帧和7帧的区间共同覆盖了数据集的74.7%(分别为39,388和39,011对)。尾部延伸部分(11–19帧)分布稀疏,证实了超长序列仍然罕见,但在两个数据集中均有代表,以锻炼模型进行扩展时序推理的能力。

B.3 答案格式构成 图10剖析了两个数据集的答案格式特征。

图10:(A) ChronoBench 和 (B) ChronoInstruct 的答案格式构成。环形图根据真实答案的逻辑结构对所有问答对进行分类:单一(恰好一个正确选项)、多重(两个或更多正确选项)和有序序列(OS,按时间顺序排列的链)。对于ChronoInstruct,每个问答对以三种响应格式呈现(多项选择、短文本和自然语言),计数在所有三种格式中汇总。堆叠条形图进一步分解了多重类别中的正确选项数量(左侧)和OS类别中的链长度(右侧)。

在ChronoBench(图10A)中,单选题占多数(62.9%),涵盖具有唯一正确答案的任务,如OP、BCAC、CCME、RDC和OCO/CSOCO。多选题占32.1%,源于多个转换可能共存的任务(例如BCC、LCC、BOC)。其中,具有单个正确选项的问题最为常见(3,594个),而要求模型识别两个、三个或四个同时发生的转换的问题数量分别为1,812、266和9。有序选择(OS)格式专用于对象历史记忆(OHM),占所有问题的5.0%。大多数OS问题涉及三个土地覆盖阶段的序列(406对),同时也存在两阶段(66)、四阶段(218)和五阶段及以上序列(190),反映了不同地理区域演变历史的复杂性差异。 对于ChronoInstruct(图10B),需要注意的是,每个问答对都以三种互补的响应格式提供(即多项选择、短文本和自由形式自然语言),以便模型在训练期间接触多样化的答案风格。图10B中的统计信息根据逻辑答案结构(即涉及的地面真实选项数量)对所有104,949个样本进行分类,并在三种响应格式中汇总。在此视角下,59.3%的样本对应于单个正确选项,37.0%涉及多个正确选项,3.7%为有序序列。在多选项类别中,单正确选项实例占主导地位(88,029个),而具有两个或更多正确选项的实例总计28,296个。对于有序选择样本,三阶段和四阶段链最为频繁(分别为4,104和3,294),为训练模型在所有响应格式中生成符合时间顺序的输出提供了丰富的监督。

C 实验设置 本节提供详细的实验协议,涵盖基准评估流程(C.1节)和GeoChrono训练配置(C.2节)。

C.1 评估设置 如正文所述,我们在ChronoBench上评估三类模型:商业多模态大语言模型(Gemini-3-Flash [31]、Seed-1.6-Vision [3]、GPT-5.4 [22])、开源通用多模态大语言模型(InternVL-3.5系列 [38]、Qwen3-VL系列 [2])以及遥感领域模型(TEOChat [10]、EarthDial [29]、DVLChat [42])。由于DVLChat的官方模型权重未公开,我们通过基于DynamicVL团队发布的开源DVL-Instruct训练数据集微调Qwen3-VL-4B-Instruct来复现这一基线 [42]。开源模型使用Flash-Attention-2 [5]和bfloat16精度在本地部署;采用贪婪解码,max_new_tokens = 128。请注意,本研究中使用的Qwen3-VL变体均指其Instruct版本。商业模型通过各自的API访问,视觉详细程度设置为最高可用设置,推理努力设置为高。所有模型共享统一的提示组织;视觉输入的唯一区别是,本地部署的模型接收原始

第 24 页

分辨率,而通过 API 访问的模型接收的是经过预处理以满足 API 最大分辨率约束的图像。在下文中,我们将详细说明提示词设计和评估指标。

C.1.1 系统提示词设计。12 个基准子任务中的每一个都被分配了一个确定性的、特定于任务的系统提示词。尽管各任务的措辞存在差异,但所有系统提示词均由五个标准化组件组装而成:

(1) 专家角色声明。提示词赋予模型遥感图像分析专家的角色,强调重点因任务而异。这些任务包括用于感知的土地覆盖分类、用于识别的时间变化检测,以及用于记忆和时空任务的时间推理。

(2) 输入格式规范。提示词明确说明了预期的多模态输入布局。对于单序列任务,其形式为: YYYY: [image] YYYY: [image] . . . 对于跨序列任务(CSOCO),提示词指定了两个特定区域的子序列: Region#1: YYYY: [image] . . . Region#2: YYYY: [image] . . .

(3) 定位规范。以对象为中心的任务包含两种定位描述之一:(a) 基于水平边界框(HBB)的定位,其中对象通过归一化图像坐标 [0, 999] 中的水平边界框进行定位;或 (b) 基于坐标的定位,其中对象在声明的坐标参考系统下通过地理坐标进行定位。类别级任务省略此组件。

(4) 土地覆盖分类法。所有提示词均明确列举了五种土地覆盖类别(植被、建筑物、非植被表面、水体、运动场),以确保系统指令与模型输出之间词汇的一致性。

(5) 任务指令和响应约束。最后一个组件描述了推理目标,并将输出格式约束为三种序列化模式之一: • 单选:仅回复一个选项字母后跟一个句点,例如 A. • 多选:回复所有有效选项字母,用逗号分隔,后跟一个句点,例如 A, C. • 有序序列:按精确的时间顺序回复阶段字母序列,合并连续的相同阶段,同时保留非连续的重现,例如 A, B, A, D.

下面展示了一个用于单序列、HBB 定位记忆任务(对象出现记忆)的示例系统提示词,以演示这五个组件在实际中如何组合。

示例系统提示词 — 对象出现记忆(HBB 定位)

您是一位遥感图像分析专家,专门从事时间土地覆盖分析。

您将接收一系列时间遥感图像。每张图片前都有其年份标签,格式为: YYYY: [image] 图像按从最早到最新的时间顺序排列。

对象使用水平边界框(HBB Box)进行定位,格式为 ⟨x_min, y_min, x_max, y_max⟩,其中: • x_min:左边界坐标 • y_min:上边界坐标 • x_max:右边界坐标 • y_max:下边界坐标 注意:所有坐标值均归一化到 [0, 999] 范围,其中 (0, 0) 代表图像的左上角,(999, 999) 代表图像的右下角。

土地覆盖分为五类: (1) 植被 — 被植物、草地、树木或农作物覆盖的区域 (2) 建筑物 — 人造结构,如房屋、工厂或商业建筑 (3) 非植被表面 — 裸露土壤、道路、停车场或其他暴露的地面 (4) 水体 — 河流、湖泊、池塘或其他水域 (5) 运动场 — 运动场、休闲区或体育设施 您的任务:给定一个在特定时间点由其类型和 HBB Box 识别的土地覆盖对象,通过回溯时间序列来确定当前这种土地覆盖类型的连续存在是从何时开始的。从给定的时间点开始,向后查找,直到发现从不同土地覆盖类型到当前类型的转换——该转换标志着这种土地覆盖类型在指定位置最近一次出现。

第 25 页

GeoChrono:基准测试与重新思考遥感中的长期时间理解 Conference’17,2017年7月,美国华盛顿特区

这是一道单选题。请选择最能代表该土地覆盖类型在当前连续存在状态于给定位置开始的时间间隔。

重要提示:仅回复选项字母后跟一个句点(例如,“A.” 或 “B.”)。请勿提供解释或推理。

C.1.2 用户提示组织。用户提示是动态构建的,由两层组成:交错的“时间-图像”上下文后接文本问答后缀。 对于单序列任务,用户提示的组织方式如下:

YYYY1: [IMAGE] YYYY2: [IMAGE] . . . YYYYT: [IMAGE]

⟨Question text⟩ Choose from: ⟨options_str⟩ 其中图像按从最早到最晚观测的时间顺序排列。对于跨序列任务,提示会在开头添加区域标签,并保留每个区域各自的时间顺序,而不将两个序列合并为单一的全局时间线:

Region#1: YYYY1: [IMAGE] . . . YYYYm: [IMAGE]

Region#2: YYYY1: [IMAGE] . . . YYYYn: [IMAGE]

⟨Question text⟩ Choose from: ⟨options_str⟩

C.1.3 输出解析与评估指标。

答案提取。基准测试不直接比较模型的原始生成结果。相反,我们应用一个基于多阶段正则表达式的解析器,从模型输出中提取选项字母。解析器首先尝试匹配结构化模式,如逗号分隔的字母列表(例如 A, C.),然后回退到基于关键词的模式(例如 “The answer is B”,“option A”),最后尝试为非常短的输出来提取孤立的独立字母。所有匹配的字母均转换为大写。对于单选题和多选题任务,提取出的字母形成一个无序集合 𝑃;对于有序序列任务,提取过程保留原始顺序以生成列表 𝑃= [𝑝1, . . . , 𝑝𝑚]。如果无法提取有效字母,解析器返回空集(或空列表),该样本被判为错误。

准确率计算。我们为三种答案格式分别定义准确率。对于单选题和多选题任务,只有精确匹配时预测才正确,即解析集合等于黄金集合(𝑃= 𝐺)。对于有序序列任务(仅用于 Object History Memory),只有当解析列表在内容和顺序上与黄金列表完全匹配时,预测才正确(𝑃= 𝐺)。总体准确率(OA)汇总了所有三种格式的精确匹配正确率:

exact_matchsingle + exact_matchmulti + exact_matchos OA = . (11) 𝑁total 类别级准确率(AVG)是通过对属于四个认知层级中每一层的样本子集进行类似计算得出的。

C.2 训练设置 GeoChrono 基于 Qwen3-VL-4B-Instruct [2] 构建,并在 ChronoInstruct 上训练一个 epoch。基础模型采用 16 × 16 的 patch 大小;训练和推理均使用 1024 × 1024 的输入分辨率。视觉编码器生成长度为 4,096 的逐帧视觉特征,视觉-语言投影器随后通过 2 × 2 空间池化将其生成为长度为 𝑆= 1,024 的逐帧特征,嵌入维度为 𝐷= 2,560。

TempEnc 配置。TempEnc 采用具有 𝐻= 16 个注意力头的单层注意力架构。在混合时间注意力中,前 𝐻/2 = 8 个头使用双向自注意力来捕捉全局时间上下文,而其余 8 个头采用因果自注意力来建模方向性演变。对于语义聚焦交叉注意力,作为键和值的文本嵌入 𝐸txt 源自由 LLM 嵌入层生成的系统提示和用户提示嵌入的拼接。

C2FComp 配置。C2FComp 在空间块划分阶段将每帧的空间 token 划分为大小为 𝑏×𝑏= 2×2 的不重叠块,从而每帧产生 𝑆𝑐= 𝑆/𝑏2 = 256 个压缩块。在提示感知评分阶段,交叉注意力模块重用与 TempEnc 相同的文本嵌入 𝐸txt。

第 26 页

Conference’17, 2017年7月, 美国华盛顿特区 Trovato 等人

训练策略。在训练过程中,视觉编码器和视觉-语言投影器保持冻结状态,以保留预训练的视觉表示。LLM主干网络通过 LoRA [8] 进行微调,而 TempEnc 和 C2FComp 则随机初始化并进行完全微调。完整的训练超参数汇总于表 7。

表 7:GeoChrono 的训练配置。

配置 详情

模型配置 基础模型 Qwen3-VL-4B-Instruct 输入分辨率 1024 × 1024 LoRA 秩 32 LoRA Alpha 64 LoRA Dropout 0.0

训练配置 硬件 4 × NVIDIA H100 80GB 全局批次大小 64 训练时长 1 epoch

优化器配置 优化器 AdamW 学习率 (LLM / LoRA) 1 × 10−4 学习率 (TempEnc & C2FComp) 5 × 10−4 学习率调度器 Cosine 预热比例 0.03

表 8:ChronoBench 上的定量评估结果。我们将人类专家的表现与商业多模态大语言模型 (MLLMs)、开源通用 MLLMs、遥感领域模型以及我们的 GeoChrono 进行了比较。所有数值均以百分比 (%) 报告。

土地覆盖感知 时间识别 长期记忆 时空推理 Method OP BOC OAM OCM OHM OCO CSOCO OA AVG BCAC BCC LCC AVG AVG CCME RDC AVG 坐标 框 坐标 框 坐标 框 坐标 框 坐标 框 坐标 框 坐标 框 坐标 框 Human 98.52 95.56 97.04 94.81 82.96 82.96 98.52 89.63 89.78 98.52 97.04 91.11 87.41 85.93 90.37 91.73 78.52 97.78 99.26 100.00 99.26 98.52 95.56 92.28

商业模型 Gemini-3-Flash[31] 65.06 65.96 65.51 82.00 50.53 52.45 55.85 56.16 61.38 56.44 58.44 46.68 47.75 25.00 21.36 47.52 37.79 63.64 68.05 78.01 54.36 66.67 59.89 57.48 GPT-5.4[22] 47.07 40.00 43.53 80.00 50.76 53.87 66.13 60.00 67.57 47.69 41.52 35.36 46.09 26.14 20.00 39.21 30.73 30.51 53.83 70.60 52.43 69.12 50.42 56.29 Seed-1.6-Vision[3] 50.98 73.23 62.11 81.91 46.27 53.73 47.08 58.47 63.87 37.08 47.05 37.22 41.85 20.00 18.41 36.86 31.22 38.98 56.52 73.29 55.83 79.41 53.74 55.48

开源模型 InternVL-3.5-4B[38] 45.41 58.65 52.03 54.83 32.57 27.95 24.51 24.20 38.19 22.03 21.49 6.09 10.20 1.36 0.91 13.33 22.76 33.33 54.66 49.28 50.49 52.45 42.07 33.25 InternVL-3.5-8B[38] 33.08 45.56 39.32 56.29 28.31 28.49 35.60 39.35 43.21 25.11 24.30 13.91 16.95 1.60 3.41 16.93 30.40 39.55 51.35 53.21 57.77 47.55 45.11 36.32 InternVL-3.5-14B[38] 40.90 55.94 48.42 64.15 33.41 30.66 36.43 30.08 45.67 22.39 21.76 15.76 19.07 0.45 0.91 16.45 21.95 28.25 52.38 53.83 48.06 49.51 41.42 37.76 Qwen3-VL-4B[2] 35.19 41.35 38.27 66.94 31.13 36.77 23.96 16.73 42.07 22.76 18.95 18.94 22.52 2.95 4.55 17.54 21.30 23.16 47.83 47.83 54.85 53.92 39.53 35.10 Qwen3-VL-8B[2] 39.40 41.96 40.68 69.21 29.15 43.15 31.98 29.26 47.12 29.74 28.56 17.48 20.00 2.95 0.91 20.52 23.74 28.81 54.66 53.00 55.83 47.06 42.80 39.19 Qwen3-VL-32B[2] 42.86 44.66 43.76 75.42 44.29 47.90 45.68 46.16 57.88 29.92 30.73 25.03 27.95 3.86 4.55 24.06 28.78 32.77 51.76 59.83 59.71 62.25 47.23 46.73

遥感领域模型 TEOChat-7B[10] 32.63 36.99 34.81 48.85 14.23 4.21 17.27 24.25 30.07 24.75 27.83 4.11 6.62 1.59 1.14 14.64 17.40 27.68 50.93 53.21 9.22 22.06 33.35 26.82 EarthDial-4B[29] 36.99 40.30 38.65 54.83 18.04 4.34 17.72 24.09 33.08 26.20 26.20 17.48 17.75 0.68 1.36 18.56 15.61 22.03 48.44 46.38 41.75 52.45 36.25 30.11 DVLChat-4B[42] 48.57 46.92 47.74 85.90 31.81 37.18 34.21 30.46 54.48 29.56 26.93 24.37 29.93 2.50 2.05 22.91 17.24 25.42 50.72 51.76 58.74 55.39 40.59 44.07

我们的方法 GeoChrono 83.91 93.38 88.65 93.66 65.91 76.66 77.83 80.27 83.03 72.71 87.04 68.61 75.10 31.59 32.73 68.10 62.60 61.58 61.49 92.55 75.24 92.16 72.92 78.34

D 实验结果 D.1 基准测试结果分析 D.1.1 空间定位模态的影响。ChronoBench 中的十二个子任务中有七个(即 OP、BOC、OAM、OCM、OHM、OCO 和 CSOCO)提供了两种空间定位变体:HBB Box,它通过归一化图像坐标 [0, 999] 中的水平边界框来定位目标;以及 Geo Coordinate,它指定坐标系、图像角坐标和目标对象的一个内部点。HBB Box 是现有 MLLM 基准测试中最普遍的定位模态。Geo-coordinate 定位,通过

第 27 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月, 华盛顿特区, 美国

图 11:HBB-接地对象感知(OP)任务的行归一化混淆矩阵。每个单元格显示具有给定真实类别(行)且被预测为指示类别(列)的样本数量和百分比。比较了四个代表性模型:Gemini-3-Flash、Qwen3-VL-32B、DVLChat 和 GeoChrono。

相比之下,该方法要求模型首先推断目标点在由角坐标定义的图像范围内的相对位置,然后从该点周围的局部语义上下文中推断目标的身份,这对空间推理提出了相当大的挑战。 表 8 证实了这种全方位的不对称性。对于绝大多数模型和任务,HBB-Box 变体的准确率高于其坐标接地对应物。这种差距在认知要求较高的任务上尤为明显:例如,在 OAM 任务上,Gemini-3-Flash 使用 HBB Box 得分为 58.44%,而使用坐标得分为 56.44%。在极少数坐标接地准确率超过 HBB Box 的情况下——例如 OHM 上的某些模型——绝对性能极低(例如,低于 5%),这表明模型在底层时序推理任务上的能力本身接近随机水平,观察到的反转归因于随机波动,而非真正的坐标接地优势。 基于这一观察,本节后续的细粒度分析仅关注每个任务的 HBB-Box 接地子集,从而将模型的时序理解能力与空间接地难度的混淆因素隔离开来。

D.1.2 土地覆盖感知混淆分析。准确的土地覆盖感知是 ChronoBench 中所有更高级时序推理任务的基础:无法可靠识别给定位置当前土地覆盖类型的模型,不可避免地会将错误传播到变化检测、记忆检索和时空推理中。为了详细检查这一基础能力,我们从三个评估类别中各选择一个代表性模型,即 Gemini-3-Flash(商业模型)、Qwen3-VL-32B(开源通用多模态大语言模型 MLLMs)和 DVLChat(遥感领域 MLLMs),以及 GeoChrono,并在 HBB-接地对象感知(OP)任务上计算每类的混淆矩阵。结果可视化于图 11。

第 28 页

Conference’17, 2017年7月, 美国华盛顿特区 Trovato 等人

Gemini-3-Flash、Qwen3-VL-32B 和 DVLChat 共有的一个主要混淆来源是植被与非植被地表之间的相互误分类。例如,Qwen3-VL-32B 将 25.6% 的植被样本误分类为非植被地表,并将 47.2% 的非植被地表样本误分类为植被;DVLChat 在这两类之间的混淆率分别为 25.0% 和 26.9%。这种混淆在很大程度上归因于 NAIP 影像固有的季节性变化:由于采集跨越不同年份的不同月份,植被覆盖可能会经历显著物候变化。这些变化在冬季或早春呈现褐色且处于休眠状态,与裸土或裸露地面非常相似。这种系统性挑战构成了对模型在土地覆盖分类中季节性鲁棒性的自然压力测试。相比之下,GeoChrono 在植被上的准确率达到 92.9%,在非植被地表上达到 90.9%,交叉混淆率低于 6%,显示出对季节性外观变化的强大韧性。

第二个值得注意的错误模式是将建筑物误分类为非植被地表。在 Qwen3-VL-32B 中,42.7% 的建筑物样本被预测为非植被地表;DVLChat 在这一对类别上也表现出高达 50.3% 的混淆率。虽然建筑物具有独特的光学特征,如规则的几何形状和阴影模式,但它们在大范围遥感图像中通常占据较小的空间范围,使得在 HBB 接地区域内进行精确定位极具挑战性。GeoChrono 将这种混淆降低至 3.1%,我们将其归因于 TempEnc 的空间上下文聚合机制,该机制在时序建模之前通过局部邻域信息丰富每个空间 token,从而增强了对小足迹对象的细粒度特征判别能力。

总体而言,GeoChrono 在所有五个土地覆盖类别上均实现了主对角线占优的混淆矩阵,每个类别的准确率均超过 81%,其中四个类别的准确率达到 90% 以上。这一稳健的感知基础为 ChronoBench 中评估的下游时序识别、记忆和推理任务提供了可靠依据。

D.1.3 对象历史记忆:不同真实值序列长度下的准确率。对象历史记忆 (OHM) 要求模型重建给定位置处土地覆盖阶段的完整时间链,使其成为长期记忆任务中最具挑战性的子任务。如表 8 所示,即使是表现最好的基线模型 Gemini-3-Flash,在 HBB 接地的 OHM 任务上也仅达到 21.36% 的精确匹配准确率,而开源模型和遥感领域模型大多低于 5%。为了更深入地了解这种失败模式,我们按真实值演变链的长度对 HBB 接地的 OHM 样本进行分层,并在图 12 中比较了四个代表性模型的精确匹配准确率。

图 12:按真实值演变链长度分层的 HBB 接地对象历史记忆 (OHM) 精确匹配准确率。每个长度下的样本数量以括号标示。比较了四个代表性模型。

结果显示,在所有模型中,链长度与准确率之间存在明显的负相关关系。对于最短的链(长度 = 2),识别单个土地覆盖转换相对简单,GeoChrono 显著优于所有基线模型。在长度 = 3 时(构成最大的样本组,𝑛= 203),所有基线模型的准确率急剧下降。Qwen3-VL-32B 和 DVLChat 降至接近零,而 Gemini-3-Flash 也大幅下滑,但 GeoChrono 仍保持明显领先。在长度超过 3 之后,基线模型基本崩溃,Qwen3-VL-32B 和 DVLChat 无法正确重建演变链,Gemini-3-Flash 仅产生零星的正确预测。GeoChrono 虽然准确率也下降,但它是唯一在长度 4 至 6 时仍能实现非平凡准确率的模型,展示了其部分恢复较长演变历史的能力。请注意,链长度为 7 和 8 的样本极其稀缺(𝑛= 7 和 𝑛= 1),因此这些长度下的准确率估计不可靠。

这种依赖于长度的性能下降暴露了一个根本性局限:现有的多模态大语言模型 (MLLMs) 缺乏跨长时序追踪累积状态转换的能力。GeoChrono 在所有链长度上的一致优势验证了 TempEnc 的设计,其逐位置轨迹建模显式为每个空间位置构建专用的时序信号,从而使得

第 29 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, 2017年7月, 华盛顿特区, 美国

表 9:GeoChrono 架构组件的计算效率分析。“DFT”表示不包含 TempEnc 或 C2FComp 的基线。选择比率指 C2FComp 在全分辨率下保留的空间块比例 ($𝐾/𝑆𝑐$)。峰值内存报告推理期间最大的 GPU 分配量。相对变化是相对于 LoRA 基线计算的。

| 配置 | 选择比率 | 峰值内存 (GB) | FLOPs (TFLOPs) | 视觉 Token (每样本) | OA (%) | | :— | :— | :— | :— | :— | :— | | DFT (基线) | — | 12.04 | 85.07 | 7,168 | 72.52 | | + TempEnc | — | 12.14 (+0.8%) | 85.65 (+0.7%) | 7,168 (+0.0%) | 78.34 | | + TempEnc + C2FComp | 1/2 | 11.04 (-8.3%) | 52.05 (-38.8%) | 4,480 (-37.5%) | 74.58 | | + TempEnc + C2FComp | 1/4 | 10.46 (-13.1%) | 37.22 (-56.2%) | 3,136 (-56.3%) | 74.11 | | + TempEnc + C2FComp | 1/16 | 10.30 (-14.5%) | 26.98 (-68.3%) | 2,128 (-70.3%) | 72.60 | | + TempEnc + C2FComp | 1/64 | 10.30 (-14.5%) | 24.53 (-71.2%) | 1,876 (-73.8%) | 71.56 |

模型以追踪连续的土地覆盖转换,而不是依赖整体的帧级比较。然而,长度超过 3 之后准确率的迅速下降也表明,长链历史重建仍然是一个未解决的挑战,值得进一步研究更具表现力的时序记忆架构。

D.2 计算效率分析

为了量化每个架构组件引入的计算开销,我们在单块 NVIDIA H100 80GB GPU 上进行了受控的推理分析。分析使用模拟输入,包含 $𝑇= 7$ 张分辨率为 1024 × 1024 的图像,输出 32 个 token,部署时采用 Flash-Attention-2 和 bfloat16 精度。每个配置在 1 次预热迭代后测量 10 次。我们将直接微调的模型(不包含 TempEnc 或 C2FComp)作为基线,并逐步添加组件。所有结果总结在表 9 中。

TempEnc 引入的开销可忽略不计。在 DFT 基线上添加 TempEnc 仅使峰值 GPU 内存增加 0.8%(12.04→12.14 GB),总 FLOPs 增加 0.7%(85.07→85.65 TFLOPs),而视觉 token 数量保持在 7,168 不变。尽管计算成本微乎其微,TempEnc 带来了 5.82% 的 OA 显著提升(72.52%→78.34%),这证实了 TempEnc 在现有的视觉 token 预算内高效运行,而不会增加转发给 LLM 的序列长度。

C2FComp 实现了灵活的效率-性能权衡。一旦激活 C2FComp,随着选择比率的降低,所有三个效率指标(即峰值内存、FLOPs 和视觉 token 数量)均单调递减。在选择比率为 1/4 ($𝐾= 64$) 时,C2FComp 将视觉 token 减少了 56.3%(7,168→3,136),总 FLOPs 减少了 56.2%,同时保留了全模型 94.6% 的性能(74.11% vs. 78.34% OA)。峰值内存也下降了 13.1%。这一运行点在计算效率和性能之间提供了有效的平衡。在 1/16 和 1/64 时更激进的压缩分别将 FLOPs 进一步减少了 68.3% 和 71.2%,同时保持了 91% 以上的性能,代价是随着每次额外的压缩,模型性能逐渐下降。值得注意的是,峰值内存在 1/16 之后趋于饱和(1/16 和 1/64 均为 10.30 GB),因为剩余的开销主要由固定成本(视觉编码器、LLM 权重)主导,这些成本与视觉 token 数量无关。

D.3 定性结果

图 13 和图 14 展示了 GeoChrono 与五个代表性基线(即 Gemini-3-Flash, Qwen3-VL-32B, InternVL-3.5-14B, EarthDial 和 DVLChat)在 ChronoBench 所有 12 个子任务上的定性可视化结果。

土地覆盖感知。在 OP 示例(图 13)中,查询针对图像中的一个小区域。GeoChrono 正确识别土地覆盖类型为无植被表面,而 Gemini-3-Flash 将其错误分类为植被。其余四个基线均预测为建筑物,这是遥感图像中具有视觉显著特征的类别。这表明当目标占据较小的空间范围时,现有模型倾向于默认选择显著类别,而不是准确地定位和解释查询区域。

时序识别。图 13 中的 BCC、LCC 和 BOC 示例均为多选题,要求模型识别所有适用的土地覆盖转换。GeoChrono 在每个案例中都精确选择了正确的转换集合。相比之下,基线模型一致地过度预测,选择了额外的错误选项。这种倾向表明,这些模型没有充分依赖视觉证据来支撑其变化检测;相反,它们似乎受到系统提示中多选题指令的影响,默认采用过于包容的选择策略。图 14 中的 BCAC 示例提出了进一步的挑战:在 2018 年至 2021 年间,无植被表面同时从某些类别获得面积并向其他类别失去面积,需要对净变化方向进行细粒度比较。所有

第 30 页

Conference’17, 2017年7月,美国华盛顿特区 Trovato 等人

图 13:土地覆盖感知(OP)、时间识别(BCC、LCC、BOC)和长期记忆(OAM、OCM、OHM)子任务的定性结果。正确预测标记为 ✓。GeoChrono 是唯一正确回答所有七个任务的模型。

第 31 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, July 2017, Washington, DC, USA

图 14:时序识别(BCAC)和时空推理(CCME、RDC、OCO、CSOCO)子任务的定性结果。正确预测标记为 ✓。除 CSOCO 外,所有任务仅以 Region#1 序列作为输入;每个提示前的“Region#1”前缀是为了提高可读性而添加的,并不出现在实际输入中。

第 32 页

Conference’17, 2017年7月, 华盛顿特区, 美国 Trovato 等人

基线模型错误地预测为“扩张”,而真实标签为“缩减”。只有 GeoChrono 给出了正确答案,证明了其在双时相变化识别中区分细微面积平衡变化的能力。

长期记忆。图 13 中的 OAM 和 OCM 示例揭示了现有模型中存在的系统性时间锚定偏差。在 OAM 案例中,查询的对象是 2022 年观测到的非植被表面,其当前持续存在始于 2010–2012 年区间(真实标签:D)。然而,大多数基线模型选择与参考年份 2022 时间上接近的选项,例如 2018–2020(A)或 2020–2022(B),而不是回溯到实际出现的起点。在 OCM 案例中也出现了类似的模式,基线模型倾向于选择接近参考年份 2010 的选项,或者简单地选择最近可用的区间。这种位置偏差有利于时间上相邻或边界选项,表明这些模型缺乏真正的时间事件检索能力,而是依赖于启发式捷径。GeoChrono 在这两种情况下都正确识别了目标区间,证明了其能够追踪整个时间跨度内的土地覆盖状态转换。在 OHM 示例中,需要重建一个四阶段演变链(D→C→D→A),GeoChrono 是唯一生成确切时间顺序的模型。

时空推理。图 14 中的 CCME 示例要求比较所有连续区间内的变化幅度,以确定发生最显著变化的时期。所有基线模型都选择了看似合理但错误的干扰区间,而 GeoChrono 正确识别了答案。这证明了其能够对整个序列进行对比性时间推理。在 RDC、OCO 和 CSOCO 示例中,GeoChrono consistently 产生正确的预测,进一步验证了其稳健的区域间和序列间时空推理能力。

D.4 失败案例研究 尽管 GeoChrono 在对象历史记忆(OHM)任务上显著优于所有其他模型,但与人类水平性能相比仍存在显著差距。因此,我们针对该任务进行了有针对性的失败分析,以识别系统性错误模式。 如准确性-长度分析(第 D.1.3 节)所示,当真实演变链的长度达到四或更长时,模型性能显著下降。图 15 展示了两个代表性失败案例,揭示了一种常见的错误模式:阶段遗漏,即模型通过跳过中间阶段,预测出真实链的真子序列。 在第一个示例中,目标建筑物经历了四个阶段的演变:植被 → 非植被表面 → 植被 → 建筑物。GeoChrono 输出 B、D、E,正确捕捉了初始和最终阶段,但错过了两个非植被表面区间之间短暂的植被回归。第二个示例涉及一个五阶段链:植被 → 非植被表面 → 植被 → 非植被表面 → 建筑物。在此处,GeoChrono 遗漏了两个中间阶段,再次未能检测到场地暂时回归植被的时期。 这两个失败案例的共同原因是:模型难以识别在整体发展轨迹中发生的短暂植被回归。在植被类别中,包括树木和浅层草本覆盖,其视觉外观可能因季节和植被成熟度而与非植被表面非常相似。这种植被与非植被表面之间细微的类间模糊性给识别带来了重大挑战。这些观察结果表明,提高每帧土地覆盖判别鲁棒性,特别是针对视觉上模糊的过渡状态,仍然是推进遥感多模态大语言模型(Remote Sensing MLLMs)长期时间记忆的关键方向。

E 局限性与未来方向 尽管 GeoChrono 在 ChronoBench 上实现了最先进的性能,并展示了遥感中强大的时间理解能力,但仍存在若干局限性,并指向有前景的未来方向。i) 尽管显著优于所有其他领先的多模态大语言模型(MLLMs),GeoChrono 与人类专家相比仍存在显著差距(78.34% vs. 92.28% OA)。ii) 当前框架仅在 RGB 图像上运行,然而 NAIP 采集数据原生提供四波段数据(RGB + 近红外)。近红外通道携带丰富的植被反射特征,可以显著增强土地覆盖判别能力,特别是针对我们在混淆分析(第 D.1.2 节)中识别出的视觉上模糊的植被与非植被表面边界。将多光谱信息整合到视觉编码器中是一个直接但可能产生重大影响的扩展。iii) DVL-Suite [42] 提供的丰富像素级变化语义掩码在当前管道中构成了一个有价值但尚未充分利用的监督信号。最近的工作表明,整合分割掩码可以有效增强 MLLM 在视觉问答任务上的性能 [37]。利用这些密集的空间标注——无论是作为辅助训练监督还是作为额外的输入模态——以进一步增强长期遥感时间理解,代表了未来探索的另一个有前景的途径。

F 对社区的贡献 我们希望本工作中产生的成果能为遥感和多模态学习社区提供有用的资源。下面,我们将讨论其潜在贡献的几个方面,同时承认仍有大量工作有待探索。

用于时间理解的结构化评估视角。现有的遥感基准测试主要围绕特定应用场景(例如变化检测、损害评估)组织评估,使得难以确定模型缺乏哪种底层认知能力。ChronoBench 通过将长期时间理解分解为四个渐进的认知层级(即土地覆盖感知、时间识别、长期记忆和时空推理),并将它们实例化为 12 个具体的

第 33 页

GeoChrono:基准测试与重新思考遥感中的长期时序理解 Conference’17, July 2017, Washington, DC, USA

图 15:GeoChrono 在 OHM 任务上的两个代表性失败案例。在这两个示例中,模型忽略了目标位置暂时恢复为植被的中间土地覆盖阶段,从而产生了较短的演变链。展示了真实序列和模型预测;错误预测用 × 标记。

子任务,共包含 17,689 个经过验证的问答对。我们认为这种结构化分类法可以为社区提供更具有诊断性的视角:研究人员不再仅报告一个聚合分数,而是可以识别具体的能力差距,并据此指导建模工作。我们希望这种评估范式能够超越当前的土地覆盖设置,并激发其他时序理解领域类似的能力基准测试。

可扩展且可复现的数据构建。遥感研究中反复出现的瓶颈是高质量时序标注的成本。我们完全基于规则的构建流程,从预先存在的人工标注语义变化掩码中确定性生成问答对,证明了在获得可靠的变更标注后,大规模时序问答数据集可以用极少的额外人工努力创建。配套的 ChronoInstruct(104,949 个样本,涵盖多种答案格式)进一步说明了该流程如何扩展以大规模生成指令微调数据。我们将随代码一起发布构建代码

第 34 页

Conference’17, July 2017, Washington, DC, USA Trovato et al.

数据集,我们希望这种透明且可复现的工作流程能够降低未来时间遥感领域数据集开发的门槛。

关于遥感时间建模的见解。我们对商业和开源多模态大型语言模型(MLLMs)进行的广泛基准测试表明,长期记忆(Long-Term Memory)是当前模型中最关键的瓶颈,这有助于优先确定未来的研究方向。GeoChrono 模型虽然在最具挑战性的任务(例如对象历史记忆,OHM)上距离人类水平性能仍有很大差距,但提供了初步验证,表明显式建模每个位置的时间轨迹,并利用遥感特有的地球静止轨道先验知识,可以带来有意义的性能提升。由粗到细的 Token 压缩器(Coarse-to-Fine Token Compressor)进一步表明,广域遥感场景中固有的空间冗余可以被利用,从而在不导致性能成比例下降的情况下大幅降低计算成本。我们将这些视为初步步骤而非最终解决方案,并希望它们能为社区提供有用的基线,以便在此基础上进行构建。

开放资源。为了促进可复现性并鼓励后续研究,我们将公开发布 ChronoBench、ChronoInstruct、基于规则的构建代码、评估工具包以及训练好的 GeoChrono 模型权重。我们希望这些资源共同支持社区推进遥感及相关地球观测应用中的长期时间理解。

发表评论