卫星视频也能读懂关系?T-STAR基准与STCL框架解析

快速导读:核心差距在于缺乏专门针对卫星视频时空全景场景图(TPSG)的大规模基准,以及能有效建模身份一致实例轨迹与演化关系的统一框架。

卫星视频为动态地理空间监测提供了前所未有的视角,但当前的研究大多停留在‘看见’物体层面,即目标检测与跟踪,而未能深入‘理解’物体间的交互与演变。T-STAR论文指出,自然视频中的场景图生成(SGG)方法无法直接迁移至卫星视频,主要障碍在于俯视视角、极小目标尺度、弱纹理特征以及复杂的时空交互。

为此,本文提出了T-STAR,这是首个专为卫星视频设计的时空全景场景图(TPSG)生成大规模基准。同时,作者提出了时空协同学习(STCL)框架,旨在联合优化实例的身份一致性与时空关系预测。这不仅是一个数据集的发布,更是对卫星视频结构化认知理解范式的一次重要探索。

英文题目:T-STAR: A Large-Scale Benchmark for Spatio-Temporal Panoptic Scene Graph Generation in Satellite Video

论文出处:arXiv 每日论文精选 · arXiv:2607.21228

原始论文:PDF / 论文页面

对应视频标题:卫星视频也能读懂关系?T-STAR基准与STCL框架解析|推荐指数:★★★★★

这篇论文解决什么问题?

现有的卫星视频数据集,如VISO、SatSOT、SV248S等,主要关注目标检测、分割或跟踪任务,缺乏对物体间关系的标注。即使是一些航拍视频SGG数据集(如AeroEye、CYCLO),其视角与物体尺度也与卫星视频存在显著差异。静态遥感图像SGG数据集(如GRTRD、RSSGD)则完全忽略了时间维度的演变。

在卫星视频中,物体往往非常小且纹理微弱,跨帧关联极易受到遮挡和杂波干扰。此外,关系语义与空间结构及时间演化高度耦合,例如‘飞机停在跑道上’不仅涉及空间位置,还涉及时间上的持续状态。这种复杂性要求模型具备超越单帧观察的推理能力。

自然视频SGG方法通常假设物体具有明显的纹理和较大的尺度,且视角多变。直接应用于卫星视频时,这些方法往往因特征提取不足和时空建模缺失而失效。因此,亟需一个专门针对卫星视频特性的基准和方法来推动该领域的发展。

核心创新

方法概览

核心差距在于缺乏专门针对卫星视频时空全景场景图(TPSG)的大规模基准,以及能有效建模身份一致实例轨迹与演化关系的统一框架。

  • T-STAR数据集定义了细粒度的分类体系,包含39个物体类别和70个关系类别,涵盖自然、人造及尾迹等元素。数据集包含150个视频,34,333帧,标注了超过118万个实例掩码和383万个时空三元组。
  • STCL框架首先通过视频全景解析提取实例特征。这一步骤至关重要,因为它为后续的关系预测提供了高质量的实例级表示,而非传统的边界框特征。
  • 为了解决跨帧身份一致性问题,STCL引入了记忆引导匹配(MGM)。MGM利用历史帧的记忆信息来辅助当前帧的实例匹配,从而在遮挡或外观变化时保持实例轨迹的连续性。
  • 在关系预测阶段,STCL采用空间上下文增强(SCE)来捕捉成对实例之间的局部空间上下文信息。这有助于区分相似但关系不同的物体对,例如区分‘相邻’与‘包含’。
  • 同时,多尺度时序学习(MTL)模块被用来建模不同时间尺度上的依赖关系。这使得模型能够捕捉短期的动态变化以及长期的状态演变,从而更准确地预测时空关系。
  • 最终,STCL联合优化实例身份一致性和时空关系预测,生成完整的时空全景场景图。这种端到端的联合优化策略有助于缓解误差累积问题。

逐图理解论文

方法贡献

方法贡献
Fig. 5. Overall framework for the TPSG task. Given a satellite video sequence, instance features are obtained via video panoptic parsing. Then, spatio-temporal relationships are predicted through spatio-temporal cooperative learning. Finally, the spatio-temporal panoptic scene graph is generated.

图5展示了TPSG任务的整体框架。重点关注视频全景解析、时空协同学习(STCL)以及最终场景图生成的流程,理解各模块之间的数据流动。

实验验证

实验验证
Fig. 8. Qualitative visualization of STCL in an airport scene.

图8展示了STCL在机场场景中的定性结果。仔细观察模型如何正确识别飞机与跑道、飞机与飞机之间的时空关系,验证其时空推理能力。

实验如何设计?

  • 实验在T-STAR数据集上进行,评估设置包括PredCls(预测分类)和SGDet(场景图检测)。这两种设置分别考察模型在给定实例和需要同时检测实例并预测关系时的性能。
  • 定性分析重点关注机场和港口等复杂场景。这些场景中物体密集、关系多样,是检验模型时空推理能力的理想测试床。
  • 对比实验包括与现有自然视频SGG方法及静态遥感SGG方法的比较,以验证STCL在卫星视频任务上的优越性。

关键结果与论文证据

  • STCL在机场场景中准确捕捉了‘裸地环绕建筑’等空间关系,展示了其对复杂场景结构组织的建模能力。
  • 模型能够识别飞机与跑道之间的‘静止’关系,以及不同飞机之间的‘平行停放’关系,证明了其在身份一致实例轨迹、成对空间上下文和时间依赖性整合方面的有效性。
  • 在港口场景中,STCL同样表现出色,能够处理船只、码头及尾迹之间的复杂时空交互。
  • 定量结果显示,STCL在PredCls和SGDet设置下均优于基线方法,特别是在关系预测的准确性上提升显著。

阅读时需要注意

  • 卫星视频中的小目标和弱纹理特性使得跨帧关联在严重遮挡和杂波环境下仍然具有挑战性。
  • 关系语义与空间结构和时间演化的高度耦合需要复杂的建模,当前方法在处理长时序依赖和极度遮挡时仍有局限。
  • 数据集的规模虽然较大,但相对于自然视频数据集仍有差距,且标注成本高昂,限制了更广泛模型的训练。

关联工作

  • 与VISO、SatSOT等仅关注检测/跟踪的数据集相比,T-STAR引入了关系标注,推动了从感知到认知的跨越。
  • 与AeroEye、CYCLO等航拍视频SGG数据集相比,T-STAR针对卫星视频的俯视视角和小目标特性进行了专门设计。
  • 与GRTRD、RSSGD等静态遥感SGG数据集相比,T-STAR引入了时间维度,使得建模动态关系成为可能。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

T-STAR:卫星视频中时空全景场景图生成的大规模基准

Linlin Wang, Xue Yang, IEEE 会员, Zhihuang Zhou, Zhenyu Zhong, Ruiyuan Zhang, 和 Yansheng Li, IEEE 高级会员

摘要——对卫星视频的结构化理解对于将动态地理空间场景分析从低级感知推进到高级认知至关重要。为了超越以对象为中心的感知,本文引入了卫星视频中的时空全景场景图生成(TPSG)作为一个新的基准任务。TPSG 旨在生成一个由一组带有显式时间跨度的三元组 <主体, 关系, 对象> 组成的结构化图,从而通过联合建模身份一致的实例掩码和全景场景元素之间的时空关系,来描述动态地理空间场景。然而,卫星视频中的 TPSG 具有内在挑战性,因为对象通常较小且纹理微弱,跨帧关联容易受到遮挡和背景杂乱的干扰,并且关系语义与空间结构和时间演化高度耦合。因此,本文提出了 T-STAR,这是一个用于卫星视频 TPSG 的大规模基准数据集,包含超过 110 万个实例掩码和超过 380 万个时空三元组,涵盖 39 个细粒度对象类别和 70 个细粒度关系类别。为了实现卫星视频中的 TPSG,我们提出了一个统一框架,以增强跨帧实例一致性和时空关系预测。广泛的实验证明了 T-STAR 的重要性以及所提出框架的有效性,为未来关于结构化卫星视频理解的研究建立了强有力的基准。数据集和代码可在 https://github.com/linlin-dev/T-STAR 获取。

索引术语——时空全景场景图生成,卫星视频,基准数据集,时空关系预测

I. 引言

SATELLITE 遥感已成为地球观测的重要手段,得益于空间、时间和光谱成像能力的提升 [1], [2]。作为一种动态观测模态,卫星视频能够持续监测地球表面,不仅记录对象的空间分布,还记录其状态变化、交互以及随时间的场景演化 [3], [4]。近年来,卫星视频解译取得了实质性进展,包括对象检测 [5], [6]、对象分割 [7], [8]、对象跟踪 [9], [10] 和场景分类 [11], [12]。然而,这些任务主要关注视觉感知,例如识别存在什么、位于何处以及如何移动,而在对卫星视频中对象间复杂交互的认知理解方面尚显不足。时空场景图生成 [13], [14] 通过联合表征对象实体、交互语义及其时间演化,为动态地理空间场景提供了结构化表示,从而将卫星视频解译从感知推进到认知。然而,目前尚无专门针对卫星视频 TPSG 的数据集。此外,为自然视频开发的 TPSG 模型不能直接应用于卫星视频。

近年来,计算机视觉社区对场景图生成(SGG)的兴趣日益浓厚 [15]。从静态 SGG [16], [17] 到框级时空 SGG [18], [19],再到实例级时空 SGG [20], [21] 的演进,代表了迈向更全面视觉理解的重要一步。这一趋势与卫星视频特别相关,在卫星视频中,场景语义通常通过动态对象交互和长期关系演化来表达。图 1 展示了军事码头场景中的一个代表性示例。具体而言,boat50 和 boat51 最初围绕 warship48 进行协作。随着时间的推移,boat50 逐渐从为 warship48 服务转变为远离它,而 boat50 和 boat51 之间的关系从合作演变为无直接交互。同时,附近的 boat52 从在 water1 上静止变为在 water1 上移动。

虽然已经为自然视频 [14], [20] 开发了时空 SGG 基准,并最近扩展到航空视频 [22],但由于成像视角、对象尺度和场景布局的巨大差异,它们不能直接应用于卫星视频。从卫星视角来看,精确的掩码注释有助于减少背景干扰并促进细粒度类别区分,正如先前研究所强调的 [8], [23], [24]。这种表示对于卫星视频尤为重要,因为它们支持可靠的跨帧关联并有助于保持身份一致的实例轨迹。同时,动态和静态场景元素之间产生了丰富的时空关系,包括自然地理元素、人造设施、交通对象以及伴随的尾迹状区域。受这些特征的启发,本文引入了时空全景场景图生成…

第 2 页

图1. 卫星视频中时空全景场景图生成(TPSG)的示意图。

生成(TPSG)作为卫星视频结构化理解的新基准任务,具有时间一致的实例级掩码,以准确勾勒物体边界并保持跨帧身份一致性;(ii) 涵盖多样化动态地理空间场景的全景场景元素。卫星视频中的所有相关场景元素都应被覆盖,包括自然地理元素(如水体和植被)、人造设施(如停机坪和航站楼)、交通对象(如飞机和船舶)以及伴随的尾迹状区域(如开尔文尾迹和湍流尾迹),以便以全景方式联合建模;以及 (iii) 具有显式时空特征的高价值关系。对象对及其关系应通过联合考虑空间和时间证据以一对多的方式进行标注,以便显式表示空间关系和时空演化的交互。

为了解决专用数据集稀缺的问题,本文提出了 T-STAR,这是一个用于卫星视频中 TPSG 的大规模基准数据集。在该数据集中,(i) 具有

第 3 页

表 I:T-STAR 数据集与代表性卫星视频数据集的比较。HBB 表示水平边界框,OBB 表示定向边界框,Mask 表示仅针对交通对象的掩码标注,Panoptic Mask 表示对所有相关场景元素的全景标注,包括自然地理要素、人造设施、交通对象以及伴随的尾迹状区域。

| 数据集 | 标注类型 | 图像尺寸 | 对象实例数 | 对象类别数 | 三元组数 | 关系类别数 | 发表 venue | | :— | :— | :— | :— | :— | :— | :— | :— | | VISO [25] | HBB | 220×223∼1,348×1,348 | 1,646,038 | 4 | – | – | TGRS’21 | | SatSOT [26] | HBB | 499×335∼1,298×1,376 | 27,664 | 4 | – | – | TGRS’22 | | SV248S [27] | Mask | 213×312∼827×971 | 163,234 | 4 | – | – | GRSM’22 | | AIR-MOT [28] | HBB | 1,920×1,080 | 5,736 | 2 | – | – | TGRS’22 | | SAT-MTB [8] | HBB/OBB/Mask | 502×512∼3,000×1,500 | 1,033,511 | 14 | – | – | TGRS’23 | | TMS [3] | HBB | 512×512∼540×480 | 128,801 | 1 | – | – | TPAMI’24 | | OOTB [10] | OBB | 142×136∼3,000×1,500 | 29,890 | 4 | – | – | ISPRS’24 | | LMOD [29] | HBB | 1,500×1,160∼4,000×2,000 | 480,332 | 4 | – | – | J-STARS’25 | | T-STAR (Ours) | Panoptic Mask | 400×400∼1,500×1,500 | 1,188,193 | 39 | 3,832,449 | 70 | – |

采集了空间分辨率约为 1 米的数据,覆盖了具有代表性的活动密集地理空间场景,包括海事、桥梁、港口、机场和铁路场景;(ii) 在领域专家的指导下,全景场景元素被分为 39 个细粒度类别,并使用时间一致的实例级掩码进行全景标注,而所有关系均使用 70 个细粒度类别进行标注;以及 (iii) 对象对之间的有效关系以一对多的方式进行标注,其中每对对象可能随时间与多个关系类别相关联,并且所有关系类别均以旋转不变的方式定义。总之,T-STAR 相较于现有主要面向检测或跟踪的卫星视频数据集具有显著优势,并为动态地理空间场景的结构化理解建立了更丰富的基准。

考虑到卫星视频的独特特性,有效的时空全景场景图(TPSG)模型应解决两个基本挑战。首先,卫星视频中的对象通常较小且纹理微弱,而遮挡、背景杂乱和外观歧义很容易破坏跨帧关联,使得构建可靠的身份一致实例轨迹变得困难。其次,卫星视频中的时空关系并非孤立的静态标签,而是由空间配置和时间演变共同塑造的动态语义。因此,TPSG 要求模型捕捉每帧内实例对之间的结构化依赖关系以及跨帧的关系演变,特别是对于涉及持久交互、相对运动模式和长期状态转换的高价值关系。为了应对这些挑战,我们提出了一个用于卫星视频中 TPSG 任务的统一框架。首先,采用视频全景解析模型来提取初始实例特征。然后,设计了一个时空协同学习(STCL)模型用于时空关系预测,其中记忆引导匹配(MGM)增强了跨帧实例一致性,空间上下文增强(SCE)在实例对之间传播上下文信息,多尺度时序学习(MTL)捕捉时序依赖关系。

总之,本文的主要贡献如下:

• 我们提出了 T-STAR,据我们所知,这是卫星视频中 TPSG 的第一个大规模基准数据集。T-STAR 包含超过 110 万个实例掩码和超过 380 万个时空三元组,涵盖 39 个细粒度对象类别和 70 个细粒度关系类别,为结构化卫星视频理解提供了一个具有挑战性且实用的测试平台。

• 为了增强卫星视频中的 TPSG,我们提出了一种时空协同学习(STCL)模型,该模型协调记忆引导匹配(MGM)、空间上下文增强(SCE)和多尺度时序学习(MTL),从而提高了跨帧实例一致性和时空关系预测性能。

• 在 T-STAR 上的大量实验证明了所提出框架在 PredCls 和 SGDet 设置下的有效性,为未来卫星视频中 TPSG 的研究奠定了坚实的实验基础。

II. 相关工作

A. 自然图像和视频中的场景图生成

自然图像 [30], [31] 和视频中的场景图生成(SGG)旨在识别实体并预测它们之间的关系,形成由三元组 <主体, 关系, 客体> 组成的结构化图。由于其强大的语义抽象和结构化推理能力,SGG 已被广泛应用于场景理解和推理任务 [32]–[34]。早期研究主要集中在静态自然图像上,大规模标注促进了图像级 SGG 的快速发展 [35]–[38]。大多数现有的 SGG 方法

第 4 页

4

表 II:T-STAR 数据集概述。遵循两阶段流水线 [16], [39],首先识别视觉实体,然后预测成对关系。该范式通过各种策略得到了进一步发展,包括多模态特征 [40], [41]、先验信息 [42]–[44]、常识知识 [45], [46]、消息传递 [17], [47], [48] 以及去偏 [49]–[51]。与静态图像相比,视频提供了随时间连续观测,因此能够建模物体运动、交互过程以及关系演化。这激发了时空场景图生成(SGG)[52]–[54] 的研究,其中物体轨迹通常通过关联帧级检测结果来构建,然后在物体轨迹片段或轨迹上预测关系。传统研究主要关注边界框级别的时空 SGG [55], [56]。考虑到边界框定位粗糙且表示不规则物体形状的能力有限,近期研究 [20], [21] 探索了掩码级别的时空 SGG,以实现对可数物体和背景区域的更细粒度建模。尽管取得了这些进展,现有的时空 SGG 方法主要是为从地面或自我中心视角拍摄的自然视频开发的。在这些场景中,物体通常占据相对较大的图像区域,包含丰富的外观线索,并表现出以人-物或物-物交互为主导的关系模式。然而,这些假设并不直接适用于卫星视频。卫星视频是从俯视视角拍摄的,其中物体通常极小、纹理微弱、分布密集,且容易与背景杂乱混淆。因此,直接将自然视频的时空 SGG 方法迁移到卫星视频是不够的。

项目 | 统计信息 —|— 数据来源 | 吉林一号卫星视频 空间分辨率 | 约 1 米 图像尺寸 | 400×400∼1,500×1,500 像素 视频数量 | 150 帧数 | 34,333 每视频帧数 | 49∼848 (平均 228.9) 物体类别 | 39 关系类别 | 70 实例掩码 | 1,188,193 时空三元组 | 3,832,449 训练/验证/测试划分 | 视频级别 6:2:2

解释,大多数现有数据集仍然以交通物体为中心,缺乏对全景场景元素的全面覆盖、显式关系标注以及实例轨迹、关系和时间跨度的统一建模。最近,基于无人机的 AeroEye 数据集已构建用于航拍视频中的边界框级别时空 SGG,而 CYCLO 已被提出用于从航拍倾斜视角建模多物体关系 [22]。尽管如此,航拍视频在成像视角、物体尺度、场景组织和关系模式方面仍与卫星视频存在显著差异。卫星视频通常覆盖更广阔的地理区域,包含具有较弱视觉纹理的较小物体,并表现出对地理空间结构和长期时间演化的更强依赖性。因此,有必要针对卫星视频专门研究时空全景场景图(TPSG),并明确考虑其独特的成像特性、物体属性和关系模式。

B. 遥感图像和视频中的场景图生成

随着对结构化地理空间理解需求的增加,场景图生成(SGG)在遥感领域也引起了越来越多的关注 [57]。包括 GRTRD [58]、RSSGD [57]、S2SG [59]、STAR [60] 和 ReCon1M [61] 在内的代表性数据集,以及近期基于原型学习 [62], [63] 和偏差感知学习 [64] 的方法,已将遥感解释从物体级感知推进到关系级场景认知。这些努力证明了场景图在结构化解释复杂遥感场景方面的潜力。然而,现有的遥感 SGG 研究主要关注静态图像,其中关系是在单张图像内建模的。因此,它们无法捕捉跨帧实例一致性或随时间演变的关系。这一局限性对于卫星视频尤为关键,其中高价值关系往往依赖于持续交互和长期状态转换。

与静态卫星图像相比,卫星视频提供了地表物体运动和状态变化的连续观测,因此对于动态地理空间解释变得越来越重要 [65]–[67]。现有的卫星视频解释研究主要集中在以物体为中心的感知任务 [10], [68],如物体检测、分割和跟踪。尽管这些努力为卫星视频解释提供了必要的基础,但……

III. T-STAR 数据集详情

A. 数据来源和场景选择

T-STAR 主要从吉林一号卫星视频构建,包括公开可获取和商业获取的视频。这些数据提供米级空间分辨率和连续帧观测,使其适合捕捉细粒度物体、保持跨帧实例一致性以及建模卫星视频中的时空关系。由于许多地理空间场景在短视频持续时间内的时间变化有限,我们特意选择活动密集、具有丰富且可观察交互过程的动态地理空间场景。具体而言,T-STAR 涵盖代表性场景类型,包括海事、桥梁、港口、机场和铁路场景。为了更清晰地概述数据集规模和视频级属性,表 II 总结了 T-STAR 的主要元数据,包括视频数量、帧统计、图像尺寸、标注类别和数据集划分。这些统计结果表明,T-STAR 提供了大规模帧级标注和多样化的视频级时间观测,使其适合在真实卫星视频条件下评估 TPSG 模型。

图 2 显示了这些场景的典型标注示例。机场场景包含功能组织区域,如……

第 5 页

图 2. T-STAR 数据集中的代表性标注场景。

跑道、滑行道、停机坪、航站楼和登机桥,对于时空全景场景图(TPSG)至关重要,因为卫星视频中高价值的关系不仅产生于动态场景元素之间,还产生于动态与静态场景元素之间,以及静态场景元素之间。此外,细粒度分类对于交通对象尤为重要。如图 3(a) 所示,卫星视频中的飞机和船舶往往表现出细微的结构差异,同时提供较弱的视觉线索,使得跨帧身份保持具有挑战性。通过引入具有语义意义的细粒度类别,T-STAR 减少了类别歧义,并为下游关系推理提供了更强的语义约束。

B. 标注分类体系设计

1) 对象分类体系:T-STAR 定义了一个由 39 个类别组成的细粒度对象分类体系,包括自然地理要素、人造设施、交通对象以及伴随的尾迹状区域。该分类体系基于典型卫星视频场景中的关键组件设计,明确考虑了跨帧可追溯性和类别可区分性。对于机场场景,它包括细粒度的飞机类别、跑道、滑行道、停机坪、航站楼、登机桥以及周围的地理要素和设施;对于港口和海事场景,它涵盖细粒度的船舶类别、码头、起重机、防波堤以及周围的场景元素。伴随的尾迹状区域,在我们的分类体系中由 kelvin 和 turbulent 类别表示,也被进行标注,因为它们为理解动态海事活动提供了有意义的语义线索。图 3(a) 展示了 T-STAR 中具有代表性的对象类别及其统计信息。

T-STAR 的一个关键设计原则是,它不将标注限制在交通对象上。相反,每一帧中的所有相关场景元素都进行全景标注。这种设计对于时空全景场景图(TPSG)至关重要,因为卫星视频中高价值的关系不仅产生于动态场景元素之间,还产生于动态与静态场景元素之间,以及静态场景元素之间。此外,细粒度分类对于交通对象尤为重要。如图 3(a) 所示,卫星视频中的飞机和船舶往往表现出细微的结构差异,同时提供较弱的视觉线索,使得跨帧身份保持具有挑战性。通过引入具有语义意义的细粒度类别,T-STAR 减少了类别歧义,并为下游关系推理提供了更强的语义约束。

2) 关系分类体系:T-STAR 建立了一个包含 70 个关系类别的细粒度时空关系分类体系。该分类体系旨在联合表征卫星视频中稳定的空间结构和随时间演变的交互语义。这些关系被组织为七个主要组:空间拓扑、连通性交互、载体交互、运动交互、静态交互、身份判别和功能交互。具体而言,空间拓扑关系,如 adjacent to(相邻于)、within the boundary of(在……边界内)和 surround(环绕),描述了场景元素之间的几何和拓扑配置。连通性交互关系,如 connected to(连接至)、accessible to(可通达至)和 not accessible to(不可通达至),捕捉地理空间场景中的结构可通达性和连接状态。载体交互关系,如 taxi on(滑行于)、sail on(航行于)和 docked at(停靠在),描述了交通对象与其底层场景元素之间的载体依赖性交互。运动交互关系,如 approach(接近)、away from(远离)和 trail(尾随),表征了实例之间随时间变化的动态相对运动模式。静态交互关系,如 parked parallel to(平行停放于)、docked side by side with(并排停靠于)和 stop near(停在……附近),描述了对象之间随时间稳定的交互状态。身份判别关系,如 is the same model as(与……型号相同)、same group as(与……同组),

第 6 页

图 3. T-STAR 数据集中对象 (a) 和关系 (b) 的统计与可视化。

以及来自不同组的区分语义或组级身份关联,丰富了生成场景图的结构复杂性,并使得稳定的空间关系和随时间演化的交互能够被同时表示。诸如“操作”、“协作”和“共同存储”等功能性交互关系,进一步将关系建模从几何和运动层面的描述扩展到更高层的场景理解。图 3(b) 展示了 T-STAR 中具有代表性的关系类别及其统计数据。

关系分类体系的一个关键特征是其时间接地性和视觉可观测性。每个标注的关系都必须由连续帧观察中的视觉证据支持,而不是仅从先验知识或单帧空间布局中推断。因此,T-STAR 中的关系建模建立在时间一致的实例轨迹及其运动演化之上,从而能够进行静态空间关系理解和过程级的时空推理。此外,T-STAR 允许为每对轨迹进行一对多的关系标注,这

C. 标注协议与质量控制

T-STAR 采用统一的标注协议,以确保准确的全景掩码、稳定的跨帧身份以及可靠的时空关系标注。该协议侧重于三个方面:像素级标注质量、跨帧身份连续性以及时空关系的语义有效性。具体而言,T-STAR 采用逐帧全景标注,其中每一帧中的每个像素都被分配到一个预定义的动态或静态场景元素类别,而不仅仅是标注交通对象。每个可见实例都被分配一个掩码,并且同一实例在跨帧时保持唯一的身份。对于持续可观测的实例,要求掩码轮廓

第 7 页

7

关系 在不同滑行道上的 在滑行道上的 在同一滑行道上的 与不同滑行道方向相反的 与同一滑行道方向相同的 与停放的非平行 在不同停机坪上的非平行 沿停放的减速滑行 在同一停机坪上停放的 平行停放 可访问 改变方向 离开 沿 向后 直线滑行 不可访问 进入 与…方向相同 远离 与…方向相反 对象 飞机 滑行 停止 靠近 停放 可访问 改变 起飞 加速 移动 滑行 不 滑行 停止 靠近 停放 可访问 改变 起飞 加速 移动 滑行 不 滑行 停止 主体 民用双发翼下发动机喷气式飞机 在…上飞行 沿…飞行 飞行 沿…飞行 民用四发翼下发动机喷气式飞机 民用四发翼下发动机喷气式飞机 民用四发翼下发动机喷气式飞机 民用四发翼下发动机喷气式飞机 民用四发翼下发动机喷气式飞机 民用四发翼下发动机喷气式飞机 被…包围 被…包围 被…包围 被…包围 民用双发尾置发动机喷气式飞机 从…上方经过 从…上方经过 从…上方经过 从…上方经过 从…上方经过 从…上方经过 火车 民用双发尾置发动机喷气式飞机 民用双发尾置发动机喷气式飞机 民用双发尾置发动机喷气式飞机 民用双发尾置发动机喷气式飞机 民用双发尾置发动机喷气式飞机 未连接到 未 未 未 未 连接 连接 连接 连接 到 到 到 到 民用双发翼下发动机喷气式飞机 相邻于 民用非喷气式飞机 被…半包围 民用非喷气式飞机 民用非喷气式飞机 民用非喷气式飞机 民用非喷气式飞机 民用非喷气式飞机 连接到 连接 连接 连接 连接 到 到 到 到 跑道 跑道 跑道 军用四发翼下发动机喷气式飞机 军用四发翼下发动机喷气式飞机 军用四发翼下发动机喷气式飞机 军用四发翼下发动机喷气式飞机 军用四发翼下发动机喷气式飞机 军用四发翼下发动机喷气式飞机 军用四发翼下发动机喷气式飞机 火车 火车 火车 火车 火车 保持 保持 保持 保持 保持 静止在 滑行道 滑行道 滑行道 滑行道 滑行道 包围 包围 包围 包围 包围 施工区域 操场 航站楼 航站楼 航站楼 航站楼 航站楼 停车场 施工区域 施工区域 操场 操场 停车场 停车场 施工区域 施工区域 操场 操场 停车场 停车场 半包围 半包围 半包围 半包围 半包围 航站楼 停机坪 停机坪 航站楼 航站楼 航站楼 航站楼 平行 平行 平行 平行 平行 到 到 到 建筑物 建筑物 建筑物 建筑物 建筑物 安全跑道 与…型号相同 是 是 是 是 的 的 的 的 相同 相同 相同 相同 型号 型号 型号 型号 如 如 如 如 停机坪 停机坪 停机坪 停机坪 铁路 与…型号不同 是 是 是 是 一个 一个 不同 不同 不同 不同 型号 来自 来自 来自 停车场 停车场 停车场 分开 分开 分开 分开 分开 安全跑道 车站 跑道 安全跑道 安全跑道 车站 车站 跑道 跑道 安全跑道 安全跑道 车站 车站 跑道 跑道 建筑物 建筑物 建筑物 建筑物 建筑物 延伸 延伸 延伸 延伸 延伸 进入 滑行道 滑行道 滑行道 滑行道 滑行道 建筑物区域 被…分隔 分隔 分隔 分隔 分隔 由 由 由 铁路 铁路 铁路 铁路 铁路 施工区域 进近 进近 进近 进近 进近 登机桥 码头 码头 码头 码头 码头 在…下方 在 在 在 在 在 操场 裸地 裸地 裸地 裸地 裸地 远离 远离 远离 远离 远离 来自 来自 来自 来自 机场附属设施 机场附属设施 机场附属设施 机场附属设施 机场附属设施 植被 在…上方 在 在 在 在 在 植被 植被 植被 植被 植被 机场附属设施 从…下方经过 经过 经过 经过 经过 在 在 在 建筑物区域 建筑物区域 建筑物区域 建筑物区域 建筑物区域 停靠在 在 在 在 在 道路 道路 道路 道路 道路 道路 道路 道路 由 由 由 防波堤 登机桥 受干扰 改变 在 停靠 停靠 受干扰 受干扰 改变 改变 停靠 停靠 受干扰 受干扰 改变 改变 航线 在 在 在 在 天桥 停靠在…外部 在 在 在 在 的 的 的 的 边界 外部 直线航行 航行 航行 航行 航行 直线 直线 直线 直线 向前 向前 向前 向前 在 在 在 在 车站 警告线 防波堤 登机桥 登机桥 天桥 天桥 警告线 警告线 防波堤 防波堤 登机桥 登机桥 天桥 天桥 警告线 警告线 防波堤 防波堤 在…边界内 在 在 在 在 的 的 的 的 边界 边界 边界 边界 内 水 水 水 水 水 水 水 水 水 水 停靠在 停靠 停靠 停靠 停靠 在 在 在 在 的 的 的 的 相同 码头 码头 码头 如 桥 桥 桥 桥 桥 天桥 停靠 非平行 停靠 停靠 停靠 非平行 非平行 非平行 非平行 到 客船 客船 客船 客船 客船 桥 桥 桥 停靠在 停靠 停靠 停靠 在 在 在 在 一个 一个 不同 不同 不同 不同 码头 来自 警告线 停靠 首尾相接 端 端 端 端 到 到 到 到 端 与 航空母舰 航空母舰 航空母舰 航空母舰 航空母舰 航空母舰 方向 航空母舰 方向 方向 方向 方向 如 军舰 军舰 军舰 军舰 在 在 不同 在 在 相同 相同 的 的 相同 相同 的 相同 相同 的 不同 不同 不同 不同 方向 方向 方向 与 客船 登陆直升机突击舰 登陆直升机突击舰 登陆直升机突击舰 登陆直升机突击舰 登陆直升机突击舰 军舰 军舰 军舰 军舰 航行 受干扰 停靠 并排 侧 侧 侧 侧 由 由 由 由 侧 侧 侧 侧 与 与 与 拖曳 登陆直升机突击舰 船 船 船 船 船 在 在 在 在 在 货船 与 与 与 与 与 货船 货船 货船 货船 货船 由 船 由 由 由 由 船 船 船 船 湍流 湍流 湍流 湍流 湍流 如 组 组 组 如 如 如 起重机 起重机 起重机 协作 协作 协作 协作 协作 与 与 开尔文 开尔文 开尔文 开尔文 开尔文 坦克 坦克 坦克 坦克 坦克 来自 与 与 组 来自 来自 与 来自 来自 湍流 起重机 与 坦克 开尔文 开尔文 开尔文 起重机 起重机 坦克 坦克 起重机 起重机 坦克 坦克 操作 协作 拖曳 相同 不 不同 共存储 不 共存储 停靠 停靠 航行 航行 航行 航行 受干扰 受干扰 停靠 停靠 拖曳 拖曳 操作 操作 协作 协作 拖曳 拖曳 相同 相同 不 不 不同 不同 共存储 共存储 不 不 停靠 停靠 航行 航行 航行 航行 受干扰 受干扰 停靠 停靠 拖曳 拖曳 操作 操作 协作 协作 拖曳 拖曳 相同 相同 不 不 不同 不同 共存储 共存储 不 不 共存储 共存储 共存储 共存储 与

图 4. 主体类别、关系类别和对象类别之间的交互映射。

随时间平滑演变;对于部分遮挡或可见性较弱的实例,利用来自相邻帧的时序线索以保持身份连续性。该协议自然地形成了所有相关实例的掩码轨迹,为视频全景解析和时空全景场景图(TPSG)提供了可靠基础。

D. 数据集特征与挑战

1) 长尾对象和关系分布:如图3所示,T-STAR中的对象和关系标注在39个对象类别和70个关系类别中均呈现出显著的长尾分布。频繁出现的类别占据了标注的大部分,而许多细粒度的交通对象和语义上重要的关系则稀疏表示。这一现象反映了真实卫星视频场景的自然语义不平衡,同时也给模型学习带来了重大挑战,因为模型往往倾向于过拟合主导类别,而在罕见但关键的类别上表现不佳。交通对象与多样化场景元素的共存,以及轨迹对上的一对多关系标注,进一步放大了这一挑战,使得T-STAR的语义构成比传统的以对象为中心的卫星视频数据集复杂得多。

2) 细粒度语义判别:T-STAR包含许多细粒度的对象类别,在卫星视频观测下其视觉差异细微。这在飞机和船舶上尤为明显。不同的飞机类别可能主要区别在于机翼布局、发动机数量、机身尺寸或尾翼结构,而不同的船舶类别通常通过船体形状、甲板布局、功能设备或相对尺寸来区分。在米级卫星视频观测下,保留此类细粒度区分十分困难,从而增加了类别歧义和跨帧身份漂移。此外,纹理微弱、空间分辨率低

第 8 页

8

图 5. TPSG 任务的整体框架。给定卫星视频序列,通过视频全景解析获取实例特征。随后,通过时空协同学习预测时空关系。最后,生成时空全景场景图。

分辨率,以及背景杂乱进一步降低了实例外观的可区分性,使得模型难以维持稳定的身份并推断准确的关系。图 4 进一步说明了 T-STAR 中对象-关系交互的结构复杂性。

3) 尺度变化与运动异质性:T-STAR 中的对象在空间尺度和时间动态上均表现出显著差异。自然地理要素和人造设施通常占据较大的图像区域,并在时间上保持结构稳定,仅因平台抖动或成像变化产生轻微的表观运动。相比之下,交通对象及其伴随的尾迹状区域通常小得多,但在帧间表现出更清晰的位移、姿态变化和交互变化。大型静态场景元素与小型交通对象共存,导致显著的尺度不平衡和运动异质性。这些特性增加了实例解析、特征学习和跨帧关联的难度。模型必须对不同空间范围、视觉细节、运动模式和时间持久性的对象保持鲁棒性,同时避免小型交通对象与复杂背景结构之间的混淆。

4) 关系语义的强时空耦合:T-STAR 中的大量关系表现出强烈的时空耦合。与静态图像场景图不同,T-STAR 中的许多关系类别不能仅从单帧确定。其有效性取决于空间结构、轨迹连续性、相对运动趋势和时间持久性的共同作用。例如,“在同一滑行道上”、“在不同滑行道上”、“停靠在同一个码头”和“停靠在另一个码头”等关系需要同时验证空间配置和时间演化。更广泛地说,T-STAR 中的许多高价值关系不仅仅是逐帧的几何描述,而是随时间出现、持续和演化的过程级语义。这使得 T-STAR 中的关系推理本质上比帧级空间关系分类更复杂。

IV. 所提方法

A. 任务定义与框架

给定具有 T 帧的卫星视频序列 V = {I1, I2, . . . , IT},TPSG 的目标是生成结构化的时空全景场景图 GV。该图由一组身份一致的三元组 Y 组成,其中每个三元组表示为 ⟨MS, r∆t, MO⟩。这里,MS 和 MO 分别表示主体和对象的掩码轨迹,r∆t 表示时间接地关系谓词,其中 r 是关系类别,∆t 表示关系成立的时间跨度。时间跨度可以是一个单一区间或多个不相交区间。形式上,卫星视频中的 TPSG 任务可以分解为:

P(GV | V) = P(M | V) P(Y | M, V), (1)

其中 M 表示所有帧中身份一致的实例集合,Y 表示在 M 基础上构建的预测时空三元组集合。第一项对应于视频全景解析,用于提取时间一致的实例掩码,而第二项对应于基于解析实例和输入视频的时空关系预测。

如图 5 所示,卫星视频中 TPSG 任务的整体框架采用两阶段流水线。在第一阶段,通过视频全景解析提取实例特征,这可以使用两个基线 [20] 执行:

第 9 页

贪婪分配确保每个实例最多匹配一条轨迹,同时每条轨迹最多被分配一次。匹配完成后,成功关联的轨迹以覆盖方式更新,用当前观测替换掩码和时间戳,以反映最新的实例状态并防止历史噪声的时序累积。未匹配的实例作为新轨迹追加到记忆中,而未匹配的历史轨迹保留在记忆中但暂时处于非活动状态。这种设计提高了跨帧对象跟踪的时序一致性,即使在尺度变化、形状改变和局部扰动下也能保持计算复杂度可控。

2) 空间上下文增强:在复杂的卫星视频场景中,实例及其相互作用形成一个相互连接且动态演变的系统,其中依赖关系不仅存在于单个实例之间,还存在于实例对之间。为了捕捉这种依赖关系,首先根据配对选择策略 [20] 生成高价值配对,并按照图 6 所示的规则构建配对级空间图。在该图中,每个节点代表一个实例对,节点之间的边建立在共享相同主体、共享相同客体或表现出跨对依赖关系的配对节点之间,即一个配对的主体与另一个配对的客体相同,反之亦然。通过显式建模实例对之间的结构化依赖关系,空间图使关系特征能够融入更广泛的场景级上下文信息,从而增强复杂对象交互的表示。

对于每个提议配对 $(s_q, o_q)$,在帧 $t$ 首先分别编码主体和客体特征并拼接以构建配对表示 $x_{t,q} = [f_{s_q,t}; f_{o_q,t}]$,其中 $[\cdot; \cdot]$ 表示特征拼接。所得的配对表示用作相应图节点的初始特征,即 $z_{t,q}^{(0)} = x_{t,q}$。具体而言,主体和客体编码器各自生成 256 维嵌入,特征拼接后得到 512 维的配对表示。

对于每一帧 $t$,在配对级空间图上独立执行多层消息传递。令 $z_{t,q}^{(\ell)}$ 表示第 $\ell$ 层第 $q$ 个节点的表示。其邻居节点的特征通过平均池化聚合并变换以获得邻域表示 $a_{t,q}^{(\ell)}$。然后将邻域表示与节点自身的特征拼接。令 $m_{t,q}^{(\ell)} = \Phi([z_{t,q}^{(\ell)}; a_{t,q}^{(\ell)}])$ 表示所得的更新特征。节点表示通过残差学习和层归一化进行更新:

$$ z_{t,q}^{(\ell+1)} = \text{ReLU}(\text{Norm}(m_{t,q}^{(\ell)}) + z_{t,q}^{(\ell)}), \quad (2) $$

其中 $\text{Norm}(\cdot)$ 表示层归一化,$\text{ReLU}(\cdot)$ 表示非线性激活函数。在训练期间,进一步对更新的节点特征应用 Dropout。通过在多层上迭代此过程,空间上下文信息在图中传播,增强实例对之间的语义一致性,并改善复杂场景中的关系表示。

3) 多尺度时序学习:在通过 SCE 模块捕捉每个实例对的空间上下文后,

第 10 页

对应的关系特征沿时间维度堆叠,形成序列 $Z_q = \{z_1^q, z_2^q, \dots, z_T^q\}$。卫星视频中的时空关系通常需要在多个帧上进行连续观测,才能进行可靠的推理。为了对这种时间依赖性进行建模,MTL 模块采用一个 $L$ 层的时间卷积网络(TCN)[69] 来编码每个实例对的关系特征序列,并捕捉时间上下文信息。每个 TCN 层利用一维空洞卷积,在保持时间分辨率的同时逐步扩大时间感受野。具体而言,第 $l$ 个 TCN 层的空洞率设置为 $d_l = 2^{l-1}$,其中 $l = 1, \dots, L$。令 $\tilde{H}^{(l)}_q = \text{Conv1D}_{d_l}(H^{(l-1)}_q)$ 表示第 $l$ 层空洞卷积的中间输出。然后计算层输出为:

$$H^{(l)}_q = H^{(l-1)}_q + \text{Drop}(\sigma(\text{Norm}(\tilde{H}^{(l)}_q))), \quad (3)$$

其中 $H^{(0)}_q = Z_q$,$\text{Conv1D}_{d_l}(\cdot)$ 表示空洞率为 $d_l$ 的一维卷积,$\text{Norm}(\cdot)$ 表示归一化层,$\sigma(\cdot)$ 是 ReLU 激活函数,$\text{Drop}(\cdot)$ 表示 dropout。残差连接有助于在多尺度时间建模期间实现稳定的优化并保留原始关系信息。最后,经过时间增强的对表示被输入到一个具有两个互补头的共享预测网络中。谓词头通过聚合时间上的逐帧响应来估计视频级关系分数,而时间跨度头预测每个关系的逐帧有效性。在推理过程中,关系分数和逐帧时间预测被联合解码为具有时间依据的关系三元组,随后根据它们的置信度分数进行排序。

4) 训练目标:在视频解析模块固定的情况下,时空关系预测阶段针对提议对生成、谓词分类和时间跨度预测进行优化。训练目标定义为:

$$L = \lambda_1 L_{\text{pair}} + \lambda_2 L_{\text{pred}} + \lambda_3 L_{\text{span}}, \quad (4)$$

其中 $L_{\text{pair}}$、$L_{\text{pred}}$ 和 $L_{\text{span}}$ 分别表示提议对生成、谓词分类和逐帧时间跨度预测的损失。为了缓解谓词类别的长尾分布,$L_{\text{pred}}$ 使用类别重加权的二元交叉熵损失实现。$L_{\text{pair}}$ 和 $L_{\text{span}}$ 均采用基于 log-sum-exp 的多标签排序损失,其中时间跨度损失仅针对提议对的谓词计算,前提是该谓词在至少一帧中有效。

V. 实验

A. 实验设置

评估任务与指标。我们采用时空场景图生成的标准评估协议,并报告时间召回率@K(TR@K)、平均时间召回率@K(mTR@K)及其调和平均数 FTR@K。TR@K 衡量前 K 个预测中真实时空三元组的整体召回率。mTR@K 平均跨关系类别的召回率,以减轻类别不平衡的影响。FTR@K 提供了整体召回率和类别级公平性的平衡总结。由于卫星视频中潜在关系的数量远大于自然视频,我们在整个实验中将 K 设置为 200、500 和 1000。

按照传统的时空 SGG 任务,TPSG 任务分为两个子任务。谓词分类(PredCls):提供真实实例轨迹和类别,同时使用相应的视频解析管道提取视觉轨迹特征,以确保公平比较。场景图检测(SGDet):对象轨迹、类别和轨迹特征是从输入视频序列中推断出来的,而下游的时空关系预测管道保持不变。遵循严格的评估协议 [20],只有当同时满足以下所有标准时,预测的三元组才被视为正确:1) 主体、对象和关系类别被准确预测;2) 预测区间和真实区间之间的时间重叠达到或超过预定义阈值;3) 在时间交集内,主体和对象的逐帧掩码 IoU 均超过空间阈值。除非另有说明,空间阈值固定为 0.5,并在两个时间阈值(即 $\theta_t = 0.5$ 和 $\theta_t = 0.1$)下报告结果,以评估严格和宽松的时间定位性能。

基线模型。对于第一阶段视频全景解析,我们采用两种基线方法 [20]:IPS+T 和 VPS。对于第二阶段时空关系预测,提出的 STCL 与六种代表性方法进行比较:1) 全连接层(Vanilla)[20]:融合的对级特征通过标准全连接层处理。2) 手工时间滤波器(Filter)[20]:通过固定核聚合相邻帧的特征来捕捉局部时间依赖性。3) 1D 卷积层(Conv)[20]:可学习的 1D 卷积取代手工滤波器,以自适应地建模时间依赖性。4) Transformer 编码器(Transformer)[20]:带有位置嵌入的 3 层 Transformer 块应用于融合的对特征。5) 运动感知对比学习(MCL)[21]:通过构建正负轨迹对样本来学习对运动敏感的关系表示。6) 迭代关系生成器(IRG)[70]:对象对的关系特征通过上下文传播进行迭代细化。为了确保公平比较,所有方法共享相同的第一阶段解析设置和对选择策略,仅在第二阶段时空关系预测模块上有所不同。

实现细节。所有实验均在 T-STAR 数据集上进行,该数据集在视频级别以 6:2:2 的比例划分为训练集、验证集和测试集。为了确保公平比较,时空关系预测模型在冻结的视频全景解析网络之上使用训练集进行训练,并在测试集上进行评估。模型优化使用 Adam [71] 优化器,初始学习率为 $1 \times 10^{-4}$。TCN 包含四层,核大小为 3,空洞率

第 11 页

11

表 III:T-STAR 测试集上 PredCls 任务的 TPSG 基线方法对比 (%)。

模型 PredCls (θt = 0.5) PredCls (θt = 0.1)

视频关系 TR@ mTR@ FTR@ TR@ mTR@ FTR@ 解析预测 200/500/1000 200/500/1000 200/500/1000 200/500/1000 200/500/1000 200/500/1000

Vanilla [20] CVPR’23 5.74/9.33/12.80 7.10/10.55/13.88 6.35/9.90/13.32 7.66/13.87/17.53 9.59/15.43/19.27 8.52/14.61/18.36

Filter [20] CVPR’23 4.27/6.99/8.34 5.02/7.13/7.62 4.61/7.06/7.96 9.49/16.37/20.08 11.22/16.72/18.24 10.28/16.54/19.12

Conv [20] CVPR’23 8.08/13.42/17.08 9.12/13.61/15.14 8.57/13.52/16.05 11.58/19.31/24.76 12.81/18.77/20.89 12.16/19.04/22.66

VPS Transformer [20] CVPR’23 6.24/11.94/21.63 7.94/12.32/16.15 6.99/12.13/18.49 8.69/17.10/29.93 11.53/17.71/22.58 9.91/17.40/25.74

MCL [21] AAAI’25 4.31/7.00/11.09 5.25/7.60/9.93 4.73/7.29/10.48 6.34/10.78/16.39 7.92/12.15/15.71 7.04/11.42/16.04

IRG [70] CVPR’25 8.79/17.00/23.72 9.26/15.54/18.06 9.02/16.24/20.51 10.60/21.46/33.12 11.61/19.50/23.83 11.09/20.44/27.72

STCL (Ours) – 16.71/29.38/41.34 17.76/23.64/26.95 17.22/26.20/32.63 18.12/31.33/43.60 20.88/26.90/30.27 19.40/28.95/35.73

Vanilla [20] CVPR’23 24.99/37.19/47.83 23.57/30.13/33.87 24.26/33.29/39.66 25.44/37.90/48.74 24.55/31.55/35.67 24.99/34.43/41.19

Filter [20] CVPR’23 30.99/42.12/53.33 27.20/33.62/37.26 28.97/37.39/43.87 31.53/42.82/54.16 29.23/36.09/40.09 30.34/39.17/46.07

Conv [20] CVPR’23 32.15/44.02/55.65 29.37/35.34/38.14 30.69/39.21/45.26 32.52/44.56/56.23 29.78/35.92/38.79 31.09/39.78/45.91

IPS+T Transformer [20] CVPR’23 30.33/43.32/54.32 29.79/35.80/39.00 30.05/39.20/45.40 30.78/43.98/55.07 31.30/37.66/41.07 31.04/40.58/47.05

MCL [21] AAAI’25 30.99/44.23/53.37 28.17/34.27/37.32 29.51/38.62/43.93 31.49/44.85/53.99 30.51/37.00/40.05 30.99/40.55/45.99

IRG [70] CVPR’25 30.45/47.25/60.07 21.65/28.67/33.02 25.30/35.68/42.61 31.07/48.03/60.98 23.18/30.51/35.51 26.55/37.32/44.88

STCL (Ours) – 38.11/51.72/60.24 32.03/37.36/39.59 34.81/43.38/47.78 38.56/52.34/60.94 34.32/39.79/42.19 36.32/45.21/49.86

率为 1、2、4 和 8。在每个时序卷积块中应用组归一化和丢弃率为 0.1 的 Dropout。损失权重设置为 λ1 = 1,λ2 = 5,λ3 = 1。所有实验均在运行 Ubuntu 18.04.6 LTS 且配备单块 NVIDIA TITAN RTX GPU 的系统上进行。为确保可复现性,随机种子固定为 42。值得注意的是,采用 IPS+T 的 STCL 性能显著优于采用 VPS 的 STCL;例如,在时序阈值为 0.5 时,IPS+T 上的 FTR@200/500/1000 达到 34.81/43.38/47.78,而 VPS 上为 17.22/26.20/32.63。这强调了稳定轨迹表示对于准确时空关系预测的重要性。

B. 与代表性基线方法的对比

为了全面评估所提方法在卫星视频 TPSG 任务上的性能,我们使用两种视频全景解析流水线(即 IPS+T 和 VPS)进行实验,并将 STCL 与六种代表性的时空关系预测方法(包括 Vanilla、Filter、Conv、Transformer、MCL 和 IRG)进行比较。鉴于时序区间预测会显著影响评估结果,我们在表 III 和表 IV 中分别报告了 PredCls 和 SGDet 任务在两个时序阈值下的结果。此外,表 V 展示了不同方法在 SGDet 上的性能和推理效率。

如表 III 所示,在两个时序阈值下,STCL 在 IPS+T 和 VPS 设置下均取得了最强的整体性能,在大多数指标上获得最佳结果。这表明 STCL 能有效利用轨迹级的时空上下文,鲁棒地建模时空关系语义。在基线方法中,Vanilla 和 Filter 通常表现较弱,表明简单的特征映射或固定的时序过滤不足以捕捉复杂的关系演化。Conv 和 Transformer 通过引入可学习的时序建模或全局上下文聚合,在多种设置下提升了性能,但其增益随解析流水线和评估指标而异。MCL 在某些指标上取得了具有竞争力的结果,但在 IPS+T 和 VPS 之间表现出明显的性能波动。IRG 通过上下文传播进一步增强了关系表示,在 IPS+T 路径下取得了极具竞争力的 TR@1000 结果。然而,这些方法主要关注局部时序建模或部分关系细化,在联合处理卫星视频中的身份一致性、空间结构和时序演化方面效果较差。

与 PredCls 相比,SGDet 要求模型直接从原始卫星视频输入中生成实例掩码、类别和轨迹特征,从而引入了额外的解析噪声和误差传播。因此,SGDet 不仅评估时空关系建模的有效性,还评估实例分割和跨帧关联的质量。如表 IV 所示,STCL 在所有配置下始终取得最佳结果,证明了其在模型生成的轨迹和噪声关系输入下的鲁棒性。基线方法的相对排名随解析路径、时序阈值和 Top-K 设置而变化。总体而言,Transformer、Conv 和 IRG 在基线中取得了具有竞争力的结果,表明时序依赖建模和上下文关系细化均有利于 SGDet。然而,在处理轨迹噪声和关系抖动时,它们的性能仍然有限。通过联合增强记忆引导的实例一致性、成对空间上下文和多尺度时序建模,STCL 在具有挑战性的 SGDet 设置下提供了更鲁棒的时空关系推理。

表 V 比较了不同关系预测方法在 SGDet 设置下的预测性能和推理效率,使用单块 NVIDIA TITAN RTX GPU。

第 12 页

表IV:T-STAR测试集上SGDet任务的TPSG基线对比(%)。

模型 SGDet (θt = 0.5) SGDet (θt = 0.1) 视频关系 TR@ mTR@ FTR@ TR@ mTR@ FTR@ 解析预测 200/500/1000 200/500/1000 200/500/1000 200/500/1000 200/500/1000 200/500/1000 会议

Vanilla [20] CVPR’23 9.32/14.00/17.60 10.54/13.34/15.15 9.90/13.66/16.29 12.60/19.93/25.56 14.04/18.15/21.19 13.28/19.00/23.17

Filter [20] CVPR’23 5.93/9.42/10.83 5.88/7.91/8.45 5.90/8.60/9.49 13.32/22.39/25.97 13.64/18.79/20.54 13.48/20.43/22.93

Conv [20] CVPR’23 10.56/16.85/20.48 9.76/13.62/15.12 10.14/15.06/17.40 14.82/24.72/30.16 14.01/19.81/22.16 14.41/22.00/25.55

VPS Transformer [20] CVPR’23 8.43/15.10/21.82 8.48/13.45/16.48 8.45/14.23/18.78 11.61/22.15/32.85 11.44/18.49/23.52 11.53/20.15/27.41

MCL [21] AAAI’25 6.81/10.29/12.49 7.02/9.43/10.51 6.92/9.84/11.42 9.39/14.57/18.08 9.36/12.61/14.46 9.37/13.52/16.07

IRG [70] CVPR’25 11.17/18.80/24.39 10.92/15.49/18.22 11.05/16.99/20.86 14.42/25.36/36.04 14.99/21.72/27.55 14.70/23.40/31.23

STCL (Ours) – 22.34/32.09/40.08 20.31/25.48/28.21 21.28/28.41/33.12 24.55/35.33/44.26 22.35/27.76/30.71 23.40/31.09/36.26

Vanilla [20] CVPR’23 10.53/13.19/15.80 11.33/12.38/13.11 10.92/12.77/14.33 13.75/16.91/19.96 16.27/17.64/20.09 14.90/17.27/20.02

Filter [20] CVPR’23 18.63/23.17/23.67 16.07/17.18/17.32 17.26/19.73/20.00 22.73/28.55/29.32 21.44/22.99/23.21 22.06/25.47/25.91

Conv [20] CVPR’23 21.45/26.33/27.49 17.76/19.72/19.86 19.43/22.55/23.06 24.00/29.88/31.10 21.42/24.94/25.09 22.64/27.19/27.77

IPS+T Transformer [20] CVPR’23 21.62/26.44/27.49 18.85/20.10/20.51 20.14/22.84/23.49 24.33/29.77/30.99 22.80/24.36/24.79 23.54/26.79/27.54

MCL [21] AAAI’25 15.96/20.07/25.78 13.85/17.01/19.30 14.83/18.41/22.07 17.85/22.51/28.66 17.42/20.98/23.36 17.63/21.72/25.74

IRG [70] CVPR’25 23.89/30.60/31.54 16.03/17.98/18.16 19.18/22.65/23.05 27.05/34.87/36.36 21.45/24.20/24.50 23.93/28.57/29.27

STCL (Ours) – 28.21/32.37/34.37 22.96/24.61/25.27 25.32/27.96/29.13 31.54/36.04/38.59 28.38/30.06/31.16 29.88/32.78/34.48

表V:基于IPS+T的SGDet任务的性能与推理效率对比。FPS表示单设备每秒帧数的推理吞吐量,Time/Video表示单设备每视频的平均推理时间(秒)。报告的推理时间仅涵盖第二阶段的关系预测。STCL在FTR@200/500/1000上表现最佳,显著优于Vanilla、Filter、Conv、Transformer、MCL和IRG。这一改进证明了将记忆引导匹配与空间和时间上下文建模相结合,对于卫星视频中复杂关系推理的有效性。尽管STCL的帧率略低,单视频推理时间比一些轻量级基线长,但它仍实现了114.09 FPS的吞吐量和每视频1.96秒的平均推理时间。总体而言,STCL在保持实用推理效率的同时提供了显著的精度提升。

模型 FTR@200/500/1000 FPS Time/Video (s) Vanilla [20] 10.92/12.77/14.33 140.83 1.59 Filter [20] 17.26/19.73/20.00 142.76 1.57 Conv [20] 19.43/22.55/23.06 139.92 1.60 Transformer [20] 20.14/22.84/23.49 136.27 1.64 MCL [21] 14.83/18.41/22.07 147.86 1.51 IRG [70] 19.18/22.65/23.05 132.15 1.69 STCL (Ours) 25.32/27.96/29.13 114.09 1.96

C. 定性结果与可视化

为了定性评估所提出的STCL方法在典型卫星视频场景中的时空关系建模能力,我们可视化了生成的时空全景场景图。图7和图8分别展示了港口和机场场景的代表性可视化结果。这些结果直观地展示了模型捕捉空间结构、多对象交互以及关系时序演化的能力。

如图7所示,在港口场景中,STCL在帧间保持实例身份的同时,准确捕捉了多对象交互的时序演化。例如,模型正确识别了时空三元组,如<aircraft carrier15, docked at, dock2>和<aircraft carrier15, remain stationary on, water17>,反映了关系随时间的持续性。此外,空间上下文建模使得能够精确识别诸如<aircraft carrier15, within the boundary of, warning line24>和<boat20, outside the boundary of, warning line24>这样的三元组,展示了对空间交互的高保真理解。此外,利用跨对象交互,STCL成功推断出复杂的三元组,如<turbulent16, same group as, kelvin7>,突显了其在多对象动态场景中的敏感性和推理能力。

图8展示了STCL在机场场景中的定性结果。STCL准确捕捉了诸如<bare land1, surround, building7>的空间关系,反映了其对复杂场景结构组织的建模能力。它进一步识别了飞机与跑道之间的remain stationary on关系,以及不同飞机之间的parked parallel to关系。这些结果表明,STCL有效地整合了身份一致的实例轨迹、成对空间上下文和时间依赖性,以推理超出单帧空间观察的演化对象间关系。

第 13 页

13

图 7. STCL 在港口场景中的定性可视化。

表 VI:STCL 关键组件的消融实验。实验在基于 IPS+T 的 SGDet 设置下进行,并使用 TR@K、mTR@K 和 FTR@K 进行评估。 SGDet (θt = 0.5) MGM SCE MTL STCL 组件的影响。为了评估 STCL 中每个关键组件的贡献,我们通过从完整模型中单独移除 MGM、SCE 或 MTL 来进行消融实验。如表 VI 所示,所有三个组件都对时空关系预测有积极贡献,但它们的影响程度不同。其中,MTL 起着最关键的作用。移除 MTL 导致 TR@200/500/1000、mTR@200/500/1000 和 FTR@200/500/1000 大幅下降,证明了动态时序建模对于识别时空关系至关重要。这是因为实例级卫星视频中的关系高度依赖于物体运动模式、关系持续时间和时序状态演变。通过在多个时间尺度上对关系特征进行建模,MTL 有效地捕捉了短期变化和长程依赖。移除 SCE 或 MGM 也会降低性能,但下降幅度相对小于移除 MTL 造成的下降。这表明 SCE 通过建模不同实例对之间的结构化依赖关系,提高了关系表示的判别力。 TR@ mTR@ FTR@ 200/500/1000 200/500/1000 200/500/1000 ✓ ✓ 27.88/31.43/33.54 22.01/23.45/24.15 24.60/26.86/28.08 ✓ ✓ 11.83/15.16/17.43 11.75/13.69/14.25 11.79/14.39/15.68 ✓ ✓ 26.10/31.32/33.09 20.40/23.38/24.03 22.90/26.77/27.84 ✓ ✓ ✓ 28.21/32.37/34.37 22.96/24.61/25.27 25.32/27.96/29.13

D. 消融实验 为了进一步了解所提出的 STCL 框架的有效性,我们从两个角度进行了消融实验。首先,我们评估了每个关键组件的贡献,包括记忆引导匹配(MGM)、空间上下文增强(SCE)和多尺度时序学习(MTL)。由于观察到 MTL 在时空关系预测中起着最关键的作用,我们进一步分析了其时序建模深度的影响。

第 14 页

14

图 8. STCL 在机场场景中的定性可视化。

表 VII:MTL 中时序建模深度 L 的影响

在同一帧内,而 MGM 增强了跨帧实例关联的稳定性,并为后续的时空关系建模提供了更可靠的轨迹基础。当这三个组件联合使用时,STCL 取得了最佳性能。这些结果验证了所提出模块的互补性:MGM 提供时间一致的实例轨迹,SCE 通过帧内结构上下文增强关系特征,MTL 捕获关系随时间的动态演化。它们的协作使 STCL 能够更准确、更鲁棒地对卫星视频中的复杂时空关系进行建模。

时序建模深度的影响。鉴于 MTL 的主导贡献,我们通过改变 TCN 层数同时保持空间建模配置固定,进一步研究了时序建模深度对时空关系预测的影响。具体而言,时序建模深度设置为 1、2、3、4、5、6 和 7 层。如表 VII 所示,时序建模深度对整体性能有显著影响,当 L 设置为 4 时取得最佳结果。这表明适当扩大的时序感受野有助于从连续帧中捕获更可靠的时序依赖关系,从而有利于复杂的时空关系预测。这一趋势与卫星视频关系的性质一致,其中关系语义通常依赖于对象

第 15 页

运动趋势、相对几何演化以及随时间变化的状态转换,而非孤立的单帧观测。例如,诸如“沿……加速”、“从……起飞”、“接近”和“远离”等关系,通常需要跨多个连续帧的观测才能可靠地推断出来。然而,当时序深度超过四层时,尽管存在微小波动,性能通常仍低于四层设置,这表明增加时序建模深度并不必然带来进一步的性能提升。一种可能的解释是,过度的时序深度可能会在时间维度上引入过平滑,削弱局部但具有判别性的运动线索;它还可能增加模型复杂度和优化难度,导致在有限训练数据下出现冗余的时序建模或过拟合。在我们的实验中,4层TCN在时序上下文建模能力和模型复杂度之间实现了最佳平衡,因此被采用为默认设置。

VI. 结论

本文提出了T-STAR,这是首个专门针对卫星视频中时空全景场景图(TPSG)任务的大规模基准数据集。T-STAR包含图像尺寸从400×400到1,500×1,500像素的卫星视频帧,提供了超过110万个带有空间和时间特征的对象实例掩码,以及超过380万个时空三元组。凭借细粒度的全景掩码标注、时间一致的实例身份以及丰富的时空关系,T-STAR为将TPSG作为卫星视频中一项具有挑战性和意义的任务进行推进,提供了重要的数据基础。此外,考虑到卫星视频的独特特性,我们在统一框架内设计了一种时空协同学习(STCL)模型,用于TPSG任务,以增强跨帧实例一致性和时空关系预测。未来的工作将专注于将T-STAR扩展到更多样化的卫星视频场景,并进一步探索开放世界TPSG,从而推动卫星视频解释向更通用和可扩展的结构化地理空间认知发展。

致谢

本工作部分得到了中国教育部基础与交叉学科突破计划(Grant JYB2025XDXM111)、国家自然科学基金(Grant 42371321)以及湖北省重点研发计划(Grant 2025BAB024)的支持。

参考文献

[1] M. Burke, A. Driscoll, D. B. Lobell, and S. Ermon, “Using satellite imagery to understand and promote sustainable development,” Science, vol. 371, no. 6535, p. eabe8628, 2021. [2] K. Wu, Y. Zhang, L. Ru, B. Dang, J. Lao, L. Yu, J. Luo, Z. Zhu, Y. Sun, J. Zhang et al., “A semantic-enhanced multi-modal remote sensing foundation model for earth observation,” Nature Machine Intelligence, vol. 7, no. 8, pp. 1235–1249, 2025. [3] B. Zhao, P. Han, and X. Li, “Vehicle perception from satellite,” IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 46, no. 4, pp. 2545–2554, 2024. [4] N. Ni and L. Zhang, “Hazy low-quality satellite video restoration via learning optimal joint degradation patterns and continuous-scale super-resolution reconstruction,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025, pp. 12 690–12 699. [5] C. Xiao, W. An, Y. Zhang, Z. Su, M. Li, W. Sheng, M. Pietik¨ainen, and L. Liu, “Highly efficient and unsupervised framework for moving object detection in satellite videos,” IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 46, no. 12, pp. 11 532–11 539, 2024. [6] J. Zhang, X. Jia, J. Hu, and K. Tan, “Moving vehicle detection for remote sensing video surveillance with nonstationary satellite platform,” IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 44, no. 9, pp. 5185–5198, 2022. [7] Y. Zhong, M. Shu, Z. Liu, and X. Lu, “Spatio-temporal dual-branch network with predictive feature learning for satellite video object segmentation,” IEEE Transactions on Geoscience and Remote Sensing, vol. 60, pp. 1–15, 2022. [8] S. Li, Z. Zhou, M. Zhao, J. Yang, W. Guo, Y. Lv, L. Kou, H. Wang, and Y. Gu, “A multitask benchmark dataset for satellite video: Object detection, tracking, and segmentation,” IEEE Transactions on Geoscience and Remote Sensing, vol. 61, pp. 1–21, 2023. [9] B. Wang, H. Sui, G. Ma, and Y. Zhou, “Mctracker: Satellite video multi-object tracking considering inter-frame motion correlation and multi-scale cascaded feature enhancement,” ISPRS Journal of Photogrammetry and Remote Sensing, vol. 214, pp. 82–103, 2024. [10] Y. Chen, Y. Tang, Y. Xiao, Q. Yuan, Y. Zhang, F. Liu, J. He, and L. Zhang, “Satellite video single object tracking: A systematic review and an oriented object tracking benchmark,” ISPRS Journal of Photogrammetry and Remote Sensing, vol. 210, pp. 212–240, 2024. [11] Y. Gu, H. Liu, T. Wang, S. Li, and G. Gao, “Deep feature extraction and motion representation for satellite video scene classification,” Science China Information Sciences, vol. 63, no. 4, p. 140307, 2020. [12] W. Guo, S. Li, F. Chen, Y. Sun, and Y. Gu, “Satellite video multi-label scene classification with spatial and temporal feature cooperative encoding: A benchmark dataset and method,” IEEE Transactions on Image Processing, vol. 33, pp. 2238–2251, 2024. [13] Y. Cong, W. Liao, H. Ackermann, B. Rosenhahn, and M. Y. Yang, “Spatial-temporal transformer for dynamic scene graph generation,” in Proceedings of the IEEE/CVF International Conference on Computer Vision, 2021, pp. 16 372–16 382. [14] J. Ji, R. Krishna, L. Fei-Fei, and J. C. Niebles, “Action genome: Actions as compositions of spatio-temporal scene graphs,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 10 236–10 247. [15] X. Chang, P. Ren, P. Xu, Z. Li, X. Chen, and A. Hauptmann, “A comprehensive survey of scene graphs: Generation and application,” IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 45, no. 1, pp. 1–26, 2023. [16] K. Tang, Y. Niu, J. Huang, J. Shi, and H. Zhang, “Unbiased scene graph generation from biased training,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 3716–3725. [17] D. Xu, Y. Zhu, C. B. Choy, and L. Fei-Fei, “Scene graph generation by iterative message passing,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2017, pp. 5410–5419. [18] S. Nag, K. Min, S. Tripathi, and A. K. Roy-Chowdhury, “Unbiased scene graph generation in videos,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 22 803–22 813. [19] G. Wang, Z. Li, Q. Chen, and Y. Liu, “Oed: Towards one-stage end-to-end dynamic scene graph generation,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 27 938–27 947. [20] J. Yang, W. Peng, X. Li, Z. Guo, L. Chen, B. Li, Z. Ma, K. Zhou, W. Zhang, C. C. Loy et al., “Panoptic video scene graph generation,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 18 675–18 685. [21] T. T. Nguyen, X. Wu, Y. Bin, C.-D. T. Nguyen, S.-K. Ng, and A. T. Luu, “Motion-aware contrastive learning for temporal panoptic scene graph generation,” in Proceedings of the AAAI Conference on Artificial Intelligence, vol. 39, no. 6, 2025, pp. 6218–6226. [22] T.-T. Nguyen, P. Nguyen, X. Li, J. Cothren, A. Yilmaz, and K. Luu, “Cyclo: Cyclic graph transformer approach to multi-object relationship modeling in aerial videos,” Advances in Neural Information Processing Systems, vol. 37, pp. 90 355–90 383, 2024. [23] W. Chen, L. Bruzzone, B. Dang, Y. Gao, Y. Deng, J.-G. Yu, L. Yuan, and Y. Li, “Rest: Holistic learning for end-to-end semantic segmentation

第 16 页

16

of whole-scene remote sensing imagery,” IEEE Transactions on Pattern [44] S. J. Hwang, S. N. Ravi, Z. Tao, H. J. Kim, M. D. Collins, and V. Singh, Analysis and Machine Intelligence, vol. 48, no. 1, pp. 693–710, 2026. “Tensorize, factorize and regularize: Robust visual relationship learning,” [24] Y. Li, W. Li, B. Dang, Y. Wang, W. Chen, L. Wang, B. Yang, and in Proceedings of the IEEE/CVF Conference on Computer Vision and Y. Zhang, “Full-scope vectorization of geographical elements from large- Pattern Recognition, 2018, pp. 1014–1023. size remote sensing imagery,” IEEE Transactions on Pattern Analysis [45] R. Yu, A. Li, V. I. Morariu, and L. S. Davis, “Visual relationship and Machine Intelligence, vol. 48, no. 6, pp. 6897–6911, 2026. detection with internal and external linguistic knowledge distillation,” [25] Q. Yin, Q. Hu, H. Liu, F. Zhang, Y. Wang, Z. Lin, W. An, and Y. Guo, in Proceedings of the IEEE/CVF International Conference on Computer “Detecting and tracking small and dense moving objects in satellite Vision, 2017, pp. 1974–1982. videos: A benchmark,” IEEE Transactions on Geoscience and Remote [46] A. Zareian, S. Karaman, and S.-F. Chang, “Bridging knowledge graphs Sensing, vol. 60, pp. 1–18, 2021. to generate scene graphs,” in Proceedings of the European Conference [26] M. Zhao, S. Li, S. Xuan, L. Kou, S. Gong, and Z. Zhou, “Satsot: on Computer Vision. Springer, 2020, pp. 606–623. A benchmark dataset for satellite video single object tracking,” IEEE [47] Y. Li, W. Ouyang, B. Zhou, J. Shi, C. Zhang, and X. Wang, “Factorizable Transactions on Geoscience and Remote Sensing, vol. 60, pp. 1–11, net: an efficient subgraph-based framework for scene graph generation,” 2022. in Proceedings of the European Conference on Computer Vision, 2018, [27] Y. Li, L. Jiao, Z. Huang, X. Zhang, R. Zhang, X. Song, C. Tian, pp. 335–351. Z. Zhang, F. Liu, S. Yang et al., “Deep learning-based object tracking [48] R. Li, S. Zhang, B. Wan, and X. He, “Bipartite graph network with in satellite videos: A comprehensive survey with a new dataset,” IEEE adaptive message passing for unbiased scene graph generation,” in Geoscience and Remote Sensing Magazine, vol. 10, no. 4, pp. 181–212, Proceedings of the IEEE/CVF Conference on Computer Vision and 2022. Pattern Recognition, 2021, pp. 11 109–11 119. [28] Q. He, X. Sun, Z. Yan, B. Li, and K. Fu, “Multi-object tracking in satel- [49] S. Sun, S. Zhi, Q. Liao, J. Heikkil¨a, and L. Liu, “Unbiased scene lite videos with graph-based multitask modeling,” IEEE Transactions on graph generation via two-stage causal modeling,” IEEE Transactions on Geoscience and Remote Sensing, vol. 60, pp. 1–13, 2022. Pattern Analysis and Machine Intelligence, vol. 45, no. 10, pp. 12 562– [29] Y. Zhang, Y. Tang, F. Liu, Y. Chen, and T. Han, “Structural consistency- 12 580, 2023. based multi-object detection for satellite video and benchmark with real [50] Y. Li, T. Wang, K. Wu, L. Wang, X. Guo, and W. Wang, “Fine-grained scene simulation dataset,” IEEE Journal of Selected Topics in Applied scene graph generation via sample-level bias prediction,” in Proceedings Earth Observations and Remote Sensing, vol. 18, pp. 23 728–23 743, of the European Conference on Computer Vision. Springer, 2024, pp. 2025. 18–35. [30] C. Lu, R. Krishna, M. Bernstein, and L. Fei-Fei, “Visual relationship [51] L. Liu, S. Sun, S. Zhi, F. Shi, Z. Liu, J. Heikkil¨a, and Y. Liu, “A detection with language priors,” in Proceedings of the European Con- causal adjustment module for debiasing scene graph generation,” IEEE ference on Computer Vision, 2016, pp. 852–869. Transactions on Pattern Analysis and Machine Intelligence, vol. 47, [31] Y. Deng, Y. Li, Y. Zhang, X. Xiang, J. Wang, J. Chen, and J. Ma, “Hi- no. 5, pp. 4024–4043, 2025. erarchical memory learning for fine-grained scene graph generation,” in [52] M. Chen, L. Li, W. Wang, and Y. Yang, “Diffvsgg: Diffusion-driven Proceedings of the European Conference on Computer Vision. Springer, online video scene graph generation,” in Proceedings of the IEEE/CVF 2022, pp. 266–283. Conference on Computer Vision and Pattern Recognition, 2025, pp. [32] J. Johnson, R. Krishna, M. Stark, L.-J. Li, D. Shamma, M. Bernstein, 29 161–29 172. and L. Fei-Fei, “Image retrieval using scene graphs,” in Proceedings of [53] Y. Zhang, Y. Pan, T. Yao, R. Huang, T. Mei, and C.-W. Chen, “End- the IEEE/CVF Conference on Computer Vision and Pattern Recognition, to-end video scene graph generation with temporal propagation trans- 2015, pp. 3668–3678. former,” IEEE Transactions on Multimedia, vol. 26, pp. 1613–1625, [33] X. Yang, K. Tang, H. Zhang, and J. Cai, “Auto-encoding scene graphs 2023. for image captioning,” in Proceedings of the IEEE/CVF Conference on [54] L. Xu, H. Qu, J. Kuen, J. Gu, and J. Liu, “Meta spatio-temporal Computer Vision and Pattern Recognition, 2019, pp. 10 685–10 694. debiasing for video scene graph generation,” in Proceedings of the [34] L. Li, Z. Gan, Y. Cheng, and J. Liu, “Relation-aware graph attention European Conference on Computer Vision. Springer, 2022, pp. 374– network for visual question answering,” in Proceedings of the IEEE/CVF 390. International Conference on Computer Vision, 2019, pp. 10 312–10 321. [55] T. Pu, T. Chen, H. Wu, Y. Lu, and L. Lin, “Spatial–temporal knowledge-[35] M. A. Sadeghi and A. Farhadi, “Recognition using visual phrases,” embedded transformer for video scene graph generation,” IEEE Trans- in Proceedings of the IEEE/CVF Conference on Computer Vision and actions on Image Processing, vol. 33, pp. 556–568, 2023. Pattern Recognition, 2011, pp. 1745–1752. [56] X. Lin, C. Shi, Y. Zhan, Z. Yang, Y. Wu, and D. Tao, “Td2-net:[36] R. Krishna, Y. Zhu, O. Groth, J. Johnson, K. Hata, J. Kravitz, S. Chen, Toward denoising and debiasing for video scene graph generation,” in Y. Kalantidis, L.-J. Li, D. A. Shamma et al., “Visual genome: Connecting Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, language and vision using crowdsourced dense image annotations,” no. 4, 2024, pp. 3495–3503. International Journal of Computer Vision, vol. 123, pp. 32–73, 2017. [37] D. A. Hudson and C. D. Manning, “Gqa: A new dataset for real-world [57] P. Li, D. Zhang, A. Wulamu, X. Liu, and P. Chen, “Semantic relation visual reasoning and compositional question answering,” in Proceedings model and dataset for remote sensing scene understanding,” ISPRS of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- International Journal of Geo-Information, vol. 10, no. 7, p. 488, 2021. tion, 2019, pp. 6700–6709. [58] J. Chen, X. Zhou, Y. Zhang, G. Sun, M. Deng, and H. Li, “Message- [38] A. Kuznetsova, H. Rom, N. Alldrin, J. Uijlings, I. Krasin, J. Pont-Tuset, passing-driven triplet representation for geo-object relational inference S. Kamali, S. Popov, M. Malloci, A. Kolesnikov et al., “The open in hrsi,” IEEE Geoscience and Remote Sensing Letters, vol. 19, pp. 1–5, images dataset v4: Unified image classification, object detection, and 2021. visual relationship detection at scale,” International Journal of Computer [59] Z. Lin, F. Zhu, Y. Kong, Q. Wang, and J. Wang, “Srsg and s2sg: A model Vision, vol. 128, no. 7, pp. 1956–1981, 2020. and a dataset for scene graph generation of remote sensing images from [39] J. Yang, Y. Z. Ang, Z. Guo, K. Zhou, W. Zhang, and Z. Liu, “Panoptic segmentation results,” IEEE Transactions on Geoscience and Remote scene graph generation,” in Proceedings of the European Conference on Sensing, vol. 60, pp. 1–11, 2022. Computer Vision, 2022, pp. 178–196. [60] Y. Li, L. Wang, T. Wang, X. Yang, J. Luo, Q. Wang, Y. Deng, W. Wang, [40] K. Liang, Y. Guo, H. Chang, and X. Chen, “Visual relationship detection X. Sun, H. Li et al., “Star: A first-ever dataset and a large-scale bench- with deep structural ranking,” in Proceedings of the AAAI Conference mark for scene graph generation in large-size satellite imagery,” IEEE

人工智能学报,第32卷,第1期,2018年,第7098–7105页。模式分析与机器智能汇刊,第47卷, [41] X. Dong, T. Gan, X. Song, J. Wu, Y. Cheng, and L. Nie, “Stacked hybrid- 第3期,第1832–1849页,2025年。 attention and group collaborative learning for unbiased scene graph [61] Q. Yan, C. Deng, C. Liu, Z. Hou, X. Liu, Y. Jiang, W. Lu, F. Yao, generation,” in Proceedings of the IEEE/CVF Conference on Computer X. Liu, L. Hao et al., “Recon1m: A large-scale benchmark dataset for Vision and Pattern Recognition, 2022, pp. 19 427–19 436. relation comprehension in remote sensing imagery,” IEEE Transactions [42] B. Dai, Y. Zhang, and D. Lin, “Detecting visual relationships with deep on Geoscience and Remote Sensing, vol. 63, pp. 1–22, 2025. relational networks,” in Proceedings of the IEEE/CVF Conference on [62] Z. Hou, C. Deng, Q. Yan, X. Liu, T. Ling, W. Lu, H. Yu, Y. Hou, Computer Vision and Pattern Recognition, 2017, pp. 3076–3086. and X. Sun, “Scene-specific multi-prototype network for remote sensing [43] R. Zellers, M. Yatskar, S. Thomson, and Y. Choi, “Neural motifs: scene graph generation,” IEEE Transactions on Geoscience and Remote Scene graph parsing with global context,” in Proceedings of the IEEE Sensing, vol. 63, pp. 1–21, 2025. Conference on Computer Vision and Pattern Recognition, 2018, pp. [63] L. Wang, T. Wang, J. Luo, and Y. Li, “Hierarchical prototype learning 5831–5840. via aggregation-decomposition for fine-grained geospatial scene graph

第 17 页

生成,”《IEEE 地球科学与遥感汇刊》,第 63 卷,第 1–13 页,2025 年。 [64] T. Wang, L. Wang, J. Luo, K. Wu, 和 Y. Li,“遥感图像中无偏场景图生成的偏差感知学习”,《ISPRS 摄影测量与遥感杂志》,第 231 卷,第 473–486 页,2026 年。 [65] Y. Gu, T. Wang, X. Jin, 和 G. Gao,“卫星视频理解中感兴趣事件的检测”,《IEEE 地球科学与遥感汇刊》,第 58 卷,第 11 期,第 7860–7871 页,2020 年。 [66] S. Li, X. Sun, Y. Gu, Y. Lv, M. Zhao, Z. Zhou, W. Guo, Y. Sun, H. Wang, 和 J. Yang,“卫星视频智能处理的最新进展:挑战、方法与应用”,《IEEE 应用地球观测与遥感精选专题杂志》,第 16 卷,第 6776–6798 页,2023 年。 [67] Y. Wang, J. Li, G. Gao, 和 Y. Gu,“用于卫星视频场景理解的双路径自监督时空学习”,《IEEE 地球科学与遥感汇刊》,第 64 卷,第 1–11 页,2026 年。 [68] P. Lai, M. Zhang, G. Cheng, S. Li, X. Huang, 和 J. Han,“用于卫星视频目标跟踪的目标感知 Transformer”,《IEEE 地球科学与遥感汇刊》,第 62 卷,第 1–10 页,2024 年。 [69] S. Bai, J. Z. Kolter, 和 V. Koltun,“通用卷积与循环网络用于序列建模的经验评估”,arXiv 预印本 arXiv:1803.01271,2018 年。 [70] Y. Li, Z. Li, H. Chen, 和 L. Xu,“通过视觉与语义双重去偏实现无偏视频场景图生成”,收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》,2025 年,第 19 047–19 056 页。 [71] D. P. Kingma 和 J. Ba,“Adam:一种随机优化方法”,收录于《国际学习表征会议》,2015 年。

发表评论