快速导读:系统比较了注意力、状态空间模型和压缩瓶颈三种融合范式在文本驱动的双时相变化检索中的效率与精度权衡,并提出了一种训练无关的级联检索策略,可在保持召回率的同时将查询成本降低10-15倍。
随着地球观测卫星档案规模的爆炸式增长,人工分析海量遥感图像已不可行。基于文本的变化检索技术应运而生:用户用自然语言描述感兴趣的变化类型(如“农田变为建筑”),系统自动返回发生该变化的双时相图像对。这项技术的关键在于如何高效融合前后两个时相的图像特征,使其与文本描述对齐。
本文在固定CLIP ViT-B/16图像编码器和统一训练配方下,系统比较了8种融合设计,涵盖简单基线、注意力机制、状态空间模型(Mamba)和压缩瓶颈(TBF)四大类。更重要的是,作者提出了一种训练无关的级联检索策略,可在保持召回率的同时将查询延迟降低一个数量级。
英文题目:Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently
论文出处:arXiv 每日论文精选 · arXiv:2607.28571
原始论文:PDF / 论文页面
对应视频标题:卫星影像变化检索:融合架构的效率-精度博弈与级联加速策略|推荐指数:★★★★★
这篇论文解决什么问题?
现有基于文本的变化检索方法多采用Transformer融合双时相特征,但其自注意力的二次复杂度和高特征维度导致查询延迟高。在交互式应用中,用户期望毫秒级响应,而全量融合数千对图像可能需要数秒甚至更久。
近年来,状态空间模型(如Mamba)以其线性复杂度在长序列建模中展现出潜力,被引入遥感变化检测领域。然而,这些新架构在文本驱动的变化检索任务中的实际效率-精度权衡尚未得到系统性评估。
此外,不同融合模块的延迟特性不仅取决于理论复杂度,还受硬件并行能力、内存带宽等因素影响。简单地将注意力替换为Mamba,在标准ViT输入尺寸下是否真的能加速?这个问题需要实测回答。
最后,查询时的计算瓶颈在于融合模块需要对所有候选对运行,而大多数候选对与查询无关。能否利用廉价模型快速排除大量不相关候选,仅对少量高概率对使用高精度融合?这种级联思路在变化检索中尚未被探索。
核心创新
- 提出训练无关的级联检索策略,利用减法模型预筛选,结合注意力模型重排序,在LEVIR-CC上实现10-15倍查询加速且召回率不降。
- 首次对注意力、状态空间模型和压缩瓶颈三类双时相融合架构进行受控比较,覆盖8种设计,基于10个随机种子提供统计显著性结果。
- 实验证明Mamba在标准ViT序列长度(L=196)下的线性复杂度优势未转化为实际延迟收益,其选择性扫描受限于内存带宽,而注意力机制能高效利用并行计算。
- 识别出TBF为效率-质量最佳平衡点,通过压缩融合表示,参数减少2.3倍,延迟降低1.6倍,仅以0.007的BLEU-1代价换取。
方法概览
在固定CLIP ViT-B/16图像编码器和统一训练配方下,系统比较了8种融合设计:简单基线(减法、MLP融合)、注意力机制(拼接Transformer、TFF)、状态空间模型(三种Mamba变体)和压缩瓶颈(Temporal Bottleneck Fusion, TBF)。TBF采用“先拼接后压缩”模式,在自注意力前将拼接特征维度减半。此外,提出一种训练无关的级联检索策略:先用廉价的减法模型筛选候选集,再用注意力模型重排序Top-N。
- 统一框架:所有方法共享冻结的CLIP ViT-B/16图像编码器和文本编码器,仅替换双时相融合模块。训练使用对称的InfoNCE损失,优化图像-文本和文本-图像两个方向的对比学习。
- 简单基线:减法融合(直接相减后投影)和MLP融合(拼接后经MLP降维),作为效率上界和质量下界的参考点。
- 注意力机制:拼接Transformer(将两个时相的patch token拼接后送入Transformer编码器)和TFF(Text-ITSR中的融合模块,使用交叉注意力),代表高质量但高延迟的方案。
- 状态空间模型:三种Mamba变体——Early Mamba(先拼接再经Mamba块)、Late Mamba(先分别经Mamba块再拼接)、Interleaved Mamba(交替使用Mamba块和交叉注意力),旨在探索线性复杂度的实际收益。
- 压缩瓶颈(TBF):采用“先拼接后压缩”模式,将拼接后的特征维度减半后再送入自注意力层,通过压缩融合表示来降低计算量。设计灵感来自多模态瓶颈Transformer。
- 级联检索策略:第一阶段使用减法模型(延迟极低)对所有候选对打分排序,筛选出Top-N;第二阶段使用注意力模型(TBF或拼接Transformer)对Top-N重排序。该策略训练无关,可直接应用于任何已训练好的融合模块。
- 评估指标:语义相似度(BLEU-1/4, METEOR, ROUGE-L)衡量生成描述的质量;严格实例级Recall@K衡量检索准确性,要求返回的图像对与查询描述精确匹配。
- 延迟测量:在RTX 4070上使用CUDA同步,1000次运行取平均,确保测量的是实际墙钟时间而非理论FLOPs。
逐图理解论文
失败的直觉:Mamba的延迟陷阱

表1对比了8种融合设计的参数量、FLOPs和实测延迟。关键观察:TBF以5.73M参数和0.47ms延迟实现最佳效率,而Interleaved Mamba虽参数最少(2.27M),延迟却比TBF高28%,揭示了理论复杂度与实际延迟的脱节。
本文贡献:受控比较与级联加速

图1展示了级联检索的完整流程:所有候选图像对经CLIP离线编码后,减法模型快速排序,TBF仅对Top-N重排序。右侧的检索示例显示,正确图像对(绿色框)被成功排在首位,干扰项(棕色框)在语义上虽合理但并非真实匹配。
核心发现:TBF是最佳平衡点,级联检索实现数量级加速

表2报告了语义相似度指标。在LEVIR-CC变化子集上,拼接Transformer的BLEU-1为0.655,TBF为0.648,差距仅0.007。注意完整测试集与变化子集的结果差异,反映了背景先验对指标的影响。
价值与边界

图2(a)绘制了Recall@1与融合延迟的帕累托前沿,TBF和拼接Transformer分别占据前沿的不同位置。图2(b)展示TBF的Top-3检索结果,正确对排第一和第三,干扰项在语义上相关但非真实变化,说明模型能区分细微差异。
实验如何设计?
- 数据集:LEVIR-CC(10077对训练,1929对测试,高分辨率)和Dubai-CC(较小规模,低分辨率),均采用面向检索的数据集划分。
- 训练配置:10个随机种子,固定CLIP ViT-B/16编码器,统一优化器和训练轮数,确保比较的公平性。
- 评估协议:分别在完整测试集和仅含变化的子集上报告语义相似度;实例级检索仅在变化查询上评估,排除无变化查询。
- 编码器鲁棒性验证:替换CLIP为GeoRSCLIP和SigLIP 2,验证融合模块排序的一致性。
- 序列长度扫描:在不同patch数量(L)下测量Mamba和注意力的延迟,分析线性复杂度的实际生效区间。
- 级联检索验证:在LEVIR-CC全量测试集上,以减法模型为第一阶段,评估不同候选集大小N下的召回率和查询延迟。
关键结果与论文证据
- TBF实现最佳效率-质量平衡:参数5.73M(拼接Transformer的2.3分之一),延迟0.47ms(1.6倍加速),在LEVIR-CC变化子集上BLEU-1仅差0.007(0.648 vs. 0.655)(第6-7页,Table 1和Table 2)。
- Mamba的线性复杂度优势未转化为实际延迟收益:Interleaved Mamba参数量最少(2.27M),但延迟0.60ms比TBF的0.47ms高28%。原因在于标准ViT序列长度L=196时,Mamba的选择性扫描受限于内存带宽,而注意力能高效利用GPU并行计算(第6页,Table 1)。
- 拼接Transformer在语义质量上最优但延迟最高:BLEU-1达0.655,但延迟0.76ms,参数量13.05M(第6-7页,Table 1和Table 2)。
- 级联检索实现10-15倍加速且召回率不降:在LEVIR-CC上,TBF级联检索(N=25)的R@1为2.33,R@5为8.91,均优于全量融合的2.06和8.29,查询延迟从907ms降至89ms(10.2倍加速)。拼接Transformer级联检索的R@1为2.43,R@5为9.33,延迟从1466ms降至96ms(15.2倍加速)(第8页,Table 4)。
- 级联检索的增益与数据集规模相关:在较小规模的Dubai-CC上,级联检索仅实现质量持平,未展现出LEVIR-CC上的显著提升(第8页)。
- 融合模块排序对编码器选择鲁棒:替换CLIP为GeoRSCLIP和SigLIP 2后,各融合模块的相对排序保持一致,TBF始终处于效率-质量前沿(第7页)。
- 序列长度扫描揭示Mamba的适用边界:当L>400时,Mamba的延迟优势开始显现,但在标准ViT输入(L=196)下,注意力更优(第6页)。
- 减法模型作为第一阶段的性价比极高:其延迟极低(0.18ms),能有效筛选候选集,为级联检索的效率提升奠定基础(第6页,Table 1)。
阅读时需要注意
- LEVIR-CC采用面向检索的数据集划分,导致无法与已发表的图像描述生成结果直接比较。
- 使用的n-gram指标(BLEU等)会惩罚有效的同义改写,仅能间接反映检索实用性,可能低估模型的实际检索能力。
- 延迟测量仅在一款桌面级GPU(RTX 4070)上进行,结论向其他硬件(如服务器GPU、边缘设备)的泛化性未经验证。
- TBF的压缩瓶颈虽高效,但更激进的压缩可能悄悄丢弃变化相关细节,而聚合指标可能无法揭示这种退化。
关联工作
- CLIP作为基础视觉-语言模型,提供冻结的图像和文本编码器,是本文所有方法的共同基础(第2页)。
- Text-ITSR中的TFF模块被作为注意力机制的代表进行评估,其交叉注意力设计与拼接Transformer形成互补(第3页)。
- ChangeMamba启发本文的Mamba变体设计,将状态空间模型引入遥感变化检测,但本文揭示了其在标准输入尺寸下的延迟陷阱(第3页)。
- 多模态瓶颈Transformer的“压缩瓶颈”思想被迁移至双时相融合,形成TBF模块的核心设计(第4页)。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
从文本中检索卫星档案中的变化: 如何高效结合前后影像
Simon Roy, Haechan Mark Bong, and Giovanni Beltrame
蒙特利尔理工学院,蒙特利尔,魁北克,加拿大 {simon-7.roy,haechan.bong,giovanni.beltrame}@polymtl.ca
摘要。业务化对地观测日益需要回答诸如“找出出现新建筑的影像对”之类的查询。这意味着搜索一个包含前后(双时相)卫星影像对的档案,并根据每对影像与变化自然语言描述的匹配程度进行排序。执行此匹配的组件,即结合“前”和“后”视图的融合模块,必须在查询时对众多候选对运行,因此其速度在很大程度上决定了每次搜索的成本。我们对该模块的构建方式进行了受控比较。使用一个固定的图像编码器(一个冻结的CLIP模型)和一种适用于所有变体的训练方案,我们评估了来自三个家族的八种设计:注意力机制、状态空间模型(Mamba)和可学习压缩(我们的时序瓶颈融合,TBF)。每种设计都在两个基准(LEVIR-CC和Dubai-CC)上使用十个随机种子进行测试,因此报告的差异具有统计基础。我们概述了三个发现:第一,一种无需训练的两阶段搜索(一个廉价的差异模型用于筛选候选对象,随后通过注意力融合进行重排序)在LEVIR-CC上匹配或超过了全融合的召回率,同时将查询成本降低了10-15倍,在Dubai-CC上具有可比的R@1/R@5;第二,Mamba的线性时间扫描在理论上很有吸引力,但在视觉Transformer典型的块数量(L=196)下并未带来速度优势:扫描受限于内存带宽,而注意力机制能清晰地映射到并行硬件上;第三,压缩融合表示(TBF)将参数减少了2.3倍,延迟降低了1.6倍,仅以0.007的变化BLEU-1代价,尽管更激进的压缩会悄然丢弃变化相关的细节,而这些细节是聚合指标未能揭示的。
关键词:对地观测 · 变化检索 · 视觉–语言模型 · 高效架构 · 状态空间模型。
1 引言
对地观测档案正以人工分析无法企及的速度增长,而许多最有价值的洞察在任何单一影像中都不可见。
第 2 页
2 S. Roy et al.
图 1. 级联变化检索(LEVIR-CC,G=1929,N=25)。帧图像离线通过CLIP编码;减法滤波器对所有候选对进行排序,然后TBF对前N个短名单进行重排序,将每查询的融合延迟从907毫秒降至89毫秒,同时达到或超越全融合的召回率。
图像。评估风暴损害或审计城市扩张需要比较两次采集的图像,例如,找出所有“道路旁出现建筑物”的瓦片。基于文本的变化检索能直接回答此类查询:给定一个自然语言描述的变化,它返回展现该变化的双时相图像对,从而取代了对数千个候选对象的人工筛查。
CLIP [12]等视觉-语言模型将图像和文本嵌入共享的潜在空间,并已被适配到遥感领域[10]。Text-ITSR [7]通过一个Transformer模块融合两次采集的特征,再与文本嵌入进行匹配,将这一范式扩展到双时相检索。在实际部署中,昂贵的视觉骨干网络在数据摄入时对每帧运行一次,而融合模块则在查询时对请求区域和时间间隔内形成的每个候选对运行(图1,第3.4节):融合延迟和内存决定了交互式查询的成本,尤其是在资源受限的平台上。
基于Transformer的融合成本由两个独立因素驱动。第一个是模型关注的图像块数量L:自注意力机制将每个块与其他所有块进行比较,因此其成本随L²增长。第二个是特征宽度D,即用于描述每个块的向量长度。将“前”和“后”视图拼接在一起会使该宽度加倍,并且由于模型线性层和前馈层的成本随D²增长,宽度加倍大致会使成本变为原来的四倍。这两个因素是独立的:一个由图像分辨率决定,另一个由两个视图的组合方式决定。在标准ViT块数量(L=196)下,宽度因素主导了参数预算。这两个因素需要不同的解决方案:状态空间模型(SSM),如Mamba [6]
第 3 页
双时相融合用于文本变化检索 3
通过线性时间选择性扫描解决序列长度项,而压缩方案则通过在交互前降低维度D来解决宽度项。 我们并非提出另一种融合架构,而是探究哪种融合家族能为文本变化检索提供最佳的效率-精度权衡,以及理论复杂度优势是否能在实际运行基准测试中体现。我们在LEVIR-CC和Dubai-CC数据集上,使用相同的骨干网络、数据和训练条件,比较了八种融合设计,涵盖基于注意力的(拼接Transformer、交叉注意力Transformer特征融合(TFF)[7])、基于状态空间模型的(三种Mamba变体)和基于压缩的(时序瓶颈融合,TBF,在自注意力之前应用经典的拼接-降维模式)家族,外加两种简单基线。我们的贡献如下:
– 一种无需训练的检索级联策略,在保持全融合召回率的同时,将查询成本降低10-15倍。 – 据我们所知,这是首次在文本变化检索任务中,对基于注意力、瓶颈和状态空间模型的双时相融合进行受控比较,在单一骨干网络和训练方案下评估了八种设计,并基于十个随机种子进行了统计报告。 – 一项实际分析表明,Mamba的线性时间优势在标准ViT序列长度(L=196)下并未转化为延迟收益,其受内存限制的扫描速度落后于并行注意力机制。 – 确定TBF为一个有利的效率-质量平衡点,在仅损失0.007变化专用BLEU-1分数的情况下,将参数量减少2.3倍,延迟降低1.6倍。
2 相关工作
遥感中的跨模态检索与变化理解。基于文本的检索通过CLIP [12]等对比学习框架,将图像和语言投影到共享的潜在空间。RemoteCLIP [10]等遥感模型在单图像任务上表现出色,但缺乏双时相机制。变化检测已从孪生网络[4]发展到BIT [1]等Transformer模型,而变化描述[9]则将监督信号扩展至自然语言。文本变化检索本身尚处于早期阶段,Ferrod等人[5]首次在LEVIR-CC上将双时相变化嵌入与文本查询对齐,Text-ITSR [7]则结合了孪生编码器与Transformer融合阶段。两者都将时序交互视为通用序列问题,但现有文献未评估融合阶段的计算权衡。
状态空间模型。为解决注意力的二次复杂度问题,Mamba [6]等状态空间模型提供了线性时间替代方案,并在ChangeMamba [2]等密集遥感预测任务中展现出潜力。大多数状态空间模型的证据来自密集长序列任务(L > 1024);其在视觉-语言领域的应用仍属近期[17]。
第 4 页
4 S. Roy 等
瓶颈与早期融合策略。先拼接后降维是一种成熟的设计范式:FC-Siam-conc [4] 通过可学习卷积融合拼接后的编码器特征,BIT [1] 将融合特征投影到紧凑的令牌空间,多模态瓶颈Transformer [11] 则限制信息流以实现高效的多模态融合。本文评估的时序瓶颈融合(Temporal Bottleneck Fusion, TBF)模块将这种先拼接后降维的原则迁移到跨模态变化检索中。
3 研究设计
3.1 任务定义与检索协议
设 (I1, I2) 为时间 t1、t2 的配准图像,T 为自然语言描述,目标是得到一个对齐分数 S(I1, I2, T),使正确配对的排名更高。所有模型均使用相同的冻结 CLIP ViT-B/16 编码器提取图像块特征 X1, X2 ∈RL×Din(L = 196, Din = 768),在融合前投影到宽度 D = 320。融合后的视觉嵌入 vi 与文本嵌入 tj 之间的相似度为余弦分数 v⊤i tj sij = , (1) ∥vi∥2 ∥tj∥2
所有模型均基于 sij 使用标准的对称 InfoNCE 损失函数进行训练。
真值与匹配。每对图像配有五条描述。查询为单条描述,其唯一真值为该描述所标注的图像对(描述不在不同图像对间聚类)。因此,前K项召回率(Recall@K)衡量的是严格的实例级成功。由于存档中包含许多经历相似变化的相似场景,严格的实例匹配会低估实际效用。因此,我们补充使用语义指标,将查询描述与排名第一的检索结果图像对的参考描述进行比较(BLEU-1/4, METEOR, ROUGE-L [13]),即使检索返回的是发生相同变化的不同图像对,也能获得较高分数。
3.2 数据集
LEVIR-CC [9] 包含德克萨斯州上空 256 × 256 图块的高分辨率(0.5 米/像素)RGB 图像对,聚焦城市化,每对五条描述,我们的划分包含 3,918/1,333/1,929 对(训练/验证/测试,变化比例池化为 70/30;测试集平衡,含 964 个变化对)。遵循 [7],该划分为检索导向(变化对比标准描述划分更多),并统一应用于所有比较模型。Dubai-CC [8] 在 50×50 的 Landsat 7 瓦片上提供类似标注,分辨率约 30 米/像素,标准划分(300/50/150,变化比例 65/35)。
3.3 研究的融合架构
所有融合模块均接收投影后的特征并生成单一视觉嵌入,其余部分保持不变。
第 5 页
双时相融合用于文本变化检索 5
简单基线方法。减法计算逐元素差值X2−X1,随后进行线性投影。MLP融合将两个流按通道拼接,并应用两层MLP,即仅进行通道混合,无令牌交互。
基于注意力的方法。拼接Transformer沿通道轴拼接特征(L × 2D),并使用标准Transformer编码器处理,加倍后的宽度使每个线性投影和前馈模块参数膨胀,总参数量达13.05M。TFF是Text-ITSR [7]的融合阶段,在差异特征与原始双时相特征之间应用交叉注意力。
基于压缩的方法:时序瓶颈融合(TBF)。TBF在注意力之前采用先拼接后降维的模式:(i)压缩:一个MLP(线性层2D→D,ReLU,线性层D→D,LayerNorm)将拼接后的特征投影回宽度D;(ii)交互:标准Transformer编码器在宽度D而非2D下运行。由于投影和前馈模块的成本与宽度呈二次方关系,在D而非2D下运行可将其参数和计算量减少约4倍,同时保留所有图像块之间的全局自注意力。
基于SSM的方法。我们评估了受近期变化检测工作[2]启发的三种Mamba [6]变体。拼接Mamba将拼接基线中的Transformer替换为宽度为2D的Mamba模块。瓶颈Mamba使用与TBF相同的压缩MLP,随后是宽度为D的Mamba模块。交错Mamba将时序令牌交错排列为长度为2L的单一序列。
3.4 部署设置与实现
离线阶段,每帧图像在入库时编码一次并与元数据一同存储;图像对不预先计算。在线阶段,带有区域/时间约束的文本查询与卫星或无人机影像进行实时匹配。扫描的图像对数量随存档规模扩展,而骨干网络成本在入库时已分摊,因此查询延迟主要由融合模块决定。 模型使用PyTorch(mamba_ssm [6])实现,并在单块RTX 4070上训练。优化器使用AdamW(学习率8 × 10⁻⁵,权重衰减5 × 10⁻⁴),余弦退火至10⁻⁶,批量大小32,dropout 0.25,训练30个周期。所有融合模块使用3层,dmodel = 320,基于注意力的模型使用16个头,基于SSM的模型使用状态维度16、卷积宽度4和扩展因子2。除非另有说明,结果为10次训练运行的均值±标准差。代码和划分索引:https://github.com/SimonR99/bitemporal-fusion-benchmark。
4 结果
4.1 效率与复杂度
表1比较了参数量、FLOPs和实测延迟。延迟为CUDA同步下的实际耗时(50次预热后运行1000次,RTX 4070),
第 6 页
6 S. Roy 等
表1. L=196时融合机制的效率。延迟为单次融合前向传播(批次大小为1),在RTX 4070上运行1000次取平均值。加粗表示六个可学习模块中的最佳结果。
模型 参数量 (M) FLOPs (G) 延迟 (ms)
减法 0.35 0.14 0.04 MLP融合 2.71 1.06 0.20
拼接Transformer 13.05 5.42 0.76 TFF (Text-ITSR) 8.02 2.65 1.90 TBF 5.73 2.41 0.47
拼接Mamba 8.14 3.28 0.58 瓶颈Mamba 2.58 1.06 0.62 交错Mamba 2.27 1.77 0.60
FLOPs使用fvcore计算,Mamba的FLOPs通过选择性扫描公式解析计算[6]。
瓶颈压缩。TBF的参数量比拼接Transformer少2.3倍(5.73M vs. 13.05M),速度提升1.6倍(0.47 vs. 0.76 ms):在注意力之前将宽度减半,消除了大部分拼接开销。宽度扫描证实,2倍瓶颈(b=320)在噪声范围内与未压缩宽度相当,而更激进的压缩会先于全量质量降低仅变化区域的质量。
SSM延迟。尽管交错Mamba参数量最少(2.27M)且FLOPs较低(1.77G),其延迟(0.60 ms)比TBF高28%,仅比大得多的拼接Transformer低21%:理论线性复杂度并未转化为实际运行时间的增益(硬件原因见第5节)。图2a绘制了前1项召回率与延迟的关系:帕累托前沿仅包含简单基线、TBF和拼接Transformer。
4.2 语义检索质量
表2报告了完整测试集和仅变化子集上的描述相似度指标,后者隔离了对实际状态转换而非背景先验的匹配。 在LEVIR-CC上,拼接Transformer始终表现最佳,TBF是最接近的竞争者,参数量少2.3倍,延迟低1.6倍。Welch检验(n=10,仅变化区域BLEU-1)将CT与七个模块中的六个区分开(p≤0.0002)。TBF是例外:其0.007的差距比次接近者小1.6倍,处于可检测性边缘,非配对检验显著(p=0.04),但按种子配对检验不显著(p=0.08)。在Dubai-CC上,各模块在噪声范围内聚集(仅变化区域BLEU-1差距在0.02以内),仅有300个训练对,无法利用更高容量的融合(第5节)。
第 7 页
7 面向文本变化检索的双时相融合
(a) (b)
图 2. (a) LEVIR-CC变化查询上的前1项召回率与融合延迟关系图(CT = 拼接Transformer;虚线 = 帕累托前沿)。(b) TBF的前3项检索结果;正确配对(绿色)排名第一(上)和第三(下),干扰项(棕色)在语义上具有合理性。
表 2. 完整测试集和仅变化子集上的标题相似度指标(10次运行的平均值±标准差)。B-1/B-4 = BLEU-1/4,MET = METEOR,R-L = ROUGE-L。每个数据集和评估范围的最佳结果以粗体显示;分数为两个检索方向的平均值。
LEVIR-CC Dubai-CC
模型 B-1 B-4 MET R-L B-1 B-4 MET R-L
完整集
减法 0.631 ± 0.007 0.326 ± 0.004 0.294 ± 0.004 0.573 ± 0.008 0.575 ± 0.011 0.270 ± 0.014 0.274 ± 0.008 0.514 ± 0.011 MLP融合 0.658 ± 0.020 0.352 ± 0.023 0.307 ± 0.012 0.610 ± 0.026 0.576 ± 0.010 0.268 ± 0.010 0.266 ± 0.009 0.500 ± 0.015 拼接Transformer 0.684 ± 0.017 0.377 ± 0.018 0.323 ± 0.012 0.638 ± 0.027 0.581 ± 0.012 0.279 ± 0.010 0.276 ± 0.009 0.512 ± 0.017 TFF (Text-ITSR) 0.662 ± 0.025 0.353 ± 0.029 0.310 ± 0.024 0.617 ± 0.040 0.581 ± 0.024 0.276 ± 0.022 0.271 ± 0.015 0.508 ± 0.030 TBF 0.662 ± 0.030 0.357 ± 0.030 0.308 ± 0.018 0.610 ± 0.043 0.573 ± 0.011 0.268 ± 0.010 0.270 ± 0.009 0.507 ± 0.015 拼接Mamba 0.661 ± 0.017 0.355 ± 0.017 0.309 ± 0.013 0.612 ± 0.028 0.585 ± 0.018 0.280 ± 0.017 0.277 ± 0.011 0.518 ± 0.020 瓶颈Mamba 0.656 ± 0.014 0.354 ± 0.012 0.308 ± 0.006 0.607 ± 0.018 0.573 ± 0.012 0.274 ± 0.011 0.270 ± 0.009 0.505 ± 0.014 交错Mamba 0.648 ± 0.014 0.344 ± 0.013 0.305 ± 0.008 0.602 ± 0.019 0.579 ± 0.011 0.273 ± 0.016 0.275 ± 0.010 0.514 ± 0.014
仅变化子集
减法 0.640 ± 0.003 0.249 ± 0.002 0.251 ± 0.002 0.452 ± 0.003 0.574 ± 0.013 0.254 ± 0.014 0.259 ± 0.009 0.471 ± 0.017 MLP融合 0.640 ± 0.009 0.250 ± 0.012 0.249 ± 0.006 0.449 ± 0.009 0.584 ± 0.011 0.261 ± 0.013 0.254 ± 0.007 0.472 ± 0.014 拼接Transformer 0.655 ± 0.004 0.267 ± 0.003 0.259 ± 0.002 0.464 ± 0.004 0.585 ± 0.015 0.270 ± 0.015 0.263 ± 0.007 0.483 ± 0.016 TFF (Text-ITSR) 0.640 ± 0.007 0.255 ± 0.006 0.254 ± 0.003 0.452 ± 0.004 0.580 ± 0.022 0.263 ± 0.020 0.258 ± 0.010 0.469 ± 0.023 TBF 0.648 ± 0.009 0.259 ± 0.010 0.255 ± 0.005 0.459 ± 0.010 0.576 ± 0.010 0.257 ± 0.009 0.256 ± 0.006 0.469 ± 0.009 拼接Mamba 0.645 ± 0.003 0.255 ± 0.006 0.251 ± 0.003 0.453 ± 0.003 0.592 ± 0.013 0.272 ± 0.017 0.263 ± 0.011 0.484 ± 0.014 瓶颈Mamba 0.643 ± 0.003 0.255 ± 0.004 0.252 ± 0.003 0.452 ± 0.004 0.577 ± 0.014 0.263 ± 0.014 0.256 ± 0.008 0.467 ± 0.012 交错Mamba 0.639 ± 0.005 0.253 ± 0.006 0.252 ± 0.003 0.453 ± 0.005 0.586 ± 0.013 0.262 ± 0.022 0.260 ± 0.011 0.475 ± 0.016
4.3 实例级检索精度
表 3 报告了在完整测试图库中排序的变化-标题查询的严格前K项召回率(随机基线反映图库大小);无变化查询因对实例排序无信息量而被排除。 拼接Transformer在LEVIR-CC上领先,TBF具有竞争力(R@5/R@10分别为8.29/14.41 vs. 8.91/15.27;Welch检验p≥0.13)。在规模小得多的Dubai-CC上,各模块受噪声主导(R@1范围在4.2–5.3,标准差约1;减法最低):Dubai名义上的领先者(拼接Mamba)在LEVIR上接近垫底,因此没有模块能显著区分。LEVIR-CC的数值较低,因为多个配对满足相同的变更描述;如图 2b所示,不正确的
第 8 页
8 S. Roy 等
表 3. 针对完整测试图库(去重至唯一图像对;10 次运行均值 ± 标准差)的变化描述查询的严格实例级检索准确率(前K项召回率,%)。各数据集最佳结果加粗。
LEVIR-CC(变化查询) Dubai-CC(变化查询)
模型 R@1 R@5 R@10 R@1 R@5 R@10
随机 0.05 0.26 0.52 0.67 3.33 6.67 减法 1.88 ± 0.17 7.93 ± 0.25 13.66 ± 0.39 3.11 ± 0.82 14.70 ± 2.38 26.33 ± 2.79 MLP 融合 1.93 ± 0.26 7.85 ± 0.69 13.66 ± 1.23 4.82 ± 1.05 19.51 ± 1.97 33.38 ± 2.21 拼接 Transformer 2.28 ± 0.26 8.91 ± 0.81 15.27 ± 1.15 5.20 ± 1.02 21.01 ± 1.70 35.81 ± 2.20 TFF (Text-ITSR) 2.08 ± 0.22 8.00 ± 0.40 13.77 ± 0.58 4.21 ± 0.70 18.97 ± 2.56 33.44 ± 3.38 TBF 2.06 ± 0.42 8.29 ± 0.94 14.41 ± 1.39 4.82 ± 1.17 19.73 ± 1.63 33.63 ± 1.74 拼接 Mamba 1.90 ± 0.23 7.80 ± 0.43 13.38 ± 0.69 5.32 ± 1.61 22.10 ± 2.09 36.33 ± 2.02 瓶颈 Mamba 2.05 ± 0.15 8.32 ± 0.27 14.33 ± 0.40 4.97 ± 0.55 19.20 ± 2.05 33.07 ± 2.27 交错 Mamba 2.05 ± 0.27 8.07 ± 0.55 13.75 ± 0.74 4.58 ± 1.16 19.63 ± 1.64 32.54 ± 1.33
表 4. LEVIR-CC 上的级联检索(变化查询,完整图库 G=1929,10 个随机种子均值 ± 标准差)。单查询成本为表 1 中的单流融合成本 G tsub + N tfuse。
重排序器 N R@1 R@5 R@10 毫秒/查询 加速比
TBF 25 2.33 ± 0.34 8.91 ± 0.58 15.17 ± 0.67 89 10.2× TBF 完整 2.06 ± 0.42 8.29 ± 0.94 14.41 ± 1.39 907 1.0×
拼接 Transf. 25 2.43 ± 0.31 9.33 ± 0.53 15.53 ± 0.53 96 15.2× 拼接 Transf. 完整 2.28 ± 0.26 8.91 ± 0.81 15.27 ± 1.15 1466 1.0×
检索结果通常在语义上是合理的,因此严格的前K项召回率低估了实际的检索质量。
4.4 级联检索:利用权衡
多阶段排序是信息检索中的经典方法 [15],也是视觉-语言检索中的标准做法。由于部署时需为每对候选图像支付融合成本(第 3.4 节),我们在变化检索中对此进行了测试(图 1):第一阶段使用减法(0.04 毫秒/对)对完整图库进行排序,第二阶段使用注意力模块对前 N 个结果进行重排序,直接复用表 1 中已训练的模型,无需重新训练。表 4 报告了在 LEVIR-CC(去重图库)上 N=25 与完整融合的对比结果。在 LEVIR-CC 上,级联检索带来了严格提升:所有评估的 N 值(从 25 到 500)均达到或超过完整融合的效果,因此无需进行预算调优。在 N=25 的逐种子配对测试中,级联检索在 TBF 的 R@1/R@5 上全部十个种子均优于完整融合(p=10⁻⁴, 0.002),在拼接 Transformer 上十个种子中有八个优于完整融合(p≤0.03,R@10 不显著)。一个合理的解释是隐式集成效应:候选图像必须在差异信号和完整融合下都获得高分,因此预过滤会丢弃那些仅靠融合就能获得高排名的干扰项。在 Dubai-CC 上(从头重新训练,10 个种子,G=150),这一增益未能复现,但质量持平:在 N=50 时,级联检索在 R@1/R@5 上与完整融合持平,R@10 约低一个点,而成本降低至 2.6 分之一。由于第一阶段每对成本便宜 12-19 倍,级联检索的加速比随图库规模增长而趋近于该每对成本上限:在 G=1929 时为 10-15 倍,在 G=10⁵ 时为 12-19 倍。
第 9 页
双时相融合用于文本变化检索 9
4.5 骨干网络鲁棒性
为排除CLIP特定因素的影响,我们使用两种替代的冻结编码器重复完整的八模块对比实验:遥感ViT-B/32模型GeoRSCLIP [16],以及256像素分辨率的通用ViT-B/16模型SigLIP 2 [14]。融合模块的排名大体保持不变(与CLIP在仅变化BLEU-1上的排序相比,Spearman相关系数ρ分别为0.69和0.74)。减法融合依然最弱,注意力模块和TBF最强,且没有SSM变体能超越注意力机制。CLIP ViT-B/16和SigLIP 2在绝对性能上领先(仅变化BLEU-1分别为0.655和0.652,对比0.581),但相对结论并不依赖于骨干网络的选择。
5 讨论
为何Mamba在L=196时表现不佳。瓶颈在于硬件利用率,选择性扫描是顺序执行且受内存带宽限制,而自注意力机制可映射为高度并行的张量核心矩阵乘法,这与推动Mamba-2 [3]设计的分析一致。序列长度扫描实验证实了这一点:Mamba仅在L≈400(两帧)后才超越注意力机制,且在L=6272时速度可提升10倍,因此SSM在长时序多时相堆栈中才能发挥优势,而非标准图块尺寸下。
瓶颈压缩的收益与代价。TBF在数值上从未超越拼接Transformer,且残差的仅变化差距很小(0.007 BLEU-1;第4节),而效率提升是确定性的,并随扫描图像对数量复合增长(第3.4节)。我们推测该差距保持较小是因为双时相场景大部分区域未发生变化,因此压缩损失的信息极少 [11]。
跨数据集差异与低数据量场景。在Dubai-CC数据集上,图像描述评分较低而Recall@K较高(检索池较小),仅有300个训练对,排名压缩且方差较大,因此我们将其准确率视为指示性结果,并用于验证效率排名的可迁移性。
局限性。(i) 我们面向检索的LEVIR-CC数据划分方式,导致无法与已发表的变化描述结果进行直接比较。(ii) n-gram指标会惩罚合理的同义改写,且仅能间接反映检索效用。(iii) 延迟测量仅在一台桌面级GPU上完成。
6 结论
我们的受控研究为文本变化检索提供了三条指导原则:在标准图块数量下,线性复杂度的SSM融合并未带来实际推理速度优势,因此优化的注意力机制应保持为默认选择;在注意力之前进行瓶颈压缩(TBF)可将参数量减少2.3倍、延迟降低1.6倍,而仅变化BLEU-1仅下降0.007;融合无需在每一对图像上运行,因为基于减法预过滤的级联检索可在查询成本降低10-15倍的同时,保持或提升召回率。
第 10 页
10 S. Roy 等
参考文献
1. Chen, H., Qi, Z., Shi, Z.: Remote sensing image change detection with transformers. IEEE Transactions on Geoscience and Remote Sensing 60, 1–14 (2022). https://doi.org/10.1109/TGRS.2021.3095166 2. Chen, H., Song, J., Han, C., Xia, J., Yokoya, N.: Changemamba: Remote sensing change detection with spatiotemporal state space model. IEEE Transactions on Geoscience and Remote Sensing 62, 1–20 (2024) 3. Dao, T., Gu, A.: Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality. In: International Conference on Machine Learning (ICML) (2024) 4. Daudt, R.C., Le Saux, B., Boulch, A.: Fully convolutional siamese networks for change detection. In: 2018 25th IEEE International Conference on Image Processing (ICIP). pp. 4063–4067. IEEE (2018) 5. Ferrod, R., Caro, L.D., Ienco, D.: Towards a multimodal framework for remote sensing image change retrieval and captioning (2024), arXiv:2406.13424 6. Gu, A., Dao, T.: Mamba: Linear-time sequence modeling with selective state spaces (2024), arXiv:2312.00752 7. Hoxha, G., Angyal, O., Demir, B.: Self-supervised cross-modal text-image time series retrieval in remote sensing (2025), arXiv:2501.19043 8. Hoxha, G., Chouaf, S., Melgani, F., Smara, Y.: Change captioning: A new paradigm for multitemporal remote sensing image analysis. IEEE Transactions on Geoscience and Remote Sensing 60, 1–14 (2022). https://doi.org/10.1109/TGRS.2022.3195692 9. Liu, C., Zhao, R., Chen, H., Zou, Z., Shi, Z.: Remote sensing image change captioning with dual-branch transformers: A new method and a large scale dataset. IEEE Transactions on Geoscience and Remote Sensing 60, 1–20 (2022). https://doi.org/10.1109/TGRS.2022.3218921 10. Liu, F., Chen, D., Guan, Z., Zhou, X., Zhu, J., Ye, Q., Fu, L., Zhou, J.: Remoteclip: A vision language foundation model for remote sensing (2024), arXiv:2306.11029 11. Nagrani, A., Yang, S., Arnab, A., Jansen, A., Schmid, C., Sun, C.: Attention bottlenecks for multimodal fusion (2022), arXiv:2107.00135 12. Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., Sutskever, I.: Learning transferable visual models from natural language supervision (2021) 13. Sharma, S., El Asri, L., Schulz, H., Zumer, J.: Relevance of unsupervised metrics in task-oriented dialogue for evaluating natural language generation (2017), arXiv:1706.09799 14. Tschannen, M., Gritsenko, A., Wang, X., Naeem, M.F., Alabdulmohsin, I., et al.: SigLIP 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features (2025) 15. Wang, L., Lin, J., Metzler, D.: A cascade ranking model for efficient ranked retrieval. In: Proc. ACM SIGIR. pp. 105–114 (2011) 16. Zhang, Z., Zhao, T., Guo, Y., Yin, J.: Rs5m and GeoRSCLIP: A large-scale vision-language dataset and a large vision-language model for remote sensing. IEEE Transactions on Geoscience and Remote Sensing 62, 1–23 (2024) 17. Zhao, H., Zhang, M., Zhao, W., Ding, P., Huang, S., Wang, D.: Cobra: Extending mamba to multi-modal large language model for efficient inference (2025), arXiv:2403.14520