卫星影像变化检索:融合架构的效率-精度博弈与级联加速策略

本文贡献:受控比较与级联加速

在文本驱动的双时相遥感图像变化检索中,查询时需对海量候选图像对运行融合模块,计算开销巨大。本文系统比较了注意力机制、状态空间模型(Mamba)和压缩瓶颈(TBF)三类融合范式的效率与精度权衡,并提出一种训练无关的级联检索策略:先用廉价的减法模型筛选候选集,再用注意力模型重排序Top-N,在LEVIR-CC上实现10-15倍查询加速且召回率不降。实验揭示了一个关键发现:Mamba的线性复杂度优势在标准ViT序列长度下并未转化为实际延迟收益,其选择性扫描受限于内存带宽,而注意力机制能高效利用并行计算。TBF通过压缩融合表示,成为效率-质量的最佳平衡点。需注意,级联检索的增益与数据集规模相关,且延迟

遥感大模型为何需要多工具?GeoLens超越单一缩放

论文代表图:figure-01-p002-01

超高分辨率遥感图像中,证据往往稀疏且分散。单一缩放工具在处理全局搜索或多区域比较时存在性能饱和。本文介绍GeoLens,通过构建GeoMTVR数据集和RTAL算法,实现多工具协同推理。实验显示其在XLRS-Bench等基准上超越主流大模型。注意:目前仅针对光学图像,且依赖半自动标注。

卫星视频也能读懂关系?T-STAR基准与STCL框架解析

方法贡献

现有卫星视频研究多局限于目标检测与跟踪,缺乏对物体间时空关系的结构化理解。本文介绍T-STAR基准,首个包含百万级实例掩码与千万级时空三元组的卫星视频数据集。针对俯视视角下小目标、弱纹理导致的跨帧关联困难,论文提出STCL框架,通过记忆引导匹配保持实例身份一致性,并利用空间上下文与多尺度时序建模复杂关系。实验表明该方法在机场、港口等复杂场景中能有效推理动态关系。需注意,当前方法对极度遮挡及长时序依赖的处理仍有局限。

少即是多:无需架构修改,MLRS凭数据多样性在遥感VLM中登顶

方法:MLRS与GRTO框架

本文提出MLRS,基于InternVL3.5-8B和SAM3,通过GRTO强化学习框架联合优化,无需修改VLM架构即可在遥感多任务中达到SOTA。实验显示,在GEOBench-VLM检测Precision@0.5从0.24提升至0.56,GeoSeg-Bench2分割IoU从0.41提升至0.70。研究证明数据多样性比数据量更能驱动OOD泛化,但需注意微调SAM3可能牺牲零样本泛化能力,且多时相/多视角任务因数据源单一提升有限。

GeoChrono:重新定义遥感长期时序理解,超越商业模型20%

GeoChrono模型架构

现有遥感模型多局限于静态或双时相对比,缺乏对长期连续演变的系统性评估。本文提出ChronoBench基准与GeoChrono模型,通过分解认知层级和构建位置时间轨迹,显著提升了多模态大语言模型在遥感长期时序理解中的表现。实验显示,GeoChrono在ChronoBench上达到78.34%准确率,超越领先商业模型超20%。同时,C2FComp模块在减少56%视觉Token的同时保留94.6%性能。尽管与人类专家仍有差距,但该工作为遥感长期动态分析提供了重要基准与架构参考。