SeasonStereo:用生成式AI让卫星立体匹配跨越季节鸿沟

快速导读:提出SeasonStereo框架,利用生成式模型合成季节外观变化,结合基础立体模型的零样本几何先验,在无需LiDAR监督的情况下实现多时相卫星影像的鲁棒视差估计。

多时相卫星影像的三维重建是遥感领域的核心挑战之一。由于不同季节、光照条件下获取的影像存在显著的外观差异,传统依赖光度一致性的立体匹配方法往往失效。现有的解决方案要么依赖昂贵的LiDAR真值进行监督,要么需要对齐的多时相训练数据,难以规模化应用。

SeasonStereo提出了一种全新的框架,巧妙地将生成式AI与基础立体模型相结合。其核心思想是:利用生成模型从易于获取的同步立体像对出发,合成几何结构保持但外观随季节变化的影像,从而构建大规模多时相训练集;同时,利用预训练基础模型MonSter++在同步像对上的零样本视差预测作为伪真值,替代LiDAR监督。这一设计使得整个训练流程无需任何真实多时相产品或LiDAR数据,极大地提升了可扩展性。

英文题目:SeasonStereo: Robust Dense Stereo Matching for Multi-Date Satellite Imagery via Generative AI

论文出处:arXiv 每日论文精选 · arXiv:2607.27139

原始论文:PDF / 论文页面

对应视频标题:SeasonStereo:用生成式AI让卫星立体匹配跨越季节鸿沟|推荐指数:★★★★★

这篇论文解决什么问题?

卫星立体匹配的传统范式依赖于同步获取的像对,以保证左右视图之间的光度一致性。然而,在实际应用中,我们常常只能获取不同时间拍摄的影像,例如夏季和冬季的同一区域。这种多时相影像对之间存在剧烈的外观变化——植被枯荣、积雪覆盖、光照角度改变等——导致基于像素相似性的匹配算法性能急剧下降。

现有针对多时相立体匹配的方法,如Diachronic Stereo,虽然在一定程度上缓解了这一问题,但需要真实的多时相像对和LiDAR高程数据进行监督训练。这两种数据的获取成本都极其高昂:真实多时相像对需要卫星多次过境且云量条件均满足要求,而LiDAR数据则需要机载或地面扫描。这使得现有方法难以推广到大规模、多区域的场景。

一个关键的观察是:基础立体模型(如MonSter++)虽然在多时相影像上表现不佳,但在同步像对上具有出色的零样本泛化能力。这意味着,如果我们能解决训练数据的外观差异问题,就可以利用这些基础模型提供的几何先验来引导学习。SeasonStereo正是沿着这一思路展开的。

此外,生成式AI的快速发展为图像翻译和风格迁移提供了强大的工具。关键在于,如何在改变影像季节外观的同时,严格保持其几何结构不变——任何建筑物的位移或形变都会直接破坏视差估计的真值。SeasonStereo通过精心设计的生成策略和输入尺寸控制,成功地在几何保真度和外观多样性之间取得了平衡。

核心创新

  • 提出基于生成式模型的几何保持季节合成策略,从真实同步像对生成多时相训练数据,无需真实多时相产品。
  • 设计多目标损失函数,结合基础模型的零样本几何先验(视差损失)与同步像对上的光度一致性(光度损失),替代昂贵的LiDAR监督。
  • 构建并发布包含21775对真实与合成多时相卫星立体像对及对应视差图的大规模数据集。

方法概览

SeasonStereo从真实同步立体像对出发,利用Nano Banana Pro生成几何保持的季节性合成影像,构建大规模合成多时相训练集;然后冻结MonSter++的单目深度先验分支,仅微调立体匹配骨干网络,采用多目标损失(视差损失、光度损失、平滑损失)进行训练,其中视差损失使用冻结的MonSter++在真实同步像对上的零样本预测作为伪真值,光度损失在真实同步像对上计算以规避多时相外观差异。

  • 数据构建流程:从真实同步立体像对出发,使用Nano Banana Pro生成模型,通过精心设计的季节提示词(如“冬季雪景”、“夏季植被”),将左视图转换为不同季节的合成影像。生成过程严格控制输入尺寸为1024×1024,以保持建筑物的几何轮廓和边缘结构。右视图保持不变,从而构建出几何一致但外观差异显著的多时相立体像对。
  • 几何保持的生成策略:实验发现,直接对全分辨率2048×2048影像进行生成会导致局部幻觉和建筑轮廓扭曲。通过裁剪至1024×1024中心区域进行生成,可以显著提升结构保真度。此外,提示词设计采用“共享部分+季节特定部分”的结构,确保不同季节合成影像之间的几何一致性。
  • 零样本教师模型:冻结MonSter++的单目深度先验分支,仅将其在真实同步像对上的零样本视差预测作为伪真值。这一设计的关键在于:基础模型在同步像对上具有可靠的几何推理能力,其预测结果可以作为高质量的监督信号,而无需任何LiDAR数据。
  • 多目标损失函数:训练损失由三项组成。视差损失在合成多时相像对上计算预测视差与教师模型伪真值之间的差异;光度损失在真实同步像对上计算左右视图之间的重建误差,规避了多时相外观差异的干扰;平滑损失则约束视差图的局部连续性。
  • 有效像素掩码:训练和评估时排除了水体、树木、遮挡区域以及图像边缘的无效像素。这些区域要么在生成模型中几何一致性差,要么在立体匹配中本身不可靠。掩码通过预训练分割模型和视差一致性检查自动生成。
  • 光度损失的应用策略:光度损失仅在建筑区域计算,因为建筑物具有明确的边缘和纹理,光度一致性假设更为可靠。对于植被等纹理复杂且随季节变化的区域,光度损失可能引入噪声,因此被排除在外。
  • 训练数据子集设计:为验证合成数据的贡献,作者构建了三个数据子集:S1仅包含真实同步像对,S2加入部分合成多时相像对,S3包含完整的合成多时相数据集。这一设计使得消融实验能够清晰量化合成数据对性能的提升幅度。
  • 网络架构与训练细节:SeasonStereo以MonSter++为骨干网络,冻结其单目深度分支,仅微调立体匹配分支。训练采用RAFT-Stereo的序列损失和数据增强策略,确保模型能够充分学习多时相外观变化下的鲁棒匹配能力。

逐图理解论文

失败案例与直觉

失败案例与直觉
Fig. 2: Image pairs ranked by decreasing RGB-SSIM similarity (2) (green), with the corresponding MonSter++ End-Point Error (EPE) against LiDAR-derived disparities (red). Blue and yellow lines correspond to low- and high-similarity pairs shown on either side of the plot. MonSter++ disparity accuracy degrades as similarity decreases.

该图揭示了核心问题:随着左右视图RGB-SSIM相似度下降,MonSter++的视差误差(EPE)急剧上升。蓝色和黄色标记的低相似度和高相似度像对示例直观展示了多时相外观差异对匹配性能的影响。

研究空白与核心思路

研究空白与核心思路
Fig. 1 shows an overview of the method. We assess SeasonStereo on test sets of synchronic and diachronic WorldView-3 images of different geographic areas [41]. Project page: https://multimedia-eurecat.github.io/SeasonStereo.

现有方法要么依赖真实的多时相像对和激光雷达真值,成本极高且难以规模化;要么直接使用基础模型,在多时相场景下性能骤降。这里存在一个明确的研究空白:能否利用容易获取的同步像对,以及基础模型在同步像对上的可靠几何先验,来训练一个对季节变化鲁棒的立体匹配模型?SeasonStereo的回答是:用生成式AI来弥合这个外观鸿沟。

方法贡献与验证

方法贡献与验证
Fig. 3: Real image vs. corresponding geometry-preserving, aligned, seasonally diverse samples generated by Nano Banana Pro [24]. The prompt above was used for winter: bold text marks season-specific instructions; regular text is shared across all seasons.

SeasonStereo的做法非常巧妙。它从真实的同步立体像对出发,利用生成模型Nano Banana Pro,将左视图合成为不同季节的版本,而右视图保持不变。这样,就凭空创造出了几何结构完全一致、但外观随季节变化的多时相训练对。训练时,它冻结基础模型MonSter++在真实同步像对上的零样本视差预测作为伪真值,同时只在同步像对上计算光度一致性损失,巧妙地避开了多时相外观差异的干扰。实验结果表明,这种无需任何激光雷达监督的方案,在多个测试集上的平均误差与激光雷达监督的方法完全持平。

最强结论与意义

最强结论与意义
Fig. 9: Top to bottom: DSMs reconstructed from disparities predicted by zero-shot MonSter++ [14], Diachronic Stereo [41], and SeasonStereo (ours), followed by the LiDAR-derived ground-truth DSM. Results are shown for hard diachronic test pairs originally listed by Masquil et al. [41]. Missing values are shown in black.

该图展示了从视差图重建的DSM与LiDAR真值的对比。从上到下分别为MonSter++、Diachronic Stereo、SeasonStereo和真值。注意观察SeasonStereo在建筑结构和地形细节上与真值的接近程度,以及MonSter++产生的大量黑色空洞区域。

局限与结尾

局限与结尾
Fig. 5: Construction of left-view valid-pixel mask V. Invalid regions comprise pixels outside the rectified image crop (black), water (blue), trees (green), and occluded or non-jointly-visible regions estimated from disparity (red). V excludes invalid pixels during training and evaluation.

当然,生成模型在水体、树木等区域的几何一致性仍然有限,需要额外的分割模型来排除这些区域。但整体而言,SeasonStereo为多时相卫星立体匹配开辟了一条摆脱昂贵真值依赖的新路径。以上就是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 测试集:在四个测试集上评估海拔MAE,包括Jacksonville、Buenos Aires、Omaha Synchronic(同步像对)和Omaha Diachronic(多时相像对),覆盖不同地理区域和季节变化程度。
  • 对比方法:与零样本MonSter/MonSter++、LiDAR监督的Diachronic Stereo以及SeasonStereo的多个消融变体进行对比。变体包括仅使用LiDAR监督、仅使用视差损失、视差损失+平滑损失、以及完整的三项损失。
  • 评估指标:主要指标为海拔MAE(米),通过将视差转换为高程后与LiDAR真值比较计算。评估时排除水体、树木等无效像素区域。
  • 消融实验设计:包括损失项消融(逐步添加Ldisp、Lphoto、Lsmooth)和数据子集消融(S1/S2/S3),以分别验证各损失项和合成数据的贡献。
  • 定性评估:通过可视化视差图、重建DSM以及与LiDAR真值的对比,评估模型在建筑边缘、复杂地形等区域的细节保持能力。
  • 生成模型配置:Nano Banana Pro使用固定的随机种子和提示词模板,确保不同季节合成影像之间的几何一致性。输入尺寸统一为1024×1024,输出保持相同分辨率。

关键结果与论文证据

  • 完整损失函数的SeasonStereo在平均MAE上达到1.05米,与LiDAR监督变体持平(第11页,Table 1)。这表明零样本视差伪真值可以完全替代昂贵的LiDAR监督。
  • 在Omaha Diachronic多时相测试集上,SeasonStereo的MAE为0.79米,优于Diachronic Stereo的0.82米和MonSter++的2.93米(第11页,Table 1)。这证明了方法对剧烈外观变化的鲁棒性。
  • 合成数据增强(S3)将平均MAE从仅用真实数据的1.18米降至1.07米,其中Omaha Diachronic的MAE从1.04米降至0.81米(第12页,Table 2)。合成多时相数据对性能提升贡献显著。
  • 光度损失项的加入使得建筑边缘更加锐利,与图像证据的对齐更好(第12页,Figure 7)。定性结果显示,完整模型在建筑轮廓保持上优于仅使用视差损失的变体。
  • 在同步像对测试集(Omaha Synchronic、Buenos Aires)上,合成数据的提升较小或非单调(第12页,Table 2)。这说明预训练的几何先验已经能较好地处理中等程度的外观变化。
  • 零样本MonSter++在多时相像对上完全失效,EPE随RGB-SSIM下降而急剧上升(第6页,Figure 2)。这直观展示了多时相外观差异对现有基础模型的挑战。
  • 重建的DSM定性对比显示,SeasonStereo在建筑结构和地形细节上更接近LiDAR真值,而MonSter++产生大量空洞,Diachronic Stereo则过度平滑(第14页,Figure 9)。
  • 生成模型在1024×1024尺寸下能较好地保持几何结构,但在全分辨率2048×2048下会产生局部幻觉和建筑轮廓扭曲(第7页,Figure 4)。这验证了输入尺寸控制策略的必要性。

阅读时需要注意

  • 合成影像在水体、树木等区域的几何一致性较差,必须依赖分割模型排除这些区域,导致这些区域的视差估计不可靠。
  • 生成模型对全分辨率影像的结构保真度有限,需裁剪至1024×1024,限制了单次处理的空间范围。
  • 光度损失仅应用于建筑区域,对非建筑结构(如道路、桥梁)的细节提升有限。
  • 合成数据的季节多样性受限于生成模型的能力,未覆盖极端气候条件(如洪水、火灾后场景)。
  • 方法依赖预训练基础模型MonSter++的零样本视差质量,在基础模型失效区域(如极端地形、重复纹理)可能退化。

关联工作

  • Diachronic Stereo是唯一明确针对多时相卫星立体匹配的方法,使用真实多时相像对和LiDAR监督。SeasonStereo在其基础上提出了更可扩展的框架,避免了真实多时相数据和LiDAR的依赖。
  • MonSter++作为SeasonStereo的视差估计骨干网络和零样本教师模型,提供了关键的几何先验。其单目深度分支在训练中被冻结,仅作为监督信号来源。
  • 自监督深度估计框架(Monodepth/Monodepth2)的光度重建损失和平滑损失被SeasonStereo借鉴,但巧妙地应用于同步像对而非多时相像对,规避了外观差异问题。
  • RAFT-Stereo的序列损失和数据增强策略被沿用,确保了训练过程的稳定性和模型的泛化能力。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

SeasonStereo:基于生成式AI的多时相卫星影像鲁棒稠密立体匹配

Álvaro Díaz-Laureano1, Roger Marí1, Elías Masquil2, Pablo Arias3, Gabriele Facciolo4,5

1 Eurecat,多媒体技术中心,巴塞罗那,西班牙 2 乌拉圭共和国大学工程学院电气工程研究所 3 庞培法布拉大学工程系,巴塞罗那,西班牙 4 巴黎-萨克雷大学,CNRS,ENS Paris-Saclay,Centre Borelli,法国 5 法兰西大学研究院 {alvaro.diaz,roger.mari}@eurecat.org

摘要。从卫星影像进行精确三维重建通常依赖近同时获取的立体像对,这限制了其在多时相(diachronic)场景中的应用,因为多日期影像会呈现不同的季节和光照条件。训练对表观变化具有鲁棒性的稠密立体匹配模型是一个长期挑战,因为对齐的多日期影像和真值几何数据的大规模获取成本高昂。我们提出SeasonStereo,一个可扩展的框架,通过在具有可控季节表观变化的合成影像对上训练视差估计,同时利用基础模型的零样本几何先验,来解决从多时相卫星影像进行视差估计的问题。SeasonStereo的精度可与最先进的LiDAR监督模型相媲美,同时能生成更清晰的几何细节,且无需对齐的真实多日期训练产品或LiDAR衍生标签。因此,SeasonStereo为以更低的监督成本从异构卫星影像进行大规模三维重建提供了一条实用路径。

关键词:稠密立体匹配 · 多日期卫星影像 · 多时相立体匹配 · 三维重建

1 引言

传统上,从卫星影像进行三维重建依赖于在近同时或同步(synchronic)条件下获取的立体像对。同步影像表现出强烈的光度一致性,使得现有的视差估计方法能够实现高水平的细节和精度[1,37]。然而,当影像偏离这种受控条件时,性能会显著下降,这凸显了一个根本性的鲁棒性差距。在多时相(diachronic)条件下,时间上相隔较远的影像受到强烈的季节变化和光照差异的影响,光度差异阻碍了现有的经典方法和学习方法,因此这仍然是一个重大挑战[41]。

第 2 页

2 Á. Díaz-Laureano 等

监督信号 配对 我们的方法 多时相基线 模型 光度一致性 LiDAR 同步的 同步的(真实) 立体匹配 [41] 零样本 视差 经变形后的视差

配对

我们的方法多时相(合成) 可扩展、低成本、稠密 受限、昂贵、 微调前 微调后 稀疏

图 1: SeasonStereo 通过在由真实同步配对生成的合成多时相配对上进行训练,学习从多日期卫星影像中估计视差。监督信号源自对应的同步配对,将零样本视差估计与基于视差变形后的光度一致性相结合。与现有方法 [41] 不同,SeasonStereo 避免了昂贵的基于 LiDAR 的监督。

鲁棒的卫星影像稠密立体匹配模型的发展长期受限于数据可用性。高分辨率影像价格昂贵,而获取可靠的 3D 真实几何信息(如 LiDAR)则更加耗费资源。这些要求难以在广阔的地理区域内满足,限制了这些模型在全球范围内的部署。因此,现有的基于学习的方法 [1,37,41,59] 仍然局限于特定地点或数据条件,这凸显了在不同地理和时间环境下对可扩展且可复现框架的需求。 在这项工作中,我们展示了图像生成和基础立体模型的最新进展为多日期卫星影像中的鲁棒多时相立体匹配提供了一条可扩展的途径。生成模型可以合成并操控图像以模拟外观变化 [24],而基础立体模型则为监督提供了强大的零样本几何线索 [3,14,15,58]。 我们提出了 SeasonStereo,一个用于从多日期卫星影像中估计视差的新颖框架,该框架在真实图像对和具有模拟季节性变化的合成图像对上进行训练。由真实同步立体配对生成的合成样本,扩充了用于微调基础立体模型以进行多时相匹配的训练数据。因此,SeasonStereo 为从异构卫星影像中进行大规模 3D 重建提供了一条实用且可扩展的途径,并大幅降低了监督成本。我们的主要贡献如下:

– 一个用于多日期卫星影像稠密立体匹配的框架,该框架利用合成的季节性外观,消除了对资源密集型基于 LiDAR 的几何监督或真实多时相产品的需求。 – 一个多项目标训练目标,结合了来自基础模型的零样本几何先验(用于全局几何精度)与增强建筑物轮廓清晰度的光度项和平滑项。 – 一个大规模的卫星立体数据集,包含在同步和多时相设置下对齐的真实与合成图像对,并配有相应的视差图。

第 3 页

SeasonStereo 3

图1展示了该方法概览。我们在不同地理区域的同步(synchronic)和多时相(diachronic)WorldView-3图像测试集上评估SeasonStereo [41]。 项目页面:https://multimedia-eurecat.github.io/SeasonStereo。

2 相关工作

密集立体匹配通常假设同步(synchronic)视图之间具有光度一致性。然而,在卫星图像中,图像往往相隔数天或数周获取,导致多时相(diachronic)的外观变化。尽管具有实际意义,多时相(diachronic)卫星立体匹配在很大程度上仍未被充分探索。据我们所知,Masquil等人[41]提供了唯一一个明确针对多时相(diachronic)立体匹配的模型,该模型使用经过筛选的真实图像对,并以LiDAR作为监督。我们的工作延续了这一研究方向,提出了一个更具可扩展性的框架。

2.1 密集立体匹配

给定一对校正后的图像(IL, IR),密集立体匹配旨在估计视图间逐像素的对应关系[52]。校正将对应关系约束为水平位移,即视差。左视图视差图D满足

I_L (x ,y ) \, \ , \, {\ Lon gleftrightarrowI_R(x-D(x,y),y),\label{eq:disp} (1)

其中D(x, y)是IL中像素(x, y)到其在IR中匹配点的水平偏移量。 传统流程依赖于手工设计的匹配代价,如归一化互相关或Census变换[64]。半全局匹配(SGM)[25]通过沿多个一维路径聚合代价,实现了精度与效率的良好平衡,成为主流的经典基线方法。SGM的变体[17,19]仍是卫星立体匹配流程中的标准方法[6,20]。然而,手工设计的算法对辐射变化、低纹理、遮挡和深度不连续较为敏感[55]。早期的端到端深度学习方法统一了可学习的代价体构建、正则化和视差回归[27,32]。后续模型通过多尺度上下文[67]、分层代价体[62]、引导聚合[65]或自适应视差搜索[16]改进了这一范式。在遥感图像中,此类模型经过目标域适应后可优于经典匹配方法,但仍对域偏移敏感[37,59]。 近期基于学习的立体模型越来越多地将循环匹配与单目线索相结合。在RAFT-Stereo[35](通过迭代循环更新细化视差)的基础上,MonSter[15]、Stereo Anywhere[3]、FoundationStereo[58]和MonSter++[14]等方法集成了单目先验[63],以提高在模糊区域的立体匹配鲁棒性。这些方法的主要区别在于单目和立体线索的融合与细化方式,但共同目标是提升在标准有监督立体数据集之外的泛化能力。其中,MonSter++将MonSter系列扩展为面向立体和多视图深度估计的统一基础模型(foundation model)。 与此同时,自监督训练目标探索了减少对密集视差或深度标签依赖的方法。光度重建损失

第 4 页

4 Á. Díaz-Laureano 等

以及左右一致性,这些概念因基于立体像对训练的自监督单目深度框架(如 Monodepth [21])而普及,并在 Monodepth2 [22] 中通过最小重投影和多尺度训练策略得到进一步改进。重建惩罚项的选择,包括 L1、SSIM [57] 或它们的组合,也会影响收敛性和几何锐度。此类方法对遥感领域具有吸引力,因为密集的真值几何数据获取成本高昂,并且它们可以通过在物体边界处鼓励图像一致的结构来补充监督损失。

2.2 从卫星影像进行三维重建

卫星视差图通过三角测量转化为数字表面模型(DSM),通常在处理图像校正、匹配和三角测量的端到端流水线中完成。经典的卫星立体流水线,如 ASP [6]、MicMac [50]、CARS [43]、S2P [20] 及其变体 [2,42],仍然是 synchronic 影像的标准选择,但其底层的匹配算法对 diachronic 输入较为敏感。 由于在卫星领域获取用于训练的大规模三维标注成本高昂,一些基于学习的方法避免直接从图像对进行重建,而是专注于优化经典立体流水线的输出 [7–9, 54]。ResDepth [54] 从粗略的立体 DSM 估计和对齐的影像中学习残差校正。图像证据有助于恢复更清晰的人造结构,如建筑物边缘 [8,9]。因此,这些方法是对密集匹配方法的补充,而非替代。 当有多次卫星采集数据可用时,重建通常被分解为一组成对立体问题,然后进行几何融合 [18, 36, 47, 49]。视角、时间邻近度和辐射相似性通常被用来优先选择接近 synchronic 设置的像对 [18,23]。生成的成对 DSM 通过稳健的聚合策略(如中值滤波或基于置信度的滤波)进行空间对齐和融合 [18, 31, 48]。这种多视图立体范式仍然高度依赖于找到足够一致的图像对,这限制了其在多日期影像集上的适用性。 近期基于神经辐射场 [38, 39] 和 3D 高斯泼溅 [12, 51] 的自监督重建方法,通过在多日期影像集上联合优化外观和几何,将卫星三维重建扩展到了显式成对立体之外。这些方法可以生成高精度的重建结果,但计算需求更高,且通常需要同一区域的多次观测。具有深度正则化公式的稀疏视图变体 [66] 旨在当可用图像较少时改善重建;然而,神经渲染方法仍然主要面向影像集级别的重建设计,并非从单个 diachronic 立体像对进行几何估计的直接解决方案。

2.3 用于卫星立体的真实与合成数据

基于学习的卫星图像三维重建历来受到公开数据有限的制约 [11]。这一差距已部分通过以下方式得到弥补

第 5 页

SeasonStereo 5

诸如2016年IARPA MVS Challenge [11]、DFC2019/US3D [10, 33]和CORE3D [13]等基准数据集,提供了高分辨率多视角卫星影像(主要来自WorldView-3)以及LiDAR衍生的几何参考数据。后续若干工作将这些资源重新整理为面向立体的基准数据集,如SatStereo [45]和Masquil等人[41]的工作,它们在synchronic(同步的)和diachronic(多时相的)外观条件下,整理了不同划分的校正图像对。更新的数据集,如Stellar [46]和WHU-Stereo [34],进一步扩展了地理和传感器多样性。然而,这些数据集仍基于真实卫星获取数据和外部几何监督,因此继承了与真值质量相关的局限性。特别是,LiDAR衍生的监督可能存在空洞、密度降低、不连续处附近的栅格化伪影,以及由于获取日期之间的场景变化导致的与影像的时间不匹配[41,45]。这些误差主要影响高频结构,使学习到的模型偏向于更平滑的视差和更弱的建筑物边界重建[7,8,54]。

为克服高质量几何监督的稀缺性,近期工作探索了合成替代方案,如渲染的虚拟场景和生成模型。基于渲染的数据集,如用于航空场景理解的SkyScenes [29],以及在Unreal Engine中模拟卫星立体获取几何的SatUnreal [30],展示了从仿真到真实迁移的潜力。在生成方面,通用图像生成器[5, 24]和卫星领域专用模型[4, 26, 28, 40]为可扩展的图像合成与编辑提供了灵活途径,因为它们不受限于显式建模的虚拟场景。然而,将其用于密集立体匹配需要对空间结构和多视图一致性进行生成控制,这仍是一个挑战[56]。

3 方法

给定一对观测同一区域的卫星图像 \(I_L\) 和 \(I_R\),SeasonStereo旨在估计对应的视差图 \(D\)。虽然主要针对diachronic(多时相的)图像对,但该方法仍兼容synchronic(同步的)影像,为多日期卫星立体提供了一个统一框架。

我们分三个阶段描述SeasonStereo。首先,我们整理一个严格synchronic(同步的)的真实卫星立体对训练集,作为后续合成增强的基础。其次,我们使用生成模型合成季节性外观变化,生成与真实synchronic(同步的)对应图像保持几何对齐的diachronic(多时相的)图像对。第三,我们利用可扩展的训练线索,通过多项监督损失对立体基础模型进行微调。

3.1 基于相似度的Synchronic(同步的)卫星立体对整理

DFC2019 Track 3数据集[10, 33]提供了杰克逊维尔(JAX)和奥马哈(OMA)关注区域(AOIs)的多日期WorldView-3图像集和LiDAR获取数据。在此数据集基础上,Masquil等人[41]

第 6 页

6 Á. Díaz-Laureano 等

L R L R

视差 视差

高相似度 低相似度 (≈0.9) (≈0.45)

图 2: 按 RGB-SSIM 相似度 (2) 降序排列的图像对(绿色),以及对应的 MonSter++ 终点误差 (EPE) 与 LiDAR 视差的对比(红色)。蓝色和黄色线条分别对应图中两侧所示的低相似度和高相似度图像对。随着相似度降低,MonSter++ 视差精度下降。

我们发布了一个立体匹配基准,包含校正后的 synchronic 和 diachronic 图像对,以及相关的校正单应矩阵。我们利用这些资源来整理训练 SeasonStereo 所需的数据。我们专注于 [41] 中的 synchronic-only 划分,其中包含 1,565 对候选图像对。尽管该划分旨在包含近同时获取的图像,但目视检查发现,部分图像对仍存在明显的光度差异。由于 SeasonStereo 依赖完全一致的实拍立体图像对来获取可靠的监督线索,我们采用了一种保守的多指标共识策略,以识别出高度一致的子集用于训练。

对于每对候选图像 (IL, IR),我们首先使用预训练的基础模型 MonSter++ [14] 估计视差图 D。该视差图用于根据公式 (1) 将右图映射到左图,得到重建的左图 ˆIL。然后,我们计算 IL 与 ˆIL 之间的光度相似度,作为立体图像对一致性的代理指标。在此映射步骤中,优先选用 MonSter++ 的估计值而非 LiDAR 视差,因为 LiDAR 与图像证据可能因采集日期不同步而存在错位 [41]。此外,定性检查表明,MonSter++ 的预测结果能产生更清晰的目标边界和更少的映射伪影。

光度一致性通过互补的低层和基于学习的度量进行评估。首先,我们计算 IL 与 ˆIL 之间在有效映射像素上的 RGB 距离,并将其转换为有界相似度分数:Scolor = 1 − min(dcolor, dmax) / dmax,其中 dcolor 是给定图像对的逐像素距离均值,dmax 设为所有评估图像对中 dcolor 的第 95 百分位数。该基于颜色的分数与 SSIM [57] 结合,归一化至 [0, 1] 并记为 SSSIM,得到单一的光度一致性分数:

S_{ \mathrm{comb}} = 0.5(S_{\mathrm{color}} + S_{\mathrm{SSIM}}). \label{eq:combined_score} (2)

除了该低层分数 (2) 外,我们还计算了一个基于学习的外观相似度分数 SDINOv3,即 DINOv3 图像特征 [53] 之间的余弦相似度。候选图像对分别按 Scomb 和 SDINOv3 进行排序。如图 2 所示,较低的相似度分数通常对应较高的 MonSter++ 视

第 7 页

SeasonStereo 7

冬季提示词:卫星影像冬季变换。仅编辑季节外观。保持精确的相机视点、取景、比例、对齐和场景几何。所有建筑物、道路、田地边界、地标、河岸、海岸线和水体轮廓的位置、宽度和形状必须完全一致。仅应用冬季条件:屋顶、田野和开阔地面的积雪;休眠或无叶的植被;较低的太阳角度阴影;(…)

真实影像 合成,夏季 合成,秋季 合成,冬季 合成,春季

图3:真实影像与对应的几何保持、对齐、季节多样化的生成样本(由Nano Banana Pro [24]生成)。上方为冬季使用的提示词:粗体文本标记季节特定指令;常规文本为所有季节共用。

真实影像

2048×2048合成影像生成 1024×1024合成影像生成 合成影像 真实影像细节

图4:输入空间范围对Nano Banana Pro生成结构保真度的影响。从完整的2048×2048影像生成会引入局部幻觉和扭曲的建筑轮廓,而从1024×1024中心裁剪生成则能获得更强的几何保持。

与LiDAR导出的参考视差的视差误差,突显了选择高度相似的同步像对的重要性。为获得SeasonStereo最终的实拍同步像对子集,我们取每种相似性度量下得分最高的1,000对影像的交集。 总体而言,该数据筛选策略从Masquil等人[41]的纯同步划分中的原始1,565对立体像对中,最终得到了871对高度一致的同步立体像对子集。

3.2 卫星影像的几何保持季节合成

对于第3.1节选出的871对实拍同步像对中的每张影像,我们使用文本条件生成模型生成四个合成的季节多样化变体,如图3所示。与原始影像一起,每个视图产生五种外观变体,每对产生25种左右组合(5种同步 + 20种多时相),将训练集扩展至21,775对。 我们使用Nano Banana Pro [24]生成几何保持、季节多样化且与真实影像对齐的合成影像,如图3所示。

第 8 页

8 Á. Díaz-Laureano 等

我们发现输入的空间范围对于保留结构细节至关重要:在完整的2048×2048 DFC2019 Track 3图像上生成会导致精细尺度几何的保真度降低,而中心1024×1024的裁剪则能更好地保留建筑轮廓等结构,如图4所示。 我们观察到水体和树木经常产生几何上不一致的生成结果,使得这些区域中继承的监督线索不可靠。因此,我们使用一个基于OpenEarthMap预训练的SegFormer模型[44, 60, 61]为每张图像提取水体和树木的分割掩膜。对应的像素被标记为无效,并在训练期间从损失计算中排除(图5)。 最后,使用Masquil等人[41]提供的校正单应性矩阵对合成样本进行校正,并将其与第3.1节中选择的对应真实同步图像对进行对齐。我们发布了由此产生的数据集,包含21,775个校正后的左右图像对,这些图像对由108个JAX和OMA区域内的真实与合成季节性变体构成,并附带了相关的掩膜、MonSter++零样本视差,以及对应真实图像对的LiDAR导出视差。

3.3 面向多时相卫星立体适配的可扩展监督

SeasonStereo采用MonSter++[14]作为视差估计的主干网络。它扩展了先前多时相卫星立体匹配工作中使用的MonSter架构[41]。MonSter++遵循RAFT-Stereo的序列损失[35]进行训练,以递增的权重监督中间视差估计:

\[ \mathcal{L} = \sum_{k=1}^{N} w^{(k)} \mathcal{L}^{(k)},\label{eq:sequence_loss} \tag{3} \]

其中 \(\mathcal{L}^{(k)}\) 表示第k次迭代的预测值与有效像素上的真实视差之间的L1视差误差。权重遵循指数调度,对后期更精细的预测赋予更高权重,即 \(w^{(k)} = \gamma^{N-k}\),且 \(\gamma = 0.9^{1/(N-1)}\)。 对于SeasonStereo,我们保留了(3)式中的序列损失公式,但将每次迭代的监督损失 \(\mathcal{L}^{(k)}\) 替换为一个多目标项:

\[ \mathcal{L}^{(k)} = \lambda_{\mathrm{disp}} \mathcal{L}_{\mathrm{disp}}(\hat{D}^{(k)}) + \lambda_{\mathrm{feat}} \mathcal{L}_{\mathrm{feat}}(\hat{D}^{(k)}) + \lambda_{\mathrm{recon}} \mathcal{L}_{\mathrm{recon}}(\hat{D}^{(k)}),\label{eq:seasonstereo_loss} \tag{4} \]

其中 \(\lambda_i\) 是标量权重。遵循(4)式,我们在第3.2节中导出的同步和多时相立体图像对上微调MonSter++。至关重要的是,(4)式依赖于从真实同步图像对自动构建的监督线索,从而消除了对资源密集型几何线索(如[41]中使用的LiDAR导出视差)的需求。

视差损失。 SeasonStereo使用L1视差损失作为主要的几何监督,而不使用LiDAR导出的视差作为密集训练目标。一个冻结的预训练MonSter++模型充当教师,产生零样本

第 9 页

SeasonStereo 9

左视图 真实 水体 树木 遮挡 组合

图 5: 左视图有效像素掩膜 V 的构建。无效区域包括校正后图像裁剪范围外的像素(黑色)、水体(蓝色)、树木(绿色),以及根据视差估计的遮挡或非共同可见区域(红色)。在训练和评估过程中,V 用于排除无效像素。

从选定的真实同步像对中提取视差 ˜D。由于合成的季节变化版本保留了几何结构与图像对齐,这些预测结果可以迁移用于监督相应的合成多时相像对。微调后的模型预测 ˆD(k) 被训练以匹配教师视差 ˜D:

} \mathcal { L m rm {disp}}( \ hat { {(k)}){x}\left{D}^{(k)}(\mathbf{x})\tilde{D}(\mathbf{x})\label{eq:our_disp_loss} (5) _{\ D}^ ath

其中 x = (x, y) 为像素位置,V 为有效像素集合(图 5)。

光度损失。先前研究表明,图像证据可用于细化已对齐几何结构的细粒度细节 [9,39,54]。我们引入光度重建损失,该损失惩罚使用预测视差将右图像扭曲到左视点时产生的误差。直接将此损失应用于多时相像对是不适定的:无论视差精度如何,季节性的外观差异在扭曲后仍会存在。SeasonStereo 通过利用合成多时相像对与底层真实同步像对共享几何结构这一事实来避免此问题。因此,无论输入像对是同步的还是多时相的,光度损失均在对应的真实同步像对上计算:

_ \mathcal {L } r to}}(\ h at} {D ^{(k )}) = c\fra {1}{|\math cal{V}_{\text{x}{V}_{\text\ell\leftI^{\mathrm{real}}_L(\mathbf{x}),{warp}(I^{\mathrm{real}}_R,{D}^{(k)})(\mathbf{x})\label{eq:our_photo_loss} (6) {\ m ath m {pho

这使得模型能够从多时相输入中学习,而重建信号则在外观一致的图像上计算。我们采用自监督深度估计框架 Monodepth [21,22] 中的逐像素光度误差 ℓphoto,该误差结合了 SSIM [57] 与 L1 差异:

{ph } ( I^{\mathrm { real}}_ L { \ell _{\mat h rmo t o } \h a t {I}^{\m a thrmr eal } } _L) ={SSIM}(I^{\mathrm{real}}_L,{I}^{\mathrm{real}}_L)}{2})\,|I^{\mathrm{real}}_L{I}^{\mathrm{real}}_L|_1,\quad , (7) 其中 IrealL 和 ˆIrealL 分别为真实左图像与扭曲后得到的重建左图像,即式 (6) 中的 ˆIrealL = warp(IrealR , ˆD(k))。

第 10 页

10 Á. Díaz-Laureano 等

L real R real D pred

L synth R synth

输入左图 输入右图 预测视差 左视图重建 监督线索 来自 (L synth, R synth) 来自 (R synth, D pred) 来自 (L real, R real)

图 6: SeasonStereo 输入图像、微调前在 diachronic 图像对上的预测视差、由真实 synchronic 图像对得到的教师视差,以及基于预测视差将右视图扭曲到左视图后的左视图重建。

尽管用于监督的真实 synchronic 图像对具有很强的一致性,但它们仍可能相隔数小时或数天采集。因此,车辆等动态物体会在光度项 Lphoto 中引入噪声。为缓解这一问题,我们将光度损失限制在建筑区域,从而在永久性结构上获得更清晰的视差估计。建筑掩膜(式 (6) 中记为 VB)通过 OpenEarthMap 预训练的 SegFormer [44] 计算得到,与第 3.2 节讨论的水体和树木掩膜类似。图 6 展示了用于式 (5) 监督的教师视差,以及用于计算式 (6) 中光度损失的左视图重建。

平滑度损失。遵循 Monodepth [21],我们还使用了一个辅助的边缘感知平滑正则化项,以抑制虚假的视差波动,同时允许在可能的物体边界处出现不连续性。视差梯度由左输入图像 IL 的逆梯度加权:

{ t th}}(\hat D}^{(k)}) = {1}{|\m cal {V}|} \s um{x}\left\left_x{D}^{(k)}(\mathbf{x})\righte^{-|\partial_xI_L(\mathbf{x})|}\left_y{D}^{(k)}(\mathbf{x})\righte^{-|\partial_yI_L(\mathbf{x})|}\label{eq:our_reg_loss} \mathcal {L} _ \ma {smoo { \frac ath hrm (8) 其中,较大的梯度会降低惩罚,从而保留图像边缘处的视差变化。

有效像素掩膜。式 (5) 和式 (8) 中的损失项使用有效像素掩膜 V。式 (6) 进一步限制在由 V 与建筑掩膜 VB 的交集所界定的建筑区域内。有效像素掩膜 V 通过排除图 5 所示的不可靠区域获得:校正后落在图像裁剪区域外的黑色边框区域;合成生成可能在几何上不一致的水体和树木区域;以及被遮挡的像素。 被遮挡或非共同可见的像素通过基于预测视差 ˆD 的 z-buffer 测试进行检测。左图像中的每个像素按其视差水平移动;若移出右图像范围,则被丢弃。当多个像素映射到同一位置时,仅保留视差最大(表面最近)的像素,并将其余像素标记为遮挡。图 5 以红色显示了得到的遮挡掩膜,主要位于建筑立面和图像边界附近。

第 11 页

SeasonStereo 11

表1:各测试集上的高度MAE(米)。Avg.为各集平均。(a)-(d)在完整SeasonStereo数据集上训练:(a)使用基于LiDAR的监督,(b)-(d)展示递增的SeasonStereo损失配置;(d)为我们的最终模型(4)。

实验 Jacksonville Buenos Aires Omaha Synch. Omaha Diach. Avg. MAE

MonSter [15] 1.70±0.45 2.32±0.43 0.87±0.30 1.59±0.67 1.62 MonSter++ [14] 1.53±0.57 2.38±0.56 0.87±0.41 2.93±3.23 1.93 Diachronic Stereo [41] 1.12±0.45 1.54±0.21 0.75±0.34 0.82±0.34 1.06

(a) LLiDAR 1.17±0.40 1.50±0.18 0.74±0.31 0.80±0.37 1.05 (b) Ldisp 1.20±0.43 1.48±0.16 0.76±0.32 0.79±0.35 1.06 (c) Ldisp + Lphoto 1.18±0.40 1.58±0.13 0.77±0.32 0.84±0.38 1.09 (d) Ldisp + Lphoto + Lsmooth 1.15±0.39 1.52±0.14 0.75±0.32 0.79±0.36 1.05

4 实验

遵循Masquil等人[41]的方法,我们在四个测试划分上评估:Jacksonville(DFC2019 [10],主要为同步图像对)、Buenos Aires(IARPA 2016多视图立体挑战赛[11],轻度多时相对)以及两个Omaha集(DFC2019 [10]),分别包含同步和多时相对。模型性能通过从预测视差图重建的DSM的高度平均绝对误差(MAE)在测试集上进行评估。所有方法均使用第3.3节定义的有效性掩膜V进行评估。特别地,水和树木区域被排除,以避免因图像采集与LiDAR参考数据之间的时间差异所导致的偏差受到惩罚。

我们进一步进行消融研究,以评估SeasonStereo (4)中每个损失项的影响以及合成多时相训练数据的贡献。为隔离后者,我们在三个数据子集上训练基于(4)的完整模型。子集1 (S1)仅包含第3.1节中精心筛选的真实同步对。子集2 (S2)在S1基础上增加生成的同步合成对。子集3 (S3)在S1基础上以等比例增加同步和多时相合成对,同时保持总增广预算与S2相同。除S1/S2/S3子集的消融研究外,所有训练运行均使用第3节描述的完整生成数据集。

4.1 实现细节

SeasonStereo从混合域MonSter++ [14]检查点初始化。我们冻结单目深度先验分支,仅微调立体匹配骨干网络和迭代更新模块。(4)中的视差、光度和平滑度损失权重在所有实验中设置为λdisp = 0.05、λphoto = 0.1和λsmooth = 0.1。我们使用AdamW优化器训练50,000次迭代,学习率为5×10−4,权重衰减为1×10−5,采用单周期调度,在NVIDIA L40S GPU上批量大小为4。数据增广遵循MonSter [15]采用的RAFT-Stereo [35]协议,包括裁剪、颜色抖动和水平翻转,更多细节见[41]。

第 12 页

12 Á. Díaz-Laureano 等

左图 LiDAR MonSter++ Diachronic LLiDAR Ldisp Ldisp + Lphoto 本文完整模型 图像 视差 [14] Stereo [41] (a) (b) (c) (d)

图 7: OMA 084, DFC2019 [10] 中一个diachronic测试对的定性细节。MonSter++在diachronic外观变化下失效,而Diachronic Stereo则过度平滑了建筑物轮廓。(a)-(d)均在完整的SeasonStereo数据集上训练:(a) 使用基于LiDAR的监督,(b)-(d) 展示了递增的SeasonStereo损失配置;基于公式(4)的完整模型产生了更清晰的建筑物边缘,且与图像证据更吻合。品红色标记指示了建筑物角点的图像位置。

表 2: 消融研究。我们使用公式(4)在第4节描述的数据子集上训练完整模型,以评估diachronic合成影像对训练的贡献。

训练数据 图像对数量 Jacksonville Buenos Aires Omaha Synch. Omaha Diach. 平均 MAE

S1: 仅真实数据 871 真实 1.33±0.48 1.63±0.13 0.75±0.31 1.04±0.38 1.18 S2: +synch.合成 871 真实 + 3483 合成 1.21±0.39 1.54±0.19 0.78±0.34 0.88±0.37 1.10 S3: +混合合成 871 真实 + 3483 合成 1.18±0.41 1.57±0.16 0.75±0.31 0.81±0.35 1.07

4.2 评估

表 1 报告了定量评估结果。我们将zero-shot的MonSter [15] 和MonSter++ [14] 模型与Diachronic Stereo [41] 以及我们的SeasonStereo变体 (a)-(d) 进行了比较,这些变体涵盖了从LiDAR导出的视差监督到公式(4)中的完整多损失项。公式(4)中的完整SeasonStereo损失取得了最低的平均MAE,与LiDAR监督变体LLiDAR持平。这表明,来自基础立体模型的zero-shot视差预测可以作为有效的伪真值,为LiDAR导出的监督提供了一种可扩展的替代方案。

尽管在表 1 的Omaha Diachronic划分上,Ldisp和完整的SeasonStereo公式(d)获得了相似的定量结果,但图 7 揭示了定性差异。单独使用Ldisp能保留全局场景几何,但会产生更平滑的物体边界。相比之下,最终损失产生了更清晰的建筑物轮廓,与图像证据更吻合,同时保持了全局平滑性。这表明光度项和平滑项通过改善永久性结构周围的结构清晰度,对视差监督起到了补充作用。

图 8 和图 9 展示了在视差和DSM空间中的进一步定性结果。与zero-shot的MonSter++和Diachronic Stereo相比,SeasonStereo在强烈的季节性外观变化下保留了场景几何,同时产生了更清晰的建筑物结构和更准确定位的高度不连续性。

第 13 页

SeasonStereo 13

IARPA 003 JAX 260 OMA 084 OMA 134 OMA 230 OMA 247 OMA 331 12JUN15-01SEP15 018-005 042-016 029-013 013-031 009-023 017-036

左图

右图

MonSter++

Stereo Diachronic

本文方法

真值

图 8: 在测试集中选取的困难多时相图像对上的视差预测定性结果,这些图像对最初列于 Masquil 等人 [41] 的工作中。

4.3 消融研究

表 2 使用公式 (4) 中的完整 SeasonStereo 损失以及第 4 节介绍的 S1/S2/S3 子集,评估了训练数据构成的影响。结果表明,与仅在真实同步图像对上训练相比,合成数据增强持续提升了性能,将平均 MAE 从 S1 的 1.18 降至 S2 的 1.10 和 S3 的 1.07。最显著的增益出现在 Omaha Diachronic 测试集上,S3 将 MAE 从 1.04 降至 0.81,这表明合成的多时相训练数据增强了对剧烈外观变化的鲁棒性。相比之下,在 Omaha Synchronic 和 Buenos Aires 等较简单的场景中,提升幅度较小或呈非单调性,这表明预训练的几何先验已经能够较好地处理中等程度的外观变化。

值得注意的是,S3 使用的训练图像对数量远少于完整的 SeasonStereo 训练集,但其结果仍接近表 1 中报告的最佳结果,这表明所提出的监督方法在数据量大幅减少的情况下依然有效。

第 14 页

14 Á. Díaz-Laureano 等

IARPA 003 JAX 260 OMA 084 OMA 134 OMA 230 OMA 247 OMA 331 12JUN15-01SEP15 018-005 042-016 029-013 013-031 009-023 017-036

MonSter++

Stereo Diachronic

Ours

GT

图 9: 从上到下:由零样本 MonSter++ [14]、Diachronic Stereo [41] 和 SeasonStereo(本文方法)预测的视差重建的 DSM,以及由 LiDAR 导出的真实 DSM。结果展示了 Masquil 等人 [41] 最初列出的困难 diachronic 测试像对。缺失值以黑色显示。

5 结论

我们提出了 SeasonStereo,一个用于多日期卫星影像鲁棒密集立体匹配的可扩展框架,旨在即使输入视图呈现强烈外观差异时也能产生准确的视差估计。通过从可靠的 synchronic 立体像对生成保持几何结构的季节变体,SeasonStereo 实现了 diachronic 训练,而无需对齐的真实多日期产品或 LiDAR 导出的密集监督。该框架结合了来自立体基础模型的几何先验与在相应 synchronic 视图上计算的图像一致性线索,为昂贵的真值获取提供了一种有效的替代方案。 我们的实验表明,SeasonStereo 取得了与 LiDAR 监督的 diachronic 立体方法相当的性能,同时恢复了更清晰的精细尺度几何结构,尤其是在建筑物轮廓方面。这些结果表明,生成式外观合成与精心设计的几何监督相结合,为从异构卫星影像进行鲁棒的大规模三维重建提供了一条实用途径。 未来的工作将侧重于改进 SeasonStereo 中使用的生成卫星图像的多样性和几何保真度。模拟更广泛气候条件下几何一致的时序变化,可以进一步提高合成数据在卫星领域密集立体匹配中的可靠性并拓宽其适用性。

第 15 页

SeasonStereo 15

参考文献

1. Albanwan, H., Qin, R.: A comparative study on deep-learning methods for dense image matching of multi-angle and multi-date remote sensing stereo-images. The Photogrammetric Record 37(180), 385–409 (2022) 2. Amadei, T., Meinhardt-Llopis, E., de Franchis, C., Anger, J., Ehret, T., Facciolo, G.: s2p-hd: GPU-accelerated binocular stereo pipeline for large-scale same-date stereo. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops. pp. 2364–2373 (2025) 3. Bartolomei, L., Tosi, F., Poggi, M., Mattoccia, S.: Stereo anywhere: Robust zero-shot deep stereo matching even where either stereo or mono fail. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 1013–1027 (June 2025) 4. Benidir, Y., Gonthier, N., Mallet, C.: The change you want to detect: Semantic change detection in earth observation with hybrid data generation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 2204–2214 (2025) 5. Betker, J., Goh, G., Jing, L., Brooks, T., Wang, J., Li, L., Ouyang, L., Dinh, J., Contino, S., Tseng, T., et al.: Improving image generation with better captions. Tech. rep., OpenAI (2023) 6. Beyer, R.A., Alexandrov, O., McMichael, S.: The Ames Stereo Pipeline: NASA's open source software for deriving and processing terrain data. Earth and Space Science 5(9), 537–548 (2018) 7. Bittner, K., d'Angelo, P., Körner, M., Reinartz, P.: DSM-to-LoD2: Spaceborne stereo digital surface model refinement. Remote Sensing 10(12), 1926 (2018) 8. Bittner, K., Korner, M.: Automatic large-scale 3D building shape refinement using conditional generative adversarial networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops. pp. 1887–1889 (2018) 9. Bittner, K., Reinartz, P., Korner, M.: Late or earlier information fusion from depth and spectral data? Large-scale digital surface model refinement by Hybrid-cGAN. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (2019) 10. Bosch, M., Foster, K., Christie, G., Wang, S., Hager, G.D., Brown, M.: Semantic stereo for incidental satellite images. In: 2019 IEEE Winter Conference on Applications of Computer Vision (WACV). pp. 1524–1532 (2019) 11. Bosch, M., Kurtz, Z., Hagstrom, S., Brown, M.: A multiple view stereo benchmark for satellite imagery. In: 2016 IEEE Applied Imagery Pattern Recognition Workshop (AIPR). pp. 1–9 (2016) 12. Bournez, P., Savant Aira, L., Ehret, T., Facciolo, G.: EOGS++: Earth observation gaussian splatting with internal camera refinement and direct panchromatic rendering. ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences XI-2-2026, 217–224 (2026) 13. Brown, M., Goldberg, H., Foster, K., Leichtman, A., Wang, S., Hagstrom, S., Bosch, M., Almes, S.: Large-scale public lidar and satellite image data set for urban semantic labeling. In: Laser Radar Technology and Applications XXIII. vol. 10636, pp. 154–167 (2018) 14. Cheng, J., Liao, W., Cai, Z., Liu, L., Xu, G., Wang, X., Wang, Y., Yuan, Z., Deng, Y., Zang, J., et al.: MonSter++: Unified stereo matching, multi-view stereo, and real-time stereo with monodepth priors. IEEE Transactions on Pattern Analysis and Machine Intelligence (2026)

第 16 页

16 Á. Díaz-Laureano 等

15. Cheng, J., Liu, L., Xu, G., Wang, X., Zhang, Z., Deng, Y., Zang, J., Chen, Y., Cai, Z., Yang, X.: MonSter: Marry monodepth to stereo unleashes power. 载于:Proceedings of the Computer Vision and Pattern Recognition Conference. 第 6273–6282 页 (2025) 16. Duggal, S., Wang, S., Ma, W.C., Hu, R., Urtasun, R.: DeepPruner: Learning efficient stereo matching via differentiable PatchMatch. 载于:Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 第 4384–4393 页 (2019) 17. Dumas, L., Defonte, V., Steux, Y., Sarrazin, E.: Improving pairwise DSM with 3SGM: A semantic segmentation for SGM using an automatically refined neural network. ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences 2, 167–175 (2022) 18. Facciolo, G., De Franchis, C., Meinhardt-Llopis, E.: Automatic 3D reconstruction from multi-date satellite images. 载于:Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops. 第 57–66 页 (2017) 19. Facciolo, G., de Franchis, C., Meinhardt, E.: MGM: A significantly more global matching for stereovision. 载于:Proceedings of the British Machine Vision Conference (BMVC). 第 1–12 页. No. 90 (2015) 20. de Franchis, C., Meinhardt-Llopis, E., Michel, J., Morel, J.M., Facciolo, G.: An automatic and modular stereo pipeline for pushbroom images. ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences II-3, 49–56 (2014) 21. Godard, C., Mac Aodha, O., Brostow, G.J.: Unsupervised monocular depth estimation with left-right consistency. 载于:Proceedings of the IEEE conference on computer vision and pattern recognition. 第 270–279 页 (2017) 22. Godard, C., Mac Aodha, O., Firman, M., Brostow, G.J.: Digging into self-supervised monocular depth estimation. 载于:Proceedings of the IEEE/CVF international conference on computer vision. 第 3828–3838 页 (2019) 23. Gómez, A., Randall, G., Facciolo, G., von Gioi, R.G.: Improving the pair selection and the model fusion steps of satellite multi-view stereo pipelines. 载于:Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. 第 6344–6353 页 (2023) 24. Google AI: Gemini 3 Pro Image. https://ai.google.dev/gemini-api/docs/models/gemini-3-pro-image (2026),访问日期:2026-06-24 25. Hirschmüller, H.: Stereo processing by semiglobal matching and mutual information. IEEE Transactions on Pattern Analysis and Machine Intelligence 30(2), 328–341 (2008) 26. Jakubik, J., Yang, F., Blumenstiel, B., Scheurer, E., Sedona, R., Maurogiovanni, S., Bosmans, J., Dionelis, N., Marsocci, V., Kopp, N., 等: TerraMind: Large-scale generative multimodality for earth observation. 载于:Proceedings of the IEEE/CVF International Conference on Computer Vision. 第 7383–7394 页 (2025) 27. Kendall, A., Martirosyan, H., Dasgupta, S., Henry, P., Kennedy, R., Bachrach, A., Bry, A.: End-to-end learning of geometry and context for deep stereo regression. 载于:Proceedings of the IEEE International Conference on Computer Vision (ICCV). 第 66–75 页 (2017) 28. Khanna, S., Liu, P., Zhou, L., Meng, C., Rombach, R., Burke, M., Lobell, D., Ermon, S.: DiffusionSat: A generative foundation model for satellite imagery. 载于:International Conference on Learning Representations. 第 2024 卷,第 5586–5604 页 (2024)

第 17 页

SeasonStereo 17

29. Khose, S., Pal, A., Agarwal, A., Deepanshi, Hoffman, J., Chattopadhyay, P.: SkyScenes: 一个用于航空场景理解的合成数据集。载于:欧洲计算机视觉会议 (ECCV)。第 19–35 页 (2024) 30. Kim, H.G., Park, J., Park, J., Kwon, D.: SatUnreal: 通过虚幻引擎构建的高精度卫星立体匹配合成数据集。载于:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 研讨会论文集 (2026) 31. Kuschk, G., d’Angelo, P., Gaudrie, D., Reinartz, P., Cremers, D.: 多分辨率数字表面模型的空间正则化融合。IEEE 地球科学与遥感汇刊 55(3), 1477–1488 (2016) 32. Laga, H., Jospin, L.V., Boussaid, F., Bennamoun, M.: 基于深度学习的立体深度估计技术综述。IEEE 模式分析与机器智能汇刊 44(4), 1738–1764 (2020) 33. Le Saux, B., Yokoya, N., Hansch, R., Brown, M., Hager, G.: 2019 数据融合竞赛 [技术委员会]。IEEE 地球科学与遥感杂志 7(1), 103–105 (2019) 34. Li, S., He, S., Jiang, S., Jiang, W., Zhang, L.: WHU-Stereo: 一个具有挑战性的高分辨率卫星影像立体匹配基准。IEEE 地球科学与遥感汇刊 61, 1–14 (2023) 35. Lipson, L., Teed, Z., Deng, J.: RAFT-Stereo: 用于立体匹配的多级循环场变换。载于:2021 年国际三维视觉会议 (3DV)。第 218–227 页 (2021) 36. Marí, R., De Franchis, C., Meinhardt-Llopis, E., Facciolo, G.: 利用 SkySat 影像的多视图立体进行自动料堆体积监测。载于:2021 IEEE 国际地球科学与遥感研讨会 IGARSS。第 4384–4387 页 (2021) 37. Marí, R., Ehret, T., Facciolo, G.: 航空与高分辨率卫星影像的视差估计网络:综述。Image Processing On Line 12, 501–526 (2022) 38. Marí, R., Facciolo, G., Ehret, T.: Sat-NeRF: 使用 RPC 相机学习具有瞬态物体和阴影建模的多视图卫星摄影测量。载于:2022 IEEE/CVF 计算机视觉与模式识别会议研讨会 (CVPRW)。第 1310–1320 页 (2022) 39. Marí, R., Facciolo, G., Ehret, T.: 多日期地球观测 NeRF: 细节在于阴影。载于:2023 IEEE/CVF 计算机视觉与模式识别会议研讨会 (CVPRW)。第 2035–2045 页 (2023) 40. Marí, R., Redondo, R.: 用于航空影像条件生成的潜在扩散方法:一项研究。Image Processing On Line 15, 20–31 (2025) 41. Masquil, E., Aira, L.S., Marí, R., Ehret, T., Musé, P., Facciolo, G.: 多日期卫星影像的 diachronic 立体匹配。ISPRS 摄影测量、遥感与空间信息科学年鉴 XI-2-2026, 483–492 (2026) 42. Masquil, E., Ehret, T., Musé, P., Facciolo, G.: Deep S2P: 将基于学习的立体匹配集成到卫星立体管线中。arXiv 预印本 arXiv:2603.21882 (2026) 43. Michel, J., Sarrazin, E., Youssefi, D., Cournet, M., Buffe, F., Delvit, J.M., Emilien, A., Bosman, J., Melet, O., L’Helguen, C.: 一个为可扩展性、鲁棒性和性能而设计的新型卫星影像立体管线。载于:ISPRS 摄影测量、遥感与空间信息科学年鉴。第 V-2-2020 卷,第 171–178 页 (2020)

第 18 页

18 Á. Díaz-Laureano 等人

44. odil111: SegFormer Fine-Tuned on OpenEarthMap. https://huggingface.co/ odil111/segformer-fine-tuned-on-openearthmap (2024), Hugging Face 模型仓库。 MIT 许可证。访问日期:2026-06-24 45. Patil, S., Comandur, B., Prakash, T., Kak, A.C.: A new stereo benchmarking dataset for satellite images. arXiv preprint arXiv:1907.04404 (2019) 46. Patil, S., Guo, Q.: Stellar: A large satellite stereo dataset for digital surface model generation. International Archives of the Photogrammetry, Remote Sensing and Spatial Information Sciences XLVIII-M-1-2023, 433–440 (2023) 47. Qin, R.: Automated 3D recovery from very high resolution multi-view images. In: ASPRS Annual Conference (2017) 48. Qin, R.: A critical analysis of satellite stereo pairs for digital surface model genera- tion and a matching quality prediction model. ISPRS Journal of Photogrammetry and Remote Sensing 154, 139–150 (2019) 49. Qin, R., Ling, X., Farella, E.M., Remondino, F.: Uncertainty-guided depth fusion from multi-view satellite images to improve the accuracy in large-scale DSM gen- eration. Remote Sensing 14(6), 1309 (2022) 50. Rupnik, E., Daakir, M., Pierrot Deseilligny, M.: MicMac–a free, open-source solu- tion for photogrammetry. Open geospatial data, software and standards 2(1), 14 (2017) 51. Savant Aira, L., Facciolo, G., Ehret, T.: Gaussian splatting for efficient satellite im- age photogrammetry. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 5959–5969 (2025) 52. Scharstein, D., Szeliski, R.: A taxonomy and evaluation of dense two-frame stereo correspondence algorithms. International Journal of Computer Vision 47(1-3), 7– 42 (2002) 53. Siméoni, O., Vo, H.V., Seitzer, M., Baldassarre, F., Oquab, M., Jose, C., Khali- dov, V., Szafraniec, M., Yi, S., Ramamonjisoa, M., 等人: DINOv3. arXiv preprint arXiv:2508.10104 (2025) 54. Stucker, C., Schindler, K.: ResDepth: A deep residual prior for 3D reconstruc- tion from high-resolution satellite images. ISPRS Journal of Photogrammetry and Remote Sensing 183, 560–580 (2022) 55. Tosi, F., Bartolomei, L., Poggi, M.: A survey on deep stereo matching in the twen- ties. International Journal of Computer Vision 133(7), 4245–4276 (2025) 56. Wang, Z., Li, D., Wu, Y., He, T., Bian, J., Jiang, R.: Diffusion models in 3D vision: A survey. arXiv preprint arXiv:2410.04738 (2024) 57. Wang, Z., Bovik, A.C., Sheikh, H.R., Simoncelli, E.P.: Image quality assessment: From error visibility to structural similarity. IEEE Transactions on Image Process- ing 13(4), 600–612 (2004) 58. Wen, B., Trepte, M., Aribido, J., Kautz, J., Gallo, O., Birchfield, S.: Foundation- Stereo: Zero-shot stereo matching. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 5249–5260 (2025) 59. Wu, T., Vallet, B., Pierrot-Deseilligny, M., Rupnik, E.: A new stereo dense match- ing benchmark dataset for deep learning. The International Archives of Photogram- metry, Remote Sensing and Spatial Information Sciences 43, 405–412 (2021) 60. Xia, J., Yokoya, N., Adriano, B., Broni-Bediako, C.: OpenEarthMap: A bench- mark dataset for global high-resolution land cover mapping. In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. pp. 6254–6264 (2023) 61. Xie, E., Wang, W., Yu, Z., Anandkumar, A., Alvarez, J.M., Luo, P.: SegFormer: Simple and efficient design for semantic segmentation with transformers. In: Ad- vances in Neural Information Processing Systems. vol. 34, pp. 12077–12090 (2021)

第 19 页

SeasonStereo 19

62. Yang, G., Manela, J., Happold, M., Ramanan, D.: Hierarchical deep stereo matching on high-resolution images. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 5515–5524 (2019) 63. Yang, L., Kang, B., Huang, Z., Zhao, Z., Xu, X., Feng, J., Zhao, H.: Depth Anything V2. Advances in Neural Information Processing Systems 37, 21875–21911 (2024) 64. Zabih, R., Woodfill, J.: Non-parametric local transforms for computing visual correspondence. In: European Conference on Computer Vision (ECCV). pp. 151–158 (1994) 65. Zhang, F., Prisacariu, V., Yang, R., Torr, P.H.: GA-Net: Guided aggregation net for end-to-end stereo matching. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 185–194 (2019) 66. Zhang, L., Rupnik, E.: SparseSat-NeRF dense depth supervised neural radiance fields for sparse satellite images. ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences 1, 895–902 (2023) 67. Zhao, H., Shi, J., Qi, X., Wang, X., Jia, J.: Pyramid scene parsing network. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). pp. 6230–6239 (2017)

发表评论