卫星影像变化检索:融合架构的效率-精度博弈与级联加速策略

本文贡献:受控比较与级联加速

在文本驱动的双时相遥感图像变化检索中,查询时需对海量候选图像对运行融合模块,计算开销巨大。本文系统比较了注意力机制、状态空间模型(Mamba)和压缩瓶颈(TBF)三类融合范式的效率与精度权衡,并提出一种训练无关的级联检索策略:先用廉价的减法模型筛选候选集,再用注意力模型重排序Top-N,在LEVIR-CC上实现10-15倍查询加速且召回率不降。实验揭示了一个关键发现:Mamba的线性复杂度优势在标准ViT序列长度下并未转化为实际延迟收益,其选择性扫描受限于内存带宽,而注意力机制能高效利用并行计算。TBF通过压缩融合表示,成为效率-质量的最佳平衡点。需注意,级联检索的增益与数据集规模相关,且延迟

Nemotron AV-Flamingo:开源长视频音视频联合推理模型解析

方法概述

本文介绍Nemotron Labs发布的AV-Flamingo,一个面向长视频与复杂场景的开放音视频智能模型。针对现有模型缺乏长上下文联合理解能力的问题,该工作提出了包含约700万实例的AV-Skills数据集,以及将推理步骤锚定时间戳的TAVIT框架。实验显示,在MMOU、WorldSense等基准上,AVF-Think表现优异,部分指标超越OmniVinci等开源模型,但在MMOU上略低于Gemini-2.5 Pro。模型完全开源,包括权重、代码及数据集,适合需要透明训练流程的研究者。需注意数据集存在来源偏差风险,且极长密集视频推理仍具挑战。

加入触觉却不忘记视觉:Splash的小模型对齐方案

Splash核心方法

小型多模态模型加入触觉时容易发生灾难性遗忘。Splash冻结视觉关键子空间,只更新休眠子空间与触觉前端。本期查看VTL与视觉基准、稀疏率消融和实时延迟,并讨论静态子空间和跨传感器泛化。

一个模型统一检测、分割和3D几何?SenseNova-Vision解读

方法概述

传统视觉任务需要不同结构和预测头。SenseNova-Vision尝试把检测、OCR、分割、深度、法线和多视图几何统一成文本、图像或混合生成。本期重点看统一接口、语料构建、各任务实验,以及评估协议与复杂场景失败案例。