三分钟导读:ScanFocus通过解耦全局时空扫描与局部边界聚焦,利用语义引导的时间聚合器恢复被下采样抑制的高频边界线索,从而显著提升时空视频定位的精度。
英文题目:ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding
论文出处:arXiv 每日论文精选 · arXiv:2607.13421
原始论文:PDF / 论文页面
对应视频标题:ScanFocus:解耦时空扫描与边界聚焦,突破视频定位高频线索抑制瓶颈|推荐指数:★★★★★
这篇论文解决什么问题?
现有基于Transformer的STVG方法因全局下采样抑制了高频时间线索,且缺乏显式的帧间依赖建模,导致时间边界定位模糊。
核心创新
- 提出由粗到细的解耦范式,结合稀疏全局检索与密集边界细化,缓解高频线索抑制问题。
- 引入Semantic-Guided Temporal Aggregator (SGTA),在局部窗口内通过语义引导显式建模帧间依赖,捕捉快速运动变化。
- 采用解耦的多模态融合策略,利用预训练的视觉-语言编码器提取对齐特征,再通过轻量级模块融合运动动态,降低计算复杂度。
方法概览
提出ScanFocus框架,分为两阶段:1) Global Spatio-Temporal Scan:使用统一的视觉-语言融合编码器和轻量级Deformable Semantic-Motion Fusion模块生成粗略时空管和时间间隔;2) Local Boundary Focus:在粗略边界周围进行密集采样,利用Semantic-Guided Temporal Aggregator (SGTA) 显式建模短期依赖以精确回归起止时间戳。
逐图理解论文
证据:时间定位是主要瓶颈

Oracle实验揭示了当前方法的根本局限。在HC-STVGv1数据集上,若使用GT时间戳替代预测区间,vIoU@0.3可从67.5%跃升至94.0%。这一巨大差距表明,时间定位精度仍是制约性能的主要瓶颈,亟需更精细的边界回归机制。
方法:由粗到细的解耦范式

ScanFocus提出由粗到细的解耦框架。第一阶段为全局时空扫描,利用统一的视觉-语言融合编码器和轻量级可变形语义-运动融合模块,生成粗略时空管和时间间隔。第二阶段为局部边界聚焦,在粗略边界周围进行密集采样,以恢复被抑制的高频细节。
创新:解耦多模态融合策略

针对全耦合三模态对齐的挑战,ScanFocus采用解耦策略。首先利用预训练的BEiT-3和VideoMAE提取已在大规模上游数据集中对齐的视觉与语言特征,随后通过轻量级语义-运动融合编码器,将这些稳健的语义表示与运动动态进一步对齐,有效降低计算复杂度。
核心:语义引导的时间聚合器

局部聚焦阶段的核心是语义引导的时间聚合器。它在局部窗口内显式建模短期依赖,通过语义引导过滤背景噪声,捕捉快速运动变化。该模块将局部特征输入双细化解码器,精确预测起止时间戳,从而修正粗略阶段产生的模糊边界。
结果:HC-STVGv1基准表现

在HC-STVGv1基准上,ScanFocus取得显著优势。vIoU@0.3达到67.5%,vIoU@0.5达到42.2%。相比之前的SOTA方法TA-STVG和TubeDETR,ScanFocus在多项指标上均实现超越,验证了由粗到细范式的有效性。
实验与关键结果
- 在HC-STVGv1, HC-STVGv2和VidSTG三个基准数据集上进行广泛实验。
- 进行Oracle实验以验证时间定位是主要瓶颈。
- 进行组件有效性分析和消融实验,评估SGTA设计、融合机制及窗口大小的影响。
- 在HC-STVGv1, HC-STVGv2和VidSTG三个基准数据集上进行广泛实验。
- 进行Oracle实验以验证时间定位是主要瓶颈。
- 进行组件有效性分析和消融实验,评估SGTA设计、融合机制及窗口大小的影响。
阅读时需要注意
- 细化阶段的窗口大小Nw需要权衡定位精度与资源消耗,过大引入背景噪声,过小丢失上下文(默认Nw=8)。
- 依赖预训练的BEiT-3和VideoMAE,可能受限于上游预训练数据的质量。
- Oracle实验显示使用GT时间戳可将vIoU@0.3从67.5%提升至94.0%,表明时间定位仍是主要瓶颈。
- SGTA模块中语义引导对于过滤背景噪声至关重要,移除后性能下降。
关联工作
- MDETR:作为现有主流STVG方法的基础架构,ScanFocus指出其全耦合三模态融合存在优化瓶颈。(第 5 页)
- TA-STVG:作为之前的SOTA方法,ScanFocus在多个指标上显著超越该方法。(第 12 页)
- TubeDETR:作为基于Transformer的STVG代表方法,被ScanFocus在性能上超越。(第 12 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
ScanFocus:一种用于时空视频定位的由粗到细框架
陈凯∗,戴明∗,程文轩,杨万扣†
东南大学
摘要。时空视频定位(STVG)旨在从视频流中检索由自然语言表达式描述的特定对象的视觉轨迹。然而,大多数先进方法难以在建模全局上下文与精确定位边界之间取得平衡。由于处理长视频的计算成本高昂,这些方法通常采用低速率的时间下采样和隐式运动建模。这不可避免地抑制了高频边界线索,并忽略了精确界定边界所需的显式帧间依赖关系。为了解决这些局限性,我们提出了 ScanFocus,这是一种新颖的由粗到细框架,将 STVG 任务解耦为全局时空扫描和局部边界聚焦。具体而言,我们利用统一的多模态融合编码器结合轻量级可变形语义-运动融合模块,以高效地对齐多模态特征并生成粗略提议。为了恢复被抑制的细粒度细节,我们在细化阶段引入了语义引导的时间聚合器(SGTA)。通过在粗略边界周围密集采样,SGTA 在语义引导下显式建模短期时间交互,捕捉快速运动变化以实现精确的时间戳回归。在三个广泛使用的基准上的大量实验证明了所提方法相较于先前方法的性能优势。代码将在 https://github.com/TenMinutes209/ScanFocus 发布。
关键词:时空视频定位 · 由粗到细 · 多模态融合
1 引言
时空视频定位 [59] 的目标是从视频流中检索由自然语言表达式描述的特定对象的视觉轨迹。这种双域定位任务不仅要求稳健的空间目标检测,还要求精确的时间边界界定,使其成为评估动态环境中跨模态推理能力的前沿复杂任务。
⋆ 同等贡献。 † 通讯作者。
第 2 页
2 K. Chen 等人
文本:有一只灰色的狗在地上咬玩具。
0 484 156 ` 367 159 375
𝑓𝑐
16 8 … 492500 模型 164172 … 375383 160161 … 376377
视频 下采样帧 区间:[164, 367] 真实动作:[159, 376] 𝑓𝑐 (a) 现有方法边界模糊 √ 密集采样帧
176 156 371 0 484 156 367 148 … 160 164 168 … 8 492 粗略 164 375 密集 160 376 𝑓𝑟 细化模型 16 164 … 380 … 500 172 … 383 采样 模型 边界 351 363 367 371 380 … … 稀疏下采样 粗略:[164, 367] 细化:[160, 376] 全局时空扫描 局部边界聚焦 (b) ScanFocus (本文)
图 1: 时间边界定位范式的比较。(a) 现有的基于 Transformer 的方法由于全局下采样导致高频时间线索被抑制,往往产生模糊的边界。(b) 我们提出的方法采用由粗到细的框架,首先在低帧率下生成粗略区间,然后通过边界密集采样恢复细粒度细节以实现精确定位。
最近,得益于 Transformer [44] 强大的注意力机制和紧凑的流水线,研究人员引入了许多基于 Transformer 的架构来解决这一挑战,取得了前所未有的成果。通过利用复杂的编码器-解码器来全面融合视觉和语言特征,这些方法 [19,20,26,33,40,53] 显著促进了多模态信息的协同识别,并在时空对齐方面确立了新的最先进 (SOTA) 性能。 尽管取得了这些进展,现有的基于 Transformer 的时空视频定位 (STVG) 方法本质上受到高频线索抑制的限制。由于处理长视频序列的计算成本高昂,现有方法 [19, 20, 26, 53] 通常采用为全局语义对齐设计的低速率时间子采样。因此,高频时间边界线索被丢弃,对应于真实边界的帧在采样过程中往往被完全跳过。这在物理上阻止了模型获取精确的边界特征,导致时间上模糊的预测,如图 1(a) 所示。 这种模糊性由于缺乏显式的时间建模而进一步加剧。为了在全局建模下保持效率,当前方法主要关注帧级跨模态交互——即在每个单独帧内融合外观、运动和语言特征。它们严重依赖骨干网络隐式编码的运动特征,缺乏专门的机制来捕捉帧之间用于精确边界划分的细粒度时间依赖关系。此外,在静态 MDETR [27] 范式下强制编码器同时容纳多模态特征会产生
第 3 页
ScanFocus:一种用于时空视频定位(STVG)的由粗到细框架 3
显著的优化瓶颈。这种过载的融合使模型陷入次优解,限制了高精度的时间定位。
为了实证验证这一时间定位瓶颈,我们在 HCSTVG-v1 数据集上进行了预言机分析(Oracle Analysis)(其他数据集请参阅补充材料)。如图 2 所示,我们将完整模型的预测结果与使用真实时间戳(Ground Truth, GT)评估空间管序列的预言机设置进行了比较。我们观察到了性能的显著飞跃:例如,vIoU@0.3 从 67.5% 激增至 94.0%,vIoU@0.5 从 42.2% 跃升至 86.9%。这一巨大的差距表明,我们的框架已经具备高度准确的空间定位能力,证实了 STVG 的主要约束在于时间模糊性。
为了解决这些局限性,本文引入了 ScanFocus,这是一种新颖的由粗到细框架,将 STVG 解耦为全局时空扫描和局部边界聚焦。如图 1(b) 所示,模仿人类视觉策略中先全局扫描后局部审视的过程,我们的框架将稀疏的全局检索与密集的边界细化相结合。这种设计有效地恢复了被抑制的高频线索,并为精确的时间界定建立了显式的帧间依赖关系。具体而言,我们首先利用统一的多模态融合编码器结合可变形语义-运动融合编码器 [63] 来高效地对齐多模态特征,随后使用两个 DETR 风格的解码器 [9] 分别生成空间管和粗略的时间区间。此外,为了捕获全局扫描中被抑制的高频线索,我们引入了局部边界聚焦阶段。在此阶段,我们在预测的粗略边界周围进行密集的边界采样,并采用语义引导的时间聚合器模块来显式建模局部窗口内的短期时间依赖关系。结果,我们恢复了边界细节,并通过细化解码器将粗略提议细化为精确的起止时间戳。综上所述,我们的贡献包括:
– 我们提出了 ScanFocus,这是一种由粗到细的框架,将 STVG 解耦为全局时空扫描和局部边界聚焦。该架构通过将稀疏检索与密集边界细化相结合,有效地缓解了全局建模中高频线索被抑制的问题。
– 为了解决现有方法中缺乏显式帧间依赖的问题,我们在
第 4 页
4 K. Chen 等
精炼阶段。该模块显式地对密集采样的边界窗口内的短期时间交互进行建模,从而实现起始和结束时间戳的精确回归。 – 我们在三个广泛使用的基准数据集上进行了大量实验,以证明我们提出的方法相较于先前最先进(SOTA)方法在性能上的优越性,验证了我们策略的有效性。
2 相关工作
2.1 时空视频定位
时空视频定位(STVG)[59] 旨在基于给定的自然语言描述,在未修剪的视频序列中精确地定位感兴趣目标的时空位置。现有的 STVG 方法主要经历了几个不同的范式演变。早期的方法 [42,58,59] 通常采用两阶段策略,首先利用预训练的目标检测器生成冗余的区域候选集,随后选择与文本查询最匹配的最佳候选者。然而,这些方法往往受限于外部检测器的质量,并且计算开销较高。为了缓解这些局限性,随后的进展 [19, 20, 26, 33, 40, 50, 53] 转向了统一的单阶段框架。受 Transformer [44] 成功的启发,这些方法采用端到端的编码器-解码器架构,直接回归时空管状区域(tubelets),而无需依赖任何预定义的候选框。通过促进更紧密的跨模态交互并消除启发式候选框生成过程,这一范式确立了新的最先进性能。最近,一种新兴范式将多模态大语言模型(MLLMs)[1,4,22,23,62] 整合到 STVG [21,30,45,60] 中,利用其强大的推理能力进一步提升细粒度的时空理解能力。然而,由于时间边界的固有模糊性以及时间下采样不可避免地导致的高频边界线索抑制,现有模型经常在时间定位方面表现出不精确的问题。为了解决这些挑战,我们提出了一种由粗到细的策略来提高时间定位性能。
2.2 视觉-语言建模
视觉-语言建模(VLM)范式旨在弥合视觉和文本模态之间的语义鸿沟,实现对异构数据的统一理解。最近,它已被广泛应用于视觉定位 [10,12–15,27,28,31,61]、视觉问答 [3,25,51]、图像描述 [18,38,39,54]、视频时间定位 [2,8,16,17,29,32,34–36,52,56] 等领域。在 STVG 中,当前的主流框架 [19,20,53] 严重依赖 MDETR [27] 流水线进行跨模态融合。尽管这些方法取得了成功,但它们通常因强制优化
第 5 页
ScanFocus:一种用于时空视频定位(STVG)的由粗到细框架 5
空间对齐编码器以同时建模时间动态和运动线索。这种范式未能显式解耦空间定位和时间定位所需的异构特征空间,导致由于过载的多模态编码器表示能力受损而出现次优性能。相比之下,我们的方法消除了对这种复杂编码器-解码器架构的依赖。通过利用视觉-语言融合编码器 [5, 48] 建立鲁棒的视觉-语言对齐,我们将复杂的三模态交互重构为简化的跨模态融合任务。
2.3 视频时间定位
视频时间定位(VTG)[2] 的目标是在未修剪视频的语言描述与其对应的时间片段之间建立细粒度的对齐。VTG 已通过其两个子任务:时刻检索(MR)和亮点检测(HD)得到了广泛研究。早期方法 [17, 52, 56] 主要依赖于基于提议的范式,即首先通过滑动窗口或锚机制生成候选片段,然后进行跨模态排序。虽然有效,但这些方法往往存在高冗余问题,并且由于依赖预定义的启发式规则,难以处理粗糙的时间边界。相比之下,最近的进展主要转向了基于端到端 DETR 的框架 [6,7,11, 24,29,32,35–37,46,57]。通过利用可学习查询直接回归时间边界,这些方法消除了对人工设计提议的需求,并促进了全局跨模态推理。后续研究,如 R2-Tuning [34] 和 FlashVTG [8],通过引入多尺度时间建模来捕捉不同持续长度的事件,进一步改进了这一范式。然而,时空视频定位(STVG)[59] 提出了比 VTG 更具挑战性的任务,因为它将定位任务从单一的时间轴扩展到了联合时空流形,要求对物体外观和运动演化进行协同理解。
3 方法
在本节中,我们首先在 3.1 节中 formulate 时空视频定位任务,并回顾基于 MDETR 的流行框架。在 3.2 节中,我们概述了我们的框架。然后,我们在 3.3 节详细介绍全局时空扫描,在 3.4 节介绍局部边界聚焦。在 3.5 节中,我们描述训练目标和优化策略。
3.1 预备知识
问题定义。给定视频序列 $V \in \mathbb{R}^{T \times H \times W \times 3}$ 和自然语言查询 $D$,时空视频定位(STVG)的目标是精确输出一个时空管(具有时间边界的边界框序列),以在 $V$ 中定位 $D$。
第 6 页
6 K. Chen 等人
粗略阶段:全局时空扫描 精炼阶段:局部边界聚焦
文本输入: 𝐷 𝑄𝑟𝑠 𝑡𝑟𝑠 有一只猫 0.8 正在拉动玩具, … 在毯子上。 𝐷 𝐹𝑎′ 𝐹𝑟𝑠 𝐹𝑟𝑠′ 𝑃𝑠𝑡 …0.4 [𝑡𝑐𝑠, 0.1 解码器Temporal 𝑡𝑐𝑒] 边界 𝑉𝑟𝑠 时间 精炼 0 [𝑡𝑐𝑠, … 密集 多模态 𝑡𝑐𝑒] 𝐹𝑟𝑒 𝐹𝑟𝑒′ 0.1 2 解码器 𝑃𝑒𝑑 𝐹𝑐′ 𝐹𝑡′ 多模态 采样 融合 语义引导 … 聚合器 𝑉𝑟𝑒 0.8 稀疏 4 融合 𝐵𝑐 密集时空/边缘编码 𝑄𝑟𝑒 …0.4 𝑡𝑟𝑒 𝐹𝑚′ 𝑉𝑐 𝑉𝑟𝑠 𝑉𝑟𝑒 密集边界采样帧 … 解码器Spatial 126 … … … 0 1 2 𝑡𝑐𝑠−1 𝑡𝑐𝑠 𝑡𝑐𝑠+ 1 𝑡𝑐𝑠+ 2 𝑡𝑐𝑒−2 𝑡𝑐𝑒−1 𝑡𝑐𝑒 𝑡𝑐𝑒+ 1 𝑇−2 𝑇−1 𝑇
𝐶𝑜𝑎𝑟𝑠𝑒𝐼𝑛𝑡𝑒𝑟𝑣𝑎𝑙: 𝑡𝑐𝑠, 𝑡𝑐𝑒
均匀采样 密集边界采样
0 1 2 21 22 23 24 95 96 97 98 125 126 127 … … … 𝑉
图 3:我们提出的 ScanFocus 的整体架构概览。该框架遵循由粗到细的范式,将任务解耦为两个阶段:1) 全局时空扫描:我们首先利用统一的多模态融合编码器结合轻量级的语义-运动融合编码器,以高效地对齐多模态特征。随后采用双 DETR 风格解码器生成粗略的空间管状区域和时间区间。2) 局部边界聚焦:为了恢复在粗略阶段被抑制的高频线索,我们在预测的粗略边界周围进行密集采样。语义引导的时间聚合器显式地建模这些局部窗口内的短期依赖关系,最终将其输入双精炼解码器以预测精确的起始和结束时间戳。
如图 4(a) 所示,现有的 STVG 框架 [19, 20, 26, 53] 通常基于 MDETR [27] 架构构建。它们首先使用独立的 MDETR 预训练骨干网络提取静态外观 ($F_a$)、语言 ($F_t$) 和时间运动 ($F_m$) 特征。随后,应用一个沉重的 MDETR 预训练标准 Transformer 编码器,将这些异构表示投影并耦合到共享的潜在空间中: \h at { F}_ a , \hat {F}_m, \hat {F}_ t = \text{Encoder}(\text{Concat}(\text{Proj}(F_a,F_m,F_t))), (1)
其中 Proj(·) 表示用于通道对齐的线性投影。 最后,采用特定任务的解码器来预测时空位置。MDETR 预训练的空间定位器回归边界框序列 $B$,而辅助时间解码器同时预测时间边界 $(s, e)$。
3.2 概览
为了解决上述局限性,我们提出了 ScanFocus。图 3 展示了整体架构。与以往依赖
第 7 页
ScanFocus:一种用于时空视频定位(STVG)的由粗到细框架 7
标准 Transformer 编码器 语义-运动融合编码器 MDETR 预训练
𝐹𝑚 𝐹𝑎 𝐹𝑡 𝐹𝑚 𝐹𝑠= 𝐹𝑎, 𝐹𝑡, 𝐹𝑐 通用预训练 … … 随机初始化 时间编码器 视觉编码器 语言编码器 时间编码器 视觉语言编码器
(a) 现有方法 (b) ScanFocus( ours)
图 4:多模态融合机制的对比。(a) 现有方法同时融合视觉、语言和运动特征。这种完全耦合的三模态对齐本质上极具挑战性,且在有限的下游数据集上会产生次优的表示。(b) 我们采用解耦策略,利用通用视觉-语言编码器从大规模上游数据集中提取预对齐的视觉和语言特征,随后通过轻量级的语义-运动融合编码器进一步将这些鲁棒的语义表示与运动动态进行对齐。
尽管存在大量的静态预训练,ScanFocus 仍采用由粗到细的理念。该流程首先使用由视频-语言预训练初始化的统一视觉-语言融合编码器来提取对齐的特征,随后使用轻量级的可变形语义-运动编码器来高效地融合语义和运动信息。编码后的特征随后在两个级联阶段中处理:1)全局时空扫描阶段(第 3.3 节),该阶段利用双解码器从稀疏的全局查询中生成粗略的空间管状区域和时间区间;2)局部边界聚焦阶段(第 3.4 节),该阶段执行密集的边界采样,并采用语义引导的时间聚合器(SGTA)来捕捉细粒度的帧间依赖关系,以实现精确的边界细化。
3.3 粗:全局时空扫描
特征提取。如图 3 所示,鉴于相邻视频帧中存在冗余以及高效全局建模的需求,我们首先对输入视频执行稀疏采样策略。具体而言,我们以较低的采样率 $f_c$ 从原始视频序列中均匀采样 $T_c$ 帧,以构建粗粒度输入,记为 $\mathbf{V}_c \in \mathbb{R}^{T_c \times H \times W \times 3}$。 随后,为了绕过特定任务预训练的优化瓶颈(图 4(a)),我们利用通用预训练的基础模型进行特征提取,如图 4(b) 所示,我们采用统一的视觉-语言融合编码器(VLF)从这些采样帧中提取外观和语言特征。与采用单独的单模态编码器提取独立的外观和语言特征,随后通过跨模态融合模块的传统视觉-语言范式不同,我们的 VLF 是内在统一的。它在大规模图像-文本对上进行预训练,在编码阶段隐式地将视觉和文本表示对齐到共享的语义空间中,消除了晚期融合架构中常见的域差异。具体而言,我们使用 BEiT-3 [48] 提取外观、语言和 [CLS] 特征,分别记为 $\mathbf{F}_a \in \mathbb{R}^{T_c \times N_a \times C_a}$、$\mathbf{F}_l \in \mathbb{R}^{T_c \times L \times C_a}$ 和 $\mathbf{F}_c \in \mathbb{R}^{T_c \times 1 \times C_a}$,其中 $N_a$ 和 $L$ 表示 token 数量,$C_a$ 表示特征维度。
第 8 页
8 K. Chen 等
对于运动特征提取,遵循先前方法 [19,20],我们引入一个视频编码器以显式提取运动特征。具体而言,我们采用冻结的预训练 VideoMAE [43] 来生成运动表示 $F_m \in \mathbb{R}^{T \times N_m \times C_m}$,其中 $N_m$ 和 $C_m$ 分别为运动 token 数量和通道维度。
语义-运动融合。先前的 STVG 方法 [19,20,26,53] 通常依赖厚重的、全耦合的 Transformer 编码器进行多模态交互。相比之下,利用我们 VLF 编码器固有的跨模态对齐能力,我们提出了一种轻量级的可变形语义-运动融合模块,将该交互重新表述为多尺度可变形注意力任务。具体而言,我们将所有特征投影到共享维度 $C$ 中,形成多级特征金字塔 $X = \{F_a, F_m, F_t, F_c\}$,并将连接后的查询序列定义为 $Z \in \mathbb{R}^{N_{total} \times C}$。对于每个查询 token $z_q \in Z$,其融合表示通过从 $X$ 中稀疏采样计算得出:
s ( \text {F u i z = \ s um _{l =1 }^ { 4} \sum_{k=1}^{K}A_{lqk}\cdot\mathbf\cdot\Phi(\mathcal{X}^l;p_q\Deltap_{lqk}), (2)
on} _q)
其中 $p_q$、$\Delta p_{lqk}$ 和 $A_{lqk}$ 分别表示参考点、可学习偏移量和注意力权重。该机制使语言 token 能够以线性复杂度稀疏地关注显著的运动或外观区域。最后,经过 $L_{enc}$ 层堆叠融合后,统一序列被解纠缠为丰富的模态流:
{ { {F _a} ^' } ,F _ {m}^{ '}, F_{t}^{'}, F_ {c} ^{'}} \text{Split}\left(\Phi_{\text{D}}\left(\text{Concat}(F_a,F_m,F_t,F_c)\right)\right(3)
其中 $\Phi_D$ 表示堆叠的可变形编码器层。$\text{Split}(\cdot)$ 根据其原始 token 长度恢复各个模态流。
全局时空解码器。遵循既定实践 [19, 20],我们采用独立的时空解码器。为了加速收敛并提高定位精度,我们提出了一种语义注入策略,在解码前将语言和全局上下文显式注入到查询中。具体而言,我们为空间和 temporal 分支初始化可学习查询 $Q_s, Q_t \in \mathbb{R}^{T_c \times C}$。然后,我们通过标准的交叉注意力层,依次从文本特征 $F_{t'}$ 和全局上下文 token $F_{c'}$ 向这些查询注入语义信息,生成语义条件查询 $Q_{is}$ 和 $Q_{it}$。这种初始化确保了查询在与视觉 $(F_a)'$ 和运动 $(F_m)'$ 特征交互之前即具备目标感知能力。利用这些条件查询,解码器通过 $K$ 层堆叠层进行迭代推理。最后,特定任务的预测头生成粗略输出:一个 3 层 MLP 预测边界框序列 $B_c \in \mathbb{R}^{T_c \times 4}$,而 temporal 头输出逐帧的起始/结束概率以形成粗略的时间区间 $\tau_c = (t_{cs}, t_{ce})$。
第 9 页
ScanFocus:一种用于时空视频定位(STVG)的由粗到细框架 9
3.4 细化:局部边界聚焦
密集边界采样。为了恢复被稀疏全局扫描所抑制的细粒度运动细节,我们引入了一种基于边界的密集采样策略。给定预测的粗略区间 $\tau_c$,我们在 $t_{cs}$ 和 $t_{ce}$ 处构建两个局部观察窗口。与全局阶段不同,我们以高采样率 $f_r = k_r \cdot f_c$(其中 $k_r > 1$ 为密度因子)在每个窗口内采样 $N_w$ 帧,以确保密集的时间覆盖。这产生了两个密集帧序列:$V_{rs}$ 和 $V_{re}$,其形状均为 $R^{N_w \times H \times W \times 3}$。
为了保持语义一致性并最大化参数效率,我们战略性地复用了粗略阶段的特征提取和融合模块(第 3.3 节)。具体而言,$V_{rs}$ 和 $V_{re}$ 分别由共享的视觉-语言融合编码器、视频编码器(Video Encoder)以及语义-运动融合模块独立处理。这产生了细化后的多模态特征序列 $F_{rs}$、$F_{re}$,编码了丰富的边界细节以进行精确描绘。
语义引导的时间聚合器(SGTA)。虽然共享编码器有效地提取了逐帧表示,但精确的边界界定本质上需要捕捉细粒度的时间演化,这依赖于显式的帧间推理。为了弥补这一差距,我们引入了 SGTA。鉴于局部窗口的时间足迹较小($N_w$),SGTA 执行高效、密集的时间建模,以捕捉在粗略阶段被忽略的高频运动线索。如图 5 所示,以起始分支为例,SGTA 首先为局部窗口生成密集的空间先验。给定粗略边界框序列 $B_c$ 和预测的起始时间戳 $t_{cs}$,我们检索对应于细化窗口时间跨度的粗略框子集。由于该窗口包含以高率 $f_r$ 采样的 $N_w$ 帧,我们对该稀疏子集进行时间线性插值,将其上采样至目标长度 $N_w$。这有效地生成了密集空间先验 $B_{st} \in R^{N_w \times 4}$,而无需依赖沉重的外部目标检测器。利用从共享编码器获得的细化特征序列 $F_{rs}$,我们隔离其不同的模态流:外观($F_{rs}^a$)、运动($F_{rs}^m$)和文本($F_{rs}^t$)。为了严格地将视觉表示与跟踪对象对齐,我们利用空间先验 $B_{st}$ 引导的外观特征上的 RoI 池化(RoI Pooling)。这产生了仅关注目标区域的对象对齐外观序列 $F_{ps}^a$: $$ F_{ps}^a = \text{ROIPool}(F_{rs}^a, \mathbf{B}_{st}). \quad (4) $$ 随后,为了显式地将时间动态与目标对象及语言查询对齐,我们利用这些语义特征来引导运动表示。为了过滤掉无关的背景动态,运动特征
第 10 页
10 K. Chen 等人
$F_{rs}^m$ 由与对象对齐的外观特征 $F_{ps,a}$ 进行调制,有效地突出了与视觉指代表征相关的运动模式。此外,文本特征 $F_{rs}^t$ 作为语言偏差被注入。最终的语义引导运动特征 $F_{sg}$ 公式化为:
$$ F_{sg} = \left( \phi_a(F_{ps}^a) \odot F_{rs}^m \right) \oplus \phi_t(F_{rs}^t), \quad (5) $$
其中 $\odot$ 和 $\oplus$ 分别表示哈达玛积(Hadamard product)和逐元素加法。$\phi_a$ 和 $\phi_t$ 表示可学习的线性投影。最后,为了捕捉高频线索并建模显式的帧间依赖关系,我们将 $F_{sg}$ 展平为长度为 $N_w \times N_m$ 的统一序列(其中 $N_m$ 表示运动标记的数量),并通过 $L_t$ 层时间自注意力层堆栈进行处理:
$$ F_{rs}' = \text{MHSA}_{\times L_t}(\text{Flatten}(F_{sg})). \quad (6) $$
这种展平结构确保局部窗口内的所有标记相互可见,从而能够在边界区域实现细粒度的全局推理。生成的 $F_{rs}'$ 有效地聚合了密集的边界细节,作为后续预测头的输入。
细化解码器(Refine Decoder)。与粗粒度阶段类似,采用 DETR 风格的解码器 $\text{Dec}_{rs}$ 来探测聚合特征 $F_{rs}'$。解码后的嵌入随后通过特定任务的预测头直接投影,以生成逐帧边界概率 $P_{st}$ 和辅助动作置信度 $A_{st}$。结束分支遵循相同的流程以获得 $P_{ed}$ 和 $A_{ed}$。
3.5 优化
为了确保优化稳定性并防止细粒度梯度扰动已充分学习的全局先验,我们采用解耦的两阶段训练范式。对于粗粒度阶段,我们首先使用 $\mathcal{L}_c$ 训练全局模块(骨干网络、融合编码器和粗粒度解码器)。给定真实边界框序列 $B^*$,空间解码器由 L1 和 GIoU 损失监督,而时间解码器使用 KL 散度来对齐预测分布 $\hat{P}_{s/e}$ 与高斯平滑的边界标签 $t^*_{s/e}$:
$$ \mathcal{L}_c = \lambda_{box} (\mathcal{L}_{L1}(\mathbf{B}_c, \mathbf{B}^*) + \mathcal{L}_{IoU}(\mathbf{B}_c, \mathbf{B}^*) + \mathcal{L}_{KL}(\hat{P}_s, t_s^*) + \mathcal{L}_{KL}(\hat{P}_e, t_e^*)). \quad (7) $$
对于细化阶段,我们冻结粗粒度阶段的参数,并仅优化细化模块(SGTA 和细化解码器)。我们将边界定位和动作检测公式化为二分类任务,通过二元交叉熵(BCE)损失进行优化:
$$ \mathcal{L}_r = \lambda_{ref} (\mathcal{L}_{BCE}(\mathbf{P}_{st/ed}, \mathbf{y}_{st/ed}^*) + \mathcal{L}_{BCE}(\mathbf{A}_{st/ed}, \mathbf{y}_{act}^*)), \quad (8) $$
其中 $P_{st/ed}$ 和 $A_{st/ed}$ 是预测的边界和动作概率,$\mathbf{y}^*$ 是对应的二元真实标签。超参数 $\lambda$ 平衡了各自的损失项。
第 11 页
ScanFocus:一种用于时空视频定位的由粗到细框架 11
4 实验
4.1 实验设置
数据集。时空视频定位中常用的数据集包括 HC-STVGv1/v2 和 VidSTG。HC-STVGv1 包含 5,660 个未修剪的视频片段,划分为 4,500 个训练和 1,160 个测试视频-文本对。HC-STVGv2 在此基础上显著扩展了规模,总共包含 16,544 个样本,细分为 10,131 个训练样本、2,000 个验证样本和 4,413 个测试样本。由于测试集缺乏真实标注,我们遵循先前工作,在验证集上报告结果。VidSTG 提供了更庞大的评估语料库,包含源自 5,436 个源视频的 99,943 个视频-文本对。该数据集的特点是语言多样性高,包含 44,808 个陈述句和 55,135 个疑问查询。数据被组织为训练、验证和测试子集,分别包含 80,684、8,956 和 10,303 个句子,这些句子映射到 5,436、602 和 732 个唯一的视频序列上。
指标。遵循先前工作,我们采用 m_tIoU、m_vIoU 和 vIoU@R 作为评估指标。m_tIoU 通过计算整个测试集上平均时间交并比(tIoU)分数来衡量时间定位能力。m_vIoU 通过计算预测和标注的时空管在空间和时间的平均交并比来评估空间定位质量,而 vIoU@R 则使用测试集中 vIoU 大于 R 的样本比例来衡量性能。有关详细指标,请参阅 [53]。
实现细节。我们的模型采用 BEiT-3 [48] 进行视觉-语言建模,并采用 VideoMAE [43] 进行运动表示。输入被调整为 384×384。我们采样 64 个粗帧和 8 个细帧(kr =2)。详细的网络配置和损失权重见补充材料。
4.2 定量结果
HC-STVGv1/v2 上的结果。为了验证我们方法的有效性,我们在 HC-STVGv1 和 v2 数据集上与最先进的方法进行了比较。表 1 和表 2 展示了在各自测试集上的比较结果。如表 1 所示,ScanFocus 在 HC-STVGv1 的所有指标上均显著优于现有方法。值得注意的是,在严格定位指标 vIoU@0.3 和 vIoU@0.5 上,我们的方法分别达到了 67.5% 和 42.2%,分别比之前的最佳方法 TA-STVG [20] 高出 4.4% 和 5.4%。同样,在 HC-STVGv2 数据集(表 2)上,ScanFocus 建立了新的最先进性能,tiou 提高了 2.0%,vIoU@0.5 提高了 2.6%,均优于 TA-STVG。这些一致的改进证明了我们由粗到细范式在恢复高频边界线索以实现精确时间界定方面的优越性。
第 12 页
12 K. Chen 等
表 1:HC-STVGv1 上的对比结果。 表 2:HC-STVGv2 上的对比结果。 最佳结果以粗体显示。 最佳结果以粗体显示。
方法 m_tIoU m_vIoU vIoU@0.3 vIoU@0.5 方法 m_tIoU m_vIoU vIoU@0.3 vIoU@0.5
STVGBert [40] – 20.4 29.4 11.3 PCC [55] – 30.0 – – TubeDETR [53] 43.7 32.4 49.8 23.5 2D-Tan [41] – 30.4 50.4 18.8 STCAT [26] 49.4 35.1 57.7 30.1 MMN [49] – 30.3 49.0 25.6 SGFDN [47] 46.9 35.8 56.3 37.1 TubeDETR [53] 53.9 36.4 58.8 30.6 STVGFormer [33] – 36.9 62.2 34.8 STVGFormer [33] 58.1 38.7 65.5 33.8 VG-DINO [50] – 38.3 62.5 36.1 VG-DINO [50] – 39.9 67.1 34.5 CG-STVG [19] 52.8 38.4 61.5 36.3 CG-STVG [19] 60.0 39.5 64.5 36.3 TA-STVG [20] 53.0 39.1 63.1 36.8 TA-STVG [20] 60.4 40.2 65.8 36.7 ScanFocus (Ours) 55.5 41.8 67.5 42.2 ScanFocus (Ours) 62.4 41.7 68.4 39.3
表 3:VidSTG 上的对比结果。最佳结果以粗体显示。
陈述句 疑问句 方法 m_tIoU m_vIoU vIoU@0.3 vIoU@0.5 m_tIoU m_vIoU vIoU@0.3 vIoU@0.5
STGRN [59] 48.5 19.8 25.8 14.6 47.0 18.3 21.1 12.8 OMRN [58] 50.7 23.1 32.6 16.4 49.2 20.6 28.4 14.1 STGVT [42] – 21.6 29.8 18.9 – – – – STVGBert [40] – 24.0 30.9 18.4 – 22.5 26.0 16.0 TubeDETR [53] 48.1 30.4 42.5 28.2 46.9 25.7 35.7 23.2 SGFDN [47] 45.1 28.3 41.7 29.1 44.8 25.8 36.9 23.9 STVGFormer [33] – 33.7 47.2 32.8 – 28.5 39.9 26.2 STCAT [26] 50.8 33.1 46.2 32.6 49.7 28.2 39.2 26.6 CG-STVG [19] 51.4 34.0 47.7 33.1 49.9 29.0 40.5 27.5 TA-STVG [20] 51.7 34.4 48.2 33.5 50.2 29.5 41.5 28.0 SpaceVLLM-7B [45] 47.7 27.4 39.1 26.2 48.5 25.4 35.9 22.2 ASTG [60] 45.6 29.2 40.3 27.8 – – – – ScanFocus (Ours) 53.3 36.5 50.6 36.0 51.4 30.7 42.5 29.4
VidSTG 上的结果。为了进一步评估 ScanFocus 的泛化能力,我们在 VidSTG 数据集上进行了实验,该数据集因其多样的语言表达(即陈述句和疑问句)以及复杂的时间变化而具有显著挑战性。如表 3 所示,ScanFocus 在两种句子类型上均持续优于现有的最先进方法。
4.3 消融实验
在本节中,我们进行消融实验以研究 ScanFocus 中关键组件的影响。除非另有说明,所有实验均在 HC-STVGv1 数据集上进行,输入分辨率为 224 × 224。为简洁起见,tiou 和 viou 分别用于表示 m_tIoU 和 m_vIoU。
组件级有效性。如表 4 所示,基线全局扫描模型实现了 50.9% 的 tIoU。仅引入带有细化解码器的密集采样(DS)策略,通过恢复高频时间线索,将 tIoU 提升至 52.4%;然而,vIoU@0.5 的轻微下降表明
第 13 页
ScanFocus:一种用于时空视频定位(STVG)的由粗到细框架 13
表 4:组件级有效性分析。在 HC-STVGv1 上评估。DS 表示使用多模态融合及起止解码器的细化阶段。
| Method | tIoU | vIoU | vIoU@0.3 | vIoU@0.5 | | :— | :— | :— | :— | :— | | Coarse | 50.9 | 38.2 | 60.7 | 38.0 | | + DS | 52.4 | 39.1 | 62.6 | 37.9 | | + SGTA | 53.7 | 40.0 | 64.0 | 39.5 |
表 5:细化窗口大小 $N_w$ 对 ScanFocus 性能的影响。
| $N_w$ | tIoU | vIoU | GFLOPs | | :— | :— | :— | :— | | 4 | 52.7 | 39.2 | 10.7 | | 6 | 53.2 | 39.6 | 16.1 | | 8 | 53.7 | 40.0 | 21.5 | | 10 | 53.6 | 39.9 | 26.9 | | 12 | 53.5 | 39.8 | 32.2 |
原始密集帧可能会引入冗余,而缺乏显式建模。最后,引入所提出的语义引导的时间聚合器(SGTA)模块在所有指标上均取得了最佳性能,证明了其通过语义引导推理有效聚合密集边界信息的能力。
细化窗口大小 $N_w$ 的影响。我们评估了细化窗口大小 $N_w \in \{4, 6, 8, 10, 12\}$ 的影响,以找到边界回归的最佳时间感受野。鉴于高采样率 $f_r$,该窗口大小 $N_w$ 决定了局部细节与时间跨度之间的平衡。如表 5 所示,tIoU 和 vIoU 最初增加,并在 $N_w = 8$ 时达到峰值。这一趋势表明,适度的窗口对于捕捉足够的时间上下文以消除动作与背景之间过渡的歧义至关重要。然而,当 $N_w$ 超过 8 时,性能开始下降。这种下降可能是由于过长的窗口引入了冗余背景帧和不相关的运动噪声,从而稀释了 SGTA 模块内的边界特定语义特征。在效率方面,GFLOPs 随 $N_w$ 线性增加,证实了我们的解耦设计保持了稳定的计算可扩展性。鉴于 $N_w = 8$ 在定位精度和资源消耗之间实现了最佳权衡,我们将其作为默认配置。
SGTA 设计的组件。为了进一步探究语义引导的时间聚合器(SGTA)的内部机制,我们对其关键组件:语义引导(Semantic Guide)和时间注意力(Temporal Attention)机制进行了详尽的消融研究。结果总结在表 6 中。观察发现,移除时间注意力组件会导致明显的性能下降,tIoU 从 53.7% 降至 52.8%。这一下降凸显了显式帧间依赖建模对于捕捉视频序列中长程时间动态的必要性。此外,缺乏语义引导导致所有指标均下降,证实了语义线索在过滤背景噪声并将模型注意力集中在任务相关的时间边界方面起着关键作用。完整的 SGTA 配置实现了
第 14 页
14 K. Chen 等
表 6:SGTA 设计的消融实验。 表 7:融合机制的消融实验。 在 HC-STVGv1 数据集上评估。 Deformable Semantic-Motion Fu- TA 和 SG 分别表示 Temporal Attention sion 以显著更低的复杂度实现了更优的性能。 和 Semantic Guide。
配置 tIoU vIoU vIoU@0.3 vIoU@0.5 机制 tIoU vIoU vIoU@0.5 GFLOPs Full SGTA 53.7 40.0 64.0 39.5 Standard SA 53.3 39.8 36.5 516 w/o TA. 52.8 39.3 63.1 38.7 Deform. SA 53.7 40.0 39.5 260 w/o SG. 53.1 39.5 63.4 39.0
最佳性能,验证了语义定位与时序关系建模之间的协同作用对于精确边界定位至关重要。
可变形语义-运动融合的有效性。如表 7 所示,我们的 Deformable Semantic-Motion Fusion 在将计算开销降低 50% 的同时,显著优于标准基线。值得注意的是,我们的方法在严格的 vIoU@0.5 指标上取得了显著增益。这表明,通过自适应地关注稀疏采样点而非密集的全局依赖关系,我们的方法有效地缓解了时空噪声,并为 STVG 任务提供了更优越的定位精度。
4.4 定性结果
为了直观地展示我们由粗到细框架的有效性,我们在图 6 中展示了定性的定位结果。如图所示,初始的粗阶段通常会产生模糊的时间边界。在局部边界聚焦内的显式帧间推理的引导下,我们的细化阶段通过扩展或修剪时间窗口,成功纠正了这些初始预测,实现了与 Ground Truth 更精确的对齐。更多可视化示例请参阅补充材料。
5 结论
我们提出了 ScanFocus,这是一种新颖的由粗到细框架,通过将任务分解为全局时空扫描和局部边界聚焦来解决 STVG 中的时间模糊问题。为了捕捉被抑制的高频线索并建模显式的帧间依赖关系,我们引入了 SGTA,用于具有密集边界采样的细粒度时序建模。在三个基准上的大量实验表明,我们的方法显著优于现有的 SOTA 方法,为 STVG 建立了一个非常有效的范式。
致谢
本研究得到了国家自然科学基金(批准号:62276061 和 62436002)的支持。本研究还得到了研究
第 15 页
ScanFocus:一种用于时空视频定位(STVG)的由粗到细框架 15
文本:戴帽子的男子举起手,转身走向门口。
视频 …
真实标签 (GT) 粗略阶段 细化阶段
文本:穿红色西装的男子合上鞭子,将穿白衬衫的男子推开。
视频 …
真实标签 (GT) 粗略阶段 细化阶段
图 6:ScanFocus 的定性结果。粗略阶段通常会产生模糊的边界。我们的细化阶段成功修正了这些初始提议,使其与真实标签(Ground Truth)精确对齐。
东南大学前沿海洋研究院基金(重大项目 MP202404)。
参考文献
1. Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F.L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al.: Gpt-4 technical report. arXiv preprint arXiv:2303.08774 (2023) 2. Anne Hendricks, L., Wang, O., Shechtman, E., Sivic, J., Darrell, T., Russell, B.: Lo- calizing moments in video with natural language. In: ICCV. pp. 5803–5812 (2017) 3. Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C.L., Parikh, D.: Vqa: Visual question answering. In: ICCV. pp. 2425–2433 (2015) 4. Bai, S., Cai, Y., Chen, R., Chen, K., Chen, X., Cheng, Z., Deng, L., Ding, W., Gao, C., Ge, C., et al.: Qwen3-vl technical report. arXiv preprint arXiv:2511.21631 (2025) 5. Bao, H., Dong, L., Piao, S., Wei, F.: Beit: Bert pre-training of image transformers. arXiv preprint arXiv:2106.08254 (2021) 6. Barrios, W., Soldan, M., Ceballos-Arroyo, A.M., Heilbron, F.C., Ghanem, B.: Lo- calizing moments in long video via multimodal guidance. In: ICCV. pp. 13667– 13678 (2023) 7. Cao, M., Yang, T., Weng, J., Zhang, C., Wang, J., Zou, Y.: Locvtp: Video-text pre-training for temporal localization. In: ECCV. pp. 38–56. Springer (2022) 8. Cao, Z., Zhang, B., Du, H., Yu, X., Li, X., Wang, S.: Flashvtg: Feature layering and adaptive score handling network for video temporal grounding. In: WACV. pp. 9226–9236. IEEE (2025) 9. Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End- to-end object detection with transformers. In: ECCV. pp. 213–229. Springer (2020) 10. Chen, W., Chen, L., Wu, Y.: An efficient and effective transformer decoder-based framework for multi-task visual grounding. In: ECCV. pp. 125–141. Springer (2024)
第 16 页
16 K. Chen 等人
11. Chen, Y.W., Tsai, Y.H., Yang, M.H.: 端到端多模态视频时间定位。NeurIPS 34, 28442–28453 (2021) 12. Dai, M., Chen, K., Cheng, W., Zhuang, J., Feng, Z., Zhu, P., Yang, W.: Gc3vg: 具有由粗到细一致性约束的广义多任务视觉定位。TCSVT (2025) 13. Dai, M., Cheng, W., Liu, J.J., Yang, L., Feng, Z., Yang, W., Wang, J.: 通过实例感知联合学习改进广义视觉定位。TPAMI (2025) 14. Dai, M., Cheng, W., Liu, J.j., Yang, S., Cai, W., Sun, Y., Yang, W.: Deris: 通过循环反馈协同解耦感知与认知以增强指代图像分割。In: ICCV. pp. 19936–19946 (2025) 15. Dai, M., Yang, L., Xu, Y., Feng, Z., Yang, W.: Simvg: 一种具有解耦多模态融合的简单视觉定位框架。NeurIPS 37, 121670–121698 (2024) 16. Dai, M., Yang, S., Duan, B., Yang, W., Wang, J.: Momentseg: 以时刻为中心的采样以增强视频像素理解。arXiv 预印本 arXiv:2510.09274 (2025) 17. Gao, J., Sun, C., Yang, Z., Nevatia, R.: Tall: 通过语言查询进行时间活动定位。In: ICCV. pp. 5267–5275 (2017) 18. Gu, X., Chen, G., Wang, Y., Zhang, L., Luo, T., Wen, L.: 结合知识图谱增强的 Transformer 用于视频描述。In: CVPR. pp. 18941–18951 (2023) 19. Gu, X., Fan, H., Huang, Y., Luo, T., Zhang, L.: 上下文引导的时空视频定位。In: CVPR. pp. 18330–18339 (2024) 20. Gu, X., Shen, Y., Luo, C., Luo, T., Huang, Y., Lin, Y., Fan, H., Zhang, L.: 了解你的目标:目标感知 Transformer 实现更好的时空视频定位。arXiv 预印本 arXiv:2502.11168 (2025) 21. Gu, X., Zhang, H., Fan, Q., Niu, J., Zhang, Z., Zhang, L., Chen, G., Chen, F., Wen, L., Zhu, S.: 利用边界框进行思考:通过强化微调增强时空视频定位。arXiv 预印本 arXiv:2511.21375 (2025) 22. Guo, D., Yang, D., Zhang, H., Song, J., Wang, P., Zhu, Q., Xu, R., Zhang, R., Ma, S., Bi, X., 等: Deepseek-r1: 通过强化学习激励大语言模型的推理能力。arXiv 预印本 arXiv:2501.12948 (2025) 23. Guo, D., Wu, F., Zhu, F., Leng, F., Shi, G., Chen, H., Fan, H., Wang, J., Jiang, J., Wang, J., 等: Seed1.5-vl 技术报告。arXiv 预印本 arXiv:2505.07062 (2025) 24. Hao, J., Sun, H., Ren, P., Wang, J., Qi, Q., Liao, J.: 视频洗牌能否缓解时间偏差问题:一种用于时间定位的新型训练框架。In: ECCV. pp. 130–147. Springer (2022) 25. Jiang, H., Misra, I., Rohrbach, M., Learned-Miller, E., Chen, X.: 捍卫视觉问答中的网格特征。In: CVPR. pp. 10267–10276 (2020) 26. Jin, Y., Yuan, Z., Mu, Y., 等: 拥抱一致性:一种用于时空视频定位的单阶段方法。NeurIPS 35, 29192–29204 (2022) 27. Kamath, A., Singh, M., LeCun, Y., Synnaeve, G., Misra, I., Carion, N.: Mdetr: 用于端到端多模态理解的调制检测。In: ICCV. pp. 1780–1790 (2021) 28. Kang, W., Liu, G., Shah, M., Yan, Y.: Segvg: 将对象边界框转移至分割以进行视觉定位。In: ECCV. pp. 57–75. Springer (2024) 29. Lei, J., Berg, T.L., Bansal, M.: 通过自然语言查询检测视频中的时刻和高光。NeurIPS 34, 11846–11858 (2021)
第 17 页
ScanFocus:一种用于时空视频定位的由粗到细框架 17
30. Li, H., Chen, J., Wei, Z., Huang, S., Hui, T., Gao, J., Wei, X., Liu, S.: Llava-st: A multimodal large language model for fine-grained spatial-temporal understanding. In: CVPR. pp. 8592–8603 (2025) 31. Li, Z., Li, Y., Li, Q., Wang, P., Guo, D., Lu, L., Jin, D., Zhang, Y., Hong, Q.: Lvit: language meets vision transformer in medical image segmentation. IEEE transactions on medical imaging 43(1), 96–107 (2023) 32. Lin, K.Q., Zhang, P., Chen, J., Pramanick, S., Gao, D., Wang, A.J., Yan, R., Shou, M.Z.: Univtg: Towards unified video-language temporal grounding. In: ICCV. pp. 2794–2804 (2023) 33. Lin, Z., Tan, C., Hu, J.F., Jin, Z., Ye, T., Zheng, W.S.: Collaborative static and dynamic vision-language streams for spatio-temporal video grounding. In: CVPR. pp. 23100–23109 (2023) 34. Liu, Y., He, J., Li, W., Kim, J., Wei, D., Pfister, H., Chen, C.W.: r 2-tuning: Efficient image-to-video transfer learning for video temporal grounding. In: ECCV. pp. 421–438. Springer (2024) 35. Moon, W., Hyun, S., Lee, S., Heo, J.P.: Correlation-guided query-dependency cal- ibration for video temporal grounding. arXiv preprint arXiv:2311.08835 (2023) 36. Moon, W., Hyun, S., Park, S., Park, D., Heo, J.P.: Query-dependent video repre- sentation for moment retrieval and highlight detection. In: CVPR. pp. 23023–23033 (2023) 37. Mun, J., Cho, M., Han, B.: Local-global video-text interactions for temporal grounding. In: CVPR. pp. 10810–10819 (2020) 38. Ren, Z., Huang, Z., Wei, Y., Zhao, Y., Fu, D., Feng, J., Jin, X.: Pixellm: Pixel reasoning with large multimodal model. In: CVPR. pp. 26374–26383 (2024) 39. Shen, Y., Gu, X., Xu, K., Fan, H., Wen, L., Zhang, L.: Accurate and fast compressed video captioning. In: ICCV. pp. 15558–15567 (2023) 40. Su, R., Yu, Q., Xu, D.: Stvgbert: A visual-linguistic transformer based framework for spatio-temporal video grounding. In: ICCV. pp. 1533–1542 (2021) 41. Tan, C., Lin, Z., Hu, J.F., Li, X., Zheng, W.S.: Augmented 2d-tan: A two- stage approach for human-centric spatio-temporal video grounding. arXiv preprint arXiv:2106.10634 (2021) 42. Tang, Z., Liao, Y., Liu, S., Li, G., Jin, X., Jiang, H., Yu, Q., Xu, D.: Human- centric spatio-temporal video grounding with visual transformers. TCSVT 32(12), 8238–8249 (2021) 43. Tong, Z., Song, Y., Wang, J., Wang, L.: Videomae: Masked autoencoders are data- efficient learners for self-supervised video pre-training. NeurIPS 35, 10078–10093 (2022) 44. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, Ł., Polosukhin, I.: Attention is all you need. NeurIPS 30 (2017) 45. Wang, J., Zhang, Z., Liu, Z., Li, Y., Ge, J., Xie, H., Zhang, Y.: Spacevllm: Endowing multimodal large language model with spatio-temporal video grounding capability. arXiv preprint arXiv:2503.13983 (2025) 46. Wang, L., Mittal, G., Sajeev, S., Yu, Y., Hall, M., Boddeti, V.N., Chen, M.: Protege: Untrimmed pretraining for video temporal grounding by video tempo- ral grounding. In: CVPR. pp. 6575–6585 (2023) 47. Wang, W., Liu, J., Su, Y., Nie, W.: Efficient spatio-temporal video grounding with semantic-guided feature decomposition. In: ACMMM. pp. 4867–4876 (2023) 48. Wang, W., Bao, H., Dong, L., Bjorck, J., Peng, Z., Liu, Q., Aggarwal, K., Mo- hammed, O.K., Singhal, S., Som, S., et al.: Image as a foreign language: Beit pre- training for vision and vision-language tasks. In: CVPR. pp. 19175–19186 (2023)
第 18 页
18 K. Chen 等人
49. Wang, Z., Wang, L., Wu, T., Li, T., Wu, G.: Negative sample matters: A renais- sance of metric learning for temporal grounding. In: AAAI. vol. 36, pp. 2613–2623 (2022) 50. Wasim, S.T., Naseer, M., Khan, S., Yang, M.H., Khan, F.S.: Videogrounding-dino: Towards open-vocabulary spatio-temporal video grounding. In: CVPR. pp. 18909– 18918 (2024) 51. Weng, Y., Han, M., He, H., Chang, X., Zhuang, B.: Longvlm: Efficient long video understanding via large language models. In: ECCV. pp. 453–470. Springer (2024) 52. Xu, H., He, K., Plummer, B.A., Sigal, L., Sclaroff, S., Saenko, K.: Multilevel lan- guage and vision integration for text-to-clip retrieval. In: AAAI. vol. 33, pp. 9062– 9069 (2019) 53. Yang, A., Miech, A., Sivic, J., Laptev, I., Schmid, C.: Tubedetr: Spatio-temporal video grounding with transformers. In: CVPR. pp. 16442–16453 (2022) 54. You, Q., Jin, H., Wang, Z., Fang, C., Luo, J.: Image captioning with semantic attention. In: CVPR. pp. 4651–4659 (2016) 55. Yu, Y., Wang, X., Hu, W., Luo, X., Li, C.: 2rd place solutions in the hc-stvg track of person in context challenge 2021. arXiv preprint arXiv:2106.07166 3(7) (2021) 56. Zhang, S., Peng, H., Fu, J., Luo, J.: Learning 2d temporal adjacent networks for moment localization with natural language. In: AAAI. vol. 34, pp. 12870–12877 (2020) 57. Zhang, Y., Chen, X., Jia, J., Liu, S., Ding, K.: Text-visual prompting for efficient 2d temporal video grounding. In: CVPR. pp. 14794–14804 (2023) 58. Zhang, Z., Zhao, Z., Lin, Z., Huai, B., Yuan, N.J.: Object-aware multi- branch relation networks for spatio-temporal video grounding. arXiv preprint arXiv:2008.06941 (2020) 59. Zhang, Z., Zhao, Z., Zhao, Y., Wang, Q., Liu, H., Gao, L.: Where does it exist: Spatio-temporal video grounding for multi-form sentences. In: CVPR. pp. 10668– 10677 (2020) 60. Zhao, H., Ong, Y.S., Zhou, J.T.: Agentic spatio-temporal grounding via collabo- rative reasoning. arXiv preprint arXiv:2602.13313 (2026) 61. Zhu, C., Zhou, Y., Shen, Y., Luo, G., Pan, X., Lin, M., Chen, C., Cao, L., Sun, X., Ji, R.: Seqtr: A simple yet universal network for visual grounding. In: ECCV. pp. 598–615. Springer (2022) 62. Zhu, J., Wang, W., Chen, Z., Liu, Z., Ye, S., Gu, L., Tian, H., Duan, Y., Su, W., Shao, J., et al.: Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models. arXiv preprint arXiv:2504.10479 (2025) 63. Zhu, X., Su, W., Lu, L., Li, B., Wang, X., Dai, J.: Deformable detr: Deformable transformers for end-to-end object detection. arXiv preprint arXiv:2010.04159 (2020)