ReflexTrack:用闭环反馈解决无训练视频分割的目标漂移问题

快速导读:ReflexTrack提出了一种无训练的指代视频对象分割(RVOS)智能体,通过Mask-guided Spatial Refinement和Video-level Mask Reflection实现空间提示迭代优化与时序预测修复,显著提升了分割鲁棒性。

指代视频对象分割(RVOS)旨在根据自然语言查询在视频中分割目标。传统方法依赖大量监督数据,而无训练方法通过组合多模态大语言模型(MLLMs)和分割基础模型(如SAM 3)实现零样本推理。然而,现有方法多采用开环设计,缺乏对预测结果的显式验证与修正机制。

ReflexTrack提出了一种反馈驱动的无训练RVOS智能体,通过Mask-guided Spatial Refinement和Video-level Mask Reflection构建闭环系统。该方法在推理期间保持所有组件冻结,通过迭代优化空间提示和修复时序预测,显著提升了在复杂场景下的分割鲁棒性。

英文题目:ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation

论文出处:arXiv 每日论文精选 · arXiv:2607.24098

原始论文:PDF / 论文页面

对应视频标题:ReflexTrack:用闭环反馈解决无训练视频分割的目标漂移问题|推荐指数:★★★★★

这篇论文解决什么问题?

现有无训练RVOS方法通常遵循‘推理-定位-分割’的开环流程。首先,MLLM根据查询生成初始空间提示(如边界框),然后SAM 3生成掩码并传播至后续帧。这种设计假设初始提示足够准确且时序传播稳定,但在实际场景中,遮挡、快速运动或形变常导致目标漂移或掩码丢失。

更关键的是,现有智能体系统主要在密集预测前进行语义推理,缺乏预测级的反馈机制。一旦初始提示错误或时序传播失效,系统无法自我纠正,导致最终分割质量大幅下降。这种‘一次性’推理模式限制了无训练方法在复杂视频场景中的应用。

此外,现有方法对MLLM的依赖也带来了新的挑战。虽然MLLM具备强大的语义理解能力,但其生成的空间提示可能存在细微偏差,且缺乏对分割质量的直接评估。如何将这些偏差转化为可操作的修正信号,是无训练RVOS面临的核心难题。

核心创新

  • 提出Mask-guided Spatial Refinement,利用下游分割质量直接反馈以迭代修正空间提示(bbox和points)。
  • 开发Video-level Mask Reflection,通过时序质量评估定位低质量区间,并基于全视频上下文选择关键帧进行选择性修复。
  • 实现完全无训练(Training-Free)的RVOS智能体,所有组件在推理期间保持冻结,无需任务特定微调或像素级标注。

方法概览

ReflexTrack构建闭环反馈机制:1) Mask-guided Spatial Refinement:利用MLLM评估关键帧掩码的正确性与完整性,迭代修正边界框及正负点提示;2) Video-level Mask Reflection:通过自适应帧采样评估时序质量,定位不可靠区间,重构上下文并生成修复候选,仅当验证改进时才替换预测。

  • Mask-guided Spatial Refinement:该模块利用MLLM评估关键帧掩码的正确性与完整性。当检测到错误时,系统迭代修正边界框及正负点提示,并通过SAM 3重新生成掩码。这一过程将分割质量直接反馈至空间提示生成,形成闭环优化。
  • Video-level Mask Reflection:该模块通过自适应帧采样(包括端点、均匀和随机帧)评估时序质量,定位不可靠区间。随后,修复智能体重构视频上下文,选择关键帧生成修复候选,并通过验证机制仅当改进时才替换预测。
  • Training-Free架构:ReflexTrack的所有组件在推理期间保持冻结,无需任务特定微调或像素级标注。该方法完全依赖MLLM的推理能力和SAM 3的分割能力,通过反馈机制提升性能。
  • 修复验证机制:在Video-level Mask Reflection中,系统通过重叠度和质量评分比较初始预测与修复候选。只有当修复候选显著优于初始预测时,才进行替换,避免引入新的错误。

逐图理解论文

核心贡献

核心贡献
Figure 1. (a) Overview of ReflexTrack. The primary pipeline performs Initial Target Grounding, Mask-guided Spatial Refinement, and mask generation, while Video-level Mask Reflection is further integrated to identify and repair unreliable predictions. By combining spatial prompt refinement with video-level reflection, ReflexTrack produces robust RVOS predictions. (b) Illustration of Mask-guided Spatial Refinement. Specifically, SAM 3 first generates an initial mask from the keyframe, referring expression, and spatial prompts. The mask is then evaluated for target correctness and completeness; when an error is detected, the spatial prompts are refined by updating the bounding box and positive and negative points for the next round of segmentation.

图1展示了ReflexTrack的整体流程。注意(a)部分中Mask-guided Spatial Refinement和Video-level Mask Reflection的闭环结构,以及(b)部分中空间提示的迭代修正过程。这说明了系统如何通过反馈机制优化分割结果。

最强结论

最强结论
Table 1. Comparison on the new Ref-VPS benchmark. All methods are evaluated by the overall quality score Q. The best result is highlighted in bold.

在Ref-VPS上,ReflexTrack显著优于基线。消融实验证明,空间细化和时序反思互补,分别解决初始化和传播错误。这验证了预测级反馈的核心价值。

实验如何设计?

  • 评估基准:在Ref-VPS和ReasonVOS两个基准上评估整体质量分数Q、J&F、J和F分数。
  • 对比方法:与MUTR、UNINEXT、VD-IT、GLUS、REM、VideoLISA、RGA3、CoT-RVS和Refer-Agent等方法对比。
  • 消融实验:验证Grounding Refinement (GR)和Mask Reflection组件的贡献,以及不同MLLM后端(Qwen3.7-Plus vs GPT-5.5)的影响。

关键结果与论文证据

  • 在Ref-VPS基准上,ReflexTrack使用GPT-5.5时Q=69.7,显著优于其他方法(第5页)。
  • 在ReasonVOS基准上,ReflexTrack使用Qwen-3.5 9B时J&F=67.2,略低于Refer-Agent的69.8(第5页)。
  • 消融实验显示,Base Q=54.2,添加GR后Q=60.6,添加Reflection后Q=64.7,证明两个组件互补(第5页)。
  • 不同MLLM后端对性能有显著影响,GPT-5.5优于Qwen3.7-Plus(第5页)。

阅读时需要注意

  • 依赖强大的MLLM进行推理和评估,计算成本较高。
  • 推理过程涉及多轮迭代和候选生成,可能影响实时性。
  • 在ReasonVOS上的J&F分数略低于Refer-Agent,表明在特定推理密集型查询上仍有提升空间。

关联工作

  • Refer-Agent:主要对比基线,ReflexTrack在Ref-VPS上显著优于其,但在ReasonVOS上略低。
  • SAM 3:作为核心分割和传播模块被集成使用。
  • CoT-RVS:零射推理方法,ReflexTrack在ReasonVOS上与其性能接近但略低。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

ReflexTrack:一种用于无训练指代视频对象分割的反馈驱动智能体

李元佳,徐天阳,周涛,唐章勇,吴晓军*,以及 Josef Kittler†

摘要 指代视频对象分割(RVOS)要求在整个视频中分割由自然语言指定的目标。现有的智能体方法将多模态大语言模型与可提示分割模型相结合,以执行无需任务特定训练的 RVOS。然而,大多数流水线依赖于单次空间定位后接掩码传播,导致初始提示和时序预测在很大程度上未经验证。我们引入了 ReflexTrack,这是一种无训练、反馈驱动的智能体,它在空间和时序层面关闭了这一循环。ReflexTrack 通过掩码引导的空间细化(Mask-guided Spatial Refinement)评估由关键帧提示生成的当前掩码,并迭代更新边界框以及正负点,从而产生更可靠的初始化。视频级掩码反思(Video-level Mask Reflection)评估完整的掩码序列,定位不可靠的时间区间,选择互补的修复关键帧,并通过掩码引导的重新传播生成候选预测。仅使用经过验证改进的候选项来更新受影响的时间区间,同时保留其他地方的可靠预测。所有组件在推理过程中保持冻结。ReflexTrack 在 Ref-VPS 上取得了 69.7 的整体 Q 分数,在 ReasonVOS 上取得了 67.2 的 J&F 分数。这些结果表明,预测级反馈显著提高了无训练 RVOS 的可靠性。

1 引言

指代视频对象分割(RVOS)要求在整个视频中分割由自然语言表达式指定的目标 [1, 2]。除了识别外观,模型还必须解决动作、空间关系、交互和高级语义,同时保持准确的掩码。在遮挡、快速运动、变形和视觉相似干扰物下 [3, 4]。这些耦合的语言、空间和时序挑战使得可靠的目标定位和传播成为 RVOS 的核心。

大多数现有方法通过监督架构学习跨模态视频-文本表示。基于 Transformer 的方法将语言表述为对象查询,并联合执行目标定位和掩码解码 [5–7],而最近的方法进一步利用运动感知特征、语义-时序对齐、全局-局部推理和视觉定位基础 [8, 9]。虽然有效,但它们通常依赖于训练,这限制了它们立即从快速演进的多模态大语言模型(MLLMs)和可提示分割模型中受益的能力。

无训练 RVOS 通过将预训练的 MLLMs、定位模型和视频分割基础模型组合成模块化推理流水线,提供了一种灵活的替代方案 [10–12]。现有的智能体系统可以在无需任务特定训练的情况下选择代表性帧、解释查询、识别目标并验证语义一致性。然而,它们的反思主要局限于密集预测之前的推理。由此产生的空间提示和传播掩码通常在没有显式预测级验证的情况下被接受。

这种开环设计是脆弱的。语义正确的边界框仍可能截断目标、包含干扰物或提供弱的前景-背景约束。同样,合理的帧掩码可能因遮挡、变形、快速运动或目标暂时缺失而在传播过程中漂移或消失。尽管 SAM 2 和 SAM 3 提供了强大的通用分割和传播能力 [13, 14],但其输出对提示质量和时序初始化仍然敏感。局部误差因此会累积成掩码丢失、目标漂移和时序不一致。

我们通过 ReflexTrack 解决了这一局限性,这是一种用于无训练 RVOS 的反馈驱动智能体。与推理-定位-分割的单程过程不同,ReflexTrack 引入了推理-定位-分割-评估-修复的闭环。反馈在两个层面运作:

第 2 页

视频级掩码反思 水中明亮的 蓝色 灯光 关键帧与 边界框及点 空间提示

初始目标 掩码引导 掩码生成 视频定位 空间细化 (a) ReflexTrack 概览

输入 SAM3 掩码评估 细化空间 关键帧 指代空间 分割 (边界框提示及点) 图像 文本提示 目标正确? 水中明亮的 Yes 蓝色 SAM3 ? 灯光 完整掩码? No 初始掩码

空间提示细化 细化边界框策略 正点策略 负点策略 收紧宽松边界框 在目标主体上添加 抑制干扰物 偏移至正确目标 覆盖关键部位 减少背景 (b) 掩码引导的 调整至完整范围 完整掩码 改善边界 空间细化

图 1. (a) ReflexTrack 概览。主流程执行初始目标定位、掩码引导的空间细化以及掩码生成,同时进一步集成视频级掩码反思以识别并修复不可靠的预测。通过结合空间提示细化与视频级反思,ReflexTrack 产生了鲁棒的 RVOS 预测。(b) 掩码引导的空间细化示意图。具体而言,SAM 3 首先从关键帧、指代表达和空间提示生成初始掩码。随后评估掩码的目标正确性和完整性;当检测到错误时,通过更新边界框以及正负点提示来细化空间提示,用于下一轮分割。

互补的预测层级。提高了无训练 RVOS 的可靠性。 首先,掩码引导的空间细化评估由当前空间提示诱导的关键帧掩码。大型多模态语言模型 (MLLM) 检查目标正确性和掩码完整性,诊断空间错误,并修正边界框以及正负点提示。随后,SAM 3 重新生成掩码,使得提示修正能够直接由下游分割质量引导,实现迭代式修正。 其次,视频级掩码反思检查完整的掩码序列,定位低质量的时序区间,并重建更具判别力的修复上下文。它从完整视频中重新选择多个关键帧,通过掩码引导的重新传播生成互补候选序列,仅在修复验证确认可靠改进时才替换该区间。这种选择性策略在将昂贵的 MLLM 推理集中于问题区域的同时,保留了高置信度预测。 所有组件均保持冻结,无需特定任务训练、额外的像素级标注或参数更新。ReflexTrack 在 Ref-VPS 上取得了 69.7 的整体 Q 分数,在 ReasonVOS 上取得了 67.2 的 J &F 分数。这些结果表明,将反思从语义推理扩展到空间和时序预测,显著提升了性能。 总体而言,我们的贡献总结如下: • 我们提出了 ReflexTrack,这是一种无训练的 RVOS 智能体,它在空间提示和视频级掩码预测上引入了闭环反馈。 • 我们开发了掩码引导的空间细化,它利用诱导的关键帧掩码作为直接反馈,迭代地修正边界框和点提示。 • 我们开发了视频级掩码反思,它通过上下文重建、关键帧重新选择、重新传播和验证,定位不可靠区间并选择性地进行修复。

2 方法 2.1 问题定义与概览 给定视频 $V = \{I_1, \dots, I_T\}$ 和自然语言查询 $q$,RVOS 预测指代目标的二值掩码序列 $M = \{M_1, \dots, M_T\}$,其中 $M_t \in \{0, 1\}^{H \times W}$。ReflexTrack 不进行特定任务训练,并使用冻结的大型多模态语言模型、视觉定位模块和 SAM 3 进行定位、提示细化、掩码传播和预测修复。

2

第 3 页

自适应帧采样质量评估修复验证 端点帧 均匀帧 … 比较候选项 随机帧 视频帧(重叠与质量)

VLM … 初始质量评分

采样质量评分 不良区间 t … t … 候选项 A

修复关键帧 推理 掩码引导 重新传播 … 水中的明亮 蓝光 候选项 B 掩码引导 … 空间细化 理解问题并 重建上下文

选择掩码 生成 关键帧 选择更好的修复掩码 t

视频掩码 迭代修复

图 2. 视频级掩码反思概览。自适应帧采样选择端点、均匀和随机帧,以进行高效的序列级质量评估和不可靠区间定位。基于评估结果,修复代理重建视频上下文,并从完整序列中选择信息丰富的关键帧。掩码引导的空间细化与 SAM 3 传播随后生成互补的修复候选项,这些候选项在修复验证阶段与初始预测进行比较。保留更好的预测,并可进行迭代细化。

如图 1 所示,该框架包含四个阶段。2.2.1 掩码生成与评估 初始目标定位选择代表性关键帧 对于选定的关键帧 $I_k$,令 $P_k(0)$ 表示初始提示, 并生成初始空间提示。掩码引导的空 通常是一个边界框。在第 $r$ 次迭代中,SAM 3 生成 间细化评估由每个提示生成的掩码, 并迭代修订其边界框和正/负点。随后, $M_k(r) = S(I_k, P_k(r)), \quad (1)$ SAM 3 生成并传播目标掩码以获得初始序列。最后, 其中 $S$ 为可提示分割模型。掩码 视频级掩码反思识别低质量区间, 评估代理联合观察 $I_k, q, P_k^{(r)}$ 和 $M_k^{(r)}$ 以 并通过关键帧推理、掩码引导的重新 确定掩码是否选择了正确的目标并 传播和修复验证有选择地修复它们。 完全覆盖它。它还诊断截断、背 因此,关键帧掩码提供空间反馈,而序列级 景泄漏、干扰物附着和边界错误, 评估提供时间反馈。 产生反馈 $z_k^{(r)}$。

2.2.2 提示细化与传播 我们将提示表示为 $P_k = \{b_k, P_k^+, P_k^-\}$,包含 一个边界框和正/负点集。如果当前 2.2 掩码引导的空间细化 掩码未通过评估,细化代理将更新 提示为

语义正确的定位结果可能仍不适合 像素级分割:宽松的边界框会引入 $P_k^{(r+1)} = R_{sp}(I_k, q, P_k^{(r)}, M_k^{(r)}, z_k^{(r)}), \quad (2)$ 背景或干扰物,而紧密的边界框会截断 目标。因此,我们评估由当前 其中 $R_{sp}$ 表示空间细化代理。边界框 提示诱导的掩码,并利用其错误来细化 根据诊断出的错误进行收紧、平移或扩展;正点强化目标主体或缺失

3

第 4 页

区域;负向点抑制背景和相似干扰项。这三种提示类型是联合选择的,而非以固定模式应用。更新后的提示返回给 SAM 3,评估-细化循环继续,直到掩码被判定为正确且足够完整,或达到最大迭代次数。最终提示 $P_{k^*}$ 初始化 SAM 3 的视频传播,产生初始掩码序列 $M^{(0)}$。该过程在不更新模型的情况下纠正空间初始化错误。

2.3 视频级掩码反思

即使关键帧初始化可靠,在遮挡、目标重新出现、快速运动或大变形情况下,传播仍可能失败。视频级掩码反思检测不可靠区间,生成互补的修复候选项,并仅保留经过验证的改进。如图 2 所示,它包括自适应帧采样、质量评估、修复关键帧推理、掩码引导的空间细化和修复验证。

2.3.1 自适应帧采样与评估

使用 VLM 评估每一帧既昂贵又冗余。我们构建 $S_{eval} = S_{end} \cup S_{uni} \cup S_{rand}, \quad (3)$ 其中端点帧检查时间边界,均匀帧以适配视频长度的间距覆盖整个序列,随机帧降低遗漏短时失败的概率。对应的图像-掩码对和查询传递给质量评估代理,该代理评估目标一致性、掩码完整性、目标缺失期间的假阳性以及时间连贯性。它输出序列级分数和低质量区间 $B = \{B_j\}_{j=1}^J$。

2.3.2 修复关键帧推理与再传播

对于每个区间,修复代理分析失败类型并重建更具判别力的文本上下文。然后从完整视频中选取多个修复关键帧,而非将选择限制在错误区间内,以便区间外更清晰的证据提供稳定的重新初始化。对于每个选定的关键帧,重建的上下文生成初始空间提示,并通过掩码引导的空间细化进一步处理。SAM 3 生成细化后的关键帧掩码并双向传播,产生 $C$ 个完整的候选序列 $\{M^{(c)}\}_{c=1}^C$。不同的时间起点提供了围绕遮挡、重新出现和漂移的互补恢复行为。

2.3.3 修复验证与选择性更新

修复验证将初始预测 $M^{(0)}$ 与所有修复候选项进行比较。对于每个区间 $B_j$,它考虑候选质量——目标正确性、掩码完整性、时间稳定性——以及候选项之间的重叠一致性和可靠周围帧。选定的候选项为 $c^*_j = \arg \max_{c \in \{0,…,C\}} E(M(c) | B_j, q), \quad (4)$ 其中 $c=0$ 表示初始预测。包含初始序列可防止在没有更好修复时强制替换。最终预测更新为 $M^{(c^*_j)}_t, \quad t \in B_j \text{ 且 } E(M^{(c^*_j)}) > E(M^{(0)}) + \delta,$ $M^{(0)}_t, \quad \text{否则}, \quad (5)$ 其中 $\delta$ 是最小可接受增益。仅替换经过验证的区间,保留其他地方的高置信度预测。更新后的序列被重新评估,循环在无可靠改进、满足质量要求或达到最大轮数时停止。

3 实验

3.1 实验设置

数据集与指标。我们在新的 Ref-VPS 基准和 ReasonVOS 上评估 ReflexTrack。对于 Ref-VPS,我们报告整体质量分数 $Q$,值越高表示性能越好。对于 ReasonVOS,遵循 Refer-Agent [12],我们报告标准的 J&F 分数、区域相似度 $J$ 和轮廓精度 $F$。

实现细节。所有实验均在单块 NVIDIA RTX 3090 GPU 上进行。整个管道是无训练的:初始目标定位、基于 MLLM 的评估和修复代理以及 SAM 3 在推理过程中保持冻结。对于 Ref-VPS 评估,我们使用 Qwen3.7-Plus 和 GPT-5.5 作为反思和修复验证模型的变体。对于 ReasonVOS,我们使用 Qwen-3.5 9B。

3.2 主要结果

Ref-VPS 上的结果。表 1 将 ReflexTrack 与新的 Ref-VPS 基准上的代表性 RVS 基线方法进行了比较。所有方法均使用相同的质量指标 $Q$ 进行评估。ReflexTrack 的 Qwen3.7-Plus 变体获得 $Q = 64.7$,而用 GPT-5.5 替换反思模型进一步将分数提高至 69.7。这些结果表明,所提出的反馈驱动管道显著优于现有方法,并且可以直接受益于更强的 MLLM 推理能力。

4

第 5 页

表1. 在新 Ref-VPS 基准上的比较。所有方法均通过总体质量分数 Q 进行评估。最佳结果以粗体显示。

方法 Q ↑

MUTR [7] 25.4 UNINEXT [15] 28.7 指代文本:极光 VD-IT [16] 37.9 Refer-Agent Ours GLUS [8] 34.6 REM (MS-1.4B) [17] 49.0 REM (Wan-14B) [17] 50.0

ReflexTrack (Qwen3.7-Plus) 64.7 ReflexTrack (GPT-5.5) 69.7

指代文本:击中山脉的闪电 表2. ReasonVOS 上的比较。每列中的最佳结果以粗体显示。

方法 J &F ↑ J ↑ F ↑

VideoLISA [18] 47.5 45.1 49.9 GLUS [8] 49.9 47.5 52.4 指代文本:水中反射的光 RGA3 [19] 53.6 51.3 56.0 CoT-RVS (GPT-4o) [11] 65.5 62.4 68.7 图3. 与 Refer-Agent 在 Ref-VPS 上的定性比较。 Refer-Agent [12] 69.8 67.0 72.7 每一行对应一个视频,前三列显示 Refer-Agent,后三列显示 Reflex- ReflexTrack (Qwen-3.5 9B) 67.2 70.1 64.2 Track。这些示例包含动态、模糊和强可形变的视觉概念。

ReasonVOS 上的结果。表2 将 ReflexTrack 与使用 Refer-Agent [12] 汇总结果的监督方法和零样本方法进行了比较。ReflexTrack 使用 Qwen-3.5 9B 取得了 67.2 的 J &F 分数,其中包括 70.1 的 J 和 64.2 的 F。较高的区域相似性分数表明,掩码引导的空间细化提高了推理密集型查询的目标覆盖率和区域准确性。

3.3 消融研究

表3 隔离了两个反馈阶段以及用于反思的多模态大语言模型(MLLM)的贡献。基础管道获得 Q = 54.2。添加定位细化(Grounding Refinement)将分数提高到 60.6,绝对增益为 6.4 分,这表明修正初始空间提示提高了后续掩码生成和传播的质量。添加视频级掩码反思(Video-level Mask Reflection)进一步将分数提高到 64.7。这一增益证实了空间细化和时间反思解决了互补的错误来源:前者改善了初始化,而后者检测不可靠的时间间隔并选择性地用经过验证的修复候选项替换它们。

将用于反思和修复验证的 Qwen3.7-Plus 替换为 GPT-5.5,使 Q 从 64.7 提高到 69.7。总体而言,完整配置相比基础管道提高了 15.5 分,相对增益约为 28.6%。结果还表明,ReflexTrack 可以直接利用更强的 MLLM 推理能力,而无需进行特定任务的重新训练。

3.4 定性结果

与 Refer-Agent 的比较。图3 比较了 Refer-Agent 和 ReflexTrack 在涉及极光、火山闪电和水面上反射光的代表性 Ref-VPS 序列上的表现。这些示例包含高度可形变和非对象区域,其空间范围随时间发生显著变化。Refer-Agent 能够识别相关的视觉概念,但其掩码可能会过度扩展、碎片化或在时间上不稳定。通过细化初始提示并修复不可靠的时间间隔,ReflexTrack 生成的掩码在序列中更一致地跟随所指的动态区域。

5

第 6 页

[4] C. Yan, H. Wang, S. Yan, X. Jiang, Y. Li, G. Kang, W. Lu, X. Zhang, and J. Xie, “VISA: Reasoning video object segmen- tation via large language models,” in European Conference on Computer Vision, 2024, pp. 98–115. [5] A. Botach, E. Zheltonozhskii, and C. Baskin, “End-to-end referring video object segmentation with multimodal trans- formers,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 4985– 4995. [6] J. Wu, Y. Jiang, P. Sun, Z. Yuan, and P. Luo, “Language as keyframes. Red rectangles indicate refined bounding boxes; yellow and red markers indicate positive and negative point prompts, re- spectively. [7] S. Yan, R. Zhang, Z. Guo, W. Chen, W. Zhang, H. Li, Y. Qiao, H. He, and P. Gao, “Referred by multi-modality: A unified temporal transformer for video object segmentation,” in Pro- Visualization of refined spatial prompts. Figure 4 visual- ceedings of the AAAI Conference on Artificial Intelligence, izes the keyframe prompts produced by Mask-guided Spatial vol. 38, no. 6, 2024, pp. 6449–6457. Refinement. Red rectangles denote refined bounding boxes, [8] L. Lin, X. Yu, Z. Pang et al., “GLUS: Global-local reasoning while yellow and red points represent positive and negative unified into a single large language model for video seg- prompts, respectively. Positive points are placed on the tar- mentation,” in Proceedings of the IEEE/CVF Conference on get body or missing target regions to strengthen foreground Computer Vision and Pattern Recognition, 2025. evidence. Negative points are placed on background regions [9] T. Liang, K. Q. Lin, C. Tan et al., “ReferDINO: Referring and nearby distractors to suppress false responses. These video object segmentation with visual grounding foundations,” examples illustrate that the combined box-and-point prompts in Proceedings of the IEEE/CVF International Conference on provide more precise spatial constraints than a single coarse Computer Vision, 2025, pp. 20 009–20 019. box and therefore offer a more reliable initialization for [10] S. Huang, R. Ling, H. Li et al., “Unleashing the temporal- SAM 3 propagation. spatial reasoning capacity of GPT for training-free audio and language referenced video object segmentation,” arXiv 4 Conclusion preprint arXiv:2408.15876, 2024. [11] S.-H. Kao, Y.-W. Tai, and C.-K. Tang, “CoT-RVS: Zero-shot We introduced ReflexTrack, a training-free, feedback-driven chain-of-thought reasoning segmentation for videos,” arXiv agent for referring video object segmentation. ReflexTrack preprint arXiv:2505.18561, 2025. combines Mask-guided Spatial Refinement, which iteratively [12] H. Jiang, T. Liang, W.-S. Zheng, and J.-F. Hu, “Refer-agent: improves bounding-box and point prompts using keyframe- A collaborative multi-agent system with reasoning and reflec- mask feedback, with Video-level Mask Reflection, which tion for referring video object segmentation,” arXiv preprint detects and selectively repairs unreliable temporal intervals. arXiv:2602.03595, 2026. Experiments on Ref-VPS and ReasonVOS demonstrate that [13] N. Ravi, V. Gabeur, Y.-T. Hu et al., “SAM 2: Segment any- these spatial and temporal feedback mechanisms improve thing in images and videos,” in International Conference on Learning Representations, 2025.segmentation accuracy and robustness without task-specific training or parameter updates. [14] N. Carion, L. Gustafson, Y.-T. Hu et al., “SAM 3: Segment anything with concepts,” arXiv preprint arXiv:2511.16719, 2025. References [15] B. Yan, Y. Jiang, J. Wu, D. Wang, P. Luo, Z. Yuan, and [1] K. Gavrilyuk, A. Ghodrati, Z. Li, and C. G. M. Snoek, “Actor H. Lu, “Universal instance perception as object discovery and and action video segmentation from a sentence,” in Proceed- retrieval,” in Proceedings of the IEEE/CVF Conference on ings of the IEEE/CVF Conference on Computer Vision and Computer Vision and Pattern Recognition, 2023. Pattern Recognition, 2018, pp. 5958–5966. [16] Z. Zhu, X. Feng, D. Chen, J. Yuan, C. Qiao, and G. Hua, [2] S. Seo, J.-Y. Lee, and B. Han, “URVOS: Unified referring “Exploring pre-trained text-to-video diffusion models for re- video object segmentation network with a large-scale bench- ferring video object segmentation,” in European Conference mark,” in European Conference on Computer Vision, 2020, on Computer Vision, 2024. pp. 208–223. [17] A. Bagchi, Z. Bao, Y.-X. Wang, P. Tokmakov, and M. Hebert, [3] H. Ding, C. Liu, S. He, X. Jiang, and C. C. Loy, “MeViS: A “Refereverything: Towards segmenting everything we can large-scale benchmark for video segmentation with motion speak of in videos,” in Proceedings of the IEEE/CVF Inter- expressions,” in Proceedings of the IEEE/CVF International national Conference on Computer Vision, 2025, pp. 23 221– Conference on Computer Vision, 2023, pp. 2694–2703. 23 231.

6

第 7 页

[18] Z. Bai, T. He, H. Mei, P. Wang, Z. Gao, J. Chen, L. Liu, Z. Zhang, and M. Z. Shou, “One token to seg them all: Lan- guage instructed reasoning segmentation in videos,” arXiv preprint arXiv:2409.19603, 2024. [19] H. Wang, Q. Chen, C. Yan, J. Cai, X. Jiang, Y. Hu, W. Xie, and E. Gavves, “Object-centric video question answering with visual grounding and referring,” in Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, pp. 22 274–22 284.

7

发表评论