VideoTreeSearch:用离散树导航解决长视频接地问答中的错误收敛问题

三分钟导读:本文提出VideoTreeSearch (VTS),一种通过将长视频组织为语义树并利用离散动作(如zoom_in, zoom_out, shift)进行显式回溯和自纠错的框架,显著提升了Grounded LVQA的性能。

英文题目:Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

论文出处:arXiv 每日论文精选 · arXiv:2607.16189

原始论文:PDF / 论文页面

对应视频标题:VideoTreeSearch:用离散树导航解决长视频接地问答中的错误收敛问题|推荐指数:★★★★★

这篇论文解决什么问题?

现有的基于智能体的长视频问答方法通常使用连续的crop_video动作,缺乏细粒度到粗粒度的回溯机制,导致智能体容易过早收敛且无法从早期错误中恢复。

核心创新

  • 提出VideoTreeSearch (VTS)框架,将视频视为自适应时间树,将定位和回溯转化为显式可学习的行为。
  • 设计离散树接地动作空间(zoom_in, zoom_out, shift, answer),解耦探索与自我修正。
  • 开发轨迹合成管道,生成包含错误分支和恢复路径的轨迹,以训练智能体的自纠错能力。
  • 引入基于CLIP的自适应场景边界检测,构建语义连贯的层次结构。

方法概览

VTS首先利用CLIP嵌入自适应构建非均匀时间树,节点对应语义连贯片段。智能体通过四个离散动作(zoom_in, zoom_out, shift, answer)在树中导航。训练包括:1) 轨迹合成:生成包含故意错误分支和恢复路径的轨迹;2) 监督微调(SFT):模仿期望的导航和恢复动作;3) 强化学习(RL):使用接地IoU和答案准确性奖励进行GRPO优化。

逐图理解论文

方法概览:VideoTreeSearch框架

方法概览:VideoTreeSearch框架
Figure 2: Overview of VideoTreeSearch (VTS). Left: Given a long video, VTS recursively partitions it into a non-uniform tree using CLIP-based scene boundaries, so each node corresponds to a semantically coherent segment. Right: The agent navigates the tree through four discrete actions— zoom_in to descend into a child, zoom_out to ascend to the parent, shift to move laterally to a sibling, and answer to terminate with a final answer and evidence interval. In this example, the agent first descends into a wrong branch (red, turns 1–2), recovers via zoom_out and shift (turns 3–4), then zooms into the correct branch (turn 5) and answers with the localized clue at 16:32–16:40 (turn 6). Backtracking is thus an explicit, learnable primitive.

VTS首先利用CLIP嵌入自适应构建非均匀时间树,节点对应语义连贯片段。智能体通过四个离散动作在树中导航,将定位与回溯转化为显式可学习的行为。

训练策略:轨迹合成与强化学习

训练策略:轨迹合成与强化学习
Figure 5: Overview of the LongClueQA construction pipeline. Collected YouTube videos are segmented into 10-second clips and captioned with Qwen3-VL. Multiple-choice QA pairs with temporal clues are then generated from the captions and filtered to retain only high-quality questions.

训练包括轨迹合成、监督微调和强化学习。合成管道生成含故意错误分支和恢复路径的轨迹,通过GRPO优化,以接地IoU和答案准确性为奖励,强化自纠错能力。

主要结果:接地与问答性能提升

主要结果:接地与问答性能提升
Table 1: Grounded LVQA results. VTS substantially improves both grounding metrics (mIoU, T-F1) and QA accuracy over prior agentic methods across all benchmarks. “Acc” denotes QA accuracy.

在CG-Bench上,VTS达到16.8 mIoU和36.4准确率,较LongVT分别提升12.5和19.0。在Haystack基准上,T-F1也显著超越TimeSearch-R,证明离散导航的有效性。

效率分析:更少帧数,更高精度

效率分析:更少帧数,更高精度
Table 2: Efficiency analysis on CG-Bench. VTS achieves the best mIoU and QA accuracy while processing fewer frames.

VTS平均每个视频处理328帧,少于基线方法的384或450帧。这表明其通过语义树聚焦关键区域,在降低计算开销的同时实现了更优的时空定位精度。

消融实验:组件贡献分析

消融实验:组件贡献分析
Table 4: Ablation studies on CG-Bench. We ablate three components of VTS: tree construction, the training pipeline, and trajectory composition. Each ablation varies one component and keeps the rest at their default setting. Highlighted rows denote the default VTS.

消融实验表明,树构建、训练管道和轨迹合成均对性能有显著贡献。特别是包含错误恢复路径的轨迹合成,是提升智能体自纠错能力的关键因素。

实验与关键结果

  • 在三个Grounded LVQA基准测试(CG-Bench, Haystack-LVBench, Haystack-Ego4D)上评估接地和QA性能。
  • 在三个通用长视频理解基准测试(Video-MME, MLVU, LVBench)上评估QA性能。
  • 进行消融实验,分析树构建、训练阶段和轨迹合成的贡献。
  • 分析不同训练数据源(LongClueQA vs 混合数据)和骨干网络(Qwen2.5-VL-7B vs Qwen3-VL-8B)的影响。
  • 效率分析:比较处理帧数与性能。
  • CG-Bench: 16.8 mIoU, 36.4 Acc (+12.5 mIoU, +19.0 Acc over LongVT)(第 6 页)
  • Haystack-LVBench: 15.2 T-F1 (+7.1 over TimeSearch-R)(第 6 页)
  • Haystack-Ego4D: 18.4 T-F1 (+7.4 over TimeSearch-R)(第 6 页)
  • LVBench: 54.7 Acc (+7.1 over Video-o3)(第 9 页)
  • 平均每个视频4.8轮,处理328帧(少于基线)(第 6 页)

阅读时需要注意

  • 当前动作空间仅支持单个证据区间,无法处理分布在多个不连续时间区域的证据。
  • 自适应分割依赖CLIP,在视觉同质视频中表现较差。
  • 轨迹合成依赖外部VLM和LLM,训练信号质量受限于这些模型。
  • VTS的性能提升部分得益于更强的骨干网络(Qwen3-VL-8B),但在匹配骨干网络(Qwen2.5-VL-7B)下仍显著优于基线。
  • CG-Bench经过过滤以移除歧义或无需视频即可回答的问题,结果可能无法直接推广到未过滤版本。

关联工作

  • LongVT:最强多轮裁剪基线,VTS在CG-Bench上大幅超越。(第 6 页)
  • TimeSearch-R:Haystack基准上的最强基线,VTS在T-F1上超越。(第 6 页)
  • SiLVR:最强Captioner-LLM基线,VMS在mIoU和Acc上超越。(第 6 页)
  • VideoTree:相关工作,使用LLM组织帧为树,但为静态表示,非交互式导航。(第 3 页)
  • VideoMiner:相关工作,使用树结构进行关键帧选择,但非多轮交互式搜索。(第 3 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

以树状结构搜索视频:用于接地长视频问答的自我修正智能体

Ce Zhang1 Ziyang Wang1 Yulu Pan1 Oluwatumininu Oguntola1 Pranav Wagh1 Qiyu Wu2 Hiromi Wakaki2 Mohit Bansal1 Gedas Bertasius1 1北卡罗来纳大学教堂山分校 2索尼 {cezhang, ziyangw, yulupan, mohit, gedas}@cs.unc.edu, {Qiyu.Wu, Hiromi.Wakaki}@sony.com

摘要

接地长视频问答(Grounded LVQA)要求在回答关于长视频的问题的同时,定位支持该答案的短证据区间。最近的智能体方法将这一任务建模为具有单一 crop_video(start, end) 动作的多轮探索,这支持从粗到细的缩小,但缺乏从细到粗回溯的原语。因此,这些智能体通常会过早收敛,且无法从早期错误中恢复。我们提出了 VideoTreeSearch (VTS),这是一个将接地长视频问答(Grounded LVQA)转化为在自适应时间树上进行迭代自我修正搜索的框架。VTS 根据视觉场景边界构建非均匀树,使得每个节点对应一个语义连贯的片段,并训练智能体通过四种离散操作在树中导航:zoom_inzoom_outshiftanswer。这些操作将回溯和恢复暴露为显式、可学习的原语,而非隐式行为。为了训练这种导航能力,我们引入了一种轨迹合成管道,该管道生成通过树的多步路径,包括故意偏离进入错误分支随后恢复的过程。我们利用这些轨迹进行监督微调,随后进行带有接地和答案准确性奖励的强化学习。在三个接地长视频问答(Grounded LVQA)基准测试(CG-Bench, Haystack-LVBench, Haystack-Ego4D)上,VTS 优于最强的先前智能体方法,在 CG-Bench 上 mIoU 提升 +12.5,在 Haystack-Ego4D 上 T-F1 提升 +7.4。学习到的策略也泛化到通用长视频问答,在 Video-MME、MLVU 和 LVBench 上以高达 +7.1 的准确率优势超越所有先前的智能体基线。消融实验证实,自我修正的分层搜索是这些性能提升的核心机制:移除自适应下降或显式回溯都会导致性能显著下降。代码可在 https://github.com/CeeZh/VTS 获取。

1 引言

考虑一个一小时的烹饪教程,配合问题:“在将碗放入烤箱之前,厨师往碗里加了什么?”回答这个问题需要模型首先定位碗被放入烤箱的那一瞬间,然后识别厨师在此之前的添加动作。许多现实世界的长视频都具有这种结构:回答问题所需的证据仅占据视频的一小部分,而周围的内容大多无关紧要。这项任务被称为接地长视频问答(Grounded LVQA)[4, 36],要求模型同时定位支持证据区间并生成最终答案。均匀帧采样并不适合这种设置,因为采样帧数过少可能会跳过短暂的证据区间。相比之下,采样过多帧则会超出当前视频模型

第 2 页

问题:厨师在把菜放进烤箱之前往菜里加了什么? 答案:胡椒 线索:14:05 – 14:12 00:00 05:00 10:00 14:05 14:12 20:00 25:00 27:57

先前基于智能体的方法与 本文方法:VideoTreeSearch (VTS) 配合 连续 crop_video 动作 离散树接地动作 第 1 步:crop_video (08:10-09:20) 00:00-27:57 ①第 1 步:zoom_in 第 2 步:crop_video (09:50-10:10) ① ② 第 2 步:zoom_out ③ ② ③ 第 3 步:zoom_in 答案:奶酪 (进入未访问分支) 线索:09:50-10:10 00:00-13:43 13:43-17:29 17:29-27:57 时间 IoU:0 从错误中回溯 答案:胡椒 从错误中回溯 线索:14:02 – 14:14 多尺度层次化搜索 多尺度层次化搜索 时间 IoU:0.58 精确时间定位 精确时间定位

图 1:先前基于智能体的方法与我们的 VideoTreeSearch (VTS) 在 Grounded LVQA 上的对比。 先前基于智能体的方法(左下)依赖于连续的 crop_video 动作,该动作将探索与修正混为一谈。 因此,它们往往过早收敛,无法从早期错误中恢复。我们提出的 VideoTreeSearch(右下) 则将视频组织为语义连贯片段的树,并让智能体通过离散动作(zoom_in, zoom_out, shift) 在其中导航。这使得精确时间定位和从错误中回溯从隐式能力转变为显式可学习的行为。

模型所能处理的内容。因此,Grounded LVQA 需要一种迭代搜索,其中模型假设证据位于何处, 并逐步缩小到视频中有希望的区域。

最近的工作将这种搜索表述为与长视频的基于智能体的交互 [34, 18, 38, 7, 32]。 大多数这些方法为视觉语言模型配备了一个单一的裁剪工具 crop_video(start, end), 并让智能体反复裁剪视频,直到它产生答案 [34, 18, 38]。虽然这种统一的动作在原则上是灵活的, 但它存在两个结构性缺陷。首先,动作空间是不对称的。裁剪自然地缩小了搜索范围,但当智能体 锁定错误的视频区域时,它没有提供用于从细粒度回溯到粗粒度的类似机制。其次,连续的时间戳 回归没有提供视频的层次化分解。智能体必须从原始像素中定位证据,而对语义连贯片段的位置 没有任何先验知识,这使得搜索空间平坦且无序。 综上所述,这些缺陷使得智能体缺乏用于恢复或精确时间定位的一致训练信号。因此, 先前基于智能体的方法通常过早收敛,无法从早期错误中恢复。

我们提出了 VideoTreeSearch (VTS),这是一个将长视频视为自适应时间树的框架, 并用离散导航取代了连续的时间戳回归。我们的关键见解是,将视频组织为语义连贯片段的树, 并让智能体通过离散动作导航该树,可以将精确时间定位和回溯从隐式能力转变为显式可学习的行为。 具体而言,VTS 首先构建一棵非均匀树,其边界是使用 CLIP [20] 嵌入推导出的视觉场景变化点, 使得每个树节点对应一个语义连贯的片段。然后,智能体通过四种离散操作导航这棵树:zoom_in 用于下降到子片段,zoom_out 用于上升到父节点,shift 用于横向移动到兄弟节点,以及 answer 用于提交答案。与平坦的连续动作空间相比,这种设计具有两个结构性优势。由于树节点预先与 语义内容边界对齐,模型不再需要从原始像素回归精确的时间戳,定位简化为选择节点。 探索和自校正也成为独立的基元。zoom_in 动作支持自适应的从粗到细的缩小,而 zoom_out 和 shift 提供了用于从细到粗回溯和自校正的专用机制。

训练智能体有效使用这些基元不仅需要针对成功导航的监督,还需要针对从错误中恢复的监督。 现有数据集 [38, 34, 41] 中不可用此类监督。因此,我们开发了一种轨迹合成流水线, 它生成正确

第 3 页

路径轨迹以及那些故意进入错误分支随后通过向上和横向移动恢复的轨迹。我们使用这些合成的轨迹进行监督微调,以植入导航和恢复模式,随后基于接地和答案准确性的结果奖励进行强化学习。

我们在三个 Grounded LVQA 基准测试(CG-Bench [4]、Haystack-LVBench [36]、Haystack-Ego4D [36])和三个通用长视频理解基准测试(Video-MME [9]、MLVU [43] 和 LVBench [28])上评估 VTS。VTS 在所有三个 Grounded LVQA 基准测试上均显著优于先前的智能体方法,其中在最长视频基准测试 Haystack-Ego4D 上的提升最大。这一趋势表明,显式分层搜索和回溯的价值随着搜索范围的增加而增长,此时不可恢复的错误下降成本最高。尽管 VTS 主要训练用于证据定位,但其导航策略也泛化到了通用长视频 QA 任务中。VTS 在 Video-MME、MLVU 和 LVBench 上超越了最强的先前智能体方法,准确率最高提升 +7.1 个百分点,这表明树接地搜索是一种除时间接地之外有用的归纳偏置。通过检查学习到的策略,我们发现 VTS 平均每视频进行 4.8 次搜索轮次,并在约 60% 的轨迹中调用回溯动作,这表明智能体积极依赖其新原语,而不仅仅是拥有访问权限。

2 相关工作

长视频理解与接地长视频问答。长视频理解需要对跨越分钟到小时的视频进行推理,其中稀疏的查询相关线索埋藏在大量冗余内容中 [9, 28, 43, 33]。大多数先前工作侧重于答案生成方面。视频专用多模态大语言模型(MLLMs)通过上下文扩展 [6, 42, 22, 5]、令牌压缩 [24, 29, 17, 25, 23]、关键帧选择 [26, 35, 19, 2] 或状态空间骨干网络 [11, 12, 14] 端到端地处理长输入,而 captioner-LLM 流水线则通过强大的语言模型聚合片段级描述 [39, 40, 15, 21]。这些方法以单次前向传递处理视频,并不定位支持证据。我们关注 Grounded LVQA [4, 36, 37],这是一个更具挑战性的设置,模型必须同时生成答案和支持该答案的证据区间。接地要求使得预测可验证,并防止模型在不关注相关证据的情况下仅依靠语言先验来正确回答问题。最近的基准测试如 CG-Bench [4]、Haystack-LVBench 和 Haystack-Ego4D [36] 将接地与 QA 结合,最近的方法包括 ReVisionLLM [10]、TimeZero [30]、VideoChat-R1 [16]、VideoITG [27] 和 TimeChat [22] 训练具有时间感知能力的视觉语言模型(VLMs)以进行细粒度定位。这些方法执行单次前向传递或遵循固定的递归流水线。相反,我们将 Grounded LVQA 表述为通过语义连贯片段树进行的迭代分层搜索,其中智能体学习控制其在时间尺度上的下降以及从错误选择中恢复。

长视频的分层表示。另一条互补的研究路线将长视频组织成分层结构以进行多尺度推理。VideoTree [31] 对密集视频特征进行聚类,并使用大语言模型将帧组织成与查询相关的树,而 VideoMiner [3] 将帧分组到树中并通过强化学习学习关键帧选择。相关方法包括 Video ReCap [13],它通过递归聚合在多个时间尺度上生成描述,以及 ReVisionLLM [10],它在固定时间表上执行由粗到细的定位。我们的框架建立在这种分层归纳偏置之上,但在两个关键方面有所不同。先前方法将分层结构作为静态表示,在单次前向传递或固定递归时间表中使用,而我们将树视为智能体在多个轮次中导航的交互式环境,学习何时以及如何下降。我们的智能体还可以通过向上和横向移动重新进入之前访问过的节点,提供固定递归流水线所缺乏的显式自我纠正能力。

3 方法

我们提出 VTS,这是一个将 Grounded LVQA 表述为在自适应时间树上进行迭代分层搜索的框架。方法概述如图 2 所示。给定长视频 V 和问题 Q,VTS 必须生成最终答案 $\hat{y}$ 和支持它的时间区间 $[t_s, t_e] \subseteq [0, |V|]$。该时间区间通常只有几秒到几十秒宽,而周围的内容则无关紧要。VTS 构建一个非均匀的时间树,其节点对应于语义连贯的视频片段(§3.1)。然后,智能体通过

3

第 4 页

步骤 1 步骤 2 自适应时序树构建 多轮树导航

博主离开海滨小镇后,在路上立即展示了什么?

第 ① 步 00:00-35:46 00:00-35:46 zoom_in ① 第 ② 步 ④ zoom_in

00:00-12:48 12:48-17:31 17:31-35:46 第 ③ 步 ② ⑤ 00:00-12:48 12:48-17:31 17:31-35:46 zoom_out ③ 第 ④ 步 00:00-04:42 04:42-12:48 12:48-16:00 shift ⑥ 马 第 ⑤ 步 16:32-16:40 zoom_in 00:00-04:42 04:42-12:48 12:48-16:00 16:00-17:31 00:00-03:31 03:31-04:42 第 ⑥ 步 answer 分割边界 树接地动作空间 zoom_in zoom_out shift answer 非叶节点

00:00-03:31 03:31-04:42 叶节点 answer + clue

图 2: VideoTreeSearch (VTS) 概览。左侧:给定一个长视频,VTS 使用基于 CLIP 的场景边界将其递归划分为非均匀树,因此每个节点对应一个语义连贯的片段。右侧:智能体通过四种离散动作在树中导航——zoom_in 向下进入子节点,zoom_out 向上回到父节点,shift 横向移动到兄弟节点,以及 answer 终止并给出最终答案和证据区间。在此示例中,智能体首先下降到一个错误的分支(红色,第 1-2 步),通过 zoom_out 和 shift 恢复(第 3-4 步),然后 zoom_in 进入正确的分支(第 5 步),并在 16:32–16:40 处定位线索进行回答(第 6 步)。因此,回溯是一个显式的、可学习的原语。

四种离散动作,将层级下降和自我纠正暴露为显式移动(§3.2)。 轨迹合成管道生成带有故意错误分支绕行及恢复的导航路径(§3.4),这些轨迹用于监督微调,随后进行强化学习(§3.5)。

3.1 自适应时序树构建

时序树向智能体暴露视频的多尺度结构。根节点对应整个视频,中间节点对应粗粒度片段,叶节点对应证据区间的细粒度候选者。节点的子节点形成其父节点区间的非重叠划分,因此向下遍历树会逐步缩小智能体的假设范围。我们没有施加固定的分支因子或均匀分割,而是自适应地构建每个节点的子节点,在视觉内容变化最大的位置放置边界。这种设计确保通过树的下降对应于沿自然内容边界的细化,而非任意划分。

具体而言,给定片段 $S = [t_{start}, t_{end}]$,我们以 1 fps 的频率从 $S$ 中均匀采样最多 64 帧,并为每个采样帧计算 CLIP [20] 嵌入 $e_i$。我们计算连续嵌入之间的余弦距离 $\delta_i = 1 – \cos(e_i, e_{i+1})$ 作为视觉变化的度量,并在该距离超过自适应阈值 $\tau = \text{mean}(\delta) + k \cdot \text{std}(\delta)$ 的帧处放置边界。我们将子节点的数量约束在 3 到 8 之间,当阈值产生过多分割时保留顶部边界,当产生过少分割时放宽阈值。当当前节点短于 64 秒时停止分割,因此低于此持续时间的节点成为树的叶节点。树在推理期间惰性构建:仅实例化根节点以及智能体实际访问的节点的子节点。这保持了导航空间较小,并确保分割反映了智能体选择检查的区域。

3.2 树接地动作空间

在每一步,智能体占据树中的一个节点,并从四种离散动作中选择一个:

4

第 5 页

• zoom_in(c):进入当前节点的第 c 个子节点。 • zoom_out():回溯到当前节点的父节点。 • shift(s):在同一父节点下横向移动到第 s 个兄弟节点。 • answer(ˆy, [ts, te]):终止并输出最终答案及证据区间。

单次 zoom_in 操作仅下降一层,而非直接锁定特定的时间戳范围,因此到达细粒度的证据区间自然需要多轮逐步收窄。探索与自我纠错被解耦:zoom_in 推动搜索向下进行,而 zoom_out 和 shift 则是用于放弃错误分支的专用机制。因此,智能体可以学习显式地调用回溯,而不是通过重复连续裁剪来近似实现 [34, 18, 38]。

3.3 多轮树导航

在每一轮中,智能体实例化当前节点的子节点,接收总结当前节点及其子节点的观察结果,生成推理轨迹,并选择四种动作之一。当智能体发出 answer 动作或达到最大轮数时,循环终止。为了在固定的上下文预算内支持长搜索视界,我们维护一个紧凑的记忆体,包括:(i) 已实例化树的当前状态,其中每个访问过的节点都标注了简短标题和访问标志;(ii) 所有已采取动作的时间顺序日志。智能体仅接收当前节点的原始帧,而其他所有节点均由其对应的文本描述表示。这种详细感知与压缩历史的分离,使智能体能够在不耗尽视觉上下文预算的情况下进行多轮推理。

3.4 层次搜索的轨迹合成

仅靠最优下降轨迹并不能教会智能体识别错误并从错误中恢复。因此,我们合成结合了正确层次下降与故意偏离错误分支随后恢复的轨迹。给定视频、问题和真实证据区间,控制器选择朝向当前节点得分最高的子节点的 zoom_in 动作(由 Qwen3-VL-8B 根据问题相关性进行评分)。当所选子节点不包含真实区间时,控制器可以选择恢复,即应用导致进入错误分支的动作序列的逆操作,或者继续深入错误分支以产生更长的偏离路径。如果在错误分支中连续两轮,则强制恢复。每个动作都与由 DeepSeek-R1 生成的推理轨迹配对,该轨迹以该轮的记忆、当前节点的帧以及所选动作为条件。这些轨迹源自 CG-Bench、Haystack-Ego4D 以及我们自动生成的 LongClueQA 语料库,后者利用了长无标签 YouTube 视频。我们重点关注包含单个真实线索且该线索跨度不超过视频时长 20% 的示例。完整的过滤和轨迹生成细节见附录。

3.5 训练

监督微调。我们首先微调智能体以模仿生成的轨迹。每条轨迹 $T = \{(O_0, M_0), (R_1, A_1, O_1, M_1), \dots, (O_T, A_T)\}$ 被分解为每轮的监督示例,其中在第 $t$ 轮,输入为前一次观察和当前记忆 $(O_{t-1}, M_t)$,目标为推理轨迹和动作 $(R_t, A_t)$。令 $D_{SFT}$ 表示由此产生的监督轮次集合,$\theta$ 为模型参数。我们优化标准的词元级负对数似然:

$$ L_{SFT} = – \sum_{(O_{t-1}, M_t, R_t, A_t) \in D_{SFT}} \log p_\theta(R_t, A_t | O_{t-1}, M_t, Q). \quad (1) $$

关键在于我们选择性应用损失:尽管每条轨迹都是作为端到端序列生成的(包括为后续恢复轮次设置铺垫的故意偏离错误分支),但我们仅通过那些动作本身作为监督目标 desirable 的轮次进行反向传播——即正确的 zoom_in、从错误节点 zoom_out,以及从错误节点 shift 到正确兄弟节点。动作是故意错误的轮次(例如,进入错误节点的 zoom_in,为后续恢复做铺垫)保留在模型的输入上下文中作为轨迹历史的一部分,但在损失计算中被屏蔽。因此,智能体观察完整的偏离与恢复序列作为上下文,但仅对我们希望它模仿的移动进行监督。

5

第 6 页

表 1:Grounded LVQA 结果。VTS 在所有基准测试中,相比先前的智能体方法,显著提升了接地指标(mIoU、T-F1)和问答准确率。“Acc”表示问答准确率。

CG-Bench Haystack-LVBench Haystack-Ego4D

Method mIoU Acc T-F1 Acc T-F1 Acc

Uniform sampling Qwen3-VL-8B (256 frames) [1] 12.1 20.2 12.8 45.9 8.9 39.2 Qwen3-VL-8B (384 frames) [1] 12.1 23.6 9.2 39.5 7.0 33.4 Video-R1 (64 frames) [8] 5.5 15.8 4.3 40.6 2.9 33.1

Captioner-LLM agents SiLVR [40] 10.1 31.8 8.5 57.0 6.3 46.4

Multi-turn cropping agents LongVT [34] 4.3 17.4 5.4 46.2 3.7 42.1 Video-o3 [38] 2.9 26.1 – – – – VideoZoomer [7] 3.0 18.3 6.8 48.3 5.4 48.6 TimeSearch-R [18] – – 8.1 52.1 11.0 53.5

VTS (Ours) 16.8 36.4 15.2 58.3 18.4 66.1

强化学习。我们进一步通过强化学习在监督检查点的基础上优化策略。每次 rollout 生成一个以答案为终点的完整轨迹 $\tau$,我们使用基于接地和答案正确性的三个结果奖励的加权和对其进行评分:

$R(\tau) = \lambda_{fmt}R_{fmt}(\tau) + \lambda_{IoU}R_{IoU}(\tau) + \lambda_{acc}R_{acc}(\tau).$ (2)

其中,$R_{fmt}$ 检查所有动作是否在语法上正确;$R_{IoU}$ 衡量预测证据区间与真实证据区间之间的时间重叠;$R_{acc}$ 是答案准确率奖励。我们使用 GRPO 优化 $R(\tau)$,并通过相对于监督检查点的 KL 散度惩罚进行正则化,以防止策略偏离监督初始化过远。具体的奖励权重和完整的优化设置详见附录。

3.6 实现细节

我们使用 Qwen3-VL-8B [1] 作为基础模型来实例化 VTS。§3.1 中的自适应分割过程使用 $k = 1.5$。智能体每轮采样 64 帧,帧率为 1 fps。轨迹合成流程产生了 6,537 条经过过滤的训练轨迹,这些轨迹来自三个来源:CG-Bench [4]、Haystack-Ego4D [36] 以及 LongClueQA。LongClueQA 是一个带时间戳的问题-线索对语料库,我们自动从未经标注的长格式 YouTube 视频中生成(详见附录)。监督微调和强化学习均在 4×H100 GPU 上进行。我们将监督检查点称为 VTS-SFT,将强化学习检查点称为 VTS-RL。VTS-RL 是实验中的主要模型。完整的超参数报告在附录中。

4 实验设置

基准和指标。我们在三个 Grounded LVQA 基准和三个通用长视频 QA 基准上评估 VTS。对于 Grounded LVQA,我们使用 CG-Bench [4] 的 mini 集,以及 Haystack-LVBench [36] 和 Haystack-Ego4D [36]。我们对 CG-Bench 应用了过滤程序(详见附录),以移除证据区间未标注或存在歧义的实例。CG-Bench 报告预测证据区间与真实证据区间之间的 mIoU 以及问答准确率。Haystack 基准报告时间 F1(T-F1,主要的接地指标)以及问答准确率。对于通用长视频 QA,我们在 Video-MME [9]、MLVU [43] 的测试集以及 LVBench [28] 上进行评估,所有指标均通过多项选择题答案准确率进行测量。

基线。我们将 VTS 与三类方法进行比较。Uniform sampling 直接将视觉-语言模型应用于均匀采样的帧,不涉及智能体交互。我们评估了 Qwen3-VL-8B [1](与 VTS 相同的基础模型),分别在 64、256 和 384 帧设置下,以及 Video-R1 [8] 在其最优的 64 帧设置下。Captioner-LLM agents 对短片段进行密集字幕标注,并在生成的文本上进行推理。我们将其与 SiLVR [40] 进行比较,后者使用 DeepSeek-R1 作为推理器

6

第 7 页

表 3:Grounded LVQA 上的性能增益分析。树接地动作空间、回溯原语和层级下降各自对 VTS 的强大性能做出了贡献。

| Variant | CG-Bench mIoU | CG-Bench Acc | CG-Bench T-F1 | Haystack-LVBench Acc | Haystack-LVBench T-F1 | Haystack-Ego4D Acc | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | Continuous crop_video action | 15.5 | 32.5 | 13.2 | 49.1 | 14.2 | 56.3 | | Tree-grounded, no backtracking | 14.4 | 35.0 | 13.2 | 52.9 | 15.5 | 64.6 | | Tree-grounded, flat tree (no hierarchy) | 15.3 | 34.5 | 13.2 | 53.2 | 18.9 | 62.9 | | VTS (full design) | 16.8 | 36.4 | 15.2 | 58.3 | 18.4 | 66.1 |

密集提取的视觉字幕。多轮裁剪代理通过连续的 crop_video(start, end) 动作定位证据区间,包括 LongVT [34]、Video-o3 [38]、VideoZoomer [7] 和 TimeSearch-R [18] 等方法。

5 实验结果

5.1 Grounded Long-Video Question Answering 上的主要结果

表 1 报告了三个 Grounded LVQA 基准上的结果。VTS 显著优于所有多轮裁剪基线。在 CG-Bench 上,VTS 达到 16.8 mIoU 和 36.4 准确率,相比最强的裁剪基线 LongVT,绝对提升分别为 +12.5 mIoU 和 +19.0 准确率。在 Haystack-LVBench 上,它达到 15.2 T-F1,比 TimeSearch-R 高出 7.1。在 Haystack-Ego4D 上,它达到 18.4 T-F1,比最强基线高出 7.4。VTS 平均每视频需要 4.8 轮,而先前的多轮裁剪方法仅在 1-2 轮内收敛,这证实了裁剪代理会早期确定一个区间,而 VTS 会在多轮中继续探索并自我纠正。VTS 还以较小的开源骨干网络,在 CG-Bench 上比最强的 captioner-LLM 基线(SiLVR)高出 +6.7 mIoU 和 +4.6 准确率。

表 2 显示这些增益并非来自处理更多帧。在 CG-Bench 上,VTS 平均每视频处理 328 帧,少于使用 384 个均匀采样帧的 Qwen3-VL-8B 和使用 450 帧的 SiLVR。尽管如此,VTS 在这些方法中实现了最佳的时序接地和 QA 准确率。

表 2:CG-Bench 上的效率分析。 VTS 在处理更少帧的同时实现了最佳的 mIoU 和 QA 准确率。

| Method | Frames ↓ | mIoU ↑ | Acc ↑ | | :— | :—: | :—: | :—: | | Uniform sampling [1] | 384 | 12.1 | 23.6 | | SiLVR [40] | 450 | 10.1 | 31.8 | | VTS (Ours) | 328 | 16.8 | 36.4 |

5.2 性能增益分析

我们将 VTS 的增益归因于两个组件:跨多个时间尺度的层级搜索,以及使从错误分支中恢复变得显式的离散导航动作。表 3 报告了三个隔离这些成分的受控实验。

树接地动作优于连续裁剪。在相同数据和配方下,用连续的 crop_video 动作替换树接地动作会导致时序接地指标下降 1.3–4.2 点,QA 准确率下降高达 9.8 点,表明树接地动作空间比连续裁剪更有效。

自我纠正至关重要。从树接地动作空间中移除回溯原语 zoom_outshift 会导致所有基准和指标上的性能下降。具体而言,所有数据集上的时序接地下降 2.0–2.9 点,而 QA 准确率下降 1.4–5.4 点,表明显式回溯使代理能够从错误的下降中恢复,从而提高时序接地和答案准确率。此外,我们将 VTS 轨迹中的任何 zoom_outshift 计为自我纠正事件,并将任何连续裁剪轮次中预测区间与上一轮区间 IoU < 0.2 的情况计为类似事件。在所有三个基准上,VTS 在约 60% 的轨迹中进行自我纠正,而在相同数据上训练的连续裁剪基线仅在 7-15% 的轨迹中进行自我纠正。在自我纠正的轨迹中,42.7% 随后到达包含真实证据的节点,表明代理在这些较难案例的相当大比例上实现了恢复。

7

第 8 页

表 4:在 CG-Bench 上的消融研究。我们对 VTS 的三个组件进行消融:树构建、训练流程和轨迹组成。每次消融仅改变一个组件,其余组件保持默认设置。高亮行表示默认 VTS。

| 变体 | mIoU | Acc | | :— | :—: | :—: | | 树构建 | | | | 均匀分割,4 个子节点 | 15.6 | 34.9 | | 均匀分割,16 个子节点 | 13.9 | 33.0 | | 自适应分割,3-8 个子节点(默认) | 16.8 | 36.4 | | 训练阶段 | | | | 零样本(动作空间 + 提示) | 12.8 | 20.9 | | VTS-SFT(+ 合成轨迹) | 14.9 | 30.7 | | VTS-RL(+ 强化学习) | 16.8 | 36.4 | | 轨迹合成 | | | | 仅最优路径轨迹 | 10.4 | 31.3 | | 绕行与恢复轨迹(默认) | 16.8 | 36.4 |

表 5:训练数据源的影响。我们将仅在 LongClueQA 上训练 VTS、在未标注长视频的合成带时间戳 QA 语料库上训练 VTS,与在所有数据源上训练进行对比,后者增加了来自 CG-Bench 和 Haystack-Ego4D 的域内视频。参考行报告了每个基准测试中最强的先前智能体基线(CG-Bench 为 LongVT,Haystack-LVBench 和 Haystack-Ego4D 为 TimeSearch-R)。

| | CG-Bench | | Haystack-LVBench | | Haystack-Ego4D | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | 训练数据源 | mIoU | Acc | T-F1 | Acc | T-F1 | Acc | | 仅 LongClueQA | 15.3 | 28.7 | 14.5 | 57.5 | 16.8 | 53.7 | | 所有数据源 | 16.8 | 36.4 | 15.2 | 58.3 | 18.4 | 66.1 | | 参考:最强的先前智能体基线 | 4.3 | 17.4 | 8.1 | 52.1 | 11.0 | 53.5 |

分层搜索支持各种线索持续时间。用均匀短片段的扁平树替换分层树会导致所有数据集上的 QA 准确率下降 1.9-5.1 个百分点。扁平树仅在 Haystack-Ego4D 上(18.9 对比 18.4 T-F1)实现了比分层树更高的时间接地性能,该数据集的平均线索持续时间最短(9.5 秒)。在另外两个基准测试中,线索持续时间因查询而异,从几秒到几分钟不等(CG-Bench 平均为 19.2 秒,Haystack-LVBench 平均为 96.2 秒),因此没有单一的扁平划分能匹配所有情况。分层搜索使智能体能够导航到适合每个查询的尺度。

5.3 消融研究

我们隔离了 VTS 设计选择的贡献,并考察了该框架在不同训练数据源和骨干网络上的泛化能力。

树构建。 表 4 显示,在 4 个子节点的情况下,自适应分割比均匀分割高出 1.2 mIoU。在 16 个子节点时,差距扩大到 2.9 mIoU,尽管那里的均匀树使用了双倍的节点数。这证实了将边界放置在内容变化点比视频划分的精细程度更重要。

训练阶段。 VTS 在零样本起点的基础上分两个阶段进行训练,表 4 显示每个阶段都有帮助。仅使用动作空间且无训练的零样本变体达到了 12.8 mIoU。在合成轨迹上进行监督微调增加了 +2.1 mIoU,强化学习进一步增加了 +1.9。

轨迹合成。 表 4 显示,在包含故意绕行和恢复的轨迹上进行训练,比仅在最优路径轨迹上进行训练高出 +6.4 mIoU 和 +5.1 准确率。这表明智能体是通过在训练轨迹中接触恢复过程来学习有效搜索的,而不仅仅是通过最优演示。

训练数据源的影响。 我们探讨 VTS 的接地性能有多少来自域内训练视频,有多少仅来自合成数据。我们比较了仅在 LongClueQA 上进行训练,

8

第 9 页

表 6:骨干网络泛化能力。在使用相同的 Qwen2.5-VL-7B 骨干网络时,VTS 在所有基准测试中均优于先前的多轮裁剪智能体。更强的 Qwen3-VL-8B 骨干网络带来了进一步的提升。

| Method | Backbone | CG-Bench mIoU | CG-Bench Acc | CG-Bench T-F1 | Haystack-LVBench Acc | Haystack-LVBench T-F1 | Haystack-Ego4D Acc | | :— | :— | :— | :— | :— | :— | :— | :— | | LongVT [34] | Qwen2.5-VL-7B | 4.3 | 17.4 | 5.4 | 46.2 | 3.7 | 42.1 | | Video-o3 [38] | Qwen2.5-VL-7B | 2.9 | 26.1 | – | – | – | – | | VideoZoomer [7] | Qwen2.5-VL-7B | 3.0 | 18.3 | 6.8 | 48.3 | 5.4 | 48.6 | | TimeSearch-R [18] | Qwen2.5-VL-7B | – | – | 8.1 | 52.1 | 11.0 | 53.5 | | VTS (Ours) | Qwen2.5-VL-7B | 14.5 | 30.7 | 12.3 | 53.1 | 13.1 | 55.3 | | VTS (Ours) | Qwen3-VL-8B | 16.8 | 36.4 | 15.2 | 58.3 | 18.4 | 66.1 |

表 7:通用长视频理解。Video-MME、MLVU 和 LVBench 上的准确率 (%),VTS 的帧数取这三个基准的平均值。VTS 在所有三个基准测试中均优于每一个多轮智能体基线。

| Method | Frames | Video-MME | MLVU | LVBench | | :— | :— | :— | :— | :— | | LongVT [34] | 512–768 | 67.0 | – | 41.3 | | Video-o3 [38] | up to 768 | 66.5 | 51.7 | 47.6 | | TimeSearch-R [18] | 768 | 66.6 | – | – | | VideoZoomer [7] | 128 | 65.2 | 55.8 | 41.5 | | VTS (Ours) | 274 | 67.5 | 58.2 | 54.7 |

完全由未标记的长格式视频生成,与使用所有来源进行训练相比。如表 5 所示,仅在 LongClueQA 上训练的 VTS 已在每个基准测试上超越了最强的先前智能体基线,在 CG-Bench 上 mIoU 提升 +11.0,在 Haystack-LVBench 上 T-F1 提升 +6.4,在 Haystack-Ego4D 上 T-F1 提升 +5.8。加入来自 CG-Bench 和 Haystack-Ego4D 的域内训练视频(all-sources 变体)进一步将接地性能分别提升了 1.5、0.7 和 1.6 分。结果表明,来自未标记视频的带时间戳的合成问答本身就是一个强大的训练信号。

骨干网络泛化能力。为了验证 VTS 的提升不依赖于 Qwen3-VL-8B 骨干网络,我们还在 Qwen2.5-VL-7B 上训练 VTS,这是先前多轮裁剪智能体所使用的骨干网络。在这种匹配骨干网络的设置下(表 6),VTS 相较于最强的 Qwen2.5-VL-7B 裁剪基线,在 CG-Bench 上 mIoU 提升 +10.2、准确率提升 +13.3,在 Haystack-LVBench 上 T-F1 提升 +4.2、准确率提升 +1.0,在 Haystack-Ego4D 上 T-F1 提升 +2.1、准确率提升 +1.8。因此,这些提升源于框架本身而非基础模型,而更强的骨干网络带来了进一步的增益。

5.4 通用长视频理解

我们测试 VTS 的树接地导航策略是否能在 Grounded LVQA 之外泛化到三个通用长视频 QA 基准测试:Video-MME、MLVU 和 LVBench。这些基准测试仅评估 QA 准确率,没有时间接地,因此当智能体回答时,VTS 会汇总其在所有访问节点中观察到的帧,并基于这一汇总集而非单个节点来生成答案。表 7 报告了结果。VTS 在所有三个基准测试中均优于每一个多轮智能体基线:在 Video-MME 上比 LongVT 高 +0.5,在 MLVU 上比 VideoZoomer 高 +2.4,在 LVBench 上比 Video-o3 高 +7.1。因此,尽管主要是在 Grounded LVQA 上训练的,树接地导航策略依然能够泛化到证据定位之外。

5.5 定性分析

图 3 展示了一个六步轨迹,问题询问透过 22 层楼的玻璃窗能看到什么。在第三步,智能体选择了一个错误的分支,向下进入显示建筑物一楼售票处的片段。意识到售票处并非所查询的 22 层楼窗户,智能体发出 zoom_out 指令回到父节点,然后通过另一个子节点重新向下探索,最终找到正确的线索。附录中包含了更多定性示例。

9

第 10 页

问题。在视频中,主角到达了富士电视台的22楼。当他径直走向玻璃窗时,右侧建筑物上的标志牌上写着什么? 选项。A: 北方。B: 南向路径。C: 南方。 线索:861.0s – 871.0s D: 西景。E: 东向路线。F: 东方。G: 东北角。

第1轮

0s 1711s 片段0 片段1 片段2 片段3 片段4 片段5

片段3包含一个场景,显示人们在一个带有楼层标识的现代观景台上,这与主角到达22楼相符。该片段聚焦于高层建筑的城市景观和建筑细节,因此最有可能包含玻璃窗以及右侧建筑物上的标志。 zoom_in (segment=3)

第2轮 zoom_in (segment=0)

第3轮 zoom_in (segment=4)

第4轮

844s 855s 当前片段显示了抵达富士电视台和售票处,但不包括主角走向玻璃窗或右侧建筑物上的标志。玻璃穹顶的视野聚焦于城市景观和天空,而不是问题中提到的具体标志。为了找到相关标志,我需要回溯到父片段,并探索其他可能捕捉到窗口行走场景的兄弟片段。 zoom_out

第5轮

720s 885s 片段0 片段1 片段2 片段3 片段4

片段4展示了一座现代建筑的内部,拥有提供全景视野的大窗户,这与主角到达22楼观景区域相符。该片段最有可能包含主角走向玻璃窗时右侧的具体标志。 zoom_in (segment=4)

第6轮

855s 885s 在视频中,当主角走向玻璃窗时,右侧建筑物上的标志清晰可见,上面写着“北方向”(英文为 “North direction”)。证据区间 [859.9s-872.2s] 包含了该标志处于焦点的时刻,从而确认了答案。 answer (A, 859.9, 872.2)

图3:定性示例:通过 zoom_out 进行恢复。对于关于透过富士电视台大楼22楼窗户能看到什么的问题,智能体首先下降到一个错误的分支,显示大楼一楼的售票处(第1–3轮)。它检测到错误,发出 zoom_out 以返回父节点(第4轮),并探索另一个子节点以找到正确的线索(第5–6轮)。该示例展示了在智能体陷入错误分支后,zoom_out 作为一种显式的恢复操作。

6 结论

我们提出了 VTS,这是一种用于接地长视频问答的树接地智能体框架。 VTS 将视频组织为语义连贯的片段树,并使用离散动作对其进行导航,从而将精确定位和回溯从隐式能力转化为显式可学习的行为。在三个接地长视频问答基准测试中,VTS 显著优于先前的多轮裁剪智能体和 captioner-LLM 基线,并且在迁移到三个通用长视频理解基准测试时效率更高。更广泛地说,我们的结果表明,对长视频进行搜索结构化是长视野视频推理的一种有用的归纳偏置。

10

第 11 页

局限性与未来工作

VTS 存在若干局限性。当前的动作空间针对每个问题仅生成一个证据区间,无法处理其证据分布在多个不相交时间区域的问题。处理此类问题需要在回答之前从多个分支聚合证据。自适应分割依赖于基于 CLIP 的场景边界检测,在视觉同质性较高的视频中可靠性较低,因为此类视频中的场景转换较弱。专为长视频设计的边界检测器可以生成更细粒度的树结构,并带来额外的性能提升。最后,轨迹合成依赖于外部视觉-语言模型和语言模型进行描述和推理,因此训练信号的质量受限于这些模型。随着更强开源模型的可用,我们预计其性能将得到改善。

致谢

本研究由北卡罗来纳州立大学分析科学实验室、ONR 奖项 N00014-23-1-2356、索尼聚焦研究奖项以及 NSF CAREER 奖项 2541848 资助。

第 12 页

参考文献

[1] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等. Qwen3-vl 技术报告. arXiv 预印本 arXiv:2511.21631, 2025.

[2] Shyamal Buch, Cristobal Eyzaguirre, Adrien Gaidon, Jiajun Wu, Li Fei-Fei, 和 Juan Carlos Niebles. 重新审视视频语言理解中的“视频”. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 2022.

[3] Xinye Cao, Hongcan Guo, Jiawen Qian, Guoshun Nan, Chao Wang, Yuqi Pan, Tianhao Hou, Xiaojuan Wang, 和 Yutong Gao. VideoMiner: 通过基于树的组相对策略优化迭代定位长视频的关键帧. arXiv 预印本 arXiv:2510.06040, 2025.

[4] Guo Chen 等. CG-Bench: 面向长视频理解的线索接地问答基准. 在国际学习表征会议 (ICLR) 论文集, 2025.

[5] Lin Chen, Xilin Wei, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Bin Lin, Zhenyu Tang, 等. ShareGPT4Video: 通过改进的标题提升视频理解 和生成能力. 神经信息处理系统进展 (NeurIPS), 2024.

[6] Yukang Chen, Fuzhao Xue, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, 等. LongVILA: 扩展长上下文视觉语言 模型以处理长视频. arXiv 预印本 arXiv:2408.10188, 2024.

[7] Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, 和 Yujiu Yang. VideoZoomer: 用于长视频推理的强化学习时间聚焦. arXiv 预印本 arXiv:2512.22315, 2025.

[8] Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, 和 Xiangyu Yue. Video-r1: 在多模态大语言模型中强化视频推理. arXiv 预印本 arXiv:2503.21776, 2025.

[9] Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, 等. Video-MME: 首个全面评估多模态大语言模型在视频分析中表现的基准. IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2025.

[10] Tanveer Hannan, Md Mohaiminul Islam, Jindong Gu, Thomas Seidl, 和 Gedas Bertasius. ReVisionLLM: 用于长视频时间接地的递归视觉语言模型. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 2025.

[11] Md Mohaiminul Islam 和 Gedas Bertasius. 使用状态空间视频模型进行长电影片段分类. 在欧洲计算机视觉会议 (ECCV), 2022.

[12] Md Mohaiminul Islam, Mahmudul Hasan, Kishan Shamsundar Athrey, Tony Braskich, 和 Gedas Bertasius. 使用状态空间 Transformer 高效检测电影场景. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2023.

[13] Md Mohaiminul Islam, Ngan Ho, Xitong Yang, Tushar Nagarajan, Lorenzo Torresani, 和 Gedas Bertasius. Video ReCap: 长视频的递归描述. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2024.

[14] Md Mohaiminul Islam, Tushar Nagarajan, Huiyu Wang, Gedas Bertasius, 和 Lorenzo Torresani. BIMBA: 用于长程视频问答的选择性扫描压缩. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2025.

[15] Kumara Kahatapitiya, Kanchana Ranasinghe, Jongwoo Park, 和 Michael S. Ryoo. 面向长视频理解的 语言仓库. 在计算语言学协会论文集 (ACL Findings), 2025.

12

第 13 页

[16] Xinhao Li, Ziang Yan, Desen Meng, Lu Dong, Xiangyu Zeng, Yinan He, Yali Wang, Yu Qiao, Yi Wang, and Limin Wang. VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning. arXiv preprint arXiv:2504.06958, 2025.

[17] Yanwei Li, Chengyao Wang, and Jiaya Jia. LLaMA-VID: An image is worth 2 tokens in large language models. European Conference on Computer Vision (ECCV), 2024.

[18] Junwen Pan, Qizhe Zhang, Rui Zhang, Ming Lu, Xin Wan, Yuan Zhang, Chang Liu, and Qi She. TimeSearch-R: Adaptive temporal search for long-form video understanding via self-verification reinforcement learning. arXiv preprint arXiv:2511.05489, 2025.

[19] Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya, Wonjeong Ryu, Donghyun Kim, and Michael S. Ryoo. Too many frames, not all useful: Efficient strategies for long-form video QA. arXiv preprint arXiv:2406.09396, 2025.

[20] Alec Radford et al. Learning transferable visual models from natural language supervision. In ICML, 2021.

[21] Kanchana Ranasinghe, Xiang Li, Kumara Kahatapitiya, and Michael Ryoo. Understanding long videos in one multimodal language model pass. In International Conference on Learning Representations (ICLR), 2025.

[22] Shuhuai Ren, Linli Yao, Shicheng Li, Xu Sun, and Lu Hou. TimeChat: A time-sensitive multimodal large language model for long video understanding. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024.

[23] Michael S. Ryoo, Honglu Zhou, Shrikant Kendre, Can Qin, Le Xue, Manli Shu, Jongwoo Park, Kanchana Ranasinghe, Silvio Savarese, Ran Xu, Caiming Xiong, and Juan Carlos Niebles. xgen-MM-vid (BLIP-3-video): You only need 32 tokens to represent a video even in VLMs. arXiv preprint arXiv:2410.16267, 2025.

[24] Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, Lemeng Wu, Jun Chen, Chenchen Zhu, Zechun Liu, Fanyi Xiao, Balakrishnan Varadarajan, Florian Bordes, et al. LongVU: Spa- tiotemporal adaptive compression for long video-language understanding. arXiv preprint arXiv:2410.17434, 2024.

[25] Enxin Song, Wenhao Chai, Guanhong Wang, Yucheng Zhang, Haoyang Zhou, Feiyang Wu, Haozhe Chi, Xun Guo, Tian Ye, Yanting Zhang, et al. MovieChat: From dense token to sparse memory for long video understanding. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024.

[26] Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, and Qixiang Ye. Adaptive keyframe sampling for long video understanding. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025.

[27] Shihao Wang, Guo Chen, De-an Huang, Zhiqi Li, Minghan Li, Guilin Li, Jose M. Alvarez, Lei Zhang, and Zhiding Yu. VideoITG: Multimodal video understanding with instructed temporal grounding. arXiv preprint arXiv:2507.13353, 2025.

[28] Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Shiyu Huang, Bin Xu, Yuxiao Dong, Ming Ding, and Jie Tang. LVBench: An extreme long video understanding benchmark. arXiv preprint arXiv:2406.08035, 2024.

[29] Xiao Wang, Qingyi Si, Jianlong Wu, Shiyu Zhu, Li Cao, and Liqiang Nie. AdaReTaKe: Adaptive redundancy reduction to perceive longer for video-language understanding. arXiv preprint arXiv:2503.12559, 2025.

[30] Ye Wang, Boshen Xu, Zihao Yue, Zihan Xiao, Ziheng Wang, Liang Zhang, Dingyi Yang, Wenxuan Wang, and Qin Jin. TimeZero: Temporal video grounding with reasoning-guided LVLM. arXiv preprint arXiv:2503.13377, 2025.

[31] Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin, Jaehong Yoon, Feng Cheng, Gedas Bertasius, and Mohit Bansal. VideoTree: Adaptive tree-based video representation for LLM reasoning on long videos. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025.

13

第 14 页

[32] Ziyang Wang, Honglu Zhou, Shijie Wang, Junnan Li, Caiming Xiong, Silvio Savarese, Mohit Bansal, Michael S. Ryoo, and Juan Carlos Niebles. Active video perception: Iterative evidence seeking for agentic long video understanding. arXiv preprint arXiv:2512.05774, 2025.

[33] Haoning Wu, Dongxu Li, Bei Chen, and Junnan Li. LongVideoBench: A benchmark for long- context interleaved video-language understanding. Advances in Neural Information Processing Systems (NeurIPS), 2024.

[34] Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, and Lidong Bing. LongVT: Incentivizing “thinking with long videos” via native tool calling. arXiv preprint arXiv:2511.20785, 2025.

[35] Linli Yao, Haoning Wu, Kun Ouyang, Yuanxing Zhang, Caiming Xiong, Bei Chen, Xu Sun, and Junnan Li. Generative frame sampler for long video understanding. arXiv preprint arXiv:2503.09146, 2025.

[36] Jinhui Ye, Zihan Wang, Haosen Sun, Keshigeyan Chandrasegaran, Zane Durante, Cristobal Eyzaguirre, Yonatan Bisk, Juan Carlos Niebles, Ehsan Adeli, Li Fei-Fei, Jiajun Wu, and Manling Li. Re-thinking temporal search for long-form video understanding. arXiv preprint arXiv:2504.02259, 2025.

[37] Huaying Yuan, Jian Ni, Zheng Liu, Yueze Wang, Junjie Zhou, Zhengyang Liang, Bo Zhao, Zhao Cao, Zhicheng Dou, and Ji-Rong Wen. MomentSeeker: A benchmark for long-video moment retrieval. arXiv preprint arXiv:2502.12558, 2025.

[38] Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, et al. Video-o3: Native interleaved clue seeking for long video multi-hop reasoning. arXiv preprint arXiv:2601.23224, 2026.

[39] Ce Zhang, Taixi Lu, Md Mohaiminul Islam, Ziyang Wang, Shoubin Yu, Mohit Bansal, and Gedas Bertasius. A simple LLM framework for long-range video question-answering. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP), 2024.

[40] Ce Zhang, Yan-Bo Lin, Ziyang Wang, Mohit Bansal, and Gedas Bertasius. SiLVR: A simple language-based video reasoning framework. arXiv preprint arXiv:2505.24869, 2025.

[41] Haoji Zhang, Xin Gu, Jiawen Li, Chixiang Ma, Sule Bai, Chubin Zhang, Bowen Zhang, Zhichao Zhou, Dongliang He, and Yansong Tang. Thinking with videos: Multimodal tool-augmented reinforcement learning for long video reasoning. arXiv preprint arXiv:2508.04416, 2025.

[42] Peiyuan Zhang, Kaichen Zhang, Bo Li, Guangtao Zeng, Jingkang Yang, Yuanhan Zhang, Ziyue Wang, Haoran Tan, Chunyuan Li, and Ziwei Liu. Long context transfer from language to vision. arXiv preprint arXiv:2406.16852, 2024.

[43] Junjie Zhou, Yan Shu, Bo Zhao, Boya Wu, Shitao Xiao, Xi Yang, Yongping Xiong, Bo Zhang, Tiejun Huang, and Zheng Liu. MLVU: A comprehensive benchmark for multi-task long video understanding. arXiv preprint arXiv:2406.04264, 2024

14

第 15 页

附录

我们的附录包含额外实现细节(A节)、评估基准(B节)、数据构建(C节)以及更多定性结果(D节)。

A 额外实现细节

训练细节。我们对 SFT 使用全量微调,对 RL 使用 LoRA 微调,两者均通过 ms-swift 框架进行。对于 SFT,我们将学习率设置为 1e-5,批量大小设置为 16,并训练 2 个 epoch。对于 RL,我们将学习率设置为 5e-5,批量大小设置为 96,并使用 GRPO 进行 1 个 epoch 的训练,每组提示词包含 8 条轨迹。对于每个视频片段,我们以 1 fps 的频率采样帧,最多 64 帧,且每帧的最大分辨率限制为 224 × 224 像素。SFT 和 RL 均在 4 块 H100 GPU 上进行。完整的超参数报告在表 8 中。

表 8:VTS 的 SFT 和 RL 阶段的关键训练超参数。

(a) SFT 阶段 (b) RL 阶段

超参数 值 超参数 值

训练轮数 2 格式奖励权重 0.5 训练批量大小 16 准确率奖励权重 0.5 学习率 1e-5 IoU 奖励权重 1.0 学习率调度器 cosine 最大交互轮次 10 预热比例 0.1 LoRA rank 32 冻结视觉编码器 true LoRA alpha 64 LoRA dropout 0 训练批量大小 96 rollout 温度 1.0 每条提示词的 rollout 数 (n) 8 KL 系数 (β) 0.04 学习率 5e-5 学习率调度器 constant

训练数据。训练数据来源于 CG-Bench 全集(排除 mini 集中的问题)、Haystack-Ego4D 训练集和 LongClueQA。总共,我们有 6,537 个 QA 对,以及来自所有数据源的 6,537 条轨迹。我们随机选取 40% 的轨迹用于 SFT 训练,选取 60% 的 QA 对用于 RL 训练。

自适应片段分割算法。在搜索树的每个节点处,我们将当前片段划分为与视觉场景边界对齐的子片段。算法 1 总结了该过程。我们从当前片段中均匀采样帧,使用 CLIP 图像编码器对每帧进行编码,并计算连续帧嵌入之间的余弦距离,以获得每个位置的边界信号 δ。然后,我们从 δ 的局部统计信息中形成自适应阈值 τ = mean(δ) + k · std(δ),并将 δi > τ 的位置视为边界。我们对边界集进行裁剪,使子节点的数量落在 [Nmin, Nmax] 范围内:如果阈值产生过多的边界,我们保留 δi 最大的那些;如果产生过少的边界,我们添加次大的边界,直到满足最小值要求。

分层树搜索算法。算法 2 描述了推理时的分层搜索。智能体从覆盖整个视频的根片段开始,并维护一个包含以下内容的记忆 M:(i) 迄今为止扩展的部分搜索树,其中每个访问过的节点都有一个标题,以及 (ii) 先前动作及其结果的交互历史。在每一轮中,智能体通过算法 1(或从缓存的树中检索)将当前片段划分为子片段,展示从这些子片段中采样的帧以及 M,并输出动作 {zoom_in, zoom_out, shift, answer}。zoom_in 进入选定的子节点,zoom_out 返回父节点,shift 移动到同一父节点下的兄弟节点。执行动作后,标题生成器 Φ 为每个子片段生成标题,并将这些标题连同推理轨迹和动作一起写入 M。

15

第 16 页

算法 1 自适应片段分割 输入:片段 $S = [t_{start}, t_{end}]$,CLIP 编码器 $E$,阈值系数 $k$,最小/最大子节点数 $N_{min}, N_{max}$ 1: $F \leftarrow \text{sampleFrames}(S)$ ▷ 1 fps 下采样 ≤64 帧 2: $\{e_i\}_{i=1}^n \leftarrow \text{encode}(F, E)$ 3: $\delta_i \leftarrow 1 – \cos(e_i, e_{i+1})$,对于 $i = 1, \dots, n-1$ 4: $\tau \leftarrow \text{mean}(\delta) + k \cdot \text{std}(\delta)$ 5: $B \leftarrow \{ i : \delta_i > \tau \}$ 6: if $|B| + 1 > N_{max}$ then 7: $B \leftarrow \delta$ 中前 $(N_{max} – 1)$ 个值的索引 8: else if $|B| + 1 < N_{min}$ then 9: $B \leftarrow \delta$ 中前 $(N_{min} – 1)$ 个值的索引 10: end if 11: return $\text{splitByBoundaries}(S, B)$ ▷ 在 $B$ 中边界帧的时间戳处切割 $S$

当智能体发出答案时循环终止,返回预测答案 $\hat{y}$ 和证据区间 $[t_s, t_e]$。在实践中,如果检测到导航循环(即智能体再次访问同一节点),算法也会终止。

算法 2 分层树搜索 输入:视频 $V$,问题 $Q$,智能体策略 $\pi$,描述生成器 $\Phi$,最大步数 $T_{max}$ 1: $S \leftarrow [0, \text{len}(V)]$ ▷ 当前节点 2: $M \leftarrow \text{initMemory()}$ ▷ 树结构 + 交互历史 3: for $t = 1, \dots, T_{max}$ do 4: $\{S_1, \dots, S_m\} \leftarrow \text{AdaptiveSplit}(S)$ ▷ 算法 1 5: $O \leftarrow \text{sampleFrames}(\{S_1, \dots, S_m\})$ 6: $(R, A) \leftarrow \pi(O, M, Q)$ ▷ 推理与动作 7: if $A = \text{zoom\_in}(j)$ then 8: $S \leftarrow S_j$ 9: else if $A = \text{zoom\_out}$ then 10: $S \leftarrow \text{parent}(S)$ 11: else if $A = \text{shift}(j)$ then 12: $S \leftarrow \text{sibling of } S \text{ indexed by } j$ 13: else if $A = \text{answer}(\hat{y}, [t_s, t_e])$ then 14: return $\hat{y}, [t_s, t_e]$ 15: end if 16: $C \leftarrow \{\Phi(S_j)\}_{j=1}^m$ ▷ 为每个子片段生成描述 17: $M \leftarrow \text{updateMemory}(M, C, R, A, S)$ 18: end for 19: return $\text{forceAnswer}(O, M, Q)$ ▷ 如果步数预算耗尽

提示结构。我们在下方代码块中展示了在每个决策轮次使用的提示结构。系统提示确立了智能体的角色并列举了四种离散动作,而每轮的用户提示提供了来自当前节点子节点的帧、文本记忆块(树结构、交互历史和导航上下文)以及带有多个选择选项的问题。

16

第 17 页

VTS 智能体提示词

系统提示词:你是一个视频问答智能体,通过分层时序搜索来导航长视频。在每一步中,当前视频片段被划分为不重叠的子片段。你观察每个子片段的帧,并决定以下四种动作之一: 1. zoom_in <segment_id>:以更细的粒度检查子片段。 2. zoom_out:回溯到父片段以探索不同的区域。 3. shift <segment_id>:移动到同一父节点下的兄弟片段。 4. answer <letter> <evidence_start> <evidence_end>:提供问题的答案,以及包含支持证据的时间间隔(以秒为单位)。

用户: 当前片段 [ts-te]: . . . 片段 i [tis-tie]: <frame_timestamp><image> . . . . . .

记忆: 树结构: <带有 [visited]/[current] 标记和简短节点描述的物化树>

交互历史: <过去回合和动作的时间顺序日志>

导航上下文: <树中的当前位置、父节点、有效的 zoom_in 子节点、有效的 shift 兄弟节点>

问题:. . . 选项:A. . . . B. . . . C. . . . . . .

训练动态。图 4 展示了我们最佳的 GRPO 模型在前 150 次更新中的训练动态。准确率奖励和时序 IoU 奖励在训练过程中均有提升。IoU 奖励明显噪声更大,表明时序接地更难优化。

准确率奖励 IoU 奖励 0.65 0.26

0.24 0.60 0.22

0.55 0.20 奖励 奖励 0.18 0.50 IoU 准确率 0.16

0.45 0.14

0.40 0.12 20 40 60 80 100 120 140 20 40 60 80 100 120 140 训练步数 训练步数

图 4:我们最佳模型变体在前 150 次 GRPO 更新期间的准确率(左)和时序 IoU(右)奖励。

推理配置。我们采用 vLLM 框架进行推理,将温度设置为 0,并使用贪婪解码以获得确定性结果。最大交互回合数设置为 10,与训练设置相匹配。我们对所有三个 Grounded LVQA 数据集使用官方评估代码:CG-Bench、Haystack-LVBench 和 Haystack-Ego4D。Haystack-LVBench 和 Haystack-Ego4D 将预测结果评估为一组相关帧索引,而非时间间隔。为了将 VTS 的片段级预测适配到这种帧级评估,我们从预测片段中均匀采样 8 帧作为帧级预测。

17

第 18 页

B 评估基准

CG-Bench-mini(过滤后)。CG-Bench 提供多项选择题及带注释的线索区间。mini 划分包含 3,000 道题目,视频平均时长为 28.5 分钟。在实践中,我们发现原始 mini 划分存在三个问题:(1) 某些问题无需视频输入即可回答;(2) 注释的线索并非唯一证据,因为回答问题所需的信息往往也出现在注释片段之外,因此无需定位该线索即可回答问题;(3) 部分线索注释不准确。我们通过以下顺序应用的四阶段过滤流程来解决这些问题,每个阶段仅将幸存的题目传递给下一阶段。过滤器 1(基于规则)应用无需模型推理的过滤器:(i) 多片段移除,丢弃其真实标签 (GT) 由多个不相交线索片段组成的题目,因为我们的层次化搜索公式假设目标区间是单个连续区间;(ii) 高覆盖率移除,丢弃其 GT 片段覆盖超过完整视频时长 30% 的题目,因为此类题目允许平凡轨迹,并为时间搜索提供很少的监督;(iii) 有效性检查,移除视频时长非正或缺失线索区间的样本。过滤器 2(视频依赖性)移除仅凭问题文本即可回答的题目:我们仅使用问题文本和多项选择选项(无帧)提示 VLM 并进行直接推理,如果预测答案与真实标签字母匹配,则丢弃该题目。过滤器 3(线索充分性)验证注释的 GT 线索是否足够提供信息以回答问题:我们从 GT 片段中以 1 fps 采样帧(每道题目限制为 256 帧),将它们与问题和选项一起输入 VLM,并丢弃 VLM 未能预测正确答案的题目。过滤器 4(线索唯一性)确保 GT 线索是唯一必需的证据:我们从整个视频中排除 GT 片段后以 1 fps 采样帧(限制为 256 帧),并用这些非线索帧提示 VLM,如果预测答案与真实标签字母匹配,则丢弃该题目,因为此类题目为时间接地提供较弱的监督。所有基于 VLM 的过滤器均使用通过 vLLM 服务的 Qwen3-VL-8B-Instruct,温度设置为 0。最终过滤后的集合包含 1,176 道题目,视频平均时长为 28.7 分钟,平均线索时长为 19.9 秒,约占完整视频的 1.2%。

Haystack-LVBench 基于 LongVideoBench 构建。我们使用官方提供的 342 道题目的验证划分,涵盖 114 个视频,平均时长为 22.9 分钟,每道题目包含 1.84 个关键帧。

Haystack-Ego4D 源自 Ego4D。我们使用验证划分,其中包含 1,000 道题目,涵盖 71 个视频,平均时长为 26.2 分钟,每道题目包含 2.17 个关键帧。

C 数据构建

C.1 LongClueQA 数据集

为了训练我们的模型,我们构建了 LongClueQA,这是一个时间接地多项选择题问答数据集,由未标记的 YouTube 长视频构建而成。该数据集作为 VTS 所需的证据搜索行为的训练资源:模型不仅要回答问题,还要识别支持答案的短时间区间。

数据收集。我们首先从 YouTube 收集视频,以获取大量且多样化的真实世界长视频池。我们首先使用多样化的搜索查询进行大规模 YouTube 爬取,并收集了超过 90,000 个候选视频。然后我们执行过滤,选择时长在 10 到 90 分钟之间、内容类型包括教学、叙事、程序、体育和 vlog 风格且包含足够元数据的视频。我们还仅选择具有知识共享 (Creative Commons) 或合理使用许可要求的视频。

为确保最终视频包含有意义的时间结构,我们应用基于 CLIP 嵌入的视觉多样性过滤器。对于每个候选视频,我们稀疏采样帧并计算归一化的 CLIP 特征。然后我们测量采样帧之间的平均成对余弦相似度。我们过滤掉多样性得分较低的视频,因为此类视频更可能包含静态摄像机设置或重复的视觉内容,因此对训练时间接地模型用处较小。

QA 生成。我们通过多阶段流水线生成带时间戳锚定的多项选择题。首先,每个视频被分割为 10 秒的片段。然后我们使用 Qwen3-VL-30B-A3B-

18

第 19 页

图 5:LongClueQA 构建流程概览。收集的 YouTube 视频被分割为 10 秒的片段,并使用 Qwen3-VL 进行描述。随后从描述中生成带有时间线索的多项选择题,并经过筛选以仅保留高质量的问题。

指示模型生成描述该时间片段视觉内容的自由形式描述。描述会附加其开始和结束时间戳。我们随后使用 Qwen3-Next-80B-A3B-Thinking 作为问题生成模型,并将之前提取的描述作为输入,提示其针对每个视频生成三个问题,每个问题附带一个答案以及作为支持线索的相应时间戳。然后,我们在单独的步骤中生成四个干扰项,输入包括问题、答案以及支持线索周围 ±30 秒的描述。干扰项必须具有合理性,与正确答案在语义上相似,并且相对于视频内容明确错误。这产生了一个五选一的多项选择题,挑战模型区分正确答案与合理的替代选项。

C.2 轨迹合成

数据过滤。我们使用三个数据源来生成轨迹:CG-Bench 全集(排除来自 mini 集的问题)、Haystack-Ego4D 训练集和 LongClueQA。CG-Bench 和 LongClueQA 提供真实值(GT)线索片段标注。Haystack-Ego4D 的标注是真实值帧索引。我们通过取标注帧时间戳的最小值和最大值,将这些标注转换为单个片段。然后,我们按照 A 节所述,对所有数据源应用四阶段过滤流程。

轨迹生成。给定一个长视频、一个问题以及真实值证据区间 $[t_{GTs}, t_{GTe}]$,控制器在树中生成导航轨迹。在此过程中的任何时刻,轨迹处于两种状态之一:正确状态,即当前节点与真实值区间重叠;或错误状态,即不重叠。当前状态决定了下一个动作的选择。在正确状态下,我们使用外部评分器(在我们的主要实验中为 Qwen3-VL-8B)对当前节点的每个子节点进行问题相关性评分,并选择得分最高的子节点作为下一个 zoom_in 目标。如果该子节点也包含真实值区间,则轨迹保持在正确状态;否则,它过渡到错误状态。在错误状态下,我们在两个选项之间随机选择:(i) 恢复,即应用导致进入错误分支的动作序列的逆操作(例如,进入错误兄弟节点的 zoom_in 通过 zoom_out 后跟随可选的 shift 到正确的兄弟节点来恢复),或 (ii) 继续,即故意在错误分支中再深入一步,以产生更长的绕行。为了防止无限延长的绕行,如果轨迹在错误状态中连续停留了两个回合,我们强制进行恢复。当模型能够在当前节点以足够准确的证据(mIoU > 0.3)产生正确答案时,或者当进一步下降不再可能时,该过程终止。

19

第 20 页

轨迹统计 图6报告了三个数据源中轨迹长度的分布情况。CG-Bench和LongClueQA的轨迹通常较短(中位数为4步),而Haystack-Ego4D需要更深的搜索(中位数为6步)。这一差距反映了每个数据集时间接地查询的难度:较短的轨迹对应于只需几次粗略的zoom_in即可回答的问题,而较长的轨迹则需要对片段树进行更深的遍历。

图7展示了轨迹生成过程中发出的动作类型的分解情况。ZOOM_IN在每个数据集中都占主导地位,这反映了分层搜索的自上而下性质。ANSWER在每个轨迹中只出现一次,因此其数量反映了数据集的大小。ZOOM_OUT和SHIFT作为纠正性动作,它们的相对频率表明在智能体确定答案之前,初始下降路径需要被修正的频率。

CG-Bench (N=1144) Haystack-Ego4D (N=1130) LongClueQA (N=3692) 200 800 200 175 700 175 150 600 150 125 500 轨迹 of 100 100 400 Number 7550 7550 300200 25 25 100 0 0 0 1 2 3 4 5 6 7 8 9 10 >10 1 2 3 4 5 6 7 8 9 10 >10 1 2 3 4 5 6 7 8 9 10 >10 步数 步数 步数

图6:三个数据源中轨迹长度的分布。对于每个数据集,我们绘制了在给定步数后终止的轨迹数量,其中一步对应于单个智能体动作(ZOOM_IN、ZOOM_OUT、SHIFT或ANSWER)。超过15步的轨迹被视为异常值被丢弃,超过10步的长度被聚合到单个“> 10”区间中。

CG-Bench (N=1144) Haystack-Ego4D (N=1130) LongClueQA (N=3692) 12000 4000 63.5% 63.4% 4000 59.2% 3500 10000 3000 3000 8000

6000 计数 25002000 2000 1500 21.4% 19.6% 16.5% 4000 15.5% 1000 1000 10.2% 8.7% 2000 9.5% 6.8% 500 5.6% 0 0 0 ZOOM_IN ZOOM_OUT SHIFT ANSWER ZOOM_IN ZOOM_OUT SHIFT ANSWER ZOOM_IN ZOOM_OUT SHIFT ANSWER 动作类型 动作类型 动作类型

图7:三个数据源中动作类型的分布。来自三个数据源的所有轨迹中,智能体发出的四种动作类型的计数。

D 更多定性结果

图8–9展示了由VTS生成的另外两个定性结果。图8–9展示了由VTS生成的另外两个定性结果。图8说明了一个更深的九步轨迹,该轨迹使用了两种回溯原语。问题询问放在男人身后桌子上的火鸡有多少只。智能体首先跟随几个zoom_in动作进入一个错误的分支,在该分支中,男人正在往锅里倒液体,但他身后的桌子上没有可见的火鸡。在识别出这个错误后,智能体发出zoom_out以返回父节点,随后发出shift以横向移动到未访问的兄弟节点。这个兄弟节点同时包含桌子上的火鸡和男人,允许智能体终止并给出答案。图9展示了一个简短的两步轨迹,用于回答关于放在柜子上水果类型的问题。在第一步zoom_in中,智能体直接到达同时包含水果和柜子的片段,然后在下一步中终止并给出答案。这代表了证据在粗粒度层面视觉上显著的问题的常见情况,表明当初始下降路径已经正确时,智能体会避免不必要的探索。

20

第 21 页

问题。视频中,戴蓝帽子的男子准备煮汤时,他身后的桌子上放了几只火鸡? 选项。A: 一只。B: 六只。C: 四只。D: 两只。E: 三只。F: 两只。G: 五只。 线索:691.0s – 694.0s

第 1 轮

0s 1711s 片段 0 片段 1 片段 2 片段 3 片段 4 片段 5

片段 1 包含户外烹饪的场景,一名戴着蓝色无檐便帽的人正在搅拌锅,这与男子准备煮汤的描述相符。该片段还包含后续涉及火鸡准备工作的厨房活动,因此对于在他身后的桌子上找到火鸡来说,这是最相关的片段。 zoom_in (segment=1)

第 2 轮 zoom_in (segment=1) 第 3 轮 zoom_in (segment=0) 第 4 轮 zoom_in (segment=2)

第 5 轮 zoom_in (segment=0) 第 6 轮 zoom_in (segment=1)

第 7 轮

595s 611s 当前片段显示男子将液体倒入锅中,但视角集中在烹饪活动上,他身后的桌子上没有可见的火鸡。问题询问的是煮汤期间放在桌子上的火鸡数量,这很可能发生在父片段的不同部分。缩小视图(zoom_out)允许探索可能显示相关场景的兄弟片段。 zoom_out

第 8 轮

578s 642s 片段 0 片段 1 片段 2

当前片段显示男子将液体倒入锅中或使用深炸锅烹饪,但他身后的桌子上没有清晰可见的火鸡。兄弟片段 1 [642.4s-706.7s] 延续了户外烹饪场景,是下一个未访问的区域,可能会揭示他身后的火鸡。 shift (sibling_segment=1)

第 9 轮

642s 705s 在 689.7s 到 696.4s 的视频中,我观察到戴蓝帽子的男子在户外搅拌一个大锅。在他身后,白色桌子上清晰可见三只火鸡,证实了答案。 answer (E, 689.7, 696.4)

图 8:定性示例:通过 zoom_out 和 shift 进行恢复。问题询问男子身后桌子上的火鸡数量。代理首先遵循多个 zoom_in 步骤进入一个错误的分支,该分支显示了男子但没有火鸡(第 1–6 轮)。随后,它通过使用 zoom_out 上升到父节点(第 7 轮),接着使用 shift 横向移动到未访问的兄弟节点(第 8 轮)来恢复。该兄弟节点包含相关证据——男子身后桌子上的火鸡——使代理能够正确回答(第 9 轮)。这一轨迹说明了 zoom_out 和 shift 如何协同工作以从不正确的探索中恢复。

21

第 22 页

问题 水果展示柜第二层托盘上从左到右有哪些水果? 选项 A: 草莓、柠檬、柠檬。B: 葡萄、草莓、草莓。C: 葡萄、柠檬、柠檬。 D: 柠檬、葡萄、柠檬。E: 柠檬、柠檬、葡萄。F: 葡萄、柠檬、草莓。 线索 230.4s – 240.3s

第 1 轮

0s 700s 片段 0 片段 1 片段 2 片段 3 片段 4 片段 5

片段 2 包含一个冷藏展示柜的场景,里面有草莓、葡萄和柠檬,这与关于展示柜上水果的问题直接相关。该片段是唯一展示水果的部分,因此对于检查水果排列最为相关。zoom_in 将允许更仔细地检查,以识别从左到右的具体水果。 zoom_in (segment=2)

第 2 轮

227s 527s 片段 0 片段 1 片段 2 片段 3 片段 4 片段 5

视频显示了水果展示柜的第二层,时间为 227.3s 至 242.1s,其中左侧可见葡萄,中间是柠檬,右侧是更多的柠檬。这种排列在该间隔内的多个帧中一致观察到,证实了从左到右的顺序。 answer (C, 227.3, 242.1)

图 9:定性示例:无需回溯的分层 zoom_in。问题询问放置在柜子里的水果种类。代理在一步 zoom_in(第 1 轮)后直接到达同时包含水果和柜子的相关片段,然后在下一轮(第 2 轮)终止并给出答案。

22

发表评论