E-VQA:通过时空证据掩码实现可解释视频问答

三分钟导读:本文提出E-VQA任务,要求模型在回答视频问题时提供精确的时空证据(时间片段和密集跟踪分割掩码),并通过构建ST-Evidence基准和160k规模的ST-Evidence-Instruct指令微调数据集,显著提升了模型在视觉感知与推理上的可解释性。

英文题目:Evidence-Backed Video Question Answering

论文出处:arXiv 每日论文精选 · arXiv:2607.11862

原始论文:PDF / 论文页面

对应视频标题:E-VQA:通过时空证据掩码实现可解释视频问答|推荐指数:★★★★★

这篇论文解决什么问题?

现有Video LLMs多为黑盒,缺乏可验证的视觉 grounding;现有的可解释性方法依赖文本理由或稀疏边界框,无法捕捉复杂视频动态(如遮挡、非刚性形变),且QA准确率与真实视觉感知之间存在解耦。

核心创新

  • 提出E-VQA新任务,强制模型联合输出语义答案和像素级时空证据。
  • 构建首个经过人工验证的E-VQA基准ST-Evidence,包含生成式和判别式变体。
  • 开发可扩展的自动化数据生成流水线,桥接语义VQA和密集视觉 grounding 数据。
  • 证明仅靠模型缩放无法解决E-VQA,需结合高质量数据和集成训练目标。

方法概览

提出E-VQA任务,要求输出三元组(答案、时间证据、空间证据);构建ST-Evidence基准(含Gen和MCQ变体);设计全自动流水线构建ST-Evidence-Instruct数据集(160k规模),通过Grounding-to-Semantics和Semantics-to-Grounding两条路径合成对齐数据;基于UniPixel架构进行指令微调。

逐图理解论文

方法:E-VQA任务定义

方法:E-VQA任务定义
Fig. 1: E-VQA: Evidence-Backed Video Question Answering. Models provide textual answers to video questions while grounding their reasoning in spatio-temporal evidence, including relevant temporal video segments and densely tracked segmentation masks that highlight the spatio-temporal visual regions supporting the answer.

本文提出E-VQA任务,要求模型在回答视频问题时,必须提供精确的时空证据。具体而言,模型需输出三元组:语义答案、时间证据(相关视频片段)以及空间证据(密集跟踪的分割掩码)。这种设计强制模型将推理过程显式地锚定在具体的视觉区域和时间点上,从而提升推理的可解释性。

基准:ST-Evidence构建

基准:ST-Evidence构建
Table 1: Statistics of our proposed datasets for the E-VQA task.

为支持E-VQA,我们构建了ST-Evidence基准,包含生成式(Gen)和多项选择(MCQ)两种变体。该基准是首个经过人工验证的E-VQA数据集,旨在评估模型生成密集时空证据的能力。通过严格的标注规范,确保时间片段与空间掩码的准确性,为模型评估提供可靠标准。

数据:自动化流水线

数据:自动化流水线
Fig. 2: Overview of our fully automated pipelines for constructing ST-Evidence- Instruct, a 160k-scale dataset for E-VQA instruction tuning.

针对标注成本高昂的问题,我们开发了一套全自动数据生成流水线,构建了160k规模的ST-Evidence-Instruct指令微调数据集。该流水线通过Grounding-to-Semantics和Semantics-to-Grounding两条路径,合成对齐数据,桥接语义VQA与密集视觉Grounding数据,实现了大规模高质量训练数据的自动化生产。

实验:生成式任务评估

实验:生成式任务评估
Table 2: Performance on ST-Evidence-Gen. † indicates closed-source proprietary mod- els. For General Video LLMs, spatial evidence is generated via a proxy segmentation model (UniPixel-3B). Fine-tuning gains are shown relative to the size-matched UniP- ixel baseline (Ours-3B vs. UniPixel-3B; Ours-7B vs. UniPixel-7B).

在ST-Evidence-Gen任务上,我们评估了通用Video LLMs和Grounded Video LLMs。Ours-7B模型在t-mean指标上提升了27.2,J&F指标提升了13.8。值得注意的是,Ours-3B模型在t-mean上达到26.9,甚至优于Qwen2.5-VL-72B,表明数据质量与任务适配比单纯模型规模更重要。

实验:判别式任务评估

实验:判别式任务评估
Table 3: Performance on ST-Evidence-MCQ. † indicates closed-source models.

在ST-Evidence-MCQ任务上,我们进一步验证了模型选择正确时空证据的能力。结果显示,经过E-VQA指令微调的模型在判别式任务上表现显著优于基线。这表明,联合优化语义答案与证据生成,能够有效提升模型对视频内容的深层理解与推理能力,而非仅仅依赖表面特征。

实验与关键结果

  • 在ST-Evidence-Gen和ST-Evidence-MCQ上评估通用Video LLMs和Grounded Video LLMs。
  • 评估微调后的UniPixel基线模型在E-VQA任务及通用视频分割/理解基准上的表现。
  • 通过掩码破坏实验验证标注证据的有效性。
  • 分析模型缩放对性能的影响。
  • Ours-7B在ST-Evidence-Gen上t-mean提升27.2,J&F提升13.8(第 9 页)
  • Ours-3B在ST-Evidence-Gen上t-mean达到26.9,优于Qwen2.5-VL-72B(第 13 页)
  • 自动化流水线生成的掩码J&F得分为62.8(第 14 页)
  • 破坏证据区域导致Gemini-2.5-Flash的QA准确率下降20.20(第 14 页)

阅读时需要注意

  • 通用Video LLMs缺乏原生密集掩码生成头,评估时需依赖代理分割模型,可能引入瓶颈。
  • 现有Grounded Video LLMs在处理需要复杂推理的分割任务时表现不佳。
  • 数据标注成本高昂,尽管有自动化流水线,但基准构建仍依赖人工验证。
  • 评估通用模型时,空间证据得分可能受限于代理分割模型(UniPixel-3B)对文本描述的理解能力,而非模型本身的推理能力。
  • 简单增加模型参数量对时空证据生成的提升有限,架构和数据质量更为关键。

关联工作

  • UniPixel:作为Grounded Video LLM基线,并用作通用模型的代理分割器。(第 9 页)
  • Sa2VA:作为Grounded Video LLM基线进行评估。(第 10 页)
  • Qwen3-VL:作为通用Video LLM基线,展示架构改进带来的提升。(第 10 页)
  • ViCaS:提供带有密集掩码和描述的数据源,用于构建ST-Evidence-Instruct。(第 7 页)
  • NeXT-QA, STAR:提供语义VQA数据源,用于构建ST-Evidence-Instruct。(第 7 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

证据支持的视觉问答

Shijie Wang1,2, Honglu Zhou1, Ziyang Wang1, Ran Xu1, Caiming Xiong1, Silvio Savarese1, Chen Sun2, and Juan Carlos Niebles1

1 Salesforce, Palo Alto, CA, USA 2 Brown University, Providence, RI, USA

摘要。当前的视频大语言模型(Video LLMs)在问答(QA)方面表现出色,但大多作为黑盒运行,仅提供文本答案而缺乏可验证的视觉定位。现有的可解释性研究依赖于文本推理或稀疏的边界框,难以捕捉遮挡和非刚性形变等复杂的视频动态。我们提出了证据支持的视觉问答(E-VQA),这是一项新颖的任务,要求模型同时输出语义答案和精确的时空证据:时间片段以及密集跟踪的对象分割掩码片段(masklets)。为此,我们引入了 ST-Evidence,这是首个经过人工验证的、针对判别式和生成式像素级定位的基准数据集。对最先进模型的评估揭示了一个关键现象:问答准确率与真正的视觉感知之间存在严重的解耦,而单纯扩大规模无法弥合这一差距。为了解决这一问题,我们开发了可扩展的自动化生成流水线,构建了 ST-Evidence-Instruct,这是一个包含 16 万条样本的数据集,旨在弥合高层推理与细粒度定位之间的鸿沟。在该数据上微调具备定位能力的 Video LLMs,相较于相应规模的 UniPixel 基线模型取得了显著提升(例如,在 7B 模型上,t-mean 提升 27.2,J &F 提升 13.8),为可解释的、证据支持的视觉理解建立了稳健的基线。代码和数据可在 https://github.com/SalesforceAIResearch/EVQA 获取。

1 引言

近期的视频大语言模型(Video LLMs)在视频问答(Video QA)基准测试中展现了令人印象深刻的结果。然而,大多数模型仍是黑盒系统,仅提供文本答案,这引发了关于信任度、可解释性和可靠性的重大担忧。由于缺乏可验证的证据,这些模型可能依赖语言先验或产生幻觉,而非真正的视觉感知;当出现错误时,几乎不可能追溯其根源。尽管近期的研究通过基于语言的思维链(Chain-of-Thought, CoT)推理来探索视频推理 [12,16,22,46,47],但这些文本推理往往缺乏具体时空视觉证据的定位支持。这种缺乏可追溯性的问题在高 stakes 领域(如自动驾驶、医疗程序分析和人机协作)中尤为关键,因为这些领域的决策需要严谨的视觉依据。

第 2 页

2 S. Wang 等人

男孩击球 并伤害了那名男子。 答案 [[7.5s, 9.8s]]

1 2 视频大语言模型 时间证据 空间证据

3 4

为什么那名男子摔倒了?

图 1: E-VQA:证据支持的视觉问答(Evidence-Backed Video Question Answering)。模型针对视频问题提供文本答案,同时将其推理依据建立在时空证据之上,包括相关的视频时间片段以及密集跟踪的分割掩码,这些掩码高亮了支持答案的时空视觉区域。

为了弥合语义推理与视觉感知之间的差距,我们认为有效的视频理解需要证据定位(evidence grounding):即能够用相应的时空视觉证据明确地论证答案。现有的基于定位的视频推理工作 [8,30,52] 主要侧重于答案定位(识别构成答案的对象),通常依赖于在有限时间关键帧上空间稀疏的边界框。然而,这种稀疏的定位缺乏捕捉复杂视频动态的精度,例如严重的遮挡、连续的状态变化、非刚性形变(如液体、电线)或通过交叉时的身份保持(例如在猜球游戏中追踪特定的杯子)。我们认为,为了明确验证模型是否感知到了正确的视觉线索,它必须执行密集的、像素级的时空跟踪,作为正式的证据链。 为了形式化这一任务,我们引入了证据支持的视觉问答(Evidence-Backed Video Question Answering, E-VQA)(见图 1)。给定一个视频和一个问题,模型必须生成一个三元组:(i) 语义答案,(ii) 支持性的时间证据(相关视频片段),以及 (iii) 支持性的空间证据,表示为密集跟踪的时空分割掩码(masklets)。通过要求这些组件,E-VQA 显式地将高层推理与底层定位耦合起来。这种形式化迫使模型不仅要解决语言任务,还要提供可验证的、像素级的感知论证。 由于现有数据集不支持此设置,我们引入了 ST-Evidence,这是第一个专门为 E-VQA 设计的基准。ST-Evidence 是通过严格的三阶段半自动流水线构建的:(1) 采样(Sample):从现有的视频问答数据集中选择合适的视频-问题-答案对;(2) 标注(Annotate):人工标注员提供密集的时空证据或拒绝低质量样本;以及 (3) 验证(Verify):独立的人工审核员评估标注质量,并在必要时标记样本以进行重新标注。 由于当前的通用视频大语言模型(General Video LLMs)通常并非为密集、生成式的时空定位而设计,我们提出了两个基准变体: ST-Evidence-Gen:一种生成式设置,要求模型合成完整的三元组,将推理与密集的像素级定位耦合在一起。

第 3 页

证据支持的视觉问答 3

ST-Evidence-MCQ:一种多项选择题形式,模型必须(1)选择正确答案,(2)识别相关的时间片段,以及(3)从候选集中选择正确的空间掩码。该变体侧重于判别性和稀疏定位。

我们评估了领先的通用视频大语言模型,包括 Qwen3-VL [37] 等开源模型以及 OpenAI-o3 [33] 和 Gemini-2.5-Pro [9] 等专有系统。我们在 ST-Evidence-MCQ 上的结果表明,高问答准确率与定位能力之间并不相关;大多数开源模型在空间证据选择上的表现接近随机猜测水平。对于 ST-Evidence-Gen,我们采用了一个两步流水线,其中通用视频大语言模型回答问题、生成时间片段,并以文本形式描述关键证据对象,随后由多模态定位模型(UniPixel [27])解析这些文本以生成交时空掩码。在这种设置下,时间和空间定位得分均较低。即使是专门的定位视频大语言模型,如 UniPixel [27] 和 Sa2VA [55],也难以应对 E-VQA 所需的联合推理任务。我们的综合评估表明,仅靠规模扩展是不足的;E-VQA 的进步需要架构、数据质量和集成训练目标方面的根本性突破。

为了解决这些局限性,我们引入了 ST-Evidence-Instruct,这是一个包含 160k 个(问答对、时间证据、空间证据)三元组的大规模指令微调数据集。虽然先前的数据集要么是纯语义的(问答),要么是定位的(局部化),但我们通过为现有问答对合成对齐的时空证据,并将 masklets 标注的视频重新用于推理任务,填补了这一空白。我们完全自动化的流水线实现了所需三元组的大规模生成。在 ST-Evidence-Instruct 上微调 UniPixel [27] 提高了问答准确率,并在密集定位方面取得了显著增益,验证了我们通过数据驱动方法提升 E-VQA 性能的途径。

我们的主要贡献总结如下:(1)新任务:我们引入了证据支持的视觉问答(E-VQA),该任务要求模型通过联合输出语义答案、时间片段和密集空间 masklets 来提供可验证的理由。(2)综合基准:我们构建了 ST-Evidence,这是第一个 E-VQA 基准,包含经过人工验证的时空注释,涵盖生成式(ST-Evidence-Gen)和判别式(ST-Evidence-MCQ)评估变体。(3)大规模指令微调数据集:我们开发了可扩展的自动化流水线,以弥合语义视频数据和定位视频数据之间的差距,生成了包含 160k 个三元组的 ST-Evidence-Instruct。在当前定位视频大语言模型上使用该数据集进行微调,在联合推理和像素级证据定位方面取得了显著增益。

2 相关工作

视频大语言模型。视频大语言模型将大语言模型扩展至对多模态视频输入进行推理。尽管专有模型(如 GPT-4o [32] 和 o3 [33],Gemini 2.5 [9])和开源模型(如 Video-LLaMA3 [57],InternVL-3.5 [43],Qwen3-VL [37])表现出强大的理解能力,但它们仅生成纯文本

第 4 页

4 S. Wang 等

缺乏视觉依据的回答。为了提升逻辑深度,近期的推理视频大语言模型(Reasoning Video LLMs)应用强化学习(RL)和测试时扩展(test-time scaling)来生成多步推理链(例如,Video-R1 [12]、VideoChat-R1 [22]、Video-RTS [46])。一些新兴模型试图对这些推理链进行定位:VITED [28] 和 Time-R1 [44] 侧重于时间片段,而 Open-O3 Video [30]、SegR1 [54] 及其他模型 [13] 则引入了稀疏边界框或“先思考后分割”(think-before-segment)策略。然而,这些工作通常将定位视为提高文本准确性的中间“草稿”(scratchpad)。相比之下,E-VQA 要求将密集的时空 masklets 作为最终答案三元组的正式组成部分,这需要模型提供像素级的“证明”以展示其底层推理过程。

时空定位视频大语言模型。弥合语言与感知之间差距的努力催生了时间定位视频大语言模型(VTimeLLM [18]、Momentor [36]、VTG-LLM [15]),它们能够预测片段边界,但缺乏空间定位。为了增加空间定位,一些模型(VideoMolmo [1]、NumPro [49]、VGR [42])利用边界框,而像素级模型(Sa2VA [55]、UniPixel [27]、VideoLISA [5]、VideoGLaMM [31]、GLUS [25])则集成分割解码器以生成密集掩码。然而,这些方法通常将定位和问答视为独立的任务,而不是联合解决推理和论证问题。我们通过指令调优来解决这一问题,迫使模型将高层推理与密集的时空跟踪协同起来,从而超越孤立的任务执行。

视频问答与定位数据集。现有数据集尚未完全支持密集的、有证据支持的推理。语义数据集,如 NeXT-QA [50] 和 STAR [48],侧重于因果推理,但缺乏定位标注。相反,近期出现了定位视频数据集,如 NeXT-GQA [51]、V-STaR [8]、VideoEspresso [16] 和 CG-Bench [7],以及指代理解视频数据集(例如,SAMA [40]、VideoRefer [56] 和 Strefer [58])。早期的定位视频问答工作以不同形式暴露支持性证据:STAIR [45] 审计中间时空结果,TranSTR [23] 选择与问题关键相关的时刻和对象作为理由,而 TVQA+ [20] 则通过时间片段和稀疏边界框增强视频问答。相比之下,E-VQA 要求将时间片段和密集跟踪的 masklets 作为最终输出的组成部分,而不是作为中间或稀疏的理由。特定领域的努力还包括 EgoMask [24] 和 InterRVOS [19]。然而,E-VQA 在两个关键方面有所不同:(a) 证据与答案定位:以往的工作主要关注答案定位(定位作为答案的视觉实体),而 E-VQA 要求证据定位——定位逻辑上导致答案的视觉线索。(b) 密集与稀疏表示:大多数现有基准依赖于稀疏标注(关键帧上的片段或边界框)。正如 E-VQA 所示,这些对于复杂的视频动态(如严重遮挡、连续状态变化和非刚性物体交互)是不足的。我们的 ST-Evidence 基准将高层推理与密集证据生成统一起来,要求以 6 FPS 的频率跟踪 masklets,从而建立了将语言逻辑与可验证视觉事实绑定在一起的严格标准。

第 5 页

证据支持的视觉问答 5

3 证据支持的视觉问答

我们提出证据支持的视觉问答(E-VQA)。 与仅预测答案 $A$ 的标准视频问答(VQA)不同,E-VQA 要求模型 $F$ 针对给定的视频 $V$ 和问题 $Q$,通过统一三元组 $(A, E_t, E_s)$ 为其预测提供依据。支撑时空证据定义如下: 时间证据 ($E_t$):一组不重叠的时间段,包含回答 $Q$ 所需的关键时间跨度:

$E_t = \{[start_i, end_i]\}_{i=1}^{N_t}$.

空间证据 ($E_s$):与推理过程相关的关键对象或区域,表示为时空掩码(即“masklets”)。 通过要求模型将推理依据具体化到特定的时空区域,E-VQA 减轻了对静态语言先验(即“语言偏差”)的依赖,并显著增强了视频理解模型的可解释性。

3.1 基准设计:ST-Evidence

为了严格评估模型在 E-VQA 任务上的表现,我们引入了 ST-Evidence。 该基准通过半自动的三阶段流水线——采样(Sample)、标注(Annotate)和验证(Verify)——构建,以确保高质量且经人工验证的证据。 (1) 采样(Sample)。我们从现有的语义视频问答基准的验证集和测试集中采样高质量的视频-问题对,包括 NeXT-QA [50]、Perception Test [34]、STAR [48]、CLEVRER [53] 和 Ego4D [14]。由于并非所有样本都适用,我们采用视觉语言模型(VLM)作为初始过滤器。过滤标准包括:(i) 视频质量清晰且时长适当(5–200 秒),(ii) 时间证据既不覆盖整个视频也不仅涉及单帧,(iii) 问题具体且可通过视觉确定。 (2) 标注(Annotate)。通过 VLM 过滤的样本被分配给人工专家。在提供视频、问题和真实答案的情况下,标注人员的任务是:(i) 识别所有关键的时间证据片段,以及 (ii) 为每个证据对象标注时空跟踪分割掩码。掩码以 6 FPS 的帧率进行密集标注,这是 prominent 视频分割数据集(如 DAVIS [35])中使用的标准采样率,旨在平衡细粒度的时间分辨率与标注的可行性。标注人员还会过滤掉任何剩余的模糊或主观样本。 (3) 验证(Verify)。最后,所有标注均由博士级研究人员进行审核。任何次优的标注都会被标记并重新标注,以确保基准在评估精确证据定位时保持严格的标准。 鉴于密集掩码标注极其耗费人力,我们通过从 ViCaS [3] 的验证集中获取数据来补充我们的基准,该数据集包含人工标注的密集掩码和描述。我们使用 VLM 根据视频和密集描述生成问题、答案和干扰选项。然后,人工标注人员过滤不合适的问答对,标注时间证据,并将正确的空间证据映射到现有的

第 6 页

6 S. Wang et al.

人工标注的 ViCaS 对象掩码。我们使用 Qwen3-VL-235B-A22B [37] 作为 VLM。

基准变体。我们提出了用于生成式像素级定位的 ST-Evidence-Gen 和用于多项选择判别式定位的 ST-Evidence-MCQ。这些不同的格式适应广泛模型架构,通过开放式合成和结构化选择来评估 E-VQA。

ST-Evidence-Gen(生成式)要求模型生成完整的三元组 (A, Et, Es)。这包括从选项列表中选出正确答案 A,预测时间片段 Et(开始/结束时间戳),并生成空间证据 Es(作为 masklets)。我们通过准确率评估 A;使用时域交并比 (tIoU) 和预测交并比 (IoP) 评估 Et;并通过标准的 J &F 指标评估 Es,以共同考量区域相似度 J 和轮廓精度 F。详见补充材料。

ST-Evidence-MCQ(多项选择题)旨在服务于未显式训练用于生成式定位的通用 Video LLMs。在此设置中,所有三个子任务均表述为多项选择题,要求模型:(1) 从选项列表中选出正确答案 A,(2) 从候选片段集合中选出正确的时间证据 Et,以及 (3) 从候选掩码集合中选出正确的空间证据 Es。

对于时间证据,我们使用 Qwen3-VL-235B-A22B [37] 生成合理但故意错误的干扰项,确保它们在语义上相关,但与真实片段的重叠最小。

对于空间证据,我们首先采样真实证据片段的中间帧作为参考帧;对应的标注掩码作为答案。为了确保高质量并保持任务挑战性,我们随后手动标注三个合理但不正确的对象掩码作为干扰选项,以构建四选一多项选择题。

所有三个子任务均使用标准准确率进行评估。

4 指令微调数据构建

有效的时空推理需要大规模的训练数据,将问答与密集的定位标注对齐。现有数据集通常分为两类:语义型和定位型。语义型数据集(例如视频问答)侧重于整体理解,但缺乏定位;而定位型数据集(例如时间或空间定位)侧重于细粒度感知和定位精度,往往以牺牲复杂推理为代价。

证据支持的视觉问答(E-VQA)任务统一了这两种范式,要求同时具备高层语义推理和细粒度时空定位。这种双重需求使得从头开始进行大规模数据标注变得极其困难且成本高昂。因此,为了支持未来的 E-VQA 研究,我们提出了可扩展的数据标注流水线,旨在通过利用现有的语义和定位视频理解数据集来构建 E-VQA 训练数据集。

第 7 页

证据支持的视觉问答 7

问:为什么杯子会掉到地板上? QWen3-VL 答:猫把它打下来了 证据:白猫,紫色杯子 Gemini-2.5-pro 置信度:5 空间证据 问答生成 问:猫接下来会做什么? SAM-2 答:跳下来 [2.3s – 5.8s] 一只白猫在室内房间的桌子上嗅闻一个紫色杯子。 证据:白猫 时间证据 然后它把紫色杯子打翻到地板上,导致里面的三个黄色 球掉出来。 过滤 (a) 利用现有的掩码标注

答案:1 次 指代表达:手,书 时间戳:0s, 2s 空间证据 自洽性检查 “玩具车”,2s 证据 对象 检查 [0s – 1s] 识别 答案:3 次 [4s – 6s] 指代表达:手,玩具车 边界框 [8s – 9s] 问:这个人把桌上的物体扔出去了几次? 时间戳:0s, 2s 生成 时间证据 “手”,0s 答:3 次 时间生成证据

(b) 利用现有的问答对 图 2:我们用于构建 ST-Evidence-Instruct 的完全自动化流水线概览,这是一个用于 E-VQA 指令微调的 16 万规模数据集。 表 1:我们提出的 E-VQA 任务数据集的统计信息。

名称 # 问题 # 视频 数据来源 时间标注 掩码标注

ST-Evidence-MCQ 1298 348 NeXT-QA 人工 人工 ST-Evidence-Gen 2706 2548 Perception Test, STAR, CLEVRER, ViCaS, Ego4D 人工 人工 ST-Evidence-Instruct 160k 30k Perception Test, STAR, CLEVRER, ViCaS 模型 模型 + 人工

数据来源与统计信息。我们通过聚合两个基准类别的样本来构建训练数据集:(1) 视频问答和 (2) 视频分割。具体而言,作为我们流水线的来源,我们从 Perception Test [34]、STAR [48] 和 CLEVRER [53] 的训练集中采样了 2 万个视频-问题对。我们还从 ViCaS [3] 的训练集中采样了 2 万个带有详细描述和分割掩码的视频。表 1 总结了数据统计信息。

4.1 自动数据构建流水线

E-VQA 数据集中的每个样本都被表述为一个元组 $(V, Q, A, C, E_t, E_s)$,包含视频 $V$、问题 $Q$、答案 $A$、可选的候选选项 $C$、时间证据 $E_t$(时间段)和空间证据 $E_s$(密集视频 masklets)。为了大规模构建这些数据,我们根据源数据类型设计了一种双向、多步生成范式(如图 2 所示)。

路径 1:接地到语义(利用现有掩码)。对于已经包含密集描述和与自然语言对象短语(即指代表达)配对的像素级对象掩码的数据集(如 ViCaS [3]),我们采用生成-验证流水线来合成接地问答对,如图 2(a) 所示。 (1) 生成。ViCaS 提供人工编写的描述,其中短语接地链接到对象掩码。我们利用两个 VLM(Qwen3-VL 和 Gemini)独立生成包含以下内容的元组:问题 $Q$、答案 $A$

第 8 页

8 S. Wang et al.

包含干扰选项 C、相关证据对象(具体而言,对象短语)、置信度分数以及简要解释。模型以视频、真实描述(ground-truth captions)和候选对象列表为条件。我们采用严格的提示策略(详见补充材料),以确保问题可回答且基于所提供的对象进行 grounding。对于每个视频,每个模型生成三到四个候选问题,通常总共产生六到八个候选项。 (2) 过滤。我们采用两阶段质量控制流程。首先,我们丢弃存在格式错误(例如,缺失答案、幻觉生成的证据对象)或置信度分数较低(< 35)的样本。其次,我们使用 Gemini-2.5-Pro 进行纯文本验证,该模型审查描述、对象候选项、生成的问答、证据对象和解释,以接受或拒绝每个样本。 (3) 证据分配。对于每个被接受的“视频-问题”对,我们再次查询 Qwen3-VL 以预测时间证据 $E_t$。值得注意的是,在此阶段,我们以比问题生成阶段(2 FPS)更高的帧率(4 FPS)处理视频,以捕捉更细微的时间动态。最后,空间证据 $E_s$ 直接源自与已识别证据对象对应的预存在 ViCaS 掩码标注。 路径 2:语义到接地(利用现有问答)对于包含复杂问答对但缺乏视觉接地的语义数据集,主要挑战在于生成支持性证据($E_t$ 和 $E_s$)。虽然时间证据 $E_t$ 使用路径 1 中描述的方法生成,但从复杂问题生成准确的空间掩码 $E_s$ 仍然并非易事。推理模型与接地模型之间存在显著的领域差距。推理模型(通常在 VQA 上训练)擅长处理复杂查询,但缺乏细粒度的空间输出能力(即,它们通常生成纯文本输出)。相比之下,接地模型(通常在定位任务上训练)产生精确的像素级预测,但仅限于简单的指代表达式或视觉提示,在复杂推理任务上表现不佳。为了弥合这一差距,我们提出了一种三步分解管道,利用这两种范式的优势,如图 2(b) 所示: (1) 证据对象识别。我们首先使用 Qwen3-VL-235B-A22B 识别回答问题所需的具体对象。为了确保质量,我们采用一个直观原则:理想的证据对象是最有可能导致正确答案的对象。我们提示 VLM:(i) 列出唯一描述关键对象的指代表达式,(ii) 提供每个对象清晰可见的时间戳,以及 (iii) 基于这些对象回答原始问题。如果生成的答案与真实值匹配,则接受该证据。我们允许最多五次重新提示尝试;如果模型在五次尝试内未能预测出正确答案,则丢弃该样本。 (2) 边界框生成。给定已验证的指代表达式及其关联的时间戳,我们提取相应的帧并提示 Qwen3-VL 为每个对象预测空间边界框。为了确保下游跟踪的鲁棒性,我们应用过滤机制以去除退化预测。具体而言,我们丢弃表现出退化的边界框

第 9 页

证据支持的视觉问答 9

表 2:ST-Evidence-Gen 上的性能。† 表示闭源专有模型。对于通用视频大语言模型,空间证据通过代理分割模型(UniPixel-3B)生成。微调增益是相对于大小匹配的 UniPixel 基线显示的(Ours-3B 对比 UniPixel-3B;Ours-7B 对比 UniPixel-7B)。

| 方法 | QA | T-Evidence | | | S-Evidence | | | | :— | :— | :— | :— | :— | :— | :— | :— | | | | acc | mIoU | mIoP | t-mean | J | F | J &F | | 通用视频大语言模型 + 分割模型 (UniPixel-3B) | | | | | | | | | | OpenAI-o3† [33] | 82.6 | 30.6 | 41.6 | 36.1 | 39.4 | 44.4 | 41.9 | | Gemini-2.5-Flash† [9] | 81.2 | 27.2 | 43.1 | 35.2 | 40.5 | 45.4 | 42.9 | | Gemini-2.5-Pro† [9] | 83.7 | 42.8 | 57.1 | 49.9 | 41.8 | 46.3 | 44.0 | | Video-LLaMA3-7B [57] | 51.0 | 13.7 | 18.9 | 16.3 | 12.3 | 14.2 | 13.2 | | LLaVA-OV-1.5-8B [2] | 67.7 | 13.6 | 26.9 | 20.3 | 35.5 | 40.1 | 37.8 | | InternVL-3.5-8B [43] | 72.0 | 17.5 | 27.8 | 22.6 | 33.7 | 39.7 | 36.7 | | Qwen2.5-VL-3B [4] | 72.4 | 21.8 | 27.4 | 24.6 | 29.6 | 33.5 | 31.6 | | Qwen2.5-VL-7B [4] | 73.4 | 18.1 | 28.5 | 23.3 | 27.7 | 30.9 | 29.3 | | Qwen2.5-VL-72B [4] | 76.2 | 20.5 | 30.1 | 25.3 | 36.6 | 42.3 | 39.5 | | Qwen3-VL-4B [37] | 76.9 | 33.0 | 44.3 | 38.6 | 37.6 | 42.3 | 39.9 | | Qwen3-VL-8B [37] | 78.2 | 30.5 | 43.3 | 36.9 | 39.0 | 43.3 | 41.1 | | Qwen3-VL-235B-A22B [37] | 83.6 | 38.4 | 50.6 | 44.5 | 39.6 | 44.1 | 41.9 | | 接地视频大语言模型 | | | | | | | | | | Sa2VA-Qwen2.5-VL-7B [55] | 76.8 | 0.0 | 0.0 | 0.0 | 23.5 | 28.8 | 26.2 | | UniPixel-3B [27] | 72.2 | 4.5 | 8.6 | 6.5 | 40.2 | 45.2 | 42.7 | | UniPixel-7B [27] | 75.0 | 1.4 | 2.4 | 1.9 | 38.3 | 42.4 | 40.3 | | Ours-3B | 72.4(+0.2) | 20.6(+16.1) | 33.2(+24.6) | 26.9(+20.4) | 51.2(+11.0) | 54.3(+9.1) | 52.7(+10.0) | | Ours-7B | 76.0(+1.0) | 21.1(+19.7) | 37.1(+34.7) | 29.1(+27.2) | 52.8(+14.5) | 55.4(+13.0) | 54.1(+13.8) |

极端面积比例(< 1% 或 > 90%)、异常长宽比,或与相邻采样帧中对象边界框相比存在严重的空间不一致性。 (3) 密集掩码传播。最后,我们利用 SAM-3 [6] 在整个视频体积上传播密集的时空分割掩码,使用经过验证的多帧边界框作为提示输入。为了消除冗余并确保一组简洁的空间证据,我们应用后处理过滤器来去重高度重叠的 masklets(IoU > 0.9)。 该流水线产生了 ST-Evidence-Instruct,这是一个包含 16 万规模的对齐 (Q, A, Et, Es) 元组的数据集,为训练能够进行可解释的、证据支持的视频推理的模型提供了必要的数据基础。

5 实验

我们在 E-VQA 任务上使用 ST-Evidence 基准评估模型,涵盖两类:通用视频大语言模型和接地视频大语言模型。 通用视频大语言模型。这些模型旨在进行广泛的 multimodal 理解,主要输出文本。对于闭源模型,我们选择了三个最先进的多模态大语言模型:OpenAI-o3、Gemini-2.5-Flash 和 Gemini-2.5-Pro 作为代表。我们还评估了多个最近的开源 MLLMs [2, 4, 37, 43, 57],参数量从 3B 到 235B 不等。值得注意的是,虽然一些通用模型(例如 Gemini 和 Qwen3-VL)支持通过预测边界框或掩码作为字符串来实现图像级接地,但它们

第 10 页

10 S. Wang 等

表 3:ST-Evidence-MCQ 上的性能。† 表示闭源模型。

方法 QA-acc T-Evidence-acc S-Evidence-acc 随机猜测 20.00 25.00 25.00 通用视频大语言模型 OpenAI-o3† [33] 81.21 50.67 84.32 Gemini-2.5-Flash† [9] 80.43 78.81 36.29 Gemini-2.5-Pro† [9] 82.82 70.88 81.28 Video-LLaMA3-7B [57] 67.64 48.84 27.12 LLaVA-OV-1.5-8B [2] 69.03 66.02 23.42 InternVL-3.5-8B [43] 79.04 58.17 27.43 Qwen2.5-VL-3B [4] 71.42 45.69 26.35 Qwen2.5-VL-7B [4] 74.65 27.12 46.15 Qwen2.5-VL-72B [4] 79.04 45.38 71.80 Qwen3-VL-4B [37] 76.44 63.41 77.04 Qwen3-VL-8B [37] 77.81 70.34 76.43 Qwen3-VL-30B-A3B [37] 81.14 71.54 67.04 Qwen3-VL-235B-A22B [37] 81.59 70.96 86.90 接地视频大语言模型 Sa2VA-Qwen2.5-VL-7B [55] 62.40 34.21 23.04 UniPixel-3B [27] 68.57 45.45 24.88 UniPixel-7B [27] 74.04 35.29 22.03

由于长度和效率限制,无法直接生成跟踪的视频掩码。 接地视频大语言模型。我们评估了两个专门用于分割的最新方法:Sa2VA [55] 和 UniPixel [27]。这些模型将 SAM-2.1 [38] 作为分割头配备给多模态大语言模型,从而实现同时进行的文本推理和像素级视频掩码预测。

5.1 ST-Evidence 上的评估

我们对基线模型在我们的基准测试的两个变体上进行了全面评估。ST-Evidence-Gen 要求模型直接预测时间片段和对象掩码,而不是从选项中选取。时间片段按照上述相同的格式生成文本字符串。对于空间证据,接地视频大语言模型可以直接生成掩码。然而,由于通用视频大语言模型缺乏原生的密集掩码生成头,我们采用两步代理评估法来处理空间证据:视频大语言模型首先为证据对象生成文本指代表达式,然后将其输入到冻结的视频分割模型(UniPixel-3B)中以生成最终掩码。为了评估模型对答案和证据进行联合推理的能力,通用视频大语言模型在单次推理传递中进行评估,并被提示同时输出答案、时间片段和空间指代表达式。然而,由于当前的接地大语言模型通常在处理长多任务指令和严格输出格式方面存在困难,我们采用顺序多轮对话策略对其进行评估,其中前一步骤的指令和输出作为后续子任务的上下文。

第 11 页

证据支持的视觉问答 11

表 4:在视频分割和通用理解基准上的性能。 增益或损失是相对于大小匹配的 UniPixel 基线而言的。

分割 (J &F) 理解 (准确率) 方法 参数量 MeViSu Ref-DAVIS17 ReVOS MVBench VideoLISA 3.8B 51.7 68.8 – – VISA 7B – 70.4 47.1 – Sa2VA 4B 52.1 73.8 53.2 – UniPixel 3B 59.7 74.2 62.1 62.5 UniPixel 7B 61.7 76.4 63.9 64.3 Ours 3B 61.8(+2.1) 74.0(-0.2) 62.7(+0.6) 62.3(-0.2) Ours 7B 62.5(+0.8) 77.8(+1.4) 64.2(+0.3) 65.6(+1.3)

在 ST-Evidence-MCQ 上,我们将三个子任务视为独立的多选题。首先,对于答案预测 (A),模型接收视频、问题和候选答案,并必须选择正确的选项。其次,对于时间证据 (Et),我们提供视频、原始问题以及四个格式化为文本字符串的候选时间片段(例如,“A. [[s1, e1], . . . ]”),查询模型以识别最能支持答案的时间间隔。最后,对于空间证据 (Es),我们将选项构建为四张不同的图像,每张图像都在目标帧上可视化一个候选掩码并叠加红色边界。模型接收视频、问题以及这四张视觉选项,并必须选择高亮显示作为证据的正确对象的选项。

5.2 ST-Evidence 上的实验结果

ST-Evidence-Gen 和 ST-Evidence-MCQ 上的评估结果分别如表 2 和表 3 所示。 ST-Evidence-Gen 上的性能。表 2 详细列出了模型在三个子任务上的性能。Gemini-2.5-Pro 在 QA 和时间证据 (Et) 方面领先,尽管其 t-mean 为 49.9,仍有巨大的提升空间。在开源通用视频大语言模型中,Qwen3-VL 系列相比 Qwen2.5-VL 表现出显著的提升。这种提升可能归因于其新颖的文本-时间戳对齐机制,该机制采用交错的“时间戳-帧”输入格式,以实现时间信息与视觉内容之间的细粒度对齐,从而直接有利于时间证据预测。因此,Qwen3-VL-235B-A22B 在 Et 上取得了第二好的性能。 关于空间证据 (Es),即使是最强的通用视频大语言模型也仅获得 44.0 的 J &F 分数:Gemini-2.5-Pro 以 44.0 排名第一,其次是 Gemini-2.5-Flash 的 42.9,而 Qwen3-VL-235B-A22B 是最强的开源通用视频大语言模型,得分为 41.9。这凸显了现有模型的一个固有局限性:它们往往依赖语言先验或捷径,而不是将答案建立在具体的视觉证据之上。转向接地视频大语言模型,Sa2VA-Qwen2.5-VL-7B 实现了 76.8% 的 QA 准确率,但在时间片段上完全失败

第 12 页

12 S. Wang 等人

(0.0 mIoU)。其较低的 S-Evidence 分数进一步表明,在处理需要复杂推理而非简单短语定位的分割任务时存在弱点。同样,尽管 UniPixel-3B 能够生成时间输出,但其表现不佳反映了训练过程中缺乏显式的时间监督。在 S-Evidence 上,UniPixel-3B 达到了 42.7 J &F,优于所有开源通用视频大语言模型(General Video LLMs)和 OpenAI-o3,但仍低于 Gemini-2.5-Pro 和 Gemini-2.5-Flash。总体而言,这些结果突显了当前模型在执行可靠的时空证据支持的视频问答(E-VQA)方面面临的重大挑战。

ST-Evidence-MCQ 上的表现。在多项选择题设置中(表 3),大多数通用视频大语言模型实现了具有竞争力的问答准确率(约 68%–83%)。虽然所有三个闭源模型的表现均稳定在 80% 左右,但 Gemini-2.5-Pro 达到了最高的问答准确率(82.82%),而开源模型 Qwen3-VL-235B-A22B 也极具竞争力(81.59%)。然而,一个关键的观察结果是,相当的问答表现并不意味着相似的定位能力。例如,尽管 Video-LLaMA3-7B 和 LLaVA-OV-1.5-8B 的问答分数相近(分别为 67.64% 和 69.03%),但它们在时间证据准确率上存在显著的 17.18 分差距。关于空间证据,OpenAI-o3 展现出比 Gemini-2.5-Flash 强得多的视觉定位能力,而 Gemini-2.5-Pro 也表现具有竞争力。在开源基线模型中,Qwen-VL 系列——特别是最新的 Qwen3-VL 模型——在识别证据对象方面表现出持续强劲的性能。相比之下,大多数其他模型的表现接近随机猜测基线(∼25%),这凸显了广泛缺乏区分正确和错误空间区域的细粒度判别能力。值得注意的是,Qwen3-VL-235B-A22B 提供了最强的整体开源性能,取得了最佳的开源问答和 S-Evidence 分数,而 Qwen3-VL-30B-A3B 则取得了最佳的开源 T-Evidence 分数(71.54)。Gemini-2.5-Flash 实现了最强的整体 T-Evidence 性能(78.81)。

模型缩放的影响。我们使用 Qwen2.5-VL 和 Qwen3-VL 系列在 ST-Evidence-Gen 上分析了模型缩放的影响。虽然在同一系列内增加模型规模一致地提高了问答准确率,但时间证据和空间证据的提升微乎其微。相反,跨代比较揭示了显著的提升。当比较规模相似的模型时(例如 Qwen2.5-VL-3B 与 Qwen3-VL-4B),新一代模型在所有指标上均显示出明显的改进。最引人注目的是,紧凑型的 Qwen3-VL-4B 在每一项指标上都匹配或超越了庞大的 Qwen2.5-VL-72B,其中 T-Evidence 的改进最为显著。这表明简单的参数缩放不足以解决 E-VQA 任务。相反,模型架构、数据质量和训练目标方面的根本性进步才是性能提升的主要驱动力。

5.3 E-VQA 任务的基线模型

为了验证我们自动化标注流程的有效性以及所提出的 ST-Evidence-Instruct 数据集的质量,我们训练了一个基线模型

第 13 页

证据支持的视觉问答 13

基于 UniPixel 架构构建。具体而言,我们对 UniPixel 的 3B 和 7B 变体进行微调,这些变体将 Qwen2.5-VL (3B/7B) 作为基础多模态大语言模型 (Multimodal LLM),并将 SAM-2.1-Base+ 作为掩码解码器。 为了防止过拟合特定的 E-VQA 任务并保留通用能力,我们遵循 UniPixel 的训练配方,将现有的视频分割数据集 [3,10,11,35,39,41,52,55] 和通用视频理解数据集 [26,29] 纳入训练混合数据中。我们采用 LoRA [17] 来高效地微调视觉编码器和 LLM,而掩码解码器则进行全参数训练。该模型通过最小化下一词元预测损失(用于 QA 和时序片段)与掩码解码损失 [38](用于空间证据)的组合,联合预测答案、时序片段和证据对象掩码。 定量结果展示在表 2 的最后一行。与原始 UniPixel 基线相比,我们微调后的模型在 QA 准确率上略有提升,但在时序证据 (Temporal Evidence) 和空间证据 (Spatial Evidence) 方面均取得了显著改进。值得注意的是,在 T-Evidence 上,我们的 3B 模型取得了 26.9 的具有竞争力的分数,优于显著更大的 QWen2.5-VL-72B。在 S-Evidence 上,我们的 3B 和 7B 模型均显著优于所有其他基线。这些结果验证了我们标注流程的有效性,并展示了我们的 ST-Evidence-Instruct 数据集在推动未来时空证据定位研究方面的潜力。 我们还在几个视频分割和通用视频理解基准 [11, 21, 35, 52] 上进一步评估了我们的模型,并在表 4 中将其与其他基于定位的 Video LLM 进行了比较。我们的 7B 模型在分割和通用理解任务上均持续超越所有基线模型。这些结果表明,我们的模型不仅在提出的 E-VQA 任务中表现出色,而且保留了强大的像素级和语义级能力。

5.4 消融实验与深入分析

标注的证据真的是证据吗?我们检查标注的证据对象掩码是否真正包含支持答案的证据,而不仅仅是显著但非必要的区域。我们在 ST-Evidence-Gen 的 200 个样本子集上,使用两个代表性的通用 Video LLM(Gemini-2.5-Flash 和 Qwen3-VL-8B)进行了实验。对于每个模型,我们评估了三种设置:(1) 原始 (Original),使用未修改的视频;(2) 证据掩码破坏 (Evidence Mask Corruption),其中标注的证据区域被像素化以使其在视觉上不可识别;(3) 非证据掩码破坏 (Non-evidence Mask Corruption),其中随机选择的非证据区域使用相同的程序进行像素化。如果标注确实捕捉到了证据对象,那么在证据破坏下的 QA 性能下降幅度应远大于非证据破坏下的下降幅度。如表 5 所示,破坏证据对象会导致 QA 大幅下降,而破坏非证据对象仅导致两个模型的轻微下降。这一结果支持了我们任务制定的有效性以及证据标注的可靠性。 代理分割器是评估瓶颈吗?通过代理分割器评估通用 Video LLM 时,一个潜在的担忧是是否

第 14 页

14 S. Wang 等

表 5:在 ST-Evidence-Gen 子集上,区域受损情况下的问答准确率。

模型 原始 证据受损 非证据受损

Gemini-2.5-Flash 81.32 61.12(-20.20) 76.43(-4.89) Qwen3-VL-8B 79.31 58.32(-20.99) 73.66(-5.65)

那个人为什么摔倒?(GT 时间证据:[8.6s, 11s]) A) 梯子向后滑 B) 梯子在他身下坍塌

Ours-7B [8.5s, 10.3s] A

UniPixel-7B [0s – 5s] B

QWen3-VL-8B [9s, 11s] A

QWen2.5-VL-7B [8s, 9s] A

图 3:模型在 ST-Evidence-Gen 上的对比。E-VQA 要求模型共同执行复杂推理并提供密集的空间和时间证据。

较低的空间得分(J &F)反映了 LLM 推理能力差,或者仅仅是分割器无法遵循文本描述。为了隔离这一因素,我们选择了 100 个带有手动标注指代表达式的样本,并将其输入我们的代理分割器(UniPixel-3B),获得了 44.7 的 J &F 得分,显著优于顶级模型生成的表达式(例如,Gemini-2.5-Pro 为 25.6)。这一巨大的性能差距证实,E-VQA 任务的主要瓶颈主要在于 LLM 无法定位到正确的证据对象。 自动化标注流程的验证。为了实证验证我们自动化流程生成的证据掩码的质量,我们直接将流程的输出与经过人工验证的 ST-Evidence-Gen 基准进行了评估。该流程取得了 62.8 的 J &F 得分,轻松优于我们微调的 7B 模型(54.1)和 235B 基线(41.9)。这验证了我们自动标注流程的有效性。

5.5 可视化

图 3 将我们的模型与 ST-Evidence-Gen 上的基线模型进行了对比。要回答“那个人为什么摔倒?”,模型需要将摔倒与梯子向后滑这一原因联系起来,并定位这两个事件同时发生的时间区间。此外,有效的空间证据需要同时对两个实体进行密集跟踪。如图所示,现有的基线模型难以满足这些严格的证据要求:它们要么未能捕捉到完整的交互

第 15 页

人物与梯子之间(Qwen3-VL 和 Qwen2.5-VL),或无关的背景物体,并输出高度不准确的时间窗口(UniPixel)。相比之下,我们的模型在整个正确的因果时间跨度内成功分割了这两个关键实体,展示了高层语义推理与密集视觉定位之间的清晰协同作用。更多的定性结果和失败模式分析见补充材料。

6 结论

我们引入了证据支持的视觉问答(E-VQA),这是一个将问答与密集时空证据定位统一起来的框架。我们提供了 ST-Evidence,一个经过人工验证的基准,以及 ST-Evidence-Instruct,一个将答案与视觉证据对齐的指令微调数据集。在 ST-Evidence-Instruct 上进行微调提高了准确性和定位能力。我们的工作为可解释且基于证据的视频大语言模型奠定了基础,使其能够在时间和空间上进行透明的推理。通过要求答案附带密集的视频对齐证据,E-VQA 弥合了推理与感知之间的鸿沟,提高了可解释性和可调试性,并使其能够在需要精确性和透明度的应用中可靠使用。

参考文献

1. Ahmad, G.S., Heakl, A., Gani, H., Shaker, A., Shen, Z., Khan, F.S., Khan, S.: VideoMolmo: 时空定位与指向。arXiv 预印本 arXiv:2506.05336 (2025) 2. An, X., Xie, Y., Yang, K., Zhang, W., Zhao, X., Cheng, Z., Wang, Y., Xu, S., Chen, C., Wu, C., et al.: LLaVA-OneVision-1.5: 用于民主化多模态训练的全开放框架。arXiv 预印本 arXiv:2509.23661 (2025) 3. Athar, A., Deng, X., Chen, L.C.: ViCaS: 一个结合整体和像素级视频理解的数据集,使用带有接地分割的说明。CVPR (2025) 4. Bai, S., et al.: Qwen2.5-VL 技术报告 (2025), https://arxiv.org/abs/ 2502.13923, 访问日期:2026-06-26 5. Bai, Z., He, T., Mei, H., Wang, P., Gao, Z., Chen, J., Zhang, Z., Shou, M.Z.: 一个令牌分割所有:视频中的语言指导推理分割。 神经信息处理系统进展 37, 6833–6859 (2024) 6. Carion, N., Gustafson, L., Hu, Y.T., Debnath, S., Hu, R., Suris, D., Ryali, C., Alwala, K.V., Khedr, H., Huang, A., Lei, J., Ma, T., Guo, B., Kalla, A., Marks, M., Greer, J., Wang, M., Sun, P., Rädle, R., Afouras, T., Mavroudi, E., Xu, K., Wu, T.H., Zhou, Y., Momeni, L., Hazra, R., Ding, S., Vaze, S., Porcher, F., Li, F., Li, S., Kamath, A., Cheng, H.K., Dollár, P., Ravi, N., Saenko, K., Zhang, P., Feichtenhofer, C.: SAM 3: 用概念分割任何东西 (2025), https: //arxiv.org/abs/2511.16719, 访问日期:2026-06-26 7. Chen, G., Liu, Y., Huang, Y., He, Y., Pei, B., Xu, J., Wang, Y., Lu, T., Wang, L.: CG-Bench: 用于长视频理解的线索接地问答基准。arXiv 预印本 arXiv:2412.12075 (2024)

第 16 页

16 S. Wang 等

8. Cheng, Z., Hu, J., Liu, Z., Si, C., Li, W., Gong, S.: V-STaR: 在视频时空推理上评估视频大语言模型 (2025), https://arxiv.org/abs/2503. 11495, 访问日期: 2026-06-26 9. Comanici, G., 等: Gemini 2.5: 通过高级推理、多模态、长上下文和下一代代理能力推动前沿 (2025), https://arxiv.org/abs/2507.06261, 访问日期: 2026-06-26 10. Deng, A., Chen, T., Yu, S., Yang, T., Spencer, L., Tian, Y., Mian, A.S., Bansal, M., Chen, C.: 运动归因的视频推理:在像素级别理解和感知运动。在:计算机视觉与模式识别会议论文集。pp. 8625–8636 (2025) 11. Ding, H., Liu, C., He, S., Jiang, X., Loy, C.C.: MeViS: 一个用于具有运动表达视频分割的大规模基准。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 2694–2703 (2023) 12. Feng, K., Gong, K., Li, B., Guo, Z., Wang, Y., Peng, T., Wu, J., Zhang, X., Wang, B., Yue, X.: Video-R1: 强化多模态大语言模型中的视频推理。arXiv 预印本 arXiv:2503.21776 (2025) 13. Gong, S., Zhang, L., Zhuge, Y., Jia, X., Zhang, P., Lu, H.: 强化视频推理分割以在分割前进行思考。arXiv 预印本 arXiv:2508.11538 (2025) 14. Grauman, K., 等: Ego4D: 3000 小时第一人称视频环游世界。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 18995–19012 (2022) 15. Guo, Y., Liu, J., Li, M., Tang, X., Chen, X., Zhao, B.: VTG-LLM: 将时间戳知识整合到视频大语言模型中以增强视频时间定位。 arXiv 预印本 arXiv:2405.13382 (2024) 16. Han, S., Huang, W., Shi, H., Zhuo, L., Su, X., Zhang, S., Zhou, X., Qi, X., Liao, Y., Liu, S.: VideoEspresso: 通过核心帧选择进行细粒度视频推理的大规模思维链数据集。在:计算机视觉 与模式识别会议论文集。pp. 26181–26191 (2025) 17. Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W.: LoRA: 大语言模型的低秩自适应。在:国际学习表征会议 (2022) 18. Huang, B., Wang, X., Chen, H., Song, Z., Zhu, W.: VTimeLLM: 赋能大语言模型掌握视频时刻。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 14271–14280 (2024) 19. Jin, W., Kim, S., Lee, J., Kim, S.: InterRVOS: 交互感知的指代视频对象分割。arXiv 预印本 arXiv:2506.02356 (2025) 20. Lei, J., Yu, L., Berg, T., Bansal, M.: TVQA+: 视频问答的时空定位。在:第 58 届计算语言学协会年会论文集。pp. 8211–8225 (2020)。https://doi.org/10. 18653/v1/2020.acl-main.730 21. Li, K., Wang, Y., He, Y., Li, Y., Wang, Y., Liu, Y., Wang, Z., Xu, J., Chen, G., Luo, P., 等: MVBench: 一个综合的多模态视频理解基准。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 22195–22206 (2024) 22. Li, X., Yan, Z., Meng, D., Dong, L., Zeng, X., He, Y., Wang, Y., Qiao, Y., Wang, Y., Wang, L.: VideoChat-R1: 通过强化微调增强时空感知。arXiv 预印本 arXiv:2504.06958 (2025) 23. Li, Y., Xiao, J., Feng, C., Wang, X., Chua, T.S.: 发现视频问答的时空推理依据。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 13869–13878 (2023)

第 17 页

证据支持的视觉问答 17

24. Liang, S., Zhong, Y., Hu, Z.Y., Tao, Y., Wang, L.: Fine-grained spatiotemporal grounding on egocentric videos. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 9385–9395 (2025) 25. Lin, L., Yu, X., Pang, Z., Wang, Y.X.: GLUS: Global-local reasoning unified into a single large language model for video segmentation. In: Proceedings of the Com- puter Vision and Pattern Recognition Conference. pp. 8658–8667 (2025) 26. Liu, H., Li, C., Li, Y., Lee, Y.J.: Improved baselines with visual instruction tun- ing. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 26296–26306 (2024) 27. Liu, Y., Ma, Z., Pu, J., Qi, Z., Wu, Y., Ying, S., Chen, C.W.: UniPixel: Unified object referring and segmentation for pixel-level visual reasoning. In: Advances in Neural Information Processing Systems (NeurIPS) (2025) 28. Lu, Y., Song, Y., Wang, W., Torresani, L., Nagarajan, T.: VITED: Video tem- poral evidence distillation. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 8501–8511 (2025) 29. Maaz, M., Rasheed, H., Khan, S., Khan, F.: VideoGPT+: Integrating image and video encoders for enhanced video understanding. arXiv preprint arXiv:2406.09418 (2024) 30. Meng, J., Li, X., Wang, H., Tan, Y., Zhang, T., Kong, L., Tong, Y., Wang, A., Teng, Z., Wang, Y., et al.: Open-o3 Video: Grounded video reasoning with explicit spatio-temporal evidence. arXiv preprint arXiv:2510.20579 (2025) 31. Munasinghe, S., Gani, H., Zhu, W., Cao, J., Xing, E., Khan, F., Khan, S.: VideoGLaMM: A large multimodal model for pixel-level visual grounding in videos. ArXiv (2024), https://arxiv.org/abs/2411.04923, accessed: 2026-06-26 32. OpenAI: GPT-4o system card (2024), https://arxiv.org/abs/2410.21276, ac- cessed: 2026-06-26 33. OpenAI: OpenAI o3 model. https://platform.openai.com/docs/models/o3 (2024), accessed: 2025-11-14 34. Patraucean, V., Smaira, L., Gupta, A., Recasens, A., Markeeva, L., Banarse, D., Koppula, S., Malinowski, M., Yang, Y., Doersch, C., et al.: Perception test: A di- agnostic benchmark for multimodal video models. Advances in Neural Information Processing Systems 36, 42748–42761 (2023) 35. Pont-Tuset, J., Perazzi, F., Caelles, S., Arbeláez, P., Sorkine-Hornung, A., Van Gool, L.: The 2017 DAVIS challenge on video object segmentation. arXiv preprint arXiv:1704.00675 (2017) 36. Qian, L., Li, J., Wu, Y., Ye, Y., Fei, H., Chua, T.S., Zhuang, Y., Tang, S.: Momen- tor: Advancing video large language model with fine-grained temporal reasoning. arXiv preprint arXiv:2402.11435 (2024) 37. Qwen Team: Qwen3-VL: Sharper vision, deeper thought, broader action (sep 2025), https://qwen.ai/blog?id=99f0335c4ad9ff6153e517418d48535ab6d8afef, ac- cessed: 2025-11-13 38. Ravi, N., Gabeur, V., Hu, Y.T., Hu, R., Ryali, C., Ma, T., Khedr, H., Rädle, R., Rolland, C., Gustafson, L., et al.: SAM 2: Segment anything in images and videos. arXiv preprint arXiv:2408.00714 (2024) 39. Seo, S., Lee, J.Y., Han, B.: URVOS: Unified referring video object segmentation network with a large-scale benchmark. In: European conference on computer vision. pp. 208–223. Springer (2020) 40. Sun, Y., Zhang, H., Ding, H., Zhang, T., Ma, X., Jiang, Y.G.: SAMA: Towards multi-turn referential grounded video chat with large language models. arXiv preprint arXiv:2505.18812 (2025)

第 18 页

18 S. Wang 等

41. Wang, H., Yan, C., Wang, S., Jiang, X., Tang, X., Hu, Y., Xie, W., Gavves, E.: Towards open-vocabulary video instance segmentation. In: proceedings of the IEEE/CVF international conference on computer vision. pp. 4057–4066 (2023) 42. Wang, J., Kang, Z., Wang, H., Jiang, H., Li, J., Wu, B., Wang, Y., Ran, J., Liang, X., Feng, C., et al.: VGR: Visual grounded reasoning. arXiv preprint arXiv:2506.11991 (2025) 43. Wang, W., Gao, Z., Gu, L., Pu, H., Cui, L., Wei, X., Liu, Z., Jing, L., Ye, S., Shao, J., et al.: InternVL3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency. arXiv preprint arXiv:2508.18265 (2025) 44. Wang, Y., Wang, Z., Xu, B., Du, Y., Lin, K., Xiao, Z., Yue, Z., Ju, J., Zhang, L., Yang, D., et al.: Time-R1: Post-training large vision language model for temporal video grounding. arXiv preprint arXiv:2503.13377 (2025) 45. Wang, Y., Wang, Y., Chen, K., Zhao, D.: STAIR: Spatial-temporal reasoning with auditable intermediate results for video question answering. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 38(17), pp. 19215–19223 (2024). https://doi.org/10.1609/aaai.v38i17.29890 46. Wang, Z., Yoon, J., Yu, S., Islam, M.M., Bertasius, G., Bansal, M.: Video-RTS: Rethinking reinforcement learning and test-time scaling for efficient and enhanced video reasoning. In: Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. pp. 28114–28128 (2025) 47. Wei, J., Wang, X., Schuurmans, D., Bosma, M., Xia, F., Chi, E., Le, Q.V., Zhou, D., et al.: Chain-of-thought prompting elicits reasoning in large language models. Advances in neural information processing systems 35, 24824–24837 (2022) 48. Wu, B., Yu, S., Chen, Z., Tenenbaum, J.B., Gan, C.: Star: A benchmark for situated reasoning in real-world videos. In: NeurIPS (2021) 49. Wu, Y., Hu, X., Sun, Y., Zhou, Y., Zhu, W., Rao, F., Schiele, B., Yang, X.: Number it: Temporal grounding videos like flipping manga. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 13754–13765 (2025) 50. Xiao, J., Shang, X., Yao, A., Chua, T.S.: NeXT-QA: Next phase of question- answering to explaining temporal actions. In: Proceedings of the IEEE/CVF con- ference on computer vision and pattern recognition. pp. 9777–9786 (2021) 51. Xiao, J., Yao, A., Li, Y., Chua, T.S.: Can I trust your answer? visually grounded video question answering. In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition. pp. 13204–13214 (2024) 52. Yan, C., Wang, H., Yan, S., Jiang, X., Hu, Y., Kang, G., Xie, W., Gavves, E.: VISA: Reasoning video object segmentation via large language models. In: Euro- pean Conference on Computer Vision. pp. 98–115. Springer (2024) 53. Yi, K., Gan, C., Li, Y., Kohli, P., Wu, J., Torralba, A., Tenenbaum, J.B.: CLEVRER: collision events for video representation and reasoning. In: ICLR (2020) 54. You, Z., Wu, Z.: Seg-R1: Segmentation can be surprisingly simple with reinforce- ment learning. arXiv preprint arXiv:2506.22624 (2025) 55. Yuan, H., Li, X., Zhang, T., Huang, Z., Xu, S., Ji, S., Tong, Y., Qi, L., Feng, J., Yang, M.H.: Sa2VA: Marrying SAM 2 with LLaVA for dense grounded under- standing of images and videos. arXiv preprint arXiv:2501.04001 (2025) 56. Yuan, Y., Zhang, H., Li, W., Cheng, Z., Zhang, B., Li, L., Li, X., Zhao, D., Zhang, W., Zhuang, Y., et al.: VideoRefer suite: Advancing spatial-temporal object un- derstanding with video LLM. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 18970–18980 (2025) 57. Zhang, B., et al.: VideoLLaMA 3: Frontier multimodal foundation models for image and video understanding. arXiv preprint arXiv:2501.13106 (2025)

第 19 页

证据支持的视觉问答 19

58. Zhou, H., Peng, X., Kendre, S., Ryoo, M.S., Savarese, S., Xiong, C., Niebles, J.C.: STRefer: 通过合成指令数据赋能视频大语言模型进行时空指代与推理。在:IEEE/CVF 国际计算机视觉会议论文集。第 4289–4300 页 (2025)

发表评论