VideoChat3:全开源高效视频理解新基准

三分钟导读:VideoChat3提出了一种全开源的视频多模态大语言模型,通过I3D-ViT架构和自适应帧分辨率实现高效视频编码,并结合大规模合成数据管道,在通用、长视频和流式理解任务上超越了现有开源模型。

英文题目:VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

论文出处:arXiv 每日论文精选 · arXiv:2607.14935

原始论文:PDF / 论文页面

对应视频标题:VideoChat3:全开源高效视频理解新基准|推荐指数:★★★★★

这篇论文解决什么问题?

现有开源视频多模态大语言模型(Video MLLMs)存在泛化能力有限(难以兼顾短/长视频及流式交互)、计算效率低下(视觉Token过多导致成本高)以及可复现性差(部分开源或数据/代码不公开)三大问题。

核心创新

  • 提出I3D-ViT,通过时空自注意力膨胀和池化显著减少视觉Token数量,提升编码效率。
  • 设计基于状态令牌(State Tokens)的自适应帧分辨率机制,实现流式视频中的动态计算资源分配。
  • 开发证据 grounded 的标注增强方法,将稀疏的学术标注转化为富含视觉证据的细粒度响应。
  • 构建长视频分段证据账本(Evidence Ledger),解决长视频中证据稀疏和跨段聚合难题。
  • 提出状态转换监督掩码(State-transition supervision mask),平衡流式训练中的沉默与响应状态学习。
  • 实现完全开源,包括模型权重、训练代码、策略及全部训练数据集。

方法概览

1. I3D-ViT架构:将预训练图像Tokenizer的2D空间自注意力膨胀为3D时空自注意力,结合块内时空建模和时序池化,实现16x时空压缩比。2. 自适应帧分辨率:在流式感知中,根据模型状态(Silence/Standby/Response)动态调整下一窗口像素配额(低/高分辨率),平衡效率与细节捕捉。3. 数据合成管道:构建三个数据集:VideoChat3-Academic2M(学术数据增强)、VideoChat3-LV116K(长视频合成)、VideoChat3-OL617K(流式交互数据)。4. 四阶段训练:视觉Tokenizer预训练、视频-语言对齐、视频指令微调、长视频/流式指令微调。

逐图理解论文

I3D-ViT架构

I3D-ViT架构
Figure 2 VideoChat3 architecture with I3D-ViT. VideoChat3 follows the classical ViT–MLP Projector–LLM architec- ture, with I3D-ViT enabling efficient video encoding before visual tokens are passed to the LLM. Specifically, spatial 2×2 merging and temporal T-frame pooling reduce the visual sequence length by approximately a factor of 4T. Under the default setting of T = 4, this yields a 16× spatiotemporal compression ratio; for clarity, the figure illustrates the mechanism with T = 2.

VideoChat3提出I3D-ViT,将预训练图像Tokenizer的2D空间自注意力膨胀为3D时空自注意力。结合块内时空建模和时序池化,实现16倍时空压缩比,显著减少视觉Token数量。

自适应帧分辨率

自适应帧分辨率
Figure 3 Illustration of the Adaptive Frame Resolution. State tokens control whether the next streaming window is encoded at a low or high pixel quota. In the soccer example, routine play is monitored at low cost; when players rush toward the goal, the Standby state enlarges the next window so the model can inspect whether the ball goes in before triggering Response.

设计基于状态令牌的自适应帧分辨率机制。在流式感知中,根据模型状态动态调整下一窗口像素配额。低分辨率用于常规监控,高分辨率用于关键细节捕捉,平衡效率与准确性。

数据合成管道

数据合成管道
Figure 4 Source Distribution of VideoChat3-Academic2M. VideoChat3-Academic2M contains 2.27M caption/QA instances from six academic sources, dominated by LLaVA-Video [26], Spoken-MIT [27], and Vript [28].

构建三个数据集:VideoChat3-Academic2M通过学术数据增强提升监督密度;VideoChat3-LV116K利用长视频合成解决长程推理难题;VideoChat3-OL617K提供流式交互数据。

证据增强方法

证据增强方法
Figure 5 Example of Annotation Enhancement from Concise Answers to Evidence-Grounded Responses. A short- phrase answer is rewritten into a temporally grounded, evidence-rich response that explains the observed actions and supports the final answer with video-specific cues. This illustrates how annotation enhancement increases supervision density while preserving the original semantic label.

开发证据grounded的标注增强方法。将稀疏的学术标注转化为富含视觉证据的细粒度响应,解释观察到的动作并支持最终答案。这增加了监督密度,同时保留原始语义标签。

长视频数据合成

长视频数据合成
Figure 7 Long-Video Data Synthesis Pipeline for VideoChat3-LV116k. The pipeline converts raw long videos into structured supervision through candidate filtering, temporal boundary segmentation, segment-level annotation, quality examination, and full-video annotation assembly. Instead of annotating an entire long video directly, it builds a validated segment-level evidence ledger, making sparse long-range events easier to capture and reason over.

针对长视频,构建分段证据账本。通过候选过滤、时间边界分割、片段级标注和质量检查,将原始长视频转化为结构化监督。这解决了长视频中证据稀疏和跨段聚合难题。

实验与关键结果

  • 在通用视频理解基准(Temporal Perception, Long Video, Reasoning, Temporal Grounding)上进行评估。
  • 在在线流式视频理解基准(Perception & Memory, Proactive Response)上进行评估。
  • 与专有模型(GPT-5, Gemini)及开源模型(Qwen3-VL, Molmo2, VideoChat-Flash)进行对比。
  • 进行消融实验,验证I3D-ViT、自适应分辨率、数据增强及训练策略的有效性。
  • 评估推理成本(Inference cost)和吞吐量。
  • 在MotionBench上得分61.7,TempCompass上得分75.6,均为全开源模型最佳(第 15 页)
  • 在TimeLens suite (Charades, ActivityNet, QVHighlights) 上显著超越VideoChat-Flash-7B(第 15 页)
  • 在ODVBench上得分72.3,超越StreamForest 12.4分(第 16 页)
  • 在OVOBench任务平均指标上超过最强竞争结果0.9分(第 16 页)
  • 在StreamingBench和River基准上取得最佳全开源结果(第 16 页)

阅读时需要注意

  • 模型参数量为4B,虽高效但可能在极复杂推理任务上略逊于更大参数量的专有模型(如Gemini 2.5 Pro)。
  • 自适应分辨率机制依赖于状态预测的准确性,若状态预测错误可能导致关键细节遗漏或计算浪费。
  • 长视频合成数据依赖LLM生成,可能存在细微的幻觉或标注噪声,尽管经过过滤。
  • I3D-ViT的时空压缩比(16x)在默认设置下可能丢失极细微的短时运动细节,需根据具体任务调整T值。
  • 流式推理中的状态转换策略在训练时采用教师强制(Teacher-forced),推理时依赖模型预测,存在分布偏移风险。
  • 数据增强过程使用Qwen3-VL-235B,其生成质量直接影响训练数据的有效性。

关联工作

  • Qwen3-VL:作为基线模型和用于数据增强/重写的强大LLM(第 1 页)
  • Molmo2:作为全开源基线模型进行性能对比(第 1 页)
  • StreamForest:作为流式视频理解领域的强基线模型进行对比(第 16 页)
  • MoonViT:作为I3D-ViT的初始化基础(预训练图像Tokenizer)(第 11 页)
  • TimeLens:用于评估时间定位(Temporal Grounding)的基准套件(第 15 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

VideoChat3: 用于高效且通用视频理解的完全开源视频多模态大语言模型

Xinhao Li1,∗ Yuhan Zhu1,∗ Xiangyu Zeng1,∗ Yuhao Dong3,∗ Haoning Wu3,∗ Zhiqiu Zhang1,∗

Yuandong Yang1 Changlian Ma1 Qingyu Zhang1 Yansong Shi2 Xinyu Chen1 Haoran Chen1

Zizheng Huang1 Jun Zhang1 Kun Ouyang4 Lin Sui1 Ziang Yan2 Yicheng Xu2 Chenting Wang2

Yinan He2 Hongjie Zhang2 Yi Wang2 Yu Qiao2 Yali Wang2 Ziwei Liu3 Kai Chen2 Limin Wang1,†

1南京大学,2上海人工智能实验室,3南洋理工大学,4北京大学

∗同等贡献。†通讯作者:lmwang@nju.edu.cn。

主页:https://mcg-nju.github.io/VideoChat3 模型与数据:https://huggingface.co/collections/MCG-NJU/videochat3 代码:https://github.com/MCG-NJU/VideoChat32026 Jul 摘要 16 视频理解的最新进展涵盖了运动、长视频和流式交互,推动该领域走向实际应用。尽管取得了这些进展,当前的开源模型在多个方面仍存在局限。它们往往难以在多样化的视频类型中实现泛化,导致其仅在特定领域有效。高昂的计算需求进一步限制了其效率和可扩展性。此外,大多数模型仅部分开源,关键的组成部分如训练代码、策略或数据集不可用,这阻碍了可复现性并减缓了社区驱动[cs.CV]的发展。为了解决这些问题,我们引入了VideoChat3,一个完全开源、高效且通用的以视频为中心的多模态大语言模型(MLLM)。VideoChat3通过两种互补的设计推进视频理解。在效率方面,我们引入了Inflated 3D Vision Transformer (I3D-ViT) 和 Adaptive Frame Resolution for Streaming Video Perception,实现了高效时空表示,并降低了训练和推理过程中处理视频输入的成本。在有效性方面,我们开发了一个可扩展的视频数据合成流水线,精心策划了三个多样化的高质量训练数据集:VideoChat3-Academic2M、VideoChat3-LV116K 和 VideoChat3-OL617K,涵盖通用、长视频和流式视频场景,提升了模型在各领域的泛化能力。通过整合这些设计,VideoChat3实现了广泛泛化与计算效率之间罕见的平衡。在通用、长视频和流式基准测试中的实验表明,VideoChat3仅用4B参数和更高的效率,就超越了先前参数量相等或更大的开源模型。通过发布模型权重、训练代码、训练策略和完整训练数据集,我们旨在提供一个完全可复现的基础,并帮助开源社区弥合数据访问和训练资源方面的差距,促进更广泛的现实世界视频理解系统的开发。arXiv:2607.14935v1

1 引言

视频是人类感知、记忆、推理以及与物理世界交互的最自然媒介。与静态图像不同,视频捕捉了物体连续视觉变化,

1

第 2 页

83.0 Molmo2-4B Qwen3-VL-4B VideoChat3 (Ours) 80.2 67.1 56.4 56.1 75.6 54.8 61.6 12.6 11.6 13.1 61.7 72.8 70.8 69.6 69.3 70.1 53.9 56.2 56.7 51.2 50.5 58.7 58.7 58.6 48.2 56.7 57.8 46.4

39.8

33.3

MotionBench TempCompass VideoMME LVBench MMVU VideoMME-v2 Charadesᵀᴸ ActivityNetᵀᴸ QVHighlightsᵀᴸ OVOBench StreamingBench

Temporal Perception Long Video Reasoning Temporal Grounding Online

Fine- grained Motion Understanding Long Video QA Temporal Grounding When using the juicer, how should both hands coordinate? What color is the cat's water bowl? When does the action of preparing oatmeal occur? One hand holds the juicer base steady while the other Based on the video, the cat's water bowl is red. The given action takes place from 593.0 s to 657.0 s. presses an orange half downward and rotates it.

Time line

… … … … … … … …

Let me know when The woman appears the woman appears Online Proactive Response in the video. in the video. </Silence> </Silence> </Silence> </Standby> </Response> </Silence> </Silence>

Figure 1 VideoChat3 achieves strong performance across diverse evaluation benchmarks, including temporal perception, long video understanding, and temporal grounding, while also supporting online proactive responses.

scenes, actions, and events, requiring models to understand not only spatial semantics but also temporal dynamics, causal evolution, and long-range contextual dependencies. Meanwhile, in the digital era, video has widespread applications, covering short-form social media, long-form entertainment, autonomous driving, embodied perception, surveillance, and real-time human-AI interaction. As a result, building a generalist and efficient video understanding model is a critical step toward general-purpose multimodal intelligence.

Recent progress [1, 2, 3, 4, 5] in Video Multimodal Large Language Models (Video MLLMs) has significantly advanced this goal. Built upon large language models [6, 7], Video MLLMs have demonstrated promising capabilities across fine-grained video perception [4, 8], long-video understanding [3, 9, 10], egocentric perception [11], temporal grounding [12, 13, 14], and streaming video understanding [15, 16, 17, 18, 19, 20, 21]. At the same time, commercial multimodal systems such as Gemini [22], Kimi [23], and Seed [24] have shown increasingly strong video understanding performance, revealing the potential of large-scale video-language modeling.

However, despite these advances, we identify three key limitations in existing Video MLLMs. First, many models remain specialized for particular video settings or benchmark categories. A model optimized for short videos may not transfer well to long-form understanding, while methods designed for offline video understanding often lack the ability to handle streaming interaction. This limited generalization prevents video MLLMs from being reliably deployed in real-world scenarios, where video inputs vary widely in duration, frame rate, viewpoint, temporal structure, and interaction mode. Second, video understanding is inherently computationally demanding. Naively extending image-based MLLMs to videos leads to a rapid increase in visual tokens, making long-video and real-time streaming understanding prohibitively expensive. Without efficient visual encoding, video MLLMs are difficult to scale, train, and deploy. Third, reproducibility remains a major bottleneck. Several high-performing models are either closed-source or only partially open, with undisclosed training data, incomplete training recipes, or unavailable data construction pipelines. This opacity makes it difficult for the community to understand what drives performance, compare methods fairly, or build upon prior work. All these limitations indicate that the field still lacks an efficient, generalist, and fully reproducible video MLLM that can serve as a strong foundation for open research.

To address these challenges, we introduce VideoChat3, a systematic framework that advances video understanding along three dimensions: efficient model architecture, scalable data construction, and full-stack open-sourcing for reproducible research.

2

第 3 页

• 模型架构: 针对视频编码这一核心问题,我们提出了膨胀3D视觉Transformer(I3D-ViT)架构以及用于流式视频感知的自适应帧分辨率(Adaptive Frame Resolution)。该设计显著减少了高帧率、长视频和实时流式视频场景中的视觉令牌数量,从而在保持强大理解精度的同时大幅提升了视频处理效率。它有效缓解了现有视频多模态大语言模型(Video MLLMs)在长视频和实时设置中面临的计算瓶颈。

• 数据构建: 我们开发了一个涵盖离线和在线流式视频理解任务的大规模多模态数据合成与策展流水线,生成了三个专用数据集:VideoChat3-Academic2M、VideoChat3-LV116K 和 VideoChat3-OL617K,这些数据集共同构成了300万个高质量的多模态指令样本。同时,我们采用多阶段课程学习策略进行渐进式模型训练,使模型能够系统地获取不同类型和难度级别的视频理解能力,最终实现强大的通用视频理解性能。

• 训练、评估与完全开源: 基于所提出的架构与数据流水线的协同效应,VideoChat3 在有效性和效率方面均取得了双重突破。在主流视频理解基准上的广泛评估表明,VideoChat3 超越了参数量相当的同级别开源最先进模型,如 Qwen3-VL [1] 和 Molmo2 [5],同时在训练吞吐量和推理速度方面也显示出显著优势。更重要的是,我们完全发布了模型权重、训练代码、训练策略、完整训练数据集以及数据集构建流水线,为未来现实世界视频理解研究提供了高性能、高效且可复现的开源基础。

总体而言,VideoChat3 不仅是一个强大的视频多模态大语言模型,也是一个完全可复现的基础,它降低了开源社区在数据、训练和高效视频建模方面的门槛。

2 模型架构

2.1 概述

视频多模态大语言模型面临着视觉感知质量与计算效率之间的根本性张力。随着视频时长、帧率和空间分辨率的增加,视觉令牌的数量迅速超过实际大语言模型部署中的上下文和计算预算。大多数现有系统继承图像分词器,并采用稀疏采样将视频编码为令牌:每个采样的帧主要作为独立图像进行编码,而时序建模则推迟到生成的视觉令牌到达大语言模型时进行。这种范式存在两个显著缺点。首先,稀疏帧采样导致大量视频细节的直接丢失,例如短期运动和细微的时序变化。其次,时序相邻的帧包含大量重叠和冗余内容,但图像分词器未能利用此类重复性来推导更紧凑的视频表示。

为此,VideoChat3 基于不同的原则构建:在视频令牌传递给大语言模型之前,应尽可能早地对视频的时空结构进行建模并减少其冗余信息。我们引入了两种互补的设计,沿时间和空间维度压缩视频表示。

1. 对于时间维度,我们引入了膨胀3D视觉Transformer(I3D-ViT),这是一种由预训练图像分词器膨胀而来的视觉分词器,通过将其2D空间自注意力扩展为3D时空自注意力。I3D-ViT 不将帧视为孤立图像,而是将连续帧分组为短片段,在每个片段内应用时空自注意力进行局部时空建模,最后执行时间池化以生成紧凑且感知运动的视觉令牌。

2. 对于空间维度,我们进一步引入了用于流式视频感知的自适应帧分辨率(Adaptive Frame Resolution)。人类分配视觉注意力是自适应的:常规时刻被粗略感知,而重要或不确定的事件则引发更细粒度的感知。受此行为启发,我们的方法使模型能够根据感知到的重要性调整输入帧的空间分辨率。因此,信息量少的区间可以以低分辨率高效处理,而潜在的关键时刻则可以用更丰富的视觉细节进行检查。

3

第 4 页

时间戳令牌:\<X.X 秒\> 所提供的图像/视频描述了…… 大语言模型

… … … … … 文本 图像 视频 文本

像素洗牌 & MLP 投影器 空间 下采样 时间 池化 2 × 2 分块时间池化 时间 下采样 𝑇𝑇× 𝑇𝑇× I3D-ViT N x 将空间注意力膨胀为时空注意力 MLP 变长自注意力 \<0.5 秒\> \<1.0 秒\> 帧块内的时空建模 原生分辨率视觉输入 任意宽高比和分辨率 帧块 时间位置编码 0 1 0 1 + + + + 空间 0 1 2 0 1 0 1 0 1 0 1

\<1.5 秒\> \<2.0 秒\> + + + + + + + + + + + 1440px 位置编码 视觉 令牌 图像 帧 480px 分块 2720px 图像 视频 640px

图 2 带有 I3D-ViT 的 VideoChat3 架构。VideoChat3 遵循经典的 ViT–MLP 投影器–LLM 架构,其中 I3D-ViT 在视觉令牌传递给 LLM 之前实现高效的视频编码。具体而言,空间 2×2 合并和时间 T 帧池化将视觉序列长度减少约 4T 倍。在默认设置 T = 4 下,这产生了 16× 的时空压缩比;为清晰起见,图中以 T = 2 为例说明该机制。

这些设计共同构成了 VideoChat3 统一的视频导向感知架构,使其能够在各种部署场景中实现高效且保留细节的视频理解。

2.2 基于时空建模的高效视频令牌化

视频本质上信息丰富:细粒度的短期运动和长程视频理解都需要大量的视觉令牌。然而,实际的 LLM 只能容纳有限的视觉令牌预算。现有系统通常通过在信息到达模型之前丢弃信息来解决这一张力,例如稀疏采样帧并以适度的分辨率对每个采样帧进行编码。虽然这使得上下文长度保持可控,但它从根本上在输入阶段移除了大量的视频细节。我们的关键观察结果是,局部时间动态和帧间冗余可以在视觉令牌器内部更有效地建模。如图 2 所示,我们从预训练的图像令牌器开始,将其原始 2D 空间自注意力膨胀为分块时空注意力机制。这产生了 VideoChat3 的视觉令牌器,称为膨胀 3D 视觉 Transformer (I3D-ViT)。具体而言,I3D-ViT 引入了以下设计:

• 分块帧分组。我们不是独立地对采样帧进行编码,而是将每个视频划分为最多 T 帧的连续帧块。每个帧块被视为局部时空单元,允许在将生成的视觉令牌传递给 LLM 之前,相邻帧之间进行交互。

• 时间位置编码。在每个帧块内,我们保留来自图像令牌器的预训练空间位置嵌入,并为帧索引 0 到 T −1 引入学习到的绝对时间嵌入,使令牌器能够在保留预训练空间结构的同时区分帧的时间顺序。

• 原生分辨率时空建模。帧块内所有帧的令牌被展平为单个序列,使 I3D-ViT 块能够在空间和时间内执行联合注意力

第 5 页

</Silence> </Silence> </Standby> </Standby> </Response> </Silence> ··· ··· ··· ··· LLM

··· ··· ··· ··· Clip 0 Question 1 Clip N Clip N+1 Clip N+2 Clip N+3 Clip N+4 Clip N+5 Question 2 Token sequence I3D-ViT

Adaptive Perception Quota ··· ··· t0 tn tn+1 tn+2 tn+3 tn+4 tn+5 Live Video Stream Clip 0 Clip N Clip N+1 Clip N+2 Clip N+3 Clip N+4 Clip N+5 Low-Res Low-Res Low-Res Low-Res High-Res High-Res Low-Res

图 3 自适应帧分辨率(Adaptive Frame Resolution)示意图。状态令牌(State Tokens)控制下一个流式窗口是以低像素配额还是高像素配额进行编码。在足球示例中,常规比赛以低成本进行监控;当球员冲向球门时,Standby 状态会扩大下一个窗口,以便模型在触发 Response 之前检查球是否进球。

原生输入分辨率。这使得 I3D-ViT 能够在时空自注意力隐式建模局部时间冗余后,生成更紧凑的视频令牌。

• 分块时间池化(Chunk-Wise Temporal Pooling)。在时空上下文化之后,我们在每个帧块内沿时间维度聚合特征。这将令牌数量减少了 T 倍,使得后续模块能够操作已经编码了局部时间冗余的特征,而不是基于帧级独立表示进行操作。

除非另有说明,我们设置 T = 4,结合由像素洗牌(pixel shuffling)[25] 引起的 2 × 2 空间下采样,产生整体 16 倍的时空压缩比。除了提高上下文效率外,I3D-ViT 还为变长视频提供了灵活的接口。由于令牌化适应可用的视觉预算,输入可以根据其估计负载进行缩放:较短的片段可以用更高的空间和时间保真度表示,而长时间运行的流或长达数小时的视频可以以较低的分辨率和帧率进行处理。这使得视觉瓶颈具有适应性而非固定不变,从而在相同的 LLM 上下文预算下保留更密集的视频证据。

2.3 用于流式视频感知的自适应帧分辨率

离线视频理解通常假设模型在开始解码之前已观察到所有帧。这一假设不适用于流式场景,其中视觉输入持续到达,模型不仅要决定回答什么,还要决定何时回答以及在回答之前消耗多少视觉细节。在此过程中,模型可能需要每时每刻处理视觉信息,导致巨大的计算开销。因此,需要一种更高效的流式视频感知方案。

我们的设计灵感来源于人类观看直播视频流的方式。观众很少以相同的注意力水平检查每一刻:常规间隔以放松模式监控,而潜在的亮点会立即触发集中观察。例如,在足球转播期间,中场传球可以用粗略的注意力跟随,但一旦进攻球员突破防线并接近球门,观众自然会专注于判断球是否进球所需的精细视觉细节。这表明流式视频模型也应默认保持低成本监控,仅在出现可能的响应线索时分配更高的视觉保真度,并在观察到足够证据后生成答案。因此,我们将流式推理表述为语言模型与视觉令牌化器之间的状态条件闭环,如图 3 所示。在每个流式步骤中,模型首先发出一个响应状态令牌。该令牌属于以下三种状态之一:

5

第 6 页

• Silence(静默)。当前窗口不包含与任务相关的证据。模型抑制自然语言生成,并继续监控视频流。

• Standby(待机)。当前窗口包含潜在证据,但信息尚不足以提供可靠的答案。模型保持沉默,同时准备以更高的保真度观察后续窗口。

• Response(响应)。累积的证据已充足。模型从状态预测切换到自回归答案生成,随后除非检测到新的线索,否则返回到低成本的监控模式。

与先前响应状态表述的关键区别在于,状态令牌(State Token)也被用作下一个视觉输入的控制信号。令 $s_t$ 表示处理完当前视频窗口后预测的状态,令 $b_{t+1}$ 表示用于下一个窗口的每帧像素配额。我们使用一个简单的确定性控制器:

$$ b_{t+1} = \begin{cases} B_{low} & \text{if } s_t = \text{Silence}, \\ B_{high} & \text{if } s_t = \text{Standby}, \\ B_{low} & \text{if } s_t = \text{Response}, \end{cases} $$

其中 $B_{low} = 224^2$ 像素,$B_{high} = 448^2$ 像素。

因此,大多数背景帧和响应后的监控帧都在每帧 $224^2$ 像素配额下,以紧凑的低配额感知窗口进行处理;而紧随 Standby 线索的窗口则在 $448^2$ 像素配额下扩大,以恢复小物体、细微运动或文本等细粒度细节。每帧根据其原始纵横比进行各向同性缩放,产生总像素数符合所选配额的灵活分辨率,例如,在低配额下,5:3 的帧可以编码为 280×168。由于 I3D-ViT 天然支持可变的空间输入尺寸,该策略不需要单独的高分辨率编码器;它仅改变下一个流式分块的像素配额,同时允许在相应配额内使用灵活的输入分辨率。结果是一个自适应的动态感知窗口,它根据模型自身的不确定性和证据状态,沿时间轴分配视觉令牌。

3 数据集构建

3.1 概述

构建视频指令数据的核心挑战在于,没有任何单一数据源能同时提供可信的监督信号和足够丰富的时间结构。现有的学术数据集提供了广泛的任务覆盖范围和清晰的来源溯源,通常经过人工验证。然而,许多这些数据集最初是为短片段或封闭式预测设计的,其期望输出是一个类别标签、选项字母或短短语。这造成了监督不匹配:模型观察到的是一个长多模态上下文,但仅接收到少量目标令牌,且缺乏明确的证据指导。

因此,我们将学术数据集视为可靠的语义锚点,而非最终的监督目标。从它们的原始注释出发,我们重写并验证标签,以生成更密集的监督信号,并配以证据 grounded(基于证据)的回答。我们的目标不是改变任务定义或注入不受约束的外部知识,而是使原始标签中隐含的视觉证据和推理逻辑显式化。这种注释增强在保持精心策划的学术资源可靠性的同时,提高了它们在训练自然语言响应生成、视觉定位和证据感知推理方面的有效性。

第二个挑战是长视频理解(long video understanding)。学术资源通常以短视频和基准测试任务为主,而长视频理解需要不同类型的监督。相关证据可能稀疏地分布在几分钟甚至几小时内,事件可能只有在结合早期上下文后才具有意义,且正确答案通常需要在多个时间片段中链接实体、动作和场景转换。为了覆盖这一领域,我们进一步从外部来源收集长视频,并构建了一个专用的合成管道。该管道将每个视频分解为连贯的时间单元,对每个单元进行注释和过滤,然后将验证过的证据组合成训练注释。

最后,我们将高质量的视频问答对转换为在线流式样本,以便模型不仅学习如何正确回答,还学习如何识别正确的响应时机,并主动响应用户

6

第 7 页

VideoChat3-Academic2M: 学术来源 视频时长(分钟/均值/最大值,秒) 按学术来源划分的视频最小、均值和最大时长 LLaVA-Video min mean max 1,401,406 | 61.8% Spoken-MIT 3.0s Spoken-MIT Vript 9.7s 447,961 | 19.8% 2.27M Vript 394,901 | 17.4% Perception-Test 30.6s 实例 StarQA StarQA 23.3s 17,386 | 0.8% Sports-QA LLaVA-Video 59.0s 2,775 | 0.1% 0 50 100 150 200 Perception-Test 视频时长(秒) 1,857 | 0.1%

图 4 VideoChat3-Academic2M 的来源分布。VideoChat3-Academic2M 包含来自六个学术来源的 2.27M 个字幕/QA 实例,主要由 LLaVA-Video [26]、Spoken-MIT [27] 和 Vript [28] 主导。

一旦出现了足够的视觉证据,便需要生成回答。

3.2 VideoChat3-Academic2M:重新标注学术视频数据

学术来源聚合。如图 4 所示,我们首先聚合了公开可用的学术数据集,涵盖视频字幕、视频问答和细粒度运动感知。这些数据集提供了互补的监督信号:字幕数据描述可见的实体和动作,QA 数据鼓励查询条件感知,而以运动为中心的数据强调细粒度的时间理解。更重要的是,它们是在明确的任务定义下精心策划的,并且通常包含人工验证的标签,使其成为视觉语义的可靠来源。然而,它们原始的标注格式并不总是适合指令微调。大量样本仅提供一个多项选择选项、一个单一的名词短语或一个简短的事实性答案。直接在这些标注上进行训练,相对于视频和提示令牌的数量,模型获得的生成性监督非常有限。模型可能会学会最终标签,但它接收到的关于如何表达答案、应提及哪些视觉证据或响应如何扎根于视频中的信号非常有限。

证据扎根的标注增强。为了更好地利用这些可靠但稀疏的学术标注,我们将它们增强为更丰富的指令跟随响应。关键原则是在保持原始答案作为语义约束的同时,增加监督的密度。对于每个样本,我们首先通过移除特定于评估的格式要求来规范化查询,例如强制模型仅输出选项字母的提示。当原始响应基于选项时,我们恢复所选选项的自然语言内容,并将其用作目标语义。然后,我们使用 Qwen3-VL-235B-A22B 将短文本或仅基于选项的响应重写为包含明确视觉证据和推理的全面答案。模型被指示保留原始答案,避免添加未经支持的事实,并将响应扎根于可观察的视频内容。通过这种方式,原本仅提供最终决策的答案被转化为也描述相关对象、动作、场景和时间线索的监督信号。如图 5 所示,重写后的标注包含比原始标注多得多的视频特定信息,为学习视频-语言对齐和证据感知生成提供了更密集的目标。

一致性验证与错误过滤。标注增强也引入了新的风险:强大的生成器可能会产生流畅但缺乏支持细节的内容。因此,我们增加了一个验证阶段,以保留原始学术标签的保真度。具体而言,我们使用 Qwen3-VL-235B-A22B 作为评判模型,将每个重写后的响应与原始标注进行比较。评判者检查重写后的响应是否与原始标签在语义上一致,以及添加的解释是否改变、矛盾或过度指定了答案。只有通过此一致性检查的标注才会被保留。此过滤步骤使我们在不牺牲学术数据集最初有价值的可靠性的情况下,增加监督的密度和可读性。实际上,原始标注定义了答案的语义边界,而重写后的响应则提供了该答案更丰富且更易于训练的表达式。

7

第 8 页

标注增强 将原始问答重写为基于时间、基于证据的推理

0:05 0:08 0:14 0:16 0:23 0:27 0:28 0:29

问题 原始答案 穿条纹夹克的女士离开建筑物后做了什么? 走向汽车。

重写后的答案 33.5倍 词汇扩展 1. 在0:05时,可以看到穿条纹夹克的女士在建筑物内,正走向出口。

2. 到0:08时,她已离开建筑物,站在一扇蓝色门附近,向外看。

3. 从0:14到0:16,她拿着一个橙色包穿过一条狭窄的通道。

4. 在0:27时,她出现在室外,走向一辆后备箱打开的蓝色汽车。

5. 在0:28到0:29之间,她将橙色包放入汽车后备箱。

因此,离开建筑物后,穿条纹夹克的女士穿过通道,走向汽车,并将包放入后备箱。

最终答案:离开建筑物后,穿条纹夹克的女士穿过通道,走向一辆蓝色汽车,并将她的橙色包 放入后备箱。

图5 从简洁答案到证据 grounded 响应的标注增强示例。简短短语答案被重写为具有时间定位、富含证据的响应,解释了观察到的动作,并用视频特定的线索支持最终答案。这说明了标注增强如何在保留原始语义标签的同时增加监督密度。

3.3 VideoChat3-LV116K:长视频数据合成

尽管增强的学术数据提高了短视频和基准风格监督的质量,但它并未完全解决长视频理解问题。长视频不仅仅是短片的加长版:它们的难度源于稀疏的证据、延迟的依赖关系、事件转换以及必须在扩展的时间上下文中聚合的信息。仅使用短片训练模型可能识别局部动作,但仍可能无法连接在时间上分离的事件,或无法在长序列中精确定位证据。为弥补这一差距,我们通过收集额外的长视频并通过多阶段管道合成结构化标注来构建 VideoChat3-LV116K。如图7所示,该管道过滤候选长视频,将其分割为连贯的时间单元,对每个片段进行质量控制标注,并将经过验证的片段描述组装成密集的完整视频描述。

长视频收集与过滤。我们从多个来源收集候选长视频,优先考虑那些具有清晰视觉内容、连贯时间结构以及足够持续时间以进行长上下文推理的视频。该数据集涵盖了广泛的领域,包括娱乐、教育、体育、新闻、科学和游戏。视频若存在严重损坏、低视觉质量、过度重复或语义内容有限,则被丢弃。新收集的数据旨在通过提供扩展的时间尺度和更丰富的事件结构来补充现有的学术数据集,而既有的学术资源则保持可靠的任务多样性。

边界感知的时间分割。直接标注整个长视频成本高、噪声大,且受限于当前视频语言模型上下文长度的约束。因此,我们在标注之前将每个视频分解为可管理的时间片段。这种分割作为一种中间表示:每个片段足够短,可以准确描述,而有序排列的片段列表保留了长视频推理所需的全局时间结构。片段边界通过结合视觉场景检测与启发式时间窗口来确定。具体而言,我们使用 PySceneDetect 来识别镜头转换,并强制执行最小和最大持续时间约束,以避免片段过于碎片化或片段过长导致标注不可靠。这产生了视觉连贯且时间粒度可控的单位。

8

第 9 页

VideoChat3-LV116k: 长视频来源 视频时长(分钟/均值/最大值,秒,对数尺度) 按任务族划分的视频时长的最小值、均值和最大值 长视频时间线 min mean max 45,495 | 39.2% 电影摘要与问答 156s156s 长视频时间定位 24,018 | 20.7% 长视频时间线 391s391s

SciVideo 摘要 长视频摘要与问答 516s516s 116.2K 实例 22,260 | 19.2% 长视频时间定位 708s708s 长视频摘要与问答 16,317 | 14.0% SciVideo 摘要 1.3K1.3K ss 电影摘要与问答 1 10 100 1K 10K 50K 8,073 | 6.9% 视频时长(秒,对数尺度)

图6 VideoChat3-LV116K 的源分布。面板总结了用于构建 VideoChat3-LV116K 的长视频库,共 116.2K 行。时长统计揭示了一个明显的时间尺度差距:学术来源大多是短片,平均时长从 3.0 秒到 59.0 秒不等,而我们收集的长视频分片的平均时长为 156 秒至 1.3K 秒,且最大值延伸至更长的时间。这种互补性既提供了可靠的短片语义锚点,也为稀疏证据、跨片段聚合和事件级推理提供了长程监督。

收集候选 视频 边界 片段级 标注 长视频池 过滤 分割 标注 组装

生成视觉上 × 损坏 连贯的单位 保留 × 低质量 … × 重复 标注员 审查员 × 低语义 丢弃 清晰的视觉 广泛的领域 连贯的时间 长时长 详细描述 全视频密集描述

图7 VideoChat3-LV116k 的长视频数据合成流水线。该流水线通过候选过滤、时间边界分割、片段级标注、质量审查和全视频标注组装,将原始长视频转换为结构化监督信号。与其直接标注整个长视频,该流水线构建了一个经过验证的片段级证据账本,使得捕获和推理稀疏的长程事件变得更加容易。

片段级标注与质量控制。 每个片段在整合到长视频监督之前都是独立标注的。使用 Qwen3-VL-235B-A22B [1],我们生成结构化描述,捕捉可见实体、动作、场景、事件转换、显著的时间细节,以及在可用时的 OCR 或字幕线索。这些带时间戳的描述构成了全视频的证据账本:与其让模型一次性对原始长视频进行推理,我们首先构建对“发生了什么”以及“何时发生”的经过验证的文本表示。为了减少幻觉和标注噪声,辅助多模态大语言模型(MLLM)会对生成的片段描述进行评估。我们丢弃那些重复、过于笼统、内部不一致或缺乏视觉证据支持的标注。剩余的描述随后与其对应的时间边界聚合,形成全视频的密集、带时间戳的描述。

长视频训练标注合成。 在获得经过验证的片段级描述后,我们合成需要超越孤立片段进行推理的长视频训练标签。我们使用交错的时间戳和片段描述序列查询前沿大语言模型(LLM),提示其对整个视频上下文进行推理,并明确引用支持性的时间证据。这将片段证据账本转化为以下任务族的多样化指令数据:

1. 长视频时间定位。 模型必须定位与给定文本查询相对应的时间区间。与仅关注单区间定位的现有时间定位数据不同,我们还合成用于多区间定位的查询。我们提示 LLM 以多个特异性级别生成查询,包括关键词、短语和完整句子,以及可能包含相关证据的候选时间区域。然后,在每个候选区域内应用专家定位模型以生成精确的时间跨度。我们将全视频内的跨度合并,

9

第 10 页

VideoChat3-OL617k: 在线数据源 观测到的上下文跨度(最小值/均值/最大值) 40 个 JSONL 分片中的 617,183 个实例 438,902 条带时间戳记录;对数尺度;零跨度在 1 秒处显示

StreamForest General 最小值 均值 最大值 272,424 | 44.1% StreamForest Drive 12.7秒 Streamo 259,977 | 42.1% StreamForest General 19.4秒

StreamForest Drive 补充数据 37.7秒 617.2K 46,538 | 7.5% 实例 Streamo 70.6秒 Seeker 19,230 | 3.1% Seeker 153.5秒

补充数据 1 10 100 1K 2K 19,014 | 3.1% 观测到的上下文跨度(秒,对数尺度)

图 8 VideoChat3-OL617K 的源组成和时间覆盖范围。左侧:40 个 JSONL 分片中 617,183 个实例的分布。StreamForest General 和 Streamo 分别贡献了 272,424 (44.1%) 和 259,977 (42.1%) 个实例,而 StreamForest Drive、Seeker 和补充数据提供了剩余的数据。右侧:438,902 条带有时间信息的记录的最小、平均和最大观测上下文跨度,以对数尺度显示,零长度跨度在可视化时放置在 1 秒处。平均跨度范围从 StreamForest Drive 的 12.7 秒到 Seeker 的 153.5 秒,为短视域和长视域因果流式上下文提供监督。这种多样性支持用于构建主动流式问答监督的证据积累和响应时机行为。

丢弃空预测,并过滤查询与接地视频内容之间语义相似度低的样本。

2. 长视频时间线。要求模型描述显著事件及其时间边界。我们使用验证过的片段描述来识别事件级单元,当相邻片段描述同一连续事件时进行合并,并生成简洁的标题以总结每个时间间隔内发生的情况。当标题过于笼统、时间上模糊或片段证据支持不足时,样本将被过滤。

3. 长视频问答。问答任务的设计使得答案依赖于分布在多个时间片段中的证据。我们提示 LLM 从完整的片段描述序列中生成问题、答案和支持时间戳。为了避免琐碎的例子,我们过滤掉仅从单帧、单个孤立片段或仅凭语言先验即可回答的问题。 保留的样本鼓励模型在长上下文中聚合信息,并提供基于特定视频时刻的接地答案。

最后,我们应用额外的过滤机制来移除那些无需有意义的视频理解即可解决的样本,例如可以从单个静态帧或常见语言先验回答的问题。 这确保了合成的注释强调长视频独特要求的能力:时间定位、跨片段聚合和事件级推理。

生成的 VideoChat3-LV116K 数据包含来自六个长视频分片的 116.2K JSONL 行,如图 6 所示。虽然学术来源的平均持续时间范围从 3.0 秒到 59.0 秒,但最终长视频分片的平均持续时间范围从 156 秒到约 1.3K 秒。VideoChat3-LV116K 不仅通过增加更多样本来补充 VideoChat3-Academic2M,而且通过在更长的时间上下文上提供监督来补充,在这些上下文中证据稀疏,事件分布在片段中,答案需要跨事件聚合。

3.4 VideoChat3-OL617K

为了将 VideoChat3 训练为主动流式助手,我们将高质量的视频-问题-答案三元组转换为在线响应监督。每个原始样本由一个视频、一个用户查询和一个真实答案组成。与其让模型在观察完整视频后回答,我们标注必要视觉证据何时变得可用,并构建带有显式响应状态令牌的因果训练序列。

视觉线索定位。我们首先将原始视频-问答三元组输入视觉语言模型 (VLM),以识别包含回答查询关键证据的时间区间。对于每个定位的区间,

10

第 11 页

表1 VideoChat3 各训练阶段的详细配置。数据集项表示每个阶段内所有子阶段使用的样本总数。相应的训练课程在以下小节中描述。

| 阶段 | 阶段 0 | 阶段 1 | 阶段 2 | 阶段 3 | | :— | :— | :— | :— | :— | | 目的 | 视觉标记器预训练 | 视频-语言对齐 | 视频指令微调 | 长视频与流式指令微调 | | 批量大小 | 512 | 256 | 256 | 256 | | 学习率 | $1 \times 10^{-3}$ | $4 \times 10^{-5}$ | $5 \times 10^{-5}$ | $3 \times 10^{-5} \rightarrow 5 \times 10^{-6}$ | | 数据集项 | 7.59M | 3.47M | 10.33M | 3.41M | | 打包序列长度 | 8192 | 16384 | 32768 | 98304 | | 训练轮数 | 1 | 1 | 1 | 1 | | 可训练模块 | Proj. $\rightarrow$ All | Proj. $\rightarrow$ All | All | Proj. & LLM |

注:箭头表示从投影器预热到联合训练的过渡。阶段 0 中使用的临时 LLM 在视觉标记器预训练后被丢弃。

VLM 还会生成相关视觉线索的详细描述,例如支持答案的对象状态、动作、文本或事件转换。

线索验证。为了减少噪声或微弱的定位,我们从原始视频中裁剪候选线索区间,并要求 VLM 针对原始查询重新评估它们。我们仅保留那些仅从裁剪片段中就能正确推断出真实答案的样本。此过滤步骤确保保留的区间提供充分的视觉证据,而不仅仅是在全视频上下文中与答案共存。

流式问答构建。验证后,我们将每个样本转换为视频窗口和目标令牌交错排列的流式序列。经过验证的线索区间被视为模型应收集视觉证据的时刻,其对应的窗口标记为 </Standby>。一旦线索区间结束,模型必须立即发出 </Response> 后跟答案文本。所有其他不相关的窗口标记为 </Silence>,鼓励模型在持续监控流的同时抑制过早响应。此过程将离线视频问答监督转化为具有明确证据获取和响应时间信号的主动在线问答数据。

4 训练

整体训练配方经过四个阶段,逐步从视觉标记器预训练过渡到视频-语言对齐、通用视频指令微调,最后是长形式流式适应。这种分阶段设计使模型首先获得鲁棒的视觉表示,然后将其与语言空间对齐,并最终在具有越来越复杂时间要求的指令遵循场景中专门化。表 1 总结了所有阶段的调度和优化设置。

4.1 阶段 0:视频标记器预训练

训练策略。在训练完整的 MLLM 之前,我们首先以语言为基础的方式预训练视觉标记器。此阶段的目标不是赋予模型高级的指令遵循能力,而是使视觉编码器产生可由自回归语言模型轻松消费的表示。为此,我们从图像预训练的 MoonViT [29] 初始化 I3D-ViT,附加一个轻量级投影器,并使用 Qwen3-4B 作为临时文本解码器。该模型在图像-文本和视频-文本对上以标准的下一个令牌预测目标进行训练,以便在语言建模监督信号下直接优化视觉令牌。此预训练阶段包含两个步骤:

1. 投影器预热。我们冻结 ViT 和 LLM,仅更新投影器。这将初始模态对齐问题与表示漂移隔离开来:图像预训练的 ViT 保留其

11

第 12 页

空间感知能力,而投影器则学习将视觉特征映射到语言嵌入空间。

2. 全参数微调。随后,我们解冻 ViT、投影器和 LLM,并在更大且更多样化的混合数据集上联合训练它们。这使得 ViT 能够从以图像为中心表示适应时空视频表示,同时仍由丰富的图像-文本数据提供锚定。

在 Stage-0 之后,我们丢弃临时语言解码器,仅保留训练好的 ViT 权重,以初始化后续 MLLM 训练阶段的视觉组件。

数据混合。我们的数据混合设计旨在与两阶段训练策略保持一致:

1. 投影器预热。我们使用一个紧凑但平衡的 1.04M 单轮样本集,包括来自 LLaVA-Pretrain [30] 的 558K 图像-文本对和来自 S-MiT [27] 的 481K 视频-文本描述对。这种混合提供了足够的视觉多样性以建立初始的视觉-语言映射,同时保持优化过程聚焦于投影器。

2. 全参数微调。我们将混合数据集扩展至 6.55M 样本,由 4.9M 图像-文本样本和 1.65M 视频-文本样本组成。图像部分仍占主导地位,在 ViT 参数解冻时作为强大的空间-语义锚点。其中包括来自 CapRL-2M [31] 的图像描述样本,其源图像来自 ShareGPT4V [32] 和 DenseFusion [33],以及我们使用 CapRL-3B [31] 重新描述过的 2.9M CC3M [34] 样本。视频部分引入了来自精心策划的内部重新描述数据和公开视频-文本资源的以时间和运动为中心的监督。其中包括来自 ShareGemini WebVid [35] 和 K400 [36] 视频的 323K VideoChat3-LV 样本,来自 Qwen3-VL-rewritten S-MiT [27] 描述的 448K VideoChat3-Academic 样本,395K Vript [28] 样本,104K PE-Video [37] 样本,以及来自 WebVid [35]、LSMDC [39]、VATEX [40]、ActivityNet [41]、Charades [42]、Something-Something V2 [43] 和 Ego4D [44] 等来源的 380K Tarsier-recaptioned [38] 公开视频样本。

总体而言,Stage-0 使用了 7.59M 单轮图像/视频-文本样本。

4.2 阶段一:视频-语言对齐

训练策略。在 Stage-0 之后,I3D-ViT 分词器已在语言建模监督下训练完毕,并能生成语言锚定的视觉表示。因此,Stage-1 的重点是将此分词器集成到最终的 MLLM 中,而不是从头重新学习视觉语义。在此阶段,我们用目标语言模型替换 Stage-0 中使用的临时解码器,并对齐完整的视频-语言路径。监督信号仍以描述为中心:图像描述继续为物体、属性、OCR 和空间关系提供密集信号,而视频描述则增强模型对运动、时间转换和事件级语义的敏感性。

我们遵循从轻量级到联合的对齐调度:

1. 投影器预热。我们首先冻结 Stage-0 初始化的 ViT 和 LLM,仅更新投影器。由于视觉分词器已经获得了语言锚定的表示,此步骤主要适应分词器与目标 LLM 之间的接口,防止新初始化的投影器破坏任何一侧的稳定性。

2. 联合视频-语言对齐。随后,我们解冻视觉分词器以及 LLM,并继续使用描述风格的监督进行训练。此步骤允许视觉前端和语言模型在最终 MLLM 架构下共同适应,同时在此早期阶段避免特定基准的指令格式。

在 Stage-1 之后,图像和视频被表示为 LLM 可以可靠叙述的紧凑视觉令牌,为后续的推理和指令跟随阶段提供稳定的基础。

数据混合。Stage-1 的数据混合遵循与 Stage-0 相同的以描述为导向的原则,但用于最终 MLLM 内部的接口对齐。所有样本均为单轮视觉提示-描述响应对。

12

第 13 页

1. 投影器预热(Projector warm-up)。我们使用 1.04M 个图文对,其中包括来自 LLaVA-Pretrain [30] 的 558K 个图像-文本样本和来自 S-MiT [27] 的 481K 个视频-文本样本。这种紧凑的混合数据保持了与初始分词器预热相同的图像-视频平衡,使投影器能够学习稳定的映射,而不会偏移预训练的视觉或语言表示。

2. 联合视频-语言对齐(Joint video-language alignment)。我们进一步在 2.43M 个图文对上训练。图像部分主要由 CapRL-2M [31] 主导,包括其源图像来自 ShareGPT4V [32] 和 DenseFusion [33] 的样本。视频部分包括来自 WebVid [35] 和 Kinetics-400 [36] 的 323K 个 ShareGemini [45] VideoChat3-LV 样本,以及 104K 个 PE-Video [37] 样本和 2K 个 ShareGPT-4o [46] 视频-文本样本。

总体而言,Stage-1 使用了 3.47M 个单轮对话(single-turn)样本,其中包括 2.56M 个图像-文本样本和 0.91M 个视频-文本样本。

4.3 阶段二:视频指令微调(Stage-2: Video Instruction Tuning)

训练策略(Training Strategy)。阶段二将对齐后的多模态大语言模型(MLLM)转换为通用的视频指令遵循模型。我们解冻所有模型参数,并在图像和视频问答/文本样本的平衡混合数据上,使用更大的打包序列长度进行训练,对应约 500 亿个训练 token。与主要教导模型描述视觉内容的阶段一不同,本阶段让模型接触基于问题的证据选择、开放式回答、多项选择推理以及跨图像和视频输入的文本生成。

图像-视频混合对于稳定性至关重要。许多视频任务的失败源于弱帧级感知,例如遗漏小物体、文本、空间关系或细微属性;因此,保留高质量的图像监督可作为细粒度空间理解的锚点。视频监督则在此基础上构建,以加强时序推理、事件排序、状态变化识别和多段证据聚合。文本生成和问答也发挥互补作用:文本生成提供密集的 token 级监督,并抑制仅生成简短答案的行为;而问答则迫使模型选择与任务相关的视觉证据,并以用户请求的形式表达。特别是,重写后的学术注释比仅包含选项的标签提供了更丰富的推理依据,从而增加了每个视觉上下文中的有效语言监督量。通过将完整的指令微调推迟到基于文本的对齐之后,阶段二可以将大部分能力用于更高层级的视频推理和响应生成,而不是用于修复原始模态不匹配的问题。

数据混合(Data Mixture)。阶段二的训练数据包含 10.33M 个样本和 23.62M 个问答对。该混合数据有意由大型图像指令语料库 Honey-Data [47] 锚定,它贡献了 5.65M 个有效图像样本和 12.85M 个有效问答轮次。它涵盖文本生成、通用视觉问答(VQA)、STEM 图表、图表/表格、文档/OCR 理解以及定位/计数,有助于在模型适应视频时保持强大的静态图像感知能力。我们另外包含了 1.81M 个纯文本的 Dolci-Instruct-SFT [48] 样本,以维持通用指令遵循、数学推理、多语言行为和面向科学的响应。

视频监督主要由 VideoChat3-Academic 主导,包含 1.54M 个有效视频样本和 5.57M 个有效问答轮次。该来源包括学术/YouTube 风格的视频文本和问答、由 Qwen3-VL 重写或校正的子集,以及按时长分桶的开放式和多项选择示例;其高问答密度为视频文本生成、时序理解和回答风格对齐提供了主要信号。我们还包含了 VideoChat3-LV Gemini 生成的长视频数据(46.7K 个样本),这些数据通过长篇幅、科学性和电影风格的定位监督,补充了学术混合数据。

其余视频数据规模较小,但针对特定领域,来自开源来源。TimeLens-100K [14]、Molmo2 [5]、TVQA [49]、FineVideo [50]、CinePile-v2 [51] 和 VCG-plus [52] 提供了密集的多轮时序和字幕感知问答。Vript [28]、PE-Video [37]、TGIF [53]、CLEVRER [54]、Something-Something-v2 [43]、EgoIT [55]、MotionBench [56]、ActivityNet [41]、LaSOT/GOT-10k [57, 58] 及相关跟踪/定位数据集,扩大了在通用视频文本生成、动作识别、程序性/自我中心理解、物体跟踪、物理/因果推理和细微动作区分方面的覆盖范围。这种构成在规模与多样性之间取得了平衡:图像/文本数据稳定了通用的多模态指令遵循,而视频

13

第 14 页

输出序列 损失 损失 损失 损失 损失

</Silence> </Silence> </Silence> </Silence> </Silence> </Silence> </Standby> </Standby> </Standby> </Response> </Silence> </Silence>

保留 变换 保留 变换 变换 随机选择 随机选择

图 9 流式训练的状态转换监督掩码。输出序列由 </Silence>、</Standby> 和 </Response> 组成。蓝色箭头指示保留损失的 State Tokens 位置。我们保留所有 Transform 位置,因为相邻窗口之间的目标状态在此处发生变化,从而定义了时间决策边界。从剩余的延续位置中,我们随机选择相同数量的 Keep 位置,以提供维持当前状态所需的监督信号。

特定的子集将监督集中在时间定位(Temporal Grounding)、长视频理解和细粒度运动推理上。

4.4 阶段 3:长视频与流式视频指令微调

训练策略。在此阶段,我们进一步使模型适应长格式和流式视频理解,其中模型需要在显著更长的时间上下文上进行推理,并在增量视觉输入下生成响应。我们采用较小的学习率并结合扩展的上下文窗口,以稳定长序列上的优化过程,总共处理约 100 亿个 token。为了避免模型偏向离线整体感知或在线时间推理,我们构建了一个混合训练课程,共同涵盖传统的离线视频和流式风格的样本。

对于流式视频,我们引入了一种专门的训练策略,使模型能够接触到逐步可用的视频片段,并要求它仅基于迄今为止观察到的信息进行回答。这种设计鼓励模型维持时间记忆,随着新帧的到来更新其理解,并在标准离线视频任务上保持强大的性能。因此,最终阶段弥合了长上下文视频指令遵循与实际流式视频交互之间的差距。

状态转换学习的监督掩码。我们使用教师强制的状态监督来训练流式行为。每个训练样本表示为视频窗口和目标 token 的交错序列。在非回答时刻,目标 token 是 </Silence> 或 </Standby> 之一;当出现足够的证据时,目标 token 变为 </Response>,后跟答案文本。答案文本使用标准的下一个 token 预测损失。特殊的处理仅应用于响应状态 token。

对所有状态 token 直接应用因果语言建模损失会导致平衡不佳:长流中包含大量重复的 </Silence> token,其数量远超状态变化,导致模型学习一种保守策略,很少进入 Standby 或 Response 状态。相反,仅在状态转换上保留损失会形成捷径:模型可以从前一个状态模式预测下一个状态,而无需使用视觉证据。我们通过状态转换掩码解决这两个问题,如图 9 所示。

设 $s_t$ 为流式步骤 $t$ 的目标状态。我们总是保留转换位置 $T = \{t \mid s_t \neq s_{t-1}\}$ 的损失,因为这些位置定义了时间决策边界。从剩余的延续位置 $C = \{t \mid s_t = s_{t-1}\}$ 中,我们均匀采样一个子集 $\hat{C}$,使得 $|\hat{C}| = |T|$。掩码状态损失为:

$$ L_{\text{state}} = – \frac{1}{\sum_t m_t} \sum_t m_t \log p_\theta(s_t | V_{\le t}, y_{<t}), \quad m_t = \mathbb{I}[t \in T \cup \hat{C}]. $$

该目标保留了每一次状态切换,同时保留了相同数量的“保持”决策,迫使模型在决定是否维持或改变行为之前,将前一个状态与当前的视觉证据进行比较。在一个典型的流式周期中,对 State Tokens 的有效监督遵循预期的比例:

$$ </Silence> : </Standby> : </Response> = 2 : 2 : 1, $$

因为 Silence 和 Standby 各自包含转换和延续监督,而 Response 立即将控制权移交给答案生成。在训练过程中,感知窗口的像素预算也

14

第 15 页

由前一个目标状态进行教师强制(teacher-forced);在推理时,相同的控制器由模型预测的状态驱动。这使训练和部署循环保持一致,并允许模型在单个流式指令微调阶段同时学习时间响应策略和主动视觉预算策略。

数据混合。第三阶段侧重于流式视频交互和长视频时间推理。训练混合数据包含 3.41M 个有效样本和 10.39M 个问答对,关键监督信号来自需要增量感知、响应时机、时间检索以及在长上下文中基于证据(evidence-grounded)推理的高交互视频数据。

流式组件主要由 VideoChat3-OL 提供,它贡献了 191K 条视频记录,但通过动作/事件描述、叙述、问答以及明确的沉默/待机回合,产生了 4.69M 个可训练的问答回合。这教导模型从传入帧中积累证据,决定何时响应,并在视觉上下文不完整时避免过早回答。长视频组件以 VideoChat3-LV 为中心,强调事件检索、时间线构建、时间定位、字幕或叙述条件推理以及跨扩展视频的多事件聚合。VideoChat3-Academic 进一步提供了由 Qwen3-VL 重写后的描述和跨多个时长分桶的问答,提高了开放式和多项选择题视频监督的质量和覆盖范围。

其他来源作为辅助监督。Honey-Data [47] 以低比例采样,以保留广泛的图像-语言技能,而 Dolci [48] 则稳定语言质量。其他视频数据集,包括 TimeLens-100K [14]、Molmo2 [5]、Vript [28]、LLaVA-Video [26]、CinePile [51]、MotionBench [56]、TGIF/TVQA 风格问答 [49, 53]、AVA/EgoQA [59, 60] 和 StreamForest [19],提供了字幕问答、密集描述、运动理解、跟踪、空间定位和驾驶场景推理的互补覆盖。此外,遵循先前关于合成时间基元的工作 [61],我们合成了一组原子运动问题,涵盖计数、旋转和其他基本运动技能,包括单项选择和多项选择题格式。总体而言,第三阶段优先考虑流式行为和长上下文视频推理,同时通过精心采样的辅助数据保留通用多模态能力。

5 评估

5.1 通用视频理解

我们在通用视频理解的四个互补维度上评估 VideoChat3:时间感知、长视频理解、复杂视频推理和时间定位(Temporal Grounding)。时间感知在 TOMATO [62]、MotionBench [56]、TVBench [63] 和 TempCompass [64] 上进行评估,而长视频理解在 Video-MME [65]、LVBench [66] 和 VideoEval-Pro [67] 上进行评估。对于推理密集型理解,我们使用 Video-MMMU [68]、MMVU [69]、Minerva [70] 和 Video-MME-v2 [71]。我们进一步在 TimeLens 套件 [14] 上评估时间定位,涵盖 Charades-STA [72]、ActivityNet Captions [73] 和 QVHighlights [74],以及 VUE-TR v1 [75]、VUE-TR v2 [76] 和 MomentSeeker [77] 的文本查询子集。

如表 2 所示,VideoChat3-4B 在所有完全开放的视频多模态大语言模型(MLLMs)中实现了强劲且均衡的性能。它在 MotionBench 和 TempCompass 上取得了最佳完全开放结果,得分分别为 61.7 和 75.6,展示了其捕捉细粒度运动和时序动态的能力。与开放权重的 Qwen3-VL-4B 相比,VideoChat3 在 19 个直接可比指标中的 18 个指标上有所提升,唯一的下降出现在 VideoEval-Pro 的开放式部分。在 MMVU (+5.9)、三个 TimeLens 分割 (+9.7/+6.4/+8.3)、VUE-TR v1/v2 (+15.0/+20.6) 和 MomentSeeker (+12.1) 上观察到了特别大的提升。

与同样大小的完全开放模型相比,VideoChat3 在大多数基准测试中与 Molmo2-4B 持平或优于 Molmo2-4B,包括 MotionBench、TempCompass、Video-MME、LVBench、VideoEval-Pro MCQ、Video-MMMU、MMVU、Minerva、Video-MME-v2、所有三个 TimeLens 分割、两个 VUE-TR 版本和 MomentSeeker。与 VideoChat-Flash-7B 相比,其在时间定位上的提升尤为显著,在 TimeLens 上达到 +16.4/+29.8/+34.3,在 VUE-TR v1/v2 上达到 +30.6/+30.1,在 MomentSeeker 上达到 +18.7。VideoChat3 还在所有三个 TimeLens 分割上超越了 GPT-5 和 Gemini 2.5 Flash,同时与 Gemini 2.5 Pro 保持竞争力。总体而言,这些结果突出了其聚合时序有序证据的能力,并

第 16 页

定位精确的时间边界。

5.2 流式视频理解

为了进一步评估 VideoChat3 在真实流式场景中的表现,我们评估了其在线视频理解能力,即模型必须以因果方式处理视觉输入,并随着新帧的到来持续更新其内部状态。与假设可以访问完整视频的离线评估不同,在线评估强调两种互补的能力:保持对先前观察内容的准确记忆,以及在适当时刻主动响应。我们在 ODVBench [19]、OVBench [17]、OVOBench [85]、StreamingBench [86] 和 River [87] 上评估了在线感知和长期记忆能力,这些基准共同涵盖了以对象为中心的感知、事件跟踪、时间状态更新以及对部分可见视频的回答。我们进一步在 OVO-Timing [88] 和 Proactive-VideoQA [89] 上评估了主动响应能力,这些基准要求模型识别值得回答的时刻,并在视频流式传输期间生成及时且上下文恰当的回答。如表 3 所示,我们将 VideoChat3 与代表性的流式和主动视频模型进行了比较,包括 VideoLLM-Online [15]、Flash-VStream [16]、Dispider [18]、VideoChat-Online [17]、LiveCC [90]、TimeChat-Online [91]、StreamForest [19]、StreamingVLM [92]、Streamo [20]、MMDuet-2 [93] 和 Em-Garde [88],以及通用基线 Qwen3-VL-4B [1]。

如表 3 所示,VideoChat3-4B 表明其强大的离线视频理解能力可以有效地扩展到在线流式场景中。它在六个聚合感知和记忆指标中的四个上取得了最佳结果,包括 ODVBench、OVOBench 的任务平均指标、StreamingBench 和 River。特别是,VideoChat3 在 ODVBench 上达到了 72.3,比 StreamForest 高出 12.4 分,并在 OVOBench 任务平均指标上超过了最强的竞争结果 0.9 分,

16

第 17 页

表 3 在线流式视频基准测试结果。Perception&Memory 基准测试评估在线视频感知和记忆能力,而 proactive-response 基准测试评估在流式场景中的及时和主动响应能力。灰色后缀(例如,+1.5B)表示辅助模块的大小。

模型 大小 Perception&Memory Proactive Response

[19] [85] [85] [86] [88] F1 [89] Avg. OVBench[17] [87] OVOBench OVOBench Avg. OVO-Timing Avg. ODVBench ProactiveVQA Overall Overall StreamingBench Avg. task Real-Time River WEB EGO TV VAD

在线视频方法 VideoLLM-Online [15] 7B 9.6 — 12.8 14.8 36.0 — 6.9 25.9 25.0 18.3 25.0 Flash-VStream [16] 7B 31.2 35.7 33.2 32.3 23.2 — 4.8 — — — — Dispider [18] 7B+1.5B — 45.2 41.8 45.0 67.6 — — — — — — VideoChat-Online [17] 4B 54.9 54.5 — — — — — — — — — LiveCC [90] 7B 46.7 44.8 59.8 — 71.4 33.9 — — — — — TimeChat-Online [91] 7B — — 47.6 51.0 75.4 — — — — — — StreamForest [19] 7B 60.5 59.9 55.6 57.0 77.3 — 14.0 — — — —

StreamingVLM [92] 7B 47.8 52.5 — — 73.2 39.9 — — — — — Streamo [20] 7B — — 57.9 60.3 — — — — — — — MMDuet-2 [93] 3B 47.1 50.0 48.8 52.3 71.5 33.6 20.5 53.3 33.6 43.4 28.9 Em-Garde [88] 7B+2B 47.2 47.7 50.3 — 76.7 33.4 31.0 — — — — Qwen3-VL-4B [1] 4B 54.5 57.4 56.7 61.6 80.2 37.8 8.1 23.5 34.8 18.4 24.2

VideoChat3-4B 4B 60.0 72.3 57.8 62.5 83.0 42.8 35.5 28.4 28.1 34.7 25.1

在 StreamingBench 上提升 2.8 分,在 River 上提升 2.9 分。这些结果表明,VideoChat3 不仅能够离线理解完整视频,还能在视频在线播放时持续感知、保留并基于视觉证据进行推理。

在主动响应方面,VideoChat3-4B 进一步展示了在流式视频交互中判断何时已积累足够信息并主动做出响应的能力。它在 OVO-Timing 上取得了 35.5 的平均 F1 分数,尽管未使用辅助的 2B 模块,仍比专用模型 Em-Garde 高出 4.5 分。在与 Qwen3-VL-4B 在相同评估设置下的对比中,VideoChat3 在 11 项可直接比较的指标中有 10 项得到提升,包括在 OVO-Timing(+27.4)和 ProactiveVQA 的 TV 子集(+16.3)上取得了显著增益。在 ProactiveVQA 上,VideoChat3 在四个子集中的三个上超越了 Qwen3-VL-4B,尽管它仍落后于专用模型 MMDuet-2。总体而言,这些结果表明 VideoChat3 将离线视频理解能力从被动识别扩展到了更广泛的领域:它能够持续解释在线视频内容,随时间推移保留相关上下文,并主动决定何时以及如何响应。

5.3 效率分析

如表 4 所示,VideoChat3 在视觉编码器中引入了显式的时空建模,这导致其编码器延迟高于 Qwen3-VL。然而,这种设计大幅减少了传递给 LLM 的视觉令牌数量。在控制设置下,即两个模型每帧使用相同数量的 ViT 补丁时,VideoChat3 产生的视觉令牌数量始终仅为 Qwen3-VL 的一半。这种令牌减少尤为重要,因为 LLM 的计算成本随序列长度呈二次方增长,而视觉编码器中的额外成本随输入帧数的增加近似线性增长。

这种权衡在长视频推理中变得愈发有利。对于 512 帧输入,VideoChat3 将 FLOPs 从 1.341 降低至 0.864 ×10^15,将 GPU 内存从 32.92 GB 降低至 26.68 GB,并实现了比 Qwen3-VL 更低的总延迟。随着视频长度的增加,这一优势变得更加明显:在 1024 帧时,VideoChat3 将总延迟从 12.251 秒降低至 8.099 秒;在 2048 帧时,它将延迟从 44.449 秒降低至 20.412 秒,同时将 FLOPs 减少超过 60%,并将内存使用量减少 26.14 GB。这些结果表明,VideoChat3 的早期时空压缩有效地将计算负担从二次方的 LLM 阶段转移到了线性的视觉编码阶段,使其在计算效率上具有显著优势。

17

第 18 页

表 4 在 NVIDIA H200 上使用 HuggingFace Pipeline 与 FlashAttention-2 进行的推理成本对比。

| | Input Frames | Visual Tokens | FLOPs ($\times 10^{15}$) | GPU Mem. (GB) | Latency (s) | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | | | | | | Vision Encoder | LLM | Total | | Qwen3-VL | 256 | 25,088 | 0.466 | 20.583 | 0.288 | 1.074 | 1.363 | | VideoChat3 | 256 | 12,544 | 0.385 | 17.663 | 1.272 | 0.380 | 1.652 | | Qwen3-VL | 512 | 50,176 | 1.341 | 32.915 | 0.578 | 3.260 | 3.838 | | VideoChat3 | 512 | 25,088 | 0.864 | 26.676 | 2.595 | 1.001 | 3.596 | | Qwen3-VL | 1024 | 100,352 | 4.313 | 57.581 | 1.152 | 11.098 | 12.251 | | VideoChat3 | 1024 | 50,176 | 2.108 | 44.709 | 5.158 | 2.941 | 8.099 | | Qwen3-VL | 2048 | 200,704 | 15.150 | 106.913 | 2.313 | 42.135 | 44.449 | | VideoChat3 | 2048 | 100,352 | 5.738 | 80.775 | 10.297 | 10.115 | 20.412 |

高效且可扩展,适用于长视频理解。

5.4 消融实验

I3D-ViT 如表 5 所示,我们将 MoonViT [29](其权重作为我们模型的初始化参数)与经过完全训练的 I3D-ViT 在各种下游 Video MLLM 任务上进行了基准测试。如表 5a 所示,与在大规模图像-文本语料库上经过充分预训练的 MoonViT 相比,I3D-ViT 实现了相当甚至略微优越的性能。从表 5b 中可以观察到,I3D-ViT 在所有类别的视频任务中均一致且显著地优于 MoonViT。我们将这一性能提升完全归因于 I3D-ViT 的帧采样优势:得益于其 4 倍的时间压缩能力,I3D-ViT 在训练和推理阶段支持的采样视频帧数量几乎是 MoonViT 的四倍。

表 5 MoonViT 和 I3D-ViT 在不同 VLM 基准上的对比。

(a) 图像基准上的对比。Image Avg. 将 OCRBench 归一化为 100 分制。

| Visual Tokenizer | Image Perception | OCR & Chart | Image STEM | Avg. | | :— | :—: | :—: | :—: | :—: | | | | M. | | | | | | EN | | | | | | w. | | | | | | | V1.1 | | | | | | val | | | | | | | MMBench DEV | | | | | | RealWorldQA test | | | | | | AI2D test | | | | | | MMStar test | | | | | | OCRBench score | | | | | | ChartQA test | | | | | | DocVQA val | | | | | | InfoVQA val | | | | | | MMMU dev | | | | | | MathVista mini | | | | | | MathVision mini | | | | | | Image | | MoonViT [29] | 74.5 | 68.9 | 74.8 | 57.7 | 709 | 75.2 | 90.8 | 66.5 | 53.1 | 65.8 | 20.1 | 65.30 | | I3D-ViT (ours) | 74.9 | 67.7 | 75.5 | 60.6 | 743 | 74.3 | 90.8 | 69.1 | 52.0 | 66.8 | 21.1 | 66.10 |

(b) 视频基准上的对比。Temporal-grounding 列 TL 共享 TimeLens 套件,但划分不同。

| Visual Tokenizer | Video Perception | Long Video | Reasoning | Temporal Grounding | Avg. | | :— | :—: | :—: | :—: | :—: | :—: | | | | | | TL | | | | | | | TL | | | | | | | TL | | | | | | | | MCQ | | | | | | | TOMATO test | | | | | | | MotionBench val | | | | | | | TVBench test | | | | | | | TempCompass test | | | | | | | Video-MME overall | | | | | | | LongVideoBench test | | | | | | | LVBench test | | | | | | | Video-MMMU test | | | | | | | MMVU overall | | | | | | | Minerva test | | | | | | | Charades mIoU | | | | | | | ActivityNet mIoU | | | | | | | QVHighlights mIoU | | | | | | | Video | | MoonViT [29] | 24.5 | 53.3 | 47.7 | 70.2 | 59.9 | 55.5 | 39.4 | 46.9 | 51.0 | 30.9 | 30.7 | 27.1 | 33.9 | 43.9 | | I3D-ViT (ours) | 25.3 | 55.6 | 54.6 | 74.1 | 65.4 | 60.7 | 45.0 | 53.4 | 51.8 | 34.8 | 45.0 | 43.7 | 58.4 | 51.4 |

18

第 19 页

动态流与训练掩码 我们在 OVO-Timing [88] 上隔离了两个流式特定的组件,其平均 F1 分数直接衡量模型是否在正确时刻附近做出响应。首先,我们固定提出的状态转换掩码,并比较三种感知窗口策略:始终低预算、始终高预算,以及 VideoChat3 使用的状态条件动态预算。这将“在 Standby 后主动扩大下一个窗口”的收益与“在所有地方简单地消耗更多视觉令牌”的收益区分开来。其次,我们固定动态窗口策略,仅改变状态令牌监督:所有状态令牌的损失、仅状态转换的损失,以及我们平衡的状态转换掩码。这项消融实验测试了掩码是否通过保留转换监督并防止模型被重复的 Silence 标签主导,从而改进了时序决策。

表 6 动态流式感知和状态转换掩码的消融设计。我们在 OVO-Timing [88] 上评估所有变体。左表固定状态转换掩码并比较感知窗口策略;右表固定动态感知窗口并比较状态令牌监督策略。预算比率仅针对窗口策略变体报告,并以始终高 448×448 策略为基准进行归一化。

| 窗口策略 | F1 ↑ | P ↑ | R ↑ | 预算 ↓ | 状态监督 | F1 ↑ | P ↑ | R ↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 固定低 (224²) | 33.5 | 31.9 | 37.0 | 25% | 所有状态令牌 | 5.8 | 7.5 | 5.1 | | 固定高 (448²) | 30.5 | 22.3 | 58.8 | 100% | 仅转换 | 20.1 | 11.8 | 97.9 | | 动态 (224² & 448²) | 35.5 | 33.1 | 44.9 | 30.2% | 状态转换掩码 | 35.5 | 33.1 | 44.9 | | (a) 感知窗口策略。 | | | | | (b) 状态令牌监督。 | | | |

VideoChat3-Academic2M 流水线 如表 7 所示,我们将使用原始标注训练的模型性能与使用通过我们的 VideoChat3-Academic2M 流水线增强的标注训练的模型性能进行了基准测试。借助我们集成的增强和错误过滤流水线,模型在几乎所有视频理解能力上都获得了一致的提升,尤其是在时间感知和时间定位方面。这一发现验证了我们的 Evidence-Grounded 标注增强方法在提升时序建模性能方面的有效性。

表 7 VideoChat3-Academic2M 流水线的消融研究。

| 第 2 阶段数据 | 时间感知 | 长视频 | 推理 | 时间定位 | 平均 | | :— | :— | :— | :— | :— | :— | | | TL | TL | MCQ | TL | TOMATO test | MotionBench val | TVBench test | TempCompass test | Video-MME subwo | LongVideoBench test | LVBench test | Video-MMMU test | MMVU overall | Minerva test | Charades mIoU | ActivityNet mIoU | QVHighlights mIoU | Overall | | 原始标注 | 24.7 | 54.4 | 44.0 | 67.8 | 64.4 | 59.7 | 48.7 | 50.9 | 53.0 | 34.7 | 38.1 | 24.6 | 29.5 | 45.7 | | + VideoChat3-Academic2M | 25.3 | 55.6 | 54.6 | 74.1 | 65.4 | 60.7 | 45.0 | 53.4 | 51.8 | 34.8 | 45.0 | 43.7 | 58.4 | 51.4 |

VideoChat3-LV116K 如表 8 所示,VideoChat3-LV116K 显著提升了包括 Video-MME、LongVideoBench [94] 和 LVBench 在内的长视频基准性能,这验证了我们数据构建流水线的有效性。同时,它在 ActivityNet 和 QVHighlights 等较长视频的时间定位任务上也带来了实质性改进。

VideoChat3-OL617K 如表 9 所示,在线流式数据主要提升了需要因果感知和响应时序的能力。与使用原始标注训练相比,增加 VideoChat3-OL 监督将 OVO-Timing 平均 F1 从 4.0 提升至 35.5,表明明确的 </Silence>、</Standby> 和 </Response> 目标对于学习何时保持沉默、何时收集证据以及何时回答至关重要。这些增益也扩展到了流式感知和记忆基准,包括 OVBench、ODVBench、OVOBench、StreamingBench 和 River,而离线视频 QA 指标则保持基本稳定。这些结果表明,所提出的线索定位、线索验证和流式

第 20 页

表 8 VideoChat3-LV116K 管道的消融研究。

时间感知 长视频 推理 时间定位 平均 第三阶段数据 TL TL TL MCQ TOMATO 测试 MotionBench 验证 TVBench 测试 TempCompass 测试 Video-MME 子集 LongVideoBench 测试 LVBench 测试 Video-MMMU 测试 MMVU 整体 Minerva 测试 Charades mIoU ActivityNet mIoU QVHighlights mIoU 整体

基线 38.8 61.8 57.7 74.6 68.4 63.6 54.3 53.3 55.6 38.1 55.8 50.5 60.3 56.4 + VideoChat3-LV116K 38.8 62.4 57.6 74.9 70.2 64.2 56.7 55.8 56.4 37.8 55.8 54.8 67.7 57.9

QA 构建管道将普通的视频 QA 注释转化为用于主动在线视频理解的有效监督,同时不牺牲通用视频能力。

表 9 VideoChat3-OL617K 管道的消融研究。

第三阶段数据 感知与记忆 主动响应 离线视频 QA

TL 平均 F1 子集 OVBench 平均 ODVBench 整体 OVOBench 整体 OVOBench 任务 StreamingBench 实时 River 平均 OVO-Timing 平均 ProactiveVQA TOMATO 测试 Video-MME 无 Video-MMMU 测试 Charades mIoU

WEB EGO TV VAD

原始注释 57.6 58.2 55.7 60.5 81.9 38.3 4.0 39.0 24.9 28.9 25.3 38.8 70.2 55.8 55.8 + VideoChat3-OL617K 60.0 72.3 57.8 62.5 83.0 42.8 35.5 28.4 28.1 34.7 25.1 37.8 70.0 56.7 56.1

6 相关工作

视频多模态大语言模型。近期的视频多模态大语言模型(Video MLLMs)通过将视觉编码器、投影模块和大语言模型耦合,将图像 MLLM 范式扩展到动态视觉输入。早期的系统如 VideoChat [95]、Video-ChatGPT [96] 和 Video-LLaVA [97] 证明了以视频为中心的指令微调可以实现开放式的视频对话和时间推理。后续工作进一步改进了数据和训练配方:LLaVA-Video [26] 引入了大规模合成视频指令数据,LLaVA-OneVision [98] 展示了在图像、多图像和视频场景中的强大迁移能力,而 VideoLLaMA3 [83] 强调了以视觉为中心的训练以实现统一的图像和视频理解。更近期的模型,包括 InternVideo2.5 [2]、Qwen3-VL [1]、Molmo2 [5] 和 LLaVA-OneVision-2 [99],已将开放权重的视频理解推向更强的长上下文推理、定位和广泛的 multimodal 能力,相邻的 VLM 适配和检索研究也在探索相关的迁移设置 [100, 101, 102]。尽管取得了这些进展,许多模型仍然继承了来自图像 MLLM 的帧采样接口,其中视频被表示为稀疏的独立编码帧集合。这种设计对于短片简单且有效,但可能会丢弃细粒度的运动线索 [103],在长视频上扩展性较差,并且对因果流式交互的支持有限。VideoChat3 则将视频视为从视觉标记器开始的时空信号,旨在构建一个完全开放、高效且通用的 Video MLLM,涵盖短、长、定位和流式视频理解。

高效视频标记化与长视频建模。密集视频输入导致的标记爆炸激发了大量关于高效视频表示的工作。一个常见的方向是在每帧编码后压缩视觉标记,例如 VideoChat-Flash [3] 中的分层片段到视频压缩、LongVU [104] 中的自适应时空压缩,以及 Video-XL-2 [9] 中的任务感知 KV 稀疏化。另一个近期方向利用输入侧的显著性信号:LLaVA-OneVision-2 [99] 使用编解码器流标记化,根据比特成本动态和运动残差分配视觉容量。这些

第 21 页

这些方法表明,冗余减少对于实用的长视频多模态大语言模型(MLLMs)至关重要,但它们通常依赖于帧级选择、下游令牌路由、任务条件稀疏化或特定编解码器的预处理。VideoChat3 探索了一条互补的路径:它将预训练的图像 ViT 膨胀为 I3D-ViT,该模型在进入 LLM 之前执行分块时空自注意力和时间池化。通过早期压缩局部时间冗余同时保留对运动敏感的视觉证据,VideoChat3 将计算从二次方复杂度的 LLM 上下文中转移出去,并提高了高帧数视频输入的扩展性。

以数据为中心的开放视频-语言训练。高质量的视频-语言数据已成为视频 MLLM 性能的核心驱动力。Video-ChatGPT [96]、VideoChat [95]、ShareGPT4Video [105] 和 LLaVA-Video [26] 建立了可扩展的视频指令数据管道,通常通过将字幕、问答对或模型生成的注释转换为对话监督来实现。LLaVA-OneVision-2 [99] 进一步通过大规模重新字幕化的视频和空间语料库扩展了开放监督,而 Molmo2 [5] 强调了开放数据的重要性,并引入了完全开放的视频数据集,用于密集字幕、问答、指点和跟踪,且不依赖封闭的 VLM 蒸馏。Qwen3-VL [1] 展示了广泛的多模态预训练、长上下文训练、显式时间戳对齐和大规模后训练的价值,呼应了向大规模视频表示预训练 [106] 的更广泛转变。然而,强大的模型往往要么是专有的,要么仅开放权重,要么在发布时未提供完整的训练数据和构建管道。VideoChat3 遵循以数据为中心的视角,但专注于可复现的视频理解:它结合了重新标注的学术视频数据、合成的长视频监督数据和在线流式问答数据,并发布了模型权重、代码、训练配方、数据集和数据构建管道,使整个训练堆栈可检查且可重用。

时间定位与流式视频理解。除了整体视频问答外,最近的工作越来越多地研究视频 MLLMs 是否能够在时间上定位证据,并在视频展开时与之交互。TimeChat [12]、VTimeLLM [107]、LITA [108]、VTG-LLM [109] 和 Grounded-VideoLLM [110] 引入了时间戳令牌、边界感知目标或时间流,以实现细粒度的时间定位,同时结合了更广泛的时间定位和行动检测工作 [111]。基于强化学习的方法,如 VideoChat-R1 [112] 和 Video-R1 [113],通过可验证的奖励信号进一步改善了时空感知和视频推理。与此同时,在线视频理解已成为一种现实场景,模型必须处理部分观测、保持记忆并在恰当的时刻做出响应。OVBench [17]、ODVBench [19]、OVOBench [85]、StreamingBench [86]、VideoLLM-Online [15]、VideoChat-Online [17]、Flash-VStream [16]、StreamBridge [21]、StreamingVLM [92] 和 Stream-Forest [19] 等基准和系统揭示了离线视频问答与实时流式交互之间的差距。VideoChat3 通过训练长形式时间定位、密集字幕、长视频问答和主动流式问答,将这两个方向联系起来。其 Adaptive Frame Resolution 进一步使模型能够在对响应至关重要的时刻投入更多的视觉预算,而在常规间隔投入较少的预算,为离线和在线视频理解提供了一个统一的框架。

7 结论

在这项工作中,我们介绍了 VideoChat3,这是一个完全开放、高效且通用的视频 MLLM,旨在解决现有开源视频模型的三个核心局限性:有限的跨领域泛化能力、高昂的计算开销以及训练资产开放性的不足。得益于针对效率和效果的两个互补设计,VideoChat3 在广泛泛化能力和计算效率之间取得了良好的平衡:提出的 Inflated 3D Vision Transformer 和 Adaptive Frame Resolution for Streaming Video Perception 实现了高效的时空建模,并降低了训练和推理中的视频处理成本,而可扩展的数据合成管道整理了三个高质量数据集,涵盖通用、长形式和流式场景,以增强跨领域泛化能力。实验表明,仅使用 4B 参数,VideoChat3 在通用、长形式和流式基准测试中均优于先前同等甚至更大规模的开源模型,且具有更高的运行效率。通过完全释放所有模型和训练资源,我们为开源社区提供了一个完全可复现的研究基础,为更广泛的实际现实世界视频理解系统的进步铺平了道路。

21

第 22 页

参考文献

[1] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, 等. Qwen3-vl technical report. arXiv preprint arXiv:2511.21631, 2025.

[2] Yi Wang, Xinhao Li, Ziang Yan, Yinan He, Jiashuo Yu, Xiangyu Zeng, Chenting Wang, Changlian Ma, Haian Huang, Jianfei Gao, 等. Internvideo2.5: Empowering video mllms with long and rich context modeling. arXiv preprint arXiv:2501.12386, 2025.

[3] Xinhao Li, Yi Wang, Jiashuo Yu, Xiangyu Zeng, Yuhan Zhu, Haian Huang, Jianfei Gao, Kunchang Li, Yinan He, Chenting Wang, 等. Videochat-flash: Hierarchical compression for long-context video modeling. arXiv preprint arXiv:2501.00574, 2024.

[4] Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi, Triantafyllos Afouras, Tushar Nagarajan, Muhammad Maaz, Yale Song, Tengyu Ma, Shuming Hu, Suyog Jain, 等. Perceptionlm: Open-access data and models for detailed visual understanding. arXiv preprint arXiv:2504.13180, 2025.

[5] Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, 等. Molmo2: Open weights and data for vision-language models with video understanding and grounding. arXiv preprint arXiv:2601.10611, 2026.

[6] An Yang, Baosong Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Zhou, Chengpeng Li, Chengyuan Li, Dayiheng Liu, Fei Huang, Guanting Dong, Haoran Wei, Huan Lin, Jialong Tang, Jialin Wang, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Ma, Jin Xu, Jingren Zhou, Jinze Bai, Jinzheng He, Junyang Lin, Kai Dang, Keming Lu, Ke-Yang Chen, Kexin Yang, Mei Li, Min Xue, Na Ni, Pei Zhang, Peng Wang, Ru Peng, Rui Men, Ruize Gao, Runji Lin, Shijie Wang, Shuai Bai, Sinan Tan, Tianhang Zhu, Tianhao Li, Tianyu Liu, Wenbin Ge, Xiaodong Deng, Xiaohuan Zhou, Xingzhang Ren, Xinyu Zhang, Xipin Wei, Xuancheng Ren, Yang Fan, Yang Yao, Yichang Zhang, Yunyang Wan, Yunfei Chu, Zeyu Cui, Zhenru Zhang, and Zhi-Wei Fan. Qwen2 technical report. CoRR, abs/2407.10671, 2024.

[7] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, Chujie Zheng, Dayiheng Liu, Fan Zhou, Fei Huang, Feng Hu, Hao Ge, Haoran Wei, Huan Lin, Jialong Tang, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxi Yang, Jing Zhou, Jingren Zhou, Junyang Lin, Kai Dang, Keqin Bao, Kexin Yang, Le Yu, Lianghao Deng, Mei Li, Mingfeng Xue, Mingze Li, Pei Zhang, Peng Wang, Qin Zhu, Rui Men, Ruize Gao, Shixuan Liu, Shuang Luo, Tianhao Li, Tianyi Tang, Wenbiao Yin, Xingzhang Ren, Xinyu Wang, Xinyu Zhang, Xuancheng Ren, Yang Fan, Yang Su, Yichang Zhang, Yinger Zhang, Yu Wan, Yuqiong Liu, Zekun Wang, Zeyu Cui, Zhenru Zhang, Zhipeng Zhou, and Zihan Qiu. Qwen3 technical report, 2025. URL https://arxiv.org/abs/2505.09388.

[8] Ziang Yan, Yinan He, Xinhao Li, Zhengrong Yue, Xiangyu Zeng, Yali Wang, Yu Qiao, Limin Wang, and Yi Wang. Videochat-r1. 5: Visual test-time scaling to reinforce multimodal reasoning by iterative perception. Advances in Neural Information Processing Systems, 38:119152–119184, 2026.

[9] Minghao Qin, Xiangrui Liu, Zhengyang Liang, Yan Shu, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, and Zheng Liu. Video-xl-2: Towards very long-video understanding through task-aware kv sparsification. arXiv preprint arXiv:2506.19225, 2025.

[10] Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, 等. Video-o3: Native interleaved clue seeking for long video multi-hop reasoning. arXiv preprint arXiv:2601.23224, 2026.

[11] Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, and Xu Sun. Spacer: Reinforcing mllms in video spatial reasoning. arXiv preprint arXiv:2504.01805, 2025.

[12] Shuhuai Ren, Linli Yao, Shicheng Li, Xu Sun, and Lu Hou. Timechat: A time-sensitive multimodal large language model for long video understanding. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 14313–14323, 2024.

[13] Xiangyu Zeng, Kunchang Li, Chenting Wang, Xinhao Li, Tianxiang Jiang, Ziang Yan, Songze Li, Yansong Shi, Zhengrong Yue, Yi Wang, 等. Timesuite: Improving mllms for long video understanding via grounded tuning. In International Conference on Learning Representations, volume 2025, pages 38057–38081, 2025.

[14] Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, and Limin Wang. Timelens: Rethinking video temporal grounding with multimodal llms. arXiv preprint arXiv:2512.14698, 2025.

22

第 23 页

[15] Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song, Difei Gao, Jia-Wei Liu, Ziteng Gao, Dongxing Mao, 和 Mike Zheng Shou。Videollm-online:用于流式视频的在线视频大语言模型。 在 IEEE/CVF 计算机视觉与模式识别会议论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition)中,页码 18407–18418, 2024。

[16] Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Jifeng Dai, 和 Xiaojie Jin。Flash-vstream: 基于内存的长视频流实时理解。arXiv 预印本 arXiv:2406.08085,2024。

[17] Zhenpeng Huang, Xinhao Li, Jiaqi Li, Jing Wang, Xiangyu Zeng, Cheng Liang, Tao Wu, Xi Chen, Liang Li, 和 Limin Wang。在线视频理解:Ovbench 和 VideoChat-Online。在计算机视觉与模式识别会议论文集(Proceedings of the Computer Vision and Pattern Recognition Conference)中,页码 3328–3338,2025。

[18] Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, 和 Jiaqi Wang。 Dispider:通过解耦感知、决策和反应,使视频大语言模型具备主动实时交互能力。在计算机视觉与模式识别会议论文集(Proceedings of the Computer Vision and Pattern Recognition Conference)中,页码 24045–24055,2025。

[19] Xiangyu Zeng, Kefan Qiu, Qingyu Zhang, Xinhao Li, Jing Wang, Jiaxin Li, Ziang Yan, Kun Tian, Meng Tian, Xinhai Zhao, 等人。Streamforest:具有持久事件记忆的高效在线视频理解。神经信息处理系统进展(Advances in Neural Information Processing Systems),38:75804–75835,2026。

[20] Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, 和 Kaiyang Zhou。流式视频指令微调。 arXiv 预印本 arXiv:2512.21334,2025。

[21] Haibo Wang, Bo Feng, Zhengfeng Lai, Mingze Xu, Shiyu Li, Weifeng Ge, Afshin Dehghan, Meng Cao, 和 Ping Huang。Streambridge:将您的离线视频大语言模型转变为主动式流式助手。 神经信息处理系统进展(Advances in Neural Information Processing Systems),38:132332–132359,2026。

[22] Google。Gemini 3:新闻与公告。https://blog.google/products-and-platforms/products/ gemini/gemini-3-collection/,2025。

[23] Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, SH Cai, Yuan Cao, Y Charles, HS Che, Cheng Chen, Guanduo Chen, 等人。Kimi k2.5:视觉智能体智能。arXiv 预印本 arXiv:2602.02276,2026。

[24] Bytedance Seed。Seed1.8 模型卡:迈向通用现实世界代理能力。arXiv 预印本 arXiv:2603.20633, 2026。

[25] Zhe Chen, Weiyun Wang, Hao Tian, Shenglong Ye, Zhangwei Gao, Erfei Cui, Wenwen Tong, Kongzhi Hu, Jiapeng Luo, Zheng Ma, Ji Ma, Jiaqi Wang, Xiaoyi Dong, Hang Yan, Hewei Guo, Conghui He, Botian Shi, Zhenjiang Jin, Chao Xu, Bin Wang, Xingjian Wei, Wei Li, Wenjian Zhang, Bo Zhang, Pinlong Cai, Licheng Wen, Xiangchao Yan, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, 和 Wenhai Wang。我们距离 GPT-4V 还有多远?通过开源套件缩小与商业多模态模型的差距, 2024。URL https://arxiv.org/abs/2404.16821。

[26] Yuanhan Zhang, Jinming Wu, Wei Li, Bo Li, Zejun Ma, Ziwei Liu, 和 Chunyuan Li。LLaVA-Video: 使用合成数据进行视频指令微调。机器学习研究汇刊(Transactions on Machine Learning Research),2025。

[27] Mathew Monfort, SouYoung Jin, Alexander Liu, David Harwath, Rogerio Feris, James Glass, 和 Aude Oliva。 Spoken moments:从视频描述中学习联合音视频表示。在 IEEE/CVF 计算机视觉与模式识别会议论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition)中,页码 14871–14881,2021。

[28] Dongjie Yang, Suyuan Huang, Chengqiang Lu, Xiaodong Han, Haoxin Zhang, Yan Gao, Yao Hu, 和 Hai Zhao。 Vript:一个视频抵得上数千个词,2024。URL https://arxiv.org/abs/2406.06040。

[29] Kimi Team, Angang Du, Bohong Yin, Bowei Xing, Bowen Qu, Bowen Wang, Cheng Chen, Chenlin Zhang, Chenzhuang Du, Chu Wei, Congcong Wang, Dehao Zhang, Dikang Du, Dongliang Wang, Enming Yuan, Enzhe Lu, Fang Li, Flood Sung, Guangda Wei, Guokun Lai, Han Zhu, Hao Ding, Hao Hu, Hao Yang, Hao Zhang, Haoning Wu, Haotian Yao, Haoyu Lu, Heng Wang, Hongcheng Gao, Huabin Zheng, Jiaming Li, Jianlin Su, Jianzhou Wang, Jiaqi Deng, Jiezhong Qiu, Jin Xie, Jinhong Wang, Jingyuan Liu, Junjie Yan, Kun Ouyang, Liang Chen, Lin Sui, Longhui Yu, Mengfan Dong, Mengnan Dong, Nuo Xu, Pengyu Cheng, Qizheng Gu, Runjie Zhou, Shaowei Liu, Sihan Cao, Tao Yu, Tianhui Song, Tongtong Bai, Wei Song, Weiran He, Weixiao Huang, Weixin Xu, Xiaokun Yuan, Xingcheng Yao, Xingzhe Wu, Xinhao Li, Xinxing Zu, Xinyu Zhou, Xinyuan Wang, Y. Charles, Yan Zhong, Yang Li, Yangyang Hu, Yanru Chen, Yejie Wang, Yibo Liu, Yibo Miao, Yidao Qin, Yimin Chen, Yiping Bao, Yiqin Wang, Yongsheng Kang, Yuanxin Liu, Yuhao Dong, Yulun Du, Yuxin Wu, Yuzhi Wang, Yuzi Yan, Zaida Zhou, Zhaowei Li, Zhejun Jiang, Zheng Zhang, Zhilin Yang, Zhiqi Huang, Zihao Huang, Zijia Zhao, Ziwei Chen, 和 Zongyu Lin。Kimi-vl 技术报告,2025。URL https://arxiv.org/ abs/2504.07491。

23

第 24 页

[30] Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee。视觉指令微调。在 NeurIPS, 2023.

[31] Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, 和 Dahua Lin。Caprl: 通过强化学习激发密集图像描述能力。arXiv 预印本 arXiv:2509.22647, 2025.

[32] Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Conghui He, Jiaqi Wang, Feng Zhao, 和 Dahua Lin。Sharegpt4v: 通过更好的描述改进大型多模态模型, 2023. URL https://arxiv.org/abs/2311.12793.

[33] Xiaotong Li, Fan Zhang, Haiwen Diao, Yueze Wang, Xinlong Wang, 和 Ling-Yu Duan。Densefusion-1m: 合并视觉专家以实现全面的 multimodal 感知, 2024. URL https://arxiv.org/abs/2407.08303.

[34] Piyush Sharma, Nan Ding, Sebastian Goodman, 和 Radu Soricut。Conceptual captions: 一个经过清洗、超名词化的图像替代文本数据集,用于自动图像描述。在 Iryna Gurevych 和 Yusuke Miyao 编辑的, 第 56 届计算语言学协会年度会议论文集 (第一卷: 长论文), 第 2556–2565 页, 澳大利亚墨尔本, 2018 年 7 月。计算语言学协会。doi: 10.18653/v1/P18-1238. URL https://aclanthology.org/P18-1238/.

[35] Max Bain, Arsha Nagrani, Gül Varol, 和 Andrew Zisserman。Frozen in time: 用于端到端检索的联合视频和图像编码器。在 IEEE 国际计算机视觉会议, 2021.

[36] Will Kay, Joao Carreira, Karen Simonyan, Brian Zhang, Chloe Hillier, Sudheendra Vijayanarasimhan, Fabio Viola, Tim Green, Trevor Back, Paul Natsev, Mustafa Suleyman, 和 Andrew Zisserman。Kinetics 人类动作视频数据集, 2017. URL https://arxiv.org/abs/1705.06950.

[37] Daniel Bolya, Po-Yao Huang, Peize Sun, Jang Hyun Cho, Andrea Madotto, Chen Wei, Tengyu Ma, Jiale Zhi, Jathushan Rajasegaran, Hanoona Rasheed, Junke Wang, Marco Monteiro, Hu Xu, Shiyu Dong, Nikhila Ravi, Daniel Li, Piotr Dollár, 和 Christoph Feichtenhofer。Perception encoder: 最好的视觉嵌入不在网络的输出端, 2025. URL https://arxiv.org/abs/2504.13181.

[38] Liping Yuan, Jiawei Wang, Haomiao Sun, Yuchen Zhang, 和 Yuan Lin。Tarsier2: 从详细的视频描述推进到全面的视频理解的大型视觉-语言模型, 2025. URL https://arxiv.org/abs/2501.07888.

[39] Anna Rohrbach, Atousa Torabi, Marcus Rohrbach, Niket Tandon, Christopher Pal, Hugo Larochelle, Aaron Courville, 和 Bernt Schiele。Movie description, 2016. URL https://arxiv.org/abs/1605.03705.

[40] Xin Wang, Jiawei Wu, Junkun Chen, Lei Li, Yuan-Fang Wang, 和 William Yang Wang。Vatex: 一个用于视频和语言研究的大规模、高质量多语言数据集, 2020. URL https://arxiv.org/abs/1904.03493.

[41] Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem, 和 Juan Carlos Niebles。Activitynet: 一个用于人类活动理解的大规模视频基准。在 IEEE 计算机视觉与模式识别会议论文集, 第 961–970 页, 2015.

[42] Gunnar A Sigurdsson, Gül Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, 和 Abhinav Gupta。Hollywood in homes: 为活动理解收集众包数据。在欧洲计算机视觉会议, 第 510–526 页。Springer, 2016.

[43] Raghav Goyal, Samira Ebrahimi Kahou, Vincent Michalski, Joanna Materzynska, Susanne Westphal, Heuna Kim, Valentin Haenel, Ingo Fruend, Peter Yianilos, Moritz Mueller-Freitag, 等人。用于学习和评估视觉常识的“something something”视频数据库。在 IEEE 国际计算机视觉会议论文集, 第 5842–5850 页, 2017.

[44] Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, 等人。Ego4d: 在 3,000 小时的第一人称视频中环游世界。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 18995–19012 页, 2022.

[45] Share。Sharegemini: 为多模态大语言模型扩展视频描述数据, 2024 年 6 月。URL https://github.com/Share14/ShareGemini.

[46] Erfei Cui, Yinan He, Zheng Ma, Zhe Chen, Hao Tian, Weiyun Wang, Kunchang Li, Yi Wang, Wenhai Wang, Xizhou Zhu, Lewei Lu, Tong Lu, Yali Wang, Limin Wang, Yu Qiao, 和 Jifeng Dai。Sharegpt-4o: 使用 GPT-4o 进行全面的 multimodal 标注, 2024. URL https://sharegpt4o.github.io/.

24

第 25 页

[47] Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, and Shi-Min Hu. Bee: A high-quality corpus and full-stack suite to unlock advanced fully open mllms, 2026. URL https://arxiv.org/abs/2510.13795.

[48] Team Olmo, Allyson Ettinger, Amanda Bertsch, Bailey Kuehl, David Graham, David Heineman, Dirk Groen- eveld, Faeze Brahman, Finbarr Timbers, Hamish Ivison, Jacob Morrison, Jake Poznanski, Kyle Lo, Luca Sol- daini, Matt Jordan, Mayee Chen, Michael Noukhovitch, Nathan Lambert, Pete Walsh, Pradeep Dasigi, Robert Berry, Saumya Malik, Saurabh Shah, Scott Geng, Shane Arora, Shashank Gupta, Taira Anderson, Teng Xiao, Tyler Murray, Tyler Romero, Victoria Graf, Akari Asai, Akshita Bhagia, Alexander Wettig, Alisa Liu, Aman Rangapur, Chloe Anastasiades, Costa Huang, Dustin Schwenk, Harsh Trivedi, Ian Magnusson, Jaron Lochner, Jiacheng Liu, Lester James V. Miranda, Maarten Sap, Malia Morgan, Michael Schmitz, Michal Guerquin, Michael Wilson, Regan Huff, Ronan Le Bras, Rui Xin, Rulin Shao, Sam Skjonsberg, Shannon Zejiang Shen, Shuyue Stella Li, Tucker Wilde, Valentina Pyatkin, Will Merrill, Yapei Chang, Yuling Gu, Zhiyuan Zeng, Ashish Sabharwal, Luke Zettlemoyer, Pang Wei Koh, Ali Farhadi, Noah A. Smith, and Hannaneh Hajishirzi. Olmo 3, 2025. URL https://arxiv.org/abs/2512.13961.

[49] Jie Lei, Licheng Yu, Mohit Bansal, and Tamara L. Berg. Tvqa: Localized, compositional video question answering, 2019. URL https://arxiv.org/abs/1809.01696.

[50] Miquel Farré, Andi Marafioti, Lewis Tunstall, Leandro Von Werra, and Thomas Wolf. Finevideo. https: //huggingface.co/datasets/HuggingFaceFV/finevideo, 2024.

[51] Ruchit Rawal, Khalid Saifullah, Miquel Farré, Ronen Basri, David Jacobs, Gowthami Somepalli, and Tom Goldstein. Cinepile: A long video question answering dataset and benchmark. arXiv preprint arXiv:2405.08813, 2024.

[52] Muhammad Maaz, Hanoona Rasheed, Salman Khan, and Fahad Khan. Videogpt+: Integrating image and video encoders for enhanced video understanding, 2024. URL https://arxiv.org/abs/2406.09418.

[53] Yunseok Jang, Yale Song, Youngjae Yu, Youngjin Kim, and Gunhee Kim. Tgif-qa: Toward spatio-temporal reasoning in visual question answering, 2017. URL https://arxiv.org/abs/1704.04497.

[54] Kexin Yi, Chuang Gan, Yunzhu Li, Pushmeet Kohli, Jiajun Wu, Antonio Torralba, and Joshua B. Tenenbaum. Clevrer: Collision events for video representation and reasoning, 2020. URL https://arxiv.org/abs/1910. 01442.

[55] Haoyu Zhang, Qiaohui Chu, Meng Liu, Haoxiang Shi, Yaowei Wang, and Liqiang Nie. Exo2ego: Exocentric knowledge guided mllm for egocentric video understanding, 2025. URL https://arxiv.org/abs/2503.09143.

[56] Wenyi Hong, Yean Cheng, Zhuoyi Yang, Weihan Wang, Lefan Wang, Xiaotao Gu, Shiyu Huang, Yuxiao Dong, and Jie Tang. Motionbench: Benchmarking and improving fine-grained video motion understanding for vision language models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 8450–8460, 2025.

[57] Heng Fan, Liting Lin, Fan Yang, Peng Chu, Ge Deng, Sijia Yu, Hexin Bai, Yong Xu, Chunyuan Liao, and Haibin Ling. Lasot: A high-quality benchmark for large-scale single object tracking. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 5374–5383, 2019.

[58] Lianghua Huang, Xin Zhao, and Kaiqi Huang. Got-10k: A large high-diversity benchmark for generic object tracking in the wild. IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(5):1562–1577, May 2021. ISSN 1939-3539. doi: 10.1109/tpami.2019.2957464. URL http://dx.doi.org/10.1109/TPAMI.2019. 2957464.

[59] Chunhui Gu, Chen Sun, David A. Ross, Carl Vondrick, Caroline Pantofaru, Yeqing Li, Sudheendra Vijaya- narasimhan, George Toderici, Susanna Ricco, Rahul Sukthankar, Cordelia Schmid, and Jitendra Malik. Ava: A video dataset of spatio-temporally localized atomic visual actions, 2018. URL https://arxiv.org/abs/1705. 08421.

[60] Chenyou Fan. Egovqa-an egocentric video question answering benchmark dataset. In Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops, pages 0–0, 2019.

[61] Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, and Zuozhu Liu. Learning transferable temporal primitives for video reasoning via synthetic videos, 2026. URL https://arxiv.org/abs/ 2603.17693.

第 26 页

[62] Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, 和 Arman Cohan。 Tomato: 评估多模态基础模型中的视觉时序推理能力。在第十三届国际学习表征会议(The Thirteenth International Conference on Learning Representations),2025。

[63] Daniel Cores, Michael Dorkenwald, Manuel Mucientes, Cees GM Snoek, 和 Yuki M Asano。Tvbench: 重新设计视频-语言评估。arXiv 预印本 arXiv:2410.07752,2024。

[64] Yuanxin Liu, Shicheng Li, Yi Liu, Yuxiang Wang, Shuhuai Ren, Lei Li, Sishuo Chen, Xu Sun, 和 Lu Hou。 Tempcompass: 视频大语言模型真的理解视频吗?在计算语言学协会 ACL 2024 发现集(Findings of the Association for Computational Linguistics: ACL 2024),第 8731–8772 页。计算语言学协会,2024。

[65] Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yun- hang Shen, Mengdan Zhang, Peixian Chen, Yanwei Li, Shaohui Lin, Sirui Zhao, Ke Li, Tong Xu, Xiawu Zheng, Enhong Chen, Caifeng Shan, Ran He, 和 Xing Sun。Video-mme: 首个全面的视频分析多模态大语言模型评估基准。在 IEEE/CVF 计算机视觉与模式识别会议论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition),第 24108–24118 页,2025。

[66] Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Xiaotao Gu, Shiyu Huang, Bin Xu, Yuxiao Dong, Ming Ding, 和 Jie Tang。Lvbench: 一个极端长视频理解基准。arXiv 预印本 arXiv:2406.08035,2024。

[67] Wentao Ma, Weiming Ren, Yiming Jia, Zhuofeng Li, Ping Nie, Ge Zhang, 和 Wenhu Chen。Videoeval-pro: 鲁棒且真实的长视频理解评估。arXiv 预印本 arXiv:2505.14640,2025。

[68] Kairui Hu, Penghao Wu, Fanyi Pu, Wang Xiao, Yuanhan Zhang, Xiang Yue, Bo Li, 和 Ziwei Liu。Video-mmmu: 评估从多学科专业视频中获取知识的能力。arXiv 预印本 arXiv:2501.13826, 2025。

[69] Yilun Zhao, Haowei Zhang, Lujing Xie, Tongyan Hu, Guo Gan, Yitao Long, Zhiyuan Hu, Weiyuan Chen, Chuhan Li, Zhijian Xu, 等。Mmvu: 测量专家级多学科视频理解能力。在计算机视觉与模式识别会议论文集(Proceedings of the Computer Vision and Pattern Recognition Conference),第 8475–8489 页,2025。

[70] Arsha Nagrani, Sachit Menon, Ahmet Iscen, Shyamal Buch, Ramin Mehran, Nilpa Jha, Anja Hauth, Yukun Zhu, Carl Vondrick, Mikhail Sirotenko, 等。Minerva: 评估复杂视频推理。在 IEEE/CVF 国际计算机视觉会议论文集(Proceedings of the IEEE/CVF International Conference on Computer Vision),第 23968–23978 页,2025。

[71] Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing Hu, Xueying Li, Jinsen Su, Chengwu Long, Xiaoyao Xie, 等。Video-mme-v2: 迈向全面视频理解基准的下一阶段。arXiv 预印本 arXiv:2604.05015,2026。

[72] Jiyang Gao, Chen Sun, Zhenheng Yang, 和 Ram Nevatia。Tall: 通过语言查询进行时间活动定位。在 IEEE 国际计算机视觉会议论文集(Proceedings of the IEEE international conference on computer vision),第 5267–5275 页,2017。

[73] Ranjay Krishna, Kenji Hata, Frederic Ren, Li Fei-Fei, 和 Juan Carlos Niebles。Dense-captioning events in videos。在 IEEE 国际计算机视觉会议论文集(Proceedings of the IEEE international conference on computer vision),第 706–715 页,2017。

[74] Jie Lei, Tamara L Berg, 和 Mohit Bansal。Detecting moments and highlights in videos via natural language queries。神经信息处理系统进展(Advances in Neural Information Processing Systems),34:11846–11858,2021。

[75] Vidi Team, Celong Liu, Chia-Wen Kuo, Dawei Du, Fan Chen, Guang Chen, Jiamin Yuan, Lingxi Zhang, Lu Guo, Lusha Li, 等。Vidi: 用于视频理解和编辑的大型多模态模型。arXiv 预印本 arXiv:2504.15681,2025。

[76] Vidi Team, Celong Liu, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Guang Chen, Haoji Zhang, Haojun Zhao, Lingxi Zhang, 等。Vidi2: 用于视频理解和创作的大型多模态模型。 arXiv 预印本 arXiv:2511.19529,2025。

[77] Huaying Yuan, Jian Ni, Zheng Liu, Yueze Wang, Junjie Zhou, Zhengyang Liang, Bo Zhao, Zhao Cao, Ji-Rong Wen, 和 Zhicheng Dou。Momentseeker: 一个面向任务的长视频片段检索基准。神经信息处理系统进展(Advances in Neural Information Processing Systems),38,2026。

[78] OpenAI。GPT-5 系统卡。https://openai.com/index/gpt-5-system-card/,2025。

[79] Gheorghe Comanici, Eric Bieber, Mike Schaekermann, Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, 等。Gemini 2.5: 通过高级推理、多模态、长上下文和下一代代理能力推动前沿。arXiv 预印本 arXiv:2507.06261,2025。

[80] Anthropic。介绍 Claude Sonnet 4.5。https://www.anthropic.com/news/claude-sonnet-4-5,2025。

26

第 27 页

[81] Tianyu Yu, Zefan Wang, Chongyi Wang, Fuwei Huang, Wenshuo Ma, Zhihui He, Tianchi Cai, Weize Chen, Yuxiang Huang, Yuanqian Zhao, 等。Minicpm-v 4.5:通过架构、数据和训练配方烹饪高效的 mllms。arXiv 预印本 arXiv:2509.18154,2025。

[82] Guo Chen, Zhiqi Li, Shihao Wang, Jindong Jiang, Yicheng Liu, Lidong Lu, De-An Huang, Wonmin Byeon, Matthieu Le, Max Ehrlich, 等。Eagle 2.5:提升前沿视觉语言模型的长上下文后训练。神经信息处理系统进展,38:91077–91100,2026。

[83] Boqiang Zhang, Kehan Li, Zesen Cheng, Zhiqiang Hu, Yuqian Yuan, Guanzheng Chen, Sicong Leng, Yuming Jiang, Hang Zhang, Xin Li, 等。Videollama 3:用于图像和视频理解的前沿多模态基础模型。arXiv 预印本 arXiv:2501.13106,2025。

[84] Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, 等。Internvl3.5:在通用性、推理和效率方面推进开源多模态模型。arXiv 预印本 arXiv:2508.18265,2025。

[85] Junbo Niu, Yifei Li, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, 等。Ovo-bench:你的视频 llms 距离真实的在线视频理解还有多远?在计算机视觉与模式识别会议论文集,页码 18902–18913,2025。

[86] Junming Lin, Zheng Fang, Chi Chen, Haoxuan Cheng, Zihao Wan, Fuwen Luo, Ziyue Wang, Peng Li, Yang Liu, 和 Maosong Sun。Streamingbench:评估 mllms 实现流式视频理解的差距。在 ICASSP 2026-2026 IEEE 国际声学、语音和信号处理会议 (ICASSP),页码 12147–12151。IEEE,2026。

[87] Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, 和 Limin Wang。River:视频 llms 的实时交互基准。arXiv 预印本 arXiv:2603.03985,2026。

[88] Yikai Zheng, Xin Ding, Yifan Yang, Shiqi Jiang, Hao Wu, Qianxi Zhang, Weijun Wang, Ting Cao, 和 Yunxin Liu。Em-garde:一种用于主动流式视频理解的提议-匹配框架。arXiv 预印本 arXiv:2603.19054,2026。

[89] Yueqian Wang, Xiaojun Meng, Yifan Wang, Huishuai Zhang, 和 Dongyan Zhao。Proactivevideoqa:一个全面评估视频大语言模型中主动交互的基准。arXiv 预印本 arXiv:2507.09313,2025。

[90] Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li, Zejun Ma, 和 Mike Zheng Shou。Livecc:大规模流式语音转录下学习视频 llm。在计算机视觉与模式识别会议论文集,页码 29083–29095,2025。

[91] Linli Yao, Yicheng Li, Yuancheng Wei, Lei Li, Shuhuai Ren, Yuanxin Liu, Kun Ouyang, Lean Wang, Shicheng Li, Sida Li, 等。Timechat-online:在流式视频中,80% 的视觉令牌天然冗余。在第 33 届 ACM 国际多媒体会议论文集,页码 10807–10816,2025。

[92] Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Kelly Peng, Yao Lu, 和 Song Han。Streamingvlm: 无限视频流的实时理解。arXiv 预印本 arXiv:2510.09608,2025。

[93] Yueqian Wang, Songxiang Liu, Disong Wang, Nuo Xu, Guanglu Wan, Huishuai Zhang, 和 Dongyan Zhao。Mm- duet2:通过多轮强化学习增强视频 mllms 的主动交互。arXiv 预印本 arXiv:2512.06810,2025。

[94] Haoning Wu, Dongxu Li, Bei Chen, 和 Junnan Li。Longvideobench:长上下文交错视频语言理解的基准,2024。URL https://arxiv.org/abs/2407.15754。

[95] KunChang Li, Yinan He, Yi Wang, Yizhuo Li, Wenhai Wang, Ping Luo, Yali Wang, Limin Wang, 和 Yu Qiao。 Videochat:以聊天为中心的视频理解,2024。URL https://arxiv.org/abs/2305.06355。

[96] Muhammad Maaz, Hanoona Rasheed, Salman Khan, 和 Fahad Shahbaz Khan。Video-chatgpt:通过大型视觉和语言模型实现详细视频理解。在计算语言学协会第 62 届年会论文集 (ACL 2024),2024。

[97] Bin Lin, Bin Zhu, Yang Ye, Munan Ning, Peng Jin, 和 Li Yuan。Video-llava:通过投影前的对齐学习统一的视觉表示。arXiv 预印本 arXiv:2311.10122,2023。

[98] Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu, 和 Chunyuan Li。Llava-onevision:轻松的视觉任务迁移,2024。URL https://arxiv.org/ abs/2408.03326。

27

第 28 页

[99] Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, and Jiankang Deng. Llava-onevision-2: Towards next- generation perceptual intelligence, 2026. URL https://arxiv.org/abs/2605.25979.

[100] Yuhan Zhu, Yuyang Ji, Zhiyu Zhao, Gangshan Wu, and Limin Wang. Awt: Transferring vision-language models via augmentation, weighting, and transportation, 2024. URL https://arxiv.org/abs/2407.04603.

[101] Yuhan Zhu, Guozhen Zhang, Chen Xu, Haocheng Shen, Xiaoxin Chen, Gangshan Wu, and Limin Wang. Efficient test-time prompt tuning for vision-language models, 2024. URL https://arxiv.org/abs/2408.05775.

[102] Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, and Limin Wang. Freeret: Mllms as training-free retrievers, 2026. URL https://arxiv.org/abs/2509.24621.

[103] Guozhen Zhang, Yuhan Zhu, Yutao Cui, Xiaotong Zhao, Kai Ma, and Limin Wang. Motion-aware generative frame interpolation, 2025. URL https://arxiv.org/abs/2501.03699.

[104] Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, Lemeng Wu, Jun Chen, Chenchen Zhu, Zechun Liu, Fanyi Xiao, Balakrishnan Varadarajan, Florian Bordes, Zhuang Liu, Hu Xu, Hyunwoo J. Kim, Bilge Soran, Raghura- man Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra. Longvu: Spatiotemporal adaptive compression for long video-language understanding, 2024. URL https://arxiv.org/abs/2410.17434.

[105] Lin Chen, Xilin Wei, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Bin Lin, Zhenyu Tang, Li Yuan, Yu Qiao, Dahua Lin, Feng Zhao, and Jiaqi Wang. Sharegpt4video: Improving video understanding and generation with better captions, 2024. URL https://arxiv.org/abs/2406.04325.

[106] Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, and Limin Wang. Internvideo-next: Towards general video foundation models without video-text supervision, 2026. URL https://arxiv.org/abs/2512.01342.

[107] Bin Huang, Xin Wang, Hong Chen, Zihan Song, and Wenwu Zhu. Vtimellm: Empower llm to grasp video moments, 2023. URL https://arxiv.org/abs/2311.18445.

[108] De-An Huang, Shijia Liao, Subhashree Radhakrishnan, Hongxu Yin, Pavlo Molchanov, Zhiding Yu, and Jan Kautz. Lita: Language instructed temporal-localization assistant, 2024. URL https://arxiv.org/abs/2403. 19046.

[109] Yongxin Guo, Jingyu Liu, Mingda Li, Dingxin Cheng, Xiaoying Tang, Dianbo Sui, Qingbin Liu, Xi Chen, and Kevin Zhao. Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding, 2025. URL https://arxiv.org/abs/2405.13382.

[110] Haibo Wang, Zhiyang Xu, Yu Cheng, Shizhe Diao, Yufan Zhou, Yixin Cao, Qifan Wang, Weifeng Ge, and Lifu Huang. Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models, 2025. URL https://arxiv.org/abs/2410.03290.

[111] Yuhan Zhu, Guozhen Zhang, Jing Tan, Gangshan Wu, and Limin Wang. Dual detrs for multi-label temporal action detection, 2024. URL https://arxiv.org/abs/2404.00653.

[112] Xinhao Li, Ziang Yan, Desen Meng, Lu Dong, Xiangyu Zeng, Yinan He, Yali Wang, Yu Qiao, Yi Wang, and Limin Wang. Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning. arXiv preprint arXiv:2504.06958, 2025.

[113] Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, and Xiangyu Yue. Video-r1: Reinforcing video reasoning in mllms, 2025. URL https: //arxiv.org/abs/2503.21776.

28

第 29 页

A 附录

A.1 实现细节

离线视频理解。我们使用表 10 中总结的基准特定配置,在离线视频理解基准上评估 VideoChat3-4B。这些配置指定了视频采样率、最大采样帧数、每帧最大像素预算以及总视觉令牌预算。为了进行一致的比较,只要基线模型支持,我们对其应用相同的配置。如果由于帧数、空间分辨率或视觉令牌预算的限制,模型无法适应特定配置,我们遵循其官方实现推荐的默认评估设置。

表 10 离线视频理解基准的评估配置。“采样率”表示视频采样频率,“最大帧数”表示采样的最大帧数,“每帧像素预算”表示分配给每帧的最大输入像素数,“视觉令牌预算”表示视觉令牌的最大总数。

| Benchmark | Temporal Sampling (Temporal Sampling) | | | Visual Budget (Visual Budget) | | | :— | :— | :— | :— | :— | :— | | | Sampling Rate (采样率) | Max. Frames (最大帧数) | Pixel Budget / Frame (每帧像素预算) | Visual Token Budget (视觉令牌预算) | | | TemporalPerception (时间感知) | | | | | | | TOMATO [62] | 8 FPS | 2,048 | 448² | 80K | | | MotionBench [56] | 8 FPS | 2,048 | 448² | 80K | | | TVBench [63] | 8 FPS | 2,048 | 448² | 80K | | | TempCompass [64] | 8 FPS | 2,048 | 448² | 80K | | | Long-VideoUnderstanding (长视频理解) | | | | | | | Video-MME [65] | 2 FPS | 1,024 | 448² | 80K | | | LVBench [66] | 2 FPS | 2,048 | 448² | 80K | | | VideoEval-Pro [67] | 2 FPS | 2,048 | 448² | 80K | | | VideoReasoning (视频推理) | | | | | | | Video-MME-v2 [71] | 1 FPS | 512 | 448² | 80K | | | Video-MMMU [68] | 2 FPS | 512 | 768² | 80K | | | MMVU [69] | 2 FPS | 2,048 | 768² | 80K | | | Minerva [70] | 2 FPS | 2,048 | 448² | 80K | | | TemporalGrounding (时间定位) | | | | | | | TimeLens [14] | 4 FPS | 2,048 | 640² | 128K | | | VUE-TR V1 [75] | 1 FPS | 2,048 | 480² | 128K | | | VUE-TR V2 [76] | 1 FPS | 2,048 | 480² | 128K | | | MomentSeeker [77] | 2 FPS | 2,048 | 480² | 128K | |

在线视频理解。在线视频基准的评估配置总结在表 11 和表 12 中。我们使用这些表中报告的配置评估 VideoChat3-4B 和 Qwen3-VL-4B。对于其余的在线视频模型,大多数结果取自其原始论文。当没有官方报告的结果时,我们考虑到其支持的视频处理能力,使用不超过 2 FPS 的采样率对模型进行评估。

表 11 报告了感知与记忆基准的配置,包括视频采样率、保留的最大帧数、每帧最大像素预算以及总视觉令牌预算。特别是,OVOBench 使用 32 帧滑动窗口处理视频,而不是同时保留所有采样的帧。对于 ODVBench 和 OVBench,在评估期间,我们将所需的边界框输出范围从 [0, 1] 修改为 [0, 1000]。表 12 报告了主动响应基准的配置。除了采样率和最大帧数外,它还指定了在低分辨率和高分辨率感知状态下的每帧视觉令牌预算。它还报告了高分

第 30 页

分辨率窗口大小,定义为模型预测到 Standby 状态后以高分辨率处理的连续帧数。对于 OVOBench,我们报告整体得分和任务平均得分,其中“Task Avg.”表示每个基准组件内所有子任务的平均性能。对于 ProactiveVQA,我们报告在默认设置 $\omega = 0.5$ 下的 Proactive Area Under Curve (PAUC) 得分。

表 11 在线感知与记忆基准的评估配置。“Max. Frames”表示每个视频样本处理的最大帧数。对于 OVOBench,$32^*$ 表示滑动窗口的大小,而非从整个视频中采样的最大帧数。“Pixel Budget / Frame”表示分配给每帧的最大输入像素数,“Visual Token Budget”表示视觉令牌的最大总数。短划线表示对相应设置没有施加显式约束。

| Benchmark | \multicolumn{2}{c}{Temporal Sampling} | \multicolumn{2}{c}{Visual Budget} | | :— | :—: | :—: | :—: | :—: | | | Sampling Rate | Max. Frames | Pixel Budget / Frame | Visual Token Budget | | OVBench [17] | 2 FPS | 4,096 | 4482 | 80K | | ODVBench [19] | 4 FPS | 4,096 | 4482 | 80K | | OVOBench [85] | 2 FPS | 32* | 4482 | 80K | | StreamingBench [86] | 4 FPS | 4,096 | 4482 | 80K | | River [87] | 2 FPS | 512 | — | — |

表 12 在线主动响应基准的评估配置。“Low Tokens / Frame”和“High Tokens / Frame”分别表示在低分辨率感知和高分辨率感知下的每帧最大视觉令牌预算。“High-Budget Frames after Standby”表示在预测到 Standby 后,以高令牌预算处理的后续帧数。

| Benchmark | \multicolumn{2}{c}{Temporal Sampling} | \multicolumn{3}{c}{Adaptive Visual Allocation} | | :— | :—: | :—: | :—: | :—: | :—: | | | Sampling Rate | Max. Frames | Low Tokens / Frame | High Tokens / Frame | High-Budget Frames after Standby | | OVO-Timing [88] | 4 FPS | 128 | 64 | 256 | 3 | | ProactiveVQA [89] | 1 FPS | 32 | 128 | 512 | 1 |

A.2 演示

我们在图 10 至 15 中提供了 VideoChat3 广泛视频理解能力的更多定性演示。这些示例涵盖了细粒度动作描述、密集视频描述、长视频问答、时间推理、时间视频定位以及在线主动响应。在细粒度动作示例中,VideoChat3 捕捉到了细微的动作转换,并描述了复杂运动的完整过程。对于密集视频描述,模型识别出分布在视频中的多个事件,并对不断变化的内容生成时间连贯的描述。长视频示例展示了其从扩展的时间上下文中检索特定视觉细节的能力,而推理示例则表明它能够识别并按时间顺序组织在不同时间戳发生的事件。在更细的时间粒度上,VideoChat3 能够沿视频时间线准确定位语言描述的事件。最后,在流式设置中,当缺乏相关视觉证据时,模型选择保持沉默,一旦有信息性内容可用,便主动响应。

30

第 31 页

细粒度运动理解 运动

展示 5 帧

01 02 03 04 05

时间

用户 VideoChat3

请详细描述视频中运动员的动作。 视频开始时,一名身穿红色上衣和黑色短裤的男子手持撑杆在跑道上奔跑。 他正在准备撑杆跳高,当他接近起跳区时,他将撑杆插入地面,并利用它将自己 向上推起。随后,运动员在空中完成了一个翻腾动作, 展示了他的敏捷性和技巧。落在垫子上后,他站起来走开,看起来 对他的表现感到满意。视频捕捉了撑杆跳的完整过程,从 助跑到落地以及运动员随后的反应。

图 10 细粒度视频描述的质量示例。VideoChat3 描述了完整的撑杆跳 序列,包括助跑、插杆、起跳、过杆和落地。

长视频理解 长上下文

展示 4 帧

01 02 03 04

时间

上下文 27:30 之后 83:43

用户 VideoChat3

她的立式麦克风支架是什么颜色? 根据视频,麦克风支架是粉色的。

图 11 长视频问答的质量示例。VideoChat3 从 长视频中检索特定的视觉细节,并正确识别立式麦克风支架的颜色。

时序推理 排序

展示 4 帧

01 02 03 04

时间

00:18 00:40 02:27 03:03

用户 VideoChat3

按时间顺序排列以下事件: 根据视频,事件的时间顺序如下: ① 穿蓝色衣服的女人按下了一楼的按钮。 1. ① 穿蓝色衣服的女人按下了一楼的按钮。(0:18) ② 穿绿色衣服的男人进入电梯。 2. ② 穿绿色衣服的男人进入电梯。(0:24) ③ 穿蓝色衣服的女人无法启动汽车。 3. ④ 电梯发生故障。(0:40) ④ 电梯发生故障。 4. ③ 穿蓝色衣服的女人无法启动汽车。(2:27) ⑤ 穿绿色衣服的男人敲车窗修车。 5. ⑤ 穿绿色衣服的男人敲车窗修车。(3:03) 因此,正确的顺序是 ①, ②, ④, ③, ⑤。

图 12 视频时序推理的质量示例。VideoChat3 识别分布在视频中的 事件,并按时间顺序排列它们。

31

第 32 页

视频时间定位 定位

显示 4 帧

01 02 03 04

时间

用户 VideoChat3

请找出句子“婴儿被安全带固定在汽车座椅中”所描述的视觉事件,确定其开始和结束时间。 真实标签 108秒 – 119秒 PREDICTION 107秒 – 119秒

边界偏差 1秒

图 13 视频时间定位的定性示例。给定语言描述,VideoChat3 能够准确定位相应事件,与真实时间区间的边界偏差极小。

流式视频理解 主动响应

显示 4 帧

01 02 03 04

时间

用户 VideoChat3

男子身后的屏幕上有什么内容? 流式输出

无响应 响应 无响应 响应 </Silence> 烤玉米的特写 </Silence> 背景中充满了鲜艳香蕉。

时间

图 14 在线主动响应的定性示例。在流式感知过程中,当缺乏相关证据时,VideoChat3 保持沉默;一旦出现具有信息量的视觉内容,便及时生成响应。

时间密集描述 密集描述

显示 6 帧

01 02 03 04 05 06

时间

00:04 00:13 00:23 00:34 00:48 01:05

用户 VideoChat3

分析视频并按时间顺序生成描述重要视觉事件的密集描述。 [00:00-00:08] 一名身穿红黑相间队服的撑杆跳运动员在跑道上冲刺,准备起跳。运动员手持撑杆奔跑,在接近起跳区时获得动量。 [00:08-00:18] 撑杆跳运动员将撑杆插入穴斗并腾空而起,身体弓起越过横杆。镜头跟随运动员的上升过程,捕捉到起跳的最高点,背景是观众和活动横幅。 [00:18-00:28] 撑杆跳运动员落在蓝色垫子上,通过滚动来缓冲冲击力。运动员坐起身来,看起来正在从落地中恢复,而官员和 旁观者在附近观察。 [00:28-00:40] 撑杆跳运动员躺在垫子上,然后开始坐起并站立,显示出疲劳的迹象。运动员的动作表明他们正在从剧烈的努力中 恢复平静。 [00:40-00:55] 撑杆跳运动员离开垫子,与官员和其他运动员互动。运动员似乎在讨论表现,可能正在 接受反馈或指导。 [00:55-01:14] 撑杆跳运动员继续在跑道上行走,经过官员和旁观者。运动员的神态显示出疲惫和 满足感的混合,因为他们反思已完成的起跳。

图 15 视频密集描述的定性示例。VideoChat3 识别出视频中的多个事件,并生成在时间上连贯的描述,以捕捉其不断变化的内容。

32

发表评论