VideoRouter:不选帧,而是协调互补证据视图

快速导读:提出VideoRouter,将长视频理解重构为协调互补的全局与局部证据视图,并通过验证引导路由自适应选择或融合两者,而非选择单一最优帧子集。

长视频理解是多模态大模型(MLLMs)面临的核心挑战之一。受限于token预算,现有方法通常采用均匀采样或自适应帧选择来压缩视频信息。然而,这两种策略都存在根本性缺陷:均匀采样稀释了细粒度证据,帧选择则丢失了全局时间上下文。VideoRouter提出了一种全新的视角——不再试图寻找单一最优帧子集,而是将长视频理解重构为协调互补的全局与局部证据视图。

该框架首先将视频组织为问题无关的时间层次结构,基于此构建全局代表性视图(覆盖故事线)和局部查询引导视图(恢复细节证据)。随后,验证引导路由器评估每个分支预测的证据支持度,自适应地接受高置信度预测,或在证据不足时对两个证据集的并集进行额外推理。实验表明,VideoRouter在VideoMME和LongVideoBench上均优于现有免训练方法。

英文题目:Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

论文出处:arXiv 每日论文精选 · arXiv:2608.05592

原始论文:PDF / 论文页面

这篇论文解决什么问题?

多模态大模型在长视频理解中面临的核心矛盾是:视频包含海量时空信息,但MLLM的上下文窗口有限。均匀采样是最直接的解决方案,但它在压缩过程中不加区分地丢弃信息,导致对细粒度视觉细节敏感的问题表现不佳。帧选择方法试图通过查询相关性或自适应策略保留关键帧,但这类方法隐含假设存在一个“最优帧子集”能够同时满足所有问题的需求。

VideoRouter的作者指出,长视频中的证据天然具有多粒度性。某些问题依赖全局事件进展——例如“视频中的人物最终去了哪里?”——需要覆盖完整时间线的上下文。另一些问题则取决于短暂的局部细节——例如“人物手中的手机是什么颜色?”——需要高时间分辨率的证据。单一帧子集无法同时满足这两种需求。

更关键的是,作者通过实验揭示了一个反直觉的发现:更强的独立分支未必是更好的合作伙伴。当固定全局分支、通过调整剪枝阈值改变局部分支的强度时,局部分支的独立性能提升并不总是带来更好的路由结果。这一观察直接挑战了“优化各分支再集成”的常规思路,为VideoRouter的设计提供了核心动机。

与VideoAgent、VideoTree等将MLLM作为智能体在帧池中搜索的方法不同,VideoRouter不依赖多轮推理来定位相关帧,而是通过预先构建的层次化视图和验证路由实现高效协调。与AKS、Q-Frame等自适应帧选择方法相比,VideoRouter从根本上放弃了“选择单一帧子集”的范式。

核心创新

  • 将长视频理解重新定义为协调互补证据视图,而非选择单一最优帧子集,并揭示了更强的独立分支未必是更好合作伙伴的权衡关系。
  • 提出VideoRouter框架,通过时间层次结构构建互补的全局和局部证据视图,并采用验证引导路由自适应选择或融合两者。

方法概览

VideoRouter首先将视频组织为问题无关的时间层次结构(粗到细的时间连贯片段),基于此构建全局代表性视图(用于覆盖故事线)和局部查询引导视图(用于恢复细节证据)。然后引入验证引导路由器,评估每个分支预测的证据支持度,并据此接受高置信度预测,或在证据不足时对两个证据集的并集进行额外推理。

  • 时间层次结构构建:将输入视频递归分割为时间连贯的片段,形成粗到细的树状结构。上层捕获粗略的故事单元,下层保留更精细的事件细节。该结构是问题无关的,仅基于视觉线索构建,无需依赖音频或字幕。
  • 全局代表性视图:从时间层次结构的指定深度d_rep提取代表性帧(如每段的中心帧或均匀采样帧),构建覆盖完整故事线的全局证据集F_g。该视图牺牲时间分辨率以换取上下文完整性。
  • 局部查询引导视图:利用查询与层次结构叶子节点的相似度进行剪枝,保留与问题最相关的细粒度帧,构建局部证据集F_l。剪枝阈值α控制局部分支的严格程度,α越大剪枝越激进。
  • 双分支独立推理:全局分支和局部分支分别基于各自的证据集进行视觉问答,产生独立的预测答案。两个分支使用相同的MLLM骨干,但输入证据的粒度和覆盖范围截然不同。
  • 验证引导路由:引入验证器MLLM,评估每个分支预测在给定证据下的支持程度,输出验证分数。路由器根据分数决定:若某一分支的分数超过阈值,直接接受其预测;否则触发回退推理,将F_g和F_l的并集输入MLLM进行额外推理。
  • 验证器设计:验证器接收候选答案和对应的证据帧,输出0-1之间的支持度分数。实验比较了Qwen2.5-VL-7B和LLaVA-Video-7B作为验证器的效果,前者表现更优。
  • 回退推理机制:当两个分支的验证分数都不够高时,系统将全局和局部证据合并,进行一次额外的联合推理。这确保了在证据模糊或分散的情况下,模型仍能访问完整的证据集。
  • 超参数配置:全局表示深度d_rep和局部剪枝阈值α是两个关键超参数。实验发现最优设置在VideoMME和LongVideoBench上表现不同,需根据数据集特点调整。

逐图理解论文

反直觉的发现

反直觉的发现
Figure 1: The best local branch is not always the best partner. Using the temporal hierarchy, we fix the global branch and vary the pruning threshold of the shared local branch. The x-axis denotes the strictness of local pruning, with α ∈{0.85, 0.90, 0.95} from left to right. For the global branch, Global-U uniformly samples 4 frames from each segment at drep = 1, while Global-C uses the center frame of each segment at the same level. Although Global-U and Global-C use different global sampling strategies, they exhibit a similar trend: stricter local pruning weakens the standalone local branch, yet consistently raises the oracle upper bound.

该图展示了核心反直觉发现:更强的独立局部分支未必是更好的合作伙伴。横轴表示局部分支剪枝阈值α(从左到右越来越严格),纵轴为准确率。虽然更严格的剪枝削弱了独立局部分支,但预言机上限(全局与局部的理想融合)却持续上升,揭示了分支间的复杂权衡关系。

研究空白与核心思路

研究空白与核心思路
Figure 2: Overview of the proposed VideoRouter. The input video is first organized into a temporal hierarchy, where each s represents a segment containing multiple frames. For clarity, the illustration shows the full video being divided into two coarse segments at the first layer; in practice, however, the first layer typically contains around 32 coarse segments. Based on this hierarchy, we derive a global representative evidence set Fg and a local query-guided evidence set Fl. The two branches perform VQA independently and are further assessed by a verification model. Verification-guided routing either accepts a sufficiently supported branch prediction or invokes an additional reasoning pass on the union of both evidence sets.

VideoRouter的整体框架图。视频首先被组织为时间层次结构,然后分别构建全局代表性证据集F_g和局部查询引导证据集F_l。两个分支独立进行VQA后,验证模型评估其证据支持度,路由器据此决定直接接受某一分支预测或触发回退推理。

实验验证

实验验证
Table 1: Comparison of global, local, and verification-guided routing strategies on VideoMME and LongVideoBench. Oracle denotes the upper-bound accuracy where a sample is considered correct if either the global or local branch predicts the correct answer. Uniform denotes the standard uniform sampling reference (128 frames for Qwen models and 64 frames for LLaVA-Video).

在VideoMME和LongVideoBench两个长视频问答基准上,VideoRouter使用多种骨干模型均优于现有免训练方法。消融实验进一步验证了每个组件的必要性:移除时间层次结构导致性能显著下降,验证引导路由也明显优于简单的置信度集成。定性分析显示,全局和局部分支确实关注不同的时间证据,验证分数能够有效识别证据质量更高的预测。

实验如何设计?

  • 基准数据集:VideoMME和LongVideoBench(LVB),均为长视频多项选择问答基准。VideoMME包含多种视频类型和时长,LVB专注于需要长程时间推理的问题。
  • 骨干模型:Qwen2.5-VL(3B和7B)、Qwen2-VL-7B、LLaVA-Video-7B。验证器默认使用Qwen2.5-VL-7B。
  • 对比方法:均匀采样基线、单分支推理(仅全局或仅局部)、免训练视频智能体(VideoRAG、VideoMind等)、自适应帧选择方法(AKS、Q-Frame等)。
  • 评估指标:多项选择准确率。同时报告MLLM调用次数和视觉token数量作为推理成本指标。
  • 消融实验:分别移除时间层次结构、替换验证路由为轻量集成方法、改变全局表示深度d_rep、调整局部剪枝阈值α、更换验证器模型。
  • 分析实验:验证分数范围与准确率的关系、直接接受与回退推理的准确率对比、典型失败案例分类。

关键结果与论文证据

  • VideoRouter-Q在VideoMME上达到65.52%,在LongVideoBench上达到64.23%,均优于其他7B规模的免训练方法(Table 1, p.7)。
  • 在LLaVA-Video-7B骨干下,VideoRouter在VideoMME上以64.37%的准确率,比AKS方法高出2.9个百分点(Table 3, p.7)。
  • 在LongVideoBench上,VideoRouter相比均匀采样提升显著,在Qwen2.5-VL-7B上提升8.23个百分点(56.00%→64.23%)(Table 1, p.7)。
  • 移除时间层次结构导致LongVideoBench上性能下降4.43个百分点(64.23%→59.80%),验证了层次化组织的必要性(Figure 3, p.8)。
  • 验证引导路由相比基于下一token置信度的集成方法,在LongVideoBench上准确率高出2.73个百分点(Figure 3, p.8)。
  • 直接接受的样本准确率远高于回退推理样本,差距在VideoMME上为15.75-19.26个百分点,在LVB上为13.07-22.47个百分点,表明验证器有效识别了证据质量(Figure 5, p.17)。
  • 更强的独立局部分支并不总是带来更好的路由性能。当固定全局分支、减小剪枝阈值α以增强局部分支时,路由准确率反而可能下降(Table 7, p.16)。
  • 典型失败案例包括字幕/文本对齐错误、时间顺序混淆和计数错误,表明验证路由在需要精确文本理解或细粒度时序推理时仍有不足(Table 12, p.19)。

阅读时需要注意

  • 时间层次结构目前仅基于视觉线索构建,未利用音频、字幕等多模态信息,可能导致语义结构不够精确。
  • 验证引导路由的结果与预言机上限之间仍存在明显差距,表明分支协调仍有改进空间,尤其在证据模糊或分散的情况下。
  • 实验仅关注长视频多项选择问答,框架在更开放的长视频推理任务(如开放式问答、视频摘要)上的泛化能力尚待验证。
  • 推理成本高于单次均匀采样,平均MLLM调用次数为4.30次,视觉token数量为1.77倍,适用于对理解准确率要求高于推理延迟的场景。
  • 方法性能对超参数敏感,最优设置在VideoMME和LongVideoBench上表现不同,实际部署需根据数据集特点调整。

关联工作

  • AKS(Adaptive Keyframe Sampling)通过平衡帧-问题相关性和时间覆盖度进行自适应关键帧采样,属于帧选择范式。VideoRouter在相同帧预算下性能优于它。
  • VideoAgent将MLLM作为智能体在平面帧池中通过多轮推理搜索有用帧,VideoRouter则通过层次化视图和验证路由进行协调,避免了多轮搜索的开销。
  • VideoRAG使用MLLM作为控制器调用外部工具进行视频分析,VideoRouter在VideoMME和LVB上性能均优于它。
  • Q-Frame使用Gumbel-Max技巧进行高效帧选择并自适应调整分辨率,VideoRouter在64帧预算下性能优于它。

发表评论