快速导读:提出VideoRouter,将长视频理解重构为协调互补的全局与局部证据视图,并通过验证引导路由自适应选择或融合两者,而非选择单一最优帧子集。
长视频理解是多模态大模型(MLLMs)面临的核心挑战之一。受限于token预算,现有方法通常采用均匀采样或自适应帧选择来压缩视频信息。然而,这两种策略都存在根本性缺陷:均匀采样稀释了细粒度证据,帧选择则丢失了全局时间上下文。VideoRouter提出了一种全新的视角——不再试图寻找单一最优帧子集,而是将长视频理解重构为协调互补的全局与局部证据视图。
该框架首先将视频组织为问题无关的时间层次结构,基于此构建全局代表性视图(覆盖故事线)和局部查询引导视图(恢复细节证据)。随后,验证引导路由器评估每个分支预测的证据支持度,自适应地接受高置信度预测,或在证据不足时对两个证据集的并集进行额外推理。实验表明,VideoRouter在VideoMME和LongVideoBench上均优于现有免训练方法。
英文题目:Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs
论文出处:arXiv 每日论文精选 · arXiv:2608.05592
原始论文:PDF / 论文页面
这篇论文解决什么问题?
多模态大模型在长视频理解中面临的核心矛盾是:视频包含海量时空信息,但MLLM的上下文窗口有限。均匀采样是最直接的解决方案,但它在压缩过程中不加区分地丢弃信息,导致对细粒度视觉细节敏感的问题表现不佳。帧选择方法试图通过查询相关性或自适应策略保留关键帧,但这类方法隐含假设存在一个“最优帧子集”能够同时满足所有问题的需求。
VideoRouter的作者指出,长视频中的证据天然具有多粒度性。某些问题依赖全局事件进展——例如“视频中的人物最终去了哪里?”——需要覆盖完整时间线的上下文。另一些问题则取决于短暂的局部细节——例如“人物手中的手机是什么颜色?”——需要高时间分辨率的证据。单一帧子集无法同时满足这两种需求。
更关键的是,作者通过实验揭示了一个反直觉的发现:更强的独立分支未必是更好的合作伙伴。当固定全局分支、通过调整剪枝阈值改变局部分支的强度时,局部分支的独立性能提升并不总是带来更好的路由结果。这一观察直接挑战了“优化各分支再集成”的常规思路,为VideoRouter的设计提供了核心动机。
与VideoAgent、VideoTree等将MLLM作为智能体在帧池中搜索的方法不同,VideoRouter不依赖多轮推理来定位相关帧,而是通过预先构建的层次化视图和验证路由实现高效协调。与AKS、Q-Frame等自适应帧选择方法相比,VideoRouter从根本上放弃了“选择单一帧子集”的范式。
核心创新
- 将长视频理解重新定义为协调互补证据视图,而非选择单一最优帧子集,并揭示了更强的独立分支未必是更好合作伙伴的权衡关系。
- 提出VideoRouter框架,通过时间层次结构构建互补的全局和局部证据视图,并采用验证引导路由自适应选择或融合两者。
方法概览
VideoRouter首先将视频组织为问题无关的时间层次结构(粗到细的时间连贯片段),基于此构建全局代表性视图(用于覆盖故事线)和局部查询引导视图(用于恢复细节证据)。然后引入验证引导路由器,评估每个分支预测的证据支持度,并据此接受高置信度预测,或在证据不足时对两个证据集的并集进行额外推理。
- 时间层次结构构建:将输入视频递归分割为时间连贯的片段,形成粗到细的树状结构。上层捕获粗略的故事单元,下层保留更精细的事件细节。该结构是问题无关的,仅基于视觉线索构建,无需依赖音频或字幕。
- 全局代表性视图:从时间层次结构的指定深度d_rep提取代表性帧(如每段的中心帧或均匀采样帧),构建覆盖完整故事线的全局证据集F_g。该视图牺牲时间分辨率以换取上下文完整性。
- 局部查询引导视图:利用查询与层次结构叶子节点的相似度进行剪枝,保留与问题最相关的细粒度帧,构建局部证据集F_l。剪枝阈值α控制局部分支的严格程度,α越大剪枝越激进。
- 双分支独立推理:全局分支和局部分支分别基于各自的证据集进行视觉问答,产生独立的预测答案。两个分支使用相同的MLLM骨干,但输入证据的粒度和覆盖范围截然不同。
- 验证引导路由:引入验证器MLLM,评估每个分支预测在给定证据下的支持程度,输出验证分数。路由器根据分数决定:若某一分支的分数超过阈值,直接接受其预测;否则触发回退推理,将F_g和F_l的并集输入MLLM进行额外推理。
- 验证器设计:验证器接收候选答案和对应的证据帧,输出0-1之间的支持度分数。实验比较了Qwen2.5-VL-7B和LLaVA-Video-7B作为验证器的效果,前者表现更优。
- 回退推理机制:当两个分支的验证分数都不够高时,系统将全局和局部证据合并,进行一次额外的联合推理。这确保了在证据模糊或分散的情况下,模型仍能访问完整的证据集。
- 超参数配置:全局表示深度d_rep和局部剪枝阈值α是两个关键超参数。实验发现最优设置在VideoMME和LongVideoBench上表现不同,需根据数据集特点调整。
逐图理解论文
反直觉的发现

该图展示了核心反直觉发现:更强的独立局部分支未必是更好的合作伙伴。横轴表示局部分支剪枝阈值α(从左到右越来越严格),纵轴为准确率。虽然更严格的剪枝削弱了独立局部分支,但预言机上限(全局与局部的理想融合)却持续上升,揭示了分支间的复杂权衡关系。
研究空白与核心思路

VideoRouter的整体框架图。视频首先被组织为时间层次结构,然后分别构建全局代表性证据集F_g和局部查询引导证据集F_l。两个分支独立进行VQA后,验证模型评估其证据支持度,路由器据此决定直接接受某一分支预测或触发回退推理。
实验验证

在VideoMME和LongVideoBench两个长视频问答基准上,VideoRouter使用多种骨干模型均优于现有免训练方法。消融实验进一步验证了每个组件的必要性:移除时间层次结构导致性能显著下降,验证引导路由也明显优于简单的置信度集成。定性分析显示,全局和局部分支确实关注不同的时间证据,验证分数能够有效识别证据质量更高的预测。
实验如何设计?
- 基准数据集:VideoMME和LongVideoBench(LVB),均为长视频多项选择问答基准。VideoMME包含多种视频类型和时长,LVB专注于需要长程时间推理的问题。
- 骨干模型:Qwen2.5-VL(3B和7B)、Qwen2-VL-7B、LLaVA-Video-7B。验证器默认使用Qwen2.5-VL-7B。
- 对比方法:均匀采样基线、单分支推理(仅全局或仅局部)、免训练视频智能体(VideoRAG、VideoMind等)、自适应帧选择方法(AKS、Q-Frame等)。
- 评估指标:多项选择准确率。同时报告MLLM调用次数和视觉token数量作为推理成本指标。
- 消融实验:分别移除时间层次结构、替换验证路由为轻量集成方法、改变全局表示深度d_rep、调整局部剪枝阈值α、更换验证器模型。
- 分析实验:验证分数范围与准确率的关系、直接接受与回退推理的准确率对比、典型失败案例分类。
关键结果与论文证据
- VideoRouter-Q在VideoMME上达到65.52%,在LongVideoBench上达到64.23%,均优于其他7B规模的免训练方法(Table 1, p.7)。
- 在LLaVA-Video-7B骨干下,VideoRouter在VideoMME上以64.37%的准确率,比AKS方法高出2.9个百分点(Table 3, p.7)。
- 在LongVideoBench上,VideoRouter相比均匀采样提升显著,在Qwen2.5-VL-7B上提升8.23个百分点(56.00%→64.23%)(Table 1, p.7)。
- 移除时间层次结构导致LongVideoBench上性能下降4.43个百分点(64.23%→59.80%),验证了层次化组织的必要性(Figure 3, p.8)。
- 验证引导路由相比基于下一token置信度的集成方法,在LongVideoBench上准确率高出2.73个百分点(Figure 3, p.8)。
- 直接接受的样本准确率远高于回退推理样本,差距在VideoMME上为15.75-19.26个百分点,在LVB上为13.07-22.47个百分点,表明验证器有效识别了证据质量(Figure 5, p.17)。
- 更强的独立局部分支并不总是带来更好的路由性能。当固定全局分支、减小剪枝阈值α以增强局部分支时,路由准确率反而可能下降(Table 7, p.16)。
- 典型失败案例包括字幕/文本对齐错误、时间顺序混淆和计数错误,表明验证路由在需要精确文本理解或细粒度时序推理时仍有不足(Table 12, p.19)。
阅读时需要注意
- 时间层次结构目前仅基于视觉线索构建,未利用音频、字幕等多模态信息,可能导致语义结构不够精确。
- 验证引导路由的结果与预言机上限之间仍存在明显差距,表明分支协调仍有改进空间,尤其在证据模糊或分散的情况下。
- 实验仅关注长视频多项选择问答,框架在更开放的长视频推理任务(如开放式问答、视频摘要)上的泛化能力尚待验证。
- 推理成本高于单次均匀采样,平均MLLM调用次数为4.30次,视觉token数量为1.77倍,适用于对理解准确率要求高于推理延迟的场景。
- 方法性能对超参数敏感,最优设置在VideoMME和LongVideoBench上表现不同,实际部署需根据数据集特点调整。
关联工作
- AKS(Adaptive Keyframe Sampling)通过平衡帧-问题相关性和时间覆盖度进行自适应关键帧采样,属于帧选择范式。VideoRouter在相同帧预算下性能优于它。
- VideoAgent将MLLM作为智能体在平面帧池中通过多轮推理搜索有用帧,VideoRouter则通过层次化视图和验证路由进行协调,避免了多轮搜索的开销。
- VideoRAG使用MLLM作为控制器调用外部工具进行视频分析,VideoRouter在VideoMME和LVB上性能均优于它。
- Q-Frame使用Gumbel-Max技巧进行高效帧选择并自适应调整分辨率,VideoRouter在64帧预算下性能优于它。