三分钟导读:本文提出MoD-VLLM框架,通过正负视频片段定位模块和模块化动态粒度反射模块的迭代闭环,实现长视频中关键事件的自适应细粒度编码与全局上下文保留,显著提升了多事件理解能力。
英文题目:Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding
论文出处:arXiv 每日论文精选 · arXiv:2607.15778
原始论文:PDF / 论文页面
对应视频标题:MoD-VLLM:模块化动态粒度长视频理解,突破Token预算与多事件定位瓶颈|推荐指数:★★★★★
这篇论文解决什么问题?
现有长视频理解方法在有限视觉Token预算与捕捉多个关键事件需求之间存在张力;Token减少方法导致细节丢失,关键帧选择方法存在不可逆的错误传播,且缺乏自适应容量分配和自我修正机制。
核心创新
- 提出正负视频片段定位模块,实现基于问题的自适应片段区分。
- 设计模块化动态粒度反射机制,根据片段相关性动态调整编码粒度(细粒度捕捉细节,粗粒度保留全局)。
- 引入迭代式自我修正框架,结合反事实验证缓解定位错误传播。
- 提出动态粒度强化学习策略,联合优化定位策略和动态粒度视觉表示。
- 构建MEventBench基准,专门评估复杂长视频中的多事件理解和推理能力。
方法概览
提出MoD-VLLM框架,包含:1) Positive-Negative Video Segments Grounding模块,利用视频LLM识别与问题相关的正片段和无关的负片段;2) Modularized Dynamic-Granularity Reflection模块,根据片段重要性动态分配细粒度(正片段)和粗粒度(负片段)编码;3) 动态粒度强化学习策略,通过DPO优化定位策略和视觉表示;4) 反事实粒度验证以减轻错误传播。
逐图理解论文
MoD-VLLM框架概览

本文提出MoD-VLLM框架,通过迭代闭环实现长视频的高效理解。该框架包含两个核心模块:正负视频片段定位模块,用于识别与问题相关的正片段和无关的负片段;以及模块化动态粒度反射模块,根据片段重要性动态分配编码粒度,从而在细节捕捉与全局上下文保留之间取得平衡。
MEventBench基准构建

为评估复杂长视频中的多事件理解能力,本文构建MEventBench基准。该基准包含1200个视频-问题对,专门针对计数、排序和推理等多事件任务设计。MEventBench填补了现有基准在多事件细粒度评估上的空白,为衡量模型在长视频场景下的真实能力提供了可靠标准。
定性案例展示

定性分析展示了MoD-VLLM在10分钟长视频中的多事件理解能力。模型能够准确识别多个关键事件,并在迭代过程中修正定位偏差。相比基线模型,MoD-VLLM在复杂场景下表现出更强的上下文感知和细节捕捉能力,特别是在需要多步推理的任务中优势明显。
实验与关键结果
- 在VideoMME, Lvbench, MLVU和MEventBench等长视频理解基准上进行实验。
- 与LLaVA-Video, Qwen2.5-VL, LongVU, Video-XL2等SOTA基线模型进行对比。
- 进行消融实验,分析不同输入模态(视觉Token与相似度分数)和多事件任务类型(计数、排序、推理)的影响。
- 定性分析展示MoD-VLLM在复杂多事件计数任务中的迭代优化效果。
- 在VideoMME Overall上达到73.2,优于LLaVA-Video (69.7)和Qwen2.5-VL (71.6)(第 5 页)
- 在MEventBench上达到64.8,优于Qwen2.5-VL (60.8)和LLaVA-Video (59.2)(第 5 页)
- 在MEventBench Counting任务上达到69.4,比Qwen2.5-VL高出5.2%(第 5 页)
- 使用V+S模态在VideoMME上达到73.2,优于仅使用V (67.1)或S (62.5)(第 5 页)
阅读时需要注意
- 依赖初始定位的准确性,尽管有迭代修正,但初始错误仍可能影响早期迭代。
- 动态粒度编码增加了计算复杂度和调度逻辑的复杂性。
- MEventBench仅包含1200个视频-问题对,规模相对较小。
- 动态粒度分配依赖于正负片段划分的准确性,若定位偏差较大,可能影响最终性能。
- 强化学习阶段需要精心设计的奖励信号(基于交叉熵损失),可能存在优化不稳定的风险。
- 反事实验证仅在第一次迭代中使用,后续迭代可能无法完全纠正累积误差。
关联工作
- LongVU:采用Token压缩策略,但可能丢失细粒度时空细节。(第 2 页)
- VideoTree:采用两阶段粗到细策略,但存在错误传播和阶段间对齐问题。(第 2 页)
- AKS:自适应关键帧选择,同样面临两阶段方法的局限性。(第 2 页)
- Video-RAG:检索增强方法,在长视频理解中作为基线进行比较。(第 5 页)
- Qwen2.5-VL:强大的开源视频LLM基线,MoD-VLLM在其基础上进行优化。(第 5 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
模块化动态粒度视频大语言模型用于多事件长视频理解
冯伟1,王欣1,2,*,詹宇伟1,周宇维1,朱文武1,2,* 1 清华大学计算机科学与技术系 2 清华大学北京信息科学与技术国家研究中心 {fw22,zhou-yw21}@mails.tsinghua.edu.cn,zhanyuweilif@gmail.com,{xin wang,wwzhu}@tsinghua.edu.cn
摘要—视频大语言模型(Video LLMs)在各种视频理解任务中取得了显著进展。然而,由于有限的视觉令牌预算与捕捉多个关键事件的需求之间存在固有的张力,长视频场景仍然具有挑战性。现有方法通常分两个阶段处理长视频,即 i) 选择关键帧 ii) 执行详细感知,这表现出显著的局限性:它们缺乏用于自适应容量分配和自我纠正的模块化机制,导致建模不可靠。为了解决这些挑战,我们提出了 MoD-VLLM,一种用于多事件长视频理解的新型模块化动态粒度视频大语言模型框架,它以迭代、自我反思的方式无缝统一了时间定位和语义理解。具体而言,我们提出了正负视频片段定位模块和模块化动态粒度反射模块,它们形成一个闭环,指导视频大语言模型根据视频问题区分相关视频片段与不相关视频片段。反射模块采用模块化调度器,对相关的正片段选择细粒度编码以捕捉详细感知,对负片段选择粗粒度编码以高效维持全局上下文,从而实现自适应粒度分配。我们进一步提出了一种动态粒度强化学习策略,允许 MoD-VLLM 联合学习最佳定位策略和动态粒度视觉表示。此外,我们提出了 MEventBench,一个具有挑战性的多事件长视频基准,用于评估模型在复杂长视频理解和推理方面的能力。在几个长视频理解基准和我们提出的 MEventBench 上的大量实验表明,所提出的 MoD-VLLM 能够显著优于最先进的基础模型。
索引术语—长视频理解,视频大语言模型
I. 引言
最近,视频大语言模型(Video LLMs)取得了显著进展。通过将大语言模型与视觉编码器通过指令微调进行对齐,视频大语言模型能够在统一框架内执行各种视频理解任务 [1], [2]。
尽管取得了这些进展,现有的视频大语言模型在长视频场景中仍表现出根本性的局限性。与短视频不同,长视频通常包含多个在时间上稀疏且不连续分布的事件。本质上,多事件长视频理解提出了一个根本性的困境:有限的视觉令牌预算与全面捕捉多个事件的需求之间的张力。现有的长视频方法未能解决这一挑战。
具体而言,图 1(a) 中展示的方法采用令牌剪枝或帧采样策略来减少视觉令牌 [3], [4]。这种静态视觉建模策略忽略了片段之间的语义重要性差异,并且无法捕捉对回答查询至关重要的细粒度细节。图 1(b) 中展示的其他方法采用两阶段策略 [5], [6],首先定位关键帧,然后进行处理以进行详细理解。这些方法在定位过程中缺乏有效的自我反思和错误纠正,导致一旦初始预测出现偏差,错误就会累积。因此,现有方法缺乏基于片段重要性自适应分配建模容量的机制,并且无法执行有效的自我纠正,导致对多个关键事件的建模不可靠。
图 1. 不同视频大语言模型范式的概念比较。令牌减少方法在处理长视频时会导致关键细节丢失。关键帧选择在定位错误片段时会遭受不可逆的错误传播。我们的 MoD-VLLM 通过迭代、自我纠正的定位和具有动态粒度的模块化编码克服了这些问题。
第 2 页
为了解决这些挑战,如图 1(c) 所示,我们提出了 MoD-VLLM,这是一种用于多事件长视频理解的模块化动态粒度视频大语言模型(Modularized Dynamic-Granularity Video LLM)。具体而言,我们的 MoD-VLLM 框架包含 i) 正负视频片段定位模块(Positive-Negative Video Segments Grounding module),该模块首先指示视频大语言模型识别并区分与多事件问题相关和不相关的视频片段;以及 ii) 模块化动态粒度反射模块(Modularized Dynamic-Granularity Reflection module),该模块采用模块化调度机制,以在视频帧间自适应地分配动态粒度。它对相关片段进行细粒度编码以捕捉详细语义,同时对不相关片段进行粗粒度编码,以高效地保持全局视觉上下文。反射模块提供了一种闭环反馈机制,其中反事实粒度验证作为基本的反射过程,以减轻定位误差,逐步引导模型实现更准确的视频片段定位。为了优化所提出的 MoD-VLLM 框架,我们进一步提出了一种动态粒度强化学习策略,用于生成最优的定位策略和动态粒度表示学习。此外,我们构建并提出了 MEventBench,这是一个用于长视频理解的多事件基准(Multi-Event Benchmark),其中包含关于几个关键视频片段和时间依赖关系的长视频问题。在多个长视频理解基准以及我们的 MEventBench 上的大量实验表明,所提出的 MoD-VLLM 框架能够显著优于现有的最先进基线方法。
总之,我们做出了以下贡献:
- 我们提出了 MoD-VLLM,这是一种用于准确的多事件长视频理解的模块化动态粒度视频大语言模型框架,该框架能够通过正负视频片段定位和模块化动态粒度反射进行动态粒度迭代。
- 我们提出了一种动态粒度强化学习策略来优化 MoD-VLLM 框架。
- 我们提出了 MEventBench,这是一个用于长视频理解的多事件基准。
- 我们在多个长视频理解基准以及我们的 MEventBench 上进行了大量实验,证明了 MoD-VLLM 能够优于最先进的基线方法。
II. 相关工作
最近,大型语言模型 [7] 的进步通过跨模态对齐推动了视频大语言模型的发展,以实现对视频的时间理解 [8]。诸如 Video-LLaMA [9] 等模型通常采用视觉编码器来提取帧级特征,并将它们投影到大语言模型的空间中,这与基于图像的 LLM [10] 共享理念。然而,在处理长视频时,这些模型面临一个关键挑战:以高采样率处理所有帧会超出令牌限制,而降低采样率则可能导致丢失重要的时间信息和视觉细节。
针对长视频理解中的令牌限制问题,一些方法侧重于压缩视觉令牌。像 LongVU [4] 这样的视频大语言模型减少令牌数量,而 MovieChat [3] 使用记忆机制进行高效压缩。然而,这些方法通常会丢弃复杂视频推理所需的细粒度时空细节。其他方法采用两阶段、由粗到细的策略。像 VideoTree [6] 和自适应关键帧选择(Adaptive Keyframe Selection, AKS)[5] 这样的方法首先粗略识别关键片段,然后对其进行详细分析。虽然这种策略在初始定位失败时容易受到误差传播的影响,且两个阶段通常是分开训练的,导致定位和理解之间的对齐次优。
III. 方法
本节介绍我们的 MoD-VLLM 框架。受视频定位在不同视频任务 [11], [12] 中的应用以及多模态大语言模型的模块化设计 [13] 的启发,我们引入了类似的方法以推进长视频中的多事件理解。如图 2 所示,MoD-VLLM 设计了一个正负视频片段定位模块和一个模块化动态粒度反射模块,这两个模块迭代运行以进行多事件长视频理解。给定长视频输入,定位模块首先指示视频大语言模型识别与问题相关的视频片段(正片段),并将剩余部分视为不相关(负片段)。基于此指导,反射模块随后采用模块化编码调度器,从一组预定义的粒度模块(每帧令牌数量和采样率不同)中动态选择。它使用细粒度令牌表示正片段以进行详细感知,同时粗略编码负片段以保留全局上下文。这种动态粒度表示替换了原始的均匀粒度令牌,并反馈给定位模块进行迭代细化。经过几次迭代,视频大语言模型逐步完善定位策略和对视频问题的最终答案。
A. 正负视频片段定位
我们的定位模块使用两个分支:均匀粒度表示和问题-帧相似度。视频大语言模型随后将问题相关片段识别为正片段,其余部分识别为负片段。
均匀粒度表示。给定长视频 $v \in \mathbb{R}^{T \times H \times W \times C}$,我们均匀采样 $N$ 帧 $e_v \in \mathbb{R}^{N \times H \times W \times C}$。每帧通过视觉 Transformer 进行编码:
$$ \{v_{cls}^i, v_1^i, v_2^i, \dots, v_{patch}^i\} = ViT(e_v^i), \quad i = 1, \dots, N, \quad (1) $$
其中全局特征 $v_{cls}^i$ 被投影为视觉令牌:
$$ z_i = f(v_{cls}^i), \quad i = 1, \dots, N, \quad (2) $$
$$ Z = \{z_i\} \in \mathbb{R}^{N \times L \times d}, $$
其中 $Z$ 是视觉令牌序列,$d$ 是隐藏维度,$L$ 是每帧的令牌数。
第 3 页
正负视频片段定位 粒度 细粒度 粗粒度 (初始)中粒度 反事实 反事实粒度验证 如何 多少 人 采访 在 视频 视频问题 验证 反事实粒度 … 视频 are unwilling to show their faces? 视觉令牌 粒度反转 动态粒度 … 多事件长视频 视觉令牌 均匀粒度 … V-L 模型 视觉令牌
模块化编码调度器 … 粒度感知 细粒度 中粒度 粗粒度 视觉令牌 反馈 编码模块 编码模块 编码模块 帧-问题匹配分数 粒度 视频 LLM 正片段: p1 p2 … 所有片段 负片段: n1 n2 …
正视频片段 负视频片段(剩余帧) 视频问题回答: 定位策略 p1 p2 p3 p4 n1 n2 视频中 有 4 个人 … 不愿意 露脸。 正视频片段: 正负 露脸。 s1, s2, s3 and s4 引导
正视频片段 负视频片段: 剩余帧 定位负视频片段策略 模块化动态粒度反射
图 2. 我们的 MoD-VLLM 框架用于多事件长视频理解。正负视频片段定位模块指导视频 LLM 生成定位策略,以识别与问题相关的片段。随后,模块化动态粒度反射模块区分编码粒度:正片段以细粒度方式编码以保留细节,而负片段以粗粒度编码以保留全局上下文。通过迭代更新视觉令牌序列,模型优化定位策略和答案。可选的反事实粒度序列(反转的粒度分配)用于验证,以减轻误差传播。 问题-帧相似度表示。使用相同的帧和特征,我们计算 $v_{cls_i}$ 和 问题嵌入 $q$ 之间的相似度: 片段定位输出将以受限的 JSON 格式由视频 LLM 响应: output = VLLM(input) (5) v_{cls_i} q = [[s1, e1], …, [sj, ej]], sim_i = \|v_{cls_i}\| \|q\|, (3) 其中 $s$ 和 $e$ 表示一个定位片段的开始时间和结束时间, Sim = {sim_i} \in \mathbb{R}^N. 而 $j$ 的数量是不规则的,取决于与问题相关的视频事件。这些视频段 目前被视为正视频片段,与视频问题更相关,而其余部分被视为 多事件视频定位。为了将两个分支获得的视觉信息结合到视频 LLM 中,我们设计 了结构化输入范式,系统地整合 视觉令牌与问题-帧相似度引导。 负视频片段。 B. 模块化动态粒度反射 具体而言,我们通过多模态提示 模板来制定这一点: 基于定位结果,我们应用动态粒度 编码来区分正片段和负片段。 input = Concat(pinst, Z, pSim, ptask), (4) 具有动态粒度的模块化编码模块。我们通过微调视觉编码器与 LLM 之间的投影层,构建了一组编码模块 $E = \{\phi_1, . . . , \phi_{b-1}, \phi_b, \phi_{b+1}, . . . , \phi_K\}$。共享的 ViT 主干提取特征,而可切换的投影产生不同粒度的令牌。通过结合具有不同每帧令牌预算和采样率的模块,我们可以灵活地定制视觉表示的信息密度,以满足多样化的视频理解需求。$\phi_m = \phi_b$ 表示视频片段定位上的初始均匀编码粒度。更粗的模块 $\phi_c = \phi_{b-1}$ 减少每帧令牌以进行压缩,更细的模块 $\phi_f = \phi_{b+1}$ 增加令牌以获取细节。$\{\phi_i, i < b-1\}$ 表示应用比初始设置更低的帧采样率的粗粒度编码模块,而
第 4 页
{ϕi, i > b + 1} 表示用于后续定位的细粒度编码模块 Z′。两个多模态输入应用了更高的帧采样率,其采样率从低到高排序。基于构建的编码模块组,我们可以断言,如果 p > n,则编码模块 ϕp 包含的视觉信息比 ϕn 更丰富。
模块化编码调度器。为了对关键视频片段进行详细感知,我们的目标是在不超过 LLM 的令牌限制 Lmax 的前提下,尽可能将正片段编码为细粒度。设 rk 为模块 ϕk 的令牌生成率(令牌/帧)。定位后,我们得到正帧数 Tp 和负帧数 Tn,比例为 ρ = Tp/T。负片段和正片段的粒度级别计算如下:
GranularityLevelneg(ρ) = b −⌊(b −1) · ρα⌋, GranularityLevelpos(ρ) = b + ⌊(K −b) · (1 −ρα)⌋, 其中 α ∈[1.5, 2.0] 是一个可调因子。相应的编码模块选择为:
ϕn = ϕmax(1,min(GranularityLevelneg(ρ),b)), ϕp = ϕmin(K,max(GranularityLevelpos(ρ),b)). (7)
总令牌预算必须满足: Tp · rp + Tn · rn ≤Lmax. (8)
如果超出预算,我们首先将 ϕn(负片段)降级为更粗的模块,如果需要,再将 ϕp 降级。反之,如果令牌数远低于 Lmax,我们首先升级 ϕp。这可以总结为以下优化问题:
maximize wp · rp −wn · rn, ϕp,ϕn∈E subject to Tp · rp + Tn · rn ≤Lmax, rp ≥r(ϕbase) ≥rn, (9) ϕp ∈{ϕb, ϕb+1, . . . , ϕK}, ϕn ∈{ϕ1, ϕ2, . . . , ϕb}, 其中 wp, wn 是正/负片段的偏好权重。
给定所选模块,我们使用分配给每个连续视频片段 si 的模块 ϕi ∈{ϕp, ϕn} 对其进行编码,生成最终的动态粒度令牌序列:
Z′ = {ϕ1(s1), ϕ2(s2), . . . , ϕt(st)}, (10) 该序列替换了原始的均匀令牌序列 Z,并反馈给定位模块进行迭代细化。
两个多模态输入被构建为: inputgrounding = Concat(pinst, Z′, pSim, ptask), inputanswering = Concat(Z′, q), (11) 其中 inputgrounding 遵循与公式 4 相同的结构,q 是原始问题。两个输入都包含关于交错令牌时间安排的文本指令。通过将 inputanswering 输入视频 LLM 来获得答案。
为了减轻因遗漏相关片段(这些片段会被粗略编码)导致的误差传播,我们在第一次反射步骤中引入了反事实验证。除了 Z′,我们还生成一个反事实令牌序列:
Z′′ = {ϕ′1(s1), ϕ′2(s2), . . . , ϕ′t(st)}, (12) 其中 ϕ′i 由调度器在反转的正负分类下分配。Z′′ 仅在第一轮迭代中使用。在第二次定位步骤中,模型同时处理 Z′ 和 Z′′,并合并两个定位输出以减少误差传播。
动态粒度强化学习。为了提高定位准确性,我们在迭代框架内使用直接偏好优化(DPO)来优化我们的 MoD-VLLM 框架。在定位过程中,模型被指示生成多个候选策略 {pi}(每个策略采用公式 20 的 JSON 格式)。每个策略通过调度器生成动态令牌序列 Zi。
高质量的令牌序列应详细表示与问题相关的帧,同时压缩无关部分。因此,将结构良好的 Zi 输入视频 LLM 应产生更接近真实值的答案,具有更低的交叉熵损失。相反,糟糕的序列会增加损失。受 RLHF [20] 的启发,我们使用交叉熵分数作为隐式偏好应用 DPO [21], [22]。设 pw 为损失最小的策略,pl 为损失较大的策略。DPO 目标函数为:
πθ(pw|q, v) πθ(pl|q, v) LDP O(πθ; πref) = −β log −E(q,v,pw,pl)∼D[log σ(β log πref(pw|q, v) πref(pl|q, v))], (13) 其中 πθ 是可训练的视频 LLM,πref 是固定的参考视频 LLM,σ 是 sigmoid 函数,β 是缩放参数,D 是训练数据集。
C. 基于强化学习的动态粒度迭代
我们将定位和反射模块结合成一个迭代框架,并通过动态粒度强化学习策略优化 MoD-VLLM。
动态粒度迭代。为了实现多事件理解,我们在定位和反射之间交替进行迭代。第一次迭代后,我们将原始的均匀令牌序列 Z 替换为动态粒度令牌。
IV. 实验
实现细节。我们使用 LLaVA-Video(7B) [19] 作为视频 LLM 骨干网络。微调后的编码模块 ϕcoarse, ϕmedium, ϕfine 分别每帧产生 36、64 和 169 个令牌。对于初始定位,我们使用 CLIP [23] 计算相似度得分,并使用中等粒度编码器(64 令牌/帧)采样 128 帧,初始采样率为 NT = 128/Tvideo。完整的编码集包括 {(0.2NT , ϕcoarse), (0.5NT , ϕcoarse), (NT , ϕcoarse), (NT , ϕmedium), (NT , ϕfine), (2NT , ϕfine), (3NT , ϕfine)}。
第 5 页
表 I 长视频理解基准上的性能比较。* 表示在主结果中应用 GPT-4 作为大语言模型。
| Models | Size | VideoMME | | | | Lvbench | MLVU Dev | MEventBench | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | | Short | Medium | Long | Overall | | | | | Duration(min) | | ≤2 | 4∼15 | 30∼60 | 1∼60 | 30∼140 | 3∼120 | 15∼100 | | Video-RAG [14] | 7B | 66.4 | 60.2 | 59.8 | 62.1 | 39.3 | 65.2 | 52.5 | | LongVU [4] | 7B | 64.7 | 58.2 | 59.5 | 60.9 | 38.3 | 65.4 | 51.2 | | Video-XL [15] | 7B | 67.4 | 60.7 | 54.9 | 61.0 | 37.7 | 64.9 | 49.3 | | Video-XL2 [16] | 8B | 73.7 | 65.9 | 60.2 | 66.6 | 48.4 | 74.8 | 53.8 | | VITA 1.5 [17] | 7B | 67.0 | 54.2 | 47.1 | 56.1 | 32.1 | 60.2 | 45.9 | | AKS [5] | 7B | – | – | – | 65.4 | 46.8 | 70.1 | 55.7 | | VideoTree [6] | | * | – | – | 54.2 | – | – | – | 55.4 | | Qwen2.5-VL [18] | 7B | 81.4 | 70.8 | 62.6 | 71.6 | 45.3 | 75.5 | 60.8 | | LLaVA-Video [19] | 7B | 78.0 | 69.3 | 61.8 | 69.7 | 43.2 | 71.4 | 59.2 | | Ours-MoD-VLLM w/ LLaVA-Video | 7B | 80.3 | 72.4 | 66.9 | 73.2 | 49.6 | 78.2 | 64.8 |
我们对每个视频运行三次动态粒度迭代。进一步的参数和训练细节见补充材料。 评估。我们在长视频基准上进行评估:VideoMME [24]、Lvbench [25] 和 MLVU [26],报告多项选择题的准确率。为了评估复杂的多事件推理能力,我们构建了 MEventBench,其中包含来自 VideoMME、Longvideobench [27]、InfiniBench [28] 和 CG-Bench [29] 的 1200 个视频-问题对。每个视频至少包含三个在时间上分散的与问题相关的片段。总之,我们将所选多事件数据的类型分类为多事件计数、排序和推理。更多细节见补充材料。
A. 长视频理解的主要结果 表 I 报告了长视频基准上的结果。我们的 MoD-VLLM 在较长视频(≥2分钟)上实现了更高的平均准确率,优于类似规模的现有最先进方法。这些方法包括开源视频大语言模型(LongVU [4]、Video-XL2 [16]、Qwen2.5-VL [18])以及两阶段由粗到细的方法(Video-RAG [14]、AKS [5]、VideoTree [6])。在我们的 MEventBench 上,MoD-VLLM 也超越了最强的基线,验证了动态粒度迭代在复杂多事件推理中的有效性。
B. 消融实验 不同多事件任务的消融研究。表 II 显示了 MEventBench 上各任务类别的结果。MoD-VLLM 在所有类别中均优于强大的视频大语言模型基线,整体准确率达到 64.8%,分别比 Qwen2.5-VL 和 LLaVA-Video 高出 4.0% 和 5.6%。最大的提升出现在计数任务(69.4%,比 Qwen2.5-VL 高 5.2%),突显了我们动态粒度迭代定位稀疏、分散事件的能力。
排序(64.2%)和推理(62.1%)的进一步提升进一步证实了该框架在建模时间关系和复杂推理方面的优势,这得益于迭代优化和正负上下文建模。这些结果表明,在保持全局上下文的同时,将细粒度表示分配给关键片段是实现全面长视频理解的关键。
表 III 定位任务输入模态的消融研究。
| Method | VideoMME | | | | MEventBench | | | | :— | :— | :— | :— | :— | :— | :— | :— | | | | Short | Medium | Long | Overall | Counting | Ordering | Reasoning | | MoD-VLLM w/ V+S | 73.2 | 69.4 | 64.2 | 62.1 | | | | | | MoD-VLLM w/ V | 67.1 | 65.8 | 60.3 | 57.7 | | | | | | MoD-VLLM w/ S | 62.5 | 59.6 | 55.0 | 51.8 | | | | |
为什么同时应用视觉表示和相似度序列进行定位?我们评估了视觉令牌(V)和相似度分数(S)对定位的贡献。如表 III 所示,同时使用(V+S)在 VideoMME 和所有 MEventBench 任务中均取得了最佳性能。仅依赖视觉令牌(V)或仅依赖相似度(S)会导致明显的性能下降,其中仅使用相似度表现最弱。V+S 的优势源于两个因素。首先,基于 CLIP 的相似度是在短图像-文本对上进行训练的,不能完全捕捉长问题与视频帧之间的对齐关系。其次,如果没有相似度作为先验,最初为问答训练的大语言模型在更复杂的任务中,由于冷启动问题,难以在 DPO 下定位多个片段。视觉令牌提供密集的语义,而相似度分数提供直接的问题-帧相关性信号,从而实现了稳健的相互验证并提高了定位准确率。
案例分析。为了展示 MoD-VLLM 的复杂视频推理能力,图 3 可视化了一个多事件计数示例,问题为:“女人从包里拿出了多少件物品?”该任务具有挑战性,因为关键片段在时间上分布,并且需要细致的感知(例如,在一个片段中同时拿走了两部手机)。通过动态粒度迭代,我们的模型能够逐步细化其注意力,并产生粒度编码,突出显示所有移除物品的片段。
第 6 页
[8] X. Wang, Y. Zhou, B. Huang, H. Chen, and W. Zhu, “Multi-modal generative ai: Multi-modal llms, diffusions and the unification,” IEEE 女人从包里拿出了多少件物品? Transactions on Circuits and Systems for Video Technology, 2025. [9] H. Zhang, X. Li, and L. Bing, “Video-llama: An instruction-tuned audio- (Video LLM) 女人总共从包里拿出了11件物品。 visual language model for video understanding,” in EMNLP, 2023, pp. 543–553. (a) 无动态粒度迭代 [10] R. Bavishi, E. Elsen, C. Hawthorne, M. Nye, A. Odena, A. Somani, and S. Tas¸ırlar, “Fuyu-8b: A multimodal architecture for ai agents,” 2023. (MoD-VLLM) 定位9-82秒、140-200秒、390-490秒的视频片段。 [11] X. Wang, X. Lan, and W. Zhu, Video Grounding and Its Generalization: 动态 From ID and Task-specific Models to OOD and Large Foundation 粒度 迭代 Models. Springer, 2025. [12] W. Feng, X. Wang, H. Chen, Z. Zhang, and W. Zhu, “Multi-sentence video grounding for long video generation,” in ICME. IEEE, 2025, pp. (MoD-VLLM) 定位23-75秒、154-290秒、394- 1–6. 490秒、540-548秒的视频片段。 最终定位输出 [13] Y.-W. Zhan, X. Wang, P. Mao, T. Feng, R. Wang, and W. Zhu, “Modularagent: A task-aware modular framework for joint optimization of multimodal large language models and world models,” in CVPR, 2026. [14] Y. Luo, X. Zheng, X. Yang, G. Li, H. Lin, J. Huang, J. Ji, F. Chao, J. Luo, and R. Ji, “Video-rag: Visually-aligned retrieval-augmented long video comprehension,” arXiv preprint arXiv:2411.13093, 2024. [15] Y. Shu, Z. Liu, P. Zhang, M. Qin, J. Zhou, Z. Liang, T. Huang, and B. Zhao, “Video-xl: Extra-long vision language model for hour-scale 两样物品(手机) video understanding,” in CVPR, 2025, pp. 26 160–26 169. 在同一帧中 [16] M. Qin, X. Liu, Z. Liang, Y. Shu, H. Yuan, J. Zhou, S. Xiao, B. Zhao, (MoD-VLLM) 女人总共从包里拿出了14件物品。 and Z. Liu, “Video-xl-2: Towards very long-video understanding through task-aware kv sparsification,” arXiv preprint arXiv:2506.19225, 2025. (b) 有动态粒度迭代 [17] C. Fu, H. Lin, X. Wang, Y.-F. Zhang, Y. Shen, X. Liu, H. Cao, Z. Long, Fig. 3. 多事件长视频理解的定性示例。持续时间约为10分钟。 H. Gao, K. Li et al., “Vita-1.5: Towards gpt-4o level real-time vision V. 结论 [18] S. Bai, K. Chen, X. Liu, J. Wang, W. Ge, S. Song, K. Dang, P. Wang, S. Wang, J. Tang et al., “Qwen2. 5-vl technical report,” arXiv preprint 在本文中,我们提出了 MoD-VLLM,这是一种新颖的模块化 arXiv:2502.13923, 2025. 动态粒度视频大语言模型框架,具有用于多事件长视频理解的反射[19] Y. Zhang, J. Wu, W. Li, B. Li, Z. MA, Z. Liu, and C. Li, “Llava-video: 机制。具体而言,我们设计了正负视频片段定位模块和 [20] P. F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, and D. Amodei, 模块化动态粒度反射模块,以在复杂长视频上实现动态粒度迭代。 “Deep reinforcement learning from human preferences,” Advances in 我们进一步提出了一种动态粒度强化学习策略,以动态粒度表 [21] R. Rafailov, A. Sharma, E. Mitchell, C. D. Manning, S. Ermon, and 征优化 MoD-VLLM。我们构建并提出了 MEventBench,一个 C. Finn, “Direct preference optimization: Your language model is 用于长视频理解的多事件基准。在多个长视频理解基准和我们 [22] Z. Song, X. Wang, Z. Qian, H. Chen, L. Huang, H. Xue, and W. Zhu, 的 MEventBench 上的广泛实验表明,所提出的 MoD-VLLM “Modularized self-reflected video reasoner for multimodal llm with 框架在处理具有多个与问题相关片段的复杂长视频方面优于 [23] A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, 现有的最先进基线。 G. Sastry, A. Askell, P. Mishkin, J. Clark et al., “Learning transferable 参考文献 2021, pp. 8748–8763. [1] H. Liu, C. Li, Q. Wu, and Y. J. Lee, “Visual instruction tuning,” in [24] C. Fu, Y. Dai, Y. Luo, L. Li, S. Ren, R. Zhang, Z. Wang, C. Zhou, NeurIPS, vol. 36, 2023, pp. 34 892–34 916. Y. Shen, M. Zhang et al., “Video-mme: The first-ever comprehensive [2] B. Huang, X. Wang, H. Chen, Z. Song, and W. Zhu, “Vtimellm: [25] W. Wang, Z. He, W. Hong, Y. Cheng, X. Zhang, J. Qi, M. Ding, X. Gu, Empower llm to grasp video moments,” in CVPR, 2024, pp. 14 271– [26] J. Zhou, Y. Shu, B. Zhao, B. Wu, Z. Liang, S. Xiao, M. Qin, X. Yang, 14 280. Y. Xiong, B. Zhang et al., “Mlvu: Benchmarking multi-task long video [3] E. Song, W. Chai, G. Wang, Y. Zhang, H. Zhou, F. Wu, H. Chi, X. Guo, understanding,” in CVPR, 2025, pp. 13 691–13 701. T. Ye, Y. Zhang et al., “Moviechat: From dense token to sparse memory [27] H. Wu, D. Li, B. Chen, and J. Li, “Longvideobench: A benchmark for long video understanding,” in CVPR, 2024, pp. 18 221–18 232. for long-context interleaved video-language understanding,” NeurIPS, [4] X. Shen, Y. Xiong, C. Zhao, L. Wu, J. Chen, C. Zhu, Z. Liu, F. Xiao, vol. 37, pp. 28 828–28 857, 2024. B. Varadarajan, F. Bordes et al., “Longvu: Spatiotemporal adaptive [28] K. Ataallah, C. Gou, E. Abdelrahman, K. Pahwa, J. Ding, and compression for long video-language understanding,” in ICML, 2025. M. Elhoseiny, “Infinibench: A comprehensive benchmark for large [5] X. Tang, J. Qiu, L. Xie, Y. Tian, J. Jiao, and Q. Ye, “Adaptive keyframe multimodal models in very long video understanding,” arXiv preprint sampling for long video understanding,” in CVPR, 2025, pp. 29 118– arXiv:2406.19875, 2024. 29 128. [29] G. Chen, Y. Liu, Y. Huang, B. Pei, J. Xu, Y. He, T. Lu, Y. Wang, and [6] Z. Wang, S. Yu, E. Stengel-Eskin, J. Yoon, F. Cheng, G. Bertasius, and L. Wang, “Cg-bench: Clue-grounded question answering benchmark for M. Bansal, “Videotree: Adaptive tree-based video representation for llm long video understanding,” in ICLR, 2025. reasoning on long videos,” in CVPR, 2025, pp. 3272–3283. [30] S. Wang, G. Chen, D.-a. Huang, Z. Li, M. Li, G. Li, J. M. Alvarez, [7] H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, L. Zhang, and Z. Yu, “Videoitg: Multimodal video understanding with T. Lacroix, B. Rozi`ere, N. Goyal, E. Hambro, F. Azhar et al., instructed temporal grounding,” arXiv preprint arXiv:2507.13353, 2025. “Llama: Open and efficient foundation language models,” arXiv preprint arXiv:2302.13971, 2023.
第 7 页
补充材料 A. 训练细节
我们框架的整体训练在 8 块 NVIDIA A100-40GB GPU 上进行。我们的框架以 LLaVA-Video 架构作为骨干模型。为了实现动态粒度控制,我们在视觉编码器和 LLM 之间的投影层中引入了额外的自适应池化模块,系统地调节每帧视频的 token 数量。这使我们能够构建三个在不同粒度级别运行的不同编码模块:每帧 36 个 token(粗粒度)、每帧 64 个 token(中粒度)和每帧 169 个 token(细粒度),代表空间细节的逐步增加。对于动态粒度编码调度器,我们将可调因子 $\alpha$ 设置为 1.5。
模块训练细节。在第一阶段训练编码模块时,我们使用 LLaVA-Video-178K [19] 数据集来微调视频 LLM。在强化学习阶段,我们使用 VideoITG 数据集 [30],该数据集包含 40K 个视频和 500K 条指令引导的注释。
表 IV 实现细节
| 配置 | 微调 | 强化学习 | | :— | :— | :— | | 视频 LLM | LLaVA-Video-7B | | | 轮数 (Epochs) | 10 | 5 | | 预热 (Warmup) | 比例 0.05 | | | 学习率 | 2e-5 | 1e-5 | | 批次大小 (Batch size) | 1 | | | 梯度累积步数 (Gradient accumulation steps) | 16 | | | 每帧 token 数 | 36, 64, 169 | 混合 | | 训练成本 | 总共 380 小时 | 800 小时 | | 优化器 | AdamW | |
1) 算法细节:模块化编码调度器。与原始的单一粒度表示相比,我们希望以更高的采样帧率尽可能细粒度地表示正视频片段,但不超过视频 LLM 的 token 限制 $L_{max}$1。定义 $r_k$ 为编码模块 $\phi_k$ 的 token 生成率(帧数/token/帧),由于我们知道初始视频片段定位可以使用中粒度编码模块执行,因此我们有:
$$ T \cdot r_{base} \lesssim L_{max}, \quad (14) $$
这表示视觉 token 的数量小于但非常接近 LLM 的限制。基于定位引导,我们可以获得正视频帧总数 $T_p$ 和负视频帧总数 $T_n$。考虑到 $\rho = \frac{T_p}{T_p + T_n}$ 为正样本帧的比例,我们探索粒度级别为:
$$ \text{GranularityLevel}_{neg}(\rho) = b – \lfloor (b – 1) \cdot \rho^\alpha \rfloor, \quad (15) $$ $$ \text{GranularityLevel}_{pos}(\rho) = b + \lfloor (K – b) \cdot (1 – \rho^\alpha) \rfloor, $$
其中 $\alpha$ 是一个范围为 1.5 到 2.0 的可调因子。根据粒度级别,我们分别为正片段和负片段选择编码模块:
$$ \phi_n = \phi_{\max(1, \min(\text{GranularityLevel}_{neg}(\rho), b))}, \quad (16) $$ $$ \phi_p = \phi_{\min(K, \max(\text{GranularityLevel}_{pos}(\rho), b))}. $$
由于总 token 限制应满足:
$$ T_p \cdot r_p + T_n \cdot r_n \le L_{max}. \quad (17) $$
我们设计的调度器算法如算法 1 所示。当我们注意到所需的总 token 数 $L_{total}$ 高于 $L_{max}$ 时,我们首先尝试将负片段的编码模块降级为更粗粒度的模块,如果有必要,再降级正片段的编码模块,直到 $L_{total} \le L_{max}$。同时,如果 $L_{total}$ 远小于 $L_{max}$,我们将首先尝试升级正编码模块的粒度。
算法 1 动态粒度编码调度器 Require: $T_p, T_n, E, L_{max}, \phi_p, \phi_n, \phi_{base} = \phi_b = \phi_{medium}$ Ensure: $\phi^*_p, \phi^*_n$
1: $\phi^*_p \leftarrow \phi_p, \phi^*_n \leftarrow \phi_n$ 2: $L \leftarrow T_p \cdot r(\phi^*_p) + T_n \cdot r(\phi^*_n)$ 3: while $L > L_{max}$ do 4: if $\phi^*_n \neq \phi_1$ then 5: $\phi^*_n \leftarrow \text{coarser}(\phi^*_n)$ 6: else if $\phi^*_p \neq \phi_{base}$ then 7: $\phi^*_p \leftarrow \text{coarser}(\phi^*_p)$ 8: else 9: break 10: end if 11: $L \leftarrow T_p \cdot r(\phi^*_p) + T_n \cdot r(\phi^*_n)$ 12: end while 13: while $L \ll L_{max}$ do 14: $\phi^{temp}_p \leftarrow \phi^*_p, \phi^{temp}_n \leftarrow \phi^*_n$ 15: if $\phi^{temp}_p \neq \phi_K$ then 16: $\phi^{temp}_p \leftarrow \text{finer}(\phi^{temp}_p)$ 17: else if $\phi^{temp}_n \neq \phi_{base}$ then 18: $\phi^{temp}_n \leftarrow \text{finer}(\phi^{temp}_n)$ 19: else 20: break 21: end if 22: $L_{new} \leftarrow T_p \cdot r(\phi^{temp}_p) + T_n \cdot r(\phi^{temp}_n)$ 23: if $L_{new} \le L_{max}$ then 24: $\phi^*_p \leftarrow \phi^{temp}_p, \phi^*_n \leftarrow \phi^{temp}_n, L \leftarrow L_{new}$ 25: else 26: break 27: end if 28: end while 29: return $\phi^*_p, \phi^*_n$
1 在实际实现中,$L_{max}$ 会小于 LLM 的最大 token 限制,以保留部分空间用于处理长文本提示。
总体而言,基于正片段比例的选取
第 8 页
可以总结为以下优化问题: output = V idLLM(input) maximize wp · rp −wn · rn, (20) ϕp,ϕn∈E = [[s1, e1], …, [sj, ej]], subject to Tp · rp + Tn · rn ≤Lmax, 通常,与表示细粒度中不相关片段或粗粒度中相关片段的令牌序列相比,我们可以断言,动态视觉令牌 sequence correctly represents all the question-related key video ϕp ∈{ϕb, ϕb+1, . . . , ϕK}, frames in a fine-grained manner and other irrelevant video ϕn ∈{ϕ1, ϕ2, . . . , ϕb}, frames only occupy a small amount of visual tokens through where wp and wn are the weight coefficients representing the coarse-grained encoding, would be more helpful for the video preference for the positive video segments. LLM to understand a multi-event long video, since it provides detailed spatial-temporal visual context precisely where it is Obtaining the suitable encoding modules for positive video needed for detailed understanding and temporal reasoning,segments and negative ones, our dynamic granularity encoding while decreases the noise from the global video informationwould process video frames through interleaved fine-grained by compressing the irrelevant segments.and coarse-grained representations according to the temporal Therefore, if we input the video question with each se-distribution of positive and negative video segments. Given the quence of dynamic encoding visual tokens to the video LLM,partitioned and continus video segments {s1, s2, …, st} with the correct sequence of visual tokens would help the videocorresponding granularity assignments {ϕ1, ϕ2, …, ϕt} where LLM to generate an answer closer to the ground truth of theϕi ∈{ϕp, ϕn}, we form the final dynamic encoding visual video question, and the cross-entropy loss between them wouldtokens: be smaller. While an incorrect sequence of visual tokens tends Z′ = {ϕ1(s1), ϕ2(s2), …, ϕt(st)}, (19) to mislead the video LLM, resulting in an incorrect answer response and an increase in loss. where Z′ would serve as granularity-aware feedback reflected Inspired by the reinforcement learning from human feed- to the positive-negative video segments grounding module, back [20](RLHF), we apply direct preference optimiza- replacing the original input visual sequence Z. tion [21](DPO) based on the different cross-entropy scores of Dynamic granularity reinforcement learning. Since the the visual token sequence inputs from the grounding policies. applied video LLM is not trained with localizing multiple This method optimizes our MoD-VLLM framework without related events in long videos, it is difficult to ensure the explicitly rewarding models and formulates the objective as: accuracy of the grounding policy through in-context prompt LDP O(πθ; πref) = learning alone. To address that, we design a dynamic gran- πθ(pw|q) πθ(pl|q) ularity reinforcement learning method to optimize the MoD- −E(q,v,pw,pl)∼D[log σ(β log πref(pw|q) −β log πref(pl|q))], VLLM framework through our dynamic granularity iteration (21) framework. where pw represents the positive grounding policy leading to To begin with, during the positive-negative video segments the smaller cross-entropy loss, and pl denotes the negative grounding strategy, we prompt the video LLM to generate sev- policy with the larger loss. πθ represents the video LLM to eral multi-event grounding policies {pi}, each policy pi is in be optimized in this stage, and πref is a reference model the same JSON format as output in equation 20. Each policy initialized with the same video LLM but remains frozen.σ is corresponds to a group of positive video segments and negative the sigmoid function, and β is a controlling parameter. ones, which would inform the dynamic granularity encoding As shown in Algorithm 2, our dynamic granularity rein- scheduler to generate a sequence of dynamic encoding visual forcement learning alternates between the DPO of grounding tokens Zi. To ensure policy diversity and avoid convergence policy generation and the SFT of dynamic representation to a local optimum, we implement three key strategies: (1) we learning. We first employ direct preference optimization to iteratively prompt the LLM with the instruction ‘try another enable the video LLM for more accurate grounding policy grounding policy different from the history ones’ to generate generation, and then adopt supervised fine-tuning on the video distinct temporal segments; (2) we employ a counterfactual LLM to adapt the dynamic granularity visual token sequence augmentation technique where the inverse of a generated input. policy (i.e., treating all non-selected segments as the positive B. MEventBench.result) is included as a valid policy candidate; and (3) we randomly generate several policies based on the video length Here, we provide the detailed data distribution of our and vary random seeds during each training sample. This proposed MEventBench dataset in Figure 4. We construct multifaceted approach to policy generation prevents the DPO the multi-event long-video dataset as follows. First, we filter optimization from collapsing into a limited set of predictions existing video benchmarks to retain only videos longer than 10 and encourages the model to explore a broader and more minutes. From these, we select samples whose original type- robust solution space for segment grounding. annotations include keywords such as “ordering,” “counting,”
第 9 页
算法 2 动态粒度强化学习 要求:视频大语言模型 $V_{idLLM}$,动态粒度模块 $D$,正负片段定位模块 $G$,数据集 $\mathcal{D} = \{(v_i, q_i, y_i)\}_{i=1}^N$,训练步数 Step,梯度累积步数 $s$,每个数据对应的策略数量 $n$
1: 激活:$V_{idLLM}$ 2: for $t = 1$ to Step do 3: for $m = 1$ to $s$ do 4: 初始化 $\pi_\theta = V_{idLLM}$, $\pi_{ref} = V_{idLLM}$ 5: $i \leftarrow ((t-1)s + m – 1) \% N + 1$ 6: 从 $\mathcal{D}$ 准备数据 $(v_i, q_i, y_i)$ 7: 生成策略 $p_1, p_2, …, p_n = G(\pi_{ref}, q_i, v_i)$ 8: for $j = 1$ to $n$ do 9: 定位:$S_j = G(v_i, p_j)$ 10: 动态粒度编码:$v_j = D(S_j)$ 11: 前向传播:$b_y = V_{idLLM}(q_i, v_j)$ 12: 计算 $L_{CE_j} = -y \log(b_y(q, v_j))$ 13: end for 14: $p_w \leftarrow \arg \min_{\{p_j\}} L_{CE}$ 15: $p_l = \{p_j, p \neq p_w\}$ 16: 使用 DPO 损失优化 $\pi_\theta$ 17: end for 18: $V_{idLLM} \leftarrow \pi_\theta$ 19: for $m = 1$ to $s$ do 20: $i \leftarrow ((t-1)s + m – 1) \% N + 1$ 21: 从 $\mathcal{D}$ 准备数据 $(v_i, q_i, y_i)$ 22: 生成单一策略 $p = G(V_{idLLM}, q_i, v_i)$ 23: 定位:$S_j = G(v_i, p_j)$ 24: 动态粒度编码:$v_j = D(S_j)$ 25: 前向传播:$b_y = V_{idLLM}(q_i, v_j)$ 26: 使用交叉熵损失优化 $V_{idLLM}$ 27: end for 28: end for
或“推理”。对于剩余数据,我们在问题文本中搜索指示性短语,如“how many”(多少)、“what order”(什么顺序)和“why”(为什么)。这两个子集的并集产生了数千个候选视频-问题对。然后,我们人工检查每个候选项,以确保问题确实指的是视频中多个时间上分散的片段,而不是单个关键视频片段。最终数据集由满足多片段要求的配对组成。总之,我们将所选多事件数据的类型分类为多事件计数、排序和推理。
图 4. MEventBench 的数据分布。
计数任务。这些数据要求模型识别并枚举分布在长视频中稀疏的多个特定事件或对象实例。关键挑战在于准确检测和统计可能在时间上分散、视觉上相似或部分被遮挡的发生次数,这需要强大的时间定位和细粒度视觉辨别能力。
排序任务。这些数据侧重于通过要求模型根据事件的发生模式按时间顺序排列多个事件来进行时间排序。复杂性源于时间边界模糊、时间线重叠或细微上下文线索决定其顺序关系的事件,这需要精确的时间理解。
推理任务。这些数据强调因果和逻辑推理,通过挑战模型识别多个事件之间的潜在关系(如因果链、先决条件或意图动机)来实现。难度源于需要在长时间跨度内整合分散的视觉证据,并从稀疏、分布的事件中构建连贯的叙事结构。
总之,这三种任务类型构成了一个综合评估框架,评估模型在定量分析(计数)、时间理解(排序)和更高级认知处理(推理)方面的能力,涵盖了复杂多事件视频理解的基本维度。