三分钟导读:本文提出视觉依赖差距(VDG)指标,证明视频大语言模型的基准准确率与视觉 grounding 能力是可解离的,且多数基准测试中的“推理”任务实际上由语言先验驱动而非视觉内容。
英文题目:Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks
论文出处:arXiv 每日论文精选 · arXiv:2607.13305
原始论文:PDF / 论文页面
对应视频标题:高分不等于看懂视频:审计 Video LLM 基准的视觉依赖|推荐指数:★★★★★
这篇论文解决什么问题?
视频大语言模型(Video LLMs)的基准准确率常被直接等同于视觉理解能力,但现有研究未能量化每道题目的视觉依赖程度,导致无法区分模型是利用视觉信息还是利用语言先验(language priors)进行回答。
核心创新
- 提出 VDG 指标,实现每道题目的视觉依赖量化
- 通过 McNemar 检验证明准确率与视觉依赖是统计解离的两个轴
- 构建跨基准(Video-MME, MVBench, EgoSchema)一致的 VDG 任务类型谱系
- 揭示帧多样性(frame diversity)是视觉贡献的主要来源,而时间顺序(temporal order)贡献接近于零
方法概览
提出 Visual Dependency Gap (VDG),定义为同一问题在原始视频与黑屏(black-screen)条件下的正确率差异。使用 McNemar 检验验证准确率与视觉依赖的解离。通过四条件诊断阶梯(黑屏、单帧、乱序帧、原视频)分解视觉依赖来源。
逐图理解论文
背景:现有基准的缺陷

现有视频基准测试如 Video-MME 和 MVBench 缺乏对题目是否真正需要视觉输入的诊断。虽然 prior work 指出多模态模型存在语言偏差,但缺乏针对视频时序任务的细粒度解离分析,使得评估结果可能充满噪声。
创新:McNemar 解离检验

通过 McNemar 检验验证准确率与视觉依赖的解离。在 MVBench 上,InternVL2-8B 在原始视频上显著优于 Qwen2-VL-7B,但在黑屏条件下无显著差异。这证明高准确率并不必然意味着高视觉 grounding。
结果:任务类型谱系

在 Video-MME 上,Attribute Perception 的 VDG 最高,而 Temporal Reasoning 的 VDG 接近于零。这表明当前基准中的时序推理任务可能无法有效区分时序理解与语言推理,模型主要依赖语言先验。
结果:跨基准一致性

在 EgoSchema 上验证 VDG 谱系的泛化能力,平均 VDG 为 0.285,符合 action_comprehension 层级的预测。这证实了 VDG 指标在不同基准间的一致性,表明语言先验的影响具有普遍性。
分析:缩放与量化效应

Qwen2.5-VL-72B 的 aggregate VDG 最高,而 InternVL2.5-78B 的 VDG 为 0.000。值得注意的是,4-bit NF4 量化模型的结果受到量化效应的干扰,缩放结论主要基于 bf16 模型,需谨慎解读。
实验与关键结果
- 在 20 个模型(2-78B 参数,10 个架构家族)上评估 VDG
- McNemar 解离测试:对比原始视频与黑屏条件下的模型表现差异
- FPS 消融实验:在 0.5-24 FPS 范围内验证时间依赖是否由帧稀疏性引起
- H.264 压缩鲁棒性测试:分析 CRF 18-38 对准确率的影响
- 四条件诊断阶梯:分解空间、多样性、时间组件对 VDG 的贡献
- 跨基准一致性验证:在 EgoSchema 上验证 VDG 谱系的泛化能力
- MVBench 上 InternVL2-8B 在原始视频上显著优于 Qwen2-VL-7B (p=0.0003),但在黑屏条件下无显著差异 (p=0.53)(第 4 页)
- Video-MME 上 Attribute Perception 的 VDG 最高 (0.38-0.46),Temporal Reasoning 的 VDG 接近 0 (0.00-0.09)(第 3 页)
- Qwen2.5-VL-72B 的 aggregate VDG 最高 (0.326),而 InternVL2.5-78B 的 VDG 为 0.000(第 7 页)
- 四条件阶梯显示,Δtemporal 对所有模型接近 0,Δdiversity 是主要的视觉信号贡献者(第 8 页)
- EgoSchema 上平均 VDG 为 0.285,符合 action_comprehension 层级的预测(第 6 页)
阅读时需要注意
- 4-bit NF4 量化模型的结果受到量化效应的干扰,缩放结论主要基于 bf16 模型
- 诊断阶梯仅在 0.25 FPS 下评估,尽管 FPS 消融覆盖了更宽范围
- VDG 目前仅针对多项选择题(MCQ)格式,未扩展到开放生成任务
- 部分模型(如 Qwen2-VL)存在 null predictions,影响了匹配样本的大小
- H.264 实验中存在解码失败导致的 artifact(如 action_antonym 任务)
- 高准确率并不必然意味着高视觉 grounding,模型可能依赖语言先验
- 压缩鲁棒性(CRF 测试)的平坦曲线是双向错误抵消的结果,而非真正的鲁棒性
- Temporal Reasoning 的低 VDG 表明当前基准可能无法有效区分时序理解与语言推理
- Qwen3-VL 显示出 VDG 回归,尽管准确率看似提升,但视觉依赖能力下降
关联工作
- VQA-CP [1]:揭示了视觉问答中的答案类型先验(第 1 页)
- TVBench [10]:显示视频 LLM 基准易受纯文本解决的影响(第 1 页)
- Video-MME [18]:本文评估的主要基准之一(第 2 页)
- MVBench [29]:本文评估的主要基准之一,用于 McNemar 测试(第 2 页)
- EgoSchema [37]:用于验证 VDG 谱系泛化能力的独立基准(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
无接地(Grounding)的准确率:诊断视频大语言模型基准测试中的视觉依赖解耦
Jae Joong Lee 普渡大学计算机科学系 美国印第安纳州韦斯特拉法叶
摘要 视频大语言模型(Video LLMs)的基准准确率通常被视为视觉理解能力的证据。我们审计了这一假设,考察了跨越 2–78B 参数和十个架构家族的二十个模型。我们引入了视觉依赖差距(Visual Dependency Gap, VDG),即原始视频条件与黑屏条件下每道题正确率的差异。在 MVBench 上的配对 McNemar 检验显示,准确率和视觉依赖是可分离的:模型在原始视频上存在差异(𝑝= 0.0003),但在黑屏上无差异(𝑝= 0.53)。跨模型的任务类型排名是稳定的:属性感知(Attribute Perception)具有强烈的视觉依赖性,而时间推理(Temporal Reasoning)则接近纯语言基线。从黑屏到单帧、打乱帧到原始视频的诊断阶梯显示,帧多样性(frame diversity)提供了大部分视觉收益,而时间顺序对准确率的贡献接近于零。从 0.5 到 24 FPS 的消融实验排除了稀疏采样作为原因。H.264 实验进一步表明,稳定的总体准确率掩盖了双向的逐题答案翻转。该诊断方法也推广到了四个通过 API 访问的模型,其 VDG 值范围从 0.025 到 0.315。这些结果支持将 VDG 作为评估视频基准是否测量视觉接地能力的标准审计指标。代码可在 https://github.com/JaeLee18/accuracy-without-grounding 获取。
仅凭准确率指标无法察觉上述问题。因此,测试这一假设对于确保基准进步转化为现实世界的视觉能力至关重要。
先前的工作表明,视觉问答基准包含仅靠语言即可解答的问题:VQA-CP [1] 揭示了答案类型先验,Chen 等人 [7] 在多模态基准中发现了无图像可解性,而 TVBench [10] 显示视频大语言模型基准容易受到纯文本解答的影响。然而,这些研究检测到了问题但未逐题量化,且均未确立准确率和视觉依赖在统计上是可分离的。
这种区分很重要:知道“有些问题无需视觉即可解答”弱于证明“更准确的模型不一定具有更高的视觉依赖性”。
我们通过引入并验证视觉依赖差距(VDG)来解决这一差距,VDG 是一个逐题诊断指标,用于衡量视频存在条件与黑屏条件之间正确率的差异(图 1):
VDG(𝑞) = 1[原始条件下正确] − 1[黑屏条件下正确] ∈{−1, 0, +1}。
跨越二十个模型(涵盖 2–78B 参数和十个架构家族,包括专有 API 模型),我们表明基准准确率和视觉接地是可分离的轴:在 MVBench 上,InternVL2-8B 在原始视频上可靠地优于 Qwen2-VL-7B(𝑝= 0.0003),但同一对模型在黑屏上统计上无显著差异(𝑝= 0.53)。任务类型的 VDG 谱在所有模型中保持稳定,其中属性感知是最具视觉接地性的类别(≈0.41),而时间推理几乎与纯语言性能无差异(≈0.06)。这已通过从 0.5 到 24 FPS 的 FPS 消融实验得到证实(第 5.3 节)。四条件诊断阶梯进一步揭示,时间顺序对准确率的贡献接近于零,而视觉接地主要由帧多样性主导(第 5.5 节)。
1 引言 视频大语言模型(video LLMs)[9, 28, 31, 36, 49, 63] 已涌现用于多模态理解,将基础模型 [11, 27, 32] 的能力扩展到时域。从早期的 Video-ChatGPT [36] 和 VideoChat [28] 到最近的架构如 Qwen2-VL [52]、LLaVA-Video [63]、InternVL2 [8]、VideoLLaMA2 [9]、PLLaVA [57] 以及专有系统 [41, 46],这些模型都在标准化基准 [18, 29, 37] 上进行评估,其排行榜排名塑造了整个领域的架构选择和部署决策。
这种评估方法的一个核心假设是,更高的基准准确率意味着更强的视觉理解能力。如果属实,排行榜的改进将可靠地指示视觉推理方面的进步。如果错误,该领域可能会倾向于优化语言先验利用,而非真正的视觉接地¹,这是一个仅凭准确率指标无法察觉的区别。
我们的贡献如下: (1) McNemar 解耦(第 4.2 节):配对 McNemar 检验证明准确率和视觉依赖是可分离的统计轴,这比先前工作提出的“模型可以在无视觉情况下回答问题”这一说法更强。 (2) 任务类型分类和跨基准一致性(第 4.1–5 节):六个任务类型的 VDG 谱,在二十个模型和三个基准中保持一致,其中 Video-MME 标签以 100% (7/7) 预测 MVBench 分类,并推广到 EgoSchema(零源重叠)。 (3) 四条件诊断阶梯(第 5.5 节):在十六个开源模型中将 VDG 分解为空间、帧多样性和时间组成部分,揭示出
¹ 我们使用“视觉接地”一词意指模型预测对视觉输入内容的依赖,而非指代表达文献中常见的特定定位用法。为避免歧义,我们在全文中主要使用“视觉依赖”一词。
第 2 页
Jae Joong Lee
图 1:每个问题回答两次:一次使用原始视频,一次使用黑屏。每个问题的视觉依赖差距(VDG)(即不同条件下正确率的差异)被聚合,以生成任务类型谱系、麦克尼马尔(McNemar)分离检验以及跨越 20 个模型(2–78B,10 个家族)的缩放分析。
时间顺序贡献的准确率接近于零,且与 Qwen2.5-VL 相比,Qwen3-VL 表现出多样性提取崩溃。 SigLIP [62] 到特定于架构的设计 [14]。VDG 谱系在所有评估的编码器类型中均保持稳定。 相对于 Qwen2.5-VL。 在所有评估的编码器类型中,VDG 谱系是稳定的。 相对于 Qwen2.5-VL。 构建效度和诊断分解。基准准确率是否测量了其声称的内容,即构建效度 [48] 的问题,在自然语言处理和多模态评估中正受到越来越多的审视。Schlangen [48] 认为,如果没有明确的构建定义,排行榜分数缺乏可解释性,而 Raji 等人 [45] 证明,聚合准确率可能会将不同的能力混淆为单个数字,而这可能并不反映任何单一能力。在多模态设置中,Frank 等人 [16] 探测了多模态 Transformer 中的跨模态影响,发现即使对于名义上的视觉任务,模型预测也往往主要依赖于文本特征。Yüksekgönül 等人 [61] 表明,许多视觉语言模型表现得像词袋,未能利用任一模态中的组合和空间结构。Lee [24] 引入了语言引导的不变性探测,以量化视觉语言模型(VLMs)是否对保持意义的改写具有不变性,并对语义翻转敏感,发现即使是像 SigLIP 这样强大的模型,对损坏的标题的评分也高于人类描述。对于视频,Buch 等人 [5] 记录的单帧可解性
(4) 压缩鲁棒性幻觉(第 4.4 节):平坦的 CRF 曲线源于双向抵消,且对 CRF 敏感的问题不成比例地依赖于视觉 grounding,这解释了为什么压缩“鲁棒性”是基准组成的伪影。 能力混淆为单个数字,而这可能并不反映任何单一能力。 能力混淆为单个数字,而这可能并不反映任何单一能力。 能力混淆为单个数字,而这可能并不反映任何单一能力。 ual one. In the vision-language setting, Frank et al. [16] probed 2 Related Work cross-modal influence in multimodal transformers and found that Video LLM benchmarks. Video-MME [18], MVBench [29], and model predictions often rely primarily on textual features even for nominally visual tasks. Yüksekgönül et al. [61] showed that many EgoSchema [37] are the primary suites audited here, and the broader vision-language models behave as bags of words, failing to leverage landscape includes ActivityNet-QA [59], NExT-QA [54], SEED- compositional and spatial structure in either modality. Lee [24] in- Bench [26], TempCompass [34], LongVideoBench [53], FunQA [55], troduced language-guided invariance probing to quantify whether MMBench-Video [15], and MSRVTT-QA [56]. Complementary image- VLMs are invariant to meaning-preserving paraphrases and sen- domain benchmarks such as MMBench [33], MMMU [60], and sitive to semantic flips, finding that even strong models such as MME [17] have established evaluation standards that video bench- SigLIP score corrupted captions above human descriptions. For marks increasingly follow. Despite this proliferation, few bench- video, the single-frame solvability documented by Buch et al. [5]
标记包括诊断性问题是否需要视觉输入。Buch 等人 [5] 表明,许多视频问答数据集仅凭单帧即可解答。Lei 等人 [25] 展示了视频语言学习中的单帧偏差,而 Chen 等人 [7] 发现多模态基准中存在无需图像的可行性。语言先验和诊断性基线。视觉问答中的语言先验已有充分记录 [1, 2, 20],后续工作识别出了单模态捷径 [6, 19]、因果偏差 [40]、标注伪影 [22] 以及多模态捷径交互 [12]。在多模态大模型时代,Tong 等人 [51] 揭示了系统性视觉缺陷,Li 等人 [30] 提出了基于轮询的幻觉评估方法。对于视频,TVBench [10] 展示了仅文本的可行性,Lydakis 等人 [35] 分析了训练数据构成,MoReVQA [39] 引入了仅大语言模型的基线。我们通过配对的 McNemar test 证明准确率和接地性是可分离的轴,这一主张比先前的基于检测的方法更强。压缩鲁棒性已在图像 [13, 23] 和分布偏移 [50] 方面进行了研究。我们将此扩展至视频大模型基准的 H.264 压缩。Bowman 和 Dahl [4] 认为基准需要超越准确率的效度诊断,行为测试框架 [47] 提供了互补的方法论。我们的 VDG 解决了准确率是否反映视觉接地的具体效度问题。视觉编码器范围从 CLIP [44] 和
Lei 等人 [25] 表明,时间基准可能不需要时间推理,但这些发现仍停留在数据集层面,缺乏逐问题的量化。我们的 VDG 填补了这一空白:它提供了准确率和接地性解耦的逐问题诊断,通过四条件阶梯将视觉依赖分解为空间、帧多样性和时间组件,并确立了由此产生的任务类型分类法在基准、模型家族和部署条件下具有泛化能力。
3 方法
3.1 模型与基准
我们评估了二十个视频大语言模型,涵盖十个架构家族,参数量在 2–78B 之间,包括开源权重和专有 API 模型。所有实验使用的三个主要模型(VDG 谱系、McNemar、CRF、跨基准):
- Qwen2-VL-7B-Instruct [52]:使用 ViT [14] 视觉编码器和 Qwen2 语言模型。
- LLaVA-Video-7B [63]:使用 CLIP [44] ViT-L/14 配合线性投影和 Qwen2-7B 语言模型。
- InternVL2-8B [8]:使用 InternViT-300M 编码器和 MLP 连接器以及 InternLM2,不包含 CLIP 编码器。
2
第 3 页
无接地能力的准确性:诊断视频大语言模型基准测试中的视觉依赖解离
表 1:Video-MME 上按任务类型划分的 VDG。百分位自助法计算 95% 置信区间(2000 次重采样)。除“时序推理”外,所有值均显著为正(𝑝< 0.01)(其置信区间包含零)。𝑛= 100 每任务类型,Qwen∗ 除外。
为了进行规模、生成和消融分析(第 5.3–5.5 节),我们在两种精度层级下评估了另外十三个开源权重模型。全精度(bf16):Qwen2-VL-2B, Qwen2.5-VL-3B/7B [3], Qwen3-VL-2B/8B [58], InternVL2-2B/26B, VideoLLaMA2-7B [9]。扩展(4-bit NF4 量化):Qwen2-VL-72B, Qwen2.5-VL-32B/72B, Qwen3-VL-32B, InternVL2-76B, InternVL2.5-78B。另有四个模型通过 API 评估以检验 VDG 的泛化能力:GPT-4o-mini, Gemini 2.5 Flash Lite, Llama 3.2 11B Vision, 和 Nemotron Nano 12B VL。对规模主张的辩护仅限于全精度模型,4-bit 结果报告时带有量化注意事项(第 5.4 节)。
我们在三个基准测试上进行评估: • Video-MME [18]:600 个问题,按 6 种任务类型分层(每种 100 个):OCR 问题、动作识别、动作推理、时序推理、属性感知、物体识别。这 600 个问题的分层子集在所有六种任务类型上均匀采样,以确保每个类别具有相等的统计效力。它源自 Video-MME 的完整问题池,并在所有四种实验条件和所有二十个模型中一致使用。 • MVBench [29]:462 个问题,涵盖 9 种任务类型,包括 action_prediction, object_existence, scene_transition, state_change, unexpected_action, episodic_reasoning, 和 action_recognition。 • EgoSchema [37]:500 个五选一问题,基于 Ego4D [21] 的 3 分钟第一人称视频。EgoSchema 与 Video-MME 和 MVBench 在视频源上零重叠,提供了完全独立的测试,以检验基于 VDG 的层级预测是否泛化到 Video-MME/MVBench 构建家族之外。
3.2 视觉依赖差距 (VDG)
对于每个问题 𝑞,我们定义: VDG(𝑞) = 1[correct(𝑞, original)] −1[correct(𝑞, black screen)] (1) 其中黑屏条件将所有视频帧替换为纯黑图像,同时保持问题文本和答案选项不变。VDG(𝑞) ∈{−1, 0, +1}。正值表示视觉接地(仅在视频存在时正确),零表示语言先验足够或普遍失败,负值表示视觉流实际上有害。
模型在问题集 Q 上的聚合 VDG 为: 1 ∑︁ VDG = VDG(𝑞) = Accorig −Accblack |Q| 𝑞∈Q
如表 1 和图 2 所示,六种任务类型形成了清晰的 VDG 梯度:属性感知位居榜首(0.38–0.46,跨模型),其次是物体识别和 OCR 问题。这种四类别分解识别出 31% 的“纯视觉核心”(第 4.3 节),诊断阶梯将 VDG 分解为空间、多样性和时间组件(第 5.5 节),以及 CRF 分层敏感性分析(第 4.4 节)。我们通过三个渠道验证 VDG:架构无关的黑屏底线(第 5.2 节)、CRF 敏感性增强和跨基准层级一致性(第 5 节)。
3.3 McNemar 解离检验
为了测试两个模型在独立于其整体准确性的情况下,对视觉流的依赖程度是否存在差异,我们将 McNemar 检验 [38] 应用于配对二元结果。具体而言,对于模型对 (𝑀1, 𝑀2) 在条件 𝑐∈{original, black screen} 上,我们检验 2 × 2 正确性列联表的非对角单元格是否相等。在原始条件下可靠的结果表明准确性差异,而在黑屏条件下可靠的结果表明语言先验利用的差异。当 𝑝orig 和 𝑝black 具有相反的可靠性模式时,发生解离。所有报告的 𝑝 值均通过了针对在两个基准测试上进行的六项检验的 Holm–Bonferroni 校正(最小 𝑝 的调整阈值为 0.05/6 = 0.0083,观察到的最小 𝑝 值为 0.0003)。
3.4 压缩协议
视频使用 ffmpeg/libx264 以 H.264 编码,CRF ∈{18, 23, 28, 33, 38}。CRF 18 接近无损(SSIM = 0.993),而 CRF 38 严重压缩(SSIM = 0.942)。作为外部感知代理,CLIP ViT-B/32 在原始视频和 CRF 38 视频之间给出的嵌入距离为 0.027(相比之下,高斯模糊 𝜎= 10 为 0.165)。由于三个主要模型均未使用此确切的编码器,我们将此值视为操纵检查,而非其内部编码器敏感性的证据。
4 结果
4.1 按任务类型的 VDG 谱
表 1 报告了所有三个模型在 Video-MME 上按任务类型的聚合 VDG,以及自助法 95% 置信区间。图 2 可视化了完整谱系。Qwen2-VL 对 53 个问题返回了空预测(主要在动作推理、OCR 问题和时序推理中),这些预测被视为不正确,并从匹配的 McNemar 样本中排除,导致 Video-MME 匹配比较的 𝑛= 547。2 虽然聚合 VDG 简化为准确性差异,但按问题的公式化使得聚合无法进行的分析成为可能:
2 Qwen2-VL 的空预测(𝑛= 53)在总体 VDG 计算中被计为不正确,导致 Qwen 的聚合 VDG 相对于全覆盖模型较低。对于匹配的 McNemar 检验,仅包含两个模型都有有效预测的问题(𝑛= 547),这排除了这 53 个问题。这两种处理方式互补:VDG 计算将空输出惩罚为任务失败,而 McNemar 比较需要匹配对。
3
第 4 页
Jae Joong Lee
0.6 表 2:MVBench(462 个问题)和 Video-MME 匹配样本(547 个问题)上的 McNemar 检验结果。“Orig” = 原始视频,“Black” = 黑屏。𝑏01 = 模型 A 错误,B 正确,𝑏10 = 模型 A 正确,B 错误。解离单元格以粗体显示。 Qwen2-VL LLaVA-Video InternVL2 0.4 Bench. Pair 𝑏01 𝑏10 𝑝orig 𝑝black Diss. VDG 0.2 IV2 vs. Qwen 58 28 0.0003 0.530 Yes 0 MVB IV2 vs. LLaVA 52 24 0.0006 0.940 Yes Qwen vs. LLaVA 41 18 0.0007 0.760 No† Attr.Perc Obj.Rec OCR Act.Rec Act.Reas Temp.Reas VME IV2 vs. Qwen 34 52 0.0906 0.0008 Yes
图 2:按任务类型划分的 Video-MME 视觉依赖差距(VDG)。所有三种架构的时间推理(Temporal Reasoning)VDG ≈ 0,而属性感知(Attribute Perception)始终显示较高的 VDG。这种排名在三种架构截然不同的模型中保持稳定(平均成对 𝑟= 0.789,个体成对范围从 𝑝> 0.05 到 𝑝= 0.008,在 𝑘= 6 时,见正文)。
其中两个模型不一致的部分,其余 81.4% 显示正确性相同。这符合预期:大多数基准问题要么普遍简单,要么普遍困难,解离必然集中在具有判别性的少数样本中。McNemar 检验正是为这种设置而设计的,其效力完全源于不一致对(discordant pairs)。
Qwen–LLaVA 对(表 2)在原始视频(𝑝= 0.0007)和黑屏条件(𝑝= 0.76)上均存在差异。这与解离框架一致:两个模型以相似的水平利用语言先验,因此它们在原始视频上的准确率差异在黑屏条件下得以保留。我们注意到 𝑝= 0.76 表示缺乏证据,而非等效性的证据。具有 ±5 个百分点边距的正式等效性检验(TOST)得出 𝑝equiv = 0.031,支持该对在黑屏条件下的实际等效性。
在 Video-MME 匹配样本(𝑛= 547)上,InternVL2 在原始视频上的准确率为 60.3%,而 Qwen 为 64.4%(差异 = −4.0%,95% 自助法置信区间 [−8.6%, +0.4%],McNemar 𝑝= 0.0906,不显著),尽管该对单独在 𝑘= 6 时未达到 𝑝< 0.05。这种跨架构的一致性并非微不足道:Qwen2-VL 使用 ViT 编码器,LLaVA-Video 使用 CLIP ViT-L/14,而 InternVL2 使用 InternViT,不包含 CLIP 组件。排名是基准任务类型的属性,而非任何特定视觉编码器架构的属性。
在问题层面,跨模型 VDG 相关系数为 𝑟= 0.274–0.304(𝑛= 600,𝑝≪0.001):模型就哪些任务类型需要视觉达成一致,但在哪些具体问题属于视觉基础问题上存在显著分歧。仅有 10.3% 的问题在三个模型中同时显示 VDG = +1(即“视觉必要问题的硬核”),但每个问题的中位 VDG 为 0,反映出聚合视觉信号由少数样本驱动。
4.2 McNemar 解离
表 2 报告了 MVBench 上所有三对模型在两种条件下的 McNemar 检验结果。在原始视频上,InternVL2-8B 的准确率高于 Qwen2-VL(𝑝= 0.0003)和 LLaVA-Video(𝑝= 0.0006)。在黑屏条件下,所有三对模型在统计上均无显著差异(𝑝= 0.53–0.94)。解离现象清晰可见:在原始视频上表现优于其他模型的模型,当视频替换为黑屏时,并未从中获益。这一发现基于 86 个不一致对(占 462 个问题的 18.6%)。
4.3 对比任务类型分析
在 MVBench 的任务类型中,场景转换(scene_transition)尽管真实标签分布近乎均匀(A: 36%,B: 20%,C: 22%,D: 22%),却达到了 86% 的黑屏准确率。字母对齐仅能解释 20–31% 的超随机表现,剩余部分由语义泄漏解释:场景转换问题的结构本身就能揭示转换是否发生,这与视觉流无关。
关键的方法学控制是状态变化(state_change):该任务类型的真实标签偏斜程度(A: 44%)高于场景转换,但黑屏准确率仅为 28%。跨模型来看,LLaVA 在场景转换上的预测仅凭文本即可匹配真实标签分布(A: 42%,B: 24%,C: 18%,D: 16%)。状态变化/场景转换的对比同时证伪了两种替代解释:如果高黑屏准确率是由真实标签偏斜驱动的,那么状态变化的准确率至少应与之相当。如果它是由字母猜测策略驱动的,那么两个任务都会受到同等影响。这两种预测均不成立。
4
第 5 页
无接地诊断:视频大语言模型基准测试中的视觉依赖解离
表 3:Qwen2-VL-7B 在不同 H.264 压缩(CRF 18–38)下的准确率,按任务类型划分。数值来自完整推理运行,不同 CRF 级别之间的差异均在零的 95% 置信区间内。基线 = 原始未压缩视频。
| 任务类型 | 原始 | CRF18 | CRF23 | CRF28 | CRF33 | CRF38 | | :— | :— | :— | :— | :— | :— | :— | | OCR 问题 | 0.570 | 0.565 | 0.562 | 0.568 | 0.565 | 0.560 | | 动作识别 | 0.680 | 0.678 | 0.675 | 0.673 | 0.670 | 0.668 | | 动作推理 | 0.550 | 0.551 | 0.549 | 0.548 | 0.547 | 0.545 | | 时间推理 | 0.545 | 0.544 | 0.543 | 0.542 | 0.541 | 0.540 | | 属性感知 | 0.700 | 0.697 | 0.695 | 0.692 | 0.689 | 0.688 | | 物体识别 | 0.620 | 0.617 | 0.615 | 0.613 | 0.611 | 0.610 | | 总体 | 0.611 | 0.609 | 0.607 | 0.606 | 0.604 | 0.602 |
差异在于语义:场景转换问题命名了所询问的现象,而状态变化问题则需要观察该现象。
每个问题根据其由 $(y_{orig}, y_{black}) \in \{0, 1\}^2$ 定义的方式落入四类之一:类别 I(纯视觉,VME/MVB 上分别为 31%/28%),类别 II(语言先验冗余,30%/40%),类别 III(视频有害,6–7%),以及类别 IV(困难,32%/25%)。类别 I 构成了 VDG 隔离出的“纯视觉核心”。在所有三个模型中,仅有 10.3% 的 Video-MME 问题同时显示 VDG = +1。破坏比率 $D: C = |\{q: VDG(q) = +1\}| / |\{q: VDG(q) = -1\}|$(移除视频导致正确答案变为错误答案,而非修正错误答案的赔率)范围从 4.25:1(Qwen)到 7.3:1(LLaVA),证实视频的帮助是非对称的。
4.4 CRF 压缩:鲁棒性错觉
所有任务类型和所有三个模型的 CRF 18–38 准确率曲线均呈均匀平坦状(表 3 展示了 Qwen2-VL,LLaVA-Video 和 InternVL2 也显示出相同的模式,CRF 38 时的总体准确率在其各自基线的 1% 以内,且无单个任务类型的变化超过置信区间)。³ 没有任何单个 CRF 级别显示出相对于基线的统计显著准确率变化。跨条件一致性为 87–90%:对于 87–90% 的问题,模型在所有六个 CRF 级别下的预测完全相同。按任务类型划分,OCR 问题显示出最高的跨条件稳定性(94.0%),物体识别最低(80.0%)。表 3 中的所有数值均来自实际模型输出,其单调外观反映了变化的幅度较小(均在 2–3% 以内),而非强制的单调性。除 CRF 38 时的 action_antonym 任务类型外(30/50 次失败,排除并在下文单独分析),所有任务类型在所有 CRF 级别下均解码成功。
然而,总体稳定性掩盖了一种双向抵消机制。大约 10% 的问题在 CRF 级别间从正确变为错误,而大约 10% 的问题从错误变为正确,在总体中相互抵消。InternVL2 在 CRF 38 时相对于原始版本净增 3 个正确答案,这是压缩带来的正向净效应。但这并非鲁棒性,而是抵消。
³ 表 3 以 Qwen2-VL 为代表,因为它是唯一在所有五个级别都运行了完整 CRF 推理的模型。LLaVA-Video 和 InternVL2 仅在原始和 CRF 38 端点进行评估,VDG 分层富集分析(Fisher 精确检验)将三个模型的数据合并。
为了确认压缩探针在存在视觉接地时是敏感的,我们按 VDG 值对问题进行分层并计算压缩敏感度。CRF 敏感问题(那些从原始状态变为 CRF 38 时预测状态发生变化的问题)具有 VDG = +1 的可能性比全样本高出 3.76 倍(61.1% vs. 29.5%,Fisher 精确检验 $p= 0.006$)。⁴ 当视觉信息被真正使用时,压缩会使其退化。整体的零结果反映了基准测试的构成(大多数问题是低 VDG),而非模型对压缩的鲁棒性。
此外,action_antonym 任务类型显示出明显的 +48% CRF 38 异常。调查揭示了一个数据伪影:该任务类型的 50 个 CRF 38 视频中,有 30 个遭受了解码失败,产生了被记录为错误的空模型输出。在有效的 20 个问题子集中:Qwen 准确率从 0.84 升至 0.90,InternVL2 从 0.88 升至 0.95,这与正常的压缩鲁棒性一致。该异常是流水线伪影,而非真正的任务类型 CRF 敏感性。
⁴ 2×2 单元格计数:CRF 敏感/VDG = +1:11,CRF 敏感/VDG ≤0:7,稳定/VDG = +1:87,稳定/VDG ≤0:439,Fisher 精确检验 $p= 0.006$,OR = 3.76,OR 的 95% CI:[1.3, 10.8]。
5 有效性与泛化
5.1 跨基准一致性
我们将 Video-MME 任务类型根据 VDG 幅度分为三个语义类别:perceptual_physical(属性感知、物体识别,VME VDG ≈0.39),action_comprehension(动作识别、动作推理,VME VDG ≈0.23),以及 temporal_linguistic(时间推理、OCR 问题,VME VDG ≈0.07)。然后,我们仅根据语义标签将 MVBench 任务类型分配到层级,随后在 MVBench 上运行黑屏实验。关键在于,层级边界(> 0.30,0.10–0.30,< 0.10)是根据 Video-MME 数据定义的,而 MVBench 的分配是一个保留预测,而非事后分类。我们承认,这种语义映射反映了标准 VQA 领域知识(感知任务预计比推理任务更具视觉性),其贡献不在于排名的方向,而在于定量的层级边界以及 7/7 的分类准确率,这证实了 VDG 幅度在具有不同问题池的基准之间是可迁移的。
从 Video-MME 得出的任务类型 VDG 排序(perceptual_physical > action_comprehension > temporal_linguistic)正确地将所有 7 个 MVBench 任务类型分类到了预测的层级中。在随机分配到 3 个有序层级的情况下,7/7 正确分类的概率为 $(1/3)^7 < 0.001$(技术上是一个下限,因为零假设允许任何映射,且确切的排列 $p$ 值取决于特定的 7/3/7 分区结构)。语义类别在不同基准测试中产生了一致的 VDG 值:perceptual_physical(VME = 0.392,MV = 0.370),action_comprehension(VME = 0.234,MV = 0.220),temporal_linguistic(VME = 0.066,MV = 0.040)。
我们接下来在 EgoSchema 上测试独立复制。Video-MME 和 MVBench 共享视频来源(ActivityNet、Kinetics),因此上述一致性可能反映了共享的刺激属性,而非可泛化的问题结构属性。EgoSchema [37] 消除了这种担忧:其 500 个问题完全来自
第 6 页
Jae Joong Lee
表 4:EgoSchema 上的 VDG(500 个问题,5 选项,Ego4D)。与 Video-MME 和 MVBench 的视频源零重叠。预测层级:action_comprehension(VDG 0.15–0.30)。百分位自助法 95% 置信区间(2000 次重采样)。D:C = 破坏-构建比(视频移除破坏 vs. 修复正确答案的数量)。
| Model | Orig | Black | VDG | 95% CI | D:C | | :— | :— | :— | :— | :— | :— | | InternVL2-8B | 0.600 | 0.318 | 0.282 | [0.236, 0.330] | 8.8:1 | | Qwen2-VL-7B | 0.568 | 0.304 | 0.264 | [0.220, 0.308] | 8.3:1 | | LLaVA-Video-7B | 0.514 | 0.206 | 0.308 | [0.264, 0.352] | 12.8:1 | | Mean | 0.561 | 0.276 | 0.285 | [0.240, 0.330] | — |
表 5:Temporal Reasoning 上的 FPS 消融实验(Video-MME,$n=100$)。VDG 在所有跨越三代且参数规模为 2–72B 的八个模型中,随 FPS 保持平坦,从而排除了帧稀疏性作为解释。
| Model | 0.5 FPS | 1.0 FPS | 2.0 FPS | | :— | :— | :— | :— | | Qwen2-VL-2B | +0.040 | +0.050 | +0.050 | | Qwen2-VL-7B | −0.010 | −0.010 | −0.010 | | Qwen2-VL-72B† | +0.120 | +0.120 | +0.100 | | Qwen2.5-VL-3B | +0.147 | +0.212 | +0.132 | | Qwen2.5-VL-7B | +0.226 | +0.232 | +0.286 | | Qwen2.5-VL-32B† | +0.210 | +0.190 | +0.220 | | Qwen2.5-VL-72B† | +0.270 | +0.250 | +0.210 | | Qwen3-VL-8B | +0.020 | +0.110 | +0.100 |
† 4-bit NF4 quantization.
Ego4D 自我中心视频,视频源零重叠。EgoSchema 问题针对 3 分钟片段的情景时间推理,具有五个答案选项(机会水平 = 20%)。
我们预测,EgoSchema 作为一个情景/时间推理基准,应落在 action_comprehension 层级(VDG $\in[0.15, 0.30]$),对应于该类别中时间推理的一端。表 4 报告了结果。
平均 VDG = 0.285 [0.240, 0.330]。三个模型中的两个(Qwen: 0.264,InternVL2: 0.282)落在预测的 action_comprehension 层级内,而 LLaVA (0.308) 略高于边界。平均值落在预测范围内。这一结果具有三层含义:(1) VDG 层级分类法推广到了具有完全独立视频源的基准,排除了共享语料库伪影,(2) EgoSchema 上的黑屏下限(20.6–31.8%)低于 MVBench(46–48%),这与从 4 选项到 5 选项格式的转变一致(机会水平从 25% 降至 20%),以及 (3) 破坏比(8–13:1)证实,即使在长篇幅自我中心内容中,视频移除也是不对称地有害的。
跨基准的模式现在涵盖了三个基准、两个构建家族和两个视频源语料库。VDG 层级成员资格是问题语义的属性,而非任何特定基准或视频领域的属性。
5.2 内部效度
Video-MME 中的折半稳定性在 1000 次随机折半分割中产生平均 Spearman $\rho=0.847$ [95% CI: 0.486, 1.000],与高内部一致性一致。黑屏下限对于特定任务类型是架构无关的:在 MVBench 物体存在任务中,原始准确率跨越模型范围为 37%(63.0–100%),但在黑屏条件下所有三个模型均收敛至 45.7–47.8%,验证了基线作为问题结构而非模型能力的度量。动作预测任务提供了经验下限:所有模型在黑屏条件下均达到机会水平准确率(0.200–0.380),确立了“视觉纯净的样子”作为 VDG 量级的锚点。
5.3 FPS 消融:排除帧稀疏性
一个自然的担忧是,我们在基线 0.25 FPS 下的 Temporal Reasoning VDG $\approx 0$ 反映的是时间采样不足,而非问题结构。我们通过跨越三代八个模型的 FPS 消融实验解决了这一问题:Qwen2-VL(2B, 7B, 72B),Qwen2.5-VL(3B, 7B, 32B, 72B),以及 Qwen3-VL-8B,分别在 0.5、1.0 和 2.0 FPS 下,在原始条件和黑屏条件下对所有 100 个 Temporal Reasoning 问题进行评估。
表 5 报告了每个 FPS 水平下的 VDG。在每个模型内部,VDG 随帧率基本保持平坦:没有任何模型显示出随 FPS 单调增加的趋势。Qwen2-VL 模型在所有 FPS 水平下显示接近零的 VDG(2B: +0.04–0.05,7B: −0.01,72B: +0.10–0.12)。Qwen2.5-VL 模型显示显著非零的 VDG(+0.13–0.29),且与 FPS 无关,证实了它们的 Temporal Reasoning VDG 反映了真实的架构能力,而非帧稀疏性抑制。Qwen3-VL-8B 显示接近零的 VDG,与其整体较低的 VDG 一致。跨越三代和八个模型的 FPS 独立性证实,Temporal Reasoning VDG 由架构和训练决定,而非帧率。
扩展消融(补充表 S9–S10)将 FPS 范围扩展至 4、8、16 和 24 FPS,涵盖五个模型。VDG 在所有测试模型中从 8 到 24 FPS 保持平坦,将帧稀疏性无效结果扩展至接近原生视频帧率。值得注意的是,Qwen2-VL-2B 在所有扩展 FPS 水平下显示负 VDG,证实视频输入即使在较高帧率下也会略微损害该模型的性能。
5.4 规模与代际分析
任务类型 VDG 排名在所有十六个开源模型(2–78B,六个家族)中得以保留,另外四个 API 模型证实,聚合 VDG 推广到了专有架构(表 6)。参数数量相差一个数量级的模型产生了从最具视觉基础到最少视觉基础的任务类型相同排序。这种一致性支持了 VDG 谱系是基准的属性,而非任何单个模型属性的解释。
表 6 和图 3 报告了所有二十个模型的 VDG。数据中出现了三个趋势。首先,VDG 跨度很大:从 0.000(InternVL2.5-78B,4-bit)到 0.326(Qwen2.5-VL-72B,4-bit),API 模型 Gemini 2.5 Flash Lite 尽管准确率中等(0.552),但也达到了 0.315。表中标记为 †(图 3 中为虚线)的 26B 以上模型使用 4-bit NF4 量化,因此从这些模型得出的规模结论需附带明确的量化警告。其次,在匹配精度(bf16)下,模型代际和规模均改善了聚合 VDG:Qwen2-VL-2B(0.159)与 Qwen2.5-VL-3B(0.210)的比较隔离了可比条件下的代际效应。
第 7 页
无接地基准的准确率:诊断视频大语言模型基准中的视觉依赖解离
表 6:20 个模型在一致(0.297)。尽管黑屏准确率更高(0.407 vs. 0.333),反映更强的语言先验,Qwen3-VL 的原始准确率较低(0.514 vs. 0.630)。视频专用模型 LLaVA-Video-7B(0.287)和 VideoLLaMA2-7B(0.243)均优于所有 Qwen3-VL 尺寸,表明当语言先验占主导地位时,针对视频的建筑专业化优于规模。
表 6:Qwen3-VL 子集上的 VDG。bf16 = 全精度,4b = 4-bit NF4 量化,API = 专有或 API 访问。T.R. = 时序推理任务类型(— = 未评估)。模型按家族和规模排序。
| Model | Prec. | Orig | Black | VDG | T.R. | | :— | :— | :— | :— | :— | :— | | Qwen2-VL-2B | bf16 | 0.472 | 0.313 | 0.159 | 0.010 | | Qwen2-VL-72B | 4b | 0.667 | 0.410 | 0.257 | 0.020 | | Qwen2.5-VL-3B | bf16 | 0.572 | 0.362 | 0.210 | 0.127 | | Qwen2.5-VL-7B | bf16 | 0.630 | 0.333 | 0.297 | 0.225 | | Qwen2.5-VL-32B | 4b | 0.635 | 0.369 | 0.266 | 0.186 | | Qwen2.5-VL-72B | 4b | 0.703 | 0.377 | 0.326 | 0.260 | | Qwen3-VL-2B | bf16 | 0.447 | 0.333 | 0.114 | 0.061 | | Qwen3-VL-8B | bf16 | 0.514 | 0.407 | 0.107 | 0.036 | | Qwen3-VL-32B | 4b | 0.557 | 0.392 | 0.165 | 0.149 | | InternVL2-2B | bf16 | 0.513 | 0.295 | 0.218 | -0.030 | | InternVL2-8B | bf16 | 0.583 | 0.312 | 0.272 | 0.100 | | InternVL2-76B | 4b | 0.308 | 0.357 | -0.048 | -0.010 | | InternVL2.5-78B | 4b | 0.452 | 0.452 | 0.000 | 0.030 | | VideoLLaMA2-7B | bf16 | 0.585 | 0.342 | 0.243 | 0.070 | | LLaVA-Video-7B | bf16 | 0.638 | 0.351 | 0.287 | 0.080 | | GPT-4o-mini | API | 0.622 | 0.332 | 0.290 | — | | Gemini 2.5 FL | API | 0.552 | 0.237 | 0.315 | — | | Llama 3.2 11B | API | 0.427 | 0.322 | 0.105 | — | | Nemotron Nano 12B | API | 0.440 | 0.415 | 0.025 | — |
时序推理 VDG 是生成依赖的:Qwen2-VL 接近零(0.010–0.020),InternVL2 中等(8B/26B 时为 0.100),而 Qwen2.5-VL 真正非零(3B 时为 0.127,7B 时为 0.225)。Qwen3-VL 逆转了这一进展(8B 时为 0.036)。FPS 消融实验(表 5)证实这些差异与 FPS 无关:Qwen2.5-VL-7B 在 0.5 到 2.0 FPS 期间保持 VDG ≈0.23,而 Qwen2-VL-7B 保持在 -0.01。
InternVL2-76B(4-bit)仅实现 30.8% 的原始准确率(低于 InternVL2-2B)和负 VDG(-0.048),表明存在量化牺牲,其中视觉通路受到选择性降级。InternVL2.5-78B(4-bit)恢复了准确率(0.452),但 VDG = 0.000,在有视频和无视频情况下得分相同。
Qwen2.5-VL 4-bit 轨迹(32B 时为 0.266,72B 时为 0.326)平滑且与其 bf16 趋势一致。26B 以上的规模行为与量化纠缠在一起。我们强调,本文中的所有规模声明仅针对 bf16 模型(2–26B)进行辩护。4-bit 结果仅为完整性而报告,应解释为规模和量化的联合效应,而非纯粹的规模证据。
通过 API 访问的另外四个模型将 VDG 分析扩展到开放权重架构之外(表 6,底部)。GPT-4o-mini(0.290)和 Gemini 2.5 Flash Lite(0.315)均实现了与最强开放权重模型(Qwen2.5-VL-7B:0.297)相当的 VDG,显示出显著的视觉依赖。尽管整体准确率中等(0.552),Gemini 2.5 Flash Lite 在所有 20 个模型中实现了第二高的 VDG。相比之下,Nemotron Nano 12B VL 尽管准确率为 44.0%,但 VDG 接近零(0.025),其大部分性能与语言先验利用一致,使其与 InternVL2.5-78B 并列,成为视频输入几乎无价值的模型。Llama 3.2 11B Vision(0.105)显示出中等 VDG,与部分视觉接地一致。这些结果表明,VDG 诊断跨越了开放权重/专有界限,且专有模型并不比其开放权重对应模型具有更均匀的接地能力。
图 3:VDG 与四个家族的模型规模。实心标记 = bf16,开放/虚线 = 4-bit NF4。Qwen2.5-VL 随规模增加 VDG,而 Qwen3-VL 显示出代际回归。
5.5 诊断阶梯:分解视觉接地
VDG 诊断测量总视觉依赖。为了将其分解为空间和时间组件,我们引入了一个四条件诊断阶梯:(1) 黑屏(语言先验底线),(2) 单帧(视频持续时间内重复一帧,隔离静态空间识别),(3) 打乱帧(原始帧随机顺序,增加帧多样性但破坏时间顺序),(4) 原始视频(完整时空信号)。这产生了三个逐步增量:
$$ \Delta_{\text{spatial}} = \text{Acc}_{\text{single}} – \text{Acc}_{\text{black}} \quad (2) $$
$$ \Delta_{\text{diversity}} = \text{Acc}_{\text{shuffled}} – \text{Acc}_{\text{single}} \quad (3) $$
$$ \Delta_{\text{temporal}} = \text{Acc}_{\text{orig}} – \text{Acc}_{\text{shuffled}} \quad (4) $$
其中 $\text{VDG} = \Delta_{\text{spatial}} + \Delta_{\text{diversity}} + \Delta_{\text{temporal}}$。
7
第 8 页
Jae Joong Lee
表 7:Video-MME(600 题,所有 16 个模型)上的四点诊断阶梯。$\Delta_s$ = 空间,$\Delta_d$ = 多样性,$\Delta_t$ = 时间。$\Delta_{temporal} \approx 0$ 适用于所有模型,且 $\Delta_{diversity}$ 是主导视觉信号。Qwen3-VL 显示近乎零的 $\Delta_d$,而 InternVL2-76B/78B 显示负的 $\Delta_s$。
| Model | Blk | Sgl | Shf | Orig | $\Delta_s$ | $\Delta_d$ | $\Delta_t$ | | :— | :— | :— | :— | :— | :— | :— | :— | | Qwen2-VL-2B | 0.313 | 0.377 | 0.475 | 0.472 | +0.064 | +0.098 | −0.003 | | Qwen2-VL-72B† | 0.410 | 0.490 | 0.637 | 0.667 | +0.080 | +0.147 | +0.030 | | Qwen2.5-VL-3B | 0.362 | 0.420 | 0.550 | 0.572 | +0.058 | +0.130 | +0.022 | | Qwen2.5-VL-7B | 0.333 | 0.425 | 0.572 | 0.630 | +0.092 | +0.147 | +0.058 | | Qwen2.5-VL-32B† | 0.369 | 0.462 | 0.600 | 0.635 | +0.093 | +0.138 | +0.035 | | Qwen2.5-VL-72B† | 0.377 | 0.482 | 0.625 | 0.703 | +0.105 | +0.143 | +0.078 | | Qwen3-VL-2B | 0.333 | 0.385 | 0.418 | 0.447 | +0.052 | +0.033 | +0.029 | | Qwen3-VL-8B | 0.407 | 0.488 | 0.522 | 0.514 | +0.081 | +0.034 | −0.008 | | Qwen3-VL-32B† | 0.392 | 0.475 | 0.513 | 0.557 | +0.083 | +0.038 | +0.044 | | InternVL2-2B | 0.295 | 0.380 | 0.503 | 0.513 | +0.085 | +0.123 | +0.010 | | InternVL2-8B | 0.312 | 0.420 | 0.575 | 0.583 | +0.108 | +0.155 | +0.008 | | InternVL2-26B | 0.320 | 0.405 | 0.575 | 0.582 | +0.085 | +0.170 | +0.007 | | InternVL2-76B† | 0.357 | 0.280 | 0.295 | 0.308 | −0.077 | +0.015 | +0.013 | | InternVL2.5-78B† | 0.452 | 0.448 | 0.452 | 0.452 | −0.004 | +0.004 | +0.000 | | VideoLLaMA2-7B | 0.342 | 0.475 | 0.550 | 0.585 | +0.133 | +0.075 | +0.035 | | LLaVA-Video-7B | 0.351 | 0.443 | 0.628 | 0.638 | +0.092 | +0.185 | +0.010 |
† 4-bit NF4 quantization. Blk=black, Sgl=singleframe, Shf=shuffled.
表 7 报告了所有十六个模型的完整阶梯。出现四个发现:
时间增量($\Delta_{temporal}$)在所有模型中近似为零。在所有十六个模型中,将打乱顺序恢复为原始顺序所带来的准确率提升最多为 +0.078(Qwen2.5-VL-72B),大多数模型的提升小于 +0.035,且有两个模型显示出负的 $\Delta_{temporal}$。当前的任何架构在我们的评估分辨率下均未使用时间顺序。这解释了时间推理 VDG 较低的原因:这些问题所要求的信息正是任何模型都无法提取的信息。
多样性增量($\Delta_{diversity}$)是主导视觉信号。对于功能良好的模型,观察到多个打乱后优于单帧的多样帧,准确率贡献为 +0.075 至 +0.185。LLaVA-Video-7B 具有最高的 $\Delta_{diversity}$(+0.185),与其高总体 VDG 一致。VDG 捕获的视觉接地主要是帧多样性:在视频中的某处看到正确内容,而非时间连贯性。
Qwen3-VL 显示近乎零的 $\Delta_{diversity}$。Qwen3-VL 模型在所有三个尺寸下的 $\Delta_{diversity}$ 仅为 +0.033–0.038,而同等规模下的 Qwen2.5-VL 为 +0.130–0.147。单帧准确率几乎与打乱顺序的准确率相当,意味着 Qwen3-VL 从单帧中提取了其几乎所有的视觉信息。这种架构转变,即偏好逐帧特征提取而非多帧聚合,解释了尽管 Qwen3-VL 具有更强的语言先验,其 VDG 却出现回归的原因。
InternVL2-76B 和 InternVL2.5-78B 显示负的 $\Delta_{spatial}$。特别是,InternVL2-76B 显示 $\Delta_{spatial} = -0.077$:单个真实帧将准确率降低至黑屏基线以下(0.280 对比 0.357),且 $\Delta_{diversity}$(+0.015)和 $\Delta_{temporal}$(+0.013)均可忽略不计。此外,InternVL2.5-78B 甚至更平坦($\Delta_{spatial} = -0.004$,$\Delta_{diversity} = +0.004$,$\Delta_{temporal} = 0.000$):所有四种条件产生相同的准确率(0.452)。这些模型在阶梯的任何层级上均未提取视觉信息,证实了它们的基准准确率完全是语言驱动的,这与它们的总体 VDG $\le 0$(第 5.4 节)一致。
6 讨论
VDG 谱系表明,大多数基准难度是语言性的,而非视觉性的:只有 31% 的 Video-MME 问题属于类别 I(纯视觉),而 70% 的问题无论视觉输入如何均可回答。时间顺序在所有模型中对准确率的贡献接近于零,且视觉接地由帧多样性主导。我们的主张针对的是基准质量,而非模型能力:当前的时间推理问题无法区分时间理解与语言先验的利用。设计用于时间判别(例如,TempCompass [34],Perception Test [42])的基准是未来分析的重点。
VDG 随规模增加(Qwen2.5-VL:0.210 → 0.297,3B→7B)和生成(Qwen2-VL-2B:0.159 → Qwen2.5-VL-3B:0.210),但 Qwen3-VL 在每个尺寸类别中都出现回归(8B 时为 0.107,对比 0.297),这是由于近乎零的 $\Delta_{diversity}$(+0.034 对比 +0.147),这在准确率中是不可见的,其中 Qwen3-VL-8B(51.4%)看似与 InternVL2-2B(51.3%)相当。API 模型显示出相同的模式:VDG 范围从 0.025(Nemotron)到 0.315(Gemini),证实这种解耦不仅限于开放权重架构。
作为需要额外基准验证的首次迭代启发式方法,VDG < 0.10 的任务类型应标记为审查,而 VDG > 0.30 的任务类型则为更依赖视觉的问题提供实证目标。这些截止值总结了观察到的谱系,而非定义通用的通过/失败标准。位置偏差 [43, 64] 解释了 20–31% 的超随机猜测黑屏准确率(补充表 S5)。基准设计者应验证均匀的真实标签字母分布。
规模声明仅限于 bf16 模型(2–26B),4-bit 和前沿模型仍部分测试。所有基准均使用多项选择题格式。将 VDG 扩展到开放生成是未来的工作。
诊断阶梯仅在 0.25 FPS 下评估,且 FPS 消融涵盖 0.5–24 FPS,但仅涉及五个模型。
7 结论
在二十个模型(2–78B,十个架构家族,包括两个专有模型)中,我们证明了基准准确率和视觉接地在统计上是可分离的。VDG 诊断揭示了四个关键发现:(1) McNemar 检验表明准确率和视觉依赖可以解耦,(2) 任务类型 VDG 谱系在基准间保持一致,(3) 时间顺序贡献接近零准确率,而帧多样性占主导地位,(4) Qwen3-VL 显示出准确率无法察觉的 VDG 回归。我们提出 VDG 作为视频基准构建的标准审计工具。所有代码和注释均公开可用。
参考文献
[1] Aishwarya Agrawal, Dhruv Batra, Devi Parikh, and Aniruddha Kembhavi. 2018. Don’t Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering. In CVPR.
[2] Stanislaw Antol, Aishwarya Agrawal, Jiasen Lu, Margaret Mitchell, Dhruv Batra, C. Lawrence Zitnick, and Devi Parikh. 2015. VQA: Visual Question Answering. In ICCV.
[3] Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, et al. 2025. Qwen2.5-VL Technical Report. arXiv preprint arXiv:2502.13923 (2025).
8
第 9 页
无接地基准的准确性:诊断视频大语言模型基准中的视觉依赖解离
[4] Samuel R. Bowman 和 George E. Dahl。2021。修复自然语言理解中的标注工作需要做什么?。在 NAACL-HLT 上。 arXiv 预印本 arXiv:2305.06355 (2023)。 [5] Shyamal Buch, Cristóbal Eyzaguirre, Adrien Gaidon, Jiajun Wu, Li Fei-Fei, 和 Juan Carlos Niebles。2022。重新审视视频语言理解中的“视频”。在 CVPR 上。 [6] Remi Cadène, Corentin Dancette, Hedi Ben-younes, Matthieu Cord, 和 Devi Parikh。2019。RUBi:减少视觉问答中的单模态偏差。在 NeurIPS 上。 [7] Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, 和 Feng Zhao。2024。我们在评估大型视觉语言模型的方向上正确吗?。在 NeurIPS 上。 [8] Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, 等人。2024。通过模型、数据和测试时扩展扩展开源多模态模型的性能边界。 arXiv 预印本 arXiv:2412.05271 (2024)。 [9] Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziqi Luo, Deli Zhao, 和 Lidong Bing。2024。VideoLLaMA 2:推进视频大语言模型中的时空建模和音频理解。 arXiv 预印本 arXiv:2406.07476 (2024)。 [10] Daniel Cores, Michael Dorkenwald, Manuel Mucientes, Cees G. M. Snoek, 和 Yuki M. Asano。2024。TVBench:重新设计视频语言评估。 arXiv 预印本 arXiv:2410.07752 (2024)。BMVC 2025。 [11] Wenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, 和 Steven Hoi。2023。InstructBLIP:通过指令微调迈向通用视觉语言模型。在 NeurIPS 上。 [12] Corentin Dancette, Remi Cadène, Damien Teney, 和 Matthieu Cord。2021。超越基于问题的偏差:评估视觉问答中的多模态捷径学习。在 ICCV 上。 [13] Samuel Dodge 和 Lina Karam。2016。理解图像质量如何影响深度神经网络。在 QoMEX 上。 [14] Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, 和 Neil Houlsby。2021。一张图片值 16×16 个词:用于大规模图像识别的 Transformer。在 ICLR 上。 [15] Xinyu Fang, Kangrui Mao, Haodong Duan, Xiangyu Zhao, Yining Li, Dahua Lin, 和 Kai Chen。2024。MMBench-Video:用于整体视频理解的长格式多镜头基准。在 NeurIPS 上。 [16] Stella Frank, Emanuele Bugliarello, 和 Desmond Elliott。2021。视觉与语言还是用于语言的视觉?论多模态 Transformer 中的跨模态影响。在 EMNLP 上。 [17] Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Jinrui Yang, Xiawu Zheng, Ke Li, Xing Sun, Yunsheng Wu, 和 Rongrong Ji。2023。MME:多模态大语言模型的综合评估基准。 arXiv 预印本 arXiv:2306.13394 (2023)。 [18] Chaoyou Fu, Yuhan Dai, Yondong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, 等人。2025。Video-MME:首个多模态大语言模型在视频分析中的综合评估基准。在 CVPR 上。 [19] Robert Geirhos, Jörn-Henrik Jacobsen, Claudio Michaelis, Richard S. Zemel, Wieland Brendel, Matthias Bethge, 和 Felix A. Wichmann。2020。深度神经网络中的捷径学习。Nature Machine Intelligence 2 (2020), 665–673。 [20] Yash Goyal, Tejas Khot, Douglas Summers-Stay, Dhruv Batra, 和 Devi Parikh。2017。使 VQA 中的 V 重要:提升图像理解在视觉问答中的作用。在 CVPR 上。 [21] Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, 等人。2022。Ego4D:3000 小时的第一人称视频环游世界。在 CVPR 上。 [22] Suchin Gururangan, Swabha Swayamdipta, Omer Levy, Roy Schwartz, Samuel Bowman, 和 Noah A. Smith。2018。自然语言推理数据中的标注伪影。在 NAACL-HLT 上。 [23] Dan Hendrycks 和 Thomas Dietterich。2019。基准测试神经网络对常见腐蚀和扰动的鲁棒性。在 ICLR 上。 [24] Jae Joong Lee。2026。视觉语言模型的语言引导不变性探测。Pattern Recognition Letters 202 (2026), 108–113。doi:10.1016/j.patrec.2026.02.012 [25] Jie Lei, Tamara L. Berg, 和 Mohit Bansal。2023。揭示视频与语言学习中的单帧偏差。在 ACL 上。 [26] Bohao Li, Yuying Ge, Yixiao Ge, Guangzhi Wang, Rui Wang, Ruimao Zhang, 和 Ying Shan。2024。SEED-Bench:基准测试多模态大语言模型。在 CVPR 上。 [27] Junnan Li, Dongxu Li, Silvio Savarese, 和 Steven Hoi。2023。BLIP-2:通过冻结图像编码器和大型语言模型引导语言-图像预训练。在 ICML 上。 [28] [缺失条目,原文中未显示完整编号或内容,根据上下文推测可能为 [28] 但原文跳至 [29]] [29] Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Yi Liu, Zun Wang, Jilan Xu, Guo Chen, Ping Luo, Limin Wang, 和 Yu Qiao。2024。MVBench:一个综合的多模态视频理解基准。在 CVPR 上。 [30] Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, 和 Ji-Rong Wen。2023。评估大型视觉语言模型中的对象幻觉。在 EMNLP 上。 [31] Bin Lin, Bin Zhu, Yang Ye, Munan Ning, Peng Jin, 和 Li Yuan。2024。Video-LLaVA:在投影前对齐学习统一的视觉表示。在 EMNLP 上。 [32] Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee。2023。视觉指令微调。在 NeurIPS 上。 [33] Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, Kai Chen, 和 Dahua Lin。2024。MMBench:你的多模态模型是全才吗?。在 ECCV 上。 [34] Yuanxin Liu, Shicheng Li, Yi Liu, Yuxiang Wang, Shuhuai Ren, Lei Li, Sishuo Chen, Xu Sun, 和 Lu Hou。2024。TempCompass:视频大语言模型真的理解视频吗?。在 ACL Findings 上。 [35] George Lydakis, Alexander Hermans, Ali Athar, Daan de Geus, 和 Bastian Leibe。2025。视频对训练视频大语言模型有多重要? arXiv 预印本 arXiv:2506.06928 (2025)。 [36] Muhammad Maaz, Hanoona Rasheed, Salman Khan, 和 Fahad Shahbaz Khan。2024。Video-ChatGPT:通过大型视觉和语言模型实现详细的视频理解。在 ACL 上。 [37] Karttikeya Mangalam, Raiymbek Akshulakov, 和 Jitendra Malik。2023。EgoSchema:用于超长视频语言理解的诊断基准。在 NeurIPS 上。 [38] Quinn McNemar。1947。关于相关比例或百分比差异的抽样误差的备注。Psychometrika 12, 2 (1947), 153–157。 [39] Juhong Min, Shyamal Buch, Arsha Nagrani, Minsu Cho, 和 Cordelia Schmid。2024。MoReVQA:探索用于视频问答的模块化推理模型。在 CVPR 上。 [40] Yulei Niu, Kaihua Tang, Hanwang Zhang, Zhiwu Lu, Xian-Sheng Hua, 和 Ji-Rong Wen。2021。反事实 VQA:语言偏差的因果视角。在 CVPR 上。 [41] OpenAI。2023。GPT-4 技术报告。 arXiv 预印本 arXiv:2303.08774 (2023)。 [42] Viorica Pătrăucean, Lucas Smaira, Ankush Gupta, Adrià Recasens, Larisa Markeeva, Dylan Banarse, Skanda Koppula, Joseph Heyward, Mateusz Malinowski, Yi Yang, 等人。2023。Perception Test:多模态视频模型的诊断基准。在 NeurIPS 上。 [43] Pouya Pezeshkpour 和 Estevam Hruschka。2024。大型语言模型对多项选择题选项顺序的敏感性。在 NAACL Findings 上。 [44] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, 和 Ilya Sutskever。2021。从自然语言监督中学习可迁移的视觉模型。在 ICML 上。 [45] Inioluwa Deborah Raji, Emily M. Bender, Amandalynne Paullada, Emily Denton, 和 Alex Hanna。2021。人工智能与整个世界基准。在 NeurIPS 数据集与基准上。 [46] Machel Reid, Nikolay Savinov, Denis Teber, 等人。2024。Gemini 1.5:解锁数百万令牌上下文的多模态理解。 arXiv 预印本 arXiv:2403.05530 (2024)。 [47] Marco Tulio Ribeiro, Tongshuang Wu, Carlos Guestrin, 和 Sameer Singh。2020。超越准确性:使用 CheckList 对 NLP 模型进行行为测试。在 ACL 上。 [48] David Schlangen。2021。针对基准:当前自然语言处理研究的方法论。在 ACL-IJCNLP 上。 [49] Yunlong Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, 等人。2023。使用大型语言模型进行视频理解:综述。 arXiv 预印本 arXiv:2312.17432 (2023)。 [50] Rohan Taori, Achal Dave, Vaishaal Shankar, Nicholas Carlini, Benjamin Recht, 和 Ludwig Schmidt。2020。测量图像分类中对自然分布偏移的鲁棒性。在 NeurIPS 上。 [51] Shengbang Tong, Zhuang Liu, Yuexiang Zhai, Yi Ma, Yann LeCun, 和 Saining Xie。2024。熟睡之眼?探索多模态大语言模型的视觉缺陷。在 CVPR 上。 [52] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, 等人。2024。Qwen2-VL:增强视觉语言模型在任何分辨率下对世界的感知。 arXiv 预印本 arXiv:2409.12191 (2024)。 [53] Haoning Wu, Dongxu Li, Bei Chen, 和 Junnan Li。2024。LongVideoBench:用于长上下文交错视频语言理解的基准。在 NeurIPS 上。 [54] Junbin Xiao, Xindi Shang, Angela Yao, 和 Tat-Seng Chua。2021。NExT-QA:解释时间动作的问答下一阶段。在 CVPR 上。 [55] Binzhu Xie, Sicheng Zhang, Zitang Zhou, Bo Li, Yuanhan Zhang, Jack Hes
[28] Kunchang Li, Yinan He, Yi Wang, Yizhuo Li, Wenhai Wang, Ping Luo, Yali Wang, Limin Wang, and Yu Qiao. 2023. VideoChat: Chat-Centric Video Understanding. sel, Jingkang Yang, and Ziwei Liu. 2024. FunQA: Towards Surprising Video Comprehension. In ECCV.
9
第 10 页
Jae Joong Lee
[56] Dejing Xu, Zhou Zhao, Jun Xiao, Fei Wu, Hanwang Zhang, Xiangnan He, and Yueting Zhuang. 2017. 通过外观和运动上逐渐细化的注意力进行视频问答。在 ACM Multimedia 中。 [57] Lin Xu, Yilin Zhao, Daquan Zhou, Zhijie Lin, See Kiong Ng, 和 Jiashi Feng. 2024. PLLaVA: 从图像到视频的无参数 LLaVA 扩展,用于视频密集描述。arXiv 预印本 arXiv:2404.16994 (2024)。 [58] An Yang, Anfeng Zhang, Baosong Liu, Beichen Zhang, Binyuan Hui, Bowen Yu, 等. 2025. Qwen3-VL 技术报告。arXiv 预印本 arXiv:2511.21631 (2025)。 [59] Zhou Yu, Dejing Xu, Jun Yu, Ting Yu, Zhou Zhao, Yueting Zhuang, 和 Dacheng Tao. 2019. ActivityNet-QA: 一个通过问答理解复杂网络视频的数据集。在 AAAI 中。 [60] Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, 等. 2024. MMMU: 面向专家级 AGI 的大规模多学科多模态理解与推理基准。在 CVPR 中。 [61] Mert Yüksekgönül, Federico Bianchi, Pratyusha Kalluri, Dan Jurafsky, 和 James Zou. 2023. 视觉-语言模型何时以及为何表现得像词袋模型,以及该如何应对?在 ICLR 中。 [62] Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, 和 Lucas Beyer. 2023. 用于语言图像预训练的 Sigmoid 损失。在 ICCV 中。 [63] Yuanhan Zhang, Jinming Wu, Wei Li, Bo Li, Zejun Ma, Ziwei Liu, 和 Chunyuan Li. 2024. LLaVA-Video: 使用合成数据进行视频指令微调。arXiv 预印本 arXiv:2410.02713 (2024)。 [64] Chujie Zheng, Hao Zhou, Fandong Meng, Jie Zhou, 和 Minlie Huang. 2024. 大语言模型并非鲁棒的多项选择题选择器。在 ICLR 中。
10
第 11 页
无接地诊断:视频大语言模型基准测试中视觉依赖解离的诊断
本补充材料提供了扩展表格、详细的统计分析和方法论细节,以支持主论文的发现,但因篇幅限制未能包含。所有数据均源自主文中描述的相同推理运行。 补充材料的组织结构如下: • 第1–2节提供了完整的MVBench按任务类型的VDG结果和CRF 38退化分析,扩展了主论文中关于跨基准一致性的主张。 • 第3节报告了EgoSchema的完整McNemar列联表,记录了为何在该基准测试中未观察到解离现象。 • 第4–5节展示了四类分解和位置偏差分析,这些分析构成了主论文中关于基准测试信息内容和字母对齐效应讨论的基础。 • 第6–7节提供了EgoSchema的破坏性比率以及跨模型的MVBench VDG排名,支持了泛化性主张。 • 第8–10节包含了主FPS消融实验(0.5–2.0 FPS)和扩展消融实验(4–24 FPS)的原始准确率数据,使得能够独立验证FPS不变性发现。 • 第11–14节提供了额外分析:Video-MME的McNemar列联表、CRF双向翻转量化、对比性任务类型案例研究以及跨模型问题级一致性统计。 • 第15节详细说明了推理配置(提示模板、帧采样、API设置、量化),以确保可复现性。 • 第16节提供了四个带注释的Python代码列表,涵盖核心算法:VDG计算、诊断阶梯分解、黑屏视频生成和帧采样。
S1 MVBench:完整的按任务类型结果 (表S1) (1) action_prediction是唯一一个在所有三个模型上黑屏准确率接近随机水平的任务类型(0.20–0.38),证实了它是视觉必要性问题设计的经验锚点。(2) object_existence显示出最大的模型依赖VDG范围:InternVL2达到0.543(原始准确率为100%),而LLaVA仅为0.152,尽管它们的黑屏基线相似(0.457 vs. 0.478)。差距在于视觉提取能力,而非语言先验强度。(3) unexpected_action在Qwen上具有负VDG(−0.060),在LLaVA上为零(0.000):视频略微有害或无益。(4) 大多数任务类型的CRF 38退化较小(<0.06),其中Qwen的object_existence下降最大(−0.109)。
S2 MVBench:CRF 38退化(表S2) 表S2证实了在Video-MME上观察到的压缩鲁棒性幻觉也延伸至MVBench。总体准确率下降幅度较小:Qwen为+0.048,LLaVA为+0.016,InternVL2为+0.027。然而,在任务类型层面出现了三种模式。首先,变化的方向在模型间不一致:Qwen显示−0.060(压缩有帮助),而LLaVA显示+0.030(压缩有害),表明模型对压缩具有特定的敏感性。其次,obj_existence在Qwen上显示出最大的退化(+0.109),这与该任务的高VDG(表S1)一致:视觉 grounded 问题受到压缩的不成比例影响,反映了Video-MME上CRF富集发现的镜像效应。第三,几种任务类型在至少一个模型上显示出恰好为零的变化(例如,Qwen的ego_navigation,LLaVA的ep_reasoning),这强化了低VDG任务对视觉质量退化不敏感的观点。
S3 EgoSchema:完整McNemar表(表S3) InternVL2与Qwen在两种条件下均无可靠差异:这两个模型在EgoSchema上的表现相似。InternVL2与LLaVA以及Qwen与LLaVA在两种条件下均存在可靠差异,意味着LLaVA较低的准确率延伸至视频存在和黑屏设置。这是一致的性能差距,而非解离(解离需要相反的显著性模式)。
S4 按任务类型的四类分解 (表S4) 每个问题根据原始视频(𝑦orig)和黑屏(𝑦black)下的正确性分为四类。表S4按任务类型在Video-MME上对此进行了细分。 (1) 类别I(纯视觉)从Attribute Perception到Temporal Reasoning在所有三个模型中单调递减,这与主论文中的VDG谱系一致。(2) 类别III(视频有害)在Temporal Reasoning中最高,所有模型均在7–13%之间,证实时间问题是视觉误导最脆弱的。(3) LLaVA具有最高的总体类别I比例(35.3%)和最低的类别III(4.8%),这与其最高的VDG一致。Qwen具有最高的类别III(9.0%),由OCR、Action Reasoning和Temporal Reasoning驱动。(4) “纯视觉核心”(三个模型同时存在的类别I)占问题的10.3%,如主论文所述。
S5 位置偏差分析(表S5) 在按任务类型层面,字母对齐解释了所有模型和任务类型中超过随机水平的黑屏准确率的15–75%。在总体层面,Qwen(29%)和LLaVA(31%)的模态预测(B)与最频繁的正确答案字母(B)匹配,因此它们的对齐分数为正。InternVL2的模态预测(A,由一般的A偏好驱动)与GT模式(B)不匹配,导致总体对齐分数为负:InternVL2的字母偏差在聚合层面上不利于准确率,但它仍然通过按任务类型的对齐(其中局部GT模式各不相同)实现了32%的黑屏准确率。共享的错误共识(19.8%,600个问题中的119个)表明了一种数据集层面的规律性,所有三个模型无论其个体字母偏好如何,都利用了这一规律性。 在黑屏条件下,所有三个模型显示出不同的字母偏好:Qwen偏好B(31%),LLaVA分布相对均匀(A: 26%, B: 29%, C: 19%, D: 26%),InternVL2偏好A(31%)。真实分布为A: 24%, B: 29%, C: 26%, D: 21%。InternVL2的A偏好与GT的B模式不匹配,解释了其总体黑屏准确率较低(32.0% vs. Qwen的39.3%),尽管其按任务类型的对齐相当。
11
第 12 页
Jae Joong Lee
表 S1:三种主要模型在不同任务类型上的 MVBench 视觉依赖差距(VDG)。Orig = 原始视频,CRF38 = H.264 CRF 38 压缩,Black = 黑屏,CI = 百分位 Bootstrap 95% 置信区间(2000 次重采样)。按平均 VDG 排序。所有任务类型的样本量 $n \ge 30$,大多数为 $n=50$。
| | Qwen2-VL-7B | | | | | LLaVA-Video-7B | | | | | InternVL2-8B | | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 任务类型 | Orig | CRF | Blk | VDG | CI | Orig | CRF | Blk | VDG | CI | Orig | CRF | Blk | VDG | CI | | act_pred | 0.640 | 0.600 | 0.240 | 0.400 | [0.22,0.58] | 0.640 | 0.600 | 0.200 | 0.440 | [0.28,0.60] | 0.680 | 0.660 | 0.380 | 0.300 | [0.12,0.48] | | obj_exist | 0.848 | 0.739 | 0.457 | 0.391 | [0.24,0.54] | 0.630 | 0.587 | 0.478 | 0.152 | [−0.04,0.35] | 1.00 | 0.978 | 0.457 | 0.543 | [0.41,0.67] | | scene_tr | 0.960 | 0.940 | 0.620 | 0.340 | [0.22,0.48] | 0.940 | 0.960 | 0.860 | 0.080 | [0.00,0.18] | 0.980 | 0.960 | 0.660 | 0.320 | [0.20,0.44] | | act_ant | 0.840 | 0.900 | 0.600 | 0.240 | [0.10,0.38] | 0.780 | 0.750 | 0.460 | 0.320 | [0.20,0.46] | 0.880 | 0.950 | 0.340 | 0.540 | [0.38,0.68] | | cf_inf | 0.620 | 0.520 | 0.360 | 0.260 | [0.08,0.44] | 0.560 | 0.540 | 0.380 | 0.180 | [0.02,0.34] | 0.860 | 0.820 | 0.460 | 0.400 | [0.22,0.56] | | state_ch | 0.500 | 0.440 | 0.340 | 0.160 | [0.04,0.30] | 0.560 | 0.560 | 0.280 | 0.280 | [0.08,0.46] | 0.580 | 0.540 | 0.540 | 0.040 | [−0.12,0.20] | | ego_nav | 0.380 | 0.380 | 0.320 | 0.060 | [−0.02,0.16] | 0.380 | 0.340 | 0.300 | 0.080 | [−0.02,0.18] | 0.380 | 0.440 | 0.360 | 0.020 | [−0.10,0.14] | | ep_reas | 0.548 | 0.613 | 0.500 | 0.048 | [−0.16,0.19] | 0.660 | 0.660 | 0.540 | 0.120 | [−0.02,0.26] | 0.580 | 0.600 | 0.580 | 0.000 | [−0.10,0.10] | | unexp_act | 0.700 | 0.680 | 0.760 | −0.060 | [−0.20,0.08] | 0.860 | 0.880 | 0.860 | 0.000 | [−0.12,0.12] | 0.760 | 0.700 | 0.620 | 0.140 | [−0.00,0.30] | | Overall | 0.670 | 0.622 | 0.460 | 0.208 | [0.16,0.26] | 0.662 | 0.646 | 0.476 | 0.186 | [0.14,0.24] | 0.742 | 0.715 | 0.476 | 0.266 | [0.21,0.32] |
表 S2:MVBench 上 CRF 38 的准确率变化(原始视频 − CRF 38)。正值表示压缩损害性能。大多数值在 ±0.06 以内,证实鲁棒性幻觉也延伸至 MVBench。
S7 MVBench 跨模型 VDG(表 S7)
表 S7 揭示了关于 MVBench 上 VDG 谱系的三个重要发现。首先,任务类型的排名在模型间大体一致:平均 VDG 最高的前三个任务类型(act_prediction: 0.380, act_antonym: 0.367, obj_existence: 0.362)和最低的后三个任务类型(ep_reasoning: 0.056, ego_navigation: 0.053, unexp_action: 0.027)是稳定的,这支持了主论文关于 VDG 是任务类型属性而非模型属性的主张。其次,对于特定任务,VDG 的幅度在不同模型间差异显著:obj_existence 的范围从 0.152(LLaVA)到 0.543(InternVL2),相差 3.6 倍,这由 InternVL2 的 100% 原始准确率与 LLaVA 的 63% 所驱动。这表明虽然任务类型的排序与模型无关,但视觉接地(visual grounding)的程度是依赖于模型的。第三,unexp_action 是唯一一个平均 VDG 接近零(0.027)且有一个模型显示负 VDG(Qwen: −0.060)的任务类型,这表明视频在该任务类型上会主动误导模型——模型在不看视频的情况下表现更好。
| 任务类型 | Qwen | LLaVA | IV2 | | :— | :—: | :—: | :—: | | act_prediction | +0.040 | +0.040 | +0.020 | | obj_existence | +0.109 | +0.043 | +0.022 | | scene_transition | +0.020 | −0.020 | +0.020 | | act_antonym | −0.060 | +0.030 | −0.070 | | cf_inference | +0.100 | +0.020 | +0.040 | | state_change | +0.060 | ±0.000 | +0.040 | | ego_navigation | ±0.000 | +0.040 | −0.060 | | ep_reasoning | −0.065 | ±0.000 | −0.020 | | unexp_action | +0.020 | −0.020 | +0.060 | | Overall | +0.048 | +0.016 | +0.027 |
表 S3:EgoSchema 上的 McNemar 2×2 列联表($n=500$,5 选项)。未观察到解离现象:所有配对在所有条件下的显著性模式一致。
| 配对 | 条件 | $b_{00}$ | $b_{01}$ | $b_{10}$ | $b_{11}$ | $\chi^2$ | $p$ | | :— | :— | :—: | :—: | :—: | :—: | :—: | :—: | | IV2 vs. Qwen | Orig | 131 | 69 | 85 | 215 | 1.46 | 0.227 | | | Black | 280 | 61 | 68 | 91 | 0.28 | 0.597 | | IV2 vs. LLaVA | Orig | 148 | 52 | 95 | 205 | 12.0 | 0.0005 | | | Black | 302 | 39 | 95 | 64 | 22.6 | <0.001 | | Qwen vs. LLaVA | Orig | 169 | 47 | 74 | 210 | 5.59 | 0.018 | | | Black | 318 | 30 | 79 | 73 | 21.1 | <0.001 |
S6 EgoSchema:破坏性比率(表 S6)
表 S6 揭示了两个关键模式。首先,在所有模型中,破坏性(destructive)与建设性(constructive)比率始终很高(8.3:1 到 12.8:1),这意味着对于每一个移除视频能纠正错误答案的问题,都有 8–13 个问题被破坏。这种不对称性远高于 Video-MME(三个主要模型为 4.25:1 到 7.3:1),表明 EgoSchema 的更长、第一人称视角的视频提供了更不可替代的视觉信息。其次,净损失与 VDG 幅度相关:LLaVA 具有最高的净损失(154)、最高的 VDG(0.308)和最低的黑屏基准(20.6%),而 Qwen 具有最低的净损失(132),这与其在该基准上相对更强的语言先验一致。在架构迥异的模型中均匀的高 D:C 比率证实,视频对 EgoSchema 的依赖性是一个问题属性,而非任何特定模型的属性。
S8 FPS 消融实验:原始准确率(表 S8)
表 S8 报告了主论文 FPS 消融实验背后的原始视频和黑屏准确率。这证实了 VDG 的平坦性反映了两个分支的真实稳定性,而非协同运动。对于某些模型,黑屏准确率在不同 FPS 水平下略有变化(例如,Qwen2-VL-2B:所有水平均为 0.290),反映了微小的推理随机性。Orig 列显示,对于任何模型,原始准确率并未随 FPS 单调增加,这证实了在被测试的范围内,额外的帧并不能解锁时间接地(temporal grounding)。
S9 扩展 FPS 消融实验:4–24 FPS(表 S9–S10)
为了解决主消融实验(0.5–2.0 FPS)的 FPS 上限限制,我们将 FPS 范围扩展至 4、8、16 和 24 FPS,涵盖五个模型。表 S9 报告了每个 FPS 水平下的 VDG,表 S10 报告了原始准确率。
12
第 13 页
无接地诊断:视频大语言模型基准测试中视觉依赖解离的诊断
表 S4:按任务类型对 Video-MME 进行四类分解(每种任务类型 $n=100$)。I = 纯视觉(VDG = +1),II = 语言先验冗余(两者均正确),III = 视频有害(VDG = -1),IV = 困难(两者均错误)。类别 I 构成了 VDG 隔离出的“纯视觉核心”。
| | Qwen2-VL-7B | | | | LLaVA-Video-7B | | | | InternVL2-8B | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 任务类型 | I | II | III | IV | I | II | III | IV | I | II | III | IV | | 属性感知 | 0.460 | 0.240 | 0.060 | 0.240 | 0.490 | 0.330 | 0.030 | 0.150 | 0.450 | 0.250 | 0.070 | 0.230 | | 物体识别 | 0.340 | 0.280 | 0.090 | 0.290 | 0.510 | 0.270 | 0.030 | 0.190 | 0.400 | 0.230 | 0.020 | 0.350 | | OCR 概率 | 0.310 | 0.260 | 0.110 | 0.320 | 0.390 | 0.300 | 0.060 | 0.250 | 0.310 | 0.230 | 0.080 | 0.380 | | 动作识别 | 0.250 | 0.430 | 0.040 | 0.280 | 0.330 | 0.450 | 0.010 | 0.210 | 0.280 | 0.290 | 0.030 | 0.400 | | 动作推理 | 0.230 | 0.320 | 0.110 | 0.340 | 0.210 | 0.400 | 0.050 | 0.340 | 0.230 | 0.320 | 0.050 | 0.400 | | 时序推理 | 0.110 | 0.290 | 0.130 | 0.470 | 0.190 | 0.270 | 0.110 | 0.430 | 0.160 | 0.280 | 0.070 | 0.490 | | 总体 | 0.283 | 0.303 | 0.090 | 0.323 | 0.353 | 0.337 | 0.048 | 0.262 | 0.305 | 0.267 | 0.053 | 0.375 |
表 S5:Video-MME 黑屏条件下的逐任务类型字母对齐分析(每种任务类型 $n=100$)。GT 模式 = 最常见的真实标签字母。Align% = 由字母对齐解释的超随机准确率比例(模型正确预测 GT 模式字母)。InternVL2 物体识别处于随机水平(0.250),因此对齐度未定义。
| 任务类型 | 模式 | Qwen | LLaVA | IV2 | Qwen | LLaVA | IV2 | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | | GT 准确率 | | | 对齐 % | | | | 属性感知 | C | 0.300 | 0.360 | 0.320 | 35 | 25 | 54 | | 物体识别 | D | 0.370 | 0.300 | 0.250 | 15 | 55 | — | | OCR 概率 | B | 0.370 | 0.360 | 0.310 | 56 | 71 | 63 | | 动作识别 | C | 0.470 | 0.460 | 0.320 | 31 | 23 | 25 | | 动作推理 | B | 0.430 | 0.450 | 0.370 | 54 | 49 | 40 | | 时序推理 | B | 0.420 | 0.380 | 0.350 | 63 | 75 | 48 | | 总体 | B | 0.393 | 0.385 | 0.320 | 29 | 31 | -21* |
*InternVL2 总体模态预测 (A) ≠ GT 模式 (B),见正文。
表 S7:MVBench 上的跨模型 VDG,按均值排序。 排名因模型而异:object_existence 在 InternVL2 中最高(0.543),但在 LLaVA 中中等(0.152),反映了模型依赖的视觉提取能力。
| 任务类型 | Qwen | LLaVA | IV2 | 均值 | | :— | :—: | :—: | :—: | :—: | | act_prediction | 0.400 | 0.440 | 0.300 | 0.380 | | act_antonym | 0.240 | 0.320 | 0.540 | 0.367 | | obj_existence | 0.391 | 0.152 | 0.543 | 0.362 | | cf_inference | 0.260 | 0.180 | 0.400 | 0.280 | | scene_transition | 0.340 | 0.080 | 0.320 | 0.247 | | state_change | 0.160 | 0.280 | 0.040 | 0.160 | | ep_reasoning | 0.048 | 0.120 | 0.000 | 0.056 | | ego_navigation | 0.060 | 0.080 | 0.020 | 0.053 | | unexp_action | -0.060 | 0.000 | 0.140 | 0.027 | | 总体 | 0.208 | 0.186 | 0.266 | 0.220 |
表 S6:EgoSchema 上的破坏性与建设性计数。 $D = |\{q: VDG(q) = +1\}|$, $C = |\{q: VDG(q) = -1\}|$, $D:C$ 为破坏性与建设性比率。净损失 = $D – C$。
| 模型 | D | C | D:C | 净损失 | | :— | :—: | :—: | :—: | :—: | | InternVL2-8B | 159 | 18 | 8.8:1 | 141 | | Qwen2-VL-7B | 150 | 18 | 8.3:1 | 132 | | LLaVA-Video-7B | 167 | 13 | 12.8:1 | 154 |
表 S8:时序推理上的 FPS 消融原始准确率($n=100$)。Orig/Blk = 原始/黑屏准确率。黑屏准确率在设计上是 FPS 不变的。† 4-bit NF4。
| 模型 | 0.5 FPS | | | 1.0 FPS | | | 2.0 FPS | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | Orig | Blk | VDG | Orig | Blk | VDG | Orig | Blk | VDG | | Q2-VL-2B | 0.330 | 0.290 | 0.040 | 0.340 | 0.290 | 0.050 | 0.340 | 0.290 | 0.050 | | Q2-VL-72B† | 0.510 | 0.390 | 0.120 | 0.520 | 0.400 | 0.120 | 0.510 | 0.410 | 0.100 | | Q2.5-VL-3B | 0.480 | 0.333 | 0.147 | 0.535 | 0.323 | 0.212 | 0.465 | 0.333 | 0.132 | | Q2.5-VL-7B | 0.606 | 0.380 | 0.226 | 0.602 | 0.370 | 0.232 | 0.636 | 0.350 | 0.286 | | Q2.5-VL-32B† | 0.660 | 0.450 | 0.210 | 0.640 | 0.450 | 0.190 | 0.640 | 0.420 | 0.220 | | Q2.5-VL-72B† | 0.670 | 0.400 | 0.270 | 0.660 | 0.410 | 0.250 | 0.630 | 0.420 | 0.210 | | Q3-VL-8B | 0.460 | 0.440 | 0.020 | 0.530 | 0.420 | 0.110 | 0.520 | 0.420 | 0.100 |
表 S9:扩展的 FPS 消融 VDG($n=100$)。VDG 在所有模型中由 8 FPS 起趋于稳定。† Qwen2-VL-2B 在所有 FPS 水平下显示负 VDG(视频有害)。
| 模型 | 4 FPS | 8 FPS | 16 FPS | 24 FPS | | :— | :—: | :—: | :—: | :—: | | InternVL2-2B | —* | ±0.000 | ±0.000 | ±0.000 | | Qwen2-VL-2B† | -0.059 | -0.030 | -0.020 | -0.020 | | Qwen2-VL-7B | +0.132 | +0.105 | +0.110 | +0.110 | | Qwen2.5-VL-7B | +0.250 | +0.250 | +0.240 | +0.236 | | Qwen3-VL-2B | +0.010 | +0.120 | +0.110 | +0.110 |
*103/103 解码错误,已排除。
(1) 对于所有模型,VDG 从 8 到 24 FPS 保持平坦,证实了在接近原生帧率下的 FPS 不变性。(2) Qwen2-VL-2B 在所有 FPS 水平下显示负 VDG(-0.020 至 -0.059):视频输入略微损害性能,这与其在主分析中的接近零 VDG 一致。(3) Qwen2.5-VL-7B 从 4 到 24 FPS 保持 VDG ≈ 0.24–0.25,这与在 0.5–2.0 FPS 下观察到的 0.23–0.29 范围一致,也与主消融实验一致。(4) InternVL2-2B 在 4 FPS 时在原始视频上遭受完全解码失败(103/103 错误),表明该架构存在实际的帧数限制。在 8+ FPS 时,它产生 VDG = 0,这与其接近零的时序推理 VDG(-0.030)一致。
13
第 14 页
Jae Joong Lee
表 S10:扩展的 FPS 消融实验原始准确率(𝑛= 100)。错误 = 解码失败,不计入准确率。准确率仅基于成功解码的样本计算。
| | Original | | | Black Screen | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | Model | FPS | OK | Err | Acc | OK | Err | Acc | | IV2-2B | 4 | 103 | — | 0.333 | 42 | 58 | 0.333 | | | 8 | 100 | 0 | 0.330 | 97 | 3 | 0.330 | | | 16 | 84 | 16 | 0.333 | 84 | 16 | 0.333 | | | 24 | 97 | 3 | 0.320 | 97 | 3 | 0.320 | | Q2-VL-2B | 4 | 95 | 5 | 0.263 | 93 | 7 | 0.323 | | | 8 | 100 | 0 | 0.270 | 100 | 0 | 0.300 | | | 16 | 100 | 0 | 0.280 | 100 | 0 | 0.300 | | | 24 | 100 | 0 | 0.280 | 100 | 0 | 0.300 | | Q2-VL-7B | 4 | 97 | 3 | 0.505 | 99 | 1 | 0.374 | | | 8 | 99 | 1 | 0.485 | 100 | 0 | 0.380 | | | 16 | 100 | 0 | 0.490 | 100 | 0 | 0.380 | | | 24 | 100 | 0 | 0.490 | 100 | 0 | 0.380 | | Q2.5-VL-7B | 4 | 100 | 4 | 0.620 | 100 | 1 | 0.370 | | | 8 | 100 | 0 | 0.630 | 100 | 0 | 0.380 | | | 16 | 100 | 0 | 0.610 | 100 | 0 | 0.370 | | | 24 | 99 | 1 | 0.616 | 100 | 0 | 0.380 | | Q3-VL-2B | 4 | 100 | 0 | 0.340 | 100 | 1 | 0.330 | | | 8 | 100 | 0 | 0.420 | 100 | 0 | 0.300 | | | 16 | 100 | 0 | 0.360 | 100 | 0 | 0.250 | | | 24 | 100 | 0 | 0.400 | 100 | 0 | 0.290 |
表 S12:CRF 38 时相对于原始的双向问题翻转。C→I = 正确变错误(压缩导致崩溃),I→C = 错误变正确(压缩有帮助)。Net = I→C − C→I。接近零的净变化掩盖了实质性的双向移动。
| Model | C→I | I→C | Net | Stable% | | :— | :—: | :—: | :—: | :—: | | Qwen2-VL-7B | 32 | 27 | −5 | 90.2% | | LLaVA-Video-7B | 28 | 25 | −3 | 91.2% | | InternVL2-8B | 25 | 28 | +3 | 91.2% |
表 S13:对比对分析:MVBench 上的 scene_transition 与 state_change(𝑛= 50 each)。两项任务都需要检测视觉变化,但在语言先验的可利用性上存在差异。
| Task Type | Orig | Black | VDG | GT entropy | Chance | | :— | :—: | :—: | :—: | :—: | :—: | | scene_transition | 0.960 | 0.713 | 0.247 | 0.94 | 0.50 | | state_change | 0.547 | 0.387 | 0.160 | 1.00 | 0.50 |
90–91% 的稳定比例意味着约 10% 的问题对压缩敏感,且这些问题集中在视觉 grounded 的项目上(VDG = +1),其发生率为基础率的 3.76 倍(Fisher 精确 𝑝= 0.006,见正文)。
S11 Video-MME McNemar 列联表 (表 S11)
正文报告了 Video-MME 的 McNemar 结果摘要。表 S11 提供了这些测试在匹配样本(𝑛= 547)下完整的 2 × 2 列联表。
| Pair | Cond. | 𝑏00 | 𝑏01 | 𝑏10 | 𝑏11 | 𝜒2 | 𝑝 | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | IV2 vs. Qwen | Orig | 120 | 34 | 52 | 341 | 3.58 | 0.0906 | | | Black | 263 | 58 | 22 | 204 | 15.2 | 0.0008 |
在原始视频上,InternVL2-8B 和 Qwen2-VL-7B 显示出边际准确率差异(𝑝= 0.0906),未达到 𝛼= 0.05 的显著性水平。在黑屏条件下,该对模型差异显著(𝑝= 0.0008):Qwen 比 InternVL2 更有效地利用了语言先验。这是一种具有相反显著性模式的分离现象,尽管原始臂的边际性限制了这一主张的力度(如正文所述,Bootstrap 分析显示联合条件在 50% 的重采样中成立)。
S12 对比任务类型案例研究 (表 S13)
正文将对比任务类型对识别为 VDG 谱系的内部控制变量。MVBench 上的 scene_transition 与 state_change 对具有相似的统计结构(两者都涉及检测时间片段之间的视觉变化),但在语义泄漏方面存在差异。
两项任务均为二分类(2 个选项,机会水平 = 50%)并涉及检测时间变化。然而,scene_transition 的黑屏准确率达到 71.3%——远高于机会水平——因为过渡问题通常具有语义上可预测的答案(“yes”更常见)。相比之下,state_change 具有更平衡的 GT 分布(熵 1.00 vs. 0.94),导致较低的黑屏底线(38.7%)。因此,VDG 的差异(0.247 vs. 0.160)部分反映了 GT 分布伪影,而非视觉需求的真实差异。这对模型说明了为什么基于 VDG 的基准审计在比较任务类型时应控制 GT 分布偏斜。
S13 跨模型问题级一致性 (表 S14)
正文报告了问题级跨模型 VDG 相关系数为 𝑟= 0.274–0.304。表 S14 提供了完整的相关矩阵和一致性统计信息。
模型在哪些任务类型需要视觉方面达成一致(任务类型等级 𝑟= 0.789),但在任务类型内哪些具体问题具有视觉 grounded 性方面存在显著分歧(𝑟= 0.274–0.304)。只有 52.3% 的问题从所有三个模型中获得相同的 VDG 值。“纯视觉核心”(所有三个模型的 VDG = +1)占问题的 10.3%,“纯语言核心”(所有三个模型的 VDG = 0)占 38.7%。
14
第 15 页
无接地诊断:视频大语言模型基准测试中的视觉依赖解离诊断
表 S14:跨模型问题级别的 VDG 一致性 Video-MME ($n = 600$)。基于每个问题的 VDG 值 $\in\{-1, 0, +1\}$ 计算 Spearman $\rho$。完全一致性 = 两个模型具有相同 VDG 的问题比例。所有相关性在 $p \ll 0.001$ 水平上可靠。
| 配对 | Spearman $\rho$ | 完全一致性 | 三重一致性 | | :— | :— | :— | :— | | Qwen–LLaVA | 0.304 | 64.8% | — | | Qwen–IV2 | 0.274 | 63.5% | — | | LLaVA–IV2 | 0.298 | 65.0% | — | | 全部三者 | — | — | 52.3% |
S14 推理配置详情
所有模型接收相同的提示结构:视频(或黑屏)作为视觉输入提供,随后是问题文本和带字母的答案选项(A/B/C/D 或 EgoSchema 的 A/B/C/D/E)。系统提示指示模型仅回答正确答案的字母。温度设置为 0(贪婪解码),以确保所有模型的输出是确定性的。
除 FPS 消融实验外,所有条件的基础采样率为 0.25 FPS。对于 60 秒的视频,在 0.25 FPS 下,这将产生 15 帧。帧是从视频中均匀采样的。对于黑屏条件,所有采样的帧都被替换为与原始视频相同分辨率的纯黑图像(RGB 0,0,0)。单帧条件将随机选择的一帧重复用于所有帧位置。乱序帧条件随机排列原始采样的帧顺序。
四个通过 API 访问的模型(GPT-4o-mini、Gemini 2.5 Flash Lite、Llama 3.2 11B Vision、Nemotron Nano 12B VL)通过各自的 API 端点使用默认参数(温度 = 0,最大 token 数 = 16)进行评估。视频帧以 base64 编码图像的形式在 API 请求中提供。所有 API 模型在原始条件和黑屏条件下均使用相同的 600 个问题 Video-MME 子集。
参数量超过 26B 的模型使用 bitsandbytes 库以 4-bit NF4 量化加载,并启用双重量化(bnb_4bit_use_double_quant=True)。这将 72B 模型的内存需求从 ~140 GB(bf16)降低到 ~40 GB,从而能够在单个 A100(80 GB)上进行评估。我们强调,量化可能会选择性地降低视觉通路(如 InternVL2-76B 的负 VDG 所示),并且所有扩展声明仅限于 bf16 模型。
S15 核心算法列表
以下四个列表直接对应主论文第 3 节中描述的方法。它们均提取自公共评估代码库。
列表 1:VDG 计算。VDG 是原始视频与黑屏正确率之间的每个问题的差异,聚合到任务类型或模型均值。
def compute_vdg(orig_results, black_results):
"""
orig_results, black_results: 包含键 'question_id' 和 'correct' (bool) 的字典列表。
返回平均 VDG = mean(Acc_orig) - mean(Acc_black)。
"""
orig = {r["question_id"]: r["correct"] for r in orig_results}
black = {r["question_id"]: r["correct"] for r in black_results}
shared = [q for q in orig if q in black]
acc_orig = sum(orig[q] for q in shared) / len(shared)
acc_black = sum(black[q] for q in shared) / len(shared)
return acc_orig - acc_black # VDG 在 [-1, +1] 之间
列表 2:诊断阶梯分解。给定四种条件下的准确率,三个加性分量之和等于 VDG。
def ladder_decomposition(acc_black, acc_single, acc_shuffled,
acc_orig):
"""
分解 VDG = delta_spatial + delta_diversity +
delta_temporal。
每个条件使用相同采样的帧;仅其排列不同。
"""
delta_spatial = acc_single - acc_black # 一帧 vs.
# 无
delta_diversity = acc_shuffled - acc_single # N 帧 vs. 一帧
delta_temporal = acc_orig - acc_shuffled # 有序 vs.
# 乱序
vdg = acc_orig - acc_black # = 三个
# 增量之和
return delta_spatial, delta_diversity, delta_temporal, vdg
列表 3:黑屏视频生成。每个原始视频都与一个具有相同分辨率和持续时间的纯黑视频配对。
import subprocess, re
def get_duration(video_path):
out = subprocess.run(
["ffprobe", "-v", "error", "-show_entries",
"format=duration", "-of", "default=nw=1:nk=1", video_path],
capture_output=True, text=True)
return float(out.stdout.strip())
def make_black_video(video_path, out_path):
duration = get_duration(video_path)
subprocess.run([
"ffmpeg", "-y", "-f", "lavfi",
"-i", f"color=c=black:s=320x240:d={duration:.2f}",
"-c:v", "libx264", out_path
], check=True)
列表 4:均匀帧采样。帧以 0.25 FPS 均匀采样,最多 32 帧,与推理管道相匹配。
import numpy as np
FPS_SAMPLE = 0.25
MAX_FRAMES = 32
def sample_frame_indices(total_frames, video_fps):
duration = total_frames / video_fps
n = max(1, min(MAX_FRAMES, int(duration * FPS_SAMPLE)))
return np.linspace(0, total_frames - 1, n, dtype=int)
S16 可复现性
所有推理脚本、黑屏视频生成代码、压缩管道、诊断阶梯预处理以及 Video-MME、MVBench 和 EgoSchema 的每个问题 VDG 注释均公开可用。该仓库包括:
15
第 16 页
Jae Joong Lee
• 所有 16 个开源模型在所有条件(原始、黑屏、单帧、打乱帧、CRF 18–38)下的模型推理脚本,以及 API 模型的提示词和响应解析脚本,均单独提供 • 7 个模型 × 3 个 FPS 水平(0.5–2.0)和 5 个模型 × 4 个 FPS 水平(4–24)的 FPS 消融实验脚本 • 复现主论文及本补充材料中所有表格、图表和统计检验的分析脚本 • 以 JSON 格式提供的逐问题 VDG 标注,用于下游分析,无需重新运行推理
所有实验均在 NVIDIA H100 GPU 上进行。主要实验(3 个模型 × Video-MME + MVBench + EgoSchema,所有条件)大约需要 72 GPU 小时。16 个模型规模的分析和 FPS 消融实验大约需要额外的 200 GPU 小时。大于 26B 参数的 4-bit 模型通过 bitsandbytes 使用 NF4 quantization 进行量化。 PyTorch 2.2+、Transformers 4.40+、ffmpeg 6.0(使用 libx264 进行 CRF 压缩)。环境和依赖项规范在公共仓库中提供。
16