高分不等于看懂视频:审计 Video LLM 基准的视觉依赖
本文提出视觉依赖差距(VDG)指标,证明视频大语言模型的基准准确率与视觉 grounding 能力是可解离的。通过黑屏对照和 McNemar 检验,揭示多数基准测试中的“推理”任务实际上由语言先验驱动。实验覆盖 20 个模型,发现帧多样性是视觉贡献的主要来源,而时间顺序贡献接近于零。
本文提出视觉依赖差距(VDG)指标,证明视频大语言模型的基准准确率与视觉 grounding 能力是可解离的。通过黑屏对照和 McNemar 检验,揭示多数基准测试中的“推理”任务实际上由语言先验驱动。实验覆盖 20 个模型,发现帧多样性是视觉贡献的主要来源,而时间顺序贡献接近于零。
本文通过九条件诊断协议,对InternVL2-8B、Qwen2.5-VL-7B等模型在InfiniBench基准上的表现进行深度剖析。研究发现,尽管模型在BBT验证集上达到37-38%的准确率,但主要依赖性别线索和位置偏差(如偏好选项E),而非真正的角色身份追踪。名称替换测试显示,模型对跨性别替换敏感,但对同性别替换不敏感。此外,帧采样策略导致的“注释结构混淆”也是性能波动的主因。本文提醒研究者警惕高基准准确率背后的虚假理解。