高分不等于看懂视频:审计 Video LLM 基准的视觉依赖

论文代表图:figure-02-p004-02

本文提出视觉依赖差距(VDG)指标,证明视频大语言模型的基准准确率与视觉 grounding 能力是可解离的。通过黑屏对照和 McNemar 检验,揭示多数基准测试中的“推理”任务实际上由语言先验驱动。实验覆盖 20 个模型,发现帧多样性是视觉贡献的主要来源,而时间顺序贡献接近于零。