视频大语言模型真的在“观看”吗?诊断长视频中的角色追踪失败
本文通过九条件诊断协议,对InternVL2-8B、Qwen2.5-VL-7B等模型在InfiniBench基准上的表现进行深度剖析。研究发现,尽管模型在BBT验证集上达到37-38%的准确率,但主要依赖性别线索和位置偏差(如偏好选项E),而非真正的角色身份追踪。名称替换测试显示,模型对跨性别替换敏感,但对同性别替换不敏感。此外,帧采样策略导致的“注释结构混淆”也是性能波动的主因。本文提醒研究者警惕高基准准确率背后的虚假理解。
本文通过九条件诊断协议,对InternVL2-8B、Qwen2.5-VL-7B等模型在InfiniBench基准上的表现进行深度剖析。研究发现,尽管模型在BBT验证集上达到37-38%的准确率,但主要依赖性别线索和位置偏差(如偏好选项E),而非真正的角色身份追踪。名称替换测试显示,模型对跨性别替换敏感,但对同性别替换不敏感。此外,帧采样策略导致的“注释结构混淆”也是性能波动的主因。本文提醒研究者警惕高基准准确率背后的虚假理解。