视频大语言模型真的在“观看”吗?诊断长视频中的角色追踪失败

三分钟导读:该研究通过九条件诊断协议证明,尽管开源7-8B视频大语言模型在InfiniBench基准上取得了37-38%的准确率,但其主要依赖性别线索和位置偏差,而非真正的角色身份追踪。

英文题目:Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

论文出处:arXiv 每日论文精选 · arXiv:2607.11078

原始论文:PDF / 论文页面

对应视频标题:视频大语言模型真的在“观看”吗?诊断长视频中的角色追踪失败|推荐指数:★★★★★

这篇论文解决什么问题?

高基准准确率是否源于真正的角色身份追踪,还是模型利用了更简单的启发式策略(如性别线索或位置偏差)。

核心创新

  • 提出九条件诊断协议,分离基准准确率与角色追踪能力。
  • 发现模型对跨性别名称替换敏感(20-43%),但对同性别替换不敏感(7-17%),表明仅利用粗略性别线索。
  • 揭示“注释结构混淆”:不同剧集因帧采样间隔差异导致表观难度波动约20个百分点。
  • 证明增加帧数仅提升视觉特征提取,不改善角色身份绑定。

方法概览

在BBT验证集上对InternVL2-8B、Qwen2.5-VL-7B、LLaVA-NeXT-Video-7B及Gemini 2.5 Flash进行诊断,包括名称替换(Name Substitution)、开放生成(Open-Ended)、目标帧选择及元数据基线测试。

逐图理解论文

结果:基准准确率与模型表现

结果:基准准确率与模型表现
Table 1. Main results. This table represents the older open-source baselines (italicized) that are reported by Ataallah et al. [1] on their full global appearance evaluation set spanning multiple shows; our numbers are on the BBT validation subset. These ranges are not strictly comparable but provide order-of-magnitude context for where current 7–8B models sit relative to earlier long-video systems. The brackets represents the Wilson 95% CIs.

BBT验证集准确率显示,InternVL2-8B为38.0%,Qwen2.5-VL-7B为37.2%,LLaVA-NeXT为23.3%,Gemini 2.5 Flash为61.2%。这些数字看似不错,但我们需要进一步探究其背后的机制。

创新:名称替换敏感性测试

创新:名称替换敏感性测试
Table 3. Name substitution sensitivity. Percentage of questions where the model produced a different answer letter when the char- acter name in the question was swapped to a randomly chosen other main-cast character; the video and options are unchanged. Brackets show Wilson 95% confidence intervals.

名称替换敏感性测试显示,开源模型在BBT上仅为4-31%,远低于预期。跨性别敏感度比同性别高13-28个百分点,表明模型仅利用粗略性别线索,而非真正的角色身份绑定。

创新:开放生成评估

创新:开放生成评估
Table 5. Multiple Choice (MC) vs. Open-Ended (OE) on BBT (n = 47–52). Effective accuracy is the mean {0, 0.5, 1} score. Gap is OE effective accuracy minus MC.

开放生成评估中,去除选项后,开源模型MC到OE准确率下降18-25个百分点,且无151个回答完全正确。这表明模型在多项选择中可能依赖猜测,而非真正的理解。

创新:集体准确率分析

创新:集体准确率分析
Table 7. Per-episode collective accuracy on BBT (n = 20 unique episodes covering the 129 validation questions). “All correct” counts episodes where the model answered every question about that episode correctly.

集体准确率统计显示,开源模型在20个BBT剧集中0/20完全正确,Gemini 2.5 Flash仅1/20。这意味着37-38%的聚合准确率代表的是分散的正确回答,而非对剧集的整体理解。

创新:注释结构混淆

创新:注释结构混淆
Figure 2. Annotation-structure confound across shows. Ac- curacy lift from oracle frame selection versus average spacing between uniformly sampled frames. Longer videos have wider frame spacing under the same 16-frame budget, so oracle frames help more when uniform sampling misses annotated outfit-change windows. Dotted line: per-show mean lift. Takeaway: apparent per-show difficulty can shift by ∼20 Percentage Points because of frame coverage, not character-tracking capability.

我们发现“注释结构混淆”:不同剧集因帧采样间隔差异导致表观难度波动约20个百分点。增加帧数仅提升视觉特征提取,不改善角色身份绑定,说明问题在于采样策略而非模型能力。

实验与关键结果

  • 名称替换敏感性测试:交换问题中的角色名称,观察答案变化率。
  • 开放生成评估:去除选项,要求模型自由描述服装顺序。
  • 集体准确率(Collective Accuracy):统计整集问题全部回答正确的剧集比例。
  • 位置偏差分析:统计模型对特定选项字母(如A或E)的偏好。
  • 元数据基线:仅输入剧集标题,排除预训练记忆污染。
  • BBT验证集准确率:InternVL2-8B 38.0%, Qwen2.5-VL-7B 37.2%, LLaVA-NeXT 23.3%, Gemini 2.5 Flash 61.2%(第 3 页)
  • 名称替换敏感性:开源模型在BBT上仅为4-31%,远低于预期;跨性别敏感度比同性别高13-28个百分点(第 5 页)
  • 开放生成准确率下降:开源模型MC到OE准确率下降18-25个百分点,且无151个回答完全正确(第 6 页)
  • 集体准确率:开源模型在20个BBT剧集中0/20完全正确,Gemini 2.5 Flash仅1/20(第 7 页)
  • 位置偏差:InternVL2预测选项E的比例高达42%(第 4 页)

阅读时需要注意

  • 样本量限制:BBT分析使用n=129个问题,难以进行更细粒度的子组分析(如按演员或视觉相似度)。
  • 视频领域局限:仅针对剧本化电视剧,可能不适用于监控或第一人称视角等复杂场景。
  • 模型范围:主要关注7-8B开源模型,Gemini 2.5 Flash仅作为部分参考。
  • 高基准准确率可能掩盖了模型缺乏真正理解的事实,特别是当模型依赖位置偏差或性别线索时。
  • 不同剧集的表观难度差异可能由帧采样策略(如均匀采样错过关键帧)引起,而非模型能力差异。

关联工作

  • InfiniBench [1]:提供全局外观任务基准,本文在其基础上进行诊断分析。(第 2 页)
  • ChartInsights [14] & Plot Twist [11]:类似研究,指出高准确率可能掩盖对简单图表细节理解的不足。(第 2 页)
  • TVBench [4]:指出视频问答模型对帧顺序不敏感。(第 2 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

视频大语言模型真的在“观看”吗?诊断长视频中的角色追踪失败

Mohammad Al-Ratrout Shayla Sharmin Aditya Raikwar Roghayeh Leila Barmaki

同性别替换 跨性别替换

原始问题(Sheldon) 原始问题(Penny)

问:在本集中,SHELDON 换装顺序是什么? 问:在本集中,PENNY 换装顺序是什么?

正确答案:D = (紫色T恤,实验服,米色 Bookman Old Style 夹克) 正确答案:C = (黄色无袖上衣,红色花纹上衣,蓝色上衣)

模型选择:E = (紫色T恤,米色夹克,实验服) -> 错误答案 模型选择:D = (蓝色上衣,黄色无袖上衣,红色花纹上衣) -> 错误答案

↓ 名称交换问题(相同视频,相同选项) ↓ 交换为不同性别名称(Howard)(相同视频,相同选项)

2026 问:在本集中,LEONARD 换装顺序是什么? 问:在本集中,HOWARD 换装顺序是什么?

模型 Sheldon Leonard 结果 模型 Penny Howard 结果 Jul InterVL2-8B E E 未改变 InterVL2-8B D E 改变 13 Qwen2.5-VL-7B E E 未改变 Qwen2.5-VL-7B D D 未改变

LLAVA-NeXT-7B A A 未改变 LLAVA-NeXT-7B D E 改变

字母改变,但仍错误(不是 C)

图 1:名称替换诊断。同性别(左):在 Sheldon→Leonard 时,所有三个模型保持相同的字母,它们未对名称进行条件判断。跨性别(右):在 Penny→Howard 时,三个模型中有两个改变了字母,但得出了错误答案,这表明模型利用了粗略的性别[cs.CV]线索,而非身份识别。底部:按性别划分的 n=124 个 BBT 交换对的敏感性。结论:模型响应的是性别,而非身份,同性别交换仅在 7–17% 的情况下改变字母,而跨性别交换为 20–43%。

摘要

视频大语言模型(Video-LLM)能否跟随视频中一个人,足够好地追踪其身份,以便按顺序报告其在一整集电视剧中的换装变化?基准测试越来越多地对这类任务进行评分,目前最强的开源 7–8B 模型在 InfiniBench 的全局外观任务上达到了 37–38% 的得分,该任务正是询问这一点。但是,该得分是来自于对命名角色的追踪,还是来自于更简单的机制?我们通过应用于三个架构不同的开源 Video-LLM 的九条件诊断协议来测试这一点,并以 Gemini 2.5 Flash 作为前沿参考,发现准确率并非来自角色追踪。当我们将问题中提到的角色名称更改为同一剧集中的其他成员,而保持视频和答案选项不变时,模型仅在 4–31% 的情况下改变其答案,因此它们很大程度上忽略了问题询问的是谁。通过交换名称的性别来分解这一测试结果表明了原因:当名称更改为不同性别的角色时,模型的反应比更改为同性别角色时更强烈(存在 13–28 分的差距),它们捕捉到了粗略的性别线索,但无法区分同性别的个体。这种浅层处理过程在我们去除多项选择选项并以开放方式提出相同问题时再次出现:开源模型的准确率下降了 18–25 分,151 个答案中没有一个完全正确,而 Gemini 仅下降了 12 分。进一步的检查排除了显而易见的无辜解释,如添加字幕、使用信息量最大的帧或将帧数加倍,这些操作均未改善角色追踪,因此瓶颈不在于模型看到了多少视频,而在于它如何将视频与问题中命名的人联系起来。我们发布了一个诊断工具包,用于审计此类基准得分实际测量的内容:链接至我们的工具包。

1

第 2 页

1. 引言

开源 7–8B 视频大语言模型(Video-LLMs)在 InfiniBench 的全局外观任务 [1] 上的准确率达到 37–38%,超过了上一代开源长视频专家模型。表面上看,这是快速的进步。但 headline number(显著指标)的意义取决于它所反映的能力:正确回答此任务要求跟随一个命名角色跨越整整 20–40 分钟的剧集,并识别其服装变化的顺序。更高的分数是否意味着模型实际上真的做到了这一点?

有理由对此表示怀疑。在图像理解领域,高基准准确率反复掩盖了浅层策略:在图表、空间推理和物体识别基准上得分良好的多模态模型,在面对针对完全相同输入的简单问题时却表现不佳 [7, 9, 11]。视频引入了另一种失败模式:许多 Video-LLMs 对帧洗牌(frame-shuffling)不敏感 [4, 15],几乎未利用其分数看似所需的时序结构。然而,这些模型是否真的在追踪角色身份,从而能够回答“Sheldon 穿什么”而不是“某人穿什么”,尚未得到直接测试。

我们对此进行测试。在 InfiniBench 的全局外观任务中,由于每个问题都指定了一个单一角色,我们可以在保持视频和选项不变的情况下仅更改该名称,因此我们对三个架构不同的开源 Video-LLMs(InternVL2-8B、Qwen2.5-VL-7B、LLaVA-NeXT-Video-7B)应用了九条件诊断协议,并以 Gemini 2.5 Flash 作为前沿参考。结果在不同模型间保持一致(图 1):将命名角色替换为另一个主要演员成员,仅在 4–31% 的情况下改变了答案,这更接近于忽略名称而非追踪名称。准确率的提升是真实的;角色追踪并非产生这些提升的原因。

贡献。我们贡献:(1) 一种将基准准确率与角色追踪分离的九条件诊断协议;(2) 对三个开源 Video-LLMs 以及 Gemini 2.5 Flash 的评估,包括基于性别的名称替换分解;(3) 一个用于审计角色追踪声明的发布工具包。

2. 相关工作

Ataallah 等人 [1] 引入了 InfiniBench,其全局外观任务要求按时间顺序列出命名角色在整个剧集中的服装变化顺序。我们采用此任务,但分析其聚合准确率背后的机制。

多模态模型的诊断研究。Razeghi 等人 [11] 使用合成和真实世界的图表问题表明,高 ChartQA 分数掩盖了基本的图表理解能力,他们发现 Gemini Pro Vision 在 ChartQA 上的准确率为 67%,而在其基本问题上降至 58%,且集体准确率(所有关于同一图表的问题均正确)对于最佳模型而言低于 36%。Wu 等人 [14] 发现了高层与低层图表问答之间的类似差距。Kamath 等人 [7] 引入了位置提示扰动,发现视觉-语言模型无法可靠地区分“左侧物体”和“右侧物体”。Li 等人 [9] 表明物体幻觉破坏了视觉问答(VQA)的准确率。我们借鉴这些工作的精神用于视频场景,以角色名称作为扰动轴。

Video-LLMs 的时序不敏感性。Cores 等人 [4] 表明,帧洗牌对大多数时序视频 QA 基准的准确率影响微乎其微;Xiao 等人 [15] 报告了针对 grounding 风格问题的类似洗牌不变性。这些发现确立了 Video-LLMs 经常忽视帧顺序的事实。我们将角色身份敏感性视为同一更广泛问题下的正交轴:当 Video-LLM 在基准测试中得分较高时,它实际使用的是哪些信息?帧洗牌测试了时序信息;我们测试角色身份信息。两者属于同一诊断家族。

位置偏差。Zheng 等人 [17] 记录到 LLMs 在多选择设置中系统性地偏好特定的答案字母,这与内容无关。我们确认这种效应同样适用于 Video-LLMs,并发现不同模型有不同的默认字母,从而排除了共享训练伪影作为唯一原因。

3. 实验设置

3.1. 任务与数据

我们使用 InfiniBench [1] 的全局外观任务,该任务呈现一集剧集视频,并询问:“对于以下问题,选择正确的选项:{角色} 在这集中服装变化的顺序是什么?”并提供五个候选排序(A–E)。真实排序源自 TVQA+ [8] 的角色边界框,并经过手动过滤以确保每集服装唯一。

剧集时长大约从 20 分钟(《生活大爆炸》、《老友记》)到 40 分钟(《灵书妙探》)不等。开源模型接收均匀采样自整集的 16 帧,并必须从中推断出命名角色的完整服装变化序列。在我们使用的《生活大爆炸》(BBT)验证集中,每集平均包含 5–8 个全局外观问题。

InfiniBench 的测试集具有隐藏标签(仅限排行榜),无法用于本地诊断分析。因此,我们主要在验证集上进行评估,该验证集包含 129 个用于全局外观的 BBT(《生活大爆炸》)问题。验证集是标准目标

第 3 页

用于当代基准测试的诊断分析:它具有可见标签,并且从典型的预训练数据中隔离出来,以防止数据泄露。为了进行跨剧集泛化分析,我们额外使用了《老友记》(Friends,n = 162)和《城堡》(Castle,n = 196)的训练集,因为这些剧集未包含在验证集中。我们通过问题 ID 验证了各数据集之间零重叠。使用训练集数据实际上是一种更严格的测试:如果在预训练数据中可能见过该数据的模型仍然失败,这比在隔离数据上失败的模型更能说明问题。

3.2. 模型

我们评估了来自架构不同家族的三个开源 7–8B 视频大语言模型(Video-LLMs),并将 Gemini 2.5 Flash 作为前沿参考:

  • InternVL2-8B [2]:InternViT 视觉编码器 + InternLM2 语言模型。
  • Qwen2.5-VL-7B [12]:Qwen 专用视觉塔 + Qwen2.5 LLM。
  • LLaVA-NeXT-Video-7B [16]:基于 CLIP 的视觉编码器 + Vicuna LLM。
  • Gemini 2.5 Flash [6]:具有原生长视频处理能力的前沿专有模型。

模型选择理由。我们研究来自架构不同家族的三个开源视频大语言模型:InternVL2-8B、Qwen2.5-VL-7B 和 LLaVA-NeXT-Video-7B,以便任何这三个模型共有的故障模式都不能归因于单一架构的怪癖。我们加入 Gemini 2.5 Flash 作为前沿参考点。这些模型被广泛使用,并处于实践中最常部署的 7–8B 开源层级,因此它们在此任务上的行为具有广泛的代表性。

Gemini 范围。我们在部分条件下评估 Gemini 2.5 Flash,完整覆盖超出了我们的 API 预算,我们在表中标记了其缺失情况(见第 7 节)。

3.3. 推理、统计与范围

推理配置。对于每个开源模型,我们在模型的原生分辨率下,每集使用 16 个均匀采样的帧(与 InfiniBench 报告的开源评估协议一致),采用贪婪解码(temperature=0),对于多项选择题 max_new_tokens=10,对于开放生成 max_new_tokens=512。Gemini 2.5 Flash 以提供商默认设置原生处理整个视频,max_output_tokens=2048 以容纳内部推理令牌。

统计方法。我们在所有准确率和敏感性上报告 Wilson 95% 置信区间 [13],使用 McNemar 精确检验 [10] 进行成对比较,使用卡方检验分析预测字母分布与均匀分布的差异以检测位置偏差,并使用 Cohen’s h [3] 计算效应量(0.2/0.5/0.8 = 小/中/大)。

实验范围。样本量在正文中陈述并在补充材料中总结。我们在 BBT 验证集上评估所有四个模型,这是我们标准的诊断目标,因为它具有可见标签;三个开源模型还在《老友记》和《城堡》的训练集上进行了评估,因为跨剧集或标注窗口分析需要这些数据。Gemini 2.5 Flash 在部分子集上进行了评估,包括完整剧集 BBT、开放生成 BBT、名称替换(n = 23)、集体准确率和题目复杂度,因为完整的诊断扫描超出了我们的 API 预算(见第 7 节)。

4. 诊断协议

我们定义了九个条件;C1–C6 构成核心协议,而 C7–C9 排除了核心协议揭示的故障的替代解释,即帧数太少、缺少对话以及无法弃权。

  • C1:完整剧集标准 InfiniBench 多项选择题,针对完整视频。
  • C2:纯文本,使用相同的提示,包含 16 个黑框,仅从提示和选项文本中即可获得的准确率。
  • C3:目标帧——用直接从地面真值服装变化窗口中提取的目标帧替换均匀 16 帧采样(每个窗口一帧)。如果即使提供了最具信息量的帧,准确率仍未上升,则表明相关视觉内容已到达模型,但跟踪能力并未提高。
  • C4:名称替换——将命名角色替换为随机选择的另一个主要角色,保持视频和选项不变;身份条件敏感的模型应改变其答案,而由位置偏差驱动的答案在构造上保持不变。

表 1. 主要结果。此表代表了较旧的开源基线(斜体显示),这些基线由 Ataallah 等人 [1] 在其涵盖多个剧集的完整全局外观评估集上报告;我们的数据位于 BBT 验证子集上。这些范围并不严格可比,但提供了当前 7–8B 模型相对于早期长视频系统所处位置的量级背景。括号表示 Wilson 95% 置信区间。

| Model | n | Full episode | Text-only | Pos. bias ($\chi^2$) | Most-pred letter | | :— | :— | :— | :— | :— | :— | | Random | | | | | | | LLaMA-VID | | full—eval‡ | 9.4 [7.2, 20.0] | 20.0 | —— | —— | | Goldfish | | full eval‡ | 33.3 [19.6, 2] | —— | —— | —— | | Gemini 1.5 Flash | | full eval‡ | 46.8 [4] | — | — | — | | GPT-4o | | | | | | | LLaVA-NeXT-Video-7B | 129 BBT | 38.0 [30.1, 46.6] | 18.6 [12.8, 26.2] | 58.6* | AE (42%) | | InternVL2-8B (ours) | 129 BBT | 23.3 [16.7, 31.5] | 16.3 [10.9, 23.6] | — | AE (70%) | | Qwen2.5-VL-7B (ours) | 129 BBT | 37.2 [29.4, 45.8] | 25.6 [18.8, 33.7] | 29.26* | E (36%) | | Gemini 2.5 Flash (ours) | 129 BBT | 61.2 [52.6, 69.2] | — | — | — |

3

第 4 页

• C5:开放生成(Open-ended generation)诱发服装序列的猜测,但“非随机”并不意味着“有依据”: 在自由文本中,由 LLM 裁判(Claude)[18] 根据 {0, 0.5, 1} 的尺度针对地面真值进行评分;并在 §5.6 中经人工评分者验证。 模型通过习得的逐字母偏差进行选择,而非基于视频内容。 • C6:仅元数据:移除视频,仅保留剧集标题,以测试预训练数据污染;接近随机水平的准确率排除了这一可能性。 • C7:帧数消融:在 InternVL2 和 Qwen 上重新运行 8/16/32/64 帧;如果准确率上升但名称敏感性未变,则表明更多帧有助于特征提取,而非追踪。 • C8:拒绝回答:在所有 129 道 BBT 问题中添加“F. 我无法从视频中确定”,以测试模型是否能识别超出其能力范围的问题。 • C9:字幕消融:使用解析后的对话文本(限制在 4000 字符以内)重新运行,以测试缺失的文本上下文是否导致了失败。

5. 结果

5.1. 总体准确率与位置偏差

表 1 报告了我们的主要准确率结果,以及 InfiniBench 报告的旧版开源系统的数值。得出三个发现:

新一代 7–8B 模型显著优于先前的开源结果。我们评估了三个当前世代的 7–8B 视频大语言模型(Video-LLMs),其家族(InternVL、Qwen2.5-VL)也出现在 Ataallah 等人 [1] 最近对其完整多剧集全球外观集合的评估中。由于子集差异,我们的 BBT 验证数值不能直接与之比较,但两项研究均发现,这些新一代 7–8B 模型的准确率超过了早期的长视频专家模型。在先前的工作中报告的是总体准确率。

所有开源模型的位置偏差均高度显著。InternVL2 在 129 个问题中有 42% 预测答案为字母 E,尽管 E 仅为正确答案的情况仅占 24%。我们使用卡方检验针对均匀分布(如果模型随机选择字母,我们将期望的分布)来测试这种不平衡是否与随机选择一致。对于 InternVL2,$\chi^2 = 58.64$,$p = 5.6 \times 10^{-12}$:在随机选择零假设下,如此大的效应极其不可能,远低于传统的 $p < 0.05$ 阈值。$^1$ Qwen2.5-VL-7B 显示出相同但幅度不同的效应:它在 36% 的问题中预测 E($\chi^2 = 29.26$,$p = 6.9 \times 10^{-6}$)。LLaVA-NeXT-Video-7B 在 65% 的问题中预测 A。

这些分布(42% E,36% E,65% A)在统计上与随机选择每字母约 20% 的模式不相容。

三个模型偏好不同的默认字母(InternVL 和 Qwen 偏好 E,LLaVA 偏好 A)这一事实,反驳了单一共同原因(如共同训练数据)的观点。这种偏差似乎是模型特定的,确定其确切机制超出了本文的范围。我们将机制性调查留给未来的工作。

Gemini 2.5 Flash 锚定了上限。Gemini 2.5 Flash 在我们的 BBT 评估中达到 61.2%,与 InfiniBench 在其完整评估集上报告的 GPT-4o 的 46.84% 相当。这两个数值并不严格可比(不同的评估子集),但都表明前沿级模型的得分显著高于开源 7–8B 模型观察到的 23–38% 范围。我们将 Gemini 2.5 Flash 用作单一的前沿参考点,并不对其运行完整的诊断协议;详见 §7 的讨论。

5.2. 视频贡献超过纯文本

为了测试视频是否提供了超出仅从问题和选项中可获得的有效信号,我们使用 McNemar 配对检验,比较 InternVL2 在有无视频的情况下对相同 129 道 BBT 问题的准确率。在 129 个问题中,有 31 个问题模型在有视频时答对,在无视频(黑帧)时答错;仅有 6 个问题在移除视频时将错误答案翻转为正确答案。这种 31 对 6 的不对称性产生 $p < 10^{-4}$ 和 Cohen’s $h = 0.44$(中等至大效应量),因此视频显然提供了可用的信号:当视觉模态可用时,InternVL2 的准确率提高了 19.4 个百分点(完整剧集 38.0% vs. 纯文本 18.6%)。然而,§5.5 中的名称替换分析将表明,这种视觉信号并未被用于识别问题所指的角色。视频帮助模型识别场景中有哪些服装,但并未将这些服装与问题中命名的角色绑定。视觉信息被处理了,但未与角色身份令牌绑定。

5.3. 字幕未能弥合差距

我们报告失败的一种可能解释是,模型缺乏足够的上下文来识别问题涉及哪个角色的服装。视频可能展示了服装,但如果没有对话线索(“Penny,你的衬衫很好看”),模型可能不知道谁是谁。为了测试这一点,我们在提示中包含剧集的解析对话文本(来自相应的 .srt 字幕文件),限制在 4000 字符以适应上下文限制,重新运行完整剧集条件。添加字幕对任何模型都没有帮助:LLaVA 23.3→20.9,InternVL2 38.0→35.7,Qwen 37.2→36.4(变化分别为 -2.3、-2.3、-0.8 个百分点;McNemar $p = 0.63, 1.00, 0.63$)。添加对话并未弥合总体准确率与…之间的差距。

$^1$ 我们 Throughout 使用 $p < 0.05$ 作为传统的显著性阈值;我们报告的 p 值通常小多个数量级。

第 5 页

目标帧条件(表2)揭示,同一模型在相同协议下评估时,在不同剧集上会表现出截然不同的有效性能,而这些差异与模型的能力无关。我们在 InternVL2 和 Qwen(我们最强的两个开源模型)上运行了这一条件,针对 InfiniBench 提供服装变化标注窗口的三部剧集(《生活大爆炸》(BBT)、《老友记》(Friends)、《灵书妙探》(Castle))进行了测试。

将均匀的16帧采样替换为从每个地面真值窗口中提取的一个目标帧(oracle frame),在《生活大爆炸》上并未带来帮助(McNemar p = 0.61,Cohen’s h = 0.06),在《老友记》上略有帮助(InternVL2 +1.5个百分点,Qwen +7.2个百分点),而在《灵书妙探》上则显著帮助(两者均约+20个百分点:InternVL2 从 29.6% 提升至 50.0%;Qwen 从 28.6% 提升至 47.9%)。

其驱动因素是剧集时长与固定16帧预算之间的交互作用:均匀采样在《生活大爆炸》(19.4分钟)上每约73秒间隔一帧,在《老友记》(24.6分钟)上每约92秒间隔一帧,在《灵书妙探》(41.3分钟)上每约155秒间隔一帧。当帧间距接近服装变化窗口的持续时间时,均匀采样的帧会偶然落入标注窗口内,此时目标帧策略的作用微乎其微(《生活大爆炸》);当帧间距超过窗口持续时间时,均匀采样的帧会错过窗口,此时目标帧策略则带来显著帮助(《灵书妙探》),《老友记》处于中间状态(图2)。这并非因为《灵书妙探》本质上更难,也非因为模型通过目标帧策略得到了提升:均匀协议为不同剧集提供了不同的时间分辨率,因此每部剧集的准确率部分反映了一个约20个百分点的结构伪影,而非能力差异。我们在§6中给出了该基准设计的影响。

5.4. 目标帧揭示了标注结构混淆

表2. 目标帧条件(每个地面真值标注窗口一个目标帧,替换均匀16帧采样)。$\Delta$ 表示同一模型和剧集从标准全剧集条件(表1)到目标帧条件的准确率变化。

| Model | Show | n | Acc. | $\Delta$ | | :— | :— | :— | :— | :— | | InternVL2 | BBT | 129 | 34.1 | -3.9 | | | Friends | 132 | 31.1 | +1.5 | | | Castle | 146 | 50.0 | +20.4 | | Qwen | BBT | 129 | 34.1 | -3.1 | | | Friends | 132 | 42.4 | +7.2 | | | Castle | 146 | 47.9 | +19.3 | | LLaVA | BBT | 129 | 23.3 | 0.0 | | | Friends | 132 | 26.5 | +1.2 | | | Castle | 146 | 30.1 | +9.7 |

†LLaVA 的基线显示出极端的A选项偏差(所有答案中70%为A);跨剧集的敏感性因此受到抑制。

5.5. 名称替换:模型对角色身份不敏感

表3. 名称替换敏感性。当问题中的角色名称被替换为随机选择的其他主要角色时,模型产生不同答案字母的问题比例;视频和选项保持不变。括号内显示 Wilson 95% 置信区间。

| Model | BBT (n = 124) | Friends (n = 124) | Castle (n = 124) | | :— | :— | :— | :— | | LLaVA-NeXT-Video-7B† | 13.7 [8.7, 20.9] | 4.8 [2.1, 10.7] | 4.0 [1.6, 9.6] | | InternVL2-8B | 26.6 [19.6, 35.0] | 12.1 [7.4, 19.1] | 9.7 [5.6, 16.2] | | Qwen2.5-VL-7B | 30.6 [23.2, 39.2] | 16.9 [11.2, 24.7] | 13.7 [8.7, 20.9] |

对于每个问题,我们将命名角色替换为随机选择的其他主要角色,同时保持视频和选项不变。由于不同角色通常穿着不同的服装,依赖命名角色进行推理的模型在大多数替换情况下应改变其答案字母。被替换角色的真实服装序列不一定出现在原始选项A–E中;该诊断仅询问基于名称条件的模型是否改变答案。

图2. 跨剧集的标注结构混淆。目标帧选择带来的准确率提升与均匀采样帧之间的平均间距对比。较长视频在相同的16帧预算下具有更宽的帧间距,因此当均匀采样错过标注的服装变化窗口时,目标帧的帮助更大。虚线:每部剧集的平均提升。结论:由于帧覆盖率而非角色追踪能力,表观的每剧集难度差异可达约20个百分点。

5

第 6 页

字母,而忽略名称的模型在两个版本中给出相同的字母。表 3 报告了这种敏感性。

所有三个开源模型在 BBT 上的名称替换敏感性均低于 31%,在《老友记》(Friends)和《生活大爆炸》(Castle,注:此处原文可能指代另一数据集或剧集,根据上下文保留 Castle)上更低(4–17%)。即使在 BBT 上威尔逊置信区间的上限(InternVL2 为 35%,Qwen 为 39%),模型在五次回答中更改答案的次数也不到两次;在每部剧集 n = 124 的情况下,《老友记》和 Castle 的置信区间上限均低于 25%。由于完全忽略角色名称的模型敏感性应为 0%,观察到的 4–31% 的范围更接近于忽略名称,而非真正的追踪。模型并未以稳健的方式对角色身份进行条件判断。

5.5.1. 机制:性别分解敏感性

为了理解哪些交换导致了答案的变化,我们将表 3 中的 124 对 BBT 交换对划分为同性别交换和跨性别交换。对于 BBT 的七位主要角色(Sheldon, Leonard, Howard, Raj 为男性;Penny, Bernadette, Amy 为女性),同性别交换例如 Sheldon→Howard,而跨性别交换例如 Sheldon→Penny。表 4 揭示了机制:所有三个模型对跨性别交换的敏感性远高于同性别交换,差异幅度为 13–28 个百分点。模型使用粗略的性别视觉线索,但无法区分同一性别内的个体。Sheldon 和 Howard 均为男性且外貌相似,本质上可以互换;而 Sheldon 和 Penny 则不能。成对层面的比率使这一点具体化:敏感性最高的五对 BBT 配对几乎全是跨性别(例如,Penny→Leonard 100%,Bernadette→Sheldon 100%,Howard→Penny 75%),而敏感性最低的五对几乎全是同性别(Leonard→Howard 0%,Sheldon→Howard 0%)。这些成对层面的比率存在噪声,因为样本量范围大约在 3 到 12 个问题之间,但整体排序是稳健的。

因此,BBT 14–31% 的名称替换敏感性反映的是性别作为类别层面的过滤器,而非稳健的角色身份:模型可以将 Sheldon 与 Penny 区分开,但不能将 Sheldon 与 Howard 区分开,否则只能猜测。

5.6. 开放生成评估揭示强制猜测

表 5. BBT 上的多项选择(MC)与开放生成(OE)(n = 47–52)。有效准确率是 {0, 0.5, 1} 分数的平均值。Gap 是 OE 有效准确率减去 MC。

| Model | MC | OE | Gap | Fully Correct | | :— | :— | :— | :— | :— | | LLaVA-NeXT-Video-7B | 23.3 | 2.9 | −20.4 | 0/52 | | InternVL2-8B | 38.0 | 13.0 | −25.0 | 0/47 | | Qwen2.5-VL-7B | 37.2 | 19.2 | −18.0 | 0/52 | | Gemini 2.5 Flash | 61.2 | 49.0 | −12.2 | 14/52 |

为了测试多项选择(MC)准确率是否反映真正的知识或从受限选项集中的强制选择,我们以开放生成(OE)形式重新提出相同的问题:“按出现顺序描述每套服装。” 回答根据与地面真值描述的一致性,使用 Claude 作为 LLM 裁判 [5, 18] 在 {0, 0.5, 1} 量表上进行评分;由独立人类评分员重新评分的 20 项子集给出二次加权 Cohen’s κ = 0.63,所有分歧均在 0.5 和 0.0 之间,且没有任何涉及完全正确(1.0)类别的分歧。

MC-OE 差距在所有四个模型中均存在,并与模型能力呈反比缩放(表 5)。开源 7–8B 模型显示出 18–25 个百分点的差距:LLaVA-NeXT-Video 从 23.3% MC 降至 2.9% OE,InternVL2 从 38.0% 降至 13.0%,Qwen 从 37.2% 降至 19.2%,151 个开放生成回答中完全正确的为零。Gemini 2.5 Flash 显示出相同性质的差距但程度较轻,从 61.2% MC 降至 49.0% OE(12.2 个百分点的差距),其中 52 个中有 14 个完全正确。

错误类型进一步明确了这种区别。开源模型的失败主要源于编造地面真值中不存在的服装(LLaVA 81%,InternVL2 72%;Qwen 分为 31% 编造 / 31% 明确拒绝)。Gemini 的错误主要是部分匹配(44%),纯编造仅占 13%,这与模型试图进行识别但受限于视觉精度而非未能将证据绑定到角色身份的情况一致。

因此,MC 准确率部分反映了选项集的约束,而非从视频中识别和描述角色外观的能力。Gemini 较小的差距表明,OE 评估比聚合 MC 准确率更清晰地将前沿模型与开源模型区分开来。这将 Razeghi 等人 [11] 的图表查找模式——适当的多项选择得分但糟糕的基础开放生成答案——扩展到了长视频角色追踪领域。

5.7. 校准:模型无法识别自身的不确定性

原始的 InfiniBench 全局外观问题已经在五个选项(A–E)中包含“我不知道”的选择,该选项存在于所有 129 个 BBT 验证问题中

第 7 页

在不同位置,但模型很少选择它(InternVL2 2.3%,Qwen 8.5%,LLaVA 4.7%)。因此,我们在所有 129 个问题中增加了一个第六选项“F. 我无法从视频中确定这一点”,并重新进行评估。拒绝回答(Abstention)的比例仍然很低,因此未能拒绝回答并非措辞造成的假象。

InternVL2 仅在 3.1% 的问题中拒绝回答,其条件准确率与基线统计上无显著差异,未提供可用的校准信号。Qwen 拒绝回答的频率更高(11.6%),且在做出承诺时条件准确率提高了 5.8 个百分点,这表明其部分校准能力较弱,但仍有 50.4% 的承诺回答是错误的。LLaVA-NeXT-Video-7B 从未使用“我不知道”(IDK)选项进行拒绝回答(0/129),这与其极端的 A 选项偏差(70% 预测为 A)一致,无论帧数预算或拒绝选项如何,该偏差均占主导地位。

因此,对于这些模型而言,无法通过拒绝回答阈值调整来提高聚合多项选择(MC)准确率:它们不知道自己不知道什么。

5.9. 集体准确率:剧集级理解

聚合准确率可能会掩盖分散的正确性,而无法体现剧集级的理解。遵循 Razeghi 等人 [11] 的做法,我们计算集体准确率:即在某个剧集中所有问题均回答正确的剧集比例。BBT 验证问题涵盖 20 个剧集(每个剧集 5–8 题);我们使用 BBT 以避免潜在的训练集数据污染。

表 7. BBT 上的每剧集集体准确率(n = 20 个独特剧集,涵盖 129 个验证问题)。“全部正确”统计的是模型正确回答该剧集所有问题的剧集数量。

| Model | Aggregate | All correct | Rate | | :— | :— | :— | :— | | LLaVA-NeXT-Video | 23.3 | 0/20 | 0.0% | | InternVL2-8B | 38.0 | 0/20 | 0.0% | | Qwen2.5-VL-7B | 37.2 | 0/20 | 0.0% | | Gemini 2.5 Flash | 61.2 | 1/20 | 5.0% |

表 7 显示了聚合准确率与每剧集理解能力之间的差距。InternVL2-8B 和 Qwen2.5-VL-7B 的聚合得分为 37–38%,但在 20 个 BBT 验证剧集中,没有一个剧集的所有问题都被正确回答。对于 InternVL2,20 个剧集中有 0 个完全正确,18 个部分正确,2 个没有任何正确问题;其他开源模型也呈现相同模式。即使是 Gemini 2.5 Flash,也仅完全理解了 1/20 个剧集(5%)。因此,37–38% 的聚合准确率意味着分散的正确回答,而非理解了 37–38% 的剧集。

5.8. 帧数消融实验

表 6. Qwen 在 BBT 上的帧数与名称敏感性对比(n = 124 对)。更多帧数提高了准确率,但未提高敏感性。

| Qwen | 16 frames | 32 frames | Name sensitivity | | :— | :— | :— | :— | | Qwen 16 frames | 37.2 | 30.6 [23.2, 39.2] | | | Qwen 32 frames | 46.0 | 28.2 [21.1, 36.7] | | | ∆ | +8.8 | −2.4 | |

我们在 Qwen 上运行了帧数与敏感性的对比实验,因为 Qwen 从增加帧数中获得的准确率提升最大,因此这是测试准确率提升是否转化为跟踪能力提升的最具信息量的实验。在 8/16/32(/64) 帧下,InternVL2 表现平稳(38.0%/38.0%/41.1%;64f 超过了其 8192-token 上下文),而 Qwen 先上升后下降(32.6%/37.2%/46.5%/41.9%)。LLaVA-NeXT-Video-7B 也大致平稳(19.4%, 23.3%, 21.7%, 18.6%),没有单调改进,且在 64 帧时略有下降,这与其极端的 A 选项偏差(70% 预测为 A;见 §5)一致,无论帧数预算如何,该偏差均占主导地位。

表 6 的决定性对比显示:Qwen 从 16 帧到 32 帧的准确率提升(+8.8 个百分点)并未伴随名称敏感性的改善(−2.4 个百分点,在重叠的 95% 置信区间内)。将帧数预算加倍改善了视觉特征提取,使模型成为更好的服装识别器,但并未使其更好地识别问题所涉及的角色的服装。因此,名称替换不敏感性并非帧采样瓶颈;瓶颈在于将视觉信息与角色身份绑定,而非可用视频量的多少。

5.10. 仅元数据基线

一个担忧是数据污染:因为这些剧集很流行,模型可能通过预训练记忆而非视频来回答问题,从而在没有视觉理解的情况下虚高准确率。我们通过仅元数据基线对此进行测试:移除视频,提示中仅包含剧集名称、问题和选项。如果污染驱动了准确率,该基线得分应远高于随机水平。事实并非如此:InternVL2 在 BBT 上得分为 17.8%,在 Castle 上得分为 19.4%,均低于或等于五选一多项选择题的 20% 随机水平。这排除了剧集标题、角色名称或经典服装的记忆作为我们观察到的 38% 全剧集准确率的主要驱动因素。

6. 讨论

我们的发现对“视频大语言模型”意味着什么。这四种失败模式构成了一个连贯的画面。考虑一个能够检测粗略视觉类别(性别、服装风格)但从不将其与命名角色绑定的模型。它会在跨性别交换时改变答案,但在同性别交换时不会;当粗略线索缩小选项范围时,它能在多项选择题中得分

第 8 页

但在需要视觉身份与语言令牌进行身份绑定(identity-bound binding)的开放生成(Open-Ended, OE)任务中失败。我们的诊断描述;且没有信号将“我知道”与“我不知道”区分开来,因为从未将证据与名称绑定。所有三个开源模型都符合这一特征。

值得注意的是,BBT 剧集演员很容易从开放互联网上识别,因此模型原则上可以利用预训练获得的人脸识别或标准服装关联来在该任务中表现良好。我们发现的故障模式组合表明,这并非我们评估的开源模型的主要影响因素:如果模型能够通过面部识别 Sheldon,他们就不会在名称交换时将他与 Howard 混淆,且 MC-OE 差距也不会如此之大。我们将预训练人脸识别在其中的作用留给直接测试。

与 InfiniBench 及先前诊断工作的关系。我们的工作建立在 Ataallah 等人 [1] 的基础上:他们的开源数字表明该任务很难,而较新的模型仅在表面指标上得分更高,却在更深层的诊断中失败。其结构与 Razeghi 等人 [11] 关于图表、高 ChartQA 准确率掩盖了较差的基础理解能力的研究类似,并移植到长视频领域:37–38% 的多项选择(MC)准确率夸大了实际的角色追踪能力。Gemini 2.5 Flash 仅作为部分前沿参考,完整的一集 BBT、开放生成 BBT、集体准确率、问题复杂度,以及 API 预算耗尽前的 23 个有效 BBT 名称交换对,我们也无法排除在更大权重的开源模型中存在不同的行为。

基准设计的影响。我们从这项研究中得出四点启示: • 在命名角色任务中,除准确率外报告名称替换不变性:两者在 BBT(跨剧集)上相差 7–11 个百分点,因此 38% 的 MC 准确率配合 30% 的敏感性并不代表所宣传的任务。 • 对于固定均匀帧协议,发布每集标注窗口统计信息(计数、持续时间、离散度):当均匀间隔的帧错过标注的服装变化时刻时,每集难度变化约 20 个百分点,这并非因为追踪能力变差。 • 将多项选择题与开放生成变体配对,或报告 MC-OE 差距:对于开源模型(即使对于 Gemini 也是如此),OE 使准确率下降 18–25 个百分点,其中 0/151 的开源答案完全正确,表明多项选择题部分反映了选项集约束。 • 平衡正确答案的位置并报告预测字母分布:开源模型默认选择特定字母,无论内容如何(例如,InternVL2 选择 “E” 42%,χ2=58.64),因此分数可能反映的是字母偏差/键对齐,而非理解能力。

模型开发的影响。准确率的提升与角色追踪能力的解耦(§5.8)表明,当前对 Video-LLM 的改进并未提升追踪能力。模型扩展了更好的视觉特征、更多的推理能力、更长的上下文,但未解决根本问题。

7. 局限性

样本大小和粒度。主要的 BBT 分析使用 n = 129 个问题,开源名称替换使用每集 n = 124 对交换对,用于 BBT、Friends 和 Castle。这些规模支持我们要报告的大效应,但限制了超出粗略性别类别的更细粒度子组分析,例如按演员、视觉相似性、场景类型或服装类别的敏感性。

Video-LLM 角色追踪留给未来工作。

视频领域。我们的视频是剧本化的电视内容,特别是情景喜剧风格的剧集,具有 recurring characters( recurring characters)、专业灯光、多机位剪辑和独特的服装。这种受控环境可能无法完美映射到混乱的真实世界视频,如闭路电视(CCTV)、身体摄像头录像、第一人称视角视频,或具有运动模糊、遮挡和不稳定视角的拥挤会议。

模型范围。我们专注于当前的 7–8B 开源模型。

8. 结论

较新的开源 Video-LLM 报告的长格式角色追踪准确率高于上一代,但我们的诊断显示,这种准确率并未反映真正的角色追踪。在三个架构不同的 7–8B 模型中,名称替换敏感性保持在 31% 以下,且主要局限于粗略的跨性别对比;开放生成评估使多项选择准确率下降 18–25 个百分点,开源生成中 0/151 完全正确;集体准确率为 0/20 BBT 剧集;增加帧数提高了准确率但未改善角色识别;且几乎从不使用“无法确定”。这些失败共同表明,模型使用性别级别的视觉特征作为类别级过滤器,而未将视觉身份与角色名称令牌绑定。我们通过表征当前开源模型失败的方式和原因来扩展 InfiniBench,并发布我们的诊断协议作为可重用工具包,用于诊断 Video-LLM 基准分数背后的角色追踪能力。

参考文献

[1] Kirolos Ataallah, Chenhui Gou, Eslam Abdelrahman, Khushbu Pahwa, Jian Ding, and Mohamed Elhoseiny. Infinibench: A comprehensive benchmark for large multimodal

8

第 9 页

在超长视频理解中的模型。在 arXiv 预印本 arXiv:2406.19875, 2024. 2, 3, 4, 8

[2] Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, 等人. InternVL2:将开源多模态模型推向商业水平。在 arXiv 预印本 arXiv:2410.16261, 2024. 3

[3] Jacob Cohen. 行为科学的统计功效分析. Routledge, 第2版, 1988. 3

[4] Daniel Cores, Michael Dorkenwald, Manuel Mucientes, Cees G. M. Snoek, 和 Yuki M. Asano. TVBench:重新设计视频-语言评估。在 arXiv 预印本 arXiv:2410.07752, 2024. 2

[5] Yann Dubois, Balázs Galambosi, Percy Liang, 和 Tatsunori B. Hashimoto. Length-controlled AlpacaEval:一种去偏自动评估器的简单方法。在 arXiv 预印本 arXiv:2404.04475, 2024. 6

[6] Gemini Team. Gemini 2.5:通过高级推理、多模态、长上下文和下一代代理能力推动前沿。arXiv 预印本 arXiv:2507.06261, 2025. 3

[7] Amita Kamath, Jack Hessel, 和 Kai-Wei Chang. 视觉-语言模型中“发生了什么”?调查它们在空间推理方面的挣扎。在 2023 年自然语言处理实证方法会议论文集, 2023. 2

[8] Jie Lei, Licheng Yu, Tamara Berg, 和 Mohit Bansal. TVQA+:视频问答的空间时间定位。在 第58届计算语言学协会年会论文集, 2020. 2

[9] Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, 和 Ji-Rong Wen. 评估大型视觉-语言模型中的对象幻觉。在 2023 年自然语言处理实证方法会议论文集, 2023. 2

[10] Quinn McNemar. 关于相关比例或百分比差异的抽样误差的备注. Psychometrika, 12:153–157, 1947. 3

[11] Yasaman Razeghi, Ishita Dasgupta, Fangyu Liu, Vinay Venkatesh Ramasesh, 和 Sameer Singh. 情节反转:多模态模型无法理解简单的图表细节。在 计算语言学协会:EMNLP 2024 论文集, 第5922–5937页, 2024. 2, 6, 7, 8

[12] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Yang Fan, Kai Dang, Mengfei Du, Xuancheng Ren, Rui Men, Dayiheng Liu, Chang Zhou, Jingren Zhou, 和 Junyang Lin. Qwen2.5-VL 技术报告。在 arXiv 预印本 arXiv:2502.13923, 2025. 3

[13] Edwin B Wilson. 概率推断、后继法则和统计推断. 美国统计协会杂志, 22:209–212, 1927. 3

[14] Yifan Wu, Lutao Yan, Leixian Shen, Yunhai Wang, Nan Tang, 和 Yuyu Luo. ChartInsights:评估多模态大语言模型进行低级图表问答。在 计算语言学协会:EMNLP 2024 论文集, 第12174–12200页, 2024. 2

[15] Junbin Xiao, Angela Yao, Yicong Li, 和 Tat-Seng Chua. 我能相信你的答案吗?视觉定位的视频问答。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 2024. 2

[16] Yuanhan Zhang, Bo Li, haotian Liu, Yong jae Lee, Liangke Gui, Di Fu, Jiashi Feng, Ziwei Liu, 和 Chunyuan Li. LLaVA-NeXT:一个强大的零样本视频理解模型。在线博客文章, 2024. 3

[17] Chujie Zheng, Hao Zhou, Fandong Meng, Jie Zhou, 和 Minlie Huang. 大型语言模型并非鲁棒的多项选择选择器。在 第十二届国际表征学习会议, 2024. 2

[18] Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P. Xing, Hao Zhang, Joseph E. Gonzalez, 和 Ion Stoica. 使用 MT-Bench 和 Chatbot Arena 评估 LLM-as-a-judge。在 神经信息处理系统进展 (NeurIPS), 数据集与基准测试轨道, 2023. 4, 6

9

发表评论