十年视觉语言AI模型的准确性与视觉认知误差演变

三分钟导读:该研究通过引入复杂社会行为(CSB)数据集,评估了2017-2025年间9个视觉语言模型在描述复杂场景时的表现,发现MLLMs在准确性上已接近人类水平,但仍存在空间依赖误差。

英文题目:Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

论文出处:arXiv 每日论文精选 · arXiv:2607.09654

原始论文:PDF / 论文页面

对应视频标题:十年视觉语言AI模型的准确性与视觉认知误差演变|推荐指数:★★★★★

这篇论文解决什么问题?

传统评估数据集(如MS-COCO)多包含简单场景,无法充分反映模型在复杂人类行为和社会互动场景下的视觉推理能力,且缺乏对具体视觉认知误差类型的系统性分析。

核心创新

  • 提出CSB数据集,专门用于评估复杂社会行为和互动场景。
  • 建立五类视觉认知误差分类体系:检测、识别、幻觉、场景理解和空间依赖。
  • 开发基于掩码范式的空间依赖误差(SDE)量化方法,比较模型与人类关注区域的差异。
  • 使用LLM-based相似度指标(Gemini-SI/GPT-SI)替代传统自动指标,以更贴合人类语义理解。

方法概览

构建了包含100张电影场景图像的CSB数据集,并与100张MS-COCO图像进行对比。评估了4个pre-MLLMs和5个MLLMs,使用Gemini-SI/GPT-SI指标衡量描述相似度,并通过掩码范式量化空间依赖误差。

逐图理解论文

背景:传统评估的局限性

背景:传统评估的局限性
Figure 1: (a) The reported performance of DNNs over the years in object recognition compared to human performance. The performance of the then state-of-the-art models exceeded human performance. (b) Reported performance of Multi-Modal Large-Language Models (MLLMs) in the scene description task on the MS-COCO dataset. The model’s performance is comparable to human performance. (c) Model descriptions for scenes with and without social interaction. The image on the left depicts a simple scene in which the models’ descriptions are similar to those observed in humans. The image on the right depicts a scene of complex social interactions among humans. We can clearly see that the human description captures the social interaction in the scene. In contrast, the pre-MLLM’s description does not capture the social interactions, while MLLMs do.

传统评估数据集如MS-COCO多包含简单场景,无法充分反映模型在复杂人类行为和社会互动场景下的视觉推理能力。此外,缺乏对具体视觉认知误差类型的系统性分析,限制了我们对模型能力的深入理解。

方法:CSB数据集的构建

方法:CSB数据集的构建
Figure 2: (a)Examples of images from the CSB (top left) and MS-COCO (top right) dataset. The CSB dataset includes images that showcase complex human behaviors and interactions. In contrast, the images from MS-COCO datasets have images with no people or people doing simple activities like walking, sitting, talking, etc. (b) 20 human descriptions are ranked based on how well they describe the image, and the top-ranked description is chosen as ground truth that is used for comparing the similarities of the models and other human descriptions. CSB images shown in this and subsequent figures were sampled from commercially released films and are shown under fair use for non-commercial academic research. Copyright remains with the respective rights holders.

研究构建了包含100张电影场景图像的CSB数据集,并与100张MS-COCO图像进行对比。CSB数据集包含复杂社会行为和互动场景,旨在评估模型在更真实、更具挑战性场景下的表现。

方法:空间依赖误差量化

方法:空间依赖误差量化
Figure 3: Example of the masking procedure used in our study to quantify spatial depen- dence errors. The masking procedure identifies the importance of a region of an image to the scene description by evaluating the impact on the scene description when that region is masked(occluded). This procedure is done for both human and model descriptions. The Spa- tial Dependence Error (SDE) uses the masking procedure to identify whether the model and the humans match (correlation) in the regions that are most important for them to provide a description.

开发基于掩码范式的空间依赖误差(SDE)量化方法。通过遮挡图像不同区域,分析模型与人类在生成描述时对图像区域的依赖差异,从而量化空间依赖误差。

实验:空间依赖误差发现

实验:空间依赖误差发现
Figure 7: (a) Example heatmaps showcasing the regions that are important for humans, UDC (pre-MLLM) and Gemini (MLLM). The MLLM and humans agree on the regions important for understanding the scene, whereas the pre-MLLM differs, leading to a spatial dependence error. (b) Summarizes the errors made by the models tested on our dataset. The spatial dependence errors (SDE) are significantly high across all pre-MLLMs, and the SDE errors in the CSB dataset are decreasing. The SDE errors are nearly identical across all models on the MS-COCO images.

空间依赖误差(SDE)对相似度影响最小,Gemini-SI为0.560。MLLMs在CSB上的SDE误差虽存在但呈下降趋势,而pre-MLLMs的SDE误差显著高于MLLMs,表明MLLMs在空间依赖方面有所改进。

实验与关键结果

  • 在CSB和MS-COCO数据集上对比pre-MLLMs和MLLMs的场景描述准确性。
  • 人工标注并分类模型生成的描述中的五类视觉认知误差。
  • 通过遮挡图像不同区域,分析模型与人类在生成描述时对图像区域的依赖差异。
  • 分析不同误差类型对描述相似度评分的影响程度。
  • MLLMs在CSB和MS-COCO上的表现均接近人类顶级描述水平,而pre-MLLMs在CSB上显著低于人类最低水平(第 11 页)
  • 检测、识别和幻觉误差对相似度影响最大,Gemini-SI降至0.405, 0.411, 0.381(第 15 页)
  • 空间依赖误差(SDE)对相似度影响最小,Gemini-SI为0.560(第 15 页)
  • MLLMs在CSB上的SDE误差虽存在但呈下降趋势,pre-MLLMs的SDE误差显著高于MLLMs(第 15 页)

阅读时需要注意

  • 仅评估了200张图像,样本量较小。
  • 误差分类主要依赖人工探测和提问,耗时且难以大规模扩展。
  • MLLMs内部架构不公开,导致部分误差分析需通过外部交互推断。
  • MLLMs的高性能可能部分源于训练数据中包含类似电影场景,尽管研究使用了未公开数据集验证,但仍需注意数据泄露可能性。
  • 空间依赖误差表明模型可能依赖与人类不同的视觉线索,这可能导致在特定情境下的不可靠性。
  • 研究结论主要基于场景描述任务,不能直接推广到其他视觉推理任务。

关联工作

  • Tong et al. [57]:指出MLLMs在视觉 grounding 和基础感知模式(如方向、计数)上仍存在不足。(第 18 页)
  • Zhang et al. [58]:发现MLLMs在理解图像文本中的讽刺方面存在显著差距,表明视觉检测不等于场景理解。(第 18 页)
  • Rosenberg et al. [56]:发现涉及空间和以代理为中心的推理任务在18个VLMs中均难以改进,与本研究SDE发现一致。(第 18 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

视觉-语言 AI 模型十年间准确率与视觉-认知误差的演变

Shravan Murlidaran a,1,*, Miguel P. Eckstein a,b,c,1

a 加州大学圣塔芭芭拉分校,心理与脑科学系,美国加利福尼亚州圣塔芭芭拉,93106 b 加州大学圣塔芭芭拉分校,计算机科学系,美国加利福尼亚州圣塔芭芭拉,93106 c 加州大学圣塔芭芭拉分校,电气与计算机工程系,美国加利福尼亚州圣塔芭芭拉,93106

摘要

在过去十年中,视觉-语言模型(VLMs)在视觉推理方面取得了显著进展。大多数评估使用了简单的场景(MS-COCO)和少量未经策展的人类描述作为基准,这些场景和描述并未展示人类互动或复杂社会行为(Complex Social Behavior, CSB)数据集,该数据集包含描绘复杂社会互动/行为的 100 张图像。在此,我们引入了复杂社会互动/行为数据集。我们分析了过去十年(2017-2025)中视觉-语言模型(四个多模态大语言模型之前的视觉语言模型,pre-MLLMs,以及五个多模态大语言模型,MLLMs)的场景描述进展。我们评估了模型在 CSB 数据集和 MS-COCO 样本上的准确率,并与黄金标准的人类描述进行了对比。我们分析了五种视觉-认知误差类型:目标检测、识别、幻觉、场景理解和空间依赖。CSB 数据集在场景描述准确率方面的提升比 MS-COCO 更为显著,pre-MLLMs 的准确率远低于排名最低的人类描述,而 MLLMs 的准确率则与排名最高的人类描述相当。我们表明,MLLMs 消除了较简单 MS-COCO 场景与描绘复杂行为的场景(CSB)之间在场景描述准确率上的差距。MLLMs 几乎消除了我们测试数据集中的所有误差类型,除了偶尔在场景描述中依赖与人类不同的图像区域(空间依赖误差)。我们还表明,检测、识别和幻觉误差对场景描述准确率的影响最大。总之,我们的研究结果提供了对视觉语言模型在过去十年中如何进步的更彻底评估。

电子邮件地址:smurlidaran@ucsb.edu (Shravan Murlidaran), eckstein@psych.ucsb.edu (Miguel P. Eckstein) 1 这些作者对本工作贡献同等。

  • 通讯作者。arXiv:2607.09654v1

第 2 页

关键词: 多模态大语言模型(MLLMs),图像理解,图像描述,描述错误分析,人类与 MLLM 的性能

1. 引言

图 1:(a) 多年来深度神经网络(DNNs)在物体识别任务中的报告性能与人类性能的对比。当时最先进的模型的性能超过了人类性能。(b) 多模态大语言模型(MLLMs)在 MS-COCO 数据集的场景描述任务中的报告性能。模型的性能与人类性能相当。(c) 具有社会互动和不具有社会互动的场景的模型描述。左侧图像描绘了一个简单场景,模型生成的描述与人类观察到的描述相似。右侧图像描绘了人类之间复杂的社会互动场景。我们可以清楚地看到,人类描述捕捉到了场景中的社会互动。相比之下,pre-MLLM 的描述未能捕捉社会互动,而 MLLMs 则能够捕捉。

自深度卷积神经网络(CNNs)发展以来,人工神经网络在视觉推理方面取得了显著进展

第 3 页

十年前 [1]。图 1a 展示了深度卷积神经网络(Deep CNNs)早期的景象,其中的模型在物体识别等任务上能够超越人类。深度循环神经网络 [2] 能够处理并生成文本等序列数据,结合深度卷积神经网络和图像-文本数据集 [3, 4, 5, 6, 7],催生了特定任务的多模态模型,这些模型能够根据图像提供描述 [8]、回答问题 [9]、进行视觉推理 [10, 11],或根据文本生成图像 [12]。Transformer 架构 [13] 的发展以及预训练方法的改进 [14],使得任务无关的多模态模型得以出现,这些模型只需极少的微调即可执行所有视觉语言任务 [15, 16]。除了这些进展外,数据和算力的增长也加速了多模态大语言模型(MLLMs)的发展,据称其已具备人类水平的推理能力。

通常,标准数据集中的图像是简单的场景(例如厨房、书桌或海滩场景的图像),不包含复杂的人类动作或社会互动。因此,这些数据集可能无法捕捉对日常视觉推断至关重要的人类行为和互动。与描述典型数据集中的简单场景相比,准确描述这些复杂场景对模型来说可能更具挑战性。图 1b 显示,当时最先进的视觉-语言模型(基于 2017 年至 2022 年间发表的相应模型论文 [17, 18, 19, 20] 中报告的值)在使用 BLEU-4 [21] 指标时,在这样数据集上的表现已接近人类水平。然而,图 1c 突显了 2017 年模型在捕捉复杂社会互动方面的不足。该图展示了来自 2017 年最先进的图像描述模型(UDC [17])和当前 MLLM(GPT-4o1 [22])对两个场景的描述:一个来自传统 MS-COCO [3] 数据集(左侧),另一个来自描绘复杂社会互动的电影场景(右侧)。值得注意的是,2017 年的模型在 MS-COCO 数据集上表现相当不错,与当前的 MLLMs 相当,但在 CSB 数据集中未能捕捉到复杂的社会互动。这表明,评估模型在场景理解方面的进展需要使用更具挑战性的场景数据集,这些数据集描绘了复杂的人类行为和互动。

此外,尽管视觉-语言模型在描述场景方面的能力有所提高,但关于哪些类型的错误随时间减少的研究却寥寥无几。最近的研究评估了这些模型的属性,如鲁棒性、偏见、公平性和毒性 [23]。其他研究分析了训练数据、模型架构以及训练或推理过程等因素如何影响模型的决策 [24],通过受控的图像扰动考察了 VLMs 在描述场景时的缺陷,揭示了当新对象插入图像时会出现误分类、遗漏和数量错误等错误 [25],并识别出图表描述中的事实错误 [26]。在本研究中,我们引入了一种新的视觉-认知错误分类法,以增进对模型在视觉推理方面遇到困难的理解,并评估哪些错误已被克服,哪些仍然存在。分

3

第 4 页

类别包括目标检测错误、目标识别错误 [27]、幻觉 [28]、场景理解以及空间依赖 [29]。

在此基础上,我们开发了复杂社会行为数据集(CSB),该数据集包含具有复杂社会互动和行为场景。利用该数据集,我们评估了过去十年中视觉-语言模型的演变情况。我们还对错误类型进行了分类,并考察了这些错误在过去十年中的演变趋势。

我们将九种在过去十年(2017-2025年)开发的视觉-语言模型相对于人类的表现进行了比较:Up-Down Captioner (UDC) [17]、Meshed Memory Transformer (M2M) [18]、OSCAR [19] 和 OFA [20] 是四种 pre-MLLM,而 GPT-4 [30]、Gemini [31]、GPT4-o1 [22]、GPT-5.1 和 Gemini3 [32] 是五种 MLLM。一些早期模型在当前平台上已无法运行,因此我们的评估(始于2019年的累积工作成果)在记录 MLLM 演变进展方面具有独特性。

为了与我们的 CSB 数据集进行对比,我们在来自广泛使用的 MS-COCO 数据集 [3] 的另一组图像上进行了相同的性能评估和错误分析。我们将模型和人类生成的图像描述与黄金标准描述进行评估。历史上,对于视觉-语言模型,研究通常使用基于句子结构的自动指标来评估模型描述 [21, 33, 34](BLEU, CIDER, ROUGE)。最近,开发了使用语言嵌入的改进指标,如 BERTScore [35],用于比较模型和人类的描述。在此,我们使用基于描述嵌入余弦相似度的 Gemini/GPT 相似度指数(Gemini-SI/GPT-SI)(类似于 BERTScore),我们证明其与人类评分的相关性优于 BERTScore(补充图 A.1)。

2. 方法

2.1. 图像 本研究使用了200张图像。其中,100张是从 MS-COCO 数据集中随机选择的。另外100张图像由十名研究助理(RAs)收集。研究助理被指示从电影场景中选择帧,这些帧可以提出需要关于社会互动或复杂人类行为进行推理的问题。图 2a 展示了本研究使用的 CSB 和 MS-COCO 数据集中的图像示例。图像样本量较小反映了分析每种模型错误类型所需的耗时工作(见第 2.5 节)。我们使用重采样自助统计法来量化由于图像样本量导致的模型准确性的变异性。

2.2. 模型 我们使用了九种不同的模型。其中五种利用了最先进的 MLLM 架构(GPT4 [30]、Gemini [31]、GPT4-o1 [22]、GPT-5.1 和 Gemini3 [32])。这些模型采用 Transformer 架构,并在海量数据上进行训练

4

第 5 页

图 2:(a) CSB(左上)和 MS-COCO(右上)数据集中的图像示例。 CSB 数据集包含展示复杂人类行为和交互的图像。 相比之下,MS-COCO 数据集中的图像要么没有人,要么有人在进行简单的活动,如走路、坐着、说话等。(b) 根据 20 个人类描述对图像的契合程度进行排名,排名最高的描述被选为ground truth,用于比较模型与其他人类描述之间的相似度。本图及后续图中展示的 CSB 图像是从商业发行的电影中采样得到的,出于非商业学术研究目的,依据合理使用原则展示。版权仍归各自的权利持有人所有。

图像-文本对数据集,通过强化学习技术 [36] 融入人类反馈。然而,关于其内部架构的详细信息公开有限。

其余四个模型是 pre-MLLM。其中,三个模型(M2M [18]、OSCAR [19] 和 OFA [20])使用 ResNet-101 CNN [37] 来提取图像特征。这些特征由 Transformer 编码器处理,该编码器表示一个联合的视觉-语言空间,随后由生成文本的 Transformer 解码器进行处理。UDC [17] 模型也包含一个 ResNet-101 CNN 图像骨干网络,但使用 LSTM(一种循环神经网络 [38])进行编码

5

第 6 页

以及解码,而非 Transformer。UDC 模型是专门为描述场景而训练的,无法执行其他任务。

M2M、OSCAR 和 OFA 是特定任务模型,但它们的编码器是在图像-文本对上进行预训练的,这使得跨任务的微调变得容易。此外,OFA 模型包含语言输入,文本特征由语言网络(BERT)处理。这使得跨不同任务的微调变得最少,因为文本输入提供了关于当前任务的额外上下文。

2.3. 人类对场景的描述 2.3.1. 收集 我们使用 Amazon Mechanical Turk 为每张图像收集了 20 条描述。参与者被指示描述场景的语义内容。在开始场景描述任务之前,我们提供了示例图像和描述,以确保参与者理解预期的格式。

2.3.2. 建立金标准描述的程序 这些描述由另一组 50 名 Mechanical Turk 工人进行排名。在每次试验中,参与者会看到一张图像及其 20 条描述中的 5 条。为了确保注意力集中,随机包含了来自其他图像的两条描述作为干扰项。参与者被要求选择与图像语义内容最匹配的描述。

每位参与者完成了 800 次试验(200 张图像 × 四种描述分割)。这意味着每位参与者为每张图像选择了四条描述。为了防止描述分割带来的偏差,每位参与者都获得了 20 条描述的独特分割。

描述根据获得“最佳”描述投票的数量进行排名。每张图像被选择次数最多的描述被指定为金标准。为了在捕捉人类描述变异性的同时减少比较,我们从剩余的 19 条描述中选择了排名最高的四条(top-ranked)和排名最低的四条(bottom-ranked)。这些描述用于将模型和人类生成的描述与金标准描述进行比较。相似度比较是使用基于 LLM 的指标进行的,如下文结果部分所述。

2.4. 多模态模型的输入文本 九种模型中的六种(一种 Pre-MLLM (OFA) 和所有 MLLM)需要输入文本和关联图像,模型基于这些生成输出。OFA 经过微调以使用输入文本“Describe Image”执行场景描述。对于 MLLM,使用以下输入文本来提示模型生成给定图像的描述。 输入文本提示:“用一句话尽可能准确地猜测这个场景中可能正在发生的事情。避免提及无助于理解场景上下文的物体。”

6

第 7 页

2.4.1. 用于评估描述与黄金标准描述相似度的 Gemini-SI/GPT-SI 指标 Gemini-SI 和 GPT-SI 是基于大语言模型的相似度(LLM-SI)指标,它们使用由 MLLM(如 Gemini 和 GPT [30, 31])生成的语言嵌入(3,072 维向量)来表示句子的语义内容,并计算这些嵌入之间的余弦相似度以量化语义相似度。

2.4.2. 将 Gemini-SI/GPT-SI 指标与场景描述的人类评分员进行比较 为了评估基于大语言模型的相似度(LLM-SI)指标,我们收集了人类评分,以将模型生成的描述(UDC、M2M 和 OSCAR)与黄金标准进行比较。

16 名 Mechanical Turk 工人参与了这项实验。在每次试验中,参与者对三个模型生成的描述与黄金标准之间的相似度进行评分。随后,将这些人类评分与 LLM-SI(Gemini-SI/GPT-SI)指标和 BERTScore [35] 进行相关性分析。补充图 A.1a 展示了这些比较的结果。图 2b 描绘了描述排名和评分流程的流程图。

2.5. 模型错误分类

2.5.1. Pre-MLLMs 由于所有 pre-MLLMs 都依赖 ResNet-101 架构来提取图像特征,因此检测和识别错误是基于 ResNet-101 模型的边界框预测和对象分类来确定的。

检测错误:未在描述中提及且没有关联边界框的相关对象被归类为检测错误。

识别错误:被错误分类的相关对象,或被错误识别并包含在描述中的不相关对象,被归类为识别错误。

场景理解错误:被正确识别但未包含在描述中的相关对象被视为场景理解错误。

幻觉:场景中不存在或被错误分类但在模型描述中被提及的对象构成幻觉 [28]。

2.5.2. MLLMs 由于 MLLMs 的架构并未公开,我们确定了模型生成的描述与人类描述存在偏差的图像,然后提出有针对性的问题以分类错误类型。

7

第 8 页

检测错误:如果描述中遗漏了相关物体,我们参考附近的参照物,询问模型是否能看见特定参照物附近的物体。如果模型未能检测到该物体,则将其归类为检测错误。示例问题:“站在墙边的人手中是否有物体?”

识别错误:我们要求模型命名被遗漏的物体。如果模型对该物体进行了错误分类,则标记为识别错误。示例问题:“站在墙边的人手中物体的名称是什么?”

场景理解错误:如果模型正确识别了某个物体,但在描述中仍将其遗漏,则将其归类为场景理解错误。

幻觉:如果模型描述了场景中不存在且并非简单误分类为其他物体的物体,则视为幻觉。为了验证物体是否被错误识别,我们分析了模型的描述,基于参照物确定潜在位置,并提出了与检测错误和识别错误类似的问题。

2.5.3. 使用掩码范式评估空间依赖误差: 最后一种误差类型衡量了模型与人类在哪些图像区域对描述有贡献这一问题上的一致性程度。如果模型和人类在生成场景描述时依赖图像的不同部分,我们将其分类为空间依赖误差。

为了评估场景描述对不同图像区域的依赖性,我们使用了掩码范式。遮挡掩码由一个带有柔和边缘的黑色不透明空间窗口组成,覆盖每幅图像的大约三分之一。这些掩码的位置各不相同。我们总共创建了 600 张掩码图像(200 张图像 × 3 种掩码位置)。

这些掩码图像的描述由 60 名 Mechanical Turk 工人收集(每种掩码条件 20 人)。每位工人仅查看每幅图像的一个掩码版本,以防止记忆效应影响其描述。

将掩码后的描述与黄金标准(未掩码)描述进行比较,以评估哪些图像区域对人类感知最为重要。对于模型,我们为每个掩码版本生成描述,并将其与未掩码图像生成的描述进行比较。图 3 说明了用于分析哪些图像区域影响模型和人类场景描述的掩码过程示例。相似度评估使用上述基于 LLM 的指标进行。

8

第 9 页

图 3:本研究中用于量化空间依赖误差(Spatial Dependence Error, SDE)的掩码过程示例。掩码过程通过评估掩蔽(遮挡)某区域对场景描述的影响,来确定图像中该区域对场景描述的重要性。该过程同时应用于人类和模型的描述。空间依赖误差(SDE)利用掩码过程来识别模型与人类在对其提供描述至关重要的区域上是否匹配(即相关性)。

如果模型与人类在描述中最关键图像区域存在显著差异,我们将其归类为空间依赖误差(SDE)。我们通过计算掩蔽三个区域后模型生成描述与人类生成描述之间的相似度评分的相关性,并将其与这些区域的平均人类间相关性进行比较,从而对此进行量化。如果模型-人类相关性低于人类间相关性两个标准差,则将其分类为空间依赖误差。

2.6. 统计分析 鉴于数据集较小(200 张图像),我们采用自助法(bootstrapping)来估计各项指标(与黄金标准相比的场景描述相似度和错误率)在图像间的变异性,从而推断其在图像总体中的泛化能力。每次分析共使用了 10,000 次图像自助重采样。由于模型性能比较涉及超过 15 次统计比较,我们使用 Benjamini-Hochberg 方法 [39] 对错误发现率(False Discovery Rate, FDR)进行了显著性水平校正。相应地报告了调整后的 p 值(q 值)。

9

第 10 页

3. 结果

我们选取了一个包含 100 张描绘复杂社会互动和行为(CSB)的图像数据集,以及来自广泛使用的 MS-COCO 数据集 [3] 的 100 张图像。图 2a 展示了本研究中使用的一些图像示例。我们使用了九种视觉-语言模型:四种 pre-MLLM(UDC、OSCAR、M2M、OFA)和五种 MLLM(GPT-4、Gemini、GPT-4o1、GPT5.1 和 Gemini3)。所有被评估的 pre-MLLM 均包含一个目标检测组件,并采用完全训练的 Faster R-CNN 模型。OSCAR、M2M 和 OFA 使用 Transformer 架构的变体来编码组合的视觉-语言特征空间,经过微调后,从该空间生成给定输入图像的描述。另一方面,UDC 使用 LSTM 来实现这一目的。多模态大语言模型(MLLM)也依赖于 Transformer 架构,但其模型细节并未公开。

3.1. 视觉-语言模型在提供描绘复杂社会互动的场景的人类级别描述方面的演进

3.1.1. 金标准描述 为了获得高质量的金标准描述,我们收集了数据集中每张图像的 20 条人工生成的描述。随后,一个由 50 名参与者组成的独立小组根据这些描述与每个场景的匹配程度对这些描述进行排名。每张图像排名最高的描述被指定为金标准,并用于与模型生成的描述及其他人工描述进行比较。在剩余的 19 条人工描述中,排名最高的四条被归类为“排名靠前”,排名最低的四条被归类为“排名靠后”。图 2b(左)展示了一张示例图像以及人工和模型生成的描述。

3.1.2. 描述比较的语义相似度度量 为了比较模型在 CSB 和 MS-COCO 数据集上与人工描述的性能,我们使用文本嵌入的余弦相似度来衡量模型生成的描述与金标准之间的相似度。这些嵌入是从 Gemini(Gemini 相似度指数,Gemini-SI)[31] 和 GPT(GPT 相似度指数,GPT-SI)[30] 等大语言模型中获得的。文本嵌入是表示句子在高维空间中语义意义的数值向量。在该空间中,语义相似的句子由彼此更接近的向量表示。

我们通过将 GPT-SI 和 Gemini-SI 与人工评分进行比较,验证了使用 GPT-SI 和 Gemini-SI 的有效性。为此,我们收集了 20 名人工评分员对场景描述对的相似度评分,这些描述对比较了三种模型(UDC、M2M 和 OSCAR)与金标准。我们发现,对于所有三种模型,GPT-SI 和 Gemini-SI 与个体人工评分员的平均相关性均高于人工评分员之间的平均相关性(Bootstrap,p < 0.001)(参见补充图 A.1a)。图 2b(右)展示了提供的评分。

10

第 11 页

人类与 LLM-SI(Gemini-SI 和 GPT-SI)针对模型生成的描述与黄金标准(gold standard)进行的比较。

3.1.3. 人类与模型描述的语义相似度,2017-2025 图 4a 展示了来自 MS-COCO 数据集和 CSB 数据集的示例图像,以及过去十年开发的模型提供的描述。该示例表明,即使在 2017 年,图像描述模型也能描述 MS-COCO 数据集中的许多场景,并且多模态大语言模型(MLLM)的引入改善了这些描述。然而,更具挑战性的 CSB 数据集显示,随着 MLLM 的引入,视觉常识推理能力有了显著提高。图 4b 展示了在两个数据集中通过 Gemini-SI(左)和 GPT-SI(右)评估的模型性能。平均而言,多模态大语言模型之前的视觉语言模型(pre-MLLM)在 CSB 图像上的表现显著差于 MS-COCO 图像(Bootstrap,p < 0.0001),而 MLLM 在两组图像上的表现相似。所有 MLLM 的性能均接近两个数据集中排名最高的人类表现(虚线)。在 MS-COCO 数据集上,pre-MLLM 的表现处于排名最低的人类水平,而在 CSB 数据集上,其表现显著低于排名最低的人类(Bootstrap,p < 0.0001)。

MLLM 表现优异的一个可能解释是,CSB 数据集中的图像(由在线可用的电影场景组成)可能已成为 MLLM 庞大训练数据的一部分。为了排除这种解释,我们还在一个包含 100 张图像的自有数据集上测试了所有 MLLM 和一个 pre-MLLM(OFA)(参见补充图 4c),这些图像在(这些模型发布时)未发布在网上,因此模型在训练期间未见。我们发现自有图像的趋势与电影场景相似,MLLM 的性能接近人类,而 OFA 模型的表现显著低于人类(Bootstrap,p < 0.0001)。

3.2. 模型犯何种错误? 为了更好地理解模型的演变,我们分析了每个模型在生成描述时所犯的错误类型。典型的视觉-语言模型由两个主要组件组成:目标检测器和编码器-解码器架构,这两者都可能在描述中引入错误。我们基于视觉科学和认知心理学的概念对这些错误进行了分类。

3.2.1. 检测错误 当模型未能检测到图像中的相关对象时,就会发生检测错误。如果某个对象出现在黄金标准的人类描述中且存在于场景中,则被视为相关对象。如图 5a 所示,人类在描述中识别出了手电筒,使其成为一个相关对象。然而,

11

第 12 页

图 4:(a) 来自 MS-COCO 数据集(左)和 CSB 数据集(右)的样本图像的模型描述演变。对于 MS-COCO 图像,模型描述与人类描述相似。相比之下,与人类相比,pre-MLLM 在 CSB 数据集上的表现较差,而 MLLM 产生的描述与人类相似。(b) 在两个数据集中,使用 Gemini-SI(左)和 GPT-SI(右)指标评估了模型和人类的表现。两个指标均显示,pre-MLLM 在 CSB 数据集上的表现显著低于在 MS-COCO 数据集上的表现,并且这些模型在 CSB 数据集上显著差于排名最低的人类描述,而在 MS-COCO 数据集上则与排名最低的人类描述相当。MLLM 在两个数据集上的表现相似,且与排名最高的人类描述相当。(c) MLLM 和一个 pre-MLLM(OFA)在内部复杂社会行为数据集上的表现,与本研究使用的数据集上的结果进行比较。使用该数据集是为了确保 MLLM 的表现并非源于在训练过程中见过我们数据集中的这些图像的可能性。我们发现,即使在内部 CSB 数据集上,模型的表现也与人类表现相似。

12

第 13 页

图 5:(a) pre-MLLM 和 MLLM 产生的检测错误示例。相关性对象是根据其在人类黄金标准描述中的存在来定义的。UDC 模型未能检测到手电筒,而 Gemini 模型检测到了。与 MS-COCO 数据集相比,pre-MLLM 在 CSB 数据集上的检测错误显著更多,而 MLLM 在检测所有对象时大多准确。(b) pre-MLLM 和 MLLM 产生的识别错误示例。模型错误地识别了检测到的对象。UDC 模型将门口错误地识别为镜子,而 Gemini 模型将墙上的灯错误地识别为另一把枪。与检测错误一样,pre-MLLM 在 CSB 数据集中的错误显著高于在 MS-COCO 数据集中的错误。

UDC (pre-MLLM) 模型未能检测到它,而 Gemini (MLLM) 模型正确地识别了它。与 MS-COCO 数据集相比,pre-MLLM 在 CSB 数据集中的检测错误显著更多(bootstrap,p < 0.001),而 MLLM 在大多数情况下准确地检测到了对象。

3.2.2. 识别错误 当模型:1) 错误分类相关对象,或 (2) 错误识别无关对象并在描述中错误提及该对象时,就会发生识别错误。图 5b 提供了一个示例:UDC (pre-MLLM) 模型检测到了门口,但将其错误识别为镜子,而 Gemini 模型将灯错误识别为第二把枪。与 MS-COCO 数据集相比,pre-MLLM 在 CSB 数据集中的识别错误显著更高(bootstrap,p < 0.001),且错误率随时间呈下降趋势。所有模型在 MS-COCO 数据集上的对象识别表现良好。

3.2.3. 场景理解错误 当模型识别了相关对象但未在描述中提及这些对象时,就会发生场景理解错误。如图 6a 所示,UDC 模型识别了场景中的人物,但未在描述中提及,而 Gemini 模型识别了医院病房,但未将其包含在描述中。与 MS-COCO 数据集相比,pre-MLLM 在 CSB 数据集中的场景理解错误显著更高(bootstrap,p < 0.01),而 MLLM 在这两个数据集中此类错误都很少。

13

第 14 页

图 6:(a) pre-MLLM 和 MLLM 在场景理解错误方面的示例。 当模型在其描述中未能提及正确识别的相关对象时,就会发生这些错误。UDC 模型正确识别了图像中的人物,但未能在其描述中提及他们。同样,Gemini 模型正确识别出这是一间医院病房,但未能在其描述中提及。我们观察到,与 MS-COCO 数据集相比,pre-MLLMs 在 CSB 数据集上的场景理解错误显著更多。相比之下,MLLMs 在 MS-COCO 数据集上的错误率相似。(b) pre-MLLM 和 MLLM 产生幻觉的示例。幻觉是指模型描述中提及的对象,但这些对象既不存在于图像中,也未被模型正确识别。当飞盘不存在或被误认时,UDC 模型会产生飞盘的幻觉。在我们的数据集中,Gemini (MLLM) 模型没有产生幻觉。pre-MLLMs 在 CSB 数据集上的错误率显著高于 MS-COCO 数据集,而 MLLMs 在这两个数据集中均表现出极少幻觉。

3.2.4. 幻觉 幻觉 [28] 发生在模型描述了一个既未被模型识别也不存在于图像中的对象时。这些对象可以被描述为模型的“想象”,这可能发生在模型的预训练数据集中包含类似图像且这些图像中存在被幻觉化的对象时。图 6b 显示了一个 UDC 模型错误提及飞盘的示例。与 MS-COCO 数据集相比,pre-MLLMs 在 CSB 数据集上产生了显著更多的幻觉错误(自助法,p < 0.0001),而 MLLMs 的幻觉极少。

3.2.5. 空间依赖误差 空间依赖误差 (SDE) 发生在人类和模型依赖不同的图像区域来生成描述时。为了估算这一点,我们一次掩蔽图像三分之一区域。我们在掩蔽每个图像区域后收集人类和模型的描述,并将这些描述与模型/人类对应的黄金标准描述进行比较相似度(参见方法)。图 3 展示了掩蔽过程的详细概述。掩蔽区域相似度评分越低,表明掩蔽该区域对生成的描述有显著影响。当关键

14

第 15 页

图 7:(a) 示例热力图展示了人类、UDC(pre-MLLM)和 Gemini(MLLM)认为重要的区域。MLLM 与人类在理解场景所需的重要区域上达成一致,而 pre-MLLM 则存在差异,从而导致空间依赖误差(SDE)。(b) 总结了在我们数据集上测试的模型所犯的错误。所有 pre-MLLM 的空间依赖误差(SDE)均显著较高,且 CSB 数据集中的 SDE 误差呈下降趋势。在 MS-COCO 图像上,所有模型的 SDE 误差几乎相同。

当人类和模型使用的区域不一致时,记录一个 SDE。使用 LLM-SIs(GPT-SI 和 Gemini-SI)来评估这些相似度。

在图 7a 所示的示例中,热力图说明了描述生成所依赖的重要区域。人类和 UDC(pre-MLLM)模型依赖于不同的区域,而 Gemini(MLLM)模型依赖的区域与人类选择的区域相似。图 7b 表明,CSB 数据集中所有模型的 SDE 误差显著更高。然而,多年来,该数据集中的误差在所有模型中均呈下降趋势。相比之下,MS-COCO 数据集中的 SDE 误差在所有模型中保持相对稳定。

3.2.6. 模型误差对相似度评分的影响

为了量化不同类型的误差如何影响人类描述与模型描述之间的相似度,我们计算了所有模型-图像对的平均 Gemini-SI 得分,并根据存在的误差类型对结果进行了分组。在图 8 中,虚线表示未识别出任何错误的图像的平均相似度基线得分 0.71。检测、识别和幻觉误差对相似度造成的降低幅度最大,将平均 Gemini-SI 分别降至 0.405、0.411 和 0.381。相比之下,场景理解误差对描述相似度的影响显著小于检测、识别和幻觉误差(Gemini-SI = 0.467,bootstrap,p < 0.04),而空间依赖误差的整体影响最小(Gemini-SI = 0.560,bootstrap,p < 0.0001)。

总体而言,这些发现表明 MS-COCO 和 CSB 数据集之间的错误率存在显著差异。特别是,MS-COCO 数据集上的 pre-MLLM 的检测、识别和幻觉错误率低于场景理解错误率。对于 CSB 数据集,pre-MLLM 的检测……

15

第 16 页

图 8:(a) Gemini-SI 作为错误类型的函数,对所有模型和包含该错误类型的图像进行平均。虚线表示所有模型-图像对的平均相似度,其描述中无错误。检测、识别和幻觉错误对模型的场景描述影响最大,其次是场景理解和空间依赖误差。

识别和幻觉错误率更接近场景理解错误率,这可能与 CSB 数据集中较小物体的关键作用有关。此外,对于两个数据集,MLLM 在所有错误类型上的错误率均有所降低。对于 MLLM 而言,唯一仍然显著的错误类型是空间依赖误差,这表明 MLLM 在描述场景时有时会依赖与人类不同的图像区域。

4. 讨论

人类与模型之间的比较涵盖了广泛的任务,包括轮廓检测、视觉失真下的识别性能 [40]、合成任务的视觉推理 [41]、抽象与推理 [42]、语言表征 [43]、真实世界场景中的视觉搜索 [44]、航拍场景理解 [45]、图像描述 [46, 47]、注视感知 [48] 以及医学图像中的病变检测 [49, 50]。

本研究评估了过去十年视觉-语言模型的演变,并将其与人类理解场景的能力进行了比较。我们选择了四个多模态大语言模型之前的视觉语言模型(pre-MLLMs)(UDC [17]、M2M [18]、OSCAR [19] 和 OFA [20])以及五个 MLLM(GPT4 [30]、Gemini [31]、GPT4-o1 [22]、GPT-5.1 和 Gemini3 [32]),这些模型涵盖了过去十年中最先进模型的范围。计算机科学领域使用的传统数据集 [3, 4, 5, 6, 7] 通常包含简单的图像,

16

第 17 页

理解,并且过去十年中的所有模型表现都相对较好,尽管很明显当前的 MLLM 远优于其他模型。我们创建了复杂社会行为数据集(CSB),描绘了复杂的人类行为和社会互动。此外,我们从 MS-COCO 数据集 [3] 中选取了 100 张代表性图像,并评估了模型在这两个数据集中描述图像的性能。

总体而言,我们的研究结果表明,对过去十年模型演变的评估因图像集的不同(MS-COCO 与 CSB)而有显著差异。使用 CSB 图像进行评估显示,在描绘复杂人类行为和社会互动的图像方面,pre-MLLM 与 MLLM 之间存在显著的性能提升。使用 MS-COCO 图像进行评估则显示出较为 modest 的提升。此外,我们的研究结果强调,MLLM 缩小了 MS-COCO 和 CSB 图像之间的性能差距。pre-MLLM 在这两个数据集之间表现出巨大的性能差距,而 MLLM 在较简单的 MS-COCO 数据集和 CSB 数据集上的性能几乎相同。在 CSB 数据集上与人类进行的比较也显示,pre-MLLM 的性能低于排名靠后的人类水平。相比之下,MLLM 的性能接近排名靠前的人类水平。

除了性能评估外,理解跨图像集的表现对于促进未来的模型改进以及帮助用户建立对模型输出的信任至关重要。为此,可解释人工智能(XAI)领域 [51] 引入了许多方法来理解模型如何做出决策。一些方法考察某些特征的变化如何影响模型的输出,而另一些方法则估计每个特征对最终预测的贡献程度 [52, 53, 54]。还有一些方法将数据集中的示例组织成原型(代表典型情况)和批评(突出模型遇到困难的地方)[55]。大多数这些方法都侧重于解释单个输入,因此无法提供对整个数据集上的解释进行统计摘要的简便方法。此外,由于当前 MLLM 的架构并未公开,因此开发不依赖访问内部模型组件的技术尤为重要。为了理解这些模型的不足之处,我们开发了一种新技术来对图像描述生成中的模型错误进行分类。这些错误包括目标检测错误、目标识别错误 [27]、幻觉 [28]、场景理解错误以及空间依赖误差 [29]。

我们发现,对于描绘复杂社会行为的图像,所有类型的错误都有显著减少,且对于当前的 MLLM 而言,错误几乎可以忽略不计。MLLM 将这些 CSB 图像的错误率降低到了与 MS-COCO 相当的水平,而 pre-MLLM 对于 CSB 图像相对于 MS-COCO 在所有错误类型上显示出高得多的错误率。唯一的例外是空间依赖误差,虽然其在 CSB 数据集中有所减少,但仍然是 MLLM 的错误来源之一。这一结果表明,人类和 MLLM 有时可能依赖图像的不同部分来生成场景

17

第 18 页

描述。

我们分析的另一个结果是,检测、识别和幻觉错误对降低与黄金标准之间的语义相似度的贡献最大。在 MLLM 中剩余的误差类型(空间依赖)对降低模型描述与黄金标准之间语义相似度的贡献最小。这种持续存在的空间依赖误差与 [56] 的最新研究一致,他们发现,需要空间和以代理为中心推理的与功能相关任务,在 18 种 VLM 中始终难以改善,即使经过提示工程和新模型版本的发布也是如此。他们的研究结果表明,这反映了对从二维图像中的三维场景内的具身代理进行推理存在更深层的困难。

当前研究的一个局限性在于我们仅评估了 200 张图像。与大型数据集评估相比,这可能被视为样本量较小。我们的主要瓶颈在于误差类型的分析,这需要针对数据集中的每张图像手动探测模型。对于 pre-MLLM,检测、识别和场景理解误差均由人工处理。对于 MLLM,我们提出了一系列问题以确定物体检测、识别、视觉-语言以及幻觉误差。尽管如此,通过使用自助重采样方法来评估 CSB 和 MS-COCO 数据集之间以及其他效应的统计差异,我们的分析考虑了图像间的变异性。

我们的发现不应被解读为暗示 MLLM 在所有感知任务中已达到人类水平性能。其他人揭示了 MLLM 的剩余局限性。Tong 等人 [57] 引入了一种使用问答来分析由 MLLM 视觉组件引起的误差的框架,而 Zhang 等人 [58] 引入了一个新数据集,以研究 MLLM 在图像关联文本中对讽刺的推理和认知理解方面的不足,这是一种需要超越理解场景视觉细节才能实现良好表现的能力。Tong 等人 [57] 表明,尽管这些模型在推理任务上表现良好,但它们仍然缺乏稳健的视觉接地,并且在基本感知模式(如方向、计数和空间关系)方面存在困难。同样,Zhang 等人 [58] 证明,大多数最先进的 MLLM 在讽刺理解方面存在显著差距,这表明视觉检测元素并不等同于理解场景。我们的技术与 Tong 等人 [57] 和 Zhang 等人 [58] 的技术一样,是模型无关的,仅基于模型的输入和输出进行操作,使我们能够分析不同模型组件的不足如何导致生成描述中的误差。

总体而言,我们开发了一种新技术,通过分析视觉认知过程中误差来源来评估视觉-语言模型的能力。所提出工作的一个独特之处在于,它可以应用于跨越十年的模型,尽管许多早期模型在当前硬件上难以轻松运行。

18

第 19 页

ware。这些误差可能解释了在 pre-MLLM 阶段人类与模型视觉推理能力之间的实际差距,也有助于我们在需要更复杂推理的场景中探究人类和当前 MLLM 的表现。

生成式 AI 和 AI 辅助技术在写作过程中的声明

作者撰写了论文初稿。第一作者使用 Grammarly 和 ChatGPT 以提高全文的可读性和语法规范性。作者进一步编辑了内容,以确保清晰度和语气恰当。作者对发表文章的内容承担全部责任。

利益冲突声明

作者声明不存在利益冲突。

19

第 20 页

补充材料

图 A.1:(a) LLM-SI 和 BERTScore 指标与人类评估者之间的相关性,这些数据是为比较 UDC、M2M 和 OSCAR 模型描述与人类黄金标准描述之间的相似性而收集的。LLM-SI 的相关性显著高于 20 位人类评估者之间的平均人际相关性,表明这些指标可以替代人类评估者。BERTScore 的性能与人际相关性相当。

参考文献

[1] A. Krizhevsky, I. Sutskever, G. E. Hinton, Imagenet classification with deep convolutional neural networks, Advances in neural information processing systems 25 (2012).

[2] H. Salehinejad, S. Sankar, J. Barfett, E. Colak, S. Valaee, Recent advances in recurrent neural networks, arXiv preprint arXiv:1801.01078 (2017).

[3] T.-Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Dol- lár, C. L. Zitnick, Microsoft coco: Common objects in context, in: Euro- pean conference on computer vision, Springer, 2014, pp. 740–755.

20

第 21 页

[4] P. Sharma, N. Ding, S. Goodman, R. Soricut, Conceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image Cap- tioning, in: Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, Melbourne, Australia, 2018, pp. 2556–2565. doi:10.18653/v1/P18-1238. URL https://www.aclweb.org/anthology/P18-1238

[5] S. Antol, A. Agrawal, J. Lu, M. Mitchell, D. Batra, C. L. Zitnick, D. Parikh, Vqa: Visual question answering, in: Proceedings of the IEEE international conference on computer vision, 2015, pp. 2425–2433.

[6] Q. Wu, D. Teney, P. Wang, C. Shen, A. Dick, A. Van Den Hengel, Visual question answering: A survey of methods and datasets, Computer Vision and Image Understanding 163 (2017) 21–40.

[7] R. Zellers, Y. Bisk, A. Farhadi, Y. Choi, From recognition to cognition: Vi- sual commonsense reasoning, in: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 2019, pp. 6720–6731.

[8] F. Chen, X. Li, J. Tang, S. Li, T. Wang, A survey on recent advances in image captioning, in: Journal of Physics: Conference Series, Vol. 1914, IOP Publishing, 2021, p. 012053.

[9] S. Manmadhan, B. C. Kovoor, Visual question answering: a state-of-the-art review, Artificial Intelligence Review 53 (8) (2020) 5705–5745.

[10] F. He, Y. Wang, X. Miao, X. Sun, Interpretable visual reasoning: A survey, Image and Vision Computing 112 (2021) 104194.

[11] R. Y. Zakari, J. W. Owusu, H. Wang, K. Qin, Z. K. Lawal, Y. Dong, Vqa and visual reasoning: An overview of recent datasets, methods and challenges, arXiv preprint arXiv:2212.13296 (2022).

[12] M. Elasri, O. Elharrouss, S. Al-Maadeed, H. Tairi, Image generation: A review, Neural Processing Letters 54 (5) (2022) 4609–4646.

[13] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, I. Polosukhin, Attention is all you need, Advances in neural information processing systems 30 (2017).

[14] X. Han, Z. Zhang, N. Ding, Y. Gu, X. Liu, Y. Huo, J. Qiu, Y. Yao, A. Zhang, L. Zhang, et al., Pre-trained models: Past, present and future, AI Open 2 (2021) 225–250.

[15] Y. Du, Z. Liu, J. Li, W. X. Zhao, A survey of vision-language pre-trained models, arXiv preprint arXiv:2202.10936 (2022).

[16] J. Zhang, J. Huang, S. Jin, S. Lu, Vision-language models for vision tasks: A survey, IEEE Transactions on Pattern Analysis and Machine Intelligence (2024).

21

第 22 页

[17] P. Anderson, X. He, C. Buehler, D. Teney, M. Johnson, S. Gould, L. Zhang, 基于自下而上和自上而下注意力的图像描述与视觉问答,在:IEEE 计算机视觉与模式识别会议论文集,2018,第 6077–6086 页。

[18] M. Cornia, M. Stefanini, L. Baraldi, R. Cucchiara, 用于图像描述的网格记忆转 换器,在:IEEE/CVF 计算机视觉与模式识别会议论文集,2020,第 10578–10587 页。

[19] X. Li, X. Yin, C. Li, P. Zhang, X. Hu, L. Zhang, L. Wang, H. Hu, L. Dong, F. Wei, 等,OSCAR:面向视觉-语言任务的对象-语义对齐预训练,在:欧洲计算机视觉会议,Springer, 2020,第 121–137 页。

[20] P. Wang, A. Yang, R. Men, J. Lin, S. Bai, Z. Li, J. Ma, C. Zhou, J. Zhou, H. Yang,OFA:通过简单的序列到序列学习框架统一架构、任务和模态,在:国际机器学习会议,PMLR,2022,第 23318–23340 页。

[21] K. Papineni, S. Roukos, T. Ward, W.-J. Zhu,Bleu:一种机器翻译自动评估方法,在:第 40 届计算语言学协会年会议论文集,2002,第 311–318 页。

[22] A. Jaech, A. Kalai, A. Lerer, A. Richardson, A. El-Kishky, A. Low, A. Hel- yar, A. Madry, A. Beutel, A. Carney, 等,OpenAI o1 系统卡片,arXiv 预印本 arXiv:2412.16720 (2024)。

[23] P. Liang, R. Bommasani, T. Lee, D. Tsipras, D. Soylu, M. Yasunaga, Y. Zhang, D. Narayanan, Y. Wu, A. Kumar, 等,语言模型的整体评估,arXiv 预印本 arXiv:2211.09110 (2022)。

[24] Y. Dang, K. Huang, J. Huo, Y. Yan, S. Huang, D. Liu, M. Gao, J. Zhang, C. Qian, K. Wang, 等,可解释且可理解的 多模态大语言模型:综合综述,arXiv 预印本 arXiv:2412.02104 (2024)。

[25] B. Yu, Z. Zhong, X. Qin, J. Yao, Y. Wang, P. He,图像描述系统的自动化测试,在:第 31 届 ACM SIGSOFT 国际软件测试与分析研讨会论文集,2022,第 467– 479 页。

[26] K.-H. Huang, M. Zhou, H. P. Chan, Y. Fung, Z. Wang, L. Zhang, S.-F. Chang, H. Ji,Lvlms 是否理解图表?分析并纠正图表描述中的事实 错误,在:计算语言学协会论文集:ACL 2024,2024,第 730–749 页。

[27] K. Saleh, S. Szénási, Z. Vámossy,通用目标检测中的遮挡处理:综述,在:2021 IEEE 第 19 届世界应用机器智能与信息学研讨会 (SAMI),IEEE,2021,第 000477– 000484 页。

22

第 23 页

[28] A. Rohrbach, L. A. Hendricks, K. Burns, T. Darrell, K. Saenko, 图像描述中的物体幻觉, arXiv:1809.02156 [cs]ArXiv: 1809.02156 (2019年3月). URL http://arxiv.org/abs/1809.02156

[29] F. Craig, F. Margari, A. R. Legrottaglie, R. Palumbi, C. De Giambattista, L. Margari, 自闭症谱系障碍和注意缺陷多动障碍中执行功能缺陷综述, 神经精神疾病与治疗 (2016) 1191–1202.

[30] J. Achiam, S. Adler, S. Agarwal, L. Ahmad, I. Akkaya, F. L. Aleman, D. Almeida, J. Altenschmidt, S. Altman, S. Anadkat, 等, Gpt-4 技术报告, arXiv 预印本 arXiv:2303.08774 (2023).

[31] G. Team, P. Georgiev, V. I. Lei, R. Burnell, L. Bai, A. Gulati, G. Tanzer, D. Vincent, Z. Pan, S. Wang, 等, Gemini 1.5: 解锁跨越数百万令牌上下文的 multimodal 理解, arXiv 预印本 arXiv:2403.05530 (2024).

[32] G. Team, A. Kamath, J. Ferret, S. Pathak, N. Vieillard, R. Merhej, S. Per- rin, T. Matejovicova, A. Ramé, M. Rivière, 等, Gemma 3 技术报告, arXiv 预印本 arXiv:2503.19786 (2025).

[33] M. Kilickaya, A. Erdem, N. Ikizler-Cinbis, E. Erdem, 重新评估图像描述的自动指标, 在: 计算语言学欧洲协会第15届会议论文集: 第1卷, 长论文, 2017, 第199–209页.

[34] G. Luo, L. Cheng, C. Jing, C. Zhao, G. Song, 图像描述模型、评估指标和数据集的全面综述, IET图像 处理 16 (2) (2022) 311–332.

[35] T. Zhang, V. Kishore, F. Wu, K. Q. Weinberger, Y. Artzi, Bertscore: 使用 bert 评估文本生成, arXiv 预印本 arXiv:1904.09675 (2019).

[36] S. Chaudhari, P. Aggarwal, V. Murahari, T. Rajpurohit, A. Kalyan, K. Narasimhan, A. Deshpande, B. C. da Silva, Rlhf deciphered: 对大语言模型人类反馈强化学习的批判性分析, arXiv 预印本 arXiv:2404.08555 (2024).

[37] K. He, X. Zhang, S. Ren, J. Sun, 用于图像识别的深度残差学习, 在: IEEE计算机视觉与模式识别会议论文集, 2016, 第770–778页.

[38] Y. Yu, X. Si, C. Hu, J. Zhang, 循环神经网络综述: Lstm 单元和网络架构, 神经计算 31 (7) (2019) 1235–1270.

23

第 24 页

[39] Y. Benjamini, Y. Hochberg, 控制错误发现率:一种实用且强大的多重检验方法,《皇家统计学会杂志:B 系列(方法论)》57 (1) (1995) 289–300。

[40] S. Dodge, L. Karam, 视觉失真下人类与深度学习识别性能的研究与比较,在:2017 年第 26 届计算机通信与网络国际会议 (ICCCN),IEEE,2017,第 1–7 页。

[41] C. Firestone, 人类与机器比较中的表现与能力,《美国国家科学院院刊》117 (43) (2020) 26562–26571,ISBN: 9781905334117 出版商:美国国家科学院 栏目:观点。doi:10.1073/pnas.1905334117。 URL https://www.pnas.org/content/117/43/26562

[42] F. Chollet, 论智力的度量,arXiv:1911.01547 [cs]ArXiv: 1911.01547 (2019 年 11 月)。 URL http://arxiv.org/abs/1911.01547

[43] C. R. Jones, B. Bergen, S. Trott, 多模态大语言模型与人类是否以相似方式对语言进行 grounding?,《计算语言学》50 (4) (2024) 1415–1440。

[44] M. P. Eckstein, K. Koehler, L. E. Welbourne, E. Akbas, 人类而非深度神经网络,经常错过场景中的巨大目标,《当代生物学》27 (18) (2017) 2827–2832.e3。doi:10.1016/j.cub.2017.07.068。 URL https://www.sciencedirect.com/science/article/pii/S0960982217309727

[45] A. Deza, A. Surana, M. P. Eckstein, Faster R-CNN 在人机协同搜索中的评估,在:2019 IEEE/CVF 计算机视觉与模式识别会议 (CVPR),IEEE,美国加利福尼亚州长滩,2019,第 3180–3189 页。doi:10.1109/CVPR.2019.00330。 URL https://ieeexplore.ieee.org/document/8954423/

[46] Q. Wang, A. B. Chan, 像人类一样描述:论图像描述中的多样性,在:IEEE/CVF 计算机视觉与模式识别会议论文集,2019,第 4195–4203 页。

[47] Z. Wang, B. Feng, K. Narasimhan, O. Russakovsky, 迈向独特且信息丰富的图像描述,在:欧洲计算机视觉会议,Springer,2020,第 629–644 页。

[48] N. X. Han, W. Y. Wang, M. P. Eckstein, 人类与基于 CNN 模型的视线感知,arXiv 预印本 arXiv:2104.08447 (2021)。

[49] M. A. Lago, A. Jonnalagadda, C. K. Abbey, B. B. Barufaldi, P. R. Bakic, A. D. A. Maidment, W. K. Leung, S. P. Weinstein, B. S. Englander, M. P. Eckstein, 对三维图像的探索不足导致对显著小目标的搜索错误,《当代生物学》(2021 年 1 月)。

24

第 25 页

doi:10.1016/j.cub.2020.12.029. URL https://www.sciencedirect.com/science/article/pii/S0960982220318819

[50] A. Jonnalagadda, B. B. Barufaldi, A. D. Maidment, S. P. Weinstein, C. K. Abbey, M. P. Eckstein, 卷积神经网络模型观察者在虚拟数字乳腺断层合成体模的搜索过程中对类信号解剖结构的折扣, Journal of Medical Imaging 12 (5) (2025) 051809–051809.

[51] F. Xu, H. Uszkoreit, Y. Du, W. Fan, D. Zhao, J. Zhu, 可解释人工智能:历史、研究领域、方法和挑战的简要综述, in: 自然语言处理与中文计算:第8届CCF国际会议, NLPCC 2019, 中国敦煌, 2019年10月9–14日, 论文集, 第II部分 8, Springer, 2019, pp. 563–574.

[52] M. T. Ribeiro, S. Singh, C. Guestrin, “我为什么要信任你?”解释任何分类器的预测, in: 第22届ACM SIGKDD国际知识发现与数据挖掘会议论文集, 2016, pp. 1135–1144.

[53] R. R. Selvaraju, M. Cogswell, A. Das, R. Vedantam, D. Parikh, D. Ba- tra, Grad-cam: 通过基于梯度的定位从深度网络中获取视觉解释, in: IEEE国际计算机视觉会议论文集, 2017, pp. 618–626.

[54] E. Cambria, L. Malandri, F. Mercorio, N. Nobani, A. Seveso, Xai meets llms: 可解释人工智能与大语言模型关系的综述, arXiv预印本 arXiv:2407.15248 (2024).

[55] B. Kim, R. Khanna, O. O. Koyejo, 例子还不够,学会批评!用于可解释性的批评, Advances in neural information pro- cessing systems 29 (2016).

[56] G. Rosenberg, S. Stadhard, B. C. Hansen, M. R. Greene, 从图片和文本中学习的局限性:视觉-语言模型与具身场景理解, arXiv预印本 arXiv:2603.26589 (2026).

[57] S. Tong, Z. Liu, Y. Zhai, Y. Ma, Y. LeCun, S. Xie, 睁眼瞎?探索多模态LLM的视觉缺陷, in: IEEE/CVF计算机视觉与模式识别会议论文集, 2024, pp. 9568–9578.

[58] Y. Zhang, C. Zou, Q. Liu, L. Rong, B. Yao, Z. Lian, Q. Li, P. Zhang, J. Qin, MLLM是否被困在视觉房间里?, in: 中国模式识别与计算机视觉会议 (PRCV), Springer, 2025, pp. 35–49.

25

发表评论