Grad-CAM遇上ViT:一次系统审计揭示的可解释性模糊地带

快速导读:本文对175篇将Grad-CAM应用于ViT的论文进行系统审计,发现大多数研究未充分说明特征提取位置、梯度目标等关键适配选择,并提出统一分类法以明确方法模糊性。

Grad-CAM是解释深度学习模型决策最广泛使用的工具之一,但它的原始设计是为CNN量身定制的。当研究者将Grad-CAM应用于Vision Transformer时,一个关键问题浮现:ViT没有CNN式的空间特征图,那么Grad-CAM究竟应该从模型的哪个位置提取特征?本文对175篇将Grad-CAM用于ViT的论文进行了系统审计,发现绝大多数研究并未明确说明这一核心选择,导致可视化结果难以复现、解释性存疑。

论文的核心贡献在于提出了一个统一的描述性分类法,系统定义了ViT中Grad-CAM的所有可能特征提取位置和梯度聚合策略,并基于此分类法量化了文献中的方法模糊性。审计结果显示,仅15%的论文明确说明了ViT特定的适配方法,而在那些说明了方法的论文中,各方案之间几乎互不采用,暴露出领域内缺乏方法论共识的深层问题。

英文题目:Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

论文出处:arXiv 每日论文精选 · arXiv:2608.05258

原始论文:PDF / 论文页面

这篇论文解决什么问题?

Grad-CAM的工作原理是通过目标类别对卷积层特征图的梯度来计算每个通道的重要性权重,然后加权求和生成类判别定位热图。这一过程天然依赖CNN特征图的空间结构——每个空间位置直接对应输入图像的一个区域。然而,ViT将图像分割为固定大小的patch,将其线性投影为token嵌入,再通过多层自注意力和前馈网络进行处理。在这个过程中,token之间的空间关系通过位置编码和自注意力机制隐式维护,但最终输出的不再是具有明确空间对应关系的二维特征图。

这种架构差异意味着,将Grad-CAM应用于ViT时,研究者面临三个必须明确的关键选择。第一是特征提取位置:是从层归一化后的token嵌入提取,还是从注意力矩阵、注意力输出、MLP激活或残差输出提取?第二是梯度目标:是对[CLS] token计算梯度,还是对所有patch token的梯度取平均?第三是空间重构:如何将一维的token序列重新排列回二维热图?这些选择中的每一个都会显著影响最终可视化的结果。

在视觉语言模型的交叉注意力模块中,问题更加复杂。交叉注意力涉及两个序列:查询序列通常来自文本模态,键值序列来自视觉token。如果研究者错误地从文本侧输出提取特征,得到的将是不包含任何视觉空间结构的信息,生成的热图毫无意义。论文明确指出,在交叉注意力中,仅有视觉侧的层归一化输出和交叉注意力矩阵本身保留了视觉token的空间结构,可用于Grad-CAM可视化。

尽管这些问题在方法论上至关重要,但文献中普遍存在一种“默认套用”的做法——直接引用原始CNN版Grad-CAM论文,而不说明在ViT上做了何种适配。这种模糊性使得不同研究之间的可视化结果难以比较,也使得以热图作为模型行为证据的做法面临可信度挑战。

核心创新

  • 首次为ViT架构下的Grad-CAM适配建立统一、详尽的描述性分类法,涵盖自注意力和交叉注意力模块中的多种特征源和聚合策略。
  • 通过大规模文献审计(175篇),量化了Grad-CAM在ViT上应用的方法模糊性,揭示了仅15%的论文明确引用或说明了ViT特定的适配方法。
  • 明确了在视觉语言模型(VLM)交叉注意力模块中,仅有视觉侧LayerNorm输出和交叉注意力矩阵保留空间结构,可用于Grad-CAM可视化。

方法概览

提出一个描述性分类法,系统定义ViT中Grad-CAM的可能特征提取位置(F1-F6,包括层归一化输出、注意力矩阵、注意力输出、MLP激活、残差输出)、梯度聚合策略([CLS]梯度加权 vs. patch-token平均梯度加权)和空间重构步骤。基于此分类法,对175篇文献进行审计,分析其引用、方法论基础和报告完整性。

  • 论文提出的分类法首先定义了ViT自注意力模块中的六种特征提取位置(F1-F6)。F1是层归一化后的token嵌入,保留了最完整的token级别信息;F2是自注意力矩阵,直接反映token之间的注意力权重分布;F3是注意力输出,即注意力加权后的值向量聚合结果;F4是第一个前馈网络层的激活输出;F5是MLP块的完整输出;F6是残差连接后的最终输出。每种位置捕获的是模型不同阶段的信息表征。
  • 在梯度聚合策略上,分类法区分了两种主要方法:[CLS]梯度加权和patch-token平均梯度加权。[CLS]梯度加权仅使用分类token的梯度来计算通道重要性,这假设[CLS] token聚合了全局信息;patch-token平均梯度加权则对所有patch token的梯度取平均,更直接地反映每个空间位置对决策的贡献。这两种策略在理论上对应不同的解释逻辑。
  • 对于视觉语言模型中的交叉注意力模块,分类法特别指出,由于查询序列来自文本等非空间模态,交叉注意力输出F3-F6实际上是文本侧的表征,不保留视觉token的空间布局。因此,仅有视觉侧的层归一化输出(对应F1)和交叉注意力矩阵(对应F2)可用于生成有意义的视觉解释热图。论文在图中用删除线明确标记了不适用的位置。
  • 空间重构步骤同样被纳入分类法。由于ViT输出的是一维token序列,需要根据patch的原始空间排列将其重新整形为二维网格,再进行上采样以匹配输入图像尺寸。这一步骤看似简单,但patch的排列顺序、是否包含[CLS] token、以及上采样方法的选择都可能引入额外的变异性。
  • 论文的分类法设计原则是描述性而非规定性的——它旨在穷举所有可能的选择,而不是判定哪种选择“正确”。这一设计选择反映了作者的核心立场:当前领域的问题不在于缺乏“正确”方法,而在于研究者没有意识到存在多种可能的选择,因而未能充分报告自己的选择。
  • 基于该分类法,论文设计了一套系统的文献审计方案。审计流程包括:通过特定关键词在学术数据库中进行检索,筛选出将Grad-CAM应用于ViT的论文;然后对每篇论文进行编码,记录其引用的Grad-CAM版本、是否说明了特征提取位置和梯度目标、以及是否引用了ViT特定的适配方法。编码结果经过多轮交叉验证以确保一致性。

逐图理解论文

一个直观的失败案例

一个直观的失败案例
Fig. 1. Feature extraction locations for adapting Grad-CAM to transformer-based vision models. The top panel shows a standard ViT self-attention encoder block, where token-feature representations, attention maps, attention outputs, MLP activations, and residual outputs may all be considered possible attribution sources. The bottom panel shows a cross-attention block commonly used in vision-language models, where the query sequence is assumed to come from a non-spatial modality such as text and the key/value sequence is derived from visual tokens. Under this assumption, the cross-attention matrix F2 provides the clearest image-token attribution source, while later cross-attention outputs F3–F6 are crossed out because they are text-side representations and do not directly preserve a spatial visual-token layout.

图1展示了ViT自注意力和交叉注意力模块中所有可能的Grad-CAM特征提取位置。上方为自注意力编码器块,标注了F1到F6六种位置;下方为交叉注意力块,其中F3-F6被删除线标记,表示这些文本侧输出不保留视觉空间结构,不可用于可视化。此图是理解整个分类法的核心。

审计结果:一个令人警醒的发现

审计结果:一个令人警醒的发现
Fig. 6. Distribution of literature by Grad-CAM reference type. Categories separate explicit peer-reviewed methodology tracking from indirect citations, un-peer-reviewed code dependencies, and unreferenced baselines.

图6展示了审计文献按Grad-CAM引用类型的分布。最大的类别是仅引用原始CNN版Grad-CAM论文,占比超过一半;其次是引用ViT适配方法、引用非同行评审代码库和无引用。此图直接量化了方法模糊性的严重程度。

结论与警示

结论与警示
Fig. 2. Grad-CAM visualizations for a standard ViT-B/16 [37] model across feature extraction locations F1, F4, F5, and F6, comparing [CLS]-gradient weighting with patch-token-average gradient weighting.

图2对比了在ViT-B/16上,从F1、F4、F5、F6四个特征位置提取的Grad-CAM热图,并比较了[CLS]梯度加权与patch-token平均梯度加权的效果差异。可以观察到不同位置和策略产生的热图在空间分布和语义聚焦上存在显著差异,直观展示了方法选择对解释结果的影响。

实验如何设计?

  • 定性可视化实验使用标准的ViT-B/16模型,在ImageNet-1k验证集图像上,对不同的特征提取位置(F1-F6)、不同的Transformer层(浅层、中层、深层)以及两种梯度加权策略([CLS]梯度加权和patch-token平均梯度加权)进行Grad-CAM热图生成,以展示这些选择如何影响可视化的空间分布和语义聚焦区域。
  • 交叉注意力Grad-CAM实验使用BLIP-base ITM模型,计算不同查询token和不同交叉注意力层下的热图,展示在视觉语言模型中,查询token的选择(如使用哪个文本token的梯度)如何决定模型关注的图像区域。
  • 文献审计覆盖175篇论文,编码维度包括:发表年份、会议/期刊分布、任务范式(传统视觉任务 vs. 视觉语言模型)、Grad-CAM应用类型(模型分析、管道嵌入、输出可视化)、引用类型(仅引用原始Grad-CAM、引用ViT适配方法、引用非同行评审代码库、无引用)以及方法论基础(是否明确说明适配方法、是否基于已有框架或自描述方法)。
  • 审计的文献来源包括顶级会议(CVPR、ICCV、NeurIPS、WACV)和期刊(如IEEE Access),时间跨度覆盖了ViT提出以来的主要年份,以确保样本的代表性。

关键结果与论文证据

  • 在175篇审计论文中,58%仅引用了原始CNN版Grad-CAM论文,未提及任何ViT特定的适配方法(第10页)。这表明大多数研究者在应用Grad-CAM时,可能未意识到架构差异带来的方法选择问题。
  • 仅15%的论文(26篇)明确说明或引用了ViT特定的Grad-CAM适配方法(第10页)。在这26篇中,13篇提出了独立的方法,但这些方法之间几乎没有互相采用——ALBEF被引用最多(8次),其余方法未被其他论文采用(第11页)。这揭示了领域内严重缺乏方法论共识。
  • 约10%的论文仅引用了一个非同行评审的GitHub库(pytorch-grad-cam)作为其Grad-CAM实现来源,该库虽提供ViT的Grad-CAM代码但无理论说明(第10页)。这种引用实践进一步加剧了方法的不透明性。
  • 定性可视化结果(图2和图3,第6-7页)清晰展示了不同特征位置和梯度策略产生的热图差异。例如,F1位置的热图倾向于突出更广泛的语义区域,而F4位置的热图可能更聚焦于局部细节;[CLS]梯度加权和patch-token平均梯度加权在同一特征位置也可能产生显著不同的空间分布。
  • 在任务分布上,约69%的论文将Grad-CAM用于传统视觉分类或分割任务,31%用于视觉语言模型(第12页)。这一分布反映了ViT应用的两大主要方向,也意味着方法模糊性问题同时影响这两个领域。
  • 论文发表年份的分布(图5,第10页)显示,将Grad-CAM应用于ViT的研究数量呈逐年上升趋势,表明这一问题的影响范围正在持续扩大。
  • 在Grad-CAM应用类型上(图8,第12页),论文将其分为三类:用于核心模型分析、嵌入到处理管道中、以及仅用于模型输出可视化。不同类型的应用对解释忠实度的要求不同,但方法模糊性对所有类型都构成潜在威胁。
  • 在交叉注意力模块中,论文通过BLIP-base ITM模型的实验(第8页)验证了仅视觉侧LayerNorm输出和交叉注意力矩阵可用于生成有意义的定位热图,而使用文本侧输出则产生无空间结构的结果。

阅读时需要注意

  • 论文提出的分类法旨在描述而非规定“正确”的适配方案,因此它不评估各方案的解释忠实度。这意味着即使研究者明确报告了方法选择,该选择本身是否合理仍然是一个开放问题。
  • 文献审计基于特定搜索查询和数据库来源,仅为有界快照而非完全普查。可能存在未包含在审计范围内但同样存在或不存在方法模糊性问题的论文。
  • 论文未对Grad-CAM的变体(如Grad-CAM++、Score-CAM等)在ViT上的适配进行深入分类,这些变体可能引入额外的方法选择维度。
  • 分类法主要关注标准ViT架构,对于其他Transformer变体(如Swin Transformer、PVT等)中可能存在的特殊结构,分类法的适用性需要进一步验证。

关联工作

  • 原始Grad-CAM论文(Selvaraju et al., 2017)是本文审计的基础方法,其设计完全基于CNN的架构特性,未考虑Transformer结构。
  • pytorch-grad-cam是一个广泛使用的非同行评审GitHub库,提供了ViT的Grad-CAM实现,但缺乏理论说明。约10%的审计论文仅引用此库作为方法来源,这一现象本身反映了领域内对方法细节的忽视。
  • ALBEF(Li et al., 2021)是被审计文献中引用最多的ViT Grad-CAM适配方法,作为8篇论文的方法论基础。这表明即使在缺乏共识的领域,某些方法仍获得了相对较多的关注。
  • Chefer et al.提出的方法是另一个ViT特定的Grad-CAM适配方案,被3篇审计论文引用。这些独立方法的存在进一步说明了领域内方法的碎片化状态。

发表评论