多模态LLM记忆陷阱:为什么低注意力区域不能随便删?

快速导读:现有工作混淆了‘当前无关’与‘未来无关’。注意力分数是动态的,而视觉证据的价值可能在后续轮次才显现。缺乏因果审计导致我们误判哪些记忆可安全遗忘。

在多模态大语言模型(MLLM)的状态管理中,KV Cache压缩是降低延迟的关键。主流方法如SnapKV和NACL依赖当前注意力分数作为代理,认为低注意力区域可安全丢弃。然而,这种启发式方法忽略了多轮对话中视觉证据的动态价值。

本文提出CVMA(Causal Visual Memory Audit)框架,通过因果干预测试当前注意力是否真的是未来效用的可靠代理。研究发现,当前注意力与未来效用往往负相关,且安全遗忘的边界在于‘视觉依赖度’和‘事实是否被言语化’,而非单纯的注意力高低。

英文题目:Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns

论文出处:arXiv 每日论文精选 · arXiv:2607.25467

原始论文:PDF / 论文页面

对应视频标题:多模态LLM记忆陷阱:为什么低注意力区域不能随便删?|推荐指数:★★★★★

这篇论文解决什么问题?

状态化多模态助手需在一次图像编码后回答多轮问题。随着对话轮次增加,KV Cache膨胀成为瓶颈。现有压缩策略(如PrefixKV, LOOK-M)通常基于‘当前注意力低即无关’的假设进行驱逐。

这一假设存在根本缺陷:当前问题可能忽略某些视觉区域,但后续问题可能依赖这些区域。例如,用户先问‘桌上有什么’,模型关注杯子而忽略时钟;随后问‘几点了’,若时钟KV已被丢弃,模型将无法回答。

更严重的是,聚合指标(如平均NLL)可能掩盖高视觉依赖对话中的灾难性失败。现有工作缺乏对‘何时安全遗忘’的因果分析,导致压缩策略在长对话中表现不稳定。

核心创新

方法概览

现有工作混淆了‘当前无关’与‘未来无关’。注意力分数是动态的,而视觉证据的价值可能在后续轮次才显现。缺乏因果审计导致我们误判哪些记忆可安全遗忘。

  • CVMA框架包含三个核心测试:代理有效性测试(Proxy Validity)、视觉依赖测试(Dependence Test)和来源测试(Source Test)。
  • 代理有效性测试通过Teacher Forcing冻结轨迹,计算当前注意力与未来区域效用的Spearman相关性,检验注意力是否是好代理。
  • 视觉依赖测试通过‘全图像丢弃’干预,测量不同对话对视觉信息的依赖程度,将对话分为高/低依赖组。
  • 来源测试通过因子干预,检查助手生成的文本KV是否能替代图像KV,特别关注事实是否被显式言语化。
  • 实验在Qwen2.5-VL-7B和Idefics3-8B上进行,使用VisDial和ConvBench数据集,覆盖25%和12.5%保留预算。

逐图理解论文

直觉失败案例

直觉失败案例
Figure 1: When is visual memory safe to forget? The top trajectory exposes the hidden commitment behind current-attention eviction: the clock is seen once, ignored by the current question, left unsaid, and unavailable when a future question needs it. The bottom shows CVMA’s three linked tests of the proposed chain—proxy validity, visual dependence, and fact-specific image–text substitution.

图1展示了CVMA的核心逻辑:上方轨迹显示时钟被忽略且未言语化,导致未来问答失败;下方展示CVMA的三个测试环节。需关注‘看见但未说出’导致的记忆丢失。

最强结论

最强结论
Figure 3: Dependence- and turn-conditioned damage at exact common budgets. Full VisDial is binned into ten equal- frequency deciles by an independent all-image drop. (a,b) Damage versus dependence decile and dialog turn at four accounted bits (five 25% selectors and matched coverage); (c,d) the same at two bits (12.5% selectors and the one-bit coverage endpoint). The lower row uses symmetric-log scaling with 95% bootstrap bands.

图3显示高依赖对话(Q4)在低预算下的巨大损伤。需关注Q1与Q4的对比,证明视觉依赖度是风险的关键指标。

意义与局限

意义与局限
Table 1: Full-dataset Qwen-7B stateful controls (teacher- forced ∆NLL vs. full cache, uniformly averaged over all benchmark turns; lower is better) on VisDial (2,064 dialogs) and ConvBench (546). Visual b/e is 16× the BF16 reten- tion fraction for logical selectors (index/kernel overhead ex- cluded) and includes scale/zero-point metadata for coverage; it is not a serving-memory claim. Paired 95% CIs appear in Appendix Table A3.

CVMA为KV Cache策略提供因果指导,但仅限Teacher Forcing下的NLL指标,未提出新压缩算法。以上便是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 使用4×4和8×8网格评估代理有效性,确保空间分辨率的影响被控制。
  • 通过独立的全图像丢弃实验,将VisDial对话按依赖度分为十个等频分位数(Deciles)。
  • 在固定预算下,比较注意力引导保留、随机保留和Oracle(边际效用控制)的∆NLL。
  • 进行事实中继实验,控制历史对话,测试已陈述与未陈述事实的图文替代效果。

关键结果与论文证据

  • 当前注意力与未来效用呈负相关:Qwen 4×4网格的Spearman相关系数为-0.103,Idefics 2×2为-0.576(第3页)。
  • 注意力引导保留在4×4网格下比随机保留更差,∆NLL增加0.053至0.062(第3页)。
  • 高依赖对话(Q4)在25%保留预算下,∆NLL增加0.417至0.676,而低依赖对话几乎无损伤(第5页)。
  • 显式言语化的事实允许文本KV替代图像KV,优势达+3.874;未陈述事实则无此效果,交互项为-0.177(第7页)。
  • 严格精确匹配率在轮次2-10从53.1%(全缓存)降至46.0-51.4%(选择器),显示长对话中的累积错误(第6页)。

阅读时需要注意

  • 证据局限于Teacher Forcing下的NLL指标,未评估自由生成场景下的端到端性能。
  • 策略阶梯比较主要在Qwen-7B上进行,Idefics仅用于代理检查,泛化性待验证。
  • CVMA是审计框架,未提出新的压缩策略,需结合其他工作实现优化。
  • 结论可能不适用于所有VLM架构或基准测试,特别是那些具有不同注意力机制的模型。

关联工作

  • SnapKV, NACL, PrefixKV等基于注意力的驱逐方法被作为基线评估,显示其在高依赖场景下的失败。
  • KIVI, VisionZip等量化和非删除覆盖控制被用作对照,证明非删除方法在精度地板以上更稳定。
  • Lin et al. 2025和Chatterjee et al. 2025关于视觉到文本迁移和言语化记忆的工作,为CVMA的来源测试提供理论基础。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

见、说,还是遗忘?跨对话轮次的视觉 KV 记忆因果审计

陈宏1∗,陈康2∗,樊宇轩1,王博1,高宇博1,楚元林1,胡旭明1† 1香港科技大学(广州) 2温州肯恩大学 {hchen763, yfan546, bwang423, ygao704, ychu763}@connect.hkust-gz.edu.cn, chenkang@kean.edu, xuminghu@hkust-gz.edu.cn

摘要 et al. 2026b; Liu et al. 2026),但聚合结果无法解决此例。较小的平均损失可能意味着选择器保留了有用证据、后续轮次无需视觉,或所需视觉事实已被口述至助手文本。这些解释隐含不同的记忆机制,但普通评估将它们混淆。先前的视觉到文本工作同样研究前向传递内的单次预填充集成 (Lin et al. 2025) 或构建显式口述记忆 (Chatterjee et al. 2025),而非测试何时自然发生的助手输出 KV 可安全替换对话轮次间持久的图像 KV。我们将安全遗忘转化为因果问题,引入因果视觉记忆审计 (CVMA; 图 1)。CVMA 保留一条状态轨迹——图像仅预取一次——并在同一对话中应用配对干预。其组件回答三个关联问题:当前注意力是否识别未来因果效用;错误驱逐决策何时变得有害;助手文本 KV 何时能挽救缺失的视觉事实?区域删除、全图删除、随机与边际效用保留控制,以及图像-文本因子干预使竞争性解释可单独测试。简言之,注意力衡量有助于当前答案的因素,而 CVMA 衡量后续将遗漏的因素,因此低注意力分数并非遗忘证书。每个结果都引出下一个。注意力与未来区域效用负相关,联合保留效果差于随机,尽管边际效用控制显示选择仍有提升空间。这种代理失败本应灾难性,但聚合退化往往温和,因为损害集中在视觉依赖对话和后续轮次,而低依赖案例甚至从去噪中受益。剩余路径是事实层面:助手输出 KV 可替换置于答案表面的事实的图像 KV,而未陈述事实的隐藏痕迹具有模型依赖性,并非可靠的答案判别特征。arXiv:2607.25467v1 我们的贡献在方法和机制上,而非新的压缩策略。(1) CVMA 是一个可复用的分析框架,具有因果估计量、状态不变性、随机/边际效用控制和依赖条件报告。(2) 它识别出注意力引导的不可逆保留是未来效用的错误指定代理,并映射该错误在预算、对话轮次和事实特定口述下何时产生影响。

1 引言 多模态助手日益以状态化方式运行:图像被编码一次,然后在多个轮次中讨论,同时其 KV 缓存保持驻留。大量工作通过当前注意力对视觉条目评分并不可逆地驱逐低分条目来减少该缓存 (Wan et al. 2024; Tu et al. 2025; Wang et al. 2026a)。该选择高效,但做出了一个重要的识别:现在重要的被假设即为后续重要的。考虑一张包含红色马克杯和时钟的图片。第一个问题询问桌上有什么,因此模型关注马克杯并驱逐低分的时钟。两轮后,用户询问时间。时钟被看见,但既未被保留也未被提及;其视觉证据现已遗忘。仅仅因为其与第一个问题无关就遗忘它,是否曾经安全?先前的多轮工作认识到,未来问题可能改变哪些视觉内容至关重要 (Khaki et al. 2025; Wang et al. 2026a)。

∗这些作者贡献相同。 †通讯作者。

第 2 页

1 已见 2 已说 3 已忘

问:桌上有什么? 问:时钟显示几点?

图像 KV 图像被编码一次 时钟区域 被驱逐 图像 KV 驱逐 文本 KV 仅马克杯 A:桌上有一个红色马克杯。 已被说出 持久视觉 KV 已说 未说 已忘 时钟事实未 因此,纯注意力驱动的 被提及 导致 token 驱逐不安全。 马克杯+时钟均进入视觉记忆 助手-文本 KV

因果视觉记忆审计 (CVMA)

1 代理测试 2 依赖测试 3 源测试 当前注意力能否预测未来效用? 驱逐何时真正造成损害? 文本记忆能否替代图像记忆? 图像 KV 图像 KV 开 关 文本 KV 开 开

开 关 低 中 高 文本 KV 关 关 比较保留策略 当后续轮次真正需要视觉时损害上升 替换仅在事实被明确陈述时才可靠

图 1:视觉记忆在何时可以安全遗忘?顶部轨迹揭示了当前注意力驱逐背后的隐性承诺:时钟被看了一次,被当前问题忽略,未被提及,且当未来问题需要它时不可用。底部展示了 CVMA 对提议链路的三个关联测试——代理有效性、视觉依赖性和事实特定的图像-文本替换。

模拟,以及轮次。(3)受控的、自然历史的和非 Qwen 测试定位视觉与文本记忆之间的事实特定言语化边界。 跟随的 Qwen 测试将事实特定的言语化边界 这种证据跨越了两个模型家族和两种对比对话机制。我们将它们之间的一致性视为测试堆栈内的复制,而非对通用主张。VLM 架构、基准或压缩策略。 结果 $L_{d,t}(Z)$ 是在干预 $Z$ 下,参考答案内容 token 的平均交叉熵。区域效用和全图像依赖使用未来视界 $H = \{2, \dots, T_d\}$,即在轮次 1 锚点之后——在跟进之前已知的审计决策——而全策略结果对所有轮次进行平均。

CVMA 将对话视为一个持久记忆轨迹: “丢弃”使选定的缓存位置不可读,但保持缓存长度、位置和 RoPE 索引不变。 主文本策略结果使用 Qwen2.5-VL-7B-Instruct (Bai et al. 2025) 在 BF16 下,因果审计还测试了 Idefics3-8B-Llama3,并在附录中进行了 Qwen 3B 规模检查。Teacher Forcing 使答案 NLL 完全配对;运行时断言强制执行 token 精确扩展、不可变视觉索引和完整源掩码(附录)。 VisDial v1.0 验证集 (Das et al. 2017) 提供 2,064 个单轮对话;ConvBench (Liu et al. 2024a) 提供 547 个三轮长对话,排除一个记录的 9,302 token 退化参考后剩余 546 个可用。全策略比较使用所有 2,064/546 个对话。对于区域审计,我们移除 72 个早期试点/确认 ID,将其余打乱(Python seed 42),并在因果结果前冻结前 200 个。22 图像事实中继试点从未与其未受影响的 80 图像确认集混合,自然历史跟进被标记为外部有效性,而非第二次确认。 这一证据的实际后果是具体的:评估者应暴露所有图像丢弃依赖和未陈述事实失败,而压缩器设计者不应将低当前注意力视为不可逆删除的充分证据。方法论的新颖性在于分离的干预系统;实证的新颖性在于由此产生的机制链。

在轮次 1 锚点之后——在跟进之前已知的审计决策——使用未来视界 $H = \{2, \dots, T_d\}$;而全策略结果对所有轮次进行平均。

CVMA 将对话视为一个持久记忆轨迹: “丢弃”使选定的缓存位置不可读,但保持缓存长度、位置和 RoPE 索引不变。 主文本策略结果使用 Qwen2.5-VL-7B-Instruct (Bai et al. 2025) 在 BF16 下,因果审计还测试了 Idefics3-8B-Llama3,并在附录中进行了 Qwen 3B 规模检查。Teacher Forcing 使答案 NLL 完全配对;运行时断言强制执行 token 精确扩展、不可变视觉索引和完整源掩码(附录)。 VisDial v1.0 验证集 (Das et al. 2017) 提供 2,064 个单轮对话;ConvBench (Liu et al. 2024a) 提供 547 个三轮长对话,排除一个记录的 9,302 token 退化参考后剩余 546 个可用。全策略比较使用所有 2,064/546 个对话。对于区域审计,我们移除 72 个早期试点/确认 ID,将其余打乱(Python seed 42),并在因果结果前冻结前 200 个。22 图像事实中继试点从未与其未受影响的 80 图像确认集混合,自然历史跟进被标记为外部有效性,而非第二次确认。 这一证据的实际后果是具体的:评估者应暴露所有图像丢弃依赖和未陈述事实失败,而压缩器设计者不应将低当前注意力视为不可逆删除的充分证据。方法论的新颖性在于分离的干预系统;实证的新颖性在于由此产生的机制链。

当前注意力也在操作层面固定。对于第一轮问题位置 $Q$,视觉位置 $V$,层 $\ell$ 和头 $h$,我们计算 $$ A_{\ell, q}^{h, i} = \frac{1}{N_h |Q|} \sum_{q \in Q} \sum_{j \in V} \frac{N_h |Q|}{N_\ell} P_{h, q \in Q} A_{\ell, q}^{h, j} \quad (1) $$ 其中 $N_\ell$ 和 $N_h$ 分别是层数和头数。然后我们对分配给空间区域的视觉 token 平均 $a_i$。因此,代理测试使用相同的第一个问题、头平均、每层视觉质量归一化以及两层堆栈中的层平均;没有未来 token 进入排名。

第 3 页

四种分离解释的干预措施包括缩放/零点元数据:INT2 在组 32 下成本为 3 位/元素。由于低位宽覆盖是现有技术(Liu et al. 2024b; Yang et al. 2024; Han et al. 2025),没有任何方法或推理延迟声明与之关联。发布的 VisionZip(Yang et al. 2025)在预填充前移除视觉嵌入,因此我们仅将其与配对的堆内全上限移除进行比较。附录列出了每种移植不可避免的差异;所有策略级比较均在共同预算下使用所有五种选择器。

区域 r 在后续是否有用?区域未来效用通过预填充回答: $U_{d,r} = \bar{L}_d(-r) – \bar{L}_d(\text{full})$. (3)

这是当前注意力机制应预测的因果目标。未来的对话是否完全需要图像 KV?视觉依赖则移除整个图像跨度: $D_d = \bar{L}_d(-\text{image}) – \bar{L}_d(\text{full})$. (4)

我们连续报告 $D_d$ 并按分位数报告;禁止使用比率,因为接近零的分母是不稳定的。

注意力是问题所在,还是选择本质上无望?在保留预算 $q$ 下,代理遗憾比较配对排名: $R_{p-cd,q} = \bar{L}_d(\text{retain}(p, q)) – \bar{L}_d(\text{retain}(c, q))$. (5)

种子随机测试存在实际误排;同一对话的边际效用控制按单次丢弃 $U_{d,r}$ 对区域进行排名。它见证了可选择的信号,但当区域相互作用时,它既不可部署也不是联合最优(图表将其缩写为“oracle”)。

最后,所需的视觉事实是否已移至文本?在边界 $b$,令 $V$ 为图像 KV,$A_{\le b}$ 为已完成的助手输出 KV。对于紧接着的下一个回答,它们的阶乘相互作用是一个上界,因为它对单区域效应进行排名,而不是解决组合问题。因此证据被限制在: $I_{d,b} = L_{d,b+1}(-V, -A_{\le b}) – L_{d,b+1}(-V) – L_{d,b+1}(-A_{\le b}) + L_{d,b+1}(\text{full})$. (6)

正的 $I$ 表示 NLL 尺度上的冗余或替代;它本身并不识别移动了什么。因此,下面的受控事实实验询问目标事实本身是否到达了助手文本。

识别假设与不变量 估计量对于冻结的、Teacher Forcing 轨迹在四种条件下是因果的——干预一致性、分别重放的分支之间无干扰、配对内干预前状态相同,以及无干预引起的未来历史令牌变化(由 Teacher Forcing 强制执行)。这将声明的范围限制在声明的轨迹上,而非自由生成。附录说明了完整条件、确切的缓存读取过程以及可执行审计清单。

压缩控制拓扑,而非聚合符号 我们在一个 Qwen2.5-VL 运行时下比较五种选择器,具有精确的视觉预算——静态首轮 top-k、LOOK-M 关键合并(Wan et al. 2024)、PrefixKV 层自适应保留(Wang et al. 2026a)、SnapKV 观察窗口池化(Li et al. 2024)和 NACL 代理加随机保留(Chen et al. 2024)——与非删除覆盖率控制相对,后者应用组仿射假量化,使用每通道键如 KIVI(Liu et al. 2024b)以及可选的 Walsh–Hadamard 旋转(已计入位)。

3 注意力并非未来效用 我们首先询问在当前问题下的注意力是否识别出移除会导致未来损失的区域;图 2a,b 边际地然后联合地测试此边际,图 2c,d 诊断失败背后的空间污染。在 200 个冻结的 Qwen-7B 对话中,4×4 区域注意力–未来效用 Spearman 相关系数为 -0.103([-0.147, -0.048];图 2a)。它在 8×8 时保持负值但较小(-0.034, [-0.058, -0.009]);但在最粗糙的 2×2 网格上方向性不确定。由于区域效应可能相互作用,我们还在 25/50/75% 下联合保留区域。在冻结的主要 4×4 粒度下,注意力比种子随机差 +0.053/ +0.062/ +0.027 NLL(图 2b);在 8×8 时,差距为 +0.092/ +0.055/ +0.016,同样所有置信区间均排除零。未来在此并非本质上不可选择:4×4 同一对话边际效用控制比随机好 -0.197/-0.166/-0.110——这是剩余空间的见证而非上限。

在支持的单元格内,问题是代理错位而非选择原则上不可行。结果也不是层聚合的伪影:最后四层、最后一层和质量加权变体均保持相关性为负(-0.084 至 -0.111)且联合遗憾差于随机(图 4a,b;附录表 A4),排除了三种即时的聚合补救措施。

这种区别在不同的模型家族中,跨越所有三种粒度均成立:使用位精确跨网格控制,Idefics 注意力–效用相关性在 2×2/4×4/8×8 时为 -0.576/ -0.263/ -0.113(所有置信区间均排除零),注意力输给了随机,而边际效用控制在每个粒度和预算下均获胜,且标题移除诊断排除了 VisDial 提供的标题(图 4c;附录给出了每粒度值)。尽管移除整个图像仍改善了 Idefics 平均 NLL,但我们复制了代理失败依赖,并将后者视为模型–任务干扰边界。

最后,失败在空间上是诊断性的(图 2c,d):顶部注意力集中在固定的缓存端点——Qwen 的第一个区域(152/200)和 Idefics 的序列端点(190/200)——但丢弃这些热点改善了未来 NLL,且图像翻转控制显示 top-1 热点遵循缓存位置而非内容。因此注意力并非无内容,但其排名最高的视觉位置是位置污染的(附录)。

第 4 页

(a) (b) Qwen Qwen attn.oracle Idefics Idefics attn.oracle

↑ 更差 Qwen 2×2 -0.100 随机 0.5 Qwen 4×4 -0.103 Qwen 8×8 -0.034 种子 0.0 Idefics 2×2 -0.576 对比

Idefics 4×4 -0.263 ΔNLL −0.5 Idefics 8×8 -0.113 ↓ 更好 −1.0 −0.6 −0.5 −0.4 −0.3 −0.2 −0.1 0.0 25 50 75 配对 注意力–未来效用 Spearman 视觉区域保留率 (%) 未来下降效应 Top-注意力 −3 (c) 频率 (%) (10 ΔNLL) (d) 固定位置 移动内容

76 3 · 2 -23 +2 +1 -12 Qwen-7B · H-flip · 4 2 · 0 +8 +7 +3

· 4 2 · +12 +4 +11 +6 Qwen-7B Qwen-7B · V-flip 1 2 · · +6 +4 +4 +3

42 2 · · -474 +42 -6 +8 Idefics-8B · H-flip · · · · -20 -27 +14 +7

· 1 · · -2 +1 -15 -3 Idefics-8B Idefics-8B · V-flip · · · 53 -2 -6 -1 -213

0 25 50 75 内容翻转后 Top-1 持久性 (%)

图 2:当前注意力的代理有效性测试。(a) 每对话注意力–效用 Spearman 均值(200 个对话)。(b) 在匹配的 4×4 网格上,注意力、种子随机和边际效用控制(“Oracle”)的联合保留 ΔNLL。(c) 按缓存位置划分的 Top-注意力频率和未来下降效应,端点已标出(百分比和 10−3 NLL)。(d) 内容翻转后 Top-1 持久性,在固定位置与移动内容处。区间为 95% 分层 (a) 或对话引导 (b,d)。

4 驱逐在何时何地失败 视觉评估因此抵消了图像依赖对话中的不可逆损失,并通过去噪处理那些从未需要图像 KV 的对话。关键在于,Dd 是与同一未来结果绑定的会话内配对干预,而非基准层面的必然标签。

代理无效性允许信息丢失,但并非处处如此:错误的驱逐仅在后续轮次需要被丢弃的证据时才重要。这可以解释为什么注意力引导的删除在聚合上看起来比其代理有效性所暗示的更安全。

完整的 ConvBench 复现了拓扑结构(关联度 0.541–0.793;每个单元格都提高了 Q1 并降低了 Q4,而精确四位覆盖率保持在 ρ = −0.009 不变),因此该下限并非 VisDial 短答案所特有。

错误驱逐仅在视觉重要时才重要 这种效应修饰也跨越了模型家族:在 200 个共享对话中,Qwen 的损害–依赖 Spearman 为 0.443,Idefics 为 0.343,其损害从 Q1 的负均值 +0.060 上升至 Q4 的 +0.425。所有十个选择器–预算单元格的损害–依赖关联均为正(Spearman 0.399–0.682)。在精确四位对比中,覆盖率没有检测到耦合(0.012 [−0.032, 0.055]);在两位时,其表示本身崩溃,依赖耦合重新出现(0.382 [0.343, 0.419])。图 3 保留了这两种机制,而不是无声地丢弃失败的端点。该关联是语义性的,而非缓存大小的伪影:在 VisDial/ConvBench 上,依赖性与视觉令牌计数的 Spearman 分别为 −0.033/ −0.126,但追踪问题类型(计数/颜色最高,是/否和推理最低;附录)。答案长度呈负相关,但仅凭长度无法判断事实是否移入文本;下面的事实测试可以。

分位数揭示了均值混合的内容。在 Q1(Dd = −0.222)中,LOOK-M/PrefixKV 通过移除干扰项改善了 NLL;在 Q4(Dd = +0.971)中,静态 25/12.5% 保留的成本分别为 +0.417/ + 0.676,而精确四位覆盖的成本为 +0.004(CI 跨越零),精确两位覆盖的成本为 +7.903,即使在非删除缓存中也是如此。聚合

第 5 页

(a) 匹配 4 b/e:依赖关系 (b) 匹配 4 b/e:轮次

静态前缀 KV NACL LOOK-M SnapKV 覆盖率 静态 +0.00 +0.09 +0.15 +0.16 +0.17 +0.18 +0.20 +0.20 +0.23 +0.20 0.2 (nats) 0.4 LOOK-M +0.01 +0.01 +0.00 +0.01 +0.01 +0.02 +0.02 +0.03 +0.05 +0.04

< 0: Dd 前缀 KV +0.01 -0.00 -0.02 -0.00 +0.00 +0.00 +0.01 +0.01 +0.03 +0.03 (nats) 缓存全丢弃 0.1 去噪 0.0 完整 0.2 策略 SnapKV +0.01 +0.06 +0.08 +0.09 +0.08 +0.09 +0.09 +0.09 +0.11 +0.11 对比 损伤 NACL +0.00 +0.02 +0.04 +0.04 +0.05 +0.05 +0.05 +0.05 +0.08 +0.06 −0.1 0.0 损伤 覆盖率 -0.00 -0.00 -0.00 +0.01 +0.01 +0.00 +0.00 -0.00 +0.00 +0.00 −0.2 −0.1 −0.25 0.00 0.25 0.50 0.75 1.00 1.25 1 2 3 4 5 6 7 8 9 10 全丢弃依赖关系(十分位均值,nats)对话轮次

(c) 匹配 2 b/e:依赖关系 (d) 匹配 2 b/e:轮次 8 覆盖率跨越 静态 +0.01 +0.17 +0.27 +0.28 +0.31 +0.30 +0.31 +0.31 +0.31 +0.29 表示层 −1 (nats) 1 LOOK-M +0.03 +0.08 +0.07 +0.08 +0.06 +0.07 +0.09 +0.10 +0.12 +0.10 1010 0 缓存 前缀 KV +0.02 +0.03 +0.02 +0.04 +0.02 +0.03 +0.05 +0.05 +0.09 +0.07 10 −2 (nats) 0.1

−2 完整 策略 SnapKV +0.02 +0.14 +0.17 +0.19 +0.19 +0.19 +0.19 +0.20 +0.19 +0.19 0−10 对比 损伤 0

−10 0 损伤 覆盖率 NACL +0.00+0.97 +0.09+7.0 +0.11+6.9 +0.11+7.0 +0.14+6.8 +0.13+6.8 +0.16+6.9 +0.16+6.7 +0.17+6.7 +0.13+6.6 −10 −1 −0.1 −0.25 0.00 0.25 0.50 0.75 1.00 1.25 1 2 3 4 5 6 7 8 9 10 全丢弃依赖关系(十分位均值,nats)对话轮次

图 3:在精确的公共预算下,依赖关系和轮次条件化的损伤。完整的 VisDial 由独立的图像全丢弃按频率分为十个等频十分位。(a,b) 在四种已记账位(五个 25% 选择器和匹配的覆盖率)下,损伤与依赖关系十分位及对话轮次的关系;(c,d) 在两位(12.5% 选择器和一位覆盖率端点)下的相同情况。下行使用对称对数缩放及 95% 自举置信区间。

逐轮失败幸存于更强的选择 3B,PrefixKV-25% 的成本为 +0.001,而覆盖率为 +0.007。我们的主张涉及可访问性拓扑,而非单一聚合赢家(附录表 A1 给出了完整的 3B/7B 阶梯)。

如果失败源于由未来查询改变所引发的不可逆早期决策,它也应随轮次显现。在完整的 VisDial 上,静态 12.5% 的损伤从第 1 轮的 +0.008 增长到第 10 轮的 +0.289。LOOK-M、PrefixKV、SnapKV 和 NACL 将损伤水平降低至不同程度,但在精确预算下,所有方法均显示出比锚点轮次更大的后期轮次损伤(图 3b,d)。可行的四位覆盖率保持在接近零;失败的两位覆盖率在第 1 轮已高达 +0.97,此后超过 +6.6,这是一种截然不同的表示误差特征。ConvBench 在其感知轮次前置,因此选择器配置文件遵循任务结构而非普遍单调律。

表 1 给出了两个基准上的固定 7B 策略阶梯,并在两种预算下添加了源自源数据的 SnapKV 和 NACL。NACL 在聚合 VisDial 上略优于 SnapKV(25% 时为 +0.043 对比 +0.082),但这并未隔离 NACL 的随机组件,且两者均未缩小与完整缓存的差距(PrefixKV +0.008;精确四位覆盖率约零)。更重要的是,两种新增选择器重现了失败拓扑:在 12.5% 时,SnapKV/NACL 从 VisDial 依赖关系 Q1 的 −0.061/ −0.062 移动到 Q4 的 +0.501/ + 0.388,ConvBench 也类似反转。非删除覆盖率仅在高于其精度层时最接近完整缓存,且即使如此也不具备尺度不变性——图 5 报告了失败的 VisDial 端点,而非截断曲线。

从隐藏的 NLL 漂移到可见的失败

教师强制 NLL 是主要的,因为它保持每一对未来的轨迹固定;对 15 个最高依赖关系对话(经过聊天模板守卫后剩 14 个可用)的密封审计将其桥接至可观察错误。主要的失败是后期轮次幻觉缺失,即在周边证据被删除后,而完整缓存、INT2+WHT 和参考均同意,且没有单元格反转该关系(附录表 A6 给出了计数和逐字案例)。

随后我们冻结完整的高依赖关系四分位——

第 6 页

(a) 聚合鲁棒性 (b) 遗憾值与种子随机 (c) 移除标题诊断

所有层平均配对偏移 -0.134 所有层 +0.053 +0.062 +0.027 0.05 ΔNLL [-0.194, -0.071] 0 最后4层平均 最后4层 +0.037 +0.042 +0.033 0.00 ΔNLL −2 最后一层 最后一层 +0.064 +0.051 +0.034 依赖性

质量加权 +0.039 +0.044 +0.022 −0.05 −4 质量加权 25% 50% 75% 全丢弃 −0.1 0.0 保留视觉区域 注意力-未来效用 Spearman 标题保留 标题移除 (d) 依赖性并非缓存大小 2–10 (e) 自由运行精确匹配 (f) 严格不良事件率 12 14 17 18 18 18 20 17 视觉令牌计数 0.20 静态 6 回合 5 7 6 11 13 9 9 10 10 0.15 0.4 LOOK-M VisDial PrefixKV 4 4 4 6 7 5 5 5 5 0.10 答案长度 ConvBench 匹配, 0.2 SnapKV 5 11 13 14 16 12 16 15 13 0.05 精确 NACL 5 8 11 11 12 10 14 11 9 问题长度 0.0 0.00 2 3 4 5 6 7 8 9 10 −0.4 −0.2 0.0 严格 对话回合 与全丢弃的关联性 依赖性 FullStaticLOOK-MPrefixKVSnapKVNACL覆盖率

图 4:鲁棒性检查与自由运行答案质量。(a) 四种聚合规则下的注意力-效用相关性。 (b) 联合保留 ∆NLL 与种子随机;正值表示更差。(c) Idefics 全图像丢弃依赖性与 VisDial 的标题 保留与移除情况。(d) 全丢弃依赖性与视觉令牌计数、答案长度和问题长度的关系。(e) 在 25%/四位精度下,所有 516 个依赖性-Q4 对话的第 2–10 回合的严格精确匹配。(f) 在全匹配和覆盖率匹配参考的单元格中,每个选择器不匹配的百分比,按回合划分。误差线为 95% 对话自助法;详细信息见附录表 A4、A5。

策略视觉 b/e VisDial ConvBench 10 1 层 +6.23 静态 top-k SnapKV LOOK-M NACL 参考 0 PrefixKV 覆盖率 全缓存 (BF16) 16 0.000 0.000 10

注意力引导的选择/合并 −1 (nats) 10 静态 top-k 25% 4 +0.159 +0.030 静态 top-k 12.5% 2 +0.257 +0.056 全 −2 LOOK-M 合并 25% 4 +0.021 +0.018 vs 10 LOOK-M 合并 12.5% 2 +0.080 +0.036 PrefixKV 25% 4 +0.008 +0.011 10 −3 PrefixKV 12.5% 2 +0.040 +0.025 损坏 0 SnapKV 25% 4 +0.082 +0.029 SnapKV 12.5% 2 +0.165 +0.051 −10 −3

注意力 + 随机保留 NACL 25% 4 +0.043 +0.018 2 4 8 NACL 12.5% 2 +0.123 +0.038 accounted bits/element

非删除覆盖率 覆盖率 INT8 9 0.000 0.000 图 5:跨 accounted-bit 梯度的匹配存储损坏。对齐的全 VisDial 扫描为每个选 择器提供 50/25/12.5% 的保留率,并覆盖覆盖率的全测量精度范围;阴影切片标记四位精度的 覆盖率 INT4 5 +0.001 0.000 计数。对称对数轴具有 ±10−3 的线性区域,并保留了失败的两比特端点。 覆盖率 INT3 4 +0.002 0.000 覆盖率 INT2+WHT 3 +0.008 +0.002 覆盖率 INT1+WHT 2 +6.229 +4.974 NLL 表 1:全数据集 Qwen-7B 状态控制(教师强制 ∆NLL 与全缓存相比,在所有基准回合上均匀平均;越低越好),在 VisDial(2,064 个对话) 和 ConvBench(546)上。视觉 b/e 是逻辑选择器保留分数的 16 倍(排除索引/内核开销),并包括覆盖率的缩放/零点元数据; 它不是服务内存声明。配对 95% CI 出现在附录表 A3 中。516 个对话和 4,644 个后期回合单元格——并在 Full 下生成所有十个 回合,以及所有五个 25% 选择器和匹配的四位覆盖率。保守的严格精确匹配在第 2– 10 回合为全缓存的 53.1% 和覆盖率的 53.3%,而选择器为 46.0–51.4%(图 4e)。每个配对选 择器差距均为负值,其 95% CI 低于零,范围从静态的 −7.08 点 [−7.97, −6.22] 到 PrefixKV 的 −1.68 [−2.33, −1.01]。在更严格的定向

第 7 页

锚点——完整性和覆盖率均正确——每个选择器产生的负面效果多于严格反向单元格:126–377 对比 47–54,影响 20.7–52.5% 的对话(图 4f;附录表 A5)。因此,可见效果不仅限于人工检查的案例或单一弱选择器,而原始密封审计提供了其语义解释。

在所有 2,064 个 VisDial 对话中,官方公式密集 NDCG 为 0.557(完整),静态保留 25%/12.5% 时为 0.534/0.515,INT4/INT2+WHT 时为 0.557/0.554。覆盖率比匹配保留高出 +0.0233 [0.0184, 0.0282] 和 +0.0390 [0.0327, 0.0455]。这是一个状态似然结果,而非排行榜提交。

ConvBench 的基准原生检查(所有七种策略,一种部署,546 个对话)达成一致:只有两种最激进的选择器(静态和 SnapKV)在完整方面失去首轮偏好(在冻结的 A/B 两侧分别为 +2.2 [0.0, 4.6] 和 +2.9 [0.9, 5.1]),而 LOOK-M、PrefixKV、NACL 和覆盖率包含零(附录表 A8)。在 A/B 不平衡下,这是一个地板诊断,而非排名;VisionZip 的配对堆栈上限达成一致(0.556 对比 0.558 NDCG)。

5 言语化定义了图像-文本记忆边界

先前的工作从三个方面接近未知的未来相关性。文本缓存方法从注意力或观察窗口推断重要性,学习未来感知的保留,并压缩长上下文或多轮缓存 (Li et al. 2024; Chen et al. 2024; Xiao et al. 2024; Tang et al. 2026; Bui et al. 2026; Chen et al. 2026a,b; Liu et al. 2025);多模态缓存添加模态、层、头和图像顺序结构,或为变化的相关性保持广泛的可检索池 (Wan et al. 2024; Tu et al. 2025; Wang et al. 2026a; Huang et al. 2025; Zeng et al. 2026; Zhuang et al. 2026; Khaki et al. 2025; Wang et al. 2026b; Liu et al. 2026; Chen et al. 2026c);量化以低精度保留每个地址而不是删除 (Liu et al. 2024b; Yang et al. 2024; Han et al. 2025; Yang et al. 2026);因此覆盖率是我们的匹配存储控制,而非贡献。视觉到文本的迁移和言语化记忆也是已知的 (Lin et al. 2025; Chatterjee et al. 2025)。我们的目标则是分离干预以测试这些系统:在一个轨迹上,受控问题很简单:图像包含事实 A 和 B;助手说了 A 但没说 B;一旦图像 KV 不可用,后续轮次能否恢复 A、B 或两者?我们构建等长历史,陈述一个事实而省略另一个,然后分别探测它们;事实通过独立的 Qwen-32B/InternVL-9B 判断和结果盲审后再分配,160 个伪词提供匹配的非语义控制。

6 相关工作

低视觉依赖是看似安全的一条途径:未来不需要图像。第二条是截然不同的多模态——未来可能需要一个不再需要图像 KV 的视觉事实,因为早期的助手回答将其写入了持久文本 KV。CVMA 接下来询问这种替代何时发生。

看似安全的第二条途径

2×2 图像/助手输出干预发现了跨源冗余,这种冗余并不简单地随着每次回答而增强(即时下一轮交互 +0.164/ +0.049 然后 -0.115;附录)。VisDial 的始终可见标题阻止了干净的无中继控制。

言语化,而不仅仅是暴露,定义了文本转移。聚合冗余并未揭示移动了什么。受控问题很简单:图像包含事实 A 和 B;助手说了 A 但没说 B;一旦图像 KV 不可用,后续轮次能否恢复 A、B 或两者?我们构建等长历史,陈述一个事实而省略另一个,然后分别探测它们;事实通过独立的 Qwen-32B/InternVL-9B 判断和结果盲审后再分配,160 个伪词提供匹配的非语义控制。S×W×R 设计变化目标是否被陈述、回答轮次能否读取图像以及后续探测能否读取;每个分支都在其源干预下重新计算。

7 结论

证据是有界的(一个非 Qwen 模型,一个仅 Qwen 的策略阶梯,以及作为主要指标的 Teacher Forcing NLL;附录给出了完整范围)。在这些界限内,CVMA 产生了关于安全遗忘的统一因果解释:当前的注意力错误估计未来效用,驱逐失败仅在后续轮次需要被丢弃的证据时显现,且助手文本主要替代其明确陈述的事实。因此,评估应基于视觉依赖性和未陈述的事实进行条件化,且永远不要将当前的低注意力视为不可逆删除的充分条件。

更强的隐藏载体解释失败:看到 B 14 同时说 A 没有留下 B 的可靠答案判别痕迹(交互 -0.177,[-0.321, -0.035];伪词控制),这在 Idefics 上得到复制(附录表 A8)。可靠的边界是语言中特定事实的暴露,而不仅仅是图像的暴露。

边界幸存于库存生成的历史

前瞻性测试为每个冻结图像生成一个 7B 描述,然后在评分前密封令牌和提及标签。在 960/960 因子单元格中,显式事实获得无图像文本记忆(+3.336)和替代(+2.898,[2.248, 3.582]),交互接近零;提及由模型选择,因此显式-缺失对比是描述性的,而每个事实内的源干预保持因果性。这种分离在 Idefics 上得到复制(显式替代 +3.801 对比缺失 +0.258),因此它不是 Qwen 特有的,尽管只有 Qwen 显示出稳定的直接概率提升(附录表 A8)。

未受触动的 80 图像确认完成了 CVMA 的 1,920/1,920 精确审计单元格(附录图 A1)。目标事实真正需要视觉(移除探测图像访问在 nonce 调整的正确-干扰边际中增加 +1.778);一旦陈述了事实,仅文本就将该边际提高 +3.874 而无需图像访问,并将图像 KV 的后续价值降低 +2.215 ([1.853, 2.579]),这对 79/80 张图像为正。

第 8 页

参考文献

Lin, Z.; Lin, M.; Lin, L.; 和 Ji, R. 2025. 通过视觉令牌提取提升多模态大语言模型以实现快速推理。在《人工智能会议论文集》(Proceedings of the AAAI Conference on Artificial Intelligence),第 39 卷,5334–5342。

Bai, S.; Chen, K.; Liu, X.; Wang, J.; Ge, W.; Song, S.; Dang, K.; Wang, P.; Wang, S.; Tang, J.; Zhong, H.; Zhu, Y.; Yang, M.; Li, Z.; Wan, J.; Wang, P.; Ding, W.; Fu, Z.; Xu, Y.; Ye, J.; Zhang, X.; Xie, T.; Cheng, Z.; Zhang, H.; Yang, Z.; Liu, S.; Xiong, Y.; Jiang, Z.; Wang, Z.; Lv, C.; 和 Zhang, S. 2026. RetentiveKV:用于不确定性感知多模态 KV Cache 驱逐的状态空间记忆。在《计算语言学协会:ACL 2026 论文集》(Findings of the Association for Computational Linguistics: ACL 2026),18717–18727。

Bui, N.; Nguyen, H. T.; Cohan, A.; 和 Ying, R. 2026. 让每个令牌都算数:通过 KV Cache 驱逐提升长上下文性能。arXiv 预印本 arXiv:2605.09649。

Chatterjee, D.; Remelli, E.; Song, Y.; Tekin, B.; Mittal, A.; Bhatnagar, B.; Camgöz, N. C.; Hampali, S.; Sauser, E.; Ma, S.; 等. 2025. 用于实时过程视频理解的内存高效流式视频大语言模型。arXiv 预印本 arXiv:2504.13915。

Chen, H.; Liu, X.; Gao, Y.; Fan, Y.; Wang, B.; Chu, Y.; Lin, Y.; 和 Hu, X. 2026a. NestedKV:用于长上下文 KV Cache 压缩的嵌套内存路由。arXiv 预印本 arXiv:2605.26678。

Chen, H.; Liu, X.; Wang, B.; Fan, Y.; Chu, Y.; Li, Z.; Chu, X.; 和 Hu, X. 2026b. SONIC:键值缓存中用于信息压缩的分段优化枢纽。arXiv 预印本 arXiv:2601.21927。

Chen, T.; Wu, Y.; Yao, K.; Xu, X.; Hu, X.; 和 Lee, D. 2026c. 最后但同样重要:多模态 KV Cache 压缩的边界注意力校准。arXiv 预印本 arXiv:2606.14782。

Chen, Y.; Wang, G.; Shang, J.; Cui, S.; Zhang, Z.; Liu, T.; Wang, S.; Sun, Y.; Yu, D.; 和 Wu, H. 2024. Nacl:一种通用且有效的推理时 LLM KV Cache 驱逐框架。在《第 62 届计算语言学协会年会论文集》(第 1 卷:长论文),7913–7926。

Das, A.; Kottur, S.; Gupta, K.; Singh, A.; Yadav, D.; Moura, J. M.; Parikh, D.; 和 Batra, D. 2017. 视觉对话。在《IEEE 计算机视觉与模式识别会议论文集》,326–335。

Han, I.; Zhang, Z.; Wang, Z.; Zhu, Y.; Liang, S.; Liu, J.; Lin, H.; Zhao, M.; Xu, C.; Wan, K.; 等. 2025. CalibQuant:多模态 LLM 的 1-Bit KV Cache 量化。arXiv 预印本 arXiv:2502.14882。

Huang, K.; Zou, H.; Wang, B.; Xi, Y.; Xie, Z.; 和 Wang, H. 2025. AirCache:激活模态间相关性 KV Cache 压缩以实现高效大型视觉语言模型推理。在《IEEE/CVF 国际计算机视觉会议论文集》,23958–23967。

Khaki, S.; Guo, J.; Tang, J.; Yang, S.; Chen, Y.; Plataniotis, K. N.; Lu, Y.; Han, S.; 和 Liu, Z. 2025. SparseVILA:解耦视觉稀疏性以实现高效 VLM 推理。在《IEEE/CVF 国际计算机视觉会议论文集》,23784–23794。

Li, Y.; Huang, Y.; Yang, B.; Venkitesh, B.; Locatelli, A.; Ye, H.; Cai, T.; Lewis, P.; 和 Chen, D. 2024. Snapkv:LLM 在生成之前就知道你在寻找什么。《神经信息处理系统进展》,37: 22947–22970。

Liu, S.; Ying, K.; Zhang, H.; Yang, Y.; Lin, Y.; Zhang, T.; Li, C.; Qiao, Y.; Luo, P.; Shao, W.; 等. 2024a. Convbench:具有分层消融能力的大型视觉语言模型多轮对话评估基准。《神经信息处理系统进展》,37: 100734–100782。

Liu, X.; Chen, H.; Hu, X.; 和 Chu, X. 2025. FlowKV:通过隔离键值缓存管理增强 LLM 的多轮对话连贯性。arXiv 预印本 arXiv:2505.15347。

Liu, Z.; Yuan, J.; Jin, H.; Zhong, S.; Xu, Z.; Braverman, V.; Chen, B.; 和 Hu, X. 2024b. Kivi:一种无需微调的非对称 2bit 量化方法用于 kv cache。arXiv 预印本 arXiv:2402.02750。

Tang, Z.; Jiao, P.; Chen, X.; Liu, W.; Li, S.; 和 Chen, J. 2026. 预测未来效用:任务无关 KV Cache 驱逐的全局组合优化。arXiv 预印本 arXiv:2602.08585。

Tu, D.; Vashchilenko, D.; Lu, Y.; 和 Xu, P. 2025. VL-cache:面向视觉语言模型推理加速的稀疏性和模态感知 KV Cache 压缩。在《国际学习表征会议》(International Conference on Learning Representations),第 2025 卷,219–239。

Wan, Z.; Wu, Z.; Liu, C.; Huang, J.; Zhu, Z.; Jin, P.; Wang, L.; 和 Yuan, L. 2024. Look-m:用于高效多模态长上下文推理的 KV Cache 单次查看优化。在《计算语言学协会:EMNLP 2024 论文集》,4065–4078。

Wang, A.; Chen, H.; Tan, J.; Zhang, K.; Cai, X.; Lin, Z.; Han, J.; 等. 2026a. Prefixkv:自适应前缀 kv cache 正是视觉指令遵循模型高效生成所需。《神经信息处理系统进展》,38: 94456–94482。

Wang, Y.; Zhang, H.; Huang, Q.; Cao, A.; Fang, G.; Wang, W.; Jin, X.; Song, J.; Song, M.; 和 Wang, X. 2026b. 重新思考大型视觉语言模型的令牌缩减。在《IEEE/CVF 计算机视觉与模式识别会议论文集》,24727–24737。

Xiao, G.; Tian, Y.; Chen, B.; Han, S.; 和 Lewis, M. 2024. 具有注意力汇点的流式高效语言模型。在《国际学习表征会议》,第 2024 卷,21875–21895。

Yang, J. Y.; Kim, B.; Bae, J.; Kwon, B.; Park, G.; Yang, E.; Kwon, S. J.; 和 Lee, D. 2024. 不留任何令牌:通过重要性感知的混合精度实现可靠的 kv cache 压缩。arXiv 预印本 arXiv:2402.18096。

Yang, S.; Chen, Y.; Tian, Z.; Wang, C.; Li, J.; Yu, B.; 和 Jia, J. 2025. Visionzip:更长更好但不必要在

第 9 页

视觉语言模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集,19792–19802。 Yang, Y.; Ye, P.; Tan, X.; Tu, C.; Zhao, M.; Hao, J.; 和 Chen, T. 2026。重新审视多模态 KV Cache 压缩:一种频域引导的异常 KV 感知方法。在 IEEE/CVF 计算机视觉与模式识别会议论文集,39550–39560。 Zeng, B.; Ren, F.; Zhang, J.; Gu, X.; Chen, K.; Shou, L.; 和 Li, H. 2026。Hybridkv:用于高效多模态大语言模型推理的混合 KV Cache 压缩。在计算语言学协会第 64 届年会论文集(第一卷:长论文),13018–13034。 Zhuang, J.; Lu, L.; Dai, M.; Chen, J.; Liu, Q.; 和 Hu, H. 2026。近视校正:通过动态注意力补贴和令牌回收对 MLLMs 进行 KV Cache 剪枝。在 IEEE/CVF 计算机视觉与模式识别会议论文集,9023–9033。

发表评论