多模态LLM记忆陷阱:为什么低注意力区域不能随便删?
当前多模态助手常根据注意力分数丢弃视觉KV Cache,但这假设‘当前不关注’等于‘未来无用’。本文通过CVMA框架证明该假设错误:低注意力区域可能在未来关键。安全遗忘需满足视觉低依赖或事实已被言语化。视频详解因果审计方法及对SnapKV等方法的启示。
当前多模态助手常根据注意力分数丢弃视觉KV Cache,但这假设‘当前不关注’等于‘未来无用’。本文通过CVMA框架证明该假设错误:低注意力区域可能在未来关键。安全遗忘需满足视觉低依赖或事实已被言语化。视频详解因果审计方法及对SnapKV等方法的启示。
Diffusion Transformers 在长序列视频生成中面临自注意力机制的二次复杂度瓶颈。Sol-Attn 提出了一种无需训练的动态稀疏注意力机制,通过在线 softmax 过程中的阈值路由和近似校正,在保持生成质量的同时显著加速推理。本文解析其核心机制、实验验证及局限性。