Agent 会梦见虚假记忆吗?多模态 AI Agent 长期记忆的黑盒视觉攻击
本文提出LUCID框架,针对多模态 AI Agent的长期记忆系统发起黑盒视觉攻击。现有防御机制往往忽视视觉数据的语义完整性,导致攻击者可通过植入不可察觉的对抗性图像,在无需访问模型权重或文本通道的情况下,成功污染记忆。实验显示,在Mem-Gallery基准上,上下文中毒攻击成功率高达61.6%,上下文注入攻击成功率达58.4%。本文分析了不同记忆后端(如MuRAG, NGMemory, UniversalRAG)的脆弱性,并评估了高斯模糊等防御策略的有效性,指出当前防御手段的局限性。