Agent 会梦见虚假记忆吗?多模态 AI Agent 长期记忆的黑盒视觉攻击

威胁模型与方法概述

本文提出LUCID框架,针对多模态 AI Agent的长期记忆系统发起黑盒视觉攻击。现有防御机制往往忽视视觉数据的语义完整性,导致攻击者可通过植入不可察觉的对抗性图像,在无需访问模型权重或文本通道的情况下,成功污染记忆。实验显示,在Mem-Gallery基准上,上下文中毒攻击成功率高达61.6%,上下文注入攻击成功率达58.4%。本文分析了不同记忆后端(如MuRAG, NGMemory, UniversalRAG)的脆弱性,并评估了高斯模糊等防御策略的有效性,指出当前防御手段的局限性。

GeoChrono:重新定义遥感长期时序理解,超越商业模型20%

GeoChrono模型架构

现有遥感模型多局限于静态或双时相对比,缺乏对长期连续演变的系统性评估。本文提出ChronoBench基准与GeoChrono模型,通过分解认知层级和构建位置时间轨迹,显著提升了多模态大语言模型在遥感长期时序理解中的表现。实验显示,GeoChrono在ChronoBench上达到78.34%准确率,超越领先商业模型超20%。同时,C2FComp模块在减少56%视觉Token的同时保留94.6%性能。尽管与人类专家仍有差距,但该工作为遥感长期动态分析提供了重要基准与架构参考。

AdaTurn:预算感知测试时扩展,解决视觉代理截断难题

方法:预算条件化代理

本文提出AdaTurn框架,解决主动视觉代理在有限Rollout预算下的灾难性截断问题。通过预算条件化决策与FA-DAPO强化学习策略,模型学会在预算耗尽前主动生成答案。实验显示在VisualProbe等基准上低预算性能显著提升,且负载均衡调度器提升了训练效率。

VideoChat3:全开源高效视频理解新基准

I3D-ViT架构

本文分析VideoChat3,一种全开源的视频多模态大语言模型。针对现有模型泛化能力有限、计算效率低下及可复现性差的问题,VideoChat3提出I3D-ViT架构和自适应帧分辨率机制。实验显示其在MotionBench和TempCompass上取得全开源最佳成绩。需注意自适应分辨率依赖状态预测准确性,且长视频数据依赖LLM生成。

ALTR:无注意力轻量级Token缩减,让VLM在边缘设备更流畅

ALTR框架核心思路

本文提出ALTR框架,解决VLM中视觉Token冗余导致的计算瓶颈。通过Rényi熵估计重要性和基于MLP变换一致性的多样性采样,ALTR在不依赖注意力图或成对比较的情况下,实现即插即用的Token缩减。实验显示,在LLaVA-v1.5-7B上保留192个Token时,平均性能保留98.86%,且额外FLOPs仅为4.13M,完全兼容FlashAttention-2。该方法适用于需要高效部署VLM的边缘场景。

SIVA-RL:基于样本级干预结果的动态路由视觉对齐

基于结果的动态路由策略

本文提出SIVA-RL框架,针对多模态强化学习中视觉干预效果异质性问题,通过基于奖励下降幅度的动态路由,将样本分为敏感性对齐和不变性对齐。实验显示,该方法在Qwen2.5-VL-3B和7B模型上显著提升视觉依赖任务准确率,但需注意PatchSwap超参数敏感性及黑屏正确性的误导性。

MM-ToolSandBox:视觉工具调用代理评估基准与失败模式分析

MM-ToolSandBox框架概览

本文介绍MM-ToolSandBox,一个包含500+工具、支持多轮多图交互的视觉工具调用代理评估基准。研究揭示了当前模型在视觉精度和规划能力上的瓶颈,以及随规模变化的失败模式转移。

面向语言智能的可扩展视觉预训练:直接预测视觉潜在以超越文本预训练

方法:视觉预训练(VP)核心机制

本文提出视觉预训练(VP),直接对原始科学文档图像进行自回归视觉潜在预测。实验显示,在相同语料源下,VP在GPQA等科学推理基准上显著优于文本预训练(TP),且跨模态对齐指标(如Centroid Separation)大幅改善。VP通过稀疏前景视觉表示保留页面结构,无需文本提取或配对监督。优势在视觉结构密度高的样本上最显著,纯文本主导样本上优势不明显。