ALTR:无注意力轻量级Token缩减,让VLM在边缘设备更流畅

ALTR框架核心思路

本文提出ALTR框架,解决VLM中视觉Token冗余导致的计算瓶颈。通过Rényi熵估计重要性和基于MLP变换一致性的多样性采样,ALTR在不依赖注意力图或成对比较的情况下,实现即插即用的Token缩减。实验显示,在LLaVA-v1.5-7B上保留192个Token时,平均性能保留98.86%,且额外FLOPs仅为4.13M,完全兼容FlashAttention-2。该方法适用于需要高效部署VLM的边缘场景。

FOLIO:无需训练的流式视频聚焦语义记忆系统

FOLIO系统架构概览

本文介绍FOLIO系统,一种面向流式视频理解的无训练方法。针对流式场景中记忆成本随视频增长及冗余细节保留的问题,FOLIO采用动态焦点状态引导记忆写入,区分重要实体与上下文。系统包含短期视觉缓冲、长期实体中心语义记忆及视觉证据缓存。实验显示,在OVO-Bench上Perception达82.0%,在StreamingBench上整体准确率达74.5%。需注意记忆写入成本随视频长度线性增长,且错误多源于检索证据区分度不足而非记忆缺失。

REAL框架:去Oracle化的开放世界移动操作具身智能体

方法:REAL框架核心设计

本文提出REAL框架,旨在解决现有具身智能依赖特权Oracle感知API、难以处理模糊指令及仿真现实差距的问题。通过移除全局物体列表等特权信息,构建无Oracle感知的闭环视觉环境,并集成LLM驱动的模拟用户进行交互式消歧。采用SFT对齐Qwen3-VL-8B工具接口,随后使用GSPO进行在线强化学习以优化自适应推理。实验显示,该框架在REAL-Bench基准SUL任务成功率达56.9%,超越所有Zero-shot VLM基线;在Ark LIFT2真实机器人部署中端到端成功率达78.3%。需注意SFT阶段存在行为克隆过拟合风险,且底层VLA策略的执行稳定性直接影响整体表现。

全切片图像多模态基准测试中的数据泄露审计:记忆化还是推理?

背景:TCGA依赖与结构性重叠

本文对WSI VLM基准测试进行系统性审计,揭示因TCGA数据源重叠导致的严重患者级和机构级数据泄露。通过计算案例级重叠率ρcase和机构级重叠率ρTSS,并在CONCH-v1和TITAN编码器上验证特征空间中的泄露信号,证明当前报告的高准确率主要源于对记忆化特征的检索而非真正的多模态推理。

看见免费,说话昂贵:揭示边缘VLM推理的真实能耗瓶颈

论文代表图:figure-02-p003-01

具身智能依赖VLM进行实时视觉推理,但边缘设备电池有限,单次查询能耗高达50-500焦耳。现有工作多聚焦减少视觉令牌,假设视觉处理是主要能耗。本研究在RTX 3070和Jetson Orin NX上对5个VLM进行系统能耗画像,发现平均功率恒定,解码阶段能耗占比86-97%。实验表明,视觉令牌剪枝最多节省10%能耗,而控制输出长度可节省97%。建议优化时优先控制输出长度,并注意动态视觉令牌模型在高分辨率下的预填充能耗陷阱。

VLM计数为何失败?探针揭示内部编码与输出错位,自校正提升15.6%

论文代表图:figure-01-p003-01

视觉语言模型(VLM)在物体计数任务中常出现幻觉。本研究通过探针分析发现,VLM内部编码了正确的计数信息,但输出方向存在错位。论文提出基于误差检测器的自校正方法,在不更新参数的情况下将计数准确率提高了最高15.6%。视频涵盖探针分析、SVCCA子空间对齐、因果干预实验及自校正框架效果,并讨论模型差异与局限性。

HIVE:幻觉如何重塑VLM推理

相关工作与对比

传统观点认为VLM幻觉有害,但HIVE框架发现,在部分可观测场景下,幻觉生成的语义线索能拓宽推理路径,提升准确率。本文通过HIVE引擎对比忠实与幻觉路径,在PlantVillage等数据集上验证了适度幻觉的收益,并揭示了倒U型性能曲线。注意:此结论不适用于所有场景,过度幻觉仍会导致失效。

APIVOT:用视觉思维解决长程机器人规划的几何困境

方法核心:交错视觉-语言思维

长 horizon 机器人规划常因语义与几何脱节而失败。APIVOT 通过自适应交错语言推理与视觉思维(Visual Thoughts),在内部验证几何可行性。实验显示其在 KitchenWorlds 中成功率显著优于 Gemini-ER-1.5 等基线,且在复杂几何场景下优势更明显。需注意其目前仅在模拟器中验证,且自适应行为基于 SFT 学习。