多模态模型真的在看自己画的草图吗?See2Think的诊断与发现

论文代表图:figure-02-p003-01

多模态大模型在推理时越来越喜欢画草图、做标注,但它们真的依赖这些自生成的视觉信息吗?See2Think这篇论文没有只看最终答案,而是设计了一套诊断框架,把视觉推理拆成三个环节:动作是否相关、渲染是否保真、后续推理是否采纳。通过在1200个样本上对四个主流模型进行标准与损坏渲染的对照实验,研究发现一个反直觉的结论——模型经常提出相关动作,但渲染质量普遍不高,而且即使渲染正确,收益也远小于损坏反馈带来的伤害。这说明当前模型的中间视觉推理更像一种行为惯性,而非真正的视觉依赖。视频将带你理解这一诊断逻辑及其对多模态系统设计的启示。

多模态LLM记忆陷阱:为什么低注意力区域不能随便删?

直觉失败案例

当前多模态助手常根据注意力分数丢弃视觉KV Cache,但这假设‘当前不关注’等于‘未来无用’。本文通过CVMA框架证明该假设错误:低注意力区域可能在未来关键。安全遗忘需满足视觉低依赖或事实已被言语化。视频详解因果审计方法及对SnapKV等方法的启示。

从图片恢复 Figma 文件:ReDesign 的代理分解与优雅验证

研究差距:缺乏结构化分解与验证

光栅图像到可编辑设计文件的恢复是一个病态逆问题。ReDesign 提出一种基于 VLM 的代理框架,通过结构化树扩展和 Graceful Verification 机制,逐步分解图像并恢复图层结构。实验表明,该方法在 Figma Edit Replay Benchmark 上实现了最佳的编辑保真度。注意:恢复结果为近似重构,非原始文件精确副本。

遥感大模型为何需要多工具?GeoLens超越单一缩放

论文代表图:figure-01-p002-01

超高分辨率遥感图像中,证据往往稀疏且分散。单一缩放工具在处理全局搜索或多区域比较时存在性能饱和。本文介绍GeoLens,通过构建GeoMTVR数据集和RTAL算法,实现多工具协同推理。实验显示其在XLRS-Bench等基准上超越主流大模型。注意:目前仅针对光学图像,且依赖半自动标注。

Motto:用思维令牌统一感知与推理

核心区分

现有多模态大模型在定位任务中难以兼顾精细感知与复杂推理。Motto提出Spatially-Grounded Thought Tokenization和Context-Adaptive Chain-of-Tokens,通过动态切换感知与推理模式,在PR-Bench等基准上实现SOTA。视频解析其核心机制与实验证据,并指出计算开销等局限。

RP-OPSD:如何用分辨率差异免费提升多模态大模型性能?

核心贡献:分辨率特权自蒸馏

多模态大模型在低分辨率下性能骤降,传统蒸馏方法成本高且存在分布偏移。本文提出RP-OPSD,利用同一图像的高/低分辨率视图构建教师-学生差距,通过在线自蒸馏提升细粒度视觉能力。实验显示该方法在Qwen3.5系列上显著提升性能,并实现1.78倍训练加速。注意:加速仅指训练阶段,且对非细粒度任务提升有限。

MLLM幻觉诊断新范式:HalluScope如何实现细粒度纠错?

论文代表图:figure-02-p004-01

现有MLLM幻觉检测多为粗粒度二元判断,缺乏对错误类型的细粒度分析与解释。HalluScope提出统一诊断框架,结合跨度检测、类型分类与解释生成。通过构建HalluScope-30K数据集与多粒度联合奖励训练,该方法在MHALO等基准上表现优异,并证明诊断反馈能显著提升模型准确性。需注意其数据生成依赖闭源模型。

视觉对比自蒸馏:无需外部监督的自蒸馏新范式

VCSD 的核心洞察

多模态大模型自蒸馏面临目标信息量不足的难题。VCSD 通过对比原始图像与内容擦除控制图像下的教师预测分布,构建无需外部监督的自蒸馏目标。实验表明,该方法在多个基准测试中显著提升模型性能,且无需额外推理成本。注意:该方法需要生成擦除控制图像下的响应,训练成本增加。

MLLM空间推理幻觉怎么破?Geo3R用几何卡片给出答案

方法贡献

多模态大模型常因2D图像缺乏深度信息而产生空间推理幻觉。Geo3R提出一种无需训练的框架,通过提取相机、世界及物体局部坐标系下的几何证据,构建结构化卡片辅助推理。实验显示其在透视、朝向和视点变化场景下显著优于基线。需注意其性能受限于上游几何估计工具的精度。

稀疏证据足矣:SIEVE智能体驱动的多模态视频虚假信息检测

方法:SIEVE框架概览

传统视频虚假信息检测常因处理冗余数据而效率低下且缺乏可解释性。本文提出SIEVE框架,通过Evidence Agent在预算约束下主动搜寻OCR、ASR及视觉线索,构建紧凑证据包供Verifier判定。实验显示,SIEVE在FakeSV和FakeTT上分别达到92.62%和91.64%准确率,刷新SOTA;在跨域基准FakeVV上亦展现良好泛化能力。需注意,模型对特定数据集证据分布存在依赖,且视觉读取受限于24张图像上限。