多模态模型真的在看自己画的草图吗?See2Think的诊断与发现

论文代表图:figure-02-p003-01

多模态大模型在推理时越来越喜欢画草图、做标注,但它们真的依赖这些自生成的视觉信息吗?See2Think这篇论文没有只看最终答案,而是设计了一套诊断框架,把视觉推理拆成三个环节:动作是否相关、渲染是否保真、后续推理是否采纳。通过在1200个样本上对四个主流模型进行标准与损坏渲染的对照实验,研究发现一个反直觉的结论——模型经常提出相关动作,但渲染质量普遍不高,而且即使渲染正确,收益也远小于损坏反馈带来的伤害。这说明当前模型的中间视觉推理更像一种行为惯性,而非真正的视觉依赖。视频将带你理解这一诊断逻辑及其对多模态系统设计的启示。

遥感大模型为何需要多工具?GeoLens超越单一缩放

论文代表图:figure-01-p002-01

超高分辨率遥感图像中,证据往往稀疏且分散。单一缩放工具在处理全局搜索或多区域比较时存在性能饱和。本文介绍GeoLens,通过构建GeoMTVR数据集和RTAL算法,实现多工具协同推理。实验显示其在XLRS-Bench等基准上超越主流大模型。注意:目前仅针对光学图像,且依赖半自动标注。

SIVA-RL:基于样本级干预结果的动态路由视觉对齐

基于结果的动态路由策略

本文提出SIVA-RL框架,针对多模态强化学习中视觉干预效果异质性问题,通过基于奖励下降幅度的动态路由,将样本分为敏感性对齐和不变性对齐。实验显示,该方法在Qwen2.5-VL-3B和7B模型上显著提升视觉依赖任务准确率,但需注意PatchSwap超参数敏感性及黑屏正确性的误导性。

UniVR:在视觉空间中进行统一视觉推理的思考

UniVR框架概述

本文提出UniVR框架,旨在解决现有AI模型依赖文本空间推理导致的物理一致性差及扩展受限问题。UniVR基于Emu3.5,采用两阶段训练:冷启动SFT建立视觉先验,随后通过VR-GRPO强化学习范式,结合全局奖励与Step-Focal奖励,直接在视觉空间中进行复杂推理和长程规划。实验显示,UniVR在VR-X基准上较基座提升20.9%,长程规划任务提升25.2%,并在34B参数规模下超越Gemini 3 Pro。需注意,该方法对计算资源要求较高,且奖励机制依赖通用VLM,在细粒度物理知识方面仍有局限。