VLM裁判为何总说“任务完成”?OSReward揭示宽松偏差并开源纠正模型

研究空白与OSReward的定位

计算机使用智能体(CUA)的评估、数据筛选和强化学习都依赖VLM裁判来判断轨迹是否成功。但裁判本身可靠吗?OSReward构建了首个跨平台、严格人工标注的基准,对27个VLM裁判进行系统评测,发现它们普遍存在“宽松偏差”——将失败轨迹误判为成功。其中“接受未完成任务”错误占所有错误的48%以上。论文进一步开源了OS-Shepherd奖励模型,通过SFT+RL两阶段训练针对性纠正偏差,在困难集上以极低成本达到商业模型水平。但需注意,OSReward-Hard上失败样本占70%,原始准确率需结合平衡准确率解读;OS-Shepherd在困难集上约60%的准确率仍距理想训练信号有差距。

病理VLM真的看懂图像了吗?PathBind基准揭示领域训练幻觉

解决方案:PathBind基准

当前病理VLM评估常陷入‘准确率陷阱’。本文通过PathBind基准证明,许多模型仅依赖文本先验而非视觉证据。领域微调虽提升准确率,却常削弱视觉定位能力(Domain Training Illusion)。视频详解这一现象及其对医疗AI评估的启示。

VLM-IE3D:仅用RGB视频实现细粒度3D空间理解

方法概览:VLM-IE3D框架

本文介绍VLM-IE3D框架,通过融合隐式几何令牌(IGTs)和显式几何令牌(EGTs),解决现有RGB-only VLMs缺乏细粒度3D理解的问题。实验显示在Scan2Cap、ScanRefer、3D Video Detection及VSI-Bench上均取得SOTA表现。注意:推理速度略有下降,且依赖3D几何编码器重建质量。

无根基的注意力:医学VLM热力图为何不可信

方法:三轴解释验证协议

医学视觉语言模型(VLM)生成的注意力热力图是否忠实反映了驱动预测的图像证据?本研究通过因果扰动和受控定位指标审计发现,当前主流医学VLM(如MedGemma, LLaVA-RAD, Qwen3-VL)的注意力热力图虽看似合理,但并未真正锚定驱动预测的图像证据,且无法通过随机控制测试。相比之下,专用CXR分类器(如DenseNet)在相同测试中表现显著更好。视频详细解析了三轴验证协议、实验结果及VLM解释的局限性,提醒研究者避免仅凭视觉检查验证可解释性。

PIXAR-DG:现代VLM像素级篡改检测的跨域泛化突破

方法概述:PIXAR-DG框架

针对现代视觉语言模型(VLM)生成图像的篡改检测难题,PIXAR-DG提出跨域泛化训练框架。通过平衡采样、晚期注入和低学习率策略,PIXAR-DG在PIXAR基准上显著优于PIXAR、SIDA和LISA等基线方法。实验显示,PIXAR-DG-13B在分布外生成器上的准确率提升25.0%,且仅需19.2%的训练数据即可达到更优效果。需注意,该方法依赖源域数据质量,极端分布外偏移下可能失效。

视觉相似性的多重维度:一种文本提示的图像感知度量

模型架构与训练

现有视觉相似性度量(如LPIPS, DreamSim)将相似性坍缩为单一标量,无法根据特定视觉方面(如颜色、姿态)进行条件化。本文提出TPIPS,通过微调Qwen3-VL-8B-Emb并构建包含25K图像三元组的大规模数据集,实现基于自由文本提示的细粒度、多面视觉相似性度量。实验显示,TPIPS在Odd-one-out任务上将模型-人类一致性差距从9.1%缩小至2.8%,在2AFC域外任务上将误差从15.8%降低至10.0%。该方法在条件化检索和生成模型评估中展现出新能力,但计算成本高于传统度量。

少即是多:无需架构修改,MLRS凭数据多样性在遥感VLM中登顶

方法:MLRS与GRTO框架

本文提出MLRS,基于InternVL3.5-8B和SAM3,通过GRTO强化学习框架联合优化,无需修改VLM架构即可在遥感多任务中达到SOTA。实验显示,在GEOBench-VLM检测Precision@0.5从0.24提升至0.56,GeoSeg-Bench2分割IoU从0.41提升至0.70。研究证明数据多样性比数据量更能驱动OOD泛化,但需注意微调SAM3可能牺牲零样本泛化能力,且多时相/多视角任务因数据源单一提升有限。

VLMs如何失败?组合式VQA中的视觉-操作错位与通路解离

问题背景:组合推理的复杂性

本研究深入分析Qwen2.5-VL-3B-Instruct在组合式视觉问答中的失败机制。通过因果均值消融、注意力消除和MLP消除,发现接地与属性提取失败源于前馈网络,而推理失败源于晚期注意力。跨架构分析显示LLaVA-1.5-7B因编码器压缩空间细节而表现不同。