UniCross:从手-物关系视角统一四种灵巧技能,实现无缝长程操作

统一视角:手-物关系运动

灵巧操作包含抓取、重定位、手中旋转和平移四种基本技能,但现有方法为每种技能设计特定约束和目标,导致技能间缺乏兼容性,难以组合成长程操作。UniCross 提出手-物关系视角,将所有技能统一建模为“在保持物体稳定的同时实现期望的关系运动”,从而共享状态、动作和奖励结构。论文先用 PPO 独立训练十个单技能策略,再通过 DAgger 蒸馏为单一统一策略。实验表明,统一策略在四种技能上均达到高成功率,并能泛化到未见物体和不同手部形态,同时支持技能链式组合完成长程操作。需要注意的是,训练和评估对象限于简单几何体,对复杂日常物体的泛化性尚未充分验证。

Beacon:知何时与如何执行智能体视觉推理——让模型按需调用工具并真正获益

论文代表图:figure-01-p001-01

现有智能体视觉推理模型常盲目调用工具,导致在简单问题上引入错误,工具带来的增益被损害抵消,净收益有限。Beacon 提出两个核心机制:必要性感知自适应奖励(NAAR)让模型学会只在必要时调用工具;提示引导能力扩展(HCE)则帮助模型在极难问题上突破能力边界。在13个基准上,Beacon 不仅取得开源最佳,更展现出最强的模式自适应性和最大的工具净增益。但该方法依赖外部专家模型生成提示,且模型在避免不必要工具调用方面仍有提升空间。

GUI智能体为何一上真机就翻车?Qwen-UI-Agent用真实设备给出答案

论文代表图:figure-06-p017-01

现有GUI智能体在模拟基准上分数很高,但一到真实手机就频繁失败。Qwen-UI-Agent直面这个问题,构建了包含超100台真实设备的运行环境,让模型在真实应用、真实网络、真实弹窗中训练和评估。它还引入混合GUI+CLI动作空间,让智能体既能点击屏幕也能执行命令行,大幅提升复杂任务的完成效率。论文在多个真实设备基准上验证了方法的有效性,同时也坦诚分析了探索失败、弹窗干扰等仍存在的局限。

Pictura:如何用 CUDA 光栅化器实现大规模纯视觉驾驶自博弈

研究缺口:速度与可观测性

现有驾驶自博弈依赖特权向量状态,导致视觉策略存在表征鸿沟。Pictura 提出自定义 CUDA 光栅化器,在单卡上实现高速透视渲染,直接训练 Alberti 策略。实验表明其在零样本迁移中表现优异,且行为更具视觉因果性。需注意其简化几何渲染带来的域差距。

先预见后行动:未来状态条件视觉语言导航

方法概述:双查询与未来监督

本文提出FSC-VLN方法,解决标准行为克隆在长程导航中因缺乏未来状态监督导致的误差累积问题。通过在训练阶段引入冻结SigLIP编码器提取的未来视觉嵌入作为目标,对齐可学习的未来查询token,实现未来状态监督。实验显示在R2R+RxR数据集上SR提升1.47pp,且在长程任务中增益显著。需注意该方法依赖专家轨迹,且增益主要集中在长距离导航。

稀疏证据足矣:SIEVE智能体驱动的多模态视频虚假信息检测

方法:SIEVE框架概览

传统视频虚假信息检测常因处理冗余数据而效率低下且缺乏可解释性。本文提出SIEVE框架,通过Evidence Agent在预算约束下主动搜寻OCR、ASR及视觉线索,构建紧凑证据包供Verifier判定。实验显示,SIEVE在FakeSV和FakeTT上分别达到92.62%和91.64%准确率,刷新SOTA;在跨域基准FakeVV上亦展现良好泛化能力。需注意,模型对特定数据集证据分布存在依赖,且视觉读取受限于24张图像上限。

少即是多:无需架构修改,MLRS凭数据多样性在遥感VLM中登顶

方法:MLRS与GRTO框架

本文提出MLRS,基于InternVL3.5-8B和SAM3,通过GRTO强化学习框架联合优化,无需修改VLM架构即可在遥感多任务中达到SOTA。实验显示,在GEOBench-VLM检测Precision@0.5从0.24提升至0.56,GeoSeg-Bench2分割IoU从0.41提升至0.70。研究证明数据多样性比数据量更能驱动OOD泛化,但需注意微调SAM3可能牺牲零样本泛化能力,且多时相/多视角任务因数据源单一提升有限。

AdaTurn:预算感知测试时扩展,解决视觉代理截断难题

方法:预算条件化代理

本文提出AdaTurn框架,解决主动视觉代理在有限Rollout预算下的灾难性截断问题。通过预算条件化决策与FA-DAPO强化学习策略,模型学会在预算耗尽前主动生成答案。实验显示在VisualProbe等基准上低预算性能显著提升,且负载均衡调度器提升了训练效率。

SIVA-RL:基于样本级干预结果的动态路由视觉对齐

基于结果的动态路由策略

本文提出SIVA-RL框架,针对多模态强化学习中视觉干预效果异质性问题,通过基于奖励下降幅度的动态路由,将样本分为敏感性对齐和不变性对齐。实验显示,该方法在Qwen2.5-VL-3B和7B模型上显著提升视觉依赖任务准确率,但需注意PatchSwap超参数敏感性及黑屏正确性的误导性。

IQA-T1:用工具调用生成视觉证据,破解大模型图像质量评估的语义偏差难题

训练流程:SFT与强化学习

本文介绍IQA-T1框架,针对现有基于多模态大语言模型的图像质量评估方法中存在的语义偏差和低层感知退化捕捉不足问题,提出基于工具的视觉证据推理范式。通过构建Q-Tool数据集并进行监督微调与强化学习,模型能自适应调用噪声残差等分析工具生成显式证据。实验显示,该方法在KonIQ、SPAQ等七个基准上平均PLCC/SRCC达0.795/0.784,优于现有对比方法。需注意工具库覆盖范围及推理延迟限制。