VLM裁判为何总说“任务完成”?OSReward揭示宽松偏差并开源纠正模型

快速导读:提出首个跨平台、基于人工标注的CUA轨迹评估基准OSReward,系统评测27个VLM裁判的可靠性,揭示其普遍存在的宽松偏差,并发布开源奖励模型OS-Shepherd以低成本弥合可靠性差距。

计算机使用智能体(CUA)正快速发展,其评估、数据筛选和强化学习都依赖VLM作为裁判来判断轨迹是否完成任务。然而,这些裁判本身的可靠性从未被系统检验过——它们会不会系统性地犯错?OSReward论文直面这一问题,构建了首个跨平台、基于全新采集和严格人工标注的CUA轨迹评估基准,对27个VLM裁判进行了全面评测,揭示了普遍存在的“宽松偏差”,并开源了低成本奖励模型OS-Shepherd以弥合可靠性差距。

核心发现是:几乎所有VLM裁判都倾向于将失败轨迹误判为成功,其中“接受未完成任务”错误占所有错误的48%以上。在困难子集OSReward-Hard上,所有裁判的平均准确率降至52%,连最强商业模型也从89.7%骤降至69.7%。这一发现对依赖VLM裁判进行强化学习训练的CUA研究具有深远影响——如果裁判系统性地放过失败,智能体将学到错误的行为模式。

英文题目:OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

论文出处:arXiv 每日论文精选 · arXiv:2607.28609

原始论文:PDF / 论文页面

这篇论文解决什么问题?

CUA智能体的评估面临独特挑战:任务成功与否往往需要理解多步操作序列和屏幕状态变化,而非简单的最终状态比对。因此,研究者普遍使用VLM作为自动化裁判,通过分析操作轨迹来判断任务完成情况。这些裁判的判决直接影响数据筛选、模型评估和强化学习的奖励信号。

然而,现有研究存在两个关键盲区。第一,缺乏跨平台、高质量的人工标注基准来测量裁判本身的可靠性。已有基准多局限于单一平台,且复用已有数据的轨迹,其标签可能包含验证器噪声。第二,从未有人系统研究过VLM裁判的错误模式——它们是否倾向于某种特定类型的误判?这种偏差在不同模型家族中是否一致?

OSReward的出发点正是填补这一空白。作者指出,如果不先校准裁判本身,整个CUA评估体系就建立在不可靠的基础之上。论文的核心问题可以概括为:VLM裁判在评估CUA轨迹时到底有多可靠?它们的错误是否有规律可循?

核心创新

  • 首个跨平台、基于全新采集和严格人工标注的CUA裁判评估基准OSReward,包含困难子集OSReward-Hard和细粒度评分子集OSReward-Multi。
  • 对27个VLM裁判进行了迄今为止最全面的评测,系统揭示了其共有的“宽松偏差”(将失败误判为成功)及成本-可靠性矛盾。
  • 构建并开源了大规模推理标注训练语料OS-Shepherd-100K,利用多裁判一致性筛选而非投票来获取可靠标签。
  • 训练并开源了低成本、自托管的奖励模型OS-Shepherd(9B/35B),通过两阶段训练(SFT+RL)针对性纠正宽松偏差,在困难集上以极低成本达到商业模型水平。

方法概览

构建专用的跨平台数据基础设施(Web、Windows、Ubuntu、Mobile),由人类标注员编写并交叉验证任务指令,使用多种智能体执行以产生真实成功与失败轨迹,再通过多阶段人工标注(三人独立标注+元审查)获得黄金标签,形成OSReward基准。基于对27个VLM裁判的全面评测发现,利用多裁判一致性筛选大规模轨迹,构建推理标注训练语料OS-Shepherd-100K,并采用SFT+RL两阶段训练得到开源奖励模型OS-Shepherd。

  • 跨平台数据基础设施:构建了覆盖Web、Windows、Ubuntu和Mobile四个平台的数据采集管线。人类标注员在各平台上编写任务指令,使用多种智能体执行以产生真实的成功与失败轨迹。这种设计确保了轨迹的多样性和真实性。
  • 严格的多阶段人工标注:每条轨迹由三名独立标注员进行二元判断(成功/失败),不一致的案例进入元审查阶段。最终获得1019条高质量黄金标签轨迹,标注员间一致性达到较高水平。
  • OSReward-Hard困难子集:从完整集中筛选出智能体失败率高的困难轨迹,形成OSReward-Hard子集。该子集中失败样本占70%,更能考验裁判识别失败的能力。
  • OSReward-Multi细粒度评分子集:除了二元判断,还对部分轨迹进行了对齐性和效率的细粒度评分,用于评测裁判的多维度评估能力。
  • 27个VLM裁判的全面评测:涵盖商业API模型和开源模型,在统一设定下(固定提示词、最后五张截图、完整文本历史、贪心解码)进行评测,分析二元准确性、成功/失败召回率及偏差模式。
  • OS-Shepherd-100K训练语料构建:利用多裁判一致性筛选大规模轨迹,而非简单投票。当多个裁判对同一轨迹给出相同判断时,该标签被认为更可靠。最终构建了包含321,631个裁判实例的训练语料。
  • 两阶段训练策略:基于Qwen3.5基座模型,先进行SFT训练使模型学会基本的轨迹评估能力,再通过RL(使用GRPO算法)针对性纠正宽松偏差。RL阶段的奖励函数设计为惩罚假阳性错误。
  • 成本-可靠性分析:系统记录了所有裁判的API调用成本,绘制了成本-准确率散点图,揭示了可靠性与成本之间的矛盾关系。

逐图理解论文

一个令人不安的发现

一个令人不安的发现
Figure 7: Per-judge error composition, seven representative judges: over-accepting an incomplete task (warm colors) dominates every family.

图7展示了七个代表性裁判的错误组成。暖色部分代表“接受未完成任务”错误,在所有模型中均占主导地位,说明这是VLM裁判的系统性缺陷,而非个别模型的偶然问题。

研究空白与OSReward的定位

研究空白与OSReward的定位
Figure 4: The annotation pipeline. Each pre-filtered trajectory is labeled by three independent annotators; disagreements go to meta review, and the verified gold set is read as three views

问题在于,此前从未有人系统测量过这种偏差。现有研究要么局限于单一平台,要么直接复用已有基准的轨迹——那些标签本身就可能包含噪声,无法用来校准裁判。OSReward的贡献在于,它首次构建了一个跨Web、Windows、Ubuntu和Mobile四个平台的专用基准,所有轨迹都由人类标注员从头编写指令、执行并严格标注,形成了真正可靠的黄金标签。

评测揭示的真相

评测揭示的真相
Figure 6: Judge bias on OSReward (left) and OSReward-Hard (right). Judges below the diagonal skew lenient; most of the field sits there, and the skew widens on the hard set.

图6是对角线偏差图,每个点代表一个裁判,对角线以下表示宽松偏差。左图(完整集)已有明显偏差趋势,右图(困难集)偏差进一步扩大,几乎所有裁判都深陷宽松区域。

OS-Shepherd:低成本纠正偏差

OS-Shepherd:低成本纠正偏差
Figure 2: Cost against binary accuracy on OSReward-Hard: reliable judges are expensive, and the OS-Shepherd models come nearest their accuracy at a fraction of the cost.

图2绘制了OSReward-Hard上成本与准确率的关系。可靠裁判(高准确率)成本极高,而OS-Shepherd模型以极低成本接近了商业模型的准确率水平,展示了开源方案的成本优势。

实验如何设计?

  • 主评测:在OSReward完整集(1019条轨迹)和OSReward-Hard子集上评测27个VLM裁判的二元判断准确率、成功召回率和失败召回率。
  • 偏差分析:通过绘制成功召回率-失败召回率散点图,可视化每个裁判的宽松/严格倾向。对角线以下表示宽松偏差。
  • 错误组成分析:将裁判错误分为“接受未完成任务”、“拒绝已完成任务”等类别,统计各类型的占比。
  • 输入消融实验:分别移除截图、减少截图数量、移除文本历史,观察对裁判决策的影响。
  • 泛化性测试:在AndroidWorld、WebArena、OSWorld三个外部基准上验证裁判和OS-Shepherd的表现。
  • 细粒度评分评测:在OSReward-Multi子集上评测裁判的对齐性和效率评分能力。

关键结果与论文证据

  • 宽松偏差普遍存在:几乎所有VLM裁判都位于对角线以下,倾向于将失败轨迹误判为成功。在OSReward-Hard上,这一偏差更加严重(第11页,图6)。
  • “接受未完成任务”是主导错误:该错误类型占所有裁判错误的48%以上,在所有模型家族中均占主导地位(第12页,图7)。这意味着裁判最常犯的错误是放过那些声称完成但实际未完成的任务。
  • 困难集上性能骤降:Claude-Opus-4-8在完整集上准确率89.7%,在OSReward-Hard上降至69.7%;所有裁判在困难集上的平均准确率仅为52%(第10-11页)。
  • 文本历史至关重要:移除文本历史导致平均准确率下降7.2个百分点,翻转了22.7%的判决(第13页)。这说明裁判高度依赖操作序列的文本来理解轨迹。
  • 成本与可靠性矛盾:高准确率的裁判(如Claude-Opus-4-8)成本极高,而低成本模型准确率显著偏低。OS-Shepherd-9B以$1.36的成本在困难集上达到60.2%准确率,比前沿模型便宜30-60倍(第17页,表4)。
  • OS-Shepherd有效纠正偏差:通过SFT+RL两阶段训练,模型从宽松区域移向平衡对角线,RL阶段贡献了最大的困难集提升(第41页,图14)。
  • 泛化能力验证:OS-Shepherd-9B在OSWorld上准确率与GPT-5.5相当,优于所有其他开源模型(第19页,图11)。
  • 细粒度评分仍是挑战:在OSReward-Multi上,所有模型(包括OS-Shepherd)的对齐性和效率评分性能远低于二元判断,说明多维度评估仍是未解决的难题(第13页,表2)。

阅读时需要注意

  • OSReward-Multi的细粒度评分对所有模型仍是挑战,性能远低于二元判断,说明当前VLM在多维度轨迹评估上能力有限。
  • OS-Shepherd在OSReward-Hard上的准确率约60%,虽领先同成本模型,但距离理想训练用奖励信号(约90%)仍有差距。
  • 裁判集成效果有限:由于模型判断趋同(herding),集成多个裁判未能显著超越最佳单一裁判。
  • OS-Shepherd-100K的标签来源于VLM裁判集成,虽经一致性筛选,但仍可能继承未被发现的系统性偏差。
  • 外部基准的验证器本身存在噪声,文中报告的“一致性”并非绝对真实准确率,泛化性结论需谨慎解读。

关联工作

  • OSWorld、WebArena、AndroidWorld:作为外部泛化性测试基准,用于验证裁判和OS-Shepherd在不同平台环境的迁移能力。
  • Qwen3.5:OS-Shepherd的基座模型,提供了强大的视觉语言理解基础。
  • GRPO:用于RL阶段的强化学习算法,通过组内相对比较来优化模型输出。
  • 现有CUA奖励模型工作对比:OSReward是唯一从全新采集、人工标注轨迹端到端构建的基准,也是唯一提供超越二元判断的黄金标签的基准(第39页,表10)。

发表评论