VLM裁判为何总说“任务完成”?OSReward揭示宽松偏差并开源纠正模型
计算机使用智能体(CUA)的评估、数据筛选和强化学习都依赖VLM裁判来判断轨迹是否成功。但裁判本身可靠吗?OSReward构建了首个跨平台、严格人工标注的基准,对27个VLM裁判进行系统评测,发现它们普遍存在“宽松偏差”——将失败轨迹误判为成功。其中“接受未完成任务”错误占所有错误的48%以上。论文进一步开源了OS-Shepherd奖励模型,通过SFT+RL两阶段训练针对性纠正偏差,在困难集上以极低成本达到商业模型水平。但需注意,OSReward-Hard上失败样本占70%,原始准确率需结合平衡准确率解读;OS-Shepherd在困难集上约60%的准确率仍距理想训练信号有差距。