GUI智能体为何一上真机就翻车?Qwen-UI-Agent用真实设备给出答案

快速导读:Qwen-UI-Agent 是一个面向真实世界的基础 GUI 智能体,通过真实设备环境、混合 GUI+CLI 动作空间、自动化数据飞轮和在线强化学习,在移动端、电脑端、浏览器和深度搜索等任务上取得了领先或具有竞争力的性能。

Qwen-UI-Agent 是通义团队提出的面向真实世界的基础 GUI 智能体系统。与大多数只在模拟基准上优化的 GUI 智能体不同,该工作直接将真实设备纳入训练和评估循环,构建了包含超 100 台真实手机和超 150 个应用的移动端运行时,从而暴露并解决模拟环境无法复现的界面复杂性、动态状态和权限弹窗等问题。

论文的核心主张是:真实设备环境、混合 GUI+CLI 动作空间和在线强化学习,是构建实用 GUI 智能体的三个关键支柱。通过在 MobileWorld-Real、AndroidDaily、OSWorld 等多个基准上的系统评估,Qwen-UI-Agent 展现了领先或具有竞争力的性能,同时也通过详尽的失败模式分析揭示了当前方法的边界。

英文题目:Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

论文出处:arXiv 每日论文精选 · arXiv:2607.28227

原始论文:PDF / 论文页面

对应视频标题:GUI智能体为何一上真机就翻车?Qwen-UI-Agent用真实设备给出答案|推荐指数:★★★★★

这篇论文解决什么问题?

GUI 智能体的目标是理解用户意图、感知界面状态并操作界面来自动化数字任务。近年来多模态基础模型的进展使这一领域快速发展,但大多数工作仍局限于模拟基准。模拟环境虽然可控且可重复,却无法复现真实设备上的界面渲染差异、系统弹窗、网络波动和应用版本更新等问题。

这种模拟与现实的差距导致了一个尴尬的局面:模型在模拟基准上得分很高,但部署到真实手机后频繁失败。论文指出,现有 GUI 智能体缺乏跨平台、长序列、混合交互和主动服务能力,与真实世界应用存在巨大差距。

此外,现有工作大多采用单一的 GUI 动作空间,即只能通过点击、滑动等图形操作来完成任务。但在真实场景中,许多操作通过命令行执行效率更高,例如批量文件处理、系统配置修改等。将 GUI 和 CLI 操作割裂开来,限制了智能体的能力边界。

另一个被忽视的问题是主动服务。现有智能体通常是被动响应用户指令的,但在真实世界中,智能体应当能够根据系统通知主动发起任务,例如检测到航班取消通知后自动搜索替代方案并调整日程。

核心创新

  • 构建了包含超 100 台真实设备和超 150 个应用的真实设备移动端运行时,用于训练和评估,以弥合模拟与现实的差距。
  • 提出统一的混合 GUI+CLI 动作空间,支持在单个轨迹中交错进行图形界面操作和命令行执行,并支持批处理动作以提升效率。
  • 设计了 AutoResearch 风格的智能体驱动数据飞轮,自动化任务合成、环境构建、验证器生成、失败分析和迭代优化,减少人工干预。
  • 将在线强化学习扩展到超过 100 步的长序列任务,并采用模型自适应课程学习,在约 10,000 个并发环境中加速 rollout。
  • 开发了 Harness 层,实现基于移动通知的主动服务启动和跨移动端与电脑端的上下文保持工作流。

方法概览

Qwen-UI-Agent 构建了一个包含真实设备移动端运行时和可扩展沙箱的环境基础设施,采用统一的混合 GUI+CLI 动作空间。通过自动化数据飞轮进行任务合成、轨迹收集和失败分析,结合 SFT、Action RL 和可扩展的 Online RL 进行训练。一个轻量级 Harness 层支持基于通知的主动服务和跨平台任务执行。

  • 真实设备移动端运行时:构建了包含超 100 台真实设备和超 150 个应用的运行环境,配备健康感知调度器,自动将任务路由到可用的手机和应用,并对故障设备进行黑名单管理和修复验证。虚拟显示技术使一台手机可并发运行多个应用。
  • 混合 GUI+CLI 动作空间:统一了图形界面操作和命令行执行,支持在单个轨迹中交错使用 click、type、scroll 等 GUI 动作和 bash、python 等 CLI 命令。还支持批处理动作,将多个原子操作合并为一次模型调用,提升执行效率。
  • 自动化数据飞轮:采用 AutoResearch 风格的智能体驱动流程,自动进行任务合成、环境构建、验证器生成、轨迹收集和失败分析。通过迭代识别能力短板并生成针对性训练数据,减少人工干预。
  • 三阶段训练策略:先通过 SFT 进行领域能力引导,再使用 Action RL 优化动作决策,最后通过可扩展的 Online RL 在约 10,000 个并发环境中进行长序列训练,并采用模型自适应课程学习逐步增加任务难度。
  • Harness 层:轻量级层支持基于移动通知的主动服务启动,能够检测通知、推理相关事务、主动执行任务并呈现决策就绪的计划。同时维护任务状态,支持跨移动端和电脑端的上下文保持工作流。
  • AutoJudge 自动评判器:使用 VLM 对真实设备轨迹进行自动评估,通过基于证据的评审区分任务成功、模型失败和环境错误。与人类标注的一致率达到 92.8%,在成功判断上达到 96.2%。

逐图理解论文

失败直觉

失败直觉
Figure 13: Representative real-device failure patterns of Qwen 3.7 Plus. Execution capability limitations: (a) exploration failure, (b) erroneous action loops, (c) lost execution state. Real-world scenario challenges: (d) UI misreading, (e) pop-up interference, (f) physical widget control. Speech bubbles quote the model’s abridged thinking, with the critical fallacy in purple.

图 13 展示了真实设备上的典型失败模式,包括探索失败、错误动作循环、状态丢失、UI 误读、弹窗干扰和物理控件操作困难六类问题。

核心贡献

核心贡献
Figure 4: Real-device mobile runtime with closed-loop environment governance. The health-aware scheduler routes each task to an eligible phone, App/account, and display; unhealthy targets remain blacklisted until repair and revalidation. Virtual displays allow one phone to run multiple Apps concur- rently. Evidence-based review separates task success, model failure, and environment failure from the complete trajectory, and confirmed environment issues are fed back to the scheduler.

Qwen-UI-Agent做了三件关键的事。第一,它构建了包含上百台真实设备的运行环境,让模型直接在真实手机上训练和评估。第二,它设计了混合动作空间,让智能体既能点击屏幕,也能执行命令行,还能把多个操作打包成批处理动作。第三,它用自动化数据飞轮持续收集失败轨迹、分析弱点、生成针对性训练数据,再通过在线强化学习让模型在真实环境中自我进化。

核心结论

核心结论
Table 3: Performance comparison on real-device mobile benchmarks. MobileWorld-Real is our proposed Chinese real-device mobile GUI benchmark (Section 3.2), and AndroidDaily (Sui et al., 2026) covers high-frequency daily scenarios on real Android devices.

这套方法的效果是显著的。在真实设备基准MobileWorld-Real上,Qwen-UI-Agent的成功率远超其他模型。更重要的是,混合动作空间在电脑端任务中发挥了关键作用——智能体学会了在合适的时候用命令行批量处理文件,而不是傻傻地一个个点击。这说明,让智能体掌握多种工具,并在真实环境中磨练,是走向实用的必经之路。

实验如何设计?

  • 在 MobileWorld-Real 真实设备基准上评估,包含超 400 个人工编写的任务,覆盖超 100 个应用,反映日常移动使用的广度。
  • 在 MobileWorld GUI-only 子集(117 个任务)、AndroidDaily、OSWorld-Verified、OSWorld-v2、WebArena、BrowseComp 等多个基准上进行全面评估。
  • 与前沿通用模型(如 Opus 4.8、GPT-5.6 Sol、Gemini 3.1 Pro)和专用 GUI 智能体进行性能对比。
  • 通过失败模式分布统计、GUI-CLI 协调使用分析和 RL 前后行为对比,进行深入的智能体行为分析。
  • 验证 AutoJudge 在真实设备轨迹评估中与人类标注的一致性。

关键结果与论文证据

  • 在 MobileWorld-Real 真实设备基准上达到 92.2% 的成功率(第 4 页),显著优于其他模型。
  • 在 AndroidDaily 上达到 97.5% 的成功率(第 4 页),展现了对高频日常场景的可靠处理能力。
  • 在 MobileWorld GUI-only 子集上达到 82.1% 的成功率(第 4 页),领先于专用 GUI 模型和通用 VLM。
  • 在 OSWorld-Verified 上达到 79.5% 的成功率(第 4 页),混合动作空间在其中发挥了关键作用。
  • 在 OSWorld-v2 上达到 13.9% 的二元成功率和 40.0% 的部分进度分数(第 4 页),反映了更复杂任务的挑战。
  • 在 WebArena 上达到 73.6% 的成功率(第 4 页),在浏览器端任务上具有竞争力。
  • AutoJudge 与人类标注的总体一致率为 92.8%,成功判断一致率为 96.2%(第 52 页),验证了自动评估的可靠性。
  • 失败模式分析显示,探索失败、错误动作循环、状态丢失、UI 误读和弹窗干扰是真实设备上的主要失败原因(第 33 页)。

阅读时需要注意

  • 模型在真实设备上仍存在探索失败、错误动作循环、状态丢失、UI 误读、弹窗干扰和物理控件操作困难等失败模式。
  • 模型在长尾动作(如 open、ask_user、long_press)上的表现显著弱于高频动作(如 click、type)。
  • AutoJudge 在区分模型失败和环境错误时仍存在困难,因为相似的观察结果可能由不同原因导致。
  • 在线 RL 训练需要大量并发环境和可执行验证器,对基础设施要求高。
  • 模型在真实设备上的卓越表现可能部分得益于针对中国移动生态的专门优化,泛化到其他生态需进一步验证。

关联工作

  • MAI-UI 是 Qwen-UI-Agent 的前序工作,本文在其基础上扩展了真实设备、混合动作空间和主动服务等能力(第 1 页)。
  • MobileWorld 是用于移动端 GUI 智能体评估的可重置 Android 沙箱基准,本文在其上构建了移动端沙箱环境(第 8 页)。
  • OSWorld 是用于电脑端 GUI 智能体评估的基准,本文在其 Ubuntu 虚拟机环境基础上扩展了 CLI 执行能力(第 8 页)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

2026年7月31日

Qwen-UI-Agent 技术报告:迈向下一代以现实世界为核心的基础图形用户界面智能体

MAI-UI 团队∗

阿里巴巴 Token Hub,阿里巴巴集团

tongyi-mai.github.io/Qwen-UI-Agent

摘要 图形用户界面智能体有潜力成为现有数字设备上的通用执行器。为了推动其走向现实世界应用,我们构想的智能体能够在真实设备上可靠运行,跨平台执行工作流,将图形界面交互与命令行执行相结合,完成长周期任务,主动发起有用的服务,并以最少的人工干预自主提升其能力。在此愿景指导下,我们提出了 Qwen-UI-Agent,一个以现实世界为核心的基础图形用户界面智能体,覆盖移动端、计算机使用、网页和 DeepSearch 环境。Qwen-UI-Agent 将多种沙箱环境与大规模真实设备移动端运行时相结合。其统一动作空间将图形界面操作与命令行执行交织在一起,并在单次模型轮次中生成批处理动作。一个 AutoResearch 风格的数据飞轮利用智能体来构建任务和环境、诊断失败并规划后续迭代。在线强化学习支持对超过 100 轮的轨迹进行训练,超过 10,000 个并发环境加速了 rollout。一个轻量级 Harness 层支持主动服务发起以及跨移动端和计算机的有状态工作流。在广泛的评估套件中,Qwen-UI-Agent 在移动端使用基准测试上取得了最先进的性能,同时在计算机和浏览器使用任务上,相较于前沿模型(包括 Opus 4.8、Gemini 3.1 Pro 和 GPT-5.6 Sol)展现了有竞争力的性能。在移动端使用方面,它在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,在 AndroidDaily 上达到 97.5%。在计算机使用方面,它在 OSWorld-Verified 上达到 79.5%,在 OSWorld-v2 上获得 40.0% 的部分进度得分。在浏览器使用和图形界面定位方面,它分别在 WebArena 上达到 73.6%,在 ScreenSpot-Pro 上达到 81.5%。[cs.AI] arXiv:2607.28227v1

图 1: Qwen-UI-Agent 在多种图形界面设置中展现了领先或有竞争力的性能。

∗Qwen-UI-Agent 是我们先前工作 MAI-UI 的延续 (Zhou et al., 2025a)。完整作者列表见贡献部分。

第 2 页

目录

1 引言 3

2 Qwen-UI-Agent 5 2.1 系统概览 … 6 2.1.1 任务形式化 … 6 2.1.2 动作空间 … 6 2.1.3 能力全景 … 7 2.2 环境基础设施 … 7 2.2.1 规模化沙箱环境 … 8 2.2.2 真实设备移动端环境:从模拟沙箱到真实世界学习 9 2.2.3 混合图形界面与命令行动作空间 … 10 2.2.4 异构环境的统一接口 … 11 2.3 智能体驱动的数据飞轮 … 11 2.4 训练 … 13 2.4.1 监督微调(SFT) … 13 2.4.2 动作级强化学习:纠正重复性动作错误 … 14 2.4.3 在线强化学习:学习长程决策 … 15 2.5 Harness 层:主动服务与跨平台任务执行 … 16 2.5.1 基于移动通知的主动服务 … 17 2.5.2 跨平台任务执行 … 19

3 实验 20 3.1 实验设置 … 20 3.2 MobileWorld-Real:真实世界移动端使用评测基准 … 21 3.3 主要结果 … 23 3.3.1 移动端使用评测 … 23 3.3.2 计算机使用评测 … 25 3.3.3 浏览器使用与深度搜索评测 … 26 3.3.4 图形界面定位 … 29 3.3.5 通用与智能体能力 … 30 3.4 Harness 赋能的工作流 … 31

4 图形用户界面智能体执行的行为分析 32 4.1 模型有限的真实设备经验如何影响其执行行为? … 32 4.2 深入观察 Qwen-UI-Agent 中的图形界面与命令行协同及批处理执行 … 34 4.3 动作级强化学习后的步骤级行为纠正 … 39 4.4 在线强化学习后的轨迹级行为转变 … 41

5 相关工作 42

6 结论 43

7 局限性与未来方向 44

8 贡献 45

A 附录 52 A.1 验证用于真实设备评估的 AutoJudge … 52 A.2 AutoJudge 对真实设备图形用户界面智能体轨迹的决策 … 52 A.3 补充定性示例 … 53

第 3 页

1 引言

图形用户界面(GUI)是人类访问数字服务和应用的主要接口。因此,一个能力强大的图形用户界面智能体(Zhou et al., 2025a; Wang et al., 2025a; Qin et al., 2025; Xu et al., 2026)有潜力成为现有应用生态系统上的通用执行器:它能够理解用户意图、感知应用状态、操作界面并完成任务,而无需每个服务都暴露专用 API。多模态基础模型的最新进展使这一方向日益可行,推动了移动端和桌面端 GUI 智能体的快速进步(Cao et al., 2026; Gao et al., 2026; Huang et al., 2026; Shen et al., 2026)。

尽管取得了这些进展,GUI 智能体仍主要针对模拟基准进行优化,导致基准性能与现实世界实用性之间存在显著差距。为弥合这一差距,我们设想下一代 GUI 智能体应能在真实设备上可靠运行、完成长周期任务、跨平台执行工作流、主动发起有用服务、将 GUI 交互与 CLI 执行相结合,并以更少的人工持续进化其能力。为实现这一愿景,我们确定了六个关键转变:(1)从模拟环境到真实设备执行。许多 GUI 智能体,尤其是移动端智能体,针对模拟基准进行了优化,而真实移动设备涉及更复杂的应用功能、多样的 UI 布局、中断、权限和不断变化的环境。在模拟中表现良好的模型在真实设备上往往失败。(2)从孤立领域到跨领域、跨平台工作流。现有智能体通常分别针对移动端、网页或桌面构建,而现实世界任务可能跨越多个领域,并在手机和电脑之间延续。(3)从纯 GUI 动作到混合图形界面与命令行动作空间及批处理动作。GUI 交互提供了对视觉界面的通用访问,而基础模型日益增长的编码能力使 CLI 成为处理数据处理和文件操作等结构化任务的自然补充。通过结合这些动作类型并支持批处理动作,智能体可以更好地将执行方法与任务性质相匹配,从而提高执行效率并扩展任务覆盖范围。(4)从短周期任务到可靠的长周期任务完成。GUI 智能体的实用价值随着其能完成的用户目标复杂度和能代表用户执行的步骤数量而增长。然而,完成长周期任务需要持续的规划、状态跟踪、中间验证和从执行错误中恢复,这使得长周期可靠性成为一项具有挑战性的能力。(5)从人力密集型训练流程到 AutoResearch 式流程。当前的 GUI 智能体开发仍严重依赖人工构建任务、收集数据、训练模型、运行评估和分析失败。随着智能体能力的提升,这一过程应日益自动化。(6)从被动执行到主动服务发起。大多数智能体等待明确的用户指令,尽管许多有用的任务可以直接来自手机或其他设备上的数字信号。一个能识别此类可行动时刻并提出适当后续步骤的智能体,可以提供根本不同的用户体验。

在本报告中,我们介绍 Qwen-UI-Agent,一个围绕这五个转变开发的、以现实世界为中心的基础 GUI 智能体,代表了我们迈向面向现实世界实用性的下一代 GUI 智能体的一步。具体而言,Qwen-UI-Agent 提供以下核心特性:

• 真实设备移动端 GUI 基础。我们发现模拟到真实的差距在移动环境中尤为严重。为解决这一差距,我们构建了一个包含超过 100 台物理设备并支持 150 多个应用的真实设备移动端环境。我们将其用于真实设备上的现实任务设计、轨迹收集、在线强化学习和评估。为提升实际可用性,我们进一步支持高风险动作的用户接管,并将覆盖范围扩展到高频工作流和较少使用的应用功能。这些努力共同使 Qwen-UI-Agent 在真实手机上的表现大幅超越现有模型。

• 多领域能力与跨领域工作流。Qwen-UI-Agent 支持跨移动端、网页、计算机使用和 DeepSearch 环境的任务执行。我们的 Harness 层(用于主动服务和跨平台工作流的轻量级层)并非将这些能力视为孤立模块,而是在统一工作流中组合它们,保留

第 4 页

上下文与任务状态随执行过程在设备与环境间无缝流转。例如,图形界面工作流可调用 DeepSearch 高效检索并验证外部信息,避免耗时的图形界面网页导航,随后无缝恢复交互。这使得多领域覆盖转化为跨异构数字环境的集成任务执行。

• 混合图形界面与命令行动作空间及批处理动作。我们为 Qwen-UI-Agent 配备了统一动作空间,支持图形界面操作、基于 bash 的命令行命令以及批处理动作。模型可在单条轨迹中选择并组合这些动作,在各自最合适的场景下使用图形界面交互和命令行执行,同时将兼容动作进行批处理以减少不必要的步骤。在计算机使用任务中,命令行命令和图形界面点击成为两种主要动作类型,超过 40% 的动作输出为批处理形式,显著缩短了执行轨迹。

• 面向长程任务的可扩展在线强化学习。混合图形界面与命令行及批处理动作提升了局部执行效率,但完成长程任务还需要在整个轨迹中进行可靠的规划、状态跟踪和中间决策。因此,我们将验证器引导的在线强化学习扩展到超过 100 个交互步骤的轨迹。我们进一步支持约 10,000 个模拟环境并发运行以加速 rollout 生成,同时采用模型自适应课程,优先处理具有中等成功率的任务,并将已掌握的任务替换为更困难的任务。

• AutoResearch 式能力获取。我们构建了一个智能体驱动的迭代循环:智能体为数据飞轮生成并评估候选任务,处理 rollout 轨迹,分析失败原因,并为下一次迭代提出计划。该系统自动化了大部分能力开发过程,而非依赖人工手动推动每个阶段,人类主要提供监督和针对性修改。这种方法减少了人力投入,加速了新图形界面智能体能力的获取与精炼。

• 主动式移动服务。设想用户手机上收到一条航班取消通知。智能体无需等待用户注意并发出指令,即可识别受影响的行程,收集替代出行选项,对照用户日程进行核查,并呈现建议方案以供确认。为支持此类体验,我们基于移动通知构建了一个主动服务 Harness 层。除启动任务外,该 Harness 层还能形成对现实情境的连贯理解,生成个性化任务,执行已批准的动作,并根据用户反馈和长期交互历史持续演进。

实验表明,Qwen-UI-Agent 在广泛的评估场景中达到了最先进性能,涵盖真实设备与基于基准的移动使用、计算机使用、浏览器使用、DeepSearch 以及图形界面定位。在这些评估中,Qwen-UI-Agent 普遍优于领先的基础模型,包括 Opus 4.8 (Anthropic, 2026)、GPT-5.6 Sol (OpenAI, 2026b)、Gemini 3.5 Flash (Google, 2026b) 和 Seed2.1 Pro (ByteDance Seed, 2026b),以及专门的图形界面智能体。主要结果如下:

• 移动使用。在 MobileWorld-Real(我们包含 100 余款应用、400 余项任务的真实设备基准)上,Qwen-UI-Agent 取得了 92.2% 的成功率。它分别比前沿闭源模型 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol 和 Seed 2.1 Pro 高出 6.0、7.5、6.8 和 3.5 个百分点。在另一真实设备基准 AndroidDaily 上,Qwen-UI-Agent 进一步取得了近乎完美的 97.5% 成功率。在 MobileWorld 上,Qwen-UI-Agent 得分为 82.1%,分别超出 Opus 4.8、GPT-5.6 Sol 和 Seed 2.1 Pro 14.6、12.0 和 8.9 个百分点。

• 计算机使用。在 OSWorld-Verified 上,Qwen-UI-Agent 达到 79.5%,排名第二,并优于 GPT-5.5、Gemini 3.1 Pro 和 Seed 2.1 Pro。在更具挑战性的 OSWorld-v2 上,Qwen-UI-Agent 获得了第二高的二元成功率(13.9%)和第三高的部分进度得分(40.0%)。其部分进度得分分别超出 MiniMax M3 和 Qwen 3.7 Plus 17.7 和 18.5 个百分点,同时每个任务所需的步骤数分别减少 58.4% 和 21.7%。

• 浏览器使用与 DeepSearch。在 WebArena 上,Qwen-UI-Agent 达到 73.6%,分别优于 Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro 1.7、4.1 和 8.3 个百分点。在 DeepSearch 上,其得分为 64.1%,

4

第 5 页

图 2:Qwen-UI-Agent 执行主动式跨平台任务的示意轨迹。 左侧面板总结了该轨迹背后的系统能力,包括跨平台执行、涵盖图形界面、命令行和 API 操作的混合动作空间,以及从大规模沙箱到真实设备的环境。右侧面板展示了一个由航班取消通知触发的旅行恢复场景。在识别受影响的任务和承诺后,智能体通过 API 搜索替代航班,在通过移动端图形界面重新预订前请求用户批准,通过桌面图形界面和命令行操作更新受影响的会议日程,并将修改后的文件发送给相关接收者。

BrowseComp 上达到 75.0%,在 BrowseComp-ZH 上达到 75.0%,超越了 Qwen3.5-397B-A17B 和 UI-TARS-2。

  • 图形界面基础能力。 Qwen-UI-Agent 在 ScreenSpot-Pro 的放大设置下达到 81.5%,优于 Seed 2.1 Pro、GUI-Owl-1.5 和 UI-Venus-1.5。它进一步在 UI-Vision (70.0%)、OSWorld-G-Refined (78.5%)、MMBench-GUI L2 (92.6%) 和 ScreenSpot-V2 (97.5%) 上取得了基线模型中的最佳结果。
  • 通用与智能体能力。 为保留模型在真实场景中的广泛实用性,我们维持了 Qwen-UI-Agent 的通用推理和智能体能力。我们在包含 MMMU-Pro、MMLU-Pro、Terminal-Bench 2.0 和 Claw-Eval 在内的 13 个基准测试套件上评估了 Qwen-UI-Agent。结果显示,Qwen-UI-Agent 在智能体任务上优于 Qwen 基础模型,同时在通用推理任务上保持可比性,并且在这两类任务上均显著优于图形界面专用模型。

2 Qwen-UI-Agent

本节介绍 Qwen-UI-Agent 作为构建先进基础图形用户界面智能体的集成系统的方法论。该系统包含四个组件:(1) 一个覆盖沙箱和真实世界的环境基础设施,支持在统一的动作空间(涵盖图形界面、命令行和批处理动作)下,跨移动端使用、计算机使用、浏览器使用和深度搜索任务进行轨迹收集和训练;(2) 一个自动化的数据飞轮,可减少人工干预,并闭合从数据合成到训练、评估、失败分析以及为下一轮迭代定向生成数据的循环;(3) 一个结合了监督微调与强化学习的统一训练框架;(4) 一个 Harness 层,用于将训练好的智能体连接到用户上下文,并支持主动服务和跨平台任务执行。图 2 展示了一个演示轨迹。

第 6 页

2.1 系统概览

Qwen-UI-Agent 被设计为一个以真实世界为中心的基础图形用户界面智能体,能够在多种数字环境中运行,包括移动端、桌面端、网页端以及信息搜索系统。本节首先定义 Qwen-UI-Agent 的任务范围,然后介绍其统一的观察空间与动作空间,最后总结该框架所支撑的能力全景。

2.1.1 任务形式化

Qwen-UI-Agent 专为交互式数字任务执行而设计。我们将一个任务定义为:

τ = (I, Eτ) , (1)

其中 I 是用户指令,Eτ 是任务可用的数字环境集合。根据任务的不同,Eτ 可能包括移动设备、网页浏览器、计算机系统、DeepSearch 系统,或它们的组合。这一形式化涵盖了在单一环境中完成的任务,以及跨越多个平台的工作流(Xu et al., 2026; Lian et al., 2026)。

在决策步骤 t,智能体接收一个多通道观察 ot,该观察可能组合了不同形式的环境反馈: ot = oGUIt , oCLIt , oAPIt . (2) 这里,oGUIt 表示当前屏幕截图,oCLIt 包含命令执行结果,oAPIt 包含来自外部服务(如搜索 API)的结构化响应。当对应通道在当前任务中不可用或不必要时,该组件被置为空。这种多通道观察使智能体能够联合推理视觉界面状态和程序化执行反馈(Hu et al., 2026; Li et al., 2026a)。

智能体预测一个中间推理输出 rt 和一个可执行动作输出 at:

(rt, at) = πθ (I, ot, ht) , (3)

其中 ht = (o1, r1, a1, . . . , ot−1, rt−1, at−1) 表示之前的交互历史。

值得注意的是,一个模型决策步骤可以产生单个动作,也可以产生一个有序的动作序列: at = a(1)t , . . . , a(Kt)t , a(k)t ∈At, (4)

其中 At 是当前环境中可用的动作集合。当 Kt = 1 时,模型执行单动作执行。当 Kt > 1 时,它产生一个批处理动作序列。批次内的动作在此决策步骤中连续执行,当多个操作可以在无需额外环境反馈的情况下完成时,这减少了不必要的推理和观察步骤。

2.1.2 动作空间

我们围绕三个需求设计 Qwen-UI-Agent 的动作空间:支持跨平台的图形界面交互、将执行能力扩展到图形界面操控之外,以及保留用户对关键操作的控制。图形界面动作空间被定义为移动端、网页端和桌面端环境所需动作的并集,每个环境暴露其原生交互机制所支持的动作子集。为补充图形界面交互,我们引入了 cli_command,它支持直接的 bash 命令执行,以及 api_call,它使用结构化参数调用外部服务。我们进一步包含了 ask_user,允许智能体在处理敏感数据、支付或其他关键操作之前,请求缺失信息或获取用户的明确确认。这些动作共同提供了一个统一的接口,用于跨平台图形界面交互、混合图形界面与命令行动作空间,以及在真实世界任务中由用户控制的操作。完整的动作空间如表 1 所示。

6

第 7 页

表1:Qwen-UI-Agent 的动作空间。

动作 定义

GUI 动作 click 在坐标 (x, y) 处单击。 double_click 在坐标 (x, y) 处双击。 long_press 在坐标 (x, y) 处长按。 type 输入指定的文本内容。 open 打开指定的应用。 drag 从起始坐标 (x1, y1) 拖拽至终点坐标 (x2, y2)。 system_button 按下系统按钮,可选 back、home、menu 和 enter。 wait 等待指定的秒数。

CLI 动作 cli_command 在活跃的 CLI 环境中执行一条 bash 命令。

API 动作 api_call 使用指定参数调用一个 API。

交互与控制动作 ask_user 与用户交互以完成任务。 terminate 结束任务,给出最终答案并标记状态为成功或失败。

2.1.3 能力全景

统一的形式化支撑了 Qwen-UI-Agent 围绕真实世界任务执行的四种互补能力。(1) 真实设备移动端执行。通过构建真实设备移动端环境,并将其贯穿于模型能力开发与评估的全过程,Qwen-UI-Agent 大幅消除了从模拟到现实的差距,在真实世界移动端执行性能上,领先于专用 GUI 智能体和前沿闭源模型。(2) 多领域任务执行。Qwen-UI-Agent 能够在移动端、桌面、网页和 DeepSearch 环境中运行,从面向特定领域的策略迈向面向异构数字任务的基础 GUI 智能体。(3) 混合高效交互。Qwen-UI-Agent 的统一动作空间使模型能够在同一条轨迹中选择 GUI 操作与基于 bash 的 CLI 命令并交替执行,同时批处理动作大幅提升了执行效率。(4) Harness 层使能的服务。一个轻量级的 Harness 层将核心智能体从孤立的单次任务执行中扩展出来,使其能够主动发起服务,并允许单一工作流跨越移动端和计算机系统。

2.2 环境基础设施

环境定义了智能体的能力边界:它决定了智能体能够感知什么、能够采取什么动作,以及通过交互能够获取何种经验。因此,将 GUI 智能体从以基准为中心的优化推向真实世界的实用,不仅需要更强的模型,还需要更广阔、更真实的环境,让智能体能够在其中学习、行动和适应。如图 3 所示,我们的环境基础设施围绕四个核心组件构建。第一,模拟环境和沙箱环境为数据生成、智能体学习和评估提供了可扩展、可控且可复现的设置。第二,将这些模拟环境扩展到真实设备,使智能体能够在真实的部署条件下学习和运行,包括动态的设备状态、系统约束和用户交互。第三,混合的 GUI 与 CLI 动作空间支持更高效、更具适应性的执行,允许智能体为每项任务选择最合适的交互模态。第四,统一的跨平台环境为移动端使用、计算机使用、浏览器使用和 DeepSearch 提供了统一的流水线,同时跨平台保留上下文和任务状态。这些组件共同使环境成为智能体系统的核心部分,直接塑造了智能体能够学习和完成的任务范围。

7

第 8 页

图 3:Qwen-UI-Agent 的环境基础设施。(a)可扩展的沙箱环境涵盖移动端使用、计算机使用、浏览器使用和 DeepSearch,为数据合成与训练提供可控性与可重复评估。(b)仿真到真实桥接将智能体扩展到真实设备,具备真实应用、网络和账户状态,支持用户接管登录、支付、权限和确认操作。(c)混合图形界面与命令行动作空间将图形操作与直接命令执行交织在一起。(d)统一接口标准化了异构环境中的思考-动作-观察循环。

2.2.1 扩展沙箱环境

沙箱环境为训练、评估和消融实验提供了可控且可重置的任务状态。我们的套件涵盖移动端使用、计算机使用、浏览器使用和 DeepSearch 任务。每个领域保留其原生应用、环境特定上下文和基于状态的验证机制。我们基础设施的一个关键优势是其可扩展性:它支持多达 10,000 个并行运行的隔离沙箱环境,从而实现大规模 rollout 和智能体训练。

移动端使用。我们在 MobileWorld 提供的环境上构建移动端沙箱,该环境提供一个可重置的 Android 系统,包含 20 个应用,并支持图形用户界面任务执行、智能体-用户交互和 MCP 工具使用(Kong et al., 2026)。为解决基于 KVM 模拟器的扩展瓶颈,我们在 redroid(Remote Android Project, 2024)上重建了 MobileWorld 环境,redroid 在主机内核上以容器形式运行 Android,无需 QEMU 或嵌套 KVM。这种设计使得完整的设备和后端环境能够在普通容器主机上复制。其容器化的设备实例和自托管的应用后端提供了可控的初始状态和可重现的状态转换。在此基础设施之上,我们构建了多样化的任务相关环境上下文,合成了任务,并生成了基于状态的验证器。由此产生的沙箱为轨迹收集和智能体训练提供了稳定且可扩展的环境。

计算机使用。我们在 OSWorld 提供的 Ubuntu 虚拟机环境上构建计算机使用沙箱,该环境支持真实的桌面应用、操作系统操作和跨应用工作流(Xie et al., 2024)。虽然标准的 OSWorld 交互接口基于图形用户界面,但我们通过直接 bash 执行对其进行了扩展,允许智能体在同一轨迹中交织图形用户界面操作和命令行指令。对于我们新构建的任务,我们进一步为其中部分任务创建了任务特定的初始环境状态和基于状态的验证器。这些扩展共同提供了一个可控且可扩展的环境,用于在纯图形用户界面和混合图形界面与命令行交互下收集轨迹和训练智能体。

浏览器使用。我们的网络环境是一个自包含的浏览器运行时,使用 FastAPI、Playwright(Microsoft, 2020)和 Chromium 实现。每个 episode 在一个全新的 Playwright BrowserContext 中运行,具有隔离的 cookies、缓存和本地存储,并从任务特定的页面和状态开始。智能体接收渲染的截图,并通过浏览器原生的图形用户界面动作进行交互。基于 JavaScript 的验证器检查 DOM 和持久化应用状态,允许替代动作序列

第 9 页

(1) 可扩展的真实设备运行时 (2) 健康感知任务执行 (3) 基于轨迹的证据审查 账户 应用 设备 网络 任务调度器 选择 已选运行时 任务

动态 路由 黑名单动作

临时 截图 排除 租约 屏幕 不健康 截图 运行时

重试/重新分配 选择一个健康的 Qwen-UI-Agent 日志运行时/ID 证据审查 健康感知调度器 符合条件的运行时 自动评判器与追踪 一部物理手机 -> 多个虚拟显示 验证 多部物理手机 物理 虚拟A 虚拟B 运行时控制器 点击、滑动、输入…

… 必要时人工协助 通过 模型失败 环境问题 验证码 用户代理 登录问题 独立显示/结果标签保持可追溯 并行执行 权限接管 至已记录证据。

环境恢复循环

隔离/确认 释放 重新验证 手动修复 黑名单 环境问题

图4: 具备闭环环境治理的真实设备移动端运行时。健康感知调度器将每个任务路由到符合条件的手机、应用/账户和显示;不健康的目标将保持黑名单状态,直至修复并重新验证。虚拟显示允许一部手机同时运行多个应用。基于证据的审查从完整轨迹中区分任务成功、模型失败和环境失败,确认的环境问题将反馈给调度器。

在达到所需状态时获得奖励。

DeepSearch。DeepSearch 环境通过结构化信息访问工具补充了交互式浏览器控制。Serper (Serper, 2023) 提供排序后的搜索结果,而 Jina Reader (Jina AI, 2024) 将选定的网页和文档转换为模型可消费的文本。智能体可以迭代地重新制定查询、选择来源、检索完整内容,并综合跨页面的证据。因此,该环境针对的是开放式的、多源信息搜索,其中主要的观察结果是搜索结果和检索到的文档,而非渲染的图形界面状态。

2.2.2 真实设备移动端环境:从模拟沙箱到现实世界学习

为什么真实设备至关重要? 沙箱环境提供稳定且可重置的任务状态,这使其对于大规模部署和训练至关重要。然而,它们无法完全捕捉不断演变的应用状态、权限相关的约束,或执行时的中断,例如意外的弹窗和网络不稳定。在真实设备上,应用界面和内容会随时间变化,权限和验证码会中断执行,网络或设备故障可能在任何步骤发生。中国的移动生态系统进一步放大了这些挑战:超级应用、密集的界面和频繁的弹窗使得在沙箱中复现此类执行路径变得不可能。为了使 Qwen-UI-Agent 在这些条件下可靠工作,我们构建了一个真实设备移动端运行时,并将其用于模型训练和评估。我们进一步构建了 MobileWorld-Real(将在第 3.2 节介绍),以系统地评估智能体在真实设备上的性能。

真实设备移动端运行时。我们构建了一个包含超过 100 部物理设备和超过 150 个应用的真实设备移动端运行时。在此规模下,为每个任务分配一个可靠且可用的执行设备成为核心的系统挑战。如图 4 所示,健康感知调度器持续追踪每个设备、应用、账户、网络连接和显示的健康状况与可用性。

第 10 页

当任务进入队列时,系统会选择一个符合条件的执行目标,为任务租用所需资源,并在发生故障时将执行重新路由到另一个目标。这种具备健康感知能力的编排机制,使得即便真实手机、应用和网络连接固有的不稳定性导致环境端故障,环境仍能保持生产力。

为了进一步扩展真实设备环境,我们利用了虚拟屏幕机制(Genymobile, 2018),该机制允许单部手机在独立的显示器上同时承载多个应用会话。运行时控制器将每个虚拟显示器绑定到对应的智能体会话,确保观察结果被传递给正确的智能体,并且其动作在预期的显示器上执行。这种设计增加了活跃执行环境的数量,而无需按比例增加物理设备。此外,现实世界中的任务常常涉及需要用户明确批准的敏感操作,或必须由用户提供的缺失信息。因此,我们引入了一个专用的用户智能体,它可以提供缺失信息,为数据敏感或支付相关的操作获取明确确认,并在动作需要直接人工干预(如验证码)时将控制权移交给用户。在所需的输入或操作完成后,任务将从更新后的环境状态恢复。

真实设备运行时还需要区分模型故障与执行环境本身的故障。即使模型的决策是有效的,应用限制、服务不可用、设备不稳定和网络错误也可能中断轨迹。调度器维护一个针对不健康设备的动态黑名单,将其从路由中移除,并仅在人工检查后恢复。我们采用一个基于 VLM 的评判器来检查完整轨迹,并区分任务成功、模型故障和环境故障。确认的环境故障会更新调度器和维护队列,而经过验证的轨迹则被保留用于训练。

2.2.3 混合图形界面与命令行动作空间

真实设备环境扩展了智能体可能遇到的状态范围,但现实世界的实用性也取决于智能体能在多大程度上有效地作用于这些状态。图形界面交互提供了对面向用户的应用和视觉上下文的通用访问,但纯粹的图形界面执行可能会将结构化操作变成长序列的定位、点击和键入。命令行执行提供了对文件、代码、系统设置和批处理操作的直接编程访问,但当任务依赖于视觉理解、特定应用界面或没有可编程访问的服务时,就不太适用。因此,图形界面和命令行提供了互补的环境访问形式:图形界面实现了广泛的应用覆盖和基于视觉的交互,而命令行则提供了对可编程状态的高效执行。

因此,我们为 Qwen-UI-Agent 配备了第 2.1.2 节中定义的统一图形界面与命令行混合动作空间,并且我们的环境通过单一执行接口暴露这两种访问形式。在计算机使用环境中,每个动作都被分派到虚拟机内的一个轻量级执行服务:图形界面动作被转换为原生输入事件,而 cli_command 则在非交互式 shell 中运行命令,无需在视觉上定位和操作终端应用。生成的 stdout、stderr 和退出状态作为结构化观察结果与动作后的屏幕截图一同返回,使模型能够基于程序化状态和视觉状态共同决定下一步动作。

可靠的命令行执行需要超越仅仅启动一个 shell 的环境端处理。命令执行受限于为依赖安装等慢速操作预算的超时时间,而非零退出和超时等故障会作为错误观察结果返回,而不是中止整个回合,从而允许模型在同一轨迹内进行诊断和恢复。在批处理动作中,图形界面和命令行子动作按顺序执行,其命令行输出被聚合到单个观察结果中。已执行的命令也会被记录到 shell 历史中,以便检查终端状态的验证器也能认可基于命令行的解决方案。

10

第 11 页

2.2.4 异构环境的统一接口

移动端使用、计算机使用、浏览器使用和 DeepSearch 环境暴露了不同的资源模型、动作空间、观察格式和验证流程。因此,我们引入了一个统一的环境接口,该接口标准化了环境生命周期以及面向智能体的输入和输出,同时将执行、重置和验证委托给特定于环境的适配器。这使得同一个智能体和训练流水线能够在异构环境中运行,而无需强加相同的运行时语义。

该接口暴露了一个通用的异步生命周期,包括 acquire、reset、step、evaluate、tear_down 和 release。每个获取的环境表示为一个绑定到后端以及(必要时)显示标识符的租用会话,该标识符将屏幕截图、动作和评估一致地路由到同一个隔离的上下文中。后端适配器实现资源初始化、观察捕获、动作执行和评估,而任务适配器则保留特定于平台的重置和验证逻辑。所有环境都返回一个通用的转换格式,其中包含观察、终止信号和奖励信息。

策略和环境各自独立声明其原生的动作空间。当它们不同时,支持的 GUI 操作通过一个规范的中间表示进行转换,坐标根据目标平台进行归一化。第 2.1.2 节中定义的混合 GUI、CLI 和 API 动作仍然可通过原生适配器使用,其视觉或结构化结果通过相同的观察流返回。这种设计提供了一个共享的 rollout、数据收集和评估流水线,同时保留了每个平台的原生交互语义。

2.3 智能体驱动的数据飞轮

持续改进 GUI 智能体需要一个迭代的闭环过程,涵盖任务设计、环境构建、验证器开发、数据整理、模型训练、评估和错误分析。当人类驱动这些阶段时,随着覆盖范围扩展到应用程序、平台和能力维度,迭代会变得缓慢且难以扩展。为了解决这个问题,我们引入了一个 AutoResearch 风格的、智能体驱动的数据飞轮,将人类的参与从执行每个阶段转变为高层次的监督和有针对性的干预。

总体流程。如图 5 所示,我们将智能体驱动的数据飞轮组织为两个阶段:领域能力引导和迭代优化循环。在引导阶段,我们使用强大的基础模型来分析覆盖移动端、桌面和 Web 的各种领域所需的领域知识和能力。在此分析的指导下,智能体生成一个初始的任务池和相应的环境上下文,并从中收集候选轨迹。遵循 MAI-UI (Zhou et al., 2025a),我们首先执行多轮拒绝采样,并将接受的轨迹聚合到一个统一的 SFT 语料库中。这个过程产生了一个强大的初始策略,对目标领域具有广泛的覆盖。在此策略的基础上,我们的智能体驱动的失败分析识别出模型的剩余弱点,并将它们映射到下一个周期的目标。这些目标指导新任务、环境配置以及(在适用情况下)任务特定验证器的生成。然后,接受的轨迹被纳入训练语料库以进一步改进模型,从而闭合循环并启动下一次迭代。在初始策略构建和迭代改进阶段,强大的基础模型都会生成任务和环境配置,合成任务特定的验证器,评估轨迹,分析失败,并规划后续迭代的优化和执行。人类的参与主要集中在设计和实现整个系统、监督其运行,并在必要时干预或修改工作流程。接下来,我们描述使这个智能体驱动的数据飞轮可扩展且有效的四个设计选择。

11

第 12 页

第一阶段:领域能力引导 1. 评估 迭代式 – 性能评估 改进 6. 迭代式 – 识别失败案例 知识-与 模型 能力感知任务 初始模型训练 2. 自动化 合成 失败 知识覆盖 – 更新模型 诊断

第二阶段:迭代式 – 环境、任务、验证器 智能体-失败 精炼循环 智能体驱动 驱动 – 模型失败 环境与数据 闭环、弱点- 验证器合成。 飞轮 5. 步骤级 驱动自进化 任务特定环境设置 评判器 & 轨迹- 基于状态的验证器 级验证器 3. 弱点- 驱动任务

作为评判器 步骤级 VLM-作为- – 轨迹级状态- – 优化目标 评判器引导 基于验证器 – 任务合成技能

  • 增强 – 失败归因 能力需求 能力
  • 步骤级 VLM- 合成

数据 新数据 最大连续正确步骤 4. 轨迹收集 反思与探索步骤 演进训练 – 拒绝采样 错误恢复步骤 数据池

图 5: Qwen-UI-Agent 的数据飞轮。领域能力引导初始化训练,迭代式精炼循环识别能力弱点并生成针对性任务,由此产生的数据改进下一次训练迭代。

知识与能力感知的任务合成。 训练任务定义了模型可用的学习信号,因此塑造了它能获取的知识与行为。我们沿着两个概念上不同的维度组织任务合成:知识覆盖,它决定了智能体需要知道什么;以及能力需求,它决定了智能体必须如何推理和行动才能完成任务。知识覆盖指定了领域特定的操作知识,包括应用功能、界面惯例、工具使用和常见工作流。能力需求捕捉了可迁移的推理和交互能力,例如长程状态追踪、精确约束遵循、数值与时间推理以及错误恢复。对于每个目标领域,我们使用强大的基础模型为知识覆盖构建初始层次化功能树,并为能力需求构建能力画像。然后,我们将它们编译成一个可复用的任务合成技能,其中包含组合规则、难度控制、环境前提条件和代表性示例。以当前迭代的目标为条件,该技能使智能体能够自动生成面向所需知识和能力的任务。

智能体驱动的环境与验证器合成。 任务合成决定了一个训练实例应激发的能力,但交互式训练额外需要一个可复现的环境,使任务在其中可行且可执行。给定一个合成任务,我们的智能体使用环境状态合成(详见第 2.4.3 节)来构建执行所需的应用状态、文件、记录、账户和跨应用上下文。对于结果可被可靠检查的任务,智能体进一步合成基于状态的验证器,这些验证器检查最终的应用、文件、数据库或系统状态,从而产生可执行的任务-验证器对。

面向可扩展 SFT 的步骤级评判与面向在线强化学习的可执行验证。 可执行验证器提供高精度的结果信号,但构建和验证一个验证器成本高昂。即使使用更强大的基础模型,我们发现合成和验证可执行验证器仍然耗时,而基于模型的评判器的准确性则随着模型发展而提高。因此,我们扩展了 MAI-UI(Zhou et al., 2025a)中使用的步骤级轨迹评判器,并将基于 VLM 的评判器应用于移动端、网页和计算机使用的轨迹,包括混合图形界面与命令行的交互。给定指令、轨迹以及视觉或结构化观察,该评判器提取三种形式的有用监督:正确推进任务的最大连续步骤、启动每个反思或探索阶段的第一步,以及将执行从错误状态恢复到正确路径的恢复片段。

第 13 页

有效路径。仅保留第一次反思或探索步骤,既能捕捉到重新考虑的有用决策,又不会过度保留可能带来噪声的分支。这一细粒度流程能从成功和失败的轨迹中恢复有效的训练信号。经验表明,步骤级数据过滤所得到的 SFT 性能,与在可执行验证器筛选出的完整轨迹上训练的效果相当甚至更优。因此,我们使用细粒度 VLM 判断来为 SFT 扩展过程监督,同时为在线强化学习所需的高精度结果信号构建可执行验证器。

基于失败分析的迭代。 我们为每个领域构建了广泛且具有诊断性的评估套件,以跟踪模型性能并定义下一轮迭代的优化目标。对于每个失败任务,分析智能体会检查完整轨迹,并将模型失败与环境、任务或验证器失败区分开来。随后,模型失败被映射到结构化的原因,例如缺少应用知识、违反约束、状态跟踪错误或验证不足。系统汇总这些任务级诊断,以识别当前策略最普遍且影响最大的弱点,并将其转化为一组按优先级排序的优化目标。基于这些目标和任务合成技能,智能体为下一轮循环生成针对性任务、相应的环境设置,并在适用时生成任务特定的验证器。非模型问题则被路由到环境维护或任务与验证器修订环节,由智能体相应地诊断并解决所识别的问题。

2.4 训练
2.4.1 监督微调 (SFT)

Qwen-UI-Agent 旨在支持跨移动端、电脑使用、网页和 DeepSearch 场景的任务执行。这一范围给 SFT 带来了两个相互关联的挑战:在单一模型中共同习得所有目标领域的强大能力,并保持稳健完成现实世界任务所需的通用推理和智能体能力。

领域条件化的专家训练。 在移动端、桌面端和网页端,每个领域对智能体提出了不同的要求。移动端任务要求在真实设备环境中可靠执行,其界面因应用而异,工作流常被弹窗打断,且安全敏感操作必须保持在用户控制之下。桌面端任务通常将 GUI 控制与基于 Bash 的文件和系统操作相结合。网页端任务需要与动态网页交互,而 DeepSearch 任务则要求智能体通过搜索 API 检索、验证并综合证据。

我们为每个领域训练一个专门的专家模型,然后整合它们的能力。每个专家主要在其目标领域的数据上进行训练,并混合了来自其他领域的受控数据。这种跨领域混合有助于每个专家保留可跨领域迁移的能力,并减少对其目标领域的过拟合。实际部署需要单一模型能在所有支持的场景中运行。因此,我们将领域专家检查点合并为一个统一模型。模型合并将它们的互补优势整合到单一检查点中,保留了各个专家习得的能力,且几乎不增加额外的训练开销。

利用分布内数据保持通用与智能体能力。 通用推理和智能体能力对于现实世界应用至关重要,因为智能体需要响应多样且开放的用户请求。有些请求甚至可能与 GUI 任务无关,但模型仍应恰当回应。即使在 GUI 任务中,现实世界的部署也会使智能体面临分布外 (OOD) 的状态和目标,这些可能需要训练中未预料到的知识、推理、指令遵循、检索、编码或工具使用能力。因此,我们力求保持并尽可能强化从基座模型继承的通用推理和智能体能力,这为处理陌生情况和维持一致的用户体验提供了重要基础。

我们发现,最有效的策略是使用分布内数据,强化起始模型能够产生的成功行为。我们构建了一个广泛的查询池,涵盖通用问答、

第 14 页

2.4.2 动作级强化学习:纠正重复性动作错误

在长周期图形用户界面任务中,一个局部错误就可能将界面带入错误状态,并影响后续决策。监督微调从成功演示中学习,但不会显式抑制重复性动作错误。因此,我们引入了动作级强化学习,这是一个动作级别的强化学习阶段,它结合了针对性的错误模式数据和动作感知奖励,以提高局部决策的可靠性。

重复性动作错误模式。 在各类应用中,我们识别出六种重复出现的模式:

  • 易混淆元素定位。 当屏幕上包含视觉或语义上相似的图标、控件或列表项时,模型可能将动作定位到附近的干扰项,而非正确目标。
  • 排序与排名。 模型可能误解排序要求,例如序数位置、top-k 选择、最新与最旧排序,或基于多个属性的排名,导致其选择错误项目或以错误顺序处理项目。
  • 数量与多目标完整性。 指定确切数量或需要对多个相关目标执行操作的任务,容易出现部分完成的情况。模型可能处理过少或过多的对象,或遗漏复合目标中的一个组成部分。
  • 过早完成。 模型可能在准备好预期结果后,但在执行最终的状态变更动作(如保存编辑、发送消息、提交表单或发布内容)之前,就宣告成功。
  • 重复动作循环。 模型可能重复执行相同的动作或一个短动作序列,而没有取得与任务相关的进展,这通常是因为它未能识别到界面状态未发生变化,或无法找到恢复动作。
  • 长尾动作选择失败。 模型可能无法调用不常见但关键的动作,例如 openask_userlong_press,反而退回到不合适的常见动作,如 click

这些失败模式的共同结构使其成为跨应用动作级别优化的可复用目标。然而,它们的重要性并未通过其在自然收集的轨迹中的频率体现出来:罕见但后果严重的模式可能会被更常见的动作所淹没。

第 15 页

针对性错误模式数据构建。为纠正这种覆盖不均衡,我们结合历史轨迹挖掘与主动环境交互。从已有轨迹中,我们定位引发每次失败的动作;对于重复行为,视觉评判器会区分无意义的循环与有目的的探索。对于历史覆盖不足的模式,智能体主动探索可执行环境,识别相关界面结构,围绕其构建任务,并收集新的执行轨迹。由此产生的语料库保留了当前策略下的真实失败上下文,同时有意增加了稀有但重要错误的代表性。

动作感知奖励与训练。利用这一针对性语料库,动作级强化学习在步骤 t 为每个预测动作分配结构化奖励:

rt = Ft wtypeCt + wargCtQt −λsensSt −λrepLt . (5)

其中 Ft ∈{0, 1} 表示格式有效性,Ct 衡量动作类型正确性,Qt 通过像素距离、词汇相似度、标签匹配或基于 LLM 的判断来衡量参数质量。项 St 和 Lt 分别惩罚错误的敏感动作和动作历史中的重复。在训练过程中,我们观察到 token 熵下降以及推理轨迹逐渐缩短。因此,我们应用熵正则化,并结合推理长度的下限和上限,以防止策略崩溃,同时避免不必要的冗长。

2.4.3 在线强化学习:学习长程决策

长程图形用户界面任务不仅仅是局部正确动作的集合。一个动作在当前状态下可能看似合理,却可能将智能体引入一个未来状态,使得任务变得困难或无法完成。动作级强化学习提高了局部决策的可靠性,但未能完全捕捉这种延迟的轨迹级后果;因此,我们引入在线强化学习,通过环境交互来优化端到端的任务成功率。

面向可扩展执行轨迹的统一环境基础设施。从完整交互中学习需要在异构图形用户界面环境中进行大规模且可靠的执行轨迹生成。基于第 2.2.1 节描述的沙箱基础设施,我们开发了一个统一的环境基础设施,用于跨领域管理环境分配、重置、交互和评估。在阿里云上,该基础设施为移动端、计算机使用、网页和 DeepSearch 部署沙箱环境,支持多达 10,000 个并发执行轨迹。每个领域保留其原生应用、动作空间和验证机制,而共享的基础设施向训练管线暴露通用的环境生命周期和执行轨迹接口。对于必须在物理手机上执行的任务,我们使用第 2.2.2 节描述的虚拟屏幕机制,允许多个应用会话在单个设备的不同显示器上并发运行。在我们的真实设备集群中,与不使用虚拟屏幕运行同一集群相比,该机制将总执行轨迹吞吐量提高了约 20 倍。总之,该基础设施为在线强化学习提供了跨沙箱和真实设备环境的可扩展执行轨迹容量。

任务-验证器合成。基于此执行轨迹基础设施,我们通过三个阶段自动构建可执行的任务-验证器对,以提供可靠的结果监督:

• 环境状态合成。编码智能体分析每个沙箱底层的代码库,并为其应用提炼可复用的数据注入技能。利用这些技能,智能体构建跨多个应用的一致初始环境状态。例如,一个代表计算机科学博士生准备论文投稿的环境状态,可能包含该学生手机上相互一致的电子邮件、照片、文件、日历事件和社交媒体记录。环境状态合成至关重要,因为它在很大程度上决定了下游任务的难度和多样性。直接从基准测试提供的状态生成任务,会将任务合成限制在基准测试中已有的应用状态和数据范围内。

15

第 16 页

• 任务合成。以每个合成的环境状态为条件,大语言模型生成多个不同难度级别的任务,包括跨多个应用的工作流。随后,一个独立的大语言模型评判器对生成的任务进行筛选,确保其可行性与初始化环境状态的一致性。

• 验证器合成。利用统一的环境基础设施,编码智能体自主启动相应的沙箱环境,注入合成的环境状态,并构建任务特定的基于代码的验证器。每个验证器通过多个智能体模型的 rollout 进行验证,同时基于 VLM 的评判器评估验证器输出是否与观察到的 rollout 证据一致。

这一自动化的合成与执行验证流水线为在线强化学习生成了约 10,000 个经过验证的任务-验证器对。

基于模型自适应任务课程的在线强化学习。在获得经过验证的任务-验证器对后,我们使用验证器引导的在线强化学习来改进长程决策。遵循 MAI-UI(Zhou 等人,2025a),我们采用了一种针对 GUI 交互轨迹定制的 Group Relative Policy Optimization(GRPO)变体。对于每个任务,当前策略采样一组 K 条完整的交互轨迹 {τi}Ki=1。验证器评估每条轨迹的最终环境状态 s(i)T。我们计算其二元结果奖励和组相对优势如下:

1 K ri −¯rx ∈{0, 1}, ¯rx = ∑ rj, ˆAi = (6) ri = vx s(i)final K j=1 Std(r1, . . . , rK) + ϵ.

其中均值和标准差是针对同一任务 x 采样的 K 次 rollout 计算得出的。GRPO 使用这些相对优势来更新策略。与提供局部动作级反馈的动作级强化学习不同,此阶段利用终端验证器结果优化完整轨迹,针对长程规划、状态跟踪和中间决策进行改进。

任务的训练价值并非固定不变:随着策略从其他任务中习得相关能力,最初过于困难的任务可能变得可学习。在组相对目标下,所有 rollout 均失败或均成功的任务不会产生奖励变化,因此几乎不提供即时学习信号。然而,永久移除困难任务会错过其进入策略学习前沿的时机。因此,我们将任务难度视为当前策略的动态属性,并将课程组织为一个活跃训练池和一个监控池。经验成功率处于中间水平的任务进入活跃池,获得完整的 rollout 预算,而当前无法解决的任务则留在监控池中,分配较小的预算。一旦困难任务开始产生成功的 rollout,它就会被提升到活跃池进行全量训练。已掌握的任务也会以小预算进行监控,并在性能下降时重新激活。这一闭环课程持续识别新近可学习的任务,同时将 rollout 计算集中在能提供最具信息量相对奖励的地方。

2.5 Harness 层:主动服务与跨平台任务执行

强大的任务执行能力是必要的,但对于 GUI 智能体而言,要超越孤立的任务执行,成为用户日常数字生活中有效的助手,这还不够。现有智能体在很大程度上是被动的:用户必须意识到需求、构思指令并调用智能体,即使该需求已从其数字环境的信号中明显可见。工作流也可能跨设备进行,相关信息出现在手机上,而后续操作必须在计算机上完成。这造成了两个根本性差距:智能体应在何时主动发起协助,以及它如何在不丢失上下文的情况下跨设备执行由此产生的工作流?我们通过一个位于底层 GUI 智能体之上的共享 Harness 层来解决这两个问题。该 Harness 层连接来自用户数字环境的信号,维护统一的活动表示,并利用此上下文在移动端和计算机环境之间发起和协调任务。

16

第 17 页

(I) 主动服务 从被动执行到主动服务发起

无 Harness(被动且孤立) 主动 Harness(主动且上下文感知) 1. 用户看到通知 航班取消通知 最佳选项 改签至 CA1530 2. 搜索替代方案 Harness 层 5月13日 12:40 -> 15:30 3. 回忆相关事件 10:00前到达

高铁 4. 比较与决策 事件 G1234 10:20 -> 13:42 5. 汇总为行动 13:42到达

明天下午16:30会议

被动、孤立、 航班 – 自主 – 并行 – 上下文感知 16:00前到达 用户主导 取消

航班改签 子任务1 Harness 层

主动任务发起 – 查询票价与座位 结果

  • 搜索航班 决策就绪

取消通知 通知 1. 检查受影响日程 流式规划 子任务2 2. 寻找替代交通方式 铁路替代方案 用户

上下文 并行 – 查询余票 Qwen-UI- 3. 汇总与比较 汇总 偏好航空出行且 • 智能体 4. 选择最佳 比较 不愿错过会议 • 方案提供给用户 检查会议冲突 子任务3

(II) 跨平台执行 – 到达时间检查

  • 搜索时刻表 记忆与
  • 交通耗时估算

手机使用 电脑使用 手机使用

跨设备执行: 手机 + 桌面

接收通过手机分享的收据,并在 SAP Concur 上提交报销报告 提交 DineHop 收据进行报销并确认完成 回复“任务完成”

图6:用于主动服务发起与跨平台执行的 Harness 概览。(I) 无 Harness 时,用户需手动解读通知、检索相关上下文并为智能体提供指令。主动 Harness 则检测到航班取消,推理相关事务,主动执行航班改签、铁路替代方案及会议冲突检查,并报告可执行的计划。(II) Harness 还维护任务状态并支持跨平台执行。在餐厅选择示例中,Qwen-UI-Agent 在手机上发现候选餐厅,在桌面电子表格中整理,发送成果物以供审批,并将选定的地点保存回手机。

基于此层,我们开发了两项能力。主动服务解决了第一个缺口,将任务发起从显式指令转变为从用户数字信号中推断出的可执行事件,使智能体能够在用户询问前识别并准备有用的协助。跨平台任务执行解决了第二个缺口,通过在手机和电脑之间传递工作流,同时保持共享上下文、依赖关系和任务状态。这两项能力共同沿两个互补维度扩展了图形用户界面智能体:任务何时可以开始,以及任务可以在何处继续推进。

2.5.1 基于手机通知的主动服务

手机通知作为高价值信号源。主动智能体需要及时、广泛可用且可由用户控制的信号。我们使用手机通知作为此接口。手机聚合了来自通信、出行、金融、物流和日程安排的信号,通知在事件变得可执行的那一刻(如航班取消、付款截止日期或日程变更)暴露了许多事件。与持续的屏幕、音频或视频监控相比,通知访问是

第 18 页

轻量级且受显式的逐应用权限管控。然而,通知信息是片面且带噪声的:它们仅反映应用选择展示的内容。因此,Harness 层将其视为观察而非完整的世界状态,仅在必要时才收集额外信息。

从通知到主动工作流。 设想一个深夜通知,告知用户次日清晨的航班已被取消。传统的图形用户界面智能体会等待明确指令后才开始搜索替代方案。而我们设想的是一个超越简单搜索的主动工作流。航班取消很少是孤立事件:它可能危及一场重要会议,需要更改酒店预订,并迫使在重新订票与铁路出行之间做出选择。关键问题在于,智能体能否在用户询问之前,预判并准备好这些相互依赖的后续行动。我们的 Harness 层通过在与用户交互前重建更广泛的上下文来实现这一点。它将取消通知解析为结构化事件,将其与进行中的行程及相关会议截止时间关联,从记忆中检索用户偏好,查询可行的替代方案,对照用户的深层目标进行评估,并呈现一个决策就绪的提案。具有外部后果的操作,如重新订票或修改预订,仍需用户确认。图 11 及附录 A.3 的图 28 展示了此行为的两个代表性示例:一个结合了用户承诺与实时天气、通勤状况的日程早间简报,以及一个由航班取消通知触发的主动旅行恢复计划。

Harness 层将此工作流实现为一个有状态流水线,该流水线将通知解析为结构化事件,将其与持续性事务关联,推导出可执行任务,并利用执行结果更新记忆和未来行为。其核心抽象是事务,即对进行中现实世界事项的持久化表示。事件记录特定时间发生的事;事务捕捉跨事件、应用和日期仍在演变的情况;而任务则指定下一步应做什么。这种分离使 Harness 层能够推理用户的深层目标。

  • 事件感知。 传入的通知在短时间窗口内处理。事件解析器移除低价值噪声,并将有用的通知转换为结构化事件,包含其来源、实体、时间戳、紧急程度和可用操作。这些事件连同其时序和来源一并存储,为后续推理提供证据基础。
  • 事务状态与记忆。 对于每个新事件,Harness 层检索相关的近期事件、活跃事务、当前上下文状态和画像记忆。然后,它将事件与现有事务关联或创建新事务,更新事务的生命周期、关键实体、截止时间、未解决的缺口和支持证据。事务保留了个别旅行、购物、会议或家庭事务的演变状态,而画像记忆则存储更稳定的知识,如用户偏好、关系和行为模式。这两种记忆形式共同将特定情境的推理与长期个性化相结合。
  • 事务级推理与任务生成。 Harness 层对更新后的事务进行推理,以识别预期的下一步、缺失信息、未完成的动作、时间压力以及跨事务的依赖或冲突。结论基于观察到的事件或存储的用户信息,并关联置信度估计。然后,任务生成器评估当前介入是否能提供足够价值,考虑因素包括紧迫性、后果、证据支持度以及节省的用户精力。根据此评估,任务可能被立即提议、放入被动待办列表,或被抑制。
  • 主动准备与受控执行。 对于选定的任务,Harness 层选择合适的执行器,例如信息搜索工具、移动端图形用户界面智能体或计算机使用智能体。它可以在打断用户前执行低风险的准备动作,例如检索替代火车、比较旅行时间或查询退款状态。因此,生成的任务卡片呈现的是具体、决策就绪的选项,而非另一个提醒。具有外部后果的操作,包括支付、预订和发送消息,仍需用户确认。
  • 个性化与持续演进。 Harness 层持续优化其对

18

第 19 页

用户数字活动主要分布在移动设备和计算机之间。因此,许多现实世界的工作流跨越多个平台,这些平台的界面、能力和状态各不相同。例如,用户可能要求智能体识别手机相册中的收据,将选中的图片传输到桌面,根据识别出的日期重命名,并生成结构化的费用电子表格。该工作流结合了手机上的视觉选择、跨设备文件传输以及计算机上的文件处理。若将每个设备视为独立片段,会割裂任务状态、掩盖依赖关系和失败点,并让用户自行协调交接。图12和附录A.3的图29展示了由我们的Harness层执行的两个此类工作流:上述收据整理任务,以及一个并行的餐厅搜索任务——该任务在计算机上汇总结果前,会同时在多个移动应用上操作;在这两种情况下,移动子任务均在虚拟屏幕上运行,不会阻塞用户自己对设备的使用。因此,我们将Harness层实现为一个分层规划-执行系统,具备设备寻址动作、共享执行状态和显式的跨平台操作:

全局感知与设备锚定。Harness层首先枚举可用设备、应用、显示器和工作区。每个观察结果都标记有其应用、设备和显示器,截图被组装成带标签的多设备视图。这使得规划器能够联合检查移动端和桌面端状态。共享状态存储指令、应用-设备映射、近期观察、文件、工具输出和子任务结果。设备标记的更新仅更改对应平台状态,同时保留其余上下文。

依赖感知规划与执行器选择。我们实现了一个类似OpenClaw的规划器,具备持久会话、工作区和工具注册表(OpenClaw Contributors, 2026)。规划器将目标分解为依赖感知的子任务,并为每个子任务选择合适的执行器。它调用以图形界面子智能体形式暴露的Qwen-UI-Agent,进行视觉锚定的应用交互。搜索、文件、命令行和API工具处理信息检索、确定性系统操作和综合任务。每次图形界面调用都指定其指令、目标应用和设备。返回的结果更新会话,允许后续步骤根据最新状态重新规划。

并行多智能体执行。对不同应用或环境的独立调用并发运行。唯一标识符和观察队列隔离每个子任务的动作和反馈。其动作-观察循环是顺序的,而不同子任务并行推进。在安卓端,显示管理器将特定应用的子任务分配到一台物理设备上的独立虚拟显示器。每个显示器提供独立的截图捕获和显示器寻址输入,使多个Qwen-UI-Agent实例能够并发操作不同应用。

与Qwen-UI-Agent的混合执行。每个图形界面子任务使用第2.1.2节中的混合动作空间。Qwen-UI-Agent使用图形界面动作进行视觉锚定的交互,并使用命令行或API动作进行结构化操作、文件处理和外部服务调用。桌面端命令行动作执行shell命令,而安卓端动作使用ADB shell命令;它们的输出、错误和退出状态作为结构化观察返回。兼容的操作可以批处理。平台适配器将动作路由到寻址的环境,并在设备间传输文件。

第 20 页

3 实验

3.1 实验设置

模型与实现细节。我们评估了 Qwen-UI-Agent 的三个变体,包括 27B、35B-A3B 和 4B 模型。27B 模型是我们用于跨移动端、计算机使用、浏览器、DeepSearch 及通用智能体基准进行端到端智能体评估的主要变体。模型从其对应的基座检查点初始化,并使用第 2.4 节描述的流程进行训练。除非另有说明,我们遵循每个基准的官方交互预算和评估配置。

基准测试。我们在五组基准上评估 Qwen-UI-Agent,涵盖真实设备移动端使用、计算机使用、浏览器使用、DeepSearch、图形界面定位以及通用与智能体能力。

• 真实设备移动端使用。我们在 MobileWorld-Real 和 AndroidDaily (Sui et al., 2026) 上评估端到端移动任务执行。MobileWorld-Real 在第 3.2 节中介绍,包含在中文移动生态系统的真实安卓设备上执行的复杂人工编写任务。AndroidDaily 专注于真实安卓设备上的高频日常任务,并提供对常见移动使用场景的补充评估。我们进一步在 MobileWorld (Kong et al., 2026) 上进行评估,该基准为具有挑战性的长周期、跨应用任务提供了稳定的模拟环境。

• 计算机使用。我们在 OSWorld-Verified (Xie et al., 2024) 和 OSWorld-v2 (Yuan et al., 2026) 上评估桌面任务执行。OSWorld-Verified 评估跨大量桌面应用和操作系统工作流的任务进度。OSWorld-v2 更侧重于长周期任务,并报告部分进度和二元任务完成情况。这些基准评估模型是否能结合视觉交互、命令行操作和批处理动作来完成复杂的计算机使用工作流。

• 网页导航与 DeepSearch。我们使用 WebArena (Zhou et al., 2024) 评估在功能性网站上的端到端浏览器交互,其中任务要求模型跟踪不断变化的页面状态并完成多步用户目标。我们分别在 BrowseComp (Wei et al., 2025) 和 BrowseComp-ZH (Zhou et al., 2025b) 上评估 DeepSearch,这些基准衡量在英文和中文网页上的持续信息搜索、跨源证据验证和答案综合能力。这些基准共同区分了与网页界面的直接交互和需要信息聚合与验证的研究密集型任务。

• 图形界面定位。我们在 ScreenSpot-Pro (Li et al., 2025a)、ScreenSpot-V2 (Wu et al., 2024)、MMBench-GUI L2 (Xuehui Wang et al., 2025)、OSWorld-G-Refined (Xie et al., 2025) 和 UI-Vision (Nayak et al., 2025) 上评估元素定位。这些基准涵盖高分辨率专业软件、移动和网页界面、桌面应用、文本和图标目标、空间推理、功能推理以及目标导向的定位指令。

• 通用与智能体能力。我们使用 MMMU-Pro (Yue et al., 2025)、RealWorldQA (xAI, 2024)、CharXiv-RQ (Wang et al., 2024c)、MathVision (Wang et al., 2024a)、AI2D (Kembhavi et al., 2016)、MMLU-Pro (Wang et al., 2024b) 和 IFEval (Zhou et al., 2023) 评估图形界面后训练是否保留了基座模型的通用能力。我们进一步在 Tau2-Bench (Barres et al., 2025)、Terminal-Bench 2.0 (Merrill et al., 2026)、Claw-Eval (Ye et al., 2026)、BFCL-v4 (Patil et al., 2025)、SkillsBench (Li et al., 2026b) 和 QwenClawBench (Qwen Team & Data Team, Alibaba Group, 2026) 上评估更广泛的智能体能力。这些评估衡量多模态推理、指令遵循、工具使用、终端操作、多轮交互以及超越常规图形界面导航的自主任务执行等能力。

评估协议。除非另有说明,我们遵循官方的任务集、环境和主要评分协议。对于交互式图形界面基准,我们使用基准定义的任务和步骤限制,并报告相应的成功、部分进度或二元完成指标。对于

第 21 页

图 7:MobileWorld-Real 概览,这是一个基于真实设备的基准测试,包含由人工编写的任务,反映了日常移动使用的广度。代表性示例和汇总统计数据显示了广泛的领域覆盖和长尾的应用分布。配对模型结果进一步表明,与 AndroidDaily 相比,其成功率更低、轨迹更长,凸显了真实世界移动交互的挑战。

对于 MobileWorld-Real,AutoJudge 为每条轨迹分配三种结果之一:通过、失败或环境错误。环境错误单独报告,并从成功率的计算分母中排除,而平均轨迹长度则基于成功运行的轨迹计算。对于 WebArena,我们手动验证了不正确的参考答案,并在评估前识别了官方评估脚本中的错误。

对比基线。我们将 Qwen-UI-Agent 与三组系统进行比较:前沿的闭源模型、强大的开源基础模型以及专用的图形用户界面智能体。对于通用基准和智能体基准,我们额外将 27B 模型与其基础检查点进行比较,以衡量图形界面后训练后的能力保留情况。当评估设置可直接比较时,我们使用官方报告的结果;当需要匹配的评估环境时,我们独立复现结果。每个结果的来源和评估设置均在相应表格中注明。

3.2 MobileWorld-Real:真实世界移动使用评估基准

大多数移动图形界面基准测试在沙箱环境中运行,其中应用状态可以重置,任务结果可以通过编程方式验证(Kong 等,2026;Rawles 等,2024)。此类环境支持受控比较,但它们无法完全展示图形用户界面智能体是否能够处理用户手机上不断变化的内容、账户状态和中断情况。我们推出了 MobileWorld-Real,这是一个针对中文移动生态系统中移动图形界面智能体的真实设备基准测试。MobileWorld-Real 使用日常

第 22 页

表2:在MobileWorld(Kong等,2026)仅含图形用户界面子集上的性能对比,该子集包含117项任务。我们纳入了具有代表性的通用视觉语言模型和专用图形用户界面模型。最佳结果以粗体高亮,次佳结果以下划线标示。

模型 访问方式 / 规模 成功率 (%)

通用视觉语言模型 Seed 2.1 Pro (字节跳动Seed,2026b) 闭源 73.2 GPT-5.6 Sol (OpenAI,2026b) 闭源 70.1 Claude Opus 4.8 (Anthropic,2026) 闭源 67.5 Seed 2.0 Pro (字节跳动Seed,2026a) 闭源 63.2 Qwen 3.7 Plus (Qwen团队,2026a) 397B-A17B 62.3 Gemini 3.1 Pro (Google,2026a) 闭源 58.1 Kimi K2.6 (月之暗面,2026) 1T-A32B 55.6

专用图形用户界面模型 GUI-Owl-1.5-32B-Instruct (Xu等,2026) 32B 43.9 MAI-UI-235B-A22B (Zhou等,2025a) 235B-A22B 39.7 UI-Venus-1.5-30B-A3B (Gao等,2026) 30B-A3B 17.1

我们的模型 Qwen-UI-Agent 27B 82.1 Qwen-UI-Agent 35B-A3B 65.0

由人类编写的任务,并在带有真实应用、账户、内容和网络的真实安卓设备上运行。它评估智能体能否在应对真实使用中产生的不确定性和中断的同时,完成用户的目标。

基准设计与任务覆盖。MobileWorld-Real包含104个应用上的409项端到端任务,每项任务均源自人类贡献者识别的日常需求。这些任务涵盖日常移动端使用的7个领域:内容消费、生活服务、生产力、电子商务、系统设置、金融服务和社交通信。在每个领域内,任务覆盖多种用户意图。例如,内容消费包括搜索内容、浏览信息流、发布和分享。为在真实条件下评估这些任务,我们在第2.2.2节描述的真实设备移动端运行时上执行它们,使用真实的账户状态和动态变化的在线内容。这使得图形用户界面智能体暴露于弹窗、登录过期、权限请求、验证码以及其他在沙箱环境中很少遇到的情况。

除了这些环境挑战,许多任务还涉及复杂的多步骤工作流。近一半任务被标记为困难,常见挑战包括长周期执行、比较与排序、基于变化信息的推理、导航至深层嵌套的应用功能、弹窗恢复以及跨应用协调。该基准进一步捕捉了真实用户请求的模糊性,这些请求并不总是提供成功执行所需的所有信息。在此类情况下,智能体必须识别缺失信息,使用ask_user获取必要细节,或在需要用户干预的步骤请求用户接管,然后才能继续任务。

我们在MobileWorld-Real的真实性与重复评估的需求之间取得了平衡。MobileWorld-Real避免了依赖于特定历史订单、购物车状态、银行卡或其他无法可靠设置或恢复的条件的任务。这确保了评估结果的高度稳定性。图7总结了MobileWorld-Real的任务覆盖、挑战概况和代表性示例。

用于轨迹级图形用户界面智能体评估的AutoJudge。在真实设备上评估任务成功与否极具挑战性。与沙箱环境不同,真实应用通常不暴露其内部状态的编程式验证器。此外,一次不成功的运行可能源于智能体失败或环境问题,例如验证码、登录会话过期、网络故障、服务不可用或基础设施错误。仅凭最终屏幕通常不足以区分这些情况。

第 23 页

表 3:真实设备移动端基准测试的性能对比。MobileWorld-Real 是我们提出的中文真实设备移动端图形用户界面基准(第 3.2 节),AndroidDaily(Sui 等,2026)覆盖了真实安卓设备上的高频日常场景。

| 模型 | 访问方式 / 规模 | MOBILEWORLD-REAL | ANDROIDDAILY | |——|—————-|——————-|————–| | 基线模型 | | | | | Seed 2.1 Pro(字节跳动 Seed,2026b) | 闭源 | 88.7 | 95.2 | | Gemini 3.1 Pro(Google,2026a) | 闭源 | 86.2 | 93.8 | | GPT-5.6 Sol(OpenAI,2026b) | 闭源 | 85.4 | 92.6 | | Claude Opus 4.8(Anthropic,2026) | 闭源 | 84.7 | 93.0 | | Qwen 3.7 Plus(Qwen 团队,2026a) | 闭源 | 72.7 | 79.8 | | Kimi K2.6(月之暗面,2026) | 1T-A32B | 62.6 | 67.6 | | PhoneBuddy-4B(Tang 等,2026) | 4B | 53.5 | 69.0 | | UI-Venus-1.5-30B-A3B(Gao 等,2026) | 30B-A3B | 33.0 | 61.7 | | GUI-Owl-1.5-32B-Instruct(Xu 等,2026) | 32B | 32.4 | 60.9 | | GELab-Zero-4B-preview(Yan 等,2025) | 4B | 31.3 | 73.4 | | 我们的模型 | | | | | Qwen-UI-Agent | 27B | 92.2 | 97.5 | | Qwen-UI-Agent | 35B-A3B | 87.4 | 93.9 |

为了实现可扩展且可复现的评估,我们开发了 AutoJudge,一个用于真实设备交互的轨迹级评估器。评判提示词规定了明确的决策标准,用于将每条轨迹归入三种结果之一:通过、失败和环境错误。每次运行时,AutoJudge 接收任务指令和完整的执行轨迹,其中每个动作都与其对应的截图对齐。五个独立的 VLM 评判器检查同一条轨迹,每个评判器都会给出一个结果标签及简短的理由。最终结果由多数投票决定。通过单独报告环境错误并将其从成功率的计算分母中排除,AutoJudge 减少了因真实设备状态变化而引入的评估噪声。附录 A.1 在 666 条轨迹上,将 AutoJudge 与独立专家标注进行了对比评估,其完全匹配准确率达到 92.8%。图 22、23 和 24 展示了这三种结果类型的代表性示例。

MobileWorld-Real 旨在补充而非替代沙箱基准测试:它衡量在受控环境中学到的能力是否能迁移到真实设备上。所有 MobileWorld-Real 任务和收集的轨迹均未用于训练。由于真实应用和账户状态会随时间变化,我们单独报告环境错误,并保留完整的执行轨迹以供审计和复现。

3.3 主要结果
3.3.1 移动端使用评估

我们在 MobileWorld(Kong 等,2026)的纯图形用户界面子集上评估了 Qwen-UI-Agent,这是一个具有挑战性且可复现的移动端使用基准测试,其特点是跨多种安卓应用的长时间、跨应用工作流。对比对象包括前沿的通用 VLM 和来自多个机构的专用移动端图形用户界面模型。如表 2 所示,在标准的 50 步评估预算下,Qwen-UI-Agent-27B 的成功率达到 82.1%,创下了新的最优水平。它分别比 GPT 5.6 Sol、Opus 4.8 和 Seed 2.1 Pro 高出 12.0、14.6 和 8.9 个百分点。它比最强的专用图形用户界面基线模型 GUI-Owl-1.5-32B-Instruct(成功率为 43.9%)高出 38.2 个百分点。Qwen-UI-Agent-35B-A3B 也达到了 65.0%,超越了除 Seed 2.1 Pro 和 Claude Opus 4.8 之外的所有专用图形用户界面基线模型和通用 VLM。当最大步数增加到 100 步时,Qwen-UI-Agent-27B 和 Qwen-UI-Agent-35B-A3B 的成功率分别进一步提升至 85.5% 和 68.4%。这些结果证明了我们强大的长时程能力。

第 24 页

图 8:真实设备移动端图形界面执行演示。轨迹以关键帧形式呈现,每帧下方标注了所执行的动作。在此跨应用任务中,智能体在高德地图上查找目标地址,在大众点评上找到附近最受欢迎的咖啡馆,并在小红书上发布发现总结。

规划、视觉理解以及在复杂移动环境中的可靠执行能力。

我们进一步在两个真实设备移动端基准测试上评估 Qwen-UI-Agent:MobileWorld-Real(第 3.2 节)和 AndroidDaily(Sui et al., 2026)。MobileWorld-Real 侧重于在中国移动生态系统的真实安卓设备上执行的复杂任务,而 AndroidDaily 则覆盖真实安卓设备上的高频日常场景。

如表 3 所示,Qwen-UI-Agent 在 MobileWorld-Real 上达到 92.2%,超越了所有基线模型,包括顶尖闭源模型 Seed 2.1 Pro 的 88.7%、Gemini 3.1 Pro 的 86.2% 以及 GPT 5.6 Sol 的 85.4%。这一结果表明,Qwen-UI-Agent 能够可靠地处理长周期跨应用执行、超级应用内的深层入口导航,以及在真实世界移动设备上对变化信息进行推理。仅凭 27B 参数,Qwen-UI-Agent 在任务能力、真实设备可靠性和部署效率之间取得了良好的平衡。

在 AndroidDaily 上,Qwen-UI-Agent 达到 97.5%,在所有对比模型中排名第一,超越了 Seed 2.1 Pro 的 95.2% 和 Gemini 3.1 Pro 的 93.8%,展示了在高频日常移动场景中可靠的任务完成能力。35B-A3B 变体在 MobileWorld-Real 上达到 87.4%,在 AndroidDaily 上达到 93.9%,而每个 token 仅激活 3B 参数,为部署提供了显著更高的推理效率。

定性示例。图 8 展示了 Qwen-UI-Agent 具有代表性的真实设备执行轨迹,每个关键帧下方标注了所执行的动作。它突显了跨应用场景中的自主规划能力:在超过 27 步的操作中,智能体直接导航至每个应用的深层功能入口,在高德地图上检索地址,在大众点评上识别 1 公里内最受欢迎的咖啡馆,并将提取的关键信息带入小红书,作为完成总结的决策依据。

第 25 页

表 4:OSWorld-Verified 上的性能对比(Xie 等,2024)。

模型 访问方式 / 规模 成功率 (%)

基线模型 Claude Opus 4.8(Anthropic,2026) 闭源 83.4 Seed 2.1 Pro(字节跳动 Seed,2026b) 闭源 78.8 GPT-5.5(OpenAI,2026a) 闭源 78.7 Gemini 3.5 Flash(Google,2026b) 闭源 78.4 Gemini 3.1 Pro(Google,2026a) 闭源 76.2 Qwen 3.7 Plus(Qwen 团队,2026a) 闭源 73.3 MiniMax M3(MiniMax,2026) 428B-A23B 75.2 Kimi K2.6(月之暗面,2026) 1T-A32B 73.1 GUI-Owl-1.5-32B-Instruct(Xu 等,2026) 32B 56.5

我们的模型 Qwen-UI-Agent 27B 79.5

表 5:OSWorld-v2 上的性能对比(Yuan 等,2026)。Partial 和 Binary 分别表示部分任务进度和完整任务完成。Steps/task 越低越好。

模型 PARTIAL (%) BINARY (%) STEPS/TASK 动作模式

基线模型 Claude Opus 4.8(Anthropic,2026) 54.8 20.6 103.0 批处理 GPT-5.5(OpenAI,2026a) 49.5 13.0 95.2 批处理 MiniMax M3(MiniMax,2026) 22.3 4.6 326.7 单步 Kimi K2.6(月之暗面,2026) 22.1 4.6 179.3 单步 Qwen 3.7 Plus(Qwen 团队,2026a) 21.5 2.8 173.5 单步

我们的模型 Qwen-UI-Agent 40.0 13.9 135.8 批处理

3.3.2 计算机使用评估

我们在 OSWorld-Verified(Xie 等,2024)和 OSWorld-v2(Yuan 等,2026)上评估了 Qwen-UI-Agent 的计算机使用能力。我们分别报告这两个基准的结果。OSWorld-Verified 衡量 361 个计算机使用任务的部分进度,而 OSWorld-v2 则侧重于更长周期的工作流,并同时报告部分进度和二元完成情况。

如表 4 所示,Qwen-UI-Agent 在 OSWorld-Verified 上取得了 79.5% 的成功率,在所有对比模型中排名第二,仅次于 Claude Opus 4.8。它超越了其他领先的闭源基础模型,包括 Seed 2.1 Pro、GPT-5.5、Gemini 3.5 Flash 和 Gemini 3.1 Pro,以及所有被评估的开源权重基础模型。这些结果表明,Qwen-UI-Agent 与最强的闭源模型具有竞争力,同时相较于当前的开源权重模型建立了显著优势。

如表 5 所示,Qwen-UI-Agent 在 OSWorld-v2 上取得了 40.0% 的部分得分和 13.9% 的二元完成率,使其在前沿闭源模型中具有竞争力。特别是,它在二元完成率上比 GPT-5.5 高出 0.9 个百分点,而在部分得分上落后 9.5 个百分点。Qwen-UI-Agent 也大幅超越了所有被评估的开源权重模型。与最强的开源权重基线 MiniMax M3 相比,Qwen-UI-Agent 将部分进度提升了 17.7 个百分点,二元完成率提升了 9.3 个百分点。相较于 Kimi K2.6,这一优势扩大至 17.9/9.3 个百分点;相较于 Qwen 3.7 Plus,优势扩大至 18.5/11.1 个百分点。此外,Qwen-UI-Agent 平均每个任务仅需 135.8 步,远少于 MiniMax M3 和 Qwen 3.7 Plus。这些结果表明,混合图形界面与命令行动作空间和批处理动作的设计,在长周期计算机使用工作流中提供了强大的任务性能和执行效率。

Qwen-UI-Agent 的一个关键特性是其统一的混合图形界面与命令行动作空间及批处理执行。与其

第 26 页

图 9:计算机使用任务中混合图形界面与命令行动作空间的执行演示。图中展示了关键帧及其发出的动作,其中命令行指令以蓝色高亮,图形界面动作以红色高亮,每一步都附有简短的操作意图说明。在此示例中,智能体选中目标照片,并通过命令行将所有候选图片拼接成一张蒙太奇图像进行一次性视觉检查,而非逐一打开每张图片。随后,它利用混合执行方式,将基于命令行的处理与基于图形界面的验证相结合,以生成最终输出。

模型并非将命令行视为偶尔的备选方案,而是学会了在同一轨迹中选择并交替使用图形界面与命令行动作。在 OSWorld-Verified 和 OSWorld-v2 上,命令行动作分别占所有动作的 40.7% 和 55.1%,而以批处理形式发出的动作相应比例分别为 39.6% 和 41.6%。我们在第 4.2 节中对 Qwen-UI-Agent 如何组合图形界面与命令行动作进行了详细分析。

定性示例。图 9 和附录 A.3 的图 26 进一步展示了 Qwen-UI-Agent 在两个典型多应用工作流中的混合执行行为,其中命令行指令(蓝色)和图形界面动作(红色)在每帧关键帧下方高亮显示,并附有简短的操作意图说明。在图 9 中,智能体必须在众多候选图片中识别出目标城市照片和可用的天气滤镜;纯图形界面执行需要逐一打开并检查每张图片,而智能体则通过一个命令行脚本将所有候选图片拼接成一张蒙太奇图像,一目了然地完成验证,然后再回到图形界面动作进行合成和演示文稿编辑。这种对两种界面的互补使用,使得混合执行比单独使用图形界面或命令行都显著更高效,并且智能体进一步将兼容操作(例如多键快捷键序列或一条命令后跟一个等待)批处理为单次模型回合。

3.3.3 浏览器使用与 DeepSearch 评估

除了移动端和计算机使用,我们还在基于浏览器的网页导航和 DeepSearch 上评估了 Qwen-UI-Agent。这些能力密切相关,但评估的是图形用户界面智能体的不同方面。

浏览器使用。我们在 WebArena(Zhou 等人,2024)上评估了 Qwen-UI-Agent,该基准包含在功能网站上进行的有状态、多步骤任务。在初步评估中,我们发现了多个错误的参考答案以及官方评估脚本中的错误。因此,我们手动验证了参考答案

26

第 27 页

表6:WebArena(Zhou et al., 2024)上的性能对比。标注∗的基线结果来自我们在相同实验设置下的自行评估。

| 模型 | 访问方式 / 规模 | 成功率 (%) | | :— | :— | :— | | 基线 | | | | Claude Opus 4.8∗(Anthropic, 2026) | 闭源 | 71.9 | | GPT-5.5∗(OpenAI, 2026a) | 闭源 | 69.5 | | Gemini 3.1 Pro∗(DeepMind, 2025) | 闭源 | 65.3 | | Qwen 3.7 Plus∗(Qwen Team, 2026a) | 闭源 | 59.0 | | CUA-GYM-A17B(Wang et al., 2026) | 397B-A17B | 56.0 | | Kimi K2.6∗(Moonshot AI, 2026) | 1T-A32B | 55.8 | | Qwen3.5-397B-A17B(Qwen Team, 2026b) | 397B-A17B | 54.0 | | GUI-Owl-1.5-32B-Thinking(Xu et al., 2026) | 32B | 48.4 | | Qwen3.5-27B(Qwen Team, 2026b) | 27B | 41.5 | | Qwen3.5-35B-A3B(Qwen Team, 2026b) | 35B-A3B | 40.8 | | 我们的模型 | | | | Qwen-UI-Agent | 27B | 73.6 | | Qwen-UI-Agent | 35A3B | 69.2 | | 人类表现(Zhou et al., 2024) | – | 78.2 |

表7:DeepSearch基准测试上的性能对比:BrowseComp (BC) 和 BrowseComp-ZH (BC-ZH)。“–”表示结果未报告。

| 模型 | 访问方式 / 规模 | BC (%) | BC-ZH (%) | | :— | :— | :— | :— | | 基线 | | | | | GPT-5.5(OpenAI, 2026a) | 闭源 | 90.1 | – | | Seed 2.1 Pro(ByteDance Seed, 2026b) | 闭源 | 86.2 | – | | Gemini 3.1 Pro(Google, 2026a) | 闭源 | 85.9 | – | | Claude Opus 4.8(Anthropic, 2026) | 闭源 | 84.3 | – | | UI-TARS-2(Wang et al., 2025a) | 闭源 | 29.6 | 50.5 | | Qwen3.5-397B-A17B(Qwen Team, 2026b) | 397B-A17B | 78.6 | 70.3 | | Apodex-1.0-mini(Apodex Team, 2026) | 35B-A3B | 71.5 | 80.6 | | Qwen3.5-27B(Qwen Team, 2026b) | 27B | 61.0 | 62.1 | | GLM-4.7(Z.ai, 2025) | 358B | 52.0 | 66.6 | | DeepSeek-V3.2(DeepSeek-AI, 2025) | 685B | 51.4 | 65.0 | | Tongyi-DR-30B(Tongyi DeepResearch, 2025) | 30B-A3B | 43.4 | 46.7 | | 我们的模型 | | | | | Qwen-UI-Agent | 27B | 64.1 | 75.0 |

在报告最终结果之前,我们修正了受影响的脚本并重新评估了答案。Kimi K2.5同样报告了其使用修正后评估设置的WebArena性能(Kimi Team, 2026)。

如表6所示,Qwen-UI-Agent的27B版本达到了73.6%的成功率,在所有对比模型中最高,而35A3B版本达到了69.2%。27B版本以1.7个百分点的优势超越了最强的基线模型Claude Opus 4.8(71.9%),并以4.1个百分点的优势超过了GPT-5.5(69.5%)。Qwen-UI-Agent还优于Gemini 3.1 Pro、Qwen 3.7 Plus、Kimi K2.6、CUA-GYM-A17B,以及专门的浏览器智能体,如Claude 3.7 Computer Use和GUI-Owl-1.5-32B-Thinking。尽管与报告的人类表现78.2%仍有4.6个百分点的差距,但这一结果展示了其在异构网页界面上强大的端到端浏览器控制能力。

DeepSearch。简单的搜索通常是网页导航本身的一部分:智能体在浏览器中输入查询,检查排序结果,并打开一个可能相关的页面。DeepSearch通过用基于API的检索和证据合成取代许多重复的图形用户界面动作,简化了这一过程,使智能体能够在继续图形用户界面工作流之前更高效地获取外部上下文。

27

第 28 页

帮我在世界杯淘汰赛决赛中完成逆转,尽管一度落后,并克服对阵世界杯夺冠次数最多球队时的最大分差,然后打开小红书,找到并点赞上周最热门的帖子。

起点 第1轮:深度搜索 第2轮:网页抓取 搜索摘要

关键词:“世界杯淘汰赛阶段” 2026年世界杯所有淘汰赛的比分 思考:根据检索到的比赛 摘要:根据 2026年世界杯:完整赛程、结果、进球和排名 报告,多场淘汰赛出现了 2026年国际足联世界杯淘汰赛阶段,多场比赛 从32强赛开始,赛事将进入单败淘汰制, 逆转取胜,并确定最大逆转 涉及先失球后逆转取胜的球队。 一直持续到两支最强的国家队脱颖而出, 中的进球数。 最引人注目的逆转是—— 在纽约新泽西体育场会师,争夺足球界的最高荣誉。阅读本文查看赛事详情。 搜索 N轮——阿根廷队在0–2落后的情况下 https://www.olympics.com/zh/news/fifa-world-cup-2026-schedule- 完整淘汰赛赛程已公布。随着小组赛 以3–2获胜,这意味着该队克服了 results-standings 结束,所有晋级2026年世界杯淘汰赛阶段的 两球落后的劣势,这是现有结果中 32支球队已确认,创造了多场历史性对决。 逆转的最大分差。其他比赛可能 2026年国际足联世界杯淘汰赛阶段——维基百科 https://app.xinhuanet.com/news/article.html? 包含一球逆转,但0–2到3–2的 2026年国际足联世界杯淘汰赛阶段将有32支 articleId=202606288c3f4bbe9f9f474e98329b939c42a34d 结果代表了搜索中识别出的最强 从小组赛晋级的球队参赛。如果比赛在常规90分钟 逆转。总体而言,阿根廷队的 后打平,将进行30分钟的加时赛。如果比分仍然 2026年世界杯赛程——CCTV 比赛既是分差最大的逆转,也是 持平,则通过点球大战决出胜者。 巴西 0–1 法国。7月5日01:00 1/8决赛直播。 搜索结果中最具戏剧性的淘汰赛 https://zh.wikipedia.org/zh-cn/ 加拿大 0–3 摩洛哥。7月7日03:00 1/8决赛直播。 逆转之一。 2026%E5%B9%B4%E5%9B%BD%E9%99%85%E8%B6%B3%E8%81 葡萄牙 0–1。 %94%E4%B8%96%E7%95%8C%E6%9D%AF%E6%B7%98%E6%B1 https://worldcup.cctv.com/2026/schedule/index.shtml %B0%E8%B5%9B …

等待

完成

打开 等待 输入 点击 完成 (小红书)

图10:DeepSearch辅助图形界面执行的演示。上方面板展示了多轮搜索过程,包括基于关键词的深度搜索、带有中间思考的目标网页抓取以及最终的搜索摘要;下方行展示了随后的图形界面操作轨迹。深度搜索在图形界面执行前解决了知识和推理问题,将模糊的跨来源请求转化为明确的目标:Qwen-UI-Agent通过深度搜索识别出世界杯淘汰赛阶段的最大逆转,然后打开小红书,直接导航到上周互动量最高的相关帖子,无需在应用内盲目搜索。

我们在BrowseComp和BrowseComp-ZH上评估了Qwen-UI-Agent,这两个基准分别评估在英文和中文网页上的持久信息搜寻能力。如表7所示,Qwen-UI-Agent在BrowseComp上获得64.1%的得分,在BrowseComp-ZH上获得75.0%的得分。在BrowseComp上,Qwen-UI-Agent优于Qwen3.5-27B、Tongyi-DR-30B和UI-TARS-2。虽然其性能仍落后于前沿的闭源模型和规模更大的系统,但它在27B规模上展示了具有竞争力的英文深度搜索能力。在BrowseComp-ZH上,Qwen-UI-Agent在所有比较系统中取得了第二好的成绩,显著优于Qwen3.5-27B、Tongyi-DR-30B和UI-TARS-2。这些结果表明,Qwen-UI-Agent不仅能够定位候选网页,还能将分布在多个来源的证据综合成可靠的、与任务相关的信息,用于后续的推理和图形界面执行。

定性示例。我们进一步展示了两个图形界面执行演示,说明了深度搜索与图形界面执行相结合的互补方式:图形界面动作处理与应用程序的交互,而深度搜索处理外部知识获取、比较和决策。在第一个演示中(图10),任务要求在进行任何图形界面操作之前解决一个知识和推理问题:识别当前世界杯淘汰赛阶段中逆转分差最大的比赛。上方面板追踪了多轮搜索过程,从基于关键词的深度搜索排名来源,到提取并交叉核对比赛比分的针对性网页抓取,再到一份搜索摘要,该摘要识别出阿根廷队在0–2落后情况下以3–2逆转的比赛。深度搜索因此在执行开始前就将一个模糊的、跨来源的用户请求转化为明确的图形界面目标,使得在下方的操作轨迹中,智能体打开小红书,直接搜索已识别的比赛,筛选过去七天的帖子,并打开讨论最多的帖子,无需在应用内盲目搜索或反复尝试。在第二个演示中(附录A.3的图27),深度搜索则在图形界面执行过程中按需调用:

28

第 29 页

表 8:图形界面定位基准上的性能对比。ScreenSpot-Pro 报告无缩放结果,括号内为放大结果(如有)。标有 ∗ 的基线结果来自我们自己的评测。

| 模型 | 定位基准 | | :— | :— | | | SS-PRO(放大) SS-V2 MM-GUI-L2 OSW-G-R UI-VISION |

| 基线 | | | | | | | Qwen 3.7 Plus* (Qwen Team, 2026a) | 68.9 (79.0) | 96.6 | 90.5 | 78.2 | 68.0 | | Seed 2.1 Pro* (ByteDance Seed, 2026b) | 65.3 (80.7) | 96.6 | 90.9 | 78.0 | 62.0 | | Qwen3.5-4B* (Qwen Team, 2026b) | 59.1 (60.3) | 94.3 | 83.4 | 62.0 | 32.6 | | Qwen3.5-35B-A3B* (Qwen Team, 2026b) | 64.5 (68.6) | 95.2 | 87.5 | 63.6 | 52.3 | | Qwen3.5-27B* (Qwen Team, 2026b) | 68.4 (70.3) | 96.1 | 89.1 | 67.9 | 46.6 | | GUI-Owl-1.5-2B-Instruct (Xu et al., 2026) | 57.8 (70.4) | 89.7 | 72.1 | 62.6 | – | | GUI-Owl-1.5-4B-Instruct (Xu et al., 2026) | 66.8 (75.6) | 93.2 | 83.2 | 68.4 | – | | GUI-Owl-1.5-8B-Instruct (Xu et al., 2026) | 71.1 (77.8) | 93.7 | 82.5 | 69.3 | – | | GUI-Owl-1.5-32B-Instruct (Xu et al., 2026) | 72.9 (80.3) | 95.3 | 86.8 | 69.7 | – | | UI-Venus-1.5-2B (Gao et al., 2026) | 57.7 (64.6) | 92.8 | 80.3 | 59.4 | 44.8 | | UI-Venus-1.5-8B (Gao et al., 2026) | 68.4 (73.9) | 95.9 | 88.1 | 69.7 | 46.5 | | UI-Venus-1.5-30B-A3B (Gao et al., 2026) | 69.6 (74.8) | 96.2 | 88.6 | 70.6 | 54.7 | | ZoomOnce-4B (Liu et al., 2026) | 66.2 | 95.2 | 87.6 | 73.1 | 40.2 | | HyMobileAgent-A3B (Shen et al., 2026) | 66.5 | 96.2 | 89.3 | – | – | | MAI-UI-2B (Zhou et al., 2025a) | 57.4 (62.8) | 92.5 | 82.6 | 63.5 | 30.3 | | MAI-UI-8B (Zhou et al., 2025a) | 65.8 (70.9) | 95.2 | 88.8 | 72.9 | 40.7 | | MAI-UI-32B (Zhou et al., 2025a) | 67.9 (73.5) | 96.5 | 91.3 | 75.0 | 47.1 | | GTA1-7B (Yang et al., 2025a) | 50.1 | 92.4 | 78.5 | 67.7 | – | | GTA1-32B (Yang et al., 2025a) | 63.6 | 95.2 | 83.4 | 72.2 | – | | UI-Ins-7B (Chen et al., 2025) | 52.2 | 94.0 | 83.1 | – | – | | UI-Ins-32B (Chen et al., 2025) | 57.0 | 94.9 | 84.9 | – | – | | OpenCUA-7B (Wang et al., 2025b) | 50.0 | 92.3 | – | – | 29.7 | | OpenCUA-32B (Wang et al., 2025b) | 55.3 | 93.4 | – | – | 33.3 | | OpenCUA-72B (Wang et al., 2025b) | 60.8 | 92.9 | – | – | 37.3 |

| 我们的模型 | | | | | | | Qwen-UI-Agent-4B | 67.8 (74.0) | 94.9 | 87.9 | 70.5 | 51.6 | | Qwen-UI-Agent-35B-A3B | 76.1 (80.2) | 96.7 | 92.0 | 74.6 | 65.9 | | Qwen-UI-Agent-27B | 76.6 (81.5) | 97.5 | 92.6 | 78.5 | 70.0 |

智能体首先定位一个关于循证减肥的抖音视频,并通过图形界面动作提取其主要观点,然后调用 DeepSearch 将这些观点与研究论文、官方指南和权威来源进行验证,因为仅凭界面本身无法决定是否评论以及评论什么。验证结论直接决定了后续的图形界面动作,即发布一条纠正误导性观点并补充必要注意事项的评论,形成一个“观察—研究—决策—行动”的闭环。

3.3.4 图形界面定位

我们在五个综合基准上评估了 Qwen-UI-Agent 的图形界面定位能力:ScreenSpot-Pro、ScreenSpot-V2、MMBench-GUI L2、OSWorld-G-Refined 和 UI-Vision。这些基准涵盖了高分辨率专业软件、通用跨平台界面、桌面软件环境以及指令驱动的定位。

如表 8 所示,27B 版本在所有五个基准上均取得了强大的定位性能,在 ScreenSpot-Pro(无缩放)上达到 76.6%,在 ScreenSpot-V2 上达到 97.5%,在 MMBench-GUI L2 上达到 92.6%,在 OSWorld-G-Refined 上达到 78.5%,在 UI-Vision 上达到 70.0%。在 ScreenSpot-Pro 上,无论是否使用缩放,它在所有对比模型中均排名第一,并且其分数在放大后进一步提升至 81.5%。这些结果证明了其在常见界面和复杂界面中均能实现精确的元素定位。

29

第 30 页

表9:通用能力与智能体能力对比。Qwen-UI-Agent在保持其基座模型通用推理与智能体能力的同时,获得了强大的图形用户界面能力。在这些基准测试中,它也大幅超越了其他图形用户界面专用模型。

| 基准测试 | Qwen-UI-Agent | Qwen3.5-27B | UI-Venus-1.5 30B-A3B | GUI-Owl-1.5 32B-Instruct | EvoCUA-32B 20260105 | OpenCUA 72B | | :— | :— | :— | :— | :— | :— | :— | | 通用能力: | | | | | | | | MMMU-Pro | 72.4 | 73.5 | 32.4 | 39.5 | 58.4 | 31.0 | | RealWorldQA | 83.1 | 83.1 | 75.3 | 76.7 | 75.4 | 66.4 | | CharXiv-RQ | 77.7 | 76.8 | 44.7 | 50.9 | 58.1 | 39.6 | | MathVision | 82.8 | 82.0 | 36.8 | 50.6 | 60.8 | 26.6 | | AI2D_TEST | 91.1 | 91.9 | 84.3 | 84.8 | 85.7 | 78.9 | | MMLU-Pro | 86.5 | 86.0 | 65.6 | 73.9 | 77.1 | 58.8 | | IFEval (提示词级严格) | 90.2 | 90.4 | 81.3 | 84.5 | 64.0 | 70.6 | | 智能体能力: | | | | | | | | Tau2-Bench | 89.9 | 89.2 | 22.7 | 6.1 | 48.9 | 14.4 | | Terminal-Bench 2.0 (平均5次) | 50.1 | 41.1 | 3.2 | 0.0 | 5.6 | 9.0 | | Claw-Eval (平均3次) | 73.5 | 66.9 | 30.6 | 29.6 | 46.3 | 26.4 | | Claw-Eval (Pass@3) | 51.8 | 41.2 | 5.5 | 5.5 | 6.5 | 0.5 | | BFCL-v4 | 74.2 | 71.3 | 19.8 | 32.7 | 48.8 | 28.3 | | SkillsBench (平均5次) | 28.0 | 24.9 | 0.5 | 0.3 | 3.3 | 0.0 | | QwenClawBench (平均3次) | 44.2 | 48.5 | 6.4 | 5.1 | 18.6 | 11.4 |

评估说明。 本表中所有结果均在我们的评估环境中独立复现。由于部分评估设置不完全相同,分数可能与官方报告存在差异。除下文注明外,我们均遵循相应的官方基准测试协议。

  • Tau2-Bench。 我们遵循官方排行榜任务集、Harness和评分协议,但使用GPT-5.5作为用户模拟器和评判器。
  • Terminal-Bench 2.0。 遵循Qwen3.6评估设置,我们使用Harbor/Terminus-2 Harness,每个任务超时时间为三小时,最多可使用32个CPU和48 GB内存。我们使用温度1.0、top-p 0.95、top-k 20、80K token输出限制和256K上下文窗口,并报告五次运行的平均值。
  • Claw-Eval。 我们遵循官方的199个任务、三次试验协议和评分规则,但使用GPT-5.5进行通用和多轮评判,并使用Qwen3.6-Plus进行多轮用户模拟,替代了官方的Gemini 3 Flash/Claude Opus 4.6设置。我们使用0.6的采样温度。
  • SkillsBench。 我们遵循Qwen3.6评估设置。我们使用OpenCode评估78个自包含任务,排除了依赖外部API的任务,并报告五次运行的平均值。
  • QwenClawBench。 我们遵循官方的v1.1任务集、三次运行协议和惩罚混合评分,但将默认的Claude Opus 4.5评判器替换为GPT-5.2。我们还将OpenClaw运行时固定为2026.6.1版本,而非使用动态更新的主镜像。

专业软件,包括需要从功能或空间上下文而非显式文本推断目标的情况。

其定位能力在不同模型规模上也保持强劲。在ScreenSpot-Pro上,35B-A3B和4B变体在不使用放大功能时的得分分别为76.1%和67.8%,使用放大功能后得分提升至80.2%和74.0%。35B-A3B变体在ScreenSpot-V2上进一步达到96.7%,在MMBench-GUI L2上达到92.0%,在OSWorld-G-Refined上达到74.6%,在UI-Vision上达到65.9%,而每个token仅激活3B参数。4B变体的相应得分分别为94.9%、87.9%、70.5%和51.6%。这些结果共同表明,Qwen-UI-Agent在从紧凑到中等模型规模范围内,都能在常见界面、专业软件和指令类型上提供可靠的图形用户界面定位。

3.3.5 通用与智能体能力

Qwen-UI-Agent在培养强大的图形用户界面领域知识的同时,保留了从其基座模型继承的通用推理和智能体能力。如表9所示,它在通用和智能体基准测试中也大幅超越了专用的图形用户界面模型。这些结果共同表明,Qwen-UI-Agent仍然是一个能力广泛的模型,而非一个狭隘的仅限图形用户界面的模型。这种更广泛的能力特征也可能有助于它处理那些需要知识、推理和工具使用,超出常规图形用户界面交互的分布外或不寻常任务。

第 31 页

主动服务:用户次日早晨的航班被取消,导致下午14:00与CTO的演示面临风险。在用户询问之前,主动式Harness层搜索替代航班和高铁,评估哪些选项能准时到达,并呈现一个可供决策的出行恢复方案。

主动任务发起 主动执行阶段 #1 主动执行阶段 #2 可供决策的结果 航班搜索 高铁搜索

航班取消事件

完成

检测到 航班取消 点击 完成 TravelPlanRecovery

图 11: 基于移动通知的主动服务演示。轨迹被组织为高亮阶段:从检测到的通知发起的主动任务、主动执行阶段以及可供决策的结果,每个关键帧下方标注了执行的动作。航班取消恢复:当用户次日早晨的航班被取消且下午14:00的演示面临风险时,Harness层主动搜索替代航班和高铁,评估哪些选项能准时到达,并呈现一个可供决策的出行恢复方案。

3.4 Harness 层赋能的工作流

除了基准评测,我们还定性地考察了第2.5节引入的Harness层所赋能的工作流,涵盖主动服务发起和跨平台任务执行。

主动服务。我们在图11和附录A.3的图28中展示了两个具有代表性的主动服务轨迹。每条轨迹被组织为四个高亮阶段:主动任务发起、一个或多个主动执行阶段以及可供决策的结果。在图11中,一个预定的08:00触发器将用户的早晨安排(从高亮通知中提取)与实时天气和通勤状况相结合。Harness层首先获取天气信息,然后通过地图导航推理公共交通和出租车选项,并在用户询问之前,提供一个包含带伞建议、出发时间和关键提醒的可执行早晨简报。在图28中,Harness层检测到一条航班取消通知(在第一阶段高亮),该通知使次日14:00的演示面临风险。它在两个执行阶段中主动搜索替代航班和高铁,评估哪些选项能准时到达,并呈现一个可供决策的出行恢复方案,将最终的预订决定留给用户。这两个例子都展示了Harness层将被动通知转化为情境化、可执行的辅助,同时将关键操作保持在用户控制之下。

跨平台任务执行。图6(II)展示了一个用于团建餐厅选择的跨平台工作流。Harness层将任务分解为四个面向设备的阶段:Qwen-UI-Agent在移动端发现候选餐厅,将其评分、菜系和预订电话整理到桌面端的电子表格中,将生成的成果发送给团队负责人审批,最后将获批的餐厅保存回移动端地图应用。在整个工作流中,共享任务状态在设备间传递候选列表、生成的电子表格和审批结果,因此每个阶段都从最新上下文继续,而非从头开始。我们在图12和附录A.3的图29中展示了该能力的两个执行轨迹:一个收据整理工作流,将移动端相册选择交给GUI+CLI计算机使用以生成费用报告;以及一个并行餐厅搜索,在多个虚拟设备上同时操作大众点评、美团和高德地图。

第 32 页

跨平台服务:跨多个平台搜索寿司餐厅,比较其评分,并创建一份本地报告,总结排名前三的选项。

移动端 移动端(多个并发虚拟屏幕) 电脑端

不阻塞 打开大众点评、美团和高德地图,并行搜索寿司餐厅,收集评分等信息,整合搜索结果。 将排名前三的餐厅总结到文件中,并在本地打开该文件。 用户操作。

图12:跨平台任务执行演示。在此工作流中,移动端子任务在物理设备的虚拟屏幕上运行,因此执行不会阻塞用户自身的操作。并行多应用搜索:智能体通过多个虚拟屏幕同时在大众点评、美团和高德地图上搜索寿司餐厅,整合其评分,并在电脑端打开的本地报告中总结排名前三的选项。

屏幕;在这两种情况下,移动端子任务均在虚拟屏幕上运行,不会阻塞用户对设备的正常使用。这些示例共同表明,该Harness层能够在执行过程在移动端和电脑端环境之间转移时,保持任务状态、产物和依赖关系。

4 图形用户界面智能体执行的行为分析

聚合基准分数能显示智能体是否完成任务,但较少揭示其如何执行任务、为何失败,以及其行为在强化学习训练后如何变化。因此,我们主要围绕Qwen-UI-Agent的执行行为,考察四个问题:(1)为何针对模拟基准优化的模型在物理设备上表现挣扎?(2)Qwen-UI-Agent在任务执行过程中如何组合使用图形界面、命令行和批处理动作,以及这些选择催生了哪些独特的执行模式?(3)动作级强化学习如何改变步骤级执行行为?(4)在线强化学习如何重塑长周期任务中的轨迹级行为?这些分析共同补充了聚合指标,揭示了智能体如何应对具有挑战性的环境、使用其动作空间,以及在强化学习训练后如何变化。

4.1 模型有限的真实设备经验如何影响其执行行为?

真实设备失败的行为分析。大多数模型在训练期间对物理设备交互的直接接触有限。诸如Qwen 3.7 Plus等前沿模型在广泛的基准测试中表现强劲,但它们在MobileWorld-Real上的结果表明,在物理设备上实现可靠执行仍然具有挑战性。这引出了一个更具体的行为问题:当模型在训练期间具有有限的真实设备交互时,会出现哪些执行模式,以及这些模式如何导致任务失败?为探究此问题,我们审查了Qwen 3.7 Plus在MobileWorld-Real和AndroidDaily上所有失败的轨迹,以识别主要的失败模式。

如表10所示,我们沿两个维度对失败进行分类,两者均源于训练中真实交互经验的匮乏:执行能力局限(40.3%),即模拟环境几乎不提供学习探索、错误恢复和状态追踪的激励;以及真实世界场景挑战(52.0%),由经过净化的模拟器很少包含的界面现象所触发。如图13所示,我们为一个代表性案例配对了两个关键帧及模型精简的思考过程。

32

第 33 页

表10:Qwen 3.7 Plus 在真实设备上所有失败轨迹的失败模式分布。

维度 | 失败模式 | 占比 | 典型行为 —–|———|——|———- 执行能力局限(40.3%) | 探索失败 | 19.5% | 无法定位深层应用内入口 | 错误动作循环 | 14.3% | 重复无效动作 | 执行状态丢失 | 6.5% | 遗忘已完成的子任务 真实场景挑战(52.0%) | 界面误读 | 24.7% | 误读有状态页面语义 | 弹窗干扰 | 18.2% | 广告、付费墙、验证码、空白页面 | 物理控件操控 | 9.1% | 目标过冲,无法收敛 其他 | – | 7.7% | 执行不足、过早停止

图13:Qwen 3.7 Plus 在真实设备上的典型失败模式。执行能力局限:(a) 探索失败,(b) 错误动作循环,(c) 执行状态丢失。真实场景挑战:(d) 界面误读,(e) 弹窗干扰,(f) 物理控件操控。对话气泡引用模型的简化思考过程,关键谬误以紫色标出。

每种模式的案例,并在下文详细分析每种模式。

执行能力局限。 Qwen 3.7 Plus 在此维度上的失败(40.3%)反映了三方面执行能力的局限:定位较少使用或嵌套较深的应用功能、从意外反馈或界面状态中恢复,以及在长轨迹中维持任务状态。

  • 探索失败(19.5%) 发生在目标为隐藏在多个入口或深层页面层级之后的较少使用功能时。在这些情况下,Qwen 3.7 Plus 经常重复访问一小部分

33

第 34 页

浅层页面,而非探索替代路径(图13(a))。相比之下,Qwen-UI-Agent 在确定路径前会检查多个可行入口。

错误动作循环(14.3%) 源于真实第三方应用的长尾分布,其中动作经常无法产生预期的状态转换。处理此类预期违背本身是一项需要学习的技能,而模拟器因其高度可预测的交互结果,几乎无法提供获取该技能的机会。当动作未能产生预期结果时,我们发现训练期间缺乏物理设备交互经验的模型倾向于重复同一动作或在两个界面状态间来回切换,而非诊断失败并修正计划(图13(b))。

执行状态丢失(6.5%) 出现在长周期任务中,这些任务需要在应用切换、中断和多个子任务之间保留中间信息和已完成的进度。在这些轨迹中,Qwen 3.7 Plus 可能会丢失对先前进度的跟踪,重复已完成的子任务或从头开始重启部分工作流(图13(c))。

真实场景挑战。 此维度的失败(52.0%)涉及在物理设备上常见但在训练中可能较少出现的界面条件:模糊的页面语义、意外的界面中断以及需要细粒度操作的交互式控件。

界面误读(24.7%) 的产生是因为真实页面带有状态语义,而纯视觉外观无法消除歧义,例如预填的搜索词、占位符提示和动态刷新的列表,而模拟器界面则保持干净和静态。因此,在模拟环境中训练的模型会误判界面状态,最典型的是将灰色占位符误认为用户输入的文本,并反复尝试清除它,而不是直接在其上输入(图13(d))。

弹窗干扰(18.2%) 涵盖广告、付费墙、验证码以及无响应或空白页面,这些是模拟器为确保评估可复现而有意排除的非确定性中断。由于缺乏任何恢复先验,这些模型要么跟随中断偏离原始任务,要么不断重试被阻塞的路径(图13(e))。

物理控件操作(9.1%) 涉及滚动条、滑块和日期选择器,这些控件需要增量式闭环操控,智能体必须观察当前值并相应调整滑动幅度。在模拟环境中,此类值通常通过直接文本注入或单次点击来设置,因此智能体会采用固定幅度的滑动,导致在两个方向上均超出目标且永远无法收敛(图13(f))。

上述发现为第 2.2.2 节中描述的真实设备训练与评估基础设施提供了动机,并有助于解释 Qwen-UI-Agent 在真实移动设备上的强劲表现。

4.2 深入探究 Qwen-UI-Agent 的 GUI–CLI 协调与批处理执行

Qwen-UI-Agent 通过交替使用 GUI 和 CLI 动作的轨迹来执行计算机使用任务,同时选择性地以批处理形式同时发出多个动作。这种混合执行过程引出了两个问题:模型如何在 GUI 和 CLI 之间分配操作,以及它何时选择批处理多个动作?我们分析了 Qwen-UI-Agent 在 OSWorld-Verified 和 OSWorld-v2 上生成的轨迹,并在下文展示了由此产生的行为模式。

跨动作与任务的使用统计。 表 11 在动作和任务层面量化了 CLI 和批处理执行。在 Qwen-UI-Agent 生成的计算机使用轨迹中,GUI 交互和 CLI 操作均作为主要的执行通道。在 OSWorld-Verified 上,CLI 操作占所有动作的 40.7%,并出现在 92.0% 的任务中。在 OSWorld-v2 上,这些比例分别上升至 55.1% 和 98.2%。GUI 和 CLI 动作近乎均衡的分布表明,Qwen-UI-Agent 能够灵活且互补地利用这两种执行方式。CLI 在 OSWorld-v2 上占比更高,部分反映了其任务分布包含更多自然倾向于程序化执行的工作流,例如合并文件、处理结构化数据以及执行批量文件操作。 批处理动作在 OSWorld-Verified 和 OSWorld-v2 上分别占所有动作的 39.6% 和 41.6%,并且

第 35 页

表 11:OSWorld-Verified 与 OSWorld-v2 上的 GUI+CLI 使用及批处理执行统计。面板 (a) 报告动作级与任务级的 CLI 及批处理动作使用情况。面板 (b) 报告批处理输出的构成。平均批大小统计一个批次中的原始动作数量。差异按 OSWorld-v2 减去 OSWorld-Verified 计算,并以百分点 (pp) 报告。

统计项 级别 OSWorld-Verified OSWorld-v2 差异 (pp)

(a) CLI 与批处理动作总体使用情况 CLI 动作级 40.7% 55.1% +14.4 CLI 任务级 92.0% 98.2% +6.2 批处理动作 动作级 39.6% 41.6% +2.0 批处理动作 任务级 62.1% 88.9% +26.8

(b) 批处理输出构成 纯 GUI 批次 75.8% 64.7% -11.1 纯 CLI 批次 13.1% 15.0% +1.9 混合 GUI+CLI 批次 11.0% 20.3% +9.3 每批次平均原始动作数 3.1 3.1 0.0

图 14:代表性 GUI 交互模式。各面板分别展示 (a) 填写结构化电子表格内容,(b) 通过页内搜索查找内容,(c) 通过滚动进行视觉导航,(d) 使用原生媒体时间轴功能,(e) 连续空间交互,以及 (f) 放大以进行细粒度检查。每个面板将渲染的动作与其产生的应用状态配对呈现。

分别出现在 62.1% 和 88.9% 的任务中,表明批处理执行在两个基准测试中均被广泛使用。每批次平均包含 3.1 个原始动作,这意味着与将每个原始动作放在单独的模型回合中执行相比,观察-推理-执行循环次数显著减少,从而大幅提升了执行效率。纯 GUI 批次仍占主导地位,而纯 CLI 批次和混合 GUI+CLI 批次则表明,批处理执行也支持程序化操作以及两种执行通道之间的协调。

Qwen-UI-Agent 何时使用 GUI、CLI 及批处理动作?除总体使用统计外,我们还考察了轨迹中反复出现的模式,以理解 Qwen-UI-Agent 在实践中如何使用 GUI 交互、CLI 执行及批处理动作。以下示例指出了每种模式的典型场景。

第 36 页

图 15:典型命令行交互模式。模型使用命令行工具(a)从混合语料中检索相关文档,(b)解析机器可读的工件结构,(c)将大量视觉候选项压缩为带标签的对比,(d)以编程方式转换工件,(e)执行重复计算并物化其输出,以及(f)验证精确输出与过程后置条件。每个面板将应用上下文与命令摘录及其任务特定目的并列展示。

能力,并说明它们在任务执行过程中如何相互补充,尽管这些代表的是经验性倾向,而非固定的能力边界。

图形界面交互。当界面同时作为控制面和执行反馈的来源时,Qwen-UI-Agent 倾向于依赖图形界面交互,特别是涉及原生应用控件、视觉导航或空间操作的操作。图 14 展示了六种反复出现的情况:用结构化标题、公式和重复值填充电子表格单元格;使用页内搜索定位相关段落;在长界面中滚动,直到所需内容可见;通过原生时间轴控件操作媒体;与状态由几何定义的空间对象交互;以及在操作前放大以使细粒度视觉证据清晰可读。这些示例表明,图形界面交互不仅支持界面导航,还支持那些执行及后续决策依赖于可见状态转换、原生应用控件或连续空间反馈的操作。

命令行执行。当信息或操作可以表示为

36

第 37 页

图 16:代表性批处理动作模式。(a) 用于页内搜索的紧凑图形界面宏,(b) 一个包含 21 个动作的依赖表单序列,在遇到下一个不确定对话框时停止,以及 (c) 一个图形界面与命令行交接,通过结构化任务状态验证空间操作。每行将渲染后的批处理与批处理后首次观察结果配对。

比一系列图形界面交互更紧凑、更精确地表示为数据或代码。图 15 展示了六种反复出现的用途:从混合语料库中检索相关文档、解析机器可读记录、将多张图像组织成带标签的联系表、以编程方式转换工件、执行重复的评分计算,以及验证输出属性(如尺寸、亮度和进程状态)。这些模式共同表明,命令行在推理前充当搜索空间缩减器,是结构化操作的高效执行通道,并在编辑后充当精确的后置条件验证器。联系表示例进一步说明,命令行可以通过将分散的视觉证据重组为单一比较界面来补充视觉推理,而非取代视觉判断本身。

• 批处理执行。当多个操作构成一个连贯的局部序列,且其中间状态足够可预测,无需再次观察即可继续时,Qwen-UI-Agent 会使用批处理执行。如图 16 所示,代表性案例包括一个用于页内搜索的简短图形界面宏、一个包含 21 个动作的依赖序列(填写邮件并进入附件选择器),以及一个混合图形界面与命令行序列(操作对象后验证结果任务状态)。当下一步决策依赖于新的截图、命令输出、

第 38 页

在浏览器中玩恐龙跳跃游戏,并达到至少 100 分。不得使用浏览器开发者工具或 CDP。

步骤 1 步骤 2 步骤 56 步骤 63

… …

Bash(cat > /tmp/onecat.py << 'PYEOF' -c 'import PIL; print(PIL.__version__)'; Bash(cat > /tmp/surv2.py << 'PYEOF' … find_obs(); keyDown('up'); sleep(0.25); click(768, 324) python3Bash(python3 -c 'import numpy; print(numpy.__version__)'; keyUp('up') … if dist < thresh: keyDown('up'); sleep(0.02); keyUp('up') … press("SPACE") PYEOF; timeout 90 python3 /tmp/onecat.py) which xdotool; python3 -c 'import pyautogui; …') PYEOF; timeout 200 python3 /tmp/surv2.py) 标注:聚焦游戏画布并启动合法的纯键盘运行。 标注:在不使用 DOM、DevTools 或 CDP 的情况下,确认像素分析和按键事件工具链。 标注:测量 35 像素的跳跃上升高度,并根据实时游戏画面校准触发距离。 标注:对无状态短按策略进行压力测试;反复 7–9 秒的失败揭示了缺失的控制状态。

步骤 71 步骤 76 步骤 78 步骤 80

… … …

Bash(cat > /tmp/hold3.py << 'PYEOF' Bash(cat > /tmp/bot2.py << 'PYEOF' Bash(cat > /tmp/verify.py << 'PYEOF' … if dist < 60: keyDown('up'); … bg=int(np.median(sky)); mask=np.abs(sub-bg)>40 … Bash(timeout 680 python3 /tmp/bot2.py 2>&1; echo exit=$?) … screenshot(); count dark pixels in stats/score regions … … if obstacle_passed: keyUp('up') … is_cactus=bottom>345; jump_for_bird= … computer.wait() PYEOF; python3 /tmp/verify.py) PYEOF; timeout 300 python3 /tmp/hold3.py) PYEOF) finish(success) 标注:使感知适应白天/黑夜的对比度反转,然后修复一个单行缩减错误。 标注:维持显式的跳跃状态并存活 40 秒,然后存活 60 秒并执行 50 次跳跃。 标注:确认可见的后置条件:所需分数。最后得分为 156,表明按住时长——而不仅仅是触发时机——至关重要。

图 17:紧密耦合的 GUI–CLI 协作的代表性轨迹。该任务要求 Qwen-UI-Agent 在不使用 DevTools 或 CDP 的情况下,在基于浏览器的恐龙游戏中达到至少 100 分。GUI 观测为测量跳跃动力学、诊断失败的控制策略以及识别白天与黑夜模式的变化提供了证据,而 CLI 代码则迭代地实现了有状态的按键控制和自适应障碍物检测。

案例研究:动态任务中紧密耦合的 GUI–CLI 协作。 一个特别有趣的轨迹是,要求 Qwen-UI-Agent 玩一个基于浏览器的恐龙游戏,并在不使用浏览器开发者工具或 Chrome DevTools 协议 (CDP) 的情况下达到至少 100 分。将每次跳跃作为一个单独的模型动作发出,对于此任务来说效果不佳,因为在截图获取和模型推理期间,障碍物会持续移动。Qwen-UI-Agent 转而使用 CLI 来构建并迭代优化一个本地控制器,该控制器通过渲染的截图和标准键盘事件进行操作。该控制器不访问 DOM 或内部游戏状态,将可见的 GUI 作为其任务状态来源,并将键盘作为其动作接口。

该轨迹揭示了一种紧密耦合的 GUI–CLI 组合模式。连续的 GUI 观测提供了测量跳跃动力学、校准障碍物触发距离以及诊断跳跃时机和时长错误所需的证据。CLI 代码将这些观测转化为显式的感知和控制程序。当反复试验暴露出无状态、固定时长点击的局限性时,模型引入了显式的动作状态,并按住跳跃键直到障碍物通过。当游戏从白天模式切换到黑夜模式时,出现了进一步的挑战。由此产生的对比度反转,使得最初关于障碍物对应暗像素的假设失效。在从渲染帧中识别出这一变化后,Qwen-UI-Agent 用基于背景相对关系的分割替换了固定的颜色阈值,并利用障碍物几何特征来处理地面仙人掌和空中飞鸟。

最终得到的控制器存活了 60 秒,执行了 50 次跳跃,并达到了 156 分的可见最终得分。这个案例表明,在单条轨迹中,GUI 和 CLI 提供了不同但相互依赖的功能。GUI 提供感知证据和执行反馈,而 CLI 执行则将这些证据转化为可重复的感知和控制程序,无需在游戏的每一步都进行模型推理。通过反复从 GUI 观测转向基于 CLI 的修正,再回到

第 39 页

表12:在动作级强化学习训练前后,模型在五个错误模式专项测试集上的表现。

| 模型 | 易混淆元素定位 | 排序与排名 | 多目标完整性 | 过早终止 | 重复动作循环 | |——|—————-|————|————–|———-|————–| | 未使用动作级强化学习 | 72.8% | 76.6% | 80.0% | 81.0% | 72.9% | | 使用动作级强化学习 | 79.1% | 80.4% | 84.4% | 86.2% | 82.4% |

在 Mastodon 中,生成一个一天后过期、自动关注我且……

未使用动作级强化学习 使用动作级强化学习

点击 导航返回 点击 导航返回 点击 打开Chrome 点击 思考:尝试 思考:没有邀请链接, 思考:尝试 思考:没有邀请链接, 思考:尝试 思考:页面错误, 思考:尝试 思考:尝试邀请 思考:生成 分享图标 返回 分享图标 返回 分享图标 尝试网页服务器 设置图标 联系人图标 邀请链接

图18:动作级强化学习案例研究。监督微调模型导航到账户页面,反复点击分享图标后再返回,陷入无效的局部循环。相比之下,经过动作级强化学习训练的模型能够识别出当前处于错误页面,转而探索 Mastodon 的网页界面,找到正确的入口点,并成功配置了符合要求的目标邀请链接。

图形用户界面验证方面,Qwen-UI-Agent 构建了一个有效的控制器,无需对应用程序的特权访问。

4.3 动作级强化学习后的步骤级行为修正

整体表现与行为转变。我们进一步对动作级强化学习训练前后的模型行为进行了对比分析。动作级强化学习的主要效果不仅体现在总体任务成功率的提升,更在于对细粒度、步骤级错误动作决策的系统性修正。除了将整体任务成功率提高超过7%之外,动作级强化学习还将推理令牌数量减少了21.3%,同时将平均交互步数增加了8.4%。这些变化表明,更新后的策略减少了冗余推理,并更频繁地将其决策转化为基于环境的动作。更重要的是,性能提升伴随着明显的动作模式转变,其特征是反复出现的动作错误得到系统性修正,我们将在下文详细探讨。

对反复出现错误模式的修正。如表12所示,动作级强化学习在所有五个错误模式专项测试集上均持续提升了性能。在需要从视觉或语义相似的候选项中选出正确目标的定位任务上,动作级强化学习将成功率提高了6.3%。在排序与排名、数量与多目标完整性以及过早终止任务上,成功率也分别提高了3.8%、4.4%和5.2%。动作级强化学习在纠正短程动作循环方面的效果尤为显著。在涉及对多个目标进行重复操作或通过长滚动界面导航的任务中,动作级强化学习将成功率提高了9.5%。这一提升表明,模型识别近期动作未能产生任务相关状态变化并切换到替代动作的能力更强。图18展示了一个代表性示例,其中要求智能体在 Mastodon 中生成一个邀请链接。未使用动作级强化学习的模型反复与个人资料分享图标交互,最终达到步数限制。相比之下,使用动作级强化学习的模型

39

第 40 页

表 13:高频动作与长尾动作的性能对比。

| 动作组 | 原始数据占比 | 动作级强化学习前奖励 | 动作级强化学习后奖励 | | :— | :— | :— | :— | | 高频动作 | 80.1% | 88.3% | 92.3% | | 长尾动作 | 19.9% | 71.5% | 77.9% |

在新工作表“Sheet2”中创建每周销售额和销售成本的簇状柱形图,标题为“Sales & COGS”。

无在线强化学习

步骤 1 步骤 4 步骤 55 步骤 6

… …

Bash find WeeklySales.xlsx Bash python3 make_chart.py Bash python3 (脚本回读:已完成 & 读取销售额/销售成本数据 (openpyxl BarChart) “Sheet2 图表:1”)

注释:读取每周销售额和销售成本数据。 注释:使用 openpyxl 脚本创建图表。 注释:仅快速检查脚本(“1 个图表”),从未重新打开应用程序实际查看。 注释:未进行实际验证即结束。生成的图表为空 → 失败。

有在线强化学习

步骤 9 步骤 12 步骤 18 步骤 27

… … … …

reopen libreoffice –calc Bash python3 (openpyxl: Bash kill -9 soffice + 清除恢复条目 已完成 WeeklySales.xlsx → 簇状条形图,销售额 + 销售成本) 恢复对话框

注释:使用 openpyxl 创建图表(在完全关闭 LibreOffice 之后)。 注释:添加验证步骤:重新打开应用程序查看,发现一个残留的恢复对话框会破坏图表。 注释:修正:强制终止残留的 LibreOffice 进程并清除恢复条目,使图表得以保留。 注释:验证完整的簇状图(销售额与销售成本,2 个系列,覆盖第 1-10 周)已渲染 → 通过。

图 19:在线强化学习引发验证和自我修正。在相同任务上,在线强化学习策略(下图)成功,而 SFT 策略(上图)失败,因为前者重新打开应用程序检查实际结果,并在结束前修正了发现的问题。SFT 策略信任一个仅计算图表数量的表面脚本检查,从未查看渲染输出,并交付了一个没有数据系列的空图表;而强化学习策略重新打开文件进行验证,发现一个残留的应用程序实例会覆盖图表,将其移除使图表得以保留,并在终止前确认完整的簇状图确实已渲染。

识别出自己处于错误页面,探索通过 Mastodon 网页界面的替代路径,并到达用于配置邀请链接的正确界面。这个例子突显了步骤级动作强化学习的核心作用:当短序列动作未能取得有意义的进展时,自动构建的循环打破示例教会策略修正其即时动作选择,而不是坚持无效的模式。

改进的长尾动作处理。 图形用户界面动作轨迹呈现高度不平衡的分布。高频动作如点击、拖拽和输入占原始动作的 80.1%,而长尾动作如询问用户和长按仅占 19.9%。尽管频率低,这些动作对于到达特定应用状态或调用专用控件往往至关重要。Pass-N 展开显示,它们的奖励比高频动作低 16.8%,反映了它们在训练数据中的有限覆盖。因此,动作强化学习将训练数据中长尾动作示例的比例提高到约 40%,使其奖励提升了 6.4%。这些结果表明,动作强化学习可以选择性地加强低频但高影响力的动作决策。

第 41 页

请根据提供的文件夹中的近期交易更新我的记账表,详细列出过去几天的支出情况。

无在线强化学习

步骤 1 步骤 6 步骤 14 步骤 22 步骤 32

… … … … …

echo password Bash d -name Bash find ~ -type python3 … def ocr(image); | sudo -S Bash Type pyautogui.typewrite finished apt-get install -y tesseract-ocr '*transaction*' 2>/dev/null; find ~ – … print(ocr('receipt_2.jpg', 3)) … ('3670.00', interval=0.02) type d -name '*receipt*' 2>/dev/null; imagemagick

标注:定位记账文件和收据。 标注:安装 OCR 工具。 标注:仅对文本运行 OCR——从未打开收据图像查看,因此将“Cash Out”误读为收入而非支出,导致失败。 标注:输入 $3,670,但将其记为收入(本应为支出)。 标注:未验证条目即宣告成功。

有在线强化学习

步骤 1 步骤 26 步骤 27 步骤 36 步骤 42

… … … … …

find ~ -type d -name python3 … new_rows = Bash Bash python3 … print(r, Bash '*transaction*' 2>/dev/null; [ …('Bank of America Cash find click pyautogui.click(682, 45) click pyautogui.click(682, 45) ~ -type d -name '*receipt*' Withdrawal', 'Bank', 'Expense', – [ws.cell(row=r,column=c).value for c in range(1,6)]) … 2>/dev/null; 3670),… ]

标注:定位记账文件和收据。 标注:切换到浏览器(GUI)实际打开并查看收据图像——因此正确识别出这是一笔“Cash Out”取款,并将其记为支出。 标注:切换到浏览器(GUI)以视觉方式读取 receipt_2。 标注:使用 openpyxl 录入真实支出 -$3670。 标注:用 openpyxl 读回工作表以复核所记录的行。

图 20:在线强化学习引发跨模态动作涌现。在同一任务中,在线强化学习策略(下)成功,而 SFT 策略(上)失败,因为前者将其决策建立在视觉观察的基础上,并在结束前验证结果。SFT 策略仅从 OCR 文本读取收据,将 Cash Out 误认为收入,并在未检查的情况下宣告成功;而强化学习策略则打开收据图像进行视觉阅读,正确将其记为支出,并在终止前读回电子表格进行验证。

4.4 在线强化学习后的轨迹级行为转变

通过仔细比较不同领域中在线强化学习前后生成的轨迹,我们识别出三种理想行为模式的涌现。

从假定成功到验证完成。 在线强化学习之前,策略通常在执行最终状态变更动作后立即终止,假定任务已完成而未验证预期效果。在线强化学习之后,策略更频繁地在终止前检查结果状态,并在验证发现执行不完整时进行恢复。图 19 展示了一个代表性示例。在线强化学习之前,策略执行一系列 Bash 操作并在未检查其效果的情况下宣告完成。在线强化学习之后,策略最初遵循相同的基于 Bash 的路径,但增加了一个验证步骤,发现部分预期输出未生成,转而采用替代方法,最终成功完成任务。OSWorld 上的汇总结果显示了相同趋势:包含至少一个验证动作的轨迹比例增加了 14.7%,同时误停率——即自我宣告成功但最终验证失败的回合比例——下降了 11.2%。

Bash 为手,GUI 为眼:跨模态协作的涌现。 在线强化学习之后,策略从偏向 Bash 的策略转向更均衡地使用 Bash 和 GUI 动作:GUI 动作的占比增加了 6%,而同时使用 GUI 和 Bash 的轨迹比例增加了 10.6%。值得注意的是,尽管没有明确的模态协调目标,一种有用的跨模态协作模式涌现出来:策略使用 Bash 高效执行状态变更,并使用 GUI 检查其效果。与此模式一致,展现出

第 42 页

图21:在线强化学习改进了长程搜索与验证。未经过在线强化学习时,模型遵循了错误的实体关联,得出了不支持的答案“广州”。经过在线强化学习后,它识别出“海岩 → 《琅琊榜》 → 黄维德 → 成都”这一关键链条。

执行-验证转换——即一个改变状态的 Bash 动作后跟一个只读的图形界面检查——的比例从 40.2% 提升至 52.4%。图20展示了一个代表性示例。在在线强化学习之前,策略仅依赖 Bash 执行任务,由于缺乏视觉信息,无法区分收入与支出,从而在结果中引入错误。经过在线强化学习后,策略先用 Bash 高效执行,然后在图形界面中打开单个收据进行视觉检查,使其能够区分相关条目并正确完成任务。这种跨模态循环将高效执行与可靠反馈相结合,Bash 充当手,图形界面充当眼睛。

在长程中维持约束。长程任务通常会对主要目标施加额外约束,包括数量、格式、范围和排除项。比较在线强化学习前后的行为,我们发现策略在执行过程中能更可靠地保留指令中较早提出的约束。在这两个基准测试中,满足所有指令约束的任务比例在 OSWorld 上提升了 8.6%,在 BrowseComp-ZH 上提升了 7.5%。图21展示了一个包含四个约束的 BrowseComp-ZH 代表性示例。在此案例中,策略从仅满足一个约束并得出错误结论,转变为保留并联合应用所有四个约束,从而得出正确答案。

5 相关工作

近期关于图形用户界面智能体的研究,涵盖移动端使用、浏览器使用和计算机使用,越来越倾向于原生多模态策略,而非仅靠提示编排,并更多地利用自演化数据引擎、在线强化学习和结构化记忆(Seed, 2025; Zhou et al., 2025a; Gao et al., 2026; He et al., 2024; Wang et al., 2025b; Huang et al., 2026)。该领域也正从仅针对基准测试的优化,转向关注真实设备执行、隐私、操作可靠性、安全性和延迟等现实部署问题(Cao et al., 2026; Qin et al., 2025; Zhou et al., 2025a; Huang et al., 2026)。

移动端使用。近期的移动端智能体工作越来越多地超越了基于截图的动作预测——

第 43 页

向具备记忆、反思、强化学习与智能体 Harness 层的更强系统演进。Mobile-Agent-v3.5(Xu 等,2026)与 UI-Venus-1.5(Gao 等,2026)将统一的图形用户界面模型扩展到跨平台、多任务场景。Step-GUI(Yan 等,2025)与 UI-TARS-2(Wang 等,2025a)探索了数据飞轮与多轮强化学习,通过迭代交互提升智能体能力。MAI-UI(Zhou 等,2025a)探索了混合图形界面与 MCP 操作以及端云协同。Xiaomi-GUI-0(Cao 等,2026)研究了能捕捉状态动态的真实设备闭环训练。现有移动智能体评测主要关注三个方面:定位能力(如 ScreenSpot-Pro(Li 等,2025a))、受控环境中的交互式任务完成(如 AndroidWorld(Rawles 等,2024)),以及更贴近日常使用的场景,如 MobileWorld(Kong 等,2026)、AndroidDaily(Sui 等,2026)和 RealMobile(Cao 等,2026)。

浏览器使用。 与移动智能体相比,浏览器使用智能体还能利用 DOM 树、无障碍树和浏览器 API 等结构化信息。早期研究如 WebVoyager(He 等,2024)和 SeeAct(Zheng 等,2024)展示了多模态大语言模型通过结合视觉理解与浏览器操作,完成端到端网页导航的能力。近期项目如 OpenAI Operator(OpenAI,2025)、Google Project Mariner(Google,2025)和 UI-TARS(Seed,2025),进一步将网页智能体扩展到与复杂网站及多样化数字环境的自主交互。一些近期研究如 WebWorld(Xiao 等,2026)和 WebEvolver(Fang 等,2025)也探索了基于世界模型的网页智能体方法。网页智能体评测已从短程网页导航,演进到涉及多网站和复杂目标的真实长程工作流(Zhou 等,2024;Xue 等,2025;Jang 等,2026)。

计算机使用。 计算机使用智能体(CUA)旨在实现与桌面环境的通用交互,覆盖各类软件和生产力应用。与移动和网页智能体相比,CUA 面临显著更大的动作空间、更多样的交互状态和更长的任务周期,这使得可靠的定位与执行验证至关重要。近期工作包括 UI-TARS(Qin 等,2025)、DART-GUI(Li 等,2025b)、OpenCUA(Wang 等,2025b)、UltraCUA(Yang 等,2025b)、EvoCUA(Huang 等,2026),它们通过利用多模态预训练、大规模交互数据和智能体推理,研究可扩展的图形用户界面基础模型。近期的 CUA 基准测试越来越强调鲁棒性、可扩展性和真实部署挑战。OSWorld-Verified 通过更严格的验证协议和减少成功评估中的歧义,提高了评测可靠性(Xie 等,2024)。OSWorld-v2 进一步将评测扩展到更复杂、长周期的工作流和多样化的真实计算机任务(Yuan 等,2026)。

6 结论

我们提出了 Qwen-UI-Agent,一个以真实世界为中心的基础图形用户界面智能体。在“智能体运行于真实设备、跨平台维持工作流、结合图形界面交互与命令行执行、主动发起有用服务”这一愿景的指导下,Qwen-UI-Agent 集成了可扩展的沙箱环境与稳健的真实设备移动端运行时、统一的图形界面与命令行动作空间、智能体驱动的数据飞轮、结合 SFT、动作级强化学习和在线强化学习的训练框架,以及用于主动服务发起和跨平台任务执行的 Harness 层。实验表明,Qwen-UI-Agent 在 MobileWorld 上达到 82.1%,在 MobileWorld-Real 上达到 92.2%,在 AndroidDaily 上达到 97.5%。它还在 OSWorld-Verified 上达到 79.5%,在 OSWorld-v2 上达到 40.0%。Qwen-UI-Agent 在浏览器使用、DeepSearch 和图形界面定位方面也取得了领先或具有竞争力的表现,同时保持了强大的通用推理与智能体能力。这些结果共同支撑了一种图形用户界面智能体开发的系统观:模型、环境、数据飞轮、训练与 Harness 层围绕真实世界使用进行协同设计。

第 44 页

7 局限性与未来方向

局限性。首先,我们使用 AutoJudge 而非确定性验证器或人工专家检查来评估真实设备移动端轨迹。由于对第三方应用内部状态的访问受限,在实体手机上通常无法进行基于状态的确定性验证。同时,人工裁定 Qwen-UI-Agent 及十个基线的轨迹需要大量专家投入,并会引入标注者间差异。为确保一致比较,我们对所有系统应用相同的 AutoJudge 协议。在专家独立检查的 666 个样本上,AutoJudge 达到了 92.8% 的完全匹配准确率。尽管如此,其残余误差可能给报告的真实设备结果带来轻微不确定性。其次,在本技术报告发布时,35B-A3B 规模的 CUA 和 DeepSearch 训练仍在进行中,因此未包含相应结果。我们计划在结果可用后更新 arXiv 版本。第三,除本报告描述的真实设备环境外,更逼真地复现真实应用的高保真合成环境为缩小仿真到真实差距提供了另一条路径。我们已构建此类环境,但尚未将其训练整合到所报告的模型中,因此当前报告未呈现该部分。我们计划在未来工作中开源环境合成方法。第四,我们全自动化 GUI 能力开发的尝试表明,当前基础模型尚无法可靠地管理整个流程。因此,我们的流水线是智能体驱动而非完全自主的,仍需大量人工监督和干预以监控进度并纠正错误。

未来方向。我们讨论几个值得进一步研究的方向,以推动 GUI 智能体走向可靠且实用的现实世界应用。

高效 GUI 执行。GUI 智能体已能直接在真实设备上完成日益复杂的工作流,这标志着向实际应用迈出了令人鼓舞的一步。然而,仅有能力是不够的。执行效率,尤其是交互延迟,仍是实际应用的主要障碍。每个 GUI 步骤通常需要新的观察、模型推理和环境转换,导致延迟在长轨迹中累积。跨移动端和桌面系统的虚拟显示机制可通过支持后台或并行执行部分缓解此问题,但无法消除感知-推理-行动循环中每步的根本成本。因此,通过更快的推理、自适应观察、异步执行和更少的交互轮次来降低这一成本,对于将 GUI 智能体引入实际应用仍至关重要。

Harness 辅助的长程工作流。我们的混合 GUI+CLI 动作空间和对批处理动作的支持提升了执行效率,而在线强化学习则增强了长轨迹上的决策能力。一个互补的方向是进一步利用 harness 作为模型之外的长程支持来源。Harness 层在上下文压缩、任务分解、记忆管理、进度跟踪和结构化工具使用方面的设计,可从另一角度提升长程工作流的效率和可靠性。

大规模跨域在线强化学习。长程 GUI 任务使在线强化学习成本高昂,因为 rollout 缓慢且长度不一,而奖励往往稀疏或延迟。未来工作应为此类场景开发更高效、更稳定的训练策略,同时跨浏览器使用、移动端使用和计算机使用环境进行联合训练,以提高数据效率和跨域泛化能力(Wang et al., 2025a; Hou et al., 2026)。

高保真环境的可扩展合成。真实设备环境提供最忠实的交互动态,但在扩展、重置和验证方面成本高昂。高保真合成环境通过以可大规模生成和控制的形式近似真实世界应用行为,提供了一条互补路径。此类环境的可扩展合成对于缩小仿真到真实差距和扩展面向真实世界的训练至关重要。我们已构建此类环境,但遗憾的是,其与模型训练的整合未能及时完成以纳入本报告。

44

第 45 页

本报告将对此进行介绍。我们将在未来的工作中开源环境合成方法。

安全性、用户控制与个性化。随着图形用户界面智能体获得跨应用和设备操作的能力,确保其行为保持安全并受用户控制变得愈发重要。在本工作中,我们纳入了安全敏感的训练场景,教导模型在需要额外输入或授权时调用 call_user 动作并将控制权交还给用户。更系统化的安全评估、面向安全的训练目标,以及用于理解和约束智能体行为的基于可解释性的方法,仍然是重要的研究方向。个性化对于改善真实世界的用户体验同样至关重要。我们的主动服务 Harness 层提供了一个初步探索,但构建有用的用户记忆和画像、将其建立在可靠信息源之上,并赋予用户对保留哪些信息的控制权,都值得进一步研究。

8 贡献

核心贡献者

Hanzhang Zhou∗, Panrong Tong∗, Xu Zhang∗, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang†, Steven Hoi.

贡献者

Hongliang Lu, Miaoyi Zhou, Chen Liu, Yuchen Sun, Yucheng Zhao, Yiran Zhong, Jiahui Zeng, Minggang Wu, Zhixiang Ma, Shaoshun Huang, Shuaihao Zhang.

∗项目共同负责人。 †项目负责人。

45

第 46 页

参考文献

Anthropic. Introducing Claude Opus 4.8. https://www.anthropic.com/news/claude-opus-4-8, 2026年5月. 访问日期: 2026-07-19.

Apodex Team. Apodex-1.0: A verification-centric agent team for discoverative intelligence. 技术报告, Apodex, 2026. URL https://www.apodex.com/blog/apodex-1.0.

Victor Barres, Honghua Dong, Soham Ray, Xujie Si, and Karthik Narasimhan. τ2-Bench: Evaluating conversational agents in a dual-control environment. arXiv preprint arXiv:2506.07982, 2025. URL https://arxiv.org/abs/2506.07982.

ByteDance Seed. Seed2.0. https://seed.bytedance.com/en/seed2, 2026年2月a. 发布日期: 2026-02-14.

ByteDance Seed. Seed2.1 officially released: Advancing AI productivity. https://seed.bytedance.com/en/blog/seed2-1-officially-released-advancing-ai-productivity, 2026年6月b. 访问日期: 2026-07-19.

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, et al. Xiaomi-gui-0 technical report. arXiv preprint arXiv:2606.31410, 2026.

Liangyu Chen, Hanzhang Zhou, Chenglin Cai, Jianan Zhang, Panrong Tong, Quyu Kong, Xu Zhang, Chen Liu, Yuqi Liu, Wenxuan Wang, et al. Ui-ins: Enhancing gui grounding with multi-perspective instruction-as-reasoning. arXiv preprint arXiv:2510.20286, 2025.

Google DeepMind. Gemini 3 pro, 2025. URL https://deepmind.google/models/gemini/pro/.

DeepSeek-AI. DeepSeek-V3.2: Pushing the frontier of open large language models. arXiv preprint arXiv:2512.02556, 2025. URL https://arxiv.org/abs/2512.02556.

Tianqing Fang, Hongming Zhang, Zhisong Zhang, Kaixin Ma, Wenhao Yu, Haitao Mi, and Dong Yu. Webevolver: Enhancing web agent self-improvement with co-evolving world model. In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pp. 8970–8986, 2025.

Changlong Gao, Zhangxuan Gu, Yulin Liu, Xinyu Qiu, Shuheng Shen, Yue Wen, Tianyu Xia, Zhenyu Xu, Zhengwen Zeng, Beitong Zhou, Xingran Zhou, Weizhi Chen, Sunhao Dai, Jingya Dou, Yichen Gong, Yuan Guo, Zhenlin Guo, Feng Li, Qian Li, Jinzhen Lin, Yuqi Zhou, Linchao Zhu, Liang Chen, Zhenyu Guo, Changhua Meng, and Weiqiang Wang. UI-Venus-1.5 Technical Report. arXiv preprint arXiv:2602.09082, 2026. URL https://arxiv.org/abs/2602.09082.

Genymobile. scrcpy: Display and control your Android device. https://github.com/Genymobile/scrcpy, 2018. 访问日期: 2026-07-28.

Google. Project mariner. https://labs.google.com/mariner/landing/, 2025.

Google. Gemini 3.1 Pro Preview. https://ai.google.dev/gemini-api/docs/models/gemini-3.1-pro-preview, 2026年2月a. Google AI for Developers; 访问日期: 2026-07-19.

Google. Gemini 3.5 Flash. https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash, 2026年5月b. Google AI for Developers; 访问日期: 2026-07-19.

Hongliang He, Wenlin Yao, Kaixin Ma, Wenhao Yu, Yong Dai, Hongming Zhang, Zhenzhong Lan, and Dong Yu. Webvoyager: Building an end-to-end web agent with large multimodal models, 2024. URL https://arxiv.org/abs/2401.13919.

Zhenyu Hou, Yujiang Li, Jie Tang, and Yuxiao Dong. Single-rollout asynchronous optimization for agentic reinforcement learning. arXiv preprint arXiv:2607.07508, 2026.

46

第 47 页

徐浩,张曦,徐海洋,Kyle Qiao,杨静怡,黄萱菁,邵婧,严明,叶杰平。ToolCUA:面向计算机使用智能体的最优图形界面工具路径编排。arXiv 预印本 arXiv:2605.12481,2026。URL https://arxiv.org/abs/2605.12481。

黄绵秋,薛涛峰,彭冲,丁金瑞,范思成,洪佳乐,高宇飞,张晓晨,郭林森,杨鑫等。Evocua-1.5:面向多轮计算机使用智能体的在线强化学习。arXiv 预印本 arXiv:2607.09773,2026。

Lawrence Keunho Jang,Jing Yu Koh,Daniel Fried,Ruslan Salakhutdinov。Odysseys:在真实长程任务上评测网页智能体。arXiv 预印本 arXiv:2604.24964,2026。

Jina AI。Jina reader:将 URL 转换为大语言模型友好的输入。https://jina.ai/reader,2024。访问日期:2026-07-28。

Aniruddha Kembhavi,Mike Salvato,Eric Kolve,Minjoon Seo,Hannaneh Hajishirzi,Ali Farhadi。一图胜千言。载于《欧洲计算机视觉会议(ECCV)》,第 235–251 页,2016。URL https://arxiv.org/abs/1603.07396。

Kimi 团队。Kimi K2.5:视觉智能体智能。https://www.kimi.com/blog/kimi-k2-5.html,2026。访问日期:2026-07-21。

孔曲宇,张曦,杨振宇,Nolan Gao,刘晨,童攀荣,蔡成林,周翰章,张建安,陈良宇等。Mobileworld:在智能体-用户交互与 MCP 增强环境中评测自主移动智能体。载于《第64届计算语言学协会年会论文集(第一卷:长文)》,第 6142–6167 页,2026。

李晨昕,方政尧,唐正阳,吕鹏远,周兴然,赖鑫,唐飞,吴亮,郭一多,王伟农,李俊毅,张毅,丁洋,沈华文,范孙奇,彭尚品,阮铮,张安然,王本友,张成权,胡瀚。PhoneHarness:通过混合图形界面、命令行与工具动作驾驭手机使用智能体。arXiv 预印本 arXiv:2606.14832,2026a。URL https://arxiv.org/abs/2606.14832。

李凯欣,孟子阳,林宏展,罗子阳,田雨辰,马晶,黄志勇,蔡达成。Screenspot-pro:面向专业高分辨率计算机使用的图形界面定位。载于《大语言模型推理与规划研讨会》,2025a。URL https://openreview.net/forum?id=XaKNDIAHas。

李鹏翔,胡泽辰,尚子睿,吴静蓉,刘洋,刘辉,高志,石晨瑞,张博飞,张子豪,石晓川,于泽东,吴雨薇,吴心筱,贾云得,项刘宇,何兆峰,李青。通过解耦训练与自适应数据筛选实现图形界面智能体的高效多轮强化学习。arXiv 预印本 arXiv:2509.23866,2025b。

李湘怡,陈文博,刘一民,郑胜涵,陈晓坤,何一峰,李玉波,游炳然,沈浩天,孙建凯等。SkillsBench:评测智能体技能在不同任务中的泛化能力。arXiv 预印本 arXiv:2602.12670,2026b。URL https://arxiv.org/abs/2602.12670。

连牛,Alan Chen,于哲浩,段成真,刘发展,刘辉,付培,栾剑,王耀威,夏树涛,王金鹏。UI-MOPD:面向持续图形界面智能体学习的多平台同策略蒸馏。arXiv 预印本 arXiv:2607.04425,2026。URL https://arxiv.org/abs/2607.04425。

刘晨,陈玲,周翰章,陈良宇,蔡成林,于鑫,Steven Hoi,王悦。一次前向优于两次:面向精确高效图形界面定位的 Innerzoom,2026。URL https://arxiv.org/abs/2606.30084。

47

第 48 页

Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, 等. Terminal-Bench: 在命令行界面中对智能体进行困难、现实任务的基准测试. arXiv 预印本 arXiv:2601.11868, 2026. URL https://arxiv.org/abs/2601.11868.

Microsoft. Playwright: 快速可靠的现代 Web 应用端到端测试. https://playwright.dev, 2020. 访问日期: 2026-07-28.

MiniMax. MiniMax M3: 前沿编程能力、百万级上下文、原生多模态. https://www.minimax.io/blog/minimax-m3, 2026年6月. 访问日期: 2026-07-19.

Moonshot AI. Kimi K2.6: 推进开源编程. https://www.kimi.com/blog/kimi-k2-6, 2026年4月. 访问日期: 2026-07-19.

Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Juan A. Rodriguez, Montek Kalsi, Rabiul Awal, Nicolas Chapados, M. Tamer Özsu, Aishwarya Agrawal, David Vazquez, Christopher Pal, Perouz Taslakian, Spandana Gella, 和 Sai Rajeswar. Ui-vision: 一个以桌面为中心的视觉感知与交互图形界面基准, 2025. URL https://arxiv.org/abs/2503.15661.

OpenAI. 推出 operator. https://openai.com/index/introducing-operator/, 2025.

OpenAI. GPT-5.5 系统卡. https://deploymentsafety.openai.com/gpt-5-5, 2026年4月a. 访问日期: 2026-07-19.

OpenAI. GPT-5.6: 随你的雄心而扩展的前沿智能. https://openai.com/index/gpt-5-6/, 2026年7月b. 访问日期: 2026-07-20.

OpenClaw 贡献者. OpenClaw: 个人 AI 助手. GitHub 仓库, 2026. URL https://github.com/openclaw/openclaw. 访问日期: 2026-07-20.

Shishir G. Patil, Huanzhi Mao, Fanjia Yan, Charlie Cheng-Jie Ji, Vishnu Suresh, Ion Stoica, 和 Joseph E. Gonzalez. 伯克利函数调用排行榜 (BFCL): 从工具使用到大型语言模型的智能体评估. 收录于第42届国际机器学习大会 (ICML) 论文集, 2025. BFCL-v4 排行榜: https://gorilla.cs.berkeley.edu/leaderboard.html.

Yujia Qin, Yining Ye, Junjie Fang, Haoming Wang, Shihao Liang, Shizuo Tian, Junda Zhang, Jiahao Li, Yunxin Li, Shijue Huang, 等. Ui-tars: 用原生智能体开创自动化图形界面交互. arXiv 预印本 arXiv:2501.12326, 2025.

Qwen 团队. Qwen3.7-Plus: 多模态智能体智能. https://qwen.ai/blog?id=qwen3.7-plus, 2026年5月a. 访问日期: 2026-07-19.

Qwen 团队. Qwen3.5: 迈向原生多模态智能体, 2026年2月b. URL https://qwen.ai/blog?id=qwen3.5.

Qwen 团队与阿里巴巴集团数据团队. QwenClawBench: 面向 OpenClaw 智能体的真实用户分布基准. https://github.com/SKYLENAGE-AI/QwenClawBench, 2026年4月. 访问日期: 2026-07-24.

Christopher Rawles, Sarah Clinckemaillie, Yifan Chang, Jonathan Waltz, Gabrielle Lau, Marybeth Fair, Alice Li, William Bishop, Wei Li, Folawiyo Campbell-Ajala, Daniel Toyama, Robert Berry, Divya Tyamagundlu, Timothy Lillicrap, 和 Oriana Riva. Androidworld: 一个面向自主智能体的动态基准测试环境, 2024. URL https://arxiv.org/abs/2405.14573.

Remote Android Project. Redroid: 一种多架构、支持 GPU 的云容器安卓解决方案. https://github.com/remote-android/redroid-doc, 2024.

48

第 49 页

ByteDance Seed. Ui-tars-1.5. https://seed-tars.com/1.5, 2025.

Serper. Serper: Google search API. https://serper.dev, 2023. 访问日期:2026-07-28.

Huawen Shen, Zhengyang Tang, Shangpin Peng, Liang Wu, Anran Zhang, Weinong Wang, Yiduo Guo, Chenxin Li, Zhengyao Fang, Yang Ding, Junyi Li, Fei Tang, Zheng Ruan, Yi Zhang, Xingran Zhou, Dingchen Yang, Sunqi Fan, Zhiyi Wan, Han Hu, Xin Lai, Pengyuan Lyu, and Chengquan Zhang. HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents. arXiv preprint arXiv:2607.14548, 2026. URL https://arxiv.org/abs/2607.14548.

Yifan Sui, Xin Huang, Hongbing Li, Fang Xu, Jiahe Lv, Haolong Yan, Yeqing Shen, Litao Liu, Zhimin Fan, Ziyang Meng, et al. Androiddaily: A verifiable benchmark for mobile gui agents on real-world closed-source applications. arXiv preprint arXiv:2605.27761, 2026.

Zhengyang Tang, Xin Lai, Pengyuan Lyu, Xinyuan Wang, Tianyi Bai, Chenxin Li, Yiduo Guo, Huawen Shen, Yuxuan Liu, Junyi Li, Zhengyao Fang, Yang Ding, Yi Zhang, Weinong Wang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Ji-Rong Wen, Rui Yan, Chengquan Zhang, and Han Hu. Phonebuddy: Training open models for agentic phone use, 2026. URL https://arxiv.org/abs/2606.23049.

Tongyi DeepResearch. Tongyi DeepResearch technical report. arXiv preprint arXiv:2510.24701, 2025. URL https://arxiv.org/abs/2510.24701.

Bowen Wang, Dunjie Lu, Junli Wang, Tianyi Bai, Shixuan Liu, Zhipeng Zhang, Haiquan Wang, Hao Hu, Tianbao Xie, Shuai Bai, Dayiheng Liu, Que Shen, Junyang Lin, and Tao Yu. CUA-GYM: Scaling verifiable training environments and tasks for computer-use agents. arXiv preprint arXiv:2605.25624, 2026. URL https://arxiv.org/abs/2605.25624.

Haoming Wang, Haoyang Zou, Huatong Song, Jiazhan Feng, Junjie Fang, Junting Lu, Longxiang Liu, Qinyu Luo, Shihao Liang, Shijue Huang, et al. Ui-tars-2 technical report: Advancing gui agent with multi-turn reinforcement learning. arXiv preprint arXiv:2509.02544, 2025a.

Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li. Measuring multimodal mathematical reasoning with MATH-Vision dataset. arXiv preprint arXiv:2402.14804, 2024a. URL https://arxiv.org/abs/2402.14804.

Xinyuan Wang, Bowen Wang, Dunjie Lu, Junlin Yang, Tianbao Xie, Junli Wang, Jiaqi Deng, Xiaole Guo, Yiheng Xu, Chen Henry Wu, Zhennan Shen, Zhuokai Li, Ryan Li, Xiaochuan Li, Junda Chen, Boyuan Zheng, Peihang Li, Fangyu Lei, Ruisheng Cao, Yeqiao Fu, Dongchan Shin, Martin Shin, Jiarui Hu, Yuyan Wang, Jixuan Chen, Yuxiao Ye, Danyang Zhang, Dikang Du, Hao Hu, Huarong Chen, Zaida Zhou, Haotian Yao, Ziwei Chen, Qizheng Gu, Yipu Wang, Heng Wang, Diyi Yang, Victor Zhong, Flood Sung, Y. Charles, Zhilin Yang, and Tao Yu. Opencua: Open foundations for computer-use agents, 2025b. URL https://arxiv.org/abs/2508.09123.

Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni, Abhranil Chandra, Shiguang Guo, Weiming Ren, Aaran Arulraj, Xuan He, Ziyan Jiang, et al. MMLU-Pro: A more robust and challenging multi-task language understanding benchmark. arXiv preprint arXiv:2406.01574, 2024b. URL https://arxiv.org/abs/2406.01574.

Zirui Wang, Mengzhou Xia, Luxi He, Howard Chen, Yitao Liu, Richard Zhu, Kaiqu Liang, Xindi Wu, Haotian Liu, Sadhika Malladi, Alexis Chevalier, Sanjeev Arora, and Danqi Chen. CharXiv: Charting gaps in realistic chart understanding in multimodal LLMs. arXiv preprint arXiv:2406.18521, 2024c. URL https://arxiv.org/abs/2406.18521.

49

第 50 页

Jason Wei, Zhiqing Sun, Spencer Papay, Scott McKinney, Jeffrey Han, Isa Fulford, Hyung Won Chung, Alex Tachard Passos, William Fedus, and Amelia Glaese. BrowseComp: A simple yet challenging benchmark for browsing agents. arXiv preprint arXiv:2504.12516, 2025. URL https://arxiv.org/abs/2504.12516.

Zhiyong Wu, Zhenyu Wu, Fangzhi Xu, Yian Wang, Qiushi Sun, Chengyou Jia, Kanzhi Cheng, Zichen Ding, Liheng Chen, Paul Pu Liang, and Yu Qiao. Os-atlas: A foundation action model for generalist gui agents, 2024. URL https://arxiv.org/abs/2410.23218.

xAI. Grok-1.5 vision preview. https://x.ai/news/grok-1.5v, 2024. RealWorldQA benchmark released alongside the blog post; dataset at https://huggingface.co/datasets/xai-org/RealworldQA.

Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen Yu, Fei Huang, Junyang Lin, and Zuozhu Liu. Webworld: A large-scale world model for web agent training. arXiv preprint arXiv:2602.14721, 2026.

Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, and Tao Yu. Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024.

Tianbao Xie, Jiaqi Deng, Xiaochuan Li, Junlin Yang, Haoyuan Wu, Jixuan Chen, Wenjing Hu, Xinyuan Wang, Yuhui Xu, Zekun Wang, Yiheng Xu, Junli Wang, Doyen Sahoo, Tao Yu, and Caiming Xiong. Scaling computer-use grounding via user interface decomposition and synthesis, 2025. URL https://arxiv.org/abs/2505.13227.

Haiyang Xu, Xi Zhang, Haowei Liu, Junyang Wang, Zhaozai Zhu, Shengjie Zhou, Xuhao Hu, Feiyu Gao, Junjie Cao, Zihua Wang, Zhiyuan Chen, Jitong Liao, Qi Zheng, Jiahui Zeng, Ze Xu, Shuai Bai, Junyang Lin, Jingren Zhou, and Ming Yan. Mobile-agent-v3.5: Multi-platform fundamental gui agents. arXiv preprint arXiv:2602.16855, 2026.

Tianci Xue, Weijian Qi, Tianneng Shi, Chan Hee Song, Boyu Gou, Dawn Song, Huan Sun, and Yu Su. An illusion of progress? assessing the current state of web agents. arXiv preprint arXiv:2504.01382, 2025.

JingJing Xie Xuehui Wang, Zhenyu Wu et al. Mmbench-gui: Hierarchical multi-platform evaluation framework for gui agents. arXiv preprint arXiv:2507.19478, 2025.

Haolong Yan, Jia Wang, Xin Huang, Yeqing Shen, Ziyang Meng, Zhimin Fan, Kaijun Tan, Jin Gao, Lieyu Shi, Mi Yang, et al. Step-gui technical report. arXiv preprint arXiv:2512.15431, 2025.

Yan Yang, Dongxu Li, Yutong Dai, Yuhao Yang, Ziyang Luo, Zirui Zhao, Zhiyuan Hu, Junzhe Huang, Amrita Saha, Zeyuan Chen, Ran Xu, Liyuan Pan, Caiming Xiong, and Junnan Li. Gta1: Gui test-time scaling agent, 2025a. URL https://arxiv.org/abs/2507.05791.

Yuhao Yang, Zhen Yang, Zi-Yi Dou, Anh Nguyen, Keen You, Omar Attia, Andrew Szot, Michael Feng, Ram Ramrakhya, Alexander Toshev, et al. Ultracua: A foundation model for computer use agents with hybrid action. arXiv preprint arXiv:2510.17790, 2025b.

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, and Tong Yang. Claw-Eval: Towards trustworthy evaluation of autonomous agents. arXiv preprint arXiv:2604.06132, 2026. URL https://arxiv.org/abs/2604.06132.

Mengqi Yuan, Zilong Zhou, Xinzhuang Xiong, Weiming Wu, Jiayang Sun, Jiamin Song, Kaiqian Cui, Bowen Wang, Haoyuan Wu, Yitong Li, Dunjie Lu, Haikong Lu, Qi Zhen, Xinyuan Wang, Jiaqi Deng, Yuhao Yang, Cheng Chen, Boyuan Zheng, Alex Su, Xiao Yu, Hao Zou, Saaket Agashe, Xing Han Lu, Manpreet Kaur, Zhengyang Qi, Vincent Sunn Chen, Frederic Sala, Dayiheng Liu, Junyang Lin, Zhou

50

第 51 页

Yu, Yu Su, Siva Reddy, Xin Eric Wang, Peng Qi, Tianbao Xie, and Tao Yu. Osworld 2.0: Benchmarking computer use agents on long-horizon real-world tasks. arXiv preprint arXiv:2606.29537, 2026.

Xiang Yue, Tianyu Zheng, Yuansheng Ni, Yubo Wang, Kai Zhang, Shengbang Tong, Yuxuan Sun, Botao Yu, Ge Zhang, Huan Sun, Yu Su, Wenhu Chen, and Graham Neubig. MMMU-Pro: A more robust multi-discipline multimodal understanding benchmark. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 15134–15186, 2025. URL https://arxiv.org/abs/2409.02813.

Z.ai. GLM-4.7: Advancing the coding capability. Z.ai Technical Blog, December 2025. URL https://z.ai/blog/glm-4.7. Released: 2025-12-22; accessed: 2026-07-28.

Boyuan Zheng, Boyu Gou, Jihyung Kil, Huan Sun, and Yu Su. Gpt-4v (ision) is a generalist web agent, if grounded. arXiv preprint arXiv:2401.01614, 2024.

Hanzhang Zhou, Xu Zhang, Panrong Tong, Jianan Zhang, Liangyu Chen, Quyu Kong, Chenglin Cai, Chen Liu, Yue Wang, Jingren Zhou, and Steven Hoi. MAI-UI Technical Report: Real-World Centric Foundation GUI Agents. arXiv preprint arXiv:2512.22047, 2025a. URL https://arxiv.org/abs/2512.22047.

Jeffrey Zhou, Tianjian Lu, Swaroop Mishra, Siddhartha Brahma, Sujoy Basu, Yi Luan, Denny Zhou, and Le Hou. Instruction-following evaluation for large language models. arXiv preprint arXiv:2311.07911, 2023. URL https://arxiv.org/abs/2311.07911.

Peilin Zhou, Bruce Leon, Xiang Ying, Can Zhang, Yifan Shao, Qichen Ye, Dading Chong, Zhiling Jin, Chenxuan Xie, Meng Cao, Yuxin Gu, Sixin Hong, Jing Ren, Jian Chen, Chao Liu, and Yining Hua. BrowseComp-ZH: Benchmarking web browsing ability of large language models in Chinese. arXiv preprint arXiv:2504.19314, 2025b. URL https://arxiv.org/abs/2504.19314.

Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig. Webarena: A realistic web environment for building autonomous agents. In The Twelfth International Conference on Learning Representations, 2024. URL https://arxiv.org/abs/2307.13854.

51

第 52 页

A 附录

A.1 验证 AutoJudge 用于真实设备评估

与沙箱基准不同,真实设备任务通常无法依赖确定性的、基于状态的验证器。第三方应用不会暴露其内部状态,而任务结果可能取决于变化的在线内容、账户状态或跨多个应用的交互。人工审查每条轨迹也难以规模化,并可能引入标注者之间的差异。因此,在将 AutoJudge 用于大规模真实设备评估之前,我们将其与独立的人工标注进行对比验证。

表 14:AutoJudge 与独立人工标注之间的一致性。行表示 AutoJudge 的判定,列表示人工标注。pass 对应于合并的 perfect/fair_enough 类别。一致性在排除标记为 unclear 的人工标注后计算。

| 人工标注 | | | | | | — | — | — | — | — | | AutoJudge 判定 | Pass | Unclear | failure | error | 一致率 | | pass | 455 | 17 | 1 | 1 | 96.2% | | failed | 15 | 144 | 9 | 1 | 85.7% | | env_error | 1 | 5 | 19 | 0 | 76.0% | | 总体 | 666 个有结论性标签的案例中 618 个一致 | | | | 92.8% |

表 14 报告了对比结果。在 666 条具有结论性人工标签的轨迹中,AutoJudge 与人工标注在 618 条上一致,总体一致率为 92.8%。对于成功轨迹,一致率达到 96.2%。模型失败和环境错误更难区分,因为相似的观察结果可能源于错误的智能体动作,也可能源于实时执行环境的问题。

我们进一步请专家评审员检查 AutoJudge 与初始人工标注不一致的案例。专家裁决更倾向于支持 AutoJudge 的判定,表明上述报告的一致率是对其准确性的保守估计。基于此验证,我们使用 AutoJudge 作为真实设备实验的主要评估器。它提供了一种更准确且可扩展的评估协议,同时能分别识别模型失败和由实时环境引起的错误。

A.2 AutoJudge 对真实设备图形用户界面智能体轨迹的判定

图 22–24 展示了三种 AutoJudge 结果的代表性示例。每个示例包含原始中文任务及其英文翻译、选定的轨迹步骤(动作渲染在截图上)以及用于最终判定的证据。这些示例说明了 AutoJudge 如何区分成功执行、模型失败以及由实时执行环境引起的错误。

52

第 53 页

图22:具有代表性的AutoJudge通过判定。轨迹证据表明,智能体成功完成了所请求的任务。

通过 查询(中文):在酷我音乐打开种树赚钱,签到领取水滴,然后去浇水

AutoJudge证据:奖励已领取,水量余额从500克变为490克。 1 2 3 4 5 6 7 8

点击 点击 点击 点击 点击 点击

打开应用 终止

酷我音乐 赚钱标签页 关闭弹窗 打开种树 领取奖励 接受奖励 浇水 终止

通过 查询(中文):在迅雷中打开迅雷论坛,找到热门版块里的迅雷11,查看精选讨论内容详情,并给这条帖子点赞

AutoJudge证据:目标帖子已打开,其点赞数从15增加到16。 1 2 3 4 5 6 7 8

输入 点击“迅雷论坛” 点击 点击 … 点击 点击 点击

终止

关闭广告 搜索框 输入查询 论坛结果 迅雷11 精选帖子 点赞 终止

图23:具有代表性的AutoJudge模型失败判定。智能体遵循了错误或不完整的执行路径,未满足任务要求。

模型失败 查询(中文):在朴朴超市的朴朴直播中,统计橱窗好物中的明星爆品,将价格低于10元且有货的商品加入购物车,收藏最贵的商品

AutoJudge证据:反复点击94.53元的龙虾打开了不相关的商品;所需的加购和收藏操作仍未完成。 1 2 3 4 5 6 7 8

点击 点击

点击 … 点击 点击 点击 点击

等待

打开橱窗 添加低价商品 选择龙虾 错误:面包 重试龙虾 错误:榴莲 重试龙虾 错误:抹茶蛋糕

模型失败 查询(中文):发布一条朋友圈,内容为今天天气不错,配图从相册选择第一张。发布后,立即进入该朋友圈详情,点击权限,部分可见,最后选择仅自己可见

AutoJudge证据:帖子已发布,但重复了相同的错误路径,且可见性从未更改。 1 2 3 4 5 6 7 8

点击 点击 输入“今天天气不错”

点击 点击 点击 点击

编辑器 相册 第一张照片 确认 输入文案 发布 重试菜单 重复点击

A.3 更多定性示例

第 54 页

环境错误

查询(中文):在米家产品中,查看小米品牌的影音娱乐产品,统计推荐的前10个产品的评价量和价格,将评价量高于50的产品中价格最贵的分享到微博

AutoJudge 证据:在多次有效尝试后,均出现相同的数据加载错误(代码 -1)。 1 2 3 4 5 6 7 8

点击 “影音娱乐”输入 点击

点击 … 点击 点击 点击

终止

商店 搜索栏 输入品类 运行搜索 打开商品 代码 -1 重试商品 代码 -1

环境错误

查询(中文):在网上国网的公益专区中,统计国网共产党员服务队志愿行动前十个行动资讯的阅读量和收藏量,收藏阅读量最高的,分享收藏量最高的给QQ好友

AutoJudge 证据:搜索反复出现空白屏幕,并将应用返回至启动器。 1 2 3 4 5 6 7 8

点击 点击

点击 点击 …

点击

等待 等待 终止

启动应用 点击搜索 空白屏幕 重新启动 资讯标签页 重试搜索 空白屏幕 终止

图24:具有代表性的 AutoJudge 环境错误判定。 轨迹中断是由实时应用或执行环境问题导致的,而非智能体动作所致。

图25:长时程真实设备图形界面执行演示。 轨迹以关键帧形式呈现,每帧下方标注了已执行的动作。在这个包含23步的购物任务中,智能体将指令分解为顺序子目标:它首先清空淘宝购物车,然后在1000元预算内从小米旗舰店选择智能音箱、智能插座和智能灯泡,全程维持预算约束和物品清单。

第 55 页

图 26:计算机使用任务中混合图形界面与命令行动作空间的执行演示。在此示例中,智能体使用命令行工具检查电子表格内容,并穿插图形界面动作(包括批处理快捷键序列和选择性粘贴),将格式化数据转移到 Writer 文档中。

首先,打开抖音并找到一个讨论循证减肥的视频,然后识别其主要观点。搜索相关研究论文、官方来源和权威健康信息,以判断该视频是否包含任何虚假或误导性陈述,或遗漏了重要条件和注意事项。完成验证后,返回抖音。如果视频包含虚假或误导性信息,撰写一条评论,指出具体问题并简要解释支持证据。如果内容基本准确,撰写一条评论,认可其主要观点,同时补充任何必要的条件或注意事项。

打开 点击 输入 点击 滚动 等待(抖音)

等待

搜索 摘要 点击 点击 输入 关键词:中国膳食指南 关键词:低糖水果分类 摘要:基于收集到的 水果按总糖量分类 来自膳食指南的八项关键建议 分类 科学证据,视频中的大部分减肥 苹果:每个中等苹果约含 10–19 克糖 来自《中国居民膳食指南(2022)》的八项关键建议 6. 保持 建议大致准确,包括饮用足够 梨:每个中等梨约含 10–17 克糖。(青苹果的糖分通常低于红苹果)。 规律饮食并饮用足够的水。三餐…… 的水、细嚼慢咽、优先选择 蔬菜和蛋白质、保持规律 睡眠以及控制总热量摄入。 完成 N 轮 N 轮 然而,有几项说法 https://en.chinacdc.cn/health_topics/ 搜索 https://www.facebook.com/groups/cajunfrench/ 搜索 水果不需要 需要纠正。 膳食指南…… 哪些水果含糖量最少?…… 只在早上吃,苹果 膳食指南。中国膳食指南 干苹果(40 克)、枣(33 克)和葡萄干(29 克) 并非真正的低糖水果,不吃早餐 不会自动减缓 是(2022 年)。日期:2022 年膳食参考摄入量。 是每 100 克中含糖量最高的水果之一。 不会自动减缓新陈代谢,靠墙站立 https://www.canadianliving.com/health-fitness/ 《中国膳食参考摄入量(2023 年)》。日期: 没有经证实的减肥益处。 nutrition/article/which-fruits-have-the-least- 2023-10-20。 总体而言,该视频基本可靠,但 amount-of-sugar https://en.cnsoc.org/dGuideline/ 包含几处误导性或 缺乏依据的细节,应予以

图 27:图形界面执行过程中按需调用 DeepSearch 的演示。Qwen-UI-Agent 首先定位一个关于循证减肥的抖音视频,并通过图形界面动作提取其主要观点,然后在轨迹中途调用 DeepSearch,依据研究论文和权威健康来源验证这些观点,提供界面本身无法提供的外部证据。验证结论直接决定后续的图形界面动作,智能体返回抖音发布一条有据可依的评论,完成“观察—研究—决策—行动”的闭环。

55

第 56 页

主动服务:在 08:00,Harness 层将用户的早晨日程与实时天气和通勤状况相结合。在用户询问之前,它会比较公共交通和出租车选项,并提供一个包含雨伞建议、出发时间和关键提醒的可操作简报。

主动任务启动 主动执行阶段 #1 主动执行阶段 #2 决策就绪结果 天气检索 推理与导航

早晨日程

… click-icon.png

完成

计划触发 滑动 打开应用 点击 输入 点击 点击 完成 早晨可操作简报 已激活

图 28:基于移动通知的主动服务演示。轨迹按高亮阶段组织:从检测到的通知启动主动任务、主动执行阶段以及决策就绪结果,每个关键帧下方标注了执行的动作。一个计划中的早晨简报:在 08:00,Harness 层将用户的早晨日程与实时天气和通勤状况相结合,在用户询问之前比较公共交通和出租车选项,并提供一个包含雨伞建议、出发时间和关键提醒的可操作简报。

跨平台服务:在相册中定位并整理收据图像,将它们传输到指定的 PC 目录,并根据收据详情生成一份汇总的费用报告。

移动端 移动端(虚拟屏幕) 电脑端

混合图形界面与命令行动作空间 电脑使用

分享

不阻塞用户操作。 打开相册,定位与收据相关的图像,查看其详情,并通过 NotifAgent 将其位置发送给智能体。 将图像复制到 PC 上的指定目录,然后提取并汇总收据详情到一份汇总费用电子表格中。

图 29:跨平台任务执行演示。在此工作流中,移动端子任务在物理设备的虚拟屏幕上运行,因此执行不会阻塞用户自身的操作。跨设备收据整理:智能体在移动虚拟屏幕的相册中定位收据图像,将它们传输到指定的 PC 目录,并使用混合图形界面与命令行动作空间的电脑使用功能,将收据详情汇总到一份汇总费用电子表格中。

56

发表评论