UniVR:在视觉空间中进行统一视觉推理的思考

三分钟导读:本文提出UniVR,一种无需密集文本监督、直接在视觉空间中进行复杂推理和长期规划的统一框架,通过引入VR-GRPO强化学习范式(包含全局和步骤聚焦奖励)及VR-X基准,显著提升了视觉推理的物理一致性和逻辑连贯性。

英文题目:UniVR: Thinking in Visual Space for Unified Visual Reasoning

论文出处:arXiv 每日论文精选 · arXiv:2607.12800

原始论文:PDF / 论文页面

对应视频标题:UniVR:在视觉空间中进行统一视觉推理的思考|推荐指数:★★★★★

这篇论文解决什么问题?

现有AI模型主要依赖文本空间进行推理,难以捕捉真实世界中的复杂动态、空间关系和物理定律;现有的视觉推理方法要么依赖文本中介导致物理一致性差,要么依赖密集的图文对训练,限制了视觉推理能力的扩展。

核心创新

  • 首次探索在统一视觉空间中直接学习异构任务(从长期规划到一般认知推理),无需语言监督。
  • 提出VR-GRPO强化学习范式,引入新颖的Step-Focal奖励机制,主动针对易错推理子步骤进行精细评估,解决长程推理中的局部不一致问题。
  • 构建VR-X基准,涵盖长程规划、空间感知、编辑等多样化任务,提供纯视觉协议下的综合评估。

方法概览

提出UniVR框架,基于Emu3.5基座模型,采用两阶段训练:1) 冷启动阶段(Cold-Start):在多样化的视觉任务数据上进行监督微调(SFT),建立视觉推理先验;2) 强化学习阶段(VR-GRPO):设计包含全局奖励(Global Reward)和步骤聚焦奖励(Step-Focal Reward)的VR-GRPO算法,通过CLIP特征方差识别高不确定性步骤,确保推理轨迹的逻辑连贯性和物理一致性。

逐图理解论文

UniVR框架概述

UniVR框架概述
Figure 2 Overview of UniVR architecture. Via a unified next-token prediction objective, UniVR processes instructions and image queries to directly generate visual reasoning traces for task execution.

本文提出UniVR框架,基于Emu3.5基座模型,旨在直接在视觉空间中进行复杂推理和长期规划。UniVR通过统一的下一个Token预测目标,处理指令和图像查询,直接生成视觉推理轨迹以执行任务。这种原生视觉推理方式,旨在建立对真实视觉世界的更深刻理解,从而改善各种场景下的策略学习。

两阶段训练策略

两阶段训练策略
Figure 3 The proposed Visual Reasoning GRPO. (up) VR-GRPO integrates global and step-focal rewards to ensure both task completion and the physical coherence of generated reasoning traces. (down) Failure case of global rewards that overlook local inconsistencies within long reasoning traces.

UniVR采用两阶段训练策略。第一阶段是冷启动阶段,在多样化的视觉任务数据上进行监督微调,建立视觉推理先验。第二阶段是强化学习阶段,引入VR-GRPO范式。该范式包含全局奖励和步骤聚焦奖励,通过CLIP特征方差识别高不确定性步骤,确保推理轨迹的逻辑连贯性和物理一致性。

VR-GRPO创新点

VR-GRPO创新点
Figure 6 Analysis of the Visual Reasoning Reward. (Up) Relying solely on the global reward misses step-level errors in long-horizon planning tasks, e.g. hangers penetrating garments (top row), erroneous liquid pouring dynamics (middle row), and jittering transitions between paper towels (bottom row). (Down) RL reward curves with and without

VR-GRPO是本文的核心创新之一。它首次探索在统一视觉空间中直接学习异构任务,无需语言监督。通过引入Step-Focal奖励机制,模型能主动针对易错推理子步骤进行精细评估,解决长程推理中的局部不一致问题。例如,仅依赖全局奖励会忽略长推理轨迹中的局部错误,如衣架穿透衣物或液体倾倒动力学错误。

VR-X基准构建

VR-X基准构建
Figure 4 Overview of VR-X benchmark.

为了全面评估视觉推理能力,本文构建了VR-X基准。该基准涵盖长程规划、空间感知、编辑等多样化任务,提供纯视觉协议下的综合评估。VR-X基准的引入,填补了现有基准在纯视觉推理评估方面的空白,为模型在视觉空间中的推理能力提供了更准确的衡量标准。

VR-X基准实验结果

VR-X基准实验结果
Table 1 Comparison on VR-X. Qwen, Gemini 2.5/3, and GPT-5 are paired with Qwen-image-edit, Nano Banana 1/2, and GPT-image-1.5, respectively.

在VR-X基准上,UniVR相比基座Emu3.5整体提升20.9%,长程规划任务提升25.2%,JEPA相似度得分降低20.61%,表示物理一致性更好。在34B参数规模下,UniVR在长程规划任务上超越Gemini 3 Pro,并接近Gemini 3 Pro加Nano Banana 2组合的性能。

实验与关键结果

  • 在VR-X基准上与大型多模态模型(LMMs)结合文本到图像模型(如Gemini+Nano Banana)及统一生成模型(如Emu3.5)进行对比。
  • 在MMMU、MME、MMBench等通用多模态理解基准上评估UniVR对基础模型能力的提升。
  • 进行消融实验,分析VR-GRPO中各奖励组件、训练数据组合及文本奖励兼容性的影响。
  • 在WorldArena、Uni-MMMU、RBench等外部基准上评估模型的泛化能力。
  • 在VR-X基准上,UniVR相比基座Emu3.5整体提升20.9%,长程规划任务提升25.2%,JEPA相似度得分降低20.61%(表示物理一致性更好)。(第 8 页)
  • 在34B参数规模下,UniVR在长程规划任务上超越Gemini 3 Pro,并接近Gemini 3 Pro + Nano Banana 2组合的性能。(第 3 页)
  • 在MMMU基准上,UniVR相比Emu3.5提升0.045;在MME(P)上提升18.2;在MM-Vet上提升7.6。(第 9 页)
  • 在外部基准WorldArena上,UniVR相比Emu3.5提升9.2分;在Uni-MMMU上提升25.7分。(第 9 页)

阅读时需要注意

  • 34B模型处理长视觉序列需要大量计算资源,限制了可访问性。
  • 奖励机制仍依赖通用VLM,其在细粒度物理世界知识方面存在局限。
  • 原生视觉、文本和听觉推理之间的最佳协同仍是未来开放性问题。
  • VR-X基准中的JEPA相似度仅适用于包含真实世界动态的长程规划子集,不适用于单步推理或模拟场景。
  • VLM评分器虽然与人类评估高度相关(Spearman相关系数约0.85),但仍可能忽略细微的物理错误,需结合JEPA等指标综合评估。

关联工作

  • Gemini 3 Pro:作为最强基线之一,在长程规划任务中与UniVR进行性能对比。(第 3 页)
  • Emu3.5:作为UniVR的基座模型,用于冷启动初始化和对比实验。(第 4 页)
  • Nano Banana 2:作为文本到图像生成模型,与Gemini组合形成强基线。(第 8 页)
  • V-JEPA:用于计算JEPA相似度指标,评估生成序列的物理动态一致性。(第 7 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

UniVR:在视觉空间中思考以实现统一视觉推理

任忠伟1,2,∗,魏云超1,赵尧1,巩卫波2,刘潇2,王安然2,李相泰2,∗,†,金晓杰1,∗

1北京交通大学,2字节跳动

∗共同一作,†项目负责人

摘要

直接从原始视觉数据中学习广泛的世界知识是智能的一项基本能力。我们介绍了 UniVR,这是首个同时从纯视觉演示中学习复杂推理、细粒度物理动态和长期规划的研究。其核心是 VR-GRPO,一种具有互补的全局和步骤级奖励的强化学习范式。该方法在整个推理过程中强制逻辑一致性和物理一致性,无需构建特定任务的启发式方法或图像-文本对。为此,我们构建了 VR-X,一个源自涵盖长程操作、空间谜题和物理推理的多样化来源的大规模基准测试。它是首个在纯视觉协议下评估这些异构能力的综合套件。值得注意的是,UniVR 在 VR-X 上实现了高达 25% 的性能提升,其卓越的视觉推理能力也提升了各种多模态理解基准测试的性能。这些发现强调了在视觉空间中进行推理的巨大潜力,所有代码、数据和模型均已开源以供进一步研究。

日期:2026年7月15日 通讯作者:金晓杰,魏云超 项目主页:https://UniVR.github.io/

1 引言

当前的人工智能模型主要从文本中获取世界知识 [2, 4, 6, 39, 64, 73, 74],并在文本空间内进行推理 [27, 29, 35, 57] 和规划 [32, 66, 68, 84]。然而,文本是世界的抽象表示,无法完全涵盖真实视觉世界的丰富信息,如复杂的动态、空间关系和潜在的物理定律。相比之下,视觉是世界知识最直接媒介,也是动物和人类获取信息的主要来源。在大多数情况下,人类可以通过直接在脑海中模拟任务执行和场景转换来进行复杂推理,而无需依赖语言,这构成了我们天生的视觉推理能力。鉴于互联网上视频内容的巨大丰富性,赋予 AI 在视觉空间中进行复杂推理和规划的能力,对于增强其世界建模能力并推动现实视觉世界中高效任务执行的边界具有重要意义。

最近的研究探索了推进视觉推理的两种主要途径。一方面,诸如 Gemini-3 [23] 和 GPT-5 [67] 等多模态大语言模型(MLLMs)可以生成详细的文本推理链,随后

第 2 页

图 1 UniVR 专注于推进跨多样任务的原生视觉空间推理与规划。与在文本空间中进行推理的多模态大模型(LMMs)相比,UniVR 促进了对真实视觉世界更深刻的理解,从而改善了各种场景下的策略学习。

通过 Nano Banana [14] 和 GPT-Image [50] 等生成模型转换为视觉推理轨迹。虽然这种范式便利地利用了既有的语言优势,但文本抽象本质上难以捕捉物理世界的复杂动态和空间关系。这种局限性阻碍了文本推理能力向视觉领域的无缝迁移。如图 1 所示,即使拥有最先进的推理能力和高保真渲染,模型在需要细粒度、长视野视觉演化的任务中,仍经常无法保持逻辑连贯性和物理一致性。另一方面,一些工作 [49, 58–60, 70] 利用视频生成模型直接在视觉空间中建模任务策略,而其他工作则采用统一生成模型 [15, 17, 81, 87, 90],通过联合视觉-语言表示进行更全面的推理。尽管它们在从视觉数据中获取复杂知识方面展现出潜力,但其推理仍然严重依赖文本引导,需要密集的图像-文本对用于训练和推理。这些局限性制约了视觉推理的扩展,并驱动了我们的核心问题:模型如何利用原始视觉数据来提升其在多样任务中的视觉推理能力?

为了探究这一问题,我们首先建立了 VR-X,这是一个旨在评估多样任务中视觉推理能力的综合基准。如图 4 所示,VR-X 包含两个主要任务类别。第一个类别侧重于跨各种环境的长视野复杂规划,具有分钟级任务,包含细粒度动态(例如打结、折叠衣物),涵盖烹饪、工艺、机器人控制和导航等多样领域。第二个类别侧重于通用视觉推理,评估视觉搜索、谜题、空间感知和编辑等基本认知技能。模型被要求在视觉空间中直接推理并生成,评估重点在于视觉推理轨迹的逻辑连贯性和任务完成度。这种任务多样性和评估范式在现有基准中很少被探索,要求模型具备强大的学习能力以掌握异构任务知识。

基于该基准,我们评估了最先进的多模态大语言模型(MLLMs),包括 Gemini [14, 23]、GPT [67] 和 Qwen [3, 54],通过提示它们生成详细的文本推理链以指导生成模型,以及 Emu3.5 [15] 等视觉生成模型。结果表明,尽管它们在文本推理、视觉理解或高保真生成方面表现出色,但在基准任务中仍难以准确执行。如图 1 和图 7 所示,它们的预测包含逻辑断层、物理不一致等错误。

2

第 3 页

不一致性,以及规则违反,最终导致无法生成视觉上连贯的任务序列。这凸显了迫切需要能够有效掌握这些异构知识的框架。

受这些观察的启发,我们提出了 UniVR,这是一个具有强大视觉推理能力的统一下一个词元预测框架。其核心是 VR-GRPO,一种新颖的强化学习范式,直接在视觉空间中学习多样化的知识。首先,视觉语言模型(VLM)评估器会对生成的序列进行整体评估,以判断任务完成情况和视觉质量。然而,如第 3.2 节所述,这种原始奖励无法捕捉逻辑断层和物理不一致性等错误。我们将此归因于当前 VLM 的视觉世界知识有限,难以在分钟级的多步序列中识别细粒度错误,从而导致最终状态和外观质量主导了判断。因此,我们提出了步骤聚焦奖励(Step-Focal Reward),该奖励能够主动针对易出错的子步骤进行更精确的评估。结合全局评估,这种设计确保了整体任务完成和细粒度推理连贯性,而无需依赖密集的图文对或特定任务的规则。

除了这些定性分析外,我们在 VR-X 上对 UniVR 与现有方法的性能进行了基准测试。如图 1 所示,UniVR 显著提升了视觉推理能力,同时没有损害基础模型(Emu3.5)的基础优势。值得注意的是,仅拥有 34B 参数的 UniVR 就达到了 Gemini 3 Pro [23] + Nano Banana 2 [21] 流水线的性能水平,甚至在长视界操作任务中超越了 Gemini 3。这证明了我们视觉推理框架卓越的效率和有效性。图 8 提供了进一步的可视化结果,以展示其在不同场景下的稳健性能。

我们的贡献总结如下:

• 我们是首个探索在统一视觉空间中直接学习异构任务(从长期规划到一般认知推理)的研究,且无需语言监督。

• 我们提出了 VR-GRPO,其特色在于一种新颖的步骤聚焦奖励,该奖励与全局奖励相结合,主动针对易出错的推理子步骤。这显著提高了视觉推理中的逻辑连贯性和物理一致性,而无需依赖图文对或特定任务的规则。

• 我们引入了 VR-X,这是一个用于评估视觉空间中多样化任务的基准,涵盖从细粒度长期规划到一般推理的范围,以促进未来视觉推理研究。

2 相关工作

视觉推理。大语言模型(LLMs)[2, 6, 13, 33, 79, 93, 94] 和多模态大语言模型(MLLMs)[3, 4, 40, 72, 88] 的快速发展推动了以文本为中心的推理范式的大量研究,例如思维链(chain-of-thought)[48, 85, 102] 和潜在空间推理(latent-space reasoning)[12, 28]。最近的视觉思维链(visual CoT)[37, 53, 80] 等工作将此范式扩展到了多模态输入,但它们仍然将视觉特征投影到语言空间中,使得推理本质上仍受限于文本。另一条工作线探索了视频生成,用于自动驾驶 [49, 60] 和机器人 [26, 70] 中的非语言世界建模。然而,这些方法通常局限于短视界动态或狭窄的单任务设置。UniVR 与这两种范式都不同,它直接在视觉空间中进行推理,统一并改进了异构任务,这些任务需要长视界规划、复杂策略和复杂的物理知识。

统一模型 [17, 31, 38, 52, 87, 90, 96] 旨在将世界知识编码在单一模型空间中,结合 MLLMs 的文本推理能力和视觉生成能力。开创性的架构 [15, 81] 将图像、文本和视频分词化为统一的离散空间,以实现灵活的跨模态生成。然而,这些模型主要在面向娱乐或艺术编辑的目标上进行训练,其视觉知识的获取仍然严重受限于密集的图文监督。我们的 UniVR 通过将无文本视觉推理框架纳入统一架构,打破了这种依赖关系,使模型能够直接从原始视觉输入中学习复杂的推理和规划。

生成模型中的强化学习。强化学习(RL)在 MLLMs [19, 39, 43, 51, 56, 61, 71, 97, 98] 中的成功已扩展到视觉生成领域,开创性工作如 DDPO [5] 和 ReFL [91] 采用 PPO [61] 或 RLHF [51] 来使模型在图像保真度方面与人类偏好对齐。继

第 4 页

图像 标记

文本 标记

BOI <h> <w> EOI BOI <h> <w> EOI BOI <h> <w> …

UniVR —— 基于统一模型的视觉推理

BOS USER BOI <h> <w> EOI BSS …

长期规划 通用推理 指令: 指令: 指令: 如何给礼物打 请告诉我 绿球如何 结? 图中的时间。识别 到达红色 分4步完成此任务 关键区域。 目标点?

多种多模态任务

图2 UniVR架构概览。通过统一的下一个标记预测目标,UniVR处理指令和图像查询,直接生成用于任务执行的视觉推理轨迹。

DeepSeek-R1 [25] 的成功使得 GRPO [41, 64] 被广泛采用于各种视觉任务中,以增强多模态理解和图像/视频生成。各种方法 [83, 92, 100] 也引入了专门的奖励,例如通过 HPSv3 [47, 89] 提升美学吸引力,或通过 CLIP [55] 和基于 VLM 的评分来强制语义对齐。然而,这些奖励机制主要针对感知质量、文本-图像一致性或单步正确性。相比之下,我们的 VR-GRPO 专门设计用于在多步视觉推理和政策学习的背景下优化逻辑一致性和物理合理性。

3 UniVR

在本节中,我们介绍 UniVR,如图2所示,它采用自回归生成模型作为基本框架。它包含两个阶段的训练流程:冷启动初始化和强化学习。我们将在第3.1节描述如何使用该框架进行视觉空间推理以及冷启动初始化,并在第3.2节描述强化学习训练。

3.1 在视觉空间中思考

给定图像序列 $x_{1:t}$ 和指令,我们建模下一帧的分布:$p(x_{t+1} | x_{1:t})$。我们使用包含跨不同场景的任务执行演示轨迹的图像序列,涵盖各种规划和推理知识。我们的公式不需要密集的文本质疑链,而是直接建模这些轨迹中的状态转换和底层策略动态,鼓励模型在视觉空间中进行推理。

具体而言,我们采用 Emu3.5 作为基线,这是一种最先进的统一生成模型,能够生成长度可变的图像序列。它采用类似 VQ-VAE 的自编码器 [77] 将图像和文本编码为统一的离散词汇表,同时也支持文本生成。这使我们能够进一步研究增强的视觉推理如何影响多模态理解(见第5.2节)。尽管在大量图像-文本对上进行预训练,但该基线仍然难以捕捉复杂的现实世界物理规律、细粒度的动作动态和视觉认知能力,如第5.1节和图7所示。我们将此归因于其对密集文本质疑链获取世界知识的过度依赖,从而将视觉简化为单纯的渲染器。因此,我们首先在一个精心策划的多样化视觉任务数据集上进行监督微调(SFT)作为冷启动初始化,以标准化

第 5 页

VR-GRPO:视觉推理 GRPO 全局 奖励 𝑦! 全局级评估 𝑅!" … 请评估图像序列的 𝑦" 整体 1. 视觉连贯性 … 𝑅!$ … 𝑦# 2. 任务完成度 … … 时间步 1 ⋯𝑇 子步采样 步骤级评估 𝑅!% 𝑍$ 𝑡∈ℝ%, 𝑍̅ 𝑡= 𝐸$ 𝑍$(𝑡) 𝜎曲线 将展示𝐭𝐰𝐨 𝐜𝐥𝐢𝐩𝐬(两个片段), VLM 步骤 1 " 请比较它们的质量: 奖励 𝜎(𝑡) = 𝐾E 𝑍$ 𝑡−𝑍̅ 𝑡 " 1. 轨迹是否 𝑅&" 𝑇&'()' = 𝑎𝑟𝑔𝑚𝑎𝑥 𝜎t −W/2 朝着目标 𝑇*+% = 𝑎𝑟𝑔𝑚𝑎𝑥 𝜎t + W/2 时间步 状态进展 … 𝑅&# 2. 推理过程是否 𝑅&$ 遵循物理定律 … … 3. …. 成对 𝑅&% 请比较哪一个 组 更好,返回 A 或 B。如果它们 𝑹= 𝑹𝒈− 相同,返回 TIE。 𝝀B 𝑹𝒈−𝑹𝒔

全局质量评估的失败案例 该样本 动作平滑并达到 VLM 了 最终状态。因此, 其质量良好。

图 3 提出的视觉推理 GRPO。(上)VR-GRPO 整合全局奖励和步骤聚焦奖励,以确保任务完成度和生成推理轨迹的物理连贯性。(下)全局奖励的失败案例,其忽略了长推理轨迹内部的局部不一致性。

将所有样本作为查询图像、指令、视觉推理轨迹。这赋予了模型视觉推理先验,用于后续的强化学习(RL)。训练配置和数据构建详见附录 A。

3.2 视觉推理 GRPO

尽管将各种任务投射到统一视觉空间具有通用性,但我们观察到,原始的监督微调(SFT)仍然难以调和异构的多源任务。例如,2D 拼图和长期人类计划在时间尺度、领域知识和视觉外观上存在巨大差异。如第 5.2 节所述,SFT 训练中的密集监督未能带来跨不同任务的一致改进。虽然强化学习方法(例如 GRPO [64])通过使模型能够在不同场景中自主探索最优策略,为性能提升提供了一种有前景的范式,但现有方法优先考虑视觉保真度或跨模态对齐,而非视觉推理。

为解决这一问题,我们引入了 VR-GRPO,这是一种强化学习方法,摒弃了对密集图像-文本对或特定任务启发式规则的依赖,专注于逻辑连贯性和任务完成度。在第 5.2 节中,我们进一步证明 VR-GRPO 也可以无缝集成到文本推理任务中,促进整体多模态理解的协同进步。

奖励设计。VR-GRPO 包含两个奖励组件:格式奖励 $R_{format}$ 和视觉推理奖励 $R_{reason}$。$R_{reason}$ 由全局奖励 $R_g$ 和一种新颖的步骤聚焦奖励 $R_s$ 组成。$R_{format}$ 确保生成的图像序列满足结构约束,例如统一的分辨率和数量。

5

第 6 页

任务指令规定的推理步骤。

对于 Reason,我们使用一个通用提示来引导在线奖励模型(即 Qwen3-VL-30B),针对真实参考样本对 rollout 样本的整体质量进行评估。尽管 VLM 能有效评估任务完成度和视觉保真度,如图 6 所示,我们的初步分析表明,这种全局奖励往往忽视中间物理违规和逻辑漏洞,过度优先考虑终端成功和像素清晰度,特别是在长视界、多步任务中。我们将此归因于当前 VLM 对文本衍生世界知识的依赖,这限制了它们在分钟级多步序列中定位细粒度视觉动态错误的能力。

因此,我们引入步骤聚焦推理奖励 $R_s$,旨在识别推理轨迹中最易出错的步骤。通过将 VLM 聚焦于这些关键步骤,我们提供精确的细粒度奖励,确保模型在复杂、长视界任务中保持逻辑和物理连贯性。具体而言,对于一组 $K$ 条 rollout 轨迹 $y_{1:K}$,我们首先假设统一长度 $T$。我们采用 CLIP 图像编码器提取每帧特征嵌入 $z_k(t) \in \mathbb{R}^d$,并计算每个时间步 $t$ 的轨迹间方差: $$ \sigma(t) = \sqrt{\frac{1}{K} \sum_{k=1}^{K} \|z_k(t) – \bar{z}(t)\|_2^2} \quad (1) $$ 其中 $\bar{z}(t)$ 是时间 $t$ 所有轨迹的平均嵌入。高方差 $\sigma(t)$ 表示最大不确定性状态,此时模型的推理路径出现分歧。给定窗口大小 $W$,我们识别峰值不确定性 $t^* = \arg\max_t \sigma(t)$,并提取从 $[t^* – W/2, t^* + W/2]$ 的推理片段。对于过于困难的样本,此过程退化为随机采样。在实践中,生成的轨迹长度往往不同。为确保时间对齐,我们将每条轨迹划分为相等数量的片段。然后,我们将片段索引视为同步时间步,并使用每个片段内的平均 CLIP 特征执行上述不确定性分析。遵循 [82],我们对全局奖励和识别出的子步骤均采用成对评估协议以得出相对胜率。这种方法旨在进一步减轻通常伴随直接基于 VLM 的标量评估的固有评分偏差。在获得每条轨迹的全局分数 $R_g$ 和步骤聚焦分数 $R_s$ 后,我们使用以下公式将它们整合:

$$ R_{\text{reason}} = R_g – \lambda |R_g – R_s| \quad (2) $$

这种公式防止模型采取推理捷径,因为它要求模型不仅要准确预测终端状态,还要保持程序完整性和物理连贯性。系数 $\lambda$ 控制这种对齐的强度。

4 VR-X 基准

我们的目标是推进在广泛场景中视觉域内原生推理的能力。我们优先考虑一个全面的基准,能够评估多步规划、精细操作和认知推理。然而,当前的基准大多强调视觉质量或文本匹配,局限于受限环境和短期任务。

因此,我们引入 VR-X,这是第一个专为多样化和异构视觉推理设计的大规模基准。如图 4 所示,它包括六个任务,每个任务都提供详细的视觉推理轨迹:视觉引导、机器人操作、益智游戏、编辑、搜索和空间感知。

4.1 数据集生成

VR-X 的特点是其巨大的多样性,涉及细粒度、视觉上复杂的操作,这些操作很难用语言描述。我们从 16 个不同来源(例如 AgiBot [7]、Action100M [10]、EgoDex [30]、VisualCoT [63])收集了 150 万原始样本,涵盖从分钟级规划(机器人操作、烹饪、手工制作)到单步推理(迷宫、视觉搜索)的范围。经过严格筛选,整理为 31 万冷启动训练样本、3 千 RL 样本和 1.8 千基准评估样本,所有样本均遵循统一格式:查询图像、文本指令、

6

第 7 页

图 4 VR-X 基准概述。

视觉推理轨迹。我们进一步使用细粒度的文本思维链(CoT)描述对这些序列进行标注,以支持多模态学习。更多细节见附录 A。

4.2 评估指标

我们的评估主要关注两个方面:视觉推理的逻辑准确性以及对真实物理动态的遵循程度。因此,我们采用以下指标进行评估:

VLM 得分:我们使用 Qwen3.5-397B [54] 进行自动化评估,以定量评估推理轨迹。该模型根据任务完成度、过程连贯性、视觉信息丰富度和图像保真度对每个样本进行评估。这些维度被聚合为一个最终归一化得分(0–100),提供了一个稳健的指标来衡量结果的逻辑和视觉质量。

JEPA 相似度:尽管具有强大的推理能力,但视觉语言模型(VLMs)对文本知识的依赖往往阻碍了它们感知内在物理规律的能力。如图 6 所示,这可能导致评估者忽略细粒度物理不一致性的幻觉。为了弥补这一差距,我们引入 JEPA 相似度作为额外指标。基于先前研究 [45] 表明 V-JEPA [1] 编码器能够捕捉高层潜在物理动态,我们将序列映射到潜在空间,并计算与真实分布的最大均值差异(maximum mean discrepancy)。较低的得分表示与真实物理规律更一致。更多评估细节见附录 A。

7

第 8 页

表 1 VR-X 上的对比结果。Qwen、Gemini 2.5/3 和 GPT-5 分别搭配 Qwen-image-edit、Nano Banana 1/2 和 GPT-image-1.5。

视觉 长期规划 通用推理 方法 总体↑ JEPA↓ 思维 指导 机器人 编辑 空间 拼图 搜索

大型多模态模型 + T2I 模型 Qwen3-VL-235B [3] % 48.2 62.8 42.1 38.2 64.1 59.8 52.5 18.08 Qwen3.5-397B [54] % 47.0 63.2 39.8 40.4 65.6 64.5 53.4 18.64 GPT-5 [67] % 68.2 64.1 58.0 49.3 64.0 77.4 63.5 12.17 Gemini-2.5-pro [14] % 58.4 67.9 54.0 40.5 67.7 76.3 60.8 14.39 Gemini-3-pro [23] % 66.2 67.1 63.7 55.1 65.5 79.0 66.1 11.07

统一生成模型 Janus-pro [11] % 9.2 18.2 5.4 10.2 27.1 21.5 15.3 68.79 Show-o2 [90] % 15.1 22.5 13.0 17.1 29.4 35.8 22.2 59.93 ILLUME+ [31] % 13.1 11.5 5.8 14.6 22.2 27.5 15.8 61.12 OneCAT [38] % 15.6 13.5 10.3 20.2 16.2 30.1 17.7 77.06 STAR [52] % 22.7 28.5 14.2 21.5 27.2 37.7 25.3 51.98 OmniGen2 [87] % 20.4 29.4 15.2 16.9 30.5 42.1 25.8 47.09 Bagel [17] % 25.2 34.7 20.9 21.3 35.1 47.7 30.8 40.88 Emu3.5 [15] % 38.6 42.8 32.7 35.3 43.4 46.2 39.8 33.62

UniVR ! 59.5 68.0 48.5 46.5 62.2 64.3 58.2 13.01 △v.s. Emu 3.5 ↑20.9 ↑25.2 ↑15.8 ↑11.2 ↑18.8 ↑18.1 ↑18.4 ↓20.61

5 实验

我们利用 Emu3.5 34B 初始化我们的统一模型,该模型经过全参数监督微调(SFT)和强化学习(RL)。我们的 RL 管道使用 verl 框架 [65] 实现, rollout 大小设置为 8。对于子步骤选择,我们将默认窗口大小设置为 4 帧,一致性系数 $\lambda$ 设置为 2.0。在训练过程中,视频分辨率被缩放至短边 512px,最大序列长度限制为 20k tokens。更多实现细节见附录 A。

5.1 VR-X 上的结果

表 1 在 VR-X 基准测试上提供了两种主导技术范式的全面对比:大型多模态模型与 T2I 模型的集成,以及统一生成模型。该评估旨在调查当前方法在视觉空间推理方面的能力,并验证 UniVR 的有效性。

LMMs 与 T2I 模型。我们首先评估现成的 LMMs(第 1-5 行),包括搭配 Qwen-Image-Edit [86] 的 Qwen 3-VL [3] 和 Qwen 3.5 [54],搭配 Nano Banana 1/2 [21, 22] 的 Gemini 2.5/3 Pro [14, 23],以及搭配 GPT-image 1.5 [50] 的 GPT-5 [67]。这些系统遵循两阶段管道:LMM 首先从输入图像和任务提示中生成步骤级文本指令。生成模块随后根据前几帧和文本指导逐帧渲染序列。Gemini 3 Pro 搭配 Nano Banana 2 取得了最佳性能,这得益于其强大的文本推理能力和卓越的渲染质量。然而,如图 7 所示,即使在详细的指令下,在具有复杂动态和规划的任务中仍然存在视觉不一致性。值得注意的是,随着语言模型的演进,这一问题并没有显著改善,Gemini 3/2.5 Pro 与 Qwen 3.5/3-VL 之间的比较显示视觉逻辑性仅有边际提升。这凸显了超越单纯语言扩展的内在视觉世界知识的迫切需求。

统一生成模型。第 9-16 行评估了各种视觉-语言统一模型。除了 Emu3.5 之外,大多数模型缺乏连续图像生成能力,必须通过迭代展开来进行长视界规划,通常表现不佳,峰值成功率仅为 30% 左右。这可能源于以娱乐生成和艺术编辑为中心的训练目标,而非逻辑推理。Emu3.5 取得了最高分

8

第 9 页

方法 MMMU [101] MME(P) [20] MME(C) [20] MMBench [42] MathVista [44] MM-Vet [99]

Emu 3.5 0.292 781.1 324.6 0.183 41.7 28.0 仅文本训练 0.290 782.0 323.4 0.199 40.8 28.3 UniVR∗ 0.337 799.3 338.5 0.198 44.0 35.6 △v.s. Emu3.5 ↑0.045 ↑18.2 ↑13.9 ↑0.015 ↑2.3 ↑7.6

(a) 理解基准上的结果。∗表示使用交错的图像-文本序列进行训练。

冷启动 奖励 VR-X 训练数据 冷启动 奖励 VR-X 开始 全局 步骤 成对 LP GR JEPA↓ 数据 开始 HPSv3 CLIP VR-GRPO LP GR JEPA↓ ✓ 48.2 42.4 18.44 V ✓ 48.2 42.4 18.44 ✓ ✓ 45.7 46.0 22.30 V&T ✓ 49.7 41.0 18.37 ✓ ✓ 54.9 45.8 15.87 V&T ✓ ✓ 49.0 41.7 18.09 ✓ ✓ ✓ 61.6 53.7 12.89 V&T ✓ ✓ ✓ 52.6 42.0 17.17 ✓ ✓ ✓ ✓ 63.8 55.4 13.01 V&T ✓ ✓ ✓ ✓ 65.4 57.8 12.97

(b) VR-GRPO 中的奖励。 (c) 基于文本的强化学习方法训练。

方法 训练数据 LP GR 方法 WorldArena [62] Uni-MMMU [103] RBench [18]

分离 53.6 44.2 Emu3.5 40.3 28.7 31.2 冷启动 联合 48.2 42.4 冷启动 42.4 37.6 36.8 分离 61.5 55.0 UniVR 49.5 54.4 47.7 UniVR 联合 63.8 55.4 △v.s. Emu3.5 ↑9.2 ↑25.7 ↑16.5

(d) 联合训练的消融实验。 (e) 在其他基准数据上的评估。

表 2 消融研究。“LP”和“GR”分别表示 VR-X 中的长期规划和一般推理。

在这一组中,得益于对多样化日常生活和手工制作序列的原生预训练,性能有所提升。然而,文本推理对于其执行仍然不可或缺,当面对 VR-X 中复杂的视觉动态时,其性能停滞在 35%。同时,这些模型也表现出较差的 JEPA 分数,显著落后于由基于文本的多模态大语言模型(MLLMs)渲染的序列,其特征分布与真实情况的差异大约大 2–4.5 倍。这强调了视觉空间推理仍然是现有模型的关键瓶颈。

UniVR。相比之下,UniVR 显著提升了所有任务的性能。尽管缺乏细粒度的文本过程注释,直接在视觉空间中进行训练实现了 60% 的长期规划成功率和 70% 的一般推理成功率。值得注意的是,在 34B 参数规模下,UniVR 在几项关键指标上优于 Gemini 2.5 Pro。这表明我们的训练流程有效地赋予模型直接从视觉信号中提炼以任务为中心的策略的能力,无需经过文本中介。此外,通过培养更强的视觉推理能力,生成的序列表现出增强的物理动态,从而获得了更好的 JEPA 指标。

5.2 消融研究

视觉推理有助于多模态理解。表 2a 展示了在标准多模态理解基准上的消融实验。遵循 [46] 中的协议,第一行报告了 Emu3.5 在 MMMU [101] 和 MME [20] 等基准上的基线性能,其中模型被提示自主生成中间视觉推理图像和最终文本答案。在第二行中,我们仅使用源自 VR-X 的文本推理链(文本推理注释的详细信息见附录 A)进行训练,以符合多模态理解模型的常规训练范式,但这带来的增益微乎其微。相比之下,整合 UniVR 训练范式(第三行)在所有六项指标上带来了更显著的增益。这表明增强的视觉推理作为文本监督的有力补充,有效地增强了整体多模态理解能力。

VR-GRPO 中的奖励。表 2b 对 VR-GRPO 的各个组成部分进行了消融。第一行确立了强化学习(RL)之前冷启动模型的基线性能。虽然仅全局奖励将一般推理(短序列)提高了 3.6%,但它导致长期规划和 JEPA 分数下降,表明发生了奖励黑客现象。相反,单独引入步骤聚焦奖励显示出积极的改进

第 10 页

在所有三项指标上均表现优异。结合两种奖励产生了协同效应,进一步提升了整体性能。最后,将视觉语言模型(VLM)从绝对标量评分过渡到成对比较协议,进一步增强了奖励的鲁棒性并改善了最终结果。

VR-GRPO 与基于文本的强化学习兼容。表 2c 调查了 VR-GRPO 与现有视觉奖励的兼容性。在 Cold-Start 阶段,添加文本推理链(第 2 行)相比纯视觉推理(第 1 行)并未带来显著增益。此外,引入以美学为中心的奖励(如 HPSv3)或通过 CLIP 进行视觉-语言对齐(第 3-4 行)对于需要复杂视觉推理的任务帮助有限,其中 HPSv3 的影响微乎其微。相比之下,VR-GRPO(第 5 行)显著提升了视觉推理能力,并保持与其他奖励函数的兼容性,突显了我们方法的通用性和多功能性。

VR-GRPO 利用异构知识稳定训练。在 VR-X 中,长期规划和一般推理在时间尺度、环境上下文、视觉外观和知识领域方面存在显著差异。表 2d 中的第 1-3 行调查了在不引入 VR-GRPO 的情况下跨这些任务的联合学习能力。结果表明,在纯 Cold-Start 阶段,联合训练难以有效平衡异构任务知识,未能超越在单个任务上单独训练的模型性能。相比之下,第 4 行中引入 VR-GRPO 赋予模型自主探索最优策略的能力,在两个类别中均带来了性能提升。这证明了我们方法在促进统一视觉推理训练方面的有效性。

在其他视觉推理基准上进行评估。为了进一步评估 UniVR 的泛化能力,我们在来自三个外部基准的测试数据上对其进行了评估(表 2e):两个侧重于具身智能场景 [18, 62],一个侧重于认知推理 [103]。利用这些基准中的指令和查询图像,我们提示 UniVR 生成相应的视觉推理轨迹,然后使用与第 5 节相同的 VLM 评分协议对其进行评估。尽管与我们的训练数据存在显著领域差距,涵盖未见过的机器人操作任务、环境、相机视角以及数学/物理推理问题——UniVR 在这些新测试中显著提升了基线性能(高达 24.3%)。此外,借助 VR-GRPO,这一增益显著超过了普通 SFT 的增益,表明 VR-GRPO 培养了更具泛化能力的视觉推理。

6 结论

在本工作中,我们提出了 UniVR,这是一个统一的框架,能够在视觉空间内直接进行复杂推理和规划,无需密集的语言监督。我们方法的核心是 VR-GRPO,它通过互补的奖励强制执行全局任务完成和细粒度的步骤级物理一致性。在多样化的 VR-X 基准上进行训练和评估,UniVR 相比强大的基于文本的推理管道和统一生成模型取得了显著增益,证明了仅凭原始视觉演示就足以支持复杂、长视距的策略学习。除了任务执行之外,我们的研究结果表明,增强的视觉推理为多模态理解带来了更广泛的好处,表明视觉原生计算是文本抽象的强大补充。我们相信这项工作为更接地气、更高效的世界模型开辟了充满希望的途径,这些模型直接从丰富的视觉世界中学习。

第 11 页

参考文献

[1] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, 等. V-jepa 2: 自监督视频模型实现理解、 预测与规划. arXiv 预印本 arXiv:2506.09985, 2025.

[2] Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, 等. Qwen 技术报告. arXiv 预印本 arXiv:2309.16609, 2023.

[3] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等. Qwen3-vl 技术报告. arXiv 预印本 arXiv:2511.21631, 2025.

[4] Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, 等. Qwen2. 5-vl 技术报告. arXiv 预印本 arXiv:2502.13923, 2025.

[5] Kevin Black, Michael Janner, Yilun Du, Ilya Kostrikov, 和 Sergey Levine. 使用 强化学习训练扩散模型. arXiv 预印本 arXiv:2305.13301, 2023.

[6] Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, 等. 语言模型是少样本学习者. 神经信息处理系统进展, 33:1877–1901, 2020.

[7] Qingwen Bu, Jisong Cai, Li Chen, Xiuqi Cui, Yan Ding, Siyuan Feng, Shenyuan Gao, Xindong He, Xuan Hu, Xu Huang, 等. Agibot world colosseo: 面向可扩展和智能具身系统的大规模操作平台. arXiv 预印本 arXiv:2503.06669, 2025.

[8] Joao Carreira 和 Andrew Zisserman. Quo vadis, action recognition? 新模型与 Kinetics 数据集. 在 IEEE 计算机视觉与模式识别会议论文集, 第 6299–6308 页, 2017.

[9] Brandon Castellano 和 PySceneDetect Contributors. Pyscenedetect: 视频场景检测与分析工具. GitHub 仓库, 2025. URL https://github.com/Breakthrough/PySceneDetect. 访问日期: 2026-05-06.

[10] Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade Yu, Allen Bolourchi, Theo Moutakanni, 和 Pascale Fung. Action100m: 大规模视频动作数据集. arXiv 预印本 arXiv:2601.10592, 2026.

[11] Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, 和 Chong Ruan. Janus-pro: 通过数据与模型扩展实现统一的 multimodal 理解与生成. arXiv 预印本 arXiv:2501.17811, 2025.

[12] Xinghao Chen, Anhao Zhao, Heming Xia, Xuan Lu, Hanlin Wang, Yanjun Chen, Wei Zhang, Jian Wang, Wenjie Li, 和 Xiaoyu Shen. 超越语言推理:潜在思维链推理全面综述. arXiv 预印本 arXiv:2505.16782, 2025.

[13] Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts, Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, 等. Palm: 使用 路径扩展语言建模. 机器学习研究杂志, 24(240):1–113, 2023.

[14] Gheorghe Comanici, Eric Bieber, Mike Schaekermann, Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, 等. Gemini 2.5: 通过高级推理、 多模态、长上下文和下一代代理能力推动前沿. arXiv 预印本 arXiv:2507.06261, 2025.

[15] Yufeng Cui, Honghao Chen, Haoge Deng, Xu Huang, Xinghang Li, Jirong Liu, Yang Liu, Zhuoyan Luo, Jinsheng Wang, Wenxuan Wang, 等. Emu3. 5: 原生多模态模型是世界学习者. arXiv 预印本 arXiv:2510.26583, 2025.

[16] Dima Damen, Hazel Doughty, Giovanni Maria Farinella, Sanja Fidler, Antonino Furnari, Evangelos Kazakos, Davide Moltisanti, Jonathan Munro, Toby Perrett, Will Price, 等. The epic-kitchens dataset: 收集、 挑战与基线. IEEE 模式分析与机器智能汇刊, 43(11):4125–4141, 2020.

[17] Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, 等. 统一多模态预训练中的涌现属性. arXiv 预印本 arXiv:2505.14683, 2025.

11

第 12 页

[18] Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, and Daquan Zhou. Rethinking video generation model for the embodied world. arXiv preprint arXiv:2601.15282, 2026.

[19] Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, and Xiangyu Yue. Video-r1: Reinforcing video reasoning in mllms. arXiv preprint arXiv:2503.21776, 2025.

[20] Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Jinrui Yang, Xiawu Zheng, Ke Li, Xing Sun, et al. Mme: A comprehensive evaluation benchmark for multimodal large language models. arXiv preprint arXiv:2306.13394, 2023.

[21] Google. Introducing Gemini 2.5 Flash Image, our state-of-the-art image model. Google Developers Blog, 2025. URL https://developers.googleblog.com/en/introducing-gemini-2-5-flash-image/. Accessed: 2025-05- 06.

[22] Google. Nano banana 2: Google’s latest AI image generation model. Google Blog, feb 2026. URL https: //blog.google/innovation-and-ai/technology/ai/nano-banana-2/. Accessed: 2026-05-06.

[23] Google DeepMind. A new era of intelligence with Gemini 3, November 2025. URL https://blog.google/ products-and-platforms/products/gemini/gemini-3/. Accessed: 2026-05-05.

[24] Jiawei Gu, Yunzhuo Hao, Huichen Will Wang, Linjie Li, Michael Qizhe Shieh, Yejin Choi, Ranjay Krishna, and Yu Cheng. Thinkmorph: Emergent properties in multimodal interleaved chain-of-thought reasoning. arXiv preprint arXiv:2510.27492, 2025.

[25] Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, et al. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948, 2025.

[26] Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, and Chelsea Finn. Ctrl-world: A controllable generative world model for robot manipulation. arXiv preprint arXiv:2510.10125, 2025.

[27] Kunyang Han, Yibo Hu, Mengxue Qu, Hailin Shi, Yao Zhao, and Yunchao Wei. Rose: Revolutionizing open-set dense segmentation with patch-wise perceptual large multimodal model, 2024. URL https://arxiv.org/abs/ 2412.00153.

[28] Shibo Hao, Sainbayar Sukhbaatar, DiJia Su, Xian Li, Zhiting Hu, Jason Weston, and Yuandong Tian. Training large language models to reason in a continuous latent space. arXiv preprint arXiv:2412.06769, 2024.

[29] Alex Havrilla, Yuqing Du, Sharath Chandra Raparthy, Christoforos Nalmpantis, Jane Dwivedi-Yu, Maksym Zhuravinskyi, Eric Hambro, Sainbayar Sukhbaatar, and Roberta Raileanu. Teaching large language models to reason with reinforcement learning. arXiv preprint arXiv:2403.04642, 2024.

[30] Ryan Hoque, Peide Huang, David J Yoon, Mouli Sivapurapu, and Jian Zhang. Egodex: Learning dexterous manipulation from large-scale egocentric video. arXiv preprint arXiv:2505.11709, 2025.

[31] Runhui Huang, Chunwei Wang, Junwei Yang, Guansong Lu, Yunlong Yuan, Jianhua Han, Lu Hou, Wei Zhang, Lanqing Hong, Hengshuang Zhao, et al. Illume+: Illuminating unified mllm with dual visual tokenization and diffusion refinement. arXiv preprint arXiv:2504.01934, 2025.

[32] Wenlong Huang, Pieter Abbeel, Deepak Pathak, and Igor Mordatch. Language models as zero-shot planners: Extracting actionable knowledge for embodied agents. In International conference on machine learning, pages 9118–9147. PMLR, 2022.

[33] Albert Q Jiang, Alexandre Sablayrolles, Arthur Mensch, Chris Bamford, Devendra Singh Chaplot, Diego de las Casas, Florian Bressand, Gianna Lengyel, Guillaume Lample, Lucile Saulnier, et al. Mistral 7b. arXiv preprint arXiv:2310.06825, 2023.

[34] Alexander Khazatsky, Karl Pertsch, Suraj Nair, Ashwin Balakrishna, Sudeep Dasari, Siddharth Karamcheti, Soroush Nasiriany, Mohan Kumar Srirama, Lawrence Yunliang Chen, Kirsty Ellis, et al. Droid: A large-scale in-the-wild robot manipulation dataset. arXiv preprint arXiv:2403.12945, 2024.

[35] Takeshi Kojima, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo, and Yusuke Iwasawa. Large language models are zero-shot reasoners. Advances in neural information processing systems, 35:22199–22213, 2022.

第 13 页

[36] Ang Li, Charles Wang, Deqing Fu, Kaiyu Yue, Zikui Cai, Wang Bill Zhu, Ollie Liu, Peng Guo, Willie Neiswanger, Furong Huang, 等。 Zebra-cot:一个用于交错式视觉语言推理的数据集。 arXiv 预印本 arXiv:2507.16746, 2025.

[37] Bangzheng Li, Ximeng Sun, Jiang Liu, Ze Wang, Jialian Wu, Xiaodong Yu, Hao Chen, Emad Barsoum, Muhao Chen, 和 Zicheng Liu。 潜在视觉推理。 arXiv 预印本 arXiv:2509.24251, 2025.

[38] Han Li, Xinyu Peng, Yaoming Wang, Zelin Peng, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Wenrui Dai, 和 Hongkai Xiong。 Onecat:用于统一理解和生成的仅解码器自回归模型。 arXiv 预印本 arXiv:2509.03498, 2025.

[39] Baijiong Lin, Weisen Jiang, Yuancheng Xu, Hao Chen, 和 Ying-Cong Chen。 Parm:通过偏好感知自回归奖励模型进行多目标测试时对齐。 arXiv 预印本 arXiv:2505.06274, 2025.

[40] Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee。 视觉指令微调。 神经信息处理系统进展, 36:34892–34916, 2023.

[41] Jie Liu, Gongye Liu, Jiajun Liang, Yangguang Li, Jiaheng Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Wanli Ouyang。 Flow-grpo:通过在线强化学习训练流匹配模型。 arXiv 预印本 arXiv:2505.05470, 2025.

[42] Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, 等。 Mmbench:你的多模态模型是全栈选手吗? 在欧洲计算机视觉会议, 页码 216–233。 Springer, 2024.

[43] Yuqi Liu, Bohao Peng, Zhisheng Zhong, Zihao Yue, Fanbin Lu, Bei Yu, 和 Jiaya Jia。 Seg-zero:通过认知强化引导的推理链分割。 arXiv 预印本 arXiv:2503.06520, 2025.

[44] Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, 和 Jianfeng Gao。 Mathvista:评估视觉语境下基础模型的数学推理能力。 arXiv 预印本 arXiv:2310.02255, 2023.

[45] Ge Ya Luo, Gian Mario Favero, Zhi Hao Luo, Alexia Jolicoeur-Martineau, 和 Christopher Pal。 超越 FVD:增强视频生成质量的评估指标。 arXiv 预印本 arXiv:2410.05203, 2024.

[46] Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios Savvides, Sharon Li, 和 Jindong Wang。 Torchumm:用于评估、分析和后训练的统一多模态模型代码库。 arXiv 预印本 arXiv:2604.10784, 2026.

[47] Yuhang Ma, Xiaoshi Wu, Keqiang Sun, 和 Hongsheng Li。 Hpsv3:迈向宽谱人类偏好评分。 在 IEEE/CVF 国际计算机视觉会议论文集, 页码 15086–15095, 2025.

[48] Aman Madaan 和 Amir Yazdanbakhsh。 文本与模式:有效的思维链需要两者共舞。 arXiv 预印本 arXiv:2209.07686, 2022.

[49] Grégoire Mialon, Clémentine Fourrier, Craig Swift, Thomas Wolf, Yann LeCun, 和 Thomas Scialom。 Gaia:一个通用 AI 助手基准。 arXiv 预印本 arXiv:2311.12983, 2023.

[50] OpenAI。 在 API 中介绍我们最新的图像生成模型。 OpenAI 博客, 2025年4月。 URL https: //openai.com/index/image-generation-api/。 访问日期:2025-05-06。

[51] Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, 等。 利用人类反馈训练遵循指令的语言模型。 神经信息处理系统进展, 35:27730–27744, 2022.

[52] Jie Qin, Jiancheng Huang, Limeng Qiao, 和 Lin Ma。 Star:用于统一多模态学习的堆叠自回归方案。 arXiv 预印本 arXiv:2512.13752, 2025.

[53] Yiming Qin, Bomin Wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, 和 XuDong Wang。 Chain-of-visual-thought:通过连续视觉令牌教导 VLMS 更好地看和思考。 arXiv 预印本 arXiv:2511.19418, 2025.

[54] Qwen Team。 Qwen3.5:迈向原生多模态智能体, 2026年2月。 URL https://qwen.ai/blog?id= qwen3.5.

13

第 14 页

[55] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, 等。从自然语言监督中学习可迁移的视觉模型。在《国际机器学习会议论文集》中,第 8748–8763 页。PmLR,2021 年。

[56] Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D Manning, Stefano Ermon, 和 Chelsea Finn。 直接偏好优化:你的语言模型秘密是一个奖励模型。《神经信息处理系统进展》,36:53728–53741,2023 年。

[57] Zhongwei Ren, Zhicheng Huang, Yunchao Wei, Yao Zhao, Dongmei Fu, Jiashi Feng, 和 Xiaojie Jin。Pixellm: 使用大型多模态模型进行像素推理。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 26374–26383 页,2024 年。

[58] Zhongwei Ren, Yunchao Wei, Xun Guo, Yao Zhao, Bingyi Kang, Jiashi Feng, 和 Xiaojie Jin。Videoworld: 探索从无标签视频中学习知识。在《计算机视觉与模式识别会议论文集》中,第 29029–29039 页,2025 年。

[59] Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, 和 Xiaojie Jin。 Videoworld 2:从真实世界视频中学习可迁移知识。arXiv 预印本 arXiv:2602.10102,2026 年。

[60] Lloyd Russell, Anthony Hu, Lorenzo Bertoni, George Fedoseev, Jamie Shotton, Elahe Arani, 和 Gianluca Corrado。Gaia-2:一种用于自动驾驶的可控多视图生成世界模型。arXiv 预印本 arXiv:2503.20523,2025 年。

[61] John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, 和 Oleg Klimov。近端策略优化 算法。arXiv 预印本 arXiv:1707.06347,2017 年。

[62] Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, 等。Worldarena:用于评估具身世界模型感知和功能统一性的基准。arXiv 预印本 arXiv:2602.08971,2026 年。

[63] Hao Shao, Shengju Qian, Han Xiao, Guanglu Song, Zhuofan Zong, Letian Wang, Yu Liu, 和 Hongsheng Li。Visual cot:通过全面的思维链推理数据集和基准测试推进多模态语言模型。《神经信息处理系统进展》,37:8612–8642,2024 年。

[64] Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, 等。Deepseekmath:推动开放语言模型中数学推理的极限。arXiv 预印本 arXiv:2402.03300,2024 年。

[65] Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, 和 Chuan Wu。Hybridflow:一种灵活且高效的 RLHF 框架。在《第二十届欧洲计算机系统会议论文集》中,第 1279–1297 页,2025 年。

[66] Wentao Shi, Xiangnan He, Yang Zhang, Chongming Gao, Xinyue Li, Jizhi Zhang, Qifan Wang, 和 Fuli Feng。 通过双层可学习的大语言模型规划增强长期推荐。arXiv 预印本 arXiv:2403.00843,2024 年。

[67] Aaditya Singh, Adam Fry, Adam Perelman, Adam Tart, Adi Ganesh, Ahmed El-Kishky, Aidan McLaughlin, Aiden Low, AJ Ostrow, Akhila Ananthram, 等。Openai gpt-5 系统卡片。arXiv 预印本 arXiv:2601.03267, 2025 年。

[68] Chan Hee Song, Jiaman Wu, Clayton Washington, Brian M Sadler, Wei-Lun Chao, 和 Yu Su。Llm-planner: 使用大型语言模型为具身代理进行少样本接地规划。在《IEEE/CVF 国际计算机视觉会议论文集》中,第 2998–3009 页,2023 年。

[69] C. Spearman。两件事之间关联的证明与测量。《美国心理学杂志》,15(1):72–101,1904 年。doi: 10.2307/1412159。

[70] Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, 和 Yanyong Zhang。Dreamworld:视频生成中的统一世界建模。arXiv 预印本 arXiv:2603.00466,2026 年。

[71] Huajie Tan, Yuheng Ji, Xiaoshuai Hao, Xiansheng Chen, Pengwei Wang, Zhongyuan Wang, 和 Shanghang Zhang。Reason-rft:视觉语言模型视觉推理的强化微调。arXiv 预印本 arXiv:2503.20752,2025 年。

[72] Qwen Team。Qwen3. 5-omni 技术报告。arXiv 预印本 arXiv:2604.15804,2026 年。

14

第 15 页

[73] Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, Aurelien Rodriguez, Armand Joulin, Edouard Grave, and Guillaume Lample. Llama: Open and efficient foundation language models, 2023. URL https: //arxiv.org/abs/2302.13971.

[74] Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al. Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv:2307.09288, 2023.

[75] Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, et al. Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features. arXiv preprint arXiv:2502.14786, 2025.

[76] Thomas Unterthiner, Sjoerd Van Steenkiste, Karol Kurach, Raphael Marinier, Marcin Michalski, and Sylvain Gelly. Towards accurate generative models of video: A new metric & challenges. arXiv preprint arXiv:1812.01717, 2018.

[77] Aaron van den Oord, Oriol Vinyals, and Koray Kavukcuoglu. Neural discrete representation learning. In NeurIPS, 2017.

[78] Homer Rich Walke, Kevin Black, Tony Z Zhao, Quan Vuong, Chongyi Zheng, Philippe Hansen-Estruch, Andre Wang He, Vivek Myers, Moo Jin Kim, Max Du, et al. Bridgedata v2: A dataset for robot learning at scale. In Conference on Robot Learning, pages 1723–1736. PMLR, 2023.

[79] Jiacong Wang, Bohong Wu, Haiyong Jiang, Zhou Xun, Xin Xiao, Haoyuan Guo, and Jun Xiao. World to code: Multi-modal data generation via self-instructed compositional captioning and filtering. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pages 4608–4623, 2024.

[80] Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, and Yisen Wang. Monet: Reasoning in latent visual space beyond images and language. arXiv preprint arXiv:2511.21395, 2025.

[81] Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo, Quan Sun, Yufeng Cui, Jinsheng Wang, Fan Zhang, Yueze Wang, Zhen Li, Qiying Yu, et al. Emu3: Next-token prediction is all you need. arXiv preprint arXiv:2409.18869, 2024.

[82] Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, and Jiaqi Wang. Pref-grpo: Pairwise preference reward-based grpo for stable text-to-image reinforcement learning. arXiv preprint arXiv:2508.20751, 2025.

[83] Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, and Jiaqi Wang. Unified reward model for multimodal understanding and generation. arXiv preprint arXiv:2503.05236, 2025.

[84] Zihao Wang, Shaofei Cai, Guanzhou Chen, Anji Liu, Xiaojian Ma, Yitao Liang, and Team CraftJarvis. Describe, explain, plan and select: interactive planning with large language models enables open-world multi-task agents. In Proceedings of the 37th International Conference on Neural Information Processing Systems, pages 34153–34189, 2023.

[85] Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou, et al. Chain-of-thought prompting elicits reasoning in large language models. Advances in neural information processing systems, 35:24824–24837, 2022.

[86] Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng ming Yin, Shuai Bai, Xiao Xu, Yilei Chen, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhengyi Wang, An Yang, Bowen Yu, Chen Cheng, Dayiheng Liu, Deqing Li, Hang Zhang, Hao Meng, Hu Wei, Jingyuan Ni, Kai Chen, Kuan Cao, Liang Peng, Lin Qu, Minggang Wu, Peng Wang, Shuting Yu, Tingkun Wen, Wensen Feng, Xiaoxiao Xu, Yi Wang, Yichang Zhang, Yongqiang Zhu, Yujia Wu, Yuxuan Cai, and Zenan Liu. Qwen-image technical report, 2025. URL https://arxiv.org/abs/2508.02324.

[87] Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, et al. Omnigen2: Exploration to advanced multimodal generation. arXiv preprint arXiv:2506.18871, 2025.

[88] Jialong Wu, Shaofeng Yin, Ningya Feng, Xu He, Dong Li, Jianye Hao, and Mingsheng Long. ivideogpt: Interactive videogpts are scalable world models. NeurIPS, 37:68082–68119, 2024.

15

第 16 页

[89] Xiaoshi Wu, Yiming Hao, Keqiang Sun, Yixiong Chen, Feng Zhu, Rui Zhao, 和 Hongsheng Li。Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis. arXiv preprint arXiv:2306.09341, 2023.

[90] Jinheng Xie, Zhenheng Yang, 和 Mike Zheng Shou。Show-o2: Improved native unified multimodal models. arXiv preprint arXiv:2506.15564, 2025.

[91] Jiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong, Qinkai Li, Ming Ding, Jie Tang, 和 Yuxiao Dong。Imagereward: Learning and evaluating human preferences for text-to-image generation. Advances in Neural Information Processing Systems, 36:15903–15935, 2023.

[92] Zeyue Xue, Jie Wu, Yu Gao, Fangyuan Kong, Lingting Zhu, Mengzhao Chen, Zhiheng Liu, Wei Liu, Qiushan Guo, Weilin Huang, 等。Dancegrpo: Unleashing grpo on visual generation. arXiv preprint arXiv:2505.07818, 2025.

[93] An Yang, Baosong Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Zhou, Chengpeng Li, Chengyuan Li, Dayiheng Liu, Fei Huang, 等。Qwen2 technical report. arXiv preprint arXiv:2407.10671, 2024.

[94] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, 等。Qwen3 technical report. arXiv preprint arXiv:2505.09388, 2025.

[95] Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, 等。Reasoning via video: The first evaluation of video models’ reasoning abilities through maze-solving tasks. arXiv preprint arXiv:2511.15065, 2025.

[96] Ling Yang, Ye Tian, Bowen Li, Xinchen Zhang, Ke Shen, Yunhai Tong, 和 Mengdi Wang。Mmada: Multimodal large diffusion language models. arXiv preprint arXiv:2505.15809, 2025.

[97] Yi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, 等。R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 2376–2385, 2025.

[98] Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Weinan Dai, Tiantian Fan, Gaohong Liu, Lingjun Liu, 等。Dapo: An open-source llm reinforcement learning system at scale. arXiv preprint arXiv:2503.14476, 2025.

[99] Weihao Yu, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Kevin Lin, Zicheng Liu, Xinchao Wang, 和 Lijuan Wang。Mm-vet: Evaluating large multimodal models for integrated capabilities. arXiv preprint arXiv:2308.02490, 2023.

[100] Shihao Yuan, Yahui Liu, Yang Yue, Jingyuan Zhang, Wangmeng Zuo, Qi Wang, Fuzheng Zhang, 和 Guorui Zhou。Ar-grpo: Training autoregressive image generation models via reinforcement learning. arXiv preprint arXiv:2508.06924, 2025.

[101] Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, 等。Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 9556–9567, 2024.

[102] Zhuosheng Zhang, Aston Zhang, Mu Li, 和 Alex Smola。Automatic chain of thought prompting in large language models. arXiv preprint arXiv:2210.03493, 2022.

[103] Kai Zou, Ziqi Huang, Yuhao Dong, Shulin Tian, Dian Zheng, Hongbo Liu, Jingwen He, Bin Liu, Yu Qiao, 和 Ziwei Liu。Uni-mmmu: A massive multi-discipline multimodal unified benchmark. arXiv preprint arXiv:2510.13759, 2025.

16

第 17 页

附录

在本补充附录中,我们提供额外的细节和分析:

• 附录 A 涵盖两阶段训练流程的实现细节

• 附录 B 展示对 VR-X 基准和评估指标的进一步分析

• 附录 C 包含额外的消融研究和可视化结果。

A 实现细节

A.1 冷启动初始化

数据构建。我们从多个来源构建 SFT 训练数据,如表 4 所示。这些数据集在规模和多样性上各不相同;我们在训练过程中根据样本数量对所有子集进行加权。利用图 5 所示的流程,我们将原始数据过滤为精心策划的训练样本。该数据处理流程包含四个阶段。首先,我们从源数据中选择原始视频序列,并通过 PySceneDetect [9] 在 0.27 FPS 下进行场景感知的时间采样,这比随机采样保留了更丰富的信息。随后,基于 SigLIP2 [75] 进行去重,并利用 VLM 进行过滤,以去除低质量帧(如面部特写、模糊帧和黑屏),通常从一分钟长的视频中提取数百帧。其次,我们利用 Qwen3.5-397B [54] 从采样的序列中合成面向推理的问题及相应的文本答案,每条轨迹包含约 10 个关键步骤。第三,基于这些问答对,我们提示 Qwen3.5 识别最相关的查询图像和关键步骤帧。最后,我们应用严格的质量过滤器以丢弃低质量样本,包括图文不匹配、无需推理或规划的琐碎问题以及视觉质量差的样本。该流程过滤掉了近 80% 的候选池,确保剩余样本代表信息量最丰富且逻辑严密的视觉推理轨迹。

对于 VisualCoT 和 ZebraCoT 等非视频来源(它们已格式化为图像序列),我们跳过时间采样,并将其标准化以匹配视频衍生数据。总体而言,我们从 150 万原始候选样本中精心策划了 31 万冷启动初始化样本。

优化。对于冷启动初始化,我们从 Emu3.5-34B 初始化,并在 32 块 GPU 上使用全参数,按照表 3(第二列)中的配置训练 UniVR。每张图像在短边缩放至 512,并通过 Emu3.5 的 VQ tokenizer 进行分词,每张图像产生 1,000–1,500 个 token。我们将每个样本的最大序列长度限制为 15,000,以减少训练开销,同时容纳跨越数分钟的推理轨迹。

A.2 强化学习

数据构建。UniVR 采用一种新颖的视觉推理奖励,这需要具有复杂推理过程的序列。为此,我们使用初始化后的模型从原始 31 万训练集中过滤出困难样本,得到约 3,000 个样本。该子集包含约 2,000 个长期规划轨迹(主要跨越 6–10 个推理步骤)和 1,000 个通用推理数据,以保持任务多样性。

优化。对于强化学习,我们从 SFT 检查点初始化,并在 32 块 GPU 上使用全参数,按照表 3(第三列)中的配置进行训练。Qwen 评估器部署在额外的 8 块 GPU 上。为了提高训练效率,我们使用 Qwen3-VL-30B-A3B 作为评估器。更大规模的变体(例如 Qwen3-VL-235B 或 Qwen3.5-397B)能产生更准确的奖励,但会显著增加训练延迟。在 rollout 期间禁用无分类器引导(CFG)。

B VR-X 基准详情

VR-X 评估集包含由专业标注员从保留子集(详细分布见表 4)中精心策划的 1,800 个高质量推理轨迹。VR-X 采用两项指标:VLM 分数和 JEPA 相似度分数,详见下文。

17

第 18 页

图 5 数据生成流程。

VLM 评估细节。对于 VLM 评分,我们设计了一个统一的提示词,涵盖视觉质量、任务完成度、逻辑连贯性、物理动态和时序一致性。真实标签(GT)和生成的序列均输入到 VLM 中,使其能够参考 GT 的逻辑过程和动作动态,从而做出更准确的判断。为了评估 VLM 与人类评估之间的一致性,我们首先由专业标注员对基准测试中的模型输出进行评分。随后,对这些样本进行随机打乱,并呈现对应的 VLM 评分和人类评分,让标注员判断哪一方更优。由此,我们计算斯皮尔曼(Spearman)

18

第 19 页

仅依赖全局推理会导致将错误案例误评为高奖励。

请将衣服挂在衣架上。

请帮我倒红酒。

请更换空的纸巾盒。

无步骤级推理奖励 有步骤级推理奖励 1

0.9

奖励 0.80.7

0.6 平均

0.5

0.4 1 21 41 61 81 101 121 141 161 181 1 21 41 61 81 101 121 141 161 181 强化学习步数 强化学习步数

图 6 视觉推理奖励分析。(上)仅依赖全局奖励会忽略长程规划任务中的步骤级错误,例如衣架穿透衣物(第一行)、错误的液体倾倒动力学(第二行)以及纸巾之间的抖动过渡(第三行)。(下)有无步骤级奖励分量的强化学习奖励曲线。

人类与视觉语言模型(VLM)评分之间的相关性 [69] 约为 0.85,表明与人类对齐程度较高。

JEPA 评估细节。对于 JEPA 分数,我们遵循 [45] 中的实现。具体而言,其计算类似于传统的视频指标如 FVD [76],但用 V-JEPA [1] 编码器替换了 I3D [8] 特征提取器。图像序列被压缩为 1280 维的潜在向量,并通过带有多项式核的最大均值差异(MMD)计算两个特征分布之间的距离——距离越小表示相似度越高。由于 V-JEPA 编码器旨在编码时空一致性和物理动力学,JEPA 分数作为 VLM 分数的补充,用于评估生成的序列是否符合现实世界的过渡。该指标仅应用于长期规划子集,因为它针对包含现实世界动态的视觉序列,不适用于单步推理任务或一般推理中的模拟场景。与 FVD 相比,JEPA 分数在约 1,000 个样本时收敛,这与 VR-X 基准的规模一致。

19

第 20 页

表 3 Cold-Start 和 RL 阶段的训练超参数。

| 超参数 | Cold-Start | RL | | :— | :— | :— | | 学习率 | $5 \times 10^{-4}$ | $1 \times 10^{-5}$ | | 学习率调度器 | Cosine | Cosine | | 权重衰减 | 0.1 | 0.1 | | 梯度范数裁剪 | 5.0 | 5.0 | | 预热步数 | 700 | 0 | | 训练步数 | 10k | 250 | | 序列长度 | 15000 | 15000 | | 批次大小 | 128 | 128 | | 分辨率 | [512, 640] | [512, 640] | | $\lambda$ | – | 2.0 |

表 4 数据构成。

| 类别 | 数据来源 | 帧数 | 比例 | | :— | :— | :— | :— | | 视觉引导 | EgoDex [30] | 289,053 | 23.7% | | | Action100M [10] | 109,029 | 5.0% | | | Epic-kitchen [16] | 53,605 | 2.5% | | | VideoCraftBench [59] | 2,272 | 1.0% | | 机器人操作 | AgiBot [7] | 427,267 | 24.5% | | | Droid [34] | 13,000 | 1.0% | | | Bridge [78] | 14,850 | 1.6% | | | ZebraCoT-Robot [36] | 54,270 | 3.5% | | 编辑 | ZebraCoT-Multiobject [36] | 128,075 | 6.5% | | 空间感知 | ThinkMorph-Navigation [24] | 68,568 | 11.2% | | | ZebraCoT-Embodiment [36] | 58,931 | 3.2% | | 视觉搜索 | VisualCoT [63] | 30,000 | 4.9% | | | ThinkMorph-Search [24] | 13,980 | 2.3% | | 谜题与游戏 | VRBench [95] | 13,000 | 1.0% | | | Zebra-Jigsaw [36] | 43,798 | 7.1% | | | ThinkMorph-VisPuzzle [24] | 13,000 | 1.0% |

C 更多分析与可视化

视觉推理奖励缓解了奖励黑客行为。图 6 展示了额外的案例,其中仅凭全局推理奖励即可产生近乎完美的 VLM 分数,但人工检查揭示了物理和逻辑错误,例如不合理的衣架-衣物交互、错误的倒酒动力学以及有缺陷的毛巾替换逻辑。这些样本持续时间较长(30 秒以上),错误仅局限于少数几帧,而全局 VLM 评估很容易忽略这些错误。这种现象反映在训练曲线中(图 6,左下角):全局奖励曲线出现尖锐的峰值和顶部的振荡,表明存在寻求捷径的行为,而忽视了中间步骤的正确性。相比之下,VR-GRPO 曲线(右下角)上升更为平滑,表明奖励黑客风险显著降低。

VR-GRPO 稳定了长视界视觉推理。 我们通过将测试样本划分为四个基于持续时间的组别:<10s、10–30s、30–60s 和 >60s,分析了 VR-GRPO 在不同时间视界下的可扩展性。如表 5 所示,VR-GRPO 在 >30s 的序列上带来了最显著的提升。我们将此归因于其步骤级奖励设计,该设计显式地维持了中间阶段的逻辑连贯性和物理一致性。通过纠正易出错的步骤,VR-GRPO 有效地缓解了…

| 方法 | <10s | 10-30s | 30-60s | >60s | | :— | :— | :— | :— | :— | | Emu3.5 | 54.2 | 48.0 | 38.9 | 21.7 | | Cold-Start | 58.7 | 54.5 | 41.1 | 26.9 | | UniVR | 71.1 | 61.0 | 56.7 | 45.6 | | △ v.s. Emu3.5 | ↑16.9 | ↑13.0 | ↑17.8 | ↑23.9 |

表 5 不同时间跨度下的性能。

20

第 21 页

请将桌上的礼物打一个简单的结。

将桌上的书放入角落的储物箱中。

图 7 与 Gemini 和 Emu3.5 的对比。每组中,第一、第二和第三行分别对应 Gemini 3 Pro + Nano Banana 2、Emu3.5 和 UniVR。

门控机制复合了通常在长程预测中累积的错误,从而在扩展的推理轨迹上表现出更优越的稳定性。

与基线的更多对比。图 7 提供了与 Gemini 3 Pro + Nano Banana 2 和 Emu3.5 在相同测试样本上的更多并排对比。尽管这两个基线模型生成了高保真的视觉外观,但在细粒度任务(如绳索操作、衣物展开与折叠、纸张折叠动力学以及策略执行期间的环境一致性)中表现出执行不准确。得益于我们的视觉推理训练流水线,UniVR 实现了相当的视觉保真度,同时展现出更优越的逻辑连贯性和物理一致性。

更多可视化。图 8 展示了 UniVR 在额外场景中的结果,生成了具有连贯逻辑、物理动态和时间一致性的长视界序列。

局限性。尽管取得了这些令人鼓舞的结果,UniVR 仍存在几个值得注意的局限性。首先,我们在 34B 规模模型上使用长视觉序列进行训练,需要大量的计算资源,这可能限制了可访问性。其次,尽管 VR-GRPO 通过其步骤级设计提高了评估质量,但我们的奖励机制仍然依赖于具有有限细粒度物理世界知识的一般用途 VLM。需要一个更强大的、原生基于视觉世界动态的奖励系统。最后,尽管视觉推理在习得复杂世界知识和增强多模态理解方面具有巨大潜力,但实现原生视觉、文本和听觉推理之间的最佳协同作用仍是未来工作中的一个开放问题。

21

第 22 页

如何将衣服挂在衣架上?

挑选一个洋葱、一根黄瓜和一根玉米。

请告诉我如何烤面包?

请将衣服折叠成整齐的方块。

我该如何扎丸子头?请展示每个步骤。

请用4个步骤画一头牛。

请用积木搭建一个塔。

如何炒秋葵?

如何使用给定的食材制作汉堡包?

图8 UniVR的更多可视化结果。

22

发表评论