HDR:分层去噪实现视频多步逻辑推理与流式生成

三分钟导读:本文提出HDR框架,通过树状分层潜在变量和稀疏层级注意力模式,在保持流式生成效率的同时,实现了视频模型的多步逻辑推理。

英文题目:Hierarchical Denoising For Multi-Step Visual Reasoning

论文出处:arXiv 每日论文精选 · arXiv:2607.15278

原始论文:PDF / 论文页面

对应视频标题:HDR:分层去噪实现视频多步逻辑推理与流式生成|推荐指数:★★★★★

这篇论文解决什么问题?

现有流式自回归扩散模型推理效率低但缺乏多步修订能力,双向扩散模型支持全局修订但计算成本高且不支持低延迟流式生成。

核心创新

  • 提出分层去噪框架,结合粗粒度全局规划与细粒度视觉细化
  • 设计熵匹配去噪调度策略,根据层级熵值动态分配去噪步数
  • 提出SHAP稀疏层级注意力模式,实现固定大小的上下文检索
  • 构建包含6个任务的层级多步视频推理基准测试

方法概览

HDR将视频潜在变量组织为树状层级,执行从粗到细的去噪推理;引入熵匹配去噪调度以保留高层假设的不确定性,并使用SHAP(稀疏层级注意力模式)降低计算复杂度。

逐图理解论文

方法:HDR分层去噪框架

方法:HDR分层去噪框架
Figure 2: Overview of HDR. Video latents are organized into a tree-structured hierarchy across multiple temporal resolutions. During training, each hierarchy token is corrupted along a flow- matching path and HDR Video DiT is optimized with a layer-wise objective. During inference, all tree tokens are flattened into a coarse-to-fine autoregressive order. SHAP (Sparse Hierarchical Attention Pattern) defines a structured attention mask over this flattened sequence: each token

HDR将视频潜在变量组织为树状层级,执行从粗到细的去噪推理。在推理阶段,所有树状令牌被展平为自回归顺序。SHAP稀疏层级注意力模式定义了结构化注意力掩码,使每个令牌仅关注固定大小的上下文,从而降低计算复杂度并维持生成效率。

创新:熵匹配去噪调度

创新:熵匹配去噪调度
Table 5: Entropy-matched versus alternative denoising schedules. The entropy-matched schedule allocates fewer denoising steps to coarse layers and more steps to fine layers according to their entropy scale, achieving the best overall average progress and remaining competitive in overall success. Compared with sparse-to-full and exponential schedules, entropy matching provides a better balance between preserving high-level uncertainty and refining fine-grained video states.

为保留高层假设的不确定性,HDR引入熵匹配去噪调度策略。该策略根据层级熵值动态分配去噪步数,粗层级分配较少步数以保留全局假设,细层级分配较多步数以细化视觉状态。相比全去噪或固定步数调度,熵匹配在保持高层不确定性与细化细粒度状态间取得更好平衡。

实验:多步推理基准测试

实验:多步推理基准测试
Figure 3: Visualization of the six multi-step video reasoning benchmarks: maze navigation, Tower of Hanoi, one-line drawing, sliding puzzle, Sokoban, and water pouring. Each task requires logical consistency across multiple reasoning steps rather than only local visual plausibility.

我们构建了包含迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子和水倾倒的六任务层级多步视频推理基准测试。这些任务要求逻辑一致性跨越多个推理步骤,而非仅局部视觉合理性。该基准用于评估模型在长程依赖和逻辑约束下的表现。

结果:性能显著提升

结果:性能显著提升
Table 1: Main comparison on multi-step video reasoning benchmarks. Scores are reported as mean ± standard deviation for success and average progress. The best and second-best means are shown in bold and underlined, respectively. Full-attention baselines are grayed out. Compared with CausalForcing, HDR improves overall success from 34.22 to 60.29 and average progress from 76.00 to 89.56.

在自建六任务推理基准上,HDR对比CausalForcing和Bidirectional Diffusion。结果显示,整体成功率从34.22提升至60.29,平均进度从76.00提升至89.56。这表明分层去噪框架能有效避免早期局部承诺导致的错误,实现更可靠的逻辑推理。

效率:推理速度对比

效率:推理速度对比
Table 2: Inference speed comparison. Latency is the average time required for each streaming generation step after KV-cache initialization.

在推理速度方面,HDR表现出显著优势。其推理延迟为0.70s/latent,比双向扩散快54.2倍。这一速度是在KV-cache初始化后的状态下测得的,证明了HDR在保持流式生成效率的同时,并未牺牲推理的实时性,适合低延迟应用场景。

实验与关键结果

  • 在自建六任务推理基准上对比CausalForcing和Bidirectional Diffusion
  • 分析层级数量、去噪步数减少和数据量减少对性能的影响
  • 在真实世界机器人迷宫任务中进行迁移实验
  • 在RoboDojo仿真基准上评估HDR-WAM的世界动作建模能力
  • 整体成功率从34.22提升至60.29(第 7 页)
  • 平均进度从76.00提升至89.56(第 7 页)
  • 推理延迟0.70s/latent,比双向扩散快54.2倍(第 7 页)
  • 使用2%训练数据时保留82.9%的全数据成功率(第 9 页)
  • RoboDojo整体得分5.47,平均成功率3.00%(第 10 页)

阅读时需要注意

  • 在部分长程推理任务末尾可能出现物理不一致(如墙壁消失)
  • 极端数据缩减下性能仍有下降
  • 复杂物理交互场景(如液体混合)可能出现视觉合理但逻辑错误的结果
  • 基准测试主要基于合成视频,真实世界域偏移可能影响性能
  • 推理速度依赖于KV-cache初始化后的状态
  • 层级数量增加虽提升性能但也增加计算开销

关联工作

  • CausalForcing:流式自回归扩散基线模型(第 2 页)
  • Bidirectional Diffusion:支持全局修订但计算昂贵的基线模型(第 2 页)
  • RoboDojo:用于评估世界动作建模的仿真基准(第 9 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

用于多步视觉推理的分层去噪

钱泽忠1,6, 迟晓伟2,6, 麦泽荣1,6, 周天泽3,6, 袁瑞斌2,5, 芮宇涵1,6, 孙恒哲1, 吴卓群4, 李明宇1, 钱思远1, 韩思锐2, 张尚航1

1 多媒体信息处理国家重点实验室,计算机学院,北京大学 2 香港科技大学 3 北京航空航天大学 4 福州大学 5 多模态艺术投影 6 墨卡机器人

摘要 2026

视频模型近期正演变为视觉基础模型,但它们仍缺乏类人的多步推理能力。现有的流式自回归扩散模型虽然高效,但缺乏推理能力;而双向扩散模型允许全局修订,但由于固定序列去噪中的密集帧,推理成本高昂。因此,这两种范式在复杂推理任务中均难以在低延迟流式传输下保持逻辑一致性。为填补这一空白,我们提出了 HDR(Hierarchical Denoising for Visual Reasoning,用于视觉推理的分层去噪),这是一种通过将分层潜在变量整合到因果视频生成过程中来实现多步推理的统一框架。HDR 将视频潜在变量组织为树状层次结构,以便在流式输出之前执行由粗到细的推理。粗略的去噪层为全局规划保持不确定的假设,而更精细的去噪层则逐步将其细化为具体的视觉状态。稀疏分层注意力模式(SHAP)进一步降低了时间注意力成本。我们构建了一个包含分布外案例的层级化多步视频推理基准测试,涵盖六个任务:迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子以及倒水。与流式自回归扩散基线相比,HDR 在多步推理准确率方面的整体成功率从 34.22 提升至 60.29(相对提升 76.2%),平均进度从 76.00 提升至 89.56,表明中间推理轨迹更加一致。在部署效率方面,HDR 保持了 0.70 秒/潜在变量的低延迟流式传输速度,比流式传输期间的双向扩散快 54.2 倍。HDR 还展现出强大的数据效率,仅使用 2% 的训练数据即可保留其全数据成功率分数的 82.9%,而双向扩散仅为 52.0%。在真实世界机器人上的进一步实验展示了 HDR 在物理交互中的潜力,为物理世界建模提供了一种新范式。项目演示页面位于 https://hierarchical-diffusion-reasoning.github.io/。arXiv:2607.15278v1

1 引言

视频模型正从逼真的视频合成器演变为具备视觉推理能力的通用视觉基础模型 [27, 26, 25, 28, 39, 37, 13]。最近的工作如 Veo3 [27] 表明,大型视频生成模型可以解决迷宫导航、对称补全等任务,

第 40 届神经信息处理系统大会(NeurIPS 2026)。

第 2 页

帧索引 双向扩散 AR扩散 自回归 HDR( ours) 去噪步骤

速度 速度 速度 速度

推理 推理 推理 推理

生成质量 生成质量 生成质量 生成质量

视频生成目标:

图1:视频生成范式的比较。流式自回归扩散模型效率高,但在可靠的多步推理中过早做出决定;而双向扩散支持全局修订,但需要昂贵的密集固定序列去噪。HDR在流式输出之前执行分层去噪:粗层维持高层假设,细层将其细化为视觉状态,稀疏分层注意力保持生成效率。

物理推理,以及通过生成的视觉轨迹进行的工具使用模拟。互补地,最近对基于扩散的视频推理的分析表明,此类推理与中间去噪状态密切相关,在这些状态下,模型可以在多个步骤中维护和细化候选解决方案 [26]。这些发现提出了一个关键问题:视频模型如何在支持低延迟流式生成的同时,支持可靠的多步推理?

现有的视频生成范式难以同时满足多步推理和低延迟流式生成的需求。流式自回归扩散模型,如 CausVid [34] 和 CausalForcing [41],仅通过过去上下文进行条件约束来高效生成,但这种从左到右的锁定限制了它们修订先前决策和执行多步推理的能力 [30, 4, 9, 16]。相比之下,双向扩散模型联合去噪固定的视频序列,允许跨时间的全局信息流动和修订 [20, 24, 27]。然而,这需要每一步去噪时都进行密集的完整序列更新,导致部署成本高且与流式生成兼容性差 [34, 5, 2, 21]。这些局限性揭示了一个根本性的张力:当前模型要么生成效率高但在多步逻辑一致性方面表现不佳,要么以高延迟的固定序列去噪为代价进行全局推理。

受此观察的启发,我们提出了 HDR(Hierarchical Denoising for Visual Reasoning),这是一个将分层潜在变量集成到流式自回归扩散过程中的统一框架。如图1所示,HDR 将视频潜在变量组织为树状层次结构,并在流式输出之前执行由粗到细的多步推理。这种层次结构为模型在锁定帧级生成之前提供了一个显式的高层规划中间空间。

HDR 的一个关键设计是将去噪强度与层次级别相匹配。HDR 不完全去噪每一层,而是保持粗层处于较高的噪声水平,以便保留多种可能的全局计划,而细层接收更强的去噪和更低的残差噪声,从而将这些计划实例化为具体的视觉状态。HDR 还引入了 SHAP(Sparse Hierarchical Attention Pattern),使每个 token 仅与固定的局部和父级上下文进行通信,以实现快速检索。这使得无需密集的完整序列注意力即可实现多尺度信息流动,在保持流式生成的同时降低了时间注意力成本。

我们构建了一个包含分布外案例的分层多步视频推理基准,涵盖六个任务:迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子和水倒水。这些任务要求模型在多步推理轨迹中保持逻辑一致性,而不仅仅是生成本地合理的运动。实验表明

2

第 3 页

HDR 显著提升了最终任务完成率和中间推理的一致性:它将整体成功率从 34.22 提升至 60.29(相对增益 76.2%),并将整体平均进度得分从 76.00 提升至 89.56。HDR 还保持了高效的流式行为,在流式处理期间每个潜在变量(latent)仅需 0.70 秒,比双向扩散模型快 54.2 倍。此外,HDR 展现出强大的数据效率,在使用仅 2% 的数据进行训练时,仍能保留其全数据成功率 82.9% 的得分,相比之下,双向扩散模型仅为 52.0%。最后,真实世界机器人迷宫实验表明,HDR 能将其分层推理能力迁移至物理交互中,暗示其作为物理世界建模新范式的潜力。

我们的贡献总结如下:

  • 我们识别出多步视频推理中的核心张力:模型必须在长轨迹上保持逻辑一致性,同时支持低延迟的流式生成。
  • 我们提出了 HDR(Hierarchical Denoising for Visual Reasoning),这是一个统一框架,它将分层潜在变量集成到流式自回归扩散中,并在流式输出之前执行由粗到细的推理。
  • 我们引入了与层级匹配的去噪调度(hierarchy-matched denoising schedule)和 SHAP(Sparse Hierarchical Attention Pattern)。前者在粗层保留高层假设并在细层对其进行细化,而后者通过局部和父级上下文降低时间注意力成本。
  • 我们构建了一个包含分布外(OOD)案例的层级分层多步视频推理基准,并展示了 HDR 在推理准确性、数据效率、低延迟流式处理以及物理世界机器人交互方面的优势。

2 相关工作

视频模型推理。最近的研究表明,视频生成模型可以表现出超越视觉真实感的推理行为。VBVR、V-ReasonBench 和 VR-Bench 等基准测试评估了这些能力在结构化问题解决、空间认知、物理动力学、迷宫导航和多步规划方面的表现 [25, 18, 35]。与输入视频固定的视频理解不同,视频生成要求模型构建一个连贯的未来轨迹,该轨迹既要满足局部视觉合理性,又要满足全局任务约束。这使得生成的视频成为世界模型式推理的自然接口,但也使得早期可视化的错误难以纠正 [28]。最近的进一步分析表明,视频扩散模型中的推理与迭代去噪动力学密切相关,其中中间潜在变量维持并细化不确定的假设,而不仅仅是逐帧预测的结果 [26]。然而,现有工作主要对双向生成器中涌现的推理进行基准测试或分析,而不是设计在流式生成约束下保留推理能力的架构 [25, 18, 26]。

自回归视频扩散模型。流式自回归扩散模型用顺序时间计算取代了密集的完整序列去噪,实现了低延迟视频生成和高效的 KV-cache 重用。最近的工作通过分块展开(chunk-wise rollout)、基于队列的去噪、AR 引导扩散、因果注意力、训练-推理对齐、蒸馏、缓存共享和滑动窗口 KV-cache 加速改进了这一范式 [7, 12, 15, 34, 5, 9, 41, 31, 22, 11, 10, 29]。这些特性使得自回归视频模型在闭环机器人交互中具有吸引力 [14, 33],其中低延迟至关重要,且其“上下文即记忆”的结构允许先前生成的视觉状态充当持久的时间记忆 [36, 8]。此外,由于生成是自回归进行的,滑动窗口 KV-cache 机制可以扩展展开长度并支持有效无限长的视频生成 [31, 16, 5]。然而,同样的顺序承诺使得早期决策难以修正:一旦生成了帧或潜在变量块,后续预测就会基于这一已确定的历史进行条件生成。HDR 保留了流式自回归扩散的低延迟结构,同时引入了树状潜在变量层级用于由粗到细的去噪,从而在确定细粒度视觉细节之前,允许对高层规划进行修订。

3 方法

我们提出了 HDR(Hierarchical Denoising for Visual Reasoning),这是一个用于多步视频推理的分层框架。HDR 保留了流式自回归扩散的低延迟流式行为,同时引入了一个用于全局规划和修订的结构化中间过程。

3

第 4 页

展平 清洗后的分层视频令牌 1 1 2 1 2 3 4 3 1 2 2 3 3 3 4 1 1 2 1 2 3 32 F F F F F F F 3 … 1 2 2 3 3 3 6 1 添加 F F F F 1 F含噪 F分层 视频F 令牌F 噪声 1 F1 2 1 损失 … F F 2 2 1 2 F 1 2 2 3 F F HDR 视频 DiT F 2 去噪 3 …… F 3 1 32 3 6 4 1 1 2 1 2 3 6 32 F 4 3 … 1 2 2 3 3 3 6 F分层 树F F F F模型 F 预测F F F F 索引 M F SHAP 层 N (稀疏分层 注意力模式) M 3 N图 2:HDR 概述。视频潜在变量在多个时间分辨率上组织成树状层次结构。在训练期间,每个分层令牌沿流匹配路径被破坏,并使用分层目标优化 HDR 视频 DiT。在推理期间,所有树令牌被展平为从粗到细的自回归顺序。SHAP(稀疏分层注意力模式)在此展平序列上定义了一个结构化的注意力掩码:每个令牌仅关注固定的局部、父级和首帧上下文,而不是整个视频序列。生成的令牌被写入共享的 KV 缓存,并被跨层级层次的后续令牌重用,从而以较低的时间注意力成本实现多尺度信息传播。

我们首先回顾为什么流式自回归生成在多步推理中表现不佳,然后介绍分层潜在表示、分层流匹配目标以及 SHAP(稀疏分层注意力模式),后者支持在展平的树令牌上进行高效推理。

3.1 重新思考用于多步推理的流式自回归生成

我们首先比较双向扩散和流式自回归扩散。令 $z_t = \{z_{t1}, \dots, z_{tN}\}$ 表示去噪步骤 $t$ 处的视频潜在序列,其中 $N$ 是时间潜在令牌的数量,$z_{ti}$ 是时间位置 $i$ 处的令牌。令 $c$ 表示条件信号,例如文本、图像或第一帧。双向视频扩散模型在每个去噪步骤联合更新整个序列 [24, 20]: $z_{t-1} = D_\theta(z_t, t, c)$, (1)

其中 $D_\theta$ 是去噪网络。由于所有时间令牌在中间去噪步骤中保持含噪状态,信息可以在视频确定之前在整个序列中传播。这使得不确定的假设能够在多个去噪步骤中得以保持和细化 [26]。然而,这种全局修订能力伴随着高昂的成本:每一步都重复更新一个密集的固定长度序列,使得双向扩散与低延迟流式传输不太兼容。

自回归扩散通过从左到右地对生成进行因式分解来提高部署效率:

$N$ $p(z | c) = \prod p(z_i | z_{<i}, c)$, (2) $i=1$

其中 $z = \{z_1, \dots, z_N\}$ 是干净的潜在序列,$z_{<i}$ 表示所有先前生成的时间令牌。借助自回归注意力掩码,令牌 $z_i$ 仅关注过去的令牌和条件 $c$,从而启用流式推理和 KV 缓存重用 [34, 41, 9]。然而,这种结构也造成了不可逆的展开:一旦生成 $z_i$,后续预测遵循 $z_i \to p(z_{i+1} | z_{\le i}, c) \to p(z_{i+2} | z_{\le i+1}, c) \to \dots$。如果早期令牌编码了错误的决策,后续令牌必须基于这一已确定的历史进行条件判断,且无法对其进行修订,这削弱了多步推理轨迹中的逻辑一致性。

因此,核心挑战不仅仅是在双向和流式自回归生成之间做出选择。双向扩散支持全局修订,但部署成本高;而流式自回归扩散效率高,但缺乏可修订的多步推理机制。HDR 通过引入潜在变量的层次结构来解决这一张力:粗粒度层级保留含噪的高级假设以进行全局规划,而细粒度层级则逐步将其细化为具体的视觉状态,然后再进行流式输出。

4

第 5 页

3.2 用于视觉推理的分层去噪

HDR 使用潜在标记的树状层次结构来表示视频:

T = {V1, V2, . . . , VL}, Vℓ= {vℓ,1, . . . , vℓ,Nℓ}. (3)

其中,L 是层次结构的层数,Vℓ 是第 ℓ 层的潜在标记集合,Nℓ 是该层的标记数量,vℓ,i 表示第 i 个标记。我们使用 ℓ= 1 表示最粗糙的层,使用 ℓ= L 表示最精细的层。粗糙标记总结全局时间结构并代表高层计划,而精细标记编码局部视觉细节并实例化最终的视频动态。每个非根标记在前一个更粗糙的层中都有一个父标记,记为 π(ℓ, i) = (ℓ−1, pℓ(i))(其中 ℓ> 1),这里 pℓ(i) 将标记 vℓ,i 映射到其在第 ℓ−1 层的父标记索引。父标记代表当前标记所细化的粗糙时间片段。

如图 2 所示,HDR 从输入视频潜在序列构建分层标记,并在流式输出之前执行由粗到细的推理。在训练期间,每个层次标记沿流匹配路径(flow-matching path)被破坏,模型学习在分层上下文下预测相应的速度目标。在推理期间,HDR 由粗到细生成标记:上层形成噪声但可修正的全局假设,而下层将这些假设细化为具体的视觉状态。在每一层内,生成过程从左到右自回归进行,保留了自回归扩散的流式结构。

3.3 逐层流匹配目标

我们现在描述基于分层标记的训练目标。对于干净的层次标记 v0ℓ,i,我们采样噪声标记 ϵ ∼N(0, I),并在连续时间 t ∈[0, 1] 构造插值标记 vtℓ,i = (1 −t)v0ℓ,i + tϵ。在此线性概率路径下,目标速度场为 utℓ,i = ϵ −v0ℓ,i。HDR 网络旨在从插值标记、时间步、分层上下文 hℓ,i 和条件 c 中预测该流动速度。逐层流匹配目标对所有层次层和标记的速度回归损失求和:

L Nℓ 1 . (4) LHDR = X λℓ X Et,ϵ h ϵ −v0ℓ,i −uθ (vtℓ,i, t, hℓ,i, c) 22 i Nℓ ℓ=1 i=1

其中,hℓ,i 表示标记 vℓ,i 可用的稀疏分层上下文,λℓ 平衡不同层次层的贡献。该目标鼓励每一层学习与其中时间抽象相适应的速度场:粗糙层建模全局规划结构,而精细层建模具体的视觉状态和运动细节。

HDR 的一个关键设计是将去噪强度与层次层相匹配。HDR 不使用相同的推理预算分配给每一层,而是使用依赖于层的采样预算 Kℓ,满足 K1 < K2 < · · · < KL。等价地,残差噪声水平由粗到细递减,即 ρ1 > ρ2 > · · · > ρL。故意在较高噪声水平下停止粗糙层的处理,因此它们的预测保持部分随机性,并能保留多种可能的全局计划。更精细的层接收更强的去噪和更低的残差噪声,逐步将这些假设实例化为视觉状态。我们在附录 C 中提供了 Kℓ 的熵匹配推导及其消融实验。

3.4 稀疏分层注意力模式

HDR 使用 SHAP(Sparse Hierarchical Attention Pattern,稀疏分层注意力模式)实现分层推理,这是一种作用于展平树标记的结构化注意力掩码。每个层次标记由 (ℓ, i) 索引,其中 ℓ 是层次层,i 是该层内的时间位置。为了进行自回归推理,我们使用 ϕ(ℓ, i) = i + Pr<ℓNr 将所有树标记展平为从粗到细的顺序,其中 s = ϕ(ℓ, i) 表示展平后的标记索引。因此,首先生成 V1 中的所有标记,然后是 V2,依此类推,直到最精细的层 VL。这种顺序与图 2 中所示的推理路径相匹配:高层标记在细化它们的低层标记之前生成。

对于标记 vℓ,i,SHAP 首先在树坐标中定义其稀疏上下文:

ASHAP(ℓ, i) = 1[i > 1]{(ℓ, i −1)} ∪1[i = 1]{xref} (5) ∪1[ℓ> 1]{π(ℓ, i), left(π(ℓ, i)), right(π(ℓ, i))}.

5

第 6 页

此处,$x_{\text{ref}}$ 为清洁的第一帧条件,$(\ell, i-1)$ 提供同层自回归连续性,$\pi(\ell, i)$ 为较粗层级的父级 token。相邻的父级 token $\text{left}(\pi(\ell, i))$ 和 $\text{right}(\pi(\ell, i))$ 提供来自相邻粗粒度片段的边界信息。无效的边界索引被省略。对于没有父级的根层级 token,层级上下文简化为第一帧条件和同层自回归上下文。

随后,将树状上下文转换为展平序列上的二元注意力掩码。令 $S = \sum_{\ell=1}^{L} N_\ell$ 为层级 token 的总数,$\mathbf{M}_{\text{SHAP}} \in \{0, 1\}^{S \times S}$ 为 SHAP 掩码。对于 $s = \phi(\ell, i)$ 和 $r = \phi(\ell', j)$,我们定义: $$ \mathbf{M}_{\text{SHAP}}[s, r] = \mathbb{I}[(\ell', j) \in \mathcal{A}_{\text{SHAP}}(\ell, i)] \quad . \quad (6) $$

该掩码在构造上就是稀疏的:每一行仅包含恒定数量的有效注意力目标,与视频长度无关。它在展平顺序下也是自回归的,因为每个有效的上下文 token 要么是之前的同层 token,要么是已经生成的较粗层级 token,或者是第一帧条件。

SHAP 自然地诱导了跨层级的 KV-cache 共享。在推理过程中,一旦生成了 token $v_{\ell,i}$,其键值状态就被写入全局层级缓存中,记为 $C_s = C_{s-1} \cup \{(k_{\ell,i}, v_{\text{KV},\ell,i})\}$,其中 $s = \phi(\ell, i)$。当生成后续 token $v_{\ell',j}$ 时,HDR 仅检索由 SHAP 掩码选中的缓存状态,即 $h_{\ell',j} = \text{Attn}(q_{\ell',j}, \{(k_{\ell,i}, v_{\text{KV},\ell,i}) : \mathbf{M}_{\text{SHAP}}[\phi(\ell', j), \phi(\ell, i)] = 1\})$。因此,通过共享的 KV-cache,在粗粒度层级生成的信息被低层级复用,而同层自回归链接则保留了局部时间连续性。由于每个 token 仅关注固定大小的 SHAP 上下文,而非密集的完整序列 token,HDR 在流式输出前维持多尺度信息流的同时,降低了时间注意力成本。

4 实验

我们从两个维度评估 HDR:多步推理能力和低延迟流式生成效率。第 4.1 节介绍了基准、指标、基线和实现设置。第 4.2 节将 HDR 与全注意力基线和流式基线进行比较。第 4.3 节分析层级层数的影响,第 4.4 节测试在减少去噪预算和有限数据下的鲁棒性,第 4.5 节评估向真实世界机器人交互的迁移。

4.1 基准、基线和实现细节

基准和指标。现有的视频推理基准并不完全适合评估流式多步生成:许多基准未发布完整的评估脚本,且大多数强调短片段或感知一致性,而非跨多个推理步骤的逻辑一致性。因此,我们构建了一个包含六个任务的受控基准套件:汉诺塔、迷宫导航、一笔画、滑动拼图、推箱子(Sokoban)和倒水。该基准按难度分层,并包含 OOD(分布外)案例,以测试超出频繁训练模式的规则迁移能力。评分评估集包含 370 个保留视频。每个任务均使用成功率(Success)进行评估,该指标衡量任务的精确完成度;以及平均进度(Average Progress),该指标衡量部分进度并反映中间逻辑一致性。我们报告的任务结果为“成功率 / 平均进度”对,并计算六个任务上的未加权平均值作为整体性能。完整的基准构建和特定任务的评估细节见附录 B。

基线和实现。我们将 HDR 与全注意力基线进行比较,包括双向扩散模型和 VideoMAE [23],以及与流式基线进行比较,包括 CausalForcing [41] 和 VideoGPT [30]。为了进行受控比较,主要的扩散基线和 HDR 均基于 Wan2.2-5B-TI2V [24] 构建;HDR 使用六个潜在层级,并采用熵匹配的去噪调度 [5, 8, 13, 20, 32, 50]。所有方法均在相同的 18,000 视频推理数据集上进行训练,以第一帧为条件,并使用相同的 Flow-matching 训练设置进行优化。完整的基线定义、训练细节和实现设置见附录 I。

4.2 主要结果:弥合推理精度与流式效率

HDR 提高了多步推理轨迹的最终成功率及其中间逻辑一致性。我们通过表 1 中的定量比较来支持这一结论,以及

第 7 页

迷宫 汉诺塔 一笔画 滑动拼图 推箱子 倒水

图 3:六个多步视频推理基准的可视化:迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子和倒水。每个任务都需要跨多个推理步骤的逻辑一致性,而不仅仅是局部视觉合理性。

表 1:多步视频推理基准上的主要对比。得分报告为成功率和平均进度的均值 ± 标准差。最佳和次佳结果分别以粗体和下划线显示。全注意力基线以灰色显示。与 CausalForcing 相比,HDR 将整体成功率从 34.22 提高到 60.29,平均进度从 76.00 提高到 89.56。

方法 全注意力 指标 汉诺塔 迷宫 一笔画 滑动 推箱子 倒水 整体

VideoMAE [23] ✓ 成功率 22.50±6.18 52.00±8.96 58.33±9.67 1.67±0.00 63.33±9.42 43.33±4.94 40.53±6.53 平均进度 58.23±3.80 93.40±1.32 91.92±1.71 49.93±0.00 100.00±0.00 73.26±2.48 77.79±1.55

双向 [24] ✓ 成功率 45.00±6.78 90.00±3.12 81.67±7.60 31.67±6.98 90.00±4.21 21.67±6.83 60.00±5.92 平均进度 73.58±2.95 99.89±0.11 99.26±0.27 93.00±1.56 100.00±0.00 57.08±3.66 87.13±1.42

VideoGPT [30] ✗ 成功率 18.75±5.70 22.00±12.83 31.67±7.73 10.00±5.57 15.00±5.46 8.33±3.00 17.57±6.71 平均进度 25.82±5.46 26.32±12.30 81.74±2.34 27.81±4.01 23.50±4.91 38.03±3.56 36.88±5.43

CausalForcing [41] ✗ 成功率 45.00±6.73 12.00±8.08 48.33±7.66 21.67±5.16 40.00±10.69 38.33±5.25 34.22±7.26 平均进度 70.47±2.76 55.04±8.36 95.15±1.28 86.13±2.62 82.25±5.79 66.94±3.03 76.00±3.97

HDR ✗ 成功率 58.75±4.50 78.00±5.25 70.00±10.12 33.33±7.93 78.33±9.67 43.33±4.79 60.29±7.04 平均进度 79.62±3.04 97.18±1.07 97.84±0.61 93.69±1.47 99.69±0.31 69.34±2.84 89.56±1.56

图 4 中的定性示例。我们在表 2 中进一步评估了流式传输效率,显示 HDR 保持了与 AR 扩散基线 [41] 相当的延迟。

整体对比。表 1 展示了我们在多步视频推理基准上的主要对比。与流式自回归扩散基线 CausalForcing 相比,HDR 将整体成功率从 34.22 提高到 60.29,相对增益为 76.2%。平均进度也从 76.00 增加到 89.56,表明中间逻辑一致性更强。以灰色显示的全注意力基线实现了密集的全局交互,但与低延迟流式传输不太一致。尽管 HDR 不使用全时间注意力,但它实现了最佳的整体成功率和平均进度,表明分层去噪可以在保留自回归扩散流式结构的同时恢复强大的推理精度。

可修订规划的定性证据。图 4 比较了 CausalForcing 和 HDR 在迷宫和一笔画案例中的表现。CausalForcing 会坚持早期的局部决策,从而导致失败:在迷宫中走错分支,或在一笔画中错过顶部方块。相反,HDR 通过在提交细粒度输出之前通过分层规划解决歧义决策点,从而成功完成任务。

流式传输效率。我们在表 2 中进一步报告了推理速度。延迟是指 KV-cache 初始化后每个流式生成步骤所需的时间。HDR 实现了与 CausalForcing 相当的延迟,0.70 秒对比 0.72 秒,而双向扩散的延迟为 37.92 秒,HDR 的速度要快得多。这表明 HDR 在改善多步推理的同时,保留了低延迟的流式传输行为。

7

第 8 页

基线

决策点: 早期 失败 决策点: 早期 失败 向右还是向下? 承诺 向上/左/向下? 承诺 错误的路径 错误的路径

我们的方法

决策点: 分层 成功 决策点: 分层 成功 向右还是向下? 规划 向上/左/向下? 规划 选择正确 选择正确 的路径 的路径

图 4:基线(CausalForcing)与 HDR 在迷宫(Maze)和单行(One-line)任务上的定性比较。CausalForcing 做出早期的局部承诺,导致失败,而 HDR 在承诺最终轨迹之前进行分层规划。

HDR 图 5: 分层层重要性。 成功 平均进度 曲线显示带有一个标准差带的平均性能。 70 90 将活动分层层数从 1 60 59.15 60.31 60.29 85 84.09 88.38 89.31 89.56 层增加到 6 层, 50(%) 40.12 6 层始终 改善 HDR 超过 79.26 [41], 80得分 40 38.38 CausalForcing 表明 每一层 30 34.22 75 76.00 层都对完整的由粗到

20 70 1 2 3 4 5 6 1 2 3 4 5 6 细的推理过程做出贡献。 层数 层数

4.3 机制分析:逐层分析

分层层重要性。我们研究随着活动分层层数的增加,性能如何变化。图 5 按层数重新组织了变体,从等同于 CausalForcing 的单层设置到完整的六层 HDR 分层结构。单层设置缺乏由分层启用的由粗到细的推理过程。随着引入更多层,模型获得了越来越丰富的高级规划和更强的多步推理行为。这一趋势表明,HDR 的优势不仅仅来自最终的帧级细化:每个分层级别都提供了有用的结构,更深的分层带来更好的性能。

4.4 鲁棒性:在减少预算和有限数据下的性能

去噪步骤减少。我们首先研究在减少去噪预算下的鲁棒性。图 6(a) 比较了 CausalForcing、双向扩散和 HDR,随着推理去噪步骤数的减少。两个基线在激进的步骤减少下性能大幅下降:双向扩散在一步时整体成功率从 60.00 降至 17.78,而 CausalForcing 从 34.22 降至 11.25。相比之下,HDR 保持显著更强的鲁棒性,在一步去噪时达到 34.72 的成功率,并保留了其全步骤性能的 57.6%,而双向扩散和 CausalForcing 基线分别为 29.6% 和 32.9%。

数据减少。我们测试 HDR 是否可以从有限数据中学习推理规则。图 6(b) 比较了使用完整训练集、10% 和 2% 数据的 HDR 和双向扩散,任务级结果见附录表 10。随着数据减少,HDR 的下降更为平缓:仅使用 2% 的训练数据时,它保留了其全数据成功率的 82.9% 和全数据平均进度的 97.2%,而双向扩散分别为 52.0% 和 89.5%。这表明分层为学习可迁移的任务规则提供了有用的归纳偏置,而不仅仅是记忆训练样本。

综上所述,这些消融实验表明 HDR 的鲁棒性源于其分层架构。模型在有限的去噪预算下仍然有效,因为粗层提供稳定的全局指导,而低层将此指导细化为详细的视觉状态。相反,当缺少粗层或训练数据有限时,分层推理过程成为决定模型能否保持多步逻辑一致性的关键因素。

8

第 9 页

Causal Bidirectional HDR Bidirectional HDR

Success Avg. Progress Success Avg. Progress

75 70 89.56 88.83 89.56 89.46 60.29 60.46 60.29 90 90 57.82 87.05 60 60 87.13 60.00 50.00 86.73 75.40 60.00 58.77 45 50 87.13 85 (%) 55.28 (%) 34.72 75 86.24 76.00 73.47 Score 30 63.66 Score 40 17.78 34.22 31.29 31.18 80 77.94 15 Retention at 1 step: 1-step / 50-step x 100 60 Retention at 1 step: 1-step / 50-step x 100 63.55 30 Retention at 2% data: 2% / Full x 100 Retention at 2% data: 2% / Full x 100 HDR 57.6% | Causal 32.9% | Bidir. 29.6% 11.25 HDR 84.2% | Causal 83.6% | Bidir. 73.1% HDR 82.9% | Bidir. 52.0% HDR 97.2% | Bidir. 89.5% 0 20 75 50 5 1 50 5 1 Full 10% 2% Full 10% 2% Denoising steps Denoising steps Training data scale Training data scale

(a) 去噪步数减少。HDR 比 CausalForcing [41]、流式自回归扩散基线以及双向扩散更具鲁棒性。 (b) 数据减少。随着训练数据规模从全集减少到 10% 和 2%,HDR 的退化比双向扩散更为平缓。

图 6:HDR 的鲁棒性消融实验。曲线显示平均性能,阴影带表示一个标准差。左图评估减少的去噪预算,右图评估减少的训练数据规模。完整的任务级数据减少结果见附录表 10。

OOD Easy Medium Hard (Irregular) Figure 7: Physical-world robot maze experiment. We fine-tune both CausalForc- ing [41] and HDR using only 50 real-world robot maze videos, then use an in- verse dynamics model (IDM) to convert generated videos into executable robot ac- tions. HDR maintains strong success rates across easy, medium, hard, and OOD 100 100 100 100 80 (%) (%) (%) 100 80 (%)100 80 mazes, where OOD mazes Rate Rate 60 Rate Rate Success 50 Success 50 Success 50 Success 50 20 contain diagonal or stacked 0 0 0 0 0 wooden blocks. 80 / 100 60 / 100 0 / 80 20 / 80

Causal (Baseline) HDR (Ours)

4.5 物理世界建模:迁移至机器人交互

为了评估 HDR 是否能在合成基准测试之外进行迁移,我们进行了一项物理世界机器人迷宫实验。该任务要求机械臂拿起一个毛绒玩具,并将其穿过由玩具积木搭建的迷宫。这种设置引入了视觉域偏移、不完美的物体定位、遮挡、光照变化以及不规则的迷宫边界。我们在 3,000 个虚拟迷宫视频上预训练 HDR,仅使用 50 个真实世界机器人视频对 HDR 和 CausalForcing 进行微调,并使用逆动力学模型(IDM)将生成的视频转换为可执行的机器人动作。

我们根据难度对物理世界迷宫进行分类。简单、中等和困难迷宫由迷宫复杂度定义,包括解决方案路径所需的分支和转弯数量。我们还包含了一个 OOD(分布外)设置,其中木块以对角线方式放置或堆叠在一起,产生与规则网格状训练迷宫不同的布局。如图 7 所示,HDR 在所有设置下都保持了较高的成功率,表明分层去噪可以将多步推理能力迁移到物理交互中。

4.6 RoboDojo 上的世界动作建模

我们还评估了分层去噪是否迁移到具身世界动作建模。我们通过结合片段级视觉上下文与局部动作条件 rollout 来实例化 HDR-WAM,同时保留附录 A 中详细的令牌布局、采样过程和注意力掩码。

表 3 报告了 RoboDojo 仿真基准上的结果,该基准包含 42 个机器人交互任务,分为五个能力维度。在没有机器人领域或具身交互预训练的情况下,HDR-WAM 达到了 5.47 的整体得分和 3.00% 的平均成功率。在

9

第 10 页

图 8:RoboDojo 环境与 HDR-WAM 执行结果。该图展示了来自 RoboDojo 仿真基准的代表性桌面操作环境,以及由 HDR-WAM 生成的执行结果。该模型在长程任务(Long-Horizon tasks)上表现出特别强的性能,得分达到 9.85,成功率为 4.75%,证明了其在长时间交互中维持连贯任务结构的能力。

堆叠碗 搭建塔 折叠衣物

表 3:RoboDojo 仿真基准排行榜。每个单元格报告了能力维度的得分/成功率。在每个预训练组内,每列中的最佳和次佳得分分别以粗体和下划线显示,并列情况也包括在内。“Pretrain”列指示该方法是否在特定于任务的基准训练之外使用了机器人领域或具身交互预训练。HDR-WAM 通过分层片段条件视觉规划和局部动作预测,将 HDR 适配到 World Action Models。

算法/维度 预训练 泛化能力 精度 长程任务 记忆 开放 平均

X-WAM [6] 是 7.39 / 3.33% 6.72 / 1.83% 17.47 / 9.08% 6.32 / 4.67% 0.57 / 0.25% 7.69 / 3.83% GigaWorld-Policy [32] 是 5.34 / 2.89% 6.15 / 1.83% 15.51 / 8.92% 3.46 / 2.22% 0.54 / 0.50% 6.20 / 3.27% LDA-1B [19] 是 0.71 / 0.17% 3.21 / 0.50% 1.92 / 0.08% 2.08 / 1.78% 0.00 / 0.00% 1.58 / 0.51% RDT-1B [17] 是 0.56 / 0.33% 0.38 / 0.00% 1.13 / 0.00% 0.49 / 0.33% 0.00 / 0.00% 0.51 / 0.13% H-RDT [1] 是 0.49 / 0.22% 0.41 / 0.00% 2.23 / 0.17% 0.12 / 0.11% 0.08 / 0.08% 0.67 / 0.12%

HDR-WAM (Ours) 否 4.98 / 3.17% 5.90 / 2.25% 9.85 / 4.75% 6.65 / 4.67% 0.50 / 0.50% 5.47 / 3.00% AHA-WAM [3] 否 5.79 / 3.28% 5.86 / 2.42% 8.61 / 2.67% 2.97 / 2.78% 0.88 / 0.83% 4.82 / 2.39% Fast-WAM [38] 否 2.34 / 1.11% 1.96 / 0.00% 9.14 / 5.17% 3.55 / 3.44% 0.42 / 0.42% 3.48 / 2.03% ACT [40] 否 0.69 / 0.56% 0.85 / 0.00% 1.73 / 0.92% 1.65 / 0.13% 0.00 / 0.00% 0.98 / 0.32%

在无预训练的 World Action Model 基线中,它优于 AHA-WAM (4.82/2.39%) 和 Fast-WAM (3.48/2.03%),在基准测试中确立了新的无预训练 WAM 最先进状态。

最强的提升出现在长程任务(Long-Horizon)和记忆(Memory)维度,HDR-WAM 分别达到了 9.85/4.75% 和 6.65/4.67%。这种模式符合分层去噪的预期作用:稀疏的片段级地标有助于在长时间交互中保持连贯的任务结构,而局部动作条件 rollout 则使执行器能够对当前观察做出响应。图 8 可视化了代表性的 RoboDojo 环境和 HDR-WAM 执行结果,进一步说明了模型强大的长程任务能力。

5 结论

我们介绍了 HDR,这是一个用于长程视频推理的框架。通过将视频潜在变量组织成由粗到细的时间树,为层级配备稀疏结构化注意力,并根据熵匹配原则分配去噪预算,该方法在不依赖完整时间注意力的情况下,恢复了双向扩散模型的大部分推理能力。

经验上,HDR 优于因果基线,并在六个基准测试中与双向扩散模型保持竞争力。消融实验表明这两个组成部分都很重要:移除粗粒度层级水平会造成性能下降,而完全去噪每个层级不如在上层保留不确定性效果好。

10

第 11 页

更广泛地说,我们的结果表明,生成式视频建模中的全局推理并不一定需要密集的全体对全体(all-to-all)时间计算。结构化多尺度潜在规划提供了一种有前景的替代方案,它在保持推理能力的同时,也保留了因果效率。

参考文献

[1] Hongzhe Bi, Lingxuan Wu, Tianwei Lin, Hengkai Tan, Zhizhong Su, Hang Su, and Jun Zhu. H-rdt: Human manipulation enhanced bimanual robotic manipulation, 2025.

[2] Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Do- minik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, Varun Jampani, and Robin Rombach. Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023.

[3] Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, and Yao Mu. Aha- wam:asynchronous horizon-adaptive world-action modeling with observation-guided context routing, 2026.

[4] Haoge Deng, Ting Pan, Haiwen Diao, Zhengxiong Luo, Yufeng Cui, Huchuan Lu, Shiguang Shan, Yonggang Qi, and Xinlong Wang. Autoregressive video generation without vector quantization, 2025.

[5] Kaifeng Gao, Jiaxin Shi, Hanwang Zhang, Chunping Wang, Jun Xiao, and Long Chen. Ca2- vdm: Efficient autoregressive video diffusion model with causal generation and cache sharing, 2025.

[6] Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, and Huaping Liu. Unified 4d world action modeling from video priors with asynchronous denoising, 2026.

[7] Roberto Henschel, Levon Khachatryan, Hayk Poghosyan, Daniil Hayrapetyan, Vahram Tade- vosyan, Zhangyang Wang, Shant Navasardyan, and Humphrey Shi. Streamingt2v: Consistent, dynamic, and extendable long video generation from text, 2025.

[8] Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, Kalyan Sunkavalli, Feng Liu, Zhengqi Li, and Hao Tan. Relic: Interactive video world model with long-horizon memory, 2025.

[9] Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman. Self forcing: Bridging the train-test gap in autoregressive video diffusion, 2025.

[10] Dongya Jia, Zhuo Chen, Jiawei Chen, Chenpeng Du, Jian Wu, Jian Cong, Xiaobin Zhuang, Chumin Li, Zhen Wei, Yuping Wang, et al. Ditar: Diffusion transformer autoregressive modeling for speech generation. In International Conference on Machine Learning, pages 27255–27270. PMLR, 2025.

[11] Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong MU, and Zhouchen Lin. Pyramidal flow matching for efficient video generative modeling. In The Thirteenth International Conference on Learning Representations, 2025.

[12] Jihwan Kim, Junoh Kang, Jinyoung Choi, and Bohyung Han. Fifo-diffusion: Generating infinite videos from text without training, 2024.

[13] Dan Kondratyuk, Lijun Yu, Xiuye Gu, José Lezama, Jonathan Huang, Grant Schindler, Rachel Hornung, Vighnesh Birodkar, Jimmy Yan, Ming-Chang Chiu, Krishna Somandepalli, Hassan Akbari, Yair Alon, Yong Cheng, Josh Dillon, Agrim Gupta, Meera Hahn, Anja Hauth, David Hendon, Alonso Martinez, David Minnen, Mikhail Sirotenko, Kihyuk Sohn, Xuan Yang, Hartwig Adam, Ming-Hsuan Yang, Irfan Essa, Huisheng Wang, David A. Ross, Bryan Seybold, and Lu Jiang. Videopoet: A large language model for zero-shot video generation, 2024.

[14] Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen, and Yinghao Xu. Causal world modeling for robot control, 2026.

11

第 12 页

[15] Zongyi Li, Shujie Hu, Shujie Liu, Long Zhou, Jeongsoo Choi, Lingwei Meng, Xun Guo, Jinyu Li, Hefei Ling, and Furu Wei. Arlon: Boosting diffusion transformers with autoregressive models for long video generation, 2025.

[16] Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, and Shijian Lu. Rolling forcing: Autoregressive long video diffusion in real time, 2025.

[17] Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, and Jun Zhu. Rdt-1b: a diffusion foundation model for bimanual manipulation, 2025.

[18] Yang Luo, Xuanlei Zhao, Baijiong Lin, Lingting Zhu, Liyao Tang, Yuqi Liu, Ying-Cong Chen, Shengju Qian, Xin Wang, and Yang You. V-reasonbench: Toward unified reasoning benchmark suite for video generation models, 2025.

[19] Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, and He Wang. Lda-1b: Scaling latent dynamics action model via universal embodied data ingestion, 2026.

[20] NVIDIA, :, Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, Daniel Dworakowski, Jiaojiao Fan, Michele Fenzi, Francesco Ferroni, Sanja Fidler, Dieter Fox, Songwei Ge, Yunhao Ge, Jinwei Gu, Siddharth Gururani, Ethan He, Jiahui Huang, Jacob Huffman, Pooya Jannaty, Jingyi Jin, Seung Wook Kim, Gergely Klár, Grace Lam, Shiyi Lan, Laura Leal-Taixe, Anqi Li, Zhaoshuo Li, Chen-Hsuan Lin, Tsung-Yi Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Arsalan Mousavian, Seungjun Nah, Sriharsha Niverty, David Page, Despoina Paschalidou, Zeeshan Patel, Lindsey Pavao, Morteza Ramezanali, Fitsum Reda, Xiaowei Ren, Vasanth Rao Naik Sabavat, Ed Schmerling, Stella Shi, Bartosz Stefaniak, Shitao Tang, Lyne Tchapmi, Przemek Tredak, Wei-Cheng Tseng, Jibin Varghese, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Xinyue Wei, Jay Zhangjie Wu, Jiashu Xu, Wei Yang, Lin Yen-Chen, Xiaohui Zeng, Yu Zeng, Jing Zhang, Qinsheng Zhang, Yuxuan Zhang, Qingqing Zhao, and Artur Zolkowski. Cosmos world foundation model platform for physical ai, 2025.

[21] Zezhong Qian, Xiaowei Chi, Yuming Li, Shizun Wang, Zhiyuan Qin, Xiaozhu Ju, Sirui Han, and Shanghang Zhang. Wristworld: Generating wrist-views via 4d world models for robotic manipulation, 2025.

[22] Robbyant Team, Zelin Gao, Qiuyu Wang, Yanhong Zeng, Jiapeng Zhu, Ka Leong Cheng, Yixuan Li, Hanlin Wang, Yinghao Xu, Shuailei Ma, Yihang Chen, Jie Liu, Yansong Cheng, Yao Yao, Jiayi Zhu, Yihao Meng, Kecheng Zheng, Qingyan Bai, Jingye Chen, Zehong Shen, Yue Yu, Xing Zhu, Yujun Shen, and Hao Ouyang. Advancing open-source world models, 2026.

[23] Zhan Tong, Yibing Song, Jue Wang, and Limin Wang. Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training, 2022.

[24] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, and Ziyu Liu. Wan: Open and advanced large-scale video generative models, 2025.

[25] Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao,

12

第 13 页

高云方,John Kitaoka,徐一乐,徐华,肯顿·布拉库特,Tin Nguyen,宋思远, 孙浩然,温少月,何林阳,王润明,王彦志,杨梦月,马子乔,拉斐尔·米利埃, Freda Shi,努诺·瓦斯科内洛斯,丹尼尔·卡沙比,艾伦·尤伊尔,杜一伦, 刘子明,李博,林达华,刘子威,Vikash Kumar,李一江,杨磊,蔡仲刚, 以及邓浩坤。一个超大型视频推理套件,2026年。

[26] 王瑞思,蔡仲刚,蒲凡一,徐俊翔,尹万奇,王迈俊贤,季然,顾陈阳,李博,黄子奇,邓浩坤,林达华,刘子威,杨磊。 解构视频推理,2026年。

[27] Thaddäus Wiedemer,李宇轩,Paul Vicol,Shixiang Shane Gu,Nick Matarese,Kevin Swersky, Kim Been,Priyank Jaini,Robert Geirhos。视频模型是零样本学习者和推理者, 2025年。

[28] 吴佳龙,张小英,袁宏毅,张翔成,黄天浩,何昌靖,邓超一,张润瑞,吴友斌,龙明盛。视觉生成通过多模态世界模型解锁类人推理,2026年。

[29] 肖光轩,田友东,陈贝迪,韩松,Mike Lewis。具有注意力汇点的流式高效语言模型。在第十二届国际学习表征会议,2024年。

[30] 杨威尔,张云志,Pieter Abbeel,Aravind Srinivas。Videogpt:使用VQ-VAE和Transformer的视频生成,2021年。

[31] 杨帅,黄伟,楚瑞航,肖一程,赵宇阳,王先邦,李沐阳,谢恩泽,陈颖聪,陆瑶,韩松,陈玉康。Longlive:实时交互式长视频生成,2025年。

[32] 叶安根,王博远,倪超军,黄冠,赵国胜,李浩,李恒涛,李杰,吕锦迪,刘景宇,曹敏,李鹏,邓秋萍,梅文军,王小峰,陈新泽,周新宇,王阳,常一凡,李一凡,周玉坤,叶云,刘志超,朱正。Gigaworld-policy:一种高效以行动为中心的世界-行动模型,2026年。

[33] 成贤叶,葛云浩,郑凯元,高沈元,余思贤,George Kurian,Suneel Indupuru,Tan You Liang,朱春宁,项建南,Ayaan Malik,李庆民,梁威廉,Ranawaka Nadun,顾家胜,徐寅珍,王冠志,胡凤源,Narayan Avnish,Bjorck Johan,王静,Kim Gwanghyun,牛丹通,郑锐杰,谢雨琪,吴吉米,王琦,Julian Ryan,徐丹飞,杜一伦,Chebotar Yevgen,Reed Scott,Kautz Jan,朱玉科,林“Jim”凡,姜乔。世界行动模型是零样本策略,2026年。

[34] 尹天伟,张强,Richard Zhang,William T. Freeman,Fredo Durand,Eli Shechtman, 黄迅。从慢速双向到快速自回归视频扩散模型,2025年。

[35] 于家硕,吴悦,陈梦,任志飞,黄子正,楚培,张锐杰,何一南,李启瑞,李松泽,李振祥,涂忠颖,何聪辉,乔宇,王雅丽,王一,王利民。Vrbench:长叙事视频多步推理基准,2025年。

[36] 于继文,白建宏,秦一然,刘全德,王新涛,万鹏飞,张迪,刘希辉。上下文即记忆:基于记忆检索的场景一致交互式长视频生成,2025年。

[37] 于立军,José Lezama,Nitesh B. Gundavarapu,Luca Versari,Kihyuk Sohn,David Minnen, 程勇,Vighnesh Birodkar,Agrim Gupta,顾一烨,Alexander G. Hauptmann,龚伯青,杨明轩,Irfan Essa,David A. Ross,江璐。语言模型击败扩散模型——分词器是视觉生成的关键,2024年。

[38] 袁天元,董子斌,刘一程,赵航。Fast-wam:世界行动模型需要测试时未来想象吗?,2026年。

[39] 张凯文,葛匡志,迟晓伟,张润瑞,石少军,董震,韩思锐,张尚航。世界模型能否为视觉语言模型的世界动力学带来益处?,2025年。

13

第 14 页

[40] Tony Z. Zhao, Vikash Kumar, Sergey Levine, 和 Chelsea Finn。使用低成本硬件学习细粒度双臂操作,2023。

[41] Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, 和 Jun Zhu。因果强制:正确执行自回归扩散蒸馏以实现高质量实时交互式视频生成,2026。

14

第 15 页

A HDR-WAM 细节

A.1 分层动作建模

HDR-WAM 通过将控制视为视觉动态和动作上的联合去噪问题,将 HDR 适应于具身世界-动作建模。视频流预测动作条件化的未来观测值,而动作流则预测基于语言、本体感觉和视觉上下文的可执行动作块。

时间视图。考虑一个片段 $E = \{(x_t, q_t, u_t)\}_{t=0}^{T-1}$,其中 $x_t$ 是多视角 RGB 观测值,$q_t$ 是本体感觉,$u_t \in \mathbb{R}^{d_a}$ 是底层动作。对于从帧 $s$ 开始的训练样本,HDR-WAM 构建两个视觉视图。片段级视图是一组均匀采样的全局锚点 $$ I_{epi} = \left\{ \frac{i(T-1)}{N_e-1} \right\}_{i=0}^{N_e-1}, \quad X_{epi} = \{x_i : i \in I_{epi}\}, $$ 它总结了任务阶段和长程进展。局部动作条件化视图包含一个局部回滚窗口以及未来的视觉地标。对于局部长度 $N_\ell$、采样步长 $\Delta$ 和 $N_f$ 个未来地标,我们首先取 $$ I_{loc} = \{s + i\Delta\}_{i=0}^{N_\ell-1}, \quad t_{end} = \min(s + (N_\ell-1)\Delta, T-1). $$ 随后,未来地标索引在局部窗口之后均匀采样, $$ I_{fut} = \left\{ t_{end} + j \frac{T-1-t_{end}}{N_f} \right\}_{j=1}^{N_f}, $$ 当剩余后缀短于所需长度时,重复最后一个可用帧。局部视觉视图为 $X_{loc} = \{x_i : i \in I_{loc} \cup I_{fut}\}$。在我们的 RoboDojo 实验中,$N_e = 9$,$N_\ell = 9$,且 $N_f = 4$。

动作对齐与令牌布局。动作仅与 $N_\ell-1$ 个局部视觉转换对齐,而不与片段锚点或未来地标对齐。给定动作视界 $H$,我们将动作块拆分为 $N_\ell-1$ 组, $$ A_s = \{u_s, \dots, u_{s+H-1}\}, \quad G_r = \{u_{s+rm}, \dots, u_{s+(r+1)m-1}\}, \quad m = \frac{H}{N_\ell-1}, $$ 其中 $r = 0, \dots, N_\ell-2$。因此,额外的全局和未来视觉令牌提供上下文,但不引入额外的动作目标。经过 VAE 编码后,两个视觉视图产生潜在变量 $Z_{epi} \in \mathbb{R}^{C \times L_e \times H' \times W'}$ 和 $Z_{loc} \in \mathbb{R}^{C \times L_\ell \times H' \times W'}$。我们将它们沿时间维度拼接,并保留每个视图的第一个潜在变量为干净状态: $$ Z = [Z_{epi}; Z_{loc}], \quad C = \{0, L_e\}. $$ 对于 $t \notin C$,训练输入通过视频扩散过程进行加噪;对于 $t \in C$,干净潜在变量被保留为观测到的视觉条件。联合动作序列为 $$ S = [V_{epi}, V_{loc}, A], $$ 其中 $V_{epi}$ 和 $V_{loc}$ 是从两个潜在视图获得的视觉令牌,$A$ 表示分组动作块的行动令牌。

注意力掩码。HDR-WAM 在联合序列 $S$ 上使用块状注意力掩码,以分离视觉去噪和动作预测。令 $V = V_{epi} \cup V_{loc}$,令 $A$ 为动作令牌集合,令 $V_C \subset V$ 为属于干净视觉潜在变量的令牌。MoT 自注意力掩码可以写为 $$ M_{MoT} = \begin{bmatrix} M_{V \to V} & 0_{V \times A} \\ M_{A \to V} & 1_{A \times A} \end{bmatrix}, $$ 其中 $M_{V \to V}$ 是视频自注意力模式,$1_{A \times A}$ 允许动作令牌对整个动作块进行建模,且 $M_{A \to V}$ 满足仅当 $v \in V_C$ 时 $M_{A \to V}(a, v) = 1$。视频令牌不直接

15

第 16 页

剧集视频动作数据集

首次展开 历史 局部窗口 未来 观测

向下 向下 当前 采样 采样 观测 未来 全局规划 局部窗口 动作 噪声 规划 动作

HDR 世界动作模型

动作 生成 视频去噪损失 损失 动作 训练 推理 图 9:HDR-WAM 执行器的概述。该模型将稀疏的剧集级视觉上下文与局部动作条件展开相结合,然后将剧集、局部视觉和动作标记排列在联合序列中。注意力掩码将视觉去噪与可执行动作预测分开:动作标记关注动作标记和干净的视觉条件,而视觉标记在语言、本体感觉和分组动作上下文中对未来的观测进行去噪。

通过 MoT 自注意力关注动作标记;相反,动作条件通过交叉注意力进入视频去噪器以获取分组动作上下文。对于第 $r$ 个局部视觉转换,因果组掩码为 $M_{r,k}^{cross} = \mathbb{1}[k \le r]$,

因此,对视觉转换进行去噪可以使用相应及之前的动作组,而干净的 conditioning 帧不受未来动作的条件影响。视频损失排除了干净索引 $C$,动作损失是在掩码掉填充的动作流上计算的。

A.2 RoboDojo 数据处理

对于每个训练样本,我们从同一个 RoboDojo 剧集中构建两个时间视图。全局视图从整个剧集中均匀采样 9 个 RGB 帧,形成任务级进展的稀疏锚点。局部动作条件视图从当前帧开始,在数据集步长下取 9 个连续的局部 RGB 帧,并附加 4 个未来地标,这些地标是在局部窗口结束和剧集结束之间均匀采样的。如果剩余剧集短于所需长度,则重复最后一个可用帧。因此,每个局部视图包含 13 个 RGB 帧,而动作监督仍与局部 9 帧窗口内的 8 个转换对齐。

RoboDojo 观测使用三个相机视图。我们调整顶部相机和两个手腕侧相机的尺寸,将侧相机水平拼接,并在标准调整大小、裁剪和归一化流水线之前,将结果堆叠在顶部视图之下。两个时间视图都使用相同的视频 VAE 进行编码,并在剧集级别缓存,因此全局锚点由来自同一剧集的所有样本共享。这避免了重复解码相同的长视频,同时保留了 HDR-WAM 所需的完整剧集上下文。

B 基准和评估细节

我们在一个包含六个长视界推理任务的混合基准上评估所有方法:迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子和水倒水。这些任务涵盖了多种推理模式,包括空间规划、状态转换、物体操作和轨迹一致性。

16

第 17 页

每个生成的视频均根据特定任务的成功标准进行评估,并使用两个指标进行报告。 成功分数 $S \in \{0, 1\}$ 衡量在基准特定成功标准下的任务精确完成情况。平均进度分数 $A \in [0, 1]$ 衡量向目标结果取得的部分进展,因此对不改变核心语义轨迹的轻微视觉偏差具有更高的容忍度。 主论文中的结果以“成功/平均进度”对的形式报告,两个值均乘以 100。

对于评分集合 $D$,报告的任务分数计算为评估样本的平均值:

$$ \text{Success}(D) = \frac{1}{|D|} \sum_{i \in D} S_i, \quad \text{Avg. Progress}(D) = \frac{1}{|D|} \sum_{i \in D} A_i. $$

总体得分通过对六个基准的任务级得分进行平均获得。这赋予每个推理任务相等的权重,并反映了模型在不同形式的长视距视频推理中的鲁棒性。

该基准使用特定任务的难度级别。迷宫(Maze)和汉诺塔(Hanoi)按原生问题规模分组,而其余四个任务使用级别目录。评估划分总结在表 4 中。

表 4:混合推理基准的难度分组。

| 任务 | 级别/规模 | 评估划分 | 主要难度因素 | | :— | :— | :— | :— | | Maze | $N = 6, 7, 8, 9, 10$ | 每种规模 10 个 | 网格大小,路径长度 | | Hanoi | 2, 3, 4, 5 个圆盘 | 每种规模 10 个 ID + 10 个 OOD | 圆盘数量,初始杆数 | | One-line | 级别 2, 3, 4 | 每个级别 25 个 ID + 25 个 OOD | 路径长度,形状拓扑 | | Sliding | 级别 2, 3, 4 | 每个级别 30 个 ID + 20 个 OOD | 棋盘大小,最优步数 | | Sokoban | 级别 2, 3, 4 | 每个级别 30 个 ID + 20 个 OOD | 布局语法,动作视距 | | Water | 级别 2, 3, 4 | 每个级别 30 个 ID + 20 个 OOD | 管道,容量,解的长度 |

B.1 迷宫导航

迷宫样本在具有固定起点 $(0, 0)$ 和终点 $(N-1, N-1)$ 的正方形网格上生成。生成器构建递归分割迷宫图,使用广度优先搜索求解,存储图边和解决方案路径,并渲染沿路径移动的红色球体。默认评估集包含 50 个样本,其中 $N \in \{6, 7, 8, 9, 10\}$ 每种规模各 10 个样本。

评估器使用颜色分割和连通分量跟踪红色球体。成功分数要求解码后的路线正确开始,保持在开放单元格内,仅通过有效的图边移动,并到达目标。平均进度分数是松弛解码路线 $\hat{r}$ 与参考路径 $r^\star$ 之间归一化的最长公共子序列重叠度:

$$ A_{\text{maze}} = \frac{\text{LCS}(\hat{r}, r^\star)}{\max(1, |r^\star|)}. $$

B.2 汉诺塔

汉诺塔样本使用 2–5 个圆盘和三根杆。域内样本将圆盘初始化为位于杆 $\{0, 1\}$ 上,而域外(OOD)样本可能将圆盘初始化为位于 $\{0, 1, 2\}$ 上,并且要求至少有一个圆盘已经出现在目标杆上。目标始终是杆 2。对于每个初始分配,生成器使用广度优先搜索求解最短合法计划,并一次渲染一个提升的圆盘移动。

评估器解码圆盘轨迹,推断形如 $(\text{disk}, \text{source}, \text{target})$ 的移动,并从真实初始状态模拟它们。成功分数要求所有推断的移动都是合法的,并且最终状态将所有圆盘放置在目标杆上。平均进度分数衡量与参考最短计划的计划重叠度:

$$ A_{\text{hanoi}} = \frac{2 \text{LCS}(\hat{m}, m^\star)}{|\hat{m}| + |m^\star|}. $$

17

第 18 页

B.3 一笔画

一笔画的第 2、3、4 级使用尺寸逐渐增大的棋盘和更长的自回避路径。生成器采样拓扑族,搜索不重复访问的相邻单元格路径,应用随机几何变换,检查唯一性和形状约束,并将生成的路径同时视为占据形状和所需解。在评估集中,第 2 级使用 9 × 9 棋盘,第 3 级使用 10 × 10,第 4 级使用 12 × 12。

评估器提取绘图头部、已访问单元格、白色轨迹单元格以及轨迹是否保持在所需形状上。成功得分要求从高亮单元格开始,覆盖每个占据单元格,避免重复访问,避免非相邻跳跃,且永不离开形状。当白色轨迹已经连接明显的短跳跃时,允许一定的视觉桥接容差。平均进度得分结合了覆盖率、合法转换比率和在形状比率:

$$ A_{\text{one}} = 0.5 C_{\text{cover}} + 0.3 R_{\text{legal}} + 0.2 R_{\text{shape}}. $$

B.4 滑动拼图

滑动拼图的 2 级和 3 级使用 3 × 3 棋盘,而 4 级使用 4 × 4 棋盘。目标状态是空白块位于最终位置的有序棋盘。对于 3 × 3 拼图,状态是从桶约束下的精确可解池中采样的;对于 4 × 4 拼图,状态是从目标状态向后打乱采样的。每个接受的样本都通过最优求解,并根据解的长度、家族和多样性约束进行过滤。

评估器从视频帧中解码棋盘状态,并选择从初始状态开始的最佳合法子序列。成功得分要求子序列到达目标,保留图块库存,不包含非法的空块移动,且未解决帧比率低于 0.8。平均进度得分结合了归一化曼哈顿进度、最终状态质量、规则遵守性和可观察性:

$$ A_{\text{slide}} = 0.45 P + 0.20 Q_{\text{final}} + 0.20 R_{\text{rule}} + 0.15 R_{\text{obs}}. $$

B.5 推箱子

推箱子样本使用 8 × 8 网格,包含墙壁、一个玩家、一个箱子和一个目标。生成器从语法算子构建布局,采样有效的玩家和箱子位置,使用最短路径搜索求解每个候选方案,并根据动作长度、推动次数、箱子-目标距离、死锁类似单元格和多样性进行过滤。更高级别使用更长且约束更多的布局。

评估器解码玩家和箱子位置,并检查恢复的状态序列是否可以由合法的行走和推动来解释。成功得分要求玩家和箱子正确开始,箱子最终位于目标上,无墙壁穿越或重叠,无非法拉动或推动,且未解决帧比率低于 0.8。平均进度得分强调箱子向目标的进展:

$$ A_{\text{sokoban}} = 0.50 P_{\text{box}} + 0.20 Q_{\text{final}} + 0.15 R_{\text{rule}} + 0.15 R_{\text{obs}}. $$

B.6 倒水

倒水样本包含具有固定容量和彩色块的垂直管。生成器构建已解决的目标状态,采样合法反向倒水的向后链以获得初始状态,求解或验证生成的谜题,并根据解的长度、埋没的块、颜色运行、分支因子和状态多样性过滤候选方案。更高级别增加管数、颜色数、容量和解的视界。

评估器从静止帧中提取管状态。合法移动将一种颜色的完整连续顶部运行转移到空管或相同颜色的管上,受限于剩余的目标容量。成功得分要求最终管状态已解决,所有解码的转换均为合法,块守恒和容量约束成立,且未解决的静止帧保持在 0.35 以下。平均进度得分结合了规则遵守性、进展、最终状态质量和可观察性:

$$ A_{\text{water}} = 0.45 R_{\text{rule}} + 0.35 P + 0.15 Q_{\text{final}} + 0.05 R_{\text{obs}}. $$

18

第 19 页

C 熵匹配与完全去噪层级

我们的最终消融实验探讨了去噪预算应如何在层级间分配。一种朴素策略是在进入下一层级之前,对每个层级进行完全去噪。在我们的实现中,这对应于为所有层分配 50 个去噪步骤。虽然直观,但该策略忽略了不同层级具有不同的熵尺度。粗粒度层包含较少的时序 token,代表低分辨率假设,而细粒度层包含更多 token,并携带更详细的视觉熵。因此,强制所有层级消除相同数量的不确定性并不与层级表示相匹配。

我们转而使用熵匹配的去噪调度。令 $N_\ell$ 表示第 $\ell$ 层的 token 数量,令 $\tilde{N}_\ell$ 表示其有效时序支持。由于较细的层级代表更多的时序自由度,我们假设在第 $\ell$ 层需要消除的熵应随其有效支持增长:

$$ \Delta H_\ell \propto \tilde{N}_\ell^\beta $$

其中 $\beta$ 是一个可调参数,控制去噪预算从粗粒度层到细粒度层增加的激进程度。较大的 $\beta$ 为细粒度层分配更多去噪步骤,而较小的 $\beta$ 使调度更加均匀。

我们将这种熵分配转换为逐层去噪预算:

$$ K_\ell = \left\lfloor K_{\max} \left( \frac{\tilde{N}_\ell}{\tilde{N}_L} \right)^\beta \right\rfloor $$

其中 $K_{\max}$ 是最细层级使用的最大去噪预算。该规则为粗粒度层提供更少的去噪步骤,为细粒度层提供更多的步骤,这与粗粒度层应保留不确定性而细粒度层应将其解析为具体视觉状态的直觉相符。

对于 21 帧设置,我们的层级具有实际的层大小:

$$ N_\ell = [1, 2, 4, 8, 16, 21]. $$

最后一层被视频长度截断,但底层二进制层级具有有效时序支持:

$$ \tilde{N}_\ell = [1, 2, 4, 8, 16, 32]. $$

使用 $K_{\max} = 50$ 和 $\beta = 0.66$,熵匹配规则给出:

$$ K_\ell = \left\lfloor 50 \left( \frac{[1, 2, 4, 8, 16, 32]}{32} \right)^{0.66} \right\rfloor = [5, 8, 13, 20, 32, 50]. $$

这是 HDR 在主实验中使用的默认去噪调度。

该调度也可以通过不确定性保留的视角来解释。粗粒度层仅消除其不确定性的一小部分,因此它们充当灵活的高级假设。细粒度层消除更多熵,允许它们将这些假设实例化为详细的帧级潜在变量。相比之下,All-50 策略设置

$$ K_1 = K_2 = \cdots = K_L = 50, $$

这强制每个层级消除相同数量的不确定性,无论其时序尺度如何。这会过早地坍缩高级假设,并降低较低层级纠正或细化它们的能力。

表 5 将熵匹配调度与完全去噪及其他调度进行了比较。All-50 变体的整体表现劣于熵匹配调度:整体成功率从 60.29 降至 58.38,平均进度得分从 89.56 降至 88.21。为了完整起见,我们还包含了另外两种调度:稀疏到完全调度 [5, 5, 5, 5, 5, 50],它在完全去噪最细层级之前保持粗粒度层最小程度去噪;以及指数调度 [2, 4, 8, 16, 32, 50],它以更具侵略性的方式增加去噪预算。它们的基准测试结果留空。

19

第 20 页

表 5:熵匹配与替代去噪调度方案。熵匹配调度方案根据熵尺度,为粗层分配较少的去噪步数,为细层分配较多的去噪步数,从而实现了最佳的整体平均进展,并在整体成功率方面保持竞争力。与稀疏到全量(sparse-to-full)和指数调度方案相比,熵匹配在保留高层不确定性和细化细粒度视频状态之间提供了更好的平衡。

去噪策略 调度方案 汉诺塔 迷宫 单线 滑动 推箱子 水 整体

熵匹配 [5, 8, 13, 20, 32, 50] 58.75/79.62 78.00/97.18 70.00/97.84 33.33/93.69 78.33/99.69 43.33/69.34 60.29/89.56 全50 [50, 50, 50, 50, 50, 50] 60.00/79.70 76.00/97.18 65.00/97.45 30.00/94.34 80.00/99.60 41.67/65.32 58.38/88.21 稀疏到全量 [5, 5, 5, 5, 5, 50] 55.00/74.58 42.00/92.86 63.33/97.25 41.67/93.76 76.67/99.33 23.33/58.99 50.33/86.13 指数 [2, 4, 8, 16, 32, 50] 53.75/77.36 58.00/95.53 73.33/98.03 41.67/94.30 86.67/98.73 46.67/68.26 60.02/88.70

D 时间复杂度分析

我们分析了双向扩散(Bidirectional diffusion)、流式自回归扩散(Streaming AR Diffusion)和 HDR 的时间注意力复杂度。令 $N$ 表示帧级视频标记的数量,$K$ 表示去噪步数。我们省略了隐藏维度、头数、模型深度以及 HDR 关注的固定标记数量等常数因子。

双向扩散。双向扩散在每个去噪步更新整个视频序列。每个标记都关注所有 $N$ 个标记,因此一个去噪步的时间注意力成本为 $O(N^2)$。经过 $K$ 个去噪步,总复杂度为:

$O(KN^2)$。

这种密集的全对全交互支持全局推理,但在推理过程中会反复重新计算完整的时间注意力图。

流式自回归扩散。流式自回归扩散从左到右生成标记。在生成标记 $i$ 时,它关注所有先前生成的标记。尽管 KV-cache 避免了重新计算先前的隐藏状态,但注意力长度仍随时间增长。因此,总的时间注意力成本为:

$N$ $O \left( K \sum_{i=1}^{N} i \right) = O(KN^2)$。

因此,与双向扩散相比,流式自回归扩散提高了流式效率,但其相对于标记数量的注意力复杂度仍然是二次的。

HDR。HDR 生成分层潜在树,而不是扁平序列。对于具有 $N$ 个帧级标记的视频,分层标记的总数与 $N$ 呈线性关系;例如,二叉树包含大约 $2N – 1$ 个节点。更重要的是,每个标记仅关注固定大小的上下文,包括其前一个同层标记、其父标记以及相邻的父标记。因此,时间注意力成本与分层标记的数量呈线性关系:

$O(K_{avg}N)$,

其中 $K_{avg}$ 表示分层标记上的平均去噪预算。由于对于 $N$ 个帧级标记,分层包含大约 $2N – 1$ 个标记,完整注意力成本为 $O(K_{avg}(2N – 1))$,简化后为 $O(K_{avg}N)$。这种线性大小的分层引入了更长的单次预填充阶段,HDR 为 16.19 秒,而双向扩散为 1.48 秒,因果强制(CausalForcing)为 2.44 秒;然而,随后的流式延迟保持为每个潜在变量 0.70 秒,远快于双向扩散的 37.92 秒。在实践中,HDR 为粗层分配较少的去噪步数,因此 $K_{avg}$ 小于标准扩散使用的完整去噪预算。

该分析突出了 HDR 的主要计算优势。虽然 HDR 引入了额外的分层标记,但其数量仅随视频长度线性增长。由于每个分层标记关注固定大小的上下文,整体时间注意力成本与 $N$ 呈线性关系。相比之下,双向扩散和流式自回归扩散相对于视频标记数量的注意力复杂度均为二次方。

20

第 21 页

表 6:时间注意力复杂度比较。双向扩散使用全对全注意力,流式自回归扩散关注完整前缀,而 HDR 在线性大小的层级结构上关注固定大小的上下文。

| 方法 | 注意力模式 | 令牌数量 | 复杂度 | | :— | :— | :— | :— | | 双向扩散 | 全对全 | $N$ | $O(KN^2)$ | | 流式自回归扩散 | 前缀注意力 | $N$ | $O(KN^2)$ | | HDR | 固定稀疏注意力 | $\approx 2N$ | $O(K_{avg}N)$ |

表 7:在视频推理基准测试中与最先进的闭源视频生成模型的比较。分数使用成功指标和平均进度指标报告。

| 方法 | 全注意力 | 微调 | 指标 | 汉诺塔 | 迷宫 | 单行 | 滑动 | 推箱子 | 水 | 总体 | | :— | :—: | :—: | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | | | 成功 | 3.75 | 6.00 | 1.67 | 0.00 | 0.00 | 1.67 | 2.16 | | Wan2.6 | ✓ | ✗ | 平均进度 | 20.15 | 46.93 | 72.13 | 61.38 | 67.56 | 35.50 | 49.06 | | | | | 成功 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | 0.00 | | Veo | ✓ | ✗ | 平均进度 | 0.09 | 24.42 | 66.46 | 0.00 | 0.33 | 0.82 | 14.28 | | | | | 成功 | 58.75 | 78.00 | 70.00 | 33.33 | 78.33 | 43.33 | 60.29 | | HDR | ✗ | ✓ | 平均进度 | 79.62 | 97.18 | 97.84 | 93.69 | 99.69 | 69.34 | 89.56 |

E 与最先进闭源模型的比较

我们进一步将 HDR 与最先进的闭源视频生成模型(包括 Wan2.6 和 Veo)进行比较。由于这些模型仅通过闭源推理 API 或发布的推理接口提供访问,我们无法修改其架构、应用我们的分层训练策略,或在提出的基准数据上对其进行微调。因此,我们在现成设置下评估它们,使用与我们的方法相同的提示和评估协议。

如表 7 所示,在精确完成标准下,现成闭源模型在我们的推理基准测试中取得的成功有限。尽管它们通常能生成视觉上合理的视频,但它们经常无法满足这些任务所需的精确多步约束。相比之下,HDR 专为 HDR 显式训练,并在所有任务中取得了显著更高的分数。这一比较表明,强大的通用视频生成能力并不一定转化为在不可逆决策下的可靠多步推理能力。

F 消融实验完整表格

主论文在图 6a、图 5 和图 6b 中可视化了去噪步数、分层层数和数据减少消融的关键趋势。为了完整起见,我们在表 8、表 9 和表 10 中提供了相应的完整数值结果。表 8 包含图 6a 背后的任务级分数,包括因果基线、双向基线和 HDR 在不同去噪预算下的完整成功率和平均进度结果。表 9 提供了图 5 的任务级细分,按 1 到 6 个活动分层层的数量组织,其中 1 层设置对应于因果基线。表 10 报告了图 6b 背后的任务级结果,比较了不同训练数据规模下的双向基线和 HDR。所有条目均以均值 ± 标准差报告。对于在 $N$ 个评估样本上计算的每个任务级指标,我们通过无放回地重复采样 $\lfloor N/2 \rfloor$ 个示例,对 10 次试验重新计算均值,然后报告所得样本均值之间的总体标准差来估计标准差。

这些表格支持与图表相同的结论,同时揭示了每个任务的细节。首先,去噪步数消融表明,HDR 在减少的去噪预算下保持更强的性能,尤其是在单步设置下。其次,分层层数消融表明,较浅的变体更接近因果基线,而增加更多层通常会提高性能并使 HDR 的推理能力更强。第三,数据减少消融表明,HDR 退化

21

第 22 页

表 8:去噪步数消融实验。数值以均值 ± 标准差报告。在减少推理预算的情况下,HDR 比因果基线表现出显著更强的鲁棒性。

| Method | Step | Metric | Hanoi | Maze | One-line | Sliding | Sokoban | Water | Overall | | :— | :—: | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | 50 | Success | 45.00±6.73 | 12.00±8.08 | 48.33±7.66 | 21.67±5.16 | 40.00±10.69 | 38.33±5.25 | 34.22±7.26 | | | | Avg. Progress | 70.47±2.76 | 55.04±8.36 | 95.15±1.28 | 86.13±2.62 | 82.25±5.79 | 66.94±3.03 | 76.00±3.97 | | CausalForcing [41] | 5 | Success | 38.75±5.14 | 14.00±11.31 | 43.33±9.26 | 20.00±6.00 | 35.00±10.19 | 36.67±6.83 | 31.29±8.12 | | | | Avg. Progress | 66.31±2.78 | 49.67±9.17 | 94.30±2.00 | 83.73±2.79 | 79.81±5.85 | 66.97±3.26 | 73.47±4.31 | | | 1 | Success | 7.50±4.36 | 10.00±5.63 | 0.00±0.00 | 18.33±6.75 | 28.33±8.92 | 3.33±1.80 | 11.25±4.57 | | | | Avg. Progress | 39.24±4.57 | 60.29±9.31 | 92.82±1.00 | 79.13±3.56 | 77.45±5.79 | 32.40±1.70 | 63.55±4.32 | | | 50 | Success | 45.00±6.78 | 90.00±3.12 | 81.67±7.60 | 31.67±6.98 | 90.00±4.21 | 21.67±6.83 | 60.00±5.92 | | | | Avg. Progress | 73.58±2.95 | 99.89±0.11 | 99.26±0.27 | 93.00±1.56 | 100.00±0.00 | 57.08±3.66 | 87.13±1.42 | | Bidirectional [24] | 5 | Success | 41.25±6.91 | 88.00±2.56 | 75.00±8.79 | 35.00±5.74 | 86.67±4.81 | 26.67±5.85 | 58.77±5.78 | | | | Avg. Progress | 75.01±3.04 | 99.75±0.15 | 98.70±0.72 | 92.45±1.66 | 99.11±0.89 | 55.34±3.16 | 86.73±1.60 | | | 1 | Success | 5.00±2.78 | 0.00±0.00 | 31.67±9.08 | 28.33±4.35 | 41.67±9.17 | 0.00±0.00 | 17.78±4.23 | | | | Avg. Progress | 43.86±3.13 | 43.87±4.43 | 91.32±1.42 | 94.26±0.62 | 84.79±5.62 | 23.86±1.53 | 63.66±2.79 | | | Full | Success | 58.75±4.50 | 78.00±5.25 | 70.00±10.12 | 33.33±7.93 | 78.33±9.67 | 43.33±4.79 | 60.29±7.04 | | | | Avg. Progress | 79.62±3.04 | 97.18±1.07 | 97.84±0.61 | 93.69±1.47 | 99.69±0.31 | 69.34±2.84 | 89.56±1.56 | | HDR | 5 | Success | 58.75±5.25 | 74.00±6.93 | 75.00±8.96 | 36.67±8.26 | 75.00±10.62 | 43.33±3.54 | 60.46±7.26 | | | | Avg. Progress | 79.38±3.56 | 96.88±1.20 | 97.88±0.61 | 94.02±1.59 | 97.61±1.19 | 67.18±2.45 | 88.83±1.77 | | | 1 | Success | 50.00±6.05 | 0.00±0.00 | 45.00±12.03 | 35.00±6.15 | 76.67±7.23 | 1.67±1.00 | 34.72±5.41 | | | | Avg. Progress | 74.03±2.74 | 57.10±9.21 | 93.80±1.11 | 95.30±0.79 | 99.81±0.19 | 32.35±1.89 | 75.40±2.66 |

表 9:分层层数消融实验。数值以均值 ± 标准差报告。结果按激活的分层层数组织,其中 1 层设置对应于因果基线。增加层数通常能提高推理性能,表明每个分层级别都对 HDR 的由粗到细的推理过程有所贡献。

| Layers | Metric | Hanoi | Maze | One-line | Sliding | Sokoban | Water | Overall | | :—: | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 1 | Success | 45.00±6.73 | 12.00±8.08 | 48.33±7.66 | 21.67±5.16 | 40.00±10.69 | 38.33±5.25 | 34.22±7.26 | | | Avg. Progress | 70.47±2.76 | 55.04±8.36 | 95.15±1.28 | 86.13±2.62 | 82.25±5.79 | 66.94±3.03 | 76.00±3.97 | | 2 | Success | 31.25±4.19 | 44.00±7.69 | 53.33±11.81 | 20.00±9.03 | 51.67±6.16 | 30.00±6.83 | 38.38±7.62 | | | Avg. Progress | 68.05±2.86 | 80.60±1.57 | 97.17±0.57 | 86.83±1.95 | 83.72±0.71 | 59.17±2.91 | 79.26±1.76 | | 3 | Success | 38.75±4.58 | 22.00±8.03 | 75.00±8.24 | 30.00±9.75 | 45.00±7.24 | 30.00±3.67 | 40.12±6.92 | | | Avg. Progress | 73.38±3.27 | 84.76±1.84 | 98.55±0.46 | 87.79±2.37 | 93.72±0.66 | 66.35±2.72 | 84.09±1.89 | | 4 | Success | 61.25±7.69 | 72.00±10.64 | 80.00±11.62 | 33.33±9.57 | 73.33±10.71 | 35.00±4.98 | 59.15±9.20 | | | Avg. Progress | 81.59±3.57 | 93.33±3.16 | 98.72±0.60 | 91.23±2.09 | 98.71±3.18 | 66.71±2.65 | 88.38±2.54 | | 5 | Success | 57.50±8.22 | 76.00±9.40 | 73.33±8.10 | 33.33±6.57 | 80.00±8.91 | 41.67±5.27 | 60.31±7.74 | | | Avg. Progress | 80.70±5.10 | 95.40±5.90 | 98.57±0.93 | 92.65±1.99 | 99.25±4.23 | 69.32±3.73 | 89.31±3.65 | | 6 | Success | 58.75±4.50 | 78.00±5.25 | 70.00±10.08 | 33.33±7.93 | 78.33±9.67 | 43.33±4.79 | 60.29±7.04 | | | Avg. Progress | 79.62±3.04 | 97.18±1.07 | 97.84±0.46 | 93.69±1.48 | 99.69±0.31 | 69.34±2.90 | 89.56±1.54 |

随着训练数据量的减少,HDR 的表现比双向基线更加优雅。综合全表结果证实,HDR 的鲁棒性既源于其由粗到细的分层结构,也源于其在有限去噪计算和有限数据下保持有用推理行为的能力。

G 分层中间预测的可视化

我们提供了 HDR 在分层推理过程中产生的中间预测的定性可视化结果。如图 10 所示,标记为 L1、L2 和 L3 的列对应于在不同层级添加噪声之前模型的干净 $x_0$ 预测。这些中间输出揭示了 HDR 的由粗到细的推理过程:高层首先捕捉粗略的任务结构和全局计划,而低层则逐步将其细化为具体的视频状态。

22

第 23 页

表 10:数据缩减消融实验。数值报告为均值 ± 标准差。我们使用完整训练集、10% 的训练集和 2% 的训练集分别训练双向基线模型和 HDR。本实验旨在评估模型是否能够从有限数据中学习推理规则。

| Method | Data Scale | Metric | Hanoi | Maze | One-line | Sliding | Sokoban | Water | Overall | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | | Success | 45.00±6.78 | 90.00±3.12 | 81.67±7.60 | 31.67±6.98 | 90.00±4.21 | 21.67±6.83 | 60.00±5.92 | | Bidirectional [24] | Full | Avg. Progress | 73.58±2.95 | 99.89±0.11 | 99.26±0.27 | 93.00±1.56 | 100.00±0.00 | 57.08±3.66 | 87.13±1.42 | | | | Success | 55.00±5.36 | 80.00±9.94 | 80.00±9.13 | 26.67±7.24 | 70.00±6.67 | 20.00±6.15 | 55.28±7.42 | | | 10% | Avg. Progress | 73.94±3.00 | 95.08±2.03 | 98.70±0.59 | 93.45±1.08 | 99.08±0.90 | 57.20±3.55 | 86.24±1.86 | | | | Success | 43.75±6.74 | 20.00±7.76 | 76.67±9.27 | 16.67±3.27 | 23.33±7.42 | 6.67±3.14 | 31.18±6.27 | | | 2% | Avg. Progress | 72.54±2.59 | 67.76±6.35 | 97.69±0.66 | 92.51±0.71 | 90.11±3.32 | 47.03±2.39 | 77.94±2.67 | | | | Success | 58.75±4.50 | 78.00±5.25 | 70.00±10.12 | 33.33±7.93 | 78.33±9.67 | 43.33±4.79 | 60.29±7.04 | | HDR | Full | Avg. Progress | 79.62±3.04 | 97.18±1.07 | 97.84±0.61 | 93.69±1.47 | 99.69±0.31 | 69.34±2.84 | 89.56±1.56 | | | | Success | 56.25±5.78 | 64.00±9.95 | 68.33±8.34 | 38.33±5.86 | 80.00±5.83 | 40.00±5.57 | 57.82±6.89 | | | 10% | Avg. Progress | 79.26±3.55 | 93.63±2.05 | 97.91±0.55 | 94.40±0.82 | 99.92±0.08 | 71.67±2.17 | 89.46±1.54 | | | | Success | 60.00±5.59 | 50.00±13.43 | 50.00±7.98 | 26.67±5.71 | 70.00±7.20 | 43.33±2.49 | 50.00±7.07 | | | 2% | Avg. Progress | 77.71±3.75 | 86.78±6.54 | 96.40±0.90 | 93.76±0.68 | 98.82±0.47 | 68.84±2.18 | 87.05±2.42 |

迷宫

汉诺塔

单行

滑动拼图

推箱子

倒水

L1 L2 L3 输出

图 10:HDR 分层中间预测的可视化。标记为 L1、L2 和 L3 的列显示了在不同层级添加噪声之前干净的 x0 预测,而最右侧的块显示了最终生成的输出。从粗粒度层到细粒度层的进展说明了 HDR 如何首先形成高层计划,然后将其细化为详细的视频状态。

这支持了我们的主张,即 HDR 使模型在提交最终流式输出之前能够形成高层假设。

H 失败案例研究

本附录提供了定性案例研究,以补充正文中的定量结果。H.1 节将 HDR 与流式自回归扩散基线进行比较,并说明分层去噪如何帮助避免早期的不可逆错误。随后,H.2 节考察了 HDR 具有代表性的残差失败案例,重点关注迷宫导航、推箱子和倒水任务中的状态一致性漂移。

H.1 与流式 AR 扩散的定性比较

我们首先提供了一些代表性的定性案例,其中由 CausalForcing 代表的流式自回归扩散基线失败,而 HDR 成功。这些例子通过展示一种反复出现的失败模式,补充了正文中的基准测试结果:基线模型做出了早期在局部看来合理的决策,但其不可逆的时间承诺阻止了后续帧对错误进行修复。

23

第 24 页

(a) 迷宫 (b) 汉诺塔

基线 基线 (Causal) (Causal)

初始状态 球离开 球不再可见 目标单元格为空 初始:3个圆盘 绿色圆盘缺失 绿色圆盘缺失 目标堆栈缺失 走廊 圆盘

我们 我们 (HDR) (HDR)

初始状态 球留在 路线保持 球到达目标 初始:3个圆盘 合法移动 三个圆盘 目标堆栈 走廊 连续 序列 转移 完整

(c) 一笔画 (d) 滑动拼图

基线 基线 (Causal) (Causal)

初始网格 路径向上转折 未访问单元格 覆盖 初始拼图 空白处局部 顺序错位 最终状态 仍剩余 不完整 移动不匹配 未解决

我们 我们 (HDR) (HDR)

初始网格 连通路径 更多单元格被覆盖 所有单元格被覆盖 初始拼图 空白处重新定位 行变为 已解决 延伸 图块 有序 配置

(e) 推箱子 (f) 倒水

基线 基线 (Causal) (Causal)

初始:箱子+ 箱子向右移动 箱子远离 目标仍为空 初始管状容器 水段分离 管状容器体积 水残留 目标 目标 缺失 缺失

我们 我们 (HDR) (HDR)

初始:箱子+ 引导智能体 箱子向上移动 箱子在目标 初始管状容器 同色倾倒 管状容器变为 排序的管状容器组 目标 到箱子 分组

图11:在所有六个推理任务中的定性比较,其中流式自回归扩散基线失败但HDR成功。对于每个任务,第一行显示CausalForcing,第二行显示HDR。红色框和箭头标记基线的失败点,绿色框和箭头突出显示HDR成功的由粗到细的细化过程。跨任务来看,基线通常会过早地陷入局部错误,例如离开有效的迷宫走廊、遗漏必需的圆盘转移、破坏路径连续性、错误放置空白图块、将箱子推离目标或违反倒水约束。相比之下,HDR保持了全局一致的任务结构并达到正确的最终状态。

轨迹。一旦展开偏离正确计划,后续帧将继承该错误,视频最终处于全局不一致的状态。

相比之下,HDR在粗粒度层级上保持可修订的高级假设,并通过由粗到细的去噪过程在提交最终流式输出之前对其进行细化。这种分层推理过程实现了潜在空间中的隐式回溯:模型可以保留对多步结构的不确定性,修订不正确的部分计划,并在更细粒度上实例化符合规则解。图11展示了这一行为在迷宫导航、汉诺塔、一笔画、滑动拼图、推箱子和倒水任务中的表现。

H.2 HDR的残差失败模式

尽管HDR显著改善了多步视频推理,但在必须将精确状态一致性保留到最后几帧时,它仍可能失败。图12、图13和图14展示了三种代表性的残差失败模式。在迷宫导航中,HDR遵循了一条合理的路径,但在展开后期墙壁消失,导致最终迷宫状态无效。在推箱子中,箱子轨迹大体上接近目标,但晚期的墙壁消失伪影破坏了物理一致性。在倒水

24

第 25 页

倾倒过程中,分组过程基本正确,但其中一种液体的颜色与另一种液体颜色发生融合,导致最终排列在视觉上合理但在语义上无效。

这些失败表明,HDR 的剩余错误较少表现为完整的规划失败,而更多表现为晚期状态一致性漂移。粗粒度层级通常编码预期的多步结构,而细粒度层级则将该意图细化为近乎正确的视频状态。残余错误主要出现在 rollout 的末尾,此时模型必须保持精确的几何结构、物体身份或终端约束。这表明未来的改进应聚焦于约束感知的细化或最终生成阶段的轻量级验证。

25

第 26 页

迷宫 成功率=0,平均进度=1.000

HDR

起始单元格 追踪路径 目标走廊 墙壁 消失

L1

L2

L3

L4

L5

L6

图 12:HDR 的迷宫失败案例。模型追踪了一条合理的路径并到达目标走廊,但在 rollout 接近尾声时一堵墙消失了,导致生成了一个无效的迷宫状态,尽管其他多步规划是正确的。

26

第 27 页

仓库问题 成功率=0,平均进展=1.000

HDR

初始布局 箱子路径 箱子接近 墙壁 目标 消失

L1

L2

L3

L4

L5

L6

图13:HDR在仓库问题中的失败案例。箱子轨迹基本正确并接近目标,但在 rollout 接近尾声时墙壁消失,导致最终场景在物理上不一致。

27

第 28 页

倒水任务 成功率=0,平均进度=0.869

HDR

混合管 橙色水 形成组 最终管 变红 分离

L1

L2

L3

L4

L5

L6

图 14:HDR 在倒水任务中的失败案例。模型几乎正确完成了管子的分组,但橙色液体坍塌为红色,导致最终排列在视觉上合理但无效。

28

第 29 页

I 基线与实现细节

基线。我们将 HDR 与三类基线方法进行比较。第一类方法包括全注意力机制方法,如双向扩散模型和 VideoMAE [23]。这些方法允许全局时间交互,因此提供了面向推理能力的有力对比,但它们需要密集的序列处理。对于 VideoMAE,我们通过训练时随机掩码 90%–100% 的 token,并在推理时掩码除第一帧外的所有帧,从而实现图像到视频的生成。第二类方法包括非全注意力机制方法,如因果扩散模型、自回归生成以及 VideoGPT [30]。这些方法效率更高,且更契合流式生成,但它们更容易受到不可逆的早期错误影响。为了进行受控比较,双向扩散基线和因果扩散基线均基于 Wan2.2-5B-TI2V [24] 构建。双向基线遵循骨干网络原始的全注意力推理范式。因果基线将全时间注意力替换为因果注意力掩码,并使用来自 Causal Forcing [41] 的教师强制策略进行训练。这种设置隔离了时间注意力和因果展开的效果,同时保持底层生成骨干网络的 comparability(可比性)。

HDR 实现。我们的实现同样基于 Wan2.2-5B-TI2V,并在骨干网络上增加了第 3 节中描述的层次潜在树结构。对于主实验中使用的 125 帧设置,我们在潜在空间中采用六个层次级别,大小分别为 1, 2, 4, 8, 16, 32,并采用熵匹配的去噪调度 [5, 8, 13, 20, 32, 50]。除非另有说明,这是 HDR 的默认设置。我们在附录 C 中提供了该熵匹配调度的推导和消融实验。在训练方面,我们使用一个混合推理数据集,总共包含 18,000 个视频片段,其中六个任务各包含 3,000 个合成视频。所有视频均调整大小为 224 × 224。我们直接从原始视频进行训练,而非使用预计算的潜在变量:视频在训练过程中在线解码,并由 Wan2.2 TI2V VAE 进行编码。我们以第一帧作为条件,并允许该条件对所有层次级别可见。模型从预训练的 Wan2.2-5B-TI2V 检查点初始化,并使用 flow-matching 目标优化 100,000 个训练步骤。我们使用 AdamW 优化器,学习率为 2 × 10−6,betas 为 (0, 0.999),权重衰减为 0.01,采用 bfloat16 混合精度训练、梯度检查点以及混合全分片 FSDP。设备级批次大小为 1,总批次大小为 8。在推理过程中,我们使用无分类器引导(classifier-free guidance),缩放比例为 3.0。每次主要训练运行使用 8 块 GPU,耗时约 48 小时。所有基线均在相同配置下训练和评估,以确保公平比较。

29

发表评论