快速导读:提出ShadowDancer,通过构建“影子对”和跨影子预测,从示范视频中学习与外观解耦的统一动态表征,实现对交互式视频世界模型的任意动作、帧级精确控制。
交互式视频世界模型的目标是生成可探索、可交互的持久虚拟世界,但其控制接口始终面临精确性与通用性的权衡。ShadowDancer通过一个简洁而深刻的观察切入这一难题:如果能让同一段动态穿上不同的“外观外衣”,模型就不得不学会忽略外观,只关注动态本身。
本文提出影子学习范式(Shadow learning paradigm),核心思想是构建“影子对”——重放同一动态轨迹但独立重采样角色、场景、光照等外观因素的两个帧同步视频——并训练潜在动作模型(LAM)从源影子提取潜在动作,预测目标影子的下一帧。这一跨影子预测目标从数据构造层面迫使潜在表征与外观解耦,从而获得统一的动态表征。
英文题目:ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow
论文出处:arXiv 每日论文精选 · arXiv:2607.28362
原始论文:PDF / 论文页面
对应视频标题:ShadowDancer:用“影子”教会世界模型任意动作——从数据构造解决动态与外观纠缠|推荐指数:★★★★★
这篇论文解决什么问题?
现有交互式视频世界模型的控制接口大致分为三类:符号或文本指令(如“向左走”)语义模糊,无法实现帧级精确控制;结构化运动输入(如3D人体姿态、相机轨迹)仅适用于单一动态类型,且获取成本高;基于自重建的潜在动作模型(LAM)从视频中学习控制信号,但自重建目标使其无法区分动态和外观——模型可能通过记忆角色的服装颜色而非运动模式来完成重建,导致跨场景动作迁移失败。
这一困境的数学本质是潜在动作的非可辨识性问题:给定单段视频,存在无穷多种方式将帧间变化分解为“动态”和“外观”,自重建目标无法唯一确定这种分解。Olaf-World和Genie等现有方法均受困于此,其学到的潜在动作不可避免地与训练视频的外观统计绑定。
ShadowDancer的关键洞察是:非可辨识性源于观测数据的单一性。如果能对同一动态提供多个外观不同的观测,模型就能通过“不变性”来识别真正的动态因素。这正是影子对的核心动机——在数据层面创造这种多观测条件,而非依赖模型架构或正则化技巧。
核心创新
- 提出影子学习范式(Shadow learning paradigm),通过构建“影子对”使动态在数据层面与外观解耦,从构造上解决了潜在动作的非可辨识性问题。
- 构建了源无关的影子库(Shadow Library),通过配对渲染协议在动画、游戏、机器人模拟器等不同来源上生成影子对,无需任何动作标签。
- 提出跨影子预测(Cross-shadow prediction)目标,训练LAM预测同一动态的另一影子,使学到的潜在表征z对重采样的外观因素具有不变性。
- 将潜在动作z与源视频细节资产s结合,注入块因果视频扩散模型,实现任意长度、可组合的动作资产驱动生成。
方法概览
ShadowDancer包含三部分:(1) 影子库(Shadow Library):通过重放动态并独立重采样外观(角色、场景、光照等)构建帧同步的“影子对”(x, ˜x);(2) 跨影子预测(Cross-shadow prediction):训练LAM从源视频x提取潜在动作z,并基于目标影子˜x的上下文预测其下一帧,迫使z仅保留共享的动态信息;(3) 将冻结的LAM和3D-VAE编码的动作资产(z, s)注入预训练视频扩散模型,并将其转换为块因果(block-causal)生成器,实现交互式长序列生成。
- 影子库(Shadow Library):跨动画资源(Mixamo等)、游戏引擎(UE5.5)、机器人模拟器(ManiSkill3)等多个来源,通过配对渲染协议构建影子对。具体而言,对每条动态轨迹,固定动态参数(骨骼动画、关节角度等),独立随机采样角色模型、纹理、场景、光照、相机角度等外观因素,渲染两段帧同步视频。未配对数据(如真实视频)以自配对形式参与训练。影子库总计包含约200万对影子对,覆盖人类运动、第一/三人称战斗、驾驶、机器人操作等动态族。
- 跨影子预测(Cross-shadow prediction):给定影子对(x, ˜x),LAM编码器从源视频x的帧间转换中提取潜在动作序列z,解码器以目标影子˜x的历史帧和z为条件预测其下一帧。由于x和˜x共享动态但外观独立,模型必须学会忽略外观信息,仅从x中提取与动态相关的信号。训练使用β-VAE目标,通过变分瓶颈进一步压缩表征。
- 动作资产(Action assets):从任意示范片段中提取可变长度的(z, s)对,其中z是LAM编码的动态表征,s是3D-VAE编码的源视频细节资产(用于保留高频纹理信息)。这些资产可存储、索引和组合,形成类似“动作库”的控制接口。
- 块因果视频扩散模型(Block-causal video diffusion):将预训练的视频扩散模型转换为块因果生成器,以动作资产为条件进行自回归生成。每个生成块内使用全注意力,块间使用因果注意力,支持无限长序列生成。生成时,z通过交叉注意力注入,s通过通道拼接注入。
- 多源训练与通道掩码:不同来源的影子对提供不同类型的监督信号——游戏数据同时提供动态和相机控制,机器人数据仅提供动态控制,动画数据提供完整配对。通过逐样本掩码(m_cam, m_dyn)控制各通道的监督强度,使单一模型统一处理所有动态族。
- 推理时的动作组合:用户可通过离散指令映射到预存的动作资产,串联生成长视频;也可从新示范视频中实时提取资产进行迁移。对于未见动作,模型依赖编码器的泛化能力而非记忆动作类别。
逐图理解论文
失败的直觉

图3展示了动作迁移的定性对比。顶部为提供动作的参考视频,下方为帧同步的生成结果。Olaf-World的生成出现角色扭曲和伪运动(如第一人称战斗中手臂异常摆动),而ShadowDancer忠实地复现了参考动态。这张图直观展示了动态-外观解耦的实际效果。
核心区分

图1展示了ShadowDancer的核心流程。上半部分显示影子对(x, ˜x)的构建——同一动态在不同外观下的两段帧同步视频——以及统一动态表征z的提取。下半部分展示了该表征驱动的多样化动作控制效果,涵盖第一/三人称战斗、驾驶、运动和机器人操作。这张图直观说明了“同一动态,不同外观”的核心思想。
结论与意义

表1报告了五个动态族上的动作迁移定量结果。ShadowDancer在PSNR、LPIPS、ATE/RPE三项指标上全面领先Olaf-World,尤其在人类运动(PSNR 22.4 vs 18.2)和机器人操作上优势显著。注意观察各动态族间的性能差异,反映了不同来源数据的配对质量影响。
实验如何设计?
- 动作迁移实验:在人类运动(HumanML3D)、第一人称战斗(UE5.5 FPS)、第三人称动作(UE5.5 TPS)、相机控制(UE5.5 Driving)和机器人操作(ManiSkill3)五个动态族上,将源视频的动作迁移到目标影子环境生成,评估PSNR、LPIPS、ATE/RPE(第7页)。
- 长序列动作rollout:将离散指令映射为预存的动作资产,串联生成512帧(约21秒)视频,通过盲测2AFC评估动作控制、动作保真度和长程一致性,对比Olaf-World、Yume-1.5和LingBot-World 2.0(第7页)。
- 消融实验:逐步添加影子配对和源资产,验证各组件的贡献。基线为仅使用z的Olaf-World风格模型(第8页)。
- 未见动作迁移:使用训练后通过游戏模组引入的新角色和新动作(如双手剑攻击)提取资产,驱动目标环境生成,测试泛化能力(第9页)。
- 表征探针实验:在留出的影子对和UE片段上,通过线性探针预测角色身份和场景ID,评估潜在表征与外观的解耦程度(第18页,表5)。
- 干预实验:固定潜在动作z,替换源资产s或目标外观,测量生成结果的PSNR变化,分析z和s各自承载的信息(第18页,表7)。
关键结果与论文证据
- 动作迁移:ShadowDancer在所有五个动态族上大幅领先Olaf-World。人类运动PSNR从18.2提升至22.4,LPIPS从0.288降至0.184(第7页,表1)。定性结果显示,Olaf-World生成的角色外观扭曲、出现伪运动,而ShadowDancer忠实地复现了参考动态(第7页,图3)。
- 长序列rollout盲测:ShadowDancer在动作控制、动作保真度和长程一致性三个维度上的平均胜率分别为94%、95%和94%,全面优于所有基线(第7页,表2)。定性对比显示,基线方法随时间漂移或质量退化,ShadowDancer保持稳定(第8页,图4)。
- 消融实验:影子配对是性能提升的基础——将配对潜在动作加入基线后,PSNR从12.44提升至14.75;完整ShadowDancer(配对+资产)PSNR达到16.35(第8页,表3)。单独添加资产而不配对(行a')效果有限,证明配对是关键。
- 分布级质量:ShadowDancer的FVD在所有动态族上均优于Olaf-World,表明解耦表征不仅提升控制精度,也改善生成质量(第18页,表6)。
- 表征解耦验证:线性探针实验显示,ShadowDancer的潜在表征对角色身份的预测准确率显著低于Olaf-World基线,证明外观信息已被有效剥离(第18页,表5)。
- 资产角色分离:干预实验表明,z主要承载动态信息(替换z导致PSNR大幅下降),s主要承载外观细节(替换s影响纹理保真度),两者分工明确(第18页,表7)。
- 未见动作泛化:模型成功将模组引入的双手剑攻击动作迁移到新环境,证明编码器学习的是“如何读取动态”而非记忆动作类别(第9页,图5)。
阅读时需要注意
- 部署时需要预先准备动作资产(参考片段或存储的资产),无法实时处理无示范的新动态。
- 影子对在游戏引擎和模拟器中易于构建,但在真实世界中难以采集——真实视频只能作为自配对参与训练,无法提供解耦的监督信号,限制了方法在纯真实数据场景下的应用。
- 定理C.2和推论C.3讨论的是确定性统计量,而实际使用的变分瓶颈(β-VAE)是率失真近似,不能保证严格的充分性和最小性(第15页)。
- 模型对未见动作的泛化能力受限于训练数据的动态多样性,极端偏离训练分布的动态可能无法准确编码。
关联工作
- Olaf-World:最先进的基于自重建的潜在动作模型,其潜在动作与外观纠缠,是本文的主要对比对象(第2页)。
- Genie:从无标签视频中学习潜在动作的交互式环境生成模型,面临相同的潜在动作非可辨识性问题(第2页)。
- Yume-1.5和LingBot-World 2.0:分别基于文本/键鼠和相机轨迹/文本触发的交互式世界模型,控制接口模糊,是长序列rollout实验的基线(第2页)。
- 本文的影子学习范式与多视角对比学习、域泛化中的不变性学习有思想上的联系,但在视频世界模型控制这一具体问题上首次实现了数据层面的动态-外观解耦。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
ShadowDancer:通过从视频及其影子中学习统一动态表征,教会视频世界模型任意动作
金操1 孟子安1,2 张凯鹏1† 1Alaya Lab 2上海创新研究院 https://ShadowDancer-1.github.io
✦ 从影子对中学习 ✦ 人体运动 机器人操作 UE5游戏玩法 ✦ShadowDancer
x
x̃ 统一动态表征2026
✦多样化动作生成 ✦Jul 30 [cs.CV] arXiv:2607.28362v1
图1. ShadowDancer从视频及其影子中学习任意动作。上图:shadow pairs (x, ˜x) 在独立重采样的外观下重放同一动态,跨越人体运动、机器人操作和开放世界游戏玩法等异构来源,并将其蒸馏为统一动态表征 z1:T −1。下图:同一潜在接口驱动多样化的指令动作,涵盖第一人称和第三人称战斗、驾驶、运动和机器人操作。
第 2 页
抽象融合骨干网络已经能够很好地合成复杂的铰接运动[5, 9, 36, 55];瓶颈在于动作的表征:用户如何传达应该展开哪些动态。任意动作、帧级控制本质上是一个表征学习问题,而每种现有接口都可以被解读为一种候选表征。符号化命令[14, 26, 63]是围绕按键记录等交互日志设计的:它们从一个有限词汇表中命名一个事件,并将其轨迹留给生成器即兴发挥,因此长按一个键会重复一个动作,但几乎无法重塑它。自由形式的文本[41, 65]消除了词汇表,但并未消除歧义,因为语言描述的是动态,而非提供动态。结构化运动输入,如3D人体运动[8, 16]、点轨迹[37, 47]和相机姿态轨迹,确实达到了帧级精度,但每种格式只服务于单一族类,需要自己的条件机制,并依赖于专门但往往脆弱的估计器,因此它所承诺的精确信号在实践中难以获得。剩下的就是示范本身,这是一种时间密集且无格式限制的自然规范,也是人类学习新动作的方式。潜在动作模型已经利用了这一点,将参考片段的转换蒸馏为连续潜在动作z,用以条件生成[6, 11, 15, 46, 61]。但关键的是,这类模型被训练来重建它们所读取的同一个片段,而自重建与控制从根本上存在冲突:重建仅要求z解释观察到的外观,而控制则要求它将底层动态迁移到新的外观上[20, 32, 34, 40, 60]。由于训练时从未观察到同一动态在两种不同外观下的表现,潜在变量无法分辨哪些特征属于动作,哪些只是与之共现:它不加区分地将运动内容与外观纠缠在一起,而缩小它[18]或将其正则化到语义特征[32]都是在同一监督下进行的:不变性只能作为惩罚项被鼓励,未被选择的残留部分可能会在生成中重新浮现为虚假运动。任务所需的是从数据中学习表征,而这些数据通过构造已将动态与外观分离。
为应对这一挑战,我们提出了ShadowDancer,其核心思想是观察同一动态两次。我们的方法引入了两项关键创新。(1) Shadow Library:我们将“观察两次”实现为shadow pairs,其中一个视频的Shadow是同一动态在另一种外观下的第二次渲染,运动帧同步,而主体、场景、材质和光照则被独立重采样。构建影子是一种协议而非引擎:重放动态并重采样其他一切。Shadow Library在动画套件、开放世界游戏和机器人模拟器中实现了这一协议。(2) cross-shadow prediction:一个编码器从一个视频中提取潜在动作,一个解码器在目标影子自身的外观下,根据这些潜在变量预测另一个影子。
†通讯作者。
第 3 页
2. 相关工作
交互式视频世界模型。世界模型预测未来观测,并支持游戏、机器人学和驾驶中的规划或交互式仿真[1, 17, 24, 25],近期系统能以令人印象深刻的保真度和时间跨度生成可探索的世界[14, 19, 26, 41, 43, 49, 52]。然而,它们的控制接口是符号化或文本式的:从游戏引擎记录的帧级键盘和鼠标状态[3, 14, 59, 63],或自由形式的文本提示[41, 65]。这些命令指定了发生什么,而非如何发生(第1节),而遥测记录的接口进一步将每个模型绑定到其数据采集管线的动作模式上[26, 28, 50, 62];结构化的运动输入[8, 16, 37, 47]则相反,是精确的,但针对特定动作族且难以准确获取。ShadowDancer 则基于从参考片段中提取的逐帧密集潜在变量进行条件控制,因此动作的速度、幅度和风格由参考提供,且任何可构建影子对的动态族都通过一个接口进行控制。
潜在动作作为控制接口。潜在动作模型(LAMs)直接从无标签视频中推断控制信号,作为交互式生成[6, 18, 31]、跨形态策略学习[7, 11–13, 35, 61]以及世界模型预训练[15, 20, 46, 57]的接口。与旨在目标形态上执行示范行为的模仿学习不同,我们的重点是表征本身:一种从示范中提取的、可跨外观和环境迁移的可复用动态信号。核心困难在于,逆动力学潜在变量将控制耦合到与之共现的任何外观上:片段局部重建会通过上下文线索产生捷径解[20, 60],且在不同上下文间不可识别[34, 40],因此相同的底层动态未必映射到一致的潜在变量[32]。现有补救措施约束潜在变量(信息瓶颈、量化)[6, 18]或将其正则化到以运动为中心的参考上[32];在实践中,正则化减少但并未消除纠缠。所有这些方法都基于对每个转换的单次观测,因此所需的不变性是作为惩罚施加的,而非由数据展现。影子配对则改变了数据:每个动态在独立重采样的外观下被观测两次,因此不变性由构造成立,目标函数只需将其读出。
构造不变性。我们的监督方式移植了自监督学习中一个经过验证的配方:表征由训练所用的配对定义,因为配对变化的部分被丢弃,而保留的部分被保持。对比学习将一张图像的两个增强版本配对,因此表征丢弃裁剪和颜色,同时保留视觉身份[10];CLIP 将图像与其标题配对,因此它保留语言能够表达的语义[45];掩码和预测视频目标将相同的逻辑扩展到
第 4 页
1 构建影子对 2 从影子对训练 LAM 训练 3 训练动作条件世界模型 训练
连续视频动作 潜在动作模型 (LAM) ❄ LAM 源 逆- 🔥 潜在 源 动力学 拼接片段 采样器 动作资产 编码器 ❄ 相同动力学 3D-VAE
影子 上下文 预测 目标 目标 上下文 预测 目标 前向🔥 🔥 世界模型 解码器
4 可复用动作资产 条件 开合跳 拉伸 深蹲 部署 流式 … ❄ 开合跳 LAM
因果 ❄ 扩散块 拉伸 LAM
❄ 流式 … 深蹲 LAM 推演
图 2. ShadowDancer 概览,以人体运动为例;该流程同样适用于相机、物体及其他所有动力学族。(1) 一个影子对将同一动力学 d 渲染两次,x=R(d, c) 和 ˜x=R(d, ˜c),其余因子独立重采样。(2) 跨影子预测训练 LAM:编码器从源转换中读取每个 zt,解码器基于 (˜xt, zt) 预测下一影子帧,因此只有影子对共享的信息能保留在 z 中。(3) 在 LAM 和 3D-VAE 冻结的情况下,微调视频扩散骨干网络为块因果世界模型,以动作轨迹 z 和源动作资产 s 为条件,并在连续和拼接的混合源上进行训练。(4) 部署时,可变长度的动作资产 (z, s) 被存储,沿条件流组合,并通过因果块流式处理;一个新动作仅需通过冻结编码器一次。
时空结构 [4, 53]。在每种情况下,目标 a = (z, s) 是世界模型消费的可复用动作资产,而统一动态表征始终仅指 z,其统一性体现在:一个编码器、一个潜在空间,以及面向所有动力学族的一个接口。
3.1. 影子公式
我们将视频 x = (x1, . . . , xT ) 建模为渲染过程的输出
x = R(d,c),\label{eq:render} (1)
其中 d = (d1, . . . , dT ) 是时变动力学轨迹,即驱动帧间变化的因子,而 c 则汇集了其余生成因子,如主体身份、场景、材质和光照,我们称之为外观。在此符号表示下,我们标题中的隐喻是字面意义上的:视频是其动力学的影子,是 d 在特定 c 下的一次渲染。仅观察 x 时,d 和 c 是纠缠的:许多不同的 (d, c) 对可以解释相同的像素,这是潜在动作学习中出现捷径和不可识别性失败的根本原因 [32, 40, 60]。
一个影子对包含同一动力学的两次独立渲染,
\big (\, x = R(d ,c ) , \; \tilde{x}=R(d,\tilde{c})\,\big),\;\;\tilde{c}\simp(c),\label{eq:shadowpair} (2)
第 5 页
其中两个视频是帧同步的:外观 x 的第 t 帧与 ˜x 的第 t 帧共享相同的 d_t。两个视频都受到 KL 项的约束,瓶颈仅保留有助于预测的信息,即共享的动态。与特征对齐正则化器 [32] 不同,预测监督本身提供了这种跨上下文约束。以概率 p,我们也让视频与自身配对 (˜x = x),将标准单视频 LAM 目标恢复为一种退化情况;这些自配对允许将未配对的真实视频纳入同一训练流(第 3.4 节),作为经验性真实感增强,超出下述保证范围。
形式化保证。这种对动态的偏好不仅是直觉;我们证明了它。记 D 为共享动态,X 为源视频,(B, Y) 为目标侧上下文和预测目标,K_d 为给定 B 时在动态 d 下 Y 的分布律。每当配对协议满足 \[ \underbrace{(X, Y) \perp\!\!\!\perp B \mid D}_{\text{独立重采样}},\quad \underbrace{K_d = K_{d'} \Rightarrow d = d'}_{\text{效应分离}},\quad \underbrace{D = h(X)}_{\text{D 可观测}}, \label{eq:conditions} \] 则足以从一个影子预测另一个影子的最小表示,就是共享动态本身,至多相差一个可逆重参数化(定理 C.2);形式化陈述和证明见补充材料第 C 节。
因子选择性控制。动态本身是复合的:观察者自身的运动(自我运动,即相机)和所观察一切的运动(场景)在每个视频中叠加。配对构建将它们分离在同一个潜在空间内,并指定读出方式:仅保留相机轨迹的配对监督一个 cam 头,仅保留场景动态的配对监督一个 dyn 头,同时保留两者的配对监督一个 full 头;dyn 因子包含的内容本身由每个族的配对协议定义,在我们的机器人操作配对中仅为手臂轨迹,在人类配对中为身体运动。因此,在推理时,同一参考视频可以被解读为纯相机动作、纯场景动作或它们的联合;机制详见补充材料第 B.1 节。
3.3. 从表征到世界模型
条件化设计遵循两个原则:(i) 动作潜在变量 z 承载统一的、可迁移的控制信号,而 (ii) 源流 s 提供高频运动细节,这些细节是受不变性约束的瓶颈刻意设计得过小而无法承载的。
动作条件化生成。我们在 Shadow Library 片段上,使用流匹配 [39] 微调一个预训练的视频扩散 Transformer (DiT) [9, 44, 55]:冻结的 LAM 的动作被融合到时间步嵌入中,用于 AdaLN 调制,并通过专用的交叉注意力臂进行注意力计算;源视频由 3D-VAE 编码,并作为运动资产注入,通过输入卷积处的通道拼接和作为额外的交叉注意力上下文。由于源和目标构成一个 shadow pair,
第 6 页
复制源外观不会得到奖励,因此生成器被训练为从源中读取运动细节而非外观;交叉注意力臂采用零初始化,细节见补充材料第B.2节。
用于交互式推演的块因果转换。交互式世界模型必须能够在长时域上进行仅前向生成,而扩散骨干网络是双向且固定长度的。遵循近期视频扩散的因果转换工作[23, 30],我们将双向模型微调为块因果生成器:潜在帧被分组为块,注意力在块间是因果的,去噪过程以前序块的干净历史为条件。在推理时,模型通过键值缓存逐块推演,消费潜在动作流并输出帧流。
动作作为可复用资产。在推理时,模型接收首帧I0和一个示范,该示范以参考片段或已存储的动作资产形式给出:冻结的编码器将示范读入逐帧潜在动作z,块因果生成器推演出一个视频,其中所描绘的世界重演了示范的动态。由于控制是潜在轨迹而非逐帧关键状态,ShadowDancer中的“动作”是一个可变长度的动态片段,存储为动作资产:从任意时长的片段中提取a = (z1:K, s),存储它,在任意世界中重放它,并通过沿推演过程拼接来组合片段。因此,教会模型一个新动作只需通过冻结编码器进行一次前向传播,无需词汇设计、标签或微调。块仅为因果去噪而将潜在帧分组,而动作流保持逐帧形式,因此单个动作可以跨越多个块,其时间细节不受块率的约束。在部署时,离散命令检索并拼接短小的已存储资产,而非提供一个连续的示范;因此,我们在训练中使生成器暴露于相同的不连续条件,以一定概率将连续源替换为从固定资产库中抽取的规范动作块的拼接,这样推理时的命令就是一个库查找,与生成器训练时的输入统计相匹配。
3.4. 影子库
影子协议重放动态并重采样其他一切,允许多种实现,我们有意构建一个库而非单一引擎。动画套件在角色、场景、光照和摄像机之间重放铰接式人体运动;开放世界游戏环境在区域、天气和时段之间重放轨迹;机器人模拟器在机械臂、物体和桌面之间重放操作;摄像机轨迹源在不同场景中重放同一路径。所有源都输出相同的产物,即共享同一动态的帧同步片段集,因此一个新的动作族只需贡献一个额外的影子脚本即可集成。
缺乏精确影子的真实世界视频,以与退化自配对(˜x = x)完全相同的方式进入流程:它贡献视觉多样性和真实感先验,而不变性压力则由合成配对提供。真正的影子对提供识别信号;自配对则拓宽视觉支持。
4. 实验
4.1. 实现细节
遵循[18, 32],LAM的潜在维度为dz=32,并在影子库上以世界模型一半的空间分辨率(H/2×W/2)训练,β=0.01;真实视频以退化自配对形式进入。世界模型基于SkyReels-V2-1.3B I2V DiT骨干网络[9]构建,使用流匹配进行微调,并转换为块因果生成器。所有实验均在NVIDIA H200 GPU上进行。更多实现细节见补充材料第D节。
数据集 影子库涵盖铰接式人体运动(在Blender中跨角色、场景、光照和摄像机重新渲染的SMPL-X序列,以及由[8]驱动的配对渲染,在重采样的角色和环境下重放同一运动)、机器人操作(ManiSkill [51])、第一人称开放世界游戏(GTA和赛博朋克风格的城市场景,包含第一人称武器射击和驾驶)、第三人称游戏(虚幻引擎场景;怪物猎人风格动作),以及摄像机轨迹,包括围绕铰接主体的轨迹和穿越静态场景的轨迹(DL3DV [38]);未配对真实视频(OpenX机器人语料库[42]、互联网片段[33])作为自配对加入。来自每个源的保留影子对构成评估集;影子库的完整构成见补充材料第D节表格。
4.2. 跨动态族的动作迁移
我们的第一个实验在一个协议中检验核心主张:单一模型通过一个潜在接口在新环境中重演每一个动态族。对于影子库中的每个族(人体运动、第一人称战斗、第三人称动作、机器人操作和摄像机控制),我们保留影子对,从视频x中提取动作,并从其影子˜x的首帧生成,这实现了相同的、帧同步的动态。四个族通过与˜x的帧对齐重建进行评分(PSNR、LPIPS [64]);摄像机控制通过目标轨迹与从生成结果中用VGGT [56]恢复的姿态之间的轨迹误差(ATE/RPE [48])进行评分。基线是Olaf-World [32],这是最先进的自重建潜在动作模型:我们匹配训练数据和世界模型骨干,通过相同路径注入其潜在变量,并保留其原始的单头、仅z设计,该设计没有源资产流。表1报告了结果:Shadow-
第 7 页
表1. 跨动态族的动作迁移定量对比。最佳结果以粗体显示。
| 方法 | 人体运动 | | 第一人称战斗 | | 第三人称动作 | | 相机控制 | | 机器人操作 | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | PSNR↑ | LPIPS↓ | PSNR↑ | LPIPS↓ | PSNR↑ | LPIPS↓ | ATE↓ | RPE↓ | PSNR↑ | LPIPS↓ | | Olaf-World [32] | 18.2 | 0.288 | 13.0 | 0.532 | 12.6 | 0.506 | 0.072 | 0.021 | 14.0 | 0.478 | | ShadowDancer (ours) | 22.4 | 0.184 | 17.0 | 0.354 | 17.4 | 0.309 | 0.005 | 0.003 | 22.6 | 0.116 |
(A) "武器开火" (B) "带相机平移的行走" 参考视频 参考视频
Olaf-World Olaf-World
Ours Ours
(C) "剑击" (D) "竖直提起销钉" (仅提取机器人手臂动态) 参考视频 参考视频
Olaf-World Olaf-World
Ours Ours
图3. 与Olaf-World的定性动作迁移对比。上方:提供跨四个族动作的参考视频;下方:在新环境中帧同步的生成结果。Olaf-World扭曲了主体并泄露了虚假运动;ShadowDancer忠实地复现了参考动态。
表2. 长动作推演。盲测2AFC偏好率显示ShadowDancer在每个族上都以较大优势领先。Dancer相对于每个基线的优势;>50%表示偏好我们的方法。 | ShadowDancer (ours) 对比 | 动作控制 | 动作保真度 | 长时程一致性 | | :— | :—: | :—: | :—: | | Olaf-World [32] | 94% | 95% | 94% | | Yume-1.5 [41] | 88% | 86% | 91% | | LingBot-World 2.0 [19] | 78% | 83% | 64% |
这种差距在图3中可见:Olaf-World经常产生扭曲、变形的主体和虚假的相机运动,因为其纠缠的潜在空间无法从源中干净地提取预期的动态,因此它迁移的是动作与伴随出现的任何外观的混合体;而通过影子训练的潜在空间,同样的接口能在新环境中忠实地复现所演示的动态。潜在空间级别的探针在任何生成发生之前就证实了这一点:对z的线性探针显示,cross-shadow prediction在保留动作内容的同时,减少了重采样场景信息的泄露(补充材料D节)。这种增益并非通过模糊换取:在三个重建族上,ShadowDancer的Fréchet视频距离大约是Olaf-World的一半(补充材料D节)。
4.3. 长动作推演
我们的第二个实验评估了学习到的action assets在长时程上是否保持可组合性。离散命令通过查找映射到规范的action assets,并被流式传输到长推演中,每个视频串联多个命令,涵盖导航、瞄准与开火、技能施放,横跨第一人称和第三人称世界,以及人体运动和机器人操作流。与迁移设置不同,串联的命令流没有真值实现,因此控制效果必须通过评判而非测量来评估:遵循[65]的偏好协议,每个ShadowDancer推演结果与基线结果进行盲测双选项强制选择(2AFC)的正面比较,由VLM(Fable 5)对所有成对比较进行评判。
7
第 8 页
(A) “机器人操作:抓取与释放” (B) “第一人称战斗:武器切换与开火” Olaf-World Olaf-World YUME1.5 YUME1.5 LingBot-v2 LingBot-v2
Ours Ours
(C) “人体运动:密集参考跟随” (D) “第三人称战斗:连招执行” Olaf-World Olaf-World YUME1.5 YUME1.5 LingBot-v2 LingBot-v2
Ours Ours
图4. 长动作推演的定性结果。每个对比从同一初始帧开始,遵循相同的指令流;行表示方法,列表示推演过程中的时间步。在基线方法出现漂移或退化时,ShadowDancer 保持对齐。
表3. 关键组件的影响。从仅使用z的潜在空间(Olaf- 对比围绕三个以动作为中心的维度展开:动作控制 World)开始,加入配对,再加入资产(=ShadowDancer)。行(a′) (指令动作是否被执行)、动作保真度(特定的武器/物体/运动 将资产加入未配对的z,以隔离配对的效果。 是否被保留)以及长程一致性(推演过程中无漂移或退化); 视觉保真度因与控制正交而被排除。我们与最先进的开源 设置 z 配对z 资产 PSNR↑ LPIPS↓ 交互式世界模型 LingBot-World 2.0 [19](由相机位姿轨迹和 (a) Olaf-World (仅z) ✓ × × 12.44 0.555 文本触发事件驱动)和 Yume-1.5 [41](由文本和按键驱动), (b) + 配对 ✓ ✓ × 14.75 0.448 以及在我们骨干网络上运行的 Olaf-World 潜在接口进行对比; (c) 资产,无动作 × – ✓ 15.07 0.420 每个方法通过其原生接口接收相同的指令流。该对比特意 (a′) 资产 + 未配对z ✓ × ✓ 14.92 0.428 在系统层面进行:各接口按设计接收不同信息,而用户的 (d) ShadowDancer (ours) ✓ ✓ ✓ 16.35 0.376 指令在每个接口中保留的忠实度正是被衡量的对象。表2 报告了偏好率,图4展示了代表性推演;在基线方法出现 漂移、幻觉或退化时,ShadowDancer 保持对齐。
4.4. 消融研究
shadow pairing 和源资产的有效性 如表3所示,我们在第4.2节的迁移划分上研究了每个组件的贡献:(a) 先前的仅z潜在接口,一个遵循 Olaf-World 方案 [32] 在我们的数据上单独训练的模型;(b) 相同的接口,但 LAM 在 shadow pairs 上训练,而非自重建;(c) 不含动作z的源资产;(d) 完整模型;(b)、(c) 和 (d) 是同一检查点的推理时消融,而 (a) 和 (a′) 是在匹配方案下单独训练的。配对是基础:一旦潜在空间被约束为仅承载动态,同一接口便变得可迁移((a) vs. (b))。资产本身是强大的载体,因为源视频已包含动作及其空间细节,因此 (c) 匹配或超越了瓶颈化的z。决定性的对比是 (a′) vs. (d):它们共享一个潜在变量和资产,唯一区别在于潜在变量是否通过 shadow pairing 训练,而配对的潜在变量将 PSNR 提升了1.4;相比之下,未配对的潜在变量在资产之上毫无增益((a′) vs. (c))。因此,顶线增益归因于 cross-shadow pairing,而非资产本身或对任何潜在变量的条件化。
8
第 9 页
(A) 未见动作资产
向前走 W 右转 L 攻击 F
•••
(B) 在新环境中直接生成(无适配)
图 5. 迁移未见动作:从经过修改的、未见过的角色录制的资产 (A) 驱动在新环境中的生成 (B)。
4.5. 通过展示而非描述来迁移未见动作
潜在接口的通用性取决于其在从未见过的动态上的表现,因此我们测试了在训练后通过游戏模组引入的动作迁移:一个未见过的玩家角色和一把双手剑,其攻击是挥砍而非射击;这两个资产均未出现在 Shadow Library 中,它们产生的动作也未曾出现。我们从修改后的角色录制了行走、转身和剑攻击,作为 action assets。源片段在一个地图上录制,提取的动作在保留的地图上重放,因此向新环境的迁移已内建于协议中;图 5 展示了结果。修改后的动态在重放中得以保留:该角色的步态和这把剑的挥砍——模型从未观察过的动作——在保留的地图上被复现,这表明编码器读取的是动态而非记忆的动作类别。这种泛化正是该范式扩展潜力的所在:训练后展示的行为只需通过冻结编码器一次即可加入动作库,因此覆盖范围随新的演示而增长,而非随新的训练运行而增长。
5. 结论
ShadowDancer 通过演示实现了对交互式视频世界模型的任意动作、帧级控制。通过 shadow pairs 和 cross-shadow prediction,它学习了一种 unified dynamics representation,该表征通过构造丢弃了配对重采样的内容,并保留了其保持的内容,因此用户可以将任何片段的动态提取为可重用的 action asset,并在新环境中重放,无需标签、估计器或微调。我们的实验证明,在动作迁移和长动作 rollout 方面,ShadowDancer 相较于潜在动作和交互式世界模型基线均有显著提升,涵盖从人体运动和相机控制到游戏玩法和机器人操作的动态族。ShadowDancer 为交互式世界模型开启了新的可能性,这些模型现在可以通过演示而非提示来驱动,应用范围从娱乐到具身智能体的仿真训练。我们在补充材料 A 节中讨论了局限性和未来方向。
参考文献 [1] Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, et al. Cosmos world foundation model platform for physical ai. arXiv preprint arXiv:2501.03575, 2025. 3 [2] Alexander A. Alemi, Ian Fischer, Joshua V. Dillon, and Kevin Murphy. Deep variational information bottleneck. In ICLR, 2017. 5 [3] Eloi Alonso, Adam Jelley, Vincent Micheli, Anssi Kanervisto, Amos J Storkey, Tim Pearce, and François Fleuret. Diffusion for world modeling: Visual details matter in atari. NeurIPS, 2024. 3 [4] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, et al. V-JEPA 2: Self-supervised video models enable understanding, prediction and planning. arXiv preprint arXiv:2506.09985, 2025. 4 [5] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh. Video generation models as world simulators. 2024. 2 [6] Jake Bruce, Michael D Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, et al. Genie: Generative interactive environments. In ICML, 2024. 2, 3 [7] Qingwen Bu, Yanting Yang, Jisong Cai, Shenyuan Gao, Guanghui Ren, Maoqing Yao, Ping Luo, and Hongyang Li. UniVLA: Learning to act anywhere with task-centric latent actions. arXiv preprint arXiv:2505.06111, 2025. 3 [8] Chenjie Cao, Jingkai Zhou, Shikai Li, Jingyun Liang, Chaohui Yu, Fan Wang, Xiangyang Xue, and Yanwei Fu. Unifying
9
第 10 页
[23] Yuchao Gu, Weijia Mao, and Mike Zheng Shou. 面向视频生成的精确3D增强相机与人体运动控制。SIGGRAPH Asia, 2025. 2, 3, 6, 5 [9] Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, et al. SkyReels-V2: 无限长度电影生成模型。arXiv preprint arXiv:2504.13074, 2025. 2, 3, 5, 6 [10] Ting Chen, Simon Kornblith, Mohammad Norouzi, and Geoffrey Hinton. 视觉表征对比学习的简单框架。ICML, 2020. 3 [11] Xiaoyu Chen, Junliang Guo, Tianyu He, Chuheng Zhang, Pushi Zhang, Derek Cathera Yang, Li Zhao, and Jiang Bian. IGOR: 图像目标表征是具身AI基础模型的原子控制单元。arXiv preprint arXiv:2411.00785, 2024. 2, 3 [12] Xiaoyu Chen, Hangxing Wei, Pushi Zhang, Chuheng Zhang, Kaixin Wang, Yanjiang Guo, Rushuai Yang, Yucen Wang, Xinquan Xiao, Li Zhao, et al. villa-X: 增强视觉-语言-动作模型中的潜在动作建模。arXiv preprint arXiv:2507.23682, 2025. [13] Yi Chen, Yuying Ge, Weiliang Tang, Yizhuo Li, Yixiao Ge, Mingyu Ding, Ying Shan, and Xihui Liu. Moto: 潜在运动令牌作为从视频中学习机器人操作的桥接语言。ICCV, 2025. 3 [14] Decart, Julian Quevedo, Quinn McIntyre, Spruce Campbell, Xinlei Chen, and Robert Wachen. Oasis: 一个Transformer中的宇宙。2024. 2, 3 [15] Ashley Edwards, Himanshu Sahni, Yannick Schroecker, and Charles Isbell. 从观察中模仿潜在策略。ICML, 2019. 2, 3 [16] Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu, Pengfei Wan, and Kun Gai. 面向视角自适应人体视频生成的3D感知隐式运动控制。arXiv preprint arXiv:2602.03796, 2026. 2, 3 [17] Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu, Andreas Geiger, Jun Zhang, and Hongyang Li. Vista: 具有高保真度和多功能可控性的可泛化驾驶世界模型。NeurIPS, 2024. 3 [18] Shenyuan Gao, Siyuan Zhou, Yilun Du, Jun Zhang, and Chuang Gan. AdaWorld: 利用潜在动作学习可适应的世界模型。ICML, 2025. 2, 3, 5, 6, 1 [19] Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, and Hao Ouyang. 具有多功能交互的无限世界。arXiv preprint arXiv:2607.07534, 2026. 2, 3, 7, 8 [20] Quentin Garrido, Tushar Nagarajan, Basile Terver, Nicolas Ballas, Yann LeCun, and Michael Rabbat. 在自然场景中学习潜在动作世界模型。arXiv preprint arXiv:2601.05230, 2026. 2, 3 [21] Google DeepMind. Veo. 模型页面。1 [22] Luigi Gresele, Paul K. Rubenstein, Arash Mehrjou, Francesco Locatello, and Bernhard Schölkopf. 不完整的罗塞塔石碑问题:多视角非线性ICA的可识别性结果。Proceedings of the 35th Conference on Uncertainty in Artificial Intelligence, pages 217–227, 2020. 2
[9] Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, et al. SkyReels-V2: 无限长度电影生成模型。arXiv preprint arXiv:2504.13074, 2025. 2, 3, 5, 6 [24] David Ha and Jürgen Schmidhuber. 世界模型。arXiv preprint arXiv:1803.10122, 2018. 3 [25] Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, and Timothy Lillicrap. 通过世界模型掌握多样化领域。arXiv preprint arXiv:2301.04104, 2023. 3 [26] Xianglong He, Chunli Peng, Zexiang Liu, Boyang Wang, Yifan Zhang, Qi Cui, Fei Kang, Biao Jiang, Mengyin An, Yangyang Ren, Baixin Xu, Hao-Xiang Guo, Kaixiong Gong, Cyrus Wu, Wei Li, Xuchen Song, Yang Liu, Eric Li, and Yahui Zhou. Matrix-Game 2.0: 一个开源、实时、流式的交互世界模型。arXiv preprint arXiv:2508.13009, 2025. 2, 3 [27] Irina Higgins, Loic Matthey, Arka Pal, Christopher Burgess, Xavier Glorot, Matthew Botvinick, Shakir Mohamed, and Alexander Lerchner. beta-VAE: 在受限变分框架下学习基本视觉概念。ICLR, 2017. 5 [28] Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, et al. RELIC: 具有长时记忆的交互式视频世界模型。arXiv preprint arXiv:2512.04040, 2025. 3 [29] Kurt Hornik. 多层前馈网络的逼近能力。Neural Networks, 4(2):251–257, 1991. 4 [30] Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman. Self forcing: 弥合自回归视频扩散中的训练-测试差距。arXiv preprint arXiv:2506.08009, 2025. 3, 6 [31] Joel Jang, Seonghyeon Ye, Zongyu Lin, Jiannan Xiang, Johan Bjorck, Yu Fang, Fengyuan Hu, Spencer Huang, Kaushil Kundalia, Yen-Chen Lin, et al. DreamGen: 通过视频世界模型解锁机器人学习中的泛化能力。arXiv preprint arXiv:2505.12705, 2025. 3 [32] Yuxin Jiang, Yuchao Gu, Ivor W. Tsang, and Mike Zheng Shou. Olaf-world: 为视频世界建模定向潜在动作。arXiv preprint arXiv:2602.10104, 2026. 2, 3, 4, 5, 6, 7, 8, 1 [33] Xuan Ju, Yiming Gao, Zhaoyang Zhang, Ziyang Yuan, Xintao Wang, Ailing Zeng, Yu Xiong, Qiang Xu, and Ying Shan. Miradata: 一个具有长持续时间和结构化描述的大规模视频数据集。NeurIPS, 2024. 6, 5 [34] Ilyes Khemakhem, Diederik Kingma, Ricardo Monti, and Aapo Hyvarinen. 变分自编码器与非线性ICA: 一个统一框架。AISTATS, 2020. 2, 3 [35] Hanjung Kim, Jaehyun Kang, Hyolim Kang, Meedeum Cho, Seon Joo Kim, and Youngwoon Lee. UniSkill: 通过跨具身技能表征模仿人类视频。arXiv preprint arXiv:2505.08787, 2025. 3 [36] Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, et al. HunyuanVideo: 大型视频生成模型的系统框架。arXiv preprint arXiv:2412.03603, 2024. 2 [37] Yao-Chih Lee, Zhoutong Zhang, Jiahui Huang, Jui-Hsien Wang, Joon-Young Lee, Jia-Bin Huang, Eli Shechtman, and
10
第 11 页
[51] Stone Tao, Fanbo Xiang, Arth Shukla, Yuzhe Qin, Xander Hinrichsen, Xiaodi Yuan, Chen Bao, Xinsong Lin, Yulin Liu, et al. Maniskill3: Gpu parallelized robotics simulation and rendering for generalizable embodied ai. arXiv preprint arXiv:2410.00425, 2024. 6, 5 [52] Robbyant Team, Zelin Gao, Qiuyu Wang, Yanhong Zeng, Jiapeng Zhu, Ka Leong Cheng, Yixuan Li, Hanlin Wang, Yinghao Xu, Shuailei Ma, et al. Advancing open-source world models. arXiv preprint arXiv:2601.20540, 2026. 2, 3 [53] Zhan Tong, Yibing Song, Jue Wang, and Limin Wang. VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training. NeurIPS, 2022. 4 [54] Julius von Kügelgen, Yash Sharma, Luigi Gresele, Wieland Brendel, Bernhard Schölkopf, Michel Besserve, and Francesco Locatello. Self-supervised learning with data augmentations provably isolates content from style. In Advances in Neural Information Processing Systems, pages 16451–16467, 2021. 2 [55] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, et al. Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314, 2025. 2, 3, 5, 1 [56] Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, and David Novotny. VGGT: Visual geometry grounded transformer. In CVPR, 2025. 6 [57] Yucen Wang, Fengming Zhang, De-Chuan Zhan, Li Zhao, Kaixin Wang, and Jiang Bian. Co-Evolving latent action world models. arXiv preprint arXiv:2510.26433, 2025. 3 [58] Halbert White. Connectionist nonparametric regression: Multilayer feedforward networks can learn arbitrary mappings. Neural Networks, 3(5):535–549, 1990. 4 [59] Zeqi Xiao, Yushi Lan, Yifan Zhou, Wenqi Ouyang, Shuai Yang, Yanhong Zeng, and Xingang Pan. WorldMem: Long-term consistent world simulation with memory. arXiv preprint arXiv:2504.12369, 2025. 3 [60] Jiange Yang, Yansong Shi, Haoyi Zhu, Mingyu Liu, Kaijing Ma, Yating Wang, Gangshan Wu, Tong He, and Limin Wang. CoMo: Learning continuous latent motion from internet videos for scalable robot learning. arXiv preprint arXiv:2505.17006, 2025. 2, 3, 4 [61] Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Sejune Joo, Jianwei Yang, Baolin Peng, Ajay Mandlekar, Reuben Tan, Yu-Wei Chao, Bill Yuchen Lin, et al. Latent Action Pretraining from Videos. In ICLR, 2025. 2, 3 [62] Yixuan Ye, Xuanyu Lu, Yuxin Jiang, Yuchao Gu, Rui Zhao, Qiwei Liang, Jiachun Pan, Fengda Zhang, Weijia Wu, and Alex Jinpeng Wang. MIND: Benchmarking memory consistency and action control in world models. arXiv preprint arXiv:2602.08025, 2026. 3 [63] Jiwen Yu, Yiran Qin, Xintao Wang, Pengfei Wan, Di Zhang, and Xihui Liu. GameFactory: Creating new games with generative interactive videos. arXiv preprint arXiv:2501.08325, 2025. 2, 3, 1
11
第 12 页
[64] Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, and Oliver Wang. The unreasonable effectiveness of deep features as a perceptual metric. In CVPR, 2018. 6 [65] Shangwen Zhu, Qianyu Peng, Zhao Pu, Zhilei Shu, Xiangrui Ke, Zhaohu Xing, Zizhao Tong, Zeqing Wang, Xinyu Cui, Zian Zheng, Huangji Wang, Jian Zhao, Yeying Jin, Fan Cheng, and Ruili Feng. Incantation: Natural language as the action interface for multi-entity video world models. arXiv preprint arXiv:2605.18601, 2026. 2, 3, 7
12
第 13 页
ShadowDancer: 通过从视频及其影子中学习统一动态表征,教会视频世界模型任意动作
补充材料
A. 局限性与未来方向
局限性 ShadowDancer 依赖于两个前提条件。首先,动作资产必须提前准备:在部署时,模型消费参考片段或存储的资产,因此对于没有示范存在的动态,必须首先被捕捉或创作。其次,影子对在游戏和模拟器中易于构建,这些环境可以按需在重采样外观下重放相同的动态,但在现实世界中收集则困难得多,因为这种重运行很少可能;因此,真实视频仅作为自对进入训练,贡献视觉真实感而非识别信号。
未来方向 这两个前提条件都指向了生成式补救措施。首先,资产生成:由于编码器在构造上具有外观不变性,示范不必被拍摄。然而,现成的视频生成 [21, 55] 本身并不足够:一个可用的资产集由同一主体的许多片段组成,这些片段在外观和起始状态上严格保持一致,仅在执行的动作上有所不同,而当前模型独立生成每个视频。设计一个具有这种跨片段一致性的资产生成视频模型,将使动作库随生成生态系统而非引擎覆盖范围而扩展。其次,为真实视频制造影子:由于配对是一种协议而非引擎,改变片段外观同时保持其运动的视频编辑模型可以制造真实素材的影子,将识别监督从合成世界扩展到真实领域。
B. 更多模型细节
B.1. 统一表征的因子选择性读出
正文(第 3.2 节)指出,自我动态和场景动态在一个潜在空间内被分离;本节给出其机制。逆动力学编码器遵循标准的 LAM 架构 [18, 32]:一个具有因果时间注意力的时空 Transformer,其在帧 t+1 的读出推断 zt,因此在实现中,后验条件基于完整的因果前缀,qϕ(zt | x1:t+1),而不仅仅是转换;任意长度的片段在单次传递中被编码。我们使用三个提示槽:三个可学习的 token(cam、dyn 和 full)被前置到每一帧的 patch 序列中,通过共享编码器联合参与注意力,并且每个都拥有一个变分读出 head。配对协议在它们之间路由监督:仅保留相机轨迹(场景和主体被重采样或冻结)的对监督 cam head;仅保留场景运动(相机被重采样)的对监督 dyn head;两者都保留的对监督 full head。每个样本的掩码 (mcam, mdyn) ∈{0, 1}2 选择一个 head,因此每个 head 仅由其配对所保留的因子监督。什么构成 dyn 因子并非预先固定,而是由每个族的配对协议定义:我们的机器人操作对仅保留机械臂轨迹,因此对于这个族,dyn 读出机械臂动态,而不包含场景中的其他任何东西;我们的人体对保留身体运动。这就是影子库的协议性质:将一个因子指定为 dyn 仅需要构建保留它的配对。每个来源的控制通道 (mcam, mdyn) 列在 D 节的组合表中。所有 head 共享一个编码器和一个潜在空间 Z,因此下游消费是相同的;然而在推理时,它们是独立的控制旋钮:同一参考视频可以产生纯相机动作、纯场景动作或它们的联合,并且身体运动、相机移动和物体交互仅仅是不同的轨迹 z。
B.2. 条件化架构
本节详述正文第 3.3 节总结的条件化路径。主干网络在具有时间压缩率 r=4 的因果 3D 视频 VAE 的潜在表示上运行;因此,我们按潜在帧对每帧动作进行分组,Zf = (zr(f−1)+1, . . . , zrf),遵循 [63]。调制路径将组平均动作 ¯zf 融合到每潜在帧时间步嵌入中,
e _f = \p si (\tau\alpha_zW_{\!z}\,\bar{z}_f,\label{eq:adaln} (B.1)
其中 ψ(τ) 嵌入扩散时间步,ef 驱动每个 DiT 块的自适应层归一化,提供全局、低频控制。交叉注意力路径保留所有 r 个动作 token:潜在帧 f 的空间隐藏状态 hf 通过一个专用臂关注每帧上下文 Cf,
h _f \l eftar row h _ fW_{\!o}\,\mathrm{Attn}\big(h_f,\,\mathcal{C}_f\big\label{eq:xattn} (B.2)
其中 Cf = [ WaZf ] 最初持有投影后的动作 token。Wo 被零初始化,因此交叉注意力臂在第 0 步是一个精确的无操作;调制门 αz 则被初始化为一个正常数,因为零初始化门在实践中接收到消失梯度并停滞。
瓶颈 dz=32 是一个特性而非限制:不变性要求 z 必须足够小,以免走私
第 14 页
C. 影子学习的正式保证
本节精确阐述了影子对使任意动态族可学习的意义。一个无条件的陈述是不可能的:如果两个动态产生完全相同的观测,没有算法能区分它们;如果有限维编码对于内在动态维度来说太小,没有连续编码器能存储它们。因此,我们明确陈述必要的可观测性、分离性和容量条件。该结果与渲染器无关,也与动态描述的是人类、相机、机器人、物体还是整个多动作轨迹无关。
我们的论证在精神上与以下结果相关:配对视图可以从独立变化的风格中分离不变内容[54],并能在多视图非线性模型中恢复可识别性[22]。这里我们不假设独立的潜在成分,也不试图恢复一个特权坐标系。我们证明跨影子预测所需的任务特定陈述:预测一个影子与另一个影子所需的最粗充分统计量,正是共享的动态,直至一个可逆的重参数化。
C.1. 设置与假设
令 D 表示待表示的动态。它可以是一个转移 dt,一个可变长度片段 d1:T,或一个完整的 rollout。令 X 为源视频,令 B 收集解码器已可用的目标侧信息(例如,前一目标帧或干净块历史),并令 Y 为目标下一帧或块。所有变量取值于标准 Borel 空间,因此以下条件分布存在。定义目标转移核
K_d (b) := P(Y ∈ · | B = b, D = d). (C.1)
三个显式条件刻画了影子构建。
假设 A1(独立上下文重采样)。一旦共享动态固定,源与目标渲染条件独立:
X ⟂ (B, Y) | D. (C.2)
这是“重放动态,重采样其他一切”的概率陈述。它允许两个视图任意依赖于 D。
假设 A2(源可观测性)。存在一个可测映射 h 使得
D = h(X) 几乎必然。 (C.3)
因此,所请求的动态在源片段中实际上是可见的。这对于任何从单个视频恢复它的确定性编码器是必要的。
假设 A3(目标重叠与分离)。在目标-上下文空间上存在一个概率测度 ν,使得对于几乎每个 d,P(B ∈ · | D = d) 等价于 ν;即,每个动态在相同的目标上下文上渲染,至多差一个零测集。此外,不同的动态诱导不同的转移核:
K_d = K_{d'} ⇒ d = d'. (C.4)
这里等号意味着 ν-几乎处处相等。我们还假设 d ↦ [Kd]ν 是一个到这些核的标准 Borel 编码的可测映射。等价地,每一对 d ≠ d' 在一个非零概率的目标上下文集合中效果不同。分离性是必要的。所述的相互绝对连续是一个透明的充分覆盖条件,防止解码器侧上下文 B 完美揭示 D。
定义 C.1(跨影子表征)。一个表征 Z = s(X) 是跨影子充分的,当
Y ⟂ X | (B, Z), (C.5)
并且当每个其他跨影子充分统计量都能决定它时,称为极小的。极小性不强加特定的坐标系;两个极小统计量可能相差一个双射。
C.2. 识别定理
定理 C.2(影子识别)。在假设 A1–A3 下,定义条件律统计量
Γ(x) := [K_{h(x)}]_ν. (C.6)
那么:(i) Γ(X) 是跨影子充分且极小的;(ii) 它对影子构建所重采样的每个源-上下文因子是不变的;(iii) 每个跨影子充分表征 Z = s(X) 决定 D。因此,每个极小充分 Z 和 D 相互决定,并且等价于一个一一对应的重参数化。
第 15 页
证明。因为 \(D = h(X)\) 且 \(X \perp\!\!\!\perp (B, Y) \mid D\),对于几乎每个 \(x\) 和目标上下文 \(b\),等式恰好当 \(Y \perp\!\!\!\perp X \mid (B, Z)\) 时成立。结论由定理 C.2 得出。
\[ \begin{aligned} \mathbb{P}(Y \in \cdot \mid B=b, X=x) &= \mathbb{P}(Y \in \cdot \mid B=b, D=h(x)) = K_{h(x)}(b). \end{aligned} \] \(Y\) 给定 \((B, X)\) 的条件分布因此仅通过 \(\Gamma(X)\) 依赖于 \(X\),这证明了充分性。同样的恒等式表明了不变性:具有相同 \(D\) 的源视频无论源上下文如何都具有相同的 \(\Gamma\)。
接下来需要在不允许目标侧变量 \(B\) 进行识别的情况下证明最小性。令 \(Z = s(X)\) 为任意跨影子充分统计量,并记 \(L_z(b) = \mathbb{P}(Y \in \cdot \mid B = b, Z = z)\)。充分性及公式 (C.9) 给出 \[ K_D(B) = L_Z(B) \quad \text{几乎必然}. \] 因为 \(Z\) 是 \(X\) 的函数,假设 A1 蕴含 \(B \perp\!\!\!\perp Z \mid D\)。因此,对于 \((D, Z)\) 支撑集中的几乎每一对 \((d, z)\),公式 (C.10) 在 \(\mathbb{P}(B \in \cdot \mid D = d)\) 下成立。该测度与假设 A3 中 \(\nu\) 的等价性将其升级为核类恒等式 \[ [K_D]_\nu = [L_Z]_\nu \qquad \text{几乎必然}. \] Borel 单射 \(d \mapsto [K_d]_\nu\) 在其像上具有可测逆,所以 \[ D = (d \mapsto [K_d]_\nu)^{-1}([L_Z]_\nu) =: r(Z) \qquad \text{几乎必然}. \] 因此,\(\Gamma(X) = [K_{r(Z)}]_\nu\) 是每个充分统计量 \(Z\) 的可测函数,证明了最小性。反之,同样的逆可从 \(\Gamma(X)\) 恢复 \(D\)。任何其他最小充分统计量 \(Z\) 也是 \(\Gamma\) 的函数,因此 \(Z\) 和 \(D\) 在零测集外是双射的。
推论 C.3(跨影子似然学习动力学表征)。假设相关条件分布关于一个共同的控制测度存在密度,且具有有限的总体对数损失。令 \(Z = s(X)\) 并允许解码器遍历所有条件分布 \(q(Y \mid B, Z)\)。在假设 A1–A3 下,\(Z\) 达到与给定完整源 \(X\) 的解码器相同的总体负对数似然,当且仅当 \(Z\) 是跨影子充分的。因此,每个贝叶斯最优编码都包含 \(D\),且每个最小贝叶斯最优编码都是 \(D\) 的一一重参数化。
证明。对于固定的 \(Z\),最优解码器是真实条件分布 \(\mathbb{P}(Y \mid B, Z)\)。由于 \(Z\) 是 \(X\) 的函数,与完整源贝叶斯风险的差距为 \[ \mathcal{R}^*(Z) – \mathcal{R}^*(X) = \mathbb{E}\left[\mathrm{KL}\left(\mathbb{P}(Y \mid B, X) \,\|\, \mathbb{P}(Y \mid B, Z)\right)\right] \geq 0, \] 等式恰好当 \(Y \perp\!\!\!\perp X \mid (B, Z)\) 时成立。结论由定理 C.2 得出。
该定理识别出一个表征,而非一个偏好的轴系:若 \(\varphi\) 是任意双射,则 \(\varphi(D)\) 同样有效。这是对无标签潜在变量所能要求的最强可识别性。一个非最小的贝叶斯最优编码器可能额外存储源外观,但该信息对于跨影子预测可证明是不必要的,并通过传递到最小充分统计量而被移除。在我们的模型中,有限变分瓶颈是偏好此最小解的机制;该定理并未声称 KL 惩罚或特定的 SGD 运行能唯一保证它。
注记 C.4(确定性表征与变分信道)。定理 C.2 和推论 C.3 涉及确定性统计量 \(Z = s(X)\),例如编码器参数或后验均值。我们实现中的采样高斯信道 \(q_\phi(z_t \mid x_{1:t+1})\) 和 \(\beta\) 加权的 KL 项构成了对此理想情况的率失真近似。它们倾向于紧凑编码,但本身并不能在有限率下保证精确的充分性或最小性。
C.3. 使用可微网络实现与学习
前述定理是非参数的。我们接下来证明,在标准正则条件下,其表征和预测器可由可微神经网络实现。
定理 C.5(可微神经表征)。假设 A1–A3 成立。此外,假设 \(X\)、\(B\) 和 \(D\) 的支撑集是有限维欧几里得空间的紧子集;\(h\) 是连续的;\(D\) 允许一个到所选潜在维度的连续嵌入 \(e : \mathcal{D} \to \mathbb{R}^m\);且目标渲染为 \[ Y = F(B, D) \] 其中 \(F\) 是连续的。则存在可微神经网络序列 \((E_n, G_n)\) 使得 \[ \sup_x \|E_n(x) – e(h(x))\|_2 \longrightarrow 0 \] 且 \[ \sup_{b,x} \|G_n(b, E_n(x)) – F(b, h(x))\|_2 \longrightarrow 0. \] 因此,一个可微神经编码器可以在忽略源上下文的同时,表征 \(D\) 直至一个可逆坐标变换,且其解码器可以达到任意小的跨影子重建误差。
证明。设 \(E_0 = e \circ h\)。由于 \(e\) 是从紧空间到豪斯多夫空间的连续单射,其逆在 \(e(\mathcal{D})\) 上连续。因此 \[ G_0(b, z) = F\bigl(b, e^{-1}(z)\bigr) \qquad z \in e(\mathcal{D}), \]
第 16 页
是连续的,且满足 \(G_0(B, E_0(X)) = F(B, D) = Y\)。(片段展示哪个族在片段中是可见的),以 \(F\) 为条件不会丢失任何信息,并且该定理在每个族内识别出 \(D\)。跨族共享的部分——一个编码器和一个潜在空间 \(Z\)——是一种架构选择,而非定理的推论:正是这一点使得每个族内被识别的表征在实践中得以统一,正文中的跨族迁移结果从经验上支持了这一点。因此,对于任何视频动态,只要能够 (i) 在独立重采样其他生成因子的同时重放该动态,(ii) 在源中观察到所请求的动态,以及 (iii) 在其族内渲染出重叠的上下文,且其中不同的动态具有不同的效果,它就允许一个上下文不变的跨影子表征。在定理 C.5 的额外有限维、紧致性、连续性和潜在容量条件下,该表征及其解码器允许以任意精度实现可微的神经实现。
如果分离失败,定义
\[ d \sim d' \quad\Longleftrightarrow\quad K_d = K_{d'}. \label{eq:supp_equiv} \] (C.20)
只要这个等价类本身可以从 \(X\) 中观察到,同样的证明就能识别出 \([D]\)——即动态中能够影响影子的确切部分——并且没有预测方法能做得更好。如果源可观察性即使对 \([D]\) 也失败,那么一个源视频的确定性表征是不可能的;一般而言,只有条件律统计量 \(x \mapsto P(Y \in \cdot \mid B = \cdot, X = x)\) 被识别(它可以表示为等价类上的混合)。这些边界防止了将“任何动态”解读为恢复视频中不包含的信息的承诺。
最后,该保证适用于满足假设 A1 的精确影子。用于导入非配对真实视频的退化自配对是一种经验性补充,其本身并不提供可识别性保证。
D. 额外实验细节与消融研究
D.1. 影子库的构成
表 4 总结了影子库的来源:每个来源如何配对,它通过第 B.1 节中的逐样本掩码 \((m_{\text{cam}}, m_{\text{dyn}})\) 监督哪个控制通道,以及其大致规模和采样混合中的份额。
D.2. 训练与推理细节
LAM 使用 \(\beta=0.01\) 和固定的先验 \(\mathcal{N}(0, I)\) 进行训练,始终以世界模型一半的空间分辨率运行;真实视频以退化自配对的形式进入流。对于人体动态来源,自配对概率为 0.5,对于其他配对来源为 0;由于非配对真实视频和静态场景相机来源始终是自配对的,大约三分之一的训练样本是自配对。世界模型首先使用流进行双向微调
第 17 页
表4. Shadow Library的构成。影子对是同一动态轨迹的两个帧同步渲染,其余生成因子被重新采样;未配对语料以自配对形式加入。(cam, dyn)是每个数据源监督的控制通道。数量为近似值。
| 类别 | 数据源 | 配对方式 | (cam, dyn) | 序列数 | 帧数 | 混合比例 | |——|———-|———-|————|——–|——|———-| | 人体运动 | SMPL-X重渲染,仅身体动态 | shadow pair | (0, 1) | ∼1k | ∼1.1M | 13.6% | | | SMPL-X重渲染,仅相机 | shadow pair | (1, 0) | ∼1.1k | ∼1.2M | 10.9% | | | SMPL-X重渲染,相机+身体 | shadow pair | (1, 1) | ∼1k | ∼1.2M | 8.2% | | | 配对角色渲染 [8] | shadow pair | (1, 1) | ∼2k | ∼0.3M | 8.8% | | 机器人操作 | ManiSkill [51],仅机械臂 | shadow pair | (0, 1) | ∼1.1k | ∼1M | 2.7% | | | ManiSkill [51],仅相机 | shadow pair | (1, 0) | ∼1.2k | ∼1.1M | 6.8% | | | ManiSkill [51],相机+机械臂 | shadow pair | (1, 1) | ∼1.2k | ∼1.1M | 5.4% | | 第一人称游戏 | GTA风格城市驾驶与武器射击 | shadow pair | (1, 1) | ∼0.9k | ∼0.4M | 8.8% | | | 赛博朋克风格夜城 | shadow pair | (1, 1) | ∼3.4k | ∼1.6M | 8.2% | | 第三人称游戏 | 虚幻引擎场景(近战、施法) | shadow pair | (1, 1) | ∼30个场景 | ∼0.6M | – | | | 怪物猎人风格动作 | shadow pair | (1, 1) | ∼1k | ∼0.5M | – | | 静态场景相机 | DL3DV [38] | self-pair | (1, 0) | ∼1k个场景 | ∼0.3M | 6.8% | | 未配对真实视频 | MiraData互联网片段 [33] | self-pair | (1, 1) | ∼5k | ∼6.5M | 5.4% | | | OpenX BridgeData [42] | self-pair | (0, 1) | ∼29k | ∼0.8M | 0.1% | | | OpenX FurnitureBench [42] | self-pair | (0, 1) | ∼5k | ∼2.2M | 4.1% | | | OpenX Berkeley UR5 [42] | self-pair | (0, 1) | ∼1k | ∼0.1M | 2.7% | | | OpenX Jaco Play [42] | self-pair | (0, 1) | ∼1.1k | ∼0.1M | 2.7% | | | OpenX Stanford HYDRA [42] | self-pair | (0, 1) | ∼0.6k | ∼0.3M | 2.7% | | | OpenX RoboTurk [42] | self-pair | (0, 1) | ∼2k | ∼0.1M | 2.0% |
匹配后,转换为block-causal生成器,每块3个潜在帧,推理时通过键值缓存进行自回归展开。动作迁移对比(表1)使用480×720分辨率模型(LAM为240×360);长时域展开模型(表2)以544×960分辨率生成(LAM为272×480),从低分辨率检查点热启动,并在目标分辨率下微调10k步,使用8块H200 GPU和全分片数据并行。推理时,我们采用30步流匹配去噪和5.0的无分类器引导。
D.3. 评估细节
在表1中,人体运动、第一人称和第三人称类别基于从首帧开始的81帧片段进行评分,平均每个类别有45–50个留出配对;机器人操作使用较小的留出ManiSkill配对集,相机分割使用留出的相机轨迹配对。由于单目姿态恢复存在尺度歧义,在计算ATE/RPE之前,通过相似变换(Sim(3))将VGGT恢复的轨迹与目标对齐。表3的消融实验使用迁移分割中的12对子集,遵循相同协议,涵盖第一人称战斗和第三人称动作类别;报告的数字为两者的平均值。
长时域展开评判协议 表2的比较使用16条长指令流。对于每条指令流,ShadowDancer和基线模型从同一首帧和相同指令下生成;两个展开结果在相同边界处截断为240帧片段,对应片段进行比较,每个基线大约产生64个比较对。每对匿名标记为A和B,随机分配顺序,由VLM(Fable 5)在三个轴上强制选择评判,无平局选项;人工审核随机抽取20%的评判结果以验证VLM的决策。评判者接收两个片段、指令列表以及如下形式的指令:
> 你正在评判由两个不同系统从同一首帧和相同动作指令序列生成的两段视频展开A和B:<commands>。评判动作,而非图像质量。回答三个独立问题;每个问题必须准确回答“A”或“B”,即使差异很小。(1) 动作控制:哪个视频中指令动作在指定时间被实际执行?(2) 动作保真度:哪个视频更好地保留了每个指令动作的特定武器、物体和运动?(3) 长时域一致性:哪个视频在展开过程中保持更长时间的连贯性,不偏离指令行为、不冻结或不退化?忽略视觉风格、清晰度或美学差异,除非退化导致动作本身不可读。输出严格三行:control: A|B, fidelity: A|B, consistency: A|B。
第 18 页
表5. 在留出影子对(24对)和UE片段(60片段;角色变化=0.04,场景变化=0.20)上的LAM表征探针。Olaf-recipe行遵循[32]:带特征对齐和单头的自重建。
| | 交叉/自MSE比率↓ | 对z的线性探针 | |—|—|—| | LAM训练 | 第一人称 | 第三人称 | 角色(内容)↑ | 场景(外观)↓ | | 自重建+正则化,单头 | 1.265 | 1.067 | 0.050 | 0.650 | | 跨影子,3提示(本文) | 1.017 | 1.103 | 0.450 | 0.433 |
表6. 与表1相同生成上的分布级质量(FVD↓)。
| 家族 | Olaf-World | ShadowDancer | |—|—|—| | 第一人称战斗 | 555.8 | 318.3 | | 第三人称动作 | 842.0 | 422.2 | | 人体运动 | 511.6 | 253.9 |
表7. 动作潜在变量携带的内容。每种干预下相对于目标A的PSNR,每个家族3-4对;∆相对于基准。
| 家族 | 基准 | z←B | 打乱z | s←B | 降质s | |—|—|—|—|—|—| | 第一人称战斗 | 14.77 | −2.59 | −1.57 | −2.48 | −0.36 | | 第三人称动作 | 16.55 | −3.01 | −0.33 | −2.15 | −0.41 | | 相机 | 21.73 | −1.92 | −2.09 | −3.28 | −0.13 | | 机器人手臂 | 23.71 | −0.98 | −1.95 | −0.15 | +0.20 | | 身体运动 | 22.25 | −0.53 | +0.19 | −0.79 | −0.37 |
D.4. 表征级探针
在接触世界模型之前,我们在留出的影子对上探测潜在变量z本身(表5)。首先是跨对迁移比率:使用LAM自己的解码器,我们利用目标自身的动作(z(˜x),“自”)或影子源的动作(z(x),“交叉”)从其视觉上下文中重建目标;比率MSEcross/MSEself衡量一个跨外观的z使重建质量下降了多少。其次,在留出的UE片段上对池化后的z进行两个线性探针:解码角色和场景。在此评估集中,每个角色都有自己独特的动作集,因此角色身份仅从运动中即可读取,角色探针衡量动作内容(越高越好),而场景探针衡量纯外观(越低越好)。由于角色在外观和运动上均不同,仅凭角色准确率原则上可以反映两者;下方的基线对比排除了外观途径:自重建潜在变量通过场景探针泄露了更多外观,但解码角色仅为随机水平,因此角色准确率追踪的是动作集而非外观。跨影子潜在变量在第一人称对上几乎无损迁移(比率1.02对比1.27),并在两个探针上均占主导地位:它以11倍于随机水平的准确率解码角色,同时泄露更少的场景身份,而自重建潜在变量在内容上处于随机水平却泄露更多外观——正则化并不能替代配对。请注意,交叉/自比率仅对承载内容的潜在变量有信息意义:基线解码内容为随机水平,因此其接近1的第三人称比率反映的是一个无信息的z,对于这种z,自重建和交叉重建同样无引导,而非成功迁移。
D.5. 分布级质量
重建指标原则上可能被一个以牺牲真实性为代价、紧贴参考的保守模型获得。我们通过在表1相同生成上计算的Fréchet视频距离(FVD)来排除这一点,该计算在三个大型重建家族上使用16帧窗口(步长8)进行(表6);相机家族通过轨迹误差而非重建评分,机器人分割因太小而无法获得稳定估计。ShadowDancer在每个家族上大约将Olaf-World的FVD减半,因此其重建优势伴随着更好而非更差的分布级真实性。
D.6. 动作潜在变量携带的内容
条件作用同时消耗潜在变量z和源资产s;此探针在推理时测试哪一个承载了动作。对于每个家族,我们取两个来自不同源的影子对A和B,并从基准输入(zA, sA)出发,形成四种干预:替换潜在变量(zB, sA)、沿时间打乱潜在变量、替换资产(zA, sB)、以及将资产降质至四分之一分辨率(zA, s↓4A)。我们报告相对于目标A的PSNR(表7)。在五个家族中的四个上,替换或打乱z会急剧降低PSNR,而降质s几乎不影响:所命令的动作存在于潜在变量中,而资产提供外观和高频细节。¹
D.7. 架构消融
潜在变量大小和自对比率 选择dz=32继承自先前的潜在动作模型[18, 32],其中该大小被验证为自重建的最佳操作点;由于真实视频在相同的重建目标下作为自对进入我们的训练流(第3.4节),其操作点得以延续,并且这与第B.2节中瓶颈应保持足够小以避免夹带外观的不变性论证一致。一次预算匹配的扫描确认了这一选择:表征探针对dz∈{16, 64}以及强制自对比率不敏感,而重建更偏好dz≤32,因此我们保留dz=32。
¹在身体运动家族上,源渲染已经完整描绘了运动,因此资产本身即可克隆它,探针无法分离这两个通道;角色渲染源共享此属性,同样未被探测。这是探针在精确重放家族上的一个局限,与资产作为强载体一致(表3中的(c))。