EgoGenesis:用3D锚定记忆与动作几何编码,让自我中心视频生成不再漂移

快速导读:提出EGOGENESIS,一种通过OAPM和A3D-RoPE生成可控、高质量自我中心操作视频以增强下游世界-动作模型泛化能力的数据增强框架。

EGOGENESIS是一个面向具身交互的自我中心视频生成框架,其核心目标不是追求更高的图像质量,而是解决现有生成器在模拟操作任务时普遍存在的几何漂移和场景不一致问题。通过将3D场景记忆与度量动作几何显式注入视频扩散模型,EGOGENESIS能够生成与给定动作轨迹精确对齐的可控视频,从而为下游世界-动作模型(WAM)提供高质量合成训练数据。

该框架基于预训练视频生成先验Wan2.2-5B-Control构建,引入两个几何感知条件模块:在线锚定投影记忆(OAPM)负责维护跨帧的场景一致性,动作-3D旋转位置嵌入(A3D-RoPE)负责将末端执行器的3D坐标精确编码到生成过程中。在8个真实机器人任务上的实验表明,用EGOGENESIS生成的合成轨迹增强训练后,WAM在分布外场景的泛化成功率显著提升。

英文题目:EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

论文出处:arXiv 每日论文精选 · arXiv:2607.28243

原始论文:PDF / 论文页面

这篇论文解决什么问题?

世界-动作模型(WAM)旨在从自我中心视频中学习视觉-动作映射,使机器人能够通过观察预测和执行操作。训练这类模型需要大量多样化的视频-动作对,但真实机器人数据采集成本高昂,且难以覆盖所有可能的场景、物体和布局变化。

现有自我中心视频生成模型虽然能够合成训练数据,但普遍存在三个关键缺陷:第一,缺乏对相机轨迹的精确几何约束,导致生成视频中出现场景漂移;第二,末端执行器的运动与视频内容之间缺乏度量级别的对齐,动作控制不精确;第三,自回归生成过程中,场景信息逐渐丢失,导致物体位置和外观不一致。论文通过诊断现有方法(如RynnWorld-TeleOp)的失败案例,发现第一帧锚定不足是场景漂移的根本原因(第2页)。

这些缺陷使得合成视频无法有效替代真实数据。当生成视频中的动作与视觉内容不匹配时,下游WAM会学到错误的关联,反而损害策略性能。因此,如何让视频生成器在保持场景一致性的同时精确遵循给定的动作轨迹,成为提升合成数据效用的关键挑战。

与通用视频生成追求感知质量不同,EGOGENESIS的设计目标明确聚焦于几何精度和时序一致性。这一研究定位使其区别于EgoHOI、EGOSIM-14B等现有自我中心生成器,后者在接触交互和指令遵循方面表现较弱(第5页)。

核心创新

  • 提出OAPM,一种结合持久3D场景锚点与在线刷新近期状态的投影式场景记忆机制,用于自回归生成中的场景一致性维护。
  • 提出A3D-RoPE,将相机感知的度量3D骨架/末端执行器几何信息编码为旋转位置嵌入,注入交叉注意力以实现精确的动作对齐视频生成。
  • 展示EGOGENESIS生成的合成轨迹能有效增强真实机器人数据,显著提升下游WAM在分布外场景的泛化能力。

方法概览

EGOGENESIS基于预训练视频生成先验,引入两个几何感知条件机制:1) OAPM维护不可变的第一帧3D场景锚点和在线更新的近期状态槽,通过门控交叉注意力注入场景记忆;2) A3D-RoPE将末端执行器的度量3D坐标编码为旋转位置嵌入,注入到骨架到视频的交叉注意力中,实现精确的动作控制。模型在210K片段的自平衡语料库上训练,生成视频-动作对用于增强真实机器人数据。

  • 整体架构:EGOGENESIS基于DiT(Diffusion Transformer)架构,以文本指令、噪声视频和骨架嵌入作为条件输入,通过自回归方式逐段生成并追加视频帧。骨架嵌入来自末端执行器或手部的3D关键点序列,为动作控制提供几何先验(第3页,图3)。
  • OAPM设计动机:自回归生成中,模型只能访问当前片段的信息,缺乏对全局场景的记忆。OAPM通过维护两类3D场景槽来解决这一问题——不可变的锚定槽(从第一帧提取的持久场景特征)和在线刷新的近期状态槽(周期性更新以反映当前交互状态)。两者通过门控交叉注意力注入DiT的生成过程(第4页)。
  • OAPM实现细节:锚定槽使用VGGT-Ω从第一帧提取3D场景重建特征,在整个生成过程中保持不变,确保背景和静态物体的长期一致性。近期状态槽每隔固定帧数从当前生成帧重新提取特征并更新,捕捉物体移动、手部位置变化等动态信息。门控机制允许模型自适应地选择从锚定记忆或近期记忆中读取信息(第4、11页)。
  • A3D-RoPE设计动机:传统位置编码(如RoPE)仅编码序列位置,无法表达末端执行器在3D空间中的度量位置。PRoPE虽然引入了相对位置信息,但仍缺乏度量3D几何的显式编码。A3D-RoPE将相机坐标系下的3D骨架坐标直接编码为旋转位置嵌入,使模型能够感知末端执行器的精确空间位置(第4页)。
  • A3D-RoPE实现细节:对于每个骨架关键点,A3D-RoPE将其3D坐标(x,y,z)映射到旋转矩阵,注入到骨架到视频的交叉注意力层中。这种设计使得注意力权重能够反映末端执行器与图像区域之间的3D空间关系,从而实现精确的动作-视觉对齐。消融实验表明,A3D-RoPE在SSIM上达到0.8509,优于RoPE的0.8198和PRoPE的0.8408(第6页,表2)。
  • 训练数据:模型在210K片段的自我中心操作视频语料库上训练,数据来源包括多种机器人平台和人类操作演示,统一转换为相机-姿态条件接口(第12页,图10)。
  • 下游WAM增强流程:EGOGENESIS生成的视频-动作对与真实机器人数据混合,用于训练下游WAM。实验设置中比较了仅用400条真实轨迹、仅用400条合成轨迹、以及两者混合(共800条)三种训练配置(第7页)。
  • 跨具身泛化:A3D-RoPE的骨架条件接口支持不同具身形式的统一表示。论文展示了从人手骨架提取食指和拇指轨迹作为夹爪控制条件,实现跨具身模拟的能力(第16页,图14)。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 2. Motivation from diagnosing failures in existing egocen- tric video generators.

图2诊断现有自我中心视频生成器的失败模式,包括场景漂移、手部几何变形和动作执行不足。这些失败案例直接驱动了OAPM和A3D-RoPE的设计。

研究空白与核心贡献

研究空白与核心贡献
Figure 3. EGOGENESIS architecture. Text, noisy video, and skeleton embeddings provide the conditioning inputs. Autoregressive DiT generates and appends video frames. OAPM maintains anchored and recent 3D scene slots and refreshes the recent state online. A3D- RoPE injects metric action geometry into skeleton-to-video cross-attention.

图3展示EGOGENESIS的完整架构,包括文本、噪声视频和骨架嵌入的条件输入,OAPM的锚定槽和近期槽结构,以及A3D-RoPE在交叉注意力中的注入位置。

方法如何工作

方法如何工作
Table 2. Compact core-component ablation on Wan2.2-5B- Control. The complete action, physical-faithfulness, and consis- tency metrics are reported in the supplementary material.

OAPM维护两类3D场景记忆:第一帧提取的锚定槽永远不变,保证背景和静态物体始终一致;近期状态槽每隔几帧刷新一次,捕捉夹爪移动和物体被推动后的新位置。A3D-RoPE则把末端执行器的3D坐标直接编码成旋转位置嵌入,注入到骨架与视频的交叉注意力中。消融实验显示,去掉近期状态槽,场景一致性大幅下降;把A3D-RoPE换成普通位置编码,几何漂移在80帧内累积到不可接受的程度。

核心结论

核心结论
Table 3. Real-robot task success rates (%). SR denotes Success Rate; ID and OOD denote in-distribution and out-of-distribution evaluation, respectively.

表3报告了8个真实机器人任务的ID和OOD成功率。重点关注混合训练(400真实+400合成)相对于纯真实数据在OOD场景的提升幅度。

实验如何设计?

  • 生成质量评估:在包含机器人夹爪、末端执行器轨迹和人手骨架的混合测试基准上,与通用视频生成模型(Wan2.1-14B)和自我中心生成模型(RynnWorld-TeleOp、EgoHOI、EGOSIM-14B)进行定量和定性比较(第5页)。
  • 评估指标:采用PSNR、SSIM、LPIPS评估图像质量,Kpt.Err评估手部关键点终点误差,Phys.Faith评估物理合理性,Subj.Cons.和Bg.Cons.分别评估主体和背景一致性(第5页,表1)。
  • 消融实验:在Wan2.2-5B-Control基线上,分别消融OAPM的近期状态槽和A3D-RoPE的度量3D编码,验证各组件的独立贡献(第6页,表2;第14页,表4)。
  • 几何漂移分析:通过80帧自回归生成过程中的累积深度误差和相机误差,量化A3D-RoPE对几何漂移的抑制效果(第6页,图5)。
  • 下游机器人实验:在8个真实机器人任务(4个双臂、4个单臂)上,评估用EGOGENESIS生成数据增强训练后下游WAM的分布内(ID)和分布外(OOD)成功率。OOD场景在物体外观和布局上与训练数据不同(第7页,表3;第13页,表6)。
  • 机器人平台:实验使用天机M6双臂机器人平台,配备头戴式自我中心相机,两个夹爪臂共享桌面工作空间(第15页,图12)。

关键结果与论文证据

  • 生成质量全面领先:EGOGENESIS在PSNR(21.8609)、SSIM(0.8509)、LPIPS(0.2399)、Kpt.Err(0.0501)、Phys.Faith(0.8278)和Bg.Cons.(0.9546)六项指标上均取得最优结果,验证了OAPM和A3D-RoPE的综合有效性(第5页,表1)。
  • OAPM近期状态槽关键作用:消融实验显示,增加近期槽Mr使PSNR从20.4135提升至21.8609,LPIPS从0.2533降至0.2399,证明在线刷新近期状态对维持场景一致性至关重要(第6页,表2)。
  • A3D-RoPE显著抑制几何漂移:在80帧rollout中,A3D-RoPE将深度误差降低79.30%,相机误差降低78.26%(相对于RoPE基线),表明度量3D几何编码有效防止了自回归生成中的误差累积(第6页,图5)。
  • 注意力可视化验证设计意图:A3D-RoPE的交叉注意力图显示,模型的空间注意力集中在末端执行器和接触相关区域,而非均匀分布,证明3D位置编码确实引导模型关注动作相关的空间位置(第7页,图6)。
  • OAPM实现持久与动态记忆的平衡:可视化分析表明,锚定槽保留了第一帧的完整场景布局,而近期状态槽周期性更新以反映夹爪位置和物体状态变化,两者互补实现了场景一致性维护(第7页,图7)。
  • 合成数据增强显著提升OOD泛化:在400条真实轨迹基础上加入400条EGOGENESIS合成轨迹,单臂OOD成功率从77%提升至84%,双臂OOD成功率从53%提升至70%。值得注意的是,仅用合成数据训练的性能远低于真实数据,但混合训练超越了纯真实数据,说明合成数据提供了互补的视觉多样性(第7页,表3)。
  • OOD任务进度可视化:在分布外场景中,使用EGOGENESIS增强训练的WAM在任务执行进度上明显优于仅用真实数据训练的模型,尤其在双臂协调任务中差距更为显著(第8页,图9)。
  • 定性比较展示场景保持优势:在压平短裤和组装方桌等任务中,EGOGENESIS生成的视频更好地保持了具身形态、场景布局和接触驱动的物体演化,而基线方法出现手部几何变形、物体漂移或动作执行不足(第5页,图4)。

阅读时需要注意

  • 生成质量依赖预训练视频先验Wan2.2-5B-Control,可能继承其训练数据中的偏差和伪影,在极端场景下生成质量可能下降。
  • OAPM的刷新间隔和A3D-RoPE的坐标构建依赖准确的相机标定和深度估计,实际部署中感知噪声可能影响条件信号的精度。
  • 下游WAM泛化实验仅在特定机器人平台(天机M6)和8个任务上验证,跨平台、跨任务类型的迁移性尚未充分测试。
  • 合成数据增强的效果与生成视频的质量强相关,低质量生成可能引入噪声反而损害策略学习,需要质量筛选机制。

关联工作

  • Wan2.1-14B作为通用视频生成先验基线,存在相机和夹爪轨迹不可控的问题,EGOGENESIS在其基础上增加了几何感知条件机制(第2页)。
  • RynnWorld-TeleOp是动作条件视频生成模型,但存在场景和物体漂移问题,论文将其归因于第一帧锚定不足,这正是OAPM设计的出发点(第2页)。
  • EgoHOI和EGOSIM-14B是自我中心手物交互生成模型和世界模拟器,在对比中表现出较弱的接触交互和指令遵循能力(第5页)。
  • VGGT-Ω用于提取3D场景重建特征,作为OAPM的编码器,为锚定槽提供第一帧的持久场景表示(第4页)。
  • RoPE和PRoPE是基线位置编码方法,A3D-RoPE在消融实验中与之对比,证明了度量3D几何注入的有效性(第6页)。

发表评论