LAWM-3D:从人类视频中学习3D感知的潜在动作,构建可泛化的机器人世界模型

快速导读:提出LAWM-3D框架,通过多视角联合训练、非单射RGB-D重建和几何特征对齐,从无标签人类视频中学习视角不变的3D感知潜在动作,显著提升世界模型的生成质量、物理一致性和泛化能力。

机器人世界模型的核心挑战在于:如何让模型在未见过的场景中依然能准确预测环境动态?LAWM-3D给出的答案是——从人类视频中学习3D感知的潜在动作表示。该框架通过多视角联合训练、非单射RGB-D重建和几何特征对齐三个紧密耦合的设计,让潜在动作编码器学会捕捉视角不变的3D运动信息,而非依赖外观捷径。

实验表明,这种3D感知的潜在动作空间不仅提升了世界模型在WorldArena基准上的视频生成质量,更关键的是,在分布外泛化评估中,仅2B参数的LAWM-3D世界模型就超越了14B的DreamDojo基线。这证明3D结构先验比模型规模更能决定泛化能力。

英文题目:LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

论文出处:arXiv 每日论文精选 · arXiv:2608.05706

原始论文:PDF / 论文页面

这篇论文解决什么问题?

潜在动作模型(LAM)通过自监督方式从无标签视频中学习动作表示,以缓解机器人领域动作标注成本高、动作空间异构的问题。然而,现有方法如DreamDojo主要依赖单视角输入,在2D像素空间建模,缺乏对3D运动和交互的显式推理。当视角变化时,同样的物理动作在像素空间可能呈现完全不同的外观,导致模型学到的是视角相关的表象而非本质的运动规律。

一个直观的改进思路是引入多视角数据。但论文揭示了一个关键发现:简单地将多视角数据整合到现有框架中,反而会导致性能下降。原因在于,编码器会利用未来帧的外观信息走捷径——它可以通过观察目标帧的纹理细节来推断动作,而非真正理解3D运动。这种"外观泄露"在多视角设置下更为严重,因为不同视角间的外观差异为模型提供了额外的作弊线索。

因此,核心问题转化为:如何设计一个框架,既能利用多视角数据提供的3D几何信息,又能防止编码器依赖外观捷径?这需要在信息流和训练目标上做出精心设计。

此外,即使成功学到视角不变的动作表示,如何将其有效注入世界模型也是一个挑战。世界模型需要在想象推演中保持物理一致性——物体的运动应符合刚体约束,遮挡关系应随视角合理变化,交互应有因果逻辑。这些要求都指向同一个方向:世界模型需要3D感知能力。

核心创新

  • 提出多视角不变统一动作分词方案,通过随机视角掩码策略联合训练多视角和单视角数据,学习视角不变的3D感知潜在动作。
  • 引入非单射RGB-D联合重建目标,解码器预测深度图作为辅助监督,有效抑制未来帧RGB信息泄露,迫使编码器关注几何运动而非外观。
  • 设计几何对齐约束,将编码器中间层特征与预训练3D基础模型VGGT对齐,显式注入跨视角一致的3D结构先验。

方法概览

LAWM-3D框架包含三个紧密耦合的设计:1) 多视角不变统一动作分词方案,联合训练多视角和单视角数据学习视角不变潜在动作;2) 几何对齐约束,将编码器中间特征锚定到预训练3D基础模型VGGT,提供显式跨视角几何对应;3) 非单射RGB-D联合重建目标,解码器预测未来帧和深度图,防止编码器从未来帧外观信息走捷径,迫使模型关注几何意义的运动线索。训练分三阶段:LAM预训练、世界模型人类视频预训练、机器人数据微调。

  • 多视角不变统一动作分词方案:LAWM-3D将多视角和单视角数据混合训练,采用随机视角掩码策略。对于多视角样本,随机选择一个视角作为编码器输入,其他视角作为重建目标;对于单视角样本,仅使用该视角进行自重建。这种设计迫使编码器学习视角无关的运动本质,而非记忆特定视角的外观模式。
  • 非单射RGB-D联合重建目标:这是防止外观泄露的关键设计。解码器同时预测未来RGB帧和深度图,但深度信息对编码器不可见——编码器仅接收当前帧和未来RGB帧作为输入。由于深度图无法从外观直接推断,编码器必须关注几何意义的运动线索才能帮助解码器准确预测深度。这种"非单射"设计切断了外观捷径。
  • 几何对齐约束:编码器中间层特征与预训练3D基础模型VGGT进行对齐。VGGT从多视角图像中提取跨视角一致的3D几何特征,通过将编码器特征锚定到VGGT的特征空间,显式注入3D结构先验。对齐仅作用于编码器中间层,避免过度约束影响表示学习。
  • 三阶段训练策略:第一阶段预训练LAM,学习潜在动作空间;第二阶段在人类视频上预训练世界模型,使用冻结的LAM编码器提取潜在动作作为条件;第三阶段在目标机器人数据上微调。这种渐进式训练使世界模型先掌握通用的3D运动先验,再适应特定任务。
  • 世界模型架构:基于Cosmos-Predict2.5扩散Transformer骨干,以LAM提取的潜在动作作为条件,通过自适应层归一化注入动作信息。推理时仅需LAM编码器,深度模块不参与推演。
  • 深度监督实现:使用Depth-Anything-V2离线生成深度伪标签,仅在训练时作为解码器的辅助监督信号。该模块冻结且不参与推理,额外计算开销可控。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 2: Architecture of the 3D-aware latent action model and world model training pipeline.

架构图详细展示了LAM的编码器-解码器结构和世界模型训练管线。重点关注非单射设计:深度解码器接收编码器特征和未来RGB,但编码器本身看不到深度信息。

几何对齐与多视角训练

几何对齐与多视角训练
Figure 1: Overview of LAWM-3D framework. The model learns 3D-aware latent actions through joint training on multi-view and single-view datasets. The learned latent action space enables world model pretraining and supports downstream tasks, achieving superior overall performance compared to the baseline method DreamDojo (Gao et al. 2026a).

框架总览图展示了LAWM-3D的核心流程:从多视角和单视角人类视频中学习3D感知潜在动作,再用于世界模型预训练和下游任务。注意观察多视角数据如何通过统一分词方案被联合利用。

泛化能力的决定性证据

泛化能力的决定性证据
Table 3: Generalization evaluation results on three OOD datasets (Pretraining on human videos).

最有力的证据来自分布外泛化测试。在三个完全未见过的场景基准上,LAWM-3D仅用2B参数的世界模型,就全面超越了14B参数的DreamDojo基线。这说明3D结构先验比模型规模更能决定泛化能力。定性结果更直观:在真实机器人操作场景中,LAWM-3D生成的推演视频展现出更强的物理合理性——物体交互有因果逻辑,空间定位准确,不会出现违反物理规律的视觉伪影。世界模型真正学会了想象3D世界中会发生什么,而不是在2D像素空间做纹理拼接。

实验如何设计?

  • LAM预训练数据:Ego-Exo4D和Assembly101多视角人类操作视频,以及EgoDex单视角灵巧操作视频。多视角数据提供跨视角几何约束,单视角数据扩充动作多样性。
  • 世界模型评估基准:WorldArena涵盖16个指标、6个维度,包括运动质量、3D精度、动作跟随等,全面评估视频生成的物理合理性。
  • 分布外泛化评估:In-lab Eval、EgoDex Eval、DreamDojo-HV Eval三个OOD基准,测试世界模型在未见场景、未见物体、未见视角下的表现。
  • 策略评估:在MuJoCo仿真操作任务上进行离线策略排序和在线策略选择实验,验证世界模型作为策略评估器的有效性。
  • 潜在动作分析:通过跨视角迁移、视角不变性矩阵、互信息估计和线性探测等多维度验证潜在动作的3D感知特性。

关键结果与论文证据

  • LAM重建质量:在Ego-Exo4D上RGB PSNR达33.38、深度PSNR达35.62;Assembly101上RGB PSNR达35.76、深度PSNR达35.85(Table 1, p.4),验证了非单射深度监督的有效性。
  • WorldArena综合评估:LAWM-3D在16项指标中取得SOTA,尤其在3D精度相关指标上表现突出,Depth Acc.达0.350、Trajectory Acc.达0.889(Table 2, p.5),证明3D感知潜在动作直接提升了世界模型的几何理解。
  • OOD泛化优势:2B参数的LAWM-3D在In-lab Eval上PSNR达21.465、SSIM达0.792,均优于14B的DreamDojo(Table 3, p.6),说明3D结构先验比模型规模更关键。
  • 策略选择提升:在线策略选择将高方差策略组的成功率从53%提升至70%,绝对提升17%(Figure 8, p.10),证明世界模型的想象推演与真实环境表现高度一致。
  • 互信息分析:LAWM-3D在KSG、BA、MINE三种估计器上均取得最高互信息,平均比MVP-LAM高约15%(Figure 12, p.14),表明潜在动作包含更丰富的动作相关信息。
  • 线性探测验证:在Bridge V2和LIBERO-Long等OOD任务上均取得最低NMSE(Figure 13, p.14),证明潜在动作表示具有良好的跨任务迁移能力。
  • 消融实验:完整模型在LAM上PSNR达30.56、SSIM达0.933,世界模型上PSNR达21.68、SSIM达0.797,均优于移除多视角、几何对齐或深度监督的变体(Table 4, p.7)。
  • 定性可视化:在真实机器人操作场景中,LAWM-3D生成的推演视频展现出更强的物理合理性,如物体交互的因果逻辑和空间定位的准确性(Figure 5, p.6)。

阅读时需要注意

  • 训练时需额外加载冻结的LAM编码器(约710M参数)和Depth-Anything-V2(约97M参数),增加了训练阶段的计算开销,尽管推理时无需深度模块。
  • 世界模型预训练和策略选择实验主要在仿真和特定机器人数据集上进行,在更广泛真实世界任务中的有效性有待进一步验证。
  • 多视角数据的获取成本较高,限制了方法在数据稀缺场景下的直接应用。

关联工作

  • DreamDojo:LAWM-3D的直接基线,采用VAE框架从单视角视频学习潜在动作,但缺乏3D感知能力。LAWM-3D在其基础上引入多视角训练和几何对齐。
  • MVP-LAM:利用跨视角重建约束学习视角不变动作表示,但依赖合成或严格对齐的多视角设置。LAWM-3D面向真实场景的非严格对齐多视角数据。
  • UniLACT:在单视角设置下引入深度监督增强3D理解,但深度信息对编码器可见。LAWM-3D的非单射设计避免了直接信息注入。
  • Geometry Forcing:将视频扩散特征与预训练3D基础模型对齐以增强几何一致性。LAWM-3D借鉴其对齐思想,但仅对齐编码器中间层,保持表示学习的灵活性。

发表评论