槽位质量如何决定对象中心世界模型的规划鲁棒性

快速导读:通过受控实验研究对象中心世界模型中槽位表示质量与分布偏移下规划鲁棒性的关系,发现规划成功率与无监督槽位质量指标正相关但增益饱和,且冻结预训练视觉特征是鲁棒性的重要来源。

对象中心世界模型(OCWM)的核心假设是:将场景分解为绑定对象的槽位,能提升世界模型的规划性能与泛化能力。但这一假设长期缺乏受控验证。本文以C-JEPA框架为基础,通过替换槽位编码器并固定动力学模型与规划器,首次系统研究了槽位表示质量与规划成功率之间的关系。

研究发现,规划成功率与无监督槽位质量指标(FG-ARI、mBO)呈正相关,但增益在高槽位质量处饱和。更重要的是,高质量槽位使原本依赖的辅助机制——slot masking和proprioception——变得不必要。在分布偏移下,冻结预训练视觉特征成为鲁棒性的关键来源。

英文题目:Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models

论文出处:arXiv 每日论文精选 · arXiv:2608.12078

原始论文:PDF / 论文页面

这篇论文解决什么问题?

世界模型从离线轨迹中学习环境动力学,用于测试时的模型预测控制(MPC)。对象中心表示将场景分解为绑定对象的槽位,理论上应提升样本效率和泛化性。然而,现有OCWM研究将槽位编码器视为给定组件,仅在分布内评估,从未验证对象中心归纳偏置是否真正提升了规划性能。

一个典型例子是C-JEPA:它使用VideoSAUR作为槽位编码器,但VideoSAUR的槽位绑定质量很差——在PushT环境中,同一物体被碎片化到多个槽位,背景与前景混合。尽管如此,C-JEPA报告了较强的规划性能,这引发了一个关键疑问:规划性能究竟来自槽位表示,还是来自辅助机制(如slot masking和proprioception)?

本文的研究缺口正在于此:缺乏对槽位表示质量与规划性能之间因果关系的受控研究。作者选择SlotContrast作为高质量槽位编码器,替换VideoSAUR,在完全相同的动力学模型和CEM规划器下进行对比,从而隔离出槽位质量的独立贡献。

核心创新

  • 首次对OCWM进行受控研究,分离槽位表示质量与动力学模型对规划性能的影响
  • 证明高质量槽位使槽位掩码目标和本体感知输入变得不必要
  • 系统评估OCWM在对象级外观、帧级和动力学分布偏移下的规划鲁棒性,并与场景中心模型对比

方法概览

以C-JEPA框架为基础,用SlotContrast替换VideoSAUR作为槽位编码器,用DINOv3替换DINOv2作为特征提取器,构建SlotContrast-WM(默认无槽位掩码、无本体感知)。在PushT和OGBench-Cube上,固定动力学模型和CEM规划器,扫描不同槽位质量检查点,并与场景中心基线DINO-WM和LeWM在匹配条件下对比分布偏移鲁棒性。

  • 以C-JEPA框架为基础,构建SlotContrast-WM:用SlotContrast替换VideoSAUR作为槽位编码器,用DINOv3替换DINOv2作为特征提取器。默认配置不使用slot masking和proprioception。
  • 槽位质量扫描实验:在SlotContrast的不同训练检查点上训练世界模型,测量FG-ARI和mBO与规划成功率的相关性。动力学模型和CEM规划器在所有检查点上保持固定。
  • 消融实验:扫描num_masked_slots∈{0,1,2}与use_proprio∈{true,false}的组合,对比SlotContrast和VideoSAUR两种编码器在PushT上的规划成功率。
  • 分布偏移鲁棒性评估:在PushT上测试外观、尺度、形状三类偏移,在OGBench-Cube上测试对象级和场景级偏移,对比SlotContrast-WM与场景中心基线DINO-WM和LeWM的零样本规划成功率。
  • 场景中心基线选择:DINO-WM在冻结DINOv2 patch特征上规划,LeWM使用端到端训练ViT的全局CLS token。两者均不引入对象中心归纳偏置,用于隔离槽位分解的贡献。

逐图理解论文

失败案例揭示的疑问

失败案例揭示的疑问
Figure 1: Slot decomposition on PushT. Left: SlotContrast binds each object (agent, T-block, goal) to a dedicated slot. Right: VideoSAUR fragments objects across slots and mixes them with the background.

左图显示SlotContrast将PushT场景中的智能体、T形块和目标分别绑定到独立槽位,右图显示VideoSAUR将同一物体碎片化到多个槽位并与背景混合。这是理解槽位质量差异的直观起点。

研究缺口与受控设计

研究缺口与受控设计
Figure 2: Across SlotContrast checkpoints (orange), planning success rate above the random-policy baseline (2%) is positively correlated with video slot-quality metrics: FG-ARI (left, Pearson r = 0.96) and mBO (right, r = 0.94). VideoSAUR (blue diamond) uses the same minimal configuration (no slot masking or proprioception). Takeaway 1: Planning success is positively correlated with slot quality with no change to the dy- namics model, but the gains saturate: at high slot quality, where the metrics themselves plateau, better-bound slots yield little additional planning success.

橙色点显示SlotContrast不同检查点的规划成功率随FG-ARI和mBO上升而提高,蓝色菱形是VideoSAUR在相同配置下的表现。注意高质量端的饱和现象:指标平台期后规划成功率不再显著提升。

辅助机制变得不必要

辅助机制变得不必要
Table 3: Planning SR (%) on PushT evaluating num_masked_slots and proprioception across strong (SlotContrast) and weak (VideoSAUR) encoders. Without proprioception (−prop), masking strictly degrades planning for both encoders.

该表展示masking和proprioception的消融结果。无proprioception时masking严格降低性能,说明masking在弱编码器上可能依赖proprioception捷径而非视觉对象交互。

分布偏移下的鲁棒性来源

分布偏移下的鲁棒性来源
Figure 3: Planning success under distribution shift on PushT. OCWM (SlotContrast-WM) versus scene-centric baselines (DINO-WM, LeWM).

对比SlotContrast-WM、DINO-WM和LeWM在PushT分布偏移下的规划成功率。重点观察LeWM在形状变化下的崩溃,以及SlotContrast-WM在各偏移类型下的稳定性。

实验如何设计?

  • PushT环境:随机策略基线成功率约2%,任务是将T形块推到目标位置。SlotContrast在PushT上训练,槽位质量随训练进度提升。
  • OGBench-Cube环境:随机策略基线成功率高达48%,任务涉及机械臂操作小立方体。该环境的基线较高,评估本身存在已知局限。
  • CEM规划参数在所有世界模型间保持一致(Table 2),确保规划器不成为混淆变量。
  • 分布偏移的具体取值在Table 4(PushT)和Table 5(OGBench-Cube)中列出,每个因子测试一个代表性变化。

关键结果与论文证据

  • PushT上规划成功率与FG-ARI的Pearson r=0.96,与mBO的r=0.94(Figure 2,第3页)。这表明槽位质量与规划性能强相关,但增益在高质量处饱和。
  • SlotContrast-WM在无proprioception、无masking的默认配置下达到84.7%±1.9的成功率,超过VideoSAUR的74.7%约10个百分点(Table 3,第14页)。
  • 无proprioception时,slot masking单调降低两个编码器的规划性能:SlotContrast从84.7%降至72.0%再降至34.0%,VideoSAUR从74.7%降至52.0%再降至49.3%(Table 3,第14页)。
  • OGBench-Cube上SlotContrast-WM与FG-ARI的r=0.76,与mBO的r=0.87(Figure 5,第13页)。但指标在场景级聚合时,大尺寸机械臂主导分数,小立方体贡献少,导致相关性弱于PushT。
  • PushT分布偏移下SlotContrast-WM保持最高成功率,LeWM在形状变化下崩溃至2-4%(Figure 3,第4页)。
  • OGBench-Cube场景级偏移(背景色、相机角度)使LeWM降至接近48%随机基线,而SlotContrast-WM和DINO-WM保持接近分布内水平(Figure 8,第15页)。
  • 定性对比(Figure 4,第12页)显示SlotContrast在80个时间步上保持时序一致的槽位绑定,而VideoSAUR的槽位碎片化严重。

阅读时需要注意

  • 无监督槽位指标在任务相关物体相对场景较小时信息量不足,如OGBench-Cube中机械臂主导分数而小立方体贡献少。
  • 所有模型在几何变化(物体形状改变)下均失败,因为形状改变影响接触动力学,这是当前方法的共同盲区。
  • 仅在PushT和OGBench-Cube两个操作环境上验证,缺乏更多物体、尺度和动力学多样性的测试。
  • OGBench-Cube随机策略基线高达48%,环境评估本身存在已知局限,可能削弱结论在该环境上的说服力。

关联工作

  • C-JEPA是本文构建的基础OCWM框架,使用VideoSAUR编码器和因果掩码目标。本文通过替换其编码器来隔离槽位质量的贡献。
  • OC-STORM是先前OCWM,仅在分布内评估,未涉及分布偏移下的规划鲁棒性。
  • Dyn-O在Procgen上评估OOD但仅报告视觉保真度而非控制指标,无法回答规划性能问题。
  • SlotContrast是本文采用的高质量视频对象中心编码器,提供时序一致的槽位,是实验的关键变量。

发表评论