HERA:冻结的世界模型如何记住被遮挡的物体?

快速导读:提出HERA框架与RRPM适配器,通过结构化记忆库和分离的Memory/Workspace Registers将历史证据路由至冻结的V-JEPA 2预测器,提升物理违规检测的准确性。

预测性世界模型通过学习未来状态的隐表征来理解物理世界,但它们在物体被遮挡后常常“忘记”关键证据,导致物理预测失败。HERA(Historical Evidence Routing Adapter)框架正是为了解决这一问题而提出的。它保持V-JEPA 2的编码器和预测器完全冻结,仅训练一个轻量级的RRPM(Register-Routed Patch Memory)适配器,通过结构化记忆库和分离的寄存器机制,将历史证据精准路由至未来预测。

在IntPhys2基准上,HERA将V-JEPA 2-G的成对AvgSurprise准确率从52.57%提升至54.35%,尤其在固定相机场景下,连续性和不变性两个物理原则的准确率分别提升了11.54和17.31个百分点。更重要的是,HERA仅需3.00M可训练参数,远少于直接注入记忆的对比方法(5.96M),却取得了更好的效果。

英文题目:HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models

论文出处:arXiv 每日论文精选 · arXiv:2608.05523

原始论文:PDF / 论文页面

这篇论文解决什么问题?

V-JEPA 2等隐空间预测模型通过预测未来帧的隐表征来构建世界模型。然而,当物体被遮挡后重新出现时,模型往往无法回忆起该物体在遮挡前的状态——例如,一个球滚到遮挡物后面,模型可能“忘记”球的存在,从而无法判断球从另一侧滚出是否合理。

现有方法主要通过两种途径尝试解决这一问题:一是扩大时序上下文窗口,让模型看到更长的历史;二是缓存通用特征作为外部记忆。但这些方法都没有解决一个核心问题——如何选择性地将相关的历史证据路由到未来的预测位置。简单地堆叠更多上下文或缓存所有特征,并不能保证预测器在需要时能够访问到正确的证据。

IntPhys2基准通过配对“可能”和“不可能”的视频,以AvgSurprise(平均惊奇度)来衡量模型是否保留了物理记忆。如果模型对不可能视频的预测误差显著高于可能视频,说明它检测到了物理违规。这一基准为诊断模型的物理记忆能力提供了严格的测试平台。

HERA的核心洞察在于:历史证据的保留、检索和集成应该被解耦为三个独立的过程。保留需要结构化的组织,检索需要专门的查询机制,集成则需要在不破坏预训练预测通路的前提下将信息注入。

核心创新

  • 提出HERA框架,将历史证据的保留、检索与集成解耦,无需物体标注即可增强冻结隐空间预测器的物理推理能力。
  • 设计RRPM适配器,通过分离Memory Registers(检索)和Workspace Registers(集成),避免干扰预训练预测通路。
  • 构建按时间角色(锚点、中间、近期、全局)组织的Structured Memory Bank,以紧凑形式保留互补的历史patch证据。

方法概览

HERA框架保持V-JEPA 2编码器和预测器冻结,仅训练轻量级RRPM适配器。RRPM包含三个模块:1) Structured Memory Bank将上下文patch按时间角色(Anchor/Middle/Recent/Global)组织为结构化记忆;2) Memory Registers通过门控交叉注意力从记忆库中检索证据;3) Workspace Registers通过预测器原生自注意力通路整合检索到的信息。

  • HERA框架保持V-JEPA 2的编码器和预测器完全冻结,仅在两者之间插入轻量级的RRPM适配器。编码器输出的上下文patch tokens首先被组织为Structured Memory Bank,然后通过Memory Registers检索相关证据,最后由Workspace Registers在预测器内部完成信息集成。
  • Structured Memory Bank将上下文patch按时间角色划分为四类:Anchor Memory存储早期物体证据(如物体初始外观),Middle Memory总结运动和交互历史,Recent Memory保存预测前最近的状态,Global Memory提供粗粒度的上下文摘要。这种结构化组织确保互补的历史证据以紧凑形式被保留(见论文第4页,Figure 2)。
  • Memory Registers是一组可学习的令牌,通过门控交叉注意力从Structured Memory Bank中检索证据。门控机制允许模型自适应地决定从每个时间角色中提取多少信息,避免无关历史干扰预测。
  • Workspace Registers是另一组可学习的令牌,它们被拼接到预测器的输入序列中,通过预测器原生的自注意力通路与目标patch tokens交互。这种设计确保检索到的历史证据能够自然地融入预测过程,而无需修改预测器本身的结构(见论文第5页)。
  • Memory Registers和Workspace Registers的分离是HERA的关键设计选择。Memory Registers专注于“检索什么”,Workspace Registers专注于“如何集成”。消融实验表明,移除任一寄存器组都会导致性能下降(见论文第7页,Table 1)。
  • 整个RRPM适配器仅包含3.00M可训练参数,远少于直接向预测器注入记忆令牌的Direct-to-Target方法(5.96M)。这种轻量设计使得HERA可以即插即用地增强各种冻结的隐空间预测器。
  • 训练在Physion数据集上进行,使用与V-JEPA 2相同的预测目标。评估时在IntPhys2上计算成对AvgSurprise准确率——对于每对可能/不可能视频,如果不可能视频的AvgSurprise更高,则判定为正确。
  • HERA与五种替代记忆机制进行了对比:Clip-Local(仅使用局部上下文)、Prefix(在序列前添加可学习令牌)、Hierarchical(分层记忆压缩)、Shared-Register(不分离Memory和Workspace Registers)和Direct-to-Target(直接向预测器注入记忆令牌)。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 2: Structured Memory Bank in RRPM. The Structured Memory Bank preserves historical patch evidence according to temporal role. Anchor memory stores early object evidence, middle memory summarizes motion and interaction history, recent memory stores the state immediately before prediction, and global memory provides a coarse context summary. The bank gives the predictor access to physically relevant history without requiring object supervision.

图2详细展示了Structured Memory Bank的组织方式。上下文patch tokens被按时间角色划分为四类:Anchor(锚点)存储早期物体证据,Middle(中间)总结运动历史,Recent(近期)保存预测前状态,Global(全局)提供粗粒度摘要。这种结构化组织确保互补的历史证据以紧凑形式被保留,使预测器能够访问物理相关的历史信息。

核心区分与研究空白

核心区分与研究空白
Figure 1: Architecture of HERA with RRPM. A frozen V-JEPA 2 context encoder produces tokens that are organized into temporally structured memory. Memory Registers retrieve this evidence through gated cross-attention, while Workspace Registers support its integration through the frozen predictor’s self-attention pathway.

图1展示了HERA的整体架构。左侧是冻结的V-JEPA 2编码器,将视频帧编码为patch tokens。中间是RRPM适配器,包含Structured Memory Bank和两组寄存器。右侧是冻结的预测器,Workspace Registers通过自注意力通路将检索到的历史证据集成到预测过程中。注意Memory Registers和Workspace Registers的分离设计——前者通过交叉注意力从记忆库检索,后者通过自注意力在预测器内部集成。

最强结论

最强结论
Table 1: Pairwise AvgSurprise accuracy (%) on the IntPhys2 Main split under the same evaluation protocol. The highest accuracy is bold.

表1展示了IntPhys2 Main split上的成对AvgSurprise准确率对比。HERA以54.35%的准确率位居第一,超越了V-JEPA 2-G基线(52.57%)和所有替代记忆机制。注意Direct-to-Target方法虽然使用了更多可训练参数(5.96M vs 3.00M),但准确率(53.56%)仍低于HERA,证明了结构化检索的优势。寄存器消融实验(移除Memory或Workspace Registers)导致准确率下降,验证了分离设计的必要性。

实验如何设计?

  • 训练数据集:Physion,包含各种物理场景的视频。
  • 评估数据集:IntPhys2 Main split,包含成对的可能/不可能视频,涵盖不同难度、相机运动类型和物理原则。
  • 骨干网络:V-JEPA 2-G(巨型变体),编码器和预测器均保持冻结。
  • 评估协议:所有方法使用相同的预定义评估协议和上下文长度选择,以成对AvgSurprise准确率作为主要指标。
  • 对比方法:Clip-Local、Prefix、Hierarchical、Shared-Register、Direct-to-Target,均基于相同的V-JEPA 2-G骨干网络。
  • 消融实验:分别移除Memory Registers和Workspace Registers,以验证分离设计的必要性。

关键结果与论文证据

  • HERA在IntPhys2 Main split上达到54.35%的成对AvgSurprise准确率,相比V-JEPA 2-G基线的52.57%提升了1.78个百分点(见论文第7页,Table 1)。
  • HERA以更少的可训练参数(3.00M vs 5.96M)超越了Direct-to-Target Memory方法(53.56%),证明了结构化检索比直接注入更有效(见论文第7页,Table 1)。
  • 移除Memory Registers或Workspace Registers均导致准确率从53.95%降至53.56%,下降0.39个百分点,验证了寄存器分离的必要性(见论文第7页,Table 1)。
  • 在固定相机场景下,HERA在连续性原则上将准确率从46.15%提升至57.69%(+11.54%),在不变性原则上从46.15%提升至63.46%(+17.31%),表明结构化记忆对静态场景下的物理推理尤为关键(见论文第7页,Table 2)。
  • 在运动相机场景下,HERA的提升相对较小,说明相机运动引入的复杂性可能部分掩盖了历史证据路由的收益。
  • Structured Memory Bank的四个时间角色各有贡献:Anchor Memory保留了物体初始外观,Recent Memory提供了预测前的即时状态,Middle和Global Memory补充了运动和上下文信息。
  • HERA无需任何物体标注或物体级别的分解,完全在patch级别操作,这使其能够泛化到各种物体和场景。
  • 与Object-Centric方法(如Slot Attention)相比,HERA避免了依赖稳定的物体分解,在物体边界模糊或遮挡严重的场景中更具优势。

阅读时需要注意

  • 仅在单一基准(IntPhys2)和单一骨干网络(V-JEPA 2-G)上验证,泛化到其他世界模型或物理推理基准的能力尚待检验。
  • Structured Memory Bank的时序划分依赖固定的启发式规则(如均匀分段),可能不适用于所有物理场景或时间尺度。
  • 训练和评估限于48帧、384×384分辨率的视频片段,对更长时序或更高分辨率场景的扩展性未经验证。
  • 子组分析的增益可能受限于特定子组的样本量,部分提升的统计显著性需要进一步验证。

关联工作

  • V-JEPA/V-JEPA 2:作为被增强的基线冻结隐空间预测模型,HERA在其基础上构建记忆增强层。
  • IntPhys2:用于诊断物理记忆的违反预期基准,提供了严格的成对评估协议。
  • Vision Transformers Need Registers:启发了寄存器令牌的使用,但HERA将其分离为记忆和计算两种角色,这是本文的核心创新。
  • Object-Centric Learning(Slot Attention, SAVi++):提供了显式物体状态抽象,但依赖稳定的物体分解,HERA避免了这一要求。
  • Long-Horizon Memory for Video(Memorizing Transformers, Compressive Transformers等):扩展了时序上下文,但未解决选择性证据路由问题,HERA的结构化检索填补了这一空白。

发表评论