快速导读:提出HERA框架与RRPM适配器,通过结构化记忆库和分离的Memory/Workspace Registers将历史证据路由至冻结的V-JEPA 2预测器,提升物理违规检测的准确性。
预测性世界模型通过学习未来状态的隐表征来理解物理世界,但它们在物体被遮挡后常常“忘记”关键证据,导致物理预测失败。HERA(Historical Evidence Routing Adapter)框架正是为了解决这一问题而提出的。它保持V-JEPA 2的编码器和预测器完全冻结,仅训练一个轻量级的RRPM(Register-Routed Patch Memory)适配器,通过结构化记忆库和分离的寄存器机制,将历史证据精准路由至未来预测。
在IntPhys2基准上,HERA将V-JEPA 2-G的成对AvgSurprise准确率从52.57%提升至54.35%,尤其在固定相机场景下,连续性和不变性两个物理原则的准确率分别提升了11.54和17.31个百分点。更重要的是,HERA仅需3.00M可训练参数,远少于直接注入记忆的对比方法(5.96M),却取得了更好的效果。
英文题目:HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models
论文出处:arXiv 每日论文精选 · arXiv:2608.05523
原始论文:PDF / 论文页面
这篇论文解决什么问题?
V-JEPA 2等隐空间预测模型通过预测未来帧的隐表征来构建世界模型。然而,当物体被遮挡后重新出现时,模型往往无法回忆起该物体在遮挡前的状态——例如,一个球滚到遮挡物后面,模型可能“忘记”球的存在,从而无法判断球从另一侧滚出是否合理。
现有方法主要通过两种途径尝试解决这一问题:一是扩大时序上下文窗口,让模型看到更长的历史;二是缓存通用特征作为外部记忆。但这些方法都没有解决一个核心问题——如何选择性地将相关的历史证据路由到未来的预测位置。简单地堆叠更多上下文或缓存所有特征,并不能保证预测器在需要时能够访问到正确的证据。
IntPhys2基准通过配对“可能”和“不可能”的视频,以AvgSurprise(平均惊奇度)来衡量模型是否保留了物理记忆。如果模型对不可能视频的预测误差显著高于可能视频,说明它检测到了物理违规。这一基准为诊断模型的物理记忆能力提供了严格的测试平台。
HERA的核心洞察在于:历史证据的保留、检索和集成应该被解耦为三个独立的过程。保留需要结构化的组织,检索需要专门的查询机制,集成则需要在不破坏预训练预测通路的前提下将信息注入。
核心创新
- 提出HERA框架,将历史证据的保留、检索与集成解耦,无需物体标注即可增强冻结隐空间预测器的物理推理能力。
- 设计RRPM适配器,通过分离Memory Registers(检索)和Workspace Registers(集成),避免干扰预训练预测通路。
- 构建按时间角色(锚点、中间、近期、全局)组织的Structured Memory Bank,以紧凑形式保留互补的历史patch证据。
方法概览
HERA框架保持V-JEPA 2编码器和预测器冻结,仅训练轻量级RRPM适配器。RRPM包含三个模块:1) Structured Memory Bank将上下文patch按时间角色(Anchor/Middle/Recent/Global)组织为结构化记忆;2) Memory Registers通过门控交叉注意力从记忆库中检索证据;3) Workspace Registers通过预测器原生自注意力通路整合检索到的信息。
- HERA框架保持V-JEPA 2的编码器和预测器完全冻结,仅在两者之间插入轻量级的RRPM适配器。编码器输出的上下文patch tokens首先被组织为Structured Memory Bank,然后通过Memory Registers检索相关证据,最后由Workspace Registers在预测器内部完成信息集成。
- Structured Memory Bank将上下文patch按时间角色划分为四类:Anchor Memory存储早期物体证据(如物体初始外观),Middle Memory总结运动和交互历史,Recent Memory保存预测前最近的状态,Global Memory提供粗粒度的上下文摘要。这种结构化组织确保互补的历史证据以紧凑形式被保留(见论文第4页,Figure 2)。
- Memory Registers是一组可学习的令牌,通过门控交叉注意力从Structured Memory Bank中检索证据。门控机制允许模型自适应地决定从每个时间角色中提取多少信息,避免无关历史干扰预测。
- Workspace Registers是另一组可学习的令牌,它们被拼接到预测器的输入序列中,通过预测器原生的自注意力通路与目标patch tokens交互。这种设计确保检索到的历史证据能够自然地融入预测过程,而无需修改预测器本身的结构(见论文第5页)。
- Memory Registers和Workspace Registers的分离是HERA的关键设计选择。Memory Registers专注于“检索什么”,Workspace Registers专注于“如何集成”。消融实验表明,移除任一寄存器组都会导致性能下降(见论文第7页,Table 1)。
- 整个RRPM适配器仅包含3.00M可训练参数,远少于直接向预测器注入记忆令牌的Direct-to-Target方法(5.96M)。这种轻量设计使得HERA可以即插即用地增强各种冻结的隐空间预测器。
- 训练在Physion数据集上进行,使用与V-JEPA 2相同的预测目标。评估时在IntPhys2上计算成对AvgSurprise准确率——对于每对可能/不可能视频,如果不可能视频的AvgSurprise更高,则判定为正确。
- HERA与五种替代记忆机制进行了对比:Clip-Local(仅使用局部上下文)、Prefix(在序列前添加可学习令牌)、Hierarchical(分层记忆压缩)、Shared-Register(不分离Memory和Workspace Registers)和Direct-to-Target(直接向预测器注入记忆令牌)。
逐图理解论文
失败案例与直觉

图2详细展示了Structured Memory Bank的组织方式。上下文patch tokens被按时间角色划分为四类:Anchor(锚点)存储早期物体证据,Middle(中间)总结运动历史,Recent(近期)保存预测前状态,Global(全局)提供粗粒度摘要。这种结构化组织确保互补的历史证据以紧凑形式被保留,使预测器能够访问物理相关的历史信息。
核心区分与研究空白

图1展示了HERA的整体架构。左侧是冻结的V-JEPA 2编码器,将视频帧编码为patch tokens。中间是RRPM适配器,包含Structured Memory Bank和两组寄存器。右侧是冻结的预测器,Workspace Registers通过自注意力通路将检索到的历史证据集成到预测过程中。注意Memory Registers和Workspace Registers的分离设计——前者通过交叉注意力从记忆库检索,后者通过自注意力在预测器内部集成。
最强结论

表1展示了IntPhys2 Main split上的成对AvgSurprise准确率对比。HERA以54.35%的准确率位居第一,超越了V-JEPA 2-G基线(52.57%)和所有替代记忆机制。注意Direct-to-Target方法虽然使用了更多可训练参数(5.96M vs 3.00M),但准确率(53.56%)仍低于HERA,证明了结构化检索的优势。寄存器消融实验(移除Memory或Workspace Registers)导致准确率下降,验证了分离设计的必要性。
实验如何设计?
- 训练数据集:Physion,包含各种物理场景的视频。
- 评估数据集:IntPhys2 Main split,包含成对的可能/不可能视频,涵盖不同难度、相机运动类型和物理原则。
- 骨干网络:V-JEPA 2-G(巨型变体),编码器和预测器均保持冻结。
- 评估协议:所有方法使用相同的预定义评估协议和上下文长度选择,以成对AvgSurprise准确率作为主要指标。
- 对比方法:Clip-Local、Prefix、Hierarchical、Shared-Register、Direct-to-Target,均基于相同的V-JEPA 2-G骨干网络。
- 消融实验:分别移除Memory Registers和Workspace Registers,以验证分离设计的必要性。
关键结果与论文证据
- HERA在IntPhys2 Main split上达到54.35%的成对AvgSurprise准确率,相比V-JEPA 2-G基线的52.57%提升了1.78个百分点(见论文第7页,Table 1)。
- HERA以更少的可训练参数(3.00M vs 5.96M)超越了Direct-to-Target Memory方法(53.56%),证明了结构化检索比直接注入更有效(见论文第7页,Table 1)。
- 移除Memory Registers或Workspace Registers均导致准确率从53.95%降至53.56%,下降0.39个百分点,验证了寄存器分离的必要性(见论文第7页,Table 1)。
- 在固定相机场景下,HERA在连续性原则上将准确率从46.15%提升至57.69%(+11.54%),在不变性原则上从46.15%提升至63.46%(+17.31%),表明结构化记忆对静态场景下的物理推理尤为关键(见论文第7页,Table 2)。
- 在运动相机场景下,HERA的提升相对较小,说明相机运动引入的复杂性可能部分掩盖了历史证据路由的收益。
- Structured Memory Bank的四个时间角色各有贡献:Anchor Memory保留了物体初始外观,Recent Memory提供了预测前的即时状态,Middle和Global Memory补充了运动和上下文信息。
- HERA无需任何物体标注或物体级别的分解,完全在patch级别操作,这使其能够泛化到各种物体和场景。
- 与Object-Centric方法(如Slot Attention)相比,HERA避免了依赖稳定的物体分解,在物体边界模糊或遮挡严重的场景中更具优势。
阅读时需要注意
- 仅在单一基准(IntPhys2)和单一骨干网络(V-JEPA 2-G)上验证,泛化到其他世界模型或物理推理基准的能力尚待检验。
- Structured Memory Bank的时序划分依赖固定的启发式规则(如均匀分段),可能不适用于所有物理场景或时间尺度。
- 训练和评估限于48帧、384×384分辨率的视频片段,对更长时序或更高分辨率场景的扩展性未经验证。
- 子组分析的增益可能受限于特定子组的样本量,部分提升的统计显著性需要进一步验证。
关联工作
- V-JEPA/V-JEPA 2:作为被增强的基线冻结隐空间预测模型,HERA在其基础上构建记忆增强层。
- IntPhys2:用于诊断物理记忆的违反预期基准,提供了严格的成对评估协议。
- Vision Transformers Need Registers:启发了寄存器令牌的使用,但HERA将其分离为记忆和计算两种角色,这是本文的核心创新。
- Object-Centric Learning(Slot Attention, SAVi++):提供了显式物体状态抽象,但依赖稳定的物体分解,HERA避免了这一要求。
- Long-Horizon Memory for Video(Memorizing Transformers, Compressive Transformers等):扩展了时序上下文,但未解决选择性证据路由问题,HERA的结构化检索填补了这一空白。