快速导读:提出PhyS三阶段框架,通过构建物理交互数据集PhyS-120K、物理感知微调与蒸馏、以及时序信用路由(TCR)在线强化学习,提升流式世界模型长时推演的物理合理性。
流式世界模型通过因果扩散Transformer逐块预测未来帧,实现连续视频推演,在机器人仿真、自动驾驶和交互式内容生成等领域具有重要应用前景。然而,现有方法在长时自回归推演中频繁违反基本物理约束和因果关系——物体碰撞后不反弹、倾倒后不散落、多米诺骨牌效应无法跨块传播。这些失败源于一个根本性问题:双向教师模型从视觉预训练中获得的物理先验本就有限,而双向到因果的蒸馏过程进一步损失了这些先验。
PhyS框架针对这一核心矛盾,提出三阶段解决方案:首先在专门构建的物理交互数据集PhyS-120K上对双向14B DiT进行物理感知监督微调,将物理先验注入教师模型;然后通过分布匹配蒸馏将物理感知教师压缩为轻量级1.3B因果生成器;最后通过时序信用路由进行在线策略优化,利用重叠窗口的物理奖励信号对齐因果生成器的去噪行为。实验表明,PhyS在四个物理感知基准上一致提升各类流式生成方法的物理合理性,并在15秒和20秒长时推演中展现出显著的因果一致性优势。
英文题目:Distilling Physical Priors into Streaming World Models
论文出处:arXiv 每日论文精选 · arXiv:2608.07981
原始论文:PDF / 论文页面
这篇论文解决什么问题?
流式世界模型的核心挑战在于因果生成范式与物理一致性之间的张力。主流方法如Self Forcing、Rolling Forcing和Causal Forcing,均采用双向到因果蒸馏策略:先训练一个双向DiT教师模型,再将其蒸馏为仅依赖过去帧预测未来的因果学生模型。这种范式转换虽然实现了流式推理,却引入了严重的物理退化——教师模型本身对物理交互的理解就有限,蒸馏过程又进一步削弱了因果推理能力。
具体而言,双向教师模型在预训练阶段主要学习视觉统计规律,而非物理因果结构。当物体碰撞、流体扩散或刚体倾倒时,模型倾向于生成视觉上合理但物理上错误的运动模式。例如,一个球撞击积木塔后,塔可能纹丝不动;或者多米诺骨牌倒下时,后续骨牌的运动与初始碰撞无关。这些失败在短时生成中尚不明显,但随着推演时间延长,误差累积导致物理一致性急剧下降。
现有改进尝试主要集中在蒸馏策略优化上,如改进训练-测试一致性或引入实时推理机制,但都未触及根本问题:教师模型缺乏足够的物理先验。PhyS-120K数据集的构建正是为了填补这一空白——通过收集12万真实世界物理交互视频,并标注结构化物理属性(如材质、质量、弹性)和因果事件序列,为教师模型提供显式的物理知识来源。
此外,蒸馏后的因果生成器在在线推演中面临时序信用分配问题:当模型生成多个连续帧后,如何判断哪些去噪步骤对最终的物理合理性贡献更大?传统方法如Flow-GRPO采用全局奖励信号,无法区分不同时间窗口的物理质量差异。PhyS提出的时序信用路由通过重叠窗口评估局部物理一致性,将窗口级优势路由至对应的去噪动作,实现了更精细的策略优化。
核心创新
- 构建PhyS-120K数据集,包含12万真实世界物理交互视频及结构化物理属性与因果状态转移标注。
- 提出三阶段框架PhyS,将物理先验从双向教师模型注入并蒸馏至轻量级因果学生模型。
- 提出时序信用路由(TCR),通过重叠时间窗口评估物理一致性,并将窗口级优势路由至对应的去噪动作,解决时序信用分配问题。
方法概览
PhyS包含三个阶段:1) 在PhyS-120K数据集上对双向14B DiT进行物理感知监督微调(SFT),注入物理先验;2) 使用DMD将物理感知教师模型蒸馏为轻量级1.3B因果DiT,支持少步流式生成;3) 通过时序信用路由(TCR)进行在线策略优化,利用重叠窗口的物理奖励信号对齐因果生成器的去噪行为。
- 阶段一:物理感知监督微调。在PhyS-120K数据集上对Wan2.1-14B双向DiT进行SFT,注入物理先验。数据集包含12万视频片段,覆盖碰撞、倾倒、流体、布料、多米诺等物理过程类别,每个片段配有Qwen3-VL生成的结构化物理属性(如物体材质、形状、质量关系)和因果事件序列(如“球撞击积木→积木塔倾倒→积木散落”)。微调后的教师模型在PhysicsIQ基准上提升18.2%,验证了物理先验注入的有效性。
- 阶段二:物理感知蒸馏。使用DMD将物理感知的14B教师模型蒸馏为1.3B因果DiT学生模型,支持少步(4-8步)自回归流式生成。蒸馏过程保持教师模型的物理知识,同时适应因果生成范式。实验表明,蒸馏后的因果模型在各类forcing基线(Self Forcing、Rolling Forcing、Causal Forcing)上均显著优于未使用物理先验的版本。
- 阶段三:时序信用路由在线策略优化。针对因果生成器的在线推演,提出TCR机制。具体而言,将生成的视频序列划分为重叠时间窗口,在每个窗口内使用V-JEPA2和RAFT组合奖励模型评估物理一致性(语义合理性与运动合理性),计算窗口级组相对优势,然后将优势路由至对应窗口内的去噪动作。这种局部信用分配策略避免了全局奖励的粒度粗糙问题。
- 奖励模型设计。V-JEPA2提供语义层面的物理合理性评估,RAFT提供光流层面的运动合理性评估。消融实验表明,两者具有互补性:单独使用RAFT提升运动动态性但可能牺牲语义一致性,单独使用V-JEPA2提升语义合理性但运动可能不够自然,组合使用达到最佳平衡。
- TCR与Flow-GRPO的对比。Flow-GRPO使用全局奖励信号优化整个生成序列,无法区分不同时间窗口的贡献差异。TCR通过重叠窗口机制,使每个去噪步骤仅对其影响范围内的物理质量负责,在PhysicsIQ上相对Flow-GRPO提升14.8%,在VideoPhy2 Joint上提升39.4%。
- 路由策略消融。实验比较了全局路由、均匀窗口路由和TCR Full三种策略。全局路由将同一优势分配给所有去噪步骤,导致部分指标下降;均匀窗口路由部分恢复性能;TCR Full通过重叠窗口和自适应优势分配,在所有五个评估指标上达到最优。
- 数据集构建流程。PhyS-120K从YouTube、Pexels和WISA收集原始视频,经过物理过程分类、类别重平衡(限制最大类别占比)、时长筛选(3-10秒为主)和质量过滤。标注由Qwen3-VL自动生成,经随机人工抽检确保质量。数据集覆盖碰撞、倾倒、滚动、滑动、流体、布料、多米诺、抛射等物理过程类别。
- 模型架构与训练细节。教师模型基于Wan2.1-14B DiT架构,学生模型为1.3B因果DiT。SFT阶段使用标准视频生成损失,DMD蒸馏阶段使用分布匹配目标,TCR阶段使用PPO风格的策略优化,优势函数基于窗口级奖励的组标准化。
逐图理解论文
失败案例与直觉

图6展示长时因果推演的视觉对比。六行分别对应碰撞、压缩、倾倒、布料扭曲、多米诺冲击和雾扩散场景,每行从左到右展示推演进程。基线方法在推演后期频繁违反物理约束(如碰撞不传播、倾倒不散落),而PhyS更好地保持了物理合理性和因果一致性。
核心矛盾与研究空白

图4展示PhyS三阶段框架总览。阶段一在PhyS-120K上对双向教师进行物理感知SFT;阶段二通过DMD将物理感知教师蒸馏为少步因果生成器;阶段三通过TCR在重叠窗口上计算优势Ai,j并路由至去噪动作。框架图清晰展示了物理先验从教师到学生的传递路径和在线优化机制。
PhyS三阶段解决方案

图2展示PhyS-120K数据集的构建流程和统计分布。子图(a)显示从YouTube、Pexels和WISA收集原始视频,经过过滤、分类和重平衡的完整流程;子图(b)展示物理过程类别和场景的分布;子图(c)显示视频时长分布,以3-10秒为主;子图(d)说明结构化物理属性和因果事件序列由Qwen3-VL生成并经人工抽检。
实验验证与核心发现

实验在四个物理感知基准上全面验证了PhyS的有效性。物理感知教师模型在PhysicsIQ上准确率大幅提升,验证了数据集的价值。更重要的是,蒸馏后的因果生成器在Self Forcing、Rolling Forcing和Causal Forcing三种范式上均显著优于基线,其中Causal Forcing受益最大。长时推演评估显示,PhyS的优势随推演时间延长而扩大——在20秒推演中,物理一致性提升幅度超过15秒推演,表明物理先验有效抑制了长时累积误差。视觉对比更直观地展示了PhyS在碰撞传播、倾倒后果、多米诺冲击等场景中保持了因果一致性,而基线方法频繁违反物理约束。
实验如何设计?
- 评估基准:PhysicsIQ(物理常识推理)、VideoPhy和VideoPhy2(物理合理性评估)、PhyGenBench(物理感知生成质量),覆盖碰撞、倾倒、流体、光学、材料等物理类别。
- 短时评估:5秒双向生成(教师模型评估)和10秒因果推演(学生模型评估),使用Self Forcing、Rolling Forcing和Causal Forcing三种因果生成范式。
- 长时评估:15秒和20秒自回归推演,在VBench-Long(时序质量、动态程度、视觉稳定性)和VideoPhy(物理一致性)上评估,仅测试Self Forcing和Rolling Forcing。
- 消融实验:数据集与标注类型消融(仅视频vs.视频+物理属性vs.视频+因果序列)、奖励模型选择消融(RAFT vs. V-JEPA2 vs. 组合)、路由策略消融(全局vs.均匀窗口vs. TCR Full)。
- 基线方法:Self Forcing(缩小训练-测试差距的因果蒸馏)、Rolling Forcing(实时自回归长视频扩散)、Causal Forcing(高质量实时交互视频生成)、Flow-GRPO(在线强化学习基线)。
- 评估指标:PhysicsIQ准确率、VideoPhy物理一致性分数、VideoPhy2 Joint分数、VBench-Long时序质量/动态程度/视觉稳定性、PhyGenBench类别分数。
关键结果与论文证据
- 物理先验注入显著提升教师模型:在PhysicsIQ上,Wan2.1-14B教师模型经PhyS-120K SFT后提升18.2%(26.9→31.8),验证了数据集的有效性(Table 1, p.6)。
- 物理感知蒸馏全面提升因果生成器:Self Forcing提升23.7%(16.9→20.9),Rolling Forcing提升14.8%(16.2→18.6),Causal Forcing提升31.4%(10.2→13.4),表明物理先验可有效传递至因果范式(Table 1, p.6)。
- VideoPhy2 Joint评估显示一致提升:Self Forcing提升2.5分(24.4→26.9),Rolling Forcing提升1.7分(23.0→24.7),Causal Forcing提升4.6分(19.8→24.4),Causal Forcing受益最大(Table 1, p.6)。
- 长时推演优势随推演长度增加而扩大:15秒推演中,Self Forcing动态程度提升6.88(46.37→53.25),VideoPhy PC提升2.0(18.4→20.4);20秒推演中,Self Forcing VideoPhy PC提升3.1(16.6→19.7),Rolling Forcing提升4.2(21.7→25.9),表明物理先验对长时累积误差的抑制作用(Table 2, p.6)。
- TCR显著优于Flow-GRPO:在PhysicsIQ上,Self Forcing + TCR相对Flow-GRPO提升14.8%(18.2→20.9);在VideoPhy2 Joint上提升39.4%(19.3→26.9),验证了时序信用分配的重要性(Table 1, p.6)。
- 视觉对比验证物理一致性:长时因果推演可视化显示,基线方法在碰撞传播、压缩响应、倾倒后果、布料扭曲、多米诺冲击和雾扩散等场景中频繁违反物理约束,而PhyS更好地保持了即时物理响应和下游状态转移(Figure 6, p.6-7)。
- 数据集标注类型消融:同时使用物理属性和因果序列标注的效果优于仅使用视频或仅使用物理属性,表明结构化物理知识对模型训练具有叠加价值(Table 3, p.7)。
- 奖励模型互补性:RAFT和V-JEPA2组合使用在所有指标上优于单独使用任一奖励模型,验证了运动合理性与语义合理性评估的互补性(Table 4, p.7)。
阅读时需要注意
- PhyGenBench上Optics和Material类别存在性能退化,可能由于PhyS-120K中相关物理过程(如折射、反射、材料变形)覆盖不足,数据集偏向刚体碰撞和宏观运动场景。
- 因果蒸馏过程仍会导致部分物理先验损失,部分指标在蒸馏后出现退化,表明双向到因果的范式转换本身存在信息损失,当前蒸馏方法未能完全保留教师模型的物理知识。
- TCR的性能增益依赖于V-JEPA2和RAFT组合奖励信号的质量,若奖励模型在某些物理场景下评估不准确,可能导致策略优化方向偏差。
- 长时推演评估仅在Self Forcing和Rolling Forcing上进行,未涵盖Causal Forcing,限制了结论的普适性。
- PhyS-120K数据集依赖Qwen3-VL自动标注,虽然经过人工抽检,但标注质量仍可能受VLM能力限制,特别是在复杂物理交互场景下。
关联工作
- Self Forcing、Rolling Forcing和Causal Forcing是当前流式世界模型的主流因果蒸馏范式,PhyS在这三种范式上均进行了验证,表明物理先验注入方法具有范式无关的通用性。
- DMD作为双向到因果蒸馏的基础方法,在PhyS框架中承担物理感知教师到因果学生的知识传递任务,其蒸馏效率和质量直接影响最终性能。
- Flow-GRPO是视频生成领域新兴的在线强化学习方法,PhyS通过TCR机制在信用分配粒度上对其进行了改进,为视频生成中的策略优化提供了新思路。
- V-JEPA2和RAFT作为物理一致性评估工具,在PhyS中组合使用,其与人类偏好的对齐程度直接影响TCR的优化效果。