世界模型会运动,却不懂动力学?iKCE诊断长视界失效

三分钟导读:我们在 DMC walker-walk 任务上评估 DreamerV3 预训练检查点。计算真实物理 rollout 与 WM 想象 rollout 在 T=16 和 T=64 视界下的 iKCE。同时,我们进行摩擦系数扫描(µ ∈ [0.1, 1.7]),跨越策略奖励崩溃的经验体制边界(µ=0.20),并设置关节噪声扫描作为运动学敏感性的阳性对照。

英文题目:Imagined Rollouts Are Kinematic, Not Dynamic: A Diagnosis of Long-Horizon World-Model Failure

论文出处:arXiv 每日论文精选 · arXiv:2607.05966

原始论文:PDF / 论文页面

对应视频标题:世界模型会运动,却不懂动力学?iKCE诊断长视界失效|推荐指数:★★★★

这篇论文解决什么问题?

长视界世界模型预测失效常被归因于误差累积,但这掩盖了核心问题:模型是否真正理解了动力学?现有研究多关注表征工程或误差界,却未诊断潜在表征是否包含动态特征。我们观察到,模型可能仅在进行“运动学回退”,即外推位置速度而忽略物理约束。

核心创新

方法概览

我们在 DMC walker-walk 任务上评估 DreamerV3 预训练检查点。计算真实物理 rollout 与 WM 想象 rollout 在 T=16 和 T=64 视界下的 iKCE。同时,我们进行摩擦系数扫描(µ ∈ [0.1, 1.7]),跨越策略奖励崩溃的经验体制边界(µ=0.20),并设置关节噪声扫描作为运动学敏感性的阳性对照。

逐图理解论文

实验设置:DMC Walker 任务

实验设置:DMC Walker 任务
Fig. 1. Empirical regime boundary. Mean episodic reward of the trained DreamerV3 walker policy across friction (K=10, 95% bootstrap CI). The regime boundary at µ=0.20 (red dashed) is the friction at which mean reward first drops below 50% of the µ=1.0 baseline (dotted). This boundary anchors the dashed reference line in Fig. 2.

我们在 DMC walker-walk 任务上评估 DreamerV3 预训练检查点。计算真实物理 rollout 与 WM 想象 rollout 在 T=16 和 T=64 视界下的 iKCE。同时,我们进行摩擦系数扫描(µ ∈ [0.1, 1.7]),跨越策略奖励崩溃的经验体制边界(µ=0.20),并设置关节噪声扫描作为运动学敏感性的阳性对照。

核心发现:对摩擦的无感性

核心发现:对摩擦的无感性
Fig. 2. iKCE diverges in physics, stays flat in imagination. Identity kinematic view (z, vz) at horizon T = 64. Left: friction sweep µ ∈[0.1, 1.7] (physical regime axis). Real-physics rollouts under the trained policy (blue) show modestly elevated iKCE in the low-µ region near the empirical regime boundary (µ=0.20, dashed line (see Fig. 1)). WM-imagined rollouts (red) are statistically flat across the entire 17× sweep. Right: joint-noise sweep σ ∈[0, 0.3] rad (kinematic control axis). Both channels respond similarly, confirming that the WM is not insensitive to all perturbations, only to dynamic ones. Shaded bands: 95% bootstrap CI from K = 20 rollouts per cell.

关键发现在于动态无感性。在摩擦扫描中,物理 iKCE 斜率严格为负(β = -0.220),反映接触事件随摩擦变化。然而,WM iKCE 斜率统计上平坦(β = -0.009),置信区间包含零。尽管策略奖励在同一摩擦范围内从 650 骤降至 200,WM 的想象轨迹却几乎不受影响,证实了其缺乏动态理解。

消融实验:排除训练偏差

消融实验:排除训练偏差
Fig. 4. Actor-training-horizon ablation. Identity view (z, vz) at T=64, with the actor retrained at imag horizon = 64 (matching the measurement horizon). WM iKCE friction spread is identical to the default-actor headline (1.32× in both cases), confirming the friction-insensitivity of imagined rollouts is not an artifact of the default actor’s h=15 training horizon. Shaded bands: 95% bootstrap CI from K = 20 rollouts per cell.

我们进行了多项消融以排除混淆因素。首先,将 Actor 训练视界从 h=15 增加到 h=64,WM iKCE 摩擦展宽仍为 1.32 倍,证实无感性非 Actor 视界不匹配所致。其次,使用域随机化(DR)训练 WM,其在整个摩擦范围上训练,但 iKCE 斜率仍平坦(β = -0.026),证明这种不变性不是训练分布偏差的结果,而是模型结构的固有缺陷。

时序结构分析

时序结构分析
Fig. 6. Per-step iKCE structure. Log-y. Physics (left) has discrete contact-event spikes whose positions shift with µ. WM (right) shows a one- to two-step encoder-decoder transient followed by a smooth tail. The per-step structure is essentially constant across friction.

分析每步 iKCE 结构,物理侧呈现离散的接触事件尖峰,且位置随摩擦移动。相比之下,WM 侧仅显示一到两步的编码器-解码器瞬态,随后是平滑尾部,且该结构在不同摩擦下基本恒定。这进一步表明 WM 未能捕捉到由动态接触引起的时序变化,仅维持了平滑的运动学外推。

实验与关键结果

  • 我们在 DMC walker-walk 任务上评估 DreamerV3 预训练检查点。计算真实物理 rollout 与 WM 想象 rollout 在 T=16 和 T=64 视界下的 iKCE。同时,我们进行摩擦系数扫描(µ ∈ [0.1, 1.7]),跨越策略奖励崩溃的经验体制边界(µ=0.20),并设置关节噪声扫描作为运动学敏感性的阳性对照。
  • 结果显示,WM 的 iKCE 显著高于真实物理。在 T=16 时,WM iKCE 约为物理的 180 倍(7.7e-3 vs 4.2e-5);在 T=64 时,约为 30 倍(2.6e-3 vs 8.6e-5)。这表明想象轨迹在运动学一致性上存在巨大偏差,且随着视界延长,这种偏差虽相对收敛但绝对值仍高。
  • 我们进行了多项消融以排除混淆因素。首先,将 Actor 训练视界从 h=15 增加到 h=64,WM iKCE 摩擦展宽仍为 1.32 倍,证实无感性非 Actor 视界不匹配所致。其次,使用域随机化(DR)训练 WM,其在整个摩擦范围上训练,但 iKCE 斜率仍平坦(β = -0.026),证明这种不变性不是训练分布偏差的结果,而是模型结构的固有缺陷。
  • 我们在 DMC walker-walk 任务上评估 DreamerV3 预训练检查点。计算真实物理 rollout 与 WM 想象 rollout 在 T=16 和 T=64 视界下的 iKCE。同时,我们进行摩擦系数扫描(µ ∈ [0.1, 1.7]),跨越策略奖励崩溃的经验体制边界(µ=0.20),并设置关节噪声扫描作为运动学敏感性的阳性对照。
  • 结果显示,WM 的 iKCE 显著高于真实物理。在 T=16 时,WM iKCE 约为物理的 180 倍(7.7e-3 vs 4.2e-5);在 T=64 时,约为 30 倍(2.6e-3 vs 8.6e-5)。这表明想象轨迹在运动学一致性上存在巨大偏差,且随着视界延长,这种偏差虽相对收敛但绝对值仍高。
  • 我们进行了多项消融以排除混淆因素。首先,将 Actor 训练视界从 h=15 增加到 h=64,WM iKCE 摩擦展宽仍为 1.32 倍,证实无感性非 Actor 视界不匹配所致。其次,使用域随机化(DR)训练 WM,其在整个摩擦范围上训练,但 iKCE 斜率仍平坦(β = -0.026),证明这种不变性不是训练分布偏差的结果,而是模型结构的固有缺陷。

阅读时需要注意

  • 需注意,低 iKCE 并不保证动态想象,平凡的运动学预测器 iKCE 为零。高 iKCE 且对摩擦敏感仅证实动态结构存在,不保证预测准确性。此外,结果基于单一具身(DMC walker)和单一 WM 家族(DreamerV3)。长视界 iKCE 降低可能反映运动幅度减小而非更清洁的运动学想象,且因果链接尚未完全证明。
  • Low iKCE does not certify dynamic imagination; a trivial kinematic predictor has zero iKCE.
  • High iKCE with friction sensitivity certifies dynamic structure but not predictive accuracy.
  • The diagnostic is structural, not predictive; it identifies the type of error, not the quality of the policy.
  • The 'kinematic fallback' hypothesis predicts unstable long-horizon actor training, but causal link is not proven.

关联工作

  • 长视界世界模型预测失效常被归因于误差累积,但这掩盖了核心问题:模型是否真正理解了动力学?现有研究多关注表征工程或误差界,却未诊断潜在表征是否包含动态特征。我们观察到,模型可能仅在进行“运动学回退”,即外推位置速度而忽略物理约束。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

想象轨迹是运动学的,而非动力学的: 对长视界世界模型失败的一种诊断

Finn Rasmus Schäfer1, Korbinian Moller1, Yuan Gao1, Christian Oefinger1, Sebastian Schmidt2 和 Johannes Betz1 1 自主车辆系统实验室 德国慕尼黑加兴 慕尼黑工业大学 电子邮件:finn.schaefer@tum.de 2 数据分析与机器学习小组 德国慕尼黑加兴 慕尼黑工业大学

摘要——世界模型的长视界失败通常归因于误差累积(compounding error),这是一种通用的框架,未能区分何种类型的误差在累积。我们提出了一种运动学 vs 动力学(Kinematic vs Dynamic)的重构视角:世界模型倾向于想象运动学而非动力学过程:它们外推位置-速度-加速度轨迹,这些轨迹与线性运动学更新规则内部一致,但与产生真实运动的物理约束不一致。我们将此操作化为想象运动学一致性误差(iKCE),这是一种逐步诊断指标,用于衡量轨迹偏离封闭形式运动学基准的程度,并配合一种扰动协议,以测试当物理条件跨越体制边界(Regime Boundary)时 iKCE 是否发生响应。我们在基于 DMC walker-walk 训练的已发布 DreamerV3 检查点上实例化了该诊断,其中想象的 iKCE 比匹配的真实物理轨迹高出约两个数量级。在跨越步态崩溃边界的摩擦扫描中,即使训练策略的奖励在同一范围内崩溃,模型的 iKCE 仍保持统计上的平坦,从而提供了“非动力学”的运动学特征。该诊断在长于本体步态周期的视界上区分了运动学与动力学想象。

核心主张 当前的世界模型想象的是运动学而非动力学过程:它们外推位置-速度-加速度轨迹,这些轨迹与线性运动学更新规则内部一致,但与产生真实运动的物理约束不一致。

2026年7月 运动学回退是长视界世界模型失败的第三种结构上不同的解释,与文献中占主导地位的两个观点并列:可预测表示工程(Dreamer 路线 [5])和误差累积界限(MBPO [8])。可预测表示工程将长视界可靠性归因于稳定、可预测的潜在表示,并通过归一化和平衡技术追求这一目标;一种具有固定超参数的单一算法在 150 多个任务上的实证验证了该观点,但它对这些表示应包含的内容保持沉默。误差累积界限推导了在策略分布偏移下,基于模型的回报与真实回报之间显式的视界二次方界限,并通过将模型信任限制为从真实状态出发的短分支轨迹来务实应对。一个潜在空间包含丰富运动学特征但无动力学特征的世界模型同时满足两者:对于 Dreamer 路线的可预测性足够稳定,对于 Janner 路线的短轨迹界限足够准确,但在条件将其轨迹推向物理体制边界之外时,仍倾向于运动学延续。因此,这三种解释并非互斥,而是同一失败曲面的不同层次;由于它们预测了不同的经验特征,第 III 节中的协议可以专门针对运动学回退层。

我们做出了三项贡献。我们 (i) 以运动学 vs 动力学的术语重构长视界世界模型失败,将结构内容层与先前研究中研究的方差工程和误差累积层区分开来;(ii) 引入想象运动学一致性误差(iKCE)以及条件扰动协议,将该解释操作化为可证伪的评估诊断;(iii) 在开源检查点(DMC walker-walk 上的 DreamerV3)上实例化了该诊断,其中

I. 引言

世界模型已成为近期具身人工智能的承重组件,作为规划 [3, 4, 5] 的潜在模拟器以及自监督学习 [6, 7] 的生成环境。一种广泛注意到的失效模式是想象轨迹随长视界的恶化,传统上归因于误差累积 [8]。这种框架是准确的但不够具体:它没有区分何种类型的误差在累积,或哪些特征维度发生恶化。最近对驾驶 VLM/VLA 和轨迹预测基准的四个观察表明,这种恶化具有特定的结构特征,而误差累积框架掩盖了这一点。

我们采用经典力学中运动学与动力学运动的区别。我们将运动学定义为纯粹通过位置、速度和加速度时间序列描述的运动,而不涉及产生它的力或物理约束。我们将动力学定义为需要正确复现这些约束(例如质量、摩擦、接触)的运动。

第 2 页

它表现出想象运动学的两个预测特征,且控制变量排除了主要混淆因素。规划器在该基准测试上并未比运动学外推法有实质性的提升。这两个特征是:在 T=16 时,运动学零残差高出匹配物理模型约 180 倍;以及想象轨迹在跨越经验步态崩溃边界的摩擦扫描中表现出统计不变性。诊断性特征在于这种体制不变性,而非绝对 iKCE 的大小:一个平凡的运动学预测器会产生零 iKCE。

II. 证据

我们的诊断基于四个现有的观察结果,每个观察结果单独来看都不具决定性,且仅由其原作者孤立解释,但共同构成了一个连贯的结构化特征。

(i) 驾驶视觉语言模型 (VLMs) 和视觉语言动作模型 (VLAs) 的表征诊断。Schäfer 等人 [11] 提出了 EgoDyn-Bench,这是一种视频问答诊断工具,它将物理推理与视觉感知解耦。(i) 加权物理一致性率 (WPCR) 在单帧静态图像下即达到饱和:从无视觉输入时的约 20% 上升到有一帧时的约 97%,并在增加额外帧或进行时间打乱时保持基本平坦。(ii) 在纯文本基线中重新引入视频,在最佳编码下仅使平衡准确率恢复约 2.6 个百分点,而纯文本输入已达到 59.6% 的平衡准确率。作者将此特征化为“视觉与语言之间的功能解耦”:自我运动理解几乎完全源自语言模态,视觉观察仅作为静态上下文贡献,而非时间证据。依赖此类编码器进行运动条件特征外推的想象轨迹,是从对所需正确想象的时间动态编码不足的表征中进行外推的。

(ii) 传感器退化行为诊断。Priyadershi 和 Funj 等人 [10] 在 1,996 个场景下,针对八种传感器扰动对 100 亿参数的驾驶 VLA Alpamayo R1 进行了压力测试。在重度高斯噪声 ($\sigma = 70$) 下,作者将故障模式描述为轨迹解码器“通过崩溃运动学先验而失败,而语言分支继续产生连贯但与安全无关的解释”。独立观察。这是对同一运动学回退故障模式的独立观察,发生在第三方 VLA 中,且是在自然传感器退化而非受控诊断刺激下进行的。

(iii) 开环轨迹预测基线。Zhai 等人 [13] 训练了一个 3 层 MLP,仅消耗自车运动学状态,并在 nuScenes 开环 L2 任务中匹配基于感知的端到端规划器(VAD-Base 为 0.29 米 vs. 0.37 米),无需摄像头、激光雷达或高精地图输入。作者将此解读为基准测试的人工产物,将其归因于 nuScenes 的轨迹分布和粗糙的碰撞评估网格,并呼吁重新思考开环评估方案。我们接受这一实证发现,但对其意义的解读不同。第三次独立签名。我们将相同的结果解读为运动学想象的第三个独立签名:当仅依赖自车状态的预测器在主导的开环指标上达到饱和时,基于感知的规划器并未表现出显著优于运动学外推的能力。

(iv) 在微调 VLAs 上的物理一致性评分。Gao 等人 [2] 引入了运动学一致性误差 (KCE),通过检查每个预测的下一位置是否与当前状态的闭式运动学外推一致来对轨迹进行评分,并将其作为微调 4B VLA 的训练损失。在其风格条件基准测试上,KCE 与模型规模或模态之间没有单调关系:最强的通用模型 (Gemini-3-Pro, 0.06–0.11 米) 和较小的微调模型 (0.08–0.12 米) 相互重叠,没有按参数量或传感器丰富度排序。这是一个数据/训练缺陷,而非能力缺陷。这种对模型规模和模态不变的缺陷不太可能反映能力限制。它指向的是训练信号和数据分布,而非模型大小。

结论。这四个观察结果集中在驾驶和 VLA 设置中,但采用了异构的方法论寄存器,从表征探测到行为扰动再到物理一致性评分,并收敛于单一的结构化缺陷:学习到的表征以运动学特征为主导,而用于物理体制条件行为的动力学特征被系统性低估。

III. 诊断协议

A. iKCE:想象运动学一致性误差

对世界模型的启示是结构性的。

定义(想象运动学一致性误差)。对于由世界模型产生的想象轨迹 $\{\hat{x}_{WM}^t\}_{t=0}^T$,其中 $\hat{x}_t$ 为选定的运动学状态向量(例如 $[x, y, v, a, \theta]^\top$),想象运动学一致性误差定义为:

$$ iKCE := \frac{1}{T} \sum_{t=0}^{T-1} \| \hat{x}_{WM}^{t+1} – \text{kin}(\hat{x}_{WM}^t) \|_2^2, \quad (1) $$

其中 $\text{kin}(\cdot)$ 是任何闭式运动学预测器(例如,恒定速度或恒定加速度),其选择需匹配世界模型的基础实体和输出空间。

公式 1 遵循 Gao 等人 [2] 中运动学一致性损失的数学形式,该损失在训练时对微调的 VLA 进行监督。我们将其重新用作测试时诊断工具(前缀“i”表示想象),用于测量运动学不一致性而非减少它。我们将其重新用作评估诊断工具:在测试时应用于想象轨迹,iKCE 衡量每个预测的下一状态与其前驱状态的运动学外推之间的偏离程度。

反直觉的是,低 iKCE 并不表示动力学想象:一个接近零 iKCE 的世界模型,根据构造,预测的下一状态与其前驱状态的运动学延续重合:它以运动学方式想象。动力学想象的签名恰恰相反:iKCE 为正,随视界增长,并对物理体制条件(摩擦瞬变、接触事件、体制边界穿越)敏感。因此,iKCE 是认证动力学想象的必要条件,但非充分条件。

第 3 页

表 I B. 条件扰动下的 iKCE 静态 iKCE 衡量单次 rollout 内部运动学自洽性。为了将其转化为区分运动学与动力学想象的诊断工具,我们通过在条件状态上施加剂量-响应曲线来驱动 iKCE。对于每个基础 rollout,世界模型在受控的物理意义条件参数(初始速度 $v_0$、摩擦系数 $\mu$、或用于驱动、地形顺应性或足式 locomotion 的载荷的横向加速度限制 $a_{lat,max}$)的扰动下生成 $K$ 次想象 rollout,这类似于其他形态中基于物理的参数。扰动集是特定于形态的,但协议并非如此。 由此产生的 $\{iKCE_k\}_{k=1}^K$ 集合中出现了两种诊断特征。首先,$iKCE(\|\Delta\|)$ 随扰动幅度变化的形状:运动学想象器产生的曲线随 $\|\Delta\|$ 平滑缩放,无论物理体制如何,因为它在任何情况下都外推相同的线性更新结构。iKCE 衡量的是每步运动学零偏差。相对于每步时间尺度而言效应缓慢的物理体制扰动(例如足式 locomotion 中随多次着地累积的摩擦驱动滑移)在短于其特征累积时间的视界下是不可见的。诊断协议应在长于形态步态周期的视界下应用:$\sim 25 \text{ ms} \times 64 \text{ steps} \approx 1.6 \text{ s}$ 对于步行类 locomotion 已足够。驾驶轨迹通常在更长的视界上规划。其次,rollout 对单调一致性:物理规律预测对特定扰动对的单调响应(更高的初始速度意味着制动时更长的停车距离;更重的载荷意味着更慢的加速度),对于每一对,我们检查想象 rollout 是否尊重单调性。运动学世界模型 trivially 尊重线性单调性,但在物理体制条件单调性上失败,后者仅在物理阈值之上或之下成立。 这是与 EgoDyn-Bench 的加权成对一致性率 [11] 最接近的可辩护类比:我们不是在单个观测上检查标记问题对的答案一致性,而是在单个基础场景上检查受控条件扰动下的 rollout 一致性。诊断被重构而非捏造,并为任何状态允许运动学预测器的形态产生可证伪的曲线。

IV. 实验与结果 实验设置记录在附录 A 中。 假设 1 (H1):iKCE 在已发布的检查点上是非退化的。在两个测量视界下,训练好的 DreamerV3 walker-walk 世界模型在相同条件下产生的想象 iKCE 至少比匹配策略驱动的真实物理 rollout 高出一个数量级(见表 I:$T=16$ 时 $\sim 180\times$,$T=64$ 时 $\sim 30\times$)。较长视界下的缩小与每步稀释一致,因为世界模型的平滑长视界尾部平均降低了集成指标。因此 iKCE 在两个视界下均是非退化的(见附录 A4 中用于解析下界的 trivial-WM 尺度)。世界模型的想象相对于任何恒定速度零假设都存在显著的残差,且 $H_1$ 是幅度分离的下界。

假设 2 (H2):世界模型想象在跨越体制边界时具有摩擦不变性。我们在 $[0.1, 1.7]$ 范围内跨越 13 个数量级扫描表面摩擦,涵盖 $\mu=0.20$ 处的体制边界,在此处训练好的步态首次降至基础回合奖励的 50% 以下(经验确定,见图 1)。对于每个 $\mu$,我们计算 (a) 在训练好的演员下的真实物理 rollout 和 (b) 以最初 5 个扰动观测为条件的世界模型想象 rollout 的 iKCE。 在 $T=64$ 时,扫描范围内的世界模型 iKCE 在统计上是平坦的($\Delta a, \Delta b$ 最大/最小散布 1.32 倍,95% 置信区间在每个 $\mu$ 处重叠,见图 2)。对同一扫描的对数-对数回归使这一假设可证伪(附录 A):世界模型斜率的 95% 自助置信区间 $(\beta_{WM} = -0.009, [-0.096, +0.082])$ 包含零,而物理斜率 $(\beta_{phys} = -0.220, [-0.301, -0.142])$ 则不包含。相比之下,训练好的策略奖励在同一范围内崩溃(从 $\mu=0.5$ 时的 $\sim 650$ 降至 $\mu=0.10$ 时的 $\sim 200$),这是真实的行为体制变化,而世界模型的想象对此视而不见。在训练好的演员下,真实物理 iKCE 表现出比世界模型更多的单元格间变异性,在低 $\mu$ 区域数值升高($\mu \in [0.1, 0.3]$ 时均值 $1.04-1.30 \times 10^{-4}$,而 $\mu \in [0.5, 1.7]$ 时为 $0.70–0.92 \times 10^{-4}$)。 这证实了 iKCE 指标并非退化,而世界模型对相同扰动的不变性提供了运动学而非动力学特征。附录控制加强了这种结构差异:每步分解(图 6)显示物理和世界模型残差在时间结构上定性不同,而不仅仅是在幅度上,并且相同的 H2 特征在更丰富的运动学切片中再次出现(图 8)。在较短的 $T=16$ 视界下,双方均未表现出摩擦敏感性。动力学特征仅在较长视界下滑移累积为每步偏差时出现(量化于附录图 3)。支持 H2 的控制措施在附录中详细报告:演员消融下的每步结构(图 7)、对运动学状态选择的鲁棒性(图 8)以及联合噪声正控制(图 2,右面板)。

第 4 页

预先排除了一个自然的反事实假设,即扩展智能体的 想象视界本可以缩小这一差距。 (0–1000) 600 当前测量的局限性。结果受到若干局限性的约束。(i) 实证结果基于 单一实体(DMC walker-walk,一个受限在 (z, vz) 子切片的 2D 9自由度系统) reward 400 以及单一的开源权重世界模型(WM)家族。将 H2 的平坦性测试扩展至四足、 人形和驾驶实体,并扩展至其他 WM 200 50% baseline 家族(如 GAIA-1 [7] 或 R2Dreamer [9]),将进一步 0 扩大证据基础。(ii) 物理侧签名中的策略分布外(OOD)混淆受限于 0.2 0.4 0.6 0.8 1 1.2 1.4 域随机化控制(附录 B2):H2 对比在每次扫描的 µ 下, 在策略分布内时依然成立,而原始低 µ 高程的分区仅在点 估计水平上保持。仍有两个残差:DR 策略以闭环方式调整其步态以适应摩擦,因此物理响应并非无策略的;且想象轨迹仅基于五次观测(在一个步态周期内),因此 WM 侧的平坦性仅在前缀所能承载的体制证据范围内具有信息量。(iii) 每步位移随 rollout 视界衰减,因此 WM 的低长期 iKCE 部分反映了运动幅度的减小,而非纯粹更清晰的运动学想象。

Fig. 1. 实证体制边界。训练好的 DreamerV3 walker 策略在不同摩擦系数下的平均回合奖励(K=10,95% 自举置信区间)。体制边界位于 µ=0.20(红色虚线),即平均奖励首次降至 µ=1.0 基线(点线)50% 以下的摩擦系数。该边界锚定了图 2 中的虚线参考线。

确认 WM 对运动学轴扰动有响应。 智能体训练视界消融。智能体训练视界消融(见附录图 4)排除了最令人担忧的混淆因素:在 imag horizon = 64 时重新训练产生了相同的 WM iKCE 摩擦分布(1.32 倍),证实 H2 并非默认智能体 15 步训练视界的伪影。 域随机化控制。域随机化控制(附录 B2,图 5)限制了策略 OOD 混淆:在 µ ~ U(0.1, 1.7) 下训练的策略中,WM 斜率仍包含零(βDRWM = −0.026),而物理斜率仍将其排除(βDRphys = −0.114),因此运动学-非动力学对比在每次扫描的摩擦下,在策略分布内依然成立。

V. 讨论与开放方向

iKCE 是集成在视界上的每步运动学零拟合。它通过缺乏体制敏感性来诊断运动学想象,而非通过动态预测质量的存在来诊断。在我们的协议中,在所有地方都实现低 iKCE 的 WM 被正确识别为运动学的,但未被认证为有用的预测器。具有高 iKCE 且具有摩擦敏感性的 WM 被认证为动力学的,但未被认证为准确的。该诊断在结构上而非预测上,这是由设计决定的。 下游行为预测。如果想象轨迹在运动学上结构化但在动力学上不可靠,那么通过长期想象轨迹传播的策略梯度将使智能体针对一个轨迹分布进行优化,该轨迹分布在 iKCE 本身未捕捉的方向上(如旋转漂移、接触事件时机、累积绝对状态误差)与现实动力学发散。因此,长期智能体训练应该是不稳定的,并产生较弱的部署策略。h=64 的消融与此预测一致:在超参数匹配的情况下,长期智能体收敛至约 400 的回合奖励,而默认 h=15 的检查点约为 955,并且在整个训练过程中表现出不稳定性。我们并未声称存在因果联系。众所周知,长期 Dreamer 训练对多种因素敏感,但这一观察结果正是基于“运动学而非动力学”假设所预测的,且

参考文献 [1] Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu, Andreas Geiger, Jun Zhang, and Hongyang Li. Vista: A generalizable driving world model with high fidelity and versatile controllability, 2024. URL https: //arxiv.org/abs/2405.17398. [2] Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Ras- mus Sch¨afer, Korbinian Moller, Lin Li, and Johannes Betz. StyleVLA: Driving style-aware vision language action model for autonomous driving. arXiv preprint arXiv:2603.09482, 2026. [3] David Ha and J¨urgen Schmidhuber. Recurrent world models facilitate policy evolution. In Advances in Neural Information Processing Systems (NeurIPS), 2018. [4] Danijar Hafner, Timothy Lillicrap, Ian Fischer, Ruben Villegas, David Ha, Honglak Lee, and James Davidson. Learning latent dynamics for planning from pixels. In

第 5 页

摩擦力(物理体制) 关节噪声(运动学控制) 10−2 10−2

10−3 物理 + 策略 10−3 物理 + 策略 世界模型 (想象) 世界模型 (想象) iKCE 体制 µ = 0.20 10−4 10−4

0.2 0.4 0.6 0.8 1 1.2 1.4 1.6 0 5 · 10−2 0.1 0.15 0.2 0.25 0.3 摩擦力乘数 µ 关节噪声 σ (弧度)

图 2. iKCE 在物理环境中发散,在想象中保持平坦。视界 T = 64 时的恒等运动学视图 (z, vz)。左图:摩擦力扫描 µ ∈[0.1, 1.7](物理体制轴)。在训练策略下的真实物理 rollout(蓝色)显示,在接近经验体制边界(µ=0.20,虚线,见图 1)的低 µ 区域,iKCE 适度升高。世界模型 (WM) 想象的 rollout(红色)在整个 17× 扫描范围内统计上保持平坦。右图:关节噪声扫描 σ ∈[0, 0.3] 弧度(运动学控制轴)。两个通道的响应相似,证实了世界模型并非对所有扰动都不敏感,而仅对动态扰动不敏感。阴影带:每个单元格 K = 20 次 rollout 的 95% 自举置信区间 (CI)。

国际机器学习会议 (ICML), 以及 Jingdong Wang。重新思考 nuscenes 中端到端自动驾驶的开环评估,2023。 2019。 URL https://arxiv.org/abs/2305.10430. [5] Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, 和 Timo- thy Lillicrap。通过世界模型掌握多样化领域。Nature, 640:647–653, 2025。 [6] Anthony Hu, Gianluca Corrado, Nicolas Griffiths, Zak Murez, Corina Gurau, Hudson Yeo, Alex Kendall, Roberto Cipolla, 和 Jamie Shotton。基于模型的模仿学习用于城市驾驶。在神经信息处理系统进展 (NeurIPS), 2022。 [7] Anthony Hu, Lloyd Russell, Hudson Yeo, Zak Murez, George Fedoseev, Alex Kendall, Jamie Shotton, 和 Gianluca Corrado。Gaia-1:一种用于自动驾驶的生成式世界模型,2023。URL https://arxiv.org/abs/ 2309.17080。 [8] Michael Janner, Justin Fu, Marvin Zhang, 和 Sergey Levine。何时信任你的模型:基于模型的政策优化。在神经信息处理系统进展 (NeurIPS), 2019。 [9] Naoki Morihira, Amal Nahar, Kartik Bharadwaj, Ya- suhiro Kato, Akinobu Hayashi, 和 Tatsuya Harada。 R2-dreamer:无需解码器或增强的冗余减少世界模型,2026。URL https://arxiv.org/ abs/2603.18202。 [10] Abhinaw Priyadershi 和 Jelena Frtunikj。迷失在雾中:传感器扰动暴露了驾驶 VLAs 的推理脆弱性。arXiv 预印本 arXiv:2605.21446, 2026。 [11] Finn Rasmus Sch¨afer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan G¨unnemann, Mattia Piccinini, Sebastian Schmidt, 和 Johannes Betz。Egodyn-bench:评估以视觉为中心的基础模型在自动驾驶中的自运动理解,2026。URL https://arxiv. org/abs/2604.22851。 [12] Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, 和 Jiwen Lu。Drivedreamer:迈向面向真实世界驱动的自动驾驶世界模型, 2023。URL https://arxiv.org/abs/2309.09777。 [13] Jiang-Tian Zhai, Ze Feng, Jinhao Du, Yongqiang Mao, Jiang-Jiang Liu, Zichang Tan, Yifu Zhang, Xiaoqing Ye,

第 6 页

附录 本附录记录了:(i) 实验配置(表 II),(ii) 核心数据背后的方法学细节(§A1-A4:体制边界确定、平坦性与视界涌现测试,以及平凡世界模型尺度锚点),(iii) 支持假设 H2 的控制实验(§B1-B6:Actor 训练视界消融、域随机化控制、单步结构分解、Actor 消融下的单步结构、对运动学状态选择的鲁棒性,以及关节噪声正控制),以及 (iv) 实现细节(§C1-C2:用于复现测量的代码和数据将在文章被接受后发布)。

表 II 实验设置。视界 $h=16$ 和 $h=64$ 指的是 iKCE 扫描(无需新的轨迹生成,见图 3)。物理侧的动态签名随视界出现:斜率 $\beta_{phys}$ 的幅度从 $T=8$ 时的 $+0.012$(CI $[-0.121, +0.146]$)增长到 $T=64$ 时的 $-0.221$(CI $[-0.301, -0.142]$),在 $T=32$ 和 $T=64$ 之间穿过包含零的置信区间区域——这与摩擦效应在多次着地前积累,随后在单步运动学零残差中变得可检测的现象一致。世界模型(WM)侧的斜率在测试的每个视界下($T=8, 16, 32, 64$ 时分别为 $-0.028, -0.012, -0.013, -0.009$,置信区间宽度均 $\le 0.32$ 且均跨越零)与零在统计上无显著差异。这种对比正是假设 H2 的涌现声明的量化表述:动态签名在物理中随视界涌现,但在世界模型中并未涌现。注意,两个通道中的长视界 iKCE 部分地因单步运动幅度减小而被稀释(§V,局限性 (iii))。当前结果对此具有鲁棒性,因为 WM-物理对比随视界扩大而非缩小,这与视界退化指标产生的效果相反。

| 字段 | 值 | | :— | :— | | 世界模型 | DreamerV3 (NM512 PyTorch 端口,提交 6ef8646) | | 任务 | DMC walker-walk, dmc_proprio 配置 | | 训练 | 1M 环境步数,种子 0,RTX 5090 | | 最终奖励 | $955 \pm 30$(最后 100k 步的平均值) | | 评估策略 | 训练好的 Actor(物理侧和 WM 侧使用相同的检查点) | | K | 每个扰动单元 20 次轨迹生成 | | 运动学规范 | $(z, v_z)$ 垂直根运动 (1D) | | 外推 | 恒定速度 |

A. 方法学细节

1) 体制边界确定:图 2(虚线)和图 1 中引用的 $\mu=0.20$ 边界并非预先选定。它是根据策略的奖励崩溃情况经验确定的。我们在 12 个摩擦乘数 $\mu \in [0.1, 1.5]$ 下的每个点上,对训练好的 Actor 进行 $K=10$ 次轨迹生成,计算平均回合奖励和每个单元 95% 的自举置信区间,并将体制边界定义为平均奖励降至其 $\mu=1.0$ 基线 50% 以下的最大 $\mu$ 值。在此扫描中,$\mu=1.0$ 的平均值约为 650($K=10$ 次轨迹生成),因此阈值为 325 左右。在我们的检查点上,边界位于 $\mu=0.20$。(表 II 中的 $955 \pm 30$ 最终奖励是对最后 100k 训练步的平均值,不可直接比较。)

2) H2 的平坦性测试:我们通过在对 $T=64$ 的摩擦扫描进行回归时,将 $\log(\text{iKCE})$ 对 $\log(\mu)$ 进行回归,使“统计平坦”的声明变得可证伪。每个种子下,13 个 $\mu$ 值中的每一个的 $K=20$ 次轨迹生成中的每一次贡献一个观测值($n=260$)。为了排除种子依赖的人工制品,我们对三个独立训练的 DreamerV3 walker-walk 检查点(种子 $\{0, 1, 2\}$,匹配超参数和步数预算;见附录 A)重复该回归。对每个斜率进行 95% 百分位自举(在轨迹生成层面进行 1000 次重采样)得到:$\beta^{(0)}_{WM} = -0.009$,CI $[-0.096, +0.082]$;$\beta^{(1)}_{WM} = +0.031$,CI $[-0.072, +0.129]$;$\beta^{(2)}_{WM} = +0.038$,CI $[-0.039, +0.123]$。所有三个 WM 斜率的置信区间均包含零,因此 H2 的平坦性声明在跨种子的可证伪统计测试中得以幸存,而不仅仅是在单个种子上。

3) 视界涌现测试:§III-B 论证该诊断应在长于本体运动周期的视界上应用。我们通过重复前一段落的平坦性回归,在四个子视界 $T \in \{8, 16, 32, 64\}$ 上量化这一声明,从现有的 $T=64$ 轨迹生成中重新积分每个轨迹生成的保存的单步 iKCE 轨迹,并在相同的训练策略上评估。物理侧的动态签名随视界出现:斜率 $\beta_{phys}$ 的幅度从 $T=8$ 时的 $+0.012$(CI $[-0.121, +0.146]$)增长到 $T=64$ 时的 $-0.221$(CI $[-0.301, -0.142]$),在 $T=32$ 和 $T=64$ 之间穿过包含零的置信区间区域——这与摩擦效应在多次着地前积累,随后在单步运动学零残差中变得可检测的现象一致。世界模型侧的斜率在测试的每个视界下($T=8, 16, 32, 64$ 时分别为 $-0.028, -0.012, -0.013, -0.009$,置信区间宽度均 $\le 0.32$ 且均跨越零)与零在统计上无显著差异。这种对比正是假设 H2 的涌现声明的量化表述:动态签名在物理中随视界涌现,但在世界模型中并未涌现。注意,两个通道中的长视界 iKCE 部分地因单步运动幅度减小而被稀释(§V,局限性 (iii))。当前结果对此具有鲁棒性,因为 WM-物理对比随视界扩大而非缩小,这与视界退化指标产生的效果相反。

图 3. 视界涌现测试。在四个测量视界 $T \in \{8, 16, 32, 64\}$ 的摩擦扫描中,斜率 $\beta = \partial \log(\text{iKCE}) / \partial \log(\mu)$ 通过重新积分保存的 $T=64$ 单步 iKCE 轨迹(无新轨迹生成)计算得出。物理斜率(蓝色)随 $T$ 增大而幅度增加,并在 $T=64$ 时穿过包含零的置信区间区域。WM 斜率(红色)在每个视界下在统计上与零无显著差异。虚线标记 H2 平坦性目标($\beta = 0$)。阴影带:在轨迹生成层面 1000 次重采样的 95% 百分位自举置信区间。

4) 平凡世界模型尺度锚点:iKCE 尺度具有一个解析下界,该下界锚定了表 I 中的幅度。一个通过应用运动学

第 7 页

预测器将其自身当前状态 $\hat{x}_{WM}^{t+1} = \text{kin}(\hat{x}_{WM}^t)$ 进行预测,产生了想象体制条件 rollout——并且它保持 iKCE = 0 由构造决定:每个预测的下一状态是其前驱状态的严格运动学延续,因此是不变的(图 5,左侧)。因此,平坦性特征并非训练时摩擦分布的伪影。

物理侧:在域随机化(DR)策略下,物理斜率保持严格为负($\beta_{DR}^{phys} = -0.114$,置信区间 $[-0.201, -0.024]$),约为默认策略幅度($-0.220$)的一半。在点估计层面,这将原始的低 $\mu$ 升高部分划分为相当的两部分:约一半归因于分布外策略的打滑,另一半则是接触动力学中持续存在的真实摩擦响应,即使策略在处处处于分布内也是如此。我们在点估计层面陈述这种划分:对两个物理斜率之差的百分位自助法(percentile bootstrap)在 $K=20$ 时未能解决这一问题($\beta_{default}^{phys} – \beta_{DR}^{phys} = -0.107$,置信区间 $[-0.221, +0.004]$)。

在 walker-walk 任务上测得的排序因此为: $$ 0 < \underbrace{4.2 \times 10^{-5}}_{\text{trivial}_{\text{kinematic}}} \ll \underbrace{7.7 \times 10^{-3}}_{\text{matched}_{\text{real physics}}} \quad (T=16) \quad \underbrace{\text{DreamerV3}}_{\text{WM}} $$ 世界模型(WM)距离平凡运动学基线比真实物理更远,这排除了“想象运动学意味着较小的绝对 iKCE”这一朴素解读。根据第三节,诊断特征是扰动下的摩擦不变性,而非低绝对幅值。该排序在 $T=64$ 时同样成立。

B. 控制实验

1) 演员训练视界控制:一个自然的担忧是,WM 在 $T=64$ 时的摩擦不变性反映了默认演员在其训练视界(想象视界 = 15)之外运行,而非 WM 想象的结构特性。为了排除这一点,我们在想象视界 = 64 的情况下重新训练一个相同的检查点,以匹配测量视界,使用相同的种子、超参数和总训练预算。图 4 显示了结果:在 $h=64$ 训练的演员下,WM iKCE 的摩擦散布与默认演员的主结果相同(两种情况下均为 $1.32\times$,每个 $\mu$ 处的置信区间重叠),证实了摩擦不变性并非演员训练视界的伪影。

2) 域随机化控制:§V 中的局限性 (ii) 指出了物理侧 H2 特征最严重的混淆因素:评估策略仅在训练期间在 $\mu=1.0$ 下运行,因此升高的低 $\mu$ 物理 iKCE 可能反映了分布外摩擦下的分布外策略打滑,而非接触动力学的真实摩擦响应。为了量化这一混淆因素,我们训练了第四个 DreamerV3 检查点,其每集对摩擦 $\mu \sim U(0.1, 1.7)$ 进行域随机化,在每次集重置时抽取(匹配超参数和步数预算;在整个扫描范围内的评估奖励为 $930 \pm 36$)。因此,DR 策略和 DR 世界模型在 H2 扫描的每个摩擦值下都处于分布内。DR 策略在测试范围内没有任何奖励崩溃,因此图 1 的体制边界是固定 $\mu$ 策略的属性,并不转移到此控制实验中。

表 III 报告了附录 A2 中 DR 检查点下的平坦性回归,以及固定 $\mu$ 的结果;图 5 显示了底层的扫描。WM 侧:DR 训练的世界模型在统计上是平坦的($\beta_{DR}^{WM} = -0.026$,置信区间 $[-0.123, +0.076]$),与三个固定 $\mu$ 种子无法区分。这关闭了种子级平坦性测试中的数据覆盖漏洞:仅在 $\mu=1.0$ 下训练的世界模型从未观察到摩擦变化,因此无法学习摩擦条件潜在动力学,其平坦性部分由构造保证。DR 世界模型是在跨越整个扫描范围的转换上训练的,原则上可以从其条件前缀推断摩擦体制,其想象的 rollout 并未复现定义物理侧残差的接触事件特征。

表 III 域随机化控制:平坦性回归 $\beta = \partial \log(\text{iKCE}) / \partial \log(\mu)$ 在 $T=64$ 时,95% 百分位自助法置信区间 (在 rollout 层面进行 1000 次重采样,每个单元格 $K=20$)。无论训练时看到的摩擦分布如何,所有四个 WM 检查点在统计上都是平坦的;两个物理斜率均严格为负。

| Side | Checkpoint / policy | $\beta$ | 95% CI | | :— | :— | :— | :— | | WM | seed 0 (fixed $\mu=1.0$) | $-0.009$ | $[-0.096, +0.082]$ | | WM | seed 1 (fixed $\mu=1.0$) | $+0.031$ | $[-0.072, +0.129]$ | | WM | seed 2 (fixed $\mu=1.0$) | $+0.038$ | $[-0.039, +0.123]$ | | WM | DR ($\mu \sim U(0.1, 1.7)$) | $-0.026$ | $[-0.123, +0.076]$ | | Physics | default policy (seed 0) | $-0.220$ | $[-0.301, -0.142]$ | | Physics | DR policy | $-0.114$ | $[-0.201, -0.024]$ |

3) 逐结构分解:表 I 和图 2 中的集成 iKCE 对 rollout 视界进行了平均,因此无法揭示 WM 想象的残差是否具有与物理相同的时序结构。图 6 分解了三个摩擦值 $\mu \in \{0.15, 1.0, 1.5\}$ 下的逐 iKCE:物理表现出稀疏的接触事件尖峰,其位置随 $\mu$ 移动(与驱动运动学零残差的足部动力学一致),而 WM 显示出一步到两步的编解码器瞬态,随后是平滑的、摩擦不变的尾部。两个残差不仅在幅值上不同(H1 比率),而且在时序结构上定性不同,WM 的想象 rollout 并未复现定义物理侧残差的接触事件特征。

这一控制解决了局限性 (ii) 的训练分布侧问题。仍有两个剩余的注意事项,均推迟到开放方向:DR 策略在闭环中仍会调整其步态以适应摩擦,因此完全无策略的变体(固定开环动作序列以相同方式应用于两个通道)仍然是更清晰的消歧方法;并且想象的 rollout 仅依赖于五个观察到的步骤(125 毫秒,在一个步态周期下),这限制了即使是一个动态能力强大的想象者能从前缀中提取多少体制证据。

第 8 页

摩擦(物理体制) 关节噪声(运动学控制) 10−2 10−2

10−3 物理 + 策略 10−3 物理 + 策略 世界模型 (想象) 世界模型 (想象) iKCE 体制 µ = 0.20 10−4 10−4

0.2 0.4 0.6 0.8 1 1.2 1.4 1.6 0 5 · 10−2 0.1 0.15 0.2 0.25 0.3 摩擦乘数 µ 关节噪声 σ (弧度)

图 4. Actor 训练时长的消融实验。在 T=64 时的恒等视图 (z, vz),其中 Actor 在想象时长 = 64 时重新训练(与测量时长匹配)。世界模型 iKCE 的摩擦分布与默认 Actor 的主要结果相同(两种情况下均为 1.32 倍),证实了想象回路的摩擦不敏感性并非默认 Actor 的 h=15 训练时长的伪影。阴影带:每个单元格 K = 20 次回路的 95% 自举置信区间。

摩擦(物理体制) 关节噪声(运动学控制) 10−2 10−2

10−3 10−3 物理 + 策略 物理 + 策略 世界模型 (想象) 世界模型 (想象) iKCE

10−4 10−4

0.2 0.4 0.6 0.8 1 1.2 1.4 1.6 0 5 · 10−2 0.1 0.15 0.2 0.25 0.3 摩擦乘数 µ 关节噪声 σ (弧度)

图 5. 域随机化控制。在 T=64 时的恒等视图 (z, vz),摩擦在训练时进行域随机化(每集 µ ∼U(0.1, 1.7))。 左侧:摩擦扫描 µ ∈[0.1, 1.7](物理体制轴)。尽管世界模型是在整个摩擦范围内训练的,但世界模型想象的回路在统计上保持平坦;在域随机化策略下的物理侧 iKCE 保持严格的负斜率,点估计值约为默认策略幅度的一半。右侧:关节噪声扫描 σ ∈[0, 0.3] 弧度(运动学控制轴)。域随机化训练的世界模型对运动学轴扰动做出响应,复现了图 2 中在域随机化检查点下的正控制。阴影带:每个单元格 K=20 次回路的 95% 自举置信区间。

物理 + 策略 世界模型 (想象) 10−3 µ = 0.15 µ = 0.15 µ = 1.0 10−2 µ = 1.0 µ = 1.5 µ = 1.5 iKCE 10−5 10−4 每步 10−7

0 10 20 30 40 50 60 0 10 20 30 40 50 60 想象步数 t 想象步数 t

图 6. 每步 iKCE 结构。对数 y 轴。物理侧(左侧)具有离散接触事件尖峰,其位置随 µ 变化。世界模型(右侧)显示一到两步的编码器-解码器瞬态,随后是平滑尾部。每步结构在摩擦变化下基本保持不变。

4) Actor 消融检查点下的每步结构:主要结果使用垂直运动切片 (z, vz)。图 6 报告了默认 Actor 下的每步分解。图 4 报告了在重新训练的 h=64 Actor 下的集成 iKCE。图 7 结合了两种控制:在默认 (h=15) 和重新训练 (h=64) Actor 下,以及相同的三个摩擦值 µ ∈{0.15, 1.0, 1.5} 下,世界模型 iKCE 的每步结构。瞬态加平滑尾部的结构在 Actor 训练时长之间保持不变,排除了联合担忧,即每步特征反映的是 Actor 分布外伪影,而非世界模型想象力的属性。 5) 对运动学状态选择的鲁棒性:iKCE 依赖于所选的运动学状态向量 ˆxt(定义 1)。图 8 使用更丰富的表示(行走器的步态自由度)重复了该协议。图 2 的定性模式再次出现:世界模型 iKCE 在摩擦方面保持平坦,而物理侧显示低 µ 高程,证实 H2 反映了世界模型想象力的属性,而非用于评估它的特定状态切片。这推广了诊断声明:任何对扰动轴敏感的动力学的运动学状态提取都可以作为探针,无需赋予恒等切片特殊地位。 6) 关节噪声作为运动学正控制:摩擦扫描是一种动态扰动(物理 grounded,体制

第 9 页

WM, actor h=15 WM, actor h=64

µ = 0.15 µ = 0.15 10−2 µ = 1.0 10−2 µ = 1.0 µ = 1.5 µ = 1.5 iKCE

10−4 10−4 per-step

0 10 20 30 40 50 60 0 10 20 30 40 50 60 imagined step t imagined step t

图 7. 每步 Actor 消融实验。两个 Actor 检查点在三组摩擦值下的 WM 每步 iKCE。瞬态加平滑尾部的结构独立于 Actor 的训练视界。

摩擦 (物理体制) 关节噪声 (运动学控制)

2 物理 + 策略 2 物理 + 策略 WM (想象) WM (想象) 体制 µ = 0.20 iKCE 1.5 1.5

1 1

0.2 0.4 0.6 0.8 1 1.2 1.4 1.6 0 5 · 10−2 0.1 0.15 0.2 0.25 0.3 摩擦乘数 µ 关节噪声 σ (弧度)

图 8. 步态自由度 (DOFs) 视图。与图 2 相同的协议,但使用 Walker 的步态运动学切片。物理仿真在低 µ 下仍显示抬升,WM 仍保持平坦,该发现并非 (z, vz) 恒等视图的伪影。

交叉)。关节噪声扫描是其运动学对应物(在向 WM 编码器之前的每个观测的关节位置通道添加零均值高斯噪声,物理状态保持不变)。运动学想象器应对关节噪声扫描做出响应。扰动直接修改驱动外推的运动学状态 $\hat{x}_t$,而动力学想象器应对摩擦扫描做出响应。图 2 的右面板证实两个通道都对关节噪声有响应,排除了 WM 的 iKCE 对所有扰动都不敏感的替代解释。这种对比(对关节噪声有响应,对摩擦无响应)正是论文标题中命名的诊断特征。

C. 可复现性 1) 代码与数据可用性:本文的诊断流水线、训练好的检查点、扰动扫描 CSV 文件以及 PGFPlots 图形源文件已发布在 https://github.com/TUM-AVS/iKCE。DreamerV3 的实现是 NM512 PyTorch 端口,提交版本为 6ef8646。上游算法见 [5]。检查点已发布在 https://huggingface.co/fnc1901/ikce-walker-walk-artifacts。所有实验均在单张 RTX 5090 上运行(训练:每个检查点约 24 小时。完整的扰动扫描,包括 Actor 视界消融实验:约 2 小时)。 2) 实现细节:对于恒等视图,运动学预测器在根垂直状态上采用恒定速度模型:$\text{kin}([z_t, \dot{z}_t]) = [z_t + \Delta t \dot{z}_t, \dot{z}_t]$,其中 $\Delta t = 25$ ms(DMC 物理时间步长)。对于步态视图,$\hat{x}_t$ 堆叠了每个

发表评论