BrainWAM:为什么自动驾驶的语义与预测不该在原始 token 里硬融合

方法贡献:动作空间协调

BrainWAM 提出一种受脑功能特化启发的动作空间协调框架,将 VLA 语义推理与 WAM 预测世界建模转化为两条独立动作通路,通过 CAB 和 CIF 在紧凑动作表示层面协调,避免原始 token 融合中的注意力分配失衡。

DreamX-Phi 1.0:让视频世界模型真正理解机械臂的刚体动作

研究缺口

DreamX-Phi 1.0 是一个基于 Wan2.2-TI2V-5B 的动作条件视频世界模型,通过 PRoPE 几何注意力、深度监督和对象一致性约束,在给定单帧观测和双手动作轨迹时预测未来视频,并在 WorldArena 2.0 上取得 Track 1 第一、Track 2 并列第二。