ContactFlow:用接触点轨迹打通人类演示与机器人操作之间的具身鸿沟

论文代表图:figure-01-p007-02

视频世界模型通过想象动作后果来规划机器人行为,但现有方法用关节状态或演员掩码作为条件化信号,这些信号与特定具身深度绑定,难以从人类演示迁移到机器人。ContactFlow 提出一种具身无关的动作表示——将手或夹爪与物体间的 3D 接触点轨迹投影到图像空间,形成稀疏的 7 通道控制视频。基于 Wan 视频扩散模型训练后,该方法在 DROID 数据集上取得最优视频预测质量,并在 7 个未见数据集上展现出强泛化能力。真实世界实验中,世界模型在 10 个桌面抓取放置场景中正确预测了 8 个场景的执行结果。但该方法依赖标定良好的外中心相机和可靠深度估计,推理速度也远未达到实时。

StatePlay:首个让AI生成游戏画面遵守规则的状态感知模型

方法贡献与验证

现有的游戏世界模型虽然能生成逼真的游戏画面,却常常违反游戏规则——比如零血状态下还能攻击,或者技能槽没满就放出超杀。StatePlay 通过显式预测血量、技能槽等内部状态,让生成的画面真正符合游戏机制。在街霸3数据集上,StatePlay 的机制保真度相比最强基线提升了近20个百分点。但该方法目前仅在格斗游戏上验证,且依赖模拟器提取的精确状态标注,泛化到其他游戏类型仍需更多工作。

视频编辑新范式:DBL-Diffusion 如何实现显式图层分解与对象插入

论文代表图:figure-01-p001-01

现有视频编辑方法缺乏对前景、背景及物理交互的显式分层表示,导致背景扭曲且难以后期调整。本文提出 TriLayer 数据集,提供包含阴影等视觉特效的三元组监督;并设计 DBL-Diffusion 双分支架构,联合生成 RGB 合成视频与 RGBA 前景层。实验表明该方法在对象插入与图层分解任务上均优于基线,但计算开销较大。

PDD:用并行解码蒸馏打破视频生成的多样性瓶颈

架构创新:复用Backbone与Layer Fusion

视频扩散模型加速常面临多样性丧失与运动缺失的困境。PDD提出并行解码蒸馏,通过单次评估预测多步平均速度,避免JVP与对抗损失。实验显示其在Wan2.1等模型上显著优于DMD2,保留更多细节与动态。注意:大规模实验依赖Data-free训练,泛化性待验证。

Wonder:如何用稀疏注意力解决视频世界模型的长程记忆与控制漂移

方法贡献:稀疏上下文强制与 MoS 蒸馏

现有视频世界模型在长程交互中常面临控制漂移、记忆丢失和延迟高的问题。Wonder 提出像素空间坐标场实现精准相机控制,利用稀疏上下文强制和全保真 KV Cache 记忆机制解决长期一致性问题,并通过 Mixture-of-Students 蒸馏实现实时推理。实验显示其在 I2V 和 V2V 任务中显著优于 RELIC 等基线,RPE 指标大幅降低。需注意其对训练算力要求高,且依赖外部位姿估计。

视频生成推理加速:Sol-Attn 如何在不牺牲质量的情况下实现 2x 加速?

论文代表图:figure-01-p001-01

Diffusion Transformers 在长序列视频生成中面临自注意力机制的二次复杂度瓶颈。Sol-Attn 提出了一种无需训练的动态稀疏注意力机制,通过在线 softmax 过程中的阈值路由和近似校正,在保持生成质量的同时显著加速推理。本文解析其核心机制、实验验证及局限性。

CameraAnything:如何用任意相机参数重拍视频?

方法贡献

现有视频编辑方法难以同时控制焦距、分辨率和相机姿态。CameraAnything 提出将 Plücker 射线注入 3D RoPE,在 Wan2.1 基础上实现内/外参联合控制。实验显示其在合成与真实数据上均优于 ReCamMaster 等基线,但复杂多镜头切换仍有局限。

GraphVid:用交互图取代轨迹,实现高效可控视频生成

论文代表图:figure-01-p001-01

可控视频生成常受限于轨迹方法的复杂度和数据需求。GraphVid通过构建有向交互场景图,利用Edge-Aware Graph Reasoning模块捕捉对象间关系动态,并通过LoRA适配器注入冻结的DiT骨干网络。实验显示其在MoveBench上优于Wan-Move等基线,推理速度提升显著。需注意其对小目标检测的依赖及上下文窗口限制。

流式视频生成提速秘诀:Ms. Forcing 如何用多尺度注意力打破延迟瓶颈

核心贡献

传统流式视频生成模型受限于嵌套去噪循环,导致高延迟和不稳定。Ms. Forcing 通过 Multi-Scale Patchification 和 Multi-Scale Self-Attention 适应噪声水平,减少冗余计算。结合 Homogeneous-Noise-Level DMD,解决训练推理失配问题。实验显示其在长视频生成中保持高质量,同时实现实时推理。注意:KV-cache 更新开销可能部分抵消计算增益。

WorldWeaver:利用世界状态寄存器解决Multi-Agent视频生成的逻辑一致性难题

方法概述:WorldWeaver架构

本文介绍WorldWeaver,一种流式Multi-Agent视频扩散模型。针对现有方法难以维持共享世界状态的问题,引入世界状态寄存器(WSR)和混合Transformer(MoT)。实验显示,在Minecraft任务上WorldScore达105.1,优于Solaris基线。需注意该方法依赖显式状态监督,且WorldScore对FID尺度敏感。