DiTango:利用注意力空间局部性的低成本并行扩散生成

方法概览:选择性状态复用

本文介绍DiTango,一种针对分布式DiT推理的低成本并行生成方法。针对现有Context Parallelism在多节点扩展时的通信瓶颈,DiTango利用注意力贡献的空间局部性,提出基于Attention State的可组合复用机制。通过Anchor-guided Selection Planner预测复用误差,结合State-centric Parallel Runtime优化通信与计算重叠。实验显示,在32 GPU上,Wan-14B模型获得1.9倍端到端加速,同时保持高质量生成。

PE-Field 4D:用位置编码让视频扩散模型理解3D几何

论文代表图:figure-01-p001-01

本文提出PE-Field 4D,解决视频扩散Transformer在视角变换中几何结构丢失的问题。核心方法是将参考内容的投影位置编码注入交叉注意力机制,实现几何感知生成。在DAVIS数据集上,该方法在Dyn-MEt3R和MEt3R指标上优于ReCamMaster、GEN3C等基线。需注意,方法依赖ViPE估计深度,几何重建误差可能影响最终效果。

TANGO:测试时噪声引导自适应,解决自回归视频生成的终端点崩溃问题

方法概述:TANGO噪声引导自适应

本文提出TANGO方法,针对自回归视频扩散模型在生成长视频时出现的“终端点”崩溃问题。该方法利用扩散模型作为评判者,通过预测下一步并检查噪声残差是否符合各向同性高斯分布来识别终端点,并在测试时通过约束优化更新参数以偏离终端点。实验显示,在VBench基准上总分提升3.1%,15秒视频平均FVD降低28.3%。需注意,该方法依赖预训练模型流形中存在有效解,且会增加推理时间。

D2DF:单步视频物体移除,无需草稿的高保真重建

方法:D2DF框架概述

传统视频物体移除方法存在伪影,扩散方法虽真实但慢且依赖草稿。本文提出D2DF框架,通过特权一致性蒸馏(PPCD)和自引导快速植入(SGFP),将多步扩散教师模型蒸馏为单步无草稿模型。实验显示D2DF-DF在RORD上PSNR达31.56,推理仅需1.05秒,比ROSE快40倍。注意:单步去噪在极端遮挡下仍有模糊,伪草稿视觉粗糙但潜在空间有效。

HDR:分层去噪实现视频多步逻辑推理与流式生成

方法:HDR分层去噪框架

本文提出HDR框架,解决视频生成中逻辑一致性与低延迟流式生成的矛盾。通过树状分层潜在变量和SHAP稀疏注意力,实现从粗到细的去噪推理。实验显示,整体成功率从34.22提升至60.29,推理延迟仅为0.70s/latent,比双向扩散快54.2倍。

视频扩散模型中的串行性差距:为何增加去噪步数无法解决长链物理推理

方法:硬球动力学测试床

本文揭示了视频扩散模型在处理长链因果推理(如多球碰撞)时存在的“串行性差距”。理论证明双向去噪无法提供可扩展的串行计算,增加去噪步数无效。实验显示,自回归生成和增加模型深度能有效缓解此问题。结果基于合成数据,自然视频应用需谨慎。

IB-Flow:基于信息瓶颈引导的CFG蒸馏用于少步文本到图像生成

IB-Flow核心思想:动态信息注入

本文提出IB-Flow,解决少步CFG蒸馏中静态引导强度与随机时间步采样的盲目性问题。通过信息瓶颈原理,动态优化注入目标时间步和引导强度,在2步NFE下实现SOTA性能。实验显示在Qwen-Image-20B上GenEval达0.86,DPG-Bench达88.67,优于ArcFlow。需注意超参数κ敏感性及极端少步生成的伦理风险。

OpenLongTail:生成式扩展长尾驾驶数据,提升VLA策略鲁棒性

OpenLongTail框架概览

本文介绍OpenLongTail框架,通过恢复自车轨迹并结合Plücker射线、时间深度扭曲和跨视图记忆库,将单目长尾视频转化为多视图资产。实验显示,在AlpaSim中,合成数据使Alpamayo R1策略得分提升至0.748,碰撞率0%。需注意生成成本较高及分布对齐限制。

PanoWorld:真实世界全景生成,解耦旋转与记忆增强

三阶段训练策略

本文介绍PanoWorld框架,针对全景世界生成中长程记忆物理一致性差的问题,提出基于旋转等变性的运动解耦、DPRC射线条件建模及GMA几何记忆增强模块。在World360基准上,该方法在FID、PSNR等指标上优于Imagine360、Matrix-3D等基线,并支持单卡H20实时生成。需注意仿真与真实数据分布差异及轨迹输入质量依赖。

LongE2V:如何用视频扩散模型解决事件相机长视界生成难题?

论文代表图:figure-04-p004-02

事件相机视频生成面临回归方法纹理模糊、长程预测时序漂移及插值重影等挑战。本文介绍LongE2V方法,通过微调CogVideoX并引入自回归展开、重编码对齐等创新机制,在ECD、MVSEC等数据集上实现SOTA重建与预测性能。需注意其推理速度较慢且对稀疏事件流敏感。