SANA-Video 2.0:混合线性注意力实现单卡高效长视频生成

方法:混合线性-Softmax 注意力

本文分析 SANA-Video 2.0 如何解决全 3D Softmax 视频 DiT 的 O(N^2) 计算瓶颈。方法核心为混合线性-Softmax 注意力(25% 锚点)与 Block AttnRes 机制。实验显示,该模型在 VBench 上取得 84.30 分,720p/5s 延迟仅 13.06 秒,比 Wan 2.2 快 120 倍。需注意当前算子为双向,且长视频训练课程仍在完善中。

SafeGen:用VLM逆向推理生成安全关键视频,测试自动驾驶模型极限

方法概览:SafeGen框架

本文介绍SafeGen框架,解决现有模拟器生成安全关键场景时存在的Sim-to-Real差距问题。通过VLM推理识别潜在脆弱性并定义灾难性终点,再利用FLF2V模型生成物理合理且时间连贯的对抗性视频。实验显示,该方法在nuScenes数据集上显著降低VLMAD的感知对齐与规划合规性,并提升模型微调后的准确率。需注意生成内容的高逼真性可能带来的伦理风险及评估指标的主观性。

Vera:解决S2V身份漂移与多主体混淆的百万级对齐方案

方法:IFMS身份焦点掩码监督

现有Subject-to-Video方法在动态姿态和多主体场景下常出现身份漂移与角色混淆。Vera通过构建百万级身份对齐数据集,引入IFMS强化面部监督,并利用RALA稳定DiT中的参考交互。实验显示其在FaceSim-Arc上达0.571,显著优于VACE。需注意:过度强调面部权重会损害运动平滑性,且目前不支持视频参考输入。

流式HOI视频生成:解决长视频交互漂移的内存自适应方案

论文代表图:figure-01-p001-01

StreamHOI针对流式HOI视频生成中固定内存预算下的长期身份漂移与短期运动不连续问题,提出偏置引导的内存专业化训练(B-MST)与记忆距离缩放(MDS)。通过离线块分析将Transformer块分类,动态分配Sink/Local内存比例,并修正Temporal RoPE以增强早期交互状态访问。实验显示在GeoHOI和HOMA测试集上优于双向方法,FPS达17.6。需注意评估基于VLM多维二进制指标,且依赖离线预处理步骤。

单卡RTX 5090实时推演:ABot-World-0的LongForcing与全栈优化

数据:WorldExplorer闭环系统

本文介绍ABot-World-0,一种基于动作条件的视频世界模型。针对现有世界模型在长时程一致性、控制耦合及部署效率上的瓶颈,研究提出WorldExplorer闭环数据系统、LongForcing长时程分布匹配机制,以及基于LightVAE、FP8/MXFP4量化和SageAttention2的全栈推理协同设计。在WorldRoamBench基准上,该模型在Strict Accuracy等指标上优于Genie 3等基线,并在单张RTX 5090上实现16 FPS实时交互。需注意,性能数据基于特定硬件,且部分基线模型参数量较大,比较时需考虑规模差异。

ShotPlan:基于可学习规划令牌的电影级多镜头视频生成

方法概述:可学习规划令牌

本文提出ShotPlan框架,解决现有视频生成模型难以在单一过程中生成具有明确镜头边界和跨镜头语义一致性的多镜头视频的问题。通过引入可学习规划令牌和分数时间旋转位置编码,实现帧级转场控制。实验显示,ShotPlan在转场偏差、角色一致性等指标上优于CineTrans、HoloCine等基线,并在摄像机运动控制上超越Kling 2.6和Seedance 1.5 Pro。需注意该方法依赖高质量合成数据训练,且规划令牌需保持干净以加速收敛。

视频生成器具备因果推理能力吗?CGDJ基准揭示“感知-预测鸿沟”

方法:CGDJ基准框架概述

本文提出CGDJ基准,通过显式因果感知和隐式生成预测评估视频生成器的推理能力。研究发现Sora-2、Veo-3.1等模型存在显著的“感知-预测鸿沟”,即能口头描述因果逻辑但无法生成一致的物理结果。高视觉保真度不等于因果正确性,模型可能依赖语言先验而非内部世界模型。

PE-Field 4D:用位置编码让视频扩散模型理解3D几何

论文代表图:figure-01-p001-01

本文提出PE-Field 4D,解决视频扩散Transformer在视角变换中几何结构丢失的问题。核心方法是将参考内容的投影位置编码注入交叉注意力机制,实现几何感知生成。在DAVIS数据集上,该方法在Dyn-MEt3R和MEt3R指标上优于ReCamMaster、GEN3C等基线。需注意,方法依赖ViPE估计深度,几何重建误差可能影响最终效果。

FVAttn:解决视频生成稀疏注意力负载不均的运行时负载均衡方案

FVAttn 系统架构概览

本文介绍 FVAttn,一种用于视频生成的自适应稀疏注意力系统。针对 Top-p 路由在多 GPU 序列并行中导致的负载不均问题,FVAttn 提出运行时负载均衡与松弛感知稀疏增强机制。实验显示,在 Wan2.2 I2V 上相比 FlashAttention 实现 4.41x 注意力加速。需注意该方法对长序列和硬件通信带宽敏感。

HDR:分层去噪实现视频多步逻辑推理与流式生成

方法:HDR分层去噪框架

本文提出HDR框架,解决视频生成中逻辑一致性与低延迟流式生成的矛盾。通过树状分层潜在变量和SHAP稀疏注意力,实现从粗到细的去噪推理。实验显示,整体成功率从34.22提升至60.29,推理延迟仅为0.70s/latent,比双向扩散快54.2倍。