视频编辑为何失效?ElasticTTT解决先验崩溃问题

方法贡献

扩散模型在视频编辑中常因测试时微调(TTT)导致先验崩溃,表现为忽略指令或破坏未编辑区域。ElasticTTT通过TDR、Contrastive CFG和Async-NS三大机制,在保留源视频结构的同时实现精准编辑。实验显示其在VLM评估中表现最佳,但需注意超参数敏感性。

扩散模型推理加速:PSP如何通过剪枝超越BoN?

PSP的核心创新

扩散模型的推理时间扩展长期滞后于LLM。本文提出PSP(Progressive Seed Pruning),通过初期大量种子探索与渐进剪枝,解决BoN等方法计算浪费问题。实验显示PSP在GenEval和人类评估中均优于基线,且计算开销极低。注意:PSP依赖奖励模型信号,对细粒度美学优化增益有限。

Texture++:如何用扩散模型修复3D纹理UV接缝伪影?

论文代表图:figure-12-p013-03

本文分析了Texture++论文,探讨了如何利用区域感知扩散模型解决3D资产纹理超分辨率中的UV接缝伪影问题。通过自适应视角选择和掩码生成机制,该方法实现了高保真细节恢复。视频将详细解释其核心创新点和实验结果,并指出其局限性。

流式视频生成提速秘诀:Ms. Forcing 如何用多尺度注意力打破延迟瓶颈

核心贡献

传统流式视频生成模型受限于嵌套去噪循环,导致高延迟和不稳定。Ms. Forcing 通过 Multi-Scale Patchification 和 Multi-Scale Self-Attention 适应噪声水平,减少冗余计算。结合 Homogeneous-Noise-Level DMD,解决训练推理失配问题。实验显示其在长视频生成中保持高质量,同时实现实时推理。注意:KV-cache 更新开销可能部分抵消计算增益。

UniD:来自不相关数据的统一视频密集预测

方法概览:从专家到统一的蒸馏

本文介绍UniD模型,解决统一密集预测需共标注数据的痛点。通过训练Task Specialist并利用Latent Projector蒸馏至Unified Backbone,UniD从Disjoint Data中学习深度、法线、语义等八种任务。实验显示,UniD在NYUv2深度估计AbsRel达0.059,超越DINOv3-H;视频时序一致性超越DICEPTION。需注意分割任务需轻量级微调,且时序性能依赖视频训练数据。

RealVDeblur:利用单步扩散与3DGS数据合成实现泛化现实视频去模糊

RealVDeblur框架概览

本文提出RealVDeblur框架,利用3D Gaussian Splatting (3DGS)合成大规模物理真实模糊数据,解决现实世界视频去模糊的泛化难题。通过Frame-wise VAE编码保留帧级模糊细节,利用Distribution Matching Distillation (DMD)将多步扩散蒸馏为单步生成器。引入无需训练的Temporal Window Mask (TWM)限制自注意力范围,消除RoPE外推不稳定性,实现恒定内存的长视频推理。在BSD、RealBlur等基准上验证了有效性,并展示了作为3DGS重建预处理步骤的提升作用。

WorldWeaver:利用世界状态寄存器解决Multi-Agent视频生成的逻辑一致性难题

方法概述:WorldWeaver架构

本文介绍WorldWeaver,一种流式Multi-Agent视频扩散模型。针对现有方法难以维持共享世界状态的问题,引入世界状态寄存器(WSR)和混合Transformer(MoT)。实验显示,在Minecraft任务上WorldScore达105.1,优于Solaris基线。需注意该方法依赖显式状态监督,且WorldScore对FID尺度敏感。

WearWow:原生2K多衣物虚拟试穿,解决显存爆炸与纹理平滑难题

方法概览:WearWow框架

本文介绍WearWow框架,旨在解决虚拟试穿(VTON)在原生2K分辨率及多衣物场景下的显存瓶颈与高频细节丢失问题。通过自适应2D Token打包(ATP)优化显存占用,利用多维试穿奖励(MTR)对齐机制纠正扩散模型的频谱偏差。实验显示,在VITON-HD和自建WearWow-2K数据集上,该方法在FID、LPIPS等指标上优于IDM-VTON、CatVTON及OminiTry等基线,实现了无掩码多衣物的照片级真实感生成。需注意,高分辨率生成涉及深度伪造风险,且MTR训练计算开销较大。

OSVE:基于单步扩散模型的一步视频编辑

方法概述:OSVE框架

本文介绍OSVE框架,旨在解决文本引导视频编辑中速度与质量的矛盾。传统多步方法计算昂贵,直接应用单步模型则导致结构坍塌。OSVE通过可学习的反转编码器和统一帧编辑机制,在单步内完成高质量编辑。实验显示,OSVE在20帧和90帧视频上分别比RAVE快171倍和155倍,且时序一致性显著优于基线。需注意单步模型对控制信号敏感,且长视频处理需依赖滑动窗口策略。

AppearancePointers:DiT多模态区域控制新范式

核心方法

本文介绍AppearancePointers,一种用于扩散变换器(DiT)的多模态区域控制方法。通过生成紧凑的指针令牌,该方法在单次去噪步骤中实现文本、图像和空间掩码的精确对齐。实验显示其在CLIP-I、DINO-I和MIoU指标上优于MS-Diffusion和InsertAnything等基线。需注意,区域数量过多时性能会下降。