视频编辑为何失效?ElasticTTT解决先验崩溃问题
扩散模型在视频编辑中常因测试时微调(TTT)导致先验崩溃,表现为忽略指令或破坏未编辑区域。ElasticTTT通过TDR、Contrastive CFG和Async-NS三大机制,在保留源视频结构的同时实现精准编辑。实验显示其在VLM评估中表现最佳,但需注意超参数敏感性。
扩散模型在视频编辑中常因测试时微调(TTT)导致先验崩溃,表现为忽略指令或破坏未编辑区域。ElasticTTT通过TDR、Contrastive CFG和Async-NS三大机制,在保留源视频结构的同时实现精准编辑。实验显示其在VLM评估中表现最佳,但需注意超参数敏感性。
扩散模型的推理时间扩展长期滞后于LLM。本文提出PSP(Progressive Seed Pruning),通过初期大量种子探索与渐进剪枝,解决BoN等方法计算浪费问题。实验显示PSP在GenEval和人类评估中均优于基线,且计算开销极低。注意:PSP依赖奖励模型信号,对细粒度美学优化增益有限。
本文分析了Texture++论文,探讨了如何利用区域感知扩散模型解决3D资产纹理超分辨率中的UV接缝伪影问题。通过自适应视角选择和掩码生成机制,该方法实现了高保真细节恢复。视频将详细解释其核心创新点和实验结果,并指出其局限性。
传统流式视频生成模型受限于嵌套去噪循环,导致高延迟和不稳定。Ms. Forcing 通过 Multi-Scale Patchification 和 Multi-Scale Self-Attention 适应噪声水平,减少冗余计算。结合 Homogeneous-Noise-Level DMD,解决训练推理失配问题。实验显示其在长视频生成中保持高质量,同时实现实时推理。注意:KV-cache 更新开销可能部分抵消计算增益。
本文介绍UniD模型,解决统一密集预测需共标注数据的痛点。通过训练Task Specialist并利用Latent Projector蒸馏至Unified Backbone,UniD从Disjoint Data中学习深度、法线、语义等八种任务。实验显示,UniD在NYUv2深度估计AbsRel达0.059,超越DINOv3-H;视频时序一致性超越DICEPTION。需注意分割任务需轻量级微调,且时序性能依赖视频训练数据。
本文提出RealVDeblur框架,利用3D Gaussian Splatting (3DGS)合成大规模物理真实模糊数据,解决现实世界视频去模糊的泛化难题。通过Frame-wise VAE编码保留帧级模糊细节,利用Distribution Matching Distillation (DMD)将多步扩散蒸馏为单步生成器。引入无需训练的Temporal Window Mask (TWM)限制自注意力范围,消除RoPE外推不稳定性,实现恒定内存的长视频推理。在BSD、RealBlur等基准上验证了有效性,并展示了作为3DGS重建预处理步骤的提升作用。
本文介绍WorldWeaver,一种流式Multi-Agent视频扩散模型。针对现有方法难以维持共享世界状态的问题,引入世界状态寄存器(WSR)和混合Transformer(MoT)。实验显示,在Minecraft任务上WorldScore达105.1,优于Solaris基线。需注意该方法依赖显式状态监督,且WorldScore对FID尺度敏感。
本文介绍WearWow框架,旨在解决虚拟试穿(VTON)在原生2K分辨率及多衣物场景下的显存瓶颈与高频细节丢失问题。通过自适应2D Token打包(ATP)优化显存占用,利用多维试穿奖励(MTR)对齐机制纠正扩散模型的频谱偏差。实验显示,在VITON-HD和自建WearWow-2K数据集上,该方法在FID、LPIPS等指标上优于IDM-VTON、CatVTON及OminiTry等基线,实现了无掩码多衣物的照片级真实感生成。需注意,高分辨率生成涉及深度伪造风险,且MTR训练计算开销较大。
本文介绍OSVE框架,旨在解决文本引导视频编辑中速度与质量的矛盾。传统多步方法计算昂贵,直接应用单步模型则导致结构坍塌。OSVE通过可学习的反转编码器和统一帧编辑机制,在单步内完成高质量编辑。实验显示,OSVE在20帧和90帧视频上分别比RAVE快171倍和155倍,且时序一致性显著优于基线。需注意单步模型对控制信号敏感,且长视频处理需依赖滑动窗口策略。
本文介绍AppearancePointers,一种用于扩散变换器(DiT)的多模态区域控制方法。通过生成紧凑的指针令牌,该方法在单次去噪步骤中实现文本、图像和空间掩码的精确对齐。实验显示其在CLIP-I、DINO-I和MIoU指标上优于MS-Diffusion和InsertAnything等基线。需注意,区域数量过多时性能会下降。