视频编辑为何失效?ElasticTTT解决先验崩溃问题

快速导读:ElasticTTT提出了一种新的测试时微调框架,通过Target Distribution Regularization、Contrastive CFG和Asynchronous Noise Scheduling解决视频编辑中的Prior Collapse问题,实现了SOTA性能。

视频编辑是扩散模型应用中的关键挑战,尤其在处理单视频实例时。传统测试时微调(TTT)方法虽能适配源视频,却常导致先验崩溃,表现为条件崩溃和空间纠缠。

ElasticTTT提出了一种新颖的保留先验框架,通过目标分布正则化、对比无分类器引导和异步噪声调度,有效解决了上述问题。该方法在多个编辑任务中实现了SOTA性能,为视频编辑提供了更稳健的解决方案。

英文题目:ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

论文出处:arXiv 每日论文精选 · arXiv:2607.21529

原始论文:PDF / 论文页面

对应视频标题:视频编辑为何失效?ElasticTTT解决先验崩溃问题|推荐指数:★★★★★

这篇论文解决什么问题?

扩散模型在视频编辑中面临领域差距问题。TTT旨在适应源视频,但过度拟合会导致生成弹性丧失。具体表现为:条件崩溃(忽略编辑指令)和空间纠缠(未编辑区域被意外修改)。

现有方法如Tune-A-Video和VidTTA虽尝试解决此问题,但仍存在分布偏移和空间混淆。FlowAlign和UniEdit等免训练方法在保留性上表现良好,但缺乏编辑弹性。

因此,需要在实例特定过拟合和分布多样性之间找到平衡,避免退化的优化状态。

核心创新

方法概览

现有方法难以平衡实例过拟合与分布多样性,导致优化状态退化。

  • 目标分布正则化(TDR):在优化目标中加入受控随机性,防止尖锐记忆,避免分布坍缩为狄拉克奇点。
  • 对比无分类器引导(Contrastive CFG):使用源提示作为负约束,主动排斥采样过程向源分布偏移,抵消分布漂移。
  • 异步噪声调度(Async-NS):为编辑和保留区域分配独立噪声轨迹,通过时间不对称性解耦空间表示,缓解空间纠缠。
  • 整体流程:在训练阶段通过TDR软化优化目标,在采样阶段通过Contrastive CFG排斥源分布,结合Async-NS实现区域独立积分轨迹。

逐图理解论文

失败案例

失败案例
Figure 1. Demonstration of ElasticTTT and the baseline TTT method on four different editing tasks. ElasticTTT obtains high quality editing results among all tasks, whereas the baseline method exhibits clear Conditioning Collapse and Spatial Entanglement.

展示ElasticTTT与基线TTT在四种编辑任务上的对比。注意基线方法的条件崩溃和空间纠缠,而ElasticTTT保持高质量编辑。

方法贡献

方法贡献
Figure 2. The overall pipeline of ElasticTTT. To resolve Conditioning Collapse, we soften the optimization target via TDR during training, and repel the sampling process from the source distribution via Contrastive CFG during sampling. To mitigate Spatial Entanglement, we perform Asynchronous Noise Scheduling to establish independent integration trajectories for distinct regions.

ElasticTTT整体流程图。关注TDR、Contrastive CFG和Async-NS如何协同解决条件崩溃和空间纠缠。

实验验证

实验验证
Table 1 summarizes the quantitative compari- son between ElasticTTT and competitive base- line methods. In general, TTT-based meth- ods outperform prevailing video editing ap- proaches due to their ability to adapt to the specific content and temporal dynamics of each input video at test time. Moreover, Elas- ticTTT achieves the strongest performance among TTT-based methods, with particularly substantial gains on VLM-based evaluations, which provide a holistic and fine-grained as- sessment of video editing quality across multiple dimensions (VQ 6.19, IA 7.50, and OVL 6.68). Although certain baselines match or exceed ElasticTTT on isolated metrics, they suffer from significant trade-offs.

实验显示,ElasticTTT在VLM评估中表现最佳,人类评分也显著优于基线。

实验如何设计?

  • 数据集:自定义125对视频数据集,覆盖5种编辑任务。
  • 基线对比:重新实现Tune-A-Video、VidTTA、FlowAlign和UniEdit以确保公平比较。
  • 评估指标:使用VLM(GPT-5)进行细粒度评估,并与人类判断进行相关性分析。
  • 消融实验:分别验证TDR、Contrastive CFG和Async-NS组件的贡献。
  • 泛化测试:在更大基座模型Wan2.2-5B上测试性能。

关键结果与论文证据

  • ElasticTTT在VLM评估中表现最佳,VQ 6.19,IA 7.50,OVL 6.68(第11页)。
  • 人类平均评分3.60,优于所有基线方法(第11页)。
  • 在Wan2.2-5B上,OVL达到7.00,显著高于基线的4.91(第11页)。
  • Async-NS相比Latent Blending,OVL从4.71提升至6.68(第13页)。
  • VLM评分与人类判断高度相关,验证了评估的有效性(第32页)。

阅读时需要注意

  • Async-NS的超参数(Te, Tp)敏感,需仔细调整。
  • 在更大模型上,源保留性(SP)略有下降,因编辑弹性过于激进。
  • 依赖自动分割(Grounded-SAM2)生成掩码,可能引入误差。
  • 测试集未公开,限制即时复现性。

关联工作

  • Tune-A-Video和VidTTA作为基线TTT方法,重新实现以确保公平比较(第9页)。
  • FlowAlign作为免训练基线,在保留性上表现优异但缺乏编辑弹性(第11页)。
  • UniEdit作为免训练基线,语义对齐高但保留性差(第11页)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

清华大学 2026年7月24日

ElasticTTT:用于视频编辑的先验保持测试时微调

刘月月1∗ 张驰1∗ 崔森2 刘淼1† 清华大学人工智能学院1, 北京人工智能研究院2

项目页面 代码 数据集

摘要。 在预训练扩散模型上进行测试时微调(Test-Time Tuning, TTT)已成为一种强大的视频编辑范式[2026]。然而,生成模型的概率分布特性与TTT的单点优化之间存在根本性的不匹配。在本文中,我们证明这种不匹配会触发标准TTT中的先验崩溃(Prior Collapse)现象[23],即模型丢弃文本条件和空间潜在变量,导致生成结果坍缩至源视频,或导致不同区域的特征发生空间纠缠(Spatial Entanglement)。为解决这一问题,我们提出了ElasticTTT,这是一种新颖的框架,旨在保持先验生成分布并恢复生成弹性。具体而言,我们提出了目标分布正则化(Target Distribution Regularization, TDR)以防止尖锐的记忆极小值,对比无分类器引导(Contrastive Classifier-Free Guidance, CFG)以引导推理远离源偏差,以及异步噪声调度(Asynchronous Noise Scheduling, Async-NS)以保留未编辑区域。广泛的评估结合理论分析表明,ElasticTTT成功保持了基础模型的生成先验,在单镜头视频编辑任务上达到了最先进(SOTA)的性能。

1 引言

去噪扩散模型[18, 62]的进步推动了文本到视频生成[21, 32, 64, 74]的显著发展。这些强大的视频生成骨干网络也通过利用学习的生成先验[24, 50, 71],为可控视频编辑开辟了新的机遇。然而,用户提供的源视频可能偏离现成模型的固定训练分布[2, 5, 17, 38, 70, 75, 78],特别是考虑到互联网上新概念的快速涌现,这导致编辑性能下降。最近,另一条研究路线探索了测试时微调(Test-Time Tuning, TTT)[16, 24, 63, 65–67, 69],旨在将现成模型的权重适配到用户提供的源视频领域。与直接使用预训练模型进行推理的视频编辑方法相比,TTT特别适用于源视频与预训练分布之间存在较大领域差异的挑战性场景。这是因为TTT显式地将模型适配到每个源视频的具体内容和动态,从而更好地保留其外观、结构和运动。除了作为视频编辑的实用范式外,

∗ 同等贡献 † 通讯作者

1

第 2 页

清华大学 | 2

图 1. ElasticTTT 与基线 TTT 方法在四种不同编辑任务上的演示。 ElasticTTT 在所有任务中均获得高质量的编辑结果,而基线方法表现出明显的条件崩溃(Conditioning Collapse)和空间纠缠(Spatial Entanglement)。

基于 TTT 的方法还作为合成配对编辑数据以训练大规模前馈视频编辑模型的有效数据引擎 [70, 77]。 尽管 TTT 为个性化用户体验提供了自然的机制 [4, 12, 35, 58],但它与扩散过程引入了固有的张力:TTT 有意鼓励针对特定实例的过拟合,而扩散过程本质上是随机的,旨在保持分布的多样性。值得注意的是,仅针对这一零方差奇点优化高度参数化的扩散模型,很容易导致一种我们称之为先验崩溃(Prior Collapse)的失效模式。如图 1 所示,先验崩溃表现为两种互补的失效现象。当条件引导在微调过程中锚定于源条件动态时,会发生条件崩溃(Conditioning Collapse),这阻碍了有效的语义控制,导致模型忽略目标编辑指令。当空间表示在去噪过程中发生全局耦合时,会发生空间纠缠(Spatial Entanglement),这阻碍了局部控制,并导致目标区域外出现非预期的修改。

为了规避这些挑战,先前的方法提出了一系列干预措施。 为了缓解条件崩溃,先前的工作通常依赖于低秩自适应(LoRA)[13]、先验保持损失(prior-preservation losses)[58]、自监督目标 [66],或对文本和空文本嵌入进行孤立优化 [12, 49]。为了解决空间纠缠,方法通常诉诸于侵入性的注意力图修改 [36, 79]、掩码优化阶段 [13],或注入深度和光流等外部控制信号 [67]。然而,这些方法从根本上说是次优的,其复杂性决定了它们严重依赖于精细的架构调整,需要辅助数据集,或者对超参数选择保持危险敏感。

更重要的是,尽管测试时微调(Test-Time Tuning, TTT)通过在源图像上直接微调模型,在图像编辑中显示出巨大的潜力,但将其适应于视频的情况却非常稀缺且充满困难。视频扩散 Transformer [53, 64] 拥有高度复杂的空间-时间先验,简单地将基于图像的 TTT 优化技术转移到视频模型上

第 3 页

清华大学 | 3

严重加速了先验崩溃。网络迅速过拟合源视频的确定性运动和外观,失去了精确、准确编辑所需的生成弹性。为了解决这一根本性的优化-采样张力,我们提出了 ElasticTTT,这是一个原则性框架,旨在挽救生成弹性并明确治愈先验崩溃的症状。ElasticTTT 并非将这些故障视为孤立的现象,而是对整个生成流水线进行干预:首先,为了防止优化过程中的条件崩溃,我们引入了目标分布正则化。通过受控的随机性柔和地放宽僵化的单点目标,我们从物理上防止模型记忆源视频,保留其弹性去噪先验。然而,由于微调后的权重仍表现出向源概念的残余偏移,我们在推理阶段随后应用对比无分类器引导,以强制将轨迹导向目标条件。最后,为了解决空间纠缠,我们在采样过程中引入了异步噪声调度,为编辑区域和锚定区域动态分配独立的扩散轨迹,澄清潜在表示,并赋予模型渲染新概念的同时安全保留未编辑环境的局部自由。

为了验证我们框架的有效性,我们在广泛的编辑任务范围内进行了大量实验。我们的结果表明,ElasticTTT 成功解决了先验崩溃问题,表现出强大的生成弹性、精确的指令遵循能力以及对源视频的高保真保留。在定量和定性评估中,ElasticTTT 始终优于具有竞争力的基线——涵盖仅推理、测试时微调和基于训练的方法——最终在视频编辑方面实现了最先进的性能。

2 相关工作

2.1 扩散模型的测试时微调

测试时微调 (TTT) [63, 65] 在推理时更新预训练的扩散模型,用于定制化和个人化生成 [4, 12, 35, 58]、风格化生成 [8, 59, 68, 76] 以及测试时扩展 [45] 等任务。对于生成式编辑,TTT 通过重建特定的参考视频 [69] 来建立高保真锚点,以便进行后续修改,但在单个参考视频上直接优化模型往往会退化性能 [58]。先前的工作试图通过低秩适应 [12, 13]、额外的先验保持损失 [58]、仅优化文本嵌入 [12] 或空文本嵌入 [49],或引入自监督信号 [66] 来缓解这一问题。然而,这些干预措施并未完全解决问题,特别是在高度参数化的文本到视频模型 [64] 上,往往导致遵循新编辑指令与保留源视频细节之间的零和妥协。

2.2 视频编辑

视频编辑要求在保留源视频未编辑结构的同时,无缝集成新的语义概念或修改现有特征。现有方法通常分为三类范式。基于训练的方法 [2, 5, 17, 38, 70, 71, 75, 78] 在配对数据集上微调视频生成模型,但面临严重的数据稀缺、对新概念的泛化能力有限以及训练所需的大量计算资源等问题。免训练方法 [1, 10, 15, 26, 33, 34, 42, 72] 通过利用逆扩散方法 [47, 60] 利用预训练先验来绕过数据需求,通常包括操纵注意力图 [36, 42, 48] 或利用预训练图像编辑模型 [13, 33, 42, 52],但由于固定的模型参数和采样轨迹长度,本质上难以平衡语义对齐和参考保留。测试时微调 (TTT) 方法 [16, 24, 43, 69] 通过在源视频上直接微调基础模型来弥合这一差距,在不涉及外部数据集的情况下提高源重建能力。然而,直接将 TTT 应用于视频编辑会遇到先验崩溃问题,我们在工作中为此提供了系统性的解决方案。更多细节

第 4 页

清华大学 | 4

图 2. ElasticTTT 的整体流程。为了解决条件崩溃(Conditioning Collapse),我们在训练期间通过目标分布正则化(TDR)软化优化目标,并在采样期间通过对比无分类器引导(Contrastive CFG)使采样过程远离源分布。为缓解空间纠缠(Spatial Entanglement),我们执行异步噪声调度(Asynchronous Noise Scheduling),为不同区域建立独立的积分轨迹。

相关工作见补充材料。

3 方法

给定源视频 $V_{src}$ 及其对应的描述性文本提示 $C_{src}$,视频编辑的目标是生成与用户提供的目标提示 $C_{trg}$ 对齐的目标视频 $V_{trg}$,同时保留 $V_{src}$ 的基本结构和时间动态。标准视频编辑模型使用冻结参数 $\theta$ 从固定的条件分布 $p_\theta(V_{trg} | V_{src}, C_{trg})$ 中采样,而测试时微调(Test-Time Tuning, TTT)方法首先通过 $\theta' = \mathcal{A}(\theta; V_{src}, C_{src})$ 在源输入上适应模型参数,然后从实例适应分布 $p_{\theta'}(V_{trg} | V_{src}, C_{trg})$ 中采样,从而在期望的编辑提示下实现更强的身份保持和场景特定一致性。

具体而言,在第一阶段,模型在潜在空间中运行,并通过最小化预测速度 $v_\theta$ 与给定时间步 $t$ 的噪声潜在 $x_t$ 下的目标条件向量场 $u_t$ 之间的均方误差(MSE)损失,优化以重构源视频潜在 $x_0$:

$L_{TTT} = \mathbb{E}_{t, x_t} \| v_\theta(x_t, t, C_{src}) – u_t(x_t | x_0) \|^2$ (1)

模型微调完成后,推理从通过 DDIM 反转 [60] 获得的噪声潜在开始,利用目标提示 $C_{trg}$ 指导 $V_{trg}$ 的生成。

3.1 优化-采样张力

虽然标准 TTT 捕捉了参考视频的空间-时间特征,但它与扩散模型的生成本质引入了根本性的不匹配。扩散模型学习数据分布之间的映射,并依赖多样化的样本来保持生成灵活性。然而,在 TTT 中,训练数据的分布坍缩为单个实例,实质上退化为狄拉克 delta 分布,即 $p(x) = \delta(x – x_0)$。

第 5 页

清华大学 | 5

图 3. 一个二维玩具实验,展示了 TDR 和对比无分类器引导(Contrastive CFG)的效果。在标准 TTT 中,基础模型的生成分布(A)会围绕优化目标(B)发生崩溃,而在应用 CFG 时则分散至混沌状态(C, D)。引入 TDR 后,生成分布保持其原始结构(F),而对比 CFG 进一步抵消了引入的分布偏移(G, H)。

在如此单点分布上优化高度参数化的扩散模型,很容易导致一种我们称之为“先验崩溃”(Prior Collapse)的失效模式:模型过度拟合源视频的高频像素级细节,优先考虑精确重建而非可泛化的条件感知去噪。我们进行了一项说明性实验来考察这一现象,如图 3 所示:基础扩散模型在包含 25 个类别的分布上进行训练(A),并在中心类别的一个样本上执行 TTT。当我们在其他类别条件下进行推理时,模型简单地绕过条件,围绕记忆的目标分布生成一个混沌簇(B)。

形式上,在视频扩散模型中,网络基于噪声潜在变量 $x_t$ 和文本条件 $C_{src}$ 预测速度场 $v_\theta(x_t, t, C_{src})$。尽管大型预训练模型并未完全崩溃先验分布,但它仍逐渐学会绕过 $x_t$ 和 $C_{src}$ 中的有意义变化,而是将源视频的高频细节硬编码到其参数中,从而降低了跨两个模态的编辑性能:

• 条件崩溃(Conditioning Collapse)通过在静态文本提示 $C_{src}$ 上反复更新,模型逐渐削弱了文本条件路径。这导致模型在推理期间忽略目标提示 $C_{trg}$,丧失语义弹性,锚定于源概念而非遵循新的文本指导(图 1 第一行)。

• 空间纠缠(Spatial Entanglement)通过越来越多地绕过噪声输入 $x_t$ 以记忆全局目标,模型降低了从 $x_t$ 中提取语义有意义的空间表示的能力。因此,不同的语义对象失去了边界,导致在尝试编辑特定区域时出现严重的视觉损坏和纠缠(图 1 第二行)。

重要的是,先验崩溃并不等同于过拟合:TTT 有意鼓励受控过拟合以捕捉源特征,而先验崩溃代表了一种生成行为崩溃且编辑可控性丧失的退化状态。

为了解决这一根本性的不匹配,我们提出了 ElasticTTT,这是一种新颖的流水线,旨在保留

第 6 页

清华大学 | 6

生成先验。我们通过将优化目标软化为连续局部分布(第 3.2 节)来缓解训练过程中的条件崩溃(Conditioning Collapse),并通过对比无分类器引导(Contrastive Classifier-Free Guidance,第 3.3 节)解决因排斥生成结果远离源条件而引发的剩余条件偏差。我们在推理过程中通过异步噪声水平动态处理不同区域(第 3.4 节)来解决空间纠缠(Spatial Entanglement)。以下章节详细阐述这三种方法的公式推导。

3.2 目标分布正则化:逃离狄拉克奇点 标准测试时微调(TTT)中先验崩溃(Prior Collapse)的根本原因在于目标数据狄拉克 delta 分布 $p_{data}(x) = \delta(x – x_0)$ 的刚性和确定性本质。为了防止生成先验坍缩到这一尖锐奇点,我们引入了目标分布正则化(Target Distribution Regularization, TDR)。TDR 的核心见解是仅在优化目标中注入受控的随机性,同时保持输入轨迹完全干净。具体而言,给定干净源视频 $x_0$ 和标准高斯噪声样本 $x_1 \sim \mathcal{N}(0, I)$,我们按照标准流匹配的方式构建中间噪声潜在变量 $x_t = tx_1 + (1 – t)x_0$。然而,在计算用于监督的目标速度时,我们用扰动版本 $\tilde{x}_0$ 替换确定性目标 $x_0$:

$\tilde{x}_0 = x_0 + \epsilon_{reg}, \quad \epsilon_{reg} \sim \mathcal{N}(0, \sigma^2_{reg}I) \quad (2)$

由此得到更新后的优化目标 $u_t(x_t|\tilde{x}_0) = x_1 – \tilde{x}_0$。注意,模型输入 $x_t$ 使用原始未扰动的 $x_0$ 进行插值,且与 $\epsilon_{reg}$ 完全独立。关键在于,这种随机性注入并未改变模型的根本优化目标。在原始流匹配框架 [41] 中,网络被训练以预测速度场的条件期望:

$v^*(x_t, t) = \arg \min_{v} \mathbb{E}_{t, x_0, x_1} \|v(x_t, t) – u_t(x_t | x_0)\|^2 = \mathbb{E}_{x_0|x_t} [u_t(x_t | x_0)] \quad (3)$

由于标准流匹配路径构建的速度场相对于目标数据是线性的(即 $u_t(x_t|\tilde{x}_0) = x_1 – \tilde{x}_0 = x_1 – x_0 – \epsilon_{reg} = u_t(x_t|x_0) – \epsilon_{reg}$),训练网络 $v_\theta$ 预测此扰动速度场会导致新的最优向量场 $\tilde{v}^*(x_t, t)$ 评估为:

$\tilde{v}^*(x_t, t) = \mathbb{E}_{x_0, \epsilon_{reg}|x_t} [u_t(x_t | \tilde{x}_0)] = \mathbb{E}_{x_0, \epsilon_{reg}|x_t} [u_t(x_t | x_0) – \epsilon_{reg}] \quad (4)$ $= \mathbb{E}_{x_0|x_t} [u_t(x_t | x_0)] – \mathbb{E}_{\epsilon_{reg}} [\epsilon_{reg}] = v^*(x_t, t) \quad (5)$

注入的噪声 $\epsilon_{reg}$ 以零均值独立采样,确保扰动在期望上保持无偏。因此,我们正则化目标的全局最小值与原始视频的真实向量场完美对齐。 如图 3 中的玩具实验所示,TDR 模型的生成并未产生坍缩分布(B),而是保留了先验分布的结构(F),突显了引入随机性的重要性。尽管期望目标保持不变,但方差 $\sigma^2_{reg}$ 从根本上改变了优化动态。通过将严格的狄拉克 delta 点替换为连续局部高斯流形,我们在损失景观中引入了几何感知的方差惩罚。模型不再通过懒惰地记忆无限尖锐、刚性的空间映射到 $x_0$ 来最小化损失。相反,它学习保持作为去噪模型的弹性属性,并寻求更广泛、泛化的最小值。因此,即使在大量微调步骤后,模型仍能稳健地遵循目标文本提示,显著提高了编辑灵活性并稳定了 TTT 过程。更数学化的解释见补充材料 A 节。

3.3 对比无分类器引导: 如图 3 (F) 所示,在应用 TDR 后,尽管先验分布的结构得以保留,但生成的点仍被拉近到 TTT 训练中训练的源分布。同样的现象发生在

第 7 页

清华大学 | 7

图 4. DiT 潜在表示的 PCA [22] 可视化。当在不使用 Async-NS 的情况下应用 TTT 时,表示变得模糊,且模型无法捕捉参考视频的结构。Async-NS 使模型能够提取清晰、对齐的表示

在视频扩散模型中:经过 TDR 后,模型不再绕过 Csrc 并完全记忆参考视频,但生成的分布仍向源分布偏移,显示出渲染参考视频中引入的概念的趋势。

为了进一步抵消分布偏移,并解耦在训练期间植入模型中的源视频概念,我们提出了对比无分类器引导(Contrastive Classifier-Free-Guidance),这是一种增强型的无分类器引导(CFG),它积极利用源条件作为负约束。标准 CFG [19] 试图通过创建条件预测和无条件预测之间的分布偏移来引导生成:

ˆvθ(xt, t, Ctrg) = vθ(xt, t, Cneg) + λ (vθ(xt, t, Ctrg) −vθ(xt, t, Cneg)) (6)

其中 Cneg 通常是空提示或通用负提示,λ 是引导尺度。为了进一步抑制嵌入的优化偏差,我们将此引导扩展为三向公式。我们通过引入利用原始源提示 Csrc 的次要负约束,明确地将目标与源进行对比,从而在两者之间建立语义对立:

ˆvθ(xt, t, Ctrg) = vθ(xt, t, Cneg) + λ1 (vθ(xt, t, Ctrg) −vθ(xt, t, Cneg)) + λ2 (vθ(xt, t, Ctrg) −vθ(xt, t, Csrc)) (7)

其中 λ1 控制标准无条件引导,λ2 控制源条件和目标条件之间语义对比的强度。

通过对比这两个条件,对比 CFG 隔离并放大了它们之间的语义差异,将采样目标从源分布中排斥出去。如图 3 所示,应用标准 CFG(G)——它仅将速度拉向目标条件——由于记忆源的残余引力,生成的分布仅发生微小偏移。相比之下,我们的对比 CFG(H)积极将生成过程从源概念中排斥出去。这种主动对比保证了清晰的语义转换,并完全恢复了模型的生成弹性。

3.4 异步噪声调度 (Async-NS)

虽然 TDR 和对比 CFG 解决了条件崩溃(Conditioning Collapse),但微调后的网络仍然容易受到空间纠缠(Spatial Entanglement)的影响。由于微调后的网络学会绕过噪声输入 xt 并直接记忆 x0,它无法提取局部、语义丰富的空间表示。如图 4 (C) 所示,在推理过程中,表示变得模糊且与源视频不对齐,前景和背景严重纠缠。

许多现有方法试图通过修改注意力图 [36, 79]、使用预编辑图像作为引导 [13, 33, 42] 或在优化阶段使用掩码进行干预 [13, 66] 来缓解空间纠缠。然而,这些复杂的方法往往会损害全局结构的一致性。相比之下,我们提出了异步噪声调度(Async-NS),这是一种推理时策略,通过解耦编辑区域和锚定区域的积分轨迹,干净地规避了空间纠缠。

第 8 页

清华大学 | 8

我们的核心见解是,时间均匀性加剧了空间纠缠。在单一时间步 $t$ 评估整个潜在变量会使网络退化为依赖其记忆输出的状态。通过显式地为编辑区域和锚定区域分配不同的噪声水平和时间嵌入,我们从物理上打破了表示的纠缠。如图 4 (B) 所示,这种时间不对称性迫使网络对区域进行区分处理,立即恢复了清晰的表示边界。此外,这种解耦天然契合不同区域的生成需求:编辑区域接收高噪声机制 ($T_e$),以便灵活渲染新概念;而保留区域被限制在低噪声机制 ($T_p$) 中,该机制携带来自源视频的最大信息。

我们定义逐帧掩码 $M$,既可通过手动输入以确保准确性,也可通过自动分割模型以获取便利性,用于标记编辑区域。随后将 $M$ 下采样以匹配潜在分辨率,并在空间上平滑为连续过渡图 $\tilde{M} \in [0, 1]$,以在潜在空间中自然化概念边界。我们定义两个异步噪声调度:$\{t_i^e\}_{i=1}^N$ 和 $\{t_i^p\}_{i=1}^N$,其中 $t_N(\cdot) = T(\cdot)$ 且 $t_1(\cdot) = 0$。采样从初始潜在变量 $\hat{x}_N$ 开始,这是具有混合噪声水平的源视频潜在变量的噪声版本,在每一步 $i$,异步更新在空间上融合:

$$ \begin{aligned} \hat{x}_N &= \tilde{M} \odot x_{T_e} + (1 – \tilde{M}) \odot x_{T_p} \\ \hat{x}_{i-1} &= \tilde{M} \odot (\hat{x}_i – \hat{v} \Delta t_i^e) + (1 – \tilde{M}) \odot (\hat{x}_i – \hat{v} \Delta t_i^p) \quad (8) \end{aligned} $$

其中 $\hat{v}$ 表示由对比无分类器引导 (Contrastive CFG) 预测的最终速度,其输入为 $t_i^e$ 和 $t_i^p$ 的空间混合时间步嵌入:

$$ \hat{v} = \hat{v}_\theta(\hat{x}_i, t_i, C_{\text{trg}}), \quad t_i = \tilde{M} \odot t_i^e + (1 – \tilde{M}) \odot t_i^p \quad (9) $$

通过打破全局时间同步,异步噪声调度 (Async-NS) 为模型提供了具有不同噪声水平和时间步嵌入的清晰、解耦的空间潜在表示。同时,这种公式还赋予模型局部自由度,使其能够沿着更长的积分路径激进地覆盖目标概念,同时沿着受限的确定性路径安全地将未编辑的背景引导回其精确的物理状态。

4 实验

4.1 实验设置 为了验证 ElasticTTT 的有效性和鲁棒性,我们进行了广泛的实验,并将其与多种视频编辑模型进行了比较。我们使用 Wan2.1 1.3B [64] 作为基础模型,并使用低秩自适应 (LoRA) [23] 进行 100 步的测试时微调 (TTT)。我们将目标分布正则化 (TDR) 方差设置为 $\sigma_{\text{reg}} = 0.2$,无分类器引导 (CFG) 引导尺度设置为 $\lambda_1 = 6, \lambda_2 = 2$,不同的噪声机制设置为 $T_p = 0.55, T_e = 0.97$。分割掩码 $M$ 由分割模型 Grounded-SAM2 [57] 结合视觉语言模型 Qwen3-VL-32B [3] 自动生成,以指定编辑概念。所有实验均在单块 Nvidia pro6000 GPU 上进行,与原始 TTT 相比,我们的完整方法仅引入了约 7% 的推理时间开销(其中对比无分类器引导贡献约 5%,异步噪声调度贡献约 2%)。更多实现细节以及针对这些超参数的敏感性分析(验证了方法的鲁棒性)见补充材料 B 节。

4.1.1 评估数据集 先前的工作 [15, 36, 39, 40, 48, 73] 通过从 Davis 数据集 [7, 54, 55] 中选择文本-视频对来构建测试集。然而,要么他们的数据未发布 [15, 27],要么选择仅包含有限的编辑任务类型 [42]。因此,我们选择遵循通用协议自行构建测试集,包括 125 个文本-视频对。为了进行全面评估,我们的测试集涵盖了五种

第 9 页

清华大学 | 9

表 1. 与先前视频编辑方法的定量比较。最佳结果以红色高亮,次佳结果以蓝色高亮。* 表示该方法使用我们的配置重新实现。

方法 VBench↑ CLIP-T↑ VEBench↑ VQ↑ IA↑ SP↑ OVL↑

其他方法 AnyV2V[33] 4.80 30.21 0.53 3.51 5.89 2.30 4.31 Ground-A-Video[26] 4.89 28.51 0.13 3.57 4.49 2.42 3.90 Token-flow[15] 4.82 29.69 0.67 4.47 5.57 4.30 4.83 Ditto [2] 4.88 28.93 0.60 5.48 5.95 3.32 5.62 Flow-align [30] 4.93 27.72 0.61 5.28 5.44 7.23 5.44 Uniedit [1] 4.31 31.76 0.64 3.87 6.51 0.54 5.04

测试时微调方法 Tune-A-Video* [69] 5.00 28.40 0.72 5.34 6.15 3.63 5.39 VidTTA*[66] 4.98 28.47 0.72 5.00 5.76 4.42 5.08 ElasticTTT 4.98 29.58 0.72 6.19 7.50 5.23 6.68

不同类型的任务,具体包括:主体编辑、背景编辑、主体添加、颜色调整和通用编辑。我们将通用编辑定义为在仅保留参考主体的一般运动动态的同时,重建视频中的所有视觉元素。当目标是保留电影构图(或摄像机运动)而非视觉内容时,这种编辑模式特别有价值。我们将发布我们的选择,以促进未来工作公平且全面的基准测试。

4.1.2 先前方法 我们将 ElasticTTT 与几个强大的视频编辑基线进行比较:FlowAlign [30]、UniEdit [1]、Ditto [2]、VidTTA [66]、TokenFlow [15]、AnyV2V [33]、Tune-A-Video [69] 和 Ground-A-Video [26]。这一选择代表了广泛的传统视频编辑范式,包括免训练方法 [1, 15, 26, 30]、首帧引导方法 [33]、基于大规模训练的方法 [2] 以及其他测试时微调 (TTT) 方法 [66, 69]。值得注意的是,为了确保与基于 TTT 的基线进行公平比较,我们使用与 ElasticTTT 完全相同的配置重新实现了 Tune-A-Video [69] 和 VidTTA [66],包括基础模型、训练和推理的所有设置。

4.1.3 评估指标 我们使用全面的客观和主观指标套件来评估 ElasticTTT 和基线模型。 自动指标。遵循标准评估协议 [1, 2, 67, 69],我们计算 CLIP 相似度以衡量编辑视频与目标提示之间的语义对齐。此外,我们结合了视频生成和编辑基准中既定的指标。我们包括来自 VBench [25] 的指标,以评估生成视频的整体视觉质量和时间一致性。具体而言,我们在分别归一化后平均了 6 个 VBench 指标,以对生成视频进行总体评估。此外,我们包括来自 VEBench [6] 的指标,作为视频编辑质量的一般指示器。这些自动指标主要作为模型开发、消融分析和大规模基准测试的高效且可复现的信号。 基于裁判的评估。尽管传统定量指标效率很高,但它们往往无法捕捉细微的编辑要求,例如未编辑区域中的细粒度保留或复杂指令的遵循。为了解决这一局限性,我们利用先进的视觉推理

第 10 页

清华大学 | 10

图 5. 与其他方法的视觉对比。我们的方法严格遵循编辑指令,同时成功保留了未编辑区域的细节。

预训练大型视觉-语言模型 (VLM) 的能力。具体而言,我们提示 GPT-5 [51] 从四个维度评估生成的视频:(1) 视频质量 (VQ) 衡量生成视频的质量,独立于源视频和编辑指令;(2) 指令遵循 (IA) 衡量编辑提示的指令遵循能力;(3) 源视频保留 (SP) 衡量未编辑区域中源视频的保留程度;(4) 综合评分 (OVL),用于总体评估。 人工研究。我们进一步开展了涉及 10 名参与者的用户研究,他们独立地从相同的三个维度对每种方法进行评分:(1) 视频质量 (VQ);(2) 指令遵循 (IA);以及 (3) 源视频保留 (SP)。我们取这三个分数的平均值,以获得每个视频的总体人工评估结果。我们在评估集中为每个视频随机选择一个编辑指令,以构建用于人工评估的子集。参与者需对每个生成视频的各项标准给出 1 到 5 的评分。评估指标的更多细节见补充材料 C 节。

第 11 页

清华大学 | 11

4.2 与先前方法的比较 表 2. 人工评估结果。最佳结果以红色高亮,次佳结果以蓝色高亮。表 1 总结了 ElasticTTT 与竞争性基线方法之间的定量比较。总体而言,基于测试时微调(TTT)的方法优于主流视频编辑方法,因为它们能够适应每个输入视频的具体内容和时间动态。此外,ElasticTTT 在基于 TTT 的方法中实现了最强的性能,特别是在基于视觉语言模型(VLM)的评估中取得了显著增益,该评估从多个维度(VQ 6.19,IA 7.50,OVL 6.68)对视频编辑质量进行了全面且细粒度的评估。尽管某些基线在孤立指标上匹配或超过 ElasticTTT,但它们存在显著的权衡问题。例如,Flow-align 在未编辑区域的保留方面表现出色(SP 7.23),但在编辑弹性和指令遵循方面表现不佳(IA 5.44)。相反,Uniedit 实现了与目标指令的强语义对齐(由高达 31.76 的 CLIP-T 分数证明),但在保留方面失败(SP 0.54),严重扭曲了原始视频。如图 5 所示,ElasticTTT 既实现了精确的编辑遵循(船和河流,黑色石头),又实现了源保留(背景建筑,犀牛和树木),而其他方法则表现出明显的妥协。

如表 2 所示,人工评估结果有力地支持了我们的定量发现。ElasticTTT 取得了最高性能(平均 3.60),表明人类明显偏好其优于基线方法。它在编辑遵循(IA 3.32)方面表现尤为出色,并在视频质量(VQ 3.87)方面获得最高分。即使在 Flow-align 达到峰值的保留方面,ElasticTTT 也保持了强劲的次佳性能(SP 3.61),且没有观察到竞争模型中存在的严重权衡问题。此外,补充材料 D 部分提供的一项研究表明,人类志愿者评分与 VLM 评估之间存在高度一致性,证明了我们基于 VLM 的评估协议的合理性。

为了考察 ElasticTTT 是否泛化到更大的基础模型,我们在 Wan2.2-5B 上进一步进行了相同的实验,在相同设置下将我们的完整方法与 vanilla TTT 基线进行比较。如表 3 所示,ElasticTTT 在更大的 Wan2.2-5B 骨干网络上产生了一致且更显著的改进:它将总分从 4.91 提高到 7.00(+2.09),超过了在 Wan2.1-1.3B 上观察到的相应增益(+1.29,从 5.39 到 6.68)。改进在指令遵循(IA 5.09 → 7.75)和视频质量(VQ 5.05 → 6.47)方面最为明显,表明我们的目标分布正则化(TDR)和对比无分类器引导(CFG)有效地释放了更大模型更丰富的生成先验,否则这些先验会被 TTT 记忆所抑制。值得注意的是,配备 ElasticTTT 的 Wan2.2-5B 在所有配置中取得了最佳总分(OVL 7.00),表明我们的方法随着模型容量的增加而具有良好的可扩展性。我们观察到源保留(SP 4.40 → 3.68)略有下降,我们将其归因于更大模型中恢复的更强编辑弹性:它更积极地遵循编辑指令,

表 2. 人工评估结果。最佳结果以红色高亮,次佳结果以蓝色高亮。 方法 | VQ ↑ | IA ↑ | SP ↑ | Avg. ↑ —|—|—|—|— AnyV2V [33] | 2.50 | 2.61 | 2.48 | 2.54 Ground-A-Video [26] | 1.95 | 2.15 | 2.37 | 2.16 Token-flow [15] | 2.83 | 2.63 | 3.16 | 2.87 Uniedit [1] | 2.36 | 2.94 | 2.08 | 2.46 Ditto [2] | 3.85 | 3.20 | 3.07 | 3.37 Flow-align [30] | 3.73 | 2.82 | 3.81 | 3.45 ElasticTTT | 3.87 | 3.32 | 3.61 | 3.60

表 3. 泛化到更大的基础模型。最佳结果以红色高亮。 方法 | VQ↑ | IA↑ | SP↑ | OVL↑ —|—|—|—|— Wan2.2-5B-baseTTT | 5.05 | 5.09 | 4.40 | 4.91 Wan2.2-5B-ours | 6.47 | 7.75 | 3.68 | 7.00 Wan2.1-1.3B-baseTTT | 5.34 | 6.15 | 3.63 | 5.39 Wan2.1-1.3B-ours | 6.19 | 7.50 | 5.23 | 6.68

第 12 页

清华大学 | 12

图 6. 消融研究的可视化结果。

以边际保留为代价换取显著更好的语义对齐——这种权衡在整体质量上显然带来了收益。

4.3 消融研究

为了评估我们提出的各个设计组件的独立贡献,我们系统地移除了 ElasticTTT 流水线中的关键组件,进行了消融研究。表 4 中的定量结果和图 6 中的定性结果均证实,完整方法在各指标上实现了最佳平衡,并且在图 6 中表现出最佳性能。

省略 TDR 会对视频质量、编辑遵循度和整体得分产生负面影响。虽然移除它会使保留分数略有提升,但这以模型执行复杂编辑的能力为代价。如图 6 第一行所示,

表 4. 消融研究的定量结果。我们从完整模型中单独排除关键组件,并报告由此产生的性能。最佳结果以红色高亮显示。

| 方法 | VQ↑ | IA↑ | SP↑ | OVL↑ | | :— | :— | :— | :— | :— | | 无(基线) | 5.34 | 6.15 | 3.63 | 5.39 | | 无平滑过渡 | 6.07 | 7.37 | 5.09 | 6.56 | | 无 Async-NS | 5.62 | 6.55 | 3.50 | 6.23 | | 无 TDR | 6.13 | 7.45 | 5.36 | 6.64 | | 无对比 CFG | 6.06 | 7.01 | 5.64 | 6.52 | | 完整 (ElasticTTT) | 6.19 | 7.50 | 5.23 | 6.68 |

第 13 页

清华大学 | 13

若无目标分布正则化(TDR),模型仅能重建源视频,无法添加新概念(妻子、熊宝宝)。 移除对比无分类器引导(CFG)会导致编辑遵循度和整体性能显著下降。缺乏该机制时,模型难以完全遵循编辑提示,往往导致介于参考与目标之间的编辑不足中间状态。如图6第二行所示,缺少对比CFG会导致细微且难以区分的编辑,缺乏我们完整方法的视觉清晰度。 异步噪声调度(Async-NS)和额外的平滑过渡对于生成连贯视频至关重要。移除Async-NS会导致所有定量指标下降。定性来看,如图6第三行所示,没有Async-NS时,模型失去了准确隔离目标区域的能力,同时错误地修改了前景和背景。同时,使用平滑过渡图 $\tilde{M}$ 代替 $M$ 被证实是有益的,因为它带来了微小但明显的整体评分提升。

我们将这一显著差距(OVL 6.68 对比表5中的 4.71)归因于两个主要因素。首先,Async-NS 和重新实现的潜在混合在相同设置下,在 DiT 前向过程中引入了异步噪声。通过为编辑区域和保留区域分配不同的噪声水平和时间步嵌入,它在速度预测期间形成了不同的区域表示,从而减轻了测试时微调(TTT)引起的空间纠缠。相比之下,事后混合方法仅在预测后替换或混合潜在变量,因此无法防止前景/背景特征从一开始就被纠缠。

其次,此类方法僵化地硬性保留背景,这在真实视频编辑中被证明是适得其反的:未掩码区域通常需要进行柔和的物理调整,如阴影、灰尘、边界变形和接触效果。在不匹配的噪声水平下,将冻结的背景潜在变量强行拼接到编辑内容上,会产生可见的接缝和时间伪影,这解释了尽管潜在混合设计看似保守,但其保留分数(SP 1.08)却灾难性低的原因。Async-NS 则抑制了虚假的背景漂移,同时允许这些必要的交互——这是一种前向传递去同步机制,而非前向传递后的背景替换。

5 结论

在本文中,我们提出了 ElasticTTT,一种基于测试时微调的视频编辑框架。我们首先分析了 TTT 中刚性优化目标与扩散模型生成特性之间的内在张力所带来的先验崩溃现象。通过引入三种新技术:目标分布正则化、对比无分类器引导和异步噪声调度,我们解决了由先验崩溃引起的条件崩溃和空间纠缠问题,并在定量结果和人工评估中取得了最先进(SOTA)的性能。详细的消融研究量化了我们框架中每个关键组件的贡献。我们相信,我们的工作不仅代表了向更可靠的基于扩散的模型迈出的重要一步,也突出了设计更好个性化 AI 系统的有前景的方向。

参考文献

[1] J. Bai, T. He, Y. Wang, J. Guo, H. Hu, Z. Liu, and J. Bian. Uniedit: A unified tuning-free framework for video motion and appearance editing, 2025.

[2] Q. Bai, Q. Wang, H. Ouyang, Y. Yu, H. Wang, W. Wang, K. L. Cheng, S. Ma, Y. Zeng, Z. Liu,

第 14 页

清华大学 | 14

Y. Xu, Y. Shen, 和 Q. Chen. 使用高质量合成数据集扩展基于指令的视频编辑。arXiv 预印本 arXiv:2510.15742, 2025.

[3] S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, L. Deng, W. Ding, C. Gao, C. Ge, W. Ge, Z. Guo, Q. Huang, J. Huang, F. Huang, B. Hui, S. Jiang, Z. Li, M. Li, M. Li, K. Li, Z. Lin, J. Lin, X. Liu, J. Liu, C. Liu, Y. Liu, D. Liu, S. Liu, D. Lu, R. Luo, C. Lv, R. Men, L. Meng, X. Ren, X. Ren, S. Song, Y. Sun, J. Tang, J. Tu, J. Wan, P. Wang, P. Wang, Q. Wang, Y. Wang, T. Xie, Y. Xu, H. Xu, J. Xu, Z. Yang, M. Yang, J. Yang, A. Yang, B. Yu, F. Zhang, H. Zhang, X. Zhang, B. Zheng, H. Zhong, J. Zhou, F. Zhou, J. Zhou, Y. Zhu, 和 K. Zhu. Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631, 2025.

[4] X. Bi, J. Lu, B. Liu, X. Cun, Y. Zhang, W. Li, 和 B. Xiao. Customttt: 通过测试时训练实现运动和外观定制的视频生成。在人工智能会议论文集 (AAAI Conference on Artificial Intelligence) 中, 第 39 卷, 第 1871–1879 页, 2025.

[5] Y. Bian, Z. Zhang, X. Ju, M. Cao, L. Xie, Y. Shan, 和 Q. Xu. Videopainter: 具有即插即用上下文控制的任意长度视频修复与编辑, 2025.

[6] bingshuai liu, A. Wang, Z. Min, C. Lyu, L. Wang, 和 J. Su. VEBench: 迈向全面且自动化的文本引导视频编辑评估, 2025.

[7] S. Caelles, A. Montes, K.-K. Maninis, Y. Chen, L. Van Gool, F. Perazzi, 和 J. Pont-Tuset. 2018 年 Davis 视频对象分割挑战赛。arXiv 预印本 arXiv:1803.00557, 2018.

[8] J. Chung, S. Hyun, 和 J.-P. Heo. 扩散模型中的风格注入:一种无需训练的方法,用于将大规模扩散模型适配用于风格迁移。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中, 第 8795–8805 页, 2024.

[9] J. Cohen. 行为科学的统计功效分析(第 2 版。行为科学的统计功效分析, 1988.

[10] N. Cohen, V. Kulikov, M. Kleiner, I. Huberman-Spiegelglas, 和 T. Michaeli. Slicedit: 使用时空切片和文本到图像扩散模型进行零样本视频编辑。arXiv 预印本 arXiv:2405.12211, 2024.

[11] P. Foret, A. Kleiner, H. Mobahi, 和 B. Neyshabur. 锐度感知最小化以有效提高泛化能力。arXiv 预印本 arXiv:2010.01412, 2020.

[12] R. Gal, Y. Alaluf, Y. Atzmon, O. Patashnik, A. H. Bermano, G. Chechik, 和 D. Cohen-Or. 一张图片胜过千言万语:使用文本反转个性化文本到图像生成。 arXiv 预印本 arXiv:2208.01618, 2022.

[13] C. Gao, L. Ding, X. Cai, Z. Huang, Z. Wang, 和 T. Xue. Lora-edit: 通过掩码感知 LoRA 微调实现可控的首帧引导视频编辑。arXiv 预印本 arXiv:2506.10082, 2025.

[14] C. F. Gauss. 天体在圆锥截面绕日运动的理论, 第 7 卷。FA Perthes, 1877.

[15] M. Geyer, O. Bar-Tal, S. Bagon, 和 T. Dekel. Tokenflow: 用于一致视频编辑的一致扩散特征。在第十二届国际学习表征会议 (The Twelfth International Conference on Learning Representations) 上, 2024.

第 15 页

清华大学 | 15

[16] S. S. Harsha, A. Revanur, D. Agarwal, 和 S. Agrawal。Genvideo:使用 t2i 扩散模型进行一次性目标图像和形状感知视频编辑。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 研讨会论文集,第 7559–7568 页,2024 年 6 月。

[17] H. He, J. Wang, J. Zhang, Z. Xue, X. Bu, Q. Yang, S. Wen, 和 L. Xie。Openve-3m:用于指令引导视频编辑的大规模高质量数据集。arXiv 预印本 arXiv:2512.07826,2025 年。

[18] J. Ho, A. Jain, 和 P. Abbeel。去噪扩散概率模型。神经信息处理系统进展,33:6840–6851,2020 年。

[19] J. Ho 和 T. Salimans。无分类器扩散引导。arXiv 预印本 arXiv:2207.12598,2022 年。

[20] S. Hochreiter 和 J. Schmidhuber。平坦极小值。神经计算,9(1):1–42,1997 年。

[21] W. Hong, M. Ding, W. Zheng, X. Liu, 和 J. Tang。Cogvideo:通过 Transformer 进行文本到视频生成的大规模预训练。arXiv 预印本 arXiv:2205.15868,2022 年。

[22] H. Hotelling。将复杂统计变量分析为主成分。教育心理学杂志,24(6):417,1933 年。

[23] E. J. Hu, Y. Shen, P. Wallis, Z. Allen-Zhu, Y. Li, S. Wang, L. Wang, W. Chen 等。Lora:大语言模型的低秩自适应。Iclr,1(2):3,2022 年。

[24] Y. Huang, W. Xiong, H. Zhang, C. Chen, J. Liu, M. Yan, 和 S. Chen。Dive:驯化 DINO 以进行主体驱动的视频编辑。在 IEEE/CVF 国际计算机视觉会议论文集,第 16004–16014 页,2025 年。

[25] Z. Huang, Y. He, J. Yu, F. Zhang, C. Si, Y. Jiang, Y. Zhang, T. Wu, Q. Jin, N. Chanpaisit 等。VBench:视频生成模型的全面基准套件。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 21807–21818 页,2024 年。

[26] H. Jeong 和 J. C. Ye。Ground-a-video:使用文本到图像扩散模型进行零样本接地视频编辑。在第十二届学习表示国际会议,2024 年。

[27] K. Kahatapitiya, A. Karjauv, D. Abati, F. Porikli, Y. M. Asano, 和 A. Habibian。用于高效视频编辑的中心化扩散模型。在欧洲计算机视觉会议,第 91–108 页。Springer,2024 年。

[28] N. S. Keskar, D. Mudigere, J. Nocedal, M. Smelyanskiy, 和 P. T. P. Tang。关于深度学习的大批量训练:泛化间隙和尖锐极小值。arXiv 预印本 arXiv:1609.04836,2016 年。

[29] J. Kim, Y. Hong, J. Park, 和 J. C. Ye。Flowalign:轨迹正则化、无需反转的基于流的图像编辑。arXiv 预印本 arXiv:2505.23145,2025 年。

[30] J. Kim, Y. Hong, J. Park, 和 J. C. Ye。Flowalign:轨迹正则化、无需反转的基于流的图像编辑。在第十四届学习表示国际会议,2026 年。

第 16 页

清华大学 | 16

[31] D. P. Kingma 和 J. Ba。Adam:一种随机优化方法。arXiv 预印本 arXiv:1412.6980,2014。

[32] W. Kong, Q. Tian, Z. Zhang, R. Min, Z. Dai, J. Zhou, J. Xiong, X. Li, B. Wu, J. Zhang 等人。Hunyuanvideo:大型视频生成模型的系统性框架。arXiv 预印本 arXiv:2412.03603,2024。

[33] M. Ku, C. Wei, W. Ren, H. Yang 和 W. Chen。Anyv2v:用于任何视频到视频编辑任务的免微调框架。《机器学习研究汇刊》,2024。可复现性认证。

[34] V. Kulikov, M. Kleiner, I. Huberman-Spiegelglas 和 T. Michaeli。Flowedit:使用预训练流模型进行无需反演的基于文本的编辑。在《IEEE/CVF 国际计算机视觉会议论文集》中,第 19721–19730 页,2025。

[35] N. Kumari, B. Zhang, R. Zhang, E. Shechtman 和 J.-Y. Zhu。文本到图像扩散的多概念定制。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 1931–1941 页,2023。

[36] G. Kwon, J. Park 和 J. C. Ye。通过解耦自注意力注入统一编辑全景图、3D 场景和视频。arXiv 预印本 arXiv:2405.16823,2024。

[37] Y. LeCun, S. Chopra, R. Hadsell, M. Ranzato, F. Huang 等人。基于能量的学习教程。《预测结构化数据》,1(0),2006。

[38] M. Li, L. Lin, Y. Liu, Y. Zhu 和 Y. Li。Qffusion:通过象限网格注意力学习实现可控肖像视频编辑。《IEEE 可视化与计算机图形学汇刊》,2025。

[39] F. Liang, A. Kodaira, C. Xu, M. Tomizuka, K. Keutzer 和 D. Marculescu。向后看:使用特征库进行流式视频到视频转换。在《第十三届国际学习表征会议》中,2025。

[40] F. Liang, B. Wu, J. Wang, L. Yu, K. Li, Y. Zhao, I. Misra, J.-B. Huang, P. Zhang, P. Vajda 等人。Flowvid:驯服不完美的光流以实现一致的视频到视频合成。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 8207–8216 页,2024。

[41] Y. Lipman, R. T. Q. Chen, H. Ben-Hamu, M. Nickel 和 M. Le。用于生成建模的流匹配。在《第十一届国际学习表征会议》中,2023。

[42] C. Liu, R. Li, K. Zhang, Y. Lan 和 D. Liu。Stablev2v:稳定视频到视频编辑中的形状一致性。《IEEE 电路与系统视频技术汇刊》,2025。

[43] S. Liu, Y. Zhang, W. Li, Z. Lin 和 J. Jia。Video-p2p:通过交叉注意力控制进行视频编辑。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 8599–8608 页,2024。

[44] I. Loshchilov 和 F. Hutter。解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101,2017。

[45] N. Ma, S. Tong, H. Jia, H. Hu, Y.-C. Su, M. Zhang, X. Yang, Y. Li, T. Jaakkola, X. Jia 等人。超越去噪步数扩展的扩散模型推理时扩展。arXiv 预印本 arXiv:2501.09732,2025。

第 17 页

清华大学 | 17

[46] S. Mandt, M. D. Hoffman, 和 D. M. Blei. 随机梯度下降作为近似贝叶斯推断. Journal of Machine Learning Research, 18(134):1–35, 2017.

[47] C. Meng, Y. He, Y. Song, J. Song, J. Wu, J.-Y. Zhu, 和 S. Ermon. Sdedit: 通过随机微分方程引导图像合成与编辑. arXiv 预印本 arXiv:2108.01073, 2021.

[48] T. H. S. Meral, H. Yesiltepe, C. Dunlop, 和 P. Yanardag. Motionflow: 视频扩散模型中的注意力驱动运动迁移. arXiv 预印本 arXiv:2412.05275, 2024.

[49] R. Mokady, A. Hertz, K. Aberman, Y. Pritch, 和 D. Cohen-Or. 使用引导扩散模型编辑真实图像的零文本反演. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 6038–6047 页, 2023.

[50] C. Mou, M. Cao, X. Wang, Z. Zhang, Y. Shan, 和 J. Zhang. Revideo: 通过运动和内容控制重制视频. 神经信息处理系统进展, 37:18481–18505, 2024.

[51] OpenAI. Gpt-5 系统卡片, 2025.

[52] W. Ouyang, Y. Dong, L. Yang, J. Si, 和 X. Pan. I2vedit: 通过图像到视频扩散模型进行首帧引导的视频编辑. CoRR, abs/2405.16537, 2024.

[53] W. Peebles 和 S. Xie. 基于 Transformer 的可扩展扩散模型. 在 IEEE/CVF 国际计算机视觉会议论文集, 第 4195–4205 页, 2023.

[54] F. Perazzi, J. Pont-Tuset, B. McWilliams, L. Van Gool, M. Gross, 和 A. Sorkine-Hornung. 视频对象分割的基准数据集与评估方法. 在 IEEE 计算机视觉与模式识别会议论文集, 第 724–732 页, 2016.

[55] J. Pont-Tuset, F. Perazzi, S. Caelles, P. Arbeláez, A. Sorkine-Hornung, 和 L. Van Gool. 2017 年 Davis 视频对象分割挑战赛. arXiv 预印本 arXiv:1704.00675, 2017.

[56] A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark 等人. 从自然语言监督中学习可迁移视觉模型. 在国际机器学习会议论文集, 第 8748–8763 页. PmLR, 2021.

[57] N. Ravi, V. Gabeur, Y.-T. Hu, R. Hu, C. Ryali, T. Ma, H. Khedr, R. Rädle, C. Rolland, L. Gustafson, E. Mintun, J. Pan, K. V. Alwala, N. Carion, C.-Y. Wu, R. Girshick, P. Dollár, 和 C. Feichtenhofer. Sam 2: 图像与视频中的分割任意对象. arXiv 预印本 arXiv:2408.00714, 2024.

[58] N. Ruiz, Y. Li, V. Jampani, Y. Pritch, M. Rubinstein, 和 K. Aberman. Dreambooth: 针对主体驱动生成的文本到图像扩散模型微调. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 22500–22510 页, 2023.

[59] K. Sohn, N. Ruiz, K. Lee, D. C. Chin, I. Blok, H. Chang, J. Barber, L. Jiang, G. Entis, Y. Li 等人. Styledrop: 任何风格下的文本到图像生成. arXiv 预印本 arXiv:2306.00983, 2023.

[60] J. Song, C. Meng, 和 S. Ermon. 去噪扩散隐式模型. arXiv 预印本 arXiv:2010.02502, 2020.

[61] Y. Song 和 S. Ermon. 通过估计数据分布梯度进行生成建模. 神经信息处理系统进展, 32, 2019.

第 18 页

清华大学 | 18

[62] Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon, 和 B. Poole. 通过随机微分方程进行基于分数的生成建模. arXiv 预印本 arXiv:2011.13456, 2020.

[63] Y. Sun, X. Wang, Z. Liu, J. Miller, A. Efros, 和 M. Hardt. 用于分布偏移下泛化的自监督测试时训练. 在国际机器学习会议, 第 9229–9248 页. PMLR, 2020.

[64] Team Wan, A. Wang, B. Ai, B. Wen, C. Mao, C.-W. Xie, D. Chen, F. Yu, H. Zhao, J. Yang, J. Zeng, J. Wang, J. Zhang, J. Zhou, J. Wang, J. Chen, K. Zhu, K. Zhao, K. Yan, L. Huang, M. Feng, N. Zhang, P. Li, P. Wu, R. Chu, R. Feng, S. Zhang, S. Sun, T. Fang, T. Wang, T. Gui, T. Weng, T. Shen, W. Lin, W. Wang, W. Wang, W. Zhou, W. Wang, W. Shen, W. Yu, X. Shi, X. Huang, X. Xu, Y. Kou, Y. Lv, Y. Li, Y. Liu, Y. Wang, Y. Zhang, Y. Huang, Y. Li, Y. Wu, Y. Liu, Y. Pan, Y. Zheng, Y. Hong, Y. Shi, Y. Feng, Z. Jiang, Z. Han, Z.-F. Wu, 和 Z. Liu. Wan: 开放且先进的大规模视频生成模型, 2025.

[65] D. Wang, E. Shelhamer, S. Liu, B. Olshausen, 和 T. Darrell. Tent: 通过熵最小化实现完全测试时自适应. arXiv 预印本 arXiv:2006.10726, 2020.

[66] J. Wang, Y. Chen, Y. He, X. Song, Y. Xin, D. Zhang, Z. Wan, B. Li, 和 R. Zhang. 用于鲁棒视频编辑的低成本测试时自适应. arXiv 预印本 arXiv:2507.21858, 2025.

[67] Z. Wang 和 J. Tang. T3v2v: 视频到视频编辑中领域适应的测试时训练. 在 CVPR 2025 研讨会, 用于创意视觉内容生成、编辑和理解的 AI.

[68] Z. Wang, L. Zhao, 和 W. Xing. Stylediffusion: 通过扩散模型进行可控解耦风格迁移. 在 IEEE/CVF 国际计算机视觉会议论文集, 第 7677–7689 页, 2023.

[69] J. Z. Wu, Y. Ge, X. Wang, S. W. Lei, Y. Gu, Y. Shi, W. Hsu, Y. Shan, X. Qie, 和 M. Z. Shou. Tune-a-video: 针对文本到视频生成的图像扩散模型单样本微调. 在 IEEE/CVF 国际计算机视觉会议论文集, 第 7623–7633 页, 2023.

[70] Y. Wu, L. Chen, R. Li, S. Wang, C. Xie, 和 L. Zhang. Insvie-1m: 通过精心构建数据集实现有效的基于指令的视频编辑. 在 IEEE/CVF 国际计算机视觉会议论文集, 第 16692–16701 页, 2025.

[71] S. Yang, Z. Gu, L. Hou, X. Tao, P. Wan, X. Chen, 和 J. Liao. Mtv-inpaint: 多任务长视频修复. CoRR, abs/2503.11412, 2025 年 3 月.

[72] X. Yang, L. Zhu, H. Fan, 和 Y. Yang. Eva: 零样本精确属性与多对象视频编辑. CoRR, abs/2403.16111, 2024.

[73] X. Yang, L. Zhu, H. Fan, 和 Y. Yang. Videograin: 调制时空注意力以实现多粒度视频编辑. 在第十三届国际学习表征会议, 2025.

[74] Z. Yang, J. Teng, W. Zheng, M. Ding, S. Huang, J. Xu, Y. Yang, W. Hong, X. Zhang, G. Feng, D. Yin, Yuxuan.Zhang, W. Wang, Y. Cheng, B. Xu, X. Gu, Y. Dong, 和 J. Tang. Cogvideox: 具有专家 Transformer 的文本到视频扩散模型. 在第十三届国际学习表征会议, 2025.

第 19 页

清华大学 | 19

[75] S. Yu, D. Liu, Z. Ma, Y. Hong, Y. Zhou, H. Tan, J. Chai, 和 M. Bansal。Veggie:基于接地生成的指令式编辑与推理视频概念。在 IEEE/CVF 国际计算机视觉会议论文集,第 15147–15158 页,2025。

[76] Y. Zhang, N. Huang, F. Tang, H. Huang, C. Ma, W. Dong, 和 C. Xu。基于扩散模型的基于反转的风格迁移。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 10146–10156 页,2023。

[77] B. Zi 等。Señorita-2m:由视频专家提供的高质量基于指令的通用视频编辑数据集。NeurIPS,2026。

[78] B. Zi, P. Ruan, M. Chen, X. Qi, S. Hao, S. Zhao, Y. Huang, B. Liang, R. Xiao, 和 K.-F. Wong。Señorita-2m:由视频专家提供的高质量基于指令的通用视频编辑数据集。arXiv 预印本 arXiv:2502.06734,2025。

[79] Z. Zuo, Z. Zhang, Y. Luo, Y. Zhao, H. Zhang, Y. Yang, 和 M. Wang。剪切与粘贴:通过注意力控制进行主体驱动的视频编辑。《神经网络》,181:106818,2025。

第 20 页

清华大学 | 20

这是论文《ElasticTTT:用于视频编辑的先验保持测试时微调》的补充材料。我们按如下方式组织内容:

A – 数学推导

B – 实验设置详情

C – 评估指标详情

D – 人类评估详情

E – 更多评估结果

F – VLM 与人类判断的相关性分析

G – VLM 判断的提示设计

H – 异步噪声调度掩码演示

I – 局限性与未来工作

J – 更多演示

K – 社会影响与伦理关切

A 数学推导

A.1 目标分布正则化

我们在第 3.2 节中证明,目标分布正则化(TDR)不改变扩散模型的优化目标。然而,它无法完全解释为何 TDR 能保持生成分布的整体结构。在此,我们从优化动力学的角度提供分析。具体而言,我们分析随机梯度的协方差,以展示标准测试时微调(TTT)为何容易退化为记忆化,以及我们提出的 TDR 如何隐式注入一种保持预训练生成先验的、感知几何结构的 Gauss-Newton 惩罚项。

A.1.1 设置与标准 TTT

令预训练网络的预测表示为 $v_\theta(x_t, t, C) \in \mathbb{R}^d$,由参数 $\theta \in \mathbb{R}^p$ 参数化,其中 $x_t$ 为噪声潜在变量,$t$ 为时间步,$C$ 表示文本条件。令真实的扩散目标为 $u_t$。在标准 TTT 期间,单个随机步的目标为 L2 损失:

$$ L(\theta) = \frac{1}{2} \| v_\theta(x_t, t, C) – u_t \|^2 \quad (10) $$

令瞬时误差向量为 $e_t(\theta) = v_\theta(x_t, t, C) – u_t \in \mathbb{R}^d$。我们将网络输出关于其参数的雅可比矩阵记为 $J_\theta = \nabla_\theta v_\theta(x_t, t, C) \in \mathbb{R}^{d \times p}$。

定义 1(随机梯度与协方差)。标准 TTT 单次迭代的随机梯度为 $g(\theta) = \nabla_\theta L = J_\theta^\top e_t(\theta)$。期望(真实)梯度为 $\bar{g} = \mathbb{E}_{t,\epsilon}[g(\theta)]$。该随机梯度的协方差矩阵定义为:

$$ \Sigma(\theta) = \mathbb{E}_{t,\epsilon} [(g(\theta) – \bar{g})(g(\theta) – \bar{g})^\top] \quad (11) $$

命题 1(标准 TTT 的先验崩溃)。假设高度过参数化的模型能够完美记忆目标 $x_0$。随着模型完美过拟合空间映射,瞬时误差消失($e_t(\theta) \to 0$),导致梯度协方差消失:$\Sigma(\theta) \to 0$。

第 21 页

清华大学 | 21

证明。根据定义,$g(\theta) = J_{\theta}^T e_t(\theta)$。由于模型完美拟合目标分布,$v_\theta(x_t, t, C) \to u_t$,导致 $e_t(\theta) \to 0$。因此,对于所有 $t$ 和 $\epsilon$,$g(\theta) \to 0 \Rightarrow \bar{g} \to 0 \Rightarrow \Sigma(\theta) \to 0$。

在随机梯度下降($d\theta = -\eta \bar{g} dt + \sqrt{\eta} \Sigma dW$)的随机微分方程(SDE)视角下 [46],项 $\Sigma$ 控制优化器的探索能力。当 $\Sigma \to 0$ 时,优化器失去所有探索能力,并不可逆地被困在一个尖锐奇点中,此时语义条件 $C$ 和先验 $x_t$ 被绕过,转而采用僵化的记忆。

A.1.2 目标分布正则化(TDR)

为防止先验崩溃,我们引入一个零均值的目标正则化项 $\epsilon_{reg} \sim \mathcal{N}(0, \sigma^2_{reg}I)$。正则化后的目标变为 $\tilde{u}_t = u_t + \epsilon_{reg}$,而输入 $x_t$ 保持严格不变。

命题 2(无偏期望梯度)。在目标分布正则化(TDR)下,期望梯度与标准测试时微调(TTT)的期望梯度严格相同:$\bar{g}_{TDR} = \bar{g}$。

证明。正则化随机梯度由下式给出:

$g_{TDR}(\theta) = J_{\theta}^T (v_\theta(x_t, t, C) – (u_t + \epsilon_{reg})) = g(\theta) – J_{\theta}^T \epsilon_{reg}$ (12)

对 $t$、$\epsilon$ 和独立噪声 $\epsilon_{reg}$ 取期望: $\mathbb{E}[g_{TDR}(\theta)] = \mathbb{E}_{t,\epsilon}[g(\theta)] – \mathbb{E}_{t,\epsilon} J_{\theta}^T \mathbb{E}_{\epsilon_{reg}}[\epsilon_{reg}]$ (13)

由于 $\epsilon_{reg}$ 是零均值的,第二项消失,从而得出 $\bar{g}_{TDR} = \bar{g}$。

命题 3(几何感知协方差注入)。在 TDR 下,梯度协方差矩阵解析分解为标准协方差加上一个与 $\sigma^2_{reg}$ 成正比的 Gauss-Newton 惩罚项:

$\Sigma_{TDR}(\theta) = \Sigma(\theta) + \sigma^2_{reg} \mathbb{E}_{t,\epsilon} J_{\theta}^T J_{\theta}$ (14)

证明。根据定义,新的协方差为:

$\Sigma_{TDR}(\theta) = \mathbb{E} [(g_{TDR}(\theta) – \bar{g})(g_{TDR}(\theta) – \bar{g})^T]$ (15)

将 $g_{TDR}(\theta) = g(\theta) – J_{\theta}^T \epsilon_{reg}$ 代入期望: $\Sigma_{TDR}(\theta) = \mathbb{E} \left[ (g – \bar{g}) – J_{\theta}^T \epsilon_{reg} \right] \left[ (g – \bar{g}) – J_{\theta}^T \epsilon_{reg} \right]^T$ $= \mathbb{E} (g – \bar{g})(g – \bar{g})^T – \mathbb{E} (g – \bar{g})\epsilon_{reg}^T J_{\theta}$ $- \mathbb{E} J_{\theta}^T \epsilon_{reg}(g – \bar{g})^T + \mathbb{E} J_{\theta}^T \epsilon_{reg}\epsilon_{reg}^T J_{\theta}$ (16)

由于 $\epsilon_{reg}$ 是零均值且与标准梯度分量 $g$ 和 $J_{\theta}$ 独立,两个交叉项的期望严格为零:

$\mathbb{E} (g – \bar{g})\epsilon_{reg}^T J_{\theta} = \mathbb{E}_{t,\epsilon} [(g – \bar{g})] \mathbb{E}_{\epsilon_{reg}}[\epsilon_{reg}^T] \mathbb{E}_{t,\epsilon}[J_{\theta}] = 0$ (17)

因此,总期望简化为剩余两项期望之和。注意到第一项正是标准协方差 $\Sigma(\theta)$ 的定义:

$\Sigma_{TDR}(\theta) = \Sigma(\theta) + \mathbb{E}_{t,\epsilon} J_{\theta}^T \mathbb{E}_{\epsilon_{reg}}[\epsilon_{reg}\epsilon_{reg}^T] J_{\theta}$ (18) 由于注入噪声的协方差为 $\mathbb{E}[\epsilon_{reg}\epsilon_{reg}^T] = \sigma^2_{reg}I$,该表达式严格计算为:

$\Sigma_{TDR}(\theta) = \Sigma(\theta) + \sigma^2_{reg} \mathbb{E}_{t,\epsilon} J_{\theta}^T J_{\theta}$ (19)

第 22 页

清华大学 | 22

命题 4(隐式雅可比惩罚)。TDR 注入与雅可比矩阵平方 Frobenius 范数成正比的优化器噪声,从数学上衡量参数空间的“尖锐度”[11, 20, 28]:

Tr(ΣTDR) = Tr(Σ) + σ²_reg E_{t,ε} ||J_θ||²_F (20)

证明。对公式 (19) 两边取迹可得。

项 E[J_θ^T J_θ] 是雅可比矩阵的非中心协方差,在 L2 损失下通常被视为 Hessian 矩阵的 Gauss-Newton 近似 [14]。如果网络试图形成退化的、刚性的空间奇点(绕过条件和先验以完美记忆 x0),雅可比范数 ||J_θ||²_F 会爆炸。 因此,即使经验损失趋近于零(ε_t → 0 且 Σ → 0),优化器仍会受到持续的、感知几何结构的噪声:σ²_reg ||J_θ||²_F。这种爆炸的协方差通过 SDE 布朗运动将优化器从尖锐极小值中猛烈弹出。为了收敛,网络在物理上被迫达到一个 ||J_θ||²_F 保持小而稳定的参数设置。原始的预训练生成先验,即预测速度在整个噪声分布上与真实值匹配, precisely 代表了这种所需的平坦配置。因此,TDR 并非通过改变全局期望梯度来禁止先验崩溃,而是使崩溃状态在物理上不可达。

A.2 对比无分类器引导 我们在第 3.3 节中声称,我们的对比无分类器引导(CFG)[19] 主动使生成分布远离源分布,克服了由单数据优化带来的分布偏移。本节提供对该机制的形式化贝叶斯分析,提供理论视角。我们将此机制表述为一种动态的、感知几何结构的滤波器,从数学上中和由 TTT 引起的分布偏移。

A.2.1 TTT 引力阱 为了阐明标准 CFG 在 TTT 后的失效,我们通过基于能量的模型(EBMs)[37, 61, 62] 的视角分析优化动力学。在扩散框架中,网络估计数据分布的得分函数 [61]:s_θ(x_t, C) = ∇_{x_t} log p_θ(x_t|C)。

定义 2(TTT 的能量景观)。令预训练基础模型描述隐式概率分布 p_base(x_t|C)。TTT 激进地优化网络以重建源视频轨迹 x_src,实质上迫使模型在给定源提示 C_src 条件时对 x_src 赋予最大似然。

命题 5(梯度偏置场)。在先验崩溃期间,TTT 通过引入高度局部的记忆峰值,结构性地移动基础分布。TTT 之后,生成分布发生偏移,偏移分布的得分分解为基础得分和加性梯度偏置场 ∇_{x_t} B(x_t)。

证明。由于神经网络是通用函数逼近器,过拟合的概率分布 p_θ* 可以分解为原始预训练先验和新的、由 TTT 诱导的记忆峰值:

1 p_θ*(x_t|C_src) = p_base(x_t|C_src) · p_mem(x_t) (21) Z

其中,当 TTT 损失收敛时,p_mem(x_t) 趋近于狄拉克 delta 函数 δ(x_t − x_src),Z 是保证 ∫ p_θ*(x_t|C_src)dx_t = 1 的正则化项。调优后的得分函数是对数似然

第 23 页

清华大学 | 23

该分解的梯度为:

sθ∗(xt, Csrc) = ∇xt log pbase(xt|Csrc) + ∇xt log pmem(xt) (22)

定义标量场 B(xt) = log pmem(xt),可得加性形式:

sθ∗(xt, Csrc) = sbase(xt, Csrc) + ∇xtB(xt) (23)

从数学上看,B(xt) 是在潜在空间中塑造出的一个深层的人工能量势阱。其梯度 ∇xtB(xt) 充当空间力向量,将潜在变量强力拉向源视频 xsrc。我们将此梯度偏差 ∇xtB(xt) 命名为源吸引子偏差(source attractor bias)。

A.2.2 TTT 偏差的语义泄漏 由于跨条件的参数共享,这个局部化的能量势阱在推理过程中不可避免地“泄漏”到其他提示条件中。

定义 3(条件依赖的 TTT 偏差)。我们将任意提示 C 的调整后评分函数定义为:由源吸引子偏差的条件依赖激活所改变的理想基础先验:

sθ∗(xt, C) = sbase(xt, C) + α(C)∇xtB(xt) (24)

其中 α(C) ∈[0, 1] 参数化激活强度。

命题 6(激活的语义比例性)。激活系数 α(C) 与查询提示 C 和调整后的源提示 Csrc 在文本嵌入空间中的语义相似度直接相关。

理由。在 TTT 期间,条件投影是专门针对 Csrc 的嵌入进行更新的。对于新提示 C,这些更新权重的触发取决于嵌入对齐,这可由余弦相似度很好地近似:α(C) ≈sim(C, Csrc)。这确立了三种不同的激活机制:源提示 (Csrc):相似度最大化 (sim = 1)。因此 α(Csrc) ≈1,完全激活重力势阱。 目标提示 (Ctrg):目标提示与源提示共享大量语义重叠(例如,共享主体)。因此,0 < α(Ctrg) < 1。这种严格的正性无意中导致部分坍缩至 TTT 重力势阱中。 负向提示 (Cneg):通用退化提示在语义上与源提示正交。因此 α(Cneg) ≈0,成功绕过过拟合参数。

A.2.3 通过对比无分类器引导进行主动抵消 为了逃离这个重力势阱并克服分布偏移,我们的对比无分类器引导(Contrastive CFG)将修改后的评分函数定义为:

sContraCFG(xt) = sθ∗(xt, Cneg) + λ1 (sθ∗(xt, Ctrg) −sθ∗(xt, Cneg)) + λ2 (sθ∗(xt, Ctrg) −sθ∗(xt, Csrc)) (25)

命题 7(标准 CFG 放大 TTT 偏差)。TTT 后应用的标准无分类器引导(CFG)本质上会放大源记忆,从而限制语义编辑。

第 24 页

清华大学 | 24

证明。将公式 (24) 代入标准 CFG 公式可得:

sStdCFG(xt) = sθ∗(xt, Cneg) + λ1 (sθ∗(xt, Ctrg) −sθ∗(xt, Cneg)) n o = sbase(xt, Cneg) + λ1 sbase(xt, Ctrg) −sbase(xt, Cneg)

| sbase, StdCFG(xt){z } n o + α(Cneg) + λ1 α(Ctrg) −α(Cneg) ∇xtB(xt)

n o ≈sbase, StdCFG(xt) + 0 + λ1 α(Ctrg) −0 ∇xtB(xt)

= sbase, StdCFG(xt) + λ1α(Ctrg)∇xtB(xt) (26)

由于 α(Cneg) ≈0,偏差简化为 λ1α(Ctrg)∇xtB(xt)。因为 λ1 ≫1,标准 CFG 激进地放大了残差偏差,误导生成轨迹朝向源吸引子偏差的方向。

命题 8(TTT 偏差的对比抵消)。对比引导项注入一个精确缩放的负梯度,在代数上抵消了放大的 TTT 偏差。

证明。评估对比引导项(缩放 λ2):

sθ∗(xt, Ctrg) −sθ∗(xt, Csrc) = (sbase(xt, Ctrg) −sbase(xt, Csrc)) + (α(Ctrg) −α(Csrc)) ∇xtB(xt) (27)

由于 TTT 严格过拟合 Csrc,我们有 α(Csrc) > α(Ctrg)。因此,偏差尺度严格为负。令 β = α(Csrc) −α(Ctrg) > 0,可得:

sθ∗(xt, Ctrg) −sθ∗(xt, Csrc) = (sbase(xt, Ctrg) −sbase(xt, Csrc)) −β∇xtB(xt) (28)

将此直接代回对比 CFG 公式(公式 (25)):

sContraCFG(xt) = sbase, ContraCFG(xt) + [λ1α(Ctrg) −λ2β] ∇xtB(xt) (29)

虽然标准 CFG 使生成过程承受着严重放大的源吸引子偏差,但对比项明确隔离了 TTT 重力场的几何结构,并以幅度 λ2β 减去它。通过适当缩放 λ2,净偏差系数 [λ1α(Ctrg)−λ2β] 评估为零,实现了 TTT 分布偏移的精确抵消,完全恢复了语义编辑能力,且未降低结构保真度。

B 实验设置细节

B.1 基线模型实现细节 在我们的主实验中,我们将提出的 ElasticTTT 方法与最近最先进的视频编辑方法进行了评估。为了全面评估性能,我们将基线分为两类:使用其官方开源配置的基线,以及我们重新实现以确保标准化比较的基线。 对于几个先前的模型——具体包括 AnyV2V [33]、Ground-A-Video [26]、Token-Flow [15]、Ditto [2] 和 UniEdit [1]——我们直接使用其官方开源代码和模型权重获取结果。我们严格遵守其官方实现中提供的默认超参数,保持输出视频长度和空间分辨率在其原始设置中不作修改。

第 25 页

清华大学 | 25

关于 AnyV2V,该框架需要一个专用的图像编辑模型来生成第一帧引导;为了与其原始论文保持一致,我们集成了 InstructPix2Pix 作为指定的编辑器。然而,依赖这些现成方法的一个显著局限性在于,它们的基础设置(如所选的基础模型)差异巨大。这种差异使得将它们与我们的方法进行直接比较的结论性较弱。

为了解决这一局限性并实现真正公平的比较,我们选取了若干最先进的免训练和测试时微调(Test-Time Tuning, TTT)编辑方法,并在与 ElasticTTT 相同的配置下重新实现了它们。具体而言,我们重新实现了 Flow-Align [29],使其成为一个与我们实验设置完全一致的极具竞争力的免训练基线。Flow-Align [29] 原本是一个最先进的免训练图像编辑框架,其方法论与模型无关,可以直接适配到新架构中。

尽管 Tune-A-Video [69] 和 VidTTA [66] 最初是为 3D-UNet 架构设计的,但它们的核心贡献与架构无关,可以轻松地适配到 Diffusion Transformer (DiT) 框架中。为了确保评估的公平性,我们将它们的主要机制移植到了 Wan2.1-1.3B [64] 架构中。此外,我们使这些重新实现的模型的所有关键超参数(如测试时微调步数、学习率)与 ElasticTTT 中使用的参数保持一致,以确保公平比较。

对于所有其他评估的基线模型,我们严格遵循其官方实现中提供的默认超参数。

B.2 ElasticTTT 的实现细节

关于我们的训练配置,我们将主要的测试时微调阶段与 LoRA-Edit [13] 建立的协议保持一致,具体将优化步数固定为 100 步。我们使用 AdamW [31, 44] 优化器,学习率设置为 3e-5。我们将扩散噪声调度的偏移量设置为 3.0,并在推理过程中使用 Euler 采样器进行 50 步采样。所有生成的视频均为 81 帧,分辨率为 480p,这与常见协议 [64] 保持一致。

在我们的消融研究中,展示目标分布正则化(Target Distribution Regularization, TDR)效果的视频样本是使用 300 步测试时微调(TTT)生成的,因为我们观察到该正则化机制在更长的优化过程中表现更有效。相反,展示对比无分类器引导(Contrastive Classifier-Free Guidance, CFG)和异步噪声调度(Asynchronous Noise Scheduling, Async-NS)消融效果的视觉示例是使用 70 步 TTT 获得的。对于与其他最先进方法的主要视觉比较,所有超参数均与我们定量评估中使用的参数保持一致。

第 4.1 节中引入的方法相关超参数是基于仅包含五个视频样本的最小验证集上的定性观察经验确定的。因为我们故意避免了详尽的网格搜索或系统的超参数优化以节省计算资源,当前的配置可能并非最优。因此,我们预计我们的方法在性能提升方面还有进一步的空间,这可以通过更严格的超参数搜索来释放。

为了进一步表征这些超参数如何影响性能,我们在测试集上评估了模型在不同设置下的表现,如表 6 所示,默认配置以红色显示。

总体而言,ElasticTTT 对 TDR 和 CFG 尺度表现出强大的鲁棒性。将 TDR 尺度从 0.1 变化到 0.3,总分变化不到 0.05(6.68–6.73),而任何非零设置都优于完全禁用 TDR(OVL 6.59),这证实了收益源于正则化本身,而非精心调整的方差。同样,所有测试的 CFG 尺度组合都保持在狭窄的范围内(6.63–6.75),表明对比引导在广泛的强度下均有效。值得注意的是,两个非默认设置(TDR 尺度 0.3,OVL 6.73;以及 CFG 尺度 6-3,OVL 6.75)略微超过了我们的默认配置,这佐证了上述因我们故意粗略选择超参数而留下的提升空间。

第 26 页

清华大学 | 26

表 6. 不同超参数设置下的总体得分 (OVL)。默认配置以红色显示。

TDR scale 0 0.1 0.2 0.3 OVL 6.59 6.69 6.68 6.73

CFG scale 5-3 6-3 6-2 6-1 OVL 6.69 6.75 6.68 6.63

Async-NS 0.95-0.5 0.97-0.6 0.97-0.55 0.95-0.55 OVL 4.59 4.71 6.68 4.62

相比之下,Async-NS 噪声机制 $(T_e, T_p)$ 是最敏感的超参数:偏离默认值 (0.97, 0.55) 会导致总体得分从 6.68 急剧下降至 4.6 左右。这是预期的,因为这两个阈值直接定义了编辑区域与保留区域之间的去同步程度——过高的 $T_p$ 会向保留区域注入过多噪声并破坏源结构,而过低的 $T_e$ 则无法为编辑区域提供足够的噪声以摆脱记忆中的源内容。

C 评估指标详情

表 7. VBench [25] 上六个指标的详细结果

Methods SC↑ BC↑ MS↑ DD↑ AQ↑ IQ↑

Other Methods Flow-align 0.900 0.910 0.971 0.960 0.519 67.056 Ditto 0.927 0.924 0.977 0.760 0.574 71.862 Uniedit 0.957 0.970 0.983 0.352 0.498 55.033 AnyV2V 0.850 0.906 0.937 0.928 0.526 65.215 Ground-A-Video 0.871 0.918 0.872 0.960 0.561 71.065 Token-flow 0.936 0.944 0.969 0.752 0.523 70.486

Test-Time-Tuning Methods Tune-A-Video 0.937 0.924 0.973 0.960 0.530 67.886 VidTTA 0.931 0.917 0.972 0.960 0.526 67.900 ElasticTTT 0.934 0.920 0.971 0.969 0.534 66.554

C.1 自动指标 我们提供所采用的自动评估协议的详细介绍。 CLIP-T. 为了量化生成的视觉内容与目标文本指令之间的对齐程度,我们测量 CLIP [56] 文本-图像相似度 (CLIP-T)。该指标利用预训练的 CLIP [56] 模型将文本和图像映射到共享的潜在空间。在我们的评估中,我们从每个视频序列中均匀采样 8 帧。跨模态相似度得分是通过计算每个单独帧的嵌入与编辑提示词的嵌入之间的余弦相似度独立计算的。最终报告的 CLIP-T 值是这 8 个独立帧级相似度得分的算术平均值。 VEBench. VEBench [6] 是一个主观对齐的基准套件,专门用于文本-

第 27 页

清华大学 | 27

驱动的编辑视频质量评估。传统的客观指标往往难以与人类感知保持一致;为了克服这一局限,VEBench 采用了一个专用的多模态质量评估网络(VE-Bench QA)。该专用网络不依赖通用的视觉-语言模型,而是通过同时建模三个关键组件来评估编辑视频:源视频与编辑视频之间的内在联系和相关性(源-目标关系)、编辑视频与驱动文本提示之间的对齐程度,以及美学和失真等整体视觉质量指标。为了确保我们在 VEBench 评估过程中的严格可复现性,我们将随机种子固定为 666。

VBench。VBench [25] 是一个全面的评估套件,将视频生成性能分解为 16 个层级化、解耦且细粒度的维度(如时间闪烁、运动平滑度、主体一致性和美学质量)。这使得对视频生成能力的评估具有高度客观性并与人类感知对齐。在我们的实验中,我们选择了六个与编辑任务密切相关且可直接在非标准 VBench 测试集数据上进行测量的核心方面。具体而言,我们计算主体一致性(SC)、背景一致性(BC)、运动平滑度(MS)、动态程度(DD)、美学质量(AQ)和图像质量(IQ)。由于这些解耦维度之间的评分尺度和计算方法存在固有差异,我们系统地对这些六个方面的原始值进行了归一化处理。随后,将这些归一化值相加,计算出一个统一的总体编辑得分。表 7 提供了所有评估的 VBench 维度的具体得分详细分解。

C.2 基于评判者的指标

上述自动指标提供了生成视频的整体评分。然而,这些指标侧重于一般信息,忽略了细粒度的视频细节以及编辑提示中的细微语义。为了对我们的编辑结果提供细致、基于推理的评估,我们采用视觉-语言模型(VLM)作为自动评判者。具体而言,我们利用 GPT-5 [51] 执行复杂的视觉推理,从而确定高度具体的编辑指令是否被准确执行。在此评估过程中,我们从原始源视频和最终编辑视频中均匀采样六个对应的帧。这些配对的帧序列被同时输入 GPT-5。这种均匀采样策略为 VLM 提供了未编辑状态与编辑状态之间空间变换的全面时间视角,且未超出模型的上下文窗口限制。

GPT-5 评估系统地分为四个不同的维度,以确保全面的评估。指令对齐(IA)衡量模型执行目标文本编辑(如局部对象交换或属性修改)的准确性。源保留(SP)评估模型保留未编辑背景、原始主体和源视频整体上下文的能力,且不引入非预期的更改。视觉质量(VQ)评估编辑帧的感知保真度,特别关注生成过程中引入的空间伪影或结构失真。最后,总体(OVL)维度提供了一个整体评分,用于衡量整体编辑性能,作为全面人类判断的代理。值得注意的是,VLM 每次调用仅评估视频的一个方面,从而保证不同的评估维度是独立测量的。用于此基于 VLM 评估的自定义推理提示词见第 G 节。

D 人类评估细节

D.1 评估设置

为了进行细致、与人类感知质量对齐的评估,我们开展了一项全面的人类评估研究。为了在确保…

第 28 页

清华大学 | 28

图 7. 我们人工评估网站的用户界面。

第 29 页

清华大学 | 29

为了确保覆盖的多样性,我们随机选取了包含 25 个独特视频-提示组合的测试集。 我们邀请了 10 位独立的人类评估者参与此次评估。对于这 25 个评估实例中的每一个,参与者都会看到源视频、驱动文本提示以及由被评估方法生成的编辑视频。为了确保严格的盲评并减轻任何潜在的认知或品牌偏见,所有模型身份均完全匿名化,生成的输出在每个单独试验中被随机打乱,并分配从模型 A 到模型 G 的临时标识符。 评估者的任务是对每个生成的视频在三个关键感知维度上进行 1 到 5 分的评分。视频质量 (VQ) 评估了整体的时间平滑度、美学吸引力以及生成伪影的缺失。指令遵循度 (IA) 衡量编辑视频在多大程度上准确反映了文本提示中请求的特定语义变化。最后,源保留度 (SP) 评估模型保留原始源视频中未编辑背景、主体身份和结构布局的能力。为此评估平台专门设计了一个自定义用户界面,促进了并排比较,如图 7 所示。

图 8. 与重新实现的 VidTTA [66] 的逐一对比结果。

D.2 与 VidTTA 的逐一对比人类评估

作为一个与我们提出的方法共享相同基础配置的极具竞争力的测试时微调 (TTT) 基线,我们重新实现的 VidTTA [66] 在标准视频编辑任务上表现出非常强大的性能。由于 VidTTA 的核心优化机制与 ElasticTTT 非常相似,且生成结果显示出相似的模式,我们特意将其排除在前文讨论的更广泛的多模型人类评估之外,并明确进行逐一对比的人类评估。 评估者会看到由 ElasticTTT 和 VidTTA 生成的视频的直接并排对比,这些视频基于相同的源视频和驱动文本提示。两个模型输出的位置在每个试验中完全随机化,且其身份保持严格匿名。对于每一对视频,参与者被要求比较生成输出,并投出一票,指出第一个视频更好、第二个视频更好,或者两个视频质量相当。这些比较判断是整体做出的,综合考虑了视频

第 30 页

清华大学 | 30

质量、指令遵循与源保持。 定量结果如图 8 所示。聚合的偏好数据清楚地表明,ElasticTTT 在所有评估指标上均优于 VidTTA 基线,获得了高得多的胜率。值得注意的是,ElasticTTT 在指令遵循(Instruction Adherence)方面以 42.3% 的胜率显著优于 15.8%,在总分(Overall score)方面以 36.4% 的胜率显著优于 25.3%。这一显著优势证实,ElasticTTT 成功克服了测试时微调(Test-Time Tuning, TTT)的固有局限性,产生了人类观察者明显更偏好的视觉输出。

表 8. 与先前视频编辑方法的定量比较(70 步 TTT)。最佳结果用红色高亮,次佳结果用蓝色高亮。* 表示该方法使用我们的配置重新实现。

方法 VQ↑ IA↑ SP↑ OVL↑

其他方法 AnyV2V[33] 3.51 5.89 2.30 4.31 Ground-A-Video[26] 3.57 4.49 2.42 3.90 Token-flow[15] 4.47 5.57 4.30 4.83 Ditto [2] 5.48 5.95 3.32 5.62 Flow-align [30] 5.28 5.44 7.23 5.44 Uniedit [1] 3.87 6.51 0.54 5.04

测试时微调方法 Tune-A-Video* [69] 5.75 6.67 3.62 5.80 VidTTA*[66] 5.16 6.06 3.86 5.27 ElasticTTT 6.08 7.02 4.68 6.68

E 更多评估结果

E.1 较少步数评估 尽管我们选择 100 步 TTT 作为最终评估设置,但我们还使用 70 步 TTT 对 ElasticTTT 进行了评估,并与相同的基线组进行比较。结果如表 8 所示。实验表明,我们的方法不仅能达到最先进(state-of-the-art)的结果,还能在较少的 TTT 步数下保持高水平的编辑质量。

E.2 带有 TDR 的更多 TTT 步数 由于目标分布正则化(Target Distribution Regularization, TDR)的有效性与时测试微调(Test-Time Tuning, TTT)过程的优化动力学紧密交织,我们通过实验评估了 TDR 在不同优化长度下的影响。图 9 展示了整体编辑性能随 TTT 步数变化的情况。正如我们的理论分析所预测的那样,标准 TTT 随着步数增加表现出编辑能力的退化。相比之下,引入 TDR 在所有评估的 TTT 步数下持续提升了整体编辑性能,特别是在较大 TTT 步数下改善显著,积极防止优化过程发生崩溃。

为了进一步量化这一现象,我们进行了一项将优化扩展至激进 300 步 TTT 的消融研究。如表 9 所示,移除 TDR 导致视频质量(Video Quality, VQ)、指令遵循(Instruction Adherence, IA)和总分(Overall, OVL)急剧下降,证明了严重的条件崩溃(Conditioning Collapse)。源保持(Source Preservation, SP)的增加表明,缺乏受控随机性的 TTT 带来了过拟合。300 步实验的结果比第 4.3 节中的消融研究显著得多,因为模型逐步过拟合,通过训练逐渐加剧了先验崩溃(Prior Collapse)现象。

第 31 页

清华大学 | 31

图 9. 不同 TTT 步数下,有无 TDR 的整体得分对比

表 9. 300 步 TTT 下 TDR 的定量结果。

方法 VQ↑ IA↑ SP↑ OVL↑

无 TDR 6.09 6.28 6.67 6.13 Full (ElasticTTT) 6.31 6.69 6.38 6.50

E.3 通过 TDR 实现高效的对齐-编辑权衡

在敏感应用中,特别是涉及人脸的场景,源内容保留是首要关切;即使微小的结构改变也可能导致严重不自然的伪影或身份丢失。虽然调整 TTT 步数是控制编辑程度和源内容保留的有效机制,但存在固有的权衡:强制与参考视频更严格地对齐不可避免地会降低语义对齐和整体编辑质量。引入我们的 TDR 模块显著缓解了这一问题,使得在最小化语义牺牲的情况下实现稳健的参考对齐。经验上,当将 TTT 步数从 100 增加到 300 时,使用 TDR 产生了高效的权衡:OVL 下降 1 点带来了 SP 大幅 5 点的提升。相比之下,在没有 TDR 的情况下,相同的语义成本仅带来 SP 2.7 点的提升。

F VLM 与人类判断的相关性分析

图 10. VLM 得分与人类评估之间的相关性可视化

第 32 页

清华大学 | 32

表 10. 人类评估分数与 VLM 给出分数之间双尾 Pearson 相关性显著性检验的 p 值。红色表示在 0.01 水平上高度显著,蓝色表示在 0.05 水平上统计显著。

方法 VQ IA SP OVL

Flow-align [29] 0.0172 0.0001 0.0005 0.0025 Ditto [2] 0.0747 0.0000 0.0931 0.0000 Uniedit [1] 0.0116 0.0126 0.0006 0.0360 AnyV2V [33] 0.0544 0.0005 0.0000 0.0223 Ground-A-Video [26] 0.8595 0.0000 0.1202 0.3907 Token-flow [15] 0.0070 0.0000 0.0438 0.0000 ElasticTTT 0.0099 0.0220 0.0033 0.0038

表 11. VLM 给出分数与人类评估分数之间的 Pearson 相关系数 (r)。 强相关 r ≥0.5;中等相关 0.3 ≤r < 0.5;弱相关 r < 0.3。

方法 VQ IA SP OVL

Flow-Align [29] 0.4041 0.7077 0.6310 0.5777 Ditto [2] 0.3084 0.8686 0.3146 0.7760 UniEdit [1] 0.5265 0.4945 0.6812 0.4219 AnyV2V [33] 0.3999 0.6388 0.7474 0.4595 Ground-A-Video [26] −0.1498 0.6103 0.2673 0.1795 Token-Flow [15] 0.5358 0.7119 0.3899 0.7405 ElasticTTT 0.5922 0.4245 0.5907 0.5915

为了严格评估我们自动化的视觉语言模型 (VLM) 评估与人类感知判断之间的一致性,我们计算了四个核心维度:指令遵循 (IA)、源保留 (SP)、视频质量 (VQ) 和总体分数 (OVL) 之间的 Pearson 相关系数 (r)。对于 n = 25 个视频片段的样本量,VLM 分配分数 (xi) 与人类评估分数 (yi) 之间的相关系数计算如下:

r = Σ(xi − x̄)(yi − ȳ) / (√Σ(xi − x̄)² · √Σ(yi − ȳ)²) (30)

其中 x̄ 和 ȳ 分别表示样本均值。该系数取值范围为 [−1, 1],量化了两种评分范式之间线性关系的强度。

为了评估这些观察到的相关性的统计显著性,我们构建了一个双尾假设检验。令 ρ 表示真实的总体相关系数。我们将零假设与备择假设定义如下:

H0 : ρ = 0 vs. H1 : ρ ≠ 0 (31)

为了评估反对 H0 的证据,H0 假设任何观察到的相关性完全是由随机抽样方差引起的,我们计算 t 统计量:

t = r√(n − 2) / √(1 − r²) (32)

第 33 页

清华大学 | 33

在原假设下,该检验统计量服从自由度为 df = n − 2 的 Student’s t 分布。对于我们的评估样本,df = 23。基于该 t 统计量,我们计算对应的双侧 p 值,该值表示在假设 H0 成立的情况下,仅凭偶然观察到与计算出的 r 同样极端的相关性的概率。足够小的 p 值为拒绝 H0 而支持 H1 提供了有力证据,表明存在统计显著的线性关系。具体的 p 值和显著性水平如表 10 所示。表 11 报告了七个评估模型中每一个的具体 Pearson 相关系数,分类阈值采用 Cohen 制定的既定指南 [9]。

此外,我们在图 10 中可视化了对齐情况。散点图中的每个数据点代表一个单独的编辑任务,其空间坐标对应于所有七个模型平均后的 VLM 和人类评估分数的均值。在图注中,r 表示相关系数,p 表示用于统计显著性检验的对应 p 值。星号 (*) 表示相关性具有统计显著性,通常 p < 0.05。更多的星号 (*) 代表更高的显著性。

最终,这些定量分析揭示了在绝大多数情况下,VLM 评分与人类评估之间存在强烈、正向且统计显著的线性相关性。这种稳健的对齐表明,我们基于 VLM 的指标可作为人类视觉判断的高度可靠且可扩展的代理。

G VLM 判断的提示词设计

为了确保结果的可复现性,我们列出用于 GPT-5 评估的提示词如下:

1 “你将收到两个帧序列: 2 – 序列 A:原始视频帧 3 – 序列 B:编辑后的视频帧 4 请对视频编辑结果进行 0 到 10 分的评分。 5 请根据视频中的实际情况更分散地分配分数。

6 7 评分标准: 8 1) 编辑完成度(权重最高): 9 编辑后的视频是否遵循编辑提示词与原始提示词? 10 2) 内容保留: 11 在应保持时,保留不相关内容/身份/背景。 12 3) 时间和视觉一致性: 13 运动稳定,无明显伪影/闪烁。

14 15 仅返回包含以下键的严格 JSON: 16 {“score_0_10”: number, “reason”: string, “confidence”: number} 17 其中 score_0_10 在 [0,10] 范围内,confidence 在 [0,1] 范围内,reason 不超过 80 个单词。”

代码清单 1. 用于总体评分的 VLM 提示词

“你将收到两个帧序列:

请对视频编辑结果进行 0 到 10 分的评分。 请根据视频中的实际情况更分散地分配分数。

  • 序列 A:原始视频帧
  • 序列 B:编辑后的视频帧

第 34 页

清华大学 | 34

“请你对编辑视频的质量进行 0 到 10 分的评分。 请根据视频中的实际情况,更分散地分配分数。” “评分标准:” “1) 图像质量: 编辑视频中的图像质量高, 应当清晰锐利。” “2) 美学评分: 编辑视频具有美学吸引力, 运动平滑自然。” “3) 背景一致性: 背景与原始视频一致, 无明显伪影/闪烁。” “4) 主体一致性: 主体与原始视频一致, 无明显伪影/闪烁。” “5) 运动平滑度: 运动平滑自然, 无明显伪影/闪烁。” “仅返回包含以下键的严格 JSON:” ’{" score_0_10 ": number , "reason ": string , "confidence ": number}’ “其中 score_0_10 在 [0,10] 范围内,confidence 在 [0,1] 范围内, reason 不超过 80 个单词。”

仅返回包含以下键的严格 JSON: {" score_0_10 ": number , "reason ": string , "confidence ": number} 其中 score_0_10 在 [0,10] 范围内,confidence 在 [0,1] 范围内, reason 不超过 80 个单词。”

列表 2. 用于视频质量的 VLM 提示词

“你将收到两个帧序列:

请你对视频编辑结果进行 0 到 10 分的评分。 请根据视频中的实际情况,更分散地分配分数。

  • 序列 A:原始视频帧
  • 序列 B:编辑视频帧

“请你对视频编辑结果进行 0 到 10 分的评分。 请根据视频中的实际情况,更分散地分配分数。” “评分标准:” “1) 语义对齐: 编辑视频是否遵循编辑提示词与原始提示词?”

“仅返回包含以下键的严格 JSON:” ’{" score_0_10 ": number , "reason ": string , "confidence ": number}’ “其中 score_0_10 在 [0,10] 范围内,confidence 在 [0,1] 范围内, reason 不超过 80 个单词。” 仅返回包含以下键的严格 JSON: {" score_0_10 ": number , "reason ": string , "confidence ": number} 其中 score_0_10 在 [0,10] 范围内,confidence 在 [0,1] 范围内,reason 不超过 80 个单词。”

第 35 页

清华大学 | 35

列表 3. 视频用的 VLM 提示词

“你将收到两个帧序列:

你正在对视频编辑结果进行 0 到 10 分的评分。 请根据视频中的实际情况更分散地分配分数。

  • 序列 A:原始视频帧
  • 序列 B:编辑后的视频帧

“你正在对视频编辑结果进行 0 到 10 分的评分。 请根据视频中的实际情况更分散地分配分数。” “评分标准:” “1) 背景中的细节 (不应被编辑的区域)与 原始视频的一致性如何?”

’{" score_0_10 ": number , "reason ": string , "confidence ": number}’ “其中 score_0_10 在 [0,10] 范围内,confidence 在 [0,1] 范围内, reason 不超过 80 个单词。”

列表 4. 源保留用的 VLM 提示词

H 异步噪声调度掩码的演示

图 11. 我们掩码区域和最终编辑视频的视觉说明。

第 36 页

清华大学 | 36

在图 11 中,我们展示了由 Grounded-SAM2 [57] 生成的用于异步噪声调度(Async-NS)的掩码。 我们展示了同一参考视频的两个不同编辑场景,以进一步演示编辑提示与掩码区域之间的关系。第二行和第三行显示了掩码区域,第四行和第五行是我们的最终编辑结果。

I 局限性与未来工作

I.1 局限性 尽管我们的模型在所有编辑任务中均能达到最先进性能,但仍存在若干局限性。首先,由于我们的模型具有测试时微调(TTT)特性,与那些无需训练的方法相比,其计算成本更高。其次,在某些情况下,我们发现视频中特定区域的过度指定也会限制其他区域的编辑能力。我们推断,这种现象可能是由于在测试时微调过程中自注意力层过度优化所致。

I.2 未来工作 目前,我们的异步噪声调度依赖于由 Grounded-SAM2 等外部模型生成的显式掩码。未来的工作可以通过在初始 TTT 步骤中直接从扩散模型内部的交叉注意力图中动态提取空间掩码,从而消除对此的依赖,构建一个完全端到端的框架。 此外,我们旨在扩展 ElasticTTT 以处理长上下文或多镜头视频。通过引入时间分块或滑动窗口 TTT,我们可以在不超出标准显存限制的情况下,确保数百帧之间的时间一致性。

J 更多演示

在图 12 中,我们进一步展示了两个具有更大运动和复杂姿态的挑战性案例。 在图 13 中,我们展示了另外两个案例,并将其与其他视频编辑方法进行了比较。

第 37 页

清华大学 | 37

图 12. 另外两个更具挑战性的案例。

K 社会影响与伦理关切

K.1 社会影响 K.1.1 积极社会影响 ElasticTTT 作为一个易于访问且高效能的框架,使视频编辑技术能够惠及更广泛的用户群体,实现了视频编辑的民主化。通过仅依靠自然语言指令实现直观修改,它消除了传统专业软件(如 DaVinci Resolve)所伴随的高昂学习门槛。此外,我们的模型通过自动化常规编辑任务,为专业创作者提供了巨大价值,从而显著加速了工作流程,并降低了时间与经济生产成本。

K.1.2 潜在风险 尽管我们提出的 ElasticTTT 实现了高质量视频编辑的民主化,但其内在伴随着与恶意视频合成相关的风险。精确编辑视频特定区域的能力可能被滥用于制造逼真的伪造内容,例如在未经同意的情况下将人物置于虚构场景中。这加剧了深度伪造(deepfakes)和虚假信息传播这一更广泛的社会挑战。我们严厉谴责使用我们的方法生成欺骗性内容的行为。为防止此类滥用,我们建议我们框架的下游应用应结合不可见水印技术,并将该技术用于先进的合成媒体检测算法。

K.2 人类评估的伦理关切 我们的人类评估框架设计严格符合伦理研究标准。首先,所有参与评估的评估者均严格基于自愿原则,保留在任何阶段无条件退出的权利,且不会面临任何负面后果。其次,我们执行了严格的数据隐私政策;所有收集的反馈均完全匿名化,确保没有个人

第 38 页

清华大学 | 38

图 13. 与其他方法的视觉对比。我们的方法严格遵循编辑指令,同时成功保留了未编辑区域的细节。

第 39 页

清华大学 | 39

从未记录过可识别的详细信息。此外,该研究纯属观察性研究。核心任务仅要求人类受试者审查标准的合成视频,这完全使他们免受物理危害、心理压力或任何令人反感的视觉刺激。因此,我们的方法论避免了任何可能损害参与者福祉的侵入性干预。

K.3 保障措施

在开发用户友好的视频编辑软件或平台时,实施适当的保障措施至关重要。为了确保我们的人类评估拥有经过彻底审查且安全的环境,我们严格从精心策划的数据集中采样视频,该数据集基于著名的 DAVIS 基准构建。这种有意的选择过程保证了所有视觉内容都是无害的,从而主动防止了无意中包含互联网上常见的不适当、敏感或未经审查的媒体。

发表评论