HPSD:把TI2V模型的条件激发能力内化到基础T2V模式

快速导读:HPSD提出混合策略自蒸馏框架,让TI2V模型在教师特权条件轨迹上锚定、按学生自身策略演化子轨迹并接受速度级监督,从而将条件激发的生成能力内化到基础T2V模式中。

HPSD(Hybrid-Policy Self-Distillation)针对文本-图像-视频(TI2V)扩散模型提出了一种新的自蒸馏框架,目标是解决一个被忽视但实际存在的问题:同一个模型在获得高质量首帧或增强提示等特权条件时,生成质量显著优于基础T2V模式,但这种能力无法在普通推理条件下被调用。论文将这一现象命名为condition-elicited capability,并设定了一个明确任务——把这种条件激发的能力内化到模型的基础生成模式中。

现有自蒸馏方法在该任务上各有缺陷:off-policy SFT在固定教师端点上监督,缺乏对学生演化策略的状态感知校正;on-policy distillation虽然在学生访问的状态上查询教师,但在TI2V中会产生condition-state mismatch,即干净首帧与学生自由T2V rollout混合成无效输入状态,导致教师监督与学生内容冲突。HPSD通过混合策略子轨迹设计同时规避了这两类问题。

英文题目:HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

论文出处:arXiv 每日论文精选 · arXiv:2608.13205

原始论文:PDF / 论文页面

这篇论文解决什么问题?

TI2V模型统一了T2V与I2V架构,首帧作为固定干净条件注入去噪过程。在flow matching训练范式下,模型学习速度场vθ(xt,t,c)。当条件c包含增强提示或高质量首帧时,模型表现出明显更强的生成能力,这从Figure 2的视觉对比和指标差异中可以直观看到。

问题在于,这种能力是条件激发的,而非模型内在的。用户在基础T2V模式下只能提供原始提示,无法获得特权条件带来的质量提升。论文的核心动机就是:能否通过训练,让模型在基础模式下也具备特权条件下的生成水平?

自蒸馏是自然的候选方案。教师以特权条件运行,学生以基础模式运行,通过蒸馏将教师能力迁移给学生。但直接套用现有方法会失败:off-policy SFT的教师端点是固定的,学生策略在训练中不断演化,监督信号逐渐偏离学生实际访问的状态分布;on-policy distillation虽然跟踪学生状态,但TI2V的首帧条件与学生自由rollout的内容不一致,形成无效混合状态,教师在该状态上的速度预测变得不可靠甚至有害。

Figure 3直观展示了condition-state mismatch:标准TI2V/T2V状态在帧间保持内容一致,而on-policy distillation强制将干净首帧与学生未对齐的T2V rollout拼接,产生冲突的、被破坏的教师监督。这是TI2V场景特有的失效模式,也是HPSD设计的直接出发点。

核心创新

  • 提出混合策略自蒸馏(HPSD),学生从教师轨迹锚定状态出发、按自身策略演化,同时规避off-policy暴露偏差与on-policy条件-状态失配
  • 识别并定义condition-elicited capability:特权条件(增强提示+高质量首帧)激发TI2V模型更强生成能力,并设定将其内化到基础模式的新任务
  • 揭示TI2V中on-policy distillation的condition-state mismatch失效模式:干净首帧与学生自由T2V rollout混合构成无效输入状态
  • 通过首帧槽重新加噪(re-noise)实现教师锚定状态到学生兼容格式的转换

方法概览

HPSD分三步:(1)离线阶段用LLM重写提示并用T2I模型合成首帧;(2)教师以特权条件滚出完整锚定轨迹,将中间状态重新加噪首帧槽以匹配学生输入格式;(3)学生从锚定状态出发用自身速度场去噪K步形成混合策略子轨迹,教师在该子轨迹终端状态上提供速度级监督,教师通过EMA更新。

  • 离线阶段:使用LLM重写原始提示得到增强提示,使用T2I模型(默认Z-Image-Turbo)合成高质量首帧,构成特权条件对。这一步是一次性数据合成,不参与训练循环。
  • 教师轨迹锚定:教师以特权条件(增强提示+首帧)滚出完整去噪轨迹,即off-policy anchor trajectory。该轨迹携带了特权条件的内容先验和高质量生成路径。
  • 首帧槽重新加噪:教师轨迹的中间状态包含干净首帧槽,与学生基础T2V模式的输入格式不兼容。HPSD将锚定状态中的首帧槽重新加噪到对应噪声水平,使其与学生输入分布一致。
  • 混合策略子轨迹:学生从重新加噪后的锚定状态出发,用自身速度场去噪K步,形成hybrid-policy sub-trajectory。轨迹的起点由教师特权内容锚定,演化过程由学生自身策略驱动。
  • 速度级监督:教师在该子轨迹的终端状态上提供速度预测作为监督信号,学生向该目标回归。由于终端状态仍处于教师轨迹的邻域内,监督信号保持有效且与学生内容对齐。
  • 教师EMA更新:教师模型通过指数移动平均从学生权重更新,使教师能力随学生进步同步提升,形成良性循环。
  • 与D-OPSD的关键区别:D-OPSD需要多模态编码器注入图像信息,在TI2V中只能蒸馏文本特权条件,无法利用图像条件;HPSD通过首帧槽重新加噪直接处理图像条件,无需额外编码器。
  • 与Flow-OPD、DiffusionOPD、OPSD-V、DanceOPD等on-policy蒸馏工作的关系:它们都在学生访问状态上查询教师,但均未处理TI2V特有的条件-状态失配问题。

逐图理解论文

条件激发能力的直观证据

条件激发能力的直观证据
Figure 2: Condition-Elicited Capability. Conditioning a TI2V model on a high-quality first frame or an enhanced prompt clearly outperforms vanilla T2V. Their combination yields the best results across visuals and metrics, motivating HPSD’s goal of internalizing this capability into the model.

该图展示了condition-elicited capability的直接证据:同一TI2V模型在高质量首帧或增强提示条件下明显优于基础T2V,两者组合效果最佳。这是HPSD任务设定的经验基础。

现有自蒸馏方法的失效

现有自蒸馏方法的失效
Figure 3: Condition-State Mismatch. While standard TI2V/T2V states maintain consistent content across frames, on-policy distillation creates an invalid mixed state by forcing a clean first frame alongside the student’s unaligned T2V rollout, yielding conflicting, corrupted teacher supervision.

该图直观呈现condition-state mismatch:标准状态帧间内容一致,而on-policy distillation将干净首帧与学生未对齐rollout拼接,形成无效混合状态,导致教师监督冲突。

HPSD的混合策略设计

HPSD的混合策略设计
Figure 4: Overview of HPSD. (a) Offline Stage: Privileged conditions (enhanced prompt and first frame) are synthesized using auxiliary models. (b) Online Stage: The student evolves hybrid-policy sub-trajectories starting from the teacher’s off-policy anchor states. Distillation on these states pro- vides the student with precise policy correction anchored by the teacher’s privileged content priors. Varying gray shading denotes the noise level over time, while solid white indicates clean frames.

该图是HPSD的完整框架图:离线阶段合成特权条件,在线阶段学生从教师锚定状态出发演化混合策略子轨迹并接受速度级监督。灰度变化表示噪声水平随时间递减。

实验验证与消融

实验验证与消融
Table 1: Quantitative comparison of different methods on various TI2V backbones. The best results are in bold, while the second-best result is underlined. UR-v2-A, UR-v2-P and UR-v2-S represent the Alignment, Physics and Style dimensions of UnifiedReward-v2, respectively.

该表是主结果对比,展示HPSD在两个骨干模型上相对Vanilla T2V、OPD、D-OPSD、SFT的VideoAlign和UnifiedReward-v2各维度得分,HPSD在绝大多数指标上最优。

结论与意义

结论与意义
Figure 1: Introduction to HPSD. (a) Off-policy SFT supervises on fixed teacher endpoints, which drift from the evolving student policy. (b) On-policy distillation queries the teacher at student-visited states, yet suffers from condition-state mismatch in TI2V models. (c) HPSD anchors the student on the teacher trajectory and supervises roll-outs evolved under its own policy. (d) HPSD substantially boosts the base generation quality of TI2V models (WAN-2.2-TI2V-5B in this figure), especially in cinematic lighting, fine details, and balanced composition. Prompts in the Appendix.

该图对比了三种蒸馏范式的核心差异:off-policy SFT在固定端点上监督导致漂移,on-policy distillation在TI2V中产生条件-状态失配,HPSD通过锚定+自身演化规避两者。右侧的生成对比展示了HPSD在电影级光照、细节和构图上的提升。

实验如何设计?

  • 骨干模型:WAN-2.2-TI2V-5B和LTX-2.3两个TI2V模型,覆盖不同架构和规模。
  • 对比基线:Vanilla T2V、On-Policy Distillation、D-OPSD (Text)、Supervised Fine-Tuning,覆盖off-policy和on-policy两类代表性方法。
  • 评估指标:VideoAlign作为主指标,辅以UnifiedReward-v2的三个维度(Alignment、Physics、Style)和VBench的六个指标(SC、BC、MS、DD、AQ、IQ)。
  • 消融维度:子轨迹长度K(0/1/3/5/7)、特权条件组合(仅+cimg vs +c+txt+cimg)、对TI2V模式的影响。
  • 泛化性实验:用Flux.2-Klein-4B替代Z-Image-Turbo作为首帧生成器,验证方法对首帧来源的鲁棒性。
  • LTX-2.3仅使用第一阶段生成,未采用第二阶段超分和细化,保证对比公平。

关键结果与论文证据

  • WAN-2.2上HPSD VideoAlign=1.8753,较SFT的1.2046提升约55%,较Vanilla T2V的0.5335提升约251%(Table 1, p.8)。
  • LTX-2.3上HPSD VideoAlign=1.5244,较SFT的0.9584提升约59%,跨骨干模型一致性验证了方法泛化性(Table 1, p.8)。
  • WAN-2.2上HPSD在全部8个reward指标上最优;LTX-2.3上在7个reward指标上最优(Table 1, p.8)。
  • VBench上HPSD在SC、BC、MS、AQ等指标均最优,但WAN-2.2的Dynamic Degree为0.422,低于Vanilla的0.560,作者认为这反映时序一致性增强而非质量下降(Table 2, p.9)。
  • 消融显示K=3时VideoAlign=1.8753最优,K=0为1.5587,K=7降至1.7130,说明适度的学生自身演化步数最有利于能力内化(Table 3, p.10)。
  • 特权条件组合消融:仅+cimg时VideoAlign=1.5006,+c+txt+cimg达1.8753,说明增强提示与首帧条件有互补增益(Table 3, p.10)。
  • TI2V模式受益:Vanilla TI2V VideoAlign=0.7831,HPSD后提升至1.2139(约+55%),说明内化能力同时惠及I2V推理(Table 3, p.10)。
  • Flux.2-Klein-4B作首帧生成器时HPSD VideoAlign=1.6587,仍显著优于Vanilla T2V的0.5335,证明方法不依赖特定首帧生成器(Table 5, p.17)。

阅读时需要注意

  • 特权条件构建需查询辅助LLM和T2I模型,产生一次性离线数据合成成本,对大规模训练管线是额外负担。
  • 训练时学生子轨迹rollout需额外前向推理步,相比SFT和OPD增加计算开销;虽无需存梯度、内存可控,但时间成本不可忽略。
  • VBench Dynamic Degree在HPSD下略低,虽然作者解释为时序一致性增强,但动态性下降是否影响某些应用场景的用户偏好仍需进一步研究。

关联工作

  • D-OPSD是扩散模型on-policy自蒸馏的代表方法,HPSD的对比基线之一;其编码器模态限制使其在TI2V中只能蒸馏文本特权条件,无法利用图像条件,这是HPSD相对其的核心优势。
  • Flow-OPD将on-policy蒸馏扩展到flow matching模型,属于多教师蒸馏类别;DiffusionOPD提供了扩散模型on-policy蒸馏的统一视角;OPSD-V针对视频生成器使用时间上下文条件;DanceOPD提出on-policy生成场蒸馏。这些工作共同构成了on-policy蒸馏的方法谱系,但均未处理TI2V的条件-状态失配问题。
  • WAN-2.2和LTX-2是当前代表性的TI2V骨干模型,HPSD在两个平台上的验证增强了结论的架构无关性。

发表评论