WearWow:原生2K多衣物虚拟试穿,解决显存爆炸与纹理平滑难题

三分钟导读:WearWow通过自适应2D Token打包(ATP)解决显存爆炸问题,并利用多维试穿奖励(MTR)对齐机制克服扩散模型的高频平滑偏差,实现了原生2K分辨率下的无掩码多衣物虚拟试穿。

英文题目:WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment

论文出处:arXiv 每日论文精选 · arXiv:2607.19923

原始论文:PDF / 论文页面

对应视频标题:WearWow:原生2K多衣物虚拟试穿,解决显存爆炸与纹理平滑难题|推荐指数:★★★★★

这篇论文解决什么问题?

现有虚拟试穿(VTON)方法在扩展至原生2K分辨率及多衣物联合生成时,面临自注意力机制导致的O(N^2)显存爆炸,以及扩散模型MSE目标固有的频谱偏差导致的高频纹理过度平滑(塑料感)问题。

核心创新

  • 提出ATP机制,通过算法化2D装箱和稀疏Token剪除,将有效序列长度从O(K·N)降低,解决多条件2K训练的显存瓶颈。
  • 设计MTR偏好对齐管道,协同视觉分布约束与文本语义引导,有效缓解MSE目标的频谱偏差,恢复微观光感纹理。
  • 构建WearWow-2K数据集,包含原生2K分辨率的三胞胎数据,支持无掩码生成及复杂多衣物空间交互学习。

方法概览

提出WearWow框架,包含两个核心模块:1) 自适应2D Token打包(ATP):利用衣物图像的稀疏性,通过2D装箱算法将异构衣物紧凑打包并剪除背景Token,在保留2D空间先验的同时最小化序列长度;2) 多维试穿奖励(MTR):结合布料分布奖励(CDR)锚定物理分布和语义引导奖励(SGR)通过文本对比驱动触觉恢复,以偏好对齐方式纠正频谱偏差。

逐图理解论文

方法概览:WearWow框架

方法概览:WearWow框架
Fig. 1: Native 2K Multi-Garment Try-On with WearWow. (Left) Mask-Free Joint Synthesis: WearWow seamlessly composes diverse categories (garments, footwear, accessories) with strict topological alignment. (Right) Tactile Realism: While standard baselines suffer from severe over-smoothing, our framework explicitly restores micro- level high-frequency textures (e.g., curly fleece, denim), overcoming plastic-like degra- dation to achieve unprecedented material fidelity.

WearWow框架通过两大核心模块解决上述痛点。首先是自适应2D Token打包(ATP),利用衣物图像的稀疏性,通过2D装箱算法将异构衣物紧凑打包并剪除背景Token,在保留2D空间先验的同时最小化序列长度。其次是多维试穿奖励(MTR),结合布料分布奖励(CDR)锚定物理分布,以及语义引导奖励(SGR)通过文本对比驱动触觉恢复,以偏好对齐方式纠正频谱偏差。

实验:单衣物试穿评估

实验:单衣物试穿评估
Fig. 3: Qualitative comparisons on VITON-HD and DressCode in the single try-on. Compared with other methods, WearWow produces more texture-consistent images.

在VITON-HD和DressCode数据集上,WearWow进行了单衣物试穿评估,对比IDM-VTON和CatVTON等SOTA模型。结果显示,WearWow的FID降至4.2475,LPIPS降至0.0688,人类主观评估(HE)得分为0.4084,均优于对比基线。这表明其在保持结构一致性的同时,显著提升了纹理细节的还原能力。

实验:原生2K多衣物评估

实验:原生2K多衣物评估
Fig. 4: Qualitative comparisons on WearWow-2k,showcasing our superior photorealism on complex multi-item combinations and challenging woolen textures.

在自建的WearWow-2K数据集上,WearWow展示了原生2K多衣物联合试穿能力,对比OminiTry、Seedream4.0等基线。量化指标显示,WearWow的FID为7.5400,LPIPS为0.0773,SSIM为0.8461,HE得分为0.2543,优于Nano Banana Pro和KeLingv3。定性结果也证实了其在复杂多物品组合和羊毛纹理上的卓越照片级真实感。

消融实验:模块有效性验证

消融实验:模块有效性验证
Fig. 5: We visualize the impact of our proposed modules. our full MTR pipeline (Ours) robustly restores micro-level tactile realism without sacrificing structural integrity.

消融实验验证了ATP模块及MTR中CDR与SGR组件的有效性。完整WearWow模型的SSIM为0.8677,LPIPS为0.0870,优于仅使用ATP或仅使用SGR/CDR的变体。可视化结果进一步表明,完整的MTR管道能在不牺牲结构完整性的前提下,鲁棒地恢复微观触觉真实感,证明了各组件的协同作用。

实验与关键结果

  • 在VITON-HD和DressCode数据集上进行单衣物试穿评估,对比IDM-VTON, CatVTON等SOTA模型。
  • 在自建的WearWow-2K数据集上进行原生2K多衣物联合试穿评估,对比OminiTry, QWen-image, Seedream4.0, GPT-image 1.5等基线。
  • 进行消融实验,验证ATP模块及MTR中CDR与SGR组件的有效性。
  • 进行人类主观评估(HE),评估材质保真度、空间一致性和整体照片级真实感。
  • 在VITON-HD/DressCode上,FID降至4.2475,LPIPS降至0.0688,HE得分0.4084,优于CatVTON和IDM-VTON。(第 12 页)
  • 在WearWow-2K上,FID为7.5400,LPIPS为0.0773,SSIM为0.8461,HE得分为0.2543,优于Nano Banana Pro和KeLingv3。(第 12 页)
  • 消融实验显示,完整WearWow模型SSIM为0.8677,LPIPS为0.0870,优于仅使用ATP或仅使用SGR/CDR的变体。(第 14 页)

阅读时需要注意

  • 处理极端复杂的背部遮挡场景仍有挑战。
  • 当前框架主要面向静态图像,尚未扩展至视频试穿。
  • 高分辨率人脸生成可能带来深度伪造风险,需配合检测算法使用。
  • MTR训练依赖HPSv2等冻结模型进行语义计算,计算开销较大。

关联工作

  • IDM-VTON:单衣物试穿SOTA基线,在VITON-HD上作为对比对象。(第 4 页)
  • CatVTON:单衣物试穿SOTA基线,SSIM较高但LPIPS略逊于WearWow。(第 4 页)
  • OminiTry:多衣物试穿开源基线,在2K多衣物任务中作为对比对象。(第 4 页)
  • Seedream4.0:商业API基线,在WearWow-2K数据集上进行多衣物生成对比。(第 5 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

WearWow:基于自适应 Token 打包与偏好对齐的原生 2K 多衣物虚拟试穿

张旭杰1⋆,杜润言2⋆,常松2,李江2,邵东亮2, 吴丽萍2,罗伟2,屈晓超2,刘罗琪2,梁小丹1†

1 中山大学深圳校区,中国 zhangxj59@mail2.sysu.edu.cn, liangxd9@mail.sysu.edu.cn 2 美图实验室,中国 {dry, cs2, lj28, sdl, wlp1, lw20, qxc, llq5}@meitu.com

2026 7月 22 [cs.CV] 图 1:WearWow 的原生 2K 多衣物试穿。(左)无掩码联合合成:WearWow 在严格拓扑对齐的前提下,无缝合成不同类别(衣物、鞋履、配饰)的物品。(右)触觉真实感:尽管标准基线方法存在严重的过度平滑问题,我们的框架显式恢复了微观级别的高频纹理(例如卷曲抓绒、丹宁布),克服了类塑料的退化现象,实现了前所未有的材质保真度。

摘要。合成原生 2K 多衣物虚拟试穿是数字时尚领域的一个艰巨前沿,主要受限于两个根本性瓶颈:由 2K 条件引发的 $O(N^2)$ 内存爆炸,以及扩散模型频谱偏差导致的高频织物细节过度平滑。我们提出了 WearWow,这是一种端到端、无掩码的生成式框架,开创了超高分辨率多衣物合成的先河。为了缓解内存爆炸问题,我们提出了自适应 2D Token 打包(Adaptive 2D Token Packing, ATP)。ATP 利用衣物固有的稀疏性,将异构物品算法化地打包到统一的 2D 画布上,并

⋆ 共同一作。 † 通讯作者。

第 2 页

2 X. Zhang. 等

剪除无信息的背景 token,在严格保留 2D 空间先验的同时,最小化有效序列长度及随后的内存开销。为纠正纹理退化,我们引入了多维试穿奖励(Multi-dimensional Try-on Reward, MTR)系统。MTR 协同语义引导奖励(Semantic Guidance Reward)以显式驱动触觉恢复,并协同布料分布奖励(Cloth Distribution Reward)以隐式锚定物理分布,这种联合公式有效缓解了严重的奖励黑客(reward hacking)问题。此外,我们精心构建了 WearWow-2K,这是一个极端质量的数据集,包含原生 2K 三元组,提供了物理上正确的空间交互,从而自然地赋予模型无掩码生成能力。大量实验表明,WearWow 确立了新的最先进水平(state-of-the-art),在原生 2K 多衣物合成方面超越了现有的商业基线。

关键词:多衣物试穿 · 原生 2K 分辨率 · 无掩码生成 · 偏好优化

1 引言

基于图像的虚拟试穿(Virtual Try-On, VTON)[2,13,14,24,42] 正在经历深刻的范式转变:从通常局限于 512p 或 1K 分辨率以确保正确姿态扭曲的宏观“结构对齐”追求,转向工业级对超高分辨率(2K 及以上)下“触觉真实感”的需求。在生成式扩散模型快速演进的推动下,最近的最先进架构在保留复杂人体姿态和单件衣物语义方面取得了显著成功。然而,当过渡到严格的商业部署时,这些部署需要原生 2K 分辨率结合多衣物联合生成(例如,同时合成内衣、外套和下装)以及无掩码推理,现有的端到端框架遇到了严重的系统性瓶颈。随着生成目标从仅仅“正确穿着”根本性地转变为“渲染真实的物理纹理”,当前范式面临显著退化,受到物理硬件限制和理论生成缺陷的双重瓶颈制约。

具体而言,将基于扩散模型的 VTON 扩展到 2K 多衣物领域受到两个主要扩展障碍的阻碍。第一个是由序列长度驱动的计算瓶颈。在现代 U-Net 或 Diffusion Transformer 骨干网络中,自注意力机制的计算复杂度与视觉 token 的总数呈二次方关系。除了目标图像和模型图像所需的固定基础 token $N_{base}$ 外,简单地将 K 个高分辨率参考衣物(每个包含 N 个 token)直接拼接会将总序列长度扩展为 $N_{base} + K \cdot N$。这会触发不可处理的计算成本 $O((N_{base} + K \cdot N)^2)$ 和灾难性的空间内存爆炸,使得原生 2K 多衣物训练从根本上不可行。因此,现有方法被迫依赖次优的级联超分辨率管道,这不可避免地引入结构幻觉并破坏原生空间连贯性。

第 3 页

WearWow 3

第二个障碍是由高频衰减导致的生成质量下降。即使人为规避了内存限制,生成模型在极端空间尺度下仍面临根本性的信号处理缺陷。传统的 L2 范数(MSE)去噪目标表现出固有的频谱偏差(Spectral Bias)和均值趋向特性。虽然在 1K 分辨率下这种偏差相对不易察觉,但在 2K 空间维度上,它充当了强力的低通滤波器。它系统地平滑了渲染复杂纺织品所必需的微观高频空间分量。因此,高度依赖高频细节的材料(如粗羊毛、厚重针织物和粗糙丹宁布)遭受严重的材质退化,退化为过度平滑、类似塑料的合成表面,无法捕捉触觉上的真实感。

为了系统性地解决这些计算和理论瓶颈,我们提出了 WearWow,这是一个专为无掩码、原生 2K 多衣物虚拟试穿设计的统一框架。我们框架的核心由一种顺序设计哲学驱动:首先,使极端分辨率的训练在计算上可行;其次,确保生成的纹理达到工业级的触觉真实感。为了实现第一个目标并从根本上缓解与多条件处理相关的计算爆炸问题,我们引入了自适应 2D Token 打包(Adaptive 2D Token Packing, ATP)。通过利用平铺衣物图像固有的空间稀疏性,ATP 动态剪除无信息的背景区域,并将异构视觉 Token 打包成一个高度紧凑的 2D 潜在矩阵。关键在于,ATP 通过严格映射的 2D 位置编码保留了原始的 2D 空间拓扑结构。通过对有效区域进行紧密打包并激进地剪除背景空洞,这种空间重组大幅削减了有效序列长度和随后的内存占用,从而在标准硬件上实现端到端的联合训练,同时在数学上保证了空间归纳偏置。

为了实现第二个目标并抵消标准扩散目标中固有的频谱衰减,我们构建了多维试穿奖励(Multi-dimensional Try-on Reward, MTR)流程。MTR 系统地将优化范式从纯粹的潜在空间回归转变为细粒度的偏好对齐。具体而言,MTR 引入了布料分布奖励(Cloth Distribution Reward, CDR),以隐式地将生成轨迹锚定到高保真物理数据分布上,并引入语义引导奖励(Semantic Guidance Reward, SGR),通过对比文本锚点显式驱动触觉恢复。这种双维度对齐有效地中和了 MSE 的频谱偏差,在物理上恢复了复杂织物的微观结构完整性,同时避免了严重的奖励黑客(reward hacking)问题。

超高分辨率数字时尚的发展还受到极端空间尺度下高保真多衣物配对数据严重稀缺的阻碍。为了建立严格的基准并实现真正的无掩码生成能力,我们策划并发布了 WearWow-2K。这个大规模数据集包含具有合成匿名模特(agnostic models)的原生 2K 配对图像,提供了无瑕的高频纹理梯度和物理正确的空间交互,从而自然地赋予模型目标人物的无掩码生成能力。总之,我们的核心贡献有四个方面:

第 4 页

4 X. Zhang. 等

– 我们提出了 WearWow,这是一种有效的端到端多衣物虚拟试穿框架,原生支持 2K 分辨率,有效地将任务从宏观结构形变推进到微观层面的触觉渲染。 – 我们引入了自适应 2D Token 打包(Adaptive 2D Token Packing, ATP),这是一种空间表示机制,通过最小化有效序列长度并大幅削减序列占用空间,同时严格保留 2D 空间先验,从而缓解计算瓶颈。 – 我们构建了多维试穿奖励(Multi-dimensional Try-on Reward, MTR)流程。它有效地抵消了扩散模型的频谱偏差(Spectral Bias),从物理层面挽救高频布料细节,并克服类塑料般的退化现象。 – 我们发布了 WearWow-2K 数据集,该数据集包含合成的通用多衣物模型,以解锁无掩码生成,并为超高清数字时尚研究建立了 2K 分辨率评估维度。

2 相关工作

单衣物虚拟试穿。早期的虚拟试穿范式主要依赖于生成对抗网络(GANs)[10,11,16,20,23,38,42–44, 48],通常采用两阶段流程,包括显式形变模块后接混合生成器。虽然在宏观姿态对齐方面有效,但基于 GAN 的架构在合成复杂的高频布料纹理以及扩展到超高分辨率方面存在固有困难。 最近,扩散模型(Diffusion Models)[29] 通过将试穿视为条件生成或图像修复任务 [5, 18, 28, 47],彻底改变了该领域。TryonDiffusion [52] 等方法引入了隐式形变机制,以更好地处理布料形变。随后的最先进框架——包括 OOTDiffusion [45]、IDM-VTON [7]、Any2AnyTryOn [15]、IMAGDressing [35]、Leffa [51]、PromptDresser [17]、cascade [21] 和 CatVTON [8]——通过先进的交叉注意力策略和定制的条件编码器,逐步完善了外观保持能力。尽管它们在保持复杂人体姿态和单衣物语义方面取得了显著成功,但这些架构本质上是为单物品场景设计的。当简单扩展到原生 2K 分辨率时,它们不可避免地会遇到传统 MSE 目标的频谱偏差,导致过度平滑、“类塑料”般的纹理,无法满足工业级触觉真实感的要求。 多衣物联合合成。与单物品 VTON 相比,多衣物合成由于复杂的空间遮挡和条件 Token 数量的指数级增长,呈现出更为严峻的挑战。虽然一些早期工作通过循环或顺序生成探索了组合式试穿 [9,22,43,50],但它们本质上存在严重的误差累积和不自然的图层混合问题。最近,OminiTry [12] 率先在统一的扩散框架内探索了多衣物输入。然而,由于自注意力机制的二次方(O(N^2))内存爆炸,目前仍严重缺乏专用的、开源的垂直基线,能够在不出现灾难性内存故障(OOM)的情况下执行原生 2K 多衣物联合推理。

第 5 页

WearWow 5

自适应2D装箱 文本编码器 “Awithwomanblue flaredwearingjeansa whiteand blackshirt,shoes.”paired 提示

稀疏Token剪除

VAE 多衣物条件 服装画布 编码器 … 稀疏密度: 40% ~70%

稀疏密度: 70% ~ 90%

噪声输入 诊断 VAE Transformer块 … Transformer块 解码器

去噪骨干网络

布料分布奖励 语义引导奖励 可训练 视觉 模型 🔥 编码器 高质量选择 HPS 原生2K输出 相似度 “过度平滑的牛仔裤…” 提示neg 参考 模型 “照片级真实纹理牛仔裤…” 提示pos 过度平滑拒绝

图2: WearWow的整体框架。我们的管道通过两个核心机制实现了无掩码、原生2K多衣物虚拟试穿。(顶部)自适应2D Token打包(ATP):给定一组参考服装 C,ATP算法将它们打包到一个统一的空间画布上。经过VAE编码后,稀疏Token剪除机制激进地丢弃背景空Token。这极大地最小化了有效序列长度以缓解内存爆炸,同时严格保留2D位置编码。(底部)多维试穿奖励(MTR):为了克服标准SFT的频谱偏差,MTR微调生成轨迹。它协同了布料分布奖励(CDR),该奖励惩罚过度平滑的伪影以锚定物理分布,以及语义引导奖励(SGR),该奖励利用HPS驱动的对比文本锚点(Promptpos, Promptneg)显式恢复高频触觉真实感。

因此,社区通常转向最先进的大型视觉语言模型(LVLMs)和商业生成式API(例如 QWen-image [40], Seedream4.0 [33], GPT-image 1.5 [1], KeLingv3 [37])来处理极端的组合复杂性。虽然这些基础模型展示了惊人的语义理解和零样本组合能力,但它们仍然是通用的文本到图像引擎。它们经常遭受跨服装特征泄漏的困扰,在复杂遮挡下难以维持空间一致性,并且无法渲染真实的材质保真度。

相比之下,我们提出的WearWow是专门为这一极端前沿领域设计的。通过自适应2D Token打包(ATP)从根本上解决多条件内存瓶颈,并通过多维试穿奖励显式恢复高频触觉纹理,WearWow为超高分辨率数字时尚建立了一个稳健、高效的专业解决方案。

第 6 页

6 X. Zhang. 等

3 方法论

3.1 概述与问题表述

原生2K多衣物虚拟试穿需要一个统一的生成范式,该范式既要能够解耦复杂的空间交互,又要严格限制计算开销。形式上,WearWow 接受三元组条件输入:(1) 无衣物目标人物图像 $I_{agnostic}$;(2) 一组 $K$ 个高分辨率参考衣物 $C = \{c_1, c_2, \dots, c_K\}$;以及 (3) 分层感知文本提示 $P$。为了实现无掩码生成,我们采用“真实地面真值,合成条件”范式构建了 WearWow-2K 数据引擎。我们利用真实的2K多衣物照片作为绝对目标 $\hat{I}_{target}$ 以保留原始的高频纹理,同时通过鲁棒的去衣管道逆向合成 $I_{agnostic}$。这种表述迫使模型隐式地学习物理深度顺序,而无需在推理前依赖精确的手动掩码(数据集细节推迟至补充材料中说明)。

如图2所示,成功将此表述扩展至原生2K范围需要解决两个连续的障碍:计算可行性和生成质量。我们的框架通过两个核心组件来解决这些问题。首先,自适应2D Token打包(Adaptive 2D Token Packing, ATP,第3.2节)有效缓解了显存瓶颈,为如何在极端分辨率下训练提供了切实可行的解决方案。其次,在此基础上,多维试穿奖励(Multi-dimensional Try-on Reward, MTR,第3.3节)抵消了扩散模型固有的频谱偏差,解决了如何有效训练以恢复真实触觉现实感的问题。

3.2 自适应2D Token打包(ATP)

在真实的虚拟试穿场景中,高分辨率参考衣物天然包含大量无信息的背景像素。在标准的基于Transformer的生成骨干网络中,输入序列由固定长度的基础Token $N_{base}$(源自噪声目标和无衣物模型)和条件衣物Token组成。简单地注入 $K$ 个参考衣物,每个产生 $N$ 个视觉Token,会将总序列长度扩展为 $N_{base} + K \cdot N$。鉴于自注意力机制固有的二次复杂度,这种简单的拼接会引发 $O((N_{base} + K \cdot N)^2)$ 的计算成本,这是令人望而却步的。随着 $K$ 的增加,这种几何级数爆炸会导致显存消耗灾难性增加以及严重的跨衣物空间干扰。为了在不损害高频结构完整性的情况下缓解这一问题,我们提出了自适应2D Token打包(ATP)机制。

自适应2D装箱。关键在于,ATP 并不改变自注意力固有的二次性质,而是策略性地最小化条件序列长度。ATP 不采用在1D中拼接条件(这会任意破坏空间先验)的方法,而是将参考注入表述为算法化的2D装箱优化问题。$K$ 个异构物品根据几何比例动态缩放,并紧密打包到统一的2D空间

第 7 页

WearWow 7

具有固定 token 容量 $L$(其中 $L \le K \cdot N$)的画布。这种空间重组立即将整体复杂度与 $K$ 的二次缩放解耦,严格将理论成本限制为 $O((N_{base} + L)^2)$。经验上,这种打包方式将有效前景 token 利用率从基线(标准填充批处理固有的)约 40% 大幅提高至近 70%,同时严格隔离空间坐标以防止特征泄漏。

稀疏 Token 剪枝与回退。为了将推理效率推向物理极限,ATP 进一步利用了统一画布的固有空间稀疏性。尽管采用了最优的 2D 边界框打包,但由于服装的不规则拓扑结构,画布不可避免地会保留无信息的空白填充。利用精确的二进制有效区域掩码,ATP 在分块后显式地剪枝并丢弃对应于这些背景空白区域的 $m$ 个视觉 token。因此,Transformer 处理的实际条件序列长度严格减少为 $(L – m)$,将最终的计算复杂度限制为 $O((N_{base} + L – m)^2)$。这种精确的掩码引导剪枝将条件 token 利用率从 70% 提升至 90% 以上,确保计算预算完全用于信息丰富的服装特征。

3.3 多维试穿奖励 (MTR)

虽然提出的 ATP 机制成功缓解了内存爆炸——使得原生 2K 多衣物训练在计算上可行——但仅仅提高分辨率并不能自动保证照片级真实的纹理。在实际应用中,用于虚拟试穿的标准监督微调(SFT)遇到了一个根本性的质量瓶颈,该瓶颈源于 MSE 目标的固有频谱偏差。模型倾向于优先对齐低频结构,而严重忽略了对于细粒度触觉真实感至关重要的高频细节。在原生的 2K 分辨率下,这种频谱偏差导致材料保真度次优,使得复杂纺织品(例如羊毛、牛仔布)退化为过度平滑的“塑料状”表面。为了系统地恢复这些高频分量并确保真实面料的渲染,我们制定了多维试穿奖励(MTR),这是一种后训练偏好对齐流程,通过双维目标显式地优化触觉真实感。理论上,MTR 继承了直接偏好优化 [27](DPO)的概念,从根本上绕过了传统强化学习算法(如 PPO [32])所需的计算昂贵的策略采样。

布料分布奖励 (CDR) CDR 的目标是利用高保真纹理模式与 SFT 阶段固有的过度平滑伪影之间的分布边际。通过将生成轨迹向高质量数据流形移动,CDR 隐式地惩罚低通滤波效应。

具体而言,我们根据生成结果的物理材料保真度策划了一个比较子集。在每个噪声时间步 $t$,通过扩散高质量(被选择)样本 $x_{w0}$ 和低质量

第 8 页

8 X. Zhang. 等人

(被拒绝) 样本 $x_t^l$ 到相同的噪声水平。对齐损失公式化为:

$$ \mathcal{L}^{\text{CDR}}_t = – \mathbb{E}_{t, x_t^w, x_t^l} \left[ \log \sigma \left( \mathbf{R}_{\theta}(x_t^w, \mathcal{V}_{\text{GT}}^w) – \mathbf{R}_{\theta}(x_t^l, \mathcal{V}_{\text{GT}}^l) \right) \right] \quad (1) $$

其中 $\sigma$ 表示 sigmoid 函数,$\mathcal{P}$ 是风格提示,$\mathcal{C}$ 是参考服装集合。为了避免训练显式的奖励模型,隐式奖励 $\mathbf{R}_\theta$ 直接通过可训练模型 $v_\theta$ 与冻结参考模型 $v_{\text{ref}}$ 之间的速度场预测误差来定义:

$$ \mathbf{R}_{\theta} ( x_t^* , \mathcal{C}, \mathcal{P} ) = \beta \left( v_{\text{ref}}(x_t^*, \mathcal{C}, \mathcal{P}) – v_{\theta}(x_t^*, \mathcal{C}, \mathcal{P}) \right) \quad (2) $$

其中 $\beta$ 是控制奖励边距的缩放超参数。$v_\theta$ 和 $v_{\text{ref}}$ 分别表示在时间步 $t$ 由可训练模型和冻结参考模型预测的速度场。$v_{\text{GT}}$ 表示为当前时间步解析计算的相应真实速度目标。$*$ 可以是 $w$ 或 $l$,即在相同时间步选择的或被拒绝的样本。

语义引导奖励 (SGR) 虽然布料分布奖励 (CDR) 成功校准了速度场以恢复细粒度的织物纹理,但仅依赖视觉偏好优化会导致收敛缓慢。我们将这一瓶颈归因于在漫长的 SFT 阶段建立的僵化的图文先验。由于基础模型将视觉分布与文本提示紧密耦合,孤立地优化视觉分支会产生显著的优化惯性。为了显式地打破这一障碍并加速多模态对齐,我们引入了受语义相对偏好优化 [36] 启发的互补文本目标。

SGR 扩大了生成图像与高质量材质提示之间的语义相似度差距,相对于低质量提示。首先,给定服装无关模型 $I_{\text{agnostic}}$、视觉条件 $\mathcal{C}$ 和基线提示 $\mathcal{P}$,扩散骨干网在噪声时间步 $t$ 预测速度场 $v_\theta(x_t, \mathcal{C}, \mathcal{P})$。利用单步去噪近似,我们将当前潜在状态直接投影到纯净的 $t=0$ 空间,获得原生 2K 空间观测 $\hat{I}_0$。为了建立显式的对比语义引导,我们构建成对的语义锚点:一个正提示 $\mathcal{P}_{\text{pos}}$(例如,高度详细、真实的材质描述)和一个负提示 $\mathcal{P}_{\text{neg}}$(例如,过度平滑或塑料般的指令)。一个冻结的多模态奖励模型(例如,CLIP [26])随后计算每个时间步 $t$ 生成图像与这些提示的余弦相似度,分别记为 $S_t^{\text{pos}}$ 和 $S_t^{\text{neg}}$。

$$ S_t^{\text{pos}} = \cos ( f_{\text{img}}(\hat{I}_0), f_{\text{txt}}(\mathcal{P}_{\text{pos}})) \quad (3) $$

$$ S_t^{\text{neg}} = \cos ( f_{\text{img}}(\hat{I}_0), f_{\text{txt}}(\mathcal{P}_{\text{neg}})) \quad (3) $$

其中 $f_{\text{img}}$ 和 $f_{\text{txt}}$ 分别表示视觉和文本编码器。语义引导损失使用标准的基于边距的 ReLU 激活函数公式化为:

$$ \mathcal{L}^{\text{SGR}}_t = \text{ReLU} \left( \tau \left( 1 + \omega S_t^{\text{neg}} – S_t^{\text{pos}} \right) \right) \quad (4) $$

第 9 页

WearWow 9

其中 $\omega > 0$ 作为相对 CFG 缩放系数,$\tau$ 为预定义的语义边界。 纯语义驱动优化的一个有据可查的漏洞是“奖励黑客”(reward hacking),即模型在严重牺牲结构完整性的情况下(例如,导致色偏或拓扑碎片化),不可控地过度优化文本对齐。为了有效规避这种退化行为,我们并不单独依赖 SGR。相反,我们的完整多维试穿奖励(MTR)管道协同了这两个维度的目标:

$$ \mathcal{L}^{\text{MTR}}_t = \alpha_t \mathcal{L}^{\text{CDR}}_t + \lambda \mathcal{L}^{\text{SGR}}_t, \quad (5) $$

其中 $\lambda$ 是平衡系数,$\alpha_t$ 是一个依赖于时间步的加权函数,旨在极端噪声水平下动态抑制 CDR 梯度。 这种双维度平衡机制作为对抗奖励黑客的稳健防御。CDR 隐式地将生成轨迹锚定在物理正确的高频数据分布内,防止结构崩溃,而 SGR 则为触觉恢复提供显式的加速语义引导。两者结合,使模型能够同时从视觉和文本角度微调其输出。

4 实验

4.1 数据集

为了支持原生 2K 多衣物合成并赋能无掩码训练,我们构建了 WearWow-2K 数据集,包含约 100,000 个训练三元组和 2,000 个测试三元组,分辨率为纯净的 2048 × 1536。为了确保极致的视觉质量和复杂的空间多样性,我们采用了一种混合策展策略。与现有的单件基准不同,WearWow-2K 具有复杂的分层感知风格组合,每个主体同时包含 1 到 6 件衣物。其高度多样化的服装本体不仅限于基本服装,还包括鞋类和细粒度配饰(例如耳环),为多条件学习提供了必要的物理正确空间交互。详细的数据分布和定性视觉示例推迟至补充材料中。

4.2 实现细节

我们在预训练的 Qwen-Image-Edit 基础模型之上构建 WearWow 生成主干,通过 Qwen2.5VL [46] 视觉语言编码器结合我们的自适应2D Token打包(ATP)模块,从参考衣物和文本提示中提取分层特征。在原生 2K 分辨率(2048 × 1536)下的初始监督微调(SFT)阶段,全局批量大小为 8,共进行 80K 步。SFT 收敛后,我们执行多维试穿奖励(MTR)对齐,以显式恢复触觉真实感。SGR 文本-图像相似度使用冻结的 HPSv2 [41] 计算。

第 10 页

10 X. Zhang. et al.

Model Garment Any2AnyTryOn IDM-VTON IMAGDressing Leffa OOTDiffusion PromptDresser CatVTON Ours

图 3:在单件试穿任务中,VITON-HD 和 DressCode 上的定性比较。 与其他方法相比,WearWow 生成了纹理更一致的图片。

MTR 微调在降低的学习率 1×10−5 下额外运行 800 步,超参数经经验设置为:CFG 比例 ω ∈[0.1, 0.6](随时间步变化而采样),安全边际 τ = 0.5,CDR 比例 β = 0.5,以及平衡权重 λ = 0.65。所有训练均在 8 块 NVIDIA H20 GPU 上使用 bf16 精度进行。

4.3 基线与实验设置

为了全面评估 WearWow 的鲁棒性和可扩展性,我们设计了一个双轨评估协议:标准单件衣物设置和超高分辨率多件衣物设置。 单件衣物设置。为了确保严格且全面的评估,我们在一个统一的测试数据集上进行了单件衣物实验,该数据集包括广泛采用的 VITON-HD [6] 和 DressCode [25] 基准。由于现有的开源基线严格将其范围限制在此单物品范式中,我们在标准的 1024 × 768 分辨率下评估此特定任务。我们将 WearWow 与一系列最先进的基于扩散的模型进行基准测试,包括 Any2AnyTryOn [15]、IDM-VTON [7]、IMAGDressing [35]、Leffa [51]、OOTDiffusion [45]、PromptDresser [19] 和 CatVTON [8]。 多件衣物设置。为了评估多件衣物合成的极端组合复杂性,我们使用我们提出的 WearWow-2K 数据集,其原生分辨率为 2048 × 1536。由于传统的开源试穿模型在多条件 2K 输入下会发生数学崩溃(OOM,即显存溢出),我们将 WearWow 与最近最强大的生成式基础模型和商业 API 进行基准测试。基线包括本地多模态模型(OminiTry [12]、QWen-image [40])和顶级闭源 API(Nano Banana Pro [30]、KeLingv3 [37]、Seedream4.0 [33] 和 GPT-image 1.5 [3])。 评估指标。我们采用一套稳健的定量指标来评估生成质量和结构对齐。为了明确量化我们在恢复高频触觉真实感和感知质量方面的核心贡献,我们优先考虑 Learned Perceptual Image Patch Similarity (LPIPS [49]) 和

第 11 页

WearWow 11

Model Garment Qwen-Image OminiTry Seedream4.0 GPT-image-1.5 Klingv3 Nano-Banana Pro WearWow

图 4:在 WearWow-2k 上的定性比较,展示了我们在复杂多件组合和具有挑战性的羊毛纹理方面卓越的 photorealism(照片级真实感)。

Fréchet Inception Distance (FID [34])。我们还报告了 Kernel Inception Distance (KID [4]) 以进行无偏分布测量,以及 Structural Similarity Index (SSIM [39]) 以评估空间对齐。对于消融实验,还通过测量文本描述与结果之间的相似度来计算 CLIP score。 Human Evaluation (HE)。为了补充偶尔在 2K 分辨率下遗漏微观感知细微差别的定量指标,我们进行了严格的 Human Evaluation,共有 100 名多样化的参与者。评估者盲评来自 WearWow 和基线模型的随机输出,评分维度包括:(1) Material Fidelity(触觉真实感,无塑料伪影),(2) Spatial Coherence(正确的多衣物遮挡关系),以及 (3) Overall Photorealism(整体照片级真实感)。报告平均 Human Evaluation (HE) 分数以提供明确的客观基准。

4.4 定量分析

Single-Garment Evaluation。如表 1 所示,WearWow 在感知真实感方面表现出极具竞争力的性能。具体而言,WearWow 在分布和感知指标上均取得了强劲结果,与 IDM-VTON [7] 和 Leffa [51] 等近期基线模型相比,在 FID 和 LPIPS 方面显示出显著改进。值得注意的是,虽然 CatVTON [8] 实现了略高的 SSIM,但该指标严重依赖逐像素平均误差,这往往倾向于产生过度平滑、低频输出的模型。相比之下,WearWow 在 FID、KID 和 LPIPS 上的改进表明,我们的 MTR 管道有效地恢复了高频触觉真实感。此外,我们的 Human Evaluation (HE) 支持了这一点,即与人类视觉偏好的一致性;评估者通常在 Material Fidelity 和整体 Photorealism 方面更青睐 WearWow。

第 12 页

12 X. Zhang. 等

表 1:在 VITON-HD 和 DressCode 数据集上的定量比较。

方法 SSIM ↑ FID ↓ LPIPS ↓ KID ↓ HE ↑

Any2AnyTryOn [15] 0.8460 6.7285 0.1292 1.4906 0.1138 IDM-VTON [7] 0.8779 5.9893 0.0720 1.7433 0.0863 IMAGDressing [35] 0.8298 9.0388 0.1120 2.8076 0.0379 Leffa [51] 0.8582 5.9421 0.0825 0.9899 0.1389 OOTDiffusion [45] 0.8565 5.9640 0.0782 0.9249 0.0505 PromptDresser [19] 0.8513 6.5618 0.0973 1.3420 0.0905 CatVTON [8] 0.8950 4.5698 0.0746 1.0298 0.0737

WearWow 0.8815 4.2475 0.0688 0.6503 0.4084

表 2:在 WearWow-2K 上的定量比较。

方法 FID ↓ KID ↓ LPIPS ↓ SSIM ↑ HE ↑

OminiTry [12] 12.4164 2.0228 0.1444 0.8002 0.0257 QWen-image [40] 14.3538 2.3196 0.2175 0.7516 0.0286 Seedream4.0 [33] 14.3389 4.7620 0.2175 0.7699 0.1514 Nano Banana Pro [31] 8.1823 0.8285 0.1114 0.8215 0.2229 KeLingv3 [37] 8.9624 1.0006 0.1108 0.8255 0.1314 GPT-image 1.5 [3] 10.7218 1.3345 0.1724 0.7705 0.1857

WearWow (ours) 7.5400 0.2643 0.0773 0.8461 0.2543

多衣物评估。WearWow 的定量优势在原生 2K 多衣物场景(表 2)中进一步显现。尽管 Nano Banana Pro [31] 和 KeLingv3 [37] 等商业 API 参数量巨大,但在严格的 spatial control(空间控制)和 structural consistency(结构一致性)方面往往遇到困难,这反映在它们的 FID 和 KID 分数上。WearWow 有效地解决了这些挑战,在关键指标(FID、KID、SSIM 和 LPIPS)上实现了持续改进。这种稳定的性能表明,我们的 Adaptive 2D Token Packing(自适应2D Token打包)成功缓解了多衣物条件的空间干扰,而 MTR(多维试穿奖励)则在极端空间尺度下保持了生成质量。与客观指标一致,我们的 Human Evaluation(HE,人工评估)显示用户明显偏好 WearWow,特别是突出了其空间连贯性和 mask-free compositional stability(无掩码组合稳定性),相较于闭源基础模型表现更佳。

4.5 定性分析

单衣物触觉真实感与一致性。如图 3 所示,现有基线模型在渲染具有复杂物理属性的衣物时面临严重困难。IDM-VTON [7] 和 CatVTON [8] 等模型倾向于充当低通滤波器,将复杂的材质退化为合成的、类似塑料的平坦表面。相反,得益于双维度 MTR 对齐,

第 13 页

WearWow 13

模型 服装 带级联超分 无ATP 带CDR 带SGR WearWow

图 5:我们可视化了所提出模块的影响。我们的完整 MTR 管道(Ours)在不牺牲结构完整性的情况下,稳健地恢复了微观层面的触觉真实感。

WearWow 在恢复高频细节方面表现出卓越的能力。值得注意的是,在处理粗糙丹宁布或复杂纹理服装等具有挑战性的面料时,我们的框架展现了出色的稳定性和一致性。 多服装稳定性与材质保真度。图 4 展示了在 WearWow-2K 上的无掩码联合合成能力。当提示同时穿着多件物品(例如,内衬衫、厚外套、丹宁裤和精致配饰)时,最近的开源模型和基线 API 经常表现出严重的组合不稳定性。它们要么幻觉出怪异的混合纹理(特征泄漏),要么完全忽略特定的服装物品,要么在原生 2K 分辨率下遭遇灾难性的纹理退化。与之形成鲜明对比的是,WearWow 以无可挑剔的生成稳定性运行。在分层感知标注和 ATP 模块严格的 2D 位置保持的驱动下,WearWow 能够准确渲染正确的深度顺序(例如,夹克明确敞开在塞入衬衫的上方),具有完美的遮挡边界,同时在整个并发服装中保持极致的材质保真度。

4.6 消融实验

为了严格验证我们的核心贡献,我们针对各种基线评估了空间表示策略(ATP)和偏好对齐管道(MTR)(表 3 和图 5)。为了验证 ATP,我们将 WearWow 与两种扩展范式进行比较。带级联超分(w/ Cascaded SR)变体在较低分辨率下处理输入,然后使用外部超分辨率模型,这不可避免地会引入结构幻觉。或者,保持原生 2K 训练但天真地将参考物品下采样以满足内存

第 14 页

14 X. Zhang. et al.

约束(无 ATP)严重破坏了高频视觉先验。因此,这两种方法都出现了明显的纹理退化和灾难性的过度平滑,其得分均低于配备 ATP 的模型。这表明,算法上的打包和剪除背景 Token 对于保留精确的前景分辨率和空间归纳偏置至关重要。

接下来,我们剖析 MTR 流程,以验证其物理和语义组件之间的协同效应。仅应用布料分布奖励(w/ CDR)将生成轨迹锚定到数据分布上,带来了轻微的视觉改善。然而,其训练收敛明显缓慢,且最终难以完全克服 SFT 优化惯性,导致复杂高频纹理的触觉真实感不足。相反,仅依赖语义引导奖励(w/ SGR)虽然提供了强大的文本推动力,但表现出关键的脆弱性。纯粹的语义引导最初会强制与文本提示过度对齐,导致织物出现不自然的色偏和过于粗糙、毛躁的外观。更关键的是,随着训练的进展,它不可避免地引发了严重的“奖励黑客”(reward hacking)。通过协同这两个目标,我们完整的 MTR 流程成功解决了上述所有问题;CDR 提供了必要的物理锚点以确保稳定性并防止黑客行为,而 SGR 则有效加速了收敛并恢复了完美的微观触觉真实感。

表 3:我们的完整 WearWow 框架与其消融变体的比较。 方法 SSIM ↑ LPIPS ↓ CLIP Score ↑ w/ cascade SR 0.8502 0.1237 0.2651 w/o ATP 0.8468 0.0923 0.2654 w/ SGR 0.8599 0.0874 0.2678 w/ CDR 0.8596 0.0961 0.2664 Ours 0.8677 0.0870 0.2690

5 结论

在本文中,我们介绍了 WearWow,这是一个有效的生成框架,将虚拟试穿扩展到了原生 2K 多衣物模式。为了消除与极高分辨率条件注入相关的令人望而却步的内存障碍,我们提出了自适应 2D Token 打包(Adaptive 2D Token Packing)。通过利用衣物图像固有的空间稀疏性,ATP 算法将异构视觉 Token 打包并剪除到统一的 2D 布局中,有效缓解了计算爆炸,同时严格保留了必要的 2D 空间先验。此外,为了解决标准扩散模型固有的频谱偏差和过度平滑退化问题,我们制定了多维试穿奖励(Multi-dimensional Try-on Reward)。通过协同布料分布奖励以锚定物理分布,以及语义引导奖励以提供显式的文本推动力,MTR 将生成轨迹对齐以惩罚塑料般的伪影,并稳健地恢复微观触觉真实感。在 WearWow-2K 数据集的支持下,我们的框架

第 15 页

WearWow 15

本工作实现了精确的空间组合与逼真的面料细节,并确立了2K多衣物虚拟试穿领域的最新技术水平。 社会影响:尽管WearWow极大地推动了数字时尚的发展,但我们承认超逼真人类生成固有的风险。我们强调需要强大的深度伪造检测算法以及严格规范的部署,以防止生成身份被恶意滥用。 局限性与未来工作 尽管WearWow成功将多衣物虚拟试穿扩展至原生2K分辨率,并确立了触觉真实感的新标准,但它仍存在一些局限性,为未来的研究提供了令人兴奋的方向。处理极端复杂的背面遮挡仍然是一个普遍的挑战。未来的工作将探索整合显式的3D人体先验,以在任意相机角度下保证严格且视角一致的多衣物合成。此外,基于WearWow建立的稳健空间表示和触觉基础,一个自然且极具前景的进展是将此框架扩展到时域。我们旨在探索高分辨率视频虚拟试穿的时间一致性机制,并结合复杂环境光照下的动态衣物重光照。

致谢

本研究得到了国家重点研发计划(2024YFE0203100)、青年教师科研创新能力支持项目(No.ZYGXQNJSKYCXNLZCXM-I28)、深圳市科技计划(Grant No.QNXMA20250701093544048)以及中山大学通用具身智能中心的支持。

参考文献

1. Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F.L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al.: Gpt-4 technical report. arXiv preprint arXiv:2303.08774 (2023) 5 2. Bai, S., Zhou, H., Li, Z., Zhou, C., Yang, H.: Single stage virtual try-on via de- formable attention flows. In: European Conference on Computer Vision (2022) 2 3. Betker, J., Goh, G., Jing, L., Brooks, T., Wang, J., Li, L., Ouyang, L., Zhuang, J., Lee, J., Guo, Y., et al.: Improving image generation with better captions. Computer Science. https://cdn. openai. com/papers/dall-e-3. pdf 2(3), 8 (2023) 10, 12 4. Bińkowski, M., Sutherland, D.J., Arbel, M., Gretton, A.: Demystifying mmd gans (2021), https://arxiv.org/abs/1801.01401 11 5. Chen, X., Huang, L., Liu, Y., Shen, Y., Zhao, D., Zhao, H.: Anydoor: Zero-shot object-level image customization. arXiv preprint arXiv:2307.09481 (2023) 4 6. Choi, S., Park, S., Lee, M., Choo, J.: Viton-hd: High-resolution virtual try-on via misalignment-aware normalization. In: Proc. of the IEEE conference on computer vision and pattern recognition (CVPR) (2021) 10 7. Choi, Y., Kwak, S., Lee, K., Choi, H., Shin, J.: Improving diffusion models for authentic virtual try-on in the wild. arXiv preprint arXiv:2403.05139 (2024) 4, 10, 11, 12

第 16 页

16 X. Zhang. et al.

8. Chong, Z., Dong, X., Li, H., Zhang, S., Zhang, W., Zhang, X., Zhao, H., Liang, X.: Catvton: Concatenation is all you need for virtual try-on with diffusion models (2024), https://arxiv.org/abs/2407.15886 4, 10, 11, 12 9. Cui, A., McKee, D., Lazebnik, S.: Dressing in order: Recurrent person image gen- eration for pose transfer, virtual try-on and outfit editing. In: Proceedings of the IEEE/CVF international conference on computer vision (2021) 4 10. Dong, H., Liang, X., Shen, X., Wang, B., Lai, H., Zhu, J., Hu, Z., Yin, J.: Towards multi-pose guided virtual try-on network. In: Proceedings of the IEEE/CVF inter- national conference on computer vision (2019) 4 11. Dong, X., Zhao, F., Xie, Z., Zhang, X., Du, D.K., Zheng, M., Long, X., Liang, X., Yang, J.: Dressing in the wild by watching dance videos. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2022) 4 12. Feng, Y., Zhang, L., Cao, H., Chen, Y., Feng, X., Cao, J., Wu, Y., Wang, B.: Omnitry: Virtual try-on anything without masks. arXiv preprint arXiv:2508.13632 (2025) 4, 10, 12 13. Ge, Y., Song, Y., Zhang, R., Ge, C., Liu, W., Luo, P.: Parser-free virtual try-on via distilling appearance flows. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition (2021) 2 14. Gou, J., Sun, S., Zhang, J., Si, J., Qian, C., Zhang, L.: Taming the power of diffusion models for high-quality virtual try-on with appearance flow. In: Proceedings of the 31st ACM International Conference on Multimedia (2023) 2 15. Guo, H., Zeng, B., Song, Y., Zhang, W., Liu, J., Zhang, C.: Any2anytryon: Leverag- ing adaptive position embeddings for versatile virtual clothing tasks. In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision. pp. 19085– 19096 (2025) 4, 10, 12 16. He, S., Song, Y.Z., Xiang, T.: Style-based global appearance flow for virtual try-on. In: CVPR (2022) 4 17. Hertz, A., Mokady, R., Tenenbaum, J., Aberman, K., Pritch, Y., Cohen-Or, D.: Prompt-to-prompt image editing with cross attention control. arXiv preprint arXiv:2208.01626 (2022) 4 18. Huang, L., Chen, D., Liu, Y., Shen, Y., Zhao, D., Zhou, J.: Composer: Cre- ative and controllable image synthesis with composable conditions. arXiv preprint arXiv:2302.09778 (2023) 4 19. Kim, J., Jin, H., Park, S., Choo, J.: Promptdresser: Improving the quality and controllability of virtual try-on via generative textual prompt and prompt-aware mask (2024), https://arxiv.org/abs/2412.16978 10, 12 20. Lee, S., Gu, G., Park, S., Choi, S., Choo, J.: High-resolution virtual try-on with misalignment and occlusion-handled conditions. In: European Conference on Com- puter Vision (2022) 4 21. Li, G., Wang, Y., Luan, J., Zhao, L., Xing, W., Lin, H., Ou, B.: Cascaded diffusion models for virtual try-on: Improving control and resolution. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 39, pp. 4689–4697 (2025) 4 22. Lin, E., Zhang, X., Zhao, F., Luo, Y., Dong, X., Zeng, L., Liang, X.: Dreamfit: Garment-centric human generation via a lightweight anything-dressing encoder. In: Proceedings of the AAAI Conference on Artificial Intelligence (AAAI). pp. 5218–5226 (2025), aAAI 2025 4 23. Minar, M.R., Tuan, T.T., Ahn, H., Rosin, P., Lai, Y.K.: Cp-vton+: Clothing shape and texture preserving image-based virtual try-on. In: The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops (June 2020) 4

第 17 页

WearWow 17

24. Morelli, D., Baldrati, A., Cartella, G., Cornia, M., Bertini, M., Cucchiara, R.: LaDI-VTON: Latent Diffusion Textual-Inversion Enhanced Virtual Try-On. In: Proceedings of the ACM International Conference on Multimedia (2023) 2 25. Morelli, D., Fincato, M., Cornia, M., Landi, F., Cesari, F., Cucchiara, R.: Dress code: High-resolution multi-category virtual try-on (2022) 10 26. Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., Sutskever, I.: Learning transferable visual models from natural language supervision (2021) 8 27. Rafailov, R., Sharma, A., Mitchell, E., Manning, C.D., Ermon, S., Finn, C.: Direct preference optimization: Your language model is secretly a reward model. Advances in neural information processing systems 36, 53728–53741 (2023) 7 28. Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., Chen, M.: Hierarchical text- conditional image generation with clip latents. arXiv preprint arXiv:2204.06125 (2022) 4 29. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition (2022) 4 30. Saharia, C., Chan, W., Saxena, S., Li, L., Whang, J., Denton, E., Ghasemipour, S.K.S., Ayan, B.K., Mahdavi, S.S., Lopes, R.G., Salimans, T., Ho, J., Fleet, D.J., Norouzi, M.: Photorealistic text-to-image diffusion models with deep language un- derstanding (2022) 10 31. Saharia, C., Chan, W., Saxena, S., Li, L., Whang, J., Denton, E.L., Ghasemipour, K., Gontijo Lopes, R., Karagol Ayan, B., Salimans, T., et al.: Photorealistic text- to-image diffusion models with deep language understanding. Advances in neural information processing systems 35, 36479–36494 (2022) 12 32. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O.: Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347 (2017) 7 33. Seedream, T., Chen, Y., Gao, Y., Gong, L., Guo, M., Guo, Q., Guo, Z., Hou, X., Huang, W., Huang, Y., et al.: Seedream 4.0: Toward next-generation multimodal image generation. arXiv preprint arXiv:2509.20427 (2025) 5, 10, 12 34. Seitzer, M.: pytorch-fid: FID Score for PyTorch. https://github.com/mseitzer/ pytorch-fid (August 2020), version 0.3.0 11 35. Shen, F., Jiang, X., He, X., Ye, H., Wang, C., Du, X., Li, Z., Tang, J.: Imagdressing- v1: Customizable virtual dressing. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 39, pp. 6795–6804 (2025) 4, 10, 12 36. Shen, X., Li, Z., Yang, Z., Zhang, S., Zhang, Y., Li, D., Wang, C., Lu, Q., Tang, Y.: Directly aligning the full diffusion trajectory with fine-grained human preference. arXiv preprint arXiv:2509.06942 (2025) 8 37. Team, K., Chen, J., Ci, Y., Du, X., Feng, Z., Gai, K., Guo, S., Han, F., He, J., He, K., et al.: Kling-omni technical report. arXiv preprint arXiv:2512.16776 (2025) 5, 10, 12 38. Wang, B., Zheng, H., Liang, X., Chen, Y., Lin, L.: Toward characteristic-preserving image-based virtual try-on network. In: Proceedings of the European Conference on Computer Vision (ECCV). pp. 589–604 (2018) 4 39. Wang, Z., Bovik, A.C., Sheikh, H.R., Simoncelli, E.P.: Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing 13(4), 600–612 (2004) 11 40. Wu, C., Li, J., Zhou, J., Lin, J., Gao, K., Yan, K., Yin, S.m., Bai, S., Xu, X., Chen, Y., et al.: Qwen-image technical report. arXiv preprint arXiv:2508.02324 (2025) 5, 10, 12

第 18 页

18 X. Zhang. 等

41. Wu, X., Hao, Y., Sun, K., Chen, Y., Zhu, F., Zhao, R., Li, H.: Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis. arXiv preprint arXiv:2306.09341 (2023) 9 42. Xie, Z., Huang, Z., Dong, X., Zhao, F., Dong, H., Zhang, X., Zhu, F., Liang, X.: Gp-vton: Towards general purpose virtual try-on via collaborative local-flow global-parsing learning. In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition (2023) 2, 4 43. Xie, Z., Huang, Z., Zhao, F., Dong, H., Kampffmeyer, M., Dong, X., Zhu, F., Liang, X.: Pasta-gan++: A versatile framework for high-resolution unpaired virtual try- on. arXiv preprint arXiv:2207.13475 (2022) 4 44. Xie, Z., Zhang, X., Zhao, F., Dong, H., Kampffmeyer, M.C., Yan, H., Liang, X.: Was-vton: Warping architecture search for virtual try-on network. In: Proceedings of the 29th ACM International Conference on Multimedia (2021) 4 45. Xu, Y., Gu, T., Chen, W., Chen, C.: Ootdiffusion: Outfitting fusion based latent diffusion for controllable virtual try-on. arXiv preprint arXiv:2403.01779 (2024) 4, 10, 12 46. Yang, A., Li, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Gao, C., Huang, C., Lv, C., et al.: Qwen3 technical report. arXiv preprint arXiv:2505.09388 (2025) 9 47. Yang, B., Gu, S., Zhang, B., Zhang, T., Chen, X., Sun, X., Chen, D., Wen, F.: Paint by example: Exemplar-based image editing with diffusion models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023) 4 48. Yang, H., Zhang, R., Guo, X., Liu, W., Zuo, W., Luo, P.: Towards photo-realistic virtual try-on by adaptively generating-preserving image content. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition (2020) 4 49. Zhang, R., Isola, P., Efros, A.A., Shechtman, E., Wang, O.: The unreasonable effectiveness of deep features as a perceptual metric. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 586–595 (2018) 10 50. Zhang, X., Lin, E., Li, X., Luo, Y., Kampffmeyer, M., Dong, X., Liang, X.: Mmtryon: Multi-modal multi-reference control for high-quality fashion generation (2024), https://arxiv.org/abs/2405.00448 4 51. Zhou, Z., Liu, S., Han, X., Liu, H., Ng, K.W., Xie, T., Cong, Y., Li, H., Xu, M., Pérez-Rúa, J.M., Patel, A., Xiang, T., Shi, M., He, S.: Learning flow fields in at- tention for controllable person image generation. arXiv preprint arXiv:2412.08486 (2024) 4, 10, 11, 12 52. Zhu, L., Yang, D., Zhu, T., Reda, F., Chan, W., Saharia, C., Norouzi, M., Kemelmacher-Shlizerman, I.: Tryondiffusion: A tale of two unets. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023) 4

发表评论