3D风格化新突破:DreamStyle3D如何用10秒生成高保真资产?

快速导读:关键差距在于缺乏对几何与风格特征的显式解耦。传统方法在单一注意力机制中混合处理两者,导致信息干扰。DreamStyle3D提出通过架构层面的分离,而非简单的输入拼接,来解决这一根本问题。

3D内容生成领域长期面临一个核心矛盾:如何在保持几何结构一致性的同时,高效地注入复杂的艺术风格?传统的优化方法如SDS虽然效果尚可,但耗时极长;而基于特征融合的快速方法往往导致语义漂移或结构扭曲。DreamStyle3D通过原生3D扩散框架,试图打破这一僵局。

该工作基于TRELLIS模型,引入了Decoupled Dual Cross-Attention (DDCA)机制,明确区分几何与风格的处理路径。同时,通过Style Disentanglement Augmentation策略,在训练阶段强制模型学习解耦的特征表示。这一组合不仅提升了生成质量,更将推理时间压缩至10秒以内,为实时3D风格化提供了可行方案。

英文题目:DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement

论文出处:arXiv 每日论文精选 · arXiv:2607.24721

原始论文:PDF / 论文页面

对应视频标题:3D风格化新突破:DreamStyle3D如何用10秒生成高保真资产?|推荐指数:★★★★★

这篇论文解决什么问题?

现有的3D风格化方法主要分为两类:优化基方法和特征融合方法。优化基方法如StyleTex,通过迭代优化来匹配风格,虽然能产生高质量结果,但单次生成需要16分钟以上,难以满足实际应用需求。特征融合方法如3D-style-LRM,试图通过线性组合CLIP特征来加速过程,但往往导致风格过平滑或结构失真。

根本问题在于风格与几何特征的纠缠。在标准扩散模型中,风格信息(如颜色、笔触)与几何信息(如形状、拓扑)在特征空间中高度耦合。当模型试图同时处理两者时,容易产生视觉伪影,例如风格纹理错误地附着在错误的几何结构上,或者几何细节被风格噪声淹没。

此外,缺乏大规模配对的3D风格化数据集也是制约领域发展的瓶颈。大多数方法依赖2D风格迁移结果进行3D提升,这种间接流程引入了额外的误差累积,且难以保证多视图的一致性。

核心创新

方法概览

关键差距在于缺乏对几何与风格特征的显式解耦。传统方法在单一注意力机制中混合处理两者,导致信息干扰。DreamStyle3D提出通过架构层面的分离,而非简单的输入拼接,来解决这一根本问题。

  • Decoupled Dual Cross-Attention (DDCA)是核心创新。它设计了两个独立的交叉注意力分支:一个分支接收来自DINO编码器的几何特征,专注于结构保持;另一个分支接收来自CLIP编码器的风格特征,专注于风格注入。这种架构避免了单一注意力机制中的特征干扰。
  • Style Disentanglement Augmentation包含两个关键组件:Structure-Aware Perturbation (SAP)和Color Remapping。SAP通过对风格图像进行掩码和洗牌,破坏其结构信息,迫使模型仅从剩余信息中学习风格;Color Remapping则扰动内容图像的颜色,防止模型过度依赖颜色线索来推断结构。
  • 模型基于TRELLIS构建,利用其Structured Latents (SLAT)表示3D结构。DDCA模块被集成到扩散去噪过程中,确保在每一步去噪时,几何和风格信息都能独立且正确地引导生成过程。
  • 自动化数据集构建流程使用OmniStyle生成2D风格化图像,再通过Hunyuan3D-2.1提升为3D资产。经过严格的质量过滤,最终构建了约1.5万组内容-风格-风格化三元组数据,为模型训练提供了充足且高质量的监督信号。

逐图理解论文

现有困境

现有困境
Figure 2: Visualization of artifacts caused by the entangle- ment of style and geometric structure in the base model.

现有方法常陷入两难:优化基方法如StyleTex虽质量高但耗时极长,而快速特征融合方法则易导致风格与几何纠缠,产生视觉伪影。这种纠缠使得模型难以区分形状与纹理,导致结构失真。

核心区分

核心区分
Figure 3: Overall pipeline of the proposed DreamStyle3D approach for stylized 3D asset generation in native 3D space.

详细描绘了DDCA模块的结构。观察几何分支和风格分支如何独立处理特征,并在去噪过程中融合。这是理解方法核心的关键。

最强结论

最强结论
Table 1: Comparison of 3D style transfer methods using source-image-based metrics, VLM Score, and inference time.

定量对比结果。关注CLIP、DINO和推理时间指标,验证DreamStyle3D在质量和效率上的双重优势。

意义与局限

意义与局限
Figure 7: Ablation of Style Disentanglement Augmentation.

Style Disentanglement Augmentation的消融实验。观察移除SAP或Color Remapping后,生成结果在风格或结构上的退化。

实验如何设计?

  • 评估指标包括基于源图像的CLIP、DINO、Gram和AdaIN分数,以及VLM Score。这些指标分别从语义相似度、结构保真度、风格统计量和视觉语言模型感知质量等多个维度评估生成结果。
  • 对比基线包括StyleTex、3D-style-LRM、MV-Adapter、Hunyuan3D-2.1和TRELLIS。实验涵盖了不同对象类别和风格类型,确保评估的全面性。
  • 消融实验针对DDCA的不同变体(如MLP融合、DINO融合、仅风格)以及Style Disentanglement Augmentation的各个组件进行,以验证每个模块的贡献。

关键结果与论文证据

  • 在CLIP分数上,DreamStyle3D达到80.096,显著高于StyleTex的78.726(第7页)。这表明模型在语义一致性方面表现优异。
  • DINO分数为63.319,远超StyleTex的50.773(第7页)。这证明了DDCA在保持几何结构方面的有效性。
  • 推理时间约为10秒,相比StyleTex的16分钟和3D-style-LRM的30秒,效率提升显著(第7页)。这使得实时应用成为可能。
  • 在参考基准评估中,Reference CLIP为0.842,高于MV-Adapter的0.821;Reference LPIPS为0.241,低于MV-Adapter的0.271(第7页)。这表明生成结果在感知质量上更接近真实风格化资产。
  • 消融实验显示,移除SAP或Color Remapping会导致性能下降,验证了Style Disentanglement Augmentation的必要性(第8页)。
  • 用户研究中,50名参与者对DreamStyle3D的偏好率最高,进一步证实了其视觉质量的优越性(第13页)。

阅读时需要注意

  • 模型依赖预训练的DINO和CLIP编码器,这些编码器可能带有固有的偏差,例如DINO偏向局部结构,CLIP偏向语义抽象,这可能限制模型对某些风格或结构的处理能力。
  • 自动化数据集构建流程依赖上游模型(OmniStyle和Hunyuan3D-2.1)的质量。如果上游模型产生错误,这些错误可能传播到训练数据中,影响最终模型的性能。
  • Style Disentanglement Augmentation仅在训练阶段使用,推理时模型依赖学习到的先验知识。这意味着模型在面对未见过的风格或复杂几何时,可能无法主动进行特征解耦,导致泛化能力受限。

关联工作

  • TRELLIS作为基础模型,提供了高效的3D生成框架。DreamStyle3D在其基础上引入了风格化能力,扩展了其应用场景。
  • StyleTex和3D-style-LRM作为主要基线,代表了当前3D风格化方法的两极:高质量但缓慢,快速但质量较低。DreamStyle3D试图在两者之间找到平衡。
  • MV-Adapter和Hunyuan3D-2.1在多视图一致性和3D提升方面提供了参考,但缺乏直接的风格迁移能力。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

DreamStyle3D: 通过双重注意力解耦实现高效 3D 风格化资产生成

Kai Wang Ziheng Ouyang Xuying Zhang VCIP, 南开大学 VCIP, 南开大学 JD 探索学院 中国天津 中国天津 中国北京 中关村学院 oyzh@mail.nankai.edu.cn VCIP, 南开大学 中国北京 中国天津 wangkaink25@mail.nankai.edu.cn zhangxuying1004@gmail.com

Ming-Ming Cheng∗ Qibin Hou VCIP & AAIS, 南开大学 VCIP & AAIS, 南开大学 中国天津 中国天津 cmm@nankai.edu.cn houqb@nankai.edu.cn

内容 图像 风格 图像2026 7月 27 [cs.CV]

图 1:给定一张内容图像和一张风格图像,我们的 DreamStyle3D 能在 10 秒内生成高保真度的 3D 风格化资产。

摘要 随着游戏、动画和虚拟现实产业的蓬勃发展,对高效生成风格化 3D 资产的需求迅速增长。然而,现有方法在同时保持风格保真度、几何一致性和生成效率方面仍面临挑战,因为它们大多仍依赖于间接的 2D 到 3D 风格化流程。这促使我们构建一个原生的 3D 风格化框架,该框架能够显式地将风格从几何中解耦,同时保持高效性。为此,我们提出了 DreamStyle3D,这是一种基于解耦双重交叉注意力(Decoupled Dual Cross-Attention, DDCA)机制的高效风格化 3D 资产生成框架。我们的方法显式分离几何和风格特征,以实现高效风格注入,同时保持结构一致性,并进一步采用轻量级训练策略以增强风格一致性和模型泛化能力。此外,我们构建了自动化数据流水线,并构建了包含约 15K 内容-风格-风格化三元组的数据集用于训练和评估。大量实验表明,我们的 DreamStyle3D 能够生成高保真度、几何一致且风格鲜明的 3D 资产。

本作品根据知识共享署名 4.0 国际许可协议授权。 MM ’26,巴西里约热内卢。 © 2026 版权归所有者/作者所有。 ACM ISBN 979-8-4007-2213-4/2026/11 https://doi.org/10.1145/3767308.3835473

  • 通讯作者。

第 2 页

MM ’26, 2026年11月10–14日, 巴西里约热内卢。Wang 等人。

在 10 秒内生成一致的、风格化的 3D 资产,在保持卓越风格质量的同时大幅提高效率,并为 3D 内容创作提供了一种新解决方案。代码和数据可在 https://github.com/HVision-NKU/DreamStyle3D 获取。

CCS 概念 • 计算方法 → 外观与纹理表示;纹理处理;学习潜变量表示。

关键词 3D 风格化, Decoupled Dual Cross-Attention, 风格-几何解耦, 轻量级框架

图 2: 基础模型中风格与几何结构纠缠导致的伪影可视化。

ACM 引用格式: Kai Wang, Ziheng Ouyang, Xuying Zhang, Ming-Ming Cheng, 和 Qibin Hou. 2026. DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement. 在《第 34 届 ACM 多媒体国际会议论文集 (MM ’26)》, 2026年11月10–14日, 巴西里约热内卢. ACM, 纽约, 纽约州, 美国, 14 页. https://doi.org/10.1145/3767308.3835473

1 引言

随着 3D 生成模型的快速发展,自动化 3D 内容生成为创作者开辟了前所未有的可能性 [45, 53, 55]。值得注意的是,在游戏、动画和虚拟现实等数字行业中,对定制化 3D 资产生成的需求也在稳步增长。除了忠实于几何和纹理重建外,许多应用还需要可控的风格化,即 3D 对象应在保持其结构身份的同时,展现参考风格图像的视觉特征。这使得图像驱动的 3D 风格化成为一个重要但具有挑战性的问题,因为它需要同时实现风格保真度、几何一致性和高效率。

现有的 3D 风格化方法主要分为两类:基于优化的方法 [2, 14, 21, 27, 56] 和特征融合方法 [25]。尽管技术路线不同,但这些方法大多遵循间接的 2D 到 3D 风格化范式,并依赖 2D 先验或中间表示,使得难以同时保持风格保真度、几何一致性和生成效率。特别是前者要么在 2D 预训练模型上执行分数蒸馏采样 (SDS) 以进行颜色回归,要么使用 2D 扩散模型生成映射到 3D 网格上的多视图图像。虽然视觉效果忠实,但这些方法需要大量的训练和推理时间。相比之下,特征融合方法将风格信息注入到大型重建模型 (LRM) [11] 中,该模型以前馈方式将 2D 稀疏视图转换为 3D 对象。这些方法提供了快速的生成速度,但由于风格和几何的耦合,存在语义漂移和结构失真的问题。

针对这些挑战,我们提出了 DreamStyle3D,这是一个原生的 3D 风格化框架,用于高效且连贯地生成分格化的 3D 资产。具体而言,我们在基于 SLAT 的扩散模型中引入了 Decoupled Dual Cross-Attention。在该模块中,对象注意力和风格注意力独立运行。对象注意力分支专注于内容图像的几何特征以保留几何细节,而风格注意力分支负责从风格图像中捕获风格特征。这种显式的分离使得几何和风格表示能够清晰解耦。为了提高我们方法的鲁棒性和泛化能力,我们设计了一种 Style Disentanglement Augmentation 策略。通过对风格图像应用结构感知扰动,我们去除其结构特征并打乱图像块,仅保留风格和纹理信息。对于内容图像,我们执行颜色重映射以改变其颜色分布,减少对颜色信息的依赖。这些数据级扰动确保模型学习独立的风格和几何特征,从而促进风格和几何的更好解耦。

鉴于数据限制,直接从 3D 场景中获取 (内容, 风格, 风格化内容) 三元组样本具有挑战性。我们开发了一种自动化数据生成流水线来解决这一问题。具体而言,我们将内容和风格图像输入现有的 2D 风格化方法以生成风格化图像,从中选择具有高视觉保真度的样本。基于这些样本,我们使用预训练的 3D 生成模型获取风格化的 3D 对象,并丢弃低质量样本。该流水线生成了一个包含约 15K 三元组的风格化 3D 资产数据集。

我们通过大量实验验证了所提出的 DreamStyle3D 的有效性。通过引入原生 3D 风格化方案,我们的 DreamStyle3D 可以在 10 秒内生成高质量的风格化对象(如图 1 所示),在风格保真度和生成效率之间取得平衡。

我们的贡献总结如下: • 我们提出了一种高效的风格化 3D 资产生成框架,其中包含 Decoupled Dual Cross-Attention,以在原生 3D 空间中显式解耦和融合几何与风格表示。 • 我们提出了一种 Style Disentanglement Augmentation 策略,结合结构感知的风格扰动和前景颜色重映射,以改善几何-风格解耦和生成稳定性。

在本文中,我们摒弃了之前的间接生成策略,转而倡导直接生成 3D 风格化资产。受近期 3D 结构化潜变量 (SLAT) [7, 46] 成功的启发,我们利用原生 3D 扩散模型来实现这一目标。然而,原生 3D 风格化仍受限于两个关键瓶颈:1) 如图 2 所示,由风格和几何纠缠导致的视觉伪影;2) 由于 3D 风格化数据集稀缺导致的训练-测试不一致性。

第 3 页

DreamStyle3D: 通过双重注意力解耦实现高效 3D 风格化资产生成 MM ’26, 2026 年 11 月 10–14 日, 巴西里约热内卢.

• 我们构建了一个基于自动三元组的数据生成流水线,受 2D 风格迁移进展的启发,最近的工作开始探索通过图像条件流水线进行生成式 3D 风格化,其中风格化必须在保持几何和多视图一致性的同时兼顾视觉风格。Style3D [35] 将来自 2D 参考图像的自注意力特征直接转移到多视图生成中;3DStyleLRM [25] 通过基于 CLIP 的 [29] 参考特征的线性组合融合风格信息;StyleTex [47] 采用语义感知特征空间中的正交投影来分解风格扩散损失,尽管其测试时的渲染优化计算成本高昂。然而,这些方法仍然依赖于间接的 2D 到 3D 生成流水线。我们提出了一种原生的 3D 风格化策略,直接在原生 3D 潜空间中进行风格迁移。

2 相关工作

3D 生成。近年来,随着扩散模型 [6, 9, 24, 26, 36] 的发展以及高质量 3D 数据集 [3, 37] 的可用性,3D 生成模型取得了显著进展。Score Distillation Sampling 方法 [27] 从 2D 扩散模型中蒸馏 3D 信息,开创了基于扩散的 3D 生成技术。随后,Zero123 [19] 通过视图条件扩散从单个输入图像合成多个新视角图像,解决了单视图重建中视角有限的问题。MV-Dream [33] 进一步在扩散模型中引入了多视图机制,能够生成一致且可靠的多视图图像,为下游 3D 资产构建提供稳定的输入。在此基础上,Zero123++ [32] 增强了条件机制和训练过程,显著提高了多视图生成的质量和稳定性。AR123 [57] 采用自回归策略,从近到远生成多视图图像,进一步提高了复杂场景中几何结构的准确性和一致性。Hunyuan3D [14, 16, 58] 由大规模 3D 数据集驱动,结合扩散模型与基于物理的渲染框架,显著提高了 3D 生成的整体质量,尤其在纹理真实感和几何细节方面表现出色。与此同时,TRELLIS [46] 引入了基于结构化 3D 潜变量的原生 3D 生成,使得直接在 3D 潜空间中进行生成成为可能,而不再仅仅依赖中间的多视图表示。

风格迁移。在风格化领域,主要研究焦点在于风格与内容的解耦。经典的 2D 神经风格迁移方法也研究了风格与内容的分离 [5, 15],但它们通常依赖于基于优化的流水线或从头训练的模型;这里我们关注基于大型预训练图像生成模型的轻量级训练方法。在这些近期方法中,基于 Adapter 的微调 [8, 18, 39, 51, 52] 和基于 LoRA 的微调 [1, 4, 23, 49, 50] 已成为两种代表性范式。基于 Adapter 的方法通常依赖注意力机制来实现风格一致性。代表性工作包括 StyleAligned [8],它共享自注意力并使用 AdaIN [12] 对齐目标图像和参考图像的查询和键特征;StyleAdapter [42],通过移除类标记和打乱位置嵌入来减少语义干扰;以及 CSGO [48],通过多注意力注入实现对象和风格的解耦。基于 LoRA 的风格迁移方法大致可分为两个分支。一个分支与概念级个性化相关,这一设置由 DreamBooth [30] 普及,后续工作如 ZipLoRA [31]、B-LoRA [4]、AgeBooth [59] 和 K-LoRA [23] 通过 LoRA 权重分析和组合进一步改进了解耦或融合。第二个分支专注于数据驱动的 LoRA 微调,其中基础模型从构建的数据集中学习风格迁移范式,例如 OmniStyle [40]、USO [44] 和 StyleExpert [60]。

3 方法论

3.1 预备知识

我们介绍 TRELLIS [46] 的预备知识,这是本工作中采用的基础原生 3D 模型,有助于理解我们 DreamStyle3D 的设计。

结构化潜变量表示。对于 3D 网格,几何和外观信息被编码为结构化潜变量表示 (SLAT),记为 $z$,整合了稀疏填充的 3D 网格与局部潜变量: $z = \{(z_i, p_i)\}_{i=1}^L, z_i \in \mathbb{R}^C, p_i \in \{0, 1, \dots, N_r-1\}^3, (1)$ 其中 $N_r$ 是 3D 网格的分辨率,$L$ 是网格占据的活动体素数量,$p_i$ 是活动体素的坐标,$z_i$ 是对应的局部特征。

稀疏结构生成。模型首先对 $N_r^3$ 密集网格执行基于整流流的扩散采样,以预测占用概率。这些概率进一步转换为活动体素,形成稀疏结构以捕捉对象的全局拓扑和空间布局。

结构化潜变量生成与多样化输出。给定稀疏支架和条件图像,基于稀疏流变换器的扩散模型对与活动体素相关的局部潜变量进行采样。然后,这些结构化潜变量可以被解码为多样化的 3D 表示,例如 3D 高斯和网格。

3.2 DreamStyle3D

现有的 3D 风格化方法遵循间接的 2D 到 3D 风格化方案来为 3D 资产纹理化,难以平衡风格保真度和生成效率。在本工作中,我们转向直接在原生 3D 空间中进行风格化资产生成的方案。

图 3 说明了 DreamStyle3D 生成风格化 3D 资产的流水线。具体而言,我们首先将内容图像输入基础模型的稀疏结构生成器,以生成由活动体素组成的粗略几何结构。然后,我们将风格图像集成到结构化潜变量生成器中,以生成 SLAT 表示,这些表示被解码为反映拓扑结构的网格以及用于纹理烘焙的风格化高斯点。然而,风格图像的引入可能导致风格信息和几何信息的纠缠。为了解决这个问题,我们开发了 Decoupled Dual Cross-Attention (DDCA) 以明确分离几何和风格表示,如第 3.3 节所示。此外,我们设计了一种 Style Disentanglement Augmentation 策略

第 4 页

MM ’26, 2026年11月10–14日,巴西里约热内卢。Wang 等人。

结构化潜变量生成 ×N 解耦双重交叉注意力

添加 … CA CA MLP CLIP FFN MHA DINO

稀疏结构

风格解耦增强 结构 风格化 3D 资产 生成 颜色重映射 结构感知 特征 扰动 掩码 CLIP 图像 原始 重排 相似度 编码器

颜色偏移 灰色 原始 打乱 掩码 风格 打乱 特征 打乱 内容 图像 风格 图像

图 3:所提出的 DreamStyle3D 方法在原生 3D 空间中进行风格化 3D 资产生成的整体流程。

我们的设计动机源于以下观察:几何与风格外观是不同的模态,直接在共享注意力路径中合并它们的特征容易混淆结构和风格线索。一种直观的思路是将风格特征与几何特征拼接,并输入到共享的交叉注意力层中。然而,这容易产生视觉伪影,如图 2 所示。 相反,我们开发了一种解耦双重交叉注意力(Decoupled Dual Cross-Attention)模块,其中几何特征和风格特征的交叉注意力层是分离的。具体而言,该模块插入到结构化潜变量生成器的交叉注意力层中,潜变量令牌通过两个解耦分支与几何和风格特征进行交互。在该模块中,内容图像由 DINO 编码以获得结构特征图 $F_c$。同时,采用 CLIP 提取高级风格特征 $F_s$,并通过可训练的两层 MLP 投影到与 $F_c$ 相同的嵌入空间,从而得到对齐的风格表示 $F'_s$。

图 4:可视化风格解耦增强。 为了减少内容图像中的风格干扰和风格图像中的结构干扰,详见第 3.4 节。

3.3 解耦双重交叉注意力

基础 3D 模型利用预训练的 DINO [22] 从内容图像中提取特征,这些特征通过交叉注意力与结构化潜变量表示融合,以生成详细的外观。然而,这种注意力机制主要重建几何细节(例如边缘和角点),缺乏捕捉全局语义或风格模式的能力。 实证研究表明,DINO 是在自蒸馏目标下训练的,导致其倾向于局部空间结构而非视觉风格。因此,原始的几何引导注意力不足以实现可控的图像风格迁移。相比之下,CLIP [29] 是在大规模图像-文本对上进行预训练的,在其特征空间中提供了强大的语义抽象和风格可分性。这使得 CLIP 能够编码语义上下文和全局艺术特征,使其适合作为补充的风格编码器。

随后,该模块将结构化潜变量令牌 $Z$ 转换为查询向量 $Q = ZW_q$,并使用由 DINO 派生的几何特征和由 CLIP 派生的风格特征作为独立的键-值集,执行两个并行的注意力计算:

$$A_c = \text{Softmax} \frac{QK_c^\top}{\sqrt{d}}, A_s = \text{Softmax} \frac{QK_s^\top}{\sqrt{d}}, \quad (2)$$

其中 $K_c = F_cW_k, V_c = F_cW_v$,以及 $K_s = F'_sW'_k, V_s = F'_sW'_v$ 分别是来自几何特征和风格特征的键和值矩阵。我们对分离的注意力输出执行逐元素相加,以获得联合表示 $F_{out}$。 最后,解码器重建 3D 资产,这些资产在保持几何保真度的同时展现出连贯的视觉风格。

请注意,在该模块中,两层风格投影 MLP 以及 $W'_k$ 和 $W'_v$ 是可训练的,而其余权重是冻结的。这种轻量级设计使得解耦双重交叉注意力能够在不修改骨干网络的情况下提高风格表现力和视觉连贯性。

第 5 页

DreamStyle3D: 通过双重注意力解耦实现高效 3D 风格化资产生成 MM ’26, 2026年11月10–14日, 巴西里约热内卢.

3.4 风格解耦增强 (Style Disentanglement Augmentation)

内容图像的颜色重映射 (Color Remapping)。尽管内容图像主要传达几何和结构信息,但其颜色分布也可能提供干扰风格解耦的虚假线索。为了解决这个问题,我们引入了一种前景颜色重映射策略,该策略随机减弱前景色彩线索,同时保留几何结构,从而鼓励模型更多地依赖轮廓和形状信息。

为了在不改变整体几何布局的情况下减少对颜色的依赖,我们将重映射应用于前景区域,同时保持背景不变。给定图像 $x \in [0, 1]^{3 \times H \times W}$ 及其前景掩码 $m$,统一算子定义为:

$A(x,m) = \Phi(x) \odot m + x \odot (1 – m), \quad (5)$

其中 $\odot$ 表示逐元素乘法,$\Phi$ 是仅应用于前景的随机颜色变换。以概率 $(p_{orig}, p_{gray}, 1 – p_{orig} – p_{gray})$,$\Phi$ 要么保持前景不变作为恒等分支,要么将其转换为灰度,要么通过将 RGB 值量化为 $L$ 个 bin 并循环移位整数偏移量 $\Delta \sim U([-S, S]^3)$ 来扰动其颜色分布:

$\Phi(x) = \frac{(\text{Round}(x \times 255/L) + \Delta) \pmod{256}}{255}. \quad (6)$

我们的关键观察是,空间洗牌破坏了图像的全局排列,同时大致保留了每个图块内的局部颜色和纹理统计信息。因此,在洗牌前后保持相似的图块更有可能编码以纹理为主的线索,而依赖结构的区域在空间扰动下往往变得不稳定。基于这一观察,我们识别出纹理稳定区域并抑制对结构敏感的区域以进行风格学习。

两种增强策略在训练中以互补的方式联合应用:内容图像被正则化以抑制色彩捷径并保留与几何相关的线索,而风格图像被扰动以抑制对结构敏感的信息并保留以纹理为主的风格统计信息。它们共同在数据层面显式地解耦几何和风格,无需引入额外的参数或损失项,并且无缝集成到解耦双重交叉注意力 (Decoupled Dual Cross-Attention, DDCA) 模块中。

风格图像的结构感知扰动 (Structure-Aware Perturbation, SAP)。风格参考图像通常包含显著的对象边界或空间布局,这可能会使模型偏向于重建几何结构,而不是学习纯粹的风格表示。为了缓解这个问题,我们提出了一种结构感知扰动策略,该策略抑制对结构敏感的线索,同时保留以风格为主的局部模式,鼓励网络关注纹理和笔触统计信息,而不是空间布局。

在训练期间,这种增强产生了颜色退化但几何一致的样本,迫使模型更多地依赖轮廓和结构线索,而不是色彩捷径。在推理期间,该策略被禁用,以保持生成结果的自然外观。

具体而言,我们将风格图像 $x$ 划分为非重叠的 $14 \times 14$ 图块,并生成其随机洗牌版本,记为 $x_{shuf}$。然后,我们使用 CLIP 视觉编码器提取图块特征并计算图块级相似度矩阵:

$S_{ij} = \frac{f_i(x) \cdot f_j(x_{shuf})}{\|f_i(x)\| \|f_j(x_{shuf})\|}, \quad (3)$

其中 $f_i(\cdot)$ 表示第 $i$ 个图块的特征。基于相似度分数,我们保留高相似度区域的前 $r$ 比例以构建二值掩码 $m$,该掩码保留纹理稳定区域,同时抑制对结构敏感的区域。将掩码应用回风格图像,保留纹理稳定图块,并用其局部均值填充剩余区域:

$x_{mask} = m \odot x + (1 – m) \odot \bar{x}. \quad (4)$

最后,应用具有较大图块大小的第二次洗牌以进一步消除任何残留的结构对齐。在训练期间,我们使用完整的掩码+洗牌扰动,而在推理期间,仅执行大规模洗牌以维持全局风格一致性。

如图 4 所示,经过掩码和洗牌操作后,图像中的结构信息显著减少,而纹理和风格成分得以保留。该策略利用了这样一个事实:依赖结构的区域在洗牌后表现出显著的相似度衰减,而以纹理为主的区域保持相对稳定,从而实现了结构与风格之间的自适应解耦。因此,模型学习到更纯粹且空间不变的风格表示。

4 3D 风格化数据集策展

目前缺乏大规模的配对 3D 风格化数据集,这限制了 3D 风格迁移模型的端到端训练和定量评估。为了克服这一限制,我们构建了一个自动化的 3D 风格化数据集策展管道,遵循“内容–风格–风格化”的三元组形式,整合了 2D 和 3D 资源。

具体而言,我们从 Objaverse [3] 和 Toys4K [37] 中选择单对象模型,并渲染正交视图图像作为内容输入。每个内容图像随机与从 OmniStyle-150K 数据集 [40] 采样的 100 个风格示例配对,形成初始候选对池。每对都通过 OmniStyle [40] 模型处理以生成风格化的 2D 图像,然后使用 Hunyuan3D-2.1 [14] 模型将其提升为 3D,结合几何重建与风格条件纹理合成。生成的数据集包含约 15K 个内容-风格-风格化资产三元组,具有自动化构建、多样化的风格覆盖以及 2D 和 3D 领域之间的语义对齐。

为了促进 3D 风格化的发展,我们为此数据集提供了预定义的训练/测试划分,其中 11K 个三元组样本用于训练,其余 4K 个样本用于

第 6 页

MM ’26,2026年11月10–14日,巴西里约热内卢。Wang 等人。

内容风格 StyleTex 3D-style-LRM MV-Adapter ours

图 5:我们的 DreamStyle3D 与近期前沿 3D 风格迁移方法的定性比较。

用于测试。在实践中,我们同时从测试集中随机选取 100 个样本,并从 Toys4K 数据集中选取 10 个细节丰富的样本 [37],以评估所提方法的性能。评估中选取的所有内容图像均与训练期间使用的图像不同,以确保评估的公平性。基线方法。我们将 DreamStyle3D 与现有的 3D 风格生成方法进行比较。基线包括:3D-style-LRM [25]、MV-Adapter [13]、StyleTex [47],以及用于评估我们框架有效性的 Hunyuan3D-2.1 [14] 和 TRELLIS [46]。对于 StyleTex 和 MV-Adapter,我们将内容图像输入 TRELLIS 并移除结果中的生成纹理,作为所需的物体网格。同时,我们使用 Qwen3-VL-4B-Instruct [38] 为 StyleTex 生成所需的文本提示。对于 Hunyuan3D,物体生成阶段使用内容图像作为输入,纹理生成阶段使用风格图像作为输入。对于 TRELLIS,在稀疏结构生成阶段,我们输入内容图像;在局部潜变量生成阶段,我们测试了两种不同的输入:一种使用风格图像,另一种使用内容图像和风格图像的拼接。所有基线方法均使用其默认设置进行配置。

5 实验

5.1 实验设置

训练。我们的训练过程遵循标准的潜在生成流程,仅微调负责局部特征去噪的潜在细化网络。DINO [22] 编码器、CLIP [29] 编码器和主 Transformer 层保持冻结,而风格注意力分支及其 MLP 投影层的参数被优化。我们采用与 TRELLIS 相同的条件流匹配 (CFM) 目标 [17],在局部潜变量集合 $\{z_i\}_{i=1}^L$ 上进行基于去噪的学习。给定扰动潜变量 $z_i(t)$,模型通过最小化以下公式预测依赖于时间的速度场 $v_\theta(z_i, t)$:

$$ L_{CFM} = \mathbb{E}_{t, z_0, \epsilon} \| v_\theta(z, t) – (\epsilon – z_0) \|_2^2, \quad (7) $$

其中 $z_0$ 表示真实潜变量,$\epsilon$ 代表高斯噪声。在训练期间,解耦双重交叉注意力 (DDCA) 模块将风格感知特征注入速度场预测中,从而实现几何保真度和风格控制的联合建模。

实现细节。我们的方法基于 TRELLIS 框架进行微调。对于每个风格化 3D 资产,我们渲染了 150 张图像并提取特征以生成结构潜变量作为监督信号。我们采用了无分类器引导 (CFG) [10],以 0.1 的概率同时丢弃内容和风格图像。优化器使用 AdamW [20],学习率为 $1 \times 10^{-4}$,在单块 A800 GPU (80GB) 上进行 130,000 步的训练,批量大小为 16。在推理过程中,CFG 强度设置为 5,采样步数设置为 50。

评估。我们从相同的六个视角渲染生成的 3D 资产以及测试集中相应的风格化 3D 资产以进行评估。测试集中风格化 3D 资产的渲染图像被用作补充基于参考的评估的参考渲染。我们首先使用基于源图像的指标以及基于视觉语言模型 (VLM) 的自动评估来评估几何保留和风格一致性。

对于几何保留,我们计算每个渲染视图与原始内容图像之间的 CLIP 余弦相似度和 DINO 余弦相似度;分数越高表示保留效果越好。

第 7 页

DreamStyle3D: 通过双重注意力解耦实现高效 3D 风格化资产生成 MM ’26, 2026 年 11 月 10–14 日, 巴西里约热内卢.

表 1: 使用基于源图像的指标、VLM Score 和推理时间比较 3D 风格迁移方法. 表 2: 与现有 3D 风格迁移方法的基于参考的定量比较.

模型 CLIP ↑ DINO ↑ Gram ↓ AdaIN ↓ VLM Score ↑ 时间 模型 CLIP ↑ PSNR ↑ SSIM ↑ LPIPS ↓

StyleTex 78.726 50.773 0.560 91.805 60.532 16min StyleTex 0.819 34.698 0.761 0.314 3D-style-LRM 76.559 37.364 0.529 96.254 46.829 ∼30s 3D-style-LRM 0.790 33.902 0.759 0.323 MV-Adapter 76.782 49.535 0.531 91.886 57.012 ∼30s MV-Adapter 0.821 34.744 0.776 0.271 Ours 80.096 63.319 0.516 91.682 73.096 ∼10s Ours 0.842 34.838 0.802 0.241

对象语义和结构。为了保持风格一致性,我们计算每个渲染视图与风格参考图像之间的 Gram 矩阵相似度和 AdaIN 距离;这些指标分别从风格统计和特征分布相似性的角度表征与参考风格的一致性。为了从语义和感知角度获得更全面的自动评估,我们进一步采用 Qwen3.5 [28] 作为视觉语言评估器。具体而言,我们将内容参考图像、风格参考图像以及按固定顺序排列的六个渲染视图提供给模型,并要求它根据三个标准对每个渲染视图进行评分:内容保留、风格对齐和视觉质量。每个评分均在 0–100 的尺度上给出。然后,我们将这三个维度聚合,并对六个视角的得分取平均,以获得最终的 VLM Score。

我们还报告了基于参考的指标作为补充指示器,方法是将生成结果的渲染图像与测试集中真实风格化 3D 资产的渲染图像进行比较。具体而言,我们使用真实渲染图像作为参考,计算 CLIP 相似度、PSNR、SSIM [41] 和 LPIPS [54]。这些指标从高级语义一致性、信号保真度、结构相似性和感知差异的角度为结果质量提供了额外证据。所有结果均在六个视角上取平均,以提供对几何保真度、风格一致性和视觉质量的全面评估。

5.2 定性结果

与现有 3D 风格迁移方法的比较。我们将 DreamStyle3D 与几种现有的 3D 风格迁移方法进行了定性比较,实验结果如图 5 所示。StyleTex [47] 倾向于以强烈的高频表面图案形式注入风格,这通常看起来与底层对象几何结构脱节。这表明其风格化偏向于表面纹理迁移,难以实现结构连贯的风格表达。相比之下,3D-style-LRM [25] 更平滑地捕捉全局风格趋势,但往往同时削弱了局部结构表达。其结果通常表现出过度平滑的颜色和缺失的局部组件。MV-Adapter 在某些情况下产生了视觉上更合理的风格化效果,但其风格表示在不同对象区域之间稳定性较差。渲染结果经常显示颜色分布不一致和纹理表达不完整,导致不同视角之间的连贯性有限。

与这些方法相比,DreamStyle3D 在风格迁移和结构保留之间取得了更好的平衡。图 5 中的实验结果表明,我们的方法在多个样本上都能生成高质量的风格化 3D 资产,同时保持高风格保真度和几何一致性。图 5 的结果显示,我们的方法能够更好地迁移目标风格,而不会引入严重的伪影、过度平滑局部结构或导致不稳定的纹理实现。总体而言,与现有方法相比,我们的方法生成的风格化 3D 资产具有更强的结构保真度和更可靠的风格一致性。

与 3D 大模型的比较。我们将 DreamStyle3D 与几种现有的 3D 大模型进行了定性比较,实验结果如图 6 所示。当前的 3D 大模型不具备直接生成风格化 3D 资产的能力。Hunyuan3D-2.1 生成的 3D 资产通常将纹理图直接映射到对象上,而不是从风格图像中学习目标风格。此外,Hunyuan3D-2.1 对某些风格不敏感,导致生成的纹理不正确。当 TRELLIS 仅使用风格图像作为输入时,它面临将纹理图直接映射到 3D 资产上的问题,导致生成的对象缺乏细节。当内容和风格图像作为输入拼接时,风格注入会受到内容图像的影响,导致结果次优。相比之下,DreamStyle3D 能够从风格图像中准确提取目标风格,同时保留对象的几何细节,生成高质量的风格化 3D 资产。

5.3 定量结果

表 1 从基于源图像的指标、VLM Score 和推理时间方面,对 DreamStyle3D 与现有 3D 风格迁移方法进行了定量比较。在几何保留方面,DreamStyle3D 取得了最佳的 CLIP 和 DINO 分数,分别比最强的基线高出 1.37 和 12.55。DreamStyle3D 在 Gram 和 AdaIN 上也表现最佳,并将 VLM Score 比最强基线提高了 12.56,显示出更强的风格一致性和整体感知质量。除了生成质量外,DreamStyle3D 在计算效率方面也显示出明显优势。与需要约 16 分钟优化的 StyleTex 相比,我们的方法仅需约 10 秒,速度提高了约 96 倍。它也比 MV-Adapter 和 3D-style-LRM 快约三倍,突显了其在高效大规模风格化 3D 生成方面的实际优势。

表 2 进一步报告了基于参考的定量比较,其中参考图像是从测试分割中的风格化 3D 资产渲染得到的。与基于源图像的比较不同,这组指标直接将渲染输出与相应的 3D 参考渲染进行比较,因此提供了关于 3D 结构和外观实现一致性的更直接度量。因此,我们使用这些指标作为补充的基于参考的评估,以从

第 8 页

MM ’26,2026年11月10–14日,巴西里约热内卢。Wang 等人。

内容 风格 Hunyuan3D-2.1 Trellis(S) Trellis(C&S) ours

图 6:我们的 DreamStyle3D 与现有大型 3D 生成模型之间的定性比较。

内容 风格 微调 更直接的 3D 参考视角。如表所示,Dream- 图像 图像 基础模型 无 SAP 无 CR 完整 Style3D 在 CLIP 相似度、PSNR 和 SSIM 上取得了最佳性能,同时获得了最低的 LPIPS 值,且整体 趋势与上述基于源图像的指标和 基于 VLM 的评估保持一致。 这些结果证实了 3D 一致性和渲染质量的提升,而附录中报告的额外用户研究 进一步表明 DreamStyle3D 获得了最高的偏好率。

图 7:风格解耦增强(Style Disentanglement Augmentation)的消融实验。 5.4 消融分析 为了验证风格解耦增强(Style Disentanglement Augmentation)的有效性,我们对其两个组件进行了消融研究:针对风格图像的结 表 3:风格解耦增强(Style Disentanglement Augmentation)在代表性评估指标上的消融结果。 构感知扰动(Structure-Aware Perturbation, SAP)和针对内容图像的颜色重映射(Color Remapping, CR)。图 7 和表 3 评估了 SAP 和 CR, 而关于 DDCA 的额外消融实验见附录。 此处,基础模型指配备了 Decoupled Dual Cross-Attention (DDCA) 但未包含 SAP 或 CR 的风格化模型。

微调 基础模型 无 SAP 无 CR 完整 CLIP ↑ 79.488 79.869 79.822 80.096 AdaIN ↓ 91.948 91.879 91.748 91.682

如图 7 所示,基础模型已经较好地保留了物体 结构,但其风格化结果对目标风格的忠实度较低。 当仅应用 CR 时(w/o SAP),物体 语义得到了更好的保留,这由与 w/o CR 相比更高的 CLIP 分数所指示。这表明 CR 通过减少内容图像中 颜色线索的干扰,帮助模型更关注物体几何结构。相比之下,当仅应用 SAP 时(w/o CR),生成结果表现出更好的风格一致性, 尤其是在颜色外观方面,这与改进的 AdaIN 指标一致。如图 7 所示,基础模型和 w/o SAP 对目标风格的忠实度较低,而 w/o CR 和 完整模型产生了更合适的风格颜色。 最后,结合 SAP 和 CR 带来了最佳的整体 性能,表明这两种策略在物体保留和风格提取方面发挥着互补作用。

6 结论 我们提出了一种用于生成风格化 3D 资产的新框架。 通过引入 Decoupled Dual Cross-Attention (DDCA) 和风格解耦增强(Style Disentanglement Augmentation),我们实现了几何和风格特征的显式解耦 和融合,从而能够在原生 3D 空间中高效地注入风格。我们还开发了一套自动化的数据 生成流水线,并生成了约 15K 个三元组样本,为模型 训练和评估提供了标准化的监督和基准。实验结果表明,我们的 方法在多个 3D 风格化基准测试中表现出色,无论是定性还是定量分析。

第 9 页

DreamStyle3D:通过双重注意力解耦实现高效 3D 风格化资产生成 MM ’26,2026 年 11 月 10–14 日,巴西里约热内卢。

致谢 本文研究得到国家自然科学基金(NO. 6225604)、深圳市科技计划(NO. JCYJ20240813114237048)以及南开大学超算中心(NKSC)的支持。

参考文献 [1] Bolin Chen, Baoquan Zhao, Haoran Xie, Yi Cai, Qing Li, and Xudong Mao. 2025. Consislora: Enhancing content and style consistency for lora-based style transfer. arXiv preprint arXiv:2503.10614 (2025). [2] Rui Chen, Yongwei Chen, Ningxin Jiao, and Kui Jia. 2023. Fantasia3d: Disentangling geometry and appearance for high-quality text-to-3d content creation. In Proceedings of the IEEE/CVF international conference on computer vision. 22246–22256. [3] Matt Deitke, Ruoshi Liu, Matthew Wallingford, Huong Ngo, Oscar Michel, Aditya Kusupati, Alan Fan, Christian Laforte, Vikram Voleti, Samir Yitzhak Gadre, et al. 2023. Objaverse-xl: A universe of 10m+ 3d objects. Advances in Neural Information Processing Systems 36 (2023), 35799–35813. [4] Yarden Frenkel, Yael Vinker, Ariel Shamir, and Daniel Cohen-Or. 2024. Implicit style-content separation using b-lora. In European Conference on Computer Vision. Springer, 181–198. [5] Leon A Gatys, Alexander S Ecker, and Matthias Bethge. 2016. Image style transfer using convolutional neural networks. In Proceedings of the IEEE conference on computer vision and pattern recognition. 2414–2423. [6] Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, and Chen Change Loy. 2026. Direct 3D-Aware Object Insertion via Decomposed Visual Proxies. arXiv preprint arXiv:2606.06601 (2026). [7] Xianglong He, Zi-Xin Zou, Chia-Hao Chen, Yuan-Chen Guo, Ding Liang, Chun Li, Yuan, Wanli Ouyang, Yan-Pei Cao, and Yangguang Li. 2025. SparseFlex: High-Resolution and Arbitrary-Topology 3D Shape Modeling. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 14822–14833. [8] Amir Hertz, Andrey Voynov, Shlomi Fruchter, and Daniel Cohen-Or. 2024. Style aligned image generation via shared attention. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 4775–4785. [9] Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Advances in neural information processing systems 33 (2020), 6840–6851. [10] Jonathan Ho and Tim Salimans. 2022. Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598 (2022). [11] Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan Sunkavalli, Trung Bui, and Hao Tan. 2023. Lrm: Large reconstruction model for single image to 3d. arXiv preprint arXiv:2311.04400 (2023). [12] Xun Huang and Serge Belongie. 2017. Arbitrary style transfer in real-time with adaptive instance normalization. In Proceedings of the IEEE international conference on computer vision. 1501–1510. [13] Zehuan Huang, Yuan-Chen Guo, Haoran Wang, Ran Yi, Lizhuang Ma, Yan-Pei Cao, and Lu Sheng. 2025. Mv-adapter: Multi-view consistent image generation made easy. In Proceedings of the IEEE/CVF International Conference on Computer Vision. 16377–16387. [14] Team Hunyuan3D, Shuhui Yang, Mingxin Yang, Yifei Feng, Xin Huang, Sheng Zhang, Zebin He, Di Luo, Haolin Liu, Yunfei Zhao, et al. 2025. Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material. arXiv preprint arXiv:2506.15442 (2025). [15] Justin Johnson, Alexandre Alahi, and Li Fei-Fei. 2016. Perceptual losses for real-time style transfer and super-resolution. In European conference on computer vision. Springer, 694–711. [16] … (Source text ends abruptly at [41] citation start, but provided text ends at [41] author list. I will translate up to the provided text limit.)

*Note: The source text provided ends mid-sentence at reference [41]. I will translate the provided portion.*

[16] (Missing in source text block provided, skipping to next available) [17] (Missing) [18] (Missing) [19] (Missing) [20] (Missing) [21] (Missing) [22] Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, et al. 2023. Dinov2: Learning robust visual features without supervision. arXiv preprint arXiv:2304.07193 (2023). [23] Ziheng Ouyang, Zhen Li, and Qibin Hou. 2025. K-lora: Unlocking training-free fusion of any subject and style loras. arXiv preprint arXiv:2502.18461 (2025). [24] Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, and Mike Zheng Shou. 2026. The consistency critic: Correcting inconsistencies in generated images via reference-guided attentive alignment. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2035–2046. [25] Ipek Oztas, Duygu Ceylan, and Aysegul Dundar. 2025. 3D Stylization via Large Reconstruction Model. In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers. 1–11. [26] Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann, Tim Dockhorn, Jonas Müller, Joe Penna, and Robin Rombach. 2024. Sdxl: Improving latent diffusion models for high-resolution image synthesis. In International Conference on Learning Representations, Vol. 2024. 1862–1874. [27] Ben Poole, Ajay Jain, Jonathan T Barron, and Ben Mildenhall. 2022. Dreamfusion: Text-to-3d using 2d diffusion. arXiv preprint arXiv:2209.14988 (2022). [28] Qwen Team. 2026. Qwen3.5: Towards Native Multimodal Agents. https://qwen.ai/blog?id=qwen3.5 [29] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PmLR, 8748–8763. [30] Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Yael Pritch, Michael Rubinstein, and Kfir Aberman. 2023. Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 22500–22510. [31] Viraj Shah, Nataniel Ruiz, Forrester Cole, Erika Lu, Svetlana Lazebnik, Yuanzhen and Varun Jampani. 2024. Ziplora: Any subject in any style by effectively merging loras. In European Conference on Computer Vision. Springer, 422–438. [32] Ruoxi Shi, Hansheng Chen, Zhuoyang Zhang, Minghua Liu, Chao Xu, Xinyue Wei, Linghao Chen, Chong Zeng, and Hao Su. 2023. Zero123++: a single image to consistent multi-view diffusion base model. arXiv preprint arXiv:2310.15110 (2023). [33] Yichun Shi, Peng Wang, Jianglong Ye, Mai Long, Kejie Li, and Xiao Yang. 2023. Mvdream: Multi-view diffusion for 3d generation. arXiv preprint arXiv:2308.16512 (2023). [34] Karen Simonyan and Andrew Zisserman. 2014. Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014). [35] Bingjie Song, Xin Huang, Ruting Xie, Xue Wang, and Qing Wang. 2024. Style3D: Attention-guided Multi-view Style Transfer for 3D Object Generation. arXiv preprint arXiv:2412.03571 (2024). [36] Jiaming Song, Chenlin Meng, and Stefano Ermon. 2020. Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502 (2020). [37] Stefan Stojanov, Anh Thai, and James M Rehg. 2021. Using shape to categorize: Low-shot learning with an explicit shape bias. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 1798–1808. [38] Qwen Team. 2025. Qwen3 Technical Report. arXiv:2505.09388 [cs.CL] https://arxiv.org/abs/2505.09388 [39] Haofan Wang, Matteo Spinelli, Qixun Wang, Xu Bai, Zekui Qin, and Anthony Chen. 2024. Instantstyle: Free lunch towards style-preserving in text-to-image generation. arXiv preprint arXiv:2404.02733 (2024). [40] Ye Wang, Ruiqi Liu, Jiang Lin, Fei Liu, Zili Yi, Yilin Wang, and Rui Ma. 2025. OmniStyle: Filtering High Quality Style Transfer Data at Scale. In Proceedings of the Computer Vision and Pattern Recognition Conference. 7847–7856. [41] Zhou Wang, Alan C Bovik, Hamid R Sheikh, and Eero P Simoncelli. 2004. Image

[16] Zeqiang Lai, Yunfei Zhao, Haolin Liu, Zibo Zhao, Qingxiang Lin, Huiwen Shi, Xianghui Yang, Mingxin Yang, Shuhui Yang, Yifei Feng 等。2025。Hunyuan3D 2.5:迈向具有极致细节的高保真 3D 资产生成。arXiv 预印本 arXiv:2506.16504 (2025)。 [17] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, Matt Le。2022。用于生成建模的流匹配。arXiv 预印本 arXiv:2210.02747 (2022)。 [18] Jia Liu, Changlin Li, Qirui Sun, Jiahui Ming, Chen Fang, Jue Wang, Bing Zeng, Shuaicheng Liu。2024。Ada-adapter:利用预训练图像编码器快速实现扩散模型的少样本风格个性化。arXiv 预印本 arXiv:2407.05552 (2024)。 [19] Ruoshi Liu, Rundi Wu, Basile Van Hoorick, Pavel Tokmakov, Sergey Zakharov, Carl Vondrick。2023。Zero-1-to-3:零样本单图转 3D 物体。在 IEEE/CVF 国际计算机视觉会议论文集。9298–9309。 [20] Ilya Loshchilov, Frank Hutter。2017。解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101 (2017)。 [21] Oscar Michel, Roi Bar-On, Richard Liu, Sagie Benaim, Rana Hanocka。2022。Text2mesh:基于文本驱动的网格神经风格化。在计算机图形学前沿会议论文集。 [42] Zhouxia Wang, Xintao Wang, Liangbin Xie, Zhongang Qi, Ying Shan, Wenping Wang, Ping Luo。2023。Styleadapter:一种统一的风格化图像生成模型。arXiv 预印本 arXiv:2309.01770 (2023)。 [43] Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu。2025。OmniGen2:探索高级多模态生成。arXiv 预印本 arXiv:2506.18871 (2025)。 [44] Shaojin Wu, Mengqi Huang, Yufeng Cheng, Wenxu Wu, Jiahe Tian, Yiming Luo, Fei Ding, Qian He。2025。Uso:通过解耦和奖励学习实现统一风格与主体驱动生成。arXiv 预印本 arXiv:2508.18966 (2025)。 [45] Shuang Wu, Youtian Lin, Feihu Zhang, Yifei Zeng, Jingxi Xu, Philip Torr, Xun Cao, Yao Yao。2024。Direct3d:通过 3D 潜在扩散 Transformer 实现可扩展的图像到 3D 生成。神经信息处理系统进展 37 (2024), 121859–121881。 [46] Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, Jiaolong Yang。2025。用于可扩展

第 10 页

MM ’26,2026年11月10–14日,巴西里约热内卢。Wang 等人。

以及多功能的 3D 生成。在计算机视觉与模式识别会议论文集。21469–21480。2018。深度特征作为感知度量的不合理有效性。在 IEEE 计算机视觉与模式识别会议论文集。

[47] Zhiyu Xie, Yuqing Zhang, Xiangjun Tang, Yiqian Wu, Dehan Chen, Gongsheng Li, 和 Xiaogang Jin。2024。Styletex:风格图像引导的 3D 模型纹理生成。ACM 图形学汇刊 (TOG) 43, 6 (2024),1–14。

[48] Peng Xing, Haofan Wang, Yanpeng Sun, Qixun Wang, Xu Bai, Hao Ai, Renyuan Huang, 和 Zechao Li。2024。Csgo:文本到图像生成中的内容-风格组合。arXiv 预印本 arXiv:2408.16766 (2024)。

[49] Xuancheng Xu, Gengyun Jia, 和 Bing-Kun Bao。2026。Disco-LoRA:解耦的内容、风格和运动组合,用于多概念视频定制。arXiv 预印本 arXiv:2606.26668 (2026)。

[50] Xuancheng Xu, Yaning Li, Sisi You, 和 Bing-Kun Bao。2026。Smrabooth:用于定制视频生成的主体与运动表示对齐。在 IEEE/CVF 计算机视觉与模式识别会议论文集。16130–16141。

[51] Xuancheng Xu, Ming Tao, 和 Bing-Kun Bao。2025。Clgc:用于一致文本到视频编辑的连续布局引导。在 2025 IEEE 多媒体与博览会会议 (ICME)。IEEE,1–6。

[52] Zixuan Ye, Huijuan Huang, Xintao Wang, Pengfei Wan, Di Zhang, 和 Wenhan Luo。2025。Stylemaster:通过艺术生成和转换为您的视频添加风格。在计算机视觉与模式识别会议论文集。2630–2640。

[53] Longwen Zhang, Ziyu Wang, Qixuan Zhang, Qiwei Qiu, Anqi Pang, Haoran Jiang, Wei Yang, Lan Xu, 和 Jingyi Yu。2024。Clay:用于创建高质量 3D 资产的可控大规模生成模型。ACM 图形学汇刊 (TOG) 43, 4 (2024),1–20。

[54] Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, 和 Oliver Wang。深度特征作为感知度量的不合理有效性。在 IEEE 计算机视觉与模式识别会议论文集。586–595。

[55] Xuying Zhang, Yutong Liu, Yangguang Li, Renrui Zhang, Yufei Liu, Kai Wang, Wanli Ouyang, Zhiwei Xiong, Peng Gao, Qibin Hou, 等人。2025。Tar3d:通过下一部分预测创建高质量 3D 资产。在 IEEE/CVF 计算机视觉国际会议论文集。5134–5145。

[56] Xuying Zhang, Bo-Wen Yin, Yuming Chen, Zheng Lin, Yunheng Li, Qibin Hou, 和 Ming-Ming Cheng。2024。Temo:面向多对象网格的文本驱动 3D 风格化。在 IEEE/CVF 计算机视觉与模式识别会议论文集。19531–19540。

[57] Xuying Zhang, Yupeng Zhou, Kai Wang, Yikai Wang, Zhen Li, Shaohui Jiao, Daquan Zhou, Qibin Hou, 和 Ming-Ming Cheng。2025。Ar-1-to-3:通过下一视角预测将单图像转换为一致的 3D 对象。在 IEEE/CVF 计算机视觉国际会议论文集。26273–26283。

[58] Zibo Zhao, Zeqiang Lai, Qingxiang Lin, Yunfei Zhao, Haolin Liu, Shuhui Yang, Yifei Feng, Mingxin Yang, Sheng Zhang, Xianghui Yang, 等人。2025。Hunyuan3d 2.0:扩展扩散模型以生成高分辨率纹理 3D 资产。arXiv 预印本 arXiv:2501.12202 (2025)。

[59] Shihao Zhu, Bohan Cao, Ziheng Ouyang, Zhen Li, Peng-Tao Jiang, 和 Qibin Hou。2025。AgeBooth:通过扩散模型实现可控的面部老化与年轻化。arXiv 预印本 arXiv:2510.05715 (2025)。

[60] Shihao Zhu, Ziheng Ouyang, Yijia Kang, Qilong Wang, Mi Zhou, Bo Li, Ming-Ming Cheng, 和 Qibin Hou。2026。混合风格专家用于多样化图像风格化。arXiv 预印本 arXiv:2603.16649 (2026)。

第 11 页

DreamStyle3D: 通过双重注意力解耦实现高效 3D 风格化资产生成 MM ’26, 2026 年 11 月 10–14 日, 巴西里约热内卢。

附录我们设计了一个自动化的数据策展管道,由两个 本附录组织如下: 顺序阶段组成。具体而言,第一阶段过滤风格化 2D (1) 我们提供了 DreamStyle3D 的额外分析,包括 图像以确保风格信号和 对 DDCA 的消融实验以及不同输入 潜在内容结构的可靠性。然后,第二阶段对生成的风格化 3D 资产进行 融合策略的比较,详见第 A 节。 过滤,以确保每个最终 (2) 我们描述了自动数据集策展管道,包括 3D 资产都具备足够的视觉质量和结构稳定性。 对风格化 2D 图像和生成的 3D 资产的过滤,详见第 B 节。 内容 Style MLP 融合 DINO 融合 仅风格 ours (3) 我们展示了额外的评估,包括与外部两阶段 资产 风格化管道的比较以及用户 研究,详见第 C 节。 (4) 我们提供了跨不同对象和参考风格的风格化 3D 资产的额外定性结果,如 第 D 节所示。

A DreamStyle3D 的额外分析 图 8: DDCA 变体的定性消融。完整 A.1 DDCA 的消融 设计在结构保持和风格保真度之间实现了更好的平衡。 为了进一步评估解耦双重交叉注意力 (DDCA) 模块的设计,我们将完整模型与三种变体进行比较。 MLP 融合将基于 DINO 的内容特征和 过滤风格化 2D 图像。第一阶段旨在从 OmniStyle 模型 [40] 生成的候选结果中选择内容结构最完整且 基于 CLIP 的风格特征,并使用 MLP 将它们投影到统一的条 风格一致性最高的 2D 风格化图像。OmniStyle 在大规模高质量风格化三元组数据集上进行预训练,使其能够在 件表示中,然后输入到单个交叉注意力层。DINO 融合保留了双分支 保持输入内容图像的布局和语义形状的同时,在风格化过程中可靠地注入目标风格。因此,其生成的候选结果为 注意力设计,但用 DINO 特征替换 CLIP 风格特征,使得两个分支都基于 DINO 表示进行条件化。Style-only 移除了基于 DINO 的内容注意力 内容保真度的可靠下限,为后续的过滤过程奠定了坚实基础。 分支,仅保留基于 CLIP 的风格注意力分支。 对于每个内容-风格对 $I_c$ 和 $I_s$,我们使用不同的随机种子生成 $K=10$ 张风格化候选图像,记为 所有其他组件和实验设置保持不变。 {$\hat{I}_k\}_{k=1}^K$。然后我们从两个互补的角度评估这些候选图像:内容保持,由内容对齐分数 (CAS) [48] 衡量,以及风格一致性,由 如图 8 所示,三种变体揭示了不同的失效模式。MLP 融合在共享的注意力路径中纠缠了几何和风格线索,降低了对各自贡献的控制能力。DINO 融合保留了对象感知的结构语义,但不如基于 CLIP 的条件化那样有效地捕捉参考风格。Style-only 移除了基于内容的注意力分支,使得潜在细化更容易受到局部结构偏差的影响。相比之下,完整的 DDCA 设计使用单独的基于 DINO 和基于 CLIP 的条件化注意力分支,在几何保持和风格保真度之间实现了更好的平衡。

A.2 输入融合策略 图 9 提供了主论文中实验设置的额外分析,其中内容图像和风格图像在输入到 TRELLIS 之前进行拼接。除了简单的空间拼接外,我们还探索了多种输入融合策略,包括沿不同轴拼接、特征级融合、官方多图像输入设置以及基于统计的风格注入。这些实验旨在验证是否可以通过直接修改输入格式来实现可控的 3D 风格化。然而,尽管进行了大量尝试,生成的 3D 资产在风格可控性和视觉一致性方面仍不理想。这表明仅靠输入级融合不足以实现可控的 3D 风格化。

B 自动数据集策展管道 为了构建由风格化 3D 资产组成的高质量数据集,并支持 3D 风格化模型的训练和评估,

CAS 是通过在 DINOv2 特征空间 [22] 中执行基于 AdaIN 的去风格化操作来计算的,该操作抑制风格属性并强调与内容相关的结构信息。其定义如下: $CAS(\hat{I}, I_c) = ||Ada(\phi(\hat{I})) – Ada(\phi(I_c))||_2$, (8) 其中 $\phi(\cdot)$ 表示特征编码器,AdaIN 去风格化算子定义为: $Ada(F) = \frac{F – \mu(F)}{\sigma(F)}$, (9) 较低的 CAS 表明候选图像与内容图像之间的几何一致性程度更高。 风格一致性使用基于 VGG-19 [34] 提取的特征通道上的二阶统计量的 Gram 矩阵相似性进行评估。对于特征图 $F \in \mathbb{R}^{C \times H \times W}$,Gram 矩阵定义为: $G = \frac{1}{C \cdot H \cdot W} FF^\top$, (10)

第 12 页

MM ’26,2026年11月10–14日,巴西里约热内卢。Wang 等人。

内容风格 H-Concat W-Concat 融合 多注入 ours

图 9:在 TRELLIS 流程下不同输入融合策略的比较。

候选图像与风格渲染质量之间的风格差异从两个互补的视角进行衡量:渲染图像的审美评分和基于 CLIP 的 [29] 渲染图像与风格参考之间的图像相似度。

风格差异通过 Frobenius 范数定义,公式如下:

$L_{Gram} = \|G_{ref} – G_{gen}\|_F$, (11)

渲染审美评分使用 TRELLIS [46] 中采用的图像级审美预测器计算,该预测器提供了对渲染图像视觉合理性的通用度量。然而,由于该预测器是在大规模自然图像偏好数据集上训练的,而非风格化视觉领域,因此风格化渲染即使在 3D 几何和风格迁移正确的情况下,偶尔也会获得较低的审美评分。因此,仅凭审美评分不足以过滤风格化 3D 资产。为了避免错误地丢弃有效的风格化结果,我们补充了渲染图像与风格参考之间的基于 CLIP 的相似度。更高的 CLIP 相似度表明更强的预期风格语义保留,有助于区分真正的渲染失败与风格驱动的审美偏差。

为了将这两个指标统一到同一尺度,我们首先对每个指标应用 min-max 归一化,然后计算统一的聚合分数,如下所示:

$\hat{C}_{AS}^k = \frac{C_{AS}^k – C_{AS}^{min}}{C_{AS}^{max} – C_{AS}^{min}},$

$\hat{L}_{Gram}^k = \frac{L_{Gram}^k – L_{Gram}^{min}}{L_{Gram}^{max} – L_{Gram}^{min}},$ (12)

$Q_k = \alpha \hat{C}_{AS}^k + (1 – \alpha) \hat{L}_{Gram}^k,$

其中 $\alpha = 0.3$。由于两个归一化指标均定义为偏差越小性能越好,我们在十个候选者中选择聚合分数 $Q_k$ 最低的候选图像作为最终的风格化 2D 结果。

此阶段的过滤确保了后续 3D 风格化过程的输入在风格一致性和内容保真度方面均达到可靠标准。

风格化 3D 资产的过滤。在获得过滤后的 2D 风格图像后,我们使用 Hunyuan3D-2.1 [14] 模型生成其对应的 3D 风格化资产,其中内容图像输入到几何生成阶段,过滤后的风格化图像用于纹理生成阶段。然后,我们进一步对这些生成的 3D 风格化资产进行过滤,以确保最终数据集包含在渲染下具有稳定视觉性能的 3D 模型。遵循 TRELLIS [46] 中使用的多视图质量评估策略,我们从四个固定视角渲染每个 3D 资产,得到一组图像 $\{R_i\}_{i=1}^4$。接下来,我们评估渲染图像的审美评分和基于 CLIP 的相似度。我们计算四个渲染视图的平均审美评分和平均 CLIP 相似度,分别记为 $S_{aesthetic}$ 和 $S_{CLIP}$。然后,我们使用以下双准则条件过滤低质量资产:

$S_{aesthetic} < 4.5 \text{ 且 } S_{CLIP} < 0.6.$ (13)

仅当资产在两个维度——渲染质量和风格语义保留——同时表现不佳时,才会被丢弃。在实践中,此阶段丢弃了最初生成的约 10% 的 3D 资产,最终得到约 15K 个风格化 3D 三元组的数据集。

通过这种互补的两阶段过滤,我们构建了一个高质量的风格化 3D 资产数据集,具有强烈的风格一致性、高几何保真度和稳定的渲染质量。该数据集为我们 DreamStyle3D 及未来 3D 风格化方法的训练和评估提供了强大且可靠的基础。

第 13 页

DreamStyle3D: 通过双重注意力解耦实现高效 3D 风格化资产生成 MM ’26, 2026年11月10–14日, 巴西里约热内卢。

Hunyuan2.1 Hunyuan2.1 内容 风格 OmniStyle OmniGen ours -OmniStyle -OmniGen

图 10: 我们的方法与两阶段风格化流程的讨论。

C 附加评估 这种两阶段公式更容易出现误差累积。 如图 10 所示,现有的 2D 风格化方法可能会产生有偏差的中间结果,在某些情况下主要对背景进行风格化而非目标对象。这些偏差随后被传递到后续的 3D 生成阶段,导致最终 3D 资产与期望的风格参考存在显著差异。此外,两阶段流程需要额外的风格化模型和额外的推理阶段,使其比我们的原生 3D 端到端方法更慢且计算需求更高。

C.2 用户研究 图 11: 用户研究结果,以偏好率表示。 我们进行了包含 50 名参与者的用户研究,所有参与者均为计算机视觉或图形学领域的研究生或研究人员,且熟悉 3D 资产评估。每位参与者评估了 C.1 与两阶段流程的比较 我们进一步讨论我们的原生 3D 端到端方法与两阶段流程之间的差异,该流程首先执行 2D 风格转移,然后生成 3D 资产。具体而言,给定内容图像和风格图像,我们首先将它们输入到 2D 风格化模型以获得风格化图像。在我们的实验中,我们使用 OmniStyle [40] 和 OmniGen2 [43] 作为代表性示例。然后我们使用 Hunyuan3D-2.1 [14] 作为下游 3D 生成器:原始内容图像用作其第一阶段几何生成的输入,而风格化图像用作其第二阶段纹理生成的输入,最终生成风格化 3D 资产。通过这种方式,3D 风格化任务被分解为 2D 风格化后接 3D 生成。原则上,如果中间风格化图像高度准确,随后的 3D 生成问题将变得容易得多,这可能导致强大的最终结果。这也是我们为什么在数据集构建中采用类似的两阶段流程的原因。 然而,需要注意的是,我们的数据集流程是一个离线策展过程,我们仔细过滤 2D 风格化阶段和 3D 生成阶段的输出,以确保数据质量。这并不与我们在此处的讨论相矛盾,因为两阶段流程在那里用作带有严格过滤的离线数据生产过程,而不是作为直接测试时生成解决方案。相比之下,当用作直接生成流程时,

C.1 与两阶段流程的比较 我们进一步讨论我们的原生 3D 端到端方法与两阶段流程之间的差异,该流程首先执行 2D 风格转移,然后生成 3D 资产。具体而言,给定内容图像和风格图像,我们首先将它们输入到 2D 风格化模型以获得风格化图像。在我们的实验中,我们使用 OmniStyle [40] 和 OmniGen2 [43] 作为代表性示例。然后我们使用 Hunyuan3D-2.1 [14] 作为下游 3D 生成器:原始内容图像用作其第一阶段几何生成的输入,而风格化图像用作其第二阶段纹理生成的输入,最终生成风格化 3D 资产。通过这种方式,3D 风格化任务被分解为 2D 风格化后接 3D 生成。原则上,如果中间风格化图像高度准确,随后的 3D 生成问题将变得容易得多,这可能导致强大的最终结果。这也是我们为什么在数据集构建中采用类似的两阶段流程的原因。 然而,需要注意的是,我们的数据集流程是一个离线策展过程,我们仔细过滤 2D 风格化阶段和 3D 生成阶段的输出,以确保数据质量。这并不与我们在此处的讨论相矛盾,因为两阶段流程在那里用作带有严格过滤的离线数据生产过程,而不是作为直接测试时生成解决方案。相比之下,当用作直接生成流程时,

C.2 用户研究 图 11: 用户研究结果,以偏好率表示。 我们进行了包含 50 名参与者的用户研究,所有参与者均为计算机视觉或图形学领域的研究生或研究人员,且熟悉 3D 资产评估。每位参与者评估了五个代表性案例,涵盖不同的对象类别和风格类型。对于每个案例,参与者会看到内容图像、风格图像以及 StyleTex、3D-style-LRM、MV-Adapter 和 DreamStyle3D 的渲染结果。他们被要求选择最能平衡风格对齐、结构保留和整体视觉质量的结果。我们汇总所有选择以计算每种方法的偏好率。 如图 11 所示,DreamStyle3D 实现了 51.2% 的最高偏好率。这一排名与主论文中的定量和定性评估一致。

D 更多可视化结果 图 12 展示了由我们的方法生成的其他 3D 风格化资产,进一步验证了其在不同场景中的适应性和有效性。通过多视图渲染,该图展示了融合不同风格参考的各种对象类型。每组图像展示了内容和风格图像的组合,说明我们的方法在保持几何一致性的同时,准确地将风格注入生成的 3D 资产中,从而产生强烈的风格一致性和高视觉质量。此外,图中的渲染视图覆盖了对象的 360 度旋转,清晰地展示了风格注入后所有角度的几何细节和风格特征。

第 14 页

MM ’26,2026年11月10–14日,巴西里约热内卢。Wang 等人。

生成式风格化 3D 资产的内容风格渲染视图

图 12:DreamStyle3D 生成的 3D 风格化资产的更多可视化结果,展示了各种物体类型和风格参考的多视角渲染。可以看出,我们的方法在不同视角下均实现了高视觉质量和纹理完整性。

发表评论