快速导读:Texture++提出了一种基于多视角渲染和区域感知扩散模型的迭代式纹理超分辨率框架,通过自适应视角选择和掩码生成机制,有效解决了UV接缝处的伪影问题并实现了高保真细节恢复。
Texture++提出了一种新颖的3D资产纹理超分辨率方法,旨在解决现有图像超分辨率模型在处理UV纹理图时产生的接缝伪影问题。该方法通过结合多视角渲染和区域感知扩散模型,实现了高保真的细节恢复。
核心创新在于其自适应视角选择策略和基于全局质量图的掩码生成机制。这些设计确保了迭代过程中的单调改进,避免了重复更新导致的模糊,并为扩散模型提供了清晰的空间先验。
英文题目:Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model
论文出处:arXiv 每日论文精选 · arXiv:2607.21504
原始论文:PDF / 论文页面
对应视频标题:Texture++:如何用扩散模型修复3D纹理UV接缝伪影?|推荐指数:★★★★★
这篇论文解决什么问题?
在3D图形学中,低分辨率纹理限制了资产在现代渲染管线中的应用。传统方法要么忽略3D结构直接处理2D纹理图,要么依赖耗时的梯度优化。
直接应用图像超分辨率模型到UV纹理图时,由于UV展开导致的非连续性,会在接缝处产生严重的伪影。基于优化的方法虽然能保留细节,但计算成本高且易积累误差。
纹理生成方法虽然能生成高质量纹理,但往往无法忠实保留原始低分辨率内容的细节,导致过度平滑或幻觉细节。
因此,需要一种高效、通用且能保持几何一致性的纹理超分辨率方法,以平衡细节恢复和计算效率。
核心创新
- 提出自适应视角选择策略,区分观察视角和规范视角,以解决UV接缝处的连续性问题。
- 引入基于全局质量图的SR掩码生成机制,确保迭代过程中的单调改进,避免重复更新导致的模糊。
- 设计基于四叉树的掩码正则化方法,消除原始掩码的碎片化边界,为扩散模型提供清晰的空间先验。
- 开发专用的局部SR扩散模型,通过掩码条件和单步残差预测,实现目标区域的高频细节注入并与周围上下文无缝融合。
方法概览
该方法包含四个阶段:(1) 自适应视角选择,分为UV图内视角(最大化单图可见性)和跨UV图视角(连接相邻图表以保持一致性);(2) SR区域提名,通过全局质量图和历史最佳分数生成二进制更新掩码,并使用四叉树正则化平滑边界;(3) 局部SR生成,使用微调的Stable Diffusion 2.1模型,结合LoRA和掩码条件,进行单步残差预测以增强指定区域;(4) 全局纹理更新,将SR结果投影回HR纹理。
- 自适应视角选择:分为UV图内视角(最大化单图可见性)和跨UV图视角(连接相邻图表以保持一致性),确保每个视角都能覆盖连续的纹理区域。
- SR区域提名:通过全局质量图和历史最佳分数生成二进制更新掩码,并使用四叉树正则化平滑边界,消除碎片化区域。
- 局部SR生成:使用微调的Stable Diffusion 2.1模型,结合LoRA和掩码条件,进行单步残差预测以增强指定区域,实现高频细节注入。
- 全局纹理更新:将SR结果投影回HR纹理,确保几何一致性,并迭代更新直到达到满意的分辨率。
逐图理解论文
现有方法的失败

直接应用图像超分辨率模型到UV纹理图时,由于UV展开导致的非连续性,会在接缝处产生严重的伪影。基于优化的方法虽然能保留细节,但计算成本高且易积累误差。纹理生成方法虽然能生成高质量纹理,但往往无法忠实保留原始低分辨率内容的细节,导致过度平滑或幻觉细节。
核心区分

图3概述了Texture++的四个主要阶段:观察视角选择、SR区域提名、局部SR生成和全局纹理更新。该图清晰地展示了方法的迭代流程和关键组件。
方法贡献

图10展示了基于扩散的局部SR模块架构。低分辨率图像和掩码条件输入到微调的Stable Diffusion模型中,通过LoRA进行单步残差预测,实现目标区域的高频细节注入。
最强结论

图6定性比较了Texture++与SOTA图像SR和纹理生成方法。图像SR基线在UV边界产生伪影,而纹理生成方法过度平滑细节。Texture++则重建了更清晰的纹理,避免了这些不连续性。
意义与局限

该方法为现代渲染管线提供了高效、通用的纹理增强解决方案,但其在处理高度复杂或自遮挡几何结构时表现不佳,且目前不支持PBR材质超分辨率。以上就是这篇论文的核心内容,感谢收听。
实验如何设计?
- 在4倍超分辨率任务上与SOTA图像SR方法(DiffBIR, HYPIR, OSEDiff, PiSASR, InvSR)和纹理生成方法(Text2Tex, Paint3D, MVPaint)进行定量和定性比较。
- 进行消融实验,验证视角选择、四叉树掩码处理和局部SR模块的有效性,评估各组件对最终结果的贡献。
- 评估方法对不同UV参数化策略(xatlas, Blender Smart UV Project)的鲁棒性,确保方法在不同UV布局下的稳定性。
关键结果与论文证据
- Texture++在PSNR、SSIM、LPIPS和DISTS指标上均优于现有SOTA方法,特别是在LPIPS和DISTS上表现显著,表明其生成的纹理在感知质量上更优。
- 消融实验显示,移除视角选择、四叉树处理或掩码生成均会导致性能下降,验证了各组件的重要性。
- 定性结果显示,Texture++能有效恢复尖锐的文本和精细的纹理细节,避免UV边界的不连续性和过度平滑。
- 方法对不同UV参数化策略表现出良好的鲁棒性,PSNR方差小于0.31,表明其不受UV岛形状和人工接缝放置的影响。
阅读时需要注意
- 在处理具有高度复杂或自遮挡几何结构的模型时表现不佳,遮挡区域无法获得有效的视角更新,导致纹理模糊。
- 目前不支持PBR(基于物理的渲染)材质超分辨率,限制了其在某些高级渲染管线中的应用。
关联工作
- PBR-SR [Chen et al. 2025c] 是一种基于优化的零样本方法,易积累伪影,计算成本高。
- TEXTure [Richardson et al. 2023] 是一种文本到纹理生成方法,侧重于从头合成而非现有纹理的增强。
- DiffBIR [Lin et al. 2024] 是SOTA图像SR基线,缺乏3D空间感知,导致UV边界伪影。
- MVPaint [Cheng et al. 2025] 是一种多视角纹理生成方法,实验中仅使用其 refinement 阶段进行对比。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Texture++:利用区域感知扩散模型提升 3D 资产纹理分辨率 王帅伟∗,中国浙江大学 CAD&CG 国家重点实验室 李石∗,中国浙江大学 CAD&CG 国家重点实验室 徐杰廷,中国浙江大学 CAD&CG 国家重点实验室 霍宇驰,中国浙江大学 CAD&CG 国家重点实验室 王琦,中国华北电力大学 郑文婷,中国浙江大学 CAD&CG 国家重点实验室 谢仁刚†,中国浙江大学 CAD&CG 国家重点实验室
LR ours LR ours OSEDiff
OSEDiff GT OSEDiff GT
Invsr PiSASR Invsr PiSASR 2026
HYPIR Diffbir HYPIR Diffbir Jul 23 LR 图像 LR 图像
图 1. Texture++ 能够提升 3D 资产的纹理分辨率。视觉对比展示了 3D 网格,对角线分割为低分辨率输入(左下角)和我们超分后的结果(右上角)。如放大区域所示,我们的方法恢复的细节更接近真实值(Ground Truth),优于最近的最先进方法。
许多 3D 资产因纹理分辨率低而被弃用,而当前的超分辨率模型在 UV 空间执行超分辨率任务时,往往忽略纹理贴图,专注于自然渲染视图,并在多个视图上执行后合并输出。首先,为了实现视角空间中更完整和连续的纹理,我们提出了一种自适应视角选择策略,以整合分散在 UV 纹理块中的纹理。此外,我们引入了一种基于四叉树的纹理区域组织方法,用于组合来自不同视角的超分纹理,并提供掩码以区分需要改进的区域。最后,我们设计了一种基于扩散模型的超分辨率模型,用于增强指定掩码区域的纹理分辨率,并与周围区域无缝集成。通过全面的评估,我们证明我们的方法产生的纹理在细节和一致性方面均显著优于现有方法。
† 通讯作者。
- 同等贡献。
作者联系方式:王帅伟,中国杭州浙江大学 CAD&CG 国家重点实验室;李石,中国杭州浙江大学 CAD&CG 国家重点实验室;徐杰廷,中国杭州浙江大学 CAD&CG 国家重点实验室;霍宇驰,中国杭州浙江大学 CAD&CG 国家重点实验室;王琦,中国北京华北电力大学;郑文婷,中国杭州浙江大学 CAD&CG 国家重点实验室;谢仁刚,中国杭州浙江大学 CAD&CG 国家重点实验室。
ACM 引用格式: Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, and Rengan Xie. 2026. Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model. ACM Trans. Graph. 1, 1 (July 2026), 16 pages. https://doi.org/10.1145/nnnnnnn.nnnnnnn
arXiv:2607.21504v1
为个人或课堂使用制作本作品全部或部分副本无需付费,前提是副本不用于盈利或商业优势,且副本保留此通知和完整引用。本作品中由作者以外的人拥有的组件的版权必须得到尊重。以注明出处的方式摘要是被允许的。否则复制、重新发布、发布到服务器或重新分发到列表,需要事先获得特定许可和/或付费。请从 permissions@acm.org 请求权限。 © 2026 版权所有归所有者/作者。出版权许可给 ACM。 ACM 1557-7368/2026/7-ART https://doi.org/10.1145/nnnnnnn.nnnnnnn
1 引言 高保真 3D 资产对于现代数字体验至关重要,支撑着沉浸式媒体、视频游戏、虚拟现实和工业数字孪生。表面纹理质量决定了 3D 资产的视觉真实感,然而制作高分辨率(HR)、艺术上一致的纹理既耗时又昂贵。许多现有
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 2 页
2 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢任刚
优化。我们的核心目标是在纹理空间中实现端到端方法的效率,同时保留视角空间超分辨率(SR)的强大泛化能力。首先,我们提出了一种迭代框架,该框架通过多次渲染视角空间图像并执行纹理细节增强。随后,我们引入了一种自适应视角选择策略。由于完整的图案能产生最佳的 SR 性能,我们将视角分为两类:观察视角和标准视角。前者旨在连接在视角空间中变得连续的 UV 图表,以产生连贯的图案;后者旨在最大化纹理空间中单个 UV 图表内内容的可见性。为了防止对同一纹理区域应用 SR 时因跨多个渲染视角而产生的闪烁,我们引入了 SR 掩码生成机制,以在每个迭代中识别视角图像中需要 SR 的区域,并引入基于四叉树的机制以在纹理图块间管理具有平滑边界的掩码。最后,为了仅使用 SR 更新视角空间中的局部区域,我们设计了一种专用的局部 SR 模型,该模型通过单次扩散步骤将高频细节注入指定区域,同时与周围上下文无缝融合。我们的主要贡献总结如下:
• 我们提出了一种新颖的纹理 SR 方法 Texture++,它无需梯度优化即可为低分辨率(LR)资产生成高质量的 SR 纹理图。实验表明,我们的方法在定量和定性评估中均显著优于当前的 SOTA 纹理图 SR 方法。
• 我们引入了一种自适应视角选择策略,该策略优先选择完整图案以增强 SR 性能,同时兼顾单个 UV 图表内及不同 UV 图表间的纹理图案。
• 我们引入了一种 SR 掩码生成机制,该机制识别跨迭代的更新区域,并采用基于四叉树的方案确保掩码边界在纹理图块间平滑过渡。
• 我们设计了一种专用的局部 SR 扩散模型,它在指定掩码内进行靶向增强,同时保留周围内容并实现无缝边界过渡。
2 相关工作
单图超分辨率。单图 SR 的最新进展主要由生成模型驱动,这些模型擅长合成逼真的细节 [Ai et al. 2024; Chen et al. 2025b; Li et al. 2025; Lin et al. 2024, 2025; Qu et al. 2024; Sun et al. 2024, 2025; Wang et al. 2024, 2023; Wu et al. 2024a,b; Yue et al. 2025; Zhu et al. 2025]。主要的研究方向集中在提高效率和控制上,例如 OFTSR [Zhu et al. 2025]、FluxSR [Li et al. 2025] 和 CCSR [Sun et al. 2024] 开发了单步推理管道,而 PiSA-SR [Sun et al. 2025] 通过双 LoRA [Hu et al. 2021] 结构实现了保真度与真实感之间的可调权衡。与此同时,增强语义一致性仍然是一个关键目标,SeeSR [Wu et al. 2024b] 等方法利用退化感知提示来解决这一问题。另一类工作针对任意尺度上采样,采用的技术范围从动态卷积到新颖的表示方法,如 2D 高斯泼溅 (GSASR) [Chen et al. 2025a]。最先进
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 3 页
Texture++:利用区域感知扩散模型提升 3D 资产纹理分辨率 • 3
针对整体矩形图像设计的 2D 图像复原方法,当直接应用于 UV 分块纹理时,会产生严重的伪影。相比之下,专为 3D 领域设计的 Texture++ 采用规范视角选择和动态掩码,以在网格表面实现全局连贯且无缝集成的细节。
基于网格的纹理生成。自动 3D 纹理化最近涌现出大量利用 2D 扩散模型 [Ho et al. 2020] 的生成方法。TEXTure [Richardson et al. 2023] 等方法通过从多个相机视角迭代绘制网格,开创了文本到纹理合成的先河;AlignTex [Zhang et al. 2025] 则专注于将多视图图像中的像素级细节转移到网格上。其他工作如 TexGaussian [Xiong et al. 2025] 甚至提出了替代的 3D 表示形式,以确保从零开始生成基于物理的渲染 (PBR) 材质时的几何一致性。尽管这些方法在从零生成 3D 资产方面表现出色,但它们未能解决增强现有 3D 模型中大量遗留低分辨率 (LR) 纹理的关键需求。这构成了一个正交的挑战,其核心目标并非合成,而是对原始艺术意图的忠实保留与增强。我们的工作专门针对这一挑战,将高保真纹理超分辨率 (SR) 定位为此类生成方法的互补任务。
纹理 SR。基于学习的纹理 SR 方法分为端到端和零样本模型。例如,Richard 等人 [Richard et al. 2020] 提出了一种端到端模型,在单个网络中统一了多视图冗余和单图像先验以进行纹理增强。相比之下,PBR-SR [Chen et al. 2025c] 等零样本模型利用预训练的 2D SR 模型作为强先验,通过可微渲染最小化视角空间损失并应用多视图约束来迭代细化纹理,从而减轻不一致性。然而,这种迭代优化容易积累伪影。相反,我们提出了一种规范视角选择算法,用于稳定、无冲突的监督,并采用单步掩码扩散模型以确保单调有益的更新。这种设计有效缓解了先前基于优化方法中普遍存在的误差累积问题。
3.1 概述
考虑单个 LR 纹理 $T_{LR}$,我们的目标是恢复对应的 HR 纹理 $T_{HR}$。与传统图像 SR 不同,纹理 SR 应结合 3D 模型 M 和 UV 映射的信息,否则在 UV 图表接缝附近会产生较差的恢复效果。对于纹理 SR,使用相机 $v_n$,算子 $\pi$ 将带有纹理 $T$ 的几何网格渲染到图像 $I_n = \pi(M, T, v_n)$ 上。为了生成 HR 且视角一致的纹理,我们通过迭代纹理细化框架引入了一种新颖的 SR 方法。我们最初使用简单的双线性上采样器生成 HR 纹理 $T_{dHR}$。我们方法的整体流程如图 3 所示,可分为四个模块:1) 观察视角选择。首先,我们引入一种接缝感知的观察视角选择方法,以建立一组规范和一致的视角。2) SR 区域提名。在每次迭代中,我们从选定的视角中选取一个视角 $v_n$,并使用 HR 纹理渲染图像 $I_n$。同时,我们生成一个 SR 掩码 $M_n$ 以及一个全局质量图 $Q_{global}$,后者指示需要分辨率增强的纹理区域。3) 局部 SR 生成。然后,我们使用预训练的局部 SR 模型,以渲染图像 $I_n$ 和掩码 $M_n$ 为条件,生成局部 SR 图像 $\tilde{I}_n$。4) 全局纹理更新。最后,我们将生成的细节 $\tilde{I}_n$ 无缝投影回去,并更新预测的 HR 纹理 $T_{dHR}$。
3.2 接缝感知的视角观察选择
纹理 SR 面临的一个重大挑战是处理由 UV 展开引入的人工边界。UV 展开将连续的 3D 表面切割成多个独立的图表,使得表面相邻的区域在 2D 纹理图中可能相距甚远,如图 3 所示。这种分离使得基于图像的 SR 操作难以自然地保持跨接缝的一致性。此外,多视图纹理更新可能会因为视角相关的可见性和投影差异,为同一表面区域分配不同的高频细节,如图 4 所示。这种不一致的更新通常会导致 UV 图表内部及其边界处出现虚假的高频伪影和可见接缝。为了解决这个问题,我们引入了一种自适应观察视角选择策略。其核心思想是为纹理丰富的区域分配一组视角,以确保在迭代细化过程中稳定且连贯地收敛。
我们的策略将视角选择解耦为两种互补方案:一种保持图表内连贯性,另一种强制执行跨接缝纹理连续性。
UV 图表内的视角选择。我们将网格面分割成不同的集合,其中每个集合对应一个连续的 UV 图表。对于每个 UV 图表 $P$,相机的观察方向设置为与相应网格表面的面积加权平均法线对齐,从而确保正面视角,最大化采样密度并最小化投影失真。相机位于相应网格表面的几何质心处。规范视角向量 $v^*_P$ 计算如下:
$$ v^*_P = \frac{\sum_{f_i \in P} A_i \cdot N_i}{\|\sum_{f_i \in P} A_i \cdot N_i\|} \quad (1) $$
其中 $f_i$ 是图表 $P$ 内的一个面,$A_i$ 是面积,$N_i$ 是法线。通过为每个图表预计算规范视角,我们确保每个 UV 图表的纹理图案至少被一个视角覆盖,并且该视角尽可能完整地观察该图表,从而最小化未观察区域。
UV 图表间的视角选择。我们将接缝定义为 3D 网格上的几何边,其组成顶点映射到 UV 坐标空间中不同的顶点对。在识别出所有接缝边的集合后,我们将它们分组为连续的接缝条带,每个条带代表 3D 模型上的连续接缝边。对于每个识别出的接缝条带,我们定义一个包含的接缝区域 $R_s$,它由该条带内任何边相邻的所有网格面组成。与图表内情况类似,相机的观察方向与 $R_s$ 中所有面的面积加权平均法线对齐。随后,相机定位在该区域的几何质心上方。
第 4 页
4 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢任刚
(a) 接缝感知视角选择 (b) 超分辨率掩码生成 (c) 基于扩散模型的局部超分辨率 接缝线索 低分辨率纹理 高分辨率纹理 质量图 $Q_{global}$ Mn Mn′ 局部超分辨率模型 内部 UV 图表
冻结参数 上采样 更新 交叉 UV 图表 反投影 细化 低分辨率 高分辨率
输入 输入 输出 n 掩码 图像 图像 $v_1$ $v_2$ 着色图像 $v_n$ $\pi$ n+1 …
高分辨率图像 n+2… 网格 M 视角选择 反投影 × n 次
图 3. 概述。我们的方法包含四个主要阶段。(1) 观察视角选择:选择一组规范视角 $(v_1, \dots, v_n)$ 以渲染 3D 模型 M。(2) 超分辨率区域提名:对于每个视角,我们渲染一张图像 $I_{LR}^n$ 并计算逐视角质量图 $Q_n$。将其与全局质量图 $Q_{global}$ 进行比较,以生成用于识别增强区域的二值掩码 $M_n$,并更新全局质量图 $Q_{global}$,随后使用基于四叉树的掩码正则化对其进行细化,以生成最终掩码 $M'_n$。(3) 局部超分辨率生成:渲染图像及其掩码被输入到局部超分辨率模型中,该模型输出局部超分辨率图像 $I_{HR}^n$。(4) 全局纹理更新:新的高分辨率细节被反投影回高分辨率纹理 $T_{HR}$。
随后的纹理更新。一种朴素地更新所有渲染像素的策略存在两个问题。首先,扩散模型本质上会引入随机变化,反复用略有不同的输出更新相同的纹理单元会逐渐使纹理模糊。其次,不加选择地重新生成已经具有足够质量的区域会浪费计算资源并降低流水线速度。为了防止这种情况,我们引入了一种超分辨率掩码生成机制,该机制跨迭代识别更新区域,确保纹理更新单调改进。这是通过一个全局质量图来协调的,该质量图跟踪每个纹理单元在所有迭代中达到的最佳渲染质量。
视角质量对纹理连续性的影响。坏视角(左侧)迫使连续的表面图案(右侧)跨多个视图进行更新,破坏了其原有的连续性。相比之下,好视角(中间)覆盖了整个图案,使其能够在单个视角中一致地进行超分辨率处理。
质量评估。对于每个视角 $v_n$,我们计算相应的几何质量图 $Q_n$。每个像素的质量分数由相机与表面的几何方向以及相机到表面的距离共同决定。目标是优先选择从近距离正面捕捉表面的相机姿态,因为这些视角能最大化可见细节并最小化投影畸变。我们通过更重地加权正面观察的表面补丁(其中纹理采样无透视缩短)来量化这一点,并惩罚远距离视角,因为捕获的细节随距离的平方成反比下降。具体而言,对于每个像素 $(u, v)$,其值为:
$$ Q_n(u, v) = \frac{\max(0, \cos(v^* \cdot N))}{d^2} \quad (2) $$
其中 $d$ 是相机到表面的距离,$v^*$ 是视角方向,$N$ 是表面法线。这种公式确保仅当表面既正对相机又靠近相机时,才会分配高质量分数。这一双重标准防止了可能因采样密度低而导致细节被更近、高保真观察所覆盖的远距离视角。
视角整合。为了减轻由大量 UV 岛和接缝引起的计算开销,我们采用了一种分层视角整合策略。我们首先在法线空间应用基于面积的 $k$-均值聚类,将 UV 岛和接缝条带分别分组为紧凑的代表性视角。然后,这些候选者通过分层聚类 1 联合合并。最后,我们重新应用可见性剔除以重新计算确切的可见面集合。此步骤有效地修剪了视图间的冗余,同时保证了完整的表面覆盖。相反,对于 UV 布局简单的模型(例如展开为单个大图表的球体),单个规范视角提供的覆盖范围不足以进行迭代细化。在这种情况下,我们渲染模型包围盒的六个轴对齐视角(前、后、上、下、左、右)。
3.3 超分辨率区域提名
在确定规范视角后,下一阶段涉及渲染相应区域并精确识别这些渲染中哪些像素适合超分辨率处理。
掩码生成。为了确保迭代细化过程严格渐进,我们维护一个与高分辨率纹理具有相同尺寸的全局质量图 $Q_{global}$。$Q_{global}$ 存储
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 5 页
Texture++:利用区域感知扩散模型提升 3D 资产纹理分辨率 • 5
输入掩码 输入图像 输出图像(左)。为解决这一问题,我们对预训练的 Stable Diffusion 2.1 基础模型(SD)[Rombach et al. 2022] 进行微调,以针对由我们生成的掩码定义的 SR 局部区域进行处理,确保与周围上下文无缝集成。
首先,为了实现对生成过程的精确控制,我们调整其架构以接受图像和相应的掩码 $M$ 作为条件输入。渲染图像通过 VAE 编码器编码为潜在表示 $z \in \mathbb{R}^{4 \times H \times W}$。为了将 SR 限制在掩码区域内,我们将掩码作为显式空间条件提供给扩散模型。具体而言,我们将潜在变量 $z$ 与掩码 $M$ 沿通道维度拼接,创建 5 通道输入 $[z; M] \in \mathbb{R}^{5 \times H \times W}$,并相应地修改 U-Net 的第一层卷积层。其次,我们利用低秩适应(LoRA)[Hu et al. 2021]。我们在 U-Net 中集成两个可训练的 LoRA 模块,一个用于恢复高保真内容,另一个专注于特定区域。受先前 SR 进展的启发 [Sun et al. 2025; Zhang et al. 2017, 2018b],我们将生成过程构建为潜在空间中的残差预测问题。具体而言,U-Net 被训练用于预测将初始潜在变量 $z$ 转换为高保真潜在变量 $z_{final}$ 所需的潜在空间残差 $\Delta z$,其计算方式为:
$$z_{final} = z – \Delta z \odot M \quad (4)$$
其中 $\odot$ 表示 Hadamard(逐元素)乘积,$M$ 为二值掩码。这种残差公式提供了稳定的训练目标,允许直接进行单步 SR,而无需迭代去噪调度。
模型优化。为了确保生成的细节不仅在结构上准确,而且在感知上令人信服,我们使用混合损失函数训练我们的模型。损失 $L$ 是掩码像素级均方误差(MSE)损失 $L_{mse}$ 和解码图像空间中的掩码学习感知图像块相似度(LPIPS)[Zhang et al. 2018a] 损失 $L_{lpips}$ 的加权和。原始掩码 $M_{raw}$ 通常以碎片化、锯齿状和不规则的边界产生,这容易被扩散模型误认为是纹理图案,从而导致边界伪影。为解决此问题,我们引入了一种基于四叉树的掩码正则化策略,以产生清晰、结构化的掩码边界。具体而言,我们在渲染图像的空间域上构建四叉树,其中根节点代表整个图像。然后,我们递归地将每个节点细分为四个大小相等的子节点,并在满足以下任一条件时终止:a) $M_{raw}$ 中节点对应区域内的所有像素均为 0(无需 SR)。b) $M_{raw}$ 中节点区域内的所有像素均为 1(需要完整 SR)。c) 节点已达到预定义的最小尺寸,标志着 0 和 1 像素混合的边界区域;我们将所有像素设置为 1,以将这些碎片整合为干净的块。掩码 $M_n$ 为扩散模型提供了连贯且更稳定的信号,促进了高质量细节的合成。
图 5. 迭代细化过程的可视化。各行展示了迭代 0、$N$ 和 $N+1$ 时管道的快照。对于每一步,我们展示当前纹理的渲染视图(中)、识别更新区域的掩码(左)以及局部 SR 输出(右)。这是所有先前迭代中每个 texel 从任何视角获得的最大渲染质量得分。我们在图像空间中定义一个二值更新掩码 $M$,指示需要 SR 的相应像素。对于每个视图,我们首先计算当前渲染图像的质量图 $Q_n(x,y)$,然后从 $Q_{global}$ 中检索对应的历史最佳得分 $Q_{hist}(x,y)$。然后通过比较 $Q_{view}(x,y)$ 和 $Q_{hist}(x,y)$ 生成原始掩码 $M_{raw}$:
$$M_{raw}(x,y) = \begin{cases} 1 & Q_{hist}(x,y) \le Q_n(x,y) \\ 0 & Q_{hist}(x,y) > Q_n(x,y) \end{cases} \quad (3)$$
掩码像素损失 $L_{mse}$ 定义为:
$$L_{mse} = \| (D(z_{final}) – I_{GT}) \odot M \|_2^2 \quad (5)$$
其中 $D(\cdot)$ 是 VAE 解码器,$I_{GT}$ 是 GT 图像。类似地,掩码感知损失 $L_{lpips}$ 利用预训练的 VGG 网络 [Simonyan and Zisserman 2015] 在感知相关空间中比较特征,同样关注掩码区域:
$$L_{lpips} = LPIPS(D(z_{final}) \odot M, I_{GT} \odot M) \quad (6)$$
最终训练目标是这两个损失的加权和:
$$L = \lambda_{mse} L_{mse} + \lambda_{lpips} L_{lpips} \quad (7)$$
纹理细化推理。在管道推理阶段,来自视角的渲染图像 $I$ 及其相应的掩码 $M$ 作为我们局部 SR 模型的输入,使 SR 模块能够利用先前迭代中的高频上下文,确保全局一致性。输出是一个局部 SR 图像,其在目标区域表现出丰富的细节,并与周围环境保持无缝边界。
3.4 局部 SR 生成
在识别出需要 SR 的局部区域后,下一步是选择合适的 SR 模型。我们此阶段的输入是一张渲染图像,除了目标区域外,其余部分都很清晰,而目标区域仍然模糊。图像 SR 模型并非为此类设置设计:
3.5 全局纹理更新
它们均匀地处理整个图像,改变清晰的上下文,并且无法将增强的细节与周围纹理协调一致,从而留下可见的接缝或不一致性,如图 9 所示。
每次迭代的最后阶段是将由我们模型生成的局部 SR 图像投影回高分辨率纹理 $T_{dHR}$。我们的
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 6 页
6 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢任刚
框架通过直接投影机制 [Zeng et al. 2024] 实现这一目标,避免了较慢的基于优化的技术 [Chen et al. 2025c; Youwang et al. 2024]。更新受二进制掩码 $M_n$(第 3.3 节)约束,这确保了仅修改视觉质量得到改善的区域。图 5 可视化了这一过程,展示了我们的方法如何在迭代过程中动态定位并细化不同的表面区域,从而累积构建出高保真 3D 资产。此外,我们选择了三种采用由粗到细策略并具备专用细化阶段的纹理生成方法。
4 实验
在本节中,为了验证我们方法的有效性,我们进行了一系列综合实验。我们首先详细介绍实现和训练设置。然后,我们与几种最先进(SOTA)方法进行定性和定量比较。最后,我们进行消融研究,以分析我们框架中关键组件的影响。
4.1 实现细节
我们的整个框架均在 PyTorch 中实现。对于核心渲染任务,我们利用 Nvidiffrast [Laine et al. 2020]。我们使用三块显存为 48 GB 的 NVIDIA A6000 GPU 进行 SR 模型训练,并使用一块 NVIDIA A6000 GPU 进行迭代纹理细化。我们在自定义的成对局部 SR 数据集上训练模型,有关数据集和训练过程的更多细节可在补充材料中找到。对于所有基线,我们使用其官方发布的预训练模型,并遵循推荐的推理设置以确保最佳性能。所有实验均针对 4× 放大倍数进行,部分结果展示在图 6 和表 1 中,其他结果可在补充材料的图 13 中找到。
方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | DISTS ↓ | 时间(s) ↓ —|—|—|—|—|— DiffBIR | 35.9406 | 0.9292 | 0.1067 | 0.1056 | 586.2 HYPIR | 33.3778 | 0.8997 | 0.1066 | 0.0996 | 48.0 OSEDiff | 31.6975 | 0.9168 | 0.0959 | 0.0964 | 108.6 PiSASR | 33.1539 | 0.9159 | 0.0866 | 0.0864 | 111.4 InvSR | 30.5382 | 0.8789 | 0.1281 | 0.1123 | 42.0 Text2Tex | 27.5001 | 0.8855 | 0.1405 | 0.1272 | 321.5 Paint3D | 24.3583 | 0.8300 | 0.1826 | 0.1570 | 130.4 MVPaint | 20.9008 | 0.7098 | 0.2581 | 0.1872 | 215.6 Ours | 37.5277 | 0.9524 | 0.0637 | 0.0736 | 94.4
表 1. 与 4x 纹理超分辨率最先进方法的定量比较。我们报告了 PSNR、SSIM、LPIPS 和 DISTS。最佳结果以红色显示,次佳以蓝色显示,第三佳以绿色显示。
4.2 比较
由于与纹理 SR 相关的工作稀缺,且现有方法未开源 [Chen et al. 2025c; Richard et al. 2020],我们与一系列 SOTA 图像 SR 和纹理生成方法进行了广泛比较。我们选择了五种强大且当代的图像 SR 基线模型,代表了基于扩散的高效 SR 的前沿技术。HYPIR [Lin et al. 2025] 是一种利用扩散生成的分数先验进行高质量图像恢复的方法。DiffBIR [Lin et al. 2024] 是另一种强大的基于扩散的模型,使用双分支架构进行可控图像恢复。OSEDiff [Wu et al. 2024a] 使用一步有效扩散网络以加快推理速度。InvSR [Yue et al. 2025] 是一种基于可逆神经网络的任意步 SR 高效框架。PiSASR [Sun et al. 2025] 是一种先进的单步 SR 模型,也利用了预训练的 Stable Diffusion 骨干网络。这些方法专为 2D 图像 SR 设计,无法直接作为局部 SR 模块集成到我们的管线中,因为我们的迭代细化过程生成的混合分辨率渲染图像包含清晰和模糊区域,这与旨在处理均匀低分辨率输入的常规 SR 方法不兼容。因此,我们将每个基线应用于整个 LR 纹理,以单次传递生成 HR 输出。
Text2Tex [Chen et al. 2023] 使用深度感知的修复扩散模型,从多个视角逐步合成 HR 部分纹理。Paint3D [Zeng et al. 2024] 首先通过多视角纹理融合生成粗略纹理图,然后在 UV 空间中利用 UV 修复和 UVHD 扩散模型对其进行细化。MVPaint [Cheng et al. 2025] 引入了一个三阶段框架,包括同步的多视角生成、空间感知的 3D 修复以及执行 UV 空间 SR 随后进行空间感知接缝平滑的 UV 细化。由于这些方法是用于从头生成纹理而非现有纹理的 SR,我们通过利用其细化阶段将其适应于我们的任务。具体而言,我们将 LR 纹理作为其细化模块的输入,并执行与其原始管线中相同的细化操作。
定性比较。如图 6、15 和图 13 所示,虽然图像 SR 基线可能产生更清晰的细节,但它们缺乏 3D 空间感知,导致严重的接缝和边界伪影。纹理生成方法未能保留原始内容或实现 SR,导致文本和结构细节模糊、失真甚至被擦除。在米色马克杯(第 3 行)和木制猫头鹰(第 2 行)上,基线引入了虚假噪声并扭曲了原始图案。场景模型(第 1 行)上的文本在所有基线方法中要么模糊,要么被伪影损坏,而我们的方法重建了清晰、可读的字符。相比之下,我们的 3D 感知方法可靠地合成高保真细节,并确保所有视角间的无缝一致性,产生最接近 GT 的结果。
定量比较。我们使用四种标准图像质量评估指标进行定量评估:峰值信噪比(PSNR)、结构相似性指数(SSIM)[Wang et al. 2004]、LPIPS [Zhang et al. 2018a] 和 DISTS [Ding et al. 2020]。这些指标是在输出 HR 纹理和 GT 纹理之间计算的。如表 1 所示,我们的方法在所有指标上均取得了最佳性能。这表明我们具有更优越的能力来准确重建 GT 结构和内容,这与我们的定性发现一致,即基线方法经常幻觉出不正确的细节。我们还报告了时间成本。尽管我们的管线涉及迭代过程,但它仍比大多数方法耗时更少。这可能是由于我们在视角空间(1K)中对渲染图像进行 SR,而不是直接在纹理(2K)上操作。更重要的是,我们的 SR 模型是一个单步扩散模型,
第 7 页
Texture++:利用区域感知扩散模型提升 3D 资产纹理分辨率 • 7
LR GT DiffBIR HYPIR MVPaint Text2Tex Our
图 6. 与最先进图像超分辨率(DiffBIR, HYPIR)及纹理生成方法(MVPaint, Text2Tex)的定性比较。图像超分辨率基线在 UV 边界处产生刺眼的接缝伪影,而纹理生成方法往往过度平滑细节并擦除细微文本和结构图案。相比之下,我们的方法重建出更清晰的纹理,并避免了这些边界不连续性。
高效地对渲染图像执行 SR。相比之下,基线方法通常在目标分辨率(2K)下处理纹理。优化以对齐 UV 边界的视图会导致模型为相邻纹理区域生成不一致的更新,从而在 3D 表面跨域产生严重的接缝伪影,切断连续图案。相比之下,我们的策略确保更新在几何上对齐,从而产生全局一致的纹理。
设置 PSNR ↑ SSIM ↑ LPIPS ↓ DISTS ↓ 无 v.s. 36.3777 0.9545 0.0482 0.0875 无四叉树 38.3475 0.9685 0.0435 0.0765 无掩码 36.2000 0.9641 0.0490 0.0979 完整 38.4241 0.9686 0.0433 0.0760
表 2. 消融研究的定量结果。我们报告了本方法变体的指标,包括移除我们的视图选择(v.s.)、四叉树处理和掩码合成。
基于四叉树的掩码处理的影响。原始的像素级比较往往在边界处产生带有高频噪声的碎片化掩码。为了验证我们四叉树正则化的必要性,我们对该组件进行消融,并直接使用原始掩码。如图 9(中间)所示,这导致清晰度和细节的明显下降。嘈杂且不连续的掩码区域无法提供连贯的空间引导,阻止 SR 模型有效地集中其生成能力。通过对这些区域进行四叉树分解正则化,我们的完整方法提供了鲁棒的空间先验,从而合成更清晰且更复杂的纹理。
局部 SR 的影响。最后,我们验证了局部 SR 模型的重要性,该模型将掩码作为显式空间条件。我们将我们的方法与基线方法进行比较,其中 SR 模块被标准 SR 模型 [Sun et al. 2025] 替换。在此设置中,掩码是在整个图像完成 SR 后应用的。如图 9(右侧)所示,该策略 invariably 在与现有纹理的界面处产生明显的边界伪影。缺乏
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 8 页
8 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢任刚
在生成过程中基于掩码的条件控制,基线模型不受周围上下文约束,导致在图块边缘出现严重的颜色和图案不连续。相比之下,我们的模型显式地以掩码为条件进行合成,确保生成的内容在上下文上连贯且无缝集成。
5 结论
总之,我们提出了 Texture++,这是一种支持任意 UV 映射并生成高分辨率(HR)纹理的纹理超分辨率方法。我们引入了一种迭代框架,通过多视角渲染细化纹理细节,其中采用自适应视角选择策略,利用观察视角连接相邻的 UV 图表以生成连贯图案,并利用规范视角最大化单个图表内的可见性。我们进一步开发了一种基于四叉树表示的 SR 掩码生成方案,该方案在每个迭代步骤中选择需要 SR 的区域,并在纹理图块之间保持平滑边界;我们还设计了一种局部 SR 扩散模型,该模型仅在视角空间中更新目标区域,注入高频细节,同时与周围上下文无缝融合。实验验证了我们的方法,定量指标显示其显著优于最先进(SOTA)基线,定性结果证实该框架能够生成无缝且高分辨率的纹理。我们在补充材料中讨论了局限性和未来工作的潜在方向。
参考文献
Yuang Ai, Xiaoqiang Zhou, Huaibo Huang, Xiaotian Han, Zhengyu Chen, Quanzeng You, and Hongxia Yang. 2024. DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation. arXiv:2410.18666 [cs.CV] https://arxiv.org/abs/2410.18666
Bin Chen, Gehui Li, Rongyuan Wu, Xindong Zhang, Jie Chen, Jian Zhang, and Lei Zhang. 2025b. Adversarial Diffusion Compression for Real-World Image Super-Resolution. arXiv:2411.13383 [eess.IV] https://arxiv.org/abs/2411.13383
Du Chen, Liyi Chen, Zhengqiang Zhang, and Lei Zhang. 2025a. Generalized and Efficient 2D Gaussian Splatting for Arbitrary-scale Super-Resolution. arXiv preprint arXiv:2501.06838 (2025).
Dave Zhenyu Chen, Yawar Siddiqui, Hsin-Ying Lee, Sergey Tulyakov, and Matthias Nießner. 2023. Text2tex: Text-driven texture synthesis via diffusion models. In Proceedings of the IEEE/CVF International Conference on Computer Vision. 18558–18568.
Yujin Chen, Yinyu Nie, Benjamin Ummenhofer, Reiner Birkl, Michael Paulitsch, and Matthias Nießner. 2025c. PBR-SR: Mesh PBR Texture Super Resolution from 2D Image Priors. arXiv:2506.02846 [cs.CV] https://arxiv.org/abs/2506.02846
Wei Cheng, Juncheng Mu, Xianfang Zeng, Xin Chen, Anqi Pang, Chi Zhang, Zhibin Wang, Bin Fu, Gang Yu, Ziwei Liu, et al. 2025. Mvpaint: Synchronized multi-view diffusion for painting anything 3d. In Proceedings of the Computer Vision and Pattern Recognition Conference. 585–594.
Keyan Ding, Kede Ma, Shiqi Wang, and Eero P. Simoncelli. 2020. Image Quality Assessment: Unifying Structure and Texture Similarity. IEEE Transactions on Pattern Analysis and Machine Intelligence (2020), 1–1. doi:10.1109/tpami.2020.3045810
Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising Diffusion Probabilistic Models. arXiv:2006.11239 [cs.LG] https://arxiv.org/abs/2006.11239
Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Guohao Li, Zi Wang, Weizhu Chen, et al. 2021. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685 [cs.CL] https://arxiv.org/abs/2106.09685
Yawei Li, Kai Zhang, Jingyun Liang, Jiezhang Cao, Ce Liu, Rui Gong, Yulun Zhang, Hao Tang, Yun Liu, Denis Demandolx, Rakesh Ranjan, Radu Timofte, and Luc Van Gool. 2023. LSDIR: A Large Scale Dataset for Image Restoration. In 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). 1775–1787. doi:10.1109/CVPRW59228.2023.00178
Xinqi Lin, Jingwen He, Ziyan Chen, Zhaoyang Lyu, Bo Dai, Fanghua Yu, Wanli Ouyang, Yu Qiao, and Chao Dong. 2024. DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior. arXiv:2308.15070 [cs.CV] https://arxiv.org/abs/2308.15070
Xinqi Lin, Fanghua Yu, Jinfan Hu, Zhiyuan You, Wu Shi, Jimmy S. Ren, Jinjin Gu, and Chao Dong. 2025. Harnessing Diffusion-Yielded Score Priors for Image Restoration. arXiv:2507.20590 [cs.CV] https://arxiv.org/abs/2507.20590
Yunpeng Qu, Kun Yuan, Kai Zhao, Qizhi Xie, Jinhua Hao, Ming Sun, and Chao Zhou. 2024. XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution. arXiv:2403.05049 [cs.CV] https://arxiv.org/abs/2403.05049
Rohit Ranade, Yangwen Liang, Shuangquan Wang, Dongwoon Bai, and Jungwon Lee. 2022. 3D Texture Super Resolution via the Rendering Loss. In ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 1556–1560.
Audrey Richard, Ian Cherabier, Martin R. Oswald, Vagia Tsiminaki, Marc Pollefeys, and Konrad Schindler. 2020. Learned Multi-View Texture Super-Resolution. arXiv:2001.04775 [cs.CV] https://arxiv.org/abs/2001.04775
Elad Richardson, Gal Metzer, Yuval Alaluf, Raja Giryes, and Daniel Cohen-Or. 2023. Texture: Text-guided texturing of 3d shapes. In ACM SIGGRAPH 2023 conference proceedings. 1–11.
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. arXiv:2112.10752 [cs.CV] https://arxiv.org/abs/2112.10752
Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. arXiv:1409.1556 [cs.CV] https://arxiv.org/abs/1409.1556
Lingchen Sun, Rongyuan Wu, Jie Liang, Zhengqiang Zhang, Hongwei Yong, and Lei Zhang. 2024. Improving the Stability and Efficiency of Diffusion Models for Content Consistent Super-Resolution. arXiv:2401.00877 [eess.IV] https://arxiv.org/abs/2401.00877
Lingchen Sun, Rongyuan Wu, Zhiyuan Ma, Shuaizheng Liu, Qiaosi Yi, and Lei Zhang. 2025. Pixel-level and Semantic-level Adjustable Super-resolution: A Dual-LoRA Approach. arXiv:2412.03017 [cs.CV] https://arxiv.org/abs/2412.03017
Jianyi Wang, Zongsheng Yue, Shangchen Zhou, Kelvin C. K. Chan, and Chen Change Loy. 2024. Exploiting Diffusion Prior for Real-World Image Super-Resolution. arXiv:2305.07015 [cs.CV] https://arxiv.org/abs/2305.07015
Xintao Wang, Liangbin Xie, Chao Dong, and Ying Shan. 2021. Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data. In 2021 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW). 1905–1914. doi:10.1109/ICCVW54120.2021.00217
Yufei Wang, Wenhan Yang, Xinyuan Chen, Yaohui Wang, Lanqing Guo, Lap-Pui Chau, Ziwei Liu, Yu Qiao, Alex C. Kot, and Bihan Wen. 2023. SinSR: Diffusion-Based Image Super-Resolution in a Single Step. arXiv:2311.14760 [cs.CV] https://arxiv.org/abs/2311.14760
Zhou Wang, A.C. Bovik, H.R. Sheikh, and E.P. Simoncelli. 2004. Image quality assessment: from error visibility to structural similarity. IEEE Transactions on Image Processing 13, 4 (2004), 600–612. doi:10.1109/TIP.2003.819861
Rongyuan Wu, Lingchen Sun, Zhiyuan Ma, and Lei Zhang. 2024a. One-Step Effective Diffusion Network for Real-World Image Super-Resolution. arXiv:2406.08177 [eess.IV] https://arxiv.org/abs/2406.08177
Rongyuan Wu, Tao Yang, Lingchen Sun, Zhengqiang Zhang, Shuai Li, and Lei Zhang. 2024b. SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution. arXiv:2311.16518 [cs.CV] https://arxiv.org/abs/2311.16518
Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, and Jiaolong Yang. 2024. Structured 3D Latents for Scalable and Versatile 3D Generation. arXiv preprint arXiv:2412.01506 (2024).
Bojun Xiong, Jialun Liu, Jiakui Hu, Chenming Wu, Jinbo Wu, Xing Liu, Chen Zhao, Errui Ding, and Zhouhui Lian. 2025. Texgaussian: Generating high-quality pbr material via octree-based 3d gaussian splatting. In Proceedings of the Computer
Lu Wang 和 Weizhu Chen。2021。LoRA:大型语言模型的低秩适应。神经信息处理系统大会(NeurIPS)。551–561。 Models。arXiv:2106.09685 [cs.CL] https://arxiv.org/abs/2106.09685 Kim Youwang, Tae-Hyun Oh, 和 Gerard Pons-Moll。2024。Paint-it:通过深度卷积纹理图优化和基于物理的渲染实现文本到纹理合成。在 IEEE/CVF 计算机视觉与模式识别大会论文集(CVPR)中。4347–4356。 Diederik P. Kingma 和 Jimmy Ba。2017。Adam:一种随机优化方法。arXiv:1412.6980 [cs.LG] https://arxiv.org/abs/1412.6980 Samuli Laine, Janne Hellsten, Tero Karras, Yeongho Seol, Jaakko Lehtinen, 和 Timo Aila。2020。高性能可微渲染的模块化基元。arXiv:2011.03277 [cs.GR] https://arxiv.org/abs/2011.03277 Jianze Li, Jiezhang Cao, Yong Guo, Wenbo Li, 和 Yulun Zhang。2025。通过流轨迹蒸馏实现一步扩散到现实世界超分辨率。arXiv:2502.01993 [cs.CV] https://arxiv.org/abs/2502.01993 Xianfang Zeng, Xin Chen, Zhongqi Qi, Wen Liu, Zibo Zhao, Zhibin Wang, Bin Fu, Yong Liu, 和 Gang Yu。2024。Paint3d:使用无光照纹理扩散模型绘制任何 3D 物体。在 IEEE/CVF 计算机视觉与模式识别大会论文集(CVPR)中。 Yawei Li, Vagia Tsiminaki, Radu Timofte, Marc Pollefeys, 和 Luc Van Gool。2019。基于深度学习的 3D 外观超分辨率。在 IEEE/CVF 计算机视觉与模式识别大会论文集(CVPR)中。
ACM 图形学汇刊,第 1 卷,第 1 期,文章。出版日期:2026 年 7 月。
第 9 页
纹理增强++:利用区域感知扩散模型提升3D资产纹理分辨率 • 9
模式识别. 4252–4262. Kai Zhang, Wangmeng Zuo, Yunjin Chen, Deyu Meng, 和 Lei Zhang. 2017. 超越高斯去噪器:用于图像去噪的深度CNN残差学习. IEEE图像处理汇刊 26, 7 (2017), 3142–3155. doi:10.1109/TIP.2017. 2662206 Richard Zhang, Phillip Isola, Alexei A. Efros, Eli Shechtman, 和 Oliver Wang. 2018a. 深度特征作为感知度量的不合理有效性. arXiv:1801.03924 [cs.CV] https://arxiv.org/abs/1801.03924 Yulun Zhang, Yapeng Tian, Yu Kong, Bineng Zhong, 和 Yun Fu. 2018b. 用于图像超分辨率的残差密集网络. arXiv:1802.08797 [cs.CV] https://arxiv.org/ abs/1802.08797 Yuqing Zhang, Hao Xu, Yiqian Wu, Sirui Chen, Sirui Lin, Xiang Li, Xifeng Gao, 和 Xiaogang Jin. 2025. AlignTex:从多视图艺术品生成像素级精确纹理. ACM图形学汇刊 44, 4, 文章161 (2025年7月), 12页. doi:10.1145/ 3731158 Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, 和 Kai Zhang. 2025. OFTSR:用于图像超分辨率的一步流,具有可调的保真度-真实性权衡. arXiv:2412.09465 [cs.CV] https://arxiv.org/abs/2412.09465
ACM图形学汇刊, 第1卷, 第1期, 文章. 出版日期: 2026年7月.
第 10 页
10 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢仁刚
LR GT Our
图 7. 定性结果(1/3)。每组三元组分别展示了渲染的 LR 输入、我们的 HR 输出以及 GT。在这些示例中,我们的方法擅长恢复 LR 输入中通常严重退化的锐利文本和精细纹理细节。
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 11 页
Texture++:利用区域感知扩散模型提升 3D 资产纹理分辨率 • 11
低分辨率 地面真值 我们的 图 8. 定性结果(2/3)。每组三元组分别展示了渲染的低分辨率输入、我们的高分辨率输出以及地面真值。这些案例进一步证明了我们方法在恢复精细表面细节和保持纹理一致性方面的能力。
无视角选择 无掩码正则化 无掩码条件
有视角选择 有掩码正则化 有掩码条件 图 9. 关键组件的消融研究。我们通过将消融基线(顶部)与我们完整的方法(底部)进行比较,可视化了每个提出模块的影响。结果表明,一致的视角选择对于几何连续性至关重要,掩码正则化对于细节清晰度必不可少,而掩码条件对于无缝集成不可或缺。
ACM 图形学报,第 1 卷,第 1 期,文章。出版日期:2026 年 7 月。
第 12 页
12 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢任刚
Texture++:利用区域感知扩散模型提升 3D 资产纹理分辨率
补充材料
A 局限性与未来工作。
我们的框架在各种资产上表现良好,但仍存在若干局限性。首先,它难以处理具有高度复杂或自遮挡几何结构的模型。图 11 展示了一个典型的失败案例:在人形角色上,左肩(绿色箭头)的图案未被遮挡,成功实现了超分辨率;而右肩(红色箭头)的图案被盔甲遮挡。因此,对应的纹理区域(蓝色方框),其底层几何结构被与红色方框关联的几何结构遮挡,无法获得有意义的更新,仍然模糊。此外,我们的方法目前尚不支持 PBR。在未来的工作中,我们将探索更自适应的视角采样策略以增强对几何复杂资产的鲁棒性,并将扩展框架以支持 PBR 材质的超分辨率。
图 11. 严重自遮挡几何结构上的局限性。我们的方法在大部分被模型其他部分遮挡的区域上失效。在渲染图像(左侧)中,左肩图案(绿色箭头)可见并成功超分辨率,而右肩图案(红色箭头)被盔甲遮挡。在输出纹理(右侧)中,蓝色方框标记了对应的纹理区域,由于缺乏有效的像素和语义观测,该区域保持模糊;红色方框指示了遮挡几何结构的纹理。
B 更多实现细节
B.1 数据集
由于缺乏足够的开源渲染图像数据集,我们在 LSDIR(大规模多样化图像修复)数据集 [Li et al. 2023] 上训练模块。LSDIR 因包含大量具有多样化内容的高质量高分辨率(HR)图像而在超分辨率(SR)任务中闻名。在训练过程中,为每张图像合成随机掩码以模拟局部 SR 任务,然后使用 RealESRGAN 退化模块 [Wang et al. 2021] 创建低分辨率(LR)和高分辨率(HR)图像块对。为了评估,我们从 TRELLIS [Xiang et al. 2024] 和 Sketchfab 收集了多样化的高质量 3D 资产集。LR 纹理是通过对原始 HR 纹理应用高斯模糊和 4× 双三次下采样合成的。
B.2 模型训练
我们的 SR 模块基于用于 ×4 SR 任务的公开预训练 Stable Diffusion 2.1 模型 [Rombach et al. 2022] 构建。二进制掩码 $M$ 被下采样以匹配潜在空间的空间维度,并应用高斯模糊以确保生成的内容与其周围环境无缝融合。Mask LoRA 应用于 U-Net 的浅层编码器块,而 Pixel-and-Semantic LoRA 应用于下采样块、中间块和上采样块,如图 10 所示。我们将 LoRA 配置为秩 $r=8$ 和缩放因子 $\alpha=16$。我们使用 Adam [Kingma and Ba 2017] 优化器,恒定学习率为 $5 \times 10^{-5}$,批量大小为 12。模型训练 10,000 步。我们混合损失函数的权重系数经验性地设置为 $\lambda_{mse}=1.0$ 和 $\lambda_{lpips}=2.0$,以在结构保真度和感知真实性之间取得平衡。
B.3 局部 SR 模型的细节
在本节中,我们将更详细地描述基于扩散的局部 SR 模块的架构和训练过程,并将在未来发布详细的网络源代码。
网络架构与数据流。我们的增强模块基于 Stable Diffusion 2.1 模型,专门针对单步掩码 SR 进行了调整。单次前向传播期间的详细数据流如图 10 所示,过程如下:
步骤 1. VAE 编码:LR 输入着色图像 $I_{LR}^n$ 首先使用预训练的 VAE 编码器编码为 4 通道潜在表示 $z_{LR}$。
步骤 2. 掩码条件化:二进制掩码图像 $M_n$ 被下采样以匹配 $z_{LR}$ 的空间维度。该下采样掩码随后与 $z_{LR}$ 沿通道
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 13 页
Texture++:利用区域感知扩散模型提升 3D 资产纹理分辨率 • 13
UV 布局 PSNR ↑ SSIM ↑ LPIPS ↓ DISTS ↓
xatlas 34.69 0.9519 0.0470 0.0911 45° 34.70 0.9511 0.0485 0.1037 60° 35.00 0.9521 0.0481 0.1003
表 3. 对 UV 参数化鲁棒性的定量评估。所有三项指标的最小方差表明,我们的方法对 UV 岛形状和人工接缝位置的变化具有鲁棒性。输入 迭代 t 迭代 t+1 输出
图 12. 流程概览。从低分辨率(LR)纹理开始,我们在不同视角下迭代地对局部区域进行超分辨率(SR)处理(每次迭代以不同的维度高亮显示,形成 5 通道张量作为 U-Net 的输入),直到生成最终的高分辨率(HR)纹理。 U-Net。为此,U-Net 的初始卷积层被替换为接受 5 通道输入的新层。 步骤 3. LoRA 引导的去噪:5 通道张量由 U-Net 处理,其生成过程由集成到其注意力层中的两个可训练的 LoRA 模块控制。 E 视角整合的细节 Pixel-and-Semantic LoRA 模块控制高保真内容的合成和核心图像结构的恢复。Mask LoRA 模块强制执行空间条件约束,将合成过程主要限制在掩码区域内,并促进与未掩码上下文的无缝过渡。 步骤 4. 单步残差预测:LoRA 引导的 U-Net 执行单次前向传播以预测潜在空间残差 Δ𝑧。该残差随后从初始潜在表示 𝑧LR 中减去,以计算最终的高分辨率潜在表示 𝑧HR。 步骤 5. VAE 解码:最后,高分辨率潜在表示 𝑧HR 通过预训练的 VAE 解码器,生成最终的高分辨率输出图像 𝐼HR𝑛 。 训练过程。模型以端到端方式训练,以优化两个 LoRA 模块和修改后层的权重。基础 Stable Diffusion U-Net 和 VAE 编码器/解码器的权重保持冻结。训练目标是在输出图像 𝐼HR𝑛 和真实高分辨率图像 𝐼GT𝑛 之间计算的混合损失函数。如主论文所述,该损失是掩码 L2 MSE 损失(𝐿𝑚𝑠𝑒)和掩码 LPIPS 感知损失(𝐿𝑙𝑝𝑖𝑝𝑠)的加权和。有关训练超参数(包括学习率和批量大小)的更多详细信息见主论文。
C 对 UV 参数化的敏感性
我们通过测试多种展开策略(包括 Blender 的 Smart UV Project(45° 和 65° 角度限制)和 xatlas,它们产生不同的接缝布局和岛屿形状),进一步评估了我们的方法对 UV 参数化的鲁棒性。如表 3 所示,我们的方法在所有配置下均保持了一致的视觉质量。
D 迭代纹理细化
图 12 说明了我们的迭代纹理 SR 流程概览。从 LR 输入开始,我们的方法通过一系列渲染和 SR 步骤逐步增强纹理细节。在每次迭代中,选择表面的特定部分进行 SR,这在 3D 网格和相应的 UV 布局上以不同的颜色可视化。此过程允许模型专注于局部区域,从最佳视角逐步覆盖整个表面,直到生成完整的 HR 纹理。 我们使用由两个标准控制的贪婪聚类算法来整合岛屿和接缝视角。位置阈值 𝜏pos 定义为 3D 模型包围盒对角线的一个固定比例,使其在不同网格间具有尺度不变性。只有当视角到聚类质心的空间距离低于 𝜏pos 且其观察方向与聚类平均方向之间的余弦相似度超过 𝜏cos 时,该视角才会被分配给该聚类。这种双重约束防止了空间相近但朝向相反的视角之间,或朝向相似但距离较远的视角之间发生错误合并。然后,我们通过视锥剔除重新计算每个合并视图的可见面集,检测未覆盖区域,并通过额外的相机视角进行覆盖。
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 14 页
14 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢任刚
低分辨率 地面真值 OSEDiff PiSASR InvSR Paint3D 本文方法
图 13. 与额外基线方法的定性比较。我们进一步与图像超分辨率方法(OSEDiff、PiSASR、InvSR)以及纹理生成方法(Paint3D)进行了比较。与之前的评估一致,这些基线方法也表现出 UV 边界不连续或过度平滑的纹理,以及偏离地面真值的幻觉细节(Paint3D)。相比之下,我们的方法始终重建出更清晰、更保真的纹理,并避免了此类伪影。
ACM 图形学报,第 1 卷,第 1 期,文章编号。出版日期:2026 年 7 月。
第 15 页
Texture++:利用区域感知扩散模型提升3D资产纹理分辨率 • 15
LR GT Our
图 14. 定性结果(3/3)。每组三元组分别展示了渲染的 LR 输入、我们的 HR 输出以及 GT。这些示例涵盖了结构化图案(文本、符号)和有机表面细节(如海龟和鱼皮纹理),展示了我们方法的通用性。
ACM Trans. Graph., Vol. 1, No. 1, Article . Publication date: July 2026.
第 16 页
16 • 王帅伟,李石,徐杰廷,霍雨晨,王琦,郑文婷,谢任刚
低分辨率 地面真值 DiffBIR HYPIR MVPaint Text2Tex 本文方法 图 15. 与最先进图像超分辨率方法(DiffBIR、HYPIR)及纹理生成方法(MVPaint、Text2Tex)的定性比较。
ACM 图形学报,第 1 卷,第 1 期,文章编号。出版日期:2026 年 7 月。