MicroZoom:如何用AI实现350倍放大且不失真?

快速导读:MicroZoom提出了一种基于级联扩散模型和分割引导的生成框架,利用智能手机照片和少量显微镜图像,实现高达350倍的极端超分辨率合成,生成全局结构连贯的吉像素级图像。

在数字成像领域,从智能手机照片到显微镜图像的跨越一直是一个巨大的技术鸿沟。传统超分辨率方法通常局限于4x至8x的放大倍数,而面对65x至350x的极端尺度时,现有生成式方法如UltraZoom和Chain-of-Zoom往往陷入全局结构混乱与纹理幻觉的困境。MicroZoom的出现,旨在解决这一极端尺度下的细节合成难题,通过引入结构保持机制,实现吉像素级图像的高保真重建。

该论文的核心贡献在于提出了一种两阶段级联扩散架构,并结合SAM分割掩码作为硬约束。这种方法不仅恢复了微观纹理,更关键的是保持了材料边界的清晰与全局结构的一致性。通过实例级LoRA微调与条件预热训练策略,MicroZoom在多个日常物体数据集上展示了优于现有基线的视觉质量与感知相似度,为极端超分辨率任务提供了新的解决思路。

英文题目:MicroZoom: Structure-Preserving Detail Synthesis at Extreme Scale

论文出处:arXiv 每日论文精选 · arXiv:2607.24729

原始论文:PDF / 论文页面

对应视频标题:MicroZoom:如何用AI实现350倍放大且不失真?|推荐指数:★★★★★

这篇论文解决什么问题?

极端超分辨率(Extreme Super-Resolution)的挑战在于,当放大倍数超过一定阈值后,输入图像中的低频信息已无法支撑高频细节的恢复。此时,模型必须依赖先验知识进行细节合成,这极易导致语义漂移与结构幻觉。例如,在放大印刷品图案时,模型可能错误地混合不同材料的纹理,导致边界模糊。

现有方法如ContinuousSR在极端缩放下性能显著下降,而Chain-of-Zoom虽能生成吉像素图像,但缺乏真实参考的grounding,导致结果不可靠。IPAdapter+ControlNet等前馈方法在无实例微调的情况下,难以应对领域差异。因此,如何在缺乏高频信息的情况下,既合成逼真纹理又保持结构连贯,成为亟待解决的关键问题。

此外,显微镜成像的浅景深特性使得获取高分辨率全焦地面真值极具挑战。传统数据构建管道难以提供足够的高质量训练数据,限制了模型在微观尺度下的泛化能力。MicroZoom通过焦点堆栈技术构建数据集,为解决这一数据瓶颈提供了基础。

核心创新

  • 级联扩散框架:分离全局结构恢复与局部细节细化,解决极端缩放下的空间上下文缺失问题。
  • 分割引导机制:利用SAM掩码作为硬约束,防止多材料物体在边界处的纹理混合。
  • 条件预热训练策略:先训练纹理合成,再引入结构对齐,优化收敛效果。
  • 基于焦点堆栈的数据构建管道:解决显微镜浅景深问题,生成高分辨率全焦地面真值。

方法概览

采用两阶段级联扩散架构:第一阶段恢复全局模式连贯性,第二阶段细化局部纹理。引入SAM生成的分割掩码以约束材料边界,并通过LoRA进行实例级微调。推理时使用MultiDiffusion滑动窗口策略。

  • 级联扩散框架:MicroZoom采用两阶段生成策略。第一阶段专注于恢复全局模式连贯性,确保大尺度结构正确;第二阶段则细化局部纹理,提升微观细节的真实感。这种分离策略有效缓解了极端缩放下的空间上下文缺失问题。
  • 分割引导机制:引入SAM生成的分割掩码作为条件输入,对多材料物体的边界进行硬约束。这防止了不同材料纹理在边界处的混合,显著减少了语义冲突与幻觉现象。
  • 条件预热训练:训练过程分为两个阶段。首先仅训练纹理合成能力,随后引入结构对齐条件。这种预热策略优化了模型的收敛效果,避免了早期结构约束对纹理学习的干扰。
  • 实例级LoRA微调:针对每个物体进行低秩适应微调,使模型能够适应特定物体的纹理特征与结构模式。虽然增加了预处理成本,但显著提升了生成结果的保真度。
  • MultiDiffusion推理:在推理阶段采用滑动窗口策略,处理吉像素级图像的计算需求。通过重叠区域的一致性约束,确保全局图像的结构连贯性。

逐图理解论文

直觉与失败

直觉与失败
Fig. 3. Qualitative Comparison. Rows are ordered from lowest to highest magnification. For each example, we compare a 6000 × 6000 patch across methods. From left to right, we show a microscope capture of the object and the full image with the region of the input patch highlighted. Then, we compare the low-resolution input (upscaled using bicubic interpolation), four baselines, and our final result. These patches are not exactly aligned, but have been selected from similar regions or contain similar materials. Qualitatively, our method achieves the most consistency and visual similarity with the exemplar. For more examples, see Figures 6 and 7 or our project page for full-resolution results.

定性对比不同方法在6000×6000 patch上的表现。从左至右依次为显微镜参考、LR输入、基线方法及MicroZoom结果。重点观察材料边界处的纹理混合情况,MicroZoom在此方面表现最佳。

方法贡献

方法贡献
Fig. 4. Ablations. We visualize the additive contribution of each module on the final output. Naive super-resolution on a pretrained ControlNet fails to resolve meaningful detail due to the domain gap. Full fine-tuning sharpens textures but suffers from structural hallucinations and material bleeding. Adding segmentation maps resolves these semantic conflicts, guiding boundaries between textures. Finally, our cascaded architecture with conditioning warmup produces the best overall result, maintaining global structural integrity and local texture authenticity.

消融实验可视化,展示各模块的 additive contribution。对比Naive SR、Full Fine-tuning、加分割掩码及最终结果。注意分割掩码如何消除语义冲突,级联架构如何提升整体质量。

意义与局限

意义与局限
Fig. 5. Failure Cases. We visualize two distinct failure cases in our method. The left example showcases the train/test domain gap that exists even after color correction, which leads to inaccurate color shifts. The right example showcases semantic drift, where ambiguous low-frequency information in the input image can generate incorrect textures, even after being labeled.

展示两种典型失败案例:左侧为域差异导致的颜色偏移,右侧为语义漂移导致的错误纹理。这些案例揭示了方法在颜色校正与低频信息处理上的局限性。

实验如何设计?

  • 数据集:在21个日常物体数据集上评估,涵盖有机与合成材料,放大倍数范围从65x到350x。数据构建采用焦点堆栈技术,确保高分辨率全焦地面真值。
  • 基线对比:对比ContinuousSR、Chain-of-Zoom、IPAdapter+ControlNet及UltraZoom等主流方法,全面评估MicroZoom在极端尺度下的性能。
  • 评估指标:采用DISTS(感知相似度)与LSD(频谱距离)进行定量评估,基于合成LR数据测试。同时开展用户研究,由79名参与者评估视觉质量与一致性。

关键结果与论文证据

  • 定量表现:在DISTS指标上,MicroZoom取得0.213的最佳结果,显著优于其他基线。LSD指标为1.014,与UltraZoom的0.951具有竞争力,表明其在频谱保真度上的优势。
  • 用户研究:在视觉质量评估中,MicroZoom的胜率达到60.52%;在一致性评估中,胜率为52.56%。单物体质量Top-1率为76.2%,一致性Top-1率为71.4%,证明其在主观感知上的优越性。
  • 消融实验:移除分割掩码导致边界纹理混合,移除级联架构导致结构幻觉。条件预热策略显著提升了收敛速度与最终质量,验证了各模块的有效性。
  • 定性结果:在印刷品、织物等多材料物体上,MicroZoom生成的细节与显微镜图像高度一致,边界清晰,无明显语义漂移。

阅读时需要注意

  • 推理成本高:单张吉像素图像在A100上需约20小时,限制了实时应用。
  • 无法零样本泛化:需对每个物体进行实例级LoRA微调,预处理流程复杂。
  • 级联误差累积:第一阶段的错误会传递到第二阶段,影响最终细节质量。
  • 域差异问题:训练与测试域的分布差异可能导致颜色偏移,需额外校正。

关联工作

  • UltraZoom作为主要基线,针对中等缩放优化,未解决微观尺度的结构连贯性问题。MicroZoom通过级联架构与分割引导,弥补了这一缺陷。
  • Chain-of-Zoom虽采用级联生成,但缺乏真实参考,易产生幻觉。MicroZoom引入显微镜图像作为grounding,提升了结果的可信度。
  • ContinuousSR在极端缩放下性能下降,验证了传统连续分辨率模型在微观尺度上的局限性。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

MicroZoom:极端尺度下的结构保持细节合成

HUY HUYNH,美国华盛顿大学 JINGWEI MA,美国华盛顿大学 BRIAN CURLESS,美国华盛顿大学 IRA KEMELMACHER-SLIZERMAN,美国华盛顿大学 STEVEN M. SEITZ,美国华盛顿大学

4890 MP

参考图像 输出(放大) 0.6 MP

参考2026 捕获过程

输入(放大)Jul 输入图像 输出(93.24倍)

图 1. 给定一张来自智能手机的标准分辨率图像和几张显微镜图像,MicroZoom 执行极端尺度的超分辨率以合成吉像素图像。我们的方法恢复了细粒度的纹理,例如打印纸张上的图案。此示例展示了 93.23 倍的放大,弥合了普通摄影与显微镜观察之间的差距。请参阅我们的项目页面以查看交互式结果。

我们介绍了 MicroZoom,这是一个用于微观尺度吉像素图像合成的生成框架。给定一张标准照片和一组稀疏的消费级显微镜特写,MicroZoom 合成无缝的、吉像素分辨率的图像,该图像基于物体的材质特性,并借助真实参考,实现了对物体整个空间范围内微观纹理的探索性可视化。我们的目标是合理的合成,而非精确重建。我们专注于全图像、基于参考的极端尺度超分辨率,放大倍数高达 350 倍,这一设置将放大因子推至显著更大的范围(65–350 倍)。

最近,生成式方法在这一目标上取得了有意义的进展。诸如 Chain-of-Zoom 和 UltraZoom [13, 23, 35] 等方法利用扩散先验 [25, 27, 28, 30] 和近距离观察作为真实世界的外观参考。虽然这些方法能够从随意拍摄的照片中生成令人印象深刻的吉像素图像,但它们主要设计用于中等放大倍数。

在本工作中,我们研究了当这种范式被推至显著更大的放大因子(65–350 倍)时会发生什么。这引入了两个主要挑战:(1) 从高度有损的输入中恢复纹理特定的细节,特别是在模糊的材质边界附近;(2) 在数百万个局部预测中保持正确的大尺度图案结构,例如织物编织的重复几何形状。我们通过两阶段级联设计来解决这些问题,其中第一阶段恢复全局图案一致性,第二阶段细化局部纹理细节,并辅以分割掩码以在模糊边界处引导合成。我们在一系列自捕获的日常物体上验证了我们的方法,并展示了全局一致、基于材质的吉像素图像。请参阅我们的项目页面以查看交互式结果。

1 引言 微观世界隐藏在众目睽睽之下:叶片上的细毛、盐的晶体结构以及日常织物的复杂编织。这些细节存在于我们遇到的每一个物体中,却在我们通常感知的尺度上不可见。将普通照片与微观细节丰富的图像联系起来,仍然是一个开放的生成式挑战。

为了解决这些挑战,我们引入了 MicroZoom,这是一个用于从随意拍摄的照片和商业数码显微镜的高倍率观察中进行极端尺度细节合成的生成框架。我们的框架结合了双阶段级联生成和结构感知条件控制。级联是一种刻意的设计选择:第一阶段在较粗的分辨率下合成一致的全局结构,此时空间上下文

第 2 页

2 • Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Schlizerman, 和 Steven M. Seitz

足以确立图案规律性。这为第二阶段提供了结构稳固的画布,以便细化局部纹理。我们结构感知的条件控制包含一个分割图,以在极端放大下保持材料边界。

我们的贡献如下: • 一种用于极端尺度超分辨率(SR)的级联扩散框架,将全局图案连贯性与局部细节细化分离,从而实现吉像素(Gigapixel)分辨率下的结构规则合成。 • 一种分割条件机制,强制执行区域一致的纹理生成,特别是在材料边界附近,因为低分辨率观测在这些区域变得高度模糊。 • 一个基于数字显微镜焦点堆栈的数据集管线,为极端放大倍数下的训练和评估生成清晰、景深扩展的参考图像。

2.3 极端尺度超分辨率 极端尺度 SR 的目标放大倍数远超标准的 4× 或 8× 设置。Generative Powers of Ten 和 Chain of Zoom (CoZ) 通过级联幻觉生成一致的缩放序列,但没有真实的参考依据 [13, 35]。WonderZoom 将 CoZ 扩展到同时进行的 RGB 和深度 SR,但继承了其缩放上限和纹理区域伪影 [5]。隐式神经表示方法如 ContinuousSR 对连续分辨率进行建模,但在超出其训练范围的尺度下评估时会退化 [26]。

2.4 分割引导的超分辨率 分割先验通过提供内容类型的空间结构来正则化 SR。SFT-GAN 使用空间特征变换(SFT)层,利用语义图调制特征 [24, 37],而 SegSR、PASD 和 SeeSR 将分割与语义标签或语言描述相结合,以引导基于扩散的生成 [40, 41, 43]。

这些方法改善了类别级的空间连贯性,但未改善实例级的纹理保真度。在 MicroZoom 中,分割分离了纹理区域并防止了在材料边界处的跨区域渗透,而不是注入语义信息。

3 方法 给定物体的标准照片(全局视图)和一组显微镜特写(局部视图),我们的目标是合成一个吉像素分辨率图像,其大规模图案和材料特征基于特写参考。此过程涉及跨越极端尺度差距(65× – 350×),同时应对高倍率消费级拍摄的实用限制,如浅景深和传感器噪声。

我们的框架 MicroZoom 通过三个阶段解决这一问题:数据集构建、边界感知的逐实例微调以及吉像素推理。

3.1 数据集构建 高倍率显微镜引入了几个在标准摄影中不太相关的独特挑战。为了收集用于训练的高质量真实数据,我们解决了两个问题:传感器噪声和极浅的景深。

3.1.1 焦点堆栈与去噪。我们使用标准智能手机相机捕获单个全视图图像 F,并使用数字显微镜收集 N 张具有局部纹理细节的特写图像 C = C1 … CN。

由于高倍率下的景深极浅,单次捕获无法使具有高度变化的纹理(例如织物编织和皱纹)均匀对焦。

为解决此问题,我们实施了一个焦点堆栈管线。对于每个显微镜视图 Ci,我们在不同的焦距 {𝑧𝑘}𝐾𝑘=1 处捕获一个 K 帧的焦点堆栈。为了减轻传感器噪声,每个焦平面

第 3 页

MicroZoom:极端尺度下的结构保持细节合成 • 3

(a) 数据集构建 (b) 逐实例微调 冻结 XGT M LoRA

“一张细节特写照片……” ③ SAM 拼接 流匹配损失

C1 = Ii … Ik + = 文生图 …

xt m vθ x ② 焦点堆栈 ④ 缩放 s 色彩匹配 H CN = Ii … Ik … … 超分 ControlNet 随机 高分辨率 退化 测试 ① 平均图块 + 分割图 图像 照片 y

(c) 吉像素推理

1 1 1

输出 全图输入(放大)

图 2. 方法概述。(a) 数据集构建:我们通过拍摄全视角智能手机图像和多个高倍率数码显微镜视图来策划合成训练数据。为了解决显微镜下的浅景深问题,我们实施了一个焦点堆栈流程,将多个焦平面融合为单个清晰的真实值 XGT。随后,我们通过下采样和色彩匹配生成对齐的训练对 (XGT, Y),并使用 SAM 计算分割掩码以解析材料边界。(b) 逐实例微调:我们将预生成的生成模型适配到我们的超分辨率任务 [15]。我们使用参数高效的方法进行微调,采用两种主要的条件控制方法:通过 ControlNet 适配器进行结构保持,以及通过通道拼接的分割掩码进行纹理合成。训练遵循条件预热策略,优先学习纹理,然后再进行结构对齐(第 3.3 节)。(c) 吉像素推理:为了生成最终输出,我们依次通过级联模块放大全局输入。我们利用 MultiDiffusion 和可变步长滑动窗口策略,将局部预测聚合为无伪影的吉像素图像。

Ii,zk 由平均 B 张快速连拍原始帧 R 形成:3.1.3 分割掩码。为了解决材料边界处的歧义, 我们使用分割一切模型 (SAM) 为每个显微捕获生成多类分割掩码 M [14]。 1 ∑︁ Ii,zk= R i,zk.(j) (1) 这些掩码以相同的缩放因子 s 下采样以创建 B j=1 MLR,以语义布局(例如“线”与 “纽扣”)对模型进行条件控制。请注意,分割仅应用于多材料情况, 其中存在边界歧义。 然后,我们使用 SIFT 关键点匹配对齐降噪后的堆栈, 并通过拉普拉斯金字塔融合融合对齐后的堆栈,生成 单个全聚焦特写 Ci[3, 21]。我们将结果 显微特写记为 XGT,用于方法部分的其余内容。

3.2 级联逐实例微调 3.1.2 缩放校准与合成退化。为了构建 用于监督逐实例超分辨率的配对数据集,我们仅从显微真实值 XGT 推导训练对。 我们在所有捕获中包含测量工具以估计像素密度 ρ(像素/毫米)。我们推导相对缩放因子 s 为: ρXGT s = (2) ρF 为了确保捕获之间的颜色一致性,我们将 XGT 的颜色 直方图与 F 中相应区域的直方图在 gamma 空间中进行匹配。 然后,我们通过双三次下采样合成低分辨率输入 Y: Y = Downsampling_s(ColorMatch(XGT, F)) (3) 在极端放大倍率下,单阶段上采样模型面临根本性的空间上下文问题:低分辨率输入包含的结构信息极少,以至于模型无法可靠地推断底层材料的大尺度模式规律性。结果是输出可能在局部合理,单个图块看起来具有纹理且清晰,但在全局上不连贯,出现重复结构(如织物编织或表面晶粒),这些结构在画布上会崩溃。 为了解决这个问题,我们采用级联方法,将总缩放因子 s 分解为两个连续阶段 s = s1 × s2。例如,对于 100× 的目标,我们训练两个单独的模型,φ1(粗阶段,例如 20×)和 φ2(细化阶段,例如 5×),并在推理期间依次应用它们。第一阶段在不太极端的上采样问题上运行,其中空间上下文足以

第 4 页

4 • Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Schlizerman, and Steven M. Seitz

恢复大规模图案结构。第二阶段随后在结构已稳固的画布上细化 Syn-LR Ref-LR 局部纹理细节。方法 DISTS ↓LSD ↓ 胜率 ↑ Top-1 ↑ 这种分解引入了已知的权衡:级联创 Qual. Consis. Qual. Consis. 建了依赖链,第一阶段产生的任何结构错误或漂移 ContSR 0.296 1.774 0% 0% 2.05% 2.89% 都会传递到第二阶段。然而,这种累积 IPAdapter 0.324 1.813 0% 0% 0.84% 1.99% 漂移比单阶段方法产生的全局 CoZ 0.297 1.386 0% 0% 2.59% 6.15 % 不连贯图案所造成的故障模式在感知上 UltraZoom 0.232 0.951 23.8% 28.6% 33.99% 36.41% 危害小得多。局部纹理细节的轻微 Ours 0.213 1.014 76.2% 71.4% 60.52% 52.56% 生成偏移对结果感知合理性的破坏性 Table 1. 定量比较。我们将 MicroZoom 与 要小得多。因此,级联是一种刻意的最先进超分辨率方法进行比较。请注意,自动指标 设计选择,以有界的、局部受限的 (DISTS, LSD) 在合成数据集 (Syn-LR) 上评估,以允许 误差换取使吉像素合成 (像素对齐的地面真值比较。相比之下,用户研究指标 在规模上连贯的结构规律性。请参阅补充材料以获取示例 (Object Win Rate 和 Top-1 偏好) 评估从 ,这些示例展示了全局一致性。 真实智能手机拍摄 (Ref-LR) 生成的输出。最佳结果以粗体显示。有关完整的合成 两个模型均按如下所述独立训练。对于 LR 视觉示例,请参阅补充材料。 每个模型,我们构建特定的训练对 (𝑥,𝑦),其中 输入 𝑦 由该模块的特定因子 𝑠1 或 𝑠2 下采样。 由于输入维度限制,我们使用非对称比例。 由于我们使用了固定的 1024 × 1024 地面真值裁剪,下采样 因子大于 5× 会导致输入低于 网络架构所需的最低分辨率。 其中 𝑐 表示文本、分割、 拼接和 ControlNet 特征的聚合条件。

3.2.1 训练策略。我们采用参数高效微调 3.4 吉像素推理 方法,将预生成的模型适应微观 在推理时,我们旨在放大全图 F 。我们首先使用双三次插值将 领域。我们将一个稀有标识符令牌(例如,“sks”)绑定到 F 上采样到目标吉像素分辨率。为了 文本提示 𝑐𝑡𝑥𝑡 中的特定实例 [10, 29]。我们冻结 保持全局一致性并避免网格伪影,我们利用 Mul- 预训练模型的权重,并在注意力机制中注入低秩适应 tiDiffusion 并在局部滑动窗口上执行去噪更新, (LoRA) 层 [11]。 然后将它们聚合回全局画布 [1, 17]。另 我们定义一个均匀采样分布 D 过处理后的外,由于标准滑动窗口在去噪步骤中重复并放大 输入。在每个训练步骤中,我们采样 (𝑥,𝑦,𝑚) ∼D(X𝐺𝑇, Y, M𝐿𝑅), 相同的边界,我们使用 UltraZoom [23] 概述的变步长 其中 𝑥 是高分辨率地面真值补丁的随机 𝐻×𝑊 推理策略。 裁剪,𝑦 和 𝑚 分别是空间对应的低分辨率裁剪 和分割掩码。 4 结果 3.2.2 潜在条件。为了解决结构-纹理权衡 4.1 评估数据 问题,我们引入了两种条件机制。首先,我们利用 我们在包含 21 种日常家用物品的数据集上评估 MicroZoom, ControlNet 来引导基于 𝑦 的全局结构对齐 [47]。对于 范围从有机材料(例如,树叶、水果、蔬菜) 材料定义,我们将独热编码的分割掩码 𝑚 直接拼接到 到合成结构(例如,织物、塑料)。所有示例的结果 模型的噪声潜在 𝑥𝑡 沿通道维度。该输入由零初始化的 可在图 3、6 和 7 以及补充材料中找到。 嵌入层处理,强制流匹配将材料边界 每个物品均按照第 3.1 节概述的过程进行拍摄, 作为硬约束。 resulting in pairs of full-view images (captured on an iPhone 15 Pro 3.3 条件预热与训练目标 Max) 和焦点堆栈显微镜图像(在 48MP 我们使用条件预热来优化此架构,将 数字显微镜上拍摄),比例范围从 65× 到 350×。 结构对齐与纹理合成分开。在预热期间, 4.2 计算成本 我们仅基于拼接的分割图 𝑚 训练 1000 步, 所有模型均在单个 A100 上训练。我们使用 Flux.1-dev 变 禁用 ControlNet 适配器。然后我们启用 ControlNet 换器作为我们的生成骨干 [2]。我们冻结变换器 并再训练 1000 步,这次使用 权重,仅训练 LoRA 适配器(秩 𝑟= 32)。每个训练 完整条件输入 (𝑥,𝑦,𝑚)。 epoch 大约需要 30 分钟,批量大小为 1。我们 训练目标是 Flow Matching 损失。给定数据 使用 Prodigy 优化器,学习率为 1.0。推理时间 点 𝑥∼𝑝𝑑𝑎𝑡𝑎 和噪声 𝑥0 ∼𝑝𝑛𝑜𝑖𝑠𝑒,我们定义概率路径 取决于输入大小和比例因子。例如,一个 300 × 300 𝑥𝑡= (1 −𝑡)𝑥0 + 𝑡𝑥 和目标向量场 𝑢𝑡(𝑥|𝑥1) = 𝑥−𝑥0。目标 像素图像,比例因子为 132.86×,输出大小为 最小化模型预测 𝑣𝜃 与目标向量场之间的预期平方误差: 40000 × 40000,在单个 A100 上耗时约 20 小时。 我们注意到,此成本并非 MicroZoom 所独有。任何在吉像素分辨率下运行的滑动 LFM(𝜃) = E𝑡,𝑥0,𝑥 ||𝑣𝜃(𝑥𝑡,𝑡,𝑐) −(𝑥−𝑥0)||2 窗口扩散方法都会产生 可比的推理时间,因为去噪遍数随 局部窗口数量而扩展。

第 5 页

MicroZoom:极端尺度下的结构保持细节合成 • 5

特写全图输入(双三次插值) ContinuousSR IPAdapter Chain-of-Zoom UltraZoom 本文方法 (参考) (绿色框 = 裁剪区域)

125.03x 衣物 镜头

132.86x 开衫

186.86x

包 托特包

192.98x

树叶

图 3. 定性比较。行按放大倍数从低到高排列。对于每个示例,我们比较了 6000 × 6000 的图像块。从左到右,我们展示了物体的显微镜捕获图像以及高亮显示输入图像块区域的全图。然后,我们比较了低分辨率输入(使用双三次插值上采样)、四个基线方法以及我们的最终结果。这些图像块并未完全对齐,但选自相似区域或包含相似材质。定性而言,我们的方法实现了与示例最一致性和视觉相似性。更多示例请参见图 6 和图 7,或访问我们的项目页面查看全分辨率结果。

4.3 基线方法 我们将 MicroZoom 与四种最先进的超分辨率方法进行比较,这些方法涵盖了前馈和逐实例范式。UltraZoom 是一种基于参考的基线方法,它利用一组稀疏的特写纹理参考来上采样低分辨率输入 [23]。与 MicroZoom 类似,UltraZoom 是一种逐实例优化方法;我们遵循原始协议,并针对每个对象单独对其进行微调。ContinuousSR 是一种任意尺度超分辨率方法,它将图像建模为连续的 2D 高斯场 [26]。与需要重复上采样的渐进式 SR 管道不同,ContinuousSR 无需修改架构即可直接在所需尺度上渲染输出,使其成为极端尺度评估的自然前馈基线。Chain-of-Zoom (CoZ) 是一个级联框架,它使用带有尺度感知提示的自回归方法,通过中间分辨率渐进地上采样图像 [13]。由于 CoZ 需要 512 × 512 的最小输入分辨率,并应用固定的 4× 放大,因此我们填充输入以满足尺寸要求并级联直到超过目标分辨率,然后使用面积插值下采样到正确的最终尺寸。IPAdapter + ControlNet 是一种前馈基线,它通过 IPAdapter 和 ControlNet 对预训练的 Flux.1.dev 模型进行参考图像条件和结构对齐,无需任何逐实例微调 [44, 47]。该基线直接测试具有适当条件的强大预训练模型是否能在零样本情况下执行基于参考的极端尺度 SR,并作为逐实例适应计算成本的比较点。

4.4 评估指标 我们使用两个互补的指标进行评估。DISTS [7] 测量对纹理重采样具有容忍度的感知相似性,使其非常适合生成式 SR,因为输出预期不与真实值像素对齐。我们还报告了对数谱距离 (LSD),这是一种衡量预测与真实值之间频域差异的指标。更多细节见补充材料。

4.4.1 定量比较。表 1 报告了我们的定量指标(DISTS、LSD),这些指标仅在合成低分辨率拆分(syn-LR)上计算,其中低分辨率输入是通过下采样真实显微镜捕获图像获得的,从而为定量比较提供像素对齐的真实值。MicroZoom 取得了最佳的 DISTS 得分 (0.213),优于 UltraZoom (0.232)、Chain-of-Zoom (0.297)、ContinuousSR (0.296) 和 IPAdapter+ControlNet (0.324)。在 LSD 方面,MicroZoom (1.014) 与 UltraZoom (0.951) 相当,而其他所有基线的得分都明显较差。前馈 IPAdapter+ControlNet 基线

第 6 页

6 • Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Schlizerman, and Steven M. Seitz

近距离输入(双三次插值) ① 预训练 ② + 微调 ③ + 级联 ④ + 分割 ⑤ + 条件预热 (参考)模块映射(完整方法)

93.24x 1.00x 魔方 Rubik's

115.09x 1.00x 草莓

图 4. 消融实验。我们可视化了每个模块对最终输出的增量贡献。在预训练的 ControlNet 上进行的朴素超分辨率由于域差异,无法解析出有意义的细节。全量微调使纹理更清晰,但存在结构幻觉和材质渗色问题。添加分割图解决了这些语义冲突,引导纹理间的边界。最后,带有条件预热的级联架构产生了最佳的整体结果,保持了全局结构完整性和局部纹理真实性。

证实了零样本参考条件约束若缺乏针对每个实例的一致性,会导致纹理过度平滑。UltraZoom 与我们共享针对每个实例的策略,在捕捉物体身份方面显著优于通用基线,但暴露了单阶段极端放大的局限性:如果没有 MicroZoom 中引入的级联设计和分割,它在处理多材质物体时会遇到困难,产生纹理错误混合或在画布上全局不一致的区域。

4.4.2 定性比较与用户研究。为了评估超越自动度量的感知质量,我们对 79 名参与者进行了用户偏好研究。与其他度量不同,本研究的刺激材料是使用我们的 ref-LR 管道生成的,其中标准智能手机照片作为低分辨率输入。在每次试验中,参与者会同时显示真实显微镜补丁和来自所有五种方法的模型生成补丁,并根据两个标准选择最佳输出:(1) 整体视觉质量;(2) 在材质外观方面与真实值的 Consistency。我们为每个物体包含一次试验,共 21 次试验,每个标准获得 1,659 票。

如表 1 所示,MicroZoom 是整体最受欢迎的的方法,获得了 60.5% 的质量投票和 52.6% 的相似度投票。按物体评估,MicroZoom 在 21 个物体中的 16 个(76.2%)上质量排名第一,在 15 个(71.4%)上相似度排名第一。与 ContinuousSR、Chain-of-Zoom 和 IPAdapter + ControlNet 相比,MicroZoom 在每个物体上都赢得了两个标准的竞争。最接近的竞争来自 UltraZoom。这些结果反映了跨方法可见的定性失败模式(见图 3)。ContinuousSR 在 4–8× 自然图像尺度上训练,无法泛化到我们数据集中视野狭窄、纹理密集的近距离图像,在极端放大下产生缺乏清晰度和材质特异性的输出。Chain-of-Zoom 的自回归级联放大了每个阶段的幻觉,在没有真实参考锚定的情况下,随着方法通过 4× 步骤级联,误差累积,导致结果逐渐偏离实际物体的外观。

IPAdapter + ControlNet 基线展示了缺乏针对每个实例适应的前馈参考条件约束的局限性:虽然它结合了外观和结构信号,但无法解决这些放大倍数下的极端域差异。

4.5 消融实验。为了验证我们管道的每个组件,我们进行了可视化和定量的消融实验,从预训练基线逐步添加组件到我们的完整方法。表 2 报告了每个定量检查点的 DISTS 和 LSD。分割图消融仅在 11 个多材质物体上评估,因为分割条件约束未应用于单材质情况。其余阶段在所有 21 个物体上评估。

最朴素的基线应用预训练的 SR 模型(Flux.1-dev + ControlNet, 4×)而不进行微调。自然图像与消费级显微镜近距离图像之间的显著域差异导致输出模糊,无法恢复有意义的高频纹理,反映在所有消融阶段中 DISTS (0.330) 和 LSD (2.055) 最差。

针对每个实例的微调(等同于 UltraZoom)产生了管道中最大的单一改进,LSD 从 2.055 降至 0.951,DISTS 从 0.330 改善至 0.232。这再次证实了在这些放大倍数下,针对实例的适应是至关重要的。然而,仅靠微调执行单阶段极端上采样,且没有级联设计,它在保持多材质物体的结构规律性方面遇到困难,导致边界处纹理混合。

添加级联设计相比单尺度生成引入了轻微的 LSD 回归(0.951 → 1.021),同时改善了 DISTS(0.232 → 0.220),表明感知纹理和结构相似性有所提高。

第 7 页

MicroZoom:极端尺度下的结构保持细节合成 • 7

阶段 DISTS ↓ LSD ↓ 5 讨论与未来工作 预训练 ControlNet 0.330 2.055 我们提出了 MicroZoom,这是一个生成式框架,能够将 + 微调 0.232 0.951 标准分辨率照片超分辨率至吉像素分辨率 + 级联模块 0.220 1.021 微观图像。我们的结果表明,在解决困扰极端尺度 + 分割图 0.224 1.076 超分辨率的幻觉和全局结构退化方面具有前景。 + 条件预热 0.213 1.014 几个约束条件指向未来的工作。 表 2. 消融研究。我们分析了管道中附加模块的定量影响。最佳结果以粗体显示。推理延迟与计算成本。我们的推理策略依赖于滑动窗口聚合,这带来了巨大的计算成本。在这些尺度下,单张图像需要在数万个局部图块上进行 28 个去噪步骤。目前,单张吉像素输出在 A100 GPU 上需要数十小时的运行时间。这种延迟限制了可访问性和适用性。未来的研究可以探索蒸馏技术,将流匹配推理减少到单步,从而显著减少推理时间 [22, 31, 32]。或者,可以通过生成一组紧凑的重复纹理基元并检索/平铺它们,而不是独立合成每个图块,以牺牲精度为代价换取速度。

添加分割图(在 11 个多材料物体上评估),为该子集产生了 DISTS (0.224) 和 LSD (1.076)。MicroZoom 的完整管道在整个 21 个物体的评估集中实现了最佳的 DISTS (0.213) 和有竞争力的 LSD (1.014)。

4.6 失败案例 虽然 MicroZoom 实现了高保真超分辨率,但我们观察到特定的局限性和失败案例。参见图 5 的视觉示例。

4.6.1 训练/测试差距。由于我们使用微观捕获来微调模型,但使用智能手机捕获进行推理,因此训练数据和测试数据之间存在域差距(例如,不同的色彩平衡、对比度和曝光度)。尽管我们进行了色彩校准,但这种差异仍可能导致最终输出的色彩偏移,特别是在具有鲜艳、饱和色调的物体(例如,微纤维毛巾)或具有对比色(例如,草莓或蓝色开衫)的物体上。

4.6.2 生成漂移。即使经过微调,管道仍可能表现出生成漂移和语义溢出。尽管我们使用分割图来指导纹理分配,但我们发现 ControlNet 作为主导的条件信号。因此,这种密集的结构指导偶尔会压倒分割线索,导致纹理在即使被明确标记的情况下也会错误地相互渗透。

训练/测试差距 生成漂移

GT 训练-低分辨率 GT 分割图 图像 图像 参考 参考

色彩校正后的 GT GT 下采样 色彩校正后的 GT 分割图

293.76x 测试-低分辨率 293.76x 测试-低分辨率

时间 时间 测试 测试

模型输出 模型输入 模型输出 模型输入

图 5. 失败案例。我们可视化了方法中的两种不同的失败案例。左侧示例展示了即使在色彩校正后仍然存在的训练/测试域差距,这导致了不准确的色彩偏移。右侧示例展示了语义漂移,其中输入图像中模糊的低频信息即使在标记后也会生成错误的纹理。

第 8 页

8 • Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Schlizerman, 和 Steven M. Seitz

参考文献

[1] Omer Bar-Tal, Lior Yariv, Yaron Lipman, 和 Tali Dekel. 2023. MultiDiffusion: 融合扩散路径以实现可控图像生成. arXiv:2302.08113 [cs.CV] https://arxiv.org/abs/2302.08113

[2] Black Forest Labs. 2024. FLUX.1: 一系列流匹配模型. https://blackforestlabs.ai.

[3] Peter J Burt 和 Edward H Adelson. 1983. 拉普拉斯金字塔作为一种紧凑的图像编码. IEEE Transactions on Communications 31, 4 (1983), 532–540.

[4] Jiezhang Cao, Jingyun Liang, Kai Zhang, Yawei Li, Yulun Zhang, Wenguan Wang, 和 Luc Van Gool. 2022. 基于参考图像的超分辨率与可变形注意力 Transformer. arXiv:2207.11938 [cs.CV] https://arxiv.org/abs/2207.11938

[5] Jin Cao, Hong-Xing Yu, 和 Jiajun Wu. 2025. WonderZoom: 多尺度 3D 世界生成. arXiv:2512.09164 [cs.CV] https://arxiv.org/abs/2512.09164

[6] Xiangyu Chen, Xintao Wang, Wenlong Zhang, Xiangtao Kong, Yu Qiao, Jiantao Zhou, 和 Chao Dong. 2025. HAT: 用于图像修复的混合注意力 Transformer. arXiv:2309.05239 [cs.CV] https://arxiv.org/abs/2309.05239

[7] Keyan Ding, Kede Ma, Shiqi Wang, 和 Eero P. Simoncelli. 2020. 图像质量评估:统一结构与纹理相似性. CoRR abs/2004.07728 (2020). https://arxiv.org/abs/2004.07728

[8] Chao Dong, Chen Change Loy, Kaiming He, 和 Xiaoou Tang. 2014. 使用深度卷积网络进行图像超分辨率. arXiv 预印本 arXiv:1501.00092 (2014).

[9] W.T. Freeman, T.R. Jones, 和 E.C. Pasztor. 2002. 基于示例的超分辨率. IEEE Computer Graphics and Applications 22, 2 (2002), 56–65. doi:10.1109/38.988747

[10] Rinon Gal, Yuval Alaluf, Yuval Atzmon, Or Patashnik, Amit H. Bermano, Gal Chechik, 和 Daniel Cohen-Or. 2022. 一张图片胜过千言万语:使用文本反转个性化文本到图像生成. arXiv:2208.01618 [cs.CV] https://arxiv.org/abs/2208.01618

[11] Omer Bar-Tal, Lior Yariv, Yaron Lipman, 和 Tali Dekel. 2023. MultiDiffusion: 融合扩散路径以实现可控图像生成. arXiv:2302.08113 [cs.CV] https://arxiv.org/abs/2302.08113

[12] Black Forest Labs. 2024. FLUX.1: 一系列流匹配模型. https://blackforestlabs.ai.

[13] Peter J Burt 和 Edward H Adelson. 1983. 拉普拉斯金字塔作为一种紧凑的图像编码. IEEE Transactions on Communications 31, 4 (1983), 532–540.

[14] Jiezhang Cao, Jingyun Liang, Kai Zhang, Yawei Li, Yulun Zhang, Wenguan Wang, 和 Luc Van Gool. 2022. 基于参考图像的超分辨率与可变形注意力 Transformer. arXiv:2207.11938 [cs.CV] https://arxiv.org/abs/2207.11938

[15] Jin Cao, Hong-Xing Yu, 和 Jiajun Wu. 2025. WonderZoom: 多尺度 3D 世界生成. arXiv:2512.09164 [cs.CV] https://arxiv.org/abs/2512.09164

[16] Xiangyu Chen, Xintao Wang, Wenlong Zhang, Xiangtao Kong, Yu Qiao, Jiantao Zhou, 和 Chao Dong. 2025. HAT: 用于图像修复的混合注意力 Transformer. arXiv:2309.05239 [cs.CV] https://arxiv.org/abs/2309.05239

[17] Keyan Ding, Kede Ma, Shiqi Wang, 和 Eero P. Simoncelli. 2020. 图像质量评估:统一结构与纹理相似性. CoRR abs/2004.07728 (2020). https://arxiv.org/abs/2004.07728

[18] Chao Dong, Chen Change Loy, Kaiming He, 和 Xiaoou Tang. 2014. 使用深度卷积网络进行图像超分辨率. arXiv 预印本 arXiv:1501.00092 (2014).

[19] W.T. Freeman, T.R. Jones, 和 E.C. Pasztor. 2002. 基于示例的超分辨率. IEEE Computer Graphics and Applications 22, 2 (2002), 56–65. doi:10.1109/38.988747

[20] Rinon Gal, Yuval Alaluf, Yuval Atzmon, Or Patashnik, Amit H. Bermano, Gal Chechik, 和 Daniel Cohen-Or. 2022. 一张图片胜过千言万语:使用文本反转个性化文本到图像生成. arXiv:2208.01618 [cs.CV] https://arxiv.org/abs/2208.01618

[21] Omer Bar-Tal, Lior Yariv, Yaron Lipman, 和 Tali Dekel. 2023. MultiDiffusion: 融合扩散路径以实现可控图像生成. arXiv:2302.08113 [cs.CV] https://arxiv.org/abs/2302.08113

[22] Black Forest Labs. 2024. FLUX.1: 一系列流匹配模型. https://blackforestlabs.ai.

[23] Peter J Burt 和 Edward H Adelson. 1983. 拉普拉斯金字塔作为一种紧凑的图像编码. IEEE Transactions on Communications 31, 4 (1983), 532–540.

[24] Jiezhang Cao, Jingyun Liang, Kai Zhang, Yawei Li, Yulun Zhang, Wenguan Wang, 和 Luc Van Gool. 2022. 基于参考图像的超分辨率与可变形注意力 Transformer. arXiv:2207.11938 [cs.CV] https://arxiv.org/abs/2207.11938

[25] Jin Cao, Hong-Xing Yu, 和 Jiajun Wu. 2025. WonderZoom: 多尺度 3D 世界生成. arXiv:2512.09164 [cs.CV] https://arxiv.org/abs/2512.09164

[26] Xiangyu Chen, Xintao Wang, Wenlong Zhang, Xiangtao Kong, Yu Qiao, Jiantao Zhou, 和 Chao Dong. 2025. HAT: 用于图像修复的混合注意力 Transformer. arXiv:2309.05239 [cs.CV] https://arxiv.org/abs/2309.05239

[27] Keyan Ding, Kede Ma, Shiqi Wang, 和 Eero P. Simoncelli. 2020. 图像质量评估:统一结构与纹理相似性. CoRR abs/2004.07728 (2020). https://arxiv.org/abs/2004.07728

[28] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer. 2022. 使用潜在扩散模型进行高分辨率图像合成. arXiv:2112.10752 [cs.CV] https://arxiv.org/abs/2112.10752

[29] Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Yael Pritch, Michael Rubinstein, 和 Kfir Aberman. 2023. DreamBooth: 微调文本到图像扩散模型以实现以主体驱动的生成. arXiv:2208.12242 [cs.CV] https://arxiv.org/abs/2208.12242

[30] Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J Fleet, 和 Mohammad Norouzi. 2022. 具有深度语言理解的逼真文本到图像扩散模型. arXiv:2205.11487 [cs.CV] https://arxiv.org/abs/2205.11487

[31] Axel Sauer, Dominik Lorenz, Andreas Blattmann, 和 Robin Rombach. 2023. 对抗性扩散蒸馏. arXiv:2311.17042 [cs.CV] https://arxiv.org/abs/2311.17042

[32] Yang Song, Prafulla Dhariwal, Mark Chen, 和 Ilya Sutskever. 2023. 一致性模型. arXiv:2303.01469 [cs.LG] https://arxiv.org/abs/2303.01469

[33] Libin Sun 和 James Hays. 2012. 从互联网规模场景匹配进行超分辨率. 2012 IEEE 国际计算摄影会议 (ICCP) (2012), 1–12. https://api.semanticscholar.org/CorpusID:2311801

[34] Jianyi Wang, Zongsheng Yue, Shangchen Zhou, Kelvin CK Chan, 和 Chen Change Loy. 2023. 利用扩散先验进行真实世界图像超分辨率. arXiv 预印本 arXiv:2305.07015 (2023).

[35] Xiaojuan Wang, Janne Kontkanen, Brian Curless, Steve Seitz, Ira Kemelmacher, Ben Mildenhall, Pratul Srinivasan, Dor Verbin, 和 Aleksander Holynski. 2024. 生成力量十倍. arXiv:2312.02149 [cs.CV] https://arxiv.org/abs/2312.02149

[36] Xintao Wang, Liangbin Xie, Chao Dong, 和 Ying Shan. 2021. Real-ESRGAN: 使用纯合成数据训练真实世界盲超分辨率. 在 ICCV

[11] Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Workshops. Wang, Lu Wang, 和 Weizhu Chen。2021。LoRA:大型语言模型的低秩适应。arXiv:2106.09685 [cs.CL] https://arxiv.org/abs/2106.09685 [12] Yuming Jiang, Kelvin C. K. Chan, Xintao Wang, Chen Change Loy, 和 Zi-wei Liu。2021。基于 C2 匹配的鲁棒参考超分辨率。arXiv:2106.01863 [cs.CV] https://arxiv.org/abs/2106.01863 [13] Bryan Sangwoo Kim, Jeongsol Kim, 和 Jong Chul Ye。2025。Chain-of-Zoom:通过尺度自回归和偏好对齐实现极端超分辨率。arXiv:2505.18600 [cs.CV] https://arxiv.org/abs/2505.18600 [14] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, 和 Ross Girshick。2023。分割一切模型。arXiv:2304.02643 [cs.CV] https://arxiv.org/abs/2304.02643 [15] Black Forest Labs。2024。FLUX。https://github.com/black-forest-labs/flux。 [16] Christian Ledig, Lucas Theis, Ferenc Huszár, 等。2017。使用生成对抗网络进行照片级真实单图像超分辨率。在 CVPR 中。 [17] Yuseung Lee, Kunho Kim, Hyunjin Kim, 和 Minhyuk Sung。2023。SyncDiffusion:通过同步联合扩散实现连贯蒙太奇。arXiv:2306.05178 [cs.CV] https://arxiv.org/abs/2306.05178 [18] Jingyun Liang, Jiezhang Cao, Guolei Sun, Kai Zhang, Luc Van Gool, 和 Radu Timofte。2021。SwinIR:使用 Swin Transformer 进行图像修复。在 ICCV Workshops 中。 [19] Bee Lim, Sanghyun Son, Heewon Kim, Seungjun Nah, 和 Kyoung Mu Lee。2017。用于单图像超分辨率的增强型深度残差网络。在 CVPR Workshops 中。 [20] Xinqi Lin, Jingwen He, Ziyan Chen, 等。2023。DiffBIR:利用生成扩散先验实现盲图像修复。arXiv 预印本 arXiv:2308.15070 (2023)。 [21] David G Lowe。2004。尺度不变关键点的独特图像特征。International Journal of Computer Vision 60, 2 (2004), 91–110。 [37] Xintao Wang, Ke Yu, Chao Dong, 和 Chen Change Loy。2018。通过深度空间特征变换恢复超分辨率图像中的真实纹理。arXiv:1804.02815 [cs.CV] https://arxiv.org/abs/1804.02815 [38] Xintao Wang, Ke Yu, Shixiang Wu, 等。2018。ESRGAN:增强型超分辨率生成对抗网络。在 ECCV Workshops 中。 [39] Zihan Wang, Ziliang Xiong, Hongying Tang, 和 Xiaobing Yuan。2024。面向参考图像超分辨率的细节增强框架。arXiv:2405.00431 [cs.CV] https://arxiv.org/abs/2405.00431 [40] Rongyuan Wu, Tao Yang, Lingchen Sun, Zhengqiang Zhang, Shuai Li, 和 Piotr Lei Zhang。2024。SeeSR:迈向语义感知的真实世界图像超分辨率。arXiv:2311.16518 [cs.CV] https://arxiv.org/abs/2311.16518 [41] Jiahua Xiao, Jiawei Zhang, Dongqing Zou, Xiaodan Zhang, Jimmy Ren, 和 Xing Wei。2024。基于扩散的真实世界超分辨率的语义分割先验。arXiv:2412.02960 [cs.CV] https://arxiv.org/abs/2412.02960 [42] Fuzhi Yang, Huan Yang, Jianlong Fu, Hongtao Lu, 和 Baining Guo。2020。学习用于图像超分辨率的纹理 Transformer 网络。arXiv:2006.04139 [cs.CV] https://arxiv.org/abs/2006.04139 [43] Tao Yang, Rongyuan Wu, Peiran Ren, Xuansong Xie, 和 Lei Zhang。2024。像素感知 Stable Diffusion 用于真实图像超分辨率和个性化风格化。arXiv:2308.14469 [cs.CV] https://arxiv.org/abs/2308.14469 [44] Hu Ye, Jun Zhang, Sibo Liu, Xiao Han, 和 Wei Yang。2023。IP-Adapter:面向文本到图像扩散模型的文本兼容图像提示适配器。(2023)。 [45] Kai Zhang, Jingyun Liang, Luc Van Gool, 和 Radu Timofte。2021。设计用于深度盲图像超分辨率的实用退化模型。arXiv:2103.14006 [eess.IV] https://arxiv.org/abs/2103.14006 [46] Lin Zhang, Xin Li, Dongliang He, Errui Ding, 和 Zhaoxiang Zhang。2023。LMR:面向参考超分辨率的大规模多参考数据集。arXiv:2303.04970 [cs.CV] https://arxiv.org/abs/2303.04970

[22] Simian Luo, Yiqin Tan, Longbo Huang, Jian Li, 和 Hang Zhao。2023。潜在一致性模型:通过少步推理合成高分辨率图像。arXiv:2310.04378 [cs.CV] https://arxiv.org/abs/2310.04378 [23] Jingwei Ma, Vivek Jayaram, Brian Curless, Ira Kemelmacher-Shlizerman, 和 Steven M. Seitz。2025。UltraZoom:从普通照片生成吉像素图像。arXiv:2506.13756 [cs.CV] https://arxiv.org/abs/2506.13756 [24] Taesung Park, Ming-Yu Liu, Ting-Chun Wang, 和 Jun-Yan Zhu。2019。具有空间自适应归一化的语义图像合成。arXiv:1903.07291 [cs.CV] https://arxiv.org/abs/1903.07291 [25] William Peebles 和 Saining Xie。2023。基于 Transformer 的可扩展扩散模型。arXiv:2212.09748 [cs.CV] https://arxiv.org/abs/2212.09748 [26] Long Peng, Anran Wu, Wenbo Li, Peizhe Xia, Xueyuan Dai, Xinjie Zhang, Xin Di, Haoze Sun, Renjing Pei, Yang Wang, Yang Cao, 和 Zheng-Jun Zha。2025。像素到高斯:基于 2D 高斯建模的超快连续超分辨率。arXiv:2503.06617 [cs.CV] https://arxiv.org/abs/2503.06617 [27] Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, 和 Mark Chen。2023。通过更好的描述改进图像生成。arXiv 预印本 arXiv:2309.16609 (2023)。 [47] Lvmin Zhang, Anyi Rao, 和 Maneesh Agrawala。2023。向文本到图像扩散模型添加条件控制。arXiv:2302.05543 [cs.CV] https://arxiv.org/abs/2302.05543 [48] Zhifei Zhang, Zhaowen Wang, Zhe Lin, 和 Hairong Qi。2019。通过神经纹理传输进行图像超分辨率。arXiv:1903.00834 [cs.CV] https://arxiv.org/abs/1903.00834

第 9 页

MicroZoom:极端尺度下的结构保持细节合成 • 9

特写 全图输入 (双三次插值) ContinuousSR IPAdapter Chain-of-Zoom UltraZoom 本文方法 (参考) (绿色框 = 裁剪区域)

72.50x

抓绒

77.66x 西兰花

81.00x

面包

91.27x 蘑菇

102.24x

毛绒

109.95x

番茄

115.09x 草莓

182.04x 开衫 灰色

图 6. 更多多材质示例。我们展示了 8 个具有多种材质的物体示例,证明了 MicroZoom 能够为具有不同纹理和边界的场景合成合理的细节。更多结果请参阅我们的项目页面。

第 10 页

10 • Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Schlizerman, and Steven M. Seitz

近距离全图输入 (双三次插值) ContinuousSR IPAdapter Chain-of-Zoom UltraZoom 本文方法 (参考) (绿色框 = 裁剪区域)

67.60x

89.58x

橙子

113.82x 钱包 皮革

128.89x

奶酪

142.83x

梨 亚洲梨

183.38x

大米

203.76x 毛巾 超细纤维

347.11x 衬衫 运动衫

图 7. 其他单一材质示例。我们展示了 8 个具有单一材质的物体示例,证明了 MicroZoom 能够为包含单一图案类型的物体合成合理的纹理。更多结果请参阅我们的项目页面。

第 11 页

MicroZoom:极端尺度下的结构保持细节合成 • 11

补充材料

S-1 对数谱距离 参考图像 生成图像

为了定量评估我们方法合成的高频纹理细节的保真度,我们采用对数谱(LSD)指标。LSD 测量真实图像与重建图像频率谱之间的距离,直接捕捉频域中的差异。它定义为对数功率谱差异的均方根:

LSD(x, ˆx) = √(1/K ∑_{k=1}^K (log P̄_x(k) − log P̄_ˆx(k))^2). (4)

图 8. 一致性合成。我们从单个超分辨率输出的不同位置采样了多个不同的裁剪区域。我们的方法在整个图像中一致地生成合理的结构,证明了其在各个区域上的鲁棒性能。

S-2 一致性合成

为了评估我们方法的空间可靠性,我们检查了从单个超分辨率输出中采样的多个不同裁剪区域,如图 8 所示。我们的方法成功保持了结构连贯性,并在同一图像的不同区域生成了合理且均匀的高频细节。

对于更多示例以及对空间一致性的连续检查(超出孤立裁剪区域),请交互体验我们的全分辨率演示。

S-3 合成低分辨率示例

在本节中,我们展示了使用合成低分辨率(Syn-LR)输入生成的完整结果集,这些输入用于表 1 中的定量比较。图 9 展示了包含多种材料的所有示例,而图 10 提供了单材料物体的完整结果集。

第 12 页

12 • Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Schlizerman, and Steven M. Seitz

近距离全图输入(双三次插值) ContinuousSR IPAdapter Chain-of-Zoom UltraZoom 本文方法 (参考)(绿色框 = 裁剪区域)

72.50x

抓绒面料

77.66x 西兰花

81.00x

面包

91.27x 蘑菇

102.24x

毛绒玩具

109.95x

番茄

115.09x 草莓

132.86x 开衫

182.04x 开衫 灰色

186.86x

手提包

图 9. Syn-LR 多材质示例。针对包含多种材质的物体,从合成低分辨率输入生成的完整定性示例,对应表 1 中的定量评估。

第 13 页

MicroZoom:极端尺度下的结构保持细节合成 • 13

微距全图输入 (双三次插值) ContinuousSR IPAdapter Chain-of-Zoom UltraZoom 本文方法 (参考) (绿色框 = 裁剪区域)

67.60x

89.58x

橙子

113.82x 钱包 皮革

125.03x 布料 镜头

128.89x

奶酪

142.83x

梨 亚洲梨

183.38x

大米

192.98x

树叶

203.76x 毛巾 超细纤维

347.11x 衬衫 运动服

图 10. Syn-LR 单一材质示例。针对包含单一材质的物体,从合成低分辨率输入生成的完整定性示例,对应表 1 中的定量评估。

发表评论