AppearancePointers:DiT多模态区域控制新范式

三分钟导读:本文提出了一种名为AppearancePointers的轻量级模块,通过生成紧凑的指针令牌将文本和图像条件与空间掩码对齐,从而在单个去噪步骤中实现扩散变换器(DiT)的精确多模态区域感知图像生成。

英文题目:Appearance Pointers: Multimodal Region Control of Diffusion Transformers

论文出处:arXiv 每日论文精选 · arXiv:2607.19344

原始论文:PDF / 论文页面

对应视频标题:AppearancePointers:DiT多模态区域控制新范式|推荐指数:★★★★★

这篇论文解决什么问题?

现有的扩散模型难以通过文本提示实现精确的区域控制(如材料、物体身份和空间布局),且现有方法通常仅支持单一模态或需要迭代处理,缺乏统一的多模态区域控制机制。

核心创新

  • 提出Appearance Pointers机制,实现模态无关的区域控制,无需从头重新训练基础模型。
  • 设计Region Aggregation Transformer,在保持空间结构的同时压缩多区域信息,显著降低计算复杂度。
  • 支持在单次去噪过程中同时处理文本、图像和材料等多种异构条件。
  • 构建了包含37K样本的合成数据集AppearancePointers-37K,涵盖区域文本描述和外观图像。

方法概览

引入Region Correspondence Network将文本/图像提示与空间掩码融合,生成Appearance Pointers(外观指针);通过Region Aggregation Transformer将多区域信息压缩为紧凑令牌,并注入到FLUX DiT模型中,同时结合Region Contour Guidance提升边界精度。

逐图理解论文

核心方法

核心方法
Fig. 2: Overview of AppearancePointers. Our framework converts heterogeneous inputs (text, images, and spatial masks) into appearance pointers (yellow). After en- coding via FLUX VAE and T5 text encoder, multimodal signals from image (IPi) and text (T Pi), are fused with their spatial masks (Ri) to form Appearance Pointers (IAP, T AP), dictating exactly which features map to specific regions. During sampling, the diffusion transformer receives noisy tokens, text/image tokens, and the appearance pointers as joint inputs to then synthesize a coherent and spatially aligned output that respects all region-specific instructions across modalities. See Sec. 3 for more details.

AppearancePointers引入Region Correspondence Network,将文本或图像提示与空间掩码融合,生成紧凑的指针令牌。这些令牌引导FLUX DiT在去噪过程中将外观线索路由到正确的空间位置。

架构创新

架构创新
Fig. 4: Appearance pointers generation. The Re- gion Aggregation Transformer creates a concise repre- sentation of regional conditions, Appearance Pointers.

Region Aggregation Transformer将多区域信息压缩为紧凑令牌,显著降低计算复杂度。结合Region Contour Guidance,模型在保持空间结构的同时提升边界精度,实现模态无关的区域控制。

数据集构建

数据集构建
Fig. 5: Overview of the dataset creation pipeline. (I) We generate diverse scenes by sam- pling objects of varying scales and prompting an LLM to produce scene- and object-level descrip- tions. (II) Images are synthesized using Flux.1 Dev and grounded with Grounded SAM. (III) For each object, we produce pose and material edits and filter them using a VLM.

作者构建了AppearancePointers-37K合成数据集,涵盖区域文本描述和外观图像。通过LLM生成场景描述,Flux.1 Dev合成图像,并使用Grounded SAM进行接地,确保数据多样性。

文本条件生成

文本条件生成
Table 2: Quantitative comparison on AppearancePointers-37K (textual region descrip- tions). Best result in gold, second best in silver. Higher is better for all metrics.

在文本条件生成任务中,AppearancePointers在CLIP-I、DINO-I和CLIP-IQA指标上均优于Seg2Any、DreamRenderer和InstanceDiffusion。模型展现出更强的区域保真度和语义对齐能力。

图像条件生成

图像条件生成
Table 3: Quantitative comparison on AppearancePointers-37K (image region descrip- tions). Best results in gold.

对于图像条件生成,模型在CLIP-I和DINO-I上表现优异,MIoU达到40.97。相比MS-Diffusion,AppearancePointers能更准确地保持物体身份和空间放置,减少外观改变。

实验与关键结果

  • 在AppearancePointers-37K数据集上进行文本和图像条件生成的定量与定性评估。
  • 与MS-Diffusion, DreamRenderer, Seg2Any, InstanceDiffusion等基线模型进行对比。
  • 在SACap-eval真实世界数据集上进行零样本和微调评估。
  • 多主体插入任务中与Iterative InsertAnything进行对比。
  • 进行消融实验以验证各组件(如聚合、掩码、轮廓引导)的有效性。
  • 文本条件生成:CLIP-I 90.40, DINO-I 56.09, CLIP-IQA 95.02 (Table 2, p13)(第 13 页)
  • 图像条件生成:CLIP-I 93.29, DINO-I 69.31, MIoU 40.97 (Table 3, p13)(第 13 页)
  • 多主体插入:CLIP-I 94.52, MIoU 45.44, CLIP-IQA 95.47 (Table 5, p19)(第 19 页)
  • SACap-eval零样本:在美学和图像文本一致性上表现具有竞争力 (Table 9, p28)(第 28 页)

阅读时需要注意

  • 在区域数量较多(如10个以上)时,区域遵循能力和图像质量会下降 (p14, p20)。
  • 偶尔忽略较细的区域,且无法完美保留人脸等细粒度细节 (p14)。
  • 模型在粗粒度掩码(如BBox)下仍能保持身份一致性,但MIoU会有所下降 (Table 8, p20)。
  • 训练数据完全来自合成数据,但在真实世界数据集上表现良好 (p28)。

关联工作

  • MS-Diffusion:基线模型,用于图像条件区域生成对比(第 13 页)
  • DreamRenderer:基线模型,支持文本和深度条件,用于对比区域遵循和身份保持(第 13 页)
  • Seg2Any:基线模型,基于Flux,仅支持文本条件,用于对比区域生成(第 13 页)
  • InsertAnything:基线模型,用于多主体插入任务的迭代对比(第 18 页)
  • InstanceDiffusion:基线模型,用于文本条件区域生成对比(第 13 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

外观指针 扩散变换器的多模态区域控制

Rahul Sajnani1,2 Yulia Gryaditskaya2 Radomir Mech2 Srinath Sridhar1 Matheus Gadelha2 1布朗大学 2Adobe Research ivl.cs.brown.edu/research/appearance_pointers

1 4 1 2 5 2 2026 3 5

BG Prompt: Jul Cinematic Lighting 3 Deck….. illuminates Ship (a) 生成(具有精细且稀疏的控制) (b) 插入/编辑 4 1 A small, plump chicken painted in shades of brown and a deep, matte black. 5 1 A boxy van … painted in white…. 2 A sleek … modern car A retro-style arcade machine….. with a smooth, aerodynamic body 3 3 BG prompt: In classroom… 3 4 5 3 4 1[cs.CV] 2 1 4

(c) 姿态控制 (d) 多模态区域控制 1 insert an engineer with the material properties….. 3 1 1 insert a sunglass with the material properties…. 4 “A tall, cylindrical soap dispenser made of … 1 2 1

3 4 “… on a red sofa “… walking in a park…” In a living room”

图 1:外观指针能够在单次去噪过程中实现精确的、多模态的、感知区域的图像生成。给定空间掩码和异构的条件信号——参考图像或文本描述——我们的区域对应网络生成紧凑的指针令牌,将扩散变换器(Diffusion Transformers (DiTs))引导至适当空间位置处的正确外观线索。我们的工作支持:(a) 从精细或稀疏的区域布局进行生成;(b) 具有材质和风格保真度的对象插入;(c) 姿态条件生成;以及 (d) 同时的多模态区域控制,在单个场景中结合基于图像和基于文本的描述。

第 2 页

2 R. Sajnani 等

摘要。可控图像生成对于创意专业人士来说仍然具有挑战性,他们通常需要对材质、物体身份和空间布局进行精确的区域控制,而这些仅通过文本提示无法可靠实现。扩散变换器(Diffusion Transformers, DiTs)可以原生地处理源自文本和图像的异构令牌,但它们缺乏确定这些令牌应在何处以及如何影响输出的机制。我们引入了外观指针(Appearance Pointers),这是一种紧凑的令牌,通过将文本或图像输入与用户指定的掩码对齐,引导 DiTs 在正确的空间位置获取正确的外观线索。外观指针由区域对应网络(Region Correspondence Network)生成,并通过空间聚合机制进行细化,使模型能够在不显著增加令牌负载的情况下处理多个区域描述。我们的方法引入了首个在 DiT 中实现局部多模态控制的模态无关接口,且无需从头重新训练基础模型。在各种指标上,我们的单一模型达到或超越了特定模态的最先进方法性能,为实现生成式图像合成中精确、感知区域的多模态引导提供了一条简单且可扩展的路径。

1 引言

生成建模的最新进展极大地扩展了机器生成图像的创意可能性。艺术家、设计师和电影制作人现在只需提供文本描述,即可合成逼真且多样的场景。然而,尽管具有强大的表达能力,当前系统在实践中的可控性仍然较差。创意专业人士通常具有特定的视觉意图——定义预期结果的精确材质、物体布局和风格细节。相比之下,文本提示仅提供间接且往往不可预测的控制,需要大量的试错才能达到预期的构图。这种人类意图与模型可控性之间的差距限制了生成模型在现实世界创意流程中的整合。 扩散变换器(Diffusion Transformers, DiTs)——如今已成为许多最先进图像生成器的核心——为实现更丰富的可控性提供了一条有吸引力的路径,因为它们可以原生地处理异构令牌流,包括文本嵌入和图像令牌。然而,它们缺乏确定这些特定模态的令牌应在何处以及如何影响生成图像的机制。简单地提供更多文本或图像令牌并不能传达用户的空间意图,也无法指定应在哪些区域使用哪些外观线索。因此,通过文本或参考图像表达的结构性和本地化用户意图,难以转化为感知区域的控制。 现有的可控生成方法试图通过注意力操作 [62,68,69]、专用适配器 [14,23,29,30,33,63,65]、噪声初始化策略 [26, 27, 41] 或推理期间的基于梯度的引导 [5,9,23,34,41,53,54,64] 来解决这一问题。大多数现有工作都是为基于 U-Net 的旧版扩散模型开发的,并采用推理时的方法,这些

第 3 页

外观指针 3

往往速度缓慢且缺乏鲁棒性。此外,大多数方法仅限于单一条件模态(例如仅文本或仅图像),无法无缝融合异质线索 [37, 62]。即使采用了最新的 DiT 骨干网络,这些局限性也限制了扩散模型在需要多模态和空间接地控制的任务中的实际应用。

考虑右侧的图像,其中参考图像被输入到左侧列所示图像的生成过程中。参考图像上的黄色/绿色叠加层对应于生成图像中被探测令牌(probe tokens)注意到的令牌——由黄色/绿色星号表示。顶行展示我们的方法,而底行展示了一个简单的基线方法,该方法仅在生成过程中将参考图像令牌传递给 DiT。由于一种新的令牌类型——外观指针(Appearance Pointers),我们的方法能够关注相应的区域。它们是紧凑的令牌,旨在被 DiT 直接吸收,以引导模型在用户提供的正确空间位置处使用正确的外观线索。外观指针由一个小型区域对应网络生成,该网络将文本或参考图像与其关联的空间掩码融合(参见上图左上角的小彩色区域)。外观指针并不直接存储外观,而是告诉 DiT 在哪里使用用户提供的原始图像和文本令牌。这种机制在保持 DiT 架构灵活性的同时,为局部多模态引导添加了一个轻量级且模块化的接口。我们还精心设计了一种空间聚合机制,该机制融合来自多个区域的外观信息,允许 DiT 在单个去噪过程中同时处理来自图像或文本的多个区域描述。尽管设计简单,但外观指针的模块化设计使其能够有效地应用于各种工作流程——见图 1 的插图以及表 1 中与最先进方法相比的模型能力。更关键的是,它将模型的能力扩展到同时使用图像和文本对特定区域进行条件控制,从而实现了图 1 (d) 中所示的材料和文本条件生成等新应用。

为了训练和评估该模型,我们创建了一个合成数据集,其中包含同一图像内多个元素的图像和文本描述。当仅通过文本描述区域时,我们的方法在所有六项指标中表现最佳或第二佳。当使用图像进行区域描述时,我们的方法在区域遵循性和身份保持方面超越了 MSDiffusion [49] 和 DreamRenderer [68]。除了这些定量增益外,外观指针为实现精确、多模态、区域感知的生成建模控制提供了一条简单且可扩展的路径,使用户能够指定不仅应该出现什么

第 4 页

4 R. Sajnani 等

区域控制 方法 图像 文本 插入 生成 多模态 精细 稀疏

InsertAnything [40] ✓ × ✓ ✓ ✓ × × MS-Diffusion [49] ✓ × × ✓ × ✓ × Sigma-Gen [37] ✓ × ✓ ✓ × ✓ × DreamRenderer [68] ✓ ✓ × ✓ × ✓ × InstanceDiffusion [50] × ✓ ✓ ✓ × ✓ × Seg2Any [62] × ✓ ✓ × × ✓ × 本文方法 ✓ ✓ ✓ ✓ ✓ ✓ ✓

表 1:区域条件生成方法在关键能力上的比较。图像和文本表示支持的区域外观描述模态。插入表示将对象放置到现有场景中的能力,生成表示从区域描述进行全图像合成,多模态表示方法是否能在单次生成过程中对同一区域同时使用图像和文本描述。这实现了如图 2 所示的材料分配示例等新颖用例。与所有先前工作不同,AppearancePointers 同时支持所有能力,从而在统一框架中实现灵活且基于空间的多模态控制。

图像,但它们应在何处以及如何实现。总之,我们的主要贡献如下:

– 我们引入了 AppearancePointers,这是一种紧凑表示,用于将扩散变换器路由到以图像、文本和掩码形式呈现的适当区域信号。 – 我们的模块化且灵活的方法扩展到多种编辑能力,包括:(a) 区域控制生成,(b) 插入,(c) 姿态控制,以及 (d) 在单次去噪过程中对多个区域进行多模态区域控制生成。 – 我们还提出了一个数据集 AppearancePointers-37K,其中包含区域文本描述、来自新视角的外观图像,以及一种用于生成更多数据的自动生成方案。

2 相关工作

关于多模态可控扩散模型的详细讨论,请参阅最近的综述 [4, 15, 39, 46, 58, 60]。早期方法基于分割图操作,采用专用架构 [12, 31, 48] 或通用条件框架 [23, 29, 30, 33, 63, 65],其中一些扩展到了边界框布局 [20,57]。在基于局部文本/图像条件的图像生成方面,存在几种相关能力。我们在开发 AppearancePointers 时的主要目标之一是使同一框架能够支持多种工作流程,而无需依赖庞大且复杂的架构。AppearancePointers 所支持功能的总结以及与最先进方法的比较见表 1。下面我们将讨论关于图像合成中基于区域控制的先前文献。

第 5 页

外观指针 5

边界框。早期工作探索了使用物体名称 [25, 54] 或描述性提示 [14, 38] 进行边界框引导的文生图生成,通常结合全局场景级提示 [14, 19, 38, 53, 54, 64],尽管这些方法缺乏精确的形状可控性。免训练方法通过噪声初始化 [26,27,41]、交叉注意力操作 [1,5,25,42,68] 以及有时使用自注意力 [22,68,69] 在推理时引入空间或语义引导。Taghipour 等人 [42] 使用 KL 散度以增强属性与区域的关联。另一种策略独立估计特定于物体的噪声,并通过交叉注意力融合它们 [38]。几种方法应用基于梯度的引导,针对交叉注意力对齐 [5,41,54]、交叉注意力和自注意力的一致性 [64],或结合边界感知损失的对齐 [53]。基于训练的方法引入轻量级模块以微调骨干网络。GLIGEN [19] 注入由定位令牌条件化的门控自注意力层。SSMG [14] 使用类似 ControlNet 的分支编码空间和语义特征,并通过注意力建模物体间关系。LayoutDiffusion [66] 提出了一种布局编码和融合模块,在端到端扩散框架中进行交叉注意力对齐。几项工作也针对自回归生成 [10, 67]。虽然我们的方法支持粗略区域(如边界框),同时也具备遵循精确区域的能力。此外,它可以同时应用于图像生成和编辑工作流。

语义布局。许多免训练方法操作交叉注意力以加强概念在区域内的影响力 [13, 16],并可选择性地限制跨片段的自注意力 [16]。基于梯度的引导通过文本-潜在交叉注意力对齐 [9,23,34] 以及有时使用自注意力 [34]、投影到潜在空间中的图像空间损失 [2],或轻量级对齐器模块 [21] 来更新潜在变量。一种方法 [35] 在早期去噪步骤中独立生成物体,然后再进行合并,而 MultiDiffusion [3] 则在每个噪声步骤优化图像以实现全局一致性。基于训练的方法整合注意力操作以微调基础模型 [51,55,61],或通过卷积层注入文本和掩码条件化特征 [59]。最相关的工作是 Seg2Any [62],它在 Flux 的基础上构建,在训练期间进行注意力限制并使用区域轮廓图以提高边界精度,但不支持图像参考。相比之下,Appearance Pointers 在同一框架内统一了文本和图像的区域条件化,允许在单次去噪过程中跨区域组合异构的外观线索。

参考图像引导。关于外观转移的全面概述,请参阅 [52]。DreamRenderer [68] 专注于基于文本的区域控制,并通过 Redux [17] 将参考图像编码为文本嵌入。AnyDoor [7] 使用通过交叉注意力注入的 DINOv2 [32] 特征,并结合用于掩码和结构的 ControlNet [63] 风格条件化。MimicBrush [6] 采用双 U-Net 架构,将参考注意力键和值注入到模仿 U-Net 中。Insert Anything [40] 基于 Flux,结合参考图像、目标区域和文本条件化;Ace++ [24] 使用逐通道拼接,但其性能不及 [40]。与我们的工作不同,这些方法一次仅支持单个区域,而 Appearance Pointers 生成多个区域(

第 6 页

6 R. Sajnani 等

图像 区域 文本 提示 (IPi) 提示 (Ri) 生成的图像 (TPi) 提示

∅ IP1 TP1 R̂P1 (第 3.1 节) 🔥 外观 放置一张书桌 指针 具有材质 属性 作为 IP2 TP2 R̂P2 所示 图像 区域轮廓

∅ 积雪覆盖的地面… IP3 TP3 R̂P3

生成 令牌 (xt) xt xt GP IP3 TP3 IP2 TP2 IP1 TP1 E IAP TAP (第 3.2 节) FLUX 变换器扩散模型 一个积雪 村庄 …. 全局 雪 提示 (GP ) 覆盖 山丘 GP LoRA🔥 和树木。

图 2: 外观指针 (Appearance Pointers) 概述。我们的框架将异构输入(文本、图像和空间掩码)转换为外观指针(黄色)。经过 FLUX VAE 和 T5 文本编码器编码后,来自图像 (IPi) 和文本 (T Pi) 的多模态信号与其空间掩码 (Ri) 融合,形成外观指针 (IAP, TAP),精确指示哪些特征映射到特定区域。在采样过程中,扩散变换器接收噪声令牌、文本/图像令牌以及外观指针作为联合输入,从而合成连贯且空间对齐的输出,尊重所有跨模态的区域特定指令。更多细节见第 3 节。

由图像或文本描述)在单次扩散过程中完成。此外,虽然这些方法在全局范围内纠缠条件信号或按顺序处理区域,但 Appearance Pointers 通过外观指针令牌将每个外观线索路由到其正确的空间位置,从而实现精确且模块化的多模态控制,且无需架构冗余。

3 方法

预备知识。最近最先进的图像生成模型 [11,17,18] 主要基于变换器架构,通过全自注意力联合处理文本和视觉信息。这些模型在两种输入模态上运行:文本流,用于编码提示描述;视觉流,用于编码条件图像和生成令牌。常见的架构设计涉及使用双变换器方案,其中文本和图像令牌首先由特定模态的投影层处理,然后通过全自注意力进行融合。双变换器块促进文本和视觉表示之间的对齐,随后一系列单变换器块执行统一的多模态处理。 概述。我们的方法生成满足全局和区域条件的图像 I ∈RH×W×3。全局条件以文本提示的形式提供,而区域条件定义为一组 n 对 R = {(Ri, Pi)}ni=1。这里,每个 Ri ∈{0, 1}H×W 表示一个区域掩码,Pi 表示相应的局部提示,它可以由来自文本描述的令牌、参考图像或两者组成。该模型的任务是生成一个图像

第 7 页

外观指针 7

其中,对应于区域 $R_i$ 的部分遵循内容 $P_i$,而图像的其余部分则与全局文本提示对齐(见图 2)。

虽然原始的 DiTs 具备接收图像或文本令牌的能力,但简单地传递额外的令牌化信息不足以让模型了解最终图像中元素的位置和构成。为此,我们引入了一种新的输入令牌类型,负责告知 DiT 在生成过程中应如何使用局部化的文本和图像信息及其位置。我们将这些令牌称为外观指针(Appearance Pointers)。它们的作用是确保区域($R_i$)与提示($P_i$)之间的正确链接。在实践中,如图 2 所示,外观指针作为 DiT 模型的条件输入,与全局信息和区域特定信息一起使用——局部图像提示和局部文本提示补充了我们的外观指针,以提供细粒度的外观细节,而区域轮廓图则促进了与区域边界的细粒度对齐。

3.1 外观指针

我们首先描述如何构建外观指针。为了符合我们的目标,良好的区域表示 $R$ 应能在实现多模态控制的同时,明确地将局部提示 $P_i$ 链接到目标区域 $R_i$。为了实现这一点,我们设计了一个区域对应变换器(Region Correspondence Transformer),它将所有模态联合链接和处理,然后再将其传递给 DiT 生成模型。我们首先描述每个区域 $R_i$ 及其对应的提示 $P_i$ 是如何编码的,然后解释这些表示如何对齐以形成外观指针。

区域与条件编码。每个区域信息 $(R_i, P_i)$ 由一个二值掩码 $R_i$ 和一个局部提示 $P_i$ 组成,提示可以是文本、图像或两者兼有。图像提示通过 VAE 图像编码器进行编码,提供图像令牌 $^I\mathcal{P}_i$,而文本提示则通过 Flux Kontext T5 编码器 [18] 进行编码,提供文本令牌 $^T\mathcal{P}_i$。为了对掩码本身进行编码,我们将其作为图像输入到相同的 VAE 编码器中。在编码之前,我们通过添加坐标信息来增强二值掩码,以提供明确的空间定位。更多细节请参见补充材料。增强坐标后的掩码 $M_i$ 随后以与图像提示相同的方式进行编码和分块(patchified),从而产生具有明确空间上下文的掩码令牌。

区域-提示链接。在对掩码、图像和文本进行编码并映射到 DiT 潜在空间后,我们的下一步目标是将掩码与其各自的条件令牌链接起来。这种链接使 DiTs 能够指向所需条件信号,并有助于生成区域条件图像(参见第 1 节中的指针注意力可视化)。为了将空间约束与语义内容相结合,我们引入了一个区域对应变换器 $\Phi_{RC}$,用于处理来自掩码 $^R\mathcal{P}_i$、图像 $^I\mathcal{P}_i$ 和文本 $^T\mathcal{P}_i$ 提示的令牌,为每个区域 $i$ 生成两个语义特征图 $^I\mathcal{M}_i$ 和 $^T\mathcal{M}_i$:

$$ ^I\mathcal{M}_i, \; ^T\mathcal{M}_i := \mathbf{\Phi}_{RC}([\,^R\mathcal{P}_i, \; ^I\mathcal{P}_i, \; ^T\mathcal{P}_i]) \quad (1) $$

第 8 页

8 R. Sajnani et al.

Region Correspondence (ΦK ) VAE IPi Encoder IMi

Mask 🔥 Transformer Image 🔥 R̂Pi EncoderVAE CorrespondenceTransformer Mask 🔥 Transformer Text A vintage- inspired air T5 Section 3.1: Appearance Pointer TPi conditioner a brushed with Encoder (Region-Prompt Linking) TMi copper finish,

图 3:区域-提示链接(Region-Prompt Linking)。为了充分利用 DiT 生成骨干网络的多模态条件机制,我们生成一组特征图,分别针对骨干 DiT 模型图像流和文本流。请注意,可以省略图像或文本提示中的任一种,但我们始终会生成针对 DiT 模型两个条件流的特征图。详细信息请参阅第 3.1 节。

这些地图作为模块化的语义区域表示,用于引导区域条件图像生成。具体而言,IMi 和 T Mi 分别针对骨干 DiT 模型的图像和文本流,从而充分利用其多模态条件机制。

在 ΦRC 内部,区域令牌通过两个轻量级掩码变换器(2 层自注意力)块进行初始对齐,将掩码与相应的图像和文本条件对齐。为了提高效率,该掩码变换器还经历了类似于 U-DiT [44] 的令牌下采样(见图 3)。处理后的掩码令牌、图像令牌和文本令牌沿序列维度拼接,并输入到具有自注意力块的多模态对应变换器中(与 Flux MM-DiT 注意力一致)。这些注意力块为每种令牌类型使用独立的查询、键和值投影。在实际应用中,我们还传递可学习令牌以处理缺失的模态,允许该模块灵活地在图像+掩码、文本+掩码或图像+文本+掩码输入上运行。关键在于,ΦRC 独立处理每个区域,且与扩散步数无关。这使得我们只需在每次生成过程中运行一次区域对应计算,显著降低了开销。此外,这种设计允许推理过程中区域数量动态变化。

区域聚合。 可学习令牌 KK == TI forfor ImageText PointerPointer KM1With the regions linked to their corresponding con- ditions we can condition Region KM2 Aggregation (ΦK)the diffusion transformer to generate region con- KAP trolled images. However, KM3 Section 3.1: Appearance Pointer (Region Aggregation) naively injecting all re- gion tokens along with 图 4:外观指针生成。区域聚合变换器创建区域条件的简洁表示,即外观指针(Appearance Pointers)。 及其条件令牌会增加令牌数量

第 9 页

外观指针 9

大幅降低,且对于自注意力机制而言,具有 $O(N^2)$ 复杂度的方法是不可行的。因此,我们通过区域聚合变换器(Region Aggregation Transformer)整合跨区域的信息,将其合并到单个画布上,从而生成外观指针(Appearance Pointers)(见图 4)。

为了保留空间结构,我们在每个补丁(patch)位置局部执行此聚合操作。我们首先从公式 (1) 中收集每个语义区域的嵌入 $T_{M_i}, I_{M_i} \in \mathbb{R}^{N \times C}$,并沿区域维度堆叠它们,以获得 $I_M, T_M \in \mathbb{R}^{N \times R \times C}$。其中,$N$ 是空间令牌的数量,$R$ 是区域的数量,$C$ 是通道维度。接下来,区域聚合变换器独立地对每个补丁执行区域自注意力机制,将 $R$ 视为序列长度。为了整合信息,我们在每个补丁的区域序列前添加一个可学习的 [CLS] 令牌($A$)。这种“深度方向”的处理将多区域堆叠折叠为一个单一的、统一的语义画布,该画布与骨干 DiT 的空间维度相匹配。

在实践中,我们采用两个独立的聚合块 $\Phi_{TA}$ 和 $\Phi_{IA}$ 分别处理文本和图像流。我们提取更新后的 [CLS] 令牌作为最终的外观指针:

$$ \begin{aligned} {}^{T}\mathcal{AP} &:= \Phi^{T}_{A}([{}^{T}A, {}^{T}\mathcal{M}]), \\ {}^{I}\mathcal{AP} &:= \Phi^{I}_{A}([{}^{I}A, {}^{I}\mathcal{M}]). \end{aligned} \quad (3) $$

外观指针聚合模块提高了身份和连贯性,从而实现了更好的身份保留和图像连贯性(消融实验表 4)。

3.2 基础 DiT 条件输入

双流条件输入。我们将文本(${}^{T}\mathcal{AP}$)和图像(${}^{I}\mathcal{AP}$)外观指针分别传递给 Flux Kontext 模型的图像流和文本流,以引导生成过程。此外,我们还包含各个局部图像令牌 $I\mathcal{P}_i$ 和文本令牌 $T\mathcal{P}_i$。连接所有令牌得到图像流和文本流的条件:

$$ \begin{aligned} X_t &:= [x_t; \, {}^{I}\mathcal{AP}; \, {}^{I}\mathcal{P}_1; \, \dots; \, {}^{I}\mathcal{P}_n] \quad \text{(ImageStream)} \\ c &:= [{}^{G}\mathcal{P}; \, {}^{T}\mathcal{AP}; \, {}^{T}\mathcal{P}_1; \, \dots; \, {}^{T}\mathcal{P}_n] \quad \text{(TextStream)} \end{aligned} \quad (5) $$

其中 $x_t$ 是带噪令牌。模型的去噪步骤随后写为:

$$ x_{t-1} := \text{FLUX}(X_t, t). \quad (6) $$

注意,某些局部提示 $I\mathcal{P}_i$ 和 $T\mathcal{P}_i$ 可能为空。

区域轮廓引导。外观指针有效地将图像区域与图像和文本提示联系起来。然而,掩码变换器和区域聚合的令牌缩减设计偶尔会平滑掉细粒度的细节。为了解决这一局限性,受 DreamRenderer [68] 的启发,

第 10 页

10 R. Sajnani et al.

Seg2Any [62],我们将所有边缘聚合为单个边界图,该边界图使用 FLUX VAE 进行编码,并提供给 DiT 以提高精度(消融实验表 4)。 实现细节。我们使用流匹配目标(flow-matching objective)和 log-normal 时间采样在 8 块 A100 GPU 上训练 AppearancePointers,耗时三天。遵循 OminiControl [43] 的做法,我们对新引入的条件 Appearance Pointer 令牌和边缘令牌应用秩为 128 的 LoRA。所有可学习参数均使用 Prodigy [28] 以 1.0 的学习率进行训练。其他训练细节和伪代码见补充材料。 复杂度。在内存方面,我们的 Region Aggregation 和 Region Correspondence 模块包含约 400M 参数——相比基础模型的参数量增加了 3.33%。在时间方面,重要的是要强调 Appearance Pointers 是在整个推理过程中计算一次,而不是针对每个去噪时间步计算。此外,我们提出的带有空间下采样和独立区域处理的设计,将注意力计算复杂度从 $O(T \cdot (RN_{reg})^2)$ 降低到 $O(R(N_{reg}/k)^2)$,其中 $k$ 是下采样因子,$R$ 是区域数量,$N_{reg}$ 是每个区域的令牌数量,$T$ 是时间步数量(注:原文此处 "T is the number or regions" 疑似笔误,结合公式上下文通常 T 代表时间步,但此处保留原文语义或根据公式修正,公式中 T 为时间步,原文文字描述可能有误,但根据公式 $O(T \cdot (RN_{reg})^2)$ 到 $O(R(N_{reg}/k)^2)$ 的变化,通常意味着去除了 T 的依赖或 T 被隐含处理,此处按原文翻译但需注意公式逻辑)。这确保了相对于基础生成过程的开销可忽略不计,同时保持高推理效率。

4 AppearancePointers-37K 数据生成

{现有个性化和 (I) 场景描述 { “主体1”:描述: “一个 LLM 材质:白色“哑光碗”;白色陶瓷”;

},物体插入 接地: “一个白色花卉碗”; 数据集 [37, 碗, 人, “主体2”: { … }, 瓶子, … … 对象,场景描述、材质和 “场景”: “在 厨房…”;43,62] 缺乏细粒度 区域 主体 列表 } 结构化 表示 字幕。我们转而生 (II) 生成和接地 成细粒度的、区域级别的

郊区 厨房, …,编辑数据集,使能 “在一个圆形的 Flux[dev] 接地 陶瓷 碗, …” 受控的物体 方向、纹理和材 (III) 编辑和 VLM 检查 质变化,并覆盖 小、中和大物 LLM 体。我们分三 个阶段生成该数 KontextFlux 一致的 VLM 评分变化? 据集,如下所述,并在图 5 中可视化。 “提取材质,放置 场景描述。我们 在中性姿态、方向…” 首先将日常物 体分为三个尺度 组:小(可抓握 的物体)、中(室内物品如床、桌子和椅子)和大(车辆和基础设施如汽车、公共汽车、起重机和建筑物)。对于每个场景,我们从这些类别中采样可变数量的物体

第 11 页

外观指针 11

类别,并向大语言模型(LLM)提供粗略的场景上下文描述(例如,“厨房”、“客厅”)。使用 Qwen 3 [56],我们生成:(i) 全局场景描述,以及 (ii) 包含视觉属性、材质描述以及用于精确对象定位的专用描述的对象级描述。

生成与定位。将结构化的场景提示提供给 Flux.1 Dev [17] 以生成图像。然后,我们使用 Grounded SAM [36] 并根据专用描述符对每个描述的对象进行分割。这产生了区域掩码,将每个生成的区域与其文本参考链接起来。

编辑与视觉语言模型(VLM)检查。遵循 SIGMA-Gen [37],我们提取每个定位对象并生成两种类型的受控编辑:(i) 姿态扰动,以及 (ii) 使用 Flux Kontext 生成的材质和纹理变化。每个编辑后的裁剪图像均由 InternVL [8] 视觉-语言模型进行评估,通过基于 VLM 的评分验证编辑是否与原始描述保持一致。完整的流水线细节和提示模板见补充材料。

提示 | 输入区域 | ours | Seg2Any | DreamRenderer* | InstanceDiffusion —|—|—|—|—|— 在一间明亮、光线充足的医院病房里,气氛平静有序,柔和的自然光透过俯瞰宁静花园的大窗户照射进来。墙壁漆成令人舒缓的淡绿色。 | 一个紧凑的、汽油动力的割草机,拥有光滑的金属框架。 | | | | 一位看起来专业的护士,三十多岁,穿着挺括的白色制服,带有微妙的蓝色镶边。 | 阁楼沐浴在透过布满灰尘的窗户过滤进来的柔和金色光线中,在地板上投下长长的阴影。 | | | | 一位五十多岁的老年男子站在摩托车旁,穿着一件褪色的蓝色牛仔夹克。 | 一辆复古的 1970 年代摩托车停放在阁楼的角落里的木制支架上,其镀铬框架在柔和的光线下闪闪发光。 | | | | 木纹透过一层薄薄的污垢可见,顶部的抽屉微微打开。 | 一个大型的古董文件柜靠着一面墙站立,其表面覆盖着灰尘和岁月斑点。 | | | | 一个明亮、光线充足的仓库。 | 一块复古风格的机械手表放置在木制表面上,其表盘呈现出抛光黄铜的光泽。 | | | | 一个现代风格的洗发水瓶子直立放置,其表面在柔和的环境光下闪闪发光。瓶子呈圆柱形,瓶颈狭窄,逐渐变宽到底部。瓶身由透明的高质量塑料制成,透出鲜艳的蓝色。 | 一个紧凑的矩形纸巾盒整齐地放在架子上,其表面漆成柔和的淡粉色。 | | | | 一台大型平板电视放置在一个坚固的深色木制支架上。 | 一张复古胶片颗粒照片捕捉到了宏伟、昏暗的酒店大堂的核心。 | | | | 一位面容沧桑、姿态自信的中年男子站在酒店入口处。 | 一只大型棕色浣熊,毛发光滑,眼睛明亮好奇。 | | | | 领带是深酒红色,带有微妙的几何图案,系得很整齐。 | 小型木制长凳。 | | | | 咖啡杯 | | | | | 在一个位于城市街道安静角落的舒适、光线充足的小咖啡馆里。 | 支架由深色、丰富的桃花心木制成,表面光滑抛光,赋予其… | | | | 一台现代、 sleek 的跑步机放置在一个坚固的木制平台上。 | 杆子漆成暗淡、柔和的绿色,与周围环境略有对比。 | | | | 一台大型平板电视放置在一个坚固的深色木制支架上。 | 一个经典的三色交通信号灯直立在一个小型金属杆上。 | | | |

图 6:基于区域条件生成的定性比较,源自文本描述。对于每个示例,左列显示用户提供的区域文本提示(为清晰起见进行了颜色编码),随后是对应的输入区域掩码。我们将我们的方法与 Seg2Any、DreamRenderer* 和 InstanceDiffusion 进行比较,所有这些方法都支持区域级文本引导。在多样化的场景中——包括室内环境、对象-人物交互、零售货架和多对象排列——我们的结果显示出更强的区域保真度、更准确的对象外观以及与全局和本地文本线索更好的对齐。DreamRenderer* 还使用深度信息,使其能够访问其他基线无法获得的几何线索。尽管如此,我们的模型生成的图像具有更高的语义正确性,并且在区域间的放置更加一致。

第 12 页

12 R. Sajnani 等

5 实验与结果

5.1 定量结果

图像提示 输入区域 ours MSDiffusion DreamRenderer* (带深度) 数据集。 我们在 Appearance Pointers-37K (第 4 节) 数据集上 对我们的多模态区域对应 模型进行基准测试, 用于区域、文本和图像 条件生成。

基线。由于先前的工作 不支持在文本和图像上 同时使用区域条件,我们将 Ap- pearancePointers 与单模态 区域模型进行基准测试:In- stanceDiffusion [50]、Dream- Renderer [68] 和 Seg2Any 图 7:基于图像提示的区域条件生成的定性比较。 [62],—— 用于 文本+区域到 每个示例提供对象参考图像 图像生成 (表 2 和 图 6)。 (左侧) 和用户定义的区域掩码 (第二列), 为了评估 指定每个对象在最终场景中应出现的位置。我们将结果与 MSDiffusion 图像+区域到图像的生 进行比较,以及 Dream- 成,我们还对 Ap- Renderer* 进行了比较,后者具有深度监督。在各种场景下,我们的结果显示更准确的对象 pearancePointers 与 身份和更忠实的空间放置,而 先前的最先进方法 MSDiffusion 和 DreamRenderer 经常改变外观或放置对象不一致。 MS-Diffusion [49] 和 Dream- Renderer* [68] (表 3 和 图 7)。 除了此处描述的生成设置外,我们还评估了 AppearancePointers 的编辑变体,该变体保留输入图像的背景区域,同时进行有针对性的修改。这使得模型能够保持现有内容,为特定于区域的编辑提供更精细的控制。有关进一步的实现细节、额外示例以及与 InsertAnything [40] 的比较,请参阅补充材料。

指标。我们的评估基准包括在两种条件下生成 500 张图像:纯文本和纯图像,均由全局提示引导,平均每张图像 5 个区域。对于纯图像条件,基准还包括要插入到指定区域中的对象的新视角。 首先,我们使用两个全局指标评估我们的结果:(i) CLIP-IQA [47],它通过比较生成图像的 CLIP 嵌入与“质量”提示来评估视觉质量;(ii) CLIP-T (全局),它通过计算生成图像与全局文本提示的 CLIP 嵌入之间的余弦相似度来衡量对齐程度。我们进一步评估区域精度

第 13 页

外观指针 13

表 2:在 AppearancePointers-37K(文本区域描述)上的定量比较。最佳结果以金色标示,次佳结果以银色标示。所有指标均为越高越好。

区域 全局 CLIP-I↑ CLIP-T↑ DINO-I↑ MIoU↑ CLIP-T↑ CLIP-IQA↑

InstanceDiffusion [50] 86.39 27.54 35.02 41.04 26.70 93.37 DreamRenderer [68] 87.75 28.03 44.20 33.84 28.43 93.24 Seg2Any [62] 89.11 27.67 50.05 36.37 29.30 94.59

Ours 90.40 27.24 56.09 40.35 28.93 95.02

表 3:在 AppearancePointers-37K(图像区域描述)上的定量比较。最佳结果以金色标示。

区域 全局 CLIP-I↑ CLIP-T↑ DINO-I↑ MIoU↑ CLIP-T↑ CLIP-IQA↑

MSDiffusion [49] 89.66 24.89 45.61 28.86 31.08 74.85 DreamRenderer* [68] 92.08 27.37 64.20 40.11 30.02 89.56 Ours 93.29 27.25 69.31 40.97 29.62 95.57

使用四个指标:(i) DINO-I,通过计算生成图像补丁和真实图像补丁的 DINO 特征的 CLS 令牌之间的余弦相似度来衡量保真度;(ii) CLIP-I,类似于 DINO-I,但使用 CLIP 图像嵌入;(iii) CLIP-T,通过 CLIP 嵌入的余弦相似度评估生成图像区域与其对应区域提示之间的对齐情况;(iv) 类别无关 MIoU [62],通过在生成的图像中的真实区域上提示 SAM2 来计算,以评估形状一致性。

分析。表 2 和表 3 分别将我们的方法与针对文本条件区域生成和图像条件区域生成的先前工作进行了比较。定性比较如图 6 和图 7 所示。

如表 2 所示,在文本条件区域生成方面,我们的方法在文本区域到图像的合成中取得了最高的全局图像质量(CLIP-IQA: 95.02)、区域保真度(CLIP-I: 90.40)和语义对齐(DINO-I: 56.09)分数。我们在 MIoU(40.35)方面也具有竞争力,表明对区域掩码有很强的遵循性。相比之下,Seg2Any 和 DreamRenderer 往往未能严格遵循指定的区域掩码,尽管在 CLIP-T 性能方面具有竞争力,但导致 MIoU 分数较低。

对于图像区域控制基准(表 3),我们的方法优于 MS-Diffusion 和 DreamRenderer*,实现了 93.29 的 CLIP-I 分数、40.97 的 MIoU 和 69.31 的 DINO-I 分数。我们的方法展示了更高的语义对齐和对指定区域边界的更好遵循。有关主体插入的更多细节以及定性和定量比较,请参阅补充材料。有关更多实验、基线设置以及在 SACap 数据集上的真实世界比较,请参阅第 E 节。

消融实验:表 4 展示了我们 AppearancePointers 方法在图像条件提示设置下的消融实验。我们使用图像条件提示设置来评估我们的方法在保持身份方面的有效性。我们

第 14 页

14 R. Sajnani 等

表 4:使用图像条件提示进行图像生成的消融研究。我们在基于图像的局部描述设置下,评估了外观指针(Appearance Pointers)模型中各个组件的贡献。移除外观指针聚合会显著损害身份保持能力(CLIP-I 和 DINO-I 降低),而由于缺乏区域融合,MIoU 略有提升。省略外观指针掩码会降低空间解耦能力,导致区域对齐效果减弱。禁用位置 ID 重采样会降低身份和区域一致性,特别是在多区域场景中。最后,移除区域轮廓引导会导致 MIoU 和区域保真度大幅下降。综上所述,这些结果突显了每个组件的重要性,并证实完整的外观指针公式在区域准确性、空间遵循性和身份保持方面实现了最强的平衡。

区域 全局 CLIP-I↑ CLIP-T↑ DINO-I↑ MIoU↑ CLIP-T↑ CLIP-IQA↑

无区域聚合 (w/o Region Aggregation) 第 3.1 节 89.93 27.35 54.47 41.49 28.45 93.48 无区域轮廓引导 (w/o Region Contour Guidance) 第 3.2 节 85.57 23.89 41.62 35.81 28.89 94.47 无位置 ID 重采样 (w/o Position ID Resampling) 多区域模仿 (Multi-Region Mimic) 第 A.2 节 93.01 27.2 67.46 40.75 29.47 95.34 无外观指针掩码 (w/o Appearance Pointer Mask) 第 A.3 节 93.23 27.25 68.93 41.09 29.60 95.83 外观指针 (Appearance Pointers) ( ours) 93.29 27.25 69.31 40.97 29.62 95.57

首先移除区域聚合(第 3.1 节),并直接使用 $T_M$ 和 $I_M$ 来条件化 DiT,而不是使用外观指针 $T_{AP}$ 和 $I_{AP}$。区域聚合提升了主体身份(DINO-I 从 54.47 提升至 69.31)和图像质量(从 93.48 提升至 95.57)。区域轮廓引导将 MIoU 从 35.81 提升至 40.97,从而提高了区域精度。更多详细的消融和分析请参阅补充材料。

6 结论

我们引入了外观指针(Appearance Pointers),这是一种轻量级且与模态无关的机制,使扩散变换器(Diffusion Transformers, DiTs)能够解释并应用来自文本或图像输入的特定于区域的意图。通过将模型引导至正确的空间位置处的正确外观线索,外观指针补充了 DiTs 原生的多模态灵活性。我们的区域对应网络(Region Correspondence Network)和空间聚合模块允许在单个去噪过程中组合多个区域描述,支持可扩展且稳健的空间控制。为了训练和评估我们的模型,我们创建了一个合成数据集,其中包含生成图像中多个区域的文本和图像描述。与特定于模态的方法相比,尽管我们的模型是针对多模态训练的,但在大多数指标上达到了或超过了最先进水平(state-of-the-art)。这些发现表明,外观指针提供了一种简单、可扩展且有效的接口,用于精确的多模态引导,使生成模型不仅能更好地实现用户意图创建的内容,还能控制内容出现的位置和方式。

局限性。我们观察到,我们的工作偶尔会忽略较细的区域,并且无法保留更细粒度的细节,例如人脸的身份。此外,我们注意到当指定更多区域(例如 10 个或更多区域)时,遵循区域信息的能力会下降。请参阅补充材料以查看视觉失败案例及其讨论。

第 15 页

附录

A 实现细节与伪代码 . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 A.1 训练设置 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 A.2 条件的 RoPE 位置 ID . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16 A.3 Appearance Pointer Mask . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16 A.4 架构 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 B 多主体插入(编辑) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 C 消融实验 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18 C.1 Appearance Pointer 伪代码 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20 D 定性结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20 E 基线比较设置 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28 F 局限性与未来工作讨论 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28 G Appearance Pointer 注意力图分析 . . . . . . . . . . . . . . . . . . . . . . 29 H 额外数据集细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 30 H.1 数据集 VLM 检查 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 30 H.2 提示词工程 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31

A 实现细节与伪代码

A.1 训练设置

我们在每次训练迭代中最多训练 7 个区域(包括背景),其中其中一个区域可以是背景区域。在训练过程中,我们 50% 的时间随机将全局提示替换为仅包含背景的全局提示,该提示不描述前景物体。使用背景提示作为全局提示迫使区域模块更多地关注区域提示,并使模型在没有提供全局提示的场景中能够稳健工作。

如主文第 4 节所述,我们对生成的 (i) 姿态变化和 (ii) 材质与纹理变化执行 VLM 检查。仅当 InternVL [8] 的一致性分数在姿态变化上超过 0.84,在纹理/材质变化上超过 0.79 时,我们才将生成结果用于训练。下面的公式给出了区域提示采样概率 $p$,该提示可以是与地面真值目标相同视角的主体图像、新视角的主体图像、材质参考图像、文本或它们的组合:

$$ p = \begin{cases} p \in [0, 0.4], & \text{consistent novel view image} \\ p \in (0.4, 0.6], & \text{image + text prompt} \\ p \in (0.6, 1.0], & \text{text prompt} \end{cases} \tag{7} $$

第 16 页

16 R. Sajnani 等

其中 (I) 表示图像提示,(T) 表示文本提示,而 (I+T) 表示同时包含图像和文本提示的情况。在训练期间,我们将提示图像中的每个参考主体居中,并在将其输入模型之前应用黑色背景掩码。此外,我们以 30% 的概率采样粗糙掩码,其中粗糙掩码可以是边界框或椭圆。此外,我们为材质提示提供类别名称,因为仅凭材质无法指示要插入的主体类型。

A.2 条件 RoPE 位置 ID

遵循 [37,43],我们为每个条件图像和文本提示令牌分配不同的、不重叠的位置嵌入。对于图像提示,位置 ID 定义为

[ 1,\, R ( i) \cdotHh,\,w],

对于文本令牌定义为

[ 0,\, R ( i) \cd ot H +\text{mean}({}^{T}h),\,

其中 R(i) 是整数区域标识符,H 是生成图像的位置嵌入网格的高度维度,h, w 是令牌在区域内的行和列坐标。此处,mean(T h) 是与区域文本提示 T Pi 对应的区域提示链接令牌 (T Mi) 的平均高度。外观指针令牌使用位置 ID:图像外观指针为 [1, h, w],文本外观指针为 [0, h, w]。 ID 重采样。为了在小区域训练设置中模拟更多的区域数量,我们将区域位置 ID 乘以一个随机整数乘数。这使得模型能够体验更广泛的位置 ID 范围,这对于在推理时进行扩展是必要的。 采用这种方法,图像提示令牌的位置 ID 变为

[ 1,\, R ( i ) \ cdotm\cdotHh,\,w],

区域文本提示令牌的位置 ID 变为

[ 0,\, R ( i) \cdotm\cdotH,\,

其中 m 是在范围 m \in6] 中随机选择的整数。

A.3 外观指针掩码

在存在多个区域的情况下,外观区域指针聚合可能难以选择最相关的特征。我们通过使用输入区域掩码屏蔽感兴趣区域来辅助外观指针聚合。在聚合所有区域条件以获得图像 (IAP) 和文本 (T AP) 外观指针(在主文档中定义)之前,我们重新利用

第 17 页

外观指针 17

输入的区域掩码(RP),以确保仅在提示指定的空间区域内具有非零特征。具体实现如下:

$$ \begin{aligned} {}^{T}\mathcal{AP} &= \Phi^{T}_{A}([{}^{T}A, {}^{T}\mathcal{RP}]) \odot {}^{T}\mathcal{M}, \\ {}^{I}\mathcal{AP} &= \Phi^{I}_{A}([{}^{I}A, {}^{I}\mathcal{RP}]) \odot {}^{I}\mathcal{M}. \end{aligned} \tag{9} $$

区域链接特征 ${}^{T}\mathcal{M} \in \mathbb{R}^{R \times C \times H_t \times W_t}$ 和 ${}^{I}\mathcal{M} \in \mathbb{R}^{R \times C \times H_i \times W_i}$、区域聚合变换器网络 $\Phi^{I}_{A}$ 和 $\Phi^{T}_{A}$,以及可学习的聚合令牌 ${}^{I}A$ 和 ${}^{T}A$ 已在主文中定义。为清晰起见,我们省略了用于调整区域掩码 RP 大小的下采样函数。$\odot$ 表示哈达玛积(Hadamard Product)。

A.4 架构

区域对应块是一个六层的多模态变换器。区域对应中的每个变换器块为文本、图像和掩码令牌分别设有独立的查询、键和值投影。我们还有一个调制块,该块接收区域的 CLIP 特征向量以调制该区域,类似于 FLUX Kontext dev 中的注意力机制。随后,令牌通过带有跳跃连接的多层感知机(MLP)。我们的隐藏维度为 768,并执行瓶颈操作,将高维 FLUX 嵌入($D=3072$)转换为 768。这使得我们的方法轻量且快速,且性能无明显变化。区域聚合块的构建方式类似,唯一的区别是我们没有调制,而是使用带有层缩放(layer scale)[45] 的跳跃连接。区域聚合块的注意力是单模态的,且相比对应块要轻量得多。

B 多主体插入(编辑)

我们模块化区域方法的一个优势是,我们可以将背景图像和全局文本提示视为区域条件,并无缝地将我们的方法扩展到允许多主体插入的编辑任务(参见算法 1)。因此,我们将我们的方法与 InsertAnything [40] 进行基准测试,后者支持在场景图像中插入对象。由于 InsertAnything 一次只能插入一个对象,我们通过迭代插入对象来构建基线。与同时插入所有对象的方法相比,这一过程使 InsertAnything 在概念上具有优势。

表 5 和图 8 展示了将我们的方法与基于 InsertAnything 的基线进行定量和定性比较的结果。尽管 AppearancePointers 一次性处理所有区域,而不是采用迭代方法,但它在 CLIP-I、CLIP-T、MIoU 和 CLIP-IQA 上优于迭代式 InsertAnything,同时在 DINO-I 上保持竞争力。此外,随着插入操作数量的增加,InsertAnything 生成图像的质量会下降。

第 18 页

18 R. Sajnani 等

主体 编辑插入 迭代式 InsertAnything 本文方法

图 8:多主体插入。我们使用 Appearance Pointers 执行多主体插入,并与迭代式 InsertAnything 进行基准对比。InsertAnything 在重复主体插入后往往会导致图像结果退化,并扭曲物体,例如第 1 行中的白色瓶子、第 2 行中的桌子和树叶。

C 消融实验

表 6 展示了我们在图像条件提示设置下对 Appearance Pointers 方法的消融实验。我们使用图像条件提示设置来评估我们方法在保持身份一致性方面的有效性。

无 Appearance Pointer 聚合:我们移除了聚合步骤,不再使用 Appearance Pointers $T_{AP}$ 和 $I_{AP}$,而是直接使用 $T_M$ 和 $I_M$。对于这些令牌,我们随后采用与 Appearance Pointers 令牌相同的 LoRA 微调方法。由于缺少到 Appearance Pointers 令牌的聚合步骤,物体的身份未能得到良好保持,这由较低的 DINO-I(54.47)和 CLIP-I(89.93)得分所表明;但不执行 Appearance Pointer 聚合使得区域控制更精细,MIoU 更高(41.49),因为模型无需学习如何聚合区域。

第 19 页

外观指针 19

表 5:在 AppearancePointers-27K(带背景图像区域描述)上的定量比较。最佳结果以金色显示。所有指标均为越高越好。AppearancePointers 在 CLIP-I、CLIP-T、MIoU 和 CLIP-IQA 上优于 Iterative InsertAnything,并且在有利于 InsertAnything 的设置下,在 DINO-I 上仍具有竞争力。

区域 全局 CLIP-I↑CLIP-T↑DINO-I↑MIoU↑CLIP-T↑CLIP-IQA↑

Iterative InsertAnything [40] 94.52 27.46 76.32 40.63 29.74 85.82 AppearancePointers (Ours) 94.52 27.69 75.11 45.44 30.03 95.47

表 6:使用图像条件提示进行图像生成的消融研究。我们使用基于图像的区域描述设置,评估 Appearance Pointer 模型中每个组件的贡献。移除外观指针聚合会严重损害身份保持(CLIP-I 和 DINO-I 降低),但由于缺少区域融合,MIoU 略有提升。省略外观指针掩码会降低空间解耦能力,导致区域对齐效果减弱。禁用位置 ID 重采样会降低身份和区域一致性,特别是在多区域场景中。最后,移除区域轮廓引导会导致 MIoU 下降。综上所述,这些结果突显了每个组件的重要性,并证实完整的外观指针公式在区域准确性、空间遵循度和身份保持之间实现了最强的平衡。

区域 全局 CLIP-I↑CLIP-T↑DINO-I↑MIoU↑CLIP-T↑CLIP-IQA↑

w/o Region Aggregation Sec. 3.1 89.93 27.35 54.47 41.49 28.45 93.48 w/o Appearance Pointer Mask Sec. A.3 93.23 27.25 68.93 41.09 29.60 95.83 w/o Region Contour Guidance Sec. 3.2 85.57 23.89 41.62 35.81 28.89 94.47 w/o Position ID Resampling Multi-Region Mimic Sec. A.2 93.01 27.2 67.46 40.75 29.47 95.34 AppearancePointers (Ours) 93.29 27.25 69.31 40.97 29.62 95.57

w/o Appearance Pointer Mask:如 Sec. A.3 所述,该掩码策略通过确保条件区域令牌仅关注目标区域内的令牌,增强了主体身份保持。与表中未使用该策略的基线(标记为 w/o Appearance Pointer Mask)相比,这带来了更高的 MIoU(69.31)。

w/o Position ID Resampling Multi-Region Mimic:如 Sec. A.2 所述,位置 ID 采样提高了更多数量区域的身份保持和区域遵循度;若缺少该机制,我们将获得更低的 DINO-I 分数(67.46)和更低的 MIoU(40.75)。

w/o Region Contour Guidance:接下来,我们通过移除区域轮廓引导进行消融研究。表 4 显示,区域轮廓引导提升了所有区域指标,将 MIoU 从 35.81 提高到 40.97。

性能与区域数量的关系:表 7 评估了当区域数量从 1 增加到 9 时,图像+区域到图像任务的性能。虽然身份保持(CLIP-I)保持显著稳定,但区域 DINO-I 和 mIoU 呈现逐渐下降的趋势。这是由于拥挤场景中空间遮挡和重叠边界增加所致。

对掩码精度的鲁棒性:表 8 分析了模型在不同掩码粒度(精细 vs. 边界框 vs. 椭圆)下的性能。我们的结果表明,在身份保持(CLIP-I)和美学质量(CLIP-

第 20 页

20 R. Sajnani 等 表 7:精度与区域数量对比。

指标 / 区域数量 1 2 3 4 5 6 7 8 9

CLIP-T 30.50 29.81 29.5 28.96 28.39 28.19 26.99 26.41 25.13 CLIP-I ↑ 95.07 95.41 95.41 95.51 94.87 95.13 94.84 95.64 94.94 区域 DINO-I ↑ 85.22 85.49 85.56 84.03 82.03 80.45 78.58 76.96 74.80 MIoU ↑ 51.19 51.95 51.88 49.13 48.35 48.05 46.33 44.13 43.63

CLIP-T ↑ 34.87 34.96 34.90 34.98 36.27 36.20 35.19 35.87 35.87 全局 CLIP-IQA ↑ 94.62 92.96 93.65 93.97 94.38 95.02 93.07 93.65 93.18

IQA),即使在使用稀疏输入的情况下也是如此。DINO-I 和 mIoU 在粗糙掩码上的下降反映了模型在合成新颖主体朝向方面的灵活性,这些朝向尊重了粗糙的空间区域(椭圆和边界框)。

表 8:粗糙区域控制消融实验。

消融实验 区域 全局

粗糙/精细区域 CLIP-T CLIP-I DINO-I MIoU CLIP-T CLIP-IQA

斑点(椭圆) 28.60 93.72 76.53 44.94 34.93 93.91 边界框(Bbox) 28.79 94.31 80.32 47.86 34.91 93.02 精细 28.93 95.13 84.03 53.87 35.00 93.51

C.1 外观指针伪代码

请参阅算法 1 的伪代码,以获取实现注意力指针的详细伪代码。

D 定性结果

图 9、图 10、图 11、图 12 和图 13 展示了结合所有条件(包括材质、图像和文本条件)使用我们方法的视觉效果。我们还对 Google 图片进行了野外图像编辑(图 14)和布局引导生成(图 15)。

第 21 页

外观指针 21

算法 1 外观指针条件图像生成

输入:RP(区域掩码),IP(区域图像),TP(区域文本提示) 输入:IPbg(背景图像),timesteps(生成时间步) 输入:R(区域数量),GP(全局提示) 输出:I := AppearancePointerConditionedGeneration(RP, IP, TP) 1: IMs := List(), T Ms := List() 2: RP.append(RPbg), IP.append(IPbg ⊙RPbg), T P.append(GP) \triangleright添加用于编辑应用的掩码全局图像提示和文本提示 3: for i = 1, 2, . . . R + 1 do 4: IMi, T Mi := ΦRC([ RPi, IPi, T Pi ]) \triangleright区域-提示链接,其中如果图像或文本提示缺失,则使用可学习嵌入 5: IMs.append(IMi), T Ms.append(T Mi) 6: end for 7: T M := Concat(T Ms), IM := Concat(IMs) 8: if AppearancePointerMask then \triangleright如果存在外观指针掩码 9: T AP := ΦTA([T A, T M ⊙RP]) 10: IAP := ΦIA([IA, IM ⊙RP]) 11: else 12: T AP := ΦTA([T A, T M]) 13: IAP := ΦIA([IA, IM]) 14: end if 15: E := VAE(RP) \triangleright获取轮廓潜在表示 16: xtimesteps := N(0, I) 17: for t = timesteps, timesteps −1, . . . 0 do 18: Xt := [xt; IAP; IP1; . . . ; IPn] (图像流) 19: c := [GP; T AP; T P1; . . . ; T Pn] (文本流) 20: xt−1 := FLUX(Xt, c, t, E) (将轮廓 E 添加到生成模型) 21: end for 22: I := Decode(x0) \triangleright解码生成的图像 23: return I

第 22 页

22 R. Sajnani et al.

Prompt Condition Image Condition Condition Types Generated Image

“insert a wallet with the material 1 2 1 properties as described in the 3 4 following image”

“A vintage ceramic bowl sits on a 5 woodenwith intricatetable,floralits surfacepatternsetchedthat 2 have faded slightly over time….” 3 4

BG Prompt: “In a dimly lit 5 basement, the atmosphere is quiet and subdued, illuminated by a single overhead bulb casting soft, even light across the space….” 1

2 “insertpropertiesa stoolas describedwith the materialin the 1 2 4 following image.”

2 5 “A tall, layered cake with three 5 distinct tiers, each covered in smooth vanilla frosting….” 3 4

BG Prompt: “In this cartoon- style shopping mall scene, the atmosphere is bright and cheerful, 1 with vibrant colors and playful elements that bring the environment to life.…” 3

1 2

2

BG Prompt: “In the heart of a quiet hospital room, the Van Gogh Starry Night style paints the scene with swirling, dreamlike brushstrokes of deep blues, 3 3 vibrant yellows……“ 1

“insert a child with the material 1 2 2 properties as described in the following image” 2 “The vase is adorned with 3 delicate, hand-painted floral patterns in muted pastel tones” 1 4 “Aof polishedsmall, intricatebrass” keychain made 4

BG Prompt: “In the heart of a bustling train station, the scene is vibrant yet orderly, with a warm, golden light filtering through large windows that frame the view of a quiet platform outside.…” 3

“insert a desk top with the 1 2 3 material properties as described in the following image.” 4 “Amadesleek,of high-qualitycylindrical waterplastic…”bottle 2 5 “Antarnishedancientwithbronzeage andcoin,time…..” 3

BG Prompt: “The interior of a 4 grand, ancient temple bathes in soft, natural light streaming through tall, arched windows. The walls are lined with intricately carved stone, adorned with faded 1 5 murals depicting historical events and religious symbols….” 3

Fig. 9: MultiModal Region Conditioned Generation. AppearancePointers can generate images from heterogeneous condition signals that include materials, images and text prompts. Each region is numbered with the same number as the conditioning signal. The background is generated by the background description. Material condi- tioned regions are highlighted with bright purple color, image conditioned regions are highlighted with cyan color, and text conditioned regions are highlighted with red color in column 3.

第 23 页

外观指针 23

提示条件 图像条件 条件类型 生成图像

1 2 1 “插入具有……材料属性的工程师” 2 “插入一副太阳镜,其材料属性如下图中所述” 4 “一个圆柱形磨砂白玻璃……皂液器” 3 1 3

4

背景提示:“在一个明亮、光线充足的办公空间,拥有大窗户,允许自然日光……”

2

1 2 3 “一只深色的小鸽子,栖息在光滑且略带虹彩的窗台上,羽毛在光线下……” 1

“一支细长的木质铅笔,笔尖略微弯曲,表面光滑抛光,反射环境光……” 2 4

背景提示:“场景设定在一座经典学校建筑内,以油画风格渲染……” 4

“插入一辆消防车,其材料属性如下图中所述……” 1 2 2

3 “在文件柜左侧的现代消防车,其表面由哑光黑色……制成” 3 2

背景提示:“在这个博物馆展厅中,氛围宁静而精致……”

1

图 10:多模态区域条件插入。外观指针可以从包括材料、图像和文本提示在内的异构条件信号中插入主体。每个区域使用与条件信号相同的编号进行标记。在编辑场景中,背景保持不变。材料条件区域以亮紫色高亮显示,图像条件区域以青色高亮显示,文本条件区域在第 3 列中以红色高亮显示。

第 24 页

24 R. Sajnani 等

条件 生成图像

带有中央钻石的 3 4 2 手工戒指。铂金 戒圈 带有 拉丝 4 饰面… 1

背景提示:温馨的乡村 餐厅,配有温暖的 灯光和优雅的 装饰。一张木桌 和一位穿着牛仔 衬衫 和皮革 围裙的农夫… 2 3

1

桌上的复古闹钟 3 2 2 。闹钟 有玻璃表盘和 金属表面 1

背景提示:一个 火车站 带有 明亮、 均匀 3 的照明 和 干净、 抛光的地板。海报 1 和广告 覆盖着墙壁,采用大胆的 彩色设计。 2

一位游客,带有 1 3 6 材质属性 1 带有 雕刻的金属钥匙在 1 木制… 2

一把 叉子, 材质 属性 如 所示。 4 3 装满浓稠红色酱汁的高玻璃瓶 4 5 … 5 4 背景 提示: 一个 2 地下室,带有 中性 米色墙壁和一扇大 窗户… 6

一台带有数字界面的洗衣机 3 4 6 ….. 1

4 带有 风化 边缘的木制长椅… 2 3

5 6 1 5

2

插入一个带有 1 5 4 材质属性的平底锅.. 1 2 身穿黑色皮革 夹克的男子。棱角分明的下颌线。 紧锁的眉头…. 2

尼龙制成的 海军蓝背包 3 5 背景提示:光线昏暗的 6 3 电影院大厅 墙上贴着褪色的电影海报 。华丽的 1 枝形吊灯投射出….. 4 6

现代 相机 带有 3 4 6 抛光的 金属机身…. 1 3

靠墙放置的白色婴儿床 配有硬质床垫… 2 5 4 2 5 6 1

图 11:图像生成与编辑画廊 AppearancePointers 可以利用野外异构条件执行区域编辑和生成。每个区域都伴有一个数字,用于将条件与区域关联起来。

第 25 页

外观指针 25

条件 生成的图像

一个光滑的现代海军蓝沙发,具有极简设计…… 1

一个经典的簇绒沙发,配有浓郁深邃的酒红色天鹅绒面料。 2

背景提示:滑板公园宽敞明亮,拥有光滑的混凝土地面以及各种用于滑板的坡道和栏杆…… 1

一个宏伟的圆形喷泉,带有复杂的…… 1

一个大型圆柱形木桶,顶部有一个宽开口,一侧有一个把手。 2

背景提示:一条宁静的小路延伸穿过广阔开阔的景观…… 5

一个光滑的白色帆船,带有三角形的帆,在风中飘扬。 1

一个简单的深绿色坚固手推车…… 1

背景提示:操场宽敞明亮,地面上散布着各种户外设备。 2

脖子上挂着一个听诊器 1

一位身材高挑、中年、姿态自信的医生,穿着一件带有细微垂直条纹的整洁海军蓝纽扣衬衫…… 2

背景提示:一个带有混凝土地面的现代工厂…… 3

一名男子正在弹奏一把原声吉他 1

木桌上放着一个高玻璃瓶,里面装有红色液体。 2

图 12:图像生成和编辑画廊 AppearancePointers 可以利用野外异构条件执行区域编辑和生成。每个区域都附有一个数字,将条件与区域关联起来。

第 26 页

26 R. Sajnani 等

条件 生成图像

一个大型带轮子的 3 4 5 购物车,带有 鲜红色的框架和 平坦的钢灰色篮子。 … 1 2 4 一个高大的中年男子 穿着海军蓝 西装外套….. 2 1 3 背景提示:一个现代化的 机场航站楼,拥有 光滑的白色瓷砖地板, 大型玻璃窗.. 5

2 1 3

1 插入给定的雕塑 石头 1

背景提示:一个花园 2 场景,在阳光明媚的 日子里。 3

纸板纸巾盒 5 4 带有卷曲的角。 褪色的标签…. 1

头发花白的老年女性 3 头发盘成发髻。花卉 图案连衣裙。平静的 表情… 2 1 2 带有灰尘和划痕的钢制文件柜….. 3 背景提示:一个医院 房间,木码头上的帆船…. 6 6 5 带有风化 木质船体。破烂的 帆显示出磨损… 4

背景 提示: 这 艘 船 2 3 1 甲板 是开放 的, 宽敞,带有木质 地板,可以清楚地看到 周围的水域。 两个空调分别放置在 甲板的两侧,一个现代 2 3 一个复古,两者都 安静高效地运行。 1

一座稍旧的办公楼 2 3 带有砖砌 外墙,色调温暖、 质朴。 1

背景 提示: 两 座 1 办公楼 在 积雪 2 区域 …… 3

背景提示:在一个 2 3 1 仓库里,后面有箱子 …… 1

4

4 5 2 5 3

图 13:图像生成和编辑画廊 AppearancePointers 可以利用野外异构条件执行区域编辑和生成。每个区域都附有一个数字,将条件与区域关联起来。

第 27 页

外观指针 27

输入图像 条件编辑 条件分割 生成图像 1 1 2 “一个亮黄色的枕头” 2 3 3 “一个亮红色的枕头” 1 2 1 “在地板上添加带有这种材质的挂毯” 2 1

图 14:使用图像和区域提示进行图像编辑。AppearancePointers 可以对来自互联网的图像执行一次性区域编辑。

输入图像 条件编辑 条件分割 生成图像 1 2 1 5 2 “一个鸟屋” 3 “一只红嘴绿鹦鹉” 3 4 “一个亮橙色的盘子” 5 背景提示:背景中有植物和棕色墙壁的桌子 4

图 15:布局引导生成。AppearancePointers 可以执行布局引导的图像生成。在此示例中,使用图像分割模型来识别输入图像的区域。然后,我们选择这些区域的一个子集,并按照相同的布局生成新图像。区域 1 由一个新的主体图像描述,而其他区域具有文本描述。

第 28 页

28 R. Sajnani 等

E 基线比较设置

遵循 Seg2Any、MS-Diffusion 和 InstanceDiffusion 的做法,我们使用其原始优化权重来评估基线模型。出于以下原因,我们避免在我们的 Appearance Pointers-37K 数据集上重新训练这些模型: (1) 指标中立性:我们的基准测试利用分布中性指标(mIoU、DINO-I、CLIP-I、CLIP-T、CLIP-IQA)来衡量空间+文本一致性、身份保留和美学效果。我们明确排除了分布敏感指标(FID/KID),以最小化固有的评估优势。我们确实认识到某些分布偏移优势可能仍然存在,并在下文对真实数据进行了实验。(2) 大规模训练:先前的工作如 Seg2Any 和 MS-Diffusion 在大规模下使用数百万数据样本进行训练。重新训练它们有创建弱基线的风险,且所有先前工作也都避免了这一点。值得注意的是,我们的方法对基于图像和基于文本的区域描述使用相同的模型——这是一个显著更困难的设置,且先前工作不支持。然而,我们也在下文展示了真实世界的结果,并在真实世界生成任务上与 Seg2Any 和 MS-Diffusion 进行基准比较。

表 9:在 SACap-eval 数据集(真实世界图像)上的定量比较。即使完全在合成数据上训练,我们的工作也具有竞争力,且具有更好的美学效果和图像-文本一致性(零样本设置)。仅使用 2.3% 的真实数据进行微调即可显著改善区域文本一致性。AppearancePointer 是唯一一个使用相同权重同时支持图像和文本作为区域引导的模型(以红色高亮显示)。最佳结果为金色,次佳结果为银色。

训练 区域 全局 数据 CLIP-I↑CLIP-T↑DINO-I↑MIoU↑CLIP-T↑CLIP-IQA↑

任务:区域+文本到图像

Seg2Any SACap-1M × 26.24 × 64.24 32.30 86.07 Ours (Zero-Shot) AP-37K × 25.57 × 60.14 32.17 89.27 Ours (2.3% Fine-Tune) AP-37K + SACap-23K × 25.78 × 61.72 32.99 87.92

任务:区域+图像到图像

MS-Diffusion (Bbox) Private-3M 87.81 × 46.86 53.53 31.95 74.91 Ours (Zero-Shot, Bbox) AP-37K 93.92 × 72.16 59.64 32.78 86.23 Ours (Zero-Shot, Fine-Grained) AP-37K 94.09 × 72.63 62.46 33.02 86.27

真实数据定量结果:我们在零样本和微调设置下,在真实世界的 SACap-eval 数据集上评估了我们的方法(表 9)。为了确保与应用面部模糊的 Seg2Any 进行公平比较,我们在评估中排除了人类主体,并随机采样 200 张图像进行基准测试。我们的结果展示了强大的分布迁移能力,以及在边际微调数据下的有效性能。见图 16 (c)。

F 局限性与未来工作讨论

首先,我们的方法继承了 FLUX Kontext 模型在保留复杂人类面部身份方面的困难,这一局限性可能反映了 FLUX 训练分布的约束。经验上,我们观察到当面部占据更大的空间区域时,模型能更可靠地保留身份,而不是

第 29 页

外观指针 29

图 16:(a) UI 中的精确简易分割(点击以红色可视化)。(b) 通过单次点击从其他图像中获取精确区域,并将其用作生成/编辑图像的条件。(c) 在 SACap-eval 上使用 AppearancePointers 进行真实世界区域+文本到图像的零样本生成。(d) 来自 MS-Bench 的稀疏边界框主体条件图像生成。

比小区域更优。其次,由于我们的数据集验证依赖于基于大规模 VLM 的过滤,验证过程中可能残留错误,从而潜在地降低外观迁移性能。最后,如 图 17 所示,对大量区域(约 10 个)进行条件化可能导致泄露伪影或降低区域质量。

我们的工作 AppearancePointers 引入了一种方法,允许将文本/图像/编辑条件指向所需区域,并显示出与单模态先前工作相比具有竞争力或更优的性能。我们通用设计的未来工作方向可能是将我们的工作扩展到其他形式的条件模态,例如音频、视频、3D 和 4D。另一个可能的方向是提高模型的效率,使其能够实时应用于编辑和场景控制应用。

G 外观指针注意力图分析

生成的图像 区域掩码 外观指针注意力可视化

我们在 图 18 中提供了注意力图可视化,以了解指针令牌在生成过程中关注的内容。生成图像和片段上的黄色查询点被查询,以获得反映负责条件化该片段的区域的注意力图。在每种情况下,我们的外观指针都突出了正确的感兴趣区域。例如,椅子上的图案、长凳的右脚、灯和起重机机身都指向相应的条件信号。

图 18:外观指针指向正确的感兴趣区域,展示了其在多模态区域控制生成中的有效性。

第 30 页

30 R. Sajnani 等

区域片段 区域条件

1 一只可爱的白鸟在天空中飞翔 1 2 2 一架明亮的黄色飞机飞越天空 3 一辆明亮的绿色自行车停在红色汽车附近

5 9 4 一辆鲜艳的红色汽车停在河边 4 8 3 5 一个高个子男人站在河边

7 6 一艘橙色的玩具快艇 6 7 一张深棕色的桌子

8 一个粉色的花瓶

9 一张深紫色的紫罗兰色沙发

生成结果

背景提示:… 河边, 背景提示:… 河边, 背景提示:… 河边的 10 10 10 城市背景… 卡通风格城市背景… 户外购物中心…

图 17:失败案例。我们测试使用文本提示为 AppearancePointers 扩展区域数量。在此案例中,将区域数量增加到 10 可能会降低区域遵循度和质量。此处,沙发未被准确捕捉。

H 附加数据集细节

H.1 数据集 VLM 检查

FLUX Kontext 的编辑不一定准确,可能存在不一致性,从而为我们的模型产生错误信号。因此,我们额外使用 InternVL 3 VLM 来评估编辑质量,并提示其提供评分原因的摘要(参见 Listing 1.1 和 Listing 1.2 中的示例)。

新视角验证 Listing 1.4 展示了提示 InternVL [8] 模型对感兴趣主体的新视角生成质量进行评分的示例。Listing 1.1 展示了从模型获得的用于评估生成新视角整体一致性的结果。

Listing 1.1:示例新姿态验证 JSON

{

第 31 页

外观指针 31

{
    "overall_consistency_score": 0.8,
    "is_geometrically_consistent": true,
    "sharpness_comparison_score": 0,
    "is_novel_pose": false,
    "overall_consistency_reason": "Good Match (Clear resemblance, but minor, subtle inconsistencies in material or lighting are noticeable).",
    "geometric_consistency_reason": "N/A",
    "sharpness_comparison_reason": "N/A",
    "pose_novelty_reason": "N/A"
}

材质/纹理验证 列表 1.5 展示了一个示例,即提示 InternVL [8] 对 FLUX-Kontext 为感兴趣主体生成的材质/纹理球体的质量进行评分。列表 1.2 展示了从 InternVL 模型获得的用于评估生成材质质量及其推理过程的结果。

列表 1.2:材质验证 JSON 示例

{
    "perceptual_similarity_score": 0.7,
    "albedo_color_fidelity_score": 0.8,
    "roughness_gloss_fidelity_score": 0.6,
    "texture_detail_fidelity_score": 0.8,
    "albedo_color_reason": "Sphere’s color is slightly lighter than the object.",
    "roughness_gloss_reason": "Sphere appears smoother than the object’s material.",
    "texture_detail_reason": "Sphere’s pattern is similar but lacks ....",
    "perceptual_consistency_reason": "Good match but some differences in texture depth and glossiness."
}

H.2 提示词工程

在此,我们详细说明了用于提示 LLM 的额外细节。列表 1.3 展示了提供给 Qwen 3 [56] 以生成物体描述、材质描述、Grounding DINO 标题等的 JSON 提示词。在我们的工作中,我们发现简洁的 Grounding DINO 标题对于提高 grounding 分数是必要的,而简洁的材质描述则用于提示 FLUX Kontext [18] 以改善材质/纹理球体的生成。

列表 1.3:为我们的数据集生成提示词和物体描述的示例

{
    "task": "expert scene captioning and material extraction for 3D generation",
    "style": "{style}",
    "environment": "{environments}",
    "required_object": "{prompt_obj_string}",
    "people_details": "{people_detail_description}",
    "constraints": {
       "output_format": "JSON object",
       "total_word_count_min": 1000,
       "total_word_count_max": 3000,
       "scene_caption_word_count": 300,
       "image_quality": "avoid dark, low-resolution, or overly complex scenes",
       "visual_distinctiveness_rule": "ALL objects generated in the scene must be visually differentiable. Ensure colors, primary textures, and unique features DO NOT overlap between objects. For example, if Object A is ’smooth, dark mahogany,’ Object B must not be ’smooth, dark walnut.’"
    }
}

第 32 页

32 R. Sajnani 等

"material_specificity_rule": "材质描述必须生动,侧重于感官 特性:光泽度、纹理触感以及光线 与表面的相互作用。务必提及主色调 和任何纹理元素的描述。避免使用技术性 3D 术语。" }, "instructions": [{ "step": 1, "name": "detailed_object_captions", "goal": "为 ’required_objects’ 中列出的每个对象生成详细且纯视觉的描述(每个对象最多 100 字)。这些描述必须完全独立:不包含任何环境背景、不与邻近对象产生关联,也不涉及场景布局。仅关注内在视觉属性。", "subtasks": ["对于 ’caption’ 字段,详细描述颜色、形状和复杂的表面 图案。", "对于 ’dino_caption’ 字段,生成一个简洁、精确的短语(少于 10 个字),专注于对象的功能或独特几何形状,以 最大化检测准确性,避免依赖简单的颜色描述。", "如果对象是人,’material_caption’ 必须描述其最显眼的衣物(例如 衬衫、夹克或裤子)的材质和纹理,详细说明其编织方式、反光性和 垂坠感。。对于所有其他对象,在材质描述中提供关于对象材质特性的丰富、感官和 感知性描述,描述纹理、反光性和光线与 材质的相互作用,并包含该材质的单一最显眼部分及其颜色(少于 10 个字)。切勿描述 多种材质或颜色。" ]}, { "step": 2, "name": "scene_caption", "goal": "通过无缝组合步骤 1 中的所有对象,生成最终生动的场景描述。专注于指定环境风格内的场景级细节(布局、光照、构图、 对象交互)。确保所有对象都清晰聚焦,且不属于模糊背景的一部分。描述长度必须不超过300 字。" } ], "output_structure": { "detailed_object_captions": { "object_1": { "name": "<object_1_name>", "caption": "<对象 1 的详细视觉描述>", "dino_caption": "<对象 1 的简洁 dino 描述,用于提高检测效果>", "material_caption": "<对象材质的详细视觉和纹理描述>" }, "object_2": { "name": "<object_2_name>", "caption": "<对象 2 的详细视觉描述>", "dino_caption": "<对象 2 的简洁 dino 描述,用于提高检测效果>", "material_caption": "<对象材质的详细视觉和纹理描述>"

}, }, "scene_caption": "<场景描述,长度不超过 300 字>", "scene_background_caption": "<场景背景描述,长度不超过 300 字>" } }

列表 1.4:评估新视角姿态质量的示例

{ "task": "专家级简化 3D 视角一致性及关键伪影分析",

第 33 页

Appearance Pointers 33

"goal": "给定同一物体从不同视角拍摄的两张图像,提供一个单一的整体一致性评分以及三个关键的二元/分类检查项(几何、清晰度、姿态)。唯一的输出必须是一个严格遵循定义输出结构的单一、有效的 JSON 对象,绝对不要包含任何前言、解释或结尾文本。", "prompt": "分析这两个物体视图。假设两张图像都是*同一 3D 模型*和*相同材质*的渲染结果。关键规则:在确定评分时,忽略所有像素化和分块伪影。在 0.0(不一致)到 1.0(完全一致)的范围内,对整体视觉一致性进行评分,涵盖感知匹配度、材质真实感和纹理细节。几何检查:如果 3D 形状/比例合理且一致,则将 is_geometrically_consistent 设置为 true;如果存在显著错误,则设置为 false。根据以下规则提供清晰度的比较整数评分:如果清晰度相同则为 0;如果视图 1 更模糊则为 -1;如果视图 2 更模糊则为 +1。此外,如果视图 1 和视图 2 具有不同的姿态方向,则将 is_novel_pose 设置为 true,否则设置为 false。为每个输出提供简短的一句话理由。确保你严格遵守评分标准并完全遵循它忽略两张图像中的白色背景。只关注物体本身。", "scoring_rubric": { "overall_consistency_score": { "0.9-1.0": "极佳匹配(几乎无法区分;在所有光照、纹理和感知方面具有极佳的一致性,忽略像素化)。", "0.7-0.89": "良好匹配(有明显的相似性,但在材质或光照方面存在轻微、细微的不一致)。", "0.4-0.69": "一般匹配(在一个或多个方面存在明显的不一致,例如颜色偏移或纹理涂抹)。", "0.0-0.39": "较差匹配(严重不一致;视图看起来像是不同的物体或材质)。" }, "is_geometrically_consistent": { "true": "3D 形状、比例和位置合理且一致(允许存在轻微伪影)。", "false": "存在显著的几何错误(失真、物体偏移、孔洞填充错误或比例错误)。" }, "sharpness_comparison_score": { "+1": "视图 2 明显更柔和,细节较少,或看起来比视图 1 更失焦(视图 2 是更模糊的图像)。", "0": "视图 1 和视图 2 之间的感知清晰度和细节水平在视觉上相同。", "-1": "视图 1 明显更柔和,细节较少,或看起来比视图 2 更失焦(视图 1 是更模糊的图像)。" }, "is_novel_pose": { "true": "新姿态:视图 2 经过旋转/变换,与视图 1 不同(差异显而易见)。", "false": "姿态无新意:视图 2 与视图 1 的方向相同(差异极小或不可见)。" } }, "output_structure": { "overall_consistency_score": "float (0.0 to 1.0)", "is_geometrically_consistent": "bool (one of: true, or false)", "sharpness_comparison_score": "integer (one of: -1, 0, or 1)", "is_novel_pose": "bool (one of: true, or false)", "overall_consistency_reason": "string (e.g., ’Low score due to clear color shift and texture smearing, NOT pixelation’ or ’N/A’)", "geometric_consistency_reason": "string (e.g., ’Significant geometric distortion is visible in View 2’ or ’N/A’)", "sharpness_comparison_reason": "string (e.g., ’Score is +1 because fine edges are lost in View 2’ or ’N/A’)", "pose_novelty_reason": "string (e.g., ’Pose is novel because it is rotated 30 degrees around up-down axis’ or ’N/A’)" } }

第 34 页

34 R. Sajnani 等

列表 1.5:对生成编辑的材质/纹理质量进行评分的示例

{ "task": "专家级图形 3D 形状与材质理解", "goal": "对物体图像与球体图像之间三个不同 PBR 属性的保真度进行数值评分。", "prompt": "分析两张图像(分割出的物体和球体)。在 0.0 到 1.0 的范围内,对球体上的材质属性和纹理准确反映物体本身属性的程度进行评分。独立评分 反照率/颜色粗糙度/光泽感知匹配度纹理/图案细节。以浮点数形式输出这三个分数。务必严格遵循评分标准并完全按照其执行忽略两张图像中的白色背景。仅关注物体和球体本身。", "scoring_rubric": { "perceptual_similarity": { "0.9-1.0": "极佳匹配(视觉上无法区分;球体完美捕捉了物体材质的“感觉”和真实感)。", "0.7-0.89": "良好匹配(球体清晰地代表了预期的材质,但外行可能能发现诸如光照交互不佳或模糊等细微缺陷)。", "0.4-0.69": "一般匹配(与真实物体相比,材质看起来具有合成感、塑料感或仅仅是“不对劲”,严重影响了可信度)。", "0.0-0.39": "较差匹配(材质无法识别或看起来是严重的简化;未能通过基本的真实感测试)。" }, "albedo_color": { "0.9-1.0": "极佳匹配(颜色、饱和度和亮度几乎相同)。", "0.7-0.89": "良好匹配(色相正确,但亮度或饱和度明显错误/偏差)。", "0.4-0.69": "一般匹配(颜色显著偏移;相关但色相不正确)。", "0.0-0.39": "较差匹配(根本不同的颜色)。" }, "roughness_gloss": { "0.9-1.0": "极佳匹配(高光和表面漫反射完美匹配观察到的光泽度/暗淡度)。", "0.7-0.89": "良好匹配(总体正确,但高光略微过锐或过宽)。", "0.4-0.69": "一般匹配(表面类型严重失真,例如,有光泽的塑料被渲染为暗淡的布料)。", "0.0-0.39": "较差匹配(属性完全颠倒)。" }, "pattern_detail": { "0.9-1.0": "极佳匹配(纹理图案、比例和方向完全相同)。", "0.7-0.89": "良好匹配(使用了正确的图案,但平铺、缩放或旋转略有错误)。", "0.4-0.69": "一般匹配(正确的纹理*类型*,但*具体图案*不同或贴图分辨率较差)。", "0.0-0.39": "较差匹配(应用了完全不同的图案)。" } }, "output_structure": { "perceptual_similarity_score": "float (0.0 to 1.0)", "albedo_color_fidelity_score": "float (0.0 to 1.0)", "roughness_gloss_fidelity_score": "float (0.0 to 1.0)", "texture_detail_fidelity_score": "float (0.0 to 1.0)", "albedo_color_reason": "string (e.g., ’Sphere’s color is too light’ or ’N/A’)", "roughness_gloss_reason": "string (e.g., ’Sphere is too shiny’ or ’N/A’)", "texture_detail_reason": "string (e.g., ’Sphere’s pattern is different than object as it contains….’ or ’N/A’)", "perceptual_consistency_reason": "string (e.g., ’Low perceptual similarity because ….. ’ or ’N/A’)"

} }

第 35 页

外观指针 35

参考文献

1. Balaji, Y., Nah, S., Huang, X., Vahdat, A., Song, J., Zhang, Q., Kreis, K., Ait- tala, M., Aila, T., Laine, S., et al.: ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers. arXiv preprint arXiv:2211.01324 (2022) 2. Bansal, A., Chu, H.M., Schwarzschild, A., Sengupta, S., Goldblum, M., Geiping, J., Goldstein, T.: Universal guidance for diffusion models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 843–852 (2023) 3. Bar-Tal, O., Yariv, L., Lipman, Y., Dekel, T.: Multidiffusion: Fusing diffusion paths for controlled image generation. Proceedings of Machine Learning Research (2023) 4. Cao, P., Zhou, F., Song, Q., Yang, L.: Controllable generation with text-to-image diffusion models: A survey. arXiv preprint arXiv:2403.04279 (2024) 5. Chen, M., Laina, I., Vedaldi, A.: Training-free layout control with cross-attention guidance. In: 2024 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). IEEE (2024) 6. Chen, X., Feng, Y., Chen, M., Wang, Y., Zhang, S., Liu, Y., Shen, Y., Zhao, H.: Zero-shot image editing with reference imitation. Advances in Neural Information Processing Systems 37 (2024) 7. Chen, X., Huang, L., Liu, Y., Shen, Y., Zhao, D., Zhao, H.: Anydoor: Zero-shot object-level image customization. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 6593–6602 (2024) 8. Chen, Z., Wu, J., Wang, W., Su, W., Chen, G., Xing, S., Zhong, M., Zhang, Q., Zhu, X., Lu, L., et al.: Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 24185–24198 (2024) 9. Couairon, G., Careil, M., Cord, M., Lathuiliere, S., Verbeek, J.: Zero-shot spa- tial layout conditioning for text-to-image diffusion models. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (2023) 10. Cui, X., Sun, Q., Wang, M., Li, L., Zhou, W., Li, H.: Layoutenc: Leveraging en- hanced layout representations for transformer-based complex scene synthesis. ACM Transactions on Multimedia Computing, Communications and Applications 21(4), 1–21 (2025) 11. Esser, P., Kulal, S., Blattmann, A., Entezari, R., Müller, J., Saini, H., Levi, Y., et al.: Scaling rectified flow transformers for high-resolution image synthesis. In: Proceedings of the 41st International Conference on Machine Learning (2024), https://proceedings.mlr.press/v235/esser24a.html 12. Ham, C., Hays, J., Lu, J., Singh, K.K., Zhang, Z., Hinz, T.: Modulating pretrained diffusion models for multimodal image synthesis. In: ACM SIGGRAPH 2023 Con- ference Proceedings (2023) 13. He, Y., Salakhutdinov, R., Kolter, J.Z.: Localized text-to-image generation for free via cross attention control. arXiv preprint arXiv:2306.14636 (2023) 14. Jia, C., Luo, M., Dang, Z., Dai, G., Chang, X., Wang, M., Wang, J.: Ssmg: Spatial- semantic map guided diffusion model for free-form layout-to-image generation. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 38 (2024) 15. Jiang, R., Zheng, G.C., Li, T., Yang, T.R., Wang, J.D., Li, X.: A survey of multi- modal controllable diffusion models. Journal of Computer Science and Technology 39(3), 509–541 (2024) 16. Kim, Y., Lee, J., Kim, J.H., Ha, J.W., Zhu, J.Y.: Dense text-to-image genera- tion with attention modulation. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 7701–7711 (2023)

第 36 页

36 R. Sajnani 等

17. Labs, B.F.: Flux.1: Flux 开放权重模型的官方推理仓库。https://github.com/black-forest-labs/flux (2024) 18. Labs, B.F., Batifol, S., Blattmann, A., Boesel, F., Consul, S., Diagne, C., Dockhorn, T., English, J., English, Z., Esser, P., Kulal, S., Lacey, K., Levi, Y., Li, C., Lorenz, D., Muller, J., Podell, D., Rombach, R., Saini, H., Sauer, A., Smith, L.: Flux.1 kontext: 潜在空间中用于上下文图像生成和编辑的流匹配。ArXiv abs/2506.15742 (2025), https://api.semanticscholar.org/CorpusID:279464475 19. Li, Y., Liu, H., Wu, Q., Mu, F., Yang, J., Gao, J., Li, C., Lee, Y.J.: Gligen: 开放集接地文本到图像生成。载于:IEEE/CVF 计算机视觉与模式识别会议论文集 (2023) 20. Li, Z., Wu, J., Koh, I., Tang, Y., Sun, L.: 基于局部感知掩码自适应的布局图像合成。载于:IEEE/CVF 国际计算机视觉会议论文集 (2021) 21. Liu, C., Liu, D.: 用于可控图像合成的后期约束扩散引导。arXiv 预印本 arXiv:2305.11520 (2023) 22. Liu, J., Huang, T., Xu, C.: 面向布局到图像合成的无训练复合场景生成。载于:欧洲计算机视觉会议。第 37–53 页。Springer (2024) 23. Lukovnikov, D., Fischer, A.: 通过交叉注意力控制使 ControlNet 遵循局部化描述。载于:欧洲机器学习与数据库知识发现联合会议。第 310–327 页。Springer (2025) 24. Mao, C., Zhang, J., Pan, Y., Jiang, Z., Han, Z., Liu, Y., Zhou, J.: Ace++: 通过上下文感知内容填充进行基于指令的图像创建和编辑。arXiv 预印本 arXiv:2501.02487 (2025) 25. Mao, J., Wang, X.: 无训练的位置感知文本到图像合成。载于:2023 IEEE 国际图像处理会议 (ICIP)。IEEE (2023) 26. Mao, J., Wang, X., Aizawa, K.: 通过扩散模型中的初始图像编辑引导图像合成。载于:第 31 届 ACM 国际多媒体会议论文集 (2023) 27. Mao, J., Wang, X., Aizawa, K.: 扩散模型中引导图像合成的语义驱动初始图像构建。arXiv 预印本 arXiv:2312.08872 (2023) 28. Mishchenko, K., Defazio, A.: Prodigy: 一种快速自适应的无参数学习者。ArXiv abs/2306.06101 (2023), https://api.semanticscholar.org/CorpusID:259129271 29. Mo, S., Mu, F., Lin, K.H., Liu, Y., Guan, B., Li, Y., Zhou, B.: Freecontrol: 使用任意条件对任意文本到图像扩散模型进行无训练的空间控制。载于:IEEE/CVF 计算机视觉与模式识别会议论文集 (2024) 30. Mou, C., Wang, X., Xie, L., Wu, Y., Zhang, J., Qi, Z., Shan, Y., Qie, X.: T2i-adapter: 学习适配器以挖掘文本到图像扩散模型更多的可控能力。arXiv 预印本 arXiv:2302.08453 (2023) 31. Niu, Y., Wu, L., Zhang, Y., Zhu, Y., Zhu, G., Wang, J.: 面向语义图像合成的多模型风格感知扩散学习。ACM 多媒体计算、通信与应用学报 20(11) (2024) 32. Oquab, M., Darcet, T., Moutakanni, T., Vo, H., Szafraniec, M., Khalidov, V., Fernandez, P., Haziza, D., Massa, F., El-Nouby, A., 等: Dinov2: 无监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193 (2023) 33. Peng, B., Wang, J., Zhang, Y., Li, W., Yang, M.C., Jia, J.: Controlnext: 强大且高效的图像和视频生成控制。arXiv 预印本 arXiv:2408.06070 (2024年11月)

第 37 页

外观指针 37

34. Phung, Q., Ge, S., Huang, J.B.: Grounded text-to-image synthesis with attention refocusing. arXiv preprint arXiv:2306.05427 (2023) 35. Qi, Z., Huang, G., Huang, Z., Guo, Q., Chen, J., Han, J., Wang, J., Zhang, G., Liu, L., Ding, E., et al.: Layered rendering diffusion model for zero-shot guided image synthesis. arXiv preprint arXiv:2311.18435 (2023) 36. Ren, T., Liu, S., Zeng, A., Lin, J., Li, K., Cao, H., Chen, J., Huang, X., Chen, Y., Yan, F., et al.: Grounded sam: Assembling open-world models for diverse visual tasks. arXiv preprint arXiv:2401.14159 (2024) 37. Saha, O., Krs, V., Mech, R., Maji, S., Blackburn-Matzen, K., Gadelha, M.: Sigma- gen: Structure and identity guided multi-subject assembly for image generation. arXiv preprint arXiv:2510.06469 (2025) 38. Shirakawa, T., Uchida, S.: Noisecollage: A layout-aware text-to-image diffusion model based on noise cropping and merging. arXiv preprint arXiv:2403.03485 (2024) 39. Shuai, X., Ding, H., Ma, X., Tu, R., Jiang, Y.G., Tao, D.: A survey of multimodal-guided image editing with text-to-image diffusion models. arXiv preprint arXiv:2406.14555 (2024) 40. Song, W., Jiang, H., Yang, Z., Quan, R., Yang, Y.: Insert anything: Image insertion via in-context editing in dit. arXiv preprint arXiv:2504.15009 (2025) 41. Sun, W., Li, T., Lin, Z., Zhang, J.: Spatial-aware latent initialization for control- lable image generation. arXiv preprint arXiv:2401.16157 (2024) 42. Taghipour, A., Ghahremani, M., Bennamoun, M., Rekavandi, A.M., Laga, H., Boussaid, F.: Box it to bind it: Unified layout control and attribute binding in text-to-image diffusion models. IEEE transactions on multimedia (2025) 43. Tan, Z., Liu, S., Yang, X., Xue, Q., Wang, X.: Ominicontrol: Minimal and universal control for diffusion transformer. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 14940–14950 (2025) 44. Tian, Y., Tu, Z., Chen, H., Hu, J., Xu, C., Wang, Y.: U-dits: Downsample tokens in u-shaped diffusion transformers. In: Advances in Neural Information Processing Systems (NeurIPS) 37 (2024) 45. Touvron, H., Cord, M., Sablayrolles, A., Synnaeve, G., J’egou, H.: Going deeper with image transformers. 2021 IEEE/CVF International Conference on Computer Vision (ICCV) pp. 32–42 (2021), https://api.semanticscholar.org/CorpusID: 232428161 46. Wang, J., Hu, J., Ma, X., Ma, H., Wei, X., Wu, E.: Image editing with diffusion models: A survey. arXiv preprint arXiv:2504.13226 (2025) 47. Wang, J., Chan, K.C., Loy, C.C.: Exploring clip for assessing the look and feel of images. In: Proceedings of the AAAI conference on artificial intelligence. vol. 37, pp. 2555–2563 (2023) 48. Wang, W., Bao, J., Zhou, W., Chen, D., Chen, D., Yuan, L., Li, H.: Semantic image synthesis via diffusion models. arXiv preprint arXiv:2207.00050 (2022) 49. Wang, X., Fu, S., Huang, Q., He, W., Jiang, H.: MS-diffusion: Multi-subject zero- shot image personalization with layout guidance. In: The Thirteenth International Conference on Learning Representations (2025), https://openreview.net/forum? id=PJqP0wyQek 50. Wang, X., Darrell, T., Rambhatla, S.S., Girdhar, R., Misra, I.: Instancediffusion: Instance-level control for image generation (2024) 51. Wang, Y., Zhang, W., Zheng, J., Jin, C.: Enhancing object coherence in layout-to- image synthesis. arXiv preprint arXiv:2311.10522 (2023)

第 38 页

38 R. Sajnani 等

52. Wei, Y., Zheng, Y., Zhang, Y., Liu, M., Ji, Z., Zhang, L., Zuo, W.: Personalized image generation with deep generative models: A decade survey. arXiv preprint arXiv:2502.13081 (2025) 53. Xiao, J., Li, L., Lv, H., Wang, S., Huang, Q.: R&b: Region and boundary aware zero-shot grounded text-to-image generation. arXiv preprint arXiv:2310.08872 (2023) 54. Xie, J., Li, Y., Huang, Y., Liu, H., Zhang, W., Zheng, Y., Shou, M.Z.: Boxdiff: Text- to-image synthesis with training-free box-constrained diffusion. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (2023) 55. Xue, H., Huang, Z., Sun, Q., Song, L., Zhang, W.: Freestyle layout-to-image syn- thesis. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023) 56. Yang, A., Li, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Gao, C., Huang, C., Lv, C., et al.: Qwen3 technical report. arXiv preprint arXiv:2505.09388 (2025) 57. Yang, B., Luo, Y., Chen, Z., Wang, G., Liang, X., Lin, L.: Law-diffusion: Com- plex scene generation by diffusion with layouts. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (2023) 58. Yang, P., Cheung, N.M., Ma, X.: Text to image generation and editing: A survey. arXiv preprint arXiv:2505.02527 (2025) 59. Zeng, Y., Lin, Z., Zhang, J., Liu, Q., Collomosse, J., Kuen, J., Patel, V.M.: Scenecomposer: Any-level semantic image synthesis. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023) 60. Zhan, Z., Chen, D., Mei, J.P., Zhao, Z., Chen, J., Chen, C., Lyu, S., Wang, C.: Conditional image synthesis with diffusion models: A survey. arXiv preprint arXiv:2409.19365 (2024) 61. Zhang, H., Duan, Z., Wang, X., Chen, Y., Zhang, Y.: Eligen: Entity-level controlled image generation with regional attention. arXiv preprint arXiv:2501.01097 (2025) 62. Zhang, H., Wang, S., Li, J., Wu, Z., et al.: Seg2any: Open-set segmentation- mask-to-image generation with precise shape and semantic control. arXiv preprint arXiv:2506.00596 (2025) 63. Zhang, L., Rao, A., Agrawala, M.: Adding conditional control to text-to-image diffusion models. In: ICCV (2023) 64. Zhao, P., Li, H., Jin, R., Zhou, S.K.: Loco: Locally constrained training-free layout- to-image synthesis. arXiv preprint arXiv:2311.12342 (2023) 65. Zhao, S., Chen, D., Chen, Y.C., Bao, J., Hao, S., Yuan, L., Wong, K.Y.K.: Uni- controlnet: All-in-one control to text-to-image diffusion models. Advances in Neural Information Processing Systems 36 (2024) 66. Zheng, G., Zhou, X., Li, X., Qi, Z., Shan, Y., Li, X.: Layoutdiffusion: Controllable diffusion model for layout-to-image generation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023) 67. Zheng, Z., Isobe, T., Shen, T., Jia, X., Zhao, J., Li, X., Ge, M., Li, B., Wang, Q., Li, D., et al.: Layout-conditioned autoregressive text-to-image generation via structured masking. arXiv preprint arXiv:2509.12046 (2025) 68. Zhou, D., Li, M., Yang, Z., Yang, Y.: Dreamrenderer: Taming multi- instance attribute control in large-scale text-to-image models. arXiv preprint arXiv:2503.12885 (2025) 69. Zhou, D., Xie, J., Yang, Z., Yang, Y.: 3dis-flux: simple and efficient multi-instance generation with dit rendering. arXiv preprint arXiv:2501.05131 (2025)

发表评论