快速导读:PC-Edit的关键区别在于,它不再依赖终端预测或速度场,而是利用提示对比注意力输出(AttnOut)来发现编辑区域。这种方法能够更精确地捕捉语义变化,从而解决传统方法的空间定位模糊问题。
随着MM-DiT架构如FLUX在文本到图像生成中的普及,无掩码图像编辑面临新的挑战。现有方法如DiffEdit和Follow-Your-Shape(FYS)在空间定位精度上存在局限,导致编辑区域模糊或背景失真。
PC-Edit提出了一种训练-free的编辑框架,通过提示对比注意力输出(AttnOut)自动发现编辑区域,并分离建模源擦除与目标生成过程。该方法在同一步骤中注入缓存的源K/V特征,有效防止背景漂移,显著提升了复杂对象替换任务的性能。
英文题目:PC-Edit: Prompt-Contrastive Region Discovery and Region-Guided Editing
论文出处:arXiv 每日论文精选 · arXiv:2607.21318
原始论文:PDF / 论文页面
对应视频标题:PC-Edit:无需掩码的精准图像编辑|推荐指数:★★★★★
这篇论文解决什么问题?
传统无掩码编辑方法依赖于噪声预测或速度场的对比,但这些信号在去噪过程中容易稀释或失配。例如,DiffEdit通过比较噪声预测来定位编辑区域,但在MM-DiT架构中,这种对比往往导致信号模糊,无法精确定位。
FYS方法通过比较不同轨迹下的速度场来发现编辑区域,但由于状态不匹配问题,其在处理形状变化大的对象替换时表现不佳。此外,现有方法通常无法区分源对象的擦除和目标对象的生成,导致编辑残留或背景失真。
因此,亟需一种能够自动发现编辑区域并精确控制编辑过程的方法,以解决无掩码编辑中的空间定位和背景保真问题。
核心创新
方法概览
PC-Edit的关键区别在于,它不再依赖终端预测或速度场,而是利用提示对比注意力输出(AttnOut)来发现编辑区域。这种方法能够更精确地捕捉语义变化,从而解决传统方法的空间定位模糊问题。
- PC-Edit的核心在于利用提示对比注意力输出(AttnOut)来定位编辑区域。具体而言,它在相同的潜在状态下,对比源提示和目标提示下的图像token注意力输出,从而发现需要编辑的区域。
- 该方法分离建模源擦除(Msrc)和目标生成区域。在反转过程中,它缓存源K/V特征并估计源擦除掩码;在去噪过程中,它跟踪目标生成掩码,并将两者结合以确定最终的编辑区域。
- 在同一步骤中,PC-Edit将缓存的源K/V特征注入到编辑区域之外,以保留无关内容的背景保真度。这种同步骤注入机制有效防止了背景漂移。
- 为了评估自动区域发现的性能,PC-Edit引入了EditRegion-Bench基准,包含484个案例,涵盖单对象和多对象的添加与替换任务。
逐图理解论文
现有方法的局限

以DiffEdit为例,它通过比较噪声预测来定位编辑区域。然而,在MM-DiT架构中,这种信号容易稀释,导致编辑区域模糊。当尝试替换形状差异大的对象时,源对象往往无法完全清除,背景也可能出现失真。
核心区别

PC-Edit的关键区别在于,它不再依赖终端预测或速度场,而是利用提示对比注意力输出(AttnOut)来发现编辑区域。这种方法能够更精确地捕捉语义变化,从而解决传统方法的空间定位模糊问题。
方法贡献

图2概述了PC-Edit的流程。反转过程缓存源K/V特征并估计源擦除掩码Msrc;去噪过程跟踪目标生成掩码,结合Msrc,并在同一步骤中将源K/V注入到结果区域之外,以保留无关内容。
最强结论

图5展示了源擦除建模的效果。显式的Msrc抑制了竞争方法和无Msrc变体中观察到的源纹理残留。注意对比有无Msrc时的源对象清除效果。
意义与局限

PC-Edit为无掩码图像编辑提供了一种高效且精准的解决方案,尤其在复杂对象替换任务中表现突出。然而,其性能依赖于固定的推理配置,且对语义对比弱的提示可能定位不准。以上就是这篇论文的核心内容,感谢收听。
实验如何设计?
- 实验在EditRegion-Bench和PIE-Bench上进行,对比了多种无掩码基线方法(如PnP、MasaCtrl、FYS)和掩码引导参考方法(如FLUX.1-Fill、KV-Edit)。
- 消融研究分析了不同定位信号、块选择和组件必要性(如Msrc、动态掩码)对性能的影响。
- 使用Qwen2.5-VL进行自动评估,以衡量源擦除质量,包括源残留率(SRR)、区域变化率(REFR)和有效源擦除率(ESER)。
关键结果与论文证据
- 在EditRegion-Bench上,PC-Edit在无掩码方法中取得了最佳的AS(6.62)、PSNR(34.37)、LPIPS(16.40)、CLIPsim(28.44)和ESER(82.44)指标(第6页)。
- 在PIE-Bench上,PC-Edit同样在无掩码方法中表现最佳,AS为6.58,PSNR为29.71,LPIPS为38.92,CLIPsim为26.42,ESER为67.50(第6页)。
- Delta AttnOut信号在定位精度上最高,AP为74.4,mIoU为40.4,优于其他信号(第6页)。
- 添加Msrc组件后,EditRegion-Bench替换案例的ESER从72.18%提升至82.44%,证明了源擦除建模的重要性(第7页)。
阅读时需要注意
- PC-Edit需要固定的推理配置和特定的块/时间步选择以达到最佳性能,限制了其灵活性。
- 如果源和目标提示引起的语义对比较弱,定位精度可能会下降。
- 该方法未明确处理编辑区域极小或分散的情况,可能导致定位不准确。
关联工作
- DiffEdit通过比较噪声预测来定位编辑区域,但信号容易稀释(第1页)。
- FYS通过比较不同轨迹下的速度场来发现编辑区域,但存在状态不匹配问题(第1页)。
- FLUX.1-Fill和KV-Edit是掩码条件方法,需要用户输入掩码(第1页)。
- Plug-and-Play方法重用特征但未明确区分编辑区域(第2页)。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
PC-Edit:提示对比区域发现与区域引导编辑
Jian Zhang1, Zhijun Zhang1 1华南理工大学电子与信息工程学院,中国广州 202411084134@mail.scut.edu.cn, auzjzhang@scut.edu.cn 项目主页:https://jianzhang-chick.github.io/PC-Edit/
摘要
类别、剪影和空间范围。成功的替换必须完全移除源对象,允许目标以其自身形状形成,并保留无关内容。将类别或形状不同的对象进行替换,需要完整的源对象移除、不受源剪影约束的自然目标形成,以及无关内容的保留。在没有用户提供编辑区域掩码的情况下,替换任务的核心挑战在于自动区域发现。现有的免训练编辑器要么通过源特征和提示词下的终端预测来定位编辑区域,要么通过空间非选择性的源特征复用而无需显式区域发现来保留无关内容。在到达终端预测之前,提示诱导的语义差异会经历额外的网络变换,这可能会模糊其空间定位,从而降低定位精度。空间非选择性的特征复用迫使编辑完整性与背景保留之间进行权衡。因此,我们提出了 PC-Edit,一种用于免训练 MM-DiT 编辑的提示对比框架。PC-Edit 对比源反转和目标编辑轨迹中跨 token 的速度差异,捕捉提示诱导的语义差异,这些差异直接在文本条件信息传递给图像 token 的地方被捕获。相同的对比在反转期间识别源擦除区域,在去噪期间识别目标出现区域。它们的并集抑制了源残留,同时允许目标自然形成。PC-Edit 进一步在每个采样步骤中通过从先前注意力块估计当前编辑区域,并在后续块中立即在其外部注入缓存的源 K/V 特征,从而在区域发现和背景保留之间建立耦合,以此在潜在更新之前保护无关内容。在 PIE-Bench 和我们提出的 EditRegion-Bench(包含单目标和多目标添加及替换的人工验证编辑区域标注)上的实验表明,PC-Edit 在无需用户指定编辑区域的方法中,实现了最佳的编辑质量和背景保留。
引言
文本到图像生成已从基于 UNet 的潜在扩散模型 (Rombach et al. 2022) 迅速转向基于 Transformer 主干网络 (Peebles and Xie 2023),这些网络使用流匹配 (Lipman et al. 2023; Liu, Gong, and Liu 2023) 进行训练,例如 SD3 (Esser et al. 2024) 和 FLUX (Black Forest Labs 2024)。基于这些模型,免训练文本引导编辑通过改进的反转 (Mokady et al. 2023; Ju et al. 2024; Rout et al. 2025; Wang et al. 2025) 和内部特征操作 (Hertz et al. 2022; Cao et al. 2023; Tumanyan et al. 2023; Avrahami et al. 2025),实现了多样化的局部和全局修改。然而,当源对象和目标对象在类别、剪影和空间范围上存在显著差异时,对象替换仍然困难。成功的替换必须完全移除源对象,允许目标以其自身形状形成,并保留无关内容。在没有用户提供编辑区域掩码的情况下,替换任务的核心挑战在于自动区域发现。掩码条件方法如 FLUX.1-Fill (Black Forest Labs 2024) 和 KV-Edit (Zhu et al. 2025) 可以很好地保留背景,但将定位的负担转移给用户,并将目标对象限制在规定的区域内。自动方法则从提示条件终端预测中推导编辑区域。DiffEdit (Couairon et al. 2023) 比较两个提示下的噪声预测,而 Follow-Your-Shape (FYS) (Long et al. 2026) 比较源和目标下的图像 token 注意力输出。然而,当产生终端预测时,后续的网络变换可能已经模糊了提示诱导的语义差异的空间响应。FYS 中的跨轨迹比较还会改变潜在状态,引入轨迹不匹配和求解器误差的干扰。这些因素降低了空间定位精度。
为了解决这些问题,我们提出了 PC-Edit,一种用于免训练 MM-DiT 编辑的提示对比框架。如图 1 所示,PC-Edit 支持单目标和多目标的添加与替换,无需用户提供掩码,同时自动发现编辑区域。在相同的潜在状态和时间步,PC-Edit 对比源和目标提示下图像 token 的注意力输出。由于这些输出通过联合注意力将文本条件信息写入图像 token,它们的差异直接揭示了哪些图像位置对提示变化做出响应,提供了比终端预测更直接、更准确的定位信号。然而,仅靠准确定位对于大形状替换是不够的,因为源擦除和目标出现的足迹不必重合。仅跟随出现目标的掩码可能会留下源对象残留,而仅限于源足迹的掩码则会抑制目标的自然形状。PC-Edit 在反转期间应用相同的对比以识别源擦除区域,在去噪期间跟踪目标出现区域。它们的并集抑制了源对象残留,同时允许目标超出源剪影延伸。PC-Edit 进一步将区域发现和保留耦合,通过从先前注意力块估计当前编辑区域,并在后续块中立即在其外部注入缓存的源 K/V 特征,从而在潜在更新之前保护无关内容。
第 2 页
源图像 单对象 双对象 三对象 一位女士坐在咖啡馆里。 一位女士坐在咖啡馆里,桌上有一块蛋糕和一杯咖啡。 任务 添加 一位女士坐在咖啡馆里,戴着黑框眼镜。 一位女士坐在咖啡馆里,戴着耳环、灰色帽子和珍珠项链。
一个女孩正在玩 玩具桶和球。 一只狗正在玩玩具桶和球。 一个女孩正在玩泰迪熊和球。 一个女孩正在玩一辆玩具卡车。 对象 单对象替换
一只小狗和一只橘猫… 一辆自行车和一辆汽车… 对象 双对象替换 一只狐狸和一只鹅… 米老鼠和唐老鸭… 一个装有西瓜、柠檬和樱桃的水果盘… 一个水果盘……,一个花瓶……,一个盛有芒果汁、挞和吐司的甜点盘。 对象 三对象替换 一个水果盘……,一个花瓶 一个水果盘……,一个插着郁金香、红玫瑰和牡丹的花瓶……,一个甜点盘……
图 1:PC-Edit 的视觉结果。每个示例将编辑后的图像(左)与其自动发现的编辑区域(右)配对,涵盖单对象和多对象的添加与替换。
在每个采样步骤内进行。它从之前的注意力块中估计当前的编辑区域,并在随后的块中立即注入该区域外的缓存源 K/V 特征。这种同一步骤设计利用最新的区域估计来指导每个潜在更新,从而减少背景漂移。为了评估自动区域发现和编辑质量,我们引入了 EditRegion-Bench,这是一个包含 484 个案例的基准测试,用于单对象和多对象的添加与替换,并配有手动标注的编辑区域。在 EditRegion-Bench 和 PIE-Bench 上的大量实验验证了所提出的定位和编辑机制的有效性。我们的主要贡献如下: • 我们识别出 MM-DiT 图像标记注意力输出在源提示和目标提示下的差异,作为一种有效的编辑区域定位信号,并开发了一种相应的提示对比定位方法。 • 我们开发了一种编辑机制,分别对源擦除区域和目标出现区域进行建模,并在同一步骤中将源 K/V 特征注入它们并集之外的区域,允许目标在不受源轮廓约束的情况下形成,同时抑制源残留并保留无关内容。 • 我们引入了 EditRegion-Bench,这是一个包含 484 个案例的基准测试,配有手动标注的编辑区域,用于单对象和多对象编辑,能够评估编辑区域定位、背景保真度和视觉质量。 • 在 EditRegion-Bench 和 PIE-Bench 上的实验表明,PC-Edit 在无编辑区域定位的方法中实现了最佳的编辑质量和背景保留。
相关工作 免训练图像编辑。免训练编辑方法使用冻结的预训练文本到图像模型对图像进行修改,通常通过源图像反演和内部特征操作实现。在基于 UNet 的扩散模型上,Prompt-to-Prompt (Hertz et al. 2022) 控制交叉注意力,Null-text Inversion (Mokady et al. 2023) 和 Direct Inversion (Ju et al. 2024) 改进了重建,而 MasaCtrl (Cao et al. 2023) 和 Plug-and-Play (Tumanyan et al. 2023) 重用内部特征以保留结构。最近的方法将这些思想扩展到扩散变换器和整流流模型。DiT4Edit (Feng et al. 2025)、RF-Inversion (Rout et al. 2025) 和 RF-Edit (Wang et al. 2025) 改进了反演或轨迹恢复,而 FlowEdit (Kulikov et al. 2025) 构建了直接的源到目标传输路径。Stable Flow (Avrahami et al. 2025) 通过特征注入保留源结构。然而,这些方法侧重于提高反演保真度、源到目标传输或通过注意力和特征控制进行内容保留,而没有明确的编辑区域定位。
自动区域发现和区域引导编辑。掩码条件方法如 FLUX.1-Fill (Black Forest Labs 2024) 和 KV-Edit (Zhu et al. 2025) 实现了强大的背景保留,但需要用户提供区域,并将目标对象限制在该区域内。无掩码方法则从提示条件化的
第 3 页
双单双单 源提示:一只灰狼,流模块 流模块 流模块 流模块 一只白羊,以及一只白 鹅并排站在沙土小径上,平均 𝑀𝑀src
VAE 双单双单 编码 流模块 流模块 ⋯ 流模块 ⋯ 流模块 流模块
来自 源图像 𝑥𝑥0 ⋯ 𝑥𝑥𝑇𝑇−1 𝑥𝑥𝑇𝑇 的掩码 ⋯ 𝑥𝑥𝑇𝑇 注入来自𝑀𝑀src的K/V 目标 去噪轨迹 注入来自源 单 单 双 双 VAE 反转轨迹 流模块 流模块 流模块 流模块 解码
使用特征 源提示潜在变量 目标图像 𝑧𝑧0 ⋯𝑧𝑧1 𝑧𝑧𝑇𝑇 目标提示:一只白鸭, 前向传播tgt 提示与 Otsubinary 一只红狐,以及一只白山羊并排站在沙土 𝑀𝑀𝑠𝑠𝑠𝑠𝑠𝑠U𝑀𝑀1 单 双 𝑀𝑀srcU𝑀𝑀𝑇𝑇 单 双 逐元素 MM-DiT 小径上 流模块 流模块 流模块 流模块 减法
图 2:PC-Edit 概述。反转过程缓存源 K/V 特征并估计源擦除掩码 Msrc。去噪过程跟踪目标出现掩码,将其与 Msrc 结合,并在同一采样步骤中在结果区域之外注入源 K/V,以保留无关内容。
预测。DiffEdit (Couairon et al. 2023) 比较基于源提示和目标提示的条件噪声预测,而 FYS (Long et al. 2026) 比较沿源反转和目标去噪轨迹的速度预测。然而,由于这些信号是从终端预测中读取的,后续的网络变换可能已经模糊了由提示引起的语义差异的空间响应。FYS 中的跨轨迹比较还会改变潜在状态,这可能会引入轨迹不匹配和求解器误差。此外,单个编辑区域并未明确区分源擦除区域和目标出现区域。PC-Edit 改为在同一潜在状态和时间步长下从图像标记注意力输出 (Vaswani et al. 2017) 读取提示对比,分别对源擦除和目标出现进行建模,并在同一采样步骤内应用区域引导的源 K/V 注入。
方法论
给定源图像 Isrc 和源提示与目标提示 (csrc, ctgt),PC-Edit 在执行所需的对象添加或替换的同时保留无关内容。如图 2 所示,该方法包括源反转和目标去噪。在反转过程中,我们将源潜在变量 x0 映射到 xT,缓存源 K/V 特征,并估计源擦除区域。从 zT = xT 开始,去噪过程动态跟踪目标出现区域,并使用由此产生的编辑区域指导同一步骤的源 K/V 注入。
动机
将提示对比与状态不匹配解耦。
轨迹发散方法 (Long et al. 2026) 比较在 csrc 下的源反转轨迹 {xt} 和在 ctgt 下的目标去噪轨迹 {zt}。其速度差异同时改变了提示和潜在状态,并且可以分解为
vθ(zt, ctgt) −vθ(xt, csrc) = vθ(xt, ctgt) −vθ(xt, csrc) | 提示对比,{z 共享状态 } + vθ(zt, ctgt) −vθ(xt, ctgt) . | 状态不匹配,{z 共享提示 } (1)
第一项测量在共享潜在状态下的提示条件变化,而第二项反映了反转和去噪状态之间的差异,包括轨迹不匹配和求解器误差。为了避免这种状态依赖的干扰,PC-Edit 仅改变文本条件,同时保持潜在状态和时间步长固定。
从注意力输出读取提示对比。状态匹配决定了应如何比较源提示和目标提示,但仍留下了从何处获取其差异的问题。现有的差异方法从终端噪声或速度预测中读取提示对比 (Couairon et al. 2023; Long et al. 2026)。在达到这些预测之前,由文本-图像交互产生的提示条件响应会经历进一步的网络处理。这些后续变换可能会稀释由提示引起的语义对比,并使其空间定位性降低。因此,我们寻求一个更接近文本条件调节图像标记的内部读取点。在 MM-DiT 骨干网络中,文本和图像标记通过联合注意力进行交互。对于每个图像标记,联合注意力将源自文本的值内容整合到图像侧的注意力输出 AttnOut 中,该输出携带了文本条件对图像表示的调节。因此,其源-目标差异为定位由提示变化引起的空间响应提供了更直接的信号。
将源擦除与目标出现分离。
预测差异方法,如 DiffEdit (Couairon et al. 2023) 和 FYS (Long et al. 2026),推导出一个编辑区域,但未明确区分源足迹
第 4 页
必须从目标对象应出现的区域中擦除。这种区分在源对象和目标对象在形状或空间范围上存在显著差异时变得至关重要。同时,像 Plug-and-Play (Tumanyan et al. 2023)、MasaCtrl (Cao et al. 2023) 和 Stable Flow (Avrahami et al. 2025) 这样的特征复用方法并未明确区分应保留源特征的区域与应保持目标驱动的区域。在必须更改的区域复用源特征可能会留下源残留物或阻碍目标形成,而削弱复用则会降低对无关内容的保护。PC-Edit 通过分别建模源擦除区域和目标出现区域,并仅在它们的并集外部注入源 K/V 特征,来解决这种“保留性-可编辑性”权衡。
并集涵盖了消失的源对象和出现的目标对象。由于后期阶段的对比响应对于定位变得不可靠,我们在步骤 $t_s$ 冻结该区域。
PC-Edit 我们引入 PC-Edit,这是一个提示对比框架,它分别在反演和去噪过程中自动发现源擦除区域和目标出现区域,并在每个区域引导采样步骤中,在它们的并集外部注入源 K/V 特征。
提示对比定位信号。令 $B_{loc}$ 表示用于区域定位的注意力块集合。在时间步 $t$,PC-Edit 对同一潜在变量进行两次前向传播,分别以 $c_{src}$ 和 $c_{tgt}$ 为条件,并计算 $$ \Delta \text{AttnOut}_t = \frac{1}{|B_{loc}|} \sum_{b \in B_{loc}} \| \text{AttnOut}_{t,b}^{tgt} – \text{AttnOut}_{t,b}^{src} \| \quad (2) $$ 其中对特征通道的范数产生逐 token 的热图。潜在变量在反演时为 $x_t$,在去噪时为 $z_t$,因此两次前向传播仅在条件上不同。由于 $B_{loc}$ 位于 $B_{inj}$ 之前,当前编辑区域在源 K/V 注入之前被定位,从而防止注入的特征影响定位信号。
反演过程中的源擦除足迹。沿着源反演轨迹,我们在每个时间步缓存注入块 $B_{inj}$ 的键和值特征,记为 $\{K_{t,b}^{src}, V_{t,b}^{src}\}_{b \in B_{inj}}$。这些缓存的特征随后被用于锚定应保持不变的区域。
对于对象替换,我们在反演过程中估计源擦除足迹。具体而言,在每个选定的时间步 $t$,我们在相同的反演潜在变量 $x_t$ 上执行额外的目标条件前向传播以计算 $\Delta \text{AttnOut}_t$。接近干净端点的响应往往较弱,而接近噪声端点的响应则在空间上扩散。由于中间状态既保留了可识别的源结构,又提供了清晰的源-目标对比,我们选择一个中间时间步窗口 $T_{probe}$,对生成的热图取平均,并应用 Otsu 阈值 (Otsu 1975): $$ H_{src} = \sum_{t \in T_{probe}} \Delta \text{AttnOut}_t, \quad M_{src} = \text{Binarize}(H_{src}, \text{Otsu}(H_{src})) \quad (3) $$ 这里,$\text{Binarize}(H, \tau)$ 在 $\tau$ 处应用逐元素阈值,将高于阈值的响应赋值为 1,否则为 0。$M_{src}$ 标识了必须禁用源 K/V 注入以移除原始对象的位置。对于对象添加,无需擦除源对象,因此我们设 $M_{src} = 0$。
去噪过程中的目标出现追踪。在去噪步骤 $t$,在注入源 K/V 之前,我们从当前潜在变量 $z_t$ 出发,分别以 $c_{src}$ 和 $c_{tgt}$ 为条件运行两次前向传播,并从定位块 $B_{loc}$ 计算 $\Delta \text{AttnOut}_t$。然后应用 Otsu 阈值以获得目标出现掩码 $M_t$。 在去噪早期,$M_t$ 通常较宽,允许目标对象超出源轮廓。随着去噪的进行,$M_t$ 逐渐收缩围绕目标对象的出现形状。我们将源擦除和目标出现结合为 $$ R_t = \begin{cases} M_{src} \cup M_t, & t \le t_s \\ R_{t_s}, & t > t_s \end{cases} \quad (4) $$
PC-Edit 我们引入 PC-Edit,这是一个提示对比框架,它分别在反演和去噪过程中自动发现源擦除区域和目标出现区域,并在每个区域引导采样步骤中,在它们的并集外部注入源 K/V 特征。
同一步骤区域引导的 K/V 注入。PC-Edit 首先从 $R_t$ 定位块 $B_{loc}$ 的提示对比响应构建 $R_t$,然后立即使用它来指导后续块 $B_{inj}$ 中的源 K/V 注入。 对于每个 $b \in B_{inj}$,我们计算 $$ K_{t,b} = R_t \odot K_{t,b}^{tgt} + (1 – R_t) \odot K_{t,b}^{src}, \quad V_{t,b} = R_t \odot V_{t,b}^{tgt} + (1 – R_t) \odot V_{t,b}^{src} \quad (5) $$ 二元掩码 $R_t$ 在特征通道上广播,并仅应用于图像 token。$R_t$ 内部的特征保持目标驱动,而 $R_t$ 外部的区域由缓存的源 K/V 特征锚定,以保留无关内容。
在最初的去噪步骤中,我们在短暂的预热窗口 $T_{warm}$ 内应用全局源 K/V 注入,以将早期潜在演化锚定到源布局和外观,然后再切换到区域引导的 K/V 注入。
实验 实现 我们使用 FLUX.1-dev (Black Forest Labs 2024) 作为骨干网络,在单个 NVIDIA A800 GPU 上评估 PC-Edit。我们使用 15 步反演和 15 步去噪,分辨率为 $1024 \times 1024$。根据图 6 中的块和时间步分析,我们将 $B_{loc}$ 设置为双流块 13–18 和最后 18 个单流块。对于替换,$B_{inj}$ 设置前两个去噪步骤使用全局 K/V 注入($T_{warm} = \{1, 2\}$),之后动态掩码更新直到 $t_s = 10$,然后保持固定。
数据集 我们在 EditRegion-Bench 和 PIE-Bench 上评估 PC-Edit。EditRegion-Bench 包含 484 个对象编辑案例,包括 236 个添加和 248 个替换,以及 330 个单对象、87 个双对象和 67 个三对象编辑。源
第 5 页
PnP MasaCtrl RF-Inv. Stable Flow FlowEdit RF-Edit FYS KV-Edit FLUX.1-Fill Ours 坐在木凳上的女孩 坐在木凳上的女孩,戴着眼镜
城市街道 有停放汽车和行走小狗的城市街道 添加
三只泰迪熊并排坐着 三只并排的泰迪熊,左边系着领结,中间围着围巾,右边戴着帽子
野餐毯上的柳条野餐篮 野餐毯上的棕色小狗
替换 盛有两个牛角包和一杯橙汁的早餐托盘 盛有两个百吉饼和一杯咖啡的早餐托盘
站在雪路上的狐狸、狼和鹿 站在雪路上的哈士奇、北极熊和兔子
图 3:添加和替换的定性比较。PC-Edit 完成单对象和多对象编辑,同时更好地保留无关内容。
图像使用 Seedream (Gao 等人 2025) 生成,并使用 LAION 美学评分 (AS) (Schuhmann 等人 2022) 用于 GPT-Image-2 (OpenAI 2026) 或通过网页搜索收集,所有图像均调整为 1024 × 1024。每个案例提供源提示和目标提示,以及所有编辑对象的边界框。注释由人工创建并由第二位注释员独立验证,从而能够直接评估单对象和多对象定位。我们另外使用来自 PIE-Bench (Ju 等人 2024) 的 240 个对象添加和对象替换案例。
基线 我们将 PC-Edit 与七种无需训练的掩码自由方法进行比较。基于 UNet 的基线包括 PnPInversion (Ju 等人 2024) 和 MasaCtrl (Cao 等人 2023)。整流流基线包括 RF-Inversion (Rout 等人 2025)、Stable Flow (Avrahami 等人 2025)、FlowEdit (Kulikov 等人 2025)、FYS (Long 等人 2026) 和 RF-Edit (Wang 等人 2025)。我们另外报告两个掩码引导的参考方法 FLUX.1-Fill (Black Forest Labs 2024) 和 KV-Edit (Zhu 等人 2025),它们以真实编辑框作为输入。
指标 定位评估基于注释框的并集,使用五个指标。AP 评估编辑区域像素是否比背景像素获得更高的响应 (Fan 等人 2017)。归一化前景-背景对比度 (FBC) 量化响应分离。bgp99 表示注释编辑区域外响应的第 99 百分位数。PeakHit 报告最大响应像素是否落在注释区域内。mIoU 衡量预测掩码与注释区域之间的重叠 (Everingham 等人 2010)。编辑质量使用整体视觉质量、CLIP 相似度 (CLIPsim) (Radford 等人 2021) 评估目标提示的语义对齐,以及 PSNR 和 LPIPS (Zhang 等人 2018) 评估像素级和感知背景保真度。背景指标在注释框并集之外计算。为了直接评估源对象移除,我们另外采用 Qwen2.5-VL (Bai 等人 2025) 作为替换案例的冻结自动评估器。我们报告有效源擦除率 (ESER),仅当源概念不再可识别且注释的编辑区域发生有意义变化时,才将案例计为成功。详细提示、定义和辅助指标见补充材料。
定量结果 编辑区域定位。我们比较了六种用于提示对比定位的候选读取输出。对于每一种,我们在相同的时间步长对源提示和目标提示在同一潜在变量上进行评估,并计算逐令牌差异 ∆Xt = ∥Xtgtt −Xsrct ∥。我们考虑图像令牌查询 Q、键 K 和值 V 投影、图像到图像注意力权重 A、图像令牌注意力输出 AttnOut 以及终端速度 vθ。除 vθ 外,所有信号均从双流块 13–18 中提取。所有信号使用相同的评价样本、热力图归一化、阈值处理和后处理。我们另外评估 FYS 风格的跨轨迹速度差异,该差异比较相同时间步长下的源反转潜在变量 xt 与目标去噪潜在变量 zt。如表 2 所示,∆AttnOut 在所有五项指标中均取得最佳结果。图 4 显示了相同的定性趋势,分布更加集中
第 6 页
EditRegion-Bench PIE-Bench 方法 AS↑ PSNR ↑ LPIPS×103 ↓ CLIPsim↑ ESER↑ AS↑ PSNR ↑ LPIPS×103 ↓ CLIPsim↑ ESER↑ PnPInversion 6.35 24.39 80.91 27.48 62.10 6.43 27.34 49.54 25.89 45.00 MasaCtrl 6.26 22.37 87.23 26.14 27.42 6.29 22.29 84.07 25.67 30.00 RF-Inversion 6.52 20.71 181.36 27.82 65.73 6.51 20.69 190.76 26.04 58.75 Stable Flow 6.52 25.85 57.06 26.44 27.02 6.25 25.95 82.74 24.36 22.50 FlowEdit 6.54 23.63 82.38 28.18 70.56 6.56 23.33 87.15 26.25 55.00 FYS 6.59 25.77 65.53 28.22 73.39 6.53 24.62 116.90 25.74 60.00 RF-Edit 6.53 26.01 104.23 27.99 73.39 6.39 25.41 127.95 25.81 62.50
FLUX.1-Fill† 6.47 35.43 6.18 28.30 81.68 6.20 36.58 11.65 25.46 66.25 KV-Edit† 6.52 37.47 3.97 27.41 65.32 6.38 36.22 8.54 24.42 50.00
PC-Edit (ours) 6.62 34.37 16.40 28.44 82.44 6.58 29.71 38.92 26.42 67.50
表1:两个数据集上的编辑结果。†表示提供真实掩码的方法。粗体表示在未指定编辑区域的方法中结果最佳。
信号 AP↑FBC↑bgp99 ↓PeakHit↑mIoU↑ 设置 AS↑PSNR ↑LPIPS×103 ↓CLIP↑ ∆Q 58.2 27.6 40.8 83.5 32.0 无 Msrc 6.50 34.11 18.87 28.00 ∆K 60.3 26.8 39.7 86.1 33.3 静态目标掩码 6.54 30.55 31.12 28.17 ∆V 63.9 26.8 37.0 86.5 35.1 分阶段控制 6.55 26.61 50.78 28.13 ∆A 66.6 36.5 41.9 78.2 38.6 完整 PC-Edit (ours) 6.57 33.25 19.50 28.21 ∆vθ 62.9 39.3 37.8 82.0 28.0 跨轨迹 ∆vθ 49.5 27.1 52.0 71.1 24.9 表3:EditRegion-Bench 中248个替换案例的组件消融实验。
表2:EditRegion-Bench 上的编辑区域定位。源(跨轨迹)目标 ∆𝑣𝑣𝜃𝜃 ∆Attnout ∆Q ∆K ∆V ∆A ∆𝑣𝑣𝜃𝜃 添加眼镜除跨轨迹 ∆vθ 外,所有信号均使用共享状态 提示对比。跨轨迹 ∆vθ 遵循 FYS 风格的 添加区域轨迹发散设置。仅 bgp99 为越低越好。
猫→狗
区域响应和较少的背景激活。Q/K/V 信号取自注意力聚合前的投影,而 ∆A 反映了图像到图像注意力分布的变化,未考虑被聚合的值内容。终端速度是在提示条件响应通过后续网络计算后获得的。此外,FYS 风格跨轨迹信号性能较低表明,比较不同潜在状态存在额外的干扰。总体而言,这些结果确定 ∆AttnOut 是编辑区域定位中相比其他信号最可靠的读取信号。
定性结果 图3展示了单目标和多目标添加及替换的定性比较。PC-Edit 成功执行了小型局部编辑和大型跨类别替换,同时保留了无关区域。与无掩码基线相比,它表现出更少的漏编辑、源残留和意外的背景变化。图5进一步表明,显式建模 Msrc 可抑制残留的源内容。尽管基于真实框(GT-box)引导的方法能很好地保留背景,但其预定义区域可能会在源和目标具有不同轮廓时限制目标的形成。通过联合建模源擦除区域并在去噪过程中跟踪目标出现,PC-Edit 允许目标扩展到源足迹之外,同时保留无关内容。
完整评估器细节和辅助指标见补充材料。
第 7 页
稳定流 FYS ours 无 ours (a) 反演过程中的逐层定位 AP ↑ FBC ↑ D13–D18 𝑀𝑀src 双流 单流 80
木质玩具 (%) 60 架子上的马 残差 无 一只小鸟 → 源 旧对象 度量 架子上的 40 残差 纹理
20 定位
猫和狐狸 0 栅栏旁 残差 无 狼和→ 狗 源 旧对象 D0 D2 D4 D6 D8 D10 D12 D14 D16 D18 S0 S4 S8 S12 S16 S20 S24 S28 S32 S36 栅栏旁 纹理 残差 FLUX 块(单个层)
AP ↑ FBC ↑图 5:源擦除建模的影响。显式 𝑀𝑠𝑟𝑐 (b) 基于 D13–D18 的逐步定位 在 s7 处达到峰值,抑制了竞争方法中观察到的残留源纹理, 以及没有 𝑀𝑠𝑟𝑐 的变体。 80 (%) 70 度量 60 消融研究 50 定位 我们首先检查区域发现的架构和时间设计 40 选择,然后是 PC-Edit 的组件级 30 消融。 块和反演步长选择。图 6 评估了 0 184 327 441 535 反演 612 步 678/ 偏移 734 时间步 783 826 (×1000) 863 897 927 954 978 ∆AttnOut 在 FLUX 块和反演步长上的变化。平 均反演步长后,双流块 13–18 图 6:FLUX 块和反演步长上的定位。 产生最强且最稳定的定位。使用这些 (a) 按块平均 AP 和 FBC。 (b) 块固定后,AP 和 FBC 均在反演 使用双流块 13–18 的逐步结果。 中间达到峰值。因此,我们设置 Bloc = {13, . . . , 18} 和 Tprobe = {6, 7, 8} 以构建 𝑀𝑠𝑟𝑐。 组件消融。我们在 EditRegion- 区域和减弱的背景保留。延迟掩码 Bench 的 248 个替换案例上评估了 PC-Edit 的主要组件, 收集可能会产生更准确的区域估计,但 其中明确要求移除源。我们考虑了三种变体。w/o 𝑀𝑠𝑟𝑐 移除了反演时间 会使前面的去噪步骤不受约束,并 源擦除足迹,并仅根据去噪时间目标出现掩码定义编辑区域。静态目 继承分阶段控制的相同限制。相比之下,PC- 标掩码在全局注入预热后估计目标出现区域一次,并在整个剩余去噪步骤中 Edit 在预热后在线细化目标出现区域,并立即在同一采样步骤内应用区域引导控制, 重用,从而消除了在线编辑区域 在保持编辑覆盖范围的同时限制背景漂移。 细化。分阶段控制遵循 FYS 风格的调度,允许潜在变量在目标提示下自由去噪, 同时累积编辑掩码,并仅在最终去噪步骤中在生成的掩码外部应用源 K/V 注入。如表 3 所示,这些变体在源移除和背景保留之间表现出不同的权衡。 尽管移除 𝑀𝑠𝑟𝑟𝑐 略微提高了背景保真度量,但它留下了更多的源残留, 因为目标出现区域可能无法完全覆盖源足迹,特别是当源和目标轮廓 差异很大时。基于 Qwen 的评估证实了这一点:添加 𝑀𝑠𝑟𝑐 将 ESER 从 72.18% 增加到 82.44%,而图 5 定性显示了没有 𝑀𝑠𝑟𝑐 的变体中 残留的源内容。分阶段控制降低了背景保真度,因为早期不受约束的去噪期间 累积的背景漂移无法在最终步骤中通过源 K/V 注入完全纠正。 静态目标掩码仅在预热后估计一次,此时目标响应仍然相对弥散, 此后保持不变。因此,它无法适应目标结构的出现,通常导致编辑区域过宽。
结论 我们提出了 PC-Edit,这是一种用于 MM-DiT 编辑中提示对比区域发现的免训练框架。 通过保持潜在状态和时间步长固定,仅改变提示,PC-Edit 捕捉了从图像令牌注意力输出中 由提示引起的语义差异。在反演和去噪过程中应用相同的对比度,产生了源擦除和目标出现区域, 它们的并集定义了编辑区域。在每个采样步骤内,PC-Edit 立即在此区域外部注入缓存的源 K/V 特征, 在潜在更新之前保留不相关的内容。我们引入了 EditRegion-Bench,它为单对象和多对象添加 提供了经过人工验证的编辑区域注释。在 EditRegion-Bench 和 PIE-Bench 上的实验表明,PC-Edit 实现了更准确的编辑区域定位,并在不需要手动指定编辑区域的方法中, 实现了编辑质量和背景保留的最佳平衡。
第 8 页
参考文献 Lipman, Y.; Chen, R. T.; Ben-Hamu, H.; Nickel, M.; 和 Le, M. 2023. Flow Matching for Generative Modeling. In Avrahami, O.; Patashnik, O.; Fried, O.; Nemchinov, E.; Aber- man, K.; Lischinski, D.; 和 Cohen-Or, D. 2025. Stable flow: 11th International Conference on Learning Representations, Vital layers for training-free image editing. In Proceedings ICLR 2023. of the Computer Vision and Pattern Recognition Conference, Liu, X.; Gong, C.; 和 Liu, Q. 2023. Flow Straight and 7877–7888. Fast: Learning to Generate and Transfer Data with Rectified Flow. In The Eleventh International Conference on LearningBai, S.; Chen, K.; Liu, X.; Wang, J.; Ge, W.; Song, S.; Dang, K.; Wang, P.; Wang, S.; Tang, J.; Zhong, H.; Zhu, Y.; Yang, Representations (ICLR). M.; Li, Z.; Wan, J.; Wang, P.; Ding, W.; Fu, Z.; Xu, Y.; Ye, Long, Z.; Zheng, M.; Feng, K.; Zhang, X.; Liu, H.; Yang, H.; J.; Zhang, X.; Xie, T.; Cheng, Z.; Zhang, H.; Yang, Z.; Xu, Zhang, L.; Chen, Q.; 和 Ma, Y. 2026. Follow-Your-Shape: H.; 和 Lin, J. 2025. Qwen2.5-VL Technical Report. arXiv Shape-Aware Image Editing via Trajectory-Guided Region preprint arXiv:2511.21631. Control. In The Fourteenth International Conference on Black Forest Labs. 2024. FLUX. https://github.com/black- Learning Representations. forest-labs/flux. Mokady, R.; Hertz, A.; Aberman, K.; Pritch, Y.; 和 Cohen- Or, D. 2023. Null-text inversion for editing real images usingCao, M.; Wang, X.; Qi, Z.; Shan, Y.; Qie, X.; 和 Zheng, guided diffusion models. In Proceedings of the IEEE/CVFY. 2023. Masactrl: Tuning-free mutual self-attention control conference on computer vision and pattern recognition, for consistent image synthesis and editing. In Proceedings of 6038–6047.the IEEE/CVF international conference on computer vision, 22560–22570. OpenAI. 2026. GPT Image 2. https://developers.openai. Couairon, G.; Verbeek, J.; Schwenk, H.; 和 Cord, M. com/api/docs/models/gpt-image-2. 2023. DiffEdit: Diffusion-based Semantic Image Editing Otsu, N. 1975. A threshold selection method from gray-level with Mask Guidance. In ICLR 2023 (Eleventh International histograms. Automatica, 11: 285–296. Conference on Learning Representations). Peebles, W.; 和 Xie, S. 2023. Scalable diffusion models with Esser, P.; Kulal, S.; Blattmann, A.; Entezari, R.; Müller, J.; transformers. In Proceedings of the IEEE/CVF international Saini, H.; Levi, Y.; Lorenz, D.; Sauer, A.; Boesel, F.; et al. conference on computer vision, 4195–4205. 2024. Scaling rectified flow transformers for high-resolution Radford, A.; Kim, J. W.; Hallacy, C.; Ramesh, A.; Goh, image synthesis. In Forty-first international conference on G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, machine learning. J.; et al. 2021. Learning transferable visual models from Everingham, M.; Van Gool, L.; Williams, C. K.; Winn, J.; natural language supervision. In International conference and Zisserman, A. 2010. The pascal visual object classes on machine learning, 8748–8763. PmLR. (voc) challenge. International journal of computer vision, Rombach, R.; Blattmann, A.; Lorenz, D.; Esser, P.; 和 Om- 88(2): 303–338. mer, B. 2022. High-resolution image synthesis with latent Fan, D.-P.; Cheng, M.-M.; Liu, Y.; Li, T.; 和 Borji, A. diffusion models. In Proceedings of the IEEE/CVF confer- 2017. Structure-measure: A new way to evaluate foreground ence on computer vision and pattern recognition, 10684– maps. In Proceedings of the IEEE international conference 10695. on computer vision, 4548–4557. Rout, L.; Chen, Y.; Ruiz, N.; Caramanis, C.; Shakkottai, S.; Feng, K.; Ma, Y.; Wang, B.; Qi, C.; Chen, H.; Chen, Q.; 和 and Chu, W.-S. 2025. Semantic Image Inversion and Edit- Wang, Z. 2025. Dit4edit: Diffusion transformer for image ing using Rectified Stochastic Differential Equations. In The editing. In Proceedings of the AAAI Conference on Artificial Thirteenth International Conference on Learning Represen- Intelligence, volume 39, 2969–2977. tations. Gao, Y.; Gong, L.; Guo, Q.; Hou, X.; Lai, Z.; Li, F.; Li, L.; Schuhmann, C.; Beaumont, R.; Vencu, R.; Gordon, C.; Lian, X.; Liao, C.; Liu, L.; et al. 2025. Seedream 3.0 Wightman, R.; Cherti, M.; Coombes, T.; Katta, A.; Mullis, technical report. arXiv preprint arXiv:2504.11346. C.; Wortsman, M.; et al. 2022. Laion-5b: An open large- Hertz, A.; Mokady, R.; Tenenbaum, J.; Aberman, K.; Pritch, scale dataset for training next generation image-text mod- Y.; 和 Cohen-Or, D. 2022. Prompt-to-Prompt Image Editing els. Advances in neural information processing systems, 35: with Cross Attention Control. arXiv e-prints, arXiv–2208. 25278–25294. Ju, X.; Zeng, A.; Bian, Y.; Liu, S.; 和 Xu, Q. 2024. Pnp Tumanyan, N.; Geyer, M.; Bagon, S.; 和 Dekel, T. 2023. Plug-inversion: Boosting diffusion-based editing with 3 lines of and-play diffusion features for text-driven image-to- code. In International Conference on Learning Representa- image translation. In Proceedings of the IEEE/CVF con- tions, volume 2024, 23395–23422. ference on computer vision and pattern recognition, 1921– Kulikov, V.; Kleiner, M.; Huberman-Spiegelglas, I.; 和 1930. Michaeli, T. 2025. Flowedit: Inversion-free text-based edit- Vaswani, A.; Shazeer, N.; Parmar, N.; Uszkoreit, J.; Jones, L.; ing using pre-trained flow models. In Proceedings of the Gomez, A. N.; Kaiser, Ł.; 和 Polosukhin, I. 2017. Attention IEEE/CVF International Conference on Computer Vision, is all you need. Advances in neural information processing 19721–19730. systems, 30.
第 9 页
Wang, J.; Pu, J.; Qi, Z.; Guo, J.; Ma, Y.; Huang, N.; Chen, Y.; Li, X.; and Shan, Y. 2025. Taming Rectified Flow for Inver- sion and Editing. In International Conference on Machine Learning, 64044–64058. PMLR. Zhang, R.; Isola, P.; Efros, A. A.; Shechtman, E.; and Wang, O. 2018. The unreasonable effectiveness of deep features as a perceptual metric. In Proceedings of the IEEE conference on computer vision and pattern recognition, 586–595. Zhu, T.; Zhang, S.; Shao, J.; and Tang, Y. 2025. Kv-edit: Training-free image editing for precise background preser- vation. In Proceedings of the IEEE/CVF International Con- ference on Computer Vision, 16607–16617.
第 10 页
补充材料
本补充材料展示了完整的 PC-Edit 推理过程及固定配置、EditRegion-Bench 的更多细节、指标定义、基于 Qwen2.5-VL 的源擦除评估、额外的定性结果以及完整的评估器提示词。除非另有说明,否则本文未提及的内容均遵循主论文。
推理过程与配置
算法 1 和算法 2 总结了 PC-Edit 的推理过程。在反演过程中,源条件前向传播推进源轨迹并缓存相应的 K/V 特征。对于对象替换,在由 $T_{probe}$ 索引的反演潜变量处执行额外的目标条件前向传播,以估计源擦除掩码 $M_{src}$。添加操作跳过此阶段并设置 $M_{src} = 0$。在去噪过程中,提示对比定位在 $B_{inj}$ 中的源 K/V 注入之前在 $B_{loc}$ 中执行,允许当前步骤估计的区域指导相同的潜变量更新。全局源 K/V 注入应用于预热步骤 $T_{warm}$。编辑区域随后更新直到冻结步骤 $t_s$ 并保持固定。表 4 列出了主论文实验中使用的固定配置。
算法 1: PC-Edit 源反演 1: 输入: 源图像 $I_{src}$, 条件 $(c_{src}, c_{tgt})$, 编辑类型 $e$, $B_{loc}$, $B_{inj}$, 和 $T_{probe}$ 2: 输出: 反演潜变量 $x_N$, 缓存的源特征 $\{C_t\}_{t=1}^N$, 和源擦除掩码 $M_{src}$ 3: $x_0 \leftarrow \text{Encode}(I_{src})$ 4: $H_{src} \leftarrow \emptyset$ 5: for $t = 1$ to $N$ do 6: 运行源条件前向传播以获得 $v^{src}_t$ 和来自 $B_{loc}$ 的图像标记注意力输出 $\text{AttnOut}^{src}_t$ 7: 缓存源 K/V 特征 $C_t = \{K^{src}_{t,b}, V^{src}_{t,b}\}_{b \in B_{inj}}$ 8: if $e = \text{replacement}$ and $t \in T_{probe}$ then 9: 在 $(x_{t-1}, \tau_t, c_{tgt})$ 处从 $B_{loc}$ 获取 $\text{AttnOut}^{tgt}_t$ 10: $H_t \leftarrow |B_{loc}|^{-1} \sum_{b \in B_{loc}} \| \text{AttnOut}^{tgt}_{t,b} – \text{AttnOut}^{src}_{t,b} \|$ 11: 将 $H_t$ 追加到 $H_{src}$ 12: end if 13: $x_t \leftarrow \text{InvertStep}(x_{t-1}, v^{src}_t)$ 14: end for 15: if $e = \text{replacement}$ then 16: $M_{src} \leftarrow \text{Otsu}(\text{Mean}(H_{src}))$ 17: else 18: $M_{src} \leftarrow 0$ 19: end if 20: return $x_N$, $\{C_t\}_{t=1}^N$, 和 $M_{src}$
算法 2: PC-Edit 目标去噪 1: 输入: 反演潜变量 $x_N$, 条件 $(c_{src}, c_{tgt})$, 缓存的源特征 $\{C_t\}_{t=1}^N$, 源擦除掩码 $M_{src}$, $B_{loc}$, $B_{inj}$, $T_{warm}$, 和 $t_s$ 2: 输出: 编辑图像 $I_{edit}$ 3: $z_N \leftarrow x_N$ 4: $R \leftarrow M_{src}$ 5: for $k = 1$ to $N$ do 6: $t \leftarrow N – k + 1$ 7: if $k \in T_{warm}$ then 8: 使用缓存的源 K/V 对所有图像标记运行目标条件前向传播以获得 $v_t$ 9: else 10: 通过 $B_{loc}$ 运行目标条件前向传播以获得 $\text{AttnOut}^{tgt}_t$ 11: if $k \le t_s$ then 12: 在 $(z_t, \tau_t, c_{src})$ 处从 $B_{loc}$ 获取 $\text{AttnOut}^{src}_t$ 13: $H_t \leftarrow |B_{loc}|^{-1} \sum_{b \in B_{loc}} \| \text{AttnOut}^{tgt}_{t,b} – \text{AttnOut}^{src}_{t,b} \|$ 14: $R \leftarrow M_{src} \cup \text{Otsu}(H_t)$ 15: end if 16: 通过 $B_{inj}$ 继续目标条件前向传播,在 $R$ 内使用目标 K/V,在 $R$ 外使用缓存的源 K/V 以获得 $v_t$ 17: end if 18: $z_{t-1} \leftarrow \text{DenoiseStep}(z_t, v_t)$ 19: end for 20: return $I_{edit} \leftarrow \text{Decode}(z_0)$
EditRegion-Bench 详情
EditRegion-Bench 包含 484 个评估案例:236 个添加案例和 248 个替换案例,涵盖主论文中报告的一个、两个和三个对象编辑。每个案例包括一个 $1024 \times 1024$ 的源图像、一个源提示词、一个目标提示词,以及每个请求的编辑目标的一个人工标注边界框。定位评估使用这些边界框的并集。注释由一名标注员绘制,并由第二名标注员独立验证。它们标记了在编辑指令下预期发生变化的图像区域,仅用于评估,在推理过程中不提供给 PC-Edit 或任何其他无掩码方法。由于有效的编辑可能发生在不同的合理位置并覆盖不同的区域,我们的注释指示编辑应该发生的位置,而不是定义精确的像素级掩码。图 7 和图 8 展示了来自 EditRegion-Bench 的代表性示例,其中红色叠加层可视化了对应的人工注释。EditRegion-Bench 在 https://zenodo.org/records/21502501 上公开可用。
组件设置
| 组件 | 设置 | | :— | :— | | Backbone | FLUX.1-dev | | Image resolution | $1024 \times 1024$ | | Guidance scale | 3.0 | | Localization blocks | 13–18 $B_{loc}$ | | Injection blocks | 18 $B_{inj}$ | | Source-erasure mask for addition | $M_{src} = 0$ | | Mask binarization | Otsu thresholding | | Warm-up steps | $T_{warm}$ {1, 2} | | Region-update steps | 3–10 | | Region-freeze step | $t_s$ 10 | | Hardware | One NVIDIA A800 GPU |
指标定义
反演/去噪步骤 15/15 定位指标 双流定位块 $B_{loc}$ 最后单流块 $B_{inj}$ 探测步骤 $T_{probe}$ {6, 7, 8}
设 $H$ 为热力图,其中 $H(p)$ 表示像素 $p$ 处的响应,并设 $G$ 表示由人工标注边界框并集覆盖的像素集合。每个热力图独立归一化到 $[0, 1]$:
$$ \hat{H}(p) = \begin{cases} \frac{H(p) – H_{min}}{H_{max} – H_{min}}, & H_{max} > H_{min}, \\ 0, & H_{max} = H_{min}, \end{cases} \quad (6) $$
表 4: PC-Edit 的固定推理配置。
第 11 页
(a) 1个物体 (b) 1个物体 (c) 1个物体
源图像真值标注 源图像真值标注 源图像真值标注
(d) 2个物体 (e) 2个物体 (f) 3个物体
源图像真值标注 源图像真值标注 源图像真值标注
面板 源提示 目标提示
(a) 一位有着波浪状红褐色头发、满脸雀斑的女性的肖像, 一位有着波浪状红褐色头发、满脸雀斑的女性的肖像, 背景为浅橄榄色,佩戴琥珀珠项链 背景为浅橄榄色,佩戴琥珀珠项链 (b) 窗边一张空的咖啡馆桌子 窗边一张空的咖啡馆桌子,上面有一杯咖啡 (c) 靠近海洋的沙滩 靠近海洋的沙滩,上面有一个彩色的沙滩球 (d) 靠近阳光窗户的厨房台面 靠近阳光窗户的厨房台面,上面有一碗 橙子和一杯牛奶 (e) 带有木制台阶的宁静湖岸 带有木制台阶的宁静湖岸,水面上有一艘小船和 一只鸭子 (f) 带有长椅的宁静河岸步道 带有长椅的宁静河岸步道,停放着一辆自行车, 长椅上坐着一个人,附近有一只小狗
图 7:代表性 EditRegion-Bench 添加案例及其提示。每个面板将源图像与人工编辑区域标注配对。面板 (a)–(c) 为单物体添加,(d)–(e) 为双物体添加,(f) 为三物体添加。
其中 $H_{min}$ 和 $H_{max}$ 分别是所有像素上的最小和最大响应。 平均精度 (AP)。$G$ 中的像素被视为正样本,所有其余像素被视为负样本。我们将所有像素按其归一化热力图响应降序排列,并计算标准非插值平均精度: $$ AP = \sum_k (R_k – R_{k-1})P_k, \quad (7) $$ 其中 $P_k$ 和 $R_k$ 分别是精确率-召回率曲线上第 $k$ 个点处的精确率和召回率。AP 评估标注区域像素是否获得更高的响应。 前景-背景对比度 (FBC)。令 $N$ 表示像素总数。我们首先计算标注区域内部和外部的平均响应: $$ \mu_{fg} = \frac{1}{|G|} \sum_{p \in G} H(p), \quad \mu_{bg} = \frac{1}{N – |G|} \sum_{p \notin G} H(p). \quad (8) $$ FBC 随后定义为 $$ FBC = \frac{\mu_{fg} – \mu_{bg}}{\mu_{fg} + \mu_{bg} + \varepsilon}. \quad (9) $$ 我们使用 $\varepsilon = 10^{-8}$。FBC 位于 $[-1, 1]$ 之间,值越高表示标注区域与背景区域之间的分离度越强。 背景 99 百分位数 (bgp99) 和 PeakHit。高背景响应定义为 $$ bgp99 = Q_{0.99} \{ H(p) | p \notin G \}, \quad (10) $$ 其中 $Q_{0.99}$ 表示第 99 百分位数,值越低越好。PeakHit 定义为 $$ PeakHit = \arg \max_{p} H(p) \in G, \quad (11) $$ 这表示最强的热力图响应是否落在标注的编辑区域内。
第 12 页
(a) 1个物体 (b) 1个物体 (c) 1个物体
源GT标注 源GT标注 源GT标注
(d) 2个物体 (e) 2个物体 (f) 3个物体
源GT标注 源GT标注 源GT标注
面板 源提示 目标提示
(a) 一个戴着红色棒球帽的年轻男子,站在城市人行道上,柔和的日光照明 一个戴着蓝色棒球帽的年轻男子,站在城市人行道上,柔和的日光照明 (b) 篮子里的一只猫的照片 篮子里的一只狗的照片 (c) 木桌上的一朵红玫瑰 木桌上的一朵粉色郁金香 (d) 一只虎斑猫和一只棕色兔子并排坐在草地上 一只棕色野兔和一只小狗并排坐在草地上 (e) 一张木桌,上面放着一碗拉面和一筷子,从稍高的角度拍摄 一张木桌,上面放着一碗沙拉和一把叉子,从稍高的角度拍摄 (f) 一个红苹果、一个绿梨和一个红玫瑰排列在大理石台面上 一个橙子、一个熟芒果和一个粉色郁金香排列在大理石台面上
图8:代表性 EditRegion-Bench 替换案例及其提示。面板 (a)–(c) 为单物体替换,(d)–(e) 为双物体替换,(f) 为三物体替换。每个标注视图显示了合并前构成并集的人类边界框。
掩码交并比 (mIoU)。我们对图像范围为 [0, 1] 的每个热力图应用 Otsu 阈值以获得二值掩码 M。每个案例的 IoU 为 IoU = |M ∩G| / (|M ∪G| + ε),其中 ε = 10−8。mIoU 是所有案例的平均 IoU。
编辑指标 美学得分 (AS)。使用 LAION 美学得分评估编辑图像的美学质量。
CLIP 得分 (CLIPsim)。我们使用 TorchMetrics CLIPsim (openai/clip-vit-large-patch14) 来测量 Iedit 与目标提示 ctgt 之间的图像-文本相似度。该得分以其原生 0–100 标度报告,值越高表示语义对齐越强。
背景保真度。我们使用 PSNR 和 LPIPS 评估背景保留情况。令 B 为背景二值掩码。背景 PSNR 由掩码编辑图像和源图像计算得出: PSNR = −10 log10 (MSE (B ⊙Iedit, B ⊙Isrc)) , (13)
对于 LPIPS,相同的掩码图像从 [0, 1] 映射到 [−1, 1],并使用基于 SqueezeNet 的 LPIPS 网络进行评估。表中报告的是 LPIPS × 103。
基于 Qwen 的源擦除评估。为了直接评估源概念是否被有效移除,我们 additionally 在替换案例中使用 Qwen2.5-VL-7B-Instruct 作为冻结的自动评估器。
对于每个编辑结果,评估器首先确定源概念或任何可识别的源特定线索是否仍存在于编辑图像中,包括特征部分、颜色、纹理、材质或轮廓。然后,它比较源图像和编辑图像,以确定标注的编辑区域是否发生了有意义的视觉或语义变化。
对于第 i 个编辑结果,令 si ∈{absent, minor_residue, major_residue} (14)
第 13 页
表示其源残留标签,其中表 5:基于 Qwen2.5-VL 的自动源擦除评估 • absent 表示既没有源概念,也没有任何可识别的源特定残留。 在 EditRegion-Bench 和 • minor_residue 表示仍有少量但可识别的源特定部分、纹理、颜色或轮廓残 PIE-Bench 的替换案例上。粗体表示在没有外部指定编辑区域的方法中最佳的结果。† 表示提供 留。 了真实编辑框的方法。 • major_residue 表示源概念或大量源特定内容仍然清晰可 EditRegion-Bench PIE-Bench 识别。 方法 SRR↓ REFR↓ ESER↑ SRR↓ REFR↓ ESER↑ 对于第 i 个编辑结果,令 ri 表示由 Qwen2.5-VL 返回的细粒度 PnPInversion 32.66 22.58 62.10 37.50 47.50 45.00 身份类别。我们将 TARGET_ONLY 和 NEITHER 确定性地映射为 absent, MasaCtrl 65.32 50.40 27.42 46.25 58.75 30.00 HYBRID_TARGET_DOMINANT 映射为 minor_residue, RF-InversionStable Flow 63.71 31.45 17.34 55.65 65.73 27.02 38.75 55.00 15.00 67.50 58.75 22.50 OLD_ONLY、HYBRID_OLD_DOMINANT 和 FlowEdit 24.60 19.35 70.56 37.50 32.50 55.00 HYBRID_BALANCED 映射为 major_residue。 FYS 21.37 18.95 73.39 31.25 25.00 60.00 同样,令 RF-Solver-Edit 20.56 20.16 73.39 28.75 17.50 62.50 PC-Edit w/o Msrc 23.39 14.52 72.18 27.50 27.50 58.75 ci ∈{meaningful_change, weak_change, unchanged} (15) PC-Edit (ours) 15.53 11.50 82.44 21.25 23.75 67.50 表示区域变化标签,其中 • meaningful_change 表示在标注的编辑区域内有明显的视觉或 使用 Qwen2.5-VL 进行自动源擦除评估 语义变化。我们使用 Qwen2.5-VL-7B-Instruct 作为冻结的自动 • weak_change 表示仅有有限或不足的变化,例如轻微移动、小 评估器,用于替换案例的源擦除分析。 如 Fig. 9 所示,评估器首先提取源概念和目标概念,然后从编辑图像及其放大区域裁剪中预测源残留类别,并确定性地映射到三个源残留级别之一: • unchanged 表示标注的编辑区域基本保持不变。 absent、minor_residue 或 major_residue。 源残留率 (SRR)。SRR 衡量编辑结果中源概念或可识别的源特定内容所占的比例。minor 和 major 残留均被计入: 此外,它将源图像和编辑图像进行比较,将区域变化分类为 meaningful_change、weak_change 或 unchanged。这些标签用于计算 SRR、REFR 和 ESER。完整的评估提示见 Sec. 。 N SRR = 1/N Σ {i | si ∈{minor_residue, major_residue}} (16) i=1 结果。表 5 报告了 EditRegion-Bench 和 PIE-bench 替换案例上的 SRR、REFR 和 ESER。 较低的 SRR 表示源概念被更彻底地移除。 在没有外部指定编辑区域的方法中, 区域编辑失败率 (REFR)。REFR 衡量标注的编辑区域仅发生微弱变化或基本保持不变的情况比例: PC-Edit 实现了最低的 SRR 和 REFR 以及最高的 ESER。与没有 Msrc 的变体相比,完整方法大幅降低了 SRR 和 REFR,同时提高了 ESER,证实了源擦除足迹的有效性。这些结果表明,反演时的源擦除足迹更有效地抑制了可识别的源内容,同时减少了编辑不足的情况。 N REFR = 1/N Σ {i | ci ∈{weak_change, unchanged}} (17) i=1 较低的 REFR 表示编辑不足的情况更少。 有效源擦除率 (ESER)。ESER 仅在源概念不再可识别且标注的编辑区域发生有意义变化时才将案例计为成功: N ESER = 1 – 1/N Σ {i | si = absent ∧ ci = meaningful_change} (18) i=1 与 1 − SRR 不同,ESER 排除了源概念被判定为 absent 但指定区域基本保持不变的情况。因此,它提供了对有效源移除更严格的度量。
更多定性结果 Figures 10 和 11 分别提供了对象添加和替换的额外定性比较,补充了正文中报告的结果。对于添加,PC-Edit 更一致地引入了请求的对象,同时保留了无关的场景内容。对于替换,它更好地移除了源对象,适应了目标对象的形状,并限制了编辑区域外的意外变化。这些例子进一步证明了提示对比区域发现和区域引导源特征注入在不同编辑场景中的有效性。
第 14 页
阶段 1:编辑规范提取 输入:源提示词,目标提示词 输出:源概念,目标概念,未变上下文
阶段 2:源残留评估 阶段 3:区域变化评估 输入:编辑图像,放大编辑区域 输入:源图像和编辑图像,以 裁剪图,以及提取的源/目标概念 及配对的区域裁剪图 输出:源残留类别 输出:区域变化类别
确定性标签映射 源残留和区域变化标签
源擦除指标 SRR • REFR • ESER
图 9:基于 Qwen2.5-VL 的源擦除评估概览。评估器首先从提示词中提取预期的编辑。然后独立评估编辑结果中的源残留以及源图像与编辑图像比较中的区域变化。输出被确定性映射到用于计算 SRR、REFR 和 ESER 的标签。
第 15 页
图10:对象添加的额外定性比较。PC-Edit 引入了请求的对象,同时更好地保留了不相关的内容。
第 16 页
图11:对象替换的额外定性比较。PC-Edit 更彻底地移除源对象并生成目标对象,同时更好地保留无关内容。
第 17 页
完成 Qwen2.5-VL 评估提示词 以下提示词为完整复现。花括号内的占位符在评估期间替换为相应的特定案例信息。
阶段 A:编辑规范提取 系统提示
精确比较标题。仅返回 JSON。
用户提示
仅从两个标题中提取预期的视觉编辑。 不要检查任何图像。将更改的概念与共享上下文分开。
源提示:{src} 目标提示:{dst} 任务类型:{edit_type}
对于类别替换,old_concept 是完整的旧对象身份,new_concept 是完整的新对象身份。
对于属性替换,old_concept/new_concept 仅是更改的属性,而共享对象属于 shared_context。
对于添加,old_concept 为“none”。
仅返回 JSON: { "old_concept": "特定身份/属性或 none", "new_concept": "特定身份/属性", "shared_context": ["未更改的概念"], "edit_subtype": "category_replacement | attribute_replacement | addition | multi_edit" }
阶段 B:源残留分类 在此阶段,评估器接收编辑后的完整图像以及标注编辑区域的放大裁剪图。不提供源图像。 系统提示
仅根据编辑图像中的字面可见证据进行判断。 仅返回 JSON。
用户提示
仅检查编辑后的结果,特别是每个编号区域。
应被移除的旧概念: {old_concept}
请求的目标概念: {new_concept}
首先描述可见的身份、颜色、纹理/材质、诊断性部分和轮廓。
然后选择恰好一个互斥类别:
旧概念仍然可识别,且目标概念缺失。
- OLD_ONLY:
- TARGET_ONLY:
第 18 页
术语指导:[{"english": "MM-DiT", "chinese_or_explanation": "Multimodal Diffusion Transformer", "keep_english": true}, {"english": "K/V features", "chinese_or_explanation": "Key/Value features in attention mechanism", "keep_english": true}, {"english": "AttnOut", "chinese_or_explanation": "Attention Output", "keep_english": true}, {"english": "ESER", "chinese_or_explanation": "Effective Source-Erasure Rate", "keep_english": true}, {"english": "Msrc", "chinese_or_explanation": "Source-erasure mask", "keep_english": true}]
翻译PDF第18页,第1部分。保留标题和段落结构。源字符数:1896。
目标是可识别的,且没有残留的旧特定线索。
旧概念和目标概念均有贡献,且存在强烈或广泛的旧身份残留。
- HYBRID_OLD_DOMINANT(旧主导混合):
目标可识别,但残留的旧特定部分、颜色、纹理、轮廓或剪影仍可识别。
- HYBRID_TARGET_DOMINANT(目标主导混合):
旧身份和目标身份均显著可见。
- HYBRID_BALANCED(平衡混合):
旧概念和目标概念均不可识别。
- NEITHER(均不可识别):
对于类别替换,即使面部或表面类似于目标,也要明确检查旧特定的身体形状、轮廓、材质/纹理和诊断性部位。
对于属性替换,任何可识别的旧颜色或纹理均为旧残留。共享的对象类别不算作残留。旧概念和目标概念共有的常见特征不计为残留。
不要使用源图像,也不要奖励请求的文本。
返回恰好一个JSON对象: { "visible_description": "字面可见的身份及旧/目标线索", "class": "OLD_ONLY | TARGET_ONLY | HYBRID_OLD_DOMINANT | HYBRID_TARGET_DOMINANT | HYBRID_BALANCED | NEITHER", "evidence": "简短的决定性可见证据" }
阶段C:区域变化分类 在此阶段,评估者将同时接收源图像和编辑后的完整图像,以及带注释区域的配对源图像和编辑后裁剪图。 系统提示
仅根据编辑后的图像中的字面可见证据进行判断。 仅返回JSON。
用户提示
仅比较编号区域内部及其紧邻区域的SOURCE(源)与EDITED(编辑后)图像。
选择恰好一个类别:
可见清晰的对象或属性重写。
- MEANINGFUL_CHANGE(有意义变化):
仅可见移动、微小的纹理或颜色波动,或重建噪声。
- WEAK_CHANGE(微弱变化):
基本上没有可见变化。
- UNCHANGED(无变化):
此问题仅关于变化幅度,而非目标成功与否。
返回恰好: { "class":
第 19 页
“MEANINGFUL_CHANGE | WEAK_CHANGE | UNCHANGED”, “证据”: “字面可见差异” }