从图片恢复 Figma 文件:ReDesign 的代理分解与优雅验证

快速导读:现有研究多关注子问题,如 LayerD 的元素隔离或 VTracer 的矢量化,但缺乏端到端的可编辑结构恢复。关键差距在于:如何在病态逆问题中,通过结构化推理推断合理的对象参数和层级关系,并防止错误扩散。

从光栅图像恢复可编辑的设计结构(如 Figma 或 Illustrator 文件)长期以来被视为计算机视觉与设计自动化领域的“圣杯”问题。然而,光栅化过程本质上是多对一的映射,导致字体、矢量几何和图层顺序等关键多模态属性永久丢失。传统的逆向工程不仅耗时,且极易出错。

ReDesign 提出了一种全新的代理分解框架,将这一病态逆问题转化为结构化的树扩展过程。通过引入 VLM 控制器和 Graceful Verification 机制,该方法能够在每一步分解中进行局部验证与纠错,从而避免了传统串行工具链中的错误累积。本文深入解析其核心机制、评估基准及实际局限性。

英文题目:ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

论文出处:arXiv 每日论文精选 · arXiv:2607.25565

原始论文:PDF / 论文页面

对应视频标题:从图片恢复 Figma 文件:ReDesign 的代理分解与优雅验证|推荐指数:★★★★★

这篇论文解决什么问题?

现有方法通常将问题拆解为文本识别、图层分解或图像矢量化等子任务。例如,LayerD 和 Qwen-Image-Layered 提供了元素隔离的原语,而 VTracer 等工具专注于形状矢量化。然而,将这些模块简单串联往往导致错误级联:前一步的微小偏差会在后续步骤中被放大,最终生成的结构无法支持有意义的编辑。

更根本的挑战在于,光栅图像缺乏明确的图层边界。设计元素可能在视觉上重叠、融合或具有复杂的纹理,使得基于像素的分割难以对应到语义上的设计对象。因此,恢复过程不仅需要视觉分割,还需要推断合理的对象参数和层级关系,这要求系统具备跨模态的推理能力。

此外,评估现有方法的“可编辑性”缺乏统一标准。传统的重建指标(如 PSNR 或 LPIPS)仅衡量像素级相似度,无法反映恢复后的文件是否真正支持布局调整、颜色替换或文本修改等实际操作。这导致许多方法在视觉上看似准确,但在实际编辑场景中表现糟糕。

核心创新

方法概览

现有研究多关注子问题,如 LayerD 的元素隔离或 VTracer 的矢量化,但缺乏端到端的可编辑结构恢复。关键差距在于:如何在病态逆问题中,通过结构化推理推断合理的对象参数和层级关系,并防止错误扩散。

  • ReDesign 的核心创新在于将重构过程建模为结构化树扩展。VLM 控制器从固定动作集(如 Text Extraction、Qwen-Image-Layered、Connected Component Labeling)中选择操作,逐步生长部分重构树。这种树状结构允许并行执行独立节点的分解,显著提升了效率。
  • Graceful Verification 是防止错误累积的关键机制。在每个节点扩展时,验证器会评估子节点的合理性,并提供接受、修剪或重试的反馈。这种局部纠错能力使得系统能够在早期发现并修正幻觉或冗余分解,避免了传统串行流程中“一步错、步步错”的问题。
  • 为了管理上下文长度,ReDesign 采用 Lineal Memory 策略,仅存储从根节点到当前节点的路径历史。这种线性记忆管理避免了指数级增长的上下文负担,使得 VLM 能够处理深层分解树而不丢失关键信息。
  • 控制器表现出明显的粗到细分解策略。在浅层,它优先提取文本等高价值语义元素;在中间层,调用 Qwen-Image-Layered 进行粗略结构分割;在深层,则使用 CCL 分离空间上不连通的分量。这种自适应的工具分配策略体现了代理对设计结构先验的学习。

逐图理解论文

直觉失败:串行工具链的局限

直觉失败:串行工具链的局限
Fig. 12: Failure cases of Qwen-Image-Layered on the Figma benchmark.

传统方法往往将文本识别、图层分解和矢量化串联执行。然而,光栅化是多对一映射,前一步的微小偏差会在后续步骤中累积放大,导致最终结构无法支持有意义的编辑,例如错误的图层顺序或丢失的字体属性。

研究差距:缺乏结构化分解与验证

研究差距:缺乏结构化分解与验证
Fig. 2: Overview of ReDesign. A VLM controller grows an editable layer hierarchy by selecting from a fixed set of tool actions for text, objects, and layered decompo- sition, and runs graceful verification at each parent-to-children expansion to accept valid splits, prune redundant or hallucinated children, or trigger a retry, until atomic editable elements are recovered.

详解 ReDesign 的整体架构。注意 VLM 控制器如何选择工具动作,以及 Graceful Verification 如何在每个父到子扩展中进行接受、修剪或重试决策。

最强结论:编辑重放基准的优越性

最强结论:编辑重放基准的优越性
Fig. 4: (a) Edit replay SSIM for different edit types, where our method performs best across all edits. (b) Text editability measured by text recall after replaying text edits, where our method achieves the highest recall among baselines.

展示编辑重放结果。图 (a) 显示 ReDesign 在所有编辑类型上的 SSIM 均优于基线;图 (b) 显示其在文本编辑上的最高召回率。这是证明其可编辑性的关键证据。

意义与局限:近似重构的现实

意义与局限:近似重构的现实
Fig. 9: Our method offers the flexibility to adjust editing granularity through a user- in-the-loop revision.

ReDesign 为设计资产自动化恢复提供了新范式,但其恢复结果是近似重构,非原始文件精确副本。图层粒度可能与地面真实值不完全一致,且矢量化对复杂纹理并非总是适用。此外,系统高度依赖 VLM 后端,计算成本仍是实际部署的挑战。以上就是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 评估在 Figma 数据集和 Crello 数据集上进行,涵盖重建准确率(L1、PSNR、LPIPS、PQ、F1)和可编辑性指标。Figma 数据集包含真实设计文件,而 Crello 数据集提供了更多样化的视觉风格。
  • 引入 Figma Edit Replay Benchmark,包含 909 个原始 Figma 文件和 14,796 条受控编辑指令。该基准通过重放编辑指令(如布局调整、颜色替换、文本修改)并计算 SSIM 和 Text Recall,直接评估恢复文件的实际可编辑性。
  • 对比基线包括 Qwen-Image-Layered、LayerD、VTracer 以及标准 Tool Agent。消融实验分析了 VLM 后端(Gemini-3-flash vs GPT-5-mini)、树深度和记忆层次结构的影响。

关键结果与论文证据

  • 在 Figma Edit Replay Benchmark 上,ReDesign 在所有编辑类型(布局、颜色、文本)上均实现了最佳的 SSIM 和 Text Recall(第 9 页)。这表明其恢复的结构不仅视觉相似,而且语义正确,能够支持精确编辑。
  • 重建准确率方面,ReDesign 在 Figma 数据集上取得了 L1 0.0431、PSNR 26.286 的最佳结果(第 11 页)。在 Crello 数据集上,同样保持了领先的 F1 和 PQ 分数,证明了其跨数据集的泛化能力。
  • 并行树扩展带来了显著的速度提升。相比串行工具调用,ReDesign 实现了高达 7.1 倍的加速(第 12 页)。这得益于独立节点的并发执行和高效的 Lineal Memory 管理。
  • Graceful Verification 在准确性和速度之间取得了最佳平衡。与终端验证相比,局部验证不仅更准确,而且方差更低,因为它能够在错误扩散前及时干预(第 12 页)。

阅读时需要注意

  • 恢复的图层粒度可能与地面真实值不完全一致,尽管支持用户介入修订,但自动化程度仍有提升空间。
  • 矢量化并非对所有设计元素都适用,复杂纹理的矢量化可能导致视觉失真,需要选择性应用。
  • 系统高度依赖 VLM 后端进行控制器和验证器决策,虽然在不同模型间表现出鲁棒性,但计算成本和延迟仍是实际部署的挑战。

关联工作

  • 与 Layered Image Generation 和 Decomposition 方法相比,ReDesign 不仅隔离元素,还恢复完整的可编辑结构。
  • 与 Image Vectorization 工具相比,ReDesign 将矢量化作为可选工具之一,而非强制步骤,从而保留了更多原始视觉信息。
  • 与 Tool-Using Agents(如 ReAct)相比,ReDesign 的结构化树扩展和局部验证机制更适合处理具有层级结构的设计分解任务。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

重新设计:通过代理分解从图像中恢复可编辑的设计结构

Jooyeol Yun*1, Jintae Park*1, Hyesu Lim2, Junha Hyung1, Hyungjin Chung34, 和 Jaegul Choo1

1 KAIST AI, 大田, 韩国 {blizzard072, sonjt00 , sharpeeee, jchoo}@kaist.ac.kr 2 Helmholtz Munich, 诺伊贝格, 德国 hye.lim@helmholtz-munich.de 3 韩国大学, EverEx hj.chung@korea.ac.kr

组: 1

子节点: 2 “75+ Free illustrations” 字体: Gilroy

组:

子节点: 3 位置: [10, 20, 80, 120]2026 矢量路径: 深度: 4

颜色: #F2

矢量路径: 位置: [32, 20, 48, 120] 颜色: #060016 深度: 3 7月 28 重新设计 [cs.CV] 重写文本 交换主题 重排布局

图 1: ReDesign 将光栅图像转换为可编辑表示,支持实时调整,如重写文本、颜色主题交换和重新定位布局,直接应用于设计。访问项目页面以获取交互式演示。

摘要。从光栅图像恢复可编辑的设计文件是现代设计工作流程中常见且昂贵的瓶颈,但仍然具有挑战性,因为可编辑性取决于恢复多模态属性,如排版、矢量几何、颜色、分组和图层顺序。我们提出了 ReDesign,这是一个代理框架,通过跨模态选择和组合专用工具来构建可编辑的图层层次结构。为了在工具输出不完美的情况下保持这一长期决策过程的可靠性,我们在每次扩展时引入优雅验证,提供局部接受、修剪或重试反馈,防止错误积累并避免大规模重跑。为了大规模评估可编辑性,我们引入了 Figma Edit Replay Benchmark,由 909 个原始 Figma 文件和 14,796 个受控编辑指令组成,这些指令在重建输出上重放编辑。在该基准和标准重建指标上,ReDesign 实现了强大的视觉保真度,同时在布局、颜色和文本编辑方面提供了最高的可编辑性,优于分层分解基线和串行工具使用管道。

*表示同等贡献。

第 2 页

2 Yun 等人

1 引言

设计师通常需要适应跨媒体平台的单一设计,为新活动重新利用布局,并进行无障碍调整。在实践中,许多现实世界的设计资产和交接交付物仅以光栅导出或截图形式存在,因此上述任务是从光栅图像重建可编辑版本(例如 Figma 或 Adobe Illustrator 文件)。如今,这种重建工作 largely 是手动的且容易出错,迫使设计师在进行任何有意义的编辑之前,必须经历繁琐的重建过程。因此,一个能自动恢复可编辑组件(如文本层、矢量形状和布局)的系统可以消除这一繁琐步骤,并显著缩短设计师的周转时间。

使光栅图像重新可编辑意味着恢复设计师所使用的相同结构化表示。设计工具(如 Adobe Illustrator、Figma 和 Canva)将排版、颜色和布局作为具有各自参数的独立对象,因为这符合人类感知和编辑设计的方式。这种结构正是使编辑变得容易的原因,因为这些表示揭示了正确的“控制旋钮”,例如文本的字体属性、基本形状的矢量路径以及布局的位置和缩放。本质上,光栅化是从可编辑图层结构到像素的多对一映射,因此从图像中恢复原始结构是一个不适定逆问题。虽然最终外观可能看起来完全相同,但光栅导出不再说明哪些像素属于哪个对象、哪些属性生成了它们,或者元素是如何分层的。因此,系统必须推断出一组合理的对象和参数,涵盖文本、几何、颜色和布局等多种模态,以便结果既与图像匹配,又表现得像可编辑的设计。

许多先前的研究解决了可编辑重建的关键子问题,例如识别文本 [7]、分解图层 [20,34,48] 和提取形状 [27,44]。自然的下一步是将这些组件组合成一个端到端系统,但简单的组合往往不可靠,因为一个工具的错误可能会级联,而单一的固定序列很少能适应真实设计的多样性。在本文中,我们提出了 ReDesign,它通过关注可编辑输出的结构来解决这一差距。可编辑设计自然地以图层层次结构呈现,组和图层以树状组织,因此我们将重建任务定义为从光栅图像恢复这种层次结构。ReDesign 以完整图像作为根节点开始,作为一个视觉语言模型 (VLM) 智能体,反复选择要扩展的节点,并从固定的动作集中组合工具序列以生成子节点,逐步将层次结构细化为原子可编辑元素。

在实践中,工具输出往往是不完美的,控制器可能会做出错误的扩展选择,产生偏离原始设计实际结构的分支。对最终输出的接受或拒绝决策 [4,30] 可能易于计算,但对于哪个扩展失败或如何修复它提供的指导很少。因此,我们在每次节点扩展时引入优雅验证 (Graceful Verification),其中验证器评估提议的子节点,并选择接受扩展、修剪无效分支或使用不同的策略重试。

第 3 页

重新设计 3

工具或配置。验证器针对分层增长特有的失败模式,例如兄弟节点间的重复以及父区域覆盖不完整。通过在分支偏离时立即对问题分支进行剪枝和重试,而不是让错误累积直至导致硬性失败,从而保持树增长的高效性。

为了评估我们的方法,我们引入了 Figma Edit Replay Benchmark(编辑重放基准),这是一个包含来自原始 Figma 文件 [8] 的多样化真实世界设计的集合,具有真实层层次结构和属性。利用该基准,我们评估视觉保真度和可编辑性,其中可编辑性通过重放 14,796 条涵盖布局、颜色和文本的控制编辑指令来衡量。我们的评估表明,ReDesign 相比强大的基线方法实现了更优越的性能。

我们的贡献有三方面:我们的贡献有三方面:

• 我们引入了 ReDesign,这是一个代理式光栅到可编辑的重建系统,将问题表述为结构化树扩展,并通过工具组合将可编辑层层次结构生长为原子元素。 • 优雅验证(Graceful Verification)在每次节点扩展时强制执行局部正确性,提供接受、剪枝和重试结果,从而实现针对性修复并防止由工具错误级联导致的硬性失败。 • 我们构建了 Figma Edit Replay Benchmark 并进行了广泛实验,表明 ReDesign 在布局、颜色和文本编辑方面实现了强大的视觉保真度和最先进的可编辑性,并提供了支持性的消融实验以及与强大基线的比较。

2 相关工作

2.1 分层图像生成与分解

越来越多的研究关注分层感知图像生成 [3,5,9,14,22,25,52] 和分解 [34,38],其动机在于对可控组合和后期编辑的需求 [4, 12, 49, 51]。最接近我们设定的是那些将光栅图形分解为层或生成类似 PSD 的分层输出的方法,旨在实现内在的可编辑性 [20, 34, 48]。这些方法为隔离元素和将编辑限制在局部区域提供了有用的原语,当与现代图像编辑模型 [1, 11] 结合时,它们变得更加实用。然而,生成层只是重建可编辑设计文件的一部分,还需要正确的语义、层次结构和参数,以确保编辑按预期行为。因此,我们将分层分解模型视为更大规模分解工作流中的工具,而非完整的解决方案。

2.2 图像矢量化与 SVG 生成

图像矢量化有着悠久的历史,从经典的追踪管道 [6] 到生成矢量原语或可缩放矢量图形 (SVG) 程序的机器学习模型 [2,27,32,44]。矢量化是重建可编辑形状和图标的重要成分,因为矢量路径暴露了对几何、缩放和外观的直接控制。同时,矢量化并非普遍

第 4 页

4 Yun 等人

这是可取的,因为将复杂纹理或摄影内容强行纳入路径会降低可编辑性,并使表示相对于原始设计创作方式发生失真。因此,实际的重建工作需要决定何时使用矢量路径,以及何时应将区域表示为文本或光栅图层。因此,类似地,我们将矢量化方法作为分层分解过程中的工具集之一,仅在它们最能支持下游编辑时选择性地应用。

2.3 使用工具的智能体

使用工具的智能体通过外部模块扩展了语言和视觉-语言模型 [31,35],使其能够通过动作选择和执行实现多步问题解决 [29, 45]。与此同时,现代图像编辑模型提供了用于局部操作、内容移除和背景补全的实用原语,这些原语可以支持迭代式流水线 [1, 11]。大多数现有的视觉智能体流水线强调串行工具调用,通常与最终输出的阶段验证相结合 [26, 30]。可编辑重建的不同之处在于,它需要一系列长期的结构决策,早期的承诺会改变重建状态并限制后续工具能够恢复的内容。这使得可靠性取决于过程中如何引导和修订中间决策,而不仅仅取决于单个工具的强度或最终验证步骤。我们的工作建立在这些智能体和编辑原语之上,专注于支持在构建可编辑图层层次结构时进行局部修订的结构化序列决策。

3 方法

3.1 问题设置与概述

给定输入的光栅图像,我们的目标是恢复可编辑的设计结构,如图 2 所示。期望的输出是一个包含可编辑元数据的 JSON 层次结构,例如矢量形状、颜色、文本内容、字体、组和 Z 轴顺序,并且必须从作为根节点的图像推断出这棵树形层次结构。

我们维护一棵部分重建树,这是一棵包含元数据字段可能不完整、并随时间逐步填充的节点的树。随着控制器策略从一组固定动作中选择动作,部分重建树会进行扩展。优雅验证器在每个步骤评估提议的扩展,要么接受提议的子节点,要么提供修订动作的信号。当树拥有足够的元数据以导出为可编辑的 JSON 层次结构时,该过程终止。

3.2 动作空间与工具

将光栅设计转换为可编辑格式需要处理异构的元素类型,如文本、矢量形状、照片和分层组合,每种类型都需要不同的专门处理。因此,我们定义

第 5 页

重新设计 5

VLM 动作空间 控制器 提取文本 分层 连通域标记

结构化树扩展

线性记忆 矢量化 检测与分割 字体预测 并行执行

优雅验证

绿色僵尸手 有效

既未幻觉也未冗余

破损僵尸手 无效

破损变体。冗余

魔法书与木棺 有效

完整且无任何视觉瑕疵

图 2:ReDesign 概览。VLM 控制器通过从用于文本、对象和分层分解的固定工具动作集中进行选择,生长出可编辑的分层结构,并在每次从父节点到子节点的扩展时运行优雅验证,以接受有效分割、修剪冗余或幻觉子节点,或触发重试,直到恢复原子可编辑元素。

一个离散动作空间,其中每个动作封装了针对特定分解场景定制的工具链。该空间在设计上是模块化的,随着新工具的可用可以扩展。

文本提取。光学字符识别工具 [7] 定位并读取可见文本,随后对文本像素进行分割 [46] 并对腾出的区域进行修复 [33],生成文本层和带有剩余背景的剩余层。

多层分解。分层图像生成模型 [48] 提供强大的分解能力,将光栅图像分离为不同的层,并根据视觉复杂性自适应选择层数。

连通域标记。当一层包含多个空间上不相连的元素时,可以使用简单的连通域标记算法 [28] 将其拆分为不重叠的子节点。

检测与分割。对于纠缠的对象,VLM [10] 识别最前方的元素,开放集检测器 [21] 定位它,分割

第 6 页

6 Yun 等人

模型 [16] 提取它,并采用修复模型 [33, 53] 填充裁剪出的区域,从而生成前景节点和背景节点。

矢量化。叶节点最终被确定为形状类内容的矢量化 SVG 路径 [6],或带有放置元数据的栅格图层(用于摄影内容)。文本叶节点经过字体识别 [39] 和排版属性拟合,以生成携带必要字体属性的完全可编辑文本元素。

3.3 树扩展的控制策略

控制策略的核心思想是遵循可编辑设计文件的结构,而非串行或非结构化的动作序列(工具调用)。因此,我们将重建过程表示为一棵树,该树从完整画布逐步生长为更小、更具体的区域,使得早期决策建立高层分组和排序,而后期决策将每个分组细化为可编辑的叶节点。每个节点代表一个局部区域及其当前的元数据,以及先前工具已推断出的任何属性。在每一步中,控制器根据节点的局部渲染结果以及为该节点存储的扩展历史(记录先前的工具选择和验证结果)选择一个动作。

此外,由于扩展仅依赖于父节点及其线性记忆(Lineal Memory)状态,而不依赖于兄弟节点的状态,我们的结构化树生长自然地实现了在所有当前叶节点上的并行扩展。因此,我们可以同时扩展多个叶节点,这在无需改变决策逻辑或牺牲恢复层次结构的由粗到细一致性的情况下,提高了吞吐量。

3.4 优雅验证(Graceful Verification)

仅靠结构化扩展并不能保证重建的正确性,因为工具的不完美和控制器的偶尔错误可能会在兄弟节点间提出重复内容、使父区域的部分内容无法解释,或引入输入中从未存在的内容。这些错误尤其有害,因为它们会立即改变树的状态,从而限制所有后续动作,导致硬性失败,迫使系统从头重新运行。

然而,我们的结构化扩展有效地将每个错误的范围限制在单个“父节点到子节点”的提议中,从而使验证既局部又定义明确,因为扩展的目标仅仅是将一个父区域分解为一组共同解释它的子节点。因此,我们在每个提议的扩展上附加一个优雅验证步骤,并根据两个简单标准评估候选子节点是否形成有效的分解:(1) 子节点的并集是否覆盖了父内容,以及 (2) 子节点是否超出了父内容的范围。验证器要么接受扩展,修剪无效或冗余的子节点,要么通过请求不同的工具选择或调整同一父节点的超参数来触发重试。通过这种方式,错误在基于它们构建更深分支之前得到局部修正,并且

第 7 页

重新设计 7

设计样本编辑指令

编辑文本 删除

重新排序

旋转

平均 ×1.35 Figma 图层深度 Crello 文本元素 ×2.45 重新着色 每样本 元素 ×2.62 每样本 重新定位 0 5 10 15 20 25 30 (a) Figma 数据集 (b) 编辑重放基准

图 3: (a) Figma 示例及与 Crello 数据集的统计对比。(b) 编辑重放基准及详细的编辑类型。

控制器接收与单个“父节点到子节点”决策相关的结构化反馈,从而减少需要大规模重跑的硬性故障。

3.5 记忆管理与修复信号

我们为每个节点维护一个线性记忆(Lineal Memory),这意味着每次扩展仅存储从根节点到当前节点的路径历史,而不跟踪兄弟节点的状态。这种设计既避免了指数级增长,也防止了因并行执行导致的并发问题。具体而言,对于每个节点,我们记录工具输入和输出、工具选择及超参数,以及任何验证结果或失败原因。这种紧凑的记录使控制器的下一次决策更加有据可依,因为它可以复用有效的配置并避免重复已失败的设置。因此,当扩展被验证器拒绝或修剪时,控制器可以根据存储的失败信号执行局部修复,通过选择不同的动作或调整设置来继续生长,而不干扰树的其他部分,从而减少冗余计算并保持并行进度的稳定。

4 实验

4.1 Figma 数据集与编辑重放基准

为了评估具有真实结构地标的现实世界设计工件的重建效果,我们收集了 909 个原始 Figma 设计文件的数据集。每个文件提供了图层层次结构以及元素类型和属性,包括文本内容和排版、矢量形状、颜色和顺序。如图 3 (a) 所示,我们发现与原始 Crello 数据集 [43] 相比,Figma 数据集由更复杂的现实世界设计组成,平均每样本包含 2.62 倍多的元素。

第 8 页

8 Yun 等人

我们使用这些文件通过生成配对监督数据来评估可编辑性。具体而言,对于每个设计,我们直接对原始 Figma 文档应用受控编辑(例如重新定位、文本编辑和重新着色),并将编辑后的图像渲染为真实值(ground truth)。总共,我们整理了 14,796 条编辑指令,平均每个设计包含 15 条编辑。

我们还在 Crello 数据集 [43] 上评估视觉重建准确率,该数据集提供带有注释的光栅设计图像。遵循标准做法,我们报告 Crello 上的重建指标,以便与强调视觉保真度和元素恢复的先前方法进行对比。

4.2 基线

分层图像分解。我们将 Qwen-Image-Layered [48] 和 LayerD [34] 作为对比基线,它们将输入图像分解为一组 RGBA 图层。由于 RGBA 图像无法直接编辑,我们按照原始论文中的讨论,使用 OCR 和矢量化工具对图层进行后处理。

基于工具的智能体(Tool using agent)。我们将一个标准的基于工具的智能体作为对比基线,其类似于 ReAct 框架 [45],拥有相同的工具和内存访问权限,并使用相同的 VLM 主干网络。该智能体通过单次线性序列的工具调用生成可编辑的 JSON 输出,并在最后进行验证。

图像矢量化。我们将 VTracer [6] 作为对比基线,这是一种广泛使用的图像矢量化工具,并将其输出视为可编辑设计。我们还尝试了最近的矢量化模型(例如 OmniSVG [44] 和 StarVector [27]),但发现由于领域差异(domain gap),它们在设计图像上的表现不佳,因为这些模型主要是在图标或简化图形上训练的。

4.3 可编辑性

编辑重放协议(Edit replay protocol)。我们在 Figma 设计数据集上使用编辑重放协议评估可编辑性,这意味着我们将相同的编辑操作应用于真实值设计和重建设计,然后比较渲染结果。每个示例提供一个真实值可编辑设计文件及其对应的光栅图像,随后每种方法将光栅图像作为输入,并生成相同目标格式的可编辑输出。然后,我们在真实值文件上重放编辑指令以获得渲染参考,在预测的可编辑输出上重放相同的指令,最后测量两个编辑后渲染结果之间的一致性。

具体而言,为了将相同的指令应用于预测的可编辑输出,我们首先将目标真实值元素与预测中的元素进行匹配。由于不同模型对重建设计的表示不同,我们使用所有分解元素中最高交并比(IoU)来匹配目标和真实值。如果不存在合适的匹配,则不执行编辑。否则,我们将相同的属性更改应用于匹配到的预测元素,并渲染编辑后的预测结果。我们

第 9 页

重新设计 9

0.75

0.7

召回率 0.65 0.45 文本 0.4

0.35

0.3

(a) 编辑重放后的 SSIM (b) 文本编辑后的文本召回率

图 4: (a) 不同编辑类型的编辑重放 SSIM,我们的方法在所有编辑中表现最佳。(b) 重放文本编辑后通过文本召回率衡量的文本可编辑性,我们的方法在基线中实现了最高的召回率。

衡量真实渲染图像与编辑图像之间的结构相似性 (SSIM) [37]。对于文本编辑,我们额外评估编辑后的文本是否通过在对渲染结果运行 OCR 并报告相对于真实渲染文本的文本召回率来正确实现。

可编辑性结果。如图 4 所示,我们的方法在所有编辑类型中实现了最佳的可编辑性,表明恢复的层次结构支持外观编辑和结构编辑而不破坏设计。特别是在重着色和不透明度等属性编辑方面,我们的表现强劲,而基线方法往往失败,因为目标元素没有干净地分离,且编辑渗入背景像素或邻近图层。Qwen-Image-Layered [48] 和 LayerD [34] 在删除和旋转等较简单的几何编辑方面仍然具有竞争力,但在依赖正确元素归属和排序的编辑上,其性能下降,这需要模型恢复哪些像素属于哪个图层以及图层如何堆叠。我们在文本方面观察到相同的趋势,图 4 (b) 显示,在重放文本编辑后,我们的方法实现了最高的文本召回率,而工具智能体基线急剧下降,因为长串行工具链中的错误级联往往在早期就破坏了重建,而文本通常是后续步骤中首先变得扭曲且无法检测到的内容。

图 5 中的定性示例说明了这种故障模式,即针对某一元素的编辑无意中影响了其他几个元素。总体而言,这些结果表明,结构化重建产生了可以精确定位的表示,并且优雅验证防止了早期的分解错误传播到需要正确分组和 Z 序的编辑失败中。

第 10 页

10 Yun 等人

真实编辑 我们的方法 Qwen-Image-Layered LayerD 工具代理

图 5:对每种基线生成的可编辑格式执行编辑指令的示例。真实编辑对包括原始图像(左上角)和编辑后的图像。目标编辑区域以绿色高亮显示。建议在数字设备上查看。

4.4 重建精度

我们在 Figma 设计数据集和 Crello 数据集上评估视觉重建精度。对于每个输入的栅格图像,每种方法都会在我们的目标格式中生成可编辑的输出,我们将其重新渲染为栅格图像。我们使用互补指标将渲染后的重建结果与输入进行比较,这些指标捕捉对象级外观(平均 L1 误差)、全局视觉保真度(PSNR 和 LPIPS [50])以及布局保真度(全景质量 (PQ) [15] 和检测 F1),结果报告在表 1 和表 2 中。

在 Figma 数据集上,我们的方法在所有指标上均表现最佳,提升了对象外观、全局保真度和布局。工具代理基线方法的全局保真度明显弱于其他方法,这支持了我们采用带有优雅验证的结构化分层分解的设计选择,以防止在长线性工具链中产生误差累积。Qwen-Image-Layered [48] 实现了较强的全局相似性,但在布局方面落后,这与层分解方法相符,即这些方法在匹配整体外观的同时,对元素进行了错误的分割或排序。定性结果展示在图 6 中,基线方法通常在合理的分层布局和精确的对象分割之间进行权衡,而我们的

第 11 页

重新设计 11

表 1:在 Figma 数据集上测量的重建精度。

对象级 全局级 布局 方法 L1↓ PSNR↑ LPIPS↓ PQ↑ F1↑

VTracer [6] 0.0977 20.487 0.1917 24.64 0.309 LayerD [34] 0.0704 16.141 0.3381 30.09 0.350 Qwen-Image-Layered [48] 0.0493 26.192 0.1073 35.37 0.429 Tool Agent [45] 0.0493 13.923 0.3869 45.33 0.527

Ours 0.0431 26.286 0.0883 45.37 0.535

表 2:在 Crello 数据集 [43] 上测量的重建精度

对象级 全局级 布局 方法 L1↓ PSNR↑ LPIPS↓ PQ↑ F1↑

VTracer [6] 0.0953 18.805 0.2919 19.55 0.243 LayerD [34] 0.0938 14.452 0.4585 30.98 0.369 Qwen-Image-Layered [48] 0.0506 26.419 0.0985 40.19 0.496 Tool Agent [45] 0.0767 12.011 0.5674 44.16 0.527

Ours 0.0465 23.525 0.1249 49.57 0.587

原始图像 Ours Qwen-Image-Layered LayerD Tool Agent

图 6:与基线方法相比的分解精度比较。以前的方法往往无法高精度地分解多个对象。

第 12 页

12 Yun 等人

该方法同时保留了两者,从而生成在结构上连贯且易于编辑的分解结果。 在 Crello 上,趋势相似。LayerD 和 Qwen-Image-Layered 由于训练分布更接近而有所提升,但我们的方法在保持对象级和全局指标具有竞争力的同时,仍实现了最强的布局保真度,且无需在 Crello 数据集上进行显式训练。

5 分析

5.1 推理成本、方差与并行性

代理系统必须考虑成本,因为每个规划步骤和工具调用都会消耗时间和令牌,人们可能会认为增加验证只会使流水线变慢。相比之下,我们的结果表明,许多小型局部验证比少数大型终端检查更便宜,因为验证每个结构化分解步骤并立即修复错误,避免了原本会迫使昂贵重启的长错误级联。在图 7(a) 中,我们绘制了单次运行的时间与准确率(即 PSNR)的关系,发现我们的方法比稀疏终端验证更快且更准确,这表明保持每一步的安全往往是穿越搜索空间的最短路径。此外,我们发现我们的执行 episode 在工具调用次数上的方差较低,表明执行稳定,工具调用浪费最少。

×7.1

×2.2

×1.7

×1.0

0 1 2 3 4 5 6 7 8

(a) 验证成本-准确率权衡 (b) 并行执行的运行时间

图 7: (a) 验证成本与准确率的权衡。优雅验证比终端验证更快、更准确,且方差更低。(b) 并行树扩展带来的加速。独立的节点扩展支持并发执行,相比串行工具使用,最高可实现 7.1 倍的加速。

此外,由于决策和工具调用通常在单个串行轨迹中执行 [17,19,40, 41],使用工具的代理在实际应用中往往较慢。相比之下,我们的重建组织为树状结构,每个扩展仅依赖于其父节点和线性记忆,而非兄弟状态,因此多个前沿节点可以在没有并发冲突的情况下并行扩展。结果,与串行工具

第 13 页

重新设计 13

执行,如图 7 (b) 所示。更广泛地说,我们的分析表明,将重建表述为树扩展不仅在技术意义上实现了加速,因为独立节点可以以最小的共享状态并发调度,而且在理论意义上实现了加速,因为依赖结构将关键路径长度从扩展次数减少到了层次结构的深度。

我们的方法

2 原始图像 香蕉 Nano

将纸袋移动到右下角。 将纸袋移动到书桌后面。 将纸袋向上移动 100 像素并逆时针旋转 45°。

图 8: Nano Banana 2 在空间编辑上的对比。对于相同的移动和旋转指令,Nano Banana 2 经常改变非预期区域并改变图像尺寸。

5.2 为何可编辑格式仍然重要

图像编辑模型 [1, 11] 正迅速变得更加强大,通常能产生视觉上合理的单步编辑,这使它们作为设计迭代的通用解决方案颇具吸引力。图 8 中的对比显示,这种灵活性并不一定意味着准确性,因为 Nano Banana 2 这一最先进的图像编辑服务在处理详细的空间调整时遇到困难,甚至在指令是局部的情况下也会改变纵横比。这凸显了恢复显式可编辑表示的重要性,因为具有对象身份和参数的图层层次结构支持确定性的布局更改、稳定的构图以及可重复的多步编辑,而不会产生非预期的全局扭曲。

5.3 局限性

很难定义一种良好的可编辑格式,因为它取决于预期的编辑类型以及设计师所需的控制级别。例如,当目标是进行布局级调整时,矢量化可能是不必要的;而在编辑图标或形状时,精细的路径则至关重要。由于我们没有针对匹配 Figma 或 Crello 注释的确切粒度进行训练,因此即使渲染外观正确,我们的重建结果也不总是与它们的图层分割完全一一对应。 同时,不受固定训练分布的束缚赋予了我们的系统灵活调整至任何粒度级别的能力。由于重建

第 14 页

14 Yun 等人

初始输出 用户介入粒度控制 修订输出

我想要对 Kaonashi 进行更细粒度的分解。

明白了!正在解析 Kaonashi……

重新设计

将三个标题合并为一段。

正在合并前几步的节点……

重新设计

无标题 单个标题 无面部区域 无面部区域

不支持 支持

“居中标题,编辑面部表情”

图 9:我们的方法允许通过用户介入的修订来调整编辑粒度。

具有代理特性,用户可以通过提示请求更细或更粗的分解,系统可以继续扩展树以匹配所需的编辑意图,如图 9 所示。此外,层级结构自然地首先暴露高层级组,因此复杂的矢量路径可以保持封装,仅在用户明确需要底层几何控制时才被揭示。

6 结论

在本文中,我们介绍了一种代理框架,该框架通过生长具有专用工具的图层层级,并在每次节点扩展时执行优雅验证,从而从光栅图像重建可编辑的设计文件,以便在本地检测和修复错误,而不是累积成难以挽回的失败。在我们包含 14,796 条编辑重放指令的原始 Figma 文件新基准上,ReDesign 提供了强大的视觉保真度,同时在布局、颜色和文本编辑方面实现了最高的可编辑性;我们的分析表明,步骤级验证和树状执行比终端检查和串行工具链更快、更准确且更可靠。

更广泛地说,我们的结果表明了代理系统的一个实用方向,即对代理如何表示进展施加结构约束,可以同时提高可控性、准确性和效率,因为失败变得局部且可修复,执行变得可预测从而可扩展。

在工作流设计的视角下,尽管基于光栅的图像编辑能力不断增长,但我们的方法指向了一个未来,即可编辑表示仍然至关重要,因为它们通过显式对象、参数和层级提供精确的实时控制,使用户能够以可预测的行为进行有针对性的更改,而不是依赖脆弱的光素级编辑。

第 15 页

重新设计 15

致谢

本工作得到了韩国政府(MSIT)资助的信息通信技术规划与评估研究所(IITP) grants 的支持(RS-2019-II190075,人工智能研究生院项目(KAIST))。 本工作得到了韩国政府(MSIT)资助的韩国国家研究基金会(NRF) grants 的支持(No. RS-2025-00555621)。 本工作得到了韩国中小企业和初创企业部(MSS)资助的技术创新研发项目(RS-2024-00438252)的支持。

参考文献

1. Batifol, S., Blattmann, A., Boesel, F., Consul, S., Diagne, C., Dockhorn, T., English, J., English, Z., Esser, P., Kulal, S., et al.: Flux. 1 kontext: Flow matching for in-context image generation and editing in latent space. arXiv preprint (2025) 3, 4, 13 2. Carlier, A., Danelljan, M., Alahi, A., Timofte, R.: Deepsvg: A hierarchical generative network for vector graphics animation. NeurIPS (2020) 3, 2 3. Chen, H., Xu, X., Li, W., Ren, J., Ye, T., Liu, S., Chen, Y.C., Zhu, L., Wang, X.: Posta: A go-to framework for customized artistic poster generation (2025) 3 4. Chen, J., Wang, Z., Zhao, N., Zhang, L., Liu, D., Yang, J., Chen, Q.: Rethinking layered graphic design generation with a top-down approach. In: ICCV (2025) 2, 3, 1 5. Chen, J., Jiang, H., Wang, Y., Wu, K., Li, J., Zhang, C., Yanai, K., Chen, D., Yuan, Y.: Prismlayers: Open data for high-quality multi-layer transparent image generative models. arXiv preprint (2025) 3 6. Cortex, V.: Vtracer (2023), https://www.visioncortex.org/vtracer-docs 3, 6, 8, 11, 1 7. Cui, C., Sun, T., Lin, M., Gao, T., Zhang, Y., Liu, J., Wang, X., Zhang, Z., Zhou, C., Liu, H., Zhang, Y., Lv, W., Huang, K., Zhang, Y., Zhang, J., Zhang, J., Liu, Y., Yu, D., Ma, Y.: Paddleocr 3.0 technical report (2025) 2, 5 8. Figma, I.: Figma community. https://www.figma.com/community 3 9. Fontanella, A., Tudosiu, P.D., Yang, Y., Zhang, S., Parisot, S.: Generating compositional scenes via text-to-image rgba instance generation. NeurIPS (2024) 3, 1 10. Google: Gemini 3 (2025), https://blog.google/products-and-platforms/products/gemini/gemini-3/ 5 11. Google DeepMind: Nano banana: Ai image editing tool (2025) 3, 4, 13 12. Huang, R., Cai, K., Han, J., Liang, X., Pei, R., Lu, G., Xu, S., Zhang, W., Xu, H.: Layerdiff: Exploring text-guided multi-layered composable image synthesis via layer-collaborative diffusion model. In: ECCV. Springer (2024) 3, 1 13. Jain, A., Xie, A., Abbeel, P.: Vectorfusion: Text-to-svg by abstracting pixel-based diffusion models. In: CVPR. pp. 1911–1920 (2023) 1 14. Kang, K., Sim, G., Kim, G., Kim, D., Nam, S., Cho, S.: Layeringdiff: Layered image synthesis via generation, then disassembly with generative knowledge. arXiv preprint (2025) 3, 1 15. Kirillov, A., He, K., Girshick, R., Rother, C., Dollár, P.: Panoptic segmentation. In: CVPR (2019) 10

第 16 页

16 Yun 等

16. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., 等:Segment anything。在:ICCV (2023) 6 17. Li, K., Zhang, Z., Yin, H., Ye, R., Zhao, Y., Zhang, L., Ou, L., Zhang, D., Wu, X., Wu, J., 等:Websailor-v2: Bridging the chasm to proprietary agents via synthetic data and scalable reinforcement learning。arXiv 预印本 (2025) 12 18. Li, T.M., Lukáč, M., Gharbi, M., Ragan-Kelley, J.:Differentiable vector graphics rasterization for editing and learning。ACM TOG 39(6), 193:1–193:15 (2020) 1 19. Li, Z., Guan, X., Zhang, B., Huang, S., Zhou, H., Lai, S., Yan, M., Jiang, Y., Xie, P., Huang, F., 等:Webweaver: Structuring web-scale evidence with dynamic outlines for open-ended deep research。arXiv 预印本 (2025) 12 20. Liu, C., Song, Y., Wang, H., Shou, M.Z.:Omnipsd: Layered psd generation with diffusion transformer。arXiv 预印本 (2025) 2, 3, 1 21. Liu, S., Zeng, Z., Ren, T., Li, F., Zhang, H., Yang, J., Li, C., Yang, J., Su, H., Zhu, J., 等:Grounding dino: Marrying dino with grounded pre-training for open-set object detection。ECCV (2024) 5 22. Liu, Y.L., Lai, W.S., Yang, M.H., Chuang, Y.Y., Huang, J.B.:Learning to see through obstructions。在:CVPR (2020) 3 23. Ma, X., Zhou, Y., Xu, X., Sun, B., Filev, V., Orlov, N., Fu, Y., Shi, H.:Towards layer-wise image vectorization。在:CVPR。pp. 16314–16323 (2022) 1 24. Nie, H., Zhang, Z., Cheng, Y., Yang, M., Shi, G., Xie, Q., Shao, J., Wu, X.:De- composition of graphic design with unified multimodal model。在:ICML (2025) 1 25. Pu, Y., Zhao, Y., Tang, Z., Yin, R., Ye, H., Yuan, Y., Chen, D., Bao, J., Zhang, S., Wang, Y., 等:Art: Anonymous region transformer for variable multi-layer transparent image generation。在:CVPR (2025) 3, 1 26. Qi, Z., Ma, M., Xu, J., Zhang, L.L., Yang, F., Yang, M.:Mutual reasoning makes smaller llms stronger problem-solvers。ICLR (2025) 4 27. Rodriguez, J.A., Agarwal, S., Laradji, I.H., Rodriguez, P., Vazquez, D., Pal, C., Pedersoli, M.:Starvector: Generating scalable vector graphics code from images。 CVPR (2025) 2, 3, 8 28. Samet, H., Tamminen, M.:Efficient component labeling of images of arbitrary dimension represented by linear bintrees。IEEE TPAMI 10(4), 579–586 (2002) 5 29. Schick, T., Dwivedi-Yu, J., Dessì, R., Raileanu, R., Lomeli, M., Hambro, E., Zettle- moyer, L., Cancedda, N., Scialom, T.:Toolformer: Language models can teach themselves to use tools。NeurIPS (2023) 4 30. Shinn, N., Cassano, F., Gopinath, A., Narasimhan, K., Yao, S.:Reflexion: Language agents with verbal reinforcement learning。NeurIPS (2023) 2, 4 31. Singh, A., Fry, A., Perelman, A., Tart, A., Ganesh, A., El-Kishky, A., McLaughlin, A., Low, A., Ostrow, A., Ananthram, A., 等:Openai gpt-5 system card。arXiv 预印本 (2025) 4 32. Song, Y., Chen, D., Shou, M.Z.:Layertracer: Cognitive-aligned layered svg syn- thesis via diffusion transformer。在:ICCV (2025) 3, 2 33. Suvorov, R., Logacheva, E., Mashikhin, A., Remizova, A., Ashukha, A., Silvestrov, A., Kong, N., Goka, H., Park, K., Lempitsky, V.:Resolution-robust large mask inpainting with fourier convolutions。在:IEEE/CVF Winter Conference on Appli- cations of Computer Vision (2022) 5, 6 34. Suzuki, T., Liu, K.J., Inoue, N., Yamaguchi, K.:Layerd: Decomposing raster graphic designs into layers。在:ICCV。pp. 17783–17792 (2025) 2, 3, 8, 9, 11, 1

第 17 页

重新设计 17

35. Team, G., Anil, R., Borgeaud, S., Alayrac, J.B., Yu, J., Soricut, R., Schalkwyk, J., Dai, A.M., Hauth, A., Millican, K., 等:Gemini:一系列高度多模态模型。arXiv 预印本 (2023) 4 36. Team, L.:Langgraph:构建循环多智能体系统。https://github.com/langchain-ai/langgraph (2024) 7 37. Wang, Z., Bovik, A.C., Sheikh, H.R., Simoncelli, E.P.:图像质量评估:从误差可见性到结构相似性。IEEE TIP (2004) 9 38. Wang, Z., Zhao, H., Zhou, Q., Lu, X., Li, X., Song, Y.:Diffdecompose:通过扩散 Transformer 对 Alpha 合成图像进行分层分解。arXiv 预印本 (2025) 3, 1 39. WhatFontIs:WhatFontIs – 字体识别 API (2024), https://www.whatfontis.com/ 6 40. Wu, J., Li, B., Fang, R., Yin, W., Zhang, L., Tao, Z., Zhang, D., Xi, Z., Fu, G., Jiang, Y., 等:Webdancer:迈向自主信息搜索智能体。NeurIPS (2025) 12 41. Wu, J., Yin, W., Jiang, Y., Wang, Z., Xi, Z., Fang, R., Zhang, L., He, Y., Zhou, D., Xie, P., 等:Webwalker:在 Web 遍历中评估大语言模型。见:计算语言学协会第 63 届年会论文集(第 1 卷:长论文)。pp. 10290–10305 (2025) 12 42. Xing, X., Zhou, H., Wang, C., Zhang, J., Xu, D., Yu, Q.:Svgdreamer:基于扩散模型的文本引导 SVG 生成。见:CVPR。pp. 4546–4555 (2024) 1 43. Yamaguchi, K.:Canvasvae:学习生成矢量图形文档。见:ICCV (2021) 7, 8, 11 44. Yang, Y., Cheng, W., Chen, S., Zeng, X., Yin, F., Zhang, J., Wang, L., Yu, G., Ma, X., Jiang, Y.G.:Omnisvg:统一的可扩展矢量图形生成模型。NeurIPS (2025) 2, 3, 8 45. Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K.R., Cao, Y.:React:协同语言模型中的推理与行动。见:ICLR (2023) 4, 8, 11 46. Ye, M., Zhang, J., Liu, J., Liu, C., Yin, B., Liu, C., Du, B., Tao, D.:Hi-sam:将 Segment Anything 模型用于分层文本分割。IEEE 模式分析与机器智能汇刊 (2024) 5 47. Yin, P., Zhu, J., Gao, H., Zheng, C., Huang, Y., Zhou, T., Yang, R., Liu, W., Chen, W., Guo, C., 等:vllm-omni:面向任意多模态模型的完全解耦服务。arXiv 预印本 (2026) 7 48. Yin, S., Zhang, Z., Tang, Z., Gao, K., Xu, X., Yan, K., Li, J., Chen, Y., Chen, Y., Shum, H.Y., 等:Qwen-image-layered:通过分层分解实现固有可编辑性。arXiv 预印本 (2025) 2, 3, 5, 8, 9, 10, 11, 1, 7 49. Zhang, L., Agrawala, M.:使用潜在透明度进行透明图像层扩散。ACM TOG (2024) 3, 1 50. Zhang, R., Isola, P., Efros, A.A., Shechtman, E., Wang, O.:深度特征作为感知度量的不合理有效性。见:CVPR (2018) 10 51. Zhang, X., Zhao, W., Lu, X., Chien, J.:Text2layer:使用潜在扩散模型进行分层图像生成。arXiv 预印本 arXiv:2307.09781 (2023) 3, 1 52. Zhang, Z., Cheng, Y., Hong, D., Yang, M., Shi, G., Ma, L., Zhang, H., Shao, J., Wu, X.:Creatiposter:迈向可编辑和可控的多层图形设计生成。arXiv 预印本 (2025) 3 53. Zhao, J., Zhou, S., Wang, Z., Yang, P., Loy, C.C.:Objectclear:通过对象-效果注意力实现完全对象移除。见:CVPR (2026) 6

第 18 页

重新设计 1

附录

A 更广泛的影响与伦理考量

从光栅图像中恢复可编辑的设计结构,可以通过减少重建扁平化资产(如截图或导出文件)所需的工作量,来改善创意工作流程。这使得诸如修改文本、颜色、布局、无障碍属性或本地化内容等常见任务变得容易得多,尤其是在原始源文件不可用的情况下。

与此同时,这种能力也引发了滥用的担忧。ReDesign 等系统可能会降低复制受版权保护的图形、品牌资产或商业模板的门槛,因为它们更容易被修改和重用。因此,我们将 ReDesign 视为一种用于合法编辑场景的工具,例如修改授权资产或恢复自己材料的可编辑性,而不是用于绕过所有权或归属权。在部署时,此类系统应配合安全措施,包括明确传达恢复的文件仅是近似重建、针对受保护资产的使用政策,以及 discouraging 未署名复制的溯源或审计机制。

B 扩展相关工作

分层图像生成。越来越多的工作超越了扁平 RGB 合成,转向由多个透明层组成的图像表示,其动机在于观察到分层结构比单个光栅图像提供更可编辑的中间表示。早期的工作探索了前景-背景分离、有限的透明层合成,或后处理分解管道,这些管道首先产生扁平图像,然后恢复组成区域或 alpha 层 [12,49,51]。最近的方法通过直接建模层间的相互作用、保持透明度并鼓励局部元素与最终合成图像之间的一致性,将此想法扩展到更丰富的 RGBA 分解 [9,14,25,38,48]。与此同时,另一条工作线研究分解而非合成。给定一个扁平化的图像,目标是推断组成层、恢复透明度并分离可见元素,从而使图像再次可编辑 [4, 20, 24, 34]。总之,这些工作确立了分层生成和分解作为可控编辑的重要方向,同时主要集中于针对 RGBA 风格输出的学习端到端公式。

矢量图形生成。一个相关的方向研究将光栅图像转换为矢量图形,这对于徽标、图标、插图和其他以形状为主的资产特别有用。一类方法将矢量化表述为基于可微渲染的优化或迭代路径拟合,旨在寻找一个渲染结果与输入图像匹配的紧凑矢量程序 [6,

第 19 页

Yun 等人

13, 18, 23, 42]。另一类方法将 SVG 视为结构化序列,并学习直接生成矢量图形,从而在纯基于优化的公式之上提升了语义连贯性和多模态可控性 [2,27,32,44]。最近的工作进一步探索了分层 SVG 生成,其中矢量基元被组织成具有语义意义的组,而不是单个扁平序列 [32]。这些方法与可编辑性高度相关,但它们主要针对矢量形式的重建或生成。在现实的设计恢复中,只有部分元素自然地允许矢量表示,而文本、光栅图像和外观繁重的效果通常以其他形式保留更好。由于改进的速度和准确性,我们使用前向式矢量化模型而不是基于优化的模型。

C 扩展分析

C.1 分解树深度上的动作选择

图 10 揭示了控制器中出现的清晰的由粗到细的分解策略。在浅层深度,控制器优先考虑文本提取,反映出早期致力于保留高价值、语义精确的元素,如文本。在深度 1,它频繁调用 Qwen-Image-Layered 进行广泛的结构分割,产生暴露设计主要组织的粗略语义层。在深度 2,CCL 变得更加常见,因为这些粗略层通常分解为空间上不相连的组件,可以干净地分离而无需生成式推理。

提取文本 分叉层 CCL 检测与分割 长度 2 100% 长度 3 10.5% 18.0% 长度 4 80% 长度 5 12.8% 长度 6 60%

40%

20% 25.5% 33.3%

0% 深度 0 深度 1 深度 2 深度 3 深度 4 深度 5

(a) 按树深度的动作分布 (b) 分叉层长度分布

图 10: (a) 每个树深度的控制器动作分布。(b) Qwen-Image-Layered 调用的层长度超参数分布。

在这些早期阶段之后,控制器不再受显式深度特定偏好的指导,而是根据其每个节点的内容调整其选择。在这种机制下,检测与分割变得越来越普遍,表明更深层次的节点由局部、细粒度的细化主导,而不是全局重构。这种进展表明分解树是

第 20 页

重新设计 3

这不仅仅是一个记账工具:它诱导了跨深度的有意义分工,早期层级处理语义重要且全局结构化的内容,后期层级专注于精确的视觉清理。

图 10 (b) 进一步显示,控制器根据节点复杂度调整 Qwen-Image-Layered 的层长超参数。控制器并非应用固定的分解粒度,而是根据当前节点的视觉纠缠程度来扩展或限制提议的层数。总之,这些结果表明,我们的智能体学会了将深度作为一种组织先验,以结构化且自适应的方式将不同工具分配给分解的不同阶段。

接受 修剪 重试

100%

80%

60%

40%

20%

0% CCL 提取 检测与分叉 文本 分割 层

图 11:每种分解动作的验证器决策分布。

C.2 优雅验证期间的重试率

图 11 显示了四种主要分解动作的验证器结果的实证分布。验证行为按设计依赖于动作。对于直接从输入中提取内容的 CCL 和文本提取,我们将验证器限制为二元的接受或重试决策,因为修剪会不可逆地丢弃信息。对于依赖偶尔幻觉出不存在内容的生成模型的检测与分割和分叉层,验证器还被允许修剪个别子节点。除了 CCL 外,相当一部分工具输出需要通过重试或部分修剪进行干预。图 12 和图 13 说明了 Qwen-Image-Layered 和 LayerD 的典型故障模式,包括幻觉内容、不完整的分离和模糊伪影,证实了优雅验证对于在错误输出传播到重建树之前将其过滤掉至关重要。

第 21 页

4 Yun 等人

原始图像 第1层 第2层 第3层 第4层

图 12: Qwen-Image-Layered 在 Figma 基准测试中的失败案例。

C.3 对 VLM 主干网络的鲁棒性

我们将两种 VLM 作为控制器和验证器进行比较,分别是 Gemini-3-flash(我们的默认设置)和 GPT-5 mini,结果见表 3。这两个模型在验证严格性的支配下,略微表现出覆盖率与保真度之间的权衡。GPT-5 mini 应用更严格的验证,仅选择性地保留高置信度元素。这通过确保最终合成图像不包含较低置信度的重建结果,提高了全局级别的保真度(PSNR 和 LPIPS)。Gemini 更全面地分析多图像上下文并避免过度修剪,从而在元素级别指标(L1、PQ 和 F1)上表现更强。更广泛的元素覆盖率略微改变了合成图像的分布,但更好地保留了原始设计的完整结构。尽管如此,这两种 VLM 主干网络之间的差异很小,与使用代理的朴素工具相比,我们的结构化工作流实现了稳健的性能提升。我们采用 Gemini 作为默认设置,因为更高的元素覆盖率更有利于下游的可编辑性。

C.4 定量消融研究

我们在表 4 中报告了通过改变树深度和记忆层级进行的实验的定量结果。结果与我们之前的分析一致,即浅层深度产生粗略分解(高准确率且较少

第 22 页

重新设计 5

原始图像 第1层 第2层 第3层 第4层

图 13:LayerD 在 Figma 基准测试中的失败案例。

可编辑性)而全深度则为我们提供更高的布局准确性,从而带来更高的可编辑性。

D 实现细节

D.1 编辑重放协议

我们将真实标签(GT)与预测元素之间的匹配表述为最小代价的多对多二分图分配问题。令 $G = \{g_1, \dots, g_M\}$ 和 $P = \{p_1, \dots, p_N\}$ 分别表示 GT 和预测元素集合,其中每个元素 $e$ 携带一个 RGBA 图像 $I_e \in [0, 1]^{H \times W \times 4}$ 和一个定义在共享画布上的二值掩码 $m_e \in \{0, 1\}^{H \times W}$。由于元素之间可能存在相互遮挡,我们按 z 轴顺序降序计算每个元素的可见掩码。

$$ v_k = m_k \wedge \bigwedge_{j:\,z_j>z_k} \neg v_j \quad (1) $$

为了处理相对于 GT 设计结构因过分割或欠分割而产生的多对多对应关系,我们通过方向包含比率生成候选组。

$$ c^{\text{gt}}_{j \to i} = \frac{|v_i \wedge v_j| + \epsilon}{|v_i| + \epsilon} \quad (2) $$

第 23 页

6 Yun 等人

对象级 全局级 布局 控制器 / 验证器 L1↓ PSNR↑ LPIPS↓ PQ↑ F1↑

Gemini-3 flash (默认) 0.0431 26.286 0.088 45.37 0.530 GPT-5 mini 0.0517 26.930 0.079 43.39 0.521

表 3:用于控制器和验证器的 VLM 的消融实验。Gemini 对应我们在表 1 中报告的默认配置。

重着色 0.839 0.792 不透明度 NoVTracerEdit 层 D 0.830 0.819 工具 代理 Qwen-分层 Gemini 2.5 Flash GPT-5-mini

0.531 0.425 0.873 0.800

旋转 0.536 0.361 删除

0.804 0.578 0.449 0.869

0.766 0.820 0.757 过渡 0.802 Z-Order

图 14:对 VLM 主干网络的鲁棒性。使用不同的 VLM(GPT-5-mini)显示出与默认设置相似的结果,两者均在创建可编辑的设计分解方面实现了最先进(state-of-the-art)的性能。

对于每个真实标签(GT)元素 $g_i$,满足 $c_{gt_i \to j} \ge \tau_h$ 的预测元素构成一个合并候选集 $M_i$,从中枚举多个子集作为候选匹配目标,使匹配器即使在预测分解与 GT 设计结构不同时也能识别出有效的解析。该过程对每个 $p_j$ 对称运行,以构建 GT 侧的组 $G_{gt}$。 对于每组对 $(G_i, P_j)$,我们按 Z-Order 合成成员并计算匹配代价。

$$ \mathcal{C}(G_i, P_j) = \lambda_{\ell_1} \ell_1 + \lambda_{\text{IoU}}(1-\text{IoU})|G_i| \cdot \rho_{\text{gt}} |P_j| \cdot \rho_{\text{pred}} \label{eq:cost} \quad (3) $$

其中 $\ell_1$ 是可见掩码并集上的平均 RGB 绝对差,IoU 是在二值掩码上计算的。合并惩罚 $\rho_{\text{gt}}$ 和 $\rho_{\text{pred}}$ 防止求解器为了获得表面上的低代价而激进地合并不相关的元素,确保匹配尊重原始设计结构。 给定代价矩阵,我们通过匈牙利算法求解全局最优匹配。

第 24 页

重新设计 7 表 4:在 Figma 子集上的额外消融实验。

对象级 全局级 布局 成本 方法 L1↓ PSNR↑ LPIPS↓ PQ↑ F1↑ 工具调用↓ API 成本↓

无记忆 0.0542 25.36 0.0985 39.09 0.4604 31.4 $0.032 顺序执行 0.0621 25.22 0.0964 42.00 0.4951 36.8 $0.040

树深度 = 2 0.0550 28.43 0.0645 31.92 0.381 6.9 $0.013 树深度 = 3 0.0594 27.10 0.0871 41.77 0.4939 12.0 $0.020 树深度 = 4 0.0541 26.06 0.0946 42.79 0.5034 26.7 $0.025

ours 0.0474 25.56 0.0969 44.76 0.5194 28.8 $0.027

\ in _ {\mat hbf {x } }\ ; \textsty le_{i,j}\mathcal{C}(G_i,P_j)\,x_{ij}_dn_{\text{unmatched}}\,,\label{eq:assignment} (4) m

其中 $x_{ij} \in \{0, 1\}$ 表示是否选择组对 $(G_i, P_j)$。成本矩阵用成本为 $\tau_d$ 的虚拟条目填充,因此仅当所有真实候选项的成本均超过 $\tau_d$ 时,元素才会保持未匹配状态。 基于匹配对,我们评估重建准确性和可编辑性。对于可编辑性,我们对 GT 和预测集合应用六种编辑。删除通过将所有 RGBA 通道置零来移除匹配元素。透明度将 alpha 通道移动 $\Delta\alpha \in [-1, 1]$。重着色在 HSV 空间中变换元素像素,色相移动 $\Delta H$,饱和度乘数 $\mu_S$,亮度乘数 $\mu_V$。旋转将元素旋转 $\theta \in [-180^\circ, 180^\circ]$。平移将元素位移 $(dx, dy)$,在画布区域内。Z 序将元素的堆叠索引与其最近的重叠邻居交换。每次编辑后,我们重新合成 GT 和预测元素集的完整画布,并测量编辑区域内的差异。

D.2 系统配置

我们的系统是一个基于公开可用工具(详见表 5)和商业 VLM API 构建的免训练代理管道。该管道使用 LangGraph [36] 编排为状态机。在我们的实验中,我们使用 NVIDIA A6000 本地托管需要加速的工具(例如 Qwen-Image-Layered [48]、检测、分割和修复)。借助优化库 [47],我们使用的工具可以在显存低于 8GB 的商业 GPU 上运行。

D.3 额外定性结果

我们在图 15 和图 16 中展示了 Figma 基准测试上的额外定性比较。即使在严重遮挡的情况下,我们的方法也能恢复清晰的元素边界和正确的堆叠顺序,使编辑能够很好地局限于目标元素。这种优势既适用于属性更改,也适用于空间变换。

第 25 页

8 Yun 等人

工具/库 用途

Grounding DINO (Swin-B) 开放词汇目标检测

PaddleOCR v5 文本检测与识别

HiSAM 文本区域分割

SAM 2.1 Hiera-L 框提示分割

LaMa (Big) 基于掩码的图像修复

ObjectClear 基于扩散模型的移除

SciPy (ndimage.label) 连通域标记

VTracer 光栅转 SVG 矢量化

Qwen-Image-Layered 多层分解

WhatFontIs API 字体家族预测

表 5:工具配置。所有工具均使用其默认设置,未经任何额外微调。

D.4 提示词

我们提供了框架中两个视觉语言模型(VLM)智能体所使用的提示词。如图 17 和图 18 所示,Controller 系统提示词定义了可用工具、动作类型以及预期的 JSON 输出模式。对于每个节点,Controller 还会接收一个特定于节点的提示词,其中包含根图像、当前层图像、先前分解决策的线性记忆(lineal history),以及任何先前失败的尝试及其验证反馈,从而实现上下文感知的规划。

图 19 中的 Verifier 系统提示词规定了一个三步顺序验证协议:针对父节点的幻觉检查、跨子节点冗余检测,以及父节点覆盖度评估,后者确认有效子节点的并集是否涵盖了父节点中的所有视觉内容。

第 26 页

重新设计 9

原始图像 我们的方法 Qwen-Image-Layered LayerD 工具代理

图 15:与基线方法相比的额外分解准确率对比。 建议以数字方式查看。

第 27 页

10 Yun 等人

真实编辑 我们的方法 Qwen-Image-Layered LayerD 工具 代理

图 16:与基线方法相比的额外编辑重放结果。建议以数字方式查看。

第 28 页

重新设计 11

你是递归图像分解系统的控制器 VLM。 你的任务是分析图像并决定将其分解为可编辑元素的最佳动作。 ═════════════════════════════════════ 工具定义(参考) ═════════════════════════════════════ 1. qwen_layered — 输入/输出:qwen_layered(image, layers=N) → List[layers] — 用途:多层分解(MM-DiT) 2. split_cca — 输入/输出:split_cca(image) → List[component_masks] — 用途:基于像素的快速连通域分析 3. Gdino / sam2 / ocr / hisam / lama / objectclear / vtracer — (为简洁起见省略工具输入/输出签名) ═════════════════════════════════════ ═════════════════════════════════════ 可用动作 ═════════════════════════════════════ 1. Fork_Layers — 当多个对象交织时使用。 — 工具序列:["qwen_image_layered"] — 超参数 layer_length(范围:2-6)。 2. Split_Text — 当可见文本时,使用 Split_Text。 — 工具序列:["ocr", "hisam", "lama"] 3. Split_DetSeg / CCL / Font Prediction / Vectorization — (为简洁起见省略动作解释) ═════════════════════════════════════

═════════════════════════════════════ 输出格式 ═════════════════════════════════════ {

"image_context": "当前层内容的描述",

"action_reasoning": "选择此动作的原因",

"action_type": "5 种动作类型之一",

"planned_tool_sequence": ["tool1", "tool2", …],

"params": {"qwen_len": 4, “must_vectorization": false}

} ═════════════════════════════════════

图 17:用于 VLM 控制器的系统提示。

第 29 页

12 Yun 等人

[图片 1]:根节点图像 [图片 1]:当前层图像 ═════════════════════════════════════ ════════════════════════════════════ 线性历史 先前失败尝试 ═════════════════════════════════════ ════════════════════════════════════

[ 该层本可以在重构 树之前被处理, 但未能通过优雅验证。

对于重构树中的每个节点

分析这些失败以避免

重复同样的错误。 树深度, 图像上下文, [ 控制器:动作推理 # 对于每次先前的尝试 动作类型,{ 工具序列 动作类型, 工具参数 工具序列, 错误发生 工具参数 验证结果 优雅验证决策 验证器:验证 优雅验证原因 … 推理 } … , } … , ] … ] ═════════════════════════════════════ ═════════════════════════════════════

图 18:线性历史与失败历史模板。

第 30 页

重新设计 13

你是递归层分解系统的验证器视觉语言模型(Verifier VLM)。 你的任务是验证子层的质量,并决定它们是被接受、修剪还是重试。

═══════════════════════════════════════ ═══════════════════════════════════════ 顺序子层验证(逐步进行) 父层覆盖评估(全局) ═══════════════════════════════════════ ═══════════════════════════════════════ 对每个子层遵循以下确切逻辑路径: 仅基于上述识别为“有效(VALID)”的层进行评估。

步骤 A:幻觉 问题:该子层是否包含父层中不存在的元素? 严格失败条件: 新对象:任何在父层中不存在的对象。 虚构背景:在父层中不可见/被隐藏的背景。

步骤 B:冗余(优化检查) 问题:该子层是否包含在其他子层中已发现的相同对象? 解决逻辑(仅限跨子层比较): 如果子层 A 和子层 B 共享同一对象: 保留(KEEP):对象最准确的那个子层。 丢弃(DROP):包含较差版本的那个子层。

步骤 C:最终状态 有效(VALID):通过幻觉和冗余检查。 无效(INVALID):任一检查失败。

═══════════════════════════════════════

方法(清单检查): 列出父层中可见的不同对象。 确认每个对象是否存在于有效子层的并集中。 结论(Verdict): 完整(COMPLETE):所有父层对象均存在于有效子层中。 不完整(INCOMPLETE):存在显著的内容丢失或缺失对象。

═══════════════════════════════════════

输出格式 ═════════════════════════════════════════════════════════════════ { "children_analysis": [ { "index": 0, "image_context": "视觉内容的简要描述", "hallucination_reason": "[步骤 1] 描述与父层的具体比较。", "hallucination_check": "通过(PASS)", "redundancy_reason": "[步骤 2] 与其他子层进行比较。", "redundancy_check": "通过(PASS)", "child_validity_reason": "[步骤 3] 综合结果以证明最终有效性。", "status_validity": "有效(VALID)" }, … ], "valid_children_indices": [ … ], "invalid_children_indices": [ … ], "coverage_reason": "[步骤 4] 清单检查: 列出不同的父层对象 -> 确认可见性在有效层中。", "coverage_check": "完整(COMPLETE)" } ═════════════════════════════════════════════════════════════════

图 19:用于优雅验证(Graceful Verification)的系统提示词。

发表评论