信息,而非长度:文生图文本条件化的缩放定律

快速导读:本文发现扩散模型的收敛损失随结构化提示中的信息量而非自然语言提示的长度而缩放,并据此通过提升提示的“可扩散性”和“可提示性”构建了性能领先的文生图系统。

本文的核心发现是:扩散模型的收敛损失并非随自然语言提示的长度缩放,而是随提示中蕴含的图像相关信息量缩放。作者提出两个互补的信息量指标——Grounded Perplexity Gain (GPG) 和 Effective Detailness (ED),并在受控实验中证明它们与收敛损失分别呈线性和幂律关系。

基于这一缩放特性,作者构建了一个完整的文生图系统:训练侧通过图像到结构化提示(SP)的标注管线提升“可扩散性”,推理侧通过三阶段训练的LLM提示器提升“可提示性”。最终系统在GenEval、DPG-Bench等多个基准上取得领先性能。

英文题目:Scaling Properties of Text Conditioning in Visual Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.29679

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有文生图系统在处理信息密集型提示时面临一个反直觉的现象:增加自然语言提示的长度往往无法提升、甚至损害生成质量。图1展示了这一现象:在五个主流开源模型上,随着提示长度增加,GSB净偏好率反而下降,最终低于最短标题的基线。

这一问题的根源在于文本条件化的不对称性。训练信号来自图文对,但图像中的大量视觉信息——如精确的空间关系、物体属性、材质细节——在自然语言描述中往往是缺失或模糊的。冗长的文本并未增加图像相关的有效信息,反而引入了噪声。

大语言模型领域已经建立了明确的缩放定律,但文生图模型的文本条件化侧缺乏类似的量化理解。现有工作多关注模型架构和训练规模的缩放,而本文聚焦于一个被忽视的维度:文本条件化本身的信息量如何影响模型性能。

作者通过一个固定骨干的探针实验(图3)直观展示了这一区别:使用相同扩散模型,自然语言描述即使长度增加,重建质量几乎不变;而逐步恢复结构化提示的字段,所有重建指标持续改善。这说明信息量而非token数是关键变量。

核心创新

  • 发现并量化了文本条件化的缩放特性:扩散模型收敛损失与提示信息量(GPG/ED)线性/幂律相关,而非与提示长度相关。
  • 提出结构化提示(SP)作为统一的文本条件化接口,将图像信息组织为类型化字段,提升了训练时的可扩散性。
  • 设计了三阶段提示器训练管线(SFT→冷启动→OPSD),结合图像条件化教师模型,提升了从用户请求到SP的推理能力(可提示性)。
  • 引入推理时智能体循环(agentic loop),通过渲染-评判-修正的迭代过程,利用字段级编辑进一步提升生成质量。

方法概览

提出结构化提示(SP),一种将图像信息组织为全局场景、逐元素属性和几何关系等字段的JSON表示。通过两个互补指标(GPG和ED)量化提示信息量,并证明其可预测扩散训练损失(缩放特性)。据此,通过图像到SP的标注管线提升训练时的“可扩散性”,并通过监督微调、冷启动和验证器门控的在线策略蒸馏(OPSD)训练LLM提示器,提升推理时的“可提示性”。

  • 结构化提示(SP)设计:将图像信息组织为JSON格式,包含全局场景描述、逐元素属性(类别、外观、材质、姿态等)、几何关系(边界框、深度)和跨元素关系。图5展示了一个示例,SP按字段类型组织信息,形成从L5到L10的嵌套层级。
  • 信息量指标定义:GPG(Grounded Perplexity Gain)是一种白盒指标,计算揭示配对图像后文本似然度的提升,衡量文本中可被图像接地验证的信息量。ED(Effective Detailness)是一种黑盒指标,通过匹配文本属性与图像参考集,以F0.5加权衡量精确率和召回率。图6展示了两个指标的定义和测量趋势。
  • 缩放特性验证:在BAGEL模型上进行15种文本条件配置的受控训练扫描。图7显示,训练曲线按SP层级分离但按自然语言丰富度重叠;收敛MSE与GPG呈线性关系(r=-0.984),与ED呈幂律关系(r=-0.971),而提示长度无法将自然语言和SP置于同一趋势线上。
  • 图像到SP标注管线:如图8所示,使用VLM恢复全局和元素级语义,结合Sapiens、DepthAnything V2和SAM 2.1提供姿态和几何证据,最终VLM组装完整的L10 SP。L5-L9通过确定性掩码字段组从L10派生。
  • 提示器三阶段训练:第一阶段SFT从(用户提示,SP)对学习目标分布;第二阶段冷启动从图像条件化轨迹引导无图像的CoT推导;第三阶段OPSD在验证器接受的轨迹上,将图像条件化教师模型的token分布蒸馏给仅文本的学生模型。图10展示了完整管线。
  • 推理时智能体循环:如图14所示,提示器根据用户请求和累积评判生成SP,扩散模型渲染图像,Gemini评判器返回PASS或字段级修改建议。失败轮次编辑目标字段后重新生成,直至通过或达到最大轮次。图15展示了结构修复、粒度修复和布局修复三类典型案例。
  • 验证器门控策略:OPSD阶段使用QA验证器筛选接受的轨迹,牺牲样本覆盖率以换取高精度。表4的消融实验显示,门控OPSD在结构评分和GSB上均优于无门控版本和GRPO基线。
  • 提示器缩放实验:固定SP模式和扩散模型,测试从0.8B到397B的Qwen3.5提示器。图9显示,生成质量随提示器规模单调提升,且思维链模式在所有规模上均优于非思维模式。

逐图理解论文

反直觉的失败案例

反直觉的失败案例
Figure 1: Information, not token count, is what scales in prompt enhancement for image generation. Naively increasing prompt length degrades performance across all evaluated open-weight models (Qwen-Image, HunyuanImage 3.0, BAGEL, FLUX.1 Dev, and Emu3), every one of them ending below its own shortest caption; a control of ours trained on that same prose ladder improves only slightly before saturating. Under our structured-prompt schema, however, the GSB net preference rises monotonically with caption length, because structured prompts add new image-grounded information rather than more words. Finetuning the prompter that writes them (finetuned structured) yields a further large margin over the zero-shot structured prompter. (Left) Each system is judged against its own shortest-caption output, so the axis measures gain from lengthening

图1展示了核心反直觉现象:五个主流模型在自然语言提示变长时性能下降,而结构化提示下性能单调上升。左侧纵轴衡量相对于最短标题的增益,说明信息量而非长度驱动性能。

核心区分:信息量 vs 长度

核心区分:信息量 vs 长度
Figure 7: The scaling properties of text conditioning: loss follows information. (a–b) Training curves separate across SP levels but overlap across NL richness levels. (c) Caption length does not place NL and SP on a common loss trend. (d–e) Across all 15 sweep points, converged MSE is approximately linear in GPG and follows a power law in ED; bands show the central 95% range across resamples of the designed sweep settings, not training-run confidence intervals. (f) GPG and ED closely agree on the caption-configuration ranking despite using different scoring interfaces.

图7是缩放特性的核心证据:训练曲线按SP层级分离但按自然语言重叠,收敛MSE与GPG/ED呈强相关,而提示长度无法统一趋势。注意置信带反映的是设计点的重采样范围。

方法贡献:从缩放到系统

方法贡献:从缩放到系统
Figure 4: Method overview: annotate and measure, train, generate. (a) A VLM and frozen domain experts map each training image to an SP (§3.3); across controlled caption configurations, GPG and ED predict converged diffusion loss, yielding the scaling properties of text conditioning (§3.2). (b) The diffuser learns SP →image; the prompter learns user prompt →SP, and prompter-side comparisons hold the schema and trained diffuser fixed. (c) Single-shot inference composes the two with one prompter call followed by one diffuser call, user prompt →SP →image.

图4提供了方法全景:标注与测量阶段建立缩放特性,训练阶段分别优化扩散模型和提示器,推理阶段组合两者实现单次生成。这是理解全文框架的关键图。

最强结论

最强结论
Table 2: Comparison with representative text-to-image systems. Higher is better. GenEval2 reports Soft-TIFA arithmetic/geometric means (AM/GM), and TIIF reports short/long accuracy on the testmini subset. “PE” denotes prompt enhancement; Qwen-Image∗uses its official PE, and † marks our Qwen-Image-2512 re-evaluation. Ours uses single-shot inference. Evaluation protocols and score provenance are detailed in Appendix D.

表2展示了最终系统与代表性模型的全面对比,覆盖多个基准。注意Qwen-Image w/ PE是使用官方提示增强的基线,Ours使用相同的扩散骨干但替换为结构化提示增强。

实验如何设计?

  • 缩放特性实验:在BAGEL模型上进行15种文本条件配置的受控训练扫描,包括5个自然语言丰富度级别和5个SP层级(L5-L10),建立GPG/ED与收敛损失的关系。
  • 最终系统评估:在Qwen-Image上训练完整系统,在GenEval、GenEval2、DPG-Bench、TIIF、WISE、CoReBench等基准上与多个开源和闭源模型对比。表2报告了主要结果。
  • 提示器消融:固定扩散模型和SP模式,消融提示器规模、推理模式、训练阶段(SFT、冷启动、OPSD)的影响。表4展示了训练管线各阶段的贡献。
  • 推理时计算量缩放:固定所有组件,改变智能体循环的最大轮次Tmax,评估生成质量随推理计算量的变化。表5报告了结果。
  • 重写后端对比:将训练后的提示器与GPT-5.4、Gemini 3.0 Pro等通用编码智能体在SP生成任务上对比。表3显示专用提示器显著优于通用后端。
  • 信息量指标鲁棒性验证:更换VLM评判模型(图16),验证GPG与MSE关系的稳定性,以及不同评判模型下的排名一致性。

关键结果与论文证据

  • 缩放特性:收敛MSE与GPG呈线性关系(MSE = 0.4549 – 8.45e-5 * GPG, r = -0.984),与ED呈幂律关系(MSE = 0.4200 * ED^{-0.2073}, r = -0.971)(第9页,图7)。
  • 提示长度不预测损失:自然语言和SP的收敛损失无法通过提示长度统一到同一趋势线上,说明信息量而非token数是关键变量(第9页)。
  • 最终系统性能:在GenEval上达到0.94(对比Qwen-Image w/ PE的0.91),GenEval2 GM达到72.5(对比52.8),DPG-Bench达到90.71(对比87.20)(第15页,表2)。
  • 提示器缩放效应:GenEval++分数从0.8B提示器的46.4%提升到397B思维链模式的86.8%,显示提示器规模对生成质量有显著影响(第12页,图9)。
  • 训练阶段贡献:SFT奠定基础,冷启动显著提升结构评分,门控OPSD进一步改善GSB净偏好率(第16页,表4)。
  • 智能体循环收益:增加推理轮次持续提升结构评分和GSB,但边际收益递减(第19页,表5)。
  • 专用提示器优势:训练后的提示器在DPG-Bench和GSB上均显著优于GPT-5.4和Gemini 3.0 Pro等通用后端(第16页,表3)。
  • 信息量指标鲁棒性:更换VLM评判模型后,GPG与MSE的关系保持稳定,且不同评判模型下的配置排名高度一致(第26页,图16)。

阅读时需要注意

  • 缩放特性是在特定架构(BAGEL)和训练配方上校准的经验关系,其普适性需要更多架构验证。
  • 图像到SP的标注管线依赖多个冻结的专家模型,各环节的错误可能传播累积。
  • 验证器门控策略牺牲了样本覆盖率以换取高精度,可能限制了强化学习阶段的探索空间。
  • 推理时智能体循环增加了额外的计算开销,每次迭代需要多次调用评判模型和扩散模型。

关联工作

  • GPG指标改编自Favero et al. (2024)提出的解码时幻觉定位的逐token接地信号,ED指标改编自Wang et al. (2025b)的文本细节度评估方法。
  • ED中偏向精确率的F0.5加权方案受Cheng et al. (2024)的发现启发:训练文生图模型时文本精确率比召回率更重要。
  • DALL-E 3 (Betker et al., 2023)展示了详细的合成重标注可显著提升提示遵循能力,是本文提升文本条件化信息量的重要先例。
  • FIBO (Gutflaish et al., 2025)同样使用长JSON标注进行训练,并学习从短请求到其模式的翻译器,与本文的结构化提示思路相似。

发表评论