快速导读:该论文提出了FoR-T2I基准,通过1200对受控的相机视图与物体参照系提示,系统评估并揭示了22个主流T2I模型在理解空间方向时普遍存在的参照系混淆问题。
文本到图像模型在遵循空间指令时,常常混淆“参照系”——即空间描述所依赖的坐标系。例如,当提示要求“站在椅子左边的人”时,模型可能将“左边”理解为图像的左侧,而非椅子自身的左侧。FoR-T2I基准首次系统性地量化了这一缺陷,通过1200对精心设计的提示,对比了相机视图描述与物体参照系描述下模型的表现差异。
研究发现,22个主流T2I模型在物体参照系提示下的平均准确率仅为15.4%,比相机视图提示低11.1个百分点。表现最佳的模型Seedream 5.0在FoR提示上的准确率也仅有44.3%。这一差距主要源于几何放置错误,而非朝向判断错误,说明模型倾向于将物体参照系的空间关系错误地映射到图像坐标系中。
英文题目:Can Text-to-Image Models Draw from the Right Frame of Reference?
论文出处:arXiv 每日论文精选 · arXiv:2608.03357
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有T2I评估基准如VISOR、GenEval和T2I-CompBench++主要关注物体间的空间关系或组合性指令遵循,但均未区分描述所依赖的参照系。例如,“A在B的左边”这一描述,在相机视图下意味着A应出现在B的图像左侧,而在物体参照系下则意味着A应位于B自身朝向的左侧——两者可能完全相反。
这种混淆在实际应用中会导致严重的生成错误。论文开篇展示了一个典型案例:提示要求“人的左手拿苹果,右手拿香蕉”,但生成的图像却将左右手与物体的对应关系完全颠倒。这是因为模型默认使用了图像参照系,而非人体自身的参照系。
语言理解领域已有FoREST等基准研究参照系依赖的空间描述,但在图像生成领域,这一问题尚未被形式化。FoR-T2I填补了这一空白,通过受控的Cam-FoR提示对,首次实现了对参照系遵循能力的独立评估。
基准构建过程从现有T2I基准中提取具有明确前后方向的物体,程序化生成空间布局,并为每个布局生成一对仅在参照系上不同的提示。这种配对设计确保了性能差异可归因于参照系转换,而非布局复杂度或其他混淆因素。
核心创新
- 首次在T2I生成中形式化参照系遵循问题,并构建了包含1200对Cam-FoR提示的受控基准FoR-T2I。
- 设计了三个递进的任务级别(单步FoR、混合FoR、链式FoR)来评估不同复杂度的参照系转换能力。
- 提出了一种基于视觉反馈的VLM门控提示重写策略,在不更新模型参数的情况下提升了FoR准确性。
方法概览
构建FoR-T2I基准:1) 从现有基准提取并筛选具有明确前后方向的物体;2) 程序化生成空间布局,指定锚点、目标位置和相机视图;3) 为每个布局生成一对提示:相机视图(Cam)提示和物体参照系(FoR)提示;4) 提出一种无需训练的VLM门控重写策略,利用视觉反馈选择性地接受改写后的提示以提升FoR准确性。
- 物体词汇构建:从VISOR、GenEval等基准的提示中提取名词短语,经过去重和人工筛选,保留具有明确前后轴的物体(如椅子、汽车、动物等),确保其左右方向可被一致定义。
- 布局程序化生成:每个布局明确指定锚点位置、目标位置和锚点朝向。布局设计覆盖了锚点左右轴与图像帧相同、垂直或相反的多种映射关系,以测试不同难度级别的参照系转换。
- 提示对生成:为每个布局生成一对提示——相机视图提示使用“在图像的左侧/右侧”等表述,物体参照系提示使用“在锚点的左侧/右侧”等表述。两者描述完全相同的空间布局,仅在参照系上不同。
- 三级任务设计:L1(单步FoR)要求理解单个物体的参照系方向;L2(混合FoR)同时包含相机视图和物体参照系约束;L3(链式FoR)需要先解析一个参照系关系,再基于其结果解析另一个。
- 自动评估器构建:结合OWL-ViT进行物体检测、SAM3.1进行分割、DA3进行深度估计、Qwen3.6-27B进行朝向判断,最终输出几何准确率和朝向准确率两个维度的评估结果。
- VLM门控重写策略:利用视觉语言模型对生成的图像进行反馈,判断是否满足FoR约束;若不满足,则自动改写提示以更明确地表达参照系关系,并选择性接受改写后的提示。该策略无需训练,可直接应用于任意T2I模型。
- 人类验证:对120对提示的人工标注显示,自动评估器与人类判断的一致性达到87.1%的准确率和88.5的F1分数,验证了评估方法的可靠性。
- 基准规模:最终基准包含1200对Cam-FoR提示,覆盖多种物体类别、空间关系和相机视角,10%的提示对经过人类专家审核以确保质量。
逐图理解论文
直觉与失败案例

图1展示了一个典型的参照系混淆案例:提示要求“人的左手拿苹果,右手拿香蕉”,但生成图像将左右手与物体的对应关系颠倒。这说明模型默认使用图像参照系而非人体自身参照系来解释空间描述。
研究空白与基准设计

图2展示了FoR-T2I基准的构建流程:从物体词汇提取、布局程序化生成、Cam-FoR提示对构建到人类专家审核。这一流程确保了每对提示仅在参照系上不同,从而隔离出参照系遵循能力。
核心发现与贡献

表2报告了各模型在Cam和FoR提示下的最终准确率。所有模型在FoR提示上均表现更差,平均差距为11.1个百分点,最佳FoR结果也仅为44.3%,表明参照系混淆是普遍且严重的问题。
结论与启示

图3展示了两种典型失败模式:错误参照系解释(将物体相对方向理解为图像方向)和部分遵循(满足相机视图约束但违反物体参照系约束)。这些案例直观说明了模型的系统性混淆。
实验如何设计?
- 在22个闭源和开源T2I模型上进行评测,包括Seedream 5.0、DALL-E 3、Stable Diffusion 3等主流模型。
- 每个模型对每对提示生成一张图像,使用固定随机种子以确保可复现性。
- 评估指标分为几何准确率(目标位置是否正确)和朝向准确率(锚点朝向是否正确),最终准确率要求两者同时正确。
- 对比六种无需训练的提示增强策略,包括直接改写、思维链提示、少样本示例等,验证VLM门控重写的有效性。
- 通过关系类型、相机视角和帧映射方式的细分分析,揭示模型在不同条件下的表现差异。
- 开源模型与闭源模型分别分析,注意开源模型可能因Cam基线过低而存在地板效应。
关键结果与论文证据
- 22个模型的平均最终准确率从Cam提示的26.5%下降到FoR提示的15.4%,差距为11.1个百分点(第4页Table 2)。
- 表现最佳的模型Seedream 5.0在FoR提示上的准确率仅为44.3%,而其Cam准确率为64.1%(第5页Table 2)。
- 几何准确率从Cam的55.1%下降到FoR的31.8%,差距达23.3个百分点;而朝向准确率仅从35.7%变为34.3%,表明FoR困难主要源于目标放置错误(第5页Table 3)。
- 当锚点左右轴与图像帧相反时,FoR准确率降至18.8%,而对应Cam准确率为68.5%,差距高达49.7个百分点(第7页Table 6)。
- VLM门控重写策略将平均FoR准确率从25.0%提升至29.2%,但提升幅度有限(第5页)。
- 模型在链式FoR(L3)任务上表现崩溃式下降,表明复杂参照系推理是重大挑战(第6页Table 3)。
- 开源模型的Cam-FoR差距较小,但主要原因是其Cam基线准确率过低,存在地板效应(第4页)。
- 失败模式分析显示,模型最常见的错误是将物体参照系方向错误地解析为图像坐标系方向,即“错误参照系解释”(第6页Figure 3)。
阅读时需要注意
- 基准使用模板化语言生成提示,可能无法完全反映自然语言的多样性和复杂性。
- VLM门控重写策略的提升效果有限(约4个百分点),未能从根本上解决参照系混淆问题。
- 评估依赖自动评估器,尽管经过人类验证,但仍可能存在与人类判断的细微偏差,特别是在边界情况下。
- 基准仅覆盖具有明确前后轴的物体,对于对称物体或不规则物体的参照系定义仍需进一步研究。
关联工作
- VISOR基准评估T2I模型的空间关系理解,但未区分参照系,无法揭示本文发现的核心问题。
- GenEval和T2I-CompBench++评估组合性指令遵循,但均未涉及物体参照系的系统对比。
- FoREST基准研究语言模型中的参照系依赖空间描述,但聚焦于语言理解而非图像生成。
- GenSpace和SpatialGenEval包含物体相对方向的评估,但缺乏受控的Cam-FoR对比设计。