诗词配图为什么难评估:从描绘到唤起之间的差距

快速导读:构建首个面向古典诗词配图的多维人工标注基准 TangPoetryBench(1280 张图像、10 个维度),并训练开放、基于评分标准的 PoemAutoEvaluator(PAE),在排序能力上达到专有评判模型 Claude 的水平。

TangPoetryBench 是首个面向古典诗词配图的多维人工标注基准,从《唐诗三百首》精选 320 首诗,由四个图像生成模型产出 1280 张图像,并在 10 个维度上进行人工评分。论文的核心发现是:所有模型在视觉质量、场景描绘、文化一致性等表面维度上表现接近天花板,但在核心意象与情感共鸣上集体塌陷,作者将这一现象命名为 depict-to-evoke gap。

基于该基准,作者训练了 PoemAutoEvaluator(PAE),一个开放、基于评分标准(rubric-conditioned)的评估器,以 Qwen3-VL-8B-Instruct 为底座,经 LoRA SFT 后接 GRPO 强化阶段。PAE 在排序一致性上达到专有评判模型 Claude 的水平,同时输出逐维分数,为诗词配图提供可诊断的自动评估。

英文题目:TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation

论文出处:arXiv 每日论文精选 · arXiv:2608.11452

原始论文:PDF / 论文页面

这篇论文解决什么问题?

唐诗将具象意象、典故与隐含情感压缩在极短篇幅内。一首二十字的绝句可能同时要求配图呈现具体场景、文化风格与情感氛围。例如王昌龄《出塞》的配图若只画一幅优美的边塞风景,却缺少戍边的苍凉与悲壮,视觉上再精致也是失败的配图。

现有 T2I 评估指标如 CLIPScore、BLIPScore、VQAScore 只衡量字面图文对应,无法判断图像是否传达隐含情感。论文第 6 页的实验显示,这些标量指标在诗词配图上几乎无区分力:CLIPScore 与人工质量相关性仅 0.14,BLIPScore 排序 τ 仅 0.02,VQAScore 无法区分最好与最差模型。

文化能力评估线(CUBE、CULTIVate、CII-Bench、TCC-Bench)检查字面文化元素或理解现有图像,但不评估生成图像的隐含情感意义。学习式偏好模型(ImageReward、PickScore、HPSv2)输出单一偏好分数而非逐维评分。诗词配图评估缺乏专门的多维人工基准,这是本文填补的空白。

核心创新

  • 首个面向诗词配图的多维人工标注基准 TangPoetryBench,含 1280 张图像、10 个评分维度及可识别性独立指标
  • 提出 depict-to-evoke gap 诊断:模型擅长描绘场景表面,但难以唤起隐含情感
  • 定位情感失败的具体瓶颈为模型回避可读人脸(face-avoidance),占情感失败评分的 15%
  • PoemAutoEvaluator(PAE):开放、基于评分标准(rubric-conditioned)的评估器,SFT+GRPO 训练,排序能力与 Claude 持平
  • 发现文本失败的双模式:Seedream 泄漏原诗文字,MJ 幻觉伪造字符

方法概览

从《唐诗三百首》精选 320 首诗,由 Midjourney V7、Nano Banana Pro、gpt-image-1、Seedream 4.5 四个模型以统一提示词生成 1280 张图像;采用两阶段人工标注(Phase 1 可识别性四选一,Phase 2 十维评分),经质量控制与文本完整性人工裁定;PAE 以 Qwen3-VL-8B-Instruct 为底座,用 LoRA 进行 SFT 后接 GRPO 强化阶段,按评分标准输出逐维分数。

  • 从《唐诗三百首》精选 320 首诗,由 Midjourney V7、Nano Banana Pro、gpt-image-1、Seedream 4.5 四个模型以统一提示词生成 1280 张图像,提示词明确禁止渲染任何文字。
  • 采用两阶段人工标注:Phase 1 为可识别性四选一测试,判断仅凭图像能否从四个候选诗中选出正确原诗;Phase 2 为十维评分,涵盖视觉质量、与诗的对应、诗意意义与整体判断四组维度。
  • 文本完整性经人工逐图裁定,因为调查内标记不可靠(漏 20 例、误标 12 例),复现需 OCR 辅助。
  • PAE 以 Qwen3-VL-8B-Instruct 为底座,用 LoRA 进行监督微调(SFT),随后接 GRPO 强化阶段。评估器以书面评分标准为输入,输出逐维分数。
  • 鲁棒性验证包括:GRPO-only 与 SFT+GRPO 的消融对比,以及 InternVL3.5-8B/2B 替代底座的迁移测试。
  • 泛化测试在未见生成器 Kolors 与第二诗体宋词上进行,验证 PAE 的跨分布能力。

逐图理解论文

一个失败案例

一个失败案例
Figure 1: Illustrating a poem demands many things at once. Top (Wang Changling, “Over the Border”): a polished, beau- tiful image that still fails, it renders a generic landscape and misses the frontier poem’s martial desolation, so craft alone is not a good match. Bottom (Li Shangyin, “Climbing the Leyou Plateau”): a successful illustration that captures the poem’s imagery, dusk setting, and melancholy together. A good illustration must satisfy faithful depiction, cultural and aesthetic fit, and emotional resonance at once; being beauti- ful is not enough.

上图展示王昌龄《出塞》的失败配图:画面优美但只是泛化风景,缺少边塞诗的苍凉。下图展示李商隐《登乐游原》的成功配图:同时捕捉意象、黄昏与惆怅。对比说明配图需要同时满足忠实描绘、文化契合与情感共鸣,仅美观不够。

研究空白

研究空白
Figure 6: Failure mode one in practice: standard metrics get good and bad backwards, PAE does not. Top: an image hu- mans rate poor, yet BLIP and VQAScore call it a near-perfect match. Bottom: an image humans rate excellent, yet all three metrics call it mediocre. CLIPScore stays near-constant and cannot discriminate at all; PAE agrees with the human in both.

上图人类评差但 BLIP 和 VQAScore 给出近乎满分,下图人类评优但三个标量指标都给出平庸分。CLIPScore 几乎恒定无区分力,而 PAE 在两种情况下都与人类一致。

核心贡献与诊断

核心贡献与诊断
Figure 2: Per-model profiles over the human scores. (a) All four models on a common scale (50 to 100): the three strong models trace nearly the same shape while MJ contracts on every axis. (b) The three strong models zoomed (72 to 100): they sit near the ceiling on the outer axes (safety, technical quality, scene, cultural coherence, style) and dent inward on core imagery, emotion, and overall impression, the depict- to-evoke gap that all four share.

雷达图显示四个模型的维度剖面:强三模型在安全、技术质量、场景、文化一致性、风格等外轴接近天花板,但在核心意象、情感与整体印象上向内凹陷,这正是 depict-to-evoke gap 的可视化证据。

评估器的训练与验证

评估器的训练与验证
Table 4: Evaluators on held-out poems (the open baseline and Claude are zero-shot). Scalar metrics give a single alignment score, so they have no per-dimension output (MAE and ≤ 0.05 do not apply), but they can still rank a poem’s images. Given the rubric, per-image agreement is high and similar for every rubric-based evaluator; they separate on ranking (τ), where scalar metrics and the untrained baseline are weak and PAE reaches the proprietary judge.

该表对比各评估器在留出诗上的表现:标量指标无逐维输出但可排序,排序 τ 极弱;未训练基线同样弱;PAE 的 τ 达到 Claude 水平,证明排序能力是评估器分化的关键。

实验如何设计?

  • 四模型在 10 个维度上的人工评分对比(Table 2,第 4 页),报告每维均值与适用图像比例。
  • 标准指标(CLIPScore、BLIPScore、VQAScore)与人工判断的相关性及排序一致性分析(Table 4,第 6 页;Figure 6)。
  • PAE 与开放基线、Claude 在留出诗上的逐维 MAE、≤0.05 比例及 Kendall τ 对比(Table 4,第 7 页)。
  • 标注者间一致性分析(Table 5,第 11 页),在 230 张多标注图像上计算 within-one-level 一致率。
  • 鲁棒性消融与底座迁移(Table 6,第 12 页),在 256 张留出图像上进行。

关键结果与论文证据

  • 情感共鸣是所有模型最弱维度,最强模型仅 82.1 分;整体印象最高仅 75.8 分(Table 2,第 4 页)。
  • MJ 整体印象 51.2,落后强三模型(73.1–75.8)超 20 分,10 个维度全部最差(Table 2,第 4 页)。
  • 文本问题共 119/1280 张(9.3%):Seedream 泄漏原诗文字 36 张,MJ 伪造字符 71 张,两种相反的失败模式(Table 3,第 5 页)。
  • face-avoidance 占情感失败评分的 15%:模型以背影、远景、遮挡或侧脸规避可读表情,导致情感共鸣失败(Figure 4,第 5 页)。
  • 可识别性与质量仅弱相关(ρ=0.23),与整体印象 ρ=0.17:图像能指向原诗不等于配图质量好(Figure 3,第 4 页)。
  • PAE 排序 Kendall τ = 0.431,与 Claude(0.444)持平,远超未训练基线(0.173)和标量指标(≤0.21)(Table 4,第 7 页)。
  • GRPO-only τ=0.167 接近未训练基线 0.173;SFT+GRPO 达 0.431,证明监督初始化是强化阶段的必要前提(Table 6,第 12 页)。
  • 宋词泛化:PAE MAE=0.086,within-one-anchor 一致率 98.5%,表明评估器可迁移到其他诗体(第 10 页)。

阅读时需要注意

  • 所有图像来自单一固定提示词,只反映各模型在一个工作点的表现,未探索提示词变化下的能力上限。
  • 基准仅覆盖唐诗,虽设计可迁移但尚未系统扩展到其他诗体与语言。
  • PAE 的增益集中在排序与训练分布内;绝对逐图评分上强零样本评判已具竞争力。
  • 情感维度对所有评估器(含 PAE 与 Claude)仍是最难维度,受标注主观性天然上限约束。
  • 固定选项集无法穷尽图像成败的所有方式,缺乏自由文本解释评估。

关联工作

  • EvalMuse-40k 是少数报告标注一致性的大规模细粒度 T2I 对齐基准,本文在标注质量上与之对齐。
  • CAP 需要 action–reason 分解,不适用于诗意意义难以分解为 present/absent 组件的场景。
  • Seedream 的高可识别性可能受国产模型与中文母语标注者文化对齐影响,无法与字面描绘倾向分离。

发表评论