快速导读:构建首个面向古典诗词配图的多维人工标注基准 TangPoetryBench(1280 张图像、10 个维度),并训练开放、基于评分标准的 PoemAutoEvaluator(PAE),在排序能力上达到专有评判模型 Claude 的水平。
TangPoetryBench 是首个面向古典诗词配图的多维人工标注基准,从《唐诗三百首》精选 320 首诗,由四个图像生成模型产出 1280 张图像,并在 10 个维度上进行人工评分。论文的核心发现是:所有模型在视觉质量、场景描绘、文化一致性等表面维度上表现接近天花板,但在核心意象与情感共鸣上集体塌陷,作者将这一现象命名为 depict-to-evoke gap。
基于该基准,作者训练了 PoemAutoEvaluator(PAE),一个开放、基于评分标准(rubric-conditioned)的评估器,以 Qwen3-VL-8B-Instruct 为底座,经 LoRA SFT 后接 GRPO 强化阶段。PAE 在排序一致性上达到专有评判模型 Claude 的水平,同时输出逐维分数,为诗词配图提供可诊断的自动评估。
英文题目:TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation
论文出处:arXiv 每日论文精选 · arXiv:2608.11452
原始论文:PDF / 论文页面
这篇论文解决什么问题?
唐诗将具象意象、典故与隐含情感压缩在极短篇幅内。一首二十字的绝句可能同时要求配图呈现具体场景、文化风格与情感氛围。例如王昌龄《出塞》的配图若只画一幅优美的边塞风景,却缺少戍边的苍凉与悲壮,视觉上再精致也是失败的配图。
现有 T2I 评估指标如 CLIPScore、BLIPScore、VQAScore 只衡量字面图文对应,无法判断图像是否传达隐含情感。论文第 6 页的实验显示,这些标量指标在诗词配图上几乎无区分力:CLIPScore 与人工质量相关性仅 0.14,BLIPScore 排序 τ 仅 0.02,VQAScore 无法区分最好与最差模型。
文化能力评估线(CUBE、CULTIVate、CII-Bench、TCC-Bench)检查字面文化元素或理解现有图像,但不评估生成图像的隐含情感意义。学习式偏好模型(ImageReward、PickScore、HPSv2)输出单一偏好分数而非逐维评分。诗词配图评估缺乏专门的多维人工基准,这是本文填补的空白。
核心创新
- 首个面向诗词配图的多维人工标注基准 TangPoetryBench,含 1280 张图像、10 个评分维度及可识别性独立指标
- 提出 depict-to-evoke gap 诊断:模型擅长描绘场景表面,但难以唤起隐含情感
- 定位情感失败的具体瓶颈为模型回避可读人脸(face-avoidance),占情感失败评分的 15%
- PoemAutoEvaluator(PAE):开放、基于评分标准(rubric-conditioned)的评估器,SFT+GRPO 训练,排序能力与 Claude 持平
- 发现文本失败的双模式:Seedream 泄漏原诗文字,MJ 幻觉伪造字符
方法概览
从《唐诗三百首》精选 320 首诗,由 Midjourney V7、Nano Banana Pro、gpt-image-1、Seedream 4.5 四个模型以统一提示词生成 1280 张图像;采用两阶段人工标注(Phase 1 可识别性四选一,Phase 2 十维评分),经质量控制与文本完整性人工裁定;PAE 以 Qwen3-VL-8B-Instruct 为底座,用 LoRA 进行 SFT 后接 GRPO 强化阶段,按评分标准输出逐维分数。
- 从《唐诗三百首》精选 320 首诗,由 Midjourney V7、Nano Banana Pro、gpt-image-1、Seedream 4.5 四个模型以统一提示词生成 1280 张图像,提示词明确禁止渲染任何文字。
- 采用两阶段人工标注:Phase 1 为可识别性四选一测试,判断仅凭图像能否从四个候选诗中选出正确原诗;Phase 2 为十维评分,涵盖视觉质量、与诗的对应、诗意意义与整体判断四组维度。
- 文本完整性经人工逐图裁定,因为调查内标记不可靠(漏 20 例、误标 12 例),复现需 OCR 辅助。
- PAE 以 Qwen3-VL-8B-Instruct 为底座,用 LoRA 进行监督微调(SFT),随后接 GRPO 强化阶段。评估器以书面评分标准为输入,输出逐维分数。
- 鲁棒性验证包括:GRPO-only 与 SFT+GRPO 的消融对比,以及 InternVL3.5-8B/2B 替代底座的迁移测试。
- 泛化测试在未见生成器 Kolors 与第二诗体宋词上进行,验证 PAE 的跨分布能力。
逐图理解论文
一个失败案例

上图展示王昌龄《出塞》的失败配图:画面优美但只是泛化风景,缺少边塞诗的苍凉。下图展示李商隐《登乐游原》的成功配图:同时捕捉意象、黄昏与惆怅。对比说明配图需要同时满足忠实描绘、文化契合与情感共鸣,仅美观不够。
研究空白

上图人类评差但 BLIP 和 VQAScore 给出近乎满分,下图人类评优但三个标量指标都给出平庸分。CLIPScore 几乎恒定无区分力,而 PAE 在两种情况下都与人类一致。
核心贡献与诊断

雷达图显示四个模型的维度剖面:强三模型在安全、技术质量、场景、文化一致性、风格等外轴接近天花板,但在核心意象、情感与整体印象上向内凹陷,这正是 depict-to-evoke gap 的可视化证据。
评估器的训练与验证

该表对比各评估器在留出诗上的表现:标量指标无逐维输出但可排序,排序 τ 极弱;未训练基线同样弱;PAE 的 τ 达到 Claude 水平,证明排序能力是评估器分化的关键。
实验如何设计?
- 四模型在 10 个维度上的人工评分对比(Table 2,第 4 页),报告每维均值与适用图像比例。
- 标准指标(CLIPScore、BLIPScore、VQAScore)与人工判断的相关性及排序一致性分析(Table 4,第 6 页;Figure 6)。
- PAE 与开放基线、Claude 在留出诗上的逐维 MAE、≤0.05 比例及 Kendall τ 对比(Table 4,第 7 页)。
- 标注者间一致性分析(Table 5,第 11 页),在 230 张多标注图像上计算 within-one-level 一致率。
- 鲁棒性消融与底座迁移(Table 6,第 12 页),在 256 张留出图像上进行。
关键结果与论文证据
- 情感共鸣是所有模型最弱维度,最强模型仅 82.1 分;整体印象最高仅 75.8 分(Table 2,第 4 页)。
- MJ 整体印象 51.2,落后强三模型(73.1–75.8)超 20 分,10 个维度全部最差(Table 2,第 4 页)。
- 文本问题共 119/1280 张(9.3%):Seedream 泄漏原诗文字 36 张,MJ 伪造字符 71 张,两种相反的失败模式(Table 3,第 5 页)。
- face-avoidance 占情感失败评分的 15%:模型以背影、远景、遮挡或侧脸规避可读表情,导致情感共鸣失败(Figure 4,第 5 页)。
- 可识别性与质量仅弱相关(ρ=0.23),与整体印象 ρ=0.17:图像能指向原诗不等于配图质量好(Figure 3,第 4 页)。
- PAE 排序 Kendall τ = 0.431,与 Claude(0.444)持平,远超未训练基线(0.173)和标量指标(≤0.21)(Table 4,第 7 页)。
- GRPO-only τ=0.167 接近未训练基线 0.173;SFT+GRPO 达 0.431,证明监督初始化是强化阶段的必要前提(Table 6,第 12 页)。
- 宋词泛化:PAE MAE=0.086,within-one-anchor 一致率 98.5%,表明评估器可迁移到其他诗体(第 10 页)。
阅读时需要注意
- 所有图像来自单一固定提示词,只反映各模型在一个工作点的表现,未探索提示词变化下的能力上限。
- 基准仅覆盖唐诗,虽设计可迁移但尚未系统扩展到其他诗体与语言。
- PAE 的增益集中在排序与训练分布内;绝对逐图评分上强零样本评判已具竞争力。
- 情感维度对所有评估器(含 PAE 与 Claude)仍是最难维度,受标注主观性天然上限约束。
- 固定选项集无法穷尽图像成败的所有方式,缺乏自由文本解释评估。
关联工作
- EvalMuse-40k 是少数报告标注一致性的大规模细粒度 T2I 对齐基准,本文在标注质量上与之对齐。
- CAP 需要 action–reason 分解,不适用于诗意意义难以分解为 present/absent 组件的场景。
- Seedream 的高可识别性可能受国产模型与中文母语标注者文化对齐影响,无法与字面描绘倾向分离。