诗词配图为什么难评估:从描绘到唤起之间的差距

一个失败案例

构建首个面向古典诗词配图的多维人工标注基准 TangPoetryBench(1280 张图像、10 个维度),并训练开放、基于评分标准的 PoemAutoEvaluator(PAE),在排序能力上达到专有评判模型 Claude 的水平。