诗词配图为什么难评估:从描绘到唤起之间的差距

一个失败案例

构建首个面向古典诗词配图的多维人工标注基准 TangPoetryBench(1280 张图像、10 个维度),并训练开放、基于评分标准的 PoemAutoEvaluator(PAE),在排序能力上达到专有评判模型 Claude 的水平。

一次投毒,任意控制:VLM可编程后门的核心逻辑

方法贡献

本文提出首个针对VLM的any-to-any后门攻击范式,通过一次性启发式投毒使模型将触发器视为指令,并在推理时利用特征空间触发器隐写术为任意未见过的目标caption动态合成隐蔽触发器。