MPIE-Bench:多人编辑的接触几何,VLM评委为何“看走眼”?

方法贡献与验证

现有文本到图像编辑模型在生成多人紧密接触场景时,常出现肢体融合、身体穿透等解剖学错误,但当前基准测试依赖的VLM评估在此类几何错误上趋于饱和,无法有效衡量。MPIE-Bench从视频中挖掘了2500个参考图-指令-目标图三元组,覆盖14种交互类别和4个接触密度。其核心贡献是MPIE-Eval评估协议:使用冻结的Multi-HMR模型从生成图像中重建多人网格,并基于网格计算Anatomy(解剖完整性)和Interaction(交互几何)两个新指标。实验发现,闭源模型的VLM-Interaction评分高达0.98-0.99,而网格Interaction评分仅为0.45-0.72,揭示了VLM评估