视觉语言模型在科学图表上会“自信地编造”吗?——SCIFIGBENCH的行为评估

A-R-I框架与SCIFIGBENCH的贡献

论文提出SCIFIGBENCH基准与A-R-I行为框架,联合评估VLM在科学图表理解中的感知、推理与不确定性下的行为可靠性,揭示高感知能力模型(如GPT-5.2)仍可能成为“自信的编造者”。