视觉语言模型在科学图表上会“自信地编造”吗?——SCIFIGBENCH的行为评估 14 8 月, 2026 作者 PengChao 论文提出SCIFIGBENCH基准与A-R-I行为框架,联合评估VLM在科学图表理解中的感知、推理与不确定性下的行为可靠性,揭示高感知能力模型(如GPT-5.2)仍可能成为“自信的编造者”。