十年视觉语言AI模型的准确性与视觉认知误差演变
本研究通过构建包含100张电影场景图像的CSB数据集,评估了2017-2025年间9个视觉语言模型在描述复杂场景时的表现。研究发现,尽管MLLMs在准确性上已接近人类水平,但仍存在空间依赖误差。研究还建立了五类视觉认知误差分类体系,并开发了基于掩码范式的空间依赖误差(SDE)量化方法。
本研究通过构建包含100张电影场景图像的CSB数据集,评估了2017-2025年间9个视觉语言模型在描述复杂场景时的表现。研究发现,尽管MLLMs在准确性上已接近人类水平,但仍存在空间依赖误差。研究还建立了五类视觉认知误差分类体系,并开发了基于掩码范式的空间依赖误差(SDE)量化方法。