LiveXiv:用ArXiv论文构建永不饱和的多模态动态基准

快速导读:问题的根源在于,传统基准是“死”的——一旦发布就固定不变,而模型却在不断进化、不断吞噬更多训练数据。现有的一些“活”基准尝试,要么依赖人工验证,成本高、速度慢;要么使用开放式问题加LLM评判,主观性强、难以规模化。LiveXiv的核心洞察是:ArXiv上每天涌现的最新科学论文,就是取之不尽、用之不竭的“考题矿藏”。关键在于,如何全自动地将这些论文中的图表转化为可靠的、真正需要视觉理解的选择题,同时还要让持续评估的成本可控。

多模态大模型(LMM)的快速发展使得评估基准的时效性和公正性变得至关重要。传统静态基准如DocVQA、ChartQA等,由于测试集固定且公开已久,面临严重的测试数据污染风险——模型可能在训练过程中“见过”考题,导致评估分数虚高,无法反映真实泛化能力。LiveXiv正是针对这一核心痛点提出的解决方案。

LiveXiv的核心思想是:将ArXiv上每日涌现的最新科学论文作为取之不尽的数据源,通过全自动流水线将其中的图表转化为多模态选择题,构建一个持续进化的“活”基准。更巧妙的是,它引入项目反应理论(IRT),只需重评少数几个模型就能准确推断所有模型在新版本上的表现,大幅降低了持续评估的计算成本。

英文题目:LiveXiv – A Multi-modal Live Benchmark Based on ArXiv Papers Content

论文出处:arXiv 每日论文精选 · arXiv:2410.10783

原始论文:PDF / 论文页面

这篇论文解决什么问题?

静态基准的污染问题并非空穴来风。论文Figure 1直观展示了这一困境:随着模型训练数据的不断膨胀,测试集被纳入训练语料的风险急剧上升,基准逐渐“饱和”,模型得分水涨船高,但实际能力并未同步提升。这种现象在LMM领域尤为严重,因为多模态训练数据往往大规模爬取自网络,而许多基准的测试样本就公开在网络上。

现有的“活”基准尝试,如LMMs-Eval LiveBench,虽然意识到了这一问题,但要么依赖人工验证,要么使用开放式问题配合LLM-as-a-judge进行评判,这两种方式都难以大规模扩展。人工验证成本高昂、速度慢;LLM评判则引入新的偏差且计算开销大。LiveXiv的突破在于,它首次实现了完全无需人工介入的、基于选择题的、可自动更新的多模态基准。

选择题形式的选择是经过深思熟虑的:它避免了开放式问题中LLM评判的主观性和高成本,使得评估结果客观、可复现、易于自动化。但这也带来了新挑战——如何确保生成的选择题真正需要视觉信息才能作答,而非仅凭文本常识就能猜对?这正是LiveXiv双重过滤机制要解决的关键问题。

此外,持续更新基准意味着每次新版本发布,都需要重新评估所有模型,计算成本随模型数量和版本迭代线性增长。LiveXiv提出的基于IRT的高效评估方法,正是为了打破这一瓶颈,让“活”基准真正具备实际可操作性。

核心创新

方法概览

问题的根源在于,传统基准是“死”的——一旦发布就固定不变,而模型却在不断进化、不断吞噬更多训练数据。现有的一些“活”基准尝试,要么依赖人工验证,成本高、速度慢;要么使用开放式问题加LLM评判,主观性强、难以规模化。LiveXiv的核心洞察是:ArXiv上每天涌现的最新科学论文,就是取之不尽、用之不竭的“考题矿藏”。关键在于,如何全自动地将这些论文中的图表转化为可靠的、真正需要视觉理解的选择题,同时还要让持续评估的成本可控。

  • 数据抓取与提取(第4页Figure 3):LiveXiv首先从ArXiv上自动抓取最新论文,提取其中的图表及其元数据,包括图片标题(caption)和表格内容。随后使用元提示(meta-prompting)对图表进行分类,识别其类型(如框图、柱状图、定性示意图等),为后续针对性生成问题做准备。
  • 题目生成(第4页):将提取的图表、标题和分类信息一并输入GPT-4o,由GPT-4o为每张图生成多道选择题,涵盖VQA(视觉问答)和TQA(表格问答)两种任务。生成时借鉴了ConMe工作的提示模板,确保题目格式规范、难度分布合理。
  • 双重过滤机制(第5页):这是保证题目质量的核心创新。第一重是“LLM盲测”——将题目中的问题文本和选项单独提取出来,不给模型看图片,让纯文本LLM尝试作答。如果LLM仅凭文本就能答对,说明这道题不依赖视觉信息,属于“伪多模态”题目,直接剔除。第二重是“跨模型一致性检验”——让多个LMM(如Claude-Sonnet)实际看图作答,只有当模型们的答案高度一致且与生成时的“标准答案”吻合时,题目才被保留。这两重过滤确保了最终基准中的每一道题都真正需要视觉理解能力。
  • IRT高效评估(第6页):项目反应理论原本用于教育测量领域,LiveXiv将其巧妙迁移到模型评估中。核心思想是:每道题有难度参数,每个模型有能力参数,通过少量模型的作答结果可以估计新题目的难度分布,进而预测其他模型的表现。具体操作是,当新版本基准发布时,只需选取3-5个代表性模型进行完整评估,利用IRT模型推断其余所有模型的得分和排名。
  • 版本迭代与多样性维护:LiveXiv设计了多版本机制(v1至v4),每个版本从不同时间段的ArXiv论文中提取,确保题目分布随领域发展自然演变。论文还验证了不同版本间题目难度分布的稳定性(Figure 10),证明基准在更新中保持了挑战性和多样性。
  • 生成模型偏差检验(第25页Table 12):为检验GPT-4o作为生成器是否会给自身带来优势,论文进行了角色互换实验——让Claude生成题目、GPT-4o负责过滤。结果显示模型排名变化很小,说明生成偏差在可控范围内,但生成模型确实存在微弱的“主场优势”。

逐图理解论文

一个令人警醒的现象

一个令人警醒的现象
Table 5: Average ranking on static benchmarks (ChartQA, DocVQA and AI2D) and LiveXiv (v1). We can see from the ranking difference column that some models have a significant drop (negative difference) in the relative ranking in LiveXiv compared to the static datasets. The gap is highlighting a potential risk of test data contamination when using static (frozen in time) benchmark datasets.

这张表是揭示污染效应的关键证据。对比各模型在静态基准和LiveXiv上的排名差异,IXC2.5和IXC2-4KHD的排名大幅下滑,强烈暗示它们在静态基准上的高分可能来自数据污染而非真实能力提升。

关键分野:从“死”基准到“活”基准

关键分野:从“死”基准到“活”基准
Figure 2: We propose LiveXiv, a new method for generating Live multi-modal dataset for Visual Question-Answering based on ArXiv content. Our pipeline automatically generates scalable and reliable questions along with an efficient evaluation method to reduce the computational and logistic overheads required for continually evaluating past and present models on new versions of the dataset.

这是LiveXiv系统的整体架构图,展示了从ArXiv论文抓取到题目生成、过滤、评估的完整流程。注意观察其中“高效评估”模块的位置,它独立于题目生成流水线,是降低持续评估成本的关键设计。

LiveXiv的解法:自动生成与高效评估

LiveXiv的解法:自动生成与高效评估
Figure 3: Our live dataset generation consists of several stages. We first extract the images and their corresponding metadata (i.e. captions and table contents), then we classify the figures into categories using meta-prompting. All the extracted data is then fed to GPT4o to generate multiple questions-answer pairs per image. Since generative models are prone to errors, we apply several filtering steps, using an LLM and LMM to ensure that our dataset is truly multi-modal and reliable.

详细展示了题目生成的各个阶段:图表提取、元数据获取、分类、GPT-4o生成、双重过滤。重点关注过滤步骤,这是保证题目质量的核心——先让纯文本LLM盲测,再检验多模型一致性。

结论:更真实的排名,更低的评估成本

结论:更真实的排名,更低的评估成本
Table 1: LiveXiv v1 VQA and TQA average accuracy across ArXiv taxonomy. (V is VQA, T-TQA)

LiveXiv揭示了一个更接近真相的模型能力图谱。Claude-Sonnet以显著优势领先,而一些在静态基准上表现优异的模型则暴露了真实水平。更重要的是,这套IRT高效评估方法被证明切实可行:仅重评三到五个模型,就能以超过零点九的排名相关性准确预测所有模型的表现,节省了超过四分之三的计算开销。LiveXiv证明了,一个真正可自我进化、抗污染、低成本的评估基准是可行的。

实验如何设计?

  • 评估了17个主流LMM在LiveXiv v1上的表现,v1包含16,328道题目,覆盖VQA和TQA两大任务。
  • 将LiveXiv排名与三个经典静态基准(DocVQA、ChartQA、AI2D)进行对比,以揭示潜在的污染效应。
  • 从v1中抽取1,000道题进行人工验证,对比自动标注与人工标注的得分差异,检验自动生成质量。
  • 在LiveXiv v1至v4四个版本上测试IRT高效评估方法,验证仅重评3-5个模型时预测的准确性。
  • 按问题类型(推理、算术、描述等)和图表类型(框图、柱状图、定性图等)进行细粒度分析。

关键结果与论文证据

  • Claude-Sonnet在LiveXiv v1上取得VQA 75.4%、TQA 83.5%的平均准确率,显著领先其他模型(第8页Table 1)。
  • 自动标注与人工验证子集之间的平均性能偏差小于2.5%(VQA为2.34%,TQA为2.11%),证明自动生成质量可靠(第8页Table 2)。
  • 仅重评3-5个模型时,IRT预测的平均绝对误差(MAE)很低,Spearman排名相关系数超过0.9,证明高效评估方法切实可行(第9页Figure 4)。
  • IXC2.5和IXC2-4KHD在LiveXiv上的平均排名相比静态基准下降了超过4个名次,强烈暗示其在静态基准上的高分可能来自数据污染(第17页Table 5)。
  • 不同领域的模型表现差异明显:cs.CV和cs.AI领域模型表现最集中,方差最小;而其他领域则呈现更大的性能分化(第18页Figure 7)。
  • 题目难度分布覆盖从“无人能答”到“人人皆对”的全谱系,且在不同版本间保持稳定,说明基准兼具挑战性和一致性(第22页Figure 10)。
  • 旧模型或小语言模型骨干的LMM在所有领域表现均较差,呈现“欠拟合”特征;中游模型对领域敏感,泛化能力不足;最新模型(无论开源还是闭源)则对领域变化鲁棒(第17页Figure 6)。

阅读时需要注意

  • 依赖GPT-4o和Claude-Sonnet等闭源商业模型进行题目生成和过滤,这些模型本身会随时间更新迭代,可能引入不一致性和偏差。
  • Claude-Sonnet在过滤环节的角色可能导致基准对其自身略微有利,尽管角色互换实验显示偏差不大,但无法完全消除。
  • 当前基准仅包含选择题形式,无法评估模型的自由生成、复杂推理或链式思维等能力,评估维度较为单一。
  • IRT高效评估假设新旧版本题目难度分布相似,若ArXiv论文领域发生剧烈变化,预测精度可能下降。

关联工作

  • LMMs-Eval LiveBench是另一个多模态动态基准,但依赖人工验证和LLM评判,扩展性受限。LiveXiv通过选择题和自动过滤实现了真正的全自动扩展。
  • tinyBenchmarks和PromptEval将IRT用于静态基准的高效评估,LiveXiv首次将其扩展到动态、多模态场景,解决了持续评估的计算瓶颈。
  • ConMe提供了VQA题目生成的提示模板,LiveXiv在此基础上进行了适配和优化。

发表评论