LiveXiv:用ArXiv论文构建永不饱和的多模态动态基准
问题的根源在于,传统基准是“死”的——一旦发布就固定不变,而模型却在不断进化、不断吞噬更多训练数据。现有的一些“活”基准尝试,要么依赖人工验证,成本高、速度慢;要么使用开放式问题加LLM评判,主观性强、难以规模化。LiveXiv的核心洞察是:ArXiv上每天涌现的最新科学论文,就是取之不尽、用之不竭的“考题矿藏”。关键在于,如何全自动地将这些论文中的图表转化为可靠的、真正需要视觉理解的选择题,同时还要让持续评估的成本可控。
问题的根源在于,传统基准是“死”的——一旦发布就固定不变,而模型却在不断进化、不断吞噬更多训练数据。现有的一些“活”基准尝试,要么依赖人工验证,成本高、速度慢;要么使用开放式问题加LLM评判,主观性强、难以规模化。LiveXiv的核心洞察是:ArXiv上每天涌现的最新科学论文,就是取之不尽、用之不竭的“考题矿藏”。关键在于,如何全自动地将这些论文中的图表转化为可靠的、真正需要视觉理解的选择题,同时还要让持续评估的成本可控。