Diagram-MMU:科学图表的解析、编辑与问答,模型到底卡在哪一步?

快速导读:Diagram-MMU 是首个同时评估 MLLM 在科学图表解析、编辑与问答三项任务上基础能力与智能体能力的 TikZ 基准,覆盖 6 类图表、3.7k 张图与 18.3k 个样本。

Diagram-MMU 是一个面向科学图表的多模态基准,核心主张是:现有图表基准无法反映 MLLM 在科研写作工作流中的真实能力,因为它们要么覆盖类型窄、要么代码表示非 TikZ、要么任务单一,且普遍缺乏智能体评估设置。Diagram-MMU 通过同时定义解析、编辑、问答三项任务,并引入 16 种评估设置,试图回答一个更根本的问题:模型在科学图表上到底是'想得对'还是'做得对'。

该基准从 TikZ/PGF 官方手册与社区资源收集 6,849 段 TikZ 代码,经简化、编译校验、去重与人工分类得到 3,744 张图,覆盖 charts、planar geometry、3D shapes、graph、chemistry、circuit 六类。评估采用三层指标:对象级 F1、代码级 CrystalBLEU、图像级 SSIM/CLIP/LPIPS/FID,DQA 用 LLM 判分准确率。

英文题目:Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

论文出处:arXiv 每日论文精选 · arXiv:2608.12262

原始论文:PDF / 论文页面

这篇论文解决什么问题?

科研写作正在向 vibe writing 工作流演进,OpenAI Prism 等平台支持将科学图表直接转为 LaTeX TikZ 代码。研究者需要解析图表为可编辑代码、按需编辑、并对图表进行领域语义推理。但现有基准如 ChartMimic 采用 Python 代码,AutomaTikZ 仅覆盖 D2C-P 且图表类型有限,DeTikZify 和 Image2Struct 也只评估解析,ChartE3 仅覆盖 charts 且使用 Python 代码,CharXiv 和 MATHEMETRIC 则只做问答。

这些基准的共同缺陷是:代码表示非 TikZ,无法直接集成到 LaTeX 写作环境;任务单一,无法反映解析-编辑-问答的级联工作流;缺乏智能体设置,无法评估模型在工具使用、状态管理、规划等'如何行动'维度上的能力。

Diagram-MMU 的研究空白定位因此非常清晰:需要一个以 TikZ 为代码表示、同时覆盖三项任务、并系统评估智能体能力的统一基准。

核心创新

  • 首个同时覆盖图表解析、编辑、问答三项任务及智能体设置的 TikZ 基准
  • 首次在 diagram-to-code 任务中覆盖 chemistry 和 circuit 领域
  • 提出对象级 F1 评估(type/text/color/bbox),从语义对象层面衡量代码生成质量
  • 设计 16 种可控评估设置,系统评估 context utilization、tool use、state management、planning 四类智能体能力
  • 构建 TikZ 搜索工具作为 MCP server,支持模型选择性检索语法参考,避免 web 搜索噪声与 PDF 手册 context rot

方法概览

从 TikZ/PGF 官方手册与社区资源收集 6,849 段 TikZ 代码,经简化、编译校验、去重与人工分类得到 3,744 张图(6 类:charts、planar geometry、3D shapes、graph、chemistry、circuit)。定义 D2C-P、D2C-E、DQA 三项任务,D2C-E 与 DQA 通过智能体流水线生成并经 13 名研究生交叉验证。评估采用三层指标:对象级 F1(type/text/color/bbox)、代码级 CrystalBLEU、图像级 SSIM/CLIP/LPIPS/FID;DQA 用 LLM 判分准确率。设计 16 种评估设置(3 基础 + 13 智能体),并构建 TikZ 搜索工具作为 MCP server 支持工具使用评估。

  • 数据来源:从 TikZ/PGF 官方手册与社区资源收集 6,849 段 TikZ 代码,经简化、编译校验、去重与人工分类得到 3,744 张图,覆盖 6 类图表。
  • 任务定义:D2C-P 要求模型将输入图表解析为 TikZ 代码;D2C-E 要求模型生成满足修改需求的 TikZ 代码,编辑维度覆盖 text、color、scope、layout 四类;DQA 要求模型回答关于输入图表的领域语义问题,包括 what-if questions。
  • D2C-E 与 DQA 通过智能体流水线生成,并经 13 名研究生交叉验证,确保标注质量。
  • 评估指标:对象级 F1 从 SVG 提取 Semantic Object Model(SOM),在 type/text/color/bbox 四个维度上计算 F1;代码级 CrystalBLEU 衡量 TikZ 语法相似度;图像级 SSIM/CLIP/LPIPS/FID 衡量渲染图视觉相似度;DQA 用 LLM 判分准确率。
  • 智能体设置:设计 16 种评估设置(3 基础 + 13 智能体),覆盖 context utilization、tool use、state management、planning 四类能力。
  • TikZ 搜索工具:构建为 MCP server,支持模型选择性检索语法参考,避免 web 搜索噪声与 PDF 手册 context rot。
  • 评估规模:12 个 MLLM(6 闭源 + 6 开源)在基础能力上评估,含 1 个 TikZ 专用模型 TikZero+ 10B(仅 D2C-P);6 个代表性模型在 300 张图的 mini split 上评估 13 种智能体设置。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 6 (Updated) Breakdown of F1 scores. Each panel shows five axes (avg, type, bbox, color, text), each with its own scale. F1bbox drops sharply in Diagram-to-Code Parsing, especially for GPT-5.2, Claude-4.6 Opus, and Seed-2.0 Pro.

图 6 展示了 F1 分数的分解,五个轴分别对应 avg、type、bbox、color、text,F1bbox 在 D2C-P 中急剧下降,尤其是 GPT-5.2、Claude-4.6 Opus 和 Seed-2.0 Pro,揭示了空间定位的核心瓶颈。

研究空白

研究空白
Table 1 Comparison with diagram-to-code and question-answering benchmarks. #Diag.: unique diagrams across diagram types (#Diag. Type). Tasks include three fundamental tasks (evaluating how to think): Diagram-to-Code Parsing (D2C-P), Diagram-to-Code Editing (D2C-E), and Diagram Question Answering (DQA), alongside agentic settings (evaluating how to act). Evaluation spans multi-levels: object-level F1 for fine-grained element grounding, CrystalBLEU for TikZ syntax correctness, image-level for visual appearance similarity, and answer accuracy (Acc.) for DQA. Benchmarks without TikZ Code (✗) target Python charts, HTML WebUIs, SVG graphics, or no code (ChartE3). ✓

表 1 对比了 Diagram-MMU 与现有基准在图表类型、任务覆盖、代码表示和评估层级上的差异,重点观察 TikZ Code 列和 Tasks 列,可以看到 Diagram-MMU 是唯一同时覆盖三项任务和智能体设置的 TikZ 基准。

贡献与验证方式

贡献与验证方式
Figure 2 Task construction pipeline for Diagram-MMU.

图 2 展示了任务构建流水线,从 TikZ 代码收集到编译校验、去重、人工分类,再到 D2C-E 和 DQA 的智能体生成与交叉验证,体现了数据质量的保障流程。

核心发现

核心发现
Figure 4 Foundational vs. agentic performance across three tasks. Green/red annotations indicate gains/drops from foundational to agentic. Current models reason well over diagrams but struggle with visual perception and coding under foundational evaluation. Agency improves editing more than parsing, likely because textual instructions guide tool and context use, but nearly all models degrade on DQA.

图 4 对比了基础与智能体性能,绿色/红色标注显示增益/下降,可以直观看到 agency 对编辑的提升大于解析,但几乎所有模型在 DQA 上退化。

意义与局限

意义与局限
Table 6 Main results on agentic evaluation settings across D2C-P (S1–S5) and DQA (S12–S16). S1/S12 uses direct coding/answering; Context utilization: S2/S13 provide diagram objects as context; Tool use: S3 provides TikZ search tool; State management: S4 perceives objects first, then builds upon them to code; S14 requires answering building upon the coding states; Planning: S5 coordinates objects and tool; S15 optionally generates code before answering; S16 adds tool access to S15 (Table 4). ∆(↑gain, ↓drop) over direct coding/answering S1/S12.

表 6 给出了 D2C-P 和 DQA 的智能体评估结果,S1/S12 为直接编码/回答基线,S2-S5 和 S13-S16 分别对应上下文利用、工具使用、状态管理和规划,是理解智能体能力差异的核心表格。

实验如何设计?

  • 基础能力评估:12 个 MLLM 在 D2C-P、D2C-E、DQA 三项任务上评估,采用对象级 F1、CrystalBLEU、图像级指标和 DQA 准确率。
  • 智能体评估:6 个代表性模型在 300 张图(每域 50 张)的 mini split 上评估 13 种智能体设置,对比直接编码/回答的基线。
  • Pass@k 评估:k=1–5,分析采样数量对性能的影响。
  • 级联分析:按 D2C-P 渲染成功/失败拆分图表集,分析解析能力对编辑与问答的级联影响。
  • 分层分析:按图表类型(6 域)和代码长度分层分析模型性能。

关键结果与论文证据

  • DQA 准确率最高 86.46%(Gemini-3.0 Pro),而 D2C-P 对象级 F1avg 范围仅 31.47–57.48(开源)与 47.57–54.64(闭源),说明模型'想得对'远好于'做得对'(第 10 页)。
  • D2C-P 最佳 F1avg:Kimi-K2.5 57.48,Qwen3-VL-235B-A22B 55.11,Gemini-3.0 Pro 54.64(第 10 页)。
  • D2C-E 编辑部分 CrystalBLEU 仅 0.51–2.98,远低于对象 F1 表现,说明模型在保持 TikZ 语法正确性上严重不足(第 10 页)。
  • GPT-5.2 与 Claude-4.6 Opus 的 F1bbox 在 D2C-P 中仅 8.0 和 9.2,而 type/text/color 达 62–71,揭示空间定位是核心瓶颈(第 11 页)。
  • D2C-E 中 Claude-4.6 Opus F1bbox 从 9.2 升至 preserve 24.3,但 edit-only 降至 3.0,说明模型能保留已有元素但难以精确定位新元素(第 11 页)。
  • 智能体设置中 D2C-E 上下文利用(S7)使所有模型 F1avg 提升:preserve +4.1~+10.6,edit +3.3~+7.1,说明提供对象上下文对编辑任务有稳定增益(第 13 页)。
  • 工具使用(S3)中 Gemini-3.1 Pro D2C-P F1avg 下降 4.3,Claude-4.6 Opus 提升 2.2,说明工具使用效果高度依赖模型(第 12 页)。
  • DQA 规划设置(S15/S16)所有 6 个模型均下降,Seed-2.0 Pro 在 S16 下降 8.8,GPT-5.2 下降 5.7,说明强制规划反而损害问答性能(第 12 页)。
  • Pass@k 从 pass@1 到 pass@2 增益最大,k>4 后饱和,说明采样多样性在低 k 时最有效(第 10 页)。
  • 3D shapes 是三项任务中最难的领域,说明空间推理复杂度与任务难度正相关(第 11 页)。

阅读时需要注意

  • 仅覆盖智能体能力的部分方面(context utilization、tool use、state management、planning),非全谱系评估。
  • DQA 答案由 LLM judge 评分,可能存在评判偏差。
  • 智能体评估仅使用 300 张图的 mini split,规模有限。
  • TikZero+ 10B 仅在 D2C-P 上评估,未覆盖编辑与问答任务。
  • 对象级 F1 的 bbox 匹配采用 IoU≥0.3 阈值,对空间精度要求相对宽松。
  • D2C-E 的 preserve/edit 拆分依赖 ground-truth 元素对齐,复杂编辑可能引入对齐误差。

关联工作

  • ChartMimic 是图表到代码生成基准,但采用 Python 代码,无 TikZ 支持。
  • AutomaTikZ 是 TikZ 文本到图形合成基准,仅覆盖 D2C-P 且图表类型有限。
  • DeTikZify 和 Image2Struct 都支持 TikZ,但仅评估 diagram-to-code parsing。
  • ChartE3 是端到端图表编辑基准,仅覆盖 charts 且使用 Python 代码。
  • CharXiv 引入描述性与推理性问题类型,MATHEMETRIC 使用合成图表且无 TikZ 代码。

发表评论