快速导读:Diagram-MMU 是首个同时评估 MLLM 在科学图表解析、编辑与问答三项任务上基础能力与智能体能力的 TikZ 基准,覆盖 6 类图表、3.7k 张图与 18.3k 个样本。
Diagram-MMU 是一个面向科学图表的多模态基准,核心主张是:现有图表基准无法反映 MLLM 在科研写作工作流中的真实能力,因为它们要么覆盖类型窄、要么代码表示非 TikZ、要么任务单一,且普遍缺乏智能体评估设置。Diagram-MMU 通过同时定义解析、编辑、问答三项任务,并引入 16 种评估设置,试图回答一个更根本的问题:模型在科学图表上到底是'想得对'还是'做得对'。
该基准从 TikZ/PGF 官方手册与社区资源收集 6,849 段 TikZ 代码,经简化、编译校验、去重与人工分类得到 3,744 张图,覆盖 charts、planar geometry、3D shapes、graph、chemistry、circuit 六类。评估采用三层指标:对象级 F1、代码级 CrystalBLEU、图像级 SSIM/CLIP/LPIPS/FID,DQA 用 LLM 判分准确率。
英文题目:Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams
论文出处:arXiv 每日论文精选 · arXiv:2608.12262
原始论文:PDF / 论文页面
这篇论文解决什么问题?
科研写作正在向 vibe writing 工作流演进,OpenAI Prism 等平台支持将科学图表直接转为 LaTeX TikZ 代码。研究者需要解析图表为可编辑代码、按需编辑、并对图表进行领域语义推理。但现有基准如 ChartMimic 采用 Python 代码,AutomaTikZ 仅覆盖 D2C-P 且图表类型有限,DeTikZify 和 Image2Struct 也只评估解析,ChartE3 仅覆盖 charts 且使用 Python 代码,CharXiv 和 MATHEMETRIC 则只做问答。
这些基准的共同缺陷是:代码表示非 TikZ,无法直接集成到 LaTeX 写作环境;任务单一,无法反映解析-编辑-问答的级联工作流;缺乏智能体设置,无法评估模型在工具使用、状态管理、规划等'如何行动'维度上的能力。
Diagram-MMU 的研究空白定位因此非常清晰:需要一个以 TikZ 为代码表示、同时覆盖三项任务、并系统评估智能体能力的统一基准。
核心创新
- 首个同时覆盖图表解析、编辑、问答三项任务及智能体设置的 TikZ 基准
- 首次在 diagram-to-code 任务中覆盖 chemistry 和 circuit 领域
- 提出对象级 F1 评估(type/text/color/bbox),从语义对象层面衡量代码生成质量
- 设计 16 种可控评估设置,系统评估 context utilization、tool use、state management、planning 四类智能体能力
- 构建 TikZ 搜索工具作为 MCP server,支持模型选择性检索语法参考,避免 web 搜索噪声与 PDF 手册 context rot
方法概览
从 TikZ/PGF 官方手册与社区资源收集 6,849 段 TikZ 代码,经简化、编译校验、去重与人工分类得到 3,744 张图(6 类:charts、planar geometry、3D shapes、graph、chemistry、circuit)。定义 D2C-P、D2C-E、DQA 三项任务,D2C-E 与 DQA 通过智能体流水线生成并经 13 名研究生交叉验证。评估采用三层指标:对象级 F1(type/text/color/bbox)、代码级 CrystalBLEU、图像级 SSIM/CLIP/LPIPS/FID;DQA 用 LLM 判分准确率。设计 16 种评估设置(3 基础 + 13 智能体),并构建 TikZ 搜索工具作为 MCP server 支持工具使用评估。
- 数据来源:从 TikZ/PGF 官方手册与社区资源收集 6,849 段 TikZ 代码,经简化、编译校验、去重与人工分类得到 3,744 张图,覆盖 6 类图表。
- 任务定义:D2C-P 要求模型将输入图表解析为 TikZ 代码;D2C-E 要求模型生成满足修改需求的 TikZ 代码,编辑维度覆盖 text、color、scope、layout 四类;DQA 要求模型回答关于输入图表的领域语义问题,包括 what-if questions。
- D2C-E 与 DQA 通过智能体流水线生成,并经 13 名研究生交叉验证,确保标注质量。
- 评估指标:对象级 F1 从 SVG 提取 Semantic Object Model(SOM),在 type/text/color/bbox 四个维度上计算 F1;代码级 CrystalBLEU 衡量 TikZ 语法相似度;图像级 SSIM/CLIP/LPIPS/FID 衡量渲染图视觉相似度;DQA 用 LLM 判分准确率。
- 智能体设置:设计 16 种评估设置(3 基础 + 13 智能体),覆盖 context utilization、tool use、state management、planning 四类能力。
- TikZ 搜索工具:构建为 MCP server,支持模型选择性检索语法参考,避免 web 搜索噪声与 PDF 手册 context rot。
- 评估规模:12 个 MLLM(6 闭源 + 6 开源)在基础能力上评估,含 1 个 TikZ 专用模型 TikZero+ 10B(仅 D2C-P);6 个代表性模型在 300 张图的 mini split 上评估 13 种智能体设置。
逐图理解论文
失败案例与直觉

图 6 展示了 F1 分数的分解,五个轴分别对应 avg、type、bbox、color、text,F1bbox 在 D2C-P 中急剧下降,尤其是 GPT-5.2、Claude-4.6 Opus 和 Seed-2.0 Pro,揭示了空间定位的核心瓶颈。
研究空白

表 1 对比了 Diagram-MMU 与现有基准在图表类型、任务覆盖、代码表示和评估层级上的差异,重点观察 TikZ Code 列和 Tasks 列,可以看到 Diagram-MMU 是唯一同时覆盖三项任务和智能体设置的 TikZ 基准。
贡献与验证方式

图 2 展示了任务构建流水线,从 TikZ 代码收集到编译校验、去重、人工分类,再到 D2C-E 和 DQA 的智能体生成与交叉验证,体现了数据质量的保障流程。
核心发现

图 4 对比了基础与智能体性能,绿色/红色标注显示增益/下降,可以直观看到 agency 对编辑的提升大于解析,但几乎所有模型在 DQA 上退化。
意义与局限

表 6 给出了 D2C-P 和 DQA 的智能体评估结果,S1/S12 为直接编码/回答基线,S2-S5 和 S13-S16 分别对应上下文利用、工具使用、状态管理和规划,是理解智能体能力差异的核心表格。
实验如何设计?
- 基础能力评估:12 个 MLLM 在 D2C-P、D2C-E、DQA 三项任务上评估,采用对象级 F1、CrystalBLEU、图像级指标和 DQA 准确率。
- 智能体评估:6 个代表性模型在 300 张图(每域 50 张)的 mini split 上评估 13 种智能体设置,对比直接编码/回答的基线。
- Pass@k 评估:k=1–5,分析采样数量对性能的影响。
- 级联分析:按 D2C-P 渲染成功/失败拆分图表集,分析解析能力对编辑与问答的级联影响。
- 分层分析:按图表类型(6 域)和代码长度分层分析模型性能。
关键结果与论文证据
- DQA 准确率最高 86.46%(Gemini-3.0 Pro),而 D2C-P 对象级 F1avg 范围仅 31.47–57.48(开源)与 47.57–54.64(闭源),说明模型'想得对'远好于'做得对'(第 10 页)。
- D2C-P 最佳 F1avg:Kimi-K2.5 57.48,Qwen3-VL-235B-A22B 55.11,Gemini-3.0 Pro 54.64(第 10 页)。
- D2C-E 编辑部分 CrystalBLEU 仅 0.51–2.98,远低于对象 F1 表现,说明模型在保持 TikZ 语法正确性上严重不足(第 10 页)。
- GPT-5.2 与 Claude-4.6 Opus 的 F1bbox 在 D2C-P 中仅 8.0 和 9.2,而 type/text/color 达 62–71,揭示空间定位是核心瓶颈(第 11 页)。
- D2C-E 中 Claude-4.6 Opus F1bbox 从 9.2 升至 preserve 24.3,但 edit-only 降至 3.0,说明模型能保留已有元素但难以精确定位新元素(第 11 页)。
- 智能体设置中 D2C-E 上下文利用(S7)使所有模型 F1avg 提升:preserve +4.1~+10.6,edit +3.3~+7.1,说明提供对象上下文对编辑任务有稳定增益(第 13 页)。
- 工具使用(S3)中 Gemini-3.1 Pro D2C-P F1avg 下降 4.3,Claude-4.6 Opus 提升 2.2,说明工具使用效果高度依赖模型(第 12 页)。
- DQA 规划设置(S15/S16)所有 6 个模型均下降,Seed-2.0 Pro 在 S16 下降 8.8,GPT-5.2 下降 5.7,说明强制规划反而损害问答性能(第 12 页)。
- Pass@k 从 pass@1 到 pass@2 增益最大,k>4 后饱和,说明采样多样性在低 k 时最有效(第 10 页)。
- 3D shapes 是三项任务中最难的领域,说明空间推理复杂度与任务难度正相关(第 11 页)。
阅读时需要注意
- 仅覆盖智能体能力的部分方面(context utilization、tool use、state management、planning),非全谱系评估。
- DQA 答案由 LLM judge 评分,可能存在评判偏差。
- 智能体评估仅使用 300 张图的 mini split,规模有限。
- TikZero+ 10B 仅在 D2C-P 上评估,未覆盖编辑与问答任务。
- 对象级 F1 的 bbox 匹配采用 IoU≥0.3 阈值,对空间精度要求相对宽松。
- D2C-E 的 preserve/edit 拆分依赖 ground-truth 元素对齐,复杂编辑可能引入对齐误差。
关联工作
- ChartMimic 是图表到代码生成基准,但采用 Python 代码,无 TikZ 支持。
- AutomaTikZ 是 TikZ 文本到图形合成基准,仅覆盖 D2C-P 且图表类型有限。
- DeTikZify 和 Image2Struct 都支持 TikZ,但仅评估 diagram-to-code parsing。
- ChartE3 是端到端图表编辑基准,仅覆盖 charts 且使用 Python 代码。
- CharXiv 引入描述性与推理性问题类型,MATHEMETRIC 使用合成图表且无 TikZ 代码。