三分钟导读:该论文提出视觉预训练(VP),通过直接对原始科学文档图像进行自回归视觉潜在预测,在保持相同语料源的情况下,显著优于传统的文本预训练(TP),提升了科学推理、跨模态对齐及多模态基准性能,且计算效率更高。
英文题目:Scalable Visual Pretraining for Language Intelligence
论文出处:arXiv 每日论文精选 · arXiv:2607.09657
原始论文:PDF / 论文页面
对应视频标题:面向语言智能的可扩展视觉预训练:直接预测视觉潜在以超越文本预训练|推荐指数:★★★★★
这篇论文解决什么问题?
现有大型基础模型主要依赖文本语料预训练,将包含图表、公式和布局的科学文档转换为纯文本会导致结构信息的丢失和扭曲,且现有视觉预训练通常依赖图像-文本配对监督,未能充分利用原始视觉文档中的结构化信息。
核心创新
- 提出无需文本提取或配对监督的视觉预训练范式,直接利用原始文档图像的视觉结构。
- 设计稀疏前景视觉表示,通过方差和亮度过滤背景,保留页面空间布局信息。
- 在冻结的视觉特征空间中进行自回归潜在预测,将视觉建模深度整合到语言模型的预测过程中。
- 证明视觉预训练在相同语料源下优于文本预训练,且能显著提升跨模态对齐能力。
方法概览
提出视觉预训练(VP),将科学PDF页面渲染为图像,通过冻结的视觉编码器提取特征,过滤前景视觉补丁(foreground visual patches),并按光栅顺序输入LLM。模型在冻结的视觉特征空间中,使用因果注意力掩码进行下一个视觉潜在(next visual latent)的自回归预测,损失函数为InfoNCE对比损失。该方法无需文本提取或图像-文本配对监督。
逐图理解论文
方法:视觉预训练(VP)核心机制

论文提出视觉预训练(VP),将科学PDF页面渲染为图像,通过冻结的视觉编码器提取特征,过滤前景视觉补丁,并按光栅顺序输入LLM。模型在冻结的视觉特征空间中,使用因果注意力掩码进行下一个视觉潜在预测,损失函数为InfoNCE对比损失。该方法无需文本提取或图像-文本配对监督,直接利用原始文档图像的视觉结构。
创新:稀疏前景视觉表示

VP设计稀疏前景视觉表示,通过方差和亮度过滤背景,保留页面空间布局信息。实验表明,增加保留的视觉token预算可 consistently 提升下游增益,且优势在视觉结构密度高的样本上最显著。这表明VP能有效捕捉图表、公式和表格中的关键视觉内容,为后续推理提供丰富的结构化证据。
实验:科学推理性能提升

在Qwen 3.5上,GPQA从76.24提升至79.29,MMLU-Pro从83.91提升至85.09。在Llama 3.2 Vision上,GPQA从30.24提升至33.08,AIME从13.75提升至18.54。这些结果证明,VP在相同语料源下优于文本预训练,且能显著提升科学推理能力。VP通过直接建模视觉潜在,避免了文本解析过程中的信息损失。
效率:视觉Token的压缩优势

VP在相同PDF语料下仅使用约20B视觉token,而TP使用约80B文本token,效率提升4倍。实验显示,8192个前景视觉token的设置提供了最佳权衡,降低最大分辨率也能保持强劲性能。这表明VP在压缩视觉输入下仍能有效建模,为大规模预训练提供了高效的视觉表示方案。
跨模态对齐:表示空间的收敛

VP显著改善跨模态对齐。Centroid Separation从1.665降至0.661,Cosine Similarity从0.631升至0.907。t-SNE投影显示,VP使匹配的视觉和文本文档嵌入在共享表示空间中更靠近。这支持Platonic Representation Hypothesis,即不同模态的学习表示会收敛于共享抽象,VP通过直接建模视觉潜在促进了这一过程。
实验与关键结果
- 在Qwen 3.5, Qwen 3, Llama 3.2 Vision, Llama 3.1等骨干模型上,对比VP与TP在科学推理基准(GPQA, AIME, MMLU-Pro, HLE)上的表现。
- 评估VP在跨模态对齐指标(Centroid Separation, Cosine Similarity, CKA, Mutual k-NN)上的提升。
- 在MMMU-Pro, SFE, ChartQAPro, MathVista等多模态基准上评估VP的迁移能力。
- 通过注意力图可视化分析VP在视觉推理中是否关注与文本推理相同的语义证据。
- 对比带生成解码器(Generative Decoder)的VP变体与无解码器(Decoder-free)版本的性能与效率。
- 通过条件困惑度(Conditional Perplexity)进行生成式图像到文本检索评估。
- 在Qwen 3.5上,GPQA从76.24提升至79.29,MMLU-Pro从83.91提升至85.09(第 3 页)
- 在Llama 3.2 Vision上,GPQA从30.24提升至33.08,AIME从13.75提升至18.54(第 3 页)
- VP在相同PDF语料下仅使用约20B视觉token,而TP使用约80B文本token,效率提升4倍(第 4 页)
- 跨模态对齐:Centroid Separation从1.665降至0.661,Cosine Similarity从0.631升至0.907(第 6 页)
- 在MMMU-Pro上,Qwen 3.5的VP得分73.87,优于TP的72.14和Base的71.39(第 6 页)
- 图像到文本检索:R@1从64.0%提升至99.0%,MRR从78.2提升至99.5(第 15 页)
- 无解码器VP在GPQA上得分75.95,优于带解码器VP的75.44,且计算成本更低(第 16 页)
阅读时需要注意
- VP并非完全独立于语言预训练,而是作为文本继续预训练的补充。
- 实验主要聚焦于高知识密度的科学PDF,未验证在自然图像或视频等更广泛视觉语料上的迁移性。
- 视觉潜在预测与文本解码的协调机制仍有待进一步优化。
- VP的优势在视觉结构密度高的样本上最显著,在纯文本主导的样本上优势不明显。
- 增加视觉token预算并不总是带来性能提升,可能存在优化效应导致的梯度尺度变化。
- 注意力分析仅作为支持性证据,不能证明文本和视觉推理使用完全相同的内部机制。
关联工作
- Platonic Representation Hypothesis:支持不同模态表示收敛于共享抽象的直觉,为VP提供理论依据(第 1 页)
- Donut, Pix2Struct:OCR-free文档模型,但主要优化解析或理解,而非语言智能的视觉预训练(第 7 页)
- InternVL, Qwen2-vl:现有视觉基础模型,通常依赖图像-文本配对或对比学习(第 1 页)
- Nougat, MinerU:用于将PDF解析为文本的工具,VP对比了这种解析方式的信息损失(第 [1, 3] 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
2026-07-13
面向语言智能的可扩展视觉预训练
张一鸣1,2,*,赵中涵1,3,*,张伟1,*,赵海腾1,林天阳1,
周云华1,宋德民1,刘琨琨1,叶浩辰1,黄海安1,顾宇哲1,4, 吕海军1,郭启鹏1,刘斌2,王高昂3,†,陈凯1,† 1上海人工智能实验室 2中国科学技术大学 3浙江大学 4上海交通大学 *这些作者对本工作贡献同等。 † 通讯作者。 gaoangwang@zju.edu.cn, chenkai@pjlab.org.cn
大型基础模型的快速进步主要由在大规模文本语料库上的预训练所驱动。然而,许多形式的知识是通过视觉表征传达的,其中图表、排版公式和页面布局携带着丰富且无法仅通过文本忠实或完整捕获的信息。然而,当前的预训练方法通过将文档和网页等视觉丰富的源转换为纯文本以学习语言智能,从而丢弃了这些视觉线索。本文挑战了语言模型必须仅在纯文本表征上进行训练这一默认假设,并表明视觉预训练(Visual Pretraining, VP)是一种可扩展的视觉预训练范式,它直接利用视觉文档作为基础模型智能学习器,无需文本提取。为此,我们对视觉预训练进行了系统研究。 10 在多个骨干网络和基准测试中,在相同底层语料库上进行的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了一条高效路径。
1. 引言
大型基础模型的显著进步是由在前所未有的规模上对文本语料库进行预训练所驱动的[4, 9, 12]。虽然有效,但这种范式基于一个强烈的隐含假设:所有值得学习的知识都可以无损地编码为文本标记的线性序列。然而,认知科学早已表明,人类 routinely 使用图表、空间布局、数学符号以及其他表征形式进行推理,这些视觉线索使得某些关系可直接用于推断[1, 2, 15, 38]。因此,在训练前将这些视觉线索转换为纯文本本质上是有损的。在此,我们挑战这一假设,并表明基础模型可以直接从视觉语料库中学习,而无需文本提取或图像-文本配对监督,从而在相同底层语料库上产生比文本预训练更强的语言智能。
科学文档是这种信息损失的一个特别严重的案例。论文、教科书和技术报告通过图表、表格、公式布局和页面级的空间组织来传达复杂内容,所有这些编码了几何约束、符号拓扑和结构对应关系,这些对于科学推理至关重要。最近提出的柏拉图表征假设(Platonic Representation Hypothesis)[10] 形式化了机器学习中相关的直觉,认为由不同模型和模态学习的表征收敛于对现实世界的共享抽象。这些观察结果表明,从科学文档中提取的语言信息只是更丰富底层结构的一种投影,并且原则上可以直接从原始视觉文档中学习这种结构。
然而,现有方法在两个维度上均未利用这种可能性。在数据层面,预训练语料库通过将 HTML 或 LaTeX 源代码解析[7, 27],或应用神经文档解析模型对 PDF 进行预处理[3, 13, 16, 32],将视觉文档简化为纯文本,之后语言模型仅在生成的文本上进行训练。在训练层面,最近的多模态基础模型在训练过程中确实融入了视觉模态[5, 21, 33],但它们将视觉输入视为文本标记预测的条件上下文,阻止了视觉内容被深度整合到预测
第 2 页
面向语言智能的可扩展视觉预训练
文本预训练 … 文本
LLM Tokenizer … OCR
相同的 底层对象
…
LLM Encoder … 视觉补丁 视觉预训练
图 1:来自同一科学文档语料库的匹配文本和视觉预训练。在 TP 路径中,PDF 页面被解析为文本,进行分词,并使用文本 token 预测进行训练,这可能会丢弃或扭曲页面级结构,如图表、公式、表格和布局。在 VP 路径中,相同的页面被渲染为图像,过滤为前景视觉补丁,并在冻结的视觉特征空间中使用下一个视觉潜在预测进行训练。右侧的 t-SNE [31] 投影说明了表 2 中量化的表示变化:VP 使共享表示空间中的匹配视觉和文本文档嵌入更加接近。
过程。在这两种情况下,原始文档都被消耗然后丢弃,使得视觉模态处于模型学习目标之外。
在此,我们提出视觉预训练(VP),这是一个基础模型直接从原始文档中学习视觉信息,而无需任何文本提取或图像-文本配对监督的框架。通过对精心匹配的数据源进行系统研究,我们发现,在多个 LLM 骨干网络和科学推理基准上,VP 在相同的底层语料库上始终优于仅文本预训练,效率显著提高(在模型大小和数据规模方面仅使用 25% 的 token 预算),并增强了跨模态对齐,确立了 VP 作为学习语言和视觉智能的可扩展路径。这项工作做出了三个贡献。首先,我们表明将视觉文档简化为纯文本会导致大量信息丢失,而视觉预训练恢复了这些原本被丢弃的信息。其次,我们引入了一种自回归视觉预训练框架,训练基础模型在潜在空间中预测文档补丁,将视觉潜在变量深度整合到预测过程中。第三,通过对多种架构和基准下的匹配语料库进行统一的实证研究,我们确立了 VP 作为仅文本预训练的一种有效、高效且可扩展的替代方案。
2. 结果
我们的实验确立了三个发现。首先,在匹配语料库下的科学推理中,视觉预训练(VP)优于文本预训练(TP)。其次,这种增益随着训练数据量的增加而高效扩展。在相同的底层文档语料库上,VP 在仅消耗 25% token 预算的情况下超越了 TP。第三,无需任何图像-文本配对监督,VP 改善了视觉感知以及跨模态推理。在整个实验中,VP 和 TP 在继续预训练(CPT)阶段使用相同的文本语料库和匹配的额外科学 PDF 语料库。VP 在表示为视觉 token 的原始文档页面上进行训练,而 TP 在从相同文档解析出的文本上进行训练。这种设置隔离了保留视觉
第 3 页
面向语言智能的可扩展视觉预训练
表 1:在文档来源匹配的情况下,VP 提升了纯文本科学推理能力。所有行均使用相同的初始检查点和监督微调(SFT)阶段。TP 和 VP 仅在科学 PDF 语料库的表示方式上有所不同:TP 使用 MinerU2.5 解析的文本,而 VP 使用渲染后的页面图像。分数报告在纯文本推理基准测试上;GPQA 指 GPQA Diamond,AIME 指 AIME 2025。
| Method | Multimodal Models | | | | Language Models | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | MMLU-Pro | GPQA | AIME | HLE | MMLU-Pro | GPQA | AIME | HLE | | | Qwen 3.5 [29] | | | | Qwen 3 [36] | | | | | Base | 82.31 | 77.84 | 81.56 | 14.39 | 81.21 | 75.06 | 75.44 | 10.59 | | Text Pretraining | 83.91 | 76.24 | 89.58 | 15.70 | 81.52 | 74.94 | 74.99 | 11.39 | | VP (Ours) | 85.09 | 79.29 | 90.21 | 16.67 | 81.94 | 77.08 | 76.98 | 11.77 | | | Llama 3.2 Vision [25] | | | | Llama 3.1 [8] | | | | | Base | 47.24 | 27.46 | 8.02 | 6.41 | 59.48 | 39.71 | 24.17 | 6.75 | | Text Pretraining | 50.60 | 30.24 | 13.75 | 6.08 | 60.64 | 43.88 | 23.65 | 6.79 | | VP (Ours) | 51.52 | 33.08 | 18.54 | 7.00 | 62.77 | 47.10 | 24.27 | 7.17 |
科学文档的原生视觉形式。然后,我们对所有 VP 和 TP 检查点应用相同的监督微调(SFT),以激发基准测试所期望的结构化推理轨迹和答案格式。
有效性:VP 提升了科学语言推理能力。我们首先确立,在原始文档页面上进行继续预训练(CPT)在科学推理基准测试上产生的性能优于在来自同一语料库的文本化文档上进行继续预训练。我们在相同的文档来源和 SFT 数据下,比较基础模型、匹配的 TP 基线和 VP。两种预训练设置仅在文档表示方式上有所不同。实验在包括 Qwen3.5 [29]、Qwen3 [36]、Llama3.2 Vision [25] 和 Llama3.1 [8] 在内的最先进基础模型上进行。除非另有说明,我们报告 GPQA [30] 的平均 pass@8,AIME-25 [24] 的 32 次运行平均得分,以及 MMLU-Pro [34] 和 HLE [28] 的 pass@1。结果报告在表 1 中。
VP 始终优于匹配的 TP 基线,且这种提升出现在原生多模态模型和纯语言模型中,表明这种优势并不局限于单一架构。由于两种设置仅在文档表示上有所不同,推理基准测试上的提升表明,VP 是一种直接从视觉语料库获取语言智能的有效方法,这些视觉语料库保留了比文本提取所削弱或丢弃的更高保真度的与推理相关的信息。具体而言,在多学科基准测试上的一致提升表明,VP 成功内化了科学文档视觉内容中的知识。在四个骨干网络上,GPQA Diamond 最高提升了 3.22 分(例如,在 Qwen 3.5 上从 76.24 提升至 79.29),MMLU-Pro 最高提升了 2.1 分,这与以下观点一致:这些科学领域中的源文档知识部分由几何图形、物理示意图和其他文本提取无法忠实保留的视觉内容承载。相比之下,HLE 仅显示出边际提升(最高 0.97 分),因为其难度主要源于困难的多步推理,而非从视觉信息中获得的知识。
可扩展性:收益随 VP 扩展。我们进一步证明,VP 的优势是高效且可扩展的。图 2(a) 比较了 VP 和 TP 在 CPT 和 SFT 阶段的训练损失动态。在 CPT 期间,两条曲线接近,VP 达到略低的最终损失。在两个检查点使用相同的 SFT 数据进行微调后,VP 检查点收敛更快,并达到更低的最终 SFT 损失。我们将这种差异归因于预训练损失对下游能力的敏感性有限 [35]。相比之下,SFT 损失植根于预训练期间建立的几何结构 [17],因此更直接地反映了表示质量及其推理能力。
3
第 4 页
面向语言智能的可扩展视觉预训练
(a) 损失对比:视觉预训练与文本预训练 (c) 跨视觉结构密度的增益 0.85 +3.80 1.3 VP (Ours) TP (Text Pretraining) Density 0.80 3.5 1.2 +2.86 0.75 3.0 0.717 VP (Ours) Structure 1.1 0.70 2.5
2.0Loss 0.723 Text Pretraining 1.0 0.65 Visual CE by 0.60 1.5 0.9 Gain 1.0 0.55 0.8 0.5 0.50 -0.15 0.0 0.7 0.45 Multimodal 0 25 50 75 100 0 2 4 6 8 10 Low Medium High Pretrain tokens (B) SFT tokens (B ) Visual structure density
(b) 视觉预训练在各基准测试中的扩展性 (d) 多模态增益与视觉特征相似度的关系 8 3.0 Text pretraining baseline ChartQAPro VP (Ours) MMLU-Pro VP (Ours) AIME-25: 2.88x MathVista VP (Ours) +6.72 GPQA VP (Ours) MMMU-Pro VP (Ours) 2.5 AIME-25 VP (Ours) +5.74 6Baseline Baseline GPQA: 2.02x TextText2.0 +4.57 +3.60 +4.60 over over4 1.5 Gain MMLU-Pro: 1.27x Gain +1.10 1.0 2 +0.18 +2.60 +0.64 +0.30 +1.80 0.5Normalized Multimodal0 -0.17 0.00 0.0 0 5 10 15 20 76 80 0.0 0.1 0.2 0.3 0.4 0.5 Scientific PDF corpus training token (B) Visual feature cosine similarity against GT
图 2:视觉预训练随保留的 PDF 视觉标记数量扩展,并从结构密集的页面中获益最多。(a),在具有可比性的继续预训练 (CPT) 损失后,视觉预训练 (VP) 达到了更有利的监督微调 (SFT) 轨迹。(b),随着保留的视觉标记预算增加,下游增益持续上升,并以文本预训练 (TP) 相对于基线的提升为基准进行归一化。(c),VP 的优势在具有高视觉结构密度的示例中最大,其中图表、公式、表格和布局承载了更多的证据。(d),更好的下一个标记视觉特征预测与相对于 TP 更大的多模态增益相关,将视觉空间建模质量与下游迁移能力联系起来。
随后,我们考察下游性能如何随训练动态扩展。在图 2(b) 中,我们将 VP 相对于 TP 的下游增益进行归一化,两者均相对于起始检查点进行测量。对于相同的 PDF 语料库,VP 仅训练约 200 亿个视觉标记,而 TP 处理约 800 亿个文本标记。此外,随着训练的进展,VP 实现了稳步增加的归一化增益,在 MMLU-Pro 上达到 1.27 倍,在 GPQA 上达到 2.02 倍,在 AIME-25 上达到 2.88 倍,表明其具有更优越的扩展效率。图 2(d) 进一步揭示,视觉特征余弦相似度(作为视觉预测质量的代理指标)与下游改进强烈相关,这表明更好的视觉空间建模通过能够从视觉内容中提取更丰富的知识,从而支持更强的推理能力。为了验证这些增益确实基于视觉内容,我们遵循 Masry 等人 [23] 的方法,按视觉结构密度对评估集进行分类(图 2(c))。VP 相对于 TP 的优势随密度增加而增长。在低密度、以文本为主的页面上,VP 和 TP 的表现相当,而在富含图表、公式和表格的高密度页面上,则产生了显著更大的改进。这证实了 VP 的扩展优势确实是由其对视觉内容的建模所驱动的。
效率:紧凑的视觉表示保留了 VP 的增益 接下来,我们展示 VP 的效率。首先,视觉表示比 OCR 提取的文本更有效地压缩相同的科学文档。具体而言,VP 训练使用约 200 亿个视觉标记,而 TP 消耗约 800 亿个解析
第 5 页
用于语言智能的可扩展视觉预训练
MMLU Pro GPQA AIME HLE 文本预训练基线
50.78 51.52 51.87 50.33 51.30 51.57 51.52 49.08 50 50
40 40 33.08 33.08 30.68 31.00 31.94 32.07 31.44 31.00 30 30 准确率 准确率 18.54 18.54 17.50 20 20 15.83 16.67 15.52 13.75 11.25
10 6.79 7.00 6.75 6.50 10 6.64 7.00 7.00 5.61
0.25× 0.5× 1× 2× 4× 560 768 1120 视觉令牌预算(× 生产规模) 训练分辨率
图 3:主要的视觉预训练(VP)设置平衡了视觉令牌预算和渲染分辨率。左侧,在每次前向传播中固定训练上下文,改变视觉令牌预算显示,1× 设置(每批次 8,192 个前景视觉令牌)提供了最佳权衡。右侧,在视觉预算固定为 8,192 令牌的情况下,降低最大分辨率保持了强劲的性能,表明 VP 在压缩视觉输入下的效率。
文本令牌。其次,在固定的优化令牌预算下,VP 仅以少量的视觉令牌就实现了显著的性能提升。我们在固定的训练上下文中变化视觉令牌预算(图 3,左侧)。8,192 令牌设置(1×)实现了最佳权衡。我们假设,在更大的视觉令牌预算下性能次优的原因在于视觉 InfoNCE 训练中的优化效应。当保留更多视觉令牌时,损失是在更多的预测目标和批次内对比项上计算的,这可能会改变有效梯度尺度和优化行为。此外,由于在此扫描过程中我们保持学习率和其他优化超参数固定,较大的令牌预算可能未在此训练配方下得到充分调整。最后,视觉输入本身允许进一步压缩。我们在不同分辨率下训练 VP 并评估下游性能。在视觉预算固定为 8,192 令牌的情况下,降低最大分辨率保持了强劲的性能(图 3,右侧),且 VP 仍然优于文本预训练(TP)。这进一步放大了 VP 的效率。
跨模态:无需配对监督即可涌现多模态能力 我们最终证明,VP 带来的增益不仅限于纯文本推理。尽管 VP 是在未标记的原始文档页面上进行的,没有特定任务的多模态标注,但它也改善了多模态表示和下游视觉推理。
我们从基础模型(即 Qwen3.5)中提取隐藏状态,这些状态来源于 100 个源自科学文档的图像-文本对,并比较 VP 前后池化的视觉和文本嵌入。表 2 (a) 显示了在三个互补的对齐层面上的一致增益。全局上,质心分离度 [19] 从 1.665 降至 0.661,配对余弦相似度从 0.631 升至 0.907,表明两种模态现在共享一个公共子空间,且配对样本系统地共定位。结构上,线性中心核对齐 [14] 从 0.657 改善至 0.745,证明了两个表示空间在更大几何结构上的一致性。局部上,互 k-NN 重叠 [10] 在所有评估的 k 值上均得到改善,证实了实例级别的邻域对齐。我们在图 1 中还提供了一个定性视图,其中原本分离的视觉和文本嵌入簇在 VP 预训练后坍缩为一个重叠区域。为了视觉可比性和公平性,两个面板共享锚点特征和 t-SNE 设置。
表 2 (b) 报告了使用 Qwen 3.5 和 Llama 3.2 Vision 的多模态基准(即 MMMU-Pro [37]、SFE [39]、ChartQAPro [23] 和 MathVista [22])性能。VP 在每一个基准和骨干网络上均 consistently 优于预训练基础模型和文本预训练模型。TP 产生的增益微乎其微,有时甚至
第 6 页
面向语言智能的可扩展视觉预训练
表 2:VP 在不使用标注的多模态预训练数据的情况下,提升了跨模态对齐和多模态迁移能力。左侧 (a):VP 前后,在 100 对未使用的科学文档图像-文本对上的对齐指标;较低的质心分离度(Centroid Sep.)和较高的余弦相似度、CKA 以及互信息 $k$-NN 表示更好的对齐。右侧 (b):原生多模态模型在多模态基准测试上的 pass@1 性能,比较基础检查点(Base)、文本预训练(TP)和 VP。这些增益表明,无标签的视觉文档预训练提高了表示兼容性和下游视觉推理能力。
(a) 跨模态对齐。 (b) 多模态基准性能。
| 指标 | 原始 | VP (本文) | $\Delta$ | 方法 | MMMU-Pro | SFE | ChartQAPro | MathVista | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 全局 | | | | Qwen 3.5 [29] | | | | | | 质心分离度 $\downarrow$ | 1.665 | 0.661 | $-1.004$ | | | | | | | 余弦相似度 $\uparrow$ | 0.631 | 0.907 | $+0.276$ | Base | 71.39 | 53.41 | 57.99 | 84.30 | | 结构 | | | | 文本预训练 | 72.14 | 53.09 | 56.42 | 85.50 | | | | | | VP (本文) | 73.87 | 56.57 | 61.80 | 86.70 | | 线性 CKA $\uparrow$ | 0.657 | 0.745 | $+0.088$ | | | | | | | 局部 | | | | Llama 3.2 Vision [25] | | | | | | 互信息 $k$-NN@1 $\uparrow$ | 0.140 | 0.310 | $+0.170$ | Base | 28.55 | 28.86 | 20.95 | 39.80 | | 互信息 $k$-NN@5 $\uparrow$ | 0.288 | 0.420 | $+0.132$ | 文本预训练 | 28.21 | 29.36 | 22.23 | 39.60 | | 互信息 $k$-NN@10 $\uparrow$ | 0.395 | 0.496 | $+0.101$ | | | | | | | | | | | VP (本文) | 29.19 | 31.08 | 27.67 | 44.40 |
出现回归现象(例如,Qwen 3.5 在 ChartQAPro 上从 57.99 降至 56.42),表明进一步的文本预训练(TP)无法从视觉丰富的文档中获取信息。VP 相对于 TP 的优势在视觉密集型基准测试中最大,在两个骨干网络上 ChartQAPro 均达到 +5.4,在 Llama 3.2 Vision 的 MathVista 上达到 +4.8。结合图 2 (c) 中的分层密度结果,这表明 VP 的主要益处在于视觉内容(图表、公式、表格和复杂布局),这些内容通过文本解析无法被忠实恢复。
视觉预训练中的推理线索 为了理解 VP 在科学推理方面取得增益的机制,我们对注意力模式进行了定性研究。我们比较了在文本和视觉输入下,由同一道数学问题引发的注意力图,使用 Qwen3.5 作为原生多模态骨干网络。在文本设置中,问题和其思维链(chain-of-thought)解答以纯文本形式提供;我们从最后一个 Transformer 层提取注意力,对头进行平均,并使用最终答案句子作为查询。在视觉设置中,同一问题被渲染为图像并通过视觉路径输入。我们使用答案区域的视觉令牌作为查询,并对保留的补丁(patches)上的注意力进行平均。我们展示了一个代表性示例,其中两个注意力图都突出了相应的语义区域,包括问题约束和中间计算步骤,同时降低了填充内容的权重(图 4)。这种探测并不意味着两种模态使用相同的内部机制,但它表明 VP 以与基于文本的推理中使用的证据平行的方式,将推理相关的视觉证据暴露给共享的大语言模型(LLM)。
3. 讨论
大型语言模型通常仅从纯文本语料库中获取语言能力,但许多科学知识最初是以多模态文档形式表达的。科学论文包含公式、图表、表格以及精心设计的布局,所有这些内容在转换为纯文本时都可能被削弱或扭曲。我们询问,通过在标准文本继续预训练(CPT)的基础上,直接对这类文档的原生形式添加视觉预训练(VP),语言模型是否能够获得更强的科学推理能力。我们的结果给出了一个谨慎肯定的回答,表明 VP 在匹配的文本预训练基础上提升了科学推理能力,以紧凑的视觉预算高效扩展,并且能够在没有标注跨模态数据的情况下迁移到多模态推理。综上所述,这些结果表明,原始科学页面可以提供无标签的视觉监督,从而补充基础模型的继续预训练。
VP 的益处似乎来自于保留和建模在文本化过程中丢失的结构。科学页面并非任意图像,因为它们的视觉组织编码了公式拓扑、表格结构、图文对应关系、符号连续性和空间分组。VP 通过在页面上按位置排序的前景视觉令牌上训练共享的自回归骨干网络,使用因果目标来预测
第 7 页
面向语言智能的可扩展视觉预训练
文本推理注意力图
视觉推理注意力图
高 低
注意力强度
图 4:视觉 token 推理与文本推理关注相同的语义证据。我们在相同的数学问题上,分别使用文本输入和图像输入,比较了采用文本预训练(TP)或视觉预训练(VP)的基础模型。上方,文本推理:问题和思维链解答以纯文本形式给出,注意力是从最终答案句子测量到先前 token 的。下方,视觉推理:相同的问题被渲染为图像并通过视觉路径输入,注意力是从答案区域的视觉 token 测量到保留的页面补丁的。这两种视角都集中在用红色高亮显示的语义区域,包括问题约束和中间计算步骤。
下一个视觉潜在变量。通过将视觉文档本身作为预测目标,该目标鼓励骨干网络以保留文档原生关系的方式建模视觉表示。几个观察结果支持这种解释。首先,VP 在匹配文本预训练的基础上,通过不同的骨干网络提升了科学推理能力,这表明模型可以从方程式、图表、表格和布局等视觉元素中获取与推理相关的知识。其次,在多模态评估中,增益在视觉密集样本上最大,在这些样本中,图表、方程式、表格和布局承载了推理所需的大部分证据。跨模态对齐也在没有成对图像-文本监督的情况下得到改善,这表明视觉目标重塑了共享表示空间,使其与语言更加兼容。最后,定性的注意力分析表明,视觉 token 推理可以关注渲染问题的语义相关区域,尽管这应被视为支持性证据,而非证明文本推理和视觉推理使用相同机制的证据。
文本继续预训练仍然是吸收已在语言中充分表示的知识的有效方法,但科学文档通过文本化管道到达模型,该管道可能会丢弃布局、公式、图表和其他视觉关系。VP 并不替代这一路径。相反,它将标准的文本继续预训练与针对原生科学页面的视觉下一个潜在变量目标相结合,使模型能够保留
第 8 页
面向语言智能的可扩展视觉预训练
在从同一科学文档语料库的原始视觉形式中学习的同时,接触文本内容。由于视觉预训练(VP)和文本基线使用相同的文档来源,这种性能提升表明,原始视觉表示提供了超越纯文本内容的有用监督信号。
现有的多模态预训练方法通常通过图像-文本对、描述损失、对比对齐、光学字符识别(OCR)监督或文档理解目标来引入视觉输入。无需 OCR 的文档模型,如 Donut [13] 和 Pix2Struct [16],进一步表明文档图像可以直接使用,但它们的预训练主要优化用于解析、理解或图像到文本生成。相比之下,视觉预训练(VP)将渲染后的科学页面视为无标签的视觉序列,并使用下一个视觉潜在预测目标训练共享的自回归骨干网络。这一过程无需密集标注或显式的图像-文本配对。
我们的研究存在若干局限性。首先,我们的方法不应被解释为一种完全独立于语言预训练的视觉预训练形式。由于视觉预训练(VP)建立在文本预训练基础之上,并在继续预训练(CPT)阶段引入视觉潜在预测,因此观察到的性能提升应被理解为视觉预训练可以补充和扩展基础模型预训练的证据。其次,虽然视觉预训练(VP)表明视觉潜在预测可以有效指导预训练优化,但未来的工作可能会进一步研究如何更好地协调视觉潜在解码与文本解码。我们的观察表明,视觉预训练强烈鼓励模型捕捉视觉呈现和结构,从而激发了关于损失调度、前景感知令牌选择以及参数高效的视觉模块的未来研究。第三,我们的实验主要集中于高知识密度的科学 PDF,其中视觉布局、图表、表格、公式以及周围的文本上下文与语义意义紧密耦合。同样的预训练策略是否能迁移到更广泛的视觉语料库(如自然图像或视频)中,仍然是一个未解之谜。
这项工作指出了两个有前景的方向。首先,视觉预训练为基础模型训练提供了一条新途径。对于高密度的视觉原生语料库,如科学文档、图表、表格、公式和结构化布局,视觉潜在预测可以作为一种有效的补充预训练目标。其次,视觉预训练开辟了一条基于高度压缩视觉语料库的可扩展预训练范式的新路径。这表明,基础模型可以主要基于大规模视觉流进行训练,仅辅以轻量级的文本对齐,以匹配文本预训练模型的性能。未来的工作应研究这种范式是否能在更大规模上实现高效训练,同时保持强大的文本和多模态能力。
4. 方法
概述。视觉预训练(VP)通过在原始科学文档页面上引入下一个视觉潜在预测,扩展了文本继续预训练(CPT)。每一页由一个冻结的视觉塔编码。保留的前景特征随后通过视觉投影模块投影到大型语言模型(LLM)的隐藏空间中。我们移除空白的背景区域,保留前景补丁,并按光栅扫描顺序对剩余特征进行排序。位置编码得以保留以维持空间布局。所得的稀疏视觉序列被输入到处理文本令牌的同一自回归骨干网络中。模型在因果图像掩码下训练以预测下一个前景补丁特征。
稀疏文档表示 给定一个渲染的文档页面 $\mathcal{I}$,冻结的视觉塔 $E_v$ 产生一个视觉特征序列: $$ \mathcal{Z} = E_v(\mathcal{I}) = (z_1, \dots, z_N). \quad (1) $$
文档页面包含大量空白区域,如页边距和空白处。因此,我们使用简单的补丁级统计信息(包括像素方差和平均亮度)计算前景掩码,并仅保留非空白补丁。保留的特征按光栅扫描顺序排列,形成稀疏的前景序列: $$ \mathcal{U} = \text{Raster}\{z_i : m_i = 1\} = (u_1, \dots, u_L), \quad L \ll N. \quad (2) $$
这种稀疏表示在页面顺序中保留了前景文档内容,同时显著缩短了视觉上下文。每个前景特征通过一个学习的线性投影映射到 LLM 隐藏空间。位置索引根据光栅顺序重新分配。确切的前景过滤规则和序列打包掩码详见补充材料 A 节。
第 9 页
面向语言智能的可扩展视觉预训练
下一个视觉潜在预测 对于每张文档图像,我们首先提取一系列冻结的视觉潜在向量,并保留前景标记。这些视觉潜在向量通过输入投影模块映射到大型语言模型(LLM)的嵌入空间,然后在视觉位置上的因果注意力掩码下输入到 LLM 中。给定位置 $t$ 处的 LLM 隐藏状态,输出投影头将其映射回冻结的视觉潜在空间,以产生预测 $\hat{z}_{t+1}$。该预测通过带有批次内负样本的对比损失进行训练,以匹配下一个前景视觉潜在向量 $z_{t+1}$。这构成了一个自回归视觉潜在预测目标。它遵循语言建模的下一个标记预测结构,但目标是连续的视觉潜在向量,而非离散的文本标记。
我们使用下一个视觉潜在预测目标来训练视觉流。对于一批预测-目标对,令 $p_{ij}$ 为将位置 $i$ 处的预测与目标特征 $j$ 匹配的 softmax 概率,该概率由余弦相似度与温度 $\tau$ 计算得出。视觉预训练损失为
$$ \mathcal{L}_{VP} = -\frac{1}{|\mathcal{B}|} \sum_{i \in \mathcal{B}} \log p_{ii}. \quad (3) $$
批次中的其他视觉特征作为负样本。该目标鼓励模型预测正确的下一个文档特征,同时将其与其他补丁区分开来。扩展的 InfoNCE [26] 公式及批次内匹配概率的定义见补充材料 A 节。
联合文本和视觉预训练 最终的训练目标结合了标准的文本下一个标记预测与下一个视觉潜在预测:
$$ \mathcal{L} = \lambda_{\text{text}} \mathcal{L}_{CE} + \lambda_{\text{vis}} \mathcal{L}_{VP}, \quad (4) $$
其中 $\mathcal{L}_{CE}$ 是文本标记上的自回归交叉熵损失,$\mathcal{L}_{VP}$ 由公式 (3) 定义。在训练过程中,文本和视觉示例根据固定的混合比例交错排列。我们更新 LLM、视觉输入投影和预测头,同时保持视觉编码器冻结。多个前景序列被打包到固定长度的上下文中,并跟踪序列边界以防止跨样本注意力。关于训练语料库、架构、优化设置和评估协议的更多细节见补充材料 D 节。
训练设置 我们使用 XTuner 框架 [6] 实现继续预训练(CPT)。在视觉预训练(VP)期间,我们优化 LLM 和将 LLM 隐藏状态映射到冻结视觉表示空间的轻量级预测投影器,同时保持视觉塔冻结。对于文本预训练(TP)和 VP,我们保持非 PDF 文本语料库、初始检查点、优化配方和监督微调(SFT)阶段不变。唯一的受控差异是额外科学 PDF 语料库的表示形式。在 TP 中,PDF 页面被转换为 MinerU2.5 解析的文本,产生约 800 亿个文本标记。在 VP 中,相同的 PDF 页面被渲染为图像并过滤为稀疏的前景视觉序列,在主分辨率下产生约 200 亿个视觉标记。因此,总的 CPT 标记预算不同(TP 为 1800 亿,VP 为 1200 亿),这是因为相同的匹配 PDF 语料库在视觉流中表示得更加紧凑,而不是因为 VP 使用了不同的文档来源。因此,所有比较都匹配底层 PDF 文档,同时允许标记数量反映所选的表示形式。随后,使用相同的 SFT 配方对生成的检查点进行训练,并使用相同的基准协议进行评估。
评估协议 如表 1 和表 2 所示,我们在从 CPT 初始化的 SFT 之后,以零样本设置评估 VP 和基线方法。表 1 中的评估使用带有指令“think step by step”的思维链(CoT)提示,而表 2 中的评估使用没有显式推理指导的直接回答模板。除非另有说明,表 1 报告了 GPQA 的平均 pass@8、AIME-25 在 32 次运行中的平均得分,以及 MMLU-Pro 和 HLE 的 pass@1。表 2 中的所有基准均以 pass@1 报告。默认情况下,我们通过基于规则的匹配提取答案并自动评分。当提取失败时,我们使用 GPT-4o [11] 进行判断。
第 10 页
面向语言智能的可扩展视觉预训练
参考文献
[1] Lawrence W. Barsalou. Perceptual symbol systems. Behavioral and Brain Sciences, 22(4):577–660, 1999. doi: 10.1017/S0140525X99002149. 1
[2] Lawrence W. Barsalou. Grounded cognition. Annual Review of Psychology, 59:617–645, 2008. doi: 10.1146/annurev.psych.59.103006.093639. 1
[3] Lukas Blecher, Guillem Cucurull Preixens, Thomas Scialom, and Robert Stojnic. Nougat: Neural optical understanding for academic documents. In International Conference on Learning Representations, volume 2024, pp. 37646–37663, 2024. 1
[4] Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al. Language models are few-shot learners. Advances in neural information processing systems, 33:1877–1901, 2020. 1
[5] Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, et al. Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 24185–24198, 2024. 1
[6] XTuner Contributors. Xtuner: A toolkit for efficiently fine-tuning llm. https://github.com/ InternLM/xtuner, 2023. 4
[7] Leo Gao, Stella Biderman, Sid Black, Laurence Golding, Travis Hoppe, Charles Foster, Jason Phang, Horace He, Anish Thite, Noa Nabeshima, et al. The pile: An 800gb dataset of diverse text for language modeling. arXiv preprint arXiv:2101.00027, 2020. 1
[8] Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Alex Vaughan, et al. The llama 3 herd of models. arXiv preprint arXiv:2407.21783, 2024. 1, 2
[9] Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, DDL Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, et al. Training compute-optimal large language models. arXiv preprint arXiv:2203.15556, 10, 2022. 1
[10] Minyoung Huh, Brian Cheung, Tongzhou Wang, and Phillip Isola. The platonic representation hypothesis. arXiv preprint arXiv:2405.07987, 2024. 1, 2
[11] Aaron Hurst, Adam Lerer, Adam P Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, Alec Radford, et al. Gpt-4o system card. arXiv preprint arXiv:2410.21276, 2024. 4
[12] Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei. Scaling laws for neural language models. arXiv preprint arXiv:2001.08361, 2020. 1
[13] Geewook Kim, Teakgyu Hong, Moonbin Yim, Jinyoung Park, Jinyeong Yim, Wonseok Hwang, Sangdoo Yun, Dongyoon Han, and Seunghyun Park. Donut: Document understanding transformer without ocr. arXiv preprint arXiv:2111.15664, 7(15):2, 2021. 1, 3
[14] Simon Kornblith, Mohammad Norouzi, Honglak Lee, and Geoffrey Hinton. Similarity of neural network representations revisited. In International conference on machine learning, pp. 3519–3529. PMlR, 2019. 2, D
[15] Jill H. Larkin and Herbert A. Simon. Why a diagram is (sometimes) worth ten thousand words. Cognitive Science, 11(1):65–100, 1987. doi: 10.1016/S0364-0213(87)80026-5. 1
[16] Kenton Lee, Mandar Joshi, Iulia Raluca Turc, Hexiang Hu, Fangyu Liu, Julian Martin Eisenschlos, Urvashi Khandelwal, Peter Shaw, Ming-Wei Chang, and Kristina Toutanova. Pix2struct: Screenshot parsing as pretraining for visual language understanding. In International Conference on Machine Learning, pp. 18893–18912. PMLR, 2023. 1, 3
10
第 11 页
面向语言智能的可扩展视觉预训练
[17] Melody Li, Kumar Krishna Agrawal, Arna Ghosh, Komal Teru, Adam Santoro, Guillaume Lajoie, 和 Blake Richards. 追踪语言模型从预训练到后训练阶段的表示几何结构. 神经信息处理系统进展, 38:54691–54724, 2026. 2
[18] Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, 和 Kaiming He. 无需向量量化的自回归图像生成. 神经信息处理系统进展, 37:56424–56445, 2024. C
[19] Victor Weixin Liang, Yuhui Zhang, Yongchan Kwon, Serena Yeung, 和 James Y Zou. 关注差距: 理解多模态对比表示学习中的模态差距. 神经信息处理系统进展, 35:17612–17625, 2022. 2
[20] Zhiqiu Lin, Xinyue Chen, Deepak Pathak, Pengchuan Zhang, 和 Deva Ramanan. 重新审视 视觉-语言模型中语言先验的作用. arXiv 预印本 arXiv:2306.01879, 2023. B
[21] Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee. 视觉指令微调. 神经信息处理系统进展, 36:34892–34916, 2023. 1
[22] Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, 和 Jianfeng Gao. Mathvista: 在视觉语境中评估基础模型的数学推理能力. 在 国际学习表征会议, 卷 2024, 页码 23439–23554, 2024. 2
[23] Ahmed Masry, Mohammed Saidul Islam, Mahir Ahmed, Aayush Bajaj, Firoz Kabir, Aaryaman Kartha, Md Tahmid Rahman Laskar, Mizanur Rahman, Shadikur Rahman, Mehrad Shahmohammadi, 等. Chartqapro: 一个更多样且具有挑战性的图表问答基准. 在 计算语言学协会 2025 年发现, 页码 19123–19151, 2025. 2, 2
[24] 美国数学协会. 美国邀请数学考试 (AIME). 2025. 网址 https://maa.org/math-competitions/ american-invitational-mathematics-examination-aime. 由美国数学协会作为 AMC 竞赛系列的一部分进行管理. 2
[25] Meta AI. Llama 3.2 视觉模型卡. https://huggingface.co/meta-llama/Llama-3. 2-11B-Vision, 2024. 访问日期: 2026-06-02. 1, 2, 2b
[26] Aaron van den Oord, Yazhe Li, 和 Oriol Vinyals. 使用对比预测编码进行表示学习. arXiv 预印本 arXiv:1807.03748, 2018. 4
[27] Keiran Paster, Marco Dos Santos, Zhangir Azerbayev, 和 Jimmy Ba. Openwebmath: 一个高质量数学网络文本的开放数据集. 在 国际学习表征会议, 卷 2024, 页码 20357–20379, 2024. 1
[28] Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, 等. 人类最后的考试. arXiv 预印本 arXiv:2501.14249, 2025. 2
[29] Qwen Team. Qwen3.5: 迈向原生多模态智能体, 2026年2月. 网址 https://qwen.ai/ blog?id=qwen3.5. 1, 2, 2b
[30] David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, 和 Samuel R Bowman. Gpqa: 一个研究生级别的防谷歌问答基准. arXiv 预印本 arXiv:2311.12022, 2023. 2
[31] Laurens van der Maaten 和 Geoffrey Hinton. 使用 t-sne 可视化数据. 机器学习研究杂志, 9(86):2579–2605, 2008. 网址 http://jmlr.org/papers/v9/vandermaaten08a.html. 1
[32] Bin Wang, Chao Xu, Xiaomeng Zhao, Linke Ouyang, Fan Wu, Zhiyuan Zhao, Rui Xu, Kaiwen Liu, Yuan Qu, Fukai Shang, 等. Mineru: 一种用于精确文档内容提取的开源解决方案. arXiv 预印本 arXiv:2409.18839, 2024. 1, D
11
第 12 页
面向语言智能的可扩展视觉预训练
[33] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, 等. Qwen2-vl: 提升视觉-语言模型在任意分辨率下对世界的感知能力. arXiv 预印本 arXiv:2409.12191, 2024. 1
[34] Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni, Abhranil Chandra, Shiguang Guo, Weiming Ren, Aaran Arulraj, Xuan He, Ziyan Jiang, 等. Mmlu-pro: 一个更稳健且具有挑战性的多任务语言理解基准. arXiv 预印本 arXiv:2406.01574, 2024. 2
[35] Jason Wei, Yi Tay, Rishi Bommasani, Colin Raffel, Barret Zoph, Sebastian Borgeaud, Dani Yogatama, Maarten Bosma, Denny Zhou, Donald Metzler, 等. 大语言模型的涌现能力. arXiv 预印本 arXiv:2206.07682, 2022. 2
[36] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, 等. Qwen3 技术报告. arXiv 预印本 arXiv:2505.09388, 2025. 1, 2
[37] Xiang Yue, Tianyu Zheng, Yuansheng Ni, Yubo Wang, Kai Zhang, Shengbang Tong, Yuxuan Sun, Botao Yu, Ge Zhang, Huan Sun, 等. Mmmu-pro: 一个更稳健的多学科多模态理解基准. 在计算语言学协会第 63 届年会论文集 (第一卷:长论文) 中,第 15134–15186 页,2025. 2
[38] Jiajie Zhang. 问题解决中外部表征的本质. 认知科学, 21(2):179–217, 1997. doi: 10.1207/s15516709cog2102_3. 1
[39] Yuhao Zhou, Yiheng Wang, Xuming He, Ruoyao Xiao, Zhiwei Li, Qiantai Feng, Zijie Guo, Yuejin Yang, Hao Wu, Wenxuan Huang, 等. 科学家的第一次考试:通过感知、理解和推理探测多模态大语言模型的认知能力. 神经信息处理系统进展, 38, 2026. 2
12
第 13 页
可扩展的语言智能视觉预训练
补充概览。我们提供了额外的分析和实现细节,以补充正文内容。
• 附录 A(详细的视觉预训练流程)。我们提供了视觉预训练流程的完整数学公式,包括冻结的视觉特征提取、前景 token 过滤、因果视觉预测、对比式下一个视觉潜在预测损失以及序列打包。 • 附录 B(基于困惑度的图像到文本检索)。我们通过基于困惑度的图像到文本检索,提供了跨模态对齐的另一种生成式评估,表明视觉预训练显著提高了检索准确率。 • 附录 C(进一步研究:使用生成解码器的视觉预训练)。我们探索了通过显式生成解码器增强视觉预训练,该解码器提供像素级重建监督。我们发现,这种变体的训练成本显著更高,但性能与无解码器的视觉预训练公式相当。 • 附录 D(实现与评估细节)。我们描述了主实验中使用的训练语料库、模型架构、优化设置、评估协议以及跨模态对齐分析。
A. 详细的视觉预训练流程
本节提供 VP 中使用的视觉预训练流程的数学细节。正文从高层描述了该方法;此处我们指定了稀疏文档 token 的构建、因果视觉预测目标以及训练中使用的序列打包过程。
冻结视觉特征提取。给定渲染的文档页面 $\mathcal{I} \in \mathbb{R}^{H \times W \times 3}$,具有补丁大小 $p$ 的冻结 ViT 编码器 $\varphi_{\text{ViT}}$ 首先将页面映射为补丁特征网格: $$ Y = \varphi_{\text{ViT}}(\mathcal{I}) = (y_1, \dots, y_{N_0}), \quad y_i \in \mathbb{R}^{c_v}. \quad (5) $$
冻结的空间合并器 $M$ 随后将相邻的补丁特征分组,并将它们映射到用作预测目标的视觉特征空间:
$$ \mathcal{Z} = M(Y) = (z_1, \dots, z_N), \quad z_i \in \mathbb{R}^{d_v}. \quad (6) $$
ViT 编码器和空间合并器在整个训练过程中保持固定。因此,视觉流学习预测稳定的文档特征,而不是重建像素。
前景 token 过滤。文档页面包含大量空白区域,如页边距和空白处。为了避免在背景补丁上消耗上下文长度,我们在构建视觉序列之前计算补丁级的前景掩码。对于每个原始图像补丁,我们计算其像素方差 $\sigma^2_i$ 和平均亮度 $\ell_i$。当补丁具有低方差和接近空白的亮度时,被视为背景: $$ b_i = \mathbb{1}[\sigma^2_i < \tau_\sigma \land (\ell_i > \tau^+_\ell \lor \ell_i < \tau^-_\ell)], \quad (7) $$
其中 $b_i=1$ 表示背景。空间合并后,掩码在每个合并块上进行最大池化,因此如果其组成补丁中的任何一个包含前景内容,则保留合并后的视觉 token:
$$ m_j = \max_{i \in \mathcal{P}(j)} (1 – b_i), \quad (8) $$
13
第 14 页
面向语言智能的可扩展视觉预训练
其中 $\mathcal{P}(j)$ 表示属于合并后的 token $j$ 的原始补丁集合。
保留的视觉特征按光栅扫描顺序排列:
$$ \mathcal{U}= \text{Raster}\{z_j: m_j= 1\} = (u_1, \dots, u_L), \quad L \ll N. \quad (9) $$
这产生了一个稀疏文档序列,在保留页面顺序的同时移除了大部分空白区域。
投影到 LLM 空间。每个前景视觉特征通过一个可学习的线性映射投影到 LLM 隐藏空间:
$$ x_i= W_{in}u_i, \quad x_i \in \mathbb{R}^d. \quad (10) $$
位置索引根据前景过滤后的光栅顺序分配。这使得 LLM 能够将页面作为有序视觉序列进行处理,同时避免为已移除的背景区域分配位置。
因果视觉预测。投影后的序列 $(x_1, \dots, x_L)$ 被输入到共享的自回归 LLM 主干网络中,并在图像位置上应用因果注意力掩码。位置 $i$ 处的隐藏状态用于预测下一个前景特征:
$$ h_i= \Phi_{\text{LLM}}(x_{\le i}), \quad \hat{u}_{i+1} = \psi(h_i), \quad (11) $$
其中 $\Phi_{\text{LLM}}$ 是 LLM 主干网络,$\psi$ 是一个轻量级的 MLP 预测头。在我们的实现中,
$$ \psi(h) = W_2 \text{GELU}(W_1h). \quad (12) $$
$\hat{u}_{i+1}$ 的目标是冻结的视觉特征 $u_{i+1}$。因此,该任务是语言模型下一个 token 预测的连续模拟。
对比式下一个视觉潜在预测损失。对于一批有效的预测-目标对 $\mathcal{B}$,我们计算余弦相似度 logits:
$$ s_{ij}= \frac{\cos(\hat{u}_{i+1}, u_{j+1})}{\tau}, \quad (13) $$
其中 $\tau$ 是温度参数。匹配概率通过对批次中的目标特征进行 softmax 获得:
$$ p_{ij}= \text{softmax}_{j \in \mathcal{B}}(s_{ij}). \quad (14) $$
视觉预训练损失随后为
$$ \mathcal{L}_{\text{VP}} = -\frac{1}{|\mathcal{B}|} \sum_{i \in \mathcal{B}} \log p_{ii}. \quad (15) $$
该目标鼓励每个预测的特征与正确的下一个前景 token 匹配,同时使用批次中的其他视觉特征作为负样本。
联合优化。视觉预训练与标准的文本下一个 token 预测相结合:
$$ \mathcal{L}= \lambda_{\text{text}}\mathcal{L}_{\text{CE}} + \lambda_{\text{vis}}\mathcal{L}_{\text{VP}}. \quad (16) $$
仅更新 LLM 参数、视觉输入投影 $W_{in}$ 和预测头 $\psi$。ViT 编码器和空间合并模块保持冻结,从而提供固定的视觉目标空间。
序列打包与注意力掩码。为了提高训练效率,将多个稀疏前景序列打包到固定长度的上下文中。令 $q(a)$ 表示打包位置 $a$ 所属的文档序列。我们使用块因果注意力掩码:
$$ A_{ab}= \begin{cases} 0, & q(a) = q(b) \text{ and } b \le a, \\ -\infty, & \text{otherwise}. \end{cases} \quad (17) $$
这防止视觉 token 关注未来的 token 或来自其他打包文档页面的 token。预测目标也被限制在相同的原始前景序列内,因此模型永远不会跨文档边界进行预测。
第 15 页
面向语言智能的可扩展视觉预训练
B. 基于困惑度的图像到文本检索
我们通过将其转化为由条件困惑度评分的图像到文本检索任务,提供了一种替代性的跨模态对齐生成式评估方法。
评估设置。我们采样 100 个随机的文档图像-文本对,对于每个(图像 $v_i$,文本 $t_j$)组合,计算匹配分数,该分数遵循 Lin 等人 [20] 的定义,通过条件困惑度估计点互信息,$\text{Score}(i, j) = \mathcal{L}(t_j| v_i) – \mathcal{L}(t_j)$,其中 $\mathcal{L}(t_j| v_i)$ 是在视觉表示 $v_i$ 条件下生成文本 $t_j$ 的交叉熵损失,$\mathcal{L}(t_j)$ 是无条件文本先验;分数越低表示对齐越强。我们报告 Recall@$K$ 和平均倒数排名(MRR)。
发现。如表 3 所示,视觉预训练带来了显著的提升:R@1 从 64.0% 增加到 99.0%,MRR 从 78.2 上升到 99.5。对 100 × 100 分数矩阵的分析显示,在原始模型中,非对角线分数表现出高方差($\sigma= 0.168$),导致某些文本充当“枢纽”吸引子,无论输入图像如何,都会接收到虚假的低分。经过视觉预训练后,非对角线方差降至 $\sigma= 0.043$,有效地消除了枢纽现象,并实现了近乎完美的区分能力。
表 3:使用条件困惑度的生成式图像到文本检索。每张图片使用第 B 节中定义的 PMI 风格分数与 100 个候选文本进行匹配;更高的 Recall@$K$ 和 MRR 表示更好的跨模态兼容性。
指标 文本预训练 VP ( ours) $\Delta$
R@1 64.0 99.0 +35.0 R@5 92.0 100.0 +8.0 MRR 78.2 99.5 +21.3
C. 使用生成式解码器的视觉预训练
动机。视觉预训练的自然扩展是为大语言模型配备一个显式的生成式解码器,将视觉潜在变量解码回像素,从而提供像素级的重建监督。在我们的探索性实验中,我们通过将 MAR 风格的自回归解码器 [18] 后接一个冻结的 VAE 解码器附加到大语言模型的隐藏状态上来实例化这种设计,从而产生如图 5 所示的完整编码-解码流水线。由此产生的像素重建损失 $\mathcal{L}_{\text{MSE}}$ 提供了细粒度的像素级监督,这是正文中使用的纯潜在预测方法所缺乏的。
与生成式视觉预训练的比较。尽管有额外的监督信号,但生成式解码器设计导致训练成本大幅增加。具体而言,(1) MAR 解码器引入了额外的可训练参数(在我们的设置中约为 300M)和计算量;(2) 扩散风格的潜在损失 $\mathcal{L}_{\text{diff}}$ 和像素 MSE 损失 $\mathcal{L}_{\text{MSE}}$ 必须在每个视觉步骤中通过解码器堆栈进行计算和反向传播;(3) 与无解码器变体相比,整体训练吞吐量下降了大约 30%–40%。在我们的实验中,生成式解码器变体需要大约 1.4 倍的训练时间才能达到与无解码器公式相同的收敛标准。当扩展到大型文档语料库时,这些开销变得显著。
我们进一步在相同的匹配文档源上比较了生成式解码器变体(记为带解码器的 VP)与无解码器视觉预训练(记为无解码器的 VP w/o Decoder)。如表 4 总结,两种视觉预训练变体在所有评估的推理基准测试中均优于基础模型和仅文本预训练基线。关键在于,像素级损失并未转化为持续更强的语言推理性能:生成式解码器变体取得的分数与无解码器公式相当或仅略高,这表明额外的像素监督对下游推理的边际收益递减。
第 16 页
面向语言智能的可扩展视觉预训练
视觉预训练(带生成式解码器) 视觉预训练(无生成式解码器)
编码器 编码器
大语言模型 (LLM) 解码器
损失 损失
损失 生成式 当前 未来
图 5:生成式解码器变体与无解码器视觉预训练之间的架构对比。(左)生成式解码器变体(带解码器的视觉预训练)添加了一个 MAR 解码器和一个冻结的 VAE 解码器,以从大语言模型优化的潜在变量中重建页面,从而在增加额外参数和计算量的代价下提供额外的像素级监督。(右)我们的无解码器公式(无解码器的视觉预训练)对前景补丁潜在变量进行自回归预测,无需像素重建。
表 4:无解码器视觉预训练与生成式解码器变体的对比。所有方法均使用相同的匹配文档来源,并在相同的监督微调 (SFT) 协议后进行评估。无解码器公式在无需额外重建解码器的情况下,达到了相当或更优的推理性能。
方法 MMLU-Pro GPQA AIME
基础 79.86 69.57 74.90 文本预训练 81.32 74.94 74.48 带解码器的视觉预训练 81.87 75.44 76.46 无解码器的视觉预训练 81.69 75.95 76.98
结论。综上所述,这些探索性结果表明,像素级生成监督对语言推理提供的边际收益有限,且伴随着不可忽视的计算成本。因此,正文采用了无解码器视觉预训练公式,该公式通过显著更简单且更高效的流水线,达到了相当的下游性能。
D. 额外的实现与评估细节
本节提供了补充主方法部分的实现与评估细节。我们首先描述训练数据、模型架构、优化设置和基准协议。然后,我们给出表 2 中报告并在第 2 节中讨论的跨模态对齐分析的完整构建过程。
训练语料。训练数据由三个部分组成:用于标准继续预训练 (CPT) 的文本语料、用于匹配视觉和文本预训练的科学 PDF 语料,以及用于指令微调 (SFT) 的数据。对于匹配的文本预训练基线,每个 PDF 页面均使用 MinerU2.5 [32] 转换为文本。对于视觉预训练 (VP),相同的 PDF 页面被渲染为图像,并作为无标签的视觉监督输入。对于
第 17 页
面向语言智能的可扩展视觉预训练
在 Qwen 的预训练过程中,实际的预处理流水线从相同的 PDF 页面中为 VP(视觉预训练)生成约 200 亿个保留的视觉 token,为 TP(文本预训练)生成约 800 亿个解析后的文本 token。这种匹配构建控制了文档来源,仅改变了科学 PDF 语料库的表示形式。
VP 图像记录存储为 JSONL 条目,包含页面图像路径和可选的预计算潜在特征路径。在加载过程中,每个页面被转换为 RGB 格式,调整大小至固定最大分辨率的正方形,并进行归一化,然后输入模型处理器。除非另有说明,页面采样时不根据裁剪坐标进行过滤。空白区域通过基于补丁方差和亮度的前景掩码移除,使用的方差阈值为 0.02,高亮度阈值为 0.95,低亮度阈值为 0.15。如果其组成的原始补丁中有任何一个是前景,则保留合并的视觉 token。
模型架构。VP 使用与相应文本预训练基线相同的 LLM 主干。在 Qwen3.5 实现中,视觉路径从相应的 Qwen3.5/Qwen-VL 检查点初始化。视觉塔是一个具有 27 层、隐藏层大小 1152、16 个注意力头、补丁大小 16 和空间合并大小 2 的 ViT 风格编码器。在 VP 期间,视觉塔被冻结。前景视觉特征通过视觉投影器映射到 LLM 隐藏空间;在主要的 VP 运行中,该投影器和 LLM 是可训练的,而冻结的视觉特征作为预测目标。一个两层 MLP 预测头将 LLM 隐藏状态映射回冻结的视觉特征空间,以进行下一个视觉潜在预测。
VP 的主要公式是无解码器的:它预测冻结的视觉特征,而不重建像素。这避免了像素级图像解码器带来的额外计算成本和优化复杂性。我们在第 C 节中单独研究了一种生成式解码器变体。
训练超参数。在继续预训练期间,文本和视觉示例根据固定的混合比例交错。在我们的实现中,每个文本训练步骤附带一个 VP 批次。文本分支使用标准的自回归交叉熵进行优化,而视觉分支使用公式 (3) 中定义的下一个视觉潜在对比损失进行优化。我们使用温度为 $\tau= 0.07$ 的 InfoNCE,并在主要的 Qwen3.5 运行中将 VP 损失权重设置为 0.1。LLM 主干、视觉投影器和预测头联合更新,而视觉塔在整个训练过程中保持冻结。
多个稀疏的前景序列被打包到固定长度的上下文中,并跟踪序列边界以防止跨不同文档页面的注意力。视觉管道的详细数学公式,包括前景过滤、投影、因果掩码和序列打包,在第 A 节中提供。
对于 Qwen3.5 运行,文本序列被硬打包到 32,768 个 token,并在全局批次大小 1024、AdamW 学习率 $3 \times 10^{-5}$、权重衰减 0.1、1,000 步预热以及线性衰减至 $10^{-6}$ 的情况下训练 12,000 步。相应的 VP 头使用 AdamW,学习率为 $4 \times 10^{-5}$,并使用与文本优化器相同的优化器 beta 和权重衰减。主要设置下的视觉 VP 上下文限制为 8,192 个保留的前景 token。
训练成本。在主要的 Qwen 和 Llama VP/TP 继续预训练运行中,每个运行通常需要在拥有 128 个加速器的分布式集群上花费大约 1.5–3 天的挂钟时间,具体取决于主干、token 预算、上下文长度和数据模态。例如,主要的 Qwen3.5-35B-A3B 继续预训练运行大约需要 36 小时,随后 SFT 阶段大约需要 10 小时。由于机构限制,具体的加速器型号未公开。
评估协议。所有模型均在从 CPT 初始化的 SFT 之后,在零样本设置下进行评估。对于表 1 中的纯文本推理基准,我们使用带有指令“think step by step”的 CoT 提示。除非另有说明,我们报告 GPQA 的平均 pass@8,AIME-25 的 32 次运行平均得分,以及 MMLU-Pro 和 HLE 的 pass@1。
对于表 2 中的多模态基准,我们使用不带显式推理指导的直接回答模板,并报告 pass@1。这些评估测试了改善语言推理的相同未标记视觉文档预训练信号是否也能迁移到多模态推理。
17
第 18 页
面向语言智能的可扩展视觉预训练
跨模态对齐分析。本段详细说明了表 2 中报告的跨模态对齐评估结果,并在图 1 中进行了定性可视化。
设置。我们构建了一组 $N=100$ 个匹配文档图像-文本对。每对样本通过将一个科学 PDF 页面渲染为 RGB 图像,并使用同一页面的 OCR 解析文本作为其文本对应部分来获得。这些样本对取自从公开可访问存储库收集的科学 PDF 预留测试集。
对于每对样本,图像由视觉通路处理,文本由共享主干网络的词元化器处理。我们从最后一个 Transformer 层收集隐藏状态,并对前景视觉词元和非填充文本词元进行平均池化,从而获得每个模态的一个嵌入。这产生了成对的嵌入
$$ \{(v_i, t_i)\}_{i=1}^N, $$
其中 $v_i$ 和 $t_i$ 表示同一文档页面的视觉和文本表示。该过程在视觉预训练(VP)前后均应用,从而实现表示对齐的直接比较。
指标定义。我们从三个互补的角度衡量对齐程度:全局距离、结构几何和局部邻域一致性。
全局对齐通过质心分离度和成对余弦相似度来衡量。质心分离度定义为
$$ \|\bar{v} – \bar{t}\|_2, $$
其中 $\bar{v} = \frac{1}{N} \sum_i v_i$ 和 $\bar{t} = \frac{1}{N} \sum_i t_i$ 是各模态的平均嵌入。成对余弦相似度计算如下
$$ \frac{1}{N} \sum_{i=1}^N \cos(v_i, t_i). $$
结构对齐通过线性中心核对齐(CKA)[14] 来衡量。令 $V, T \in \mathbb{R}^{N \times d}$ 表示视觉和文本表示的中心化嵌入矩阵。我们计算
$$ \text{CKA}(V, T) = \frac{\|V^\top T\|_F^2}{\|V^\top V\|_F \|T^\top T\|_F}. $$
线性 CKA 比较两个嵌入空间的相对几何结构,并且对正交变换和各向同性缩放具有不变性。
局部对齐通过相互 $k$-近邻重叠来衡量:
$$ A_k = \frac{1}{N} \sum_{i=1}^N |\mathcal{N}_V^k(i) \cap \mathcal{N}_T^k(i)|, $$
其中 $\mathcal{N}_V^k(i)$ 和 $\mathcal{N}_T^k(i)$ 分别是样本 $i$ 在视觉和文本嵌入空间中基于余弦距离的 $k$ 个最近邻。我们报告 $k \in \{1, 5, 10\}$。
发现。这三组指标提供了互补的证据,表明 VP 在不依赖图像-文本对监督的情况下改善了跨模态对齐。从全局来看,质心分离度从 1.665 下降到 0.661,降幅为 60%,而成对余弦相似度从 0.631 上升到 0.907。这表明配对的视觉和文本嵌入被拉近到表示空间中更兼容的区域。
从结构上看,线性 CKA 从 0.657 增加到 0.745,表明这种改善不仅仅是平均距离的变化,也是两种模态之间相对几何结构的变化。从局部来看,在所有测试的 $k$ 值下,相互 $k$-近邻重叠均有所改善,在最严格的设置下增益最大:$k=1$ 从 0.140 增加到 0.310,$k=5$ 从 0.288 增加到 0.420,$k=10$ 从 0.395 增加到 0.496。
这种模式反驳了平凡的表示坍缩。坍缩往往会均匀地增加邻域重叠,而 VP 在最细粒度的局部尺度上产生了最强的改善。综上所述,全局、结构和局部指标表明,视觉预训练重塑了共享表示空间,使得视觉和文本文档状态更加兼容。
18