面向语言智能的可扩展视觉预训练:直接预测视觉潜在以超越文本预训练

方法:视觉预训练(VP)核心机制

本文提出视觉预训练(VP),直接对原始科学文档图像进行自回归视觉潜在预测。实验显示,在相同语料源下,VP在GPQA等科学推理基准上显著优于文本预训练(TP),且跨模态对齐指标(如Centroid Separation)大幅改善。VP通过稀疏前景视觉表示保留页面结构,无需文本提取或配对监督。优势在视觉结构密度高的样本上最显著,纯文本主导样本上优势不明显。