面向语言智能的可扩展视觉预训练:直接预测视觉潜在以超越文本预训练
本文提出视觉预训练(VP),直接对原始科学文档图像进行自回归视觉潜在预测。实验显示,在相同语料源下,VP在GPQA等科学推理基准上显著优于文本预训练(TP),且跨模态对齐指标(如Centroid Separation)大幅改善。VP通过稀疏前景视觉表示保留页面结构,无需文本提取或配对监督。优势在视觉结构密度高的样本上最显著,纯文本主导样本上优势不明显。
本文提出视觉预训练(VP),直接对原始科学文档图像进行自回归视觉潜在预测。实验显示,在相同语料源下,VP在GPQA等科学推理基准上显著优于文本预训练(TP),且跨模态对齐指标(如Centroid Separation)大幅改善。VP通过稀疏前景视觉表示保留页面结构,无需文本提取或配对监督。优势在视觉结构密度高的样本上最显著,纯文本主导样本上优势不明显。
LingBot-Vision把边界从下游输出变成预训练信号,通过边界强制掩码和在线目标生成提升密集空间感知。本期查看深度、分割、视频对象分割和深度补全证据,同时讨论几何能力与全局语义分类之间的权衡。