快速导读:RP-OPSD利用同一图像的高/低分辨率视图构建教师-学生能力差距,通过在线自蒸馏提升多模态大模型在细粒度视觉任务上的性能,同时实现1.78倍训练加速。
多模态大语言模型(MLLMs)的性能高度依赖输入图像的分辨率。当图像分辨率降低时,细粒度视觉线索(如小物体、文本)丢失,导致模型性能显著下降。这种由分辨率引起的能力差距(Resolution-induced capability gap)限制了模型在资源受限场景下的应用。
传统知识蒸馏方法存在训练与推理分布偏移的问题,而在线自蒸馏(On-Policy Self-Distillation, OPSD)虽能解决此问题,但构建有效的特权信息(Privileged Information)在多模态场景中极具挑战。现有方法依赖外部模型生成解释或手动标注视觉证据,导致后训练成本高且难以扩展。
英文题目:RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models
论文出处:arXiv 每日论文精选 · arXiv:2607.24447
原始论文:PDF / 论文页面
对应视频标题:RP-OPSD:如何用分辨率差异免费提升多模态大模型性能?|推荐指数:★★★★★
这篇论文解决什么问题?
MLLMs对输入图像分辨率敏感,降低分辨率会导致细粒度视觉线索丢失,产生显著的性能下降。例如,在Qwen3.5-9B Base模型上,将图像宽高减半会导致平均性能下降6.21分。这种性能差距在细粒度视觉任务(如OCR、小物体检测)中尤为明显。
传统知识蒸馏方法通常使用离线生成的教师模型输出作为监督信号,这导致训练分布与推理分布不一致。OPSD方法通过在线生成轨迹来解决分布偏移问题,但如何构建有效的特权信息是关键挑战。现有OPSD方法依赖外部模型生成多模态解释或使用区域裁剪作为特权信息,这些方法成本高且难以扩展。
此外,现有方法在构建特权信息时往往需要额外的标注或外部模型,这增加了训练复杂度和成本。例如,OmniOPSD使用外部模型生成多模态解释,成本较高;Vision-OPD使用区域裁剪作为特权信息,但效果有限。因此,寻找一种无需外部标注、低成本且高效的特权信息构建方法至关重要。
核心创新
- 利用分辨率差异作为天然的特权信息来源,无需额外标注或外部模型。
- 提出偏置校正的教师Top-K反向KL目标,解决截断偏差并聚焦于教师高置信度Token。
- 结合EMA教师更新策略,在保持训练目标稳定性的同时跟随学生进步。
- 实现训练效率提升,低分辨率学生输入显著降低计算成本。
方法概览
提出RP-OPSD框架:使用低分辨率图像(1/2宽高)作为学生策略输入以生成在线轨迹,使用原始分辨率图像作为教师策略输入以提供Token级分布监督。通过偏置校正的教师Top-K反向KL散度(Bias-Corrected Teacher-Top-K Reverse KL)优化学生,并利用指数移动平均(EMA)更新教师参数,实现无需外部标注的自蒸馏。
- RP-OPSD框架利用同一图像的高/低分辨率视图构建教师-学生能力差距。学生模型使用低分辨率图像(1/2宽高)生成在线轨迹,教师模型使用原始分辨率图像评估相同生成的前缀,并提供Token级分布监督。
- 通过偏置校正的教师Top-K反向KL散度(Bias-Corrected Teacher-Top-K Reverse KL)优化学生模型。该方法解决截断偏差并聚焦于教师高置信度Token,确保学生模型学习到更准确的视觉-语言对齐。
- 利用指数移动平均(EMA)更新教师参数,实现无需外部标注的自蒸馏。EMA策略在保持训练目标稳定性的同时跟随学生进步,避免教师模型过时或过度拟合。
- 低分辨率学生输入显著降低计算成本,实现训练效率提升。通过减少视觉Token数量,RP-OPSD在相同硬件和数据下实现1.78倍训练加速。
逐图理解论文
直觉与失败:细粒度线索的丢失

该图展示了RP-OPSD在细粒度OCR任务上的优势。目标裁剪使定位要求明确,预测比较显示RP-OPSD解析了小查询标签,而Base模型未能正确识别。
核心贡献:分辨率特权自蒸馏

该图概述了RP-OPSD框架。学生模型使用低分辨率图像生成在线轨迹,教师模型使用原始分辨率图像评估相同生成的前缀,并提供Token级分布监督。通过偏置校正的教师Top-K反向KL目标优化学生,并利用EMA更新教师参数。
最强结论:性能与效率的双重提升

该表展示了RP-OPSD在Qwen3.5-9B和Qwen3.5-4B上的主要结果。RP-OPSD在平均性能上显著超越Base、SFT、GRPO、OPSD和Vision-OPD基线,证明其有效性。
实验如何设计?
- 在Qwen3.5-9B和Qwen3.5-4B上评估,涵盖V*Bench, HR-Bench, MME-RealWorld, VisualProbe, MMVP, MMStar, POPE等基准。
- 对比基线包括Base, SFT, GRPO, OPSD, Vision-OPD。
- 进行消融实验:蒸馏目标(GSD, Forward KL, Reverse KL, Bias-Corrected RKL)、教师更新策略(Frozen vs EMA)、学生输入分辨率(1/3, 1/4, 1/2, 1/2->1 canvas)。
关键结果与论文证据
- RP-OPSD在Qwen3.5-9B上平均性能达到80.43,相比Base模型提升4.16分(页6)。
- 在Qwen3.5-4B上平均性能达到78.35,相比Base模型提升4.63分(页6)。
- 在半分辨率评估下,RP-OPSD平均性能提升6.09分(71.45 -> 77.54)(页6)。
- 在VisualProbe任务上,半分辨率下性能提升14.90分(页6)。
- 训练效率提升1.78倍(13.93h -> 7.83h)(页7)。
阅读时需要注意
- 主要依赖分辨率差异,对于不依赖细粒度视觉细节的任务提升有限。
- 过度下采样(如1/4宽高)会削弱视觉证据,导致性能下降。
- 恢复画布尺寸(1/2->1)无法恢复丢失的视觉细节,效果不如直接半分辨率训练。
关联工作
- OPSD (Zhao et al. 2026) 使用答案提示作为特权信息,RP-OPSD在平均性能上超越其0.63分(页5)。
- Vision-OPD (Yuan et al. 2026) 使用区域裁剪作为特权信息,RP-OPSD在平均性能上超越其1.44分(9B)(页5)。
- OmniOPSD (Cheng et al. 2026) 使用外部模型生成多模态解释,成本较高,RP-OPSD无需外部生成(页3)。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
RP-OPSD:面向多模态大语言模型的分辨率特权在线自蒸馏
朱启辉1∗,王雨辰1∗,文子健1,张涛1,张梦杰1,刘洋2, 陈双武1†,吴思颖1,杨健1,蒋晓峰1 1中国科学技术大学 2长鑫存储技术有限公司
摘要 在线自蒸馏(On-Policy Self-Distillation, OPSD)利用仅教师可用的特权信息,对学生生成的轨迹提供密集的令牌级监督。然而,现有方法通常依赖于经过验证的解轨迹、由外部模型生成的解释或人工定位的视觉证据,这限制了其在多模态大语言模型中的可扩展应用。为解决这一问题,我们利用同一图像的高分辨率与低分辨率视图之间的信息差,提出了 RP-OPSD(Resolution-Privileged On-Policy Self-Distillation,面向多模态大语言模型的分辨率特权在线自蒸馏)。在训练过程中,学生策略从四分之一原始分辨率的图像生成在线轨迹,而教师策略则提供基于原始分辨率图像输出分布的监督。通过最小化学生轨迹上两者输出分布之间的散度,学生学习到教师在高分辨率输入下的预测行为,从而增强其低分辨率能力,并将所学改进迁移至原始分辨率推理。RP-OPSD 既不需要额外的人工标注,也不需要外部模型来生成解轨迹,仅需图像-问题对。在 Qwen3.5-9B 上的实验表明,RP-OPSD 在原始分辨率下的平均性能提升了 5.45%,且训练速度较 OPSD 提升了 1.78 倍。这些结果表明,分辨率差异可以作为一种简单且可扩展的特权信息来源,为多模态大语言模型的在线自蒸馏提供了一种有效且高效的方法。
代码 — https://github.com/sansanyuchen/RP-OPSD
1 引言 多模态大语言模型(Multimodal Large Language Models, MLLMs)的最新进展显著提升了视觉问答、文档理解、图表分析和多模态问题解决能力 (Liu et al. 2023; Wang et al. 2024a)。近期开源权重的系统,如 Qwen3-VL (Bai et al. 2025) 和 InternVL3.5 (Wang et al. 2025),进一步加强了多模态推理和高效视觉处理能力。然而,高效的后期训练仍然具有挑战性。现有方法主要包括监督微调、具有可验证奖励的强化学习以及知识蒸馏 (Hinton, Vinyals, and Dean 2015; Shao et al. 2024)。
监督微调从高质量演示中学习,但其固定的训练轨迹可能与推理时生成的轨迹不同,导致分布偏移和暴露偏差 (Agarwal et al. 2024)。强化学习使用模型生成的轨迹,但稀疏的序列级奖励提供的令牌级反馈有限,而针对每个提示采样多个响应成本高昂 (Shao et al. 2024; Huang et al. 2025; Shen et al. 2025)。知识蒸馏从教师的输出分布提供密集监督,但其对离线轨迹的依赖导致了类似的训练-推理不匹配 (Agarwal et al. 2024)。
在线蒸馏(On-Policy Distillation, OPD)允许学生策略生成自身的轨迹,而教师策略则在学生访问的状态下提供令牌级监督 (Agarwal et al. 2024; Lu and Thinking Machines Lab 2025)。通过在上述轨迹上匹配两者的输出分布,OPD 结合了在线学习和密集监督的优势。然而,传统的 OPD 通常依赖于一个独立且更强的教师模型,并要求兼容的输出空间或模型架构,这限制了其在大规模模型后期训练中的应用。
在线自蒸馏(On-Policy Self-Distillation, OPSD)进一步消除了对外部教师模型的需求 (Zhao et al. 2026; Shenfeld et al. 2026; Hübotter et al. 2026)。它在不同的输入条件下使用同一模型作为学生和老师。学生
Figure 1: Qwen3.5-Jul 9B Base 在五个多模态基准测试上的分辨率诱导能力差距。图像宽度和高度减半导致平均性能下降 6.21 个百分点。
89.36 90 84.82 84.75 82.07 87.83 80 79.25 80.27 70 Score 60 69.63 50 41.85 40 34.81 1/4 Original pixels resolution 30 VisualProbe V*Bench HR-Bench 4K MMStar POPE2026
† 通讯作者。
- 这些作者贡献相同。
第 2 页
生成轨迹而不需要额外信息,同时利用高分辨率推理。教师模型使用经过验证的解决方案、专家演示或丰富的环境反馈作为训练时的特权信息,以提供词元级别的监督。通过这种方式,OPSD 结合了在线轨迹、密集反馈和自监督,使模型能够利用其现有能力进行改进。
尽管 OPSD 在需要多步推理的语言任务中展现出潜力 (Zhao et al. 2026; Shenfeld et al. 2026; Hübotter et al. 2026),但将其扩展到多模态大语言模型仍然具有挑战性,因为必须为教师模型构建有效的特权信息。现有方法通常使用参考答案、经过验证的解决方案轨迹或上下文示例,这些方法非常适合具有明确答案的文本任务。然而,多模态模型中的错误可能源于漏检物体、丢失视觉细节、定位不准确或跨模态连接薄弱,这通常还需要额外的区域标注、多模态解释或证据定位。OmniOPSD 使用外部模型生成多模态解决方案证据 (Cheng et al. 2026),而 Vision-OPD 通过裁剪相关图像区域为教师模型构建局部特权视图 (Yuan et al. 2026)。尽管这些方法证明了在不同视觉条件下教师-学生自蒸馏的可行性,但它们依赖外部生成、物体识别、区域分割或局部裁剪,增加了数据构建和质量控制的成本。此外,额外的上下文并不总是提供有效的教师信号,因为 OPD 的性能也可能取决于教师选择、学生能力和监督上下文 (Ma et al. 2026)。因此,构建简单且有效的特权信息仍然是将 OPSD 扩展到多模态大语言模型的关键挑战。
基于这一观察和假设,我们提出了 RP-OPSD,一种用于多模态大语言模型的分辨率特权在线自蒸馏框架。给定原始图像,我们从同一个多模态模型实例化两个在不同视觉条件下运行的策略。学生策略接收低分辨率图像及其对应的问题作为输入,并从当前策略中采样在线响应。教师策略则使用原始分辨率图像作为特权视觉视图,并对学生生成的轨迹提供监督。RP-OPSD 不仅仅将分辨率导致的能力差距视为低分辨率鲁棒性问题,而是利用这种差距来构建 OPSD 所需的非对称教师-学生条件。由于这种非对称性直接源自同一输入的两个分辨率,优化过程仅需图像-查询对,不依赖标注答案、外部生成的推理轨迹或局部视觉证据。这种设计大幅降低了构建特权信息的成本,并可轻松应用于现有的多模态数据。我们在 Qwen3.5-4B 和 Qwen3.5-9B 上,在一系列广泛使用的多模态基准上评估了 RP-OPSD。在半分辨率评估下,RP-OPSD 使 Qwen3.5-9B 的平均性能提升了 6.09 分。与代表性的后训练方法和最先进的多模态 OPSD 基线相比,RP-OPSD 在原始分辨率设置下实现了最大的平均性能提升,在 Qwen3.5-4B 和 Qwen3.5-9B 上的平均相对提升分别为 6.28% 和 5.45%。跨分辨率的一致改进共同支持了我们的假设。此外,在 Qwen3.5-9B 上的效率分析显示,RP-OPSD 相比 OPSD 实现了 1.78 倍的训练加速。
这些局限性促使我们寻求一种具有三个期望特性的更简单的特权信息来源:它应在教师和学生之间产生有意义的能力差距,保留其输入的语义内容,且既不需要外部模型也不需要额外标注。图像分辨率自然满足这些要求。给定相同的图像和问题,多模态大语言模型可能会从原始分辨率图像中产生正确答案,但从其下采样版本中产生错误答案。我们将这种现象称为分辨率诱导的能力差距。如图 1 所示,当输入图像的宽度和高度均减小为原始尺寸的一半时,Qwen3.5-9B Base (Qwen Team 2026) 在五个基准测试上的平均性能下降了 6.21 分。在 V*Bench (Wu and Xie 2024) 上,性能下降幅度达到 15.19 分。这种差距的产生是因为原始分辨率图像保留了更多关于局部纹理、文本和小物体的完整信息,而下采样则以不同程度削弱了这些视觉线索。因此,我们提出使用原始分辨率教师来监督低分辨率学生生成的轨迹。这种监督首先提高了模型在有限视觉证据下的能力。由于教师和学生共享相同的模型参数,由此产生的改进可以进一步迁移到原始分辨率推理中,无需额外信息,同时利用高分辨率推理。
总之,我们的主要贡献如下: • 我们提出了 RP-OPSD,一种分辨率特权在线自蒸馏框架,其中原始分辨率教师通过词元级别分布匹配监督低分辨率学生在学生轨迹上的表现。 • RP-OPSD 直接从图像-查询对构建特权监督,无需额外标注或外部模型,实现了简单且可扩展的多模态 OPSD。 • 在两个模型规模和多个多模态基准上的综合实验验证了 RP-OPSD 的有效性和效率。
2 相关工作
多模态大语言模型 (MLLMs) 通常通过视觉编码器和模态连接器将视觉表示映射到大语言模型的语义空间,并通过多模态预训练和指令微调获得视觉理解和跨模态推理能力。最近具有代表性的模型包括 Qwen3-VL (Bai et al. 2025)、InternVL3.5 (Wang et al.
第 3 页
教师策略 教师分布 πθ̄ pTt(· | xH, q, y<t) 停止梯度
特权蒸馏损失 EMA更新 前缀 y<t 问题 q 时钟上显示的时间是?
学生策略 在线学生分布 πθ 轨迹 y pSt(· | xL, q, y<t) 1/4 像素 梯度
图2:RP-OPSD概览。我们首先使用低分辨率学生从下采样图像生成在线轨迹。然后,原始分辨率教师评估相同的生成前缀,并提供具有更丰富视觉证据的令牌级分布目标。我们使用偏置校正的教师Top-K反向KL散度目标优化学生,并通过指数移动平均更新教师,从而实现无需外部教师或额外标注的自蒸馏。
2025),以及GLM-4.5V(Team et al. 2026),在视觉问答、文档理解、细粒度视觉感知和复杂多模态推理方面取得了显著进展,这得益于大规模且多样化的多模态预训练,以及视觉-语言对齐、跨模态特征融合、动态分辨率处理和多阶段后训练方面的持续进步。然而,它们的性能仍然对输入图像的质量和分辨率敏感。降低图像分辨率会削弱细粒度视觉线索,如文本、小物体和局部纹理,导致对同一图像-问题对的理解和推理能力下降。这种敏感性表明,不同的输入分辨率不仅影响模型性能,还可能在同一模型内部产生自然的能力差距,为多模态自蒸馏中建立教师-学生条件提供了一种新途径。
在线蒸馏 传统的知识蒸馏在固定轨迹上对齐教师和学生的输出分布(Hinton, Vinyals, and Dean 2015),这可能导致训练和推理之间的状态分布不匹配。在线策略蒸馏(OPD)通过允许学生生成自己的轨迹,同时教师对学生实际访问的状态提供令牌级监督来解决这个问题(Agarwal et al. 2024; Lu and Thinking Machines Lab 2025)。OPD结合了在线策略采样和密集反馈,但通常依赖于一个单独且更强的教师模型。在线策略自蒸馏(OPSD)进一步在不同的上下文中将同一模型实例化为教师和学生(Zhao et al. 2026; Shenfeld et al. 2026; Hübotter et al. 2026)。教师使用经过验证的解决方案、专家演示或丰富的环境反馈作为特权信息来监督学生生成的轨迹,从而消除了对外部教师模型的依赖。
在多模态设置中,OmniOPSD使用外部模型生成的多模态解释作为教师侧特权信息(Cheng et al. 2026),而Vision-OPD使用裁剪的证据区域来监督基于全图的学生(Yuan et al. 2026)。这些方法需要额外的解释生成或区域构建。相比之下,RP-OPSD直接使用同一图像的原始分辨率和下采样视图来创建不对称的教师-学生条件。它不需要外部生成、区域标注或问题合成,提供了一种更简单且可扩展的构建特权信息的方式。
3 方法 我们提出了RP-OPSD,这是一种用于多模态大语言模型(MLLMs)的分辨率特权在线策略自蒸馏框架。如图2所示,低分辨率学生首先生成在线轨迹。高分辨率教师随后在相同的生成前缀上提供令牌级分布监督,学生通过与教师选择的分布匹配进行优化。
分辨率特权公式 给定原始分辨率图像 xH 和视觉问题 q,我们构建低分辨率视图为 xL = R1/2(xH), (1) 其中 R1/2 将图像的宽度和高度均减半。因此,xL 包含大约四分之一的原始像素。这两个视图包含相同的场景和视野,没有裁剪、区域标注或额外的位置提示。这种对齐的设置允许我们使用
第 4 页
xH 中可用的视觉细节作为高分辨率教师所偏好的 token 的特权信息。RP-OPSD 使用具有相同模型架构的低分辨率学生和高分辨率教师: πLθ (· | xL, q), πHϕ (· | xH, q). (2) 我们从 xL 中学习。在每个 token 位置,我们定义教师选择的支撑集为 SKg,t = TopKv∈V rg,t(v). (7) 我们将学生和教师的概率收集在相同的 token 索引上。这些值保持为其原始全词汇 softmax 分布的概率:我们不在 SKg,t 内重新归一化它们,也不添加单独的尾部桶。从教师选择支撑集确保了比较覆盖了由特权视觉输入最强支持的 token。
简单地将对反向 KL 的限制限制在教师选择的 Top-K 支撑集中会引入截断偏差,因为保留的概率质量之和不等于一。遵循 MOPD (Ma et al. 2026) 中的 top-k 蒸馏目标,我们定义偏置校正的教师 Top-K 反向 KL 为 " pg,t(v) dK(pg,t∥rg,t) = X pg,t(v) log rg,t(v) v∈SKg,t (8) # −pg,t(v) + rg,t(v) .
修正项 −pg,t(v) + rg,t(v) 校正了这种 Top-K 截断偏差,确保当学生在保留的支撑集上与教师匹配时,梯度变为零。这在不比较全词汇的情况下保留了所需的优化行为。
在这种同步的单更新设置下,我们不应用额外的 rollout 策略重要性重加权。令 mg,t ∈{0, 1} 表示响应掩码,它排除提示和填充 token。最终的 RP-OPSD 目标为 X mg,tdK(pg,t∥rg,t) LRP-OPSD = E g,t (9) X mg,t . g,t
期望是在训练示例和从 rollout 策略采样的响应上进行的。该目标为低分辨率学生访问的状态提供了密集的分布级监督。RP-OPSD 不使用答案级奖励、监督目标响应或单独的参考策略。多次 rollout 用于覆盖多样化的学生状态,而不是为了执行基于组的奖励优化。
算法 1 总结了 RP-OPSD 的完整训练过程。
4 实验 实验设置 训练设置。我们将 RP-OPSD 应用于 Qwen3.5-4B 和 Qwen3.5-9B (Qwen Team 2026)。训练集包含从 Vision-SR1 (Li et al. 2026)、VLM-CapCurriculum Perception (Wu et al. 2026)、ZwZ-RL-VQA (Wei et al. 2026) 和 Vision-OPD (Yuan et al. 2026) 中抽取的 5.2K 个样本,详见补充材料中的训练数据部分。教师接收原始图像,而
第 5 页
算法 1:RP-OPSD 的训练流程。图像。我们尽可能使用基于规则的解析;其余回复由 Qwen3.5-9B (Qwen 团队 2026) LLM 裁判使用其默认解码设置进行评估。基线。我们将 RP-OPSD 与 Base、SFT、GRPO、OPSD 和 Vision-OPD 进行比较。Base 表示未经后训练的原始 Qwen3.5 模型,用于衡量训练带来的整体增益。SFT 使用原始图像和真实答案,并在助手 token 上最小化交叉熵。GRPO (Shao 等人 2024) 为每张原始分辨率图像采样八个回复,并使用二元正确性奖励计算组相对优势。OPSD (Zhao 等人 2026) 向学生和教师呈现相同的原始图像,同时通过从真实答案构建的答案提示增强教师提示。随后,教师对学生在线策略回复提供 token 级别的蒸馏信号。SFT、GRPO、OPSD 和 RP-OPSD 均使用相同的 5.2K 训练样本。Vision-OPD (Yuan 等人 2026) 执行区域到全局的自蒸馏,其中教师接收证据裁剪图像,学生接收带有边界框标注的全图。我们使用其官方实现复现了 Vision-OPD。
主要结果
如表 1 所示,RP-OPSD 在两种模型规模下均取得了最高的平均分数。对于 9B 模型,RP-OPSD 达到 80.43,分别优于 Base、Vision-OPD 和 OPSD 4.16、1.44 和 0.63 分。对于 4B 模型,相应的提升分别为 4.63、1.03 和 0.61 分。这些结果表明 RP-OPSD 的收益在不同模型规模上具有泛化性。
与 Base 相比,9B RP-OPSD 在 V*Bench、VisualProbe、MME-RW EN/CN 和 HR-Bench 4K/8K 上分别提升了 6.28、15.12、5.51/5.17 和 1.75/2.62 分。4B 模型在 MME-RW EN/CN 和 VisualProbe 上分别提升了 12.36、8.62 和 11.15 分。同时,9B 模型在 MMVP、MMStar 和 POPE 上分别提升了 0.33、0.60 和 0.07 分,这表明细粒度感知能力的提升并未以牺牲通用视觉能力为代价。相对于 OPSD,RP-OPSD 将平均分提升了 0.63 分,并在 VisualProbe 和 MMStar 上分别取得了 7.00 和 1.27 分的增益。这一结果表明,分辨率特权蒸馏有效地增强了细粒度视觉搜索和通用视觉感知能力。
低分辨率能力分析
如表 2 所示,RP-OPSD 在低分辨率评估下的所有五个基准测试中均有提升,平均分数从 71.45 提高到 77.54。最大的增益出现在 VisualProbe 和 V*Bench 上,RP-OPSD 分别使基线模型提升了 14.90 和 12.05 分。这些基准测试强调细微的视觉细节和定向视觉搜索,表明来自原始分辨率教师的监督使学生能够更好地利用有限的视觉证据。
结合表 1 中的原始分辨率结果,这些发现支持我们的核心假设:RP-OPSD 直
算法 1:RP-OPSD 的训练流程。图像。我们尽可能使用基于规则的解析;其余回复由 Qwen3.5-9B (Qwen 团队 2026) LLM 裁判使用其默认解码设置进行评估。 要求:训练集 $D = \{(x_{Hi}, q_i)\}$;预训练参数 $\theta_0$; rollout 次数 $G$;支持集大小 $K$;EMA 率 $\rho$ 确保:训练好的学生策略 $\pi^L_\theta$ 1: 初始化学生、教师和 rollout 参数:$\theta \leftarrow \theta_0, \phi \leftarrow \theta_0, \theta^- \leftarrow \theta_0$ 2: for each minibatch $B \subset D$ do 3: for each $(x_H, q) \in B$ do 4: 构建低分辨率视图 $x_L \leftarrow R_{1/2}(x_H)$ 5: 采样 $G$ 个回复 $y^{(g)} \sim \pi^L_{\theta^-}(\cdot | x_L, q)$ 6: for each response $y^{(g)}$ and token position $t$ do 7: 使用 $(x_L, q, y^{(g)}_{<t})$ 计算学生分布 $p_{g,t}$ 8: 使用 $(x_H, q, y^{(g)}_{<t})$ 计算停止梯度的教师分布 $r_{g,t}$ 9: 选择教师选定的 top-K 支持集 $S^K_{g,t} \leftarrow \text{TopK}(r_{g,t})$ 10: 使用公式 (8) 计算偏置校正的教师 Top-K 反向 KL $d_K(p_{g,t} \| r_{g,t})$ 11: end for 12: end for 13: 使用公式 (9) 计算 $L_{\text{RP-OPSD}}$ 14: 更新学生:$\theta \leftarrow \theta – \eta \nabla_\theta L_{\text{RP-OPSD}}$ 15: 更新教师:$\phi \leftarrow (1 – \rho)\phi + \rho\theta$ 16: 同步 rollout 策略:$\theta^- \leftarrow \theta$ 17: end for 18: return $\pi^L_\theta$
图像。我们尽可能使用基于规则的解析;其余回复由 Qwen3.5-9B (Qwen 团队 2026) LLM 裁判使用其默认解码设置进行评估。 基线。我们将 RP-OPSD 与 Base、SFT、GRPO、OPSD 和 Vision-OPD 进行比较。Base 表示未经后训练的原始 Qwen3.5 模型,用于衡量训练带来的整体增益。SFT 使用原始图像和真实答案,并在助手 token 上最小化交叉熵。GRPO (Shao 等人 2024) 为每张原始分辨率图像采样八个回复,并使用二元正确性奖励计算组相对优势。OPSD (Zhao 等人 2026) 向学生和教师呈现相同的原始图像,同时通过从真实答案构建的答案提示增强教师提示。随后,教师对学生在线策略回复提供 token 级别的蒸馏信号。SFT、GRPO、OPSD 和 RP-OPSD 均使用相同的 5.2K 训练样本。Vision-OPD (Yuan 等人 2026) 执行区域到全局的自蒸馏,其中教师接收证据裁剪图像,学生接收带有边界框标注的全图。我们使用其官方实现复现了 Vision-OPD。
主要结果
如表 1 所示,RP-OPSD 在两种模型规模下均取得了最高的平均分数。对于 9B 模型,RP-OPSD 达到 80.43,分别优于 Base、Vision-OPD 和 OPSD 4.16、1.44 和 0.63 分。对于 4B 模型,相应的提升分别为 4.63、1.03 和 0.61 分。这些结果表明 RP-OPSD 的收益在不同模型规模上具有泛化性。
与 Base 相比,9B RP-OPSD 在 V*Bench、VisualProbe、MME-RW EN/CN 和 HR-Bench 4K/8K 上分别提升了 6.28、15.12、5.51/5.17 和 1.75/2.62 分。4B 模型在 MME-RW EN/CN 和 VisualProbe 上分别提升了 12.36、8.62 和 11.15 分。同时,9B 模型在 MMVP、MMStar 和 POPE 上分别提升了 0.33、0.60 和 0.07 分,这表明细粒度感知能力的提升并未以牺牲通用视觉能力为代价。相对于 OPSD,RP-OPSD 将平均分提升了 0.63 分,并在 VisualProbe 和 MMStar 上分别取得了 7.00 和 1.27 分的增益。这一结果表明,分辨率特权蒸馏有效地增强了细粒度视觉搜索和通用视觉感知能力。
低分辨率能力分析
如表 2 所示,RP-OPSD 在低分辨率评估下的所有五个基准测试中均有提升,平均分数从 71.45 提高到 77.54。最大的增益出现在 VisualProbe 和 V*Bench 上,RP-OPSD 分别使基线模型提升了 14.90 和 12.05 分。这些基准测试强调细微的视觉细节和定向视觉搜索,表明来自原始分辨率教师的监督使学生能够更好地利用有限的视觉证据。
结合表 1 中的原始分辨率结果,这些发现支持我们的核心假设:RP-OPSD 直
第 6 页
表1:Qwen3.5-9B和Qwen3.5-4B上的主要结果。所有方法均在原始分辨率图像上进行评估。Avg.是九个报告指标的非加权平均值。粗体表示每个模型规模内的最佳结果。
MME-RW MME-RW 视觉 模型 V∗ HR-4K HR-8K EN CN Probe MMVP MMStar POPE Avg.
Qwen3.5-9B Base 84.82 84.75 81.50 71.40 67.67 41.85 83.00 82.07 89.36 76.27 SFT 91.10 87.88 83.62 73.25 71.54 51.25 83.67 78.93 89.74 79.00 GRPO 88.48 84.50 81.50 75.72 71.81 50.38 84.33 80.73 89.09 78.50 OPSD 91.10 86.88 84.25 78.12 74.43 49.97 83.00 81.40 89.08 79.80 Vision-OPD 85.86 86.62 85.12 73.40 70.46 56.84 81.33 81.53 89.79 78.99 RP-OPSD 91.10 86.50 84.12 76.91 72.84 56.97 83.33 82.67 89.43 80.43
Qwen3.5-4B Base 84.29 84.38 80.13 64.20 63.80 43.22 76.67 78.53 88.28 73.72 SFT 87.96 85.75 80.00 71.24 69.17 48.53 78.00 68.60 89.43 75.41 GRPO 84.82 81.88 78.38 72.15 70.27 52.23 82.33 72.27 85.63 75.55 OPSD 86.39 85.50 80.12 76.75 74.72 48.78 82.00 76.67 88.70 77.74 Vision-OPD 87.96 82.62 81.75 74.70 70.46 54.95 77.00 77.40 89.10 77.33 RP-OPSD 87.96 85.50 82.00 76.56 72.42 54.37 78.33 79.07 88.98 78.35
表2:Qwen3.5-9B和RP-OPSD在教师更新策略下的性能。表4比较了使用固定为初始参数的教师的EMA教师与半分辨率评估。Avg.是五个报告指标的非加权平均值,∆表示相对于Base的提升。所有指标越高越好。粗体表示每行中更好的分数。
基准 Qwen3.5-9B RP-OPSD ∆ 在HR-Bench 8K上,EMA教师平均达到82.73,比冻结教师高出0.51分,在HR-Bench 8K、VisualProbe和MMStar上分别提升了1.12、4.58和0.67分。虽然冻结教师在V∗Bench、MMVP和CV-Bench上略好,但EMA提供了更强的平均和细粒度性能。 VisualProbe 34.81 49.71 +14.90 V∗Bench 69.63 81.68 +12.05 HR-Bench 4K 79.25 82.00 +2.75 POPE 87.83 88.39 +0.56 CV-Bench 85.75 85.94 +0.19 Avg. 71.45 77.54 +6.09
学生输入分辨率 表5仅改变学生分辨率;教师和评估保留原始分辨率图像。1/2 →1设置将两个维度减半,然后恢复原始画布大小,从而使我们能够将丢失的图像细节与输入画布的变化区分开来。 将两个维度减半可获得82.73的最佳平均分。将维度缩小三倍和四倍会使平均分降低0.80和2.56分,表明激进的降采样会削弱可用于迁移的视觉证据。1/2 →1设置仅达到81.85,低于半分辨率训练,证实恢复画布无法恢复丢失的视觉细节。
消融研究与分析 蒸馏目标的选择 表3比较了直接GSD (Agarwal et al. 2024)、前向KL、标准反向KL和偏置校正的教师Top-100反向KL,以检查令牌级蒸馏目标和Top-K截断偏差校正如何影响性能。我们使用Qwen3.5-9B,为GSD设置α = 0.5,并保持所有其他训练和评估设置固定。 偏置校正的教师Top-100反向KL目标实现了82.73的最高平均分,分别比标准反向KL和GSD高出1.14和0.37分。相对于标准反向KL,它在V∗Bench、HR-Bench 8K和VisualProbe上分别提升了2.09、1.37和3.18分。这些结果支持在蒸馏仅限于教师选择的词汇支持时纠正Top-K截断偏差。因此,我们在后续实验中采用此目标。
训练效率 表6在相同的数据、训练步骤、批量大小、rollouts和硬件下比较OPSD和RP-OPSD,隔离学生输入分辨率的影响。 设nH为原始分辨率的视觉令牌数量;将图像的两个维度减半得到nL = nH/4。设Cg(n)和Cf(n)分别表示一次rollout和一次完整序列前向传播。对于G次rollouts和3Cf(n)的前向-反向近似,OPSD的成本为 FOPSD ≃G[Cg(nH) + 4Cf(nH)] . (10) 而RP-OPSD的成本为 FRP ≃G[Cg(nH/4) + 3Cf(nH/4) + Cf(nH)] . (11)
第 7 页
表3:蒸馏目标的消融实验。所有目标均使用教师选定的Top-100支持集;RKL表示反向KL散度。Avg.为八个指标的未加权均值。粗体标记每列的最佳结果;若涉及默认设置的并列情况,仅对默认设置加粗。
视觉设置 V* HR-4K HR-8K Probe MMVP CV-Bench MMStar POPE Avg.
GSD Top-100 91.10 86.38 82.38 55.89 83.33 87.91 82.47 89.42 82.36 Forward Top-100 KL 90.05 85.62 81.88 53.84 82.33 87.61 83.40 89.39 81.77 Reverse Top-100 KL 89.01 87.25 82.75 53.79 82.33 87.86 80.80 88.93 81.59 Bias-Corrected RKL (Ours) 91.10 86.50 84.12 56.97 83.33 87.73 82.67 89.43 82.73
表4:教师更新策略的消融实验。Avg.为八个指标的未加权均值。粗体标记每列的最佳结果;若涉及默认设置的并列情况,仅对默认设置加粗。
视觉设置 V* HR-4K HR-8K Probe MMVP CV-Bench MMStar POPE Avg.
Frozen Initial Teacher 91.62 86.50 83.00 52.39 84.33 88.23 82.00 89.69 82.22 EMA Teacher (Ours) 91.10 86.50 84.12 56.97 83.33 87.73 82.67 89.43 82.73
表5:学生训练分辨率的消融实验。教师和评估使用原始分辨率图像。Avg.为八个指标的未加权均值。粗体标记每列的最佳结果;若涉及默认设置的并列情况,仅对默认设置加粗。
视觉设置 V* HR-4K HR-8K Probe MMVP CV-Bench MMStar POPE Avg.
1/3 width/height 91.62 86.75 83.12 55.38 82.67 86.55 80.93 88.40 81.93 1/4 width/height 89.01 85.12 82.75 55.21 79.00 85.85 79.87 84.57 80.17 1/2 →1 canvas 91.10 86.88 83.25 51.82 82.00 87.66 82.27 89.82 81.85 1/2 width/height (Ours) 91.10 86.50 84.12 56.97 83.33 87.73 82.67 89.43 82.73
表6:在相同数据、批次大小80.43、每次输入的回溯次数(8)以及硬件(8× NVIDIA H20 GPU)条件下的训练效率。因此,低分辨率学生输入在不牺牲原始分辨率性能的情况下降低了训练成本。加速比为 TOPSD/Tmethod;Full 和 Half 分别表示输入分辨率。加速比仅涵盖训练,不包括评估。
主要方法 学生 教师 时间 (h) 加速比 Avg. OPSD Full Full+hint 13.93 1.00× 79.80 RP-OPSD Half Full 7.83 1.78× 80.43
5 结论
我们引入了 RP-OPSD,这是一种在线自蒸馏(On-Policy Self-Distillation, OPSD)框架,利用同一图像原始视图和低分辨率视图之间产生的能力差距作为多模态大语言模型(Multimodal Large Language Models, MLLMs)的特权监督。低分辨率学生生成在线轨迹,而原始分辨率的指数移动平均(Exponential Moving Average, EMA)教师利用更丰富的视觉证据,在相同前缀上提供令牌级分布目标。
令 $\Delta C_g = C_g(n_H) – C_g(n_H/4)$ 并类似地定义 $\Delta C_f$。它们的差距为 $$ F_{OPSD} – F_{RP} \simeq G(\Delta C_g + 3\Delta C_f) > 0. \quad (12) $$
因子三近似于学生前向-反向计算。由于 $n_L = n_H/4$,线性视觉项降至四分之一,二次自注意力项降至十六分之一。在我们的设置中,文本令牌远少于视觉令牌,因此我们在FLOPs估计中省略了它们的贡献。共享的原始分辨率教师抵消了公式(12)中的项,仅留下回溯和学生更新的节省。该估计在非视觉教师上下文固定且省略系统开销的情况下成立,而系统开销由挂钟测量捕获。
RP-OPSD 将训练时间从 13.93 小时降低至 7.83 小时(1.78×),同时将主表平均值从 79.80 提升至 80.43。RP-OPSD 仅需图像-查询对,无需额外的答案标注、外部教师模型、生成的解决方案轨迹或局部视觉证据。在 Qwen3.5-4B 和 Qwen3.5-9B 上,RP-OPSD 在相比的后训练方法中取得了最佳平均性能,相对于其基础模型分别提升了 6.28% 和 5.45%。在减半分辨率评估下的增益进一步支持了改进的低分辨率能力向原始分辨率推理的迁移。RP-OPSD 还实现了相对于 OPSD 1.78× 的训练加速,表明分辨率差异提供了简单、有效且高效的特权信息。
第 8 页
参考文献
Shao, Z.; Wang, P.; Zhu, Q.; Xu, R.; Song, J.; Bi, X.; Zhang, H.; Zhang, M.; Li, Y. K.; Wu, Y.; and Guo, D. 2024. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300.
Agarwal, R.; Vieillard, N.; Zhou, Y.; Stanczyk, P.; Ramos Garea, S.; Geist, M.; and Bachem, O. 2024. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes. In Kim, B.; Yue, Y.; Chaudhuri, S.; Fragkiadaki, K.; Khan, M.; and Sun, Y., eds., International Conference on Learning Representations, volume 2024, 21246–21263.
Bai, S.; Cai, Y.; Chen, R.; Chen, K.; Chen, X.; Cheng, Z.; Deng, L.; Ding, W.; Gao, C.; Ge, C.; et al. 2025. Qwen3-VL Technical Report. arXiv:2511.21631.
Tarvainen, A.; and Valpola, H. 2017. Mean Teachers Are Better Role Models: Weight-Averaged Consistency Targets Improve Semi-Supervised Deep Learning Results. In Guyon, I.; Luxburg, U. V.; Bengio, S.; Wallach, H.; Fergus, R.; Vishwanathan, S.; and Garnett, R., eds., Advances in Neural Information Processing Systems, volume 30, 1195–1204. Curran Associates, Inc.
Chen, L.; Li, J.; Dong, X.; Zhang, P.; Zang, Y.; Chen, Z.; Duan, H.; Wang, J.; Qiao, Y.; Lin, D.; and Zhao, F. 2024. Are We on the Right Way for Evaluating Large Vision-Language Models? arXiv:2403.20330.
Cheng, Z.; Chen, S.; Yang, B.; Guan, Y.; Chen, J.; Lian, Z.; Peng, X.; Ma, F.; Cui, L.; and Tian, Q. 2026. OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing. arXiv:2606.15920.
Team, V.; Hong, W.; Yu, W.; Gu, X.; Wang, G.; Gan, G.; Tang, H.; Cheng, J.; Qi, J.; Ji, J.; Pan, L.; Duan, S.; Wang, W.; Wang, Y.; Cheng, Y.; He, Z.; Su, Z.; Yang, Z.; Pan, Z.; Zeng, A.; Wang, B.; Chen, B.; Shi, B.; Pang, C.; Zhang, C.; Huang, W.; Jia, B.; Zhai, Z.; Cao, S.; Ye, Z.; Zhao, F.; Xu, Z.; Tang, X.; Hu, Y.; and Lin, S. 2025. Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models. arXiv:2503.06749.
Hinton, G.; Vinyals, O.; and Dean, J. 2015. Distilling the Knowledge in a Neural Network. arXiv:1503.02531.
Hübotter, J.; Lübeck, F.; Behric, L.; Baumann, A.; Bagatella, M.; Marta, D.; Hakimi, I.; Shenfeld, I.; Buening, T. K.; Guestrin, C.; and Krause, A. 2026. Reinforcement Learning via Self-Distillation. arXiv:2601.20802.
Lai, X.; Li, J.; Li, W.; Liu, T.; Li, T.; and Zhao, H. 2025. Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search. arXiv:2509.07969.
Li, Y.; Du, Y.; Zhou, K.; Wang, J.; Zhao, X.; and Wen, J.-R. 2023. Evaluating Object Hallucination in Large Vision-Language Models. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 292–305. Singapore: Association for Computational Linguistics.
Li, Z.; Yu, W.; Huang, C.; Liang, Z.; Liu, R.; Liu, F.; Che, J.; Yu, D.; Boyd-Graber, J.; Mi, H.; and Yu, D. 2026. Self-Rewarding Vision-Language Model via Reasoning Decomposition. arXiv:2508.19652.
Liu, H.; Li, C.; Wu, Q.; and Lee, Y. J. 2023. Visual Instruction Tuning. arXiv:2304.08485.
Lu, K.; and Thinking Machines Lab. 2025. On-Policy Distillation. Thinking Machines Lab: Connectionism. https://thinkingmachines.ai/blog/on-policy-distillation/.
Ma, W.; Wei, J.; Zhao, L.; Zhang, H.; Xiao, B.; Li, L.; Wang, Q.; Gao, B.; Wang, Y.; Li, R.; Dong, J.; Sui, Z.; and Luo, F. 2026. MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training. arXiv:2606.30406.
Qwen Team. 2026. Qwen3.5: Towards Native Multimodal Agents. https://qwen.ai/blog?id=qwen3.5. Accessed: 2026-07-23.
Shenfeld, I.; Damani, M.; Hübotter, J.; and Agrawal, P. 2026. Self-Distillation Enables Continual Learning. arXiv:2601.19897.
Shen, H.; Liu, P.; Li, J.; Fang, C.; Ma, Y.; Liao, J.; Shen, Q.; Zhang, Z.; Zhao, K.; Zhang, Q.; Xu, R.; and Zhao, T. 2025. VLM-R1: A Stable and Generalizable R1-Style Large Vision-Language Model. arXiv:2504.07615.
Tong, S.; Brown, E.; Wu, P.; Woo, S.; Middepogu, M.; Akula, S. C.; Yang, J.; Yang, S.; Iyer, A.; Pan, X.; Wang, A.; Fergus, R.; LeCun, Y.; and Xie, S. 2024a. Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs. In Globerson, A.; Mackey, L.; Belgrave, D.; Fan, A.; Paquet, U.; Tomczak, J.; and Zhang, C., eds., Advances in Neural Information Processing Systems, volume 37, 87310–87356. Curran Associates, Inc.
Tong, S.; Liu, Z.; Zhai, Y.; Ma, Y.; LeCun, Y.; and Xie, S. 2024b. Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 9568–9578.
Wang, P.; Bai, S.; Tan, S.; Wang, S.; Fan, Z.; Bai, J.; Chen, K.; Liu, X.; Wang, J.; Ge, W.; Fan, Y.; Dang, K.; Du, M.; Ren, X.; Men, R.; Liu, D.; Zhou, C.; Zhou, J.; and Lin, J. 2024a. Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution. arXiv:2409.12191.
Wang, W.; Ding, L.; Zeng, M.; Zhou, X.; Shen, L.; Luo, Y.; and Tao, D. 2024b. Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Im-
第 9 页
多模态大语言模型中的视觉感知。 arXiv:2408.15556。 Wang, W.; Gao, Z.; Gu, L.; Pu, H.; Cui, L.; Wei, X.; Liu, Z.; Jing, L.; Ye, S.; Shao, J.; 等. 2025. InternVL3.5:在通用性、推理和效率方面推进开源多模态模型。arXiv:2508.18265。 Wei, L.; He, L.; Lan, J.; Dong, L.; Cai, Y.; Li, S.; Zhu, H.; Wang, W.; Kong, L.; Wang, Y.; Zhang, Z.; 和 Huang, W. 2026. 无缩放缩放:用于细粒度多模态感知的区域到图像蒸馏。 arXiv:2602.11858。 Wu, J.; Chen, H.; Tu, H.; Tang, X.; Shi, F.; Liu, H.; Lu, H.; Xie, C.; 和 Zhou, Y. 2026. 从看到思考:解耦感知与推理改善视觉语言模型的后期训练。arXiv:2605.20177。 Wu, P.; 和 Xie, S. 2024. V*:引导式视觉搜索作为多模态大语言模型的核心机制。在 IEEE/CVF 计算机视觉与模式识别会议论文集,13084–13094。 Yuan, Q.; Lou, J.; Yu, X.; Lin, H.; Sun, L.; Han, X.; 和 Lu, Y. 2026. Vision-OPD:通过在线自蒸馏(On-Policy Self-Distillation)学习多模态大语言模型的细粒度细节。arXiv:2605.18740。 Zhang, Y.-F.; Zhang, H.; Tian, H.; Fu, C.; Zhang, S.; Wu, J.; Li, F.; Wang, K.; Wen, Q.; Zhang, Z.; Wang, L.; Jin, R.; 和 Tan, T. 2025. MME-RealWorld:您的多模态大语言模型能否挑战对人类而言困难的高分辨率真实世界场景?在 Yue, Y.; Garg, A.; Peng, N.; Sha, F.; 和 Yu, R., 编,国际学习表征会议,卷 2025,89655–89701。 Zhao, S.; Xie, Z.; Liu, M.; Huang, J.; Pang, G.; Chen, F.; 和 Grover, A. 2026. 自蒸馏推理器:大语言模型的在线自蒸馏。arXiv:2601.18734。
第 10 页
RP-OPSD 补充材料:面向多模态大语言模型的分辨率特权在线自蒸馏
Qihui Zhu1∗, Yuchen Wang1∗, Zijian Wen1, Tao Zhang1, Mengjie Zhang1, Yang Liu2, Shuangwu Chen1†, Siying Wu1, Jian Yang1, Xiaofeng Jiang1 1中国科学技术大学 2长鑫存储技术有限公司
A 训练数据配置 我们从 Vision-SR1、VLM-CapCurriculum Perception、ZwZ-RL-VQA 以及公共 Vision-OPD 训练集中构建了包含 5,295 个样本的单图像训练集 Backbone Qwen3.5-4B / Qwen3.5-9B。表 1 报告了来源构成。
| Source | Samples | | :— | :— | | ZwZ-RL-VQA | 3,034 | | Vision-OPD | 1,060 | | Vision-SR1 | 887 | | VLM-CapCurriculum Perception | 314 | | Total | 5,295 |
表 1:RP-OPSD 训练集的来源构成。
| Configuration | Value | | :— | :— | | Trainable parameters | All, including vision encoder | | Student image | Physical 1/2 width and height | | Teacher image | Original resolution | | Interpolation | Lanczos | | Teacher update | EMA, ρ = 0.05 | | Distillation objective | Bias-corrected reverse KL | | Distillation support | Teacher-selected Top-100 | | Rollouts per input | 8 | | Maximum response length | 1,024 tokens | | Sampling temperature | 1.0 | | Top-p / Top-k | 1.0 / −1 | | Maximum prompt length | 8,192 tokens | | Maximum sequence length | 9,216 tokens |
表 2:4B 和 9B 实验共享的模型和生成配置。
B 详细训练设置 我们将学生模型和教师模型初始化为相同的 Qwen3.5 检查点。学生模型从半分辨率图像生成在线策略响应。教师模型在观察原始分辨率图像和相同文本提示的同时,对相同的响应前缀进行评分。梯度仅通过学生模型传播。在每次 Actor 更新之后,教师参数更新为:
ϕs+1 = (1 −ρ)ϕs + ρθs+1, ρ = 0.05. (1)
所有学生参数,包括视觉编码器,均保持可训练。我们使用主论文中描述的偏置校正反向 KL 目标,对教师选定的 Top-100 令牌分布进行蒸馏。对于每个输入,学生模型采样八个响应。训练不使用序列级奖励,也不使用外部评判器。表 2 和表 3 列出了 4B 和 9B 实验共享的完整配置。
| Configuration | Value | | :— | :— | | Global batch size | 96 | | PPO mini-batch size | 96 | | Micro-batch per GPU | 1 | | Dynamic batching | Disabled | | Optimizer | AdamW | | Learning rate | 2 × 10−6 | | Adam coefficients | (0.9, 0.999) | | Weight decay | 0.01 | | Gradient clipping | 1.0 | | Linear warmup | 10 steps | | Training schedule | 1 epoch / 55 steps | | Checkpoint | Final step | | Training precision | BF16 | | Gradient checkpointing | Enabled | | Actor parameter offload | Enabled | | Optimizer offload | Enabled | | Data / generation seed | 42 / 42 | | Hardware | 8× NVIDIA H20 |
表 3:RP-OPSD 的优化和系统设置。
我们使用 Python 3.12、PyTorch 2.10.0、Transformers 5.5.0、vLLM 0.18.0 和 Ray 2.53.0 在 FSDP 和 vLLM 下进行训练。Rollout 使用八个具有张量并行度 1 的工作进程。感知聊天模板在开头添加一个空的 〈think〉〈/think〉 块;它不请求或监督推理轨迹。9B 运行在八块 H20 GPU 上耗时 7.83 小时。
C 案例研究 我们在两个原始分辨率的 VisualProbe 案例上比较 Qwen3.5-9B Base 和 RP-OPSD。
∗ 这些作者贡献相同。 † 通讯作者。
第 11 页
(b) 目标区域裁剪
问题。在集装箱打开的门底部的白色矩形上写的是什么? 真实标签。MCI
(a) 全图,7952 × 5304
Qwen3.5-9B Base(错误) RP-OPSD(正确)
预测。MSKU 728 702 7 / 22G1 预测。MCI 分析。基础模型复制了查询区域附近显眼的集装箱代码,分析。RP-OPSD 定位到打开的门底部附近的白色矩形,并正确转录了小型目标文本。
图 1:集装箱上的细粒度 OCR。目标裁剪使定位要求显式化,而预测比较显示 RP-OPSD 解决了小型查询标签的问题。
(b) 目标区域裁剪
问题。最右侧红色集装箱起重机上的数字是多少? 真实标签。85 (a) 全图,7587 × 4410
Qwen3.5-9B Base(错误) RP-OPSD(正确)
预测。R95 预测。85 分析。基础模型选择了附近的起重机标识符,未能将短语“最右侧”分析。RP-OPSD 识别出最右侧的起重机并识别出其上部结构上的小型白色数字。
图 2:集装箱码头的远距离数字识别。RP-OPSD 将空间参考定位到正确的起重机并读取其小型标识符,而基础模型选择了附近的标签。