快速导读:VCSD通过对比原始图像与内容擦除控制图像下的教师模型预测分布,构建无需外部监督的自蒸馏目标,显著提升多模态大模型的视觉 grounding 能力。
多模态大模型(MMLMs)的自蒸馏(On-policy Self-Distillation, OPSD)旨在通过教师-学生模型间的知识传递提升性能,但面临目标信息量不足的难题。现有方法通常依赖特权答案或视觉证据来构建不对称性,这增加了复杂性并限制了适用性。
本文提出视觉对比自蒸馏(Visual Contrastive Self-Distillation, VCSD),通过对比原始图像与内容擦除控制图像下的教师模型预测分布,构建无需外部监督的自蒸馏目标。该方法显著提升了多模态大模型的视觉 grounding 能力,且在多个基准测试中表现优异。
英文题目:VISUAL CONTRASTIVE SELF-DISTILLATION
论文出处:arXiv 每日论文精选 · arXiv:2607.21556
原始论文:PDF / 论文页面
对应视频标题:视觉对比自蒸馏:无需外部监督的自蒸馏新范式|推荐指数:★★★★★
这篇论文解决什么问题?
OPSD 的核心挑战在于教师和学生模型共享相同输入时,难以提供信息丰富的蒸馏目标。现有解决方案通常引入特权答案(如语言描述)或视觉证据(如裁剪区域),这需要额外的监督信号或复杂的预处理流程。
例如,Vision-OPD 和 V-Zero 等方法利用视觉证据来增强目标信息量,但这限制了其在无标注数据上的应用。此外,这些方法往往需要复杂的管道来生成和整合视觉证据,增加了训练和推理的复杂性。
因此,亟需一种简洁、高效且无需外部监督的自蒸馏方法,能够在保持模型性能的同时降低实现复杂度。
核心创新
方法概览
VCSD 的核心洞察在于,无需外部监督,仅通过对比原始图像与内容擦除控制图像(如黑图)下的教师预测分布,即可构建具有视觉信息量的目标不对称性。
- VCSD 的核心思想是通过输入条件构建目标不对称性。具体而言,它对比 EMA 教师模型在原始图像和内容擦除控制图像(如黑图)下的预测分布。
- 通过计算对数概率差异,VCSD 在合理的支撑集内锐化原始图像的分布,形成蒸馏目标。这一过程无需特权答案或视觉证据,仅依赖图像和问题的输入。
- 蒸馏目标通过前向 KL 散度(Forward KL)进行优化,确保学生模型能够覆盖教师模型的模式。前向 KL 的选择基于其在模式覆盖方面的优势,有助于提升模型的泛化能力。
- 内容擦除控制图像必须保持分辨率和预处理路径的一致性,以确保对比信号的有效性。实验表明,黑图、高斯噪声等不同控制图像均能产生类似的对比信号,但黑图最为简洁有效。
- 合理性支撑集(Plausibility Support)是防止目标扭曲的关键。通过限制目标塑造在合理范围内,VCSD 避免了 unlikely tokens 的高对比度导致的性能下降。
- VCSD 的训练过程无需额外推理成本,仅在训练阶段需要生成擦除控制图像下的响应,这增加了教师模型的前向传播次数。
逐图理解论文
现有方法的局限

图 1 展示了不同目标不对称性来源的对比。现有方法利用特权答案或视觉证据锐化教师分布,而 VCSD 通过对比原始图像和擦除控制图像下的预测,仅使用图像和问题生成视觉信息目标,无需辅助监督。
VCSD 的核心洞察

图 2 概述了 VCSD 的流程。在每个学生生成的前缀处,EMA 教师对比原始图像和擦除控制图像下的下一个 token 分布。对比锐化了合理的原始图像分布以形成目标,通过前向 KL 蒸馏到学生模型。
实验验证

实验表明,VCSD 在 Qwen3-VL 和 Qwen3.5 系列模型上均实现一致提升,平均准确率提升 1.86% 至 4.77%。消融研究证实,合理性支撑集和原始图像锚点对训练稳定性至关重要。
结论与局限

图 6 展示了 token 级别的图像依赖对比。对比分数显示了相同响应在基础模型、OPSD 和 VCSD 下的差异。暖色表示更强的图像依赖偏好,底部行显示了 VCSD 相对于 OPSD 学习的额外对比。
实验如何设计?
- 实验在 ViRL39K 数据集上进行,评估了 Qwen3-VL(2B, 4B, 8B)和 Qwen3.5(2B, 4B, 9B)模型。
- 对比基线包括基础模型和答案提示 OPSD,评估基准涵盖 BLINK, MMStar, V*Bench, MathVista, HRBench4K/8K, HallusionBench 等七个任务。
- 消融实验研究了合理性支撑集、对比强度、蒸馏散度、控制图像构建和原始图像锚点的影响。
关键结果与论文证据
- VCSD 在所有模型规模上均优于基础模型和 OPSD,平均准确率提升 1.86% 至 4.77%(Table 1, Page 8)。
- 前向 KL 散度优于 JSD 和反向 KL,在 Qwen3-VL-2B 上分别提升 0.79% 和 2.27%(Table 2, Page 9)。
- 合理性支撑集对长期训练稳定性至关重要,移除它会导致性能逐渐下降(Figure 3a, Page 8)。
- 对比强度在 α ∈ [1, 1.5] 时表现最佳,过弱或过强的对比均会降低准确率(Figure 3b, Page 8)。
- 保留原始图像分布作为锚点显著减少了训练过程中的语言漂移(Figure 3c, Page 8)。
- VCSD 在视觉概念(如 roof, shingles, food)上分配更强的正对比,抑制了无信息量的 token(Figure 6, Page 12)。
阅读时需要注意
- 训练阶段需要生成擦除控制图像下的响应,导致教师模型前向传播次数加倍。
- 性能提升因模型规模和家族而异,某些基准测试中 OPSD 可能优于基础模型。
- 依赖 EMA 教师模型的稳定性,长期训练中未限制的合理性支撑集可能导致性能下降。
关联工作
- 与 On-policy distillation (OPD) 相比,VCSD 移除了对外部教师的依赖。
- 与 Contrastive decoding 相比,VCSD 将对数比率概念应用于训练目标而非推理阶段。
- 与 Vision-OPD / V-Zero 相比,VCSD 使用内容擦除控制而非视觉证据。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
视觉对比自蒸馏
梁一俊1 田俊杰 李一江2 贾玉琦3 黄富荣1 周一4 付迪 1马里兰大学帕克分校 2加州大学圣地亚哥分校 3杜克大学 4穆罕默德·本·扎耶德人工智能大学 yliang17@umd.edu, {tianyunjie96, fu.burning}@gmail.com
摘要
策略自蒸馏(On-policy self-distillation, OPSD)因其消除了策略蒸馏(On-policy distillation, OPD)所需的外部教师而展现出巨大潜力,但它仍需确保自教师提供的学习信号强于学生,这通常依赖于师生之间的非对称信息。现有方法要么通过特权答案,要么通过视觉证据来构建这种非对称性。我们探讨是否可以将两者都移除,从而得到一种仅由输入条件驱动的更简单的OPSD形式。为此,我们提出了视觉对比自蒸馏(Visual Contrastive Self-Distillation, VCSD),该方法将图像内容移除转化为策略自蒸馏信号。在每个学生生成的响应前缀处,指数移动平均教师模型(Exponential Moving Average (EMA) teacher)在相同的提示和前缀下生成两个下一个2026词元分布——一个基于原始图像条件,另一个基于内容擦除控制图像(Content-erased control)。它们逐词元的对数概率差异突出了那些因原始图像视觉内容而可能性显著增加的候选词元。我们利用这一对比来锐化自教师在其合理支撑集(Plausibility support)内的实例级分布,并将由此产生的完整分布目标蒸馏给学生。在ViRL39K数据集上,VCSD在Qwen3-VL和Qwen3.5模型上均一致优于匹配的OPSD。例如,在Qwen3-VL上,它将七个基准测试的聚合得分从2B模型的62.27%提升至67.04%,4B模型从71.30%提升至73.16%,8B模型从72.51%提升至76.26%。此外,VCSD无需外部教师、特权答案、视觉证据信号、推理轨迹或额外的推理时成本。[cs.CV]
1 引言
策略蒸馏(On-policy distillation, OPD)(Agarwal et al., 2024; Lu & Lab, 2025; Li et al., 2026)利用从学生自身策略中采样的前缀训练学生,同时使用外部教师进行密集的词元级监督。这使得训练与学生推理时的轨迹保持一致,但通常需要更强的教师,从而增加了后训练的成本和复杂性(Liu et al., 2026; Yoon et al., 2026)。策略自蒸馏(On-policy self-distillation, OPSD)通过从同一模型(通常通过指数移动平均教师模型)推导目标来移除外部教师。然而,当学生和自教师在相同的前缀处接收相同信息时,目标可能并未在学生当前预测之外提供太多额外信息。因此,策略采样决定了学习发生的位置,但并未决定自教师提供何种额外的监督。有效的OPSD仍需师生非对称性,使自教师比学生提供更多信息。arXiv:2607.21556v1 现有方法通过仅对自教师可用而对学生不可用的辅助信息来构建这种非对称性,如图1所示。对于语言推理任务,教师可能基于特权答案或推理轨迹(Zhao et al., 2026)、专家演示(Shenfeld et al., 2026)或丰富的文本反馈(Hübötter et al., 2026)进行条件设置。对于视觉语言任务,教师可以接收视觉证据信号,例如裁剪、区域或其他视觉条件,以更直接地暴露相关的图像证据(Yuan et al., 2026; Sun et al., 2026; Tian et al., 2026)。这些方法可以产生有效的监督,但依赖于特定任务的信息或额外的处理管道。这些语言侧信号并不总是可用,而视觉证据输入可能需要标注、外部定位模型或手动设计的图像变换。
1
第 2 页
1. 基础 $p(\text{token})$ 3. 视觉证据 $p(\text{token})$ 猫 地面 猫 图像 问题 问题: 问题: 真相 图像中有什么? 图像中有什么? 特权提示 答案 2. 特权答案 4. VCSD (本文方法) $p(\text{token})$ $p(\text{token})$ $p(\text{token})$ 问题: 猫 视觉 图像中有什么? 图像中有什么? $p(\text{token})$ 地面 问题: 图像中有什么? 本文方法 真相: 沙发上坐着一只猫。
图 1:不同目标不对称性来源的比较。现有方法使用特权答案或视觉证据来锐化教师分布。我们的方法则对比原始图像和内容擦除控制图像下教师的预测,仅利用图像和问题生成视觉 informed 的目标,无需辅助监督。
这引出了本工作的核心问题:是否可以在不依赖辅助信息的情况下,仅通过输入条件构建策略自蒸馏 (On-policy self-distillation (OPSD)) 所需的不对称性?我们通过将内容擦除图像视为受控参考而非用于模仿的替代教师输入来回答这一问题。在每个学生生成的响应前缀处,相同的指数移动平均教师模型 (Exponential Moving Average (EMA) teacher) 在相同的提示和前缀下被评估两次——一次使用原始图像,一次使用内容擦除控制图像。由于仅视觉条件发生变化,它们的逐 token 对数概率差异捕捉了当移除实例特定的视觉内容时,每个候选者似然的变化情况,如图 1 所示。这种条件对比提供了自蒸馏所需的目标不对称性。
然而,仅靠对比并不能定义可靠的蒸馏目标,因为一个 token 可能在原始图像下仍然不太可能,但表现出较大的相对变化。因此,我们为两个教师预测分配互补的角色:原始图像分布识别合理的候选者,而条件对比根据它们对视觉内容的依赖性锐化其相对偏好。两者共同产生一个视觉 informed 的全分布目标,可沿其策略轨迹蒸馏到学生模型中。
基于这一思想,我们提出了视觉对比自蒸馏 (Visual Contrastive Self-Distillation, VCSD)。给定学生生成的前缀 $y_{<t}$,我们定义
$\Delta_t(v) = \log p_\phi(v | P, J, y_{<t}) – \log p_\phi(v | P, J_{ctrl}, y_{<t}),$ (1) $q^*_t (v) \propto p_\phi(v | P, J, y_{<t}) \exp(\alpha \Delta_t(v)) , v \in S_t,$
其中 $S_t$ 将目标限制为在原始图像下合理的候选者。 resulting 的全分布目标通过前向 KL 散度 (Forward KL) 沿其策略轨迹蒸馏到学生模型中。这里的“对比”指的是条件 token 分布之间的对比,而非嵌入级别的对比损失。
我们在 ViRL39K 上对 Qwen3-VL 和 Qwen3.5 模型(从 2B 到 9B)在七个视觉语言基准上评估了 VCSD。对于 Qwen3-VL,它在 2B 时将聚合分数从 62.27% 提高到 67.04%,在 4B 时从 71.30% 提高到 73.16%,在 8B 时从 72.51% 提高到 76.26%。它还使 Qwen3.5 模型相比其对应的基线模型一致提高了 2.9% 到 4.3%。跨模型家族和规模,VCSD 优于基线模型和匹配的 OPSD 基线。此外,VCSD 不需要外部教师、特权答案、推理轨迹、证据聚焦裁剪或外部验证器。
我们的贡献有三方面:
• 我们表明,匹配输入条件可以提供 OPSD 所需的目标不对称性,而无需特权答案或视觉证据信号。
• 我们提出了 VCSD,它利用原始图像和内容擦除教师预测之间的对比来锐化一个合理的全分布目标。
2
第 3 页
• 我们在七个视觉-语言基准测试中,展示了 Qwen3-VL 和 Qwen3.5 模型(从 2B 到 9B)的一致性能提升。
2 相关工作
策略自蒸馏中的目标不对称性。策略自蒸馏(On-policy self-distillation (OPSD))的目标源自同一底层模型,因此需要一种不对称性,使其相对于学生模型具有信息量。现有方法通过特权答案或推理轨迹(Zhao et al., 2026)、以证据为中心的视觉视图(Yuan et al., 2026)或用于轨迹选择的配对证据来构建这种不对称性。其他监督机制使用可验证奖励(Shao et al., 2024; Yang et al., 2026)或单独训练的教师模型,有时结合视觉加权或梯度引导(Liu et al., 2026; Bousselham et al., 2026; Yoon et al., 2026)。VCSD 则从同一目标模型的匹配视觉条件中推导目标不对称性:内容擦除控制图像(Content-erased control)的预测作为参考,而真实图像预测将目标锚定在由输入支持的合理性支撑集(Plausibility support)内的候选项上。这针对了视觉语言模型倾向于偏好语言先验而非细粒度图像证据的倾向(Guan et al., 2024)。在推理时,相关方法通过跨模型、视觉条件或内部表示的对比解码(Li et al., 2023; Leng et al., 2024),或通过逐层激活细化(Wang et al., 2025a)来解决这种依赖性。VCSD 将视觉对比蒸馏到 OPSD 中,无需可验证奖励或外部教师,且在推理时不增加前向传播次数。
配对条件下的相对预测分布。预测分布之间的差异已被用于揭示单独从任一预测中无法察觉的信息。对比解码比较专家模型与业余模型,或原始与退化的视觉条件,以修改推理时的令牌选择(Li et al., 2023; Leng et al., 2024)。除了解码之外,配对模型行为也可以定义训练信号:MARGO 在估计显式推理的优势时,使用非思考轨迹作为同模型参考(Wang et al., 2026b)。相关的策略迁移方法比较模型检查点:弱到强偏好优化转移由对齐引入的变化(Zhu et al., 2025),而 Direct-OPD 将强化学习引起的策略差异转移到学生的策略内状态(Feng et al., 2026)。VCSD 考虑的是同模型、配对输入的设置,其中目标参数和响应前缀保持不变,仅视觉条件发生变化。由此产生的词汇级对比塑造了一个解耦的令牌分布,并通过前向 KL 散度(Forward KL)进行蒸馏。真实图像预测提供合理性锚点,而内容擦除控制图像预测提供用于调整其相对令牌偏好的参考。
3 方法
我们提出了 VCSD,它从匹配的视觉条件构建 OPSD 所需的目标不对称性。如图 2 所示,学生在原始图像下生成策略内响应,而指数移动平均教师模型(Exponential Moving Average (EMA) teacher)在原始图像和内容擦除控制图像下评估每个响应前缀。它们的逐令牌对数概率对比在其合理性支撑集内锐化了原始图像分布,从而为自蒸馏生成全分布目标。
3.1 策略自蒸馏设置
令 $D = \{(P_i, J_i)\}_{i=1}^N$ 表示提示-图像对的集合,其中 $P$ 为提示,$J$ 为原始图像。我们将可训练的学生模型记为 $\pi_\theta$,其指数移动平均教师模型记为 $\pi_\phi$。教师模型被视为停止梯度的目标模型,不接收梯度更新。
对于每个 $(P, J) \sim D$,学生采样一个策略内响应:
$y \sim \pi_\theta(\cdot | P, J). \quad (2)$
在生成步骤 $t$,学生和教师沿相同的由学生生成的前缀 $y_{<t}$ 进行评估。学生的下一个令牌分布为:
$p_{\theta,t}(v) = \pi_\theta(v | P, J, y_{<t}), v \in V, \quad (3)$
3
第 4 页
原始图像目标分布 $J$ $p_\phi(v|P, J)$ 对比(logit 差异)新 + 提示 $P$(对比形状) $\Delta(v) = \log \frac{p_\phi(v \mid P, I)}{q^*(v)} \propto p_\phi(v \mid P, I) \cdot \exp(\alpha \Delta(v))$ 模型 sofa cat … dog the and $-\log p_\phi(v \mid P, I_{ctrl})$ $v \in S_t$ 黑色图像 $J_{ctrl}$ $p_\phi(v|P, J_{ctrl})$ + 提示 $P$
… sofa cat … dog the and sofa cat … dog the and EMA sofa cat dog the and
原始图像 $J$ + 提示 模型 $P$ $p_\phi(v|P, J)$ 对比 $\Delta(v)$ 前向 KL(在步骤 $t$) $\Delta(v) > 0$(增加) $\mathcal{L}_t = D_{KL} (q^*(v) \parallel p_\theta(v \mid P, J))$ $\Delta(v) \approx 0$(无变化) sofa cat … dog the and $\Delta(v) < 0$(减少)
图 2:VCSD 概述。在每个学生生成的前缀处,EMA 教师对比原始图像和内容擦除控制下的下一个 token 分布。这种对比使合理的原始图像分布变得更加尖锐以形成目标,并通过前向 KL 蒸馏到学生模型中。为清晰起见,省略了响应前缀。
其中 $V$ 是词汇表。
rollout 是策略自蒸馏 (On-policy self-distillation (OPSD)),因为学生决定了应用监督的每一个前缀。然而,仅靠策略采样并不能指定教师目标应如何比 $p_{\theta,t}$ 包含更多信息。VCSD 并非为教师提供特权答案或聚焦证据的裁剪图像,而是通过比较两种匹配视觉条件下的教师来构建这种目标不对称性。
3.2 视觉条件对比
我们构建一个内容擦除控制 $J_{ctrl} = C(J)$,其中 $C(J)$ 是同等大小的黑色 RGB 图像。该控制保留了图像分辨率、多模态输入接口、预处理路径和视觉 token 数量,同时去除了 $J$ 的实例特定内容。
在每个固定的前缀 $y_{<t}$ 处,EMA 教师生成两个下一个 token 分布:
$p^J_{\phi,t}(v) = \pi_\phi(v \mid P, J, y_{<t}), \quad (4)$ $p^0_{\phi,t}(v) = \pi_\phi(v \mid P, J_{ctrl}, y_{<t}). \quad (5)$
提示、响应前缀、模型参数和多模态计算路径在两次评估中是共享的。它们仅在是否存在实例特定的视觉内容方面有所不同。
我们通过词汇级别的 log-probability 对比来衡量 token 偏好的变化:
$\Delta_t(v) = \log p^J_{\phi,t}(v) – \log p^0_{\phi,t}(v). \quad (6)$
正的 $\Delta_t(v)$ 表明 token $v$ 在原始图像下比在内容擦除控制下获得更大的合理性支撑集 (Plausibility support)。相反,负值表明当移除原始视觉内容时其概率增加。因此,$\Delta_t$ 描述了教师的下一个 token 偏好如何响应实例特定的视觉内容。
重要的是,控制分布仅用作参考。它既不被视为教师目标,也不直接蒸馏到学生模型中。
4
第 5 页
3.3 对比塑造的教师目标
条件对比为修改教师目标提供了方向,但仅凭其本身是不够的。一个词元在两种条件下可能表现出较大的相对变化,但在原始图像下仍然极不可能发生。因此,我们使用原始图像的教师分布作为合理性支撑集(plausibility anchor),并仅对其中被认为足够可能的候选者应用对比塑造。
具体而言,我们定义相对合理性支撑集
S_t(β) = {v ∈ V : p_{Jϕ,t}(v) ≥ β max_{u∈V} p_{Jϕ,t}(u)}, (7)
其中 β ∈ [0, 1] 控制支撑阈值。这种相对阈值构造遵循对比解码中常用的合理性限制 (Li et al., 2023; Leng et al., 2024)。
随后,我们构建对比塑造的教师目标为
q^*_t(v) = (1/Z) [v ∈ S_t(β)] p_{Jϕ,t}(v) exp(αe∆_t(v)), (8) Z = Σ_{u∈S_t(β)} p_{Jϕ,t}(u) exp(αe∆_t(u))
其中 α ≥ 0 控制对比塑造的强度。此处,e∆_t 等于 ∆_t,但指定序列终止词元的对比值被设为零。 公式 (8) 为两个信号分配了互补的角色。原始图像分布 p_{Jϕ,t} 决定了初始概率和允许的候选集,而 e∆_t 根据每个候选者被原始视觉内容偏好的程度来调整相对概率。在支撑集内,对应的未归一化对数得分是
log p_{Jϕ,t}(v) + αe∆_t(v) = (1 + α) log p_{Jϕ,t}(v) − α log p^0_{ϕ,t}(v), (9)
对于非终止词元。当 α = 0 时,目标简化为在 S_t(β) 上重新归一化的原始图像教师分布。当 β = 0 时,塑造应用于整个词汇表。
在 VCSD 中,“对比”指的是两个条件词元分布之间的对比,而不是基于正负样本对的嵌入级对比目标。
3.4 策略自蒸馏与 EMA 更新
对比塑造的目标通过全分布前向 KL 散度,在学生生成响应的每个位置蒸馏到学生模型中:
L_{VCSD} = E_{(P,J)∼D} [ (1/|y|) Σ_{t=1}^{|y|} D_KL (sg[q^*_t] ∥ p_{θ,t}) ] (10)
其中 sg[·] 表示停止梯度。用于目标构建和蒸馏的所有教师和学生分布均使用相同的蒸馏温度 T_KD 进行评估;为清晰起见,符号中省略了其依赖性。因子 T_KD^2 遵循标准的温度缩放知识蒸馏。
梯度仅通过学生分布 p_{θ,t} 传播。两次教师评估是在相同的固定学生生成前缀上进行的,并不产生单独的响应轨迹。每次学生更新后,教师参数通过 ϕ ← µϕ + (1 − µ)θ 进行更新,其中 µ ∈ [0, 1) 是 EMA 衰减系数。
5
第 6 页
训练仅需原始提示-图像对以及学生自身的在线策略响应。 它不依赖外部教师、特权答案、推理轨迹、证据聚焦裁剪、 外部验证器或可验证奖励。在推理时,仅保留更新后的学生模型;既不需要 指数移动平均教师模型,也不需要内容擦除控制图像引入额外的推理分支。
3.5 理论视角
公式 6 中的条件对数比具有两种互补的解释。首先,它可以 被视为一种密集的令牌级奖励,用于衡量归因于实例特定视觉内容的预测支持。其次,它提供了候选令牌与观测图像之间条件逐点互信息的受控近似,其中内容擦除 预测作为无实例特定视觉信息预测的代理。
一步 KL 正则化策略更新。令在合理性支撑集上受限并重新归一化的原始图像教师分布为
1[v ∈St(β)] pJϕ,t(v) ¯pJϕ,t(v) = . (11) P u∈St(β) pJϕ,t(u)
我们将条件对比度
rvist (v) := e∆t(v) (12)
视为隐式视觉证据奖励。
备注 1。对于每个学生生成的前缀,公式 8 中的对比度形状目标是以下优化问题的唯一解:
q⋆t = arg max αEv∼q rvist (v) −DKL q ∥¯pJϕ,t . (13) q∈Π(St(β))
此处,Π(St(β)) 表示 St(β) 上的概率单纯形。闭式解为
¯pJϕ,t(v) exp αrvist (v) q⋆t (v) = . (14) P u∈St(β) ¯pJϕ,t(u) exp αrvist (u)
由于 ¯pJϕ,t 中的支撑归一化常数在分子和分母中抵消, 公式 14 完全等价于公式 8 中定义的目标。原始图像预测 因此充当参考策略,而条件对数比提供用于改进它的奖励。合理性限制进一步施加了硬支撑约束,防止具有较大似然比但原始图像概率可忽略的令牌主导改进后的目标。完整推导见附录 A。
此处,“一步”指的是从支撑归一化的原始图像教师分布 ¯pJϕ,t 到固定响应前缀处的局部改进目标 q⋆t 的单个闭式更新。它并不指学生优化的单个梯度步。
重要的是,这种解释并不假设原始图像策略历史上是通过将强化学习应用于控制图像策略获得的。相反,条件对数比定义了一个隐式奖励,其 KL 正则化最优解与我们的对比度形状目标一致。
条件逐点互信息的近似。令 Ht = (P, y<t) 表示步骤 t 的文本上下文。令牌 v 与图像 J 之间的条件逐点互信息,在给定 Ht 的条件下,形式为
p(v | J, Ht) PMI(v; J | Ht) = log . (15) p(v | Ht)
6
第 7 页
我们的条件对比则采用如下形式
pϕ(v | J, Ht) ∆t(v) = log (16) pϕ(v | Jctrl, Ht).
当内容擦除预测 pϕ(v | Jctrl, Ht) 近似于模型在没有实例特定视觉信息时的预测时,它作为 pϕ(v | Ht) 的控制代理。在此解释下,∆t(v) 是对条件逐点互信息的对比近似:它衡量观察到的图像在内容独立预测之外,使 token 的对数似然增加了多少。正值标识那些在存在观察到的视觉内容时似然增加的 token,而接近零的值标识那些在该内容移除后似然基本保持不变的 token。受保护的奖励 rvist (v) = e∆t(v) 对普通 token 遵循此解释,而指定的终止 token 被排除在对比调整之外,以保证训练稳定性。
这说明了所提出目标函数的有用性。最大化条件互信息有利于在考虑文本上下文后仍能关于观察到的图像提供信息的预测,而不是主要可由语言先验解释的预测。因此,对具有较大正对比值的 token 进行加权鼓励学生在其下一个 token 分布中保留图像依赖的证据,同时使对视觉不敏感的 token 基本保持不变。结合原始图像教师分布作为参考策略,这产生了一种保守的视觉接地形式:该方法仅在教师已认为合理的 token 中放大由视觉支持的差异,而不是奖励任意的图像敏感输出。因此,生成的目标促进了更强的实例特定视觉证据依赖,同时保留了教师编码的流畅性和语义知识。
4 实验
4.1 设置
模型和训练数据。我们在 2B、4B 和 8B 规模的 Qwen3-VL (Bai et al., 2025) 以及 2B、4B 和 9B 规模的 Qwen3.5 (Qwen Team, 2026) 上评估 VCSD。所有后训练方法均在 ViRL39K 单图像数据集 (Wang et al., 2026a) 上进行训练。
基线。每个模型块比较未修改的基础模型、已发布的带有答案提示的 OPSD 方法 (Zhao et al., 2026) 和 VCSD。OPSD 目标模型以参考答案为条件,而学生仅接收原始问题和图像。VCSD 保留了策略自蒸馏 (OPSD) 的在线 rollout 结构,但通过配对原始图像和内容擦除图像条件构建其目标,而不消耗答案。
基准和聚合指标。我们使用 BLINK (Fu et al., 2024) 和 MMStar (Chen et al., 2024) 评估通用视觉感知,使用 MathVista (Lu et al., 2024) 评估视觉数学,使用 V∗Bench (Wu & Xie, 2023) 和 HRBench4K/8K (Wang et al., 2025b) 评估细粒度和高分辨率感知,使用 HallusionBench (Guan et al., 2024) 评估幻觉。报告的 Acc 是这七个基准的未加权平均值;HallusionBench 条目首先对 aAcc、fAcc 和 qAcc 进行平均。
训练配置。除非另有说明,VCSD 使用 α = 1.0,β = 0.1,且 TKD = 2,响应位置权重均匀。EMA 目标使用更新率 ρ = 0.05。我们使用 AdamW 优化全词汇前向 KL 散度目标,批大小为 32 个提示,每个提示 n = 8 次 rollout,学习率为 2 × 10−6,10 个预热步骤后保持恒定学习率。所有模型在 8 块 NVIDIA B200 GPU 上使用固定的 90 次优化步骤预算。
4.2 主要结果
表 1 报告了跨两个 Qwen 模型家族及每个家族三种规模的主要对比结果。
VCSD 在视觉能力方面优于带有答案提示的 OPSD。在 Qwen3-VL-2B 上,VCSD 在每一个基准上都优于 OPSD:BLINK +1.27%,MMStar +3.00%,V∗Bench +2.09%,MathVista +1.40%,HRBench4K +1.00%,HRBench8K +2.00%,以及 HallusionBench +4.32%。
7
第 8 页
表1:七个基准上的主要结果。我们在三种 Qwen3-VL 和三种 Qwen3.5 模型规模下比较了基础模型、OPSD 和 VCSD。Acc. 表示七个评估基准上的平均准确率。VCSD 始终优于基础模型和 OPSD,在几乎所有模型规模下均取得最佳整体性能,相较于相应的基础模型,平均准确率提高了 +1.86% 到 +4.77%。每列中的最高分以粗体显示。
模型 方法 BLINK MMStar V∗ MathVista HR4K HR8K HalluB Acc.
基础 53.02 57.47 72.77 62.50 71.13 67.38 51.60 62.27 Qwen3-VL-2B OPSD 56.02 60.73 75.92 64.70 76.25 71.25 49.36 64.89 VCSD (ours) 57.29 63.73 78.01 66.10 77.25 73.25 53.68 67.04 (+4.77)
基础 67.18 68.93 80.63 73.90 79.88 73.75 54.81 71.30 Qwen3-VL-4B OPSD 64.97 68.73 83.77 74.10 78.12 75.63 54.50 71.40 VCSD (ours) 66.86 68.73 83.77 74.90 80.50 77.00 60.37 73.16 (+1.86)
基础 69.65 70.67 82.72 76.50 77.38 71.12 59.51 72.51 Qwen3-VL-8B OPSD 67.81 70.20 85.34 77.30 81.12 74.62 59.64 73.72 VCSD (ours) 70.38 74.07 87.43 77.90 84.12 79.25 60.69 76.26 (+3.75)
基础 59.02 67.67 83.25 74.10 73.75 72.25 50.22 68.61 Qwen3.5-2B OPSD 59.44 67.00 79.58 69.70 75.00 68.75 43.76 66.18 VCSD (ours) 64.86 69.40 83.77 76.50 78.50 70.75 56.77 71.51 (+2.90)
基础 64.97 73.00 82.20 81.70 81.38 74.00 60.36 73.94 Qwen3.5-4B OPSD 64.44 71.40 84.29 77.60 82.75 78.75 58.22 73.92 VCSD (ours) 66.70 75.00 84.82 82.20 85.38 79.38 63.95 76.77 (+2.83)
基础 66.70 74.60 83.25 81.60 82.38 77.38 58.89 74.97 Qwen3.5-9B OPSD 67.65 72.27 87.96 78.80 81.50 78.12 56.80 74.73 VCSD (ours) 72.23 78.87 85.86 85.00 87.00 81.50 64.19 79.24 (+4.27)
(a) 合理性支撑 (b) 对比强度 (c) 锚点减少语言漂移 67.5 68 (%) 10 Acc Acc 8 65.0 66 锚点 6 62.5 64 by 4 60.0 2 62 减少 57.5 = 0 七基准 = 0.1 (ours) 七基准 0 60 漂移 30 60 90 120 150 0.00 0.50 1.00 1.25 1.50 2.00 10 30 50 70 90 训练步数 对比强度 训练步数
图3:在 Qwen3-VL-2B 上的消融研究。(a) 合理性支撑的影响。将目标塑造限制在合理性支撑集内可稳定长视距自蒸馏,而移除它会导致性能逐渐下降。(b) 对比强度的影响。当 α ∈[1, 1.5] 时,性能最强且具有局部鲁棒性,而较弱或较强的塑造会降低准确率。(c) 原始图像锚点的影响。将原始图像分布保留为锚点可显著减少训练期间的语言漂移。
这带来了 +2.15% 的整体增益,改进涵盖了通用感知、视觉数学、细粒度和高分辨率感知以及幻觉,而非由单一基准驱动。
这种优势在模型族和规模中持续存在。在所有六种配置中,VCSD 实现了最高的聚合准确率。在每个族中测试的最大规模下,它在 Qwen3-VL-8B 上仍比 OPSD 高出 +2.54%,在 Qwen3.5-9B 上高出 +4.51%。在 Qwen3.5 上的对比尤为明显,其中 OPSD 相比基础模型没有提供一致的增益,而 VCSD 改善了所有测试的规模。总之,这些结果表明,在评估设置下,输入条件非对称性提供了比特权答案 conditioning 更有效的自蒸馏信号:在匹配的视觉条件下,成对的预测足以驱动自我改进,而无需答案或证据提示。
8
第 9 页
表2:蒸馏散度的消融实验。我们在 Qwen3-VL-2B 上比较了前向 KL、反向 KL 和 JSD。前向 KL 始终表现最佳,支持我们选择用于蒸馏对比形状目标的模式覆盖目标。
散度 BLINK MMStar V∗ MathVista HR4K HR8K HalluB 准确率
前向 KL 57.29 63.73 78.01 66.10 77.25 73.25 53.68 67.04 JSD 57.08 62.33 76.44 65.70 75.37 73.00 53.86 66.25 反向 KL 56.92 61.07 76.44 64.00 73.62 70.50 50.86 64.77
4.3 合理性限制的影响
合理性支撑集限制了递归目标失真。图 3 (a) 比较了经过扩展训练后,有和无合理性支撑集情况下的七项基准准确率。条件对比可能会强烈倾向于那些在两种视觉条件下概率发生显著变化的 token,即使该 token 在原始图像下仍然不太可能。将目标塑造限制在原始图像预测的相对支撑范围内,可以确保对比仅在由观察到的输入支持的候选者之间重新分配概率。虽然两种变体在训练早期阶段表现相似,但无限制的目标(β = 0)随着持续的自蒸馏而稳步恶化,而合理性支撑集(β = 0.1)保持了稳定的性能。由于连续目标是基于更新后的模型递归构建的,这种日益扩大的差异表明,合理性支撑集减轻了自蒸馏更新中目标失真的累积。
4.4 对比强度的影响
适度的对比塑造是有效且局部鲁棒的。图 3 (b) 显示,性能在 α ≈ 1 时达到峰值,且在 α ∈ [1, 1.5] 范围内变化不到 1%。设置 α = 0 会移除条件对比,同时保持目标构建的其余部分不变;与 α = 1 相比,七项基准准确率下降了 2.33%。相反,将强度增加到 α = 2 会使性能降低到大约无对比的水平。综上所述,这些结果隔离了对比塑造的贡献,并表明其在适度范围内对精确值不敏感,但当其压倒原始图像目标时会退化。
4.5 蒸馏散度的影响
前向 KL 最有效地蒸馏了对比塑造的目标。表 2 在保持对比塑造目标和所有其他训练设置固定的情况下,比较了前向 KL、反向 KL 和 JSD。前向 KL 以 67.04% 的最高综合准确率获胜,比 JSD 高出 0.79%,比反向 KL 高出 2.27%,并在七项基准中的六项中排名第一。这种模式表明,在蒸馏视觉对比塑造的教师目标时,保持对完整目标分布的覆盖是有益的。
4.6 控制图像构建的影响
对比目标对确切的控制构建不敏感。表 3 比较了黑色、高斯噪声、高斯模糊和无图像控制,它们通过不同的干预措施移除特定实例的视觉内容。尽管产生了定性不同的控制输入,但这四种变体实现了相似的综合准确率。它们的共同属性是移除了特定实例的图像内容,这表明移除内容而非特定的退化过程是构建参考预测的关键要求。
4.7 原始图像锚点的影响
为了隔离原始图像锚点的作用,我们在目标分数中引入锚点系数 λ:
(17) a(λ)t (v) = λ log pJϕ,t(v) + αe∆t(v) = (λ + α) log pJϕ,t(v) −α log p0ϕ,t(v), v ∈St(β).
9
第 10 页
表3:控制图像构建的消融实验。我们比较了多种内容擦除控制图像,包括黑色图像( ours )、高斯噪声、高斯模糊和无图像。所有变体的平均准确率相似,表明对比信号对控制图像的选择具有鲁棒性。
配置 BLINK MMStar V∗ MathVista HR4K HR8K HalluB 准确率
高斯噪声 58.23 63.60 76.44 67.20 76.38 73.25 54.87 67.14 黑色(ours) 57.29 63.73 78.01 66.10 77.25 73.25 53.68 67.04 高斯模糊 55.65 62.87 78.01 66.00 76.88 73.88 51.25 66.36 无图像 57.23 62.93 74.87 63.10 76.38 72.88 56.31 66.24
表4:原始图像锚点的消融实验。Qwen3-VL-2B 在各基准上的结果;准确率(Acc.)为七个基准的平均值。
配置 BLINK MMStar V∗ MathVista HR4K HR8K HalluB 准确率
无锚点 58.71 62.93 75.92 67.00 76.38 73.12 53.43 66.78 VCSD(ours) 57.29 63.73 78.01 66.10 77.25 73.25 53.68 67.04
完整方法使用 λ = 1,恢复公式 9,而无锚点变体设置 λ = 0,同时保留相同的合理性支撑集。当 α = 1 时,其目标得分变为 log pJϕ,t(v)−log p0ϕ,t(v)。
锚点主要起到正则化生成的作用,而非提高整体准确率。表 4 显示,有锚点和无锚点的七个基准准确率相当,表明能力提升主要来自对比塑造。我们将语言漂移定义为包含非目标语言标记的 rollout 比例。图 3 (c) 显示,锚点在整个训练过程中降低了这种漂移,且在中间检查点处减少幅度最大。通过使塑造后的目标更接近原始预测,锚点提高了语言一致性,同时整体准确率基本保持不变。
4.8 训练动态
VCSD 保持一致的优势,且不易受到后期退化的影响。图 4 比较了同一运行中 VCSD 和 OPSD 在七个基准聚合以及 MMStar 和 MathVista 上的表现。在聚合指标上,VCSD 在每个评估的训练步骤中都高于 OPSD,且表现出较少的后期退化。在第一个评估步骤之后,VCSD 在 MMStar 上保持领先,而在 MathVista 上其准确率在整个训练过程中都更高。其准确率的变化范围也更窄,而 OPSD 表现出更明显的后期退化,特别是在 MathVista 上。这些轨迹表明,在评估设置下,VCSD 对持续训练更具鲁棒性。
4.9 定性分析
MathVista 提供了一个具体的场景,用于考察整体提升是否反映了对图像证据更准确的使用。案例研究将决定性修正定位到视觉计数上。图 5 展示了一个十进制方块问题,其答案取决于千位方块的数量。基础模型误解了位值方块并预测为 6169,而 OPSD 高估了千位方块的数量并预测为 8519。VCSD 正确识别出七个千位方块(顶部一行六个,下方一个),得出正确答案 7519。一旦恢复了这个基于图像的数值,剩余的位值计算便直接得出。此示例表明,条件对比将自蒸馏目标转向由实例特定视觉内容支持的候选项。
图 6 可视化了相同生成响应的学习到的图像依赖对比得分 ∆(v) = log p(v | I)−log p(v | Ictrl)。VCSD 将额外的对比集中在基于图像的证据上。基础模型和 OPSD 表现出高度相似的对比模式,而 VCSD 对屋顶、瓦片、食物、米色和标志等视觉概念赋予更强的正对比,同时抑制信息量较少的标记。底行隔离了相对于 OPSD 学习到的额外对比,显示这种变化局限于语义上有意义的视觉概念,而非均匀分布在序列中。这种模式支持了对比目标
第 11 页
七基准 MMStar MathVista 64 67 66 66 62 准确率 65 64 准确率 60 64 准确率 62 58 63 我们的方法 OPSD 56 OPSD 60 OPSD 62 10 50 90 130 10 50 90 130 10 50 90 130 训练步数 训练步数 训练步数
图 4:VCSD 和 OPSD 的训练动态。七基准聚合准确率(左)以及在 MMStar(中)和 MathVista(右)上的各基准准确率,均基于相同的训练过程。
Qwen3.5-2B 基础模型预测 6169(错误) 顶行:6 个大立方体 → 6,000。中间:1 个中等立方体,代表 100 → +100。底部:5 个平板,1 根长条,9 个单位 → 69。总计 = 6,169。
OPSD 预测 8519(错误) 大立方体(千位):顶部有 7 个,下方有 1 个,所以 7 + 1 = 8 个千位 → 8,000。 然后是 5 个平板(500),1 根长条(10),9 个单位(9)。总计 = 8,519。
VCSD(我们的方法)预测 7519(正确) 顶行有 6 个大立方体和下方 1 个 → 7 个千位立方体(7,000)。加上 5 问:显示的数字是多少? 个平板(500),1 根长条(10),以及 9 个单位(9)。总计 = 7,519。 真实值:7519
图 5:MathVista 上的定性比较(Qwen3.5-2B)。决定性的视觉数量是千位立方体的数量。红色标记基础模型和 OPSD 模型的错误计数;绿色标记 VCSD 使用的正确计数。
重塑操作将概率质量重新分配给图像依赖的 token,而不仅仅是放大现有的语言偏好。
5 结论
我们提出了 VCSD,它直接从匹配的视觉条件中构建策略自蒸馏(On-policy self-distillation (OPSD))所需的非对称性。在每个学生生成的前缀处,指数移动平均教师模型(Exponential Moving Average (EMA) teacher)分别在原始图像和内容擦除控制图像(Content-erased control)下进行评估。它们的 token 级对数概率对比在合理性支撑集(Plausibility support)内锐化了原始图像的分布,从而生成了信息丰富的全分布目标,无需外部教师、特权答案和视觉证据信号。在 Qwen3-VL 和 Qwen3.5 模型上,VCSD 一致地提升了视觉语言性能,优于相应的基础模型和匹配的 OPSD 基线。这些结果表明,模型自身条件预测的变化可以为自蒸馏提供有效的监督来源。
参考文献
Rishabh Agarwal, Nino Vieillard, Yongchao Zhou, Piotr Stanczyk, Sabela Ramos Garea, Matthieu Geist, and Olivier Bachem. On-policy distillation of language models: Learning from self-generated mistakes. In International Conference on Learning Representations, volume 2024, pp. 21246–21263, 2024.
Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, et al. Qwen3-vl technical report. arXiv preprint arXiv:2511.21631, 2025.
Walid Bousselham, Hilde Kuehne, and Cordelia Schmid. Vold: Reasoning transfer from llms to vision-language models via on-policy distillation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 26209–26218, 2026.
Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, et al. Are we on the right way for evaluating large vision-language models? Advances in Neural Information Processing Systems, 37:27056–27087, 2024.
11
第 12 页
图 6:Token 级别的图像依赖对比。同一响应在基础模型、OPSD 和 VCSD 下的对比分数。颜色越暖表示图像依赖偏好越强,底行展示了 VCSD 相较于 OPSD 额外学到的对比度。
Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, 和 Hao Zhou. 通过直接策略自蒸馏实现弱到强的泛化。arXiv 预印本 arXiv:2607.05394, 2026.
Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang, Xudong Lin, Dan Roth, Noah A Smith, Wei-Chiu Ma, 和 Ranjay Krishna. Blink:多模态大语言模型能看但不能感知。在欧洲计算机视觉会议 (ECCV) 中,页码 148–166。Springer, 2024.
Tianrui Guan, Fuxiao Liu, Xiyang Wu, Ruiqi Xian, Zongxia Li, Xiaoyu Liu, Xijun Wang, Lichang Chen, Furong Huang, Yaser Yacoob, 等。Hallusionbench:用于大视觉语言模型中纠缠的语言幻觉和视觉幻觉的高级诊断套件。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,页码 14375–14385, 2024.
Jonas Hübötter, Frederike Lückeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, 等。通过自蒸馏进行强化学习。arXiv 预印本 arXiv:2601.20802, 2026.
Sicong Leng, Hang Zhang, Guanzheng Chen, Xin Li, Shijian Lu, Chunyan Miao, 和 Lidong Bing. 通过视觉对比解码缓解大视觉语言模型中的物体幻觉。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,页码 13872–13882, 2024.
Xiang Lisa Li, Ari Holtzman, Daniel Fried, Percy Liang, Jason Eisner, Tatsunori B Hashimoto, Luke Zettlemoyer, 和 Mike Lewis. 对比解码:开放式文本生成作为优化。在第 61 届计算语言学协会年会论文集 (第 1 卷:长论文) 中,页码 12286–12312, 2023.
Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyuan Liu, 等。重新思考大语言模型的策略自蒸馏:现象学、机制与配方。arXiv 预印本 arXiv:2604.13016, 2026.
12
第 13 页
Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, 等. 面向视觉语言模型的视觉优势策略自蒸馏 (On-policy self-distillation (OPSD))。arXiv 预印本 arXiv:2605.21924, 2026.
Kevin Lu 和 Thinking Machines Lab. 策略自蒸馏 (On-policy distillation)。Thinking Machines Lab: Connectionism, 2025. doi: 10.64434/tml.20251026. https://thinkingmachines.ai/blog/on-policy-distillation.
Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, 和 Jianfeng Gao. Mathvista: 在视觉语境中评估基础模型的数学推理能力。在 International Conference on Learning Representations, 卷 2024, 页 23439–23554, 2024.
Qwen Team. Qwen3.5: 迈向原生多模态智能体, 2026年2月. URL https://qwen.ai/blog?id=qwen3.5.
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, 等. Deepseekmath: 推动开放语言模型中数学推理的极限。arXiv 预印本 arXiv:2402.03300, 2024.
Idan Shenfeld, Mehul Damani, Jonas Hübötter, 和 Pulkit Agrawal. 自蒸馏 (Self-distillation) 支持持续学习。arXiv 预印本 arXiv:2601.19897, 2026.
Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, 和 Tao Wang. V-zero: 基于对比证据门控的无答案标签策略自蒸馏用于细粒度视觉推理。arXiv 预印本 arXiv:2606.25319, 2026.
Kanghui Tian, Siyuan Liu, Ziang Yan, Sheng Xia, Shuai Dong, 和 Yi Wang. Vicur: 视觉线索作为多模态策略自蒸馏的可恢复特权。arXiv 预印本 arXiv:2606.05718, 2026.
Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, 和 Wenhu Chen. Vl-rethinker: 利用强化学习激励视觉语言模型的自我反思。Advances in Neural Information Processing Systems, 38:30865–30891, 2026a.
Kaishen Wang, Hengrui Gu, Meijun Gao, 和 Kaixiong Zhou. Damo: 通过累积激活动量解码以缓解视觉语言模型中的幻觉。在 The Thirteenth International Conference on Learning Representations, 2025a.
Kaishen Wang, Tong Zheng, Xuehao Cui, Ruibo Chen, Tianyi Xiong, 和 Heng Huang. 通过混合模式优势正则化缓解大型推理模型中的事实幻觉。arXiv 预印本 arXiv:2607.05861, 2026b.
Wenbin Wang, Liang Ding, Minyan Zeng, Xiabin Zhou, Li Shen, Yong Luo, Wei Yu, 和 Dacheng Tao. 分割、征服与结合:多模态大语言模型中高分辨率图像感知的免训练框架。在 Proceedings of the AAAI Conference on Artificial Intelligence, 卷 39, 页 7907–7915, 2025b.
Penghao Wu 和 Saining Xie. V*: 引导式视觉搜索作为多模态大语言模型的核心机制。arXiv 预印本 arXiv:2312.14135, 2023.
Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, 和 Nan Duan. 自蒸馏 RLVR。arXiv 预印本 arXiv:2604.03128, 2026.
Hee Suk Yoon, Eunseop Yoon, Jaehyun Jang, SooHwan Eom, Ji Woo Hong, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, 和 Chang D Yoo. 分解策略自蒸馏用于视觉语言推理:引导梯度进行视觉定位。arXiv 预印本 arXiv:2606.00564, 2026.
Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, 和 Yaojie Lu. Vision-opd: 通过策略自蒸馏学习多模态大语言模型的细粒度视觉能力。arXiv 预印本 arXiv:2605.18740, 2026.
13
第 14 页
Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, 和 Aditya Grover。 自蒸馏推理器:大语言模型的策略自蒸馏 (On-policy self-distillation)。arXiv 预印本 arXiv:2601.18734,2026。
Wenhong Zhu, Zhiwei He, Xiaofeng Wang, Pengfei Liu, 和 Rui Wang。弱到强偏好 优化:从弱对齐模型中窃取奖励。在国际学习表征会议 (International Conference on Learning Representations) 上,卷 2025,页码 37116–37144,2025。
A 注记 1 的证明
我们证明第 3.5 节中的注记 1。固定学生生成的前缀 $y_{<t}$,并将合理性支撑集 (Plausibility support) 简写为 $S_t = S_t(\beta)$。如公式 11 所示,令
$$ \frac{1[v \in S_t] p_{J_{\phi,t}}(v)}{\bar{p}_{J_{\phi,t}}(v)} = \frac{p_{J_{\phi,t}}(v)}{\sum_{u \in S_t} p_{J_{\phi,t}}(u)} \quad (18) $$
表示在 $S_t$ 上重新归一化的原始图像教师分布,并且如公式 12 所示,令
$$ r^{ist}_v(v) = e^{\Delta_t(v)} \quad (19) $$
表示隐式视觉证据奖励。
考虑在 $S_t$ 上的概率单纯形 $\Pi(S_t)$ 上的以下优化问题:
$$ \max_{q \in \Pi(S_t)} J_t(q) := \alpha \sum_{v \in S_t} q(v) r^{ist}_v(v) – \sum_{v \in S_t} q(v) \log \frac{q(v)}{\bar{p}_{J_{\phi,t}}(v)} \quad (20) $$
最大值的存在性与唯一性。由于教师分布是(温度缩放的)softmax 输出,对于每个 $v \in V$,$p_{J_{\phi,t}}(v) > 0$;因此,对于任意 $\beta \in [0, 1]$,对于每个 $v \in S_t$,$\bar{p}_{J_{\phi,t}}(v) > 0$。在约定 $0 \log 0 = 0$ 下,目标函数 $J_t$ 在 $\Pi(S_t)$ 上是有限且连续的;由于 $\Pi(S_t)$ 是紧致的,因此存在最大值点。对于唯一性,将目标函数分解为
$$ J_t(q) = \sum_{v \in S_t} q(v) \left( \alpha r^{ist}_v(v) + \log \bar{p}_{J_{\phi,t}}(v) \right) – \sum_{v \in S_t} q(v) \log q(v). \quad (21) $$
第一项关于 $q$ 是线性的,由于 $\bar{p}_{J_{\phi,t}}$ 在 $S_t$ 上严格为正,系数是有限的,而剩余项 $-\sum_{v \in S_t} q(v) \log q(v)$ 是 $q$ 的香农熵,它在 $\Pi(S_t)$ 上是严格凹的。因此 $J_t$ 是严格凹的,其最大值点是唯一的。
推导候选解。我们首先仅受限于归一化约束 $\sum_{v \in S_t} q(v) = 1$ 求解该问题,并随后验证在所得解处被忽略的非负约束 $q(v) \ge 0$ 是不起作用的。为归一化约束引入拉格朗日乘子 $\lambda$:
$$ F(q, \lambda) = \alpha \sum_{v \in S_t} q(v) r^{ist}_v(v) – \sum_{v \in S_t} q(v) \log \frac{q(v)}{\bar{p}_{J_{\phi,t}}(v)} + \lambda \left( \sum_{v \in S_t} q(v) – 1 \right). \quad (22) $$
对于每个 $v \in S_t$,平稳性条件为
$$ \frac{\partial F}{\partial q(v)} = \alpha r^{ist}_v(v) – \log \frac{q(v)}{\bar{p}_{J_{\phi,t}}(v)} – 1 + \lambda = 0. \quad (23) $$
重新排列可得
14
第 15 页
q(v) log = αrvist (v) + λ −1, (24) ¯pJϕ,t(v)
因此
q(v) = ¯pJϕ,t(v) exp αrvist (v) exp(λ −1). (25)
因子 exp(λ−1) 在所有候选项中共享,并由归一化确定。因此,
¯pJϕ,t(v) exp αrvist (v) q⋆t (v) = . (26) P u∈St ¯pJϕ,t(u) exp αrvist (u)
验证全局最优性。方程 26 右侧的每个因子均严格为正,因此对于所有 v ∈St,q⋆t (v) > 0,上述省略的非负约束被严格满足,因此在 q⋆t 处处于非活跃状态。结合方程 23 中的平稳性条件和原始可行性,q⋆t 满足方程 20 中问题的 Karush–Kuhn–Tucker (KKT) 条件,且非活跃非负约束的乘子为零。由于目标函数是凹的且所有约束均为仿射,KKT 条件是全局最优性的充分条件,因此 q⋆t 是方程 20 的最大值点;由上述建立的严格凹性可知,它是唯一的。直观上,任何最大值点都不能在 St 中的任何候选项上放置零质量,因为当 q(v) →0+ 时,∂Jt/∂q(v) →+∞。
与对比形状目标的等价性。对于 v ∈St,代入
pJϕ,t(v) ¯pJϕ,t(v) = (27) P u∈St pJϕ,t(u)
到方程 26 中,支持归一化常数同时出现在分子和分母中,因此相互抵消。我们得到
1[v ∈St] pJϕ,t(v) exp αe∆t(v) q⋆t (v) = . (28) P u∈St pJϕ,t(u) exp αe∆t(u)
这正好是方程 8 中的对比形状目标,从而证明了该结果。
对于 α > 0,目标函数的等价形式为
q⋆t = arg max Ev∼q rvist (v) −1 q ∥¯pJϕ,t . (29) q∈Π(St) αDKL
因此,增加 α 会赋予视觉证据奖励相对于 KL 正则化器更大的权重,而极限 α →0 则恢复支持归一化的原始图像教师分布。
15