快速导读:VAD通过反事实视觉干预估计教师修正中可归因于视觉证据的部分,并据此重建以学生为中心的学习目标,从而解决多模态在线蒸馏中源混合监督的问题。
在多模态在线策略蒸馏(On-Policy Distillation, OPD)中,特权视图教师能够访问更丰富的视觉信息,因此可以在学生生成的每个token位置提供修正信号。然而,这些修正信号天然是“源混合”的——它们同时包含了视觉证据、语言先验以及教师自身的特异性偏好。现有方法如Vision-OPD直接匹配教师的完整分布,VA-OPD和V-Zero通过视觉优势加权选择token或轨迹,但均未显式估计修正中可归因于视觉干预的部分。更关键的是,正视觉优势可能遗漏视觉反驳信号:当揭示相关视觉证据时,学生的错误token可能被抑制,概率质量应流向正确的替代选项。
VAD(Visual Evidence Attribution for Target Reconstruction)的核心洞察是:与其直接使用源混合的教师修正,不如先估计其中可归因于视觉证据的分量,再据此重建学习目标。该方法通过反事实视觉干预——在同一学生生成前缀上,使用同一固定教师评估证据存在和证据移除两种视图——计算中心化对数概率的差异作为视觉证据方向的代理向量,然后将完整教师修正投影到该方向上得到视觉归因分量,最终重建一个以全图学生分布为中心、分离支持与反驳分支的目标分布。
英文题目:VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
论文出处:arXiv 每日论文精选 · arXiv:2607.28590
原始论文:PDF / 论文页面
这篇论文解决什么问题?
多模态OPD的标准流程是:学生模型基于全图生成下一个token的分布,特权视图教师(可访问裁剪区域或高分辨率视图)在同一前缀上评估其分布,两者之间的差异构成修正信号。问题在于,这个修正信号是多种因素混合的结果。教师可能因为看到了更清晰的视觉细节而给出不同判断,也可能因为其语言先验与学生的语言先验不同而产生分歧,还可能因为教师自身的训练偏差而表现出特异性偏好。
现有方法对这一问题的处理存在明显不足。Vision-OPD(第3页)直接匹配证据存在视图下的完整教师分布,将源混合信号全部作为学习目标。VA-OPD(第3页)使用视觉优势对token或轨迹进行加权,但保留源混合目标;VAD指出其正视觉优势可能遗漏反驳信号——当视觉证据不支持学生的错误token时,正确的做法是抑制该token并将概率重新分配给正确选项,而不仅仅是放大支持信号。V-Zero(第3页)采用对比证据门控进行轨迹级筛选,粒度较粗。Decomposed OPD和Anchored Residual OPD(第3页)分别从分解和残差角度处理特权指导,但均未直接估计修正中可归因于视觉证据变化的分量。
VAD提出的核心问题是:在教师提供的逐token修正中,哪些部分真正由视觉证据的变化所解释?这个问题此前未被显式提出,更未被系统解决。回答它需要一种方法,能够在保持文本上下文不变的前提下,隔离视觉输入变化对教师判断的影响。
此外,VAD还识别出一个更深层的需求:学习目标应该以学生为中心,而非以教师为中心。即使我们成功估计了视觉归因分量,直接将其作为目标可能导致学生偏离自身的分布特性。因此,目标重建需要将视觉归因分量锚定到学生的全图分布上,形成学生能够有效吸收的监督信号。
核心创新
- 提出视觉修正归因问题,通过反事实视觉干预估计教师修正中可归因于视觉证据的分量。
- 设计基于投影的视觉归因方法,将教师修正分解为视觉对齐分量和代理未解释残差。
- 重建以学生为中心的目标分布,并分离视觉支持与反驳分支,实现预算控制。
- 引入弱特权教师正则项,稳定优化过程,防止语言漂移。
方法概览
VAD在每步学生生成前缀上,使用同一固定教师评估证据存在和证据移除两种视图,计算中心化对数概率的差异作为视觉证据方向的代理向量ut。将完整教师修正rt投影到ut上得到视觉归因分量rvis_t,并基于此重建一个以全图学生分布为中心、分离支持与反驳分支的目标分布qVAD_T,t。训练时以该目标为主监督信号,辅以弱特权教师正则项。
- 反事实视图构建(第4页,图2a):在每步学生生成前缀上,学生基于全图产生下一个token的分布。同时,使用同一固定教师评估两个视图——证据存在视图(如裁剪区域或高分辨率视图)和证据移除视图(如模糊或遮挡对应区域)——在完全相同的文本上下文下。这确保了教师判断的差异仅来源于视觉输入的变化。
- 视觉证据方向估计(第4页,图2b):对证据存在和证据移除两种视图,分别计算教师对词汇表中每个token的中心化对数概率(减去均值后的对数概率),然后取两者的差值向量ut。这个差值向量作为视觉证据方向的干预衍生代理,反映了视觉信息变化如何影响教师对各token的相对偏好。
- 修正归因投影(第4页):将完整的教师修正rt(即证据存在视图下教师分布与学生全图分布的差异)投影到视觉证据方向ut上,得到视觉归因分量rvis_t = (rt·ut / ||ut||²) ut。残差rres_t = rt – rvis_t代表代理未解释的部分,可能包含语言先验差异和教师特异性效应。
- 学生锚定目标重建(第4-5页):以全图学生分布为中心,将视觉归因分量rvis_t分解为支持分支(正分量,表示视觉证据支持的token)和反驳分支(负分量,表示视觉证据反对的token),分别构建目标分布的两个组成部分。最终目标qVAD_T,t是这两个分支的加权组合,权重由超参数τ+控制。
- 分支感知预算控制(第5页):支持分支和反驳分支分别使用不同的温度参数,允许对两种信号进行非对称的强度控制。反驳分支的存在是VAD区别于仅使用正视觉优势方法的关键——它能够显式建模视觉证据对错误token的抑制作用。
- 弱特权教师正则项(第5页):除主目标qVAD_T,t外,引入一个弱正则项,鼓励学生分布与证据存在视图下的教师分布保持一定的一致性。正则项强度由超参数λ控制,防止学生在视觉归因信号稀疏时发生语言漂移。
- JSD监督散度(第5页):训练时使用Jensen-Shannon散度(JSD)作为学生分布与重建目标之间的损失函数。消融实验(表4,第11页)比较了JSD、前向KL和反向KL,JSD在4B和9B尺度上均表现最优。
- 训练效率(表5,第16页):VAD的训练开销与Vision-OPD相当,在H800硬件上4B模型每步约需额外的前向传播计算两种教师视图,但总体步时增加有限,9B模型每步约增加10-15%的时间成本。
逐图理解论文
正视觉优势的盲区

图1展示了VAD的动机和概览。(A)说明强师生分歧不等于视觉解释力强——教师修正可能主要来自语言先验差异。(B)展示正视觉优势的盲区:揭示视觉证据可能抑制错误token并将概率导向正确选项,这是反驳信号的价值。(C)概述VAD的三步流程:干预衍生代理、视觉归因投影、学生锚定目标重建。
研究空白:源混合监督

图2详细展示VAD的方法架构。(a)反事实视图构建:同一学生前缀下,教师评估证据存在和证据移除两种视图,文本上下文保持不变。(b)修正归因:视图对比定义视觉证据方向代理ut,将完整修正rt投影得到视觉归因分量rvis_t和残差rres_t。
归因有效性的证据

图3验证视觉归因的语义分离效果。(a)三类方向中视觉属性、物体和决策token的相对占比对比,rvis_t显著富集。(b)代表性token级别的分量得分示例。(c)rvis_t中高幅值token的词汇分布,集中在视觉描述和决策相关词。
实验如何设计?
- 评估基准:6个细粒度视觉基准,包括V*(需要视觉搜索)、Zoom(需要缩放推理)、HR-Bench 4K和8K(高分辨率理解)、MME-RealWorld EN和CN(真实场景理解)。所有评估使用统一的官方评测流程。
- 模型尺度:基于Qwen3.5系列,在4B和9B两个尺度上进行实验。表中同时列出跨模型族的能力参考(如Gemini、GPT-5.2),但仅作参考而非控制比较。
- 训练数据:合成VQA示例,所有对比方法使用匹配的数据和后训练预算,确保公平比较。
- 对比基线:Vision-OPD(直接匹配特权教师分布)、VA-OPD(视觉优势加权)、V-Zero(对比证据门控),以及VAD的多个消融变体。
- 泛化测试:在4个留出基准(MMVP、CV-Bench、MMStar、POPE)上评估后训练模型的通用能力保持,使用各基准的原生指标。
- 语义分析:对视觉归因分量rvis_t、完整修正rt和残差rres_t进行token级别的语义类别标注,分析视觉属性、物体/内容和决策相关token的相对占比。
关键结果与论文证据
- 整体性能(表1,第7页):VAD在4B和9B尺度上Avg6分别达到78.32和79.93,比最佳尺度匹配基线分别高2.40和2.80个百分点。在6个基准中的5个上取得最优或次优结果。
- 语义分离验证(图3,第8页):视觉归因分量rvis_t中视觉属性、物体/内容和决策token的top-5相对占比达42.0%,而完整修正rt中为26.7%,残差rres_t中仅17.7%。这证实投影操作有效富集了视觉相关语义。
- 离线token效应分析(图4,第10页):VAD目标qVAD_T对正确答案的支持提升7.89个百分点,对错误答案的抑制提升6.61个百分点,优于直接匹配、标量缩放和单边投影等替代目标。
- 留出泛化(表3,第10页):VAD在4B和9B上Avg4分别达79.14和82.62,是唯一在两个尺度上均实现正Δ(+0.24和+0.23)的后训练方法。这表明视觉归因目标重建不会损害通用能力。
- 消融实验(表2,第9页):分支感知目标重建(分离支持与反驳分支)带来1.00点Avg6提升,弱正则项进一步带来0.26点提升。两者合计贡献了VAD相对于简单投影方法的主要增益。
- 超参数敏感性(图5,第10页):λ在0.05-0.2范围内表现稳定,τ+在0.5-1.5范围内对性能影响较小,表明方法对超参数选择具有较好的鲁棒性。
- 散度函数选择(表4,第11页):JSD在两个尺度上均优于前向KL和反向KL。前向KL倾向于模式覆盖,反向KL倾向于模式寻求,JSD在两者之间取得平衡,更适合目标重建场景。
- 高幅值token分析(图3c,第8页):视觉归因分量中高幅值token的词汇分布主要集中在视觉描述词(颜色、形状、空间关系)和决策相关词(肯定/否定判断词),进一步验证了归因的语义有效性。
阅读时需要注意
- 组合性证据偏差:每次干预仅由单一视图对的对比向量表示,当视觉证据涉及多个区域或属性的组合时,单一对比向量可能无法完整捕获组合性证据的效应。
- 非可辨识分离:当前投影操作仅实现语义富集而非可辨识分离,归因分量可能仍包含与视觉相关的非视觉教师效应(如教师对特定视觉模式的系统性偏好),残差仍为源混合。
- 合成数据依赖:训练数据为合成VQA示例,不保证在所有真实场景下的泛化性能,特别是对于需要复杂视觉推理的长尾场景。
- 超参数需调整:λ和τ+的最优值可能因模型尺度和训练数据分布而异,实际部署时需要针对具体设置进行调整。
关联工作
- Vision-OPD(第3页)是VAD的直接前身,它直接匹配证据存在视图的完整教师分布。VAD在此基础上进一步归因并重建目标,可以视为Vision-OPD的原则性改进。
- VA-OPD(第3页)使用视觉优势加权token或轨迹,VAD指出其仅使用正视觉优势可能遗漏反驳信号,并通过分离支持与反驳分支来解决这一问题。
- V-Zero(第3页)采用对比证据门控进行轨迹级筛选,VAD则进行更细粒度的token级目标重建,两者在粒度上互补。
- Decomposed OPD和Anchored Residual OPD(第3页)分别从分解和残差角度处理特权指导,VAD的投影归因方法提供了另一种正交的视角。