VAD:多模态在线蒸馏中,如何让模型只学视觉真正支持的修正?

正视觉优势的盲区

多模态在线策略蒸馏中,特权视图教师提供的逐token修正混合了视觉信号、语言先验和教师特异性效应,导致学生无法分辨哪些修正真正由视觉证据支持。VAD通过反事实视觉干预——对比证据存在和证据移除两种视图——估计视觉证据方向的代理向量,将教师修正投影到该方向上得到视觉归因分量,并据此重建以学生为中心、分离支持与反驳分支的目标分布。实验在6个细粒度视觉基准上验证了方法的有效性,语义分析证实视觉归因分量显著富集视觉属性、物体和决策相关token。留出泛化测试表明VAD是唯一在两个模型尺度上均实现正增益的后训练方法。需要注意的是,当前归因方法仅实现语义富集而非可辨识分离,归因分量可能仍包含非视觉教师效应