RP-OPSD:如何用分辨率差异免费提升多模态大模型性能?

核心贡献:分辨率特权自蒸馏

多模态大模型在低分辨率下性能骤降,传统蒸馏方法成本高且存在分布偏移。本文提出RP-OPSD,利用同一图像的高/低分辨率视图构建教师-学生差距,通过在线自蒸馏提升细粒度视觉能力。实验显示该方法在Qwen3.5系列上显著提升性能,并实现1.78倍训练加速。注意:加速仅指训练阶段,且对非细粒度任务提升有限。

视觉对比自蒸馏:无需外部监督的自蒸馏新范式

VCSD 的核心洞察

多模态大模型自蒸馏面临目标信息量不足的难题。VCSD 通过对比原始图像与内容擦除控制图像下的教师预测分布,构建无需外部监督的自蒸馏目标。实验表明,该方法在多个基准测试中显著提升模型性能,且无需额外推理成本。注意:该方法需要生成擦除控制图像下的响应,训练成本增加。

OPSD-V:自回归视频长程退化问题的策略内自蒸馏解决方案

论文代表图:figure-01-p002-01

自回归视频生成器在长程生成中常出现误差累积、运动减弱和视觉伪影。OPSD-V通过策略内自蒸馏,利用真实长视频数据作为特权上下文,对少步生成器进行后训练。实验显示,该方法在MovieGenBench和MeiBench上显著提升了质量分数和动态程度,用户研究也证实其在运动质量和视觉质量上的优势。需注意语义匹配可能略有下降,且依赖高质量长视频数据。