少看快想:多模态大语言模型的联合Token-计算自适应推理
多模态大语言模型推理成本高,现有方法如FastV或AdaLLaVA仅独立优化Token剪枝或层跳过,忽略视觉密度与LLM容量的耦合。本文提出SmartVL,联合控制视觉Token数、Transformer层数及注意力头组。通过可微延迟估计器和非对称损失,在VQAv2等基准上,50%预算下准确率显著优于基线。需注意不同任务最优配置差异,且FLOP节省需硬件支持才能转化为实际加速。
多模态大语言模型推理成本高,现有方法如FastV或AdaLLaVA仅独立优化Token剪枝或层跳过,忽略视觉密度与LLM容量的耦合。本文提出SmartVL,联合控制视觉Token数、Transformer层数及注意力头组。通过可微延迟估计器和非对称损失,在VQAv2等基准上,50%预算下准确率显著优于基线。需注意不同任务最优配置差异,且FLOP节省需硬件支持才能转化为实际加速。