问两次,看两次:提示回音解决视觉语言模型中的“问题优先”悖论
本文揭示了视觉语言模型(VLM)中“问题优先”(Question-First)提示导致性能下降的悖论。通过Logit Lens和因果注意力阻断实验,我们发现问题优先虽能引导感知,但因距离过远导致下游读取失败。为此,提出无需训练的提示回音策略(Question Echoing和Image Echoing),在Qwen3-VL等模型上显著恢复并超越基线性能。
本文揭示了视觉语言模型(VLM)中“问题优先”(Question-First)提示导致性能下降的悖论。通过Logit Lens和因果注意力阻断实验,我们发现问题优先虽能引导感知,但因距离过远导致下游读取失败。为此,提出无需训练的提示回音策略(Question Echoing和Image Echoing),在Qwen3-VL等模型上显著恢复并超越基线性能。