视觉token何时变成文本:用跨模态残差找出真正该留的视觉信息 12 8 月, 2026 作者 PengChao 提出训练无关的视觉token压缩方法SIEVE,通过跨模态残差(CMR)量化视觉token中无法被文本子空间解释的信息,结合注意力相关性与残差空间多样性选择,在多个VLM上以11.1%的token保留率实现显著加速。