视觉token何时变成文本:用跨模态残差找出真正该留的视觉信息

研究缺口

提出训练无关的视觉token压缩方法SIEVE,通过跨模态残差(CMR)量化视觉token中无法被文本子空间解释的信息,结合注意力相关性与残差空间多样性选择,在多个VLM上以11.1%的token保留率实现显著加速。

Stream Forcing:用统一训练轨迹解决流式视频生成的训练-推理错位

核心区分与研究空白

提出 Stream Forcing,将训练噪声级采样重构为帧索引随机过程,通过联合校准与时间相关采样构建从独立采样到推理一致采样的连续课程训练轨迹,以平衡训练覆盖与推理一致性。

显著性模型真的学会了看人吗:一个空白中心图为何胜过所有训练网络

论文代表图:figure-01-p010-01

该研究从受众侧审计了主流显著性模型,发现一个无训练的中央高斯图在新闻照片上胜过所有训练网络,且模型剩余精度存在年龄、种族和意识形态偏见,并提出用群体凝视签名判断哪些受众可被模型学习。