PengChao
视觉token何时变成文本:用跨模态残差找出真正该留的视觉信息
提出训练无关的视觉token压缩方法SIEVE,通过跨模态残差(CMR)量化视觉token中无法被文本子空间解释的信息,结合注意力相关性与残差空间多样性选择,在多个VLM上以11.1%的token保留率实现显著加速。
Gaussian Sculpting:把高斯从渲染工具变成几何雕刻刀
提出 Gaussian Sculpting,一种将受约束高斯锚定在可微演化网格上、以双层优化引导 SDF 场优化的端到端表面重建框架。
UniProbe:把 LVLM 内部计算轨迹变成可学习的幻觉检测器
UniProbe 从冻结 LVLM 的单次前向传播中构建计算轨迹图,并用 GNN、ViT、GRU 交替模块进行令牌级幻觉检测与解码期缓解。
Stream Forcing:用统一训练轨迹解决流式视频生成的训练-推理错位
提出 Stream Forcing,将训练噪声级采样重构为帧索引随机过程,通过联合校准与时间相关采样构建从独立采样到推理一致采样的连续课程训练轨迹,以平衡训练覆盖与推理一致性。
4D-WAM:用几何一致性让世界模型真正理解驾驶场景
4D-WAM 通过训练时引入几何基础模型的 4D 一致性监督与决策导向时间步采样,使世界-动作模型能够预测物理一致的 4D 场景并提升轨迹规划性能。
MAD-HOI:连续潜在空间如何让文本驱动手物交互既平滑又能自由补全
MAD-HOI 提出一种结合连续潜在空间与掩码自回归扩散的框架,实现文本驱动的可变长度、复合、可补全/填充且自动终止的手-物交互运动生成。
空间思维链:把3D几何蒸馏进VLM的潜在token,不加重推理负担
提出 Space Tokens 框架,将场景级 3D 几何与物体中心空间属性蒸馏为连续潜在 token,在不增加推理模块的前提下提升 VLM 空间推理能力。
显著性模型真的学会了看人吗:一个空白中心图为何胜过所有训练网络
该研究从受众侧审计了主流显著性模型,发现一个无训练的中央高斯图在新闻照片上胜过所有训练网络,且模型剩余精度存在年龄、种族和意识形态偏见,并提出用群体凝视签名判断哪些受众可被模型学习。
P2Voxel:用“表面证据采样”重新定义三维网格标记化
提出P2Voxel框架,将网格标记化重新定义为局部表面证据采样,通过枢轴点和方向符号紧凑表示体素,并利用金字塔自适应分配实现高效、可重建的网格标记化。