TASQ:扩散模型量化为什么不该所有步骤用同一种精度?
TASQ的关键洞察是:存储精度和运行精度可以解耦。它始终保存一份完整的8比特权重,但通过一个可学习的Temporal-Spatial LSB Mask,在每个去噪阶段和每一层动态决定实际使用几个低位。噪声大的阶段保留更多比特,噪声小的阶段大胆丢弃低位。这样既不用存多份权重,又能让计算量跟随实际需求变化。
TASQ的关键洞察是:存储精度和运行精度可以解耦。它始终保存一份完整的8比特权重,但通过一个可学习的Temporal-Spatial LSB Mask,在每个去噪阶段和每一层动态决定实际使用几个低位。噪声大的阶段保留更多比特,噪声小的阶段大胆丢弃低位。这样既不用存多份权重,又能让计算量跟随实际需求变化。
提出首个支持无界长序列前端跟踪与后端联合位姿-几何优化的几何Transformer SLAM系统,通过记忆条件设计实现17km级城市重建。
对六款VLM在脑MRI上的审计表明,模型几乎回答所有问题且高度自信,但校准极差,准确率最高的模型在其错误上最为过度自信,医疗微调提升了肿瘤检测却未改善置信度可靠性。
该论文提出了FoR-T2I基准,通过1200对受控的相机视图与物体参照系提示,系统评估并揭示了22个主流T2I模型在理解空间方向时普遍存在的参照系混淆问题。
提出Weighted Diversity Score (WDS)量化DiT块间表示多样性,并基于此设计DiverseDiT++框架,通过长残差连接和表示多样性损失提升生成质量。
Qwen-3D通过3D旋转位置编码和基于掩码的解码器,将多视图几何信息直接融入Qwen视觉语言模型,在统一的架构中实现了领先的3D和2D视觉语言任务性能。
提出统一3D多模态框架Hunyuan3D-Buffalo 1.0,结合自回归VLM与扩散DiT,在87M样本上实现3D理解、文生3D、指令编辑与部件生成,并在多项基准上达到领先水平。
提出EOVSAM,将SAM 3改造为无需提示的掩码生成器,并通过Attentional Aggregation实现端到端的单次前向开放词汇分割,在精度和速度上均显著优于原始SAM 3。