测试时原型自适应:一个与模型架构无关的开放词汇分割即插即用模块
提出一种无需训练的即插即用模块TPA,在测试时利用少量无标签部署域图像构建DINO特征原型库,通过余弦相似度查找与主机logits线性融合,以输出级操作一致提升多种OVSS模型的精度。
提出一种无需训练的即插即用模块TPA,在测试时利用少量无标签部署域图像构建DINO特征原型库,通过余弦相似度查找与主机logits线性融合,以输出级操作一致提升多种OVSS模型的精度。
本文评估了三种生成式视觉语言模型在三个机构胸部X光数据集上的参考标准一致性,发现错误模式随机构、发现和提问方式显著变化,并严格验证了在排除目标机构数据的情况下,自适应选择估计器未能优于简单的固定策略。
SpikeWorld的核心洞察在于一个关键区分:适应环境变化,不一定非要动模型参数。论文提出,我们可以把“世界知识”和“当前偏移状态”彻底分开——前者冻结在脉冲Transformer的参数里,后者放在一个轻量的外部模块中。这个外部模块不看环境真值,只靠预测下一帧的误差来驱动更新。这样一来,模型对相同输入给出的语义输出,比特级完全不变。
提出BRACE,一种无需训练的基于重心有理外推的特征预测框架,通过直接聚合稀疏历史特征来替代导数驱动的多项式外推,以稳定处理DiT特征轨迹中的尖锐不规则性,实现高质量加速推理。
提出PhyS三阶段框架,通过构建物理交互数据集PhyS-120K、物理感知微调与蒸馏、以及时序信用路由(TCR)在线强化学习,提升流式世界模型长时推演的物理合理性。
提出一种无需训练、基于维纳滤波的表示编辑方法,通过离线估计真实与幻觉表示的协方差结构,将校正算子吸收到模型权重中,从而在推理时零成本地抑制视觉语言模型的对象幻觉。
提出ComplexityWorld基准,通过390个任务评估VLM从多样化视觉场景中恢复约束并构建全局有效结构化决策的能力,揭示出显著的视觉到决策瓶颈。
提出 InsertFuse 框架,通过分离类别专家训练与跨类别能力整合,并引入 Token-Aligned Geometry Conditioning (TAGC)、Region-Balanced Flow Matching 和 Reference CFG,解决了多类别图像插入中的任务冲突与精细控制难题。