计算机视觉
SCI-CLIP:用分割区域统一推理粒度,免训练开放词汇分割的新框架
提出SCI-CLIP,一种免训练的开放词汇分割框架,通过将分割区域作为统一的推理单元,约束特征交互、重建密集特征并融合参考记忆,解决了现有方法中特征传播、上下文恢复和检索校正粒度不一致的问题。
XEWorld:动作条件世界模型真的学会了物理,还是只记住了外观?
本文构建了跨形态测试平台XEWorld,系统性地揭示了当前动作条件世界模型本质上是2D视觉模式匹配器,其跨形态泛化能力受视觉相似性而非物理运动学相似性主导。
EmoWorld:解耦情感场,让视频生成的情绪控制不再“一锅粥”
现有方法要么控制结构,要么控制运动,但没有人把“情感”本身当作一个可以拆解的复合维度。EmoWorld 的核心洞察是:情感不是单一变量,而是一个由氛围场、语义场和时序场组成的复合结构。只有把这三个场解耦开来,分别设计控制手柄,才能真正实现精细的情绪调节。
文本引导医学分割为什么需要频域?DD-CMD 的双域解码逻辑
提出 DD-CMD,在解码阶段同时利用空间域文本引导交叉注意力(TGSA)和频域谱-文本自适应调制(STAM),以粗到细方式实现临床文本引导的肺部感染分割。
SR-JEPA:物体完全删除后,预测通路到底补全了什么?
SR-JEPA 是一个原生点云 JEPA 模型,其冻结的预测通路可在物体完全删除后,通过固定查询补全缺失实体的语义身份,并表明该身份可与几何信息组合以支持下游结构决策。
In-Context Forcing:用递减噪声上下文打破自回归视频扩散的细节复制陷阱
提出一种渐进式自回归范式 In-Context Forcing,通过为历史帧施加递减的噪声水平提供自适应引导,解决现有少步自回归视频扩散模型中因依赖干净帧导致的局部细节泄露和时序动态退化问题。
Grad-CAM遇上ViT:一次系统审计揭示的可解释性模糊地带
本文对175篇将Grad-CAM应用于ViT的论文进行系统审计,发现大多数研究未充分说明特征提取位置、梯度目标等关键适配选择,并提出统一分类法以明确方法模糊性。
APQF:当大语言模型学会为深度网络“体检”并自动压缩
问题的根源在于,压缩决策与层敏感度测量是脱节的。现有的剖析工具能告诉你每层有多敏感、计算量有多大,但如何将这些数据转化为具体的剪枝比例和量化位宽,仍然依赖工程师的经验判断。APQF 的核心洞察是:大语言模型恰好擅长阅读结构化数据并做出规划。如果把剖析报告以文本形式提供给 LLM,它就能像一位经验丰富的压缩工程师那样,为每一层量身定制压缩方案。