SCI-CLIP:用分割区域统一推理粒度,免训练开放词汇分割的新框架

论文代表图:figure-02-p008-01

提出SCI-CLIP,一种免训练的开放词汇分割框架,通过将分割区域作为统一的推理单元,约束特征交互、重建密集特征并融合参考记忆,解决了现有方法中特征传播、上下文恢复和检索校正粒度不一致的问题。

EmoWorld:解耦情感场,让视频生成的情绪控制不再“一锅粥”

核心区分

现有方法要么控制结构,要么控制运动,但没有人把“情感”本身当作一个可以拆解的复合维度。EmoWorld 的核心洞察是:情感不是单一变量,而是一个由氛围场、语义场和时序场组成的复合结构。只有把这三个场解耦开来,分别设计控制手柄,才能真正实现精细的情绪调节。

In-Context Forcing:用递减噪声上下文打破自回归视频扩散的细节复制陷阱

方法贡献与验证

提出一种渐进式自回归范式 In-Context Forcing,通过为历史帧施加递减的噪声水平提供自适应引导,解决现有少步自回归视频扩散模型中因依赖干净帧导致的局部细节泄露和时序动态退化问题。

APQF:当大语言模型学会为深度网络“体检”并自动压缩

APQF 如何实现自动化压缩

问题的根源在于,压缩决策与层敏感度测量是脱节的。现有的剖析工具能告诉你每层有多敏感、计算量有多大,但如何将这些数据转化为具体的剪枝比例和量化位宽,仍然依赖工程师的经验判断。APQF 的核心洞察是:大语言模型恰好擅长阅读结构化数据并做出规划。如果把剖析报告以文本形式提供给 LLM,它就能像一位经验丰富的压缩工程师那样,为每一层量身定制压缩方案。