CVPR三分钟
MedPlex:让文本在视觉编码全程持续参与,解决医学分割中的表征陈旧问题
MedPlex 提出双向融合(BiFusion)与概念锚定对比对齐,使文本在视觉编码全程持续参与表征学习,在多个 CT/MR 医学分割基准上取得最优结果。
概念引导:让扩散模型按概念精准发力,无需训练
提出 Concept Guidance (CoG),通过逐层互信息分析定位概念相关层,并以性能加权的多层跳层预测外推实现免训练、概念特定的 T2I 引导。
被放大不等于可预测:思维模型推理行为研究
本文提出 Behavioral Lift 指标,在 15,282 条推理轨迹上发现思维模型放大的行为(自我纠正、假设检验、不确定性承认)并非与正确性最相关的行为,而置信度校准等未被放大的行为才是最强正确性信号。
ForgeWM:少步因果世界模型如何兼顾低延迟交互与离线画质
ForgeWM 提出四阶段渐进训练框架,将双向动作条件视频生成器转化为 1/2/4 步预算专用的因果世界模型,并支持回放时细化以兼顾低延迟交互与离线画质。
Marionette:把几何交给渲染器,把外观留给扩散模型
Marionette 将交互式游戏世界模型分解为显式 276 维关节世界状态预测、零参数确定性图形桥渲染和外观视频扩散三部分,使几何与遮挡由构造保证精确,控制通过覆写单个动作 token 实现。
见红思坏:视觉语言模型中的颜色偏差
该论文提出 Stealth Visual Prompts 方法,系统研究文本渲染中的颜色与对比度等视觉样式变化如何在不改变语义内容的情况下影响 VLM 的情感分析与 VQA 行为。
ImageNet 验证集到底错在哪:从单标签到多标签定位的重标注
对 ImageNet-1k 验证集进行从零开始的多标签定位重标注(ReImageNet),揭示约 12% 原始标签错误、33.3% 图像为多标签,并证明标注错误会结构性传播至衍生基准。