档案胶片修复:DART如何用显式掩码避免误删场景结构

DART方案:显式掩码与条件调制

档案胶片修复面临划痕、灰尘等复合退化,且缺乏干净参考。现有方法常将场景中的细线结构(如栏杆)误认为划痕而抹除。DART通过显式预测软缺陷掩码,并结合AdaLN-Zero进行条件调制,有效区分损伤与内容。本文详解其核心机制与实验验证。

KroQuant:用Kronecker结构破解DiT W4A4量化难题

直觉与失败

DiT模型的W4A4 PTQ因激活Outliers导致质量下降,且AdaLN层使传统离线吸收技巧失效。KroQuant提出一种基于Kronecker积的可学习块对角激活变换,结合LoRaQ权重校正,在保持推理速度的同时显著提升图像质量。实验表明,该方法在PixArt-Σ、SANA和FLUX.1-schnell上均优于基线。需注意,该方法依赖支持MXFP4格式的硬件,且在线变换增加了计算开销。

MLLM空间推理幻觉怎么破?Geo3R用几何卡片给出答案

方法贡献

多模态大模型常因2D图像缺乏深度信息而产生空间推理幻觉。Geo3R提出一种无需训练的框架,通过提取相机、世界及物体局部坐标系下的几何证据,构建结构化卡片辅助推理。实验显示其在透视、朝向和视点变化场景下显著优于基线。需注意其性能受限于上游几何估计工具的精度。

ReMo:无需训练的 Omni-LLM 视觉 Token 压缩与语义重分布

ReMo 方案:投影、剪枝与文本代理

Omni-LLM 处理音视频时,视觉 Token 冗余严重导致计算瓶颈。ReMo 提出无需训练的压缩框架,通过 Cross-modal Projection 对齐音频与视觉空间,利用 Residual Saliency 剪枝冗余 Token,并引入 Text Proxy 保留对象语义。实验显示其在 Qwen2.5-Omni 和 Qwen3-Omni 上均超越全 Token 模型准确率,同时大幅降低延迟。需注意其依赖离线投影和检测器词汇表。

视频编辑为何失效?ElasticTTT解决先验崩溃问题

方法贡献

扩散模型在视频编辑中常因测试时微调(TTT)导致先验崩溃,表现为忽略指令或破坏未编辑区域。ElasticTTT通过TDR、Contrastive CFG和Async-NS三大机制,在保留源视频结构的同时实现精准编辑。实验显示其在VLM评估中表现最佳,但需注意超参数敏感性。

扩散模型推理加速:PSP如何通过剪枝超越BoN?

PSP的核心创新

扩散模型的推理时间扩展长期滞后于LLM。本文提出PSP(Progressive Seed Pruning),通过初期大量种子探索与渐进剪枝,解决BoN等方法计算浪费问题。实验显示PSP在GenEval和人类评估中均优于基线,且计算开销极低。注意:PSP依赖奖励模型信号,对细粒度美学优化增益有限。

机器人VLA为何“偷懒”?因子偏差诊断与偏差感知数据收集策略解析

直觉与失效案例

预训练机器人策略常因过度依赖颜色等主导因子而忽略动词或尺寸,导致组合泛化失败。本文提出FDR/FDH指标量化这种“因子偏差”,并据此设计偏差感知数据收集策略。实验表明,该策略在ManiSkill仿真与UR5真机实验中,以半数演示显著提升了成功率。需注意,评估依赖VLM裁判且限于桌面操作场景。

SDM:如何从冻结特征中解耦相机与物体运动

SDM方法:主残差分解

视频帧间变化常混淆相机运动与物体运动。本文提出SDM,通过主/残差令牌结构化解耦动态。在ProbeMotion基准上,其表现优于DeltaTok并接近VGGT。注意:长程外推存在漂移,且依赖合成数据弱监督。

GraphVid:用交互图取代轨迹,实现高效可控视频生成

论文代表图:figure-01-p001-01

可控视频生成常受限于轨迹方法的复杂度和数据需求。GraphVid通过构建有向交互场景图,利用Edge-Aware Graph Reasoning模块捕捉对象间关系动态,并通过LoRA适配器注入冻结的DiT骨干网络。实验显示其在MoveBench上优于Wan-Move等基线,推理速度提升显著。需注意其对小目标检测的依赖及上下文窗口限制。

3D点云分割:为何简单CE损失比复杂重加权方法更稳健?

直觉与反例

在2D视觉中,Focal Loss等不平衡缓解方法效果显著,但在3D点云分割中,它们往往不如简单的交叉熵损失(CE)。本文通过损失景观拓扑分析,揭示了这一现象背后的几何原因:极端不平衡数据导致狭窄的解空间,激进重加权会破坏决策边界稳定性。研究建议从业者优先使用标准CE,避免盲目引入复杂损失函数。