TARS:无3D重建的视频重拍,时间步感知如何让数据规模化?

方法:时间步感知的数据规模化

视频重拍摄想让镜头动起来,但3D重建又慢又容易崩,配对数据又太少。TARS发现了一个关键洞察:扩散模型去噪时,高噪声步管全局结构和视角,低噪声步管纹理细节。于是它用单视频切两段做自监督学习,大规模训练重拍先验,再只在最关键的高噪声步用少量配对数据微调。结果在相机精度和视角控制上大幅超越3D方法和配对学习方法。当然,极端动态场景下的表现和MLLM生成描述的精度仍是潜在瓶颈。

FeatFix:缓存扩散模型里,验证过的精确特征为何要丢弃?

一个具体的浪费场景

扩散模型推理慢,训练免缓存加速器通过复用或预测中间特征来减少计算,但会引入近似误差。部分方法引入验证步骤计算精确特征来监控漂移,却算完就扔,从未想过用这些已经付过计算代价的精确特征来当场校正草稿状态。FeatFix 提出“验证即复用”原则,在固定的层-时间步验证点,将已计算的完整块输出直接替换草稿输出,消除局部残差,其余点保持原草稿策略。通过匹配计算量的 Verify 控制组,论文在 FLUX.1-dev 上证明,相同延迟下 FeatFix 的 ImageReward 从 0.911 跃升至 1.318,且校正带来的误差降低会持续传播到下游层和后续去噪步骤。方法在 HunyuanVideo-1

ROAD:不堆数据不堆算力,靠对齐3D基础模型先验实现高保真生成

论文代表图:figure-02-p003-01

高保真3D生成通常依赖大规模模型与海量数据,计算成本极高。ROAD框架另辟蹊径:它冻结一个现成的3D基础模型,通过互惠目标对齐策略将其判别语义先验注入扩散Transformer,在仅用3万训练资产、8块A100训练3.5天的条件下,生成质量超越TRELLIS等更大规模模型,逼近商业模型Step1X-3D。核心创新在于识别并解决了生成模型与判别模型之间的语义-结构异构性问题——全局语义凝聚(HSC)和结构最优对齐(SOA)两个组件协同工作,让生成器真正“理解”3D形状的语义结构。该方法可迁移至CraftsMan和TRELLIS等不同框架,但生成质量受限于所选基础模型的语义能力。

Chimera:混合注意力+Chinchilla缩放,视觉扩散模型的长序列高效生成之道

论文代表图:figure-01-p002-01

视觉生成进入token密集型时代,全注意力机制计算成本高昂,且缺乏系统性缩放框架。Chimera提出混合KDA/MLA注意力骨干,结合模态感知短卷积实现无位置编码设计,并配套HeteroP超参数迁移方案和Chinchilla缩放定律。实验显示,在匹配算力下Chimera预训练效率比Wan2.1提升6.8倍,零样本视频长度从5秒外推至30秒时FID仅退化6.5%。缩放定律揭示了算力应近乎均匀分配给模型大小和训练token,并首次分析了算力最优的图像-视频数据配比。需要注意的是,缩放定律基于预训练损失,未直接关联下游生成质量指标。

视频编辑新范式:DBL-Diffusion 如何实现显式图层分解与对象插入

论文代表图:figure-01-p001-01

现有视频编辑方法缺乏对前景、背景及物理交互的显式分层表示,导致背景扭曲且难以后期调整。本文提出 TriLayer 数据集,提供包含阴影等视觉特效的三元组监督;并设计 DBL-Diffusion 双分支架构,联合生成 RGB 合成视频与 RGBA 前景层。实验表明该方法在对象插入与图层分解任务上均优于基线,但计算开销较大。

PDD:用并行解码蒸馏打破视频生成的多样性瓶颈

架构创新:复用Backbone与Layer Fusion

视频扩散模型加速常面临多样性丧失与运动缺失的困境。PDD提出并行解码蒸馏,通过单次评估预测多步平均速度,避免JVP与对抗损失。实验显示其在Wan2.1等模型上显著优于DMD2,保留更多细节与动态。注意:大规模实验依赖Data-free训练,泛化性待验证。

SILICA:如何用扩散模型让机器人看清玻璃?

核心贡献

传统深度传感器在玻璃表面失效,导致机器人导航危险。SILICA利用Stable Diffusion先验,联合预测玻璃分割和深度。通过CLIP条件化机制解决任务纠缠,并利用非玻璃区域校准深度。实验显示其在Mirage 18k等数据集上显著优于现有方法。注意:该方法依赖非玻璃区域的传感器读数进行校准。

MicroZoom:如何用AI实现350倍放大且不失真?

论文代表图:figure-01-p001-01

本文探讨MicroZoom如何解决极端超分辨率中的结构不一致问题。通过级联扩散模型与SAM分割引导,该方法在吉像素尺度下保持材料边界清晰。实验显示其在视觉质量上优于UltraZoom等基线,但需注意其高推理成本与实例级微调需求。

PC-Edit:无需掩码的精准图像编辑

方法贡献

现有无掩码图像编辑方法在处理形状变化大的对象替换时,常出现源对象残留或背景失真。PC-Edit通过对比源目标提示下的AttnOut输出,自动发现编辑区域,并分离建模源擦除与目标生成过程。实验表明,该方法在EditRegion-Bench上显著优于DiffEdit和FYS等基线,尤其在保持背景一致性方面表现突出。需注意,其性能依赖于固定的推理配置,且对语义对比弱的提示可能定位不准。

KroQuant:用Kronecker结构破解DiT W4A4量化难题

直觉与失败

DiT模型的W4A4 PTQ因激活Outliers导致质量下降,且AdaLN层使传统离线吸收技巧失效。KroQuant提出一种基于Kronecker积的可学习块对角激活变换,结合LoRaQ权重校正,在保持推理速度的同时显著提升图像质量。实验表明,该方法在PixArt-Σ、SANA和FLUX.1-schnell上均优于基线。需注意,该方法依赖支持MXFP4格式的硬件,且在线变换增加了计算开销。