ATSplat:自适应Token扩展实现紧凑前馈3D高斯泼溅

方法概述:稀疏初始化与自由放置

本文提出ATSplat,一种紧凑的前馈3D高斯泼溅框架。传统前馈方法将高斯绑定于输入像素,导致冗余或容量不足。ATSplat从稀疏3D锚点Token开始,通过自适应Token扩展(ATE)模块,根据不确定性分数选择性扩展困难区域的Token,实现场景复杂度感知的表示。在RealEstate10K和DL3DV数据集上,ATSplat以5.7倍更少的高斯数量实现了SOTA渲染质量,推理时间小于1秒。注意:ATE未进行冗余Token剪枝,且目前仅支持已知相机位姿输入。

WearWow:原生2K多衣物虚拟试穿,解决显存爆炸与纹理平滑难题

方法概览:WearWow框架

本文介绍WearWow框架,旨在解决虚拟试穿(VTON)在原生2K分辨率及多衣物场景下的显存瓶颈与高频细节丢失问题。通过自适应2D Token打包(ATP)优化显存占用,利用多维试穿奖励(MTR)对齐机制纠正扩散模型的频谱偏差。实验显示,在VITON-HD和自建WearWow-2K数据集上,该方法在FID、LPIPS等指标上优于IDM-VTON、CatVTON及OminiTry等基线,实现了无掩码多衣物的照片级真实感生成。需注意,高分辨率生成涉及深度伪造风险,且MTR训练计算开销较大。

OSVE:基于单步扩散模型的一步视频编辑

方法概述:OSVE框架

本文介绍OSVE框架,旨在解决文本引导视频编辑中速度与质量的矛盾。传统多步方法计算昂贵,直接应用单步模型则导致结构坍塌。OSVE通过可学习的反转编码器和统一帧编辑机制,在单步内完成高质量编辑。实验显示,OSVE在20帧和90帧视频上分别比RAVE快171倍和155倍,且时序一致性显著优于基线。需注意单步模型对控制信号敏感,且长视频处理需依赖滑动窗口策略。

Crowd4D:场景感知的单目4D人群重建,解决大场景深度歧义

Crowd4D框架概览

本文介绍Crowd4D框架,针对大场景单目人群重建中的深度歧义和尺度漂移问题,提出人类-场景交互代理(HSIP)和人群结构相干正则化(CSCR)。在VirtualCrowd和PANDA数据集上,PPDS达到91.43,MPJPE降至59.35,优于DyCrowd等基线。该方法为离线优化,计算成本较高,适用于城市管理和公共安全场景,需注意隐私保护。

SafeGen:用VLM逆向推理生成安全关键视频,测试自动驾驶模型极限

方法概览:SafeGen框架

本文介绍SafeGen框架,解决现有模拟器生成安全关键场景时存在的Sim-to-Real差距问题。通过VLM推理识别潜在脆弱性并定义灾难性终点,再利用FLF2V模型生成物理合理且时间连贯的对抗性视频。实验显示,该方法在nuScenes数据集上显著降低VLMAD的感知对齐与规划合规性,并提升模型微调后的准确率。需注意生成内容的高逼真性可能带来的伦理风险及评估指标的主观性。

HeadCast:免训练注意力头路由,实现自回归视频生成的高效推理

HeadCast四阶段流程

本文分析HeadCast框架,解决自回归(AR)视频生成中KV缓存无限增长导致的O(L^2)计算瓶颈。现有免训练方法如Dummy Forcing通过激进驱逐缓存导致帧间闪烁,而HeadCast通过一次性Online Classification将注意力头划分为Sink、Dummy、Spatial和Global四种原型,并重构异构KV缓存。实验显示,在Self-Forcing和LongLive模型上,HeadCast在720P下加速1.62倍,1080P下加速1.95倍,且VBench质量与Full Attention基线相差在0.15分以内,显著优于Dummy Forcing。注意PSNR/L

Vera:解决S2V身份漂移与多主体混淆的百万级对齐方案

方法:IFMS身份焦点掩码监督

现有Subject-to-Video方法在动态姿态和多主体场景下常出现身份漂移与角色混淆。Vera通过构建百万级身份对齐数据集,引入IFMS强化面部监督,并利用RALA稳定DiT中的参考交互。实验显示其在FaceSim-Arc上达0.571,显著优于VACE。需注意:过度强调面部权重会损害运动平滑性,且目前不支持视频参考输入。

流式HOI视频生成:解决长视频交互漂移的内存自适应方案

论文代表图:figure-01-p001-01

StreamHOI针对流式HOI视频生成中固定内存预算下的长期身份漂移与短期运动不连续问题,提出偏置引导的内存专业化训练(B-MST)与记忆距离缩放(MDS)。通过离线块分析将Transformer块分类,动态分配Sink/Local内存比例,并修正Temporal RoPE以增强早期交互状态访问。实验显示在GeoHOI和HOMA测试集上优于双向方法,FPS达17.6。需注意评估基于VLM多维二进制指标,且依赖离线预处理步骤。

自梯度强制:解决自回归视频模型长视频生成中的身份漂移与上下文断裂

SGF:两阶段梯度恢复框架

本文提出Self Gradient Forcing (SGF),旨在解决自回归视频扩散模型在长视频生成中因KV缓存冻结导致的身份漂移和场景断裂问题。SGF通过两阶段训练策略,在Pass 1进行无梯度自回归Rollout,在Pass 2并行重建采样退出步的计算,使未来DMD损失能监督KV写入过程。实验显示,在60秒和240秒尺度上,Subject一致性分别提升至0.983和0.972,GSB偏好得分显著提升。该方法避免了全序列反向传播的内存溢出,仅用5秒训练窗口即可实现分钟级视频生成。

AppearancePointers:DiT多模态区域控制新范式

核心方法

本文介绍AppearancePointers,一种用于扩散变换器(DiT)的多模态区域控制方法。通过生成紧凑的指针令牌,该方法在单次去噪步骤中实现文本、图像和空间掩码的精确对齐。实验显示其在CLIP-I、DINO-I和MIoU指标上优于MS-Diffusion和InsertAnything等基线。需注意,区域数量过多时性能会下降。