MAD-HOI:连续潜在空间如何让文本驱动手物交互既平滑又能自由补全
MAD-HOI 提出一种结合连续潜在空间与掩码自回归扩散的框架,实现文本驱动的可变长度、复合、可补全/填充且自动终止的手-物交互运动生成。
MAD-HOI 提出一种结合连续潜在空间与掩码自回归扩散的框架,实现文本驱动的可变长度、复合、可补全/填充且自动终止的手-物交互运动生成。
PhotoHOI从单张RGB照片和开放词汇指令出发,通过VLM任务解析、任务相关场景恢复和可迁移交互先验,生成场景一致的3D手物交互序列。
StreamHOI针对流式HOI视频生成中固定内存预算下的长期身份漂移与短期运动不连续问题,提出偏置引导的内存专业化训练(B-MST)与记忆距离缩放(MDS)。通过离线块分析将Transformer块分类,动态分配Sink/Local内存比例,并修正Temporal RoPE以增强早期交互状态访问。实验显示在GeoHOI和HOMA测试集上优于双向方法,FPS达17.6。需注意评估基于VLM多维二进制指标,且依赖离线预处理步骤。