三分钟导读:StreamHOI提出了一种低延迟流式生成框架,通过离线块分析与偏置引导的内存专业化训练,解决了流式生成中固定内存预算下长期交互一致性与短期运动连续性的权衡难题。
英文题目:StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation
论文出处:arXiv 每日论文精选 · arXiv:2607.20174
原始论文:PDF / 论文页面
对应视频标题:流式HOI视频生成:解决长视频交互漂移的内存自适应方案|推荐指数:★★★★★
这篇论文解决什么问题?
现有HOI视频生成多为离线短片段生成,难以满足实时交互需求;流式生成中标准Sink-Local内存设计存在长期身份漂移与短期运动不连续的权衡困境,且不同Transformer块对历史记忆的偏好不同。
核心创新
- 发现并量化了流式HOI生成中Sink-Local内存的权衡关系及Transformer块的块级历史记忆偏好。
- 提出B-MST框架,实现块级内存布局的专业化适配,无需增加总KV-cache预算。
- 引入MDS模块,通过可学习参数修正Temporal RoPE,缓解长程记忆访问中的相位扰动。
方法概览
1. 离线HOI感知块分析:利用SAM2池化注意力,将Transformer块分类为HOI偏置或周围偏置;2. 偏置引导的内存专业化训练(B-MST):根据块偏置动态分配Sink/Local内存比例;3. 记忆距离缩放(MDS):调整HOI偏置块的Temporal RoPE频率,增强对早期交互状态的访问。
逐图理解论文
内存权衡的量化分析

在固定内存预算下,Sink与Local内存比例直接影响生成质量。图2展示了不同比例对物体一致性和交互连贯性的影响。定量评估表明,过度偏向Sink会导致运动不连续,而过度偏向Local则造成身份漂移。这一发现揭示了统一内存布局无法适配HOI生成中不同模块对早期交互状态和近期上下文的差异化需求。
Transformer块的内存偏好

进一步分析发现,Transformer不同块对历史记忆的偏好存在显著差异。图3显示,浅层块通常更偏向HOI交互信息,而深层块更关注周围背景。这种空间专业化特性在不同生成器间具有稳定性,但分布比例各异。理解这种块级历史记忆偏好,为优化内存布局提供了关键依据。
离线HOI感知块分析

StreamHOI首先进行离线HOI感知块分析。利用SAM2池化历史记忆注意力,根据空间注意力偏好将Transformer块分类为HOI偏置或周围偏置。图4展示了跨样本的块级空间注意力偏置稳定性,箱线图显示25%至75%四分位距内的中位数分布。这一预处理步骤虽增加额外开销,但为后续内存专业化奠定基础。
偏置引导的内存专业化训练

基于块偏置分析,提出B-MST框架进行内存专业化训练。HOI偏置块获得更多Sink内存以利用可靠的早期交互状态,周围偏置块获得更多Local内存以维持近期上下文连续性。图6展示了B-MST管线,通过动态分配内存比例解决Sink-Local权衡,且无需增加总KV-cache预算,实现了块级内存布局的专业化适配。
记忆距离缩放模块

为缓解长程记忆访问中的相位扰动,引入MDS模块修正Temporal RoPE。固定MDS配置可能导致渐进式颜色漂移,而可学习MDS机制能有效保持颜色一致性。图12展示了可学习MDS对时间退化的缓解效果,通过调整HOI偏置块的RoPE频率,增强对早期交互状态的访问能力,提升长视频生成的视觉一致性。
实验与关键结果
- 在自建主测试集(400个案例,涵盖电商及HOIGen-1M)上进行5s/30s/60s长视频生成评估。
- 在GeoHOI-testset和HOMA-testset上与双向HOI生成方法进行5s对比。
- 消融研究验证B-MST、MDS及块分组策略的有效性。
- 用户研究评估人类一致性、物体一致性、交互自然度及整体视频质量。
- Obj-CLIP: 0.8621 (5s), 0.8496 (30s), 0.8298 (60s)(第 7 页)
- InternVLO: 0.909 (5s), 0.882 (30s), 0.857 (60s)(第 7 页)
- FPS: 17.6 FPS, First-chunk latency: 0.75s(第 1 页)
- GeoHOI测试集Obj-CLIP: 0.8993 (优于UniAnimate-DiT的0.8786)(第 7 页)
- HOMA测试集InternVLI: 0.896 (优于HUMA-17B的0.769)(第 7 页)
阅读时需要注意
- 依赖离线分析确定块偏置,虽稳定但需额外预处理步骤。
- MDS仅应用于HOI偏置块,周围偏置块保持原始RoPE。
- 评估指标InternVLH和InternVLI基于VLM的多维二进制评估,具体细节见补充材料。
- 与双向方法对比时,将结构化条件(如姿态)转换为文本描述,侧重最终生成质量而非条件遵循精度。
关联工作
- LongLive:基线对比及泛化验证对象(第 3 页)
- Causal Forcing:流式生成基线对比(第 2 页)
- Deep Forcing:无训练长视频生成基线对比(第 3 页)
- GeoHOI:双向HOI生成方法对比(第 2 页)
- HOMA:双向HOI生成方法对比(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
1
StreamHOI: 面向流式 HOI 视频生成的交互感知时序记忆 自适应方法
Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee, IEEE 高级会员
摘要——现有的人机交互(HOI)视频生成方法主要局限于具有复杂驱动条件的离线短视频生成,使其不适用于实时交互式应用。我们提出了 StreamHOI,这是一种用于长时程 HOI 视频生成的低延迟流式框架。与将重度条件化的 HOI 管线转换为流式系统不同,我们研究了图像到视频的流式生成器应如何组织历史记忆,以在有限延迟下保持交互性。我们发现,标准的 Sink-Local Memory 设计在流式 HOI 生成中面临权衡,且不同的 Transformer 块对 HOI 区域和周围区域表现出不同的历史记忆偏好。为了使记忆组成与块行为相匹配,StreamHOI 执行离线的 HOI 感知块分析,并应用 B-MST(偏置引导的内存专业化训练)以适配特定于块的记忆布局。我们进一步引入了 MDS(记忆距离缩放)模块,以加强对早期交互状态的长程访问。与长视频基线及近期 HOI 生成方法的广泛比较表明,StreamHOI 实现了强大的交互合理性、物体保真度、人类质量和效率,达到 17.6 FPS,首块延迟为 0.75 秒。
索引术语——人机交互,流式视频生成,长视频生成,扩散 Transformer,记忆。 ✦2026 Jul 1 INTRODUCTION (1) 离线 HOI (2) 片段链式长 HOI 条件 交互崩溃 ….22 UMAN–OBJECT INTERACTION (HOI) has received in- pose mask object trajectory creasing attention in computer vision and graph- H ics [1]–[3], with applications in virtual humans, embodied agents, online object manipulation, and interactive content denoise creation [4], [5]. Existing HOI video generation methods [3], chain clips [6]–[8] improve controllability by conditioning on structured fixed length HOI cues. However, most of them follow an offline, fixed- High quality Short clip Long video High cost[cs.CV] Impractical for real time Long-form HOI collapse length generation paradigm and mainly produce short clips. (3) StreamHOI Historical Memory Such a paradigm fails to meet the needs of real-time virtual Early sink memory Recent local-window memory human interaction and online content creation, which re- ……..evicted Real time Long-form quire immediate response and continuous long-video gen- HOI quality eration. …. …. update few-stepdenoise As illustrated in Fig. 1, a straightforward way to generate memory long HOI videos is to chain multiple short HOI clips, using infinite length condition the ending frames of one clip to initialize the next, as in InteractAvatar-long [9]. This increases video duration, but Fig. 1: Conceptual comparison of HOI video generation still inherits the high offline generation cost of bidirectional paradigms. (1) Offline methods are restricted to fixed-length HOI models and remains prone to interaction collapse in clips. (2) Clip-chained approaches extend duration but suf- long-form generation. Streaming video generation [10]–[12] fer from high computational cost and interaction collapse. provides a different paradigm by generating videos chunk (3) The proposed StreamHOI framework enables causal, by chunk with nearly constant computation. Such streaming low-latency streaming generation while maintaining robust generators rely on cached historical memory to condition long-horizon interaction consistency.arXiv:2607.20174v1 each newly generated chunk. However, most short-video HOI methods depend on offline structured conditions, such as pose sequences, object trajectories, depth maps, or inter- action layouts, which are difficult to obtain causally during streaming generation. Instead of converting heavily con- • This work was conducted during the author’s internship at Kling AI ditioned HOI methods into streaming pipelines, we focus Research. on a more fundamental question: how should an image-to- • Corresponding author: Fan Tang, tfan.108@gmail.com video streaming generator organize historical memory to preserve • Z. Rao and F. Tang are with University of Chinese Academy of Sciences, Beijing, China. human–object interactions under bounded latency? • H. Zhang, X. Liu, Y. Meng, G. Zhang and P. Wan are with Kling AI A common memory design for long streaming genera- Research, Beijing, China. tion is to keep several early frames as sink memory together • T.-Y. Lee is with National Cheng Kung University, Tainan, Taiwan.
第 2 页
2
使用滚动局部窗口 [13]。然而,在固定的内存预算下,这两种内存类型在流式 HOI 生成中会产生权衡。较大的 Sink 内存保留早期的外观和交互状态,从而提高主体和物体的一致性以及手-物关系,但会减少近期的上下文,并可能导致动作跳跃和运动不连续。较大的 Local 内存改善了短期运动传播,但使模型更依赖近期的自回归帧,并削弱了长期交互的保持。在第 3 节中,我们将对此权衡进行详细的定量分析。我们进一步观察到,不同的 Transformer 块并不需要同样的内存组成:一些块更关注主体、手、物体和接触区域,而其他块则更关注周围场景和物体-运动上下文。这激发了针对流式 HOI 生成的块级内存组织。
在本研究中,我们引入了 StreamHOI,这是一个流式 HOI 视频生成框架,通过在 Transformer 块级别对历史内存进行简单而有效的块级组织,以保留长期的人-物交互。它首先执行离线的 HOI 感知块分析(HOI-aware block profiling),根据空间历史内存偏置识别 HOI 偏置块和周围偏置块。经验表明,这种分析捕捉到了稳定的块级内存倾向,而非样本特定的注意力波动。为了将内存组成与块行为相匹配,我们提出了偏置引导的内存专业化训练(Bias-Guided Memory-Specialized Training, B-MST),它根据分析得到的偏置为每个块分配特定的 Sink-Local 内存组成:HOI 偏置块接收更多的 Sink 内存,用于利用可靠的早期交互状态以保持一致性;而周围偏置块接收更多的局部窗口内存,用于利用人-物交互周围的近期运动和场景上下文以保持连续性。我们进一步引入了一个内存距离缩放(Memory Distance Scaling, MDS)模块,该模块缩短了当前块与内存标记在时间 RoPE 中的感知时间距离,加强了 HOI 偏置块对远处交互状态的访问。
我们的贡献总结如下:
- 我们识别了流式 HOI 生成中的 Sink-Local 内存权衡,并通过离线的 HOI 感知块分析揭示了块级历史内存偏好,表明不同的 Transformer 块表现出 HOI 偏置和周围偏置的行为。
- 我们提出了偏置引导的内存专业化训练,该训练使用块专用的 Sink-Local 内存布局和内存距离缩放模块来训练生成器,使得不同的块在固定的内存预算下能够分别专注于长期交互一致性和短期运动连续性。
- 我们通过定量和定性比较、长视距评估以及消融实验验证了 StreamHOI,证明了其在流式 HOI 视频生成方面的强大性能。
2 相关工作
2.1 人-物交互视频生成
随着可控人类视频生成的进展 [14]–[16],真实的人-物交互(Human-Object Interaction, HOI)生成已成为一个重要的研究方向。人-物交互视频生成旨在合成人类和物体遵循物理和语义合理关系的视频。基于编辑的方法通过替换真实视频中的人类或物体来保持交互,例如用于人类替换的 MIMO [17] 和 AnimateAnyone2 [16],以及用于物体替换的 HOI-Swap [7]、ReHoLD [18] 和 iDiT-HOI [19]。基于生成的方法通过显式条件(如人体姿态、物体轨迹、深度图和边界框)提高交互可控性。例如,SViMo [20] 和 HarmoHOI [21] 探索了视频-运动协同生成以用于第一人称手-物交互。AnchorCrafter [3] 使用多条件引导来动画化人类-物交互,DreamActor-H1 [22] 从参考图像中检索运动模板并调整物体布局,而 HunyuanVideo-HOMA [6] 探索了稀疏的用户可编辑条件以实现可控的 HOI 生成。最近的工作如 GeoHOI [8] 进一步提高了物体感知和几何交互控制,而 InteractAvatar-long [9] 通过链接多个生成的片段将 HOI 生成扩展到更长的视频。
然而,现有的 HOI 视频生成方法主要仍建立在离线生成管道之上。因此,HOI 视频生成中的实时生成和长期交互状态保持仍未得到充分探索。相比之下,StreamHOI 针对流式 HOI 视频生成,旨在在保持低延迟推理的同时,在长期生成过程中保留人-物交互状态。
2.2 流式与长视频生成
流式视频生成旨在将离线视频扩散模型转换为因果生成器,以低延迟逐块生成视频。早期的因果视频扩散模型通常使用教师强制(Teacher Forcing)[23] 或扩散强制(Diffusion Forcing)[24], [25] 进行训练,其中模型根据干净或带噪的历史帧预测未来帧。为了进一步降低采样成本,一致性蒸馏(Consistency Distillation)[26], [27] 和分数蒸馏(Score Distillation)[28], [29] 已被用于将多步扩散模型蒸馏为少步生成器。分数蒸馏的一个常见实例是分布匹配蒸馏(Distribution Matching Distillation, DMD)[30],它通过遵循其梯度最小化学生分布与数据分布之间的 KL 散度。CausVid [10] 通过 ODE 初始化和非对称 DMD 将双向视频 DiT 蒸馏为因果学生模型。Self-Forcing [11] 通过自 rollout 训练减少训练-测试差距,而 Causal-Forcing [12] 通过使用自回归教师进行因果 ODE 初始化来改进因果蒸馏。
长视频生成还要求在超出视频扩散模型短期训练视野的情况下保持视觉和语义一致性。最近的方法从不同角度提高了长视距稳定性。FramePack [31] 将历史帧压缩为固定长度的上下文,以减少下一帧预测中的漂移。
第 3 页
3
身份漂移 / 交互坍塌 动作跳跃 / 运动不连续
“那个男人在阳光充足的 网球场上用球拍颠球。”
min 1
参考 (Ssink, Slocal) (1,11) (3,9) (5,7) (7,5) (9,3) (11,1) (a) (b) (c)
图 2: 在固定内存预算下,流式 HOI 生成中 Sink-Local Memory 权衡的示意图。 (a) 不同 sink-to-local 内存比例对定性结果的影响,展示了长期身份漂移(sink 内存不足)与运动不连续(local 内存不足)。(b) 对象-片段和主体一致性的定量评估。(c) 交互连贯性和运动平滑度的定量评估。
LongLive [13]、Rolling Forcing [32] 和 Self-Forcing++ [33] 块 05 块 07 块 10 块 18 块 23 块 28 通过长上下文训练、自展开(self-rollout)、滚动生成或抗漂移策略扩展流式生成。其他 方法将历史上下文视为内存。Context as Memory [34]、Memory Forcing [35]、MemFlow [36] 和 Context Forcing [37] 检索、压缩或组织历史 记忆以提高场景级一致性。另一 条工作线修改位置或内存机制 以实现更长的外推。Infinity-RoPE [38] 重新公式化 时间 RoPE 以实现无限视界展开,而 Deep Forc- ing [39] 使用深层 sink 和参与式压缩来 稳定长视频而无需训练。最近的异质 KV 方法,如 Head Forcing [40],进一步分析 注意力头并分配头特定的缓存策略以用于 长程生成。 块 03 块 05 块 08 块 18 块 23 块 28 这些方法与 StreamHOI 密切相关,但在 内存适应方面存在差异。Deep Forcing 和 Infinity-RoPE 主要依赖无需训练的离散 RoPE 重新校准或 缓存重新索引,这在重新分配缓存的时间段时 可能会引入边界不连续。 相比之下,我们的 MDS 在 HOI 偏置块内连续重塑时间 RoPE 几何结构。Head Forcing 等异质 KV 方法使用预定义的头部级 缓存策略,而 StreamHOI 学习交互感知的 块级内存专业化,以在有限延迟下保留细粒度 HOI 状态。 案例 1 Longlive-5B* 3 预备知识与动机 图 3: 两个基础流式生成器之间的块级历史内存注意力。在每个生成器内部,空间 在介绍我们的方法之前,我们分析了在有限 内存预算下,时间内存如何影响流式 HOI 生成。 我们首先研究标准内存设计中的 sink-local 权衡,然后检查 不同的 Transformer 块是否以相同的方式检索历史内存。 这些分析表明,HOI 生成不仅需要适当的 全局 sink-local 平衡,还需要 块级内存组织。 为什么标准内存组织在 HOI 生成中失效?现有的流式生成器通常采用 固定大小的 sink-local 内存,其中 sink 帧保留 早期的外观和交互状态,local 帧 提供近期的运动上下文。为了在 HOI 生成中检验这种设计,我们使用我们在 人机交互数据上蒸馏的基础流式生成器实例化它,其 构建细节见第 5.1.1 节,并在测试集的诊断子集上对其进行评估, 如第 5.1.2 节所述。在固定的总内存预算下,我们将 sink-local 分配从 (Ssink = 1, Slocal = 11) 变化到 (Ssink = 11, Slocal = 1),跨越 19k 推断帧。 如图 2(a) 所示,较小的 sink 内存导致长期 身份漂移和交互坍塌,而较小的 local
第 4 页
4
离线 HOI 感知块分析 Streaming Decode+ 区域级注意力,池化 շ,։ջ ؽ֣֭֡֩ Generator SAM2 ؽ 空间偏置得分 DIT Block m 注意力块级映射 图像-文本 dž։ = Ư,ؽշ,։ջ − ؽ֣֭֡֩ ,։ pairs … dž։ > 0 dž։ < 0 DIT Block n … 周围偏置 HOI 偏置块 块 m 块 n 块
图 5:离线 HOI 感知块分析流程。 我们利用 SAM2 对历史记忆注意力在 空间区域上进行池化,根据每个 Transformer 块的 注意力偏好将其分类为 HOI 偏置或周围偏置。 (a) 偏好。
互四分位距进一步表明,这种偏置 是稳定的块级属性,而非特定样本的 伪影。我们在未见过的 GeoHOI 和 HOMA 测试集上进行的后续跨数据集评估(第 5.2.2 节)进一步 支持了这种块级记忆行为在采样观察集之外的稳定性。 (b) 块级记忆组织的动机。上述观察表明,sink-local 权衡 不仅是一个全局内存预算问题,也是一个块级 图 4:基于 50 个随机采样的 HOI 示例计算的块级空间注意力 记忆匹配问题。在标准的固定设 偏置的跨样本稳定性,使用相同的基线流式生成器。(a) 样本 计中,所有 Transformer 块使用相同的内存组成, 级热力图;(b) 每个块的箱线图,显示 25%–75% 无论它们主要是检索交互区域的 IQR,中位数用红色表示,须线延伸至 历史信息还是周围区域。这种统一的设计对于 HOI 生 第 10 和第 90 百分位数。 成来说可能不是最优的。对于 HOI 偏置块,早期的 sink 帧提供 重要的线索以保留对象身份、主体 记忆导致动作跳跃和运动不连续。 身份以及手-对象关系。减少这些块中的 sink 内存 图 2(b,c) 中的定量结果证实了这种权衡: 可能会削弱长期交互状态。 增加 sink 内存提高了 Object-CLIP 和 Subject 对于周围偏置块,最近的局部帧提供 一致性,但减少局部窗口会降低交互连贯性和运动平滑度。 更多关于短期视觉变化和运动 连贯性的有用线索。将这些块分配过多的 sink 内存 这里,交互连贯性是一个基于 VLM 的指标,用于衡量时间交互 连贯性,详细信息见补充材料。这些结果表明,在内存受限的情况下, 标准 sink-local 组织无法同时维持长期的 HOI 稳定性和短期的运动连续性。 所有 Transformer 块都需要相同的内存组成吗?为了检查 sink-local 权衡是否可以在块级别减少,我们分析了两个基线模型中的历史记忆注意力:我们的基线流式生成器和 LongLive-5B∗(我们在 Wan2.2-TI2V-5B 骨干网络上复现的 LongLive)。我们从 HOIGen-1M [41] 和实时电商片段中随机采样 50 个 HOI 示例。
4 方法 4.1 概述 对于每个块,我们可视化了人类-对象交互区域和周围区域上的历史记忆注意力。如图 3 所示,较浅的块更多地关注主体、手、交互对象和接触区域,而较深的块更多地关注周围区域。我们将这两种倾向分别称为 HOI 偏置和周围偏置行为。 我们使用第 4.2 节中详细描述的分析程序进一步量化了这一观察结果。图 4(a) 显示了空间注意力偏置的样本-块热力图。大多数块在样本间保持一致的偏置方向,在热力图中形成列状的红色或蓝色模式。图 4(b) 报告了相应的每块分布;
因此,内存组成应根据块级空间偏置进行调整,而不是在所有块之间统一共享。这激发了我们在第 4 节中提出的交互感知时间内存适应,其中在相同的总内存预算下,不同 Transformer 块的历史记忆以不同方式组织。
第 5 页
5
写入 KV 缓存 HOI 偏置块 内存 周围偏置块 内存 输入 被驱逐… … … 被驱逐… … KV 写入缓存 仅在第一步 第一个块 较大的早期 Sink KV 缓存 最近的局部 KV 缓存 早期 Sink KV 缓存 较大的最近局部 KV 缓存 4 步去噪 读取 读取 KV 缓存 HOI 偏置块 KV 缓存 周围偏置块
图像 KV 缓存 KV 缓存 DIT 记忆距离 DIT DIT DIT 干净潜在变量 缩放 … 提示 块 查询 归一化 FFN 块 …块 块 查询 归一化 FFN VAE 解码 ـ j م ։ ـ֩ م ։ 自注意力 交叉注意力 自注意力 交叉注意力 ։ 噪声潜在变量 م = ط։ م , LoRA 适配器 隐藏潜在变量 LoRA 适配器 隐藏潜在变量 ط։ = ؿ (ؽ։) 视频帧
图 6:偏置引导的内存专业化训练(B-MST)流程。为了解决流式 HOI 生成中的 Sink-Local 内存权衡问题,B-MST 根据分析得出的空间偏置对内存组成进行专业化:HOI 偏置块接收更多的 Sink 内存,并配合记忆距离缩放(MDS)模块,以一致性地利用可靠的早期交互状态;而周围偏置块接收更多的局部内存,以连续性利用最近的上下文。
HOI 生成的持续时间。以下小节详细描述这两个组件。 正偏置意味着该块将更多的历史 描述这些组件。 记忆注意力分配给 HOI 区域而非周围 区域,因此被视为 HOI 偏置。否则, 4.2 离线 HOI 感知块分析 该块被视为周围偏置。由于块级空间偏置在 在 B-MST 之前,我们执行离线 HOI 感知块分析,根据它们的 同一基础生成器内的交互场景中保持稳定,因此 历史记忆注意力模式对 Transformer 块进行分类。一些块从 HOI 区域(包 只需少量分析集即可确定块类型。实现 括人类、物体和接触区域)更强烈地检索历史记忆,而其他块 细节见补充材料。 则更依赖于周围区域。这为块分类提供了一个直接标准:测量分配给 HOI 区域和 周围区域的相对历史记忆注意力。 对于离线分析,我们将潜在块解码为 RGB 帧,并在小型分析集上使用 SAM2 [42] 获取 帧,并使用 SAM2 [42] 获取人类主体和交互物体的掩码。 人类主体和交互物体的掩码。 HOI 区域定义为人和 物体掩码的并集,略微膨胀以包含局部接触区域, 物体掩码的并集,略微膨胀以包含局部接触区域, 然后下采样到潜在标记分辨率。 然后下采样到潜在标记分辨率。 周围区域定义为其补集。这些 周围区域定义为其补集。这些 掩码仅用于离线分析,在流式推理期间不需要。 这些掩码仅用于离线分析,在流式推理期间不需要。 令 $B$ 表示每个 Transformer 块的总内存预算。在均匀流式生成器中,每个 对于块 $l$ 在块 $t$,令 $\rho_{t,l}^{hoi}$ 和 $\rho_{t,l}^{sur}$ 表示分配给 HOI 区域和周围区域的平均历史记忆注意力质量。块级空间偏置是在分析视频和块上计算的: $\hat{b}_l = \frac{b_l}{\max_k |b_k| + \epsilon} = \frac{1}{|D_{prof}||T_{prof}|} \sum_{x \in D_{prof}} \sum_{t \in T_{prof}} (\rho_{t,l}^{hoi}(x) – \rho_{t,l}^{sur}(x))$ , (1) 其中 $\epsilon$ 是用于数值稳定性的常数。块 $l$ 的 Sink 大小定义为 其中 $D_{prof}$ 表示分析集,$T_{prof}$ 表示分析块。较大的 $b_l$ 意味着块 $l$ 对交互区域使用历史记忆更强,而较小的 $b_l$ 表示更依赖于周围 区域。 块类型由以下公式确定: (HOI-biased, $b_l > 0$, 这里,$s_{min}$ 和 $w_{min}$ 确保每个块保留 surrounding-biased, otherwise. 最少数量的 Sink 和局部窗口帧。此 Type(l) = (2) 周围偏置, 否则。 局部窗口大小为 $w_l = B – s_l$. (5)
第 6 页
6
分配为每个块保留了相同的总内存预算。距离缩放参数 {ρl} 用于 HOI 偏向块。 正的 ˆbl 增加 HOI 偏向块的 sink 大小,使它们能够保留更多包含稳定物体外观、接触关系和操作状态的早期潜在帧。负的 ˆbl 增加周围偏向块的局部窗口大小,使它们能够基于更多近期的潜在帧来维持局部运动和场景连续性。 给定参考人体图像 IH、文本提示 P、潜在噪声 ϵt 以及块特定记忆 {Mtl}L−1l=0 ,生成器生成当前的潜在块: ˆZt = Gθ,ϕ (IH, P, ϵt, {Mtl}L−1l=0) , (9) 其中 θ 表示冻结的生成器参数。 我们使用 DMD 蒸馏目标: LB−MST = LDMD + λcLcritic. (10) 这里,LDMD 通过将生成分布匹配到真实分数模型来更新 LoRA 增强的生成器,而 Lcritic 使用生成样本上的去噪目标更新虚假分数判别器。 因此,B-MST 仅改变每个块的内存组成,而不增加总 KV 缓存预算。 记忆距离缩放。虽然 sink 内存保留了早期的交互状态,但在长流式生成过程中,其键令牌在时间上距离当前块较远。在标准的时序 RoPE 下,时间位置 τt 处的查询与 τj 处的键之间的相对旋转与 (τt −τj)ω 成正比,其中 ω 是时序 RoPE 频率。由于 sink 令牌的 τt −τj 较大,由此产生的快速相位变化会削弱它们的查询-键相关性,并降低早期交互状态的贡献。为了缓解这个问题,B-MST 为 HOI 偏向块引入了作用于时序 RoPE 频率的可学习记忆距离缩放机制。 在块 t,块特定的 KV 内存构建如下: Mtl = Concat (Mtl,sink, Mtl,local) , 这里,LDMD 更新 LoRA 增强的生成器, Mtl,sink = KVl ({z0, . . . , zsl−1}) , (6) 通过将生成分布匹配到真实分数模型, Mtl,local = KVl ({ztm−wl, . . . , ztm−1}) . 而 Lcritic 使用生成样本上的去噪目标更新虚假分数判别器。 因此,B-MST 仅改变每个块的内存组成,而不增加总 KV 缓存预算。 记忆距离缩放。虽然 sink 内存保留了早期的交互状态,但在长流式生成过程中,其键令牌在时间上距离当前块较远。在标准的时序 RoPE 下,时间位置 τt 处的查询与 τj 处的键之间的相对旋转与 (τt −τj)ω 成正比,其中 ω 是时序 RoPE 频率。由于 sink 令牌的 τt −τj 较大,由此产生的快速相位变化会削弱它们的查询-键相关性,并降低早期交互状态的贡献。为了缓解这个问题,B-MST 为 HOI 偏向块引入了作用于时序 RoPE 频率的可学习记忆距离缩放机制。 对于 HOI 偏向块 l,我们通过可学习的块特定因子重新缩放其时序 RoPE 频率: ˜ωl = λlω, λl = σ(ρl), (7) 其中 ρl ∈R 是可学习标量,σ(·) 是 sigmoid 函数。对于周围偏向块,我们固定 λl ≡1,以保留原始时间距离且不引入额外参数。 由此缩放引起的相位扰动为: ∆ϕltj = (1 −λl)(τt −τj)ω. (8) 该表达式表明 MDS 并非简单的仅 sink 重索引操作:由于时序 RoPE 频率在块级别被重新缩放,相应 HOI 偏向块中的所有查询-键时间距离都会受到影响。然而,其效果本质上依赖于距离。局部窗口键与当前块的时间距离有界,而随着流式生成的进行,sink 键变得越来越远。因此,相同的缩放因子对遥远的 sink 令牌产生的相位校正远强于对近期局部令牌的影响。 MDS 仅有意应用于 HOI 偏向块。这些块由 B-MST 分配了更大的 sink 内存,需要更强烈地访问早期交互锚点,如接触关系、相对姿态和物体状态。周围偏向块保持原始 RoPE 频率,保留其近期上下文行为以维持运动和场景连续性。 训练目标。B-MST 作为轻量级的第二阶段训练过程进行。我们冻结预训练的流式生成器,并仅优化插入 Transformer 块中的 LoRA 适配器 ϕ 以及距离缩放参数 {ρl} 用于 HOI 偏向块。 给定参考人体图像 IH、文本提示 P、潜在噪声 ϵt 以及块特定记忆 {Mtl}L−1l=0 ,生成器生成当前的潜在块: ˆZt = Gθ,ϕ (IH, P, ϵt, {Mtl}L−1l=0) , (9) 其中 θ 表示冻结的生成器参数。 我们使用 DMD 蒸馏目标: LB−MST = LDMD + λcLcritic. (10) 这里,LDMD 通过将生成分布匹配到真实分数模型来更新 LoRA 增强的生成器,而 Lcritic 使用生成样本上的去噪目标更新虚假分数判别器。 与使用统一 sink-local 内存对所有 Transformer 块进行生成器展开的标准 DMD 训练不同,B-MST 使用偏置引导的内存布局进行生成器展开和分数评估,因此蒸馏梯度是在块特定的历史上下文中计算的。 通过 B-MST,流式生成器学习根据每个块的功能偏好使用历史记忆。HOI 偏向块被强化为倾向于一致性导向的内存使用,而周围偏向块被强化为倾向于连续性导向的内存使用。在推理时,我们使用配置好的块特定内存布局和学习的距离缩放系数,而不引入额外的模型分支或增加总内存预算。 5 实验 5.1 实验设置 5.1.1 实现细节 我们使用 Wan2.2-TI2V-5B 作为基础视频扩散模型,并以 704 × 1280 的分辨率生成视频。我们首先通过教师强制因果训练、因果 ODE 蒸馏和 DMD 蒸馏构建分块式的少步流式生成器,然后应用提出的偏置引导的内存专业化训练 (B-MST) 以实现交互感知的时间内存适应。所有阶段均以分块流式方式实现,其中每个块包含 4 个潜在帧。在教师强制因果训练阶段,我们在 100K 个视频片段上对自回归扩散模型进行了 13K 步训练。然后,我们使用训练好的自回归模型作为教师采样 10K 条因果 ODE 轨迹,并执行因果 ODE 蒸馏 5K 步以获得 4 步生成器。在 DMD 蒸馏阶段,我们采用统一的 sink-local 内存配置,其中 s = 4 个 sink 潜在帧和 w = 8 个局部窗口潜在帧,并训练流式生成器 300 步。最后,我们在配置好的块特定内存布局下应用 B-MST 进行 700 步训练。LoRA 的秩 (rank) 和 alpha 均设置为 256。所有训练实验均在 32 张 80GB GPU 上进行。 5.1.2 数据集 训练数据集。我们在 100K 视频数据集上训练 StreamHOI。该数据集由 80K 内部直播电商视频片段和从 HOIGen-1M 采样的 20K HOI 片段组成。
第 7 页
7
表 1:在主测试集上,不同时间设置下与代表性方法的定量比较。LC-Avatar 表示 Longcat-Video-Avatar 1.5。我们的 5B 模型在保持高通用视觉质量的同时,显著提升了 HOI 特定指标,在大多数通用指标上仅次于 13.6B 的 LC-Avatar。
HOI 特定指标 通用指标 方法 主体 背景 运动 美学 Obj-CLIP↑ InternVLO↑ InternVLH↑ InternVLI↑ 一致性↑ 一致性↑ 平滑度↑ 质量↑
Causal Forcing-1.3B 0.7104 0.823 0.921 0.836 0.9688 0.9665 0.9821 0.5298 LongLive-1.3B 0.7261 0.821 0.908 0.842 0.9683 0.9672 0.9815 0.5281 Causal Forcing-5B∗ 0.8032 0.869 0.937 0.860 0.9699 0.9724 0.9833 0.5493 LongLive-5B∗ 0.7927 0.862 0.994 0.857 0.9742 0.9778 0.9869 0.5490 Deep Forcing-5B 0.8181 0.885 0.982 0.864 0.9729 0.9780 0.9877 0.5503 5秒 LC-Avatar-13.6B 0.8539 0.899 0.995 0.889 0.9879 0.9893 0.9969 0.5482 InteractAvatar-10B 0.7688 0.851 0.982 0.884 0.9760 0.9789 0.9893 0.5426 Ours-5B 0.8621 0.909 0.993 0.901 0.9782 0.9801 0.9934 0.5558
Causal Forcing-1.3B 0.6033 0.681 0.794 0.704 0.9486 0.9599 0.9812 0.5139 LongLive-1.3B 0.6109 0.631 0.802 0.715 0.9495 0.9622 0.9808 0.5118 Causal Forcing-5B∗ 0.6607 0.782 0.831 0.782 0.9586 0.9681 0.9827 0.5211 LongLive-5B∗ 0.6586 0.789 0.824 0.790 0.9701 0.9766 0.9845 0.5234 Deep Forcing-5B 0.6936 0.805 0.816 0.801 0.9692 0.9773 0.9858 0.5269 30秒 LC-Avatar-13.6B 0.8244 0.863 0.951 0.866 0.9869 0.9891 0.9966 0.5438 InteractAvatar-10B 0.7492 0.827 0.924 0.822 0.9709 0.9785 0.9872 0.5377 Ours-5B 0.8496 0.882 0.958 0.874 0.9751 0.9802 0.9923 0.5431
Causal Forcing-1.3B 0.4930 0.537 0.688 0.613 0.9480 0.9582 0.9796 0.4998 LongLive-1.3B 0.5164 0.548 0.707 0.626 0.9488 0.9603 0.9821 0.4981 Causal Forcing-5B∗ 0.5882 0.687 0.792 0.702 0.9577 0.9669 0.9828 0.5203 LongLive-5B∗ 0.5937 0.688 0.808 0.712 0.9640 0.9760 0.9842 0.5193 Deep Forcing-5B 0.6334 0.703 0.831 0.745 0.9659 0.9731 0.9857 0.5251 60秒 LC-Avatar-13.6B 0.8156 0.842 0.940 0.834 0.9846 0.9880 0.9963 0.5431 InteractAvatar-10B 0.7344 0.808 0.923 0.791 0.9693 0.9781 0.9878 0.5372 Ours-5B 0.8298 0.857 0.942 0.868 0.9734 0.9796 0.9902 0.5429
表 2:在 5 秒设置下与双向 HOI 方法的比较。Uni-DiT 表示 UniAnimate-DiT。我们的方法在无需额外注入物体信息的情况下取得了具有竞争力的性能。
HOI 特定指标 通用指标 方法 主体 背景 运动 美学 Obj-CLIP↑ InternVLO↑ InternVLH↑ InternVLI↑ 一致性↑ 一致性↑ 平滑度↑ 质量↑
GeoHOI 测试集 Uni-DiT-14B 0.8786 0.818 0.945 0.848 0.9814 0.9858 0.9948 0.5274 VACE-14B 0.8516 0.736 0.962 0.825 0.9831 0.9863 0.9951 0.5391 GeoHOI-5B 0.9015 0.882 0.963 0.898 0.9810 0.9860 0.9923 0.5396 Ours-5B 0.8993 0.914 0.980 0.892 0.9824 0.9879 0.9957 0.5483
HOMA 测试集 HUMO-17B 0.8560 0.758 0.926 0.769 0.9792 0.9891 0.9940 0.5100 VACE-14B 0.8572 0.880 0.997 0.842 0.9788 0.9878 0.9900 0.5350 HOMA-13B 0.8803 0.887 0.983 0.885 0.9774 0.9860 0.9810 0.5860 Ours-5B 0.8790 0.905 0.984 0.896 0.9806 0.9869 0.9830 0.5380
[41]。内部视频包含直播电商场景下多样化的人类演示和物体操作情景,而 HOIGen-1M 子集提供了具有更广泛交互类别的人-物交互示例。此外,我们使用 GeoHOI-testset [8] 和 HOMA-testset [6] 与现有的双向 HOI 生成方法进行比较。这两个测试集与其对应的方法相关联,并为短视频 HOI 生成提供了标准化的评估提示或条件。每个测试集包含 100 个示例。因此,我们仅将它们用于与双向 HOI 基线的 5 秒比较。
评估数据集。现有的 HOI 测试集主要针对短离线视频生成,且覆盖的交互场景有限。因此,我们在多样化的真实世界交互场景下构建了一个主测试集,包含 400 个 HOI 案例,产生 384k 个推理帧。具体而言,它包括 100 个直播电商视频和 300 个从 HOIGen-1M 中选择的视频,这些视频均未用于训练。为了表征其场景多样性,我们根据标题将视频分为粗略的交互类别,如表 3 所示。
5.1.3 比较方法
我们将 StreamHOI 与两组基线进行比较。对于长视频生成方法,我们在 5 秒、30 秒和 60 秒设置下评估所有方法,以衡量短期质量和长时间稳定性。对于双向
第 8 页
8
min “他坐着,用手指 弹奏吉他。”
min “她坐着,用 双手在碗里揉 面团。” Identity 身份漂移 Interaction 交互 collapse 崩溃 Slow motion 慢动作 Ours Interact- LC-Avatar Deep Longlive CF-5B* Longlive CF-1.3B Avatar-long 1.5 Forcing -5B* -1.3B
图 7:与最先进的长视频生成框架的定性比较。虽然基线方法在长上下文中表现出严重的身份漂移、物体失真或时间不一致性,但我们的方法保持了鲁棒的主体-物体保真度和连贯的交互动态。完整视频序列请参阅补充材料。
“一个穿着西装的人 在杂乱的木桌上 用一支银色的笔 写字。” TABLE 3:主要评估测试集的交互类别分布。
交互类别 视频数量
数字设备交互 46 食物准备 44 艺术/手工制作 40 Ref Ours 17.6 fps Longcat-Video-Avatar-1.5 0.9 fps 鞋类处理 40 物体展示 40 图 8:在 60 秒设置下与 Longcat-Video-Avatar 1.5 的进一步比较。视频结果可在 补充材料中找到。 可穿戴/梳理调整 34 运动/移动活动 31 手势/解释 30 家庭/植物/宠物护理 29 学习/工具使用 24 音乐/舞蹈表演 23 食物/饮料服务 19 传统的 HOI 生成方法,我们在 5 秒设置下评估它们,因为这些方法主要是为 短离线视频生成而设计的。 长视频生成方法。首先,我们与 代表性的流式视频生成方法进行比较,包括 因果强制(逐帧)[12]、LongLive [13] 和 Deep Forcing [39]。由于因果强制和 LongLive 仅发布 1.3B 模型权重,我们在 使用我们的训练数据和 紧密匹配的训练配置的情况下,使用 Wan2.2-TI2V-5B 骨干网络对其进行了复现,分别记为 Causal Forcing-5B∗ 和 LongLive-5B∗。Deep Forcing [39] 是一种 无需训练的长视频生成方法;我们应用它
第 9 页
9
为了进行对比,我们将我们的方法与未使用 B-MST 的基线模型进行比较。我们还与 InteractAvatar-long [9] 进行了比较,这是一种基于顺序片段生成的离线长视频 HOI 生成方法。此外,我们纳入了 LongCat-Video-Avatar 1.5 [43],这是一种拥有 136 亿参数的少步化身视频生成方法。由于 LongCat-Video-Avatar 1.5 额外接受音频作为输入,我们使用静音音轨以保持比较在相同的图像和文本驱动设置下进行。所有这些方法都在主测试集上进行了评估。
双向 HOI 方法。其次,我们在 5 秒设置下的 HOI 测试集上与双向 HOI 视频生成方法进行比较,因为这些基线主要是为短视频生成设计的。由于 StreamHOI 仅接受参考图像和文本提示作为输入,我们使用 Qwen2.5-VL [44] 将数据集提供的手势和物体轨迹条件转换为文本描述,并将其附加到我们方法的提示中。因此,该实验侧重于比较相同测试用例上的最终 HOI 生成质量,而不是严格的条件遵循准确性。在 GeoHOI-testset 上,我们与 UniAnimate-DiT [45]、VACE [46] 和 GeoHOI [8] 进行了比较。UniAnimate-DiT 基于 Wan-14B 主干网络,从人物图像和姿态序列生成人类视频。VACE 是一个构建在 14B 视频模型上的通用视频编辑框架,支持文本控制生成和编辑。GeoHOI 通过增强物体感知和几何交互控制来改进 HOI 视频生成。在 HOMA-testset 上,我们与 HUMO [47]、VACE 和 HOMA [6] 进行了比较。HUMO 支持基于多个参考图像的条件视频生成。HOMA 为 HOI 人类视频生成引入了弱运动引导。
“这个人拿着一个橙色的手提包。 一只手握住把手,另一只手调整背带。”
我们的方法 4.60 秒 UniAnimate-DiT 549 秒
GeoHOI 87 秒 VACE 334 秒
图 9:在 5 秒设置下与 GeoHOI-testset 上的 SOTA 方法的比较。视频结果可在补充材料中找到。
5.1.4 指标
我们使用几个既定的指标来评估我们的方法。Object-CLIP [3] 用于通过计算分割内输入图像与生成视频之间物体的 CLIP [48] 余弦相似度来评估物体一致性。由于传统指标难以捕捉细粒度的物理接触和交互演变,我们进一步使用 InternVL3-38B [49] 作为结构化评估器。它对采样的帧执行多维二元评估,以评估物体保真度、人类质量和交互合理性。指标的详细信息在补充材料中提供。Subject Consistency(主体一致性)、Background Consistency(背景一致性)、Motion smoothness(运动平滑度)和 Aesthetic Quality(美学质量)从 Vbench [50] 中提取,用于衡量通用视频质量。我们还报告了 FPS 和 Latency(延迟)作为第 5.6 节中的效率指标。
5.2 比较结果
5.2.1 与长视频生成方法的比较
根据表 1,我们的方法在不同时间设置下的几乎所有质量指标中均 consistently 取得了最佳结果。对于 HOI 特定评估,我们的方法在 5、30 和 60 秒时获得了最高的 Obj-CLIP 分数,显示出比代表性基线更好的物体外观保持能力。基于 InternVL 的评估进一步表明,我们的方法在产生更可靠的手-物交互方面更好地保持了人类和物体状态。对于通用视频质量,我们的方法也实现了强大的主体一致性和背景一致性,表明前景主体和场景在时间上保持稳定。同时,具有竞争力的运动平滑度和美学质量分数表明,我们的方法在不同视频长度下保持了平滑的运动和高的视觉质量。详细的每类别结果和额外的基于 Qwen3-VL 的评估 [51] 在补充材料中提供;基于 Qwen3-VL 的结果评估了跨评估器的鲁棒性,并显示出与 InternVL3-38B broadly 一致的性能趋势。
我们方法的一个关键优势是其强大的长时细粒度生成长度能力。随着生成长度从 5 秒增加到 60 秒,大多数流式基线显示出明显的性能下降,特别是在 Obj-CLIP 和 InternVL 分数上。这表明它们在长自回归生成过程中逐渐丢失了早期的物体和交互状态。相比之下,我们的方法即使在 60 秒时也能保持高分,仅略有下降。图 7 中的定性结果显示出类似的趋势。流式基线通常在长生成后遭受物体漂移、手-物接触弱、物体外观不一致和运动退化的问题。我们的方法在整个视频中更好地保持了人类身份、物体外观、背景稳定性和物理上合理的交互动力学。
我们进一步展示了与 LongCat-Video-Avatar 1.5 [43] 的定性比较,这是一种拥有 136 亿参数的少步化身视频生成方法。如图 8 所示,LongCat-Video-Avatar 1.5 倾向于产生缓慢的运动,并在长生成过程中显示出相机漂移。相比之下,我们的方法在整个长视频中保持了更自然的运动动力学和更稳定的人类身份。
第 10 页
10
键盘外观,VACE 改变了帽子 “一个戴着帽子和眼镜的男人坐在沙发上, 的形状。这些定性结果进一步表明,我们的方法 拿着键盘,看着它, 并用一只手做手势。” 能够保持人物身份、物体外观以及交互的合理性。值得注意的是,我们的方法 仅需 4.6 秒即可生成 5 秒的视频,这比 我们的方法 现有的双向 HOI 方法快得多。 4.60 s
5.3 消融实验与讨论 HOMA 329 s 5.3.1 偏置引导的内存专业化训练 训练 466 s 我们首先验证偏置引导的内存专 HUMO 业化训练(B-MST)的效果。如表 4 所示,所有 466 s 变体均在相同的 60 秒设置下进行评估, 并使用相同的总内存预算。为了验证 改进并非仅来自额外的 LoRA 微调, VACE 我们使用原始的 sink-local 布局对 uniform-memory 基线 334 s 进行了相同的 700 步训练, 记为 Uniform-Mem FT。这种等步长控制 Fig. 10: 在 5 秒设置下与 HOMA-testset 上的 SOTA 方法对比 仅带来微小的变化,表明在 uniform-memory 设计下, 在 5 秒设置下。视频结果可在补充材料中找到。 300 步的 DMD 阶段已基本收敛。相比之下,完整 模型在 HOI 特定指标和通用指标上均有显著提升。 这些结果表明,性能提升主要源于 在固定 KV 缓存预算下的偏置引导内存专业化, 而非更大的缓存或额外的 LoRA 微调。 5.2.2 与双向 HOI 方法的比较 如表 2 所示,我们的模型与最近的 双向 HOI 生成方法相比,取得了极具竞争力的 结果。在 HOI 特定指标方面,我们的方法获得了 与定量发现一致的定性结果。如图 11 所示。如果没有 B-MST,模型表现出
在 Obj-CLIP 指标上高于 UniAnimate-DiT、VACE 和 HUMO,显示出更强的物体外观保持能力。在不注入任何额外物体条件的情况下,我们的方法在 GeoHOI 和 HOMA 上仍取得了与 GeoHOI 和 HOMA 相当的 Obj-CLIP 性能。更重要的是,我们的方法在 InternVLO 和 InternVLI 上获得了极具竞争力的分数,表明其能有效保持物体一致性并产生合理的人机交互。InternVLH 的结果也表明,我们的方法在生成过程中很好地保持了人物外观。此外,我们的方法在通用视频指标上表现强劲,证明了所提出的流式框架能够同时支持高质量 HOI 生成和整体视频质量。关键在于,在完全未见过的 GeoHOI 和 HOMA 测试集上取得如此具有竞争力的性能,有力地验证了我们离线块分析设计的跨数据集泛化能力。
如图 9 所示,我们展示了在 GeoHOI 测试集上的定性比较。我们的方法很好地保持了物体外观,并产生了合理的交互过程。即使没有姿态引导或物体驱动的控制,我们的方法也能根据交互上下文自然地调整背带。相比之下,UniAnimate-DiT 和 GeoHOI 需要额外的姿态注入,但其生成结果显得不够自然,而 VACE 在生成的视频中显示出明显的色调变化。如图 10 所示,我们进一步展示了在 HOMA 测试集上的定性结果。我们的方法很好地保持了面部身份,并生成了手部与键盘之间的自然接触。其他方法显示出更明显的伪影:生成的人脸经常扭曲,HOMA 未能遵循人物应注视键盘的指令,HUMO 改变了物体状态,并且由于长期自回归生成过程中早期交互先验的衰减,导致手部-物体接触不稳定、物体状态改变以及人物身份漂移。相比之下,B-MST 将每个 Transformer 块与其分析得出的空间偏置对齐:HOI 偏置块保留可靠的早期交互线索,而周围偏置块保留局部视觉变化和运动连续性的近期上下文。这种特定于块的记忆行为有助于在不妨碍短期时间平滑性的同时,维持长期交互一致性。
块分组验证。我们进一步考察所提出的记忆专业化是否依赖于块的语义分组。我们将我们的语义分组与两种控制条件进行比较:反向分组和随机分组。反向分组交换 HOI 偏置块和周围偏置块的记忆分配,而随机分组保持相同的组大小但随机采样块身份。如表 4 所示,两种控制条件的表现均不如我们的语义分组,其中反向分组导致长期 HOI 一致性下降最大。这表明,仅靠非均匀的记忆分配是不够的;记忆行为需要与每个块组的语义偏置相匹配。图 13 中的定性结果也显示了相同的趋势:反向和随机分组通常导致接触漂移、物体状态改变或不稳定的时间连续性,而我们的分组更好地保持了交互状态和短期视觉一致性。
泛化验证。为了验证所提出的记忆专业化并不绑定于特定的骨干网络,我们将 B-MST 进一步应用于 LongLive-5B∗。具体而言,我们首先应用相同的离线 HOI 感知块分析策略
第 11 页
11
表 4:60 秒设置下的消融研究。我们分别对偏置引导的内存专业化训练(B-MST)、记忆距离缩放(MDS)以及块分组策略进行了消融。Uniform-Mem FT 表示均匀内存微调,这是一个使用与 B-MST 相同的 700 步 LoRA 微调步数和相同的总 KV 缓存预算的等步长 LoRA 微调基线,同时保持原始的均匀 sink-local 内存布局。
HOI 特定指标 通用指标 方法 主体 背景 运动 美学 Obj-CLIP↑ InternVLO↑ InternVLH↑ InternVLI↑ Cons.↑ Cons.↑ Smooth.↑ Quality↑
ours 0.8298 0.857 0.942 0.868 0.9734 0.9796 0.9902 0.5429 固定 MDS 0.8204 0.840 0.923 0.864 0.9730 0.9792 0.9885 0.5366 无 MDS 0.7519 0.781 0.880 0.774 0.9647 0.9759 0.9883 0.5279 无 B-MST 0.6028 0.682 0.836 0.701 0.9583 0.9748 0.9851 0.5236 Uniform-Mem FT 0.6093 0.675 0.859 0.688 0.9592 0.9744 0.9855 0.5269
反向分组 0.5744 0.671 0.808 0.662 0.9579 0.9747 0.9839 0.5231 随机分组 0.5939 0.686 0.821 0.724 0.9601 0.9732 0.9852 0.5282
表 5:偏置引导的内存专业化训练的泛化能力。
HOI 特定指标 通用指标 方法 主体 背景 运动 美学 Obj-CLIP↑ InternVLO↑ InternVLH↑ InternVLI↑ Cons.↑ Cons.↑ Smooth.↑ Quality↑ LongLive-5B∗ 0.5937 0.688 0.808 0.712 0.9640 0.9731 0.9842 0.5193 + B-MST 0.8036 0.832 0.926 0.847 0.9694 0.9758 0.9864 0.5281
在 4.2 节中应用于 LongLive-5B∗,该模型识别出其具有 HOI 偏置和周围偏置的块。由此产生的块分组如图 14(b) 所示,随后根据这些配置文件的块类型实例化 B-MST。如表 5 所示,B-MST 在 HOI 特定指标和通用指标上均持续提升了 LongLive-5B∗ 的性能。Obj-CLIP 和基于 InternVL 的指标上的提升表明更好地保留了对象外观、人类状态和交互关系,而通用指标的改进则显示了更稳定的前景和背景一致性。图 14(a) 中的定性比较进一步显示,原始的 LongLive-5B∗ 在长生成过程中会累积误差,导致手-物接触不稳定和外观变化。使用 B-MST 后,模型在块之间更好地维持了手-物交互和对象状态。这些结果表明,B-MST 可以作为长期流式 HOI 生成的一种通用内存适应策略。
5.3.2 记忆距离缩放的验证
随后,我们验证了记忆距离缩放模块(MDS)的效果。MDS 调整了当前块与 HOI 偏置块的 sink 内存之间的感知时间距离,使得在长流式生成过程中更容易访问早期的交互状态。如表 4 所示,与完整模型相比,移除 MDS 会导致性能明显下降。这表明内存容量和时间距离起着互补作用。基于块的内存分配为 HOI 偏置块提供了更多的早期交互 token,而 MDS 则在注意力机制中使这些时间上遥远的 token 更有效。可学习 MDS 的效果。我们还评估了一种具有手动固定 MDS 参数的变体。这些参数是根据 4.2 节中的离线配置文件结果设置的,详细信息见补充材料。如表 4 所示,固定 MDS 参数的变体已经取得了强大的性能,表明配置文件结果为配置记忆距离缩放模块提供了有用的指导。然而,它始终不如我们完整模型中使用的可学习 MDS。这表明
第 12 页
12
“一位留着脏辫的年轻女子坐在公园的毯子上,用触控笔在数字绘图板上绘画” 1分钟 “一名男子站立着,右手拿着一根木棍在打磨木头。” 1分钟
Ref Longlive-5B* (a) Longlive-5B* + B-MST Ref w/ learnable MDS w/ fixed MDS
HOI-biased block surrounding-biased block 图12:使用可学习MDS缓解时间退化。虽然固定MDS配置在长时间生成过程中会出现渐进式颜色漂移,但可学习MDS机制有效地保持了颜色一致性,从而提高了长时程的一致性。
Longlive-5B* block group (b) 图14:B-MST在LongLive-5B*上的泛化能力。(a) 集成B-MST防止了原始LongLive-5B*在长时程生成过程中出现的交互漂移和物体失真。(b) LongLive-5B*的配置块分组概况。
HOI-biased block surrounding-biased block “一个孩子用一只手拿着罐盖,并用另一只手以专注、好奇的方式操作它。” 1分钟 “一位身穿绿色医疗制服的人坐在书桌前,用黑色钢笔在纸上书写。” 1分钟
5.4 用户研究
我们进行了一项用户研究,以评估我们的方法相对于长视频方法和双向HOI生成方法的感知质量。我们采用了N选一的强制选择协议。对于每个图像-文本对,参与者查看相应基准测试中所有竞争方法生成的视频,这些视频以随机顺序呈现,并根据四个标准选择唯一最佳结果:人体一致性、物体一致性、交互自然性和整体视频质量。共有28名参与者参加了这项研究,每位参与者在三个基准测试中完成了40次随机试验。定期提供短暂休息以减少疲劳。对于每个基准测试和标准,我们报告每种方法被选为最佳结果的试验百分比,称为首选率。结果总结在图15中。
Reverse Grouping 图13:块分组策略的消融实验。与空间偏置不匹配的内存分配(反向/随机)会导致接触漂移,而我们的语义分组保持了稳定的交互。
Random Grouping 图15中的用户偏好显示,我们的方法在长视频生成方面具有一致的优势。在LongVideo Bench上,我们的方法在所有四个标准上获得了最高的首选率,范围为36.8%至38.0%。这远高于最强的基线LC-Avatar 1.5(24.5%–27.0%),也远高于其余的流式方法。特别是,1.3B规模的Causal Forcing和LongLive几乎从未被选为最佳结果(<0.4%),而它们的5B变体和Deep Forcing仅获得6%–13%的选票。这些结果表明,所提出的内存设计在长视频生成过程中更可靠地保持了人体外观、物体身份和手-物交互状态。
我们的方法在与专用的双向HOI生成模型竞争时也保持竞争力。在GeoHOI Bench上,StreamHOI在四个标准上获得了33.4%–35.8%的首选率,与专用的Geo-HO模型(30.9%–34.9%)相当,并优于Unianimate-DiT(20.8%–22.6%)和VACE(9.1%–12.3%)。在HOMA Bench上,StreamHOI在每个标准上都取得了最高的首选率(40.0%–44.4%),领先于HOMA(35.0%–40.8%),而VACE和HUMO被选中的频率要低得多。总体而言,该研究表明,StreamHOI提供的感知质量与专用模型相当,且通常更受青睐
第 13 页
13
图 15:用户研究结果。饼图展示了在 Long-Video、GeoHOI 和 HOMA 基准测试中,基于四个感知标准(人类一致性、物体一致性、交互自然度和整体视频质量)的首选偏好率。
“一名年轻男子坐在米色沙发上,穿着格子衬衫和帽子,在温馨、灯光柔和的客厅里用手指弹奏黑色吉他。” 20000 帧 “一名穿着无袖上衣的年轻女子躺在床上,在柔和灯光的温馨房间里浏览智能手机。” 流式切换
KV 重新缓存 》》 》》
“一名穿着蓝色连帽衫的男子坐在黄色沙发上,戴着 VR 头显,手持发光运动控制器,完全沉浸在一款游戏中,身处温馨的客厅。” 20000 帧 “年轻女子稍微调整了一下姿势,一只手拿着智能手机,另一只手将一缕头发别到耳后。脸上浮现出温柔的微笑。”
》》 》》 图 17:流式生成过程中的动态提示切换。收到新的文本提示后,模型能够实时调整生成的动作和交互,保持高交互质量。 图 16:扩展视野生成的定性结果。StreamHOI 在 20,000 帧序列中保持了稳定的人-物交互和结构一致性,减少了长自回归生成过程中的视觉退化。值得注意的是,我们的方法可以与 KV Recache [13] 机制结合,在流式生成期间动态切换提示,从而实现对人-物交互的流式控制。
如图 17 所示,模型在收到下一个提示后立即响应,准确遵循指示的交互变化。此外,与专门的双向 HOI 生成方法相比,我们的方法在保持流式生成效率和时间可扩展性的同时,实现了高质量的交互。
5.6 运行时分析 5.5 长视野评估 我们在表 6 中报告了运行时比较。StreamHOI 在首块延迟为 0.75 秒的情况下实现了 17.6 FPS 的吞吐量。在相同的 5B 模型规模下,其吞吐量与 LongLive∗ 相当,且快于 Causal Forcing∗ 和 Deep Forcing,同时提供了更强的长持续时间 HOI 质量,如前文比较所示。尽管 1.3B 的 LongLive 基线达到了更高的 FPS,但其生成质量明显较弱,特别是在长时间设置下。与更大的化身或双向
第 14 页
14
表 6:不同方法的 FPS 和延迟对比。
| 方法 | 模型大小 | FPS↑ | 延迟↓ | | :— | :— | :— | :— | | Causal Forcing | 1.3B | 8.9 | 0.45 | | LongLive | 1.3B | 20.7 | 0.69 | | Causal Forcing∗ | 5B | 14.4 | 0.75 | | LongLive∗ | 5B | 17.6 | 0.75 | | Deep Forcing | 5B | 14.3 | 0.75 | | LC-Avatar 1.5 | 13.6B | 0.9 | 87.51 | | InteractAvatar-Long | 10B | 0.14 | 600 | | UniAnimate-DiT | 14B | 0.15 | 549 | | VACE | 14B | 0.24 | 334 | | HUMO | 17B | 0.17 | 466 | | GeoHOI | 5B | 0.93 | 87 | | HOMA | 13B | 0.25 | 329 | | StreamHOI | 5B | 17.6 | 0.75 |
在 HOI 生成方法中,StreamHOI 的效率显著更高:LC-Avatar 1.5 需要 87.51 秒,InteractAvatar-Long 需要 600 秒,而其他双向 HOI 方法端到端生成需要 87 秒至 549 秒。这些结果表明,StreamHOI 在保持流式生成低延迟优势的同时,实现了具有竞争力的长时程 HOI 质量。
6 局限性
当参考图像中的人-物交互不明确时,例如接触区域模糊或物体被遮挡,StreamHOI 可能会生成稳定性较差的交互。此外,由于我们的训练数据主要包含单人视频,StreamHOI 在复杂的多人生场景中可能效果较差。我们将这些情况留待未来工作研究。
7 结论
我们提出了 StreamHOI,这是一个用于长时程人-物交互视频生成的流式框架。通过分析块级空间注意力,我们表明不同的 Transformer 块对 HOI 区域和周围区域具有不同的内存偏好。基于这一观察,StreamHOI 使用偏置引导的内存专业化训练(B-MST)使生成器适应块特定的 Sink-Local Memory 布局,并应用记忆距离缩放(MDS)模块以加强对可靠交互锚点的长程访问。在长视频和 HOI 基准上的实验表明,StreamHOI 在受限内存和低延迟生成的条件下,提高了交互合理性、物体保持、时间稳定性和运行时效率。这些结果表明,交互感知的时间内存适应是可扩展流式 HOI 视频生成的有效方向。
参考文献
[1] B. Zuo, Z. Zhao, W. Sun, X. Yuan, Z. Yu, and Y. Wang, “Graspdiff: Grasping generation for hand-object interaction with multimodal guided diffusion,” IEEE Transactions on Visualization and Computer Graphics, vol. 31, no. 9, pp. 5642–5654, 2024.
[2] Z. Hu, Z. Yin, D. Haeufle, S. Schmitt, and A. Bulling, “Hoimotion: Forecasting human motion during human-object interactions using egocentric 3d object bounding boxes,” IEEE Transactions on Visualization and Computer Graphics, vol. 30, no. 11, pp. 7375–7385, 2024.
[3] Z. Xu, Z. Huang, J. Cao, Y. Zhang, X. Cun, Q. Shuai, Y. Wang, L. Bao, J. Li, and F. Tang, “Anchorcrafter: Animate cyberanchors salaling your products via human-object interacting video generation,” arXiv preprint arXiv:2411.17383, 2024.
[4] J. Xing, M. Xia, Y. Liu, Y. Zhang, Y. Zhang, Y. He, H. Liu, H. Chen, X. Cun, X. Wang et al., “Make-your-video: Customized video generation using textual and structural guidance,” IEEE transactions on visualization and computer graphics, vol. 31, no. 2, pp. 1526–1541, 2024.
[5] Y. Zhang, W. Dong, F. Tang, N. Huang, H. Huang, C. Ma, P. Wan, T.-Y. Lee, and C. Xu, “Motioncrafter: Plug-and-play motion guidance for diffusion models,” IEEE Transactions on Visualization and Computer Graphics, 2025.
[6] Z. Huang, Z. Zhou, J. Cao, Y. Ma, Y. Chen, Z. Rao, Z. Xu, H. Wang, Q. Lin, Y. Zhou et al., “Hunyuanvideo-homa: Generic human-object interaction in multimodal driven human animation,” arXiv preprint arXiv:2506.08797, 2025.
[7] Z. S. Xue, R. Luo, C. Chen, and K. Grauman, “Hoi-swap: Swapping objects in videos with hand-object interaction awareness,” Advances in Neural Information Processing Systems (NeurIPS), vol. 37, pp. 77 132–77 164, 2024.
[8] Z. Xu, Z. Rao, J. Cao, X. Liu, Z. Fang, H. Zhang, S. Tang, and F. Tang, “Geohoi: Geometry-enhanced human-object interaction video generation via hierarchical multi-modal injection,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026, pp. 3739–3748.
[9] Y. Zhang, Z. Zhou, Z. Yu, Z. Huang, T. Hu, S. Liang, G. Zhang, Z. Peng, S. Li, Y. Chen et al., “Making avatars interact: Towards text-driven human-object interaction for controllable talking avatars,” arXiv preprint arXiv:2602.01538, 2026.
[10] T. Yin, Q. Zhang, R. Zhang, W. T. Freeman, F. Durand, E. Shechtman, and X. Huang, “From slow bidirectional to fast autoregressive video diffusion models,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025, pp. 22 963–22 974.
[11] X. Huang, Z. Li, G. He, M. Zhou, and E. Shechtman, “Self forcing: Bridging the train-test gap in autoregressive video diffusion,” arXiv preprint arXiv:2506.08009, 2025.
[12] H. Zhu, M. Zhao, G. He, H. Su, C. Li, and J. Zhu, “Causal forcing: Autoregressive diffusion distillation done right for high-quality real-time interactive video generation,” arXiv preprint arXiv:2602.02214, 2026.
[13] S. Yang, W. Huang, R. Chu, Y. Xiao, Y. Zhao, X. Wang, M. Li, E. Xie, Y. Chen, Y. Lu, and S. H. Y. Chen, “Longlive: Real-time interactive long video generation,” 2025.
[14] Z. Huang, F. Tang, Y. Zhang, X. Cun, J. Cao, J. Li, and T.-Y. Lee, “Make-your-anchor: A diffusion-based 2d avatar generation framework,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024, pp. 6997–7006.
[15] Z. Huang, F. Tang, J. Cao, Y. Zhang, X. Cun, Y. Bo, J. Li, and T.-Y. Lee, “Make-your-anchor+: Temporal consistent 2d avatar generation via video diffusion prior,” IEEE Transactions on Visualization & Computer Graphics, vol. 32, no. 04, pp. 2883–2897, Apr. 2026. [Online]. Available: https://doi.ieeecomputersociety.org/10.1109/TVCG.2026.3655478
[16] L. Hu, G. Wang, Z. Shen, X. Gao, D. Meng, L. Zhuo, P. Zhang, B. Zhang, and L. Bo, “Animate anyone 2: High-fidelity character image animation with environment affordance,” arXiv preprint arXiv:2502.06145, 2025.
[17] Y. Men, Y. Yao, M. Cui, and L. Bo, “Mimo: Controllable character video synthesis with spatial decomposed modeling,” in Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR), 2025, pp. 21 181–21 191.
[18] Y. Fan, Q. Yang, K. Wang, H. Zhou, Y. Li, H. Feng, E. Ding, Y. Wu, and J. Wang, “Re-hold: Video hand object interaction reenactment via adaptive layout-instructed diffusion model,” in Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR), 2025, pp. 17 550–17 560.
[19] Z. Shen, C. Wu, J. Zhou, C. Zhao, K. Wang, H. Zhou, Y. Li, H. Feng, W. He, and J. Wang, “idit-hoi: Inpainting-based hand object interaction reenactment via video diffusion transformer,” arXiv preprint arXiv:2506.12847, 2025.
[20] L. Dang, R. Shao, H. Zhang, W. Min, Y. Liu, and Q. Wu, “Svimo: Synchronized diffusion for video and motion generation in hand-object interaction scenarios,” arXiv preprint arXiv:2506.02444, 2025.
[21] L. Dang, J. Li, Z. Li, H. Zhang, L. An, W. Min, Y. Liu, and Q. Wu, “Harmohoi: Harmonizing appearance and 3d motion
第 15 页
15
for multi-view hand-object interaction synthesis,” 2026. [Online]. [43] M. L. Team, X. Cai, M. Cheng, F. Gao, Z. Kong, J. Li, L. Li, W. Li, Available: https://arxiv.org/abs/2607.17097 H. Liu, S. Tan et al., “Longcat-video-avatar 1.5 technical report,” [22] L. Wang, Z. Xia, T. Hu, P. Wang, P. Wei, Z. Zheng, M. Zhou, arXiv preprint arXiv:2605.26486, 2026. Y. Zhang, and M. Gao, “Dreamactor-h1: High-fidelity human- [44] S. Bai, K. Chen, X. Liu, J. Wang, W. Ge, S. Song, K. Dang, P. Wang, product demonstration video generation via motion-designed dif- S. Wang, J. Tang, H. Zhong, Y. Zhu, M. Yang, Z. Li, J. Wan, P. Wang, fusion transformers,” arXiv preprint arXiv:2506.10568, 2025. W. Ding, Z. Fu, Y. Xu, J. Ye, X. Zhang, T. Xie, Z. Cheng, H. Zhang, [23] Y. Jin, Z. Sun, N. Li, K. Xu, H. Jiang, N. Zhuang, Q. Huang, Z. Yang, H. Xu, and J. Lin, “Qwen2.5-vl technical report,” arXiv Y. Song, Y. Mu, and Z. Lin, “Pyramidal flow matching for efficient preprint arXiv:2502.13923, 2025. video generative modeling,” in International Conference on Learning [45] X. Wang, S. Zhang, L. Tang, Y. Zhang, C. Gao, Y. Wang, and Representations, vol. 2025, 2025, pp. 23 378–23 402. N. Sang, “Unianimate-dit: Human image animation with large- [24] B. Chen, D. Mart´ı Mons´o, Y. Du, M. Simchowitz, R. Tedrake, scale video diffusion transformer,” arXiv preprint arXiv:2504.11289, and V. Sitzmann, “Diffusion forcing: Next-token prediction meets 2025. full-sequence diffusion,” Advances in Neural Information Processing [46] Z. Jiang, Z. Han, C. Mao, J. Zhang, Y. Pan, and Y. Liu, “Vace: All- Systems, vol. 37, pp. 24 081–24 125, 2024. in-one video creation and editing,” arXiv preprint arXiv:2503.07598, [25] K. Song, B. Chen, M. Simchowitz, Y. Du, R. Tedrake, and 2025. V. Sitzmann, “History-guided video diffusion,” arXiv preprint [47] L. Chen, T. Ma, J. Liu, B. Li, Z. Chen, L. Liu, X. He, G. Li, Q. He, and arXiv:2502.06764, 2025. Z. Wu, “Humo: Human-centric video generation via collaborative [26] Y. Song, P. Dhariwal, M. Chen, and I. Sutskever, “Consistency multi-modal conditioning,” arXiv preprint arXiv:2509.08519, 2025. models,” 2023. [48] A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agar- [27] Y. Song and P. Dhariwal, “Improved techniques for training con- wal, G. Sastry, A. Askell, P. Mishkin, J. Clark et al., “Learning sistency models,” in International Conference on Learning Represen- transferable visual models from natural language supervision,” tations, vol. 2024, 2024, pp. 15 078–15 097. in International conference on machine learning. PmLR, 2021, pp. [28] Z. Wang, C. Lu, Y. Wang, F. Bao, C. Li, H. Su, and J. Zhu, 8748–8763. “Prolificdreamer: High-fidelity and diverse text-to-3d generation [49] J. Zhu, W. Wang, Z. Chen, Z. Liu, S. Ye, L. Gu, H. Tian, Y. Duan, with variational score distillation,” Advances in neural information W. Su, J. Shao et al., “Internvl3: Exploring advanced training processing systems, vol. 36, pp. 8406–8441, 2023. and test-time recipes for open-source multimodal models,” arXiv preprint arXiv:2504.10479, 2025.[29] W. Luo, T. Hu, S. Zhang, J. Sun, Z. Li, and Z. Zhang, “Diff-instruct: [50] Z. Huang, Y. He, J. Yu, F. Zhang, C. Si, Y. Jiang, Y. Zhang, T. Wu, A universal approach for transferring knowledge from pre-trained Q. Jin, N. Chanpaisit et al., “Vbench: Comprehensive benchmark diffusion models,” Advances in Neural Information Processing Sys- suite for video generative models,” in Proceedings of the IEEE/CVF tems, vol. 36, pp. 76 525–76 546, 2023. Conference on Computer Vision and Pattern Recognition (CVPR), 2024,[30] T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Free- pp. 21 807–21 818. man, and T. Park, “One-step diffusion with distribution matching [51] S. Bai, Y. Cai, R. Chen, K. Chen, X. Chen, Z. Cheng, L. Deng, distillation,” in Proceedings of the IEEE/CVF conference on computer W. Ding, C. Gao, C. Ge, W. Ge, Z. Guo, Q. Huang, J. Huang, vision and pattern recognition, 2024, pp. 6613–6623. F. Huang, B. Hui, S. Jiang, Z. Li, M. Li, M. Li, K. Li, Z. Lin, [31] L. Zhang, S. Cai, M. Li, G. Wetzstein, and M. Agrawala, “Frame J. Lin, X. Liu, J. Liu, C. Liu, Y. Liu, D. Liu, S. Liu, D. Lu, R. Luo, context packing and drift prevention in next-frame-prediction C. Lv, R. Men, L. Meng, X. Ren, X. Ren, S. Song, Y. Sun, J. Tang, video diffusion models,” in The Thirty-ninth Annual Conference on J. Tu, J. Wan, P. Wang, P. Wang, Q. Wang, Y. Wang, T. Xie, Y. Xu, Neural Information Processing Systems, 2025. H. Xu, J. Xu, Z. Yang, M. Yang, J. Yang, A. Yang, B. Yu, F. Zhang, [32] K. Liu, W. Hu, J. Xu, Y. Shan, and S. Lu, “Rolling forcing: H. Zhang, X. Zhang, B. Zheng, H. Zhong, J. Zhou, F. Zhou, J. Zhou, Autoregressive long video diffusion in real time,” arXiv preprint Y. Zhu, and K. Zhu, “Qwen3-vl technical report,” arXiv preprint arXiv:2509.25161, 2025. arXiv:2511.21631, 2025. [33] J. Cui, J. Wu, M. Li, T. Yang, X. Li, R. Wang, A. Bai, Y. Ban, and C.- J. Hsieh, “Self-forcing++: Towards minute-scale high-quality video generation,” in The Fourteenth International Conference on Learning Representations. [34] J. Yu, J. Bai, Y. Qin, Q. Liu, X. Wang, P. Wan, D. Zhang, and X. Liu, “Context as memory: Scene-consistent interactive long video gen- eration with memory retrieval,” arXiv preprint arXiv:2506.03141, 2025. [35] J. Huang, X. Hu, B. Han, S. Shi, Z. Tian, T. He, and L. Jiang, “Memory forcing: Spatio-temporal memory for consistent scene generation on minecraft,” arXiv preprint arXiv:2510.03198, 2025. [36] S. Ji, X. Chen, S. Yang, X. Tao, P. Wan, and H. Zhao, “Memflow: Flowing adaptive memory for consistent and efficient long video narratives,” arXiv preprint arXiv:2512.14699, 2025. [37] S. Chen, C. Wei, S. Sun, P. Nie, K. Zhou, G. Zhang, M.-H. Yang, and W. Chen, “Context forcing: Consistent autoregressive video generation with long context,” arXiv preprint arXiv:2602.06028, 2026. [38] H. Yesiltepe, T. Meral, A. K. Akan, K. Oktay, and P. Ya- nardag, “Infinity-rope: Action-controllable infinite video genera- tion emerges from autoregressive self-rollout,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026, pp. 40 256–40 265. [39] J. Yi, W. Jang, P. H. Cho, J. Nam, H. Yoon, and S. Kim, “Deep forcing: Training-free long video generation with deep sink and participative compression,” arXiv preprint arXiv:2512.05081, 2025. [40] J. Tian, Y. Wang, G. Yu, and C. Zhang, “Head forcing: Long autoregressive video generation via head heterogeneity,” in arXiv preprint, 2026. [41] K. Liu, Q. Liu, X. Liu, J. Li, Y. Zhang, J. Luo, X. He, and W. Liu, “Hoigen-1m: A large-scale dataset for human-object interaction video generation,” in Proceedings of the Computer Vision and Pattern Recognition Conference, 2025, pp. 24 001–24 010. [42] N. Ravi, V. Gabeur, Y.-T. Hu, R. Hu, C. Ryali, T. Ma, H. Khedr, R. R¨adle, C. Rolland, L. Gustafson et al., “Sam 2: Segment anything in images and videos,” arXiv preprint arXiv:2408.00714, 2024.