Wan-Streamer v0.3:世界与事件流解耦的实时全双工交互模型

三分钟导读:Wan-Streamer v0.3 提出将视频重构为持久世界上下文与随时间变化的事件流,通过通用预训练学习世界动态,并实例化为支持实时全双工音频视觉交互及开放词汇自由行为生成的模型。

英文题目:Video = World + Event Stream

论文出处:arXiv 每日论文精选 · arXiv:2607.15038

原始论文:PDF / 论文页面

对应视频标题:Wan-Streamer v0.3:世界与事件流解耦的实时全双工交互模型|推荐指数:★★★★★

这篇论文解决什么问题?

现有实时交互模型(如 v0.1/v0.2)将特定应用(如代理对话)作为训练目标,缺乏可泛化的底层能力,且行为表达局限于固定的倾听或空闲动作。

核心创新

  • 提出视频的世界+事件流分解范式,实现通用预训练与下游任务解耦。
  • 引入基于角色扮演格式的开放词汇自由行为生成,代理可通过自然语言描述执行非固定动作集的行为。
  • 保持 v0.2 的建模契约和服务拓扑,在扩展表达能力同时维持低延迟特性。

方法概览

提出“世界+事件流”分解:世界(World)包含环境、角色、声学条件等持久上下文;事件流(Event Stream)包含行为、语音等随时间变化的内容。模型在大规模视频上进行通用预训练,预测给定世界和输入下的世界演化;在推理时,世界上下文一次性预填充,模型根据用户流式输入生成语言形式的语音和自由行为指令,进而条件化生成同步的音频和视频。

逐图理解论文

预训练数据构造:世界上下文摘要

预训练数据构造:世界上下文摘要
Figure 1 Two examples of the general-purpose pretraining data: time-aligned events paired with a summary of the persistent world context, including the visual setting, acoustic conditions, and characters. Parentheses denote character behavior, while quotation marks enclose spoken words. For clarity, both examples contain only one character, so actor names are omitted from the event labels. Training supports multiple characters by associating each event with its corresponding character, or with an explicit no-character marker for character-independent events.

预训练数据构造是关键。每个视频示例通过相关信息总结其持久世界上下文,包括视觉设置、声学条件和角色。自然语言事件与发生的时间区间对齐。这种构造方式让模型学习世界-事件动态,为推理时在线产生事件提供基础。训练支持多角色,通过关联事件与对应角色或无角色标记来处理。

推理机制:块因果注意力与流式生成

推理机制:块因果注意力与流式生成
Figure 2 The world context is tokenized and prefilled once before streaming. Language, audio, and video inputs and outputs then share a causal timeline coordinated by block-causal attention. The model maps this world and streaming multimodal user input to language-form speech and behavior actions. These predicted tokens condition synchronized audio-video generation. In the agent text stream, phrases inside parentheses denote free-form behavior, while text outside parentheses is spoken by the agent.

推理时,世界上下文被 tokenized 并一次性预填充。语言、音频和视频输入输出共享由块因果注意力协调的因果时间线。模型将世界和流式多模态用户输入映射为语言形式的语音和行为动作。这些预测的 token 条件化生成同步的音频和视频,实现低延迟的实时交互。

创新点二:通用预训练与任务解耦

创新点二:通用预训练与任务解耦
Figure 1 makes this supervision concrete: each example summarizes its persistent world context once using the information relevant to that clip, while natural-language events are aligned to the intervals in which they occur. Learning how these events unfold in context teaches the pretrained model world-event dynamics that can be reused when events are produced online at inference.

核心创新在于提出视频的世界+事件流分解范式。通过通用预训练学习世界动态,模型不再绑定于特定下游任务。这种解耦使得模型能够适应更广泛的交互场景,如世界模型控制或具身操作,尽管这些应用目前仅作为未来工作提及。这标志着从特定任务模型向通用世界动态学习器的转变。

创新点三:保持低延迟与服务拓扑

创新点三:保持低延迟与服务拓扑
Table 1 summarizes the changes across versions. The end-to-end streaming formulation, the resolution and frame rate, the latency budget, and the serving topology are inherited from v0.2; v0.3 changes the conceptual framing (world + event stream), the pretraining objective (predict how a world streams forward), and the agent’s expressive range (speech plus free-form behavior).

v0.3 保持了 v0.2 的建模契约和服务拓扑,包括使用 DeepSpeed Ulysses 进行上下文并行执行。这使得模型在扩展表达能力的同时,维持了低延迟特性。端到端流式 formulation、分辨率、帧率、延迟预算和 serving topology 均继承自 v0.2,确保了实时交互的可行性。

实验结果:延迟与性能评估

实验结果:延迟与性能评估
Table 1 Summary of the Wan-Streamer versions. Emphasized cells indicate what v0.3 changes; unemphasized cells indicate what it preserves from v0.2.

实验在真实视频上进行通用预训练,并实例化于实时全双工音频视觉交互任务。评估显示,模型侧响应延迟约 200 ms,总交互延迟约 550 ms,其中包含 350 ms 的网络预算。这些指标表明模型在保持高分辨率 640×368 和 25 FPS 的同时,实现了高效的实时交互。

实验与关键结果

  • 在真实视频上进行通用预训练,学习世界-事件动态。
  • 实例化于实时全双工音频视觉交互任务,评估代理的语音同步行为生成能力。
  • 对比 v0.1, v0.2, v0.3 的版本特性与性能指标。
  • 640×368 分辨率, 25 FPS(第 1 页)
  • 模型侧响应延迟约 200 ms(第 1 页)
  • 总交互延迟约 550 ms (350 ms 网络预算)(第 1 页)

阅读时需要注意

  • 仅研究了实时全双工音频视觉交互的实例化,其他下游应用(如世界模型控制、具身操作)的系统适应和评估留待未来工作。
  • 行为生成依赖于语言描述的准确性,可能受限于自然语言对复杂物理交互描述的局限性。
  • 预训练数据中的世界上下文摘要依赖于对视频内容的推断和结构化,可能存在信息丢失或偏差。
  • 自由行为指令的生成质量高度依赖于预训练数据中行为与视觉/音频对齐的准确性。

关联工作

  • Wan-Streamer v0.1:前身版本,建立了端到端流式交互基础。(第 1 页)
  • Wan-Streamer v0.2:前身版本,提升了分辨率并优化了并行性能,v0.3 继承其拓扑和延迟特性。(第 1 页)
  • DeepSpeed Ulysses:用于 v0.2 及 v0.3 的上下文并行执行器,支持长序列 Transformer 训练。(第 1 页)
  • Worldplay:相关世界模型工作,用于实时交互中的长期几何一致性。(第 4 页)
  • Matrix-game 3.0:相关实时流式交互世界模型,具有长程记忆。(第 4 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

视频 = 世界 + 事件流

万团队,阿里巴巴集团

完整作者名单请参阅贡献与致谢。

摘要

我们提出 Wan-Streamer v0.3,它在单一组织视角下重构了我们的原生流式交互模型:视频是世界加上事件流。世界是视频展开的持久上下文,包括环境、场景、主体、环境声学条件、声音特征以及其他相对稳定的条件。事件流是世界内随时间发生的一切变化,包括场景或环境变化、主体行为、语音以及其他声音。这产生了一个针对大量真实视频的通用人预训练任务:给定一个世界和输入,预测世界如何实时移动、变化和响应。由此产生的能力可以专门用于广泛的实时下游任务。我们在实时全双工视听交互中实例化了它,其中事件流是代理的语音以及自由行为。从功能上讲,模型的多模态理解过程类似于视觉-语言-动作(VLA):它将多模态用户输入映射为语言形式的语音和行为动作。Wan-Streamer v0.3 保留了 v0.2 的运行点:640×368 分辨率、25 FPS 的视频,160 毫秒的流式单元,约 200 毫秒的模型侧响应延迟,以及在 350 毫秒双向网络预算下约 550 毫秒的总交互延迟。

网站:https://wan-streamer.com/

1 引言 [cs.CV]

Wan-Streamer v0.1 [1] 为实时全双工视听交互建立了原生流式、端到端的公式化方法:用户和代理的文本、音频和视频共存于一个因果时间线上,并由单个 Transformer 建模,因此感知、响应时机、说话、可见的倾听以及同步视频被学习为一种行为,而不是由级联模块组装而成。Wan-Streamer v0.2 [2] 保持该公式化方法不变,并将交互流从 192×336 提升至 640×368,同时保持约 200 毫秒的模型侧延迟,将昂贵的潜在生成移至 Ulysses 风格的上下文并行执行器 [3]。

这两个版本都将一个目标应用——一个能说话和反应的代理——作为训练目标。Wan-Streamer v0.3 退后一步,询问潜在的能力是什么。我们的答案是一个简单的分解:任何视频都可以被解读为世界加上事件流。世界是视频展开的持久上下文:其环境和场景、视觉风格、主体及其身份和外观、环境声学条件、声音特征以及其他相对稳定的条件。事件流是该上下文内随时间发生的一切变化:场景或环境变化、主体行为、相机运动、语音以及其他声音。录制的视频是世界内展开的事件流的一个实现;交互体验是同一对象,其事件流根据输入在线生成。

这种分解定义了一个通用人预训练任务。我们在大量普通视频上进行预训练以学习一件事:给定一个世界和输入,世界如何向前流式传输——它如何移动、变化和响应,以单位为单位,实时进行。因为本质上所有自然视频都是具有事件流的世界的一个实例,所以这个目标是广泛且可扩展的,它产生的能力是关于场景如何合理演化的世界知识。然后,可以通过改变世界上下文和驱动流的输入来专门化这种能力,同时保留相同的流式响应逻辑。

第 2 页

[世界 #1] 白天的郊区社区。环境特征包括带有黄色车道标线的铺砌沥青道路、人行道和草地路缘 … 音频包含各种游戏内声音,如角色在铺砌路面上的脚步声、经过车辆的引擎声 … @character1 是一个类人机器人 身着流线型的白色和灰色装甲服。其胸部和肩部有发光的红色圆形灯光 …

[00.00s – 01.75s] [01.75s – 07.13s] [07.13s – 17.38s] [17.38s – 18.52s]

[事件](在人行道上奔跑) [事件](右转进入道路) [事件](朝金色汽车跑去) [事件](靠近金色汽车的 驾驶座一侧)

[18.52s – 19.46s] [19.46s – 20.57s] [20.57s – 27.70s] [27.70s – 30.93s]

[事件](打开驾驶座车门) [事件](进入汽车) [事件](驾驶金色汽车直行) [事件](将金色汽车右转)

[世界 #2] 环境特征为户外家禽圈养场景,上方有绿色遮阳篷。地面为泥土。有一个鸡舍 … 音频包含 一位女性声音,用英语说话,语气友好且具有指导性,你可以听到鸡的咯咯声和公鸡的打鸣声,以及 角色行走时发出的声音 … @character1 是一位金发的中年白人女性,戴着棕色宽边帽。她穿着黑色T恤…

[00.00s – 01.37s] [01.37s – 07.72s] [07.72s – 10.51s] [10.51s – 18.91s]

[事件](朝摄像机走去) [事件](站立并配合手势解释 [事件](转身朝鸡舍走去) [事件](进入鸡舍并 说道:“现在我要向你展示我们喂鸡的” 拿起白色桶) 所有食物。”

[18.91s – 23.70s] [23.70s – 25.59s] [25.59s – 28.18s] [28.18s – 33.72s]

[事件](拿着桶走回桌子) [事件](放置桶) [事件](打开桶盖并舀起 [事件](举起勺子并展示 饲料) 饲料)“基本上,这就是 商业碎粒饲料。”

图 1 两个通用预训练数据的示例:时间对齐的事件与持久世界上下文的摘要配对,包括视觉设置、声学条件和角色。括号表示角色 行为,而引号包含所说的话。为了清晰起见,两个示例仅包含一个角色,因此事件标签中省略了角色名称。训练通过支持将每个事件与其 对应的角色关联,或与用于独立于角色的事件的显式无角色标记关联,从而支持多个角色。

我们在与 v0.1/v0.2 相同的下游任务上实例化了预训练的世界-事件模型——实时全双工视听交互——但扩大了代理的表达范围。在此,世界配置了 场景、角色、环境声音和语音;事件流是代理的响应,由用户的流式文本、音频和视频驱动。与 v0.2 的关键变化在于,代理的事件流现在携带 自由行为以及语音。我们采用角色扮演聊天格式,其中模型的语言/状态流将所说的话与括号内的行为指令交织在一起,例如“(微微皱眉)你说什么?”或“(拿起杯子并瞥向窗户)好的,稍等。”括号内的部分可以是任何 可用语言描述的行为,因此代理不限于小的固定动作词汇

2

第 3 页

预填充 流式传输 代理文本 代理音频 代理视频 代理文本 代理音频 代理视频

(放下 玻璃杯 并 v0.3 输出: (拿起 喝 一口 水) 比 出 和平 手势) 谢谢 提醒。 640×368 @ 25 FPS 好 多。

文本 音频 视频 文本 音频 视频 分词器 解码器 解码器 分词器 解码器 解码器 ……

Wan-Streamer

……

文本 文本 音频 视频 文本 音频 视频 分词器 分词器 编码器 编码器 分词器 编码器 编码器

一个 明亮、 舒适 家庭 工作室 一直在 与 一杯 水 在 桌子 你for 一会儿——有 感觉好些吗? 上。 @character1 是 友好的 一些 水。 年轻 东亚 亚洲 女性。

世界上下文 用户文本 用户音频 用户视频 用户文本 用户音频 用户视频

流式传输帧 #1 (160毫秒) 流式传输帧 #2 (160毫秒)

图 2 世界上下文在流式传输之前被分词并预填充一次。语言、音频和视频的输入和输出随后共享由块因果注意力协调的因果时间线。模型将此世界和流式多模态用户输入映射为语言形式的语音和行为动作。这些预测的标记条件化同步的音频-视频生成。在代理文本流中,括号内的短语表示自由行为,而括号外的文本由代理说出。

(例如漫游中使用的 w/a/s/d 移动)但可以在世界中执行开放词汇的动作。 这种交织的流在语言流之前进行音频-视频生成的条件化,因此 没有引入新的延迟关键路径。

由于建模契约和部署拓扑保持不变,v0.3 保留了 v0.2 的操作 点:25 FPS 下的 640×368 视频,160 毫秒的流式单元,大约 200 毫秒的模型侧响应延迟, 以及大约 550 毫秒的总交互延迟,具有 350 毫秒的双向网络预算。图 1 显示了图 2 显示其交互实例化之前的通用预训练表示。论文的其余部分 形式化了分解和目标,描述了下游行为接口,比较了版本,并报告了实验。服务拓扑 从 v0.2 继承且保持不变,因此我们不再此处重述。

我们的贡献是:

• 我们将原生流式生成重构为一种世界+事件流分解,将持久 世界上下文与随时间变化的事件分开,产生一个通用的预训练目标,该目标 跨实时任务转移。

• 我们将此模型实例化于实时全双工音频-视频交互,其中模型的 multimodal 理解是类 VLA 的,将流式多模态输入映射为用自然语言表达的语音和开放词汇行为 动作。这些语言形式的输出条件化同步的音频-视频 生成。

• 我们表明,这种扩展保持了 v0.1/v0.2 的建模契约和 v0.2 的服务拓扑完整, 保留了 25 FPS 下的 640×368,大约 200 毫秒的模型侧和大约 550 毫秒的总 交互延迟。

3

第 4 页

2 世界-事件分解

2.1 形式化

我们将视频读取为持久世界与随时间变化的事件流的结合。世界提供了在片段或交互的时间尺度上相对稳定的上下文——包括视觉设置与风格、环境与布局、主体及其身份与外观、环境声学条件以及声音特征。事件流包含在该上下文中展开的变化,包括主体行为、相机运动、环境变化、语音以及其他声音事件。

在学习过程中,我们将世界表示为灵活的结构化记录:

W = {wj}j∈S(W ), (1)

其中模式 S(W) 由片段或任务决定,而非全局固定。在实践中,字段通常分为视觉上下文(媒介或风格、环境、布局)、声学上下文(环境声音和声音特征)以及一组角色记录(身份、外观、人格、可见性),但字段也可能缺失或扩展。

事件是一个时间局部化的记录:

ek = τk, ck, dk , ck ∈C(W) ∪{∅}, (2)

其中 τk 是其活跃区间,dk 是对变化的自由形式描述,ck 将事件与 W 中的角色关联,或明确标记为与角色无关。描述可能涵盖行为、相机运动、环境变化、语音或物理声音;重叠的变化可以通过多条记录来表示。视频随后被展开为带有其事件流的世界,其可观察的音视频实现由 v0.1 的因果解码器从生成的潜变量中产生。这并非一种新架构:它是对同一交错因果序列的读取,其中持久条件被命名为 W,时间局部化变化被命名为 ek。

2.2 流式世界-事件分解

v0.1 公式从完整的因果历史中预测下一个响应单元。将该响应写为事件单元 ek,并令 x≤k 表示驱动流的任何输入(对于预训练,为观察到的过去;对于交互,为用户的流式观察),模型分解为:

K pθ e1:K | W, x1:K = Y pθ ek | W, x≤k, e<k , (3)

k=1

其中 K 是流式单元的数量。v0.1 的自回归分解是 W 折叠进历史、x 为用户观察、ek 为代理的文本/音频/视频响应的特例。如前所述,ek 的离散部分(语言,以及现在的行为指令)通过下一个 token 预测进行优化,而连续的音频和视频潜变量则在相同的干净上下文下通过条件流匹配生成,因此语音、运动、外观和场景演变作为耦合响应一起去噪,并重新提交到历史中以供下一个单元使用。显式命名 W 使得持久世界上下文成为一等条件对象:在推理时,它只需提供一次,事件流即可在线生成。

2.3 预训练与下游迁移

公式 (3) 定义了一个针对大规模、多样化视频语料库的通用预训练任务,而非单一交互领域。每个片段提供推断的世界和对齐的时间事件,模型从因果历史中预测下一个事件及其音视频实现。这种能力原则上可以支持许多下游接口,每个接口由其世界上下文和驱动流的输入定义:世界模型控制和实时第一人称交互使用场景世界上的动作或导航输入 [4–7];具身操作使用工作空间世界上的命令 [8–10];而我们的实例化使用场景和角色世界上的流式用户文本、音频和视频。本文仅研究实时全双工

4

第 5 页

音频-视觉交互专业化,并将其他方面的系统性适应与评估留给未来工作。

图 1 使这种监督具体化:每个示例使用与该片段相关的信息总结其持久世界上下文一次,而自然语言事件则与其发生的时间间隔对齐。学习这些事件如何在上下文中展开,教会预训练模型世界-事件动态,这些动态可以在推理时在线生成事件时重用。

3 实时交互

3.1 实例化世界和事件流

对于实时全双工音频-视觉交互,持久世界上下文通过该任务所需的设置进行实例化:

• 场景设置:代理所处的环境和布局。

• 角色设置:代理的身份、外观和人格。

• 环境声音设置:场景的背景声场。

• 声音音色:代理的说话声音。

用户的流式文本、音频和视频是驱动事件流的输入 $x_{\le k}$。在 v0.3 中,代理响应交织了语音和自由行为记录,两者均由因果解码器渲染为同步的音频和视频。

这种推理时的行为流是图 1 中预训练期间使用的时间对齐行为语言的受控对应物:行为事件不是从录制视频中恢复的,而是在线生成或提供的,模型随之流式传输相应的世界演变。

3.2 角色扮演格式中的自由行为

v0.1 和 v0.2 专注于一个说话并展示可见倾听行为的代理——空闲存在、注视、点头、微表情、唇同步语音。v0.3 将行为通道扩展为用自然语言描述的开放词汇动作。我们采用角色扮演聊天格式,其中代理的语言输出将 spoken words 与括号内的行为指令交织,例如:

(reaches into the grass and picks up a green leaf) Look what I found. (covers mouth in surprise) I did not expect that.

括号内的指令可以是任何可以用语言表达的行为,因此代理不限于小的固定动作集(如漫游中使用的 w/a/s/d 导航移动),而是可以执行扎根于配置世界的情境化、开放词汇动作——伸手拿附近的物体、转向声音、改变姿势或做出富有表现力的反应。行为指令和 spoken words 共享一个 token 流,因此它们的时间、顺序以及与语音的交织是联合学习的,而不是由外部控制器调度的。

3.3 多模态理解和语言形式动作

从功能上讲,模型的多模态理解过程类似于视觉-语言-动作 (VLA):以世界为条件,它持续将用户的文本、音频和视频映射为语言形式的语音和行为动作。这些动作形成一个交织的语音和行为 token 流,用于条件化联合音频-视频潜变量生成。行为指令是短语言 token,因此它们对 token 因果路径增加的开销可忽略不计。产生的行为在视觉上(姿势、手势、注视、与场景的交互)和声学上(韵律、非语言声音)实现,在解码之前保持语音、行为和外观的同步,而不是事后对齐。

第 6 页

4 版本对比

表 1 总结了各版本之间的变化。端到端流式处理公式、分辨率和帧率、延迟预算以及服务拓扑均继承自 v0.2;v0.3 改变了概念框架(世界+事件流)、预训练目标(预测世界如何向前流式传输)以及代理的表达范围(语音加自由行为)。

表 1 Wan-Streamer 版本摘要。强调的单元格表示 v0.3 的变化;未强调的单元格表示其从 v0.2 保留的内容。

| 方面 | v0.1 | v0.2 | v0.3 | | :— | :— | :— | :— | | 框架 | 端到端流式处理 | 相同,更高分辨率 | 视频 = 世界 + 事件流 | | | 音频/视频交互 | | | | 核心目标 | 交互数据 | 交互数据 | 通用世界-事件预训练,<br>然后进行专业化 | | 输出分辨率 | 192×336 | 640×368 | 640×368 | | 帧率 | 25 FPS | 25 FPS | 25 FPS | | 模型侧延迟 | ~200 ms | ~200 ms | ~200 ms | | 总延迟 | ~550 ms (350 ms<br>网络) | ~550 ms (350 ms 网络) | ~550 ms (350 ms 网络) | | 服务 | Thinker + 单 GPU<br>执行者 | Thinker + Ulysses<br>上下文并行执行者 | 与 v0.2 相同 | | 代理事件流 | 语音 + 可见的倾听<br>行为 | 语音 + 倾听,更高分<br>保真度 | 语音 + 开放词汇的自由<br>行为 | | 行为格式 | 隐式倾听/空闲<br>运动 | 隐式倾听/空闲<br>运动 | 带有括号内行为<br>指令的角色扮演 |

5 实验

延迟和运行时协议。我们使用与 v0.1/v0.2 相同的响应边界。模型侧信号到信号的延迟从 thinker 可用 160 ms 用户流式单元时开始,到相应的音频-视频响应单元解码完毕准备发射时结束。由于服务拓扑从 v0.2 原样继承,v0.3 在产生 25 FPS 的 640×368 视频时,保持约 200 ms 的模型侧延迟,并在 350 ms 的双向网络预算下保持约 550 ms 的总交互延迟。我们将网络项保留为外部部署假设,以便比较隔离模型侧路径,并且我们在与先前版本 [11–15] 相同的边界上报告 v0.3 的运行时。

定性行为观察。在生成的 640×368 对话中,Wan-Streamer v0.3 在实时执行开放词汇行为的同时进行语音输出。语言流中的行为指令被实现为连贯的面部表情、姿势变化、对声音的反应以及与附近物体的交互。这些动作与语音保持同步,扎根于配置的场景中,并与角色的身份和外观保持一致。在显式行为事件之间,代理保持稳定的空闲和倾听行为。因此,Wan-Streamer v0.3 在保留与 v0.2 相同的低延迟流式设置的同时,扩展了代理的表达范围,超越了语音和隐式倾听。

6 结论

Wan-Streamer v0.3 将原生流式处理生成重新定义为世界+事件流分解:持久世界上下文加上随时间变化的所有内容。这支持通用视频预训练,并迁移到漫游、音频-视频交互和具身操作。我们通过下游后训练实例化了这一框架,以实现实时全双工音频-视频交互。在此实例中,类 VLA 的多模态理解将流式用户输入映射为语言形式的语音和开放词汇的行为动作,这些动作条件化同步的音频-视频生成。Wan-Streamer v0.3 保留了 v0.2 的建模契约和服务拓扑,保持 25 FPS 的 640×368 视频,具有约 200 ms 的模型侧延迟和 550 ms 的总交互延迟。

6

第 7 页

参考文献

[1] Lianghua Huang, Zhi-Fan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, and Zoubin Bi. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models, 2026年6月. URL https://arxiv.org/abs/2606.25041. 提交于 2026年6月23日.

[2] Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, and Zoubin Bi. Wan-Streamer v0.2: Higher Resolution, Same Latency, 2026年7月. URL https://arxiv.org/abs/2607.04443. 提交于 2026年7月5日.

[3] Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Shuaiwen Leon Song, Samyam Rajbhandari, and Yuxiong He. Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models. arXiv preprint arXiv:2309.14509, 2023.

[4] Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, and Chunchao Guo. Worldplay: Towards long-term geometric consistency for real-time interactive world modeling. arXiv preprint arXiv:2512.14614, 2025.

[5] Zile Wang, Zexiang Liu, Jiaxing Li, Kaichen Huang, Baixin Xu, Fei Kang, Mengyin An, et al. Matrix-game 3.0: Real-time and streaming interactive world model with long-horizon memory. arXiv preprint arXiv:2604.08995, 2026.

[6] Xinhua Cheng, Haiyang Zhou, Wangbo Yu, Tanghui Jia, Bin Lin, Yunyang Ge, Weiqi Li, and Li Yuan. 360explorer: Exploring 4d controllable world in panoramic videos. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 40, pages 3300–3308, 2026.

[7] Wei Liu, Ziyu Chen, Zizhang Li, Yue Wang, Hong-Xing Yu, and Jiajun Wu. Realwonder: Real-time physical action-conditioned video generation. arXiv preprint arXiv:2603.05449, 2026.

[8] Tenglong Ao. Body of her: A preliminary study on end-to-end humanoid agent. arXiv preprint arXiv:2408.02879, 2024.

[9] Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen, and Yinghao Xu. Causal world modeling for robot control. arXiv preprint arXiv:2601.21998, 2026.

[10] Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu Hu, Shiyang Qin, et al. Flowact-r1: Towards interactive humanoid video generation. arXiv preprint arXiv:2601.10103, 2026.

[11] ByteDance Seed Team. Doubao realtime voice model. https://seed.bytedance.com/en/realtime_voice, 2025. 模型页面,2025年1月20日.

[12] OpenAI. Hello gpt-4o. https://openai.com/index/hello-gpt-4o/, 2024. 博客文章,2024年5月13日.

[13] Hume AI. Introducing evi 3: The world’s most realistic and instructible speech-language model. https://www. hume.ai/blog/introducing-evi-3, 2025. 博客文章,2025年.

[14] Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, and Yong-Jin Liu. Streamavatar: Streaming diffusion models for real-time interactive human avatars. arXiv preprint arXiv:2512.22065, 2025.

[15] Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, and Siyu Zhu. Hallo-live: Real-time streaming joint audio-video avatar generation with asynchronous dual-stream and human-centric preference distillation. arXiv preprint arXiv:2604.23632, 2026.

7

第 8 页

附录

A 贡献与致谢

A.1 核心贡献者

Lianghua Huang∗, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, 和 Jingren Zhou。

A.2 贡献者

贡献者按名字首字母顺序排列:Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, 和 Zoubin Bi。

∗通讯作者:lianghua.huang.cs@gmail.com。

8

发表评论