Wan-Streamer v0.3:世界与事件流解耦的实时全双工交互模型
本文分析 Wan-Streamer v0.3 的核心创新:将视频重构为持久世界上下文与随时间变化的事件流。相比 v0.1/v0.2 针对单一交互任务训练的局限,v0.3 通过通用预训练学习世界动态,支持实时全双工音频视觉交互及开放词汇自由行为生成。实验显示模型侧响应延迟约 200 ms,总交互延迟约 550 ms。需注意预训练数据中的世界上下文摘要可能存在信息丢失,且行为生成依赖语言描述的准确性。
本文分析 Wan-Streamer v0.3 的核心创新:将视频重构为持久世界上下文与随时间变化的事件流。相比 v0.1/v0.2 针对单一交互任务训练的局限,v0.3 通过通用预训练学习世界动态,支持实时全双工音频视觉交互及开放词汇自由行为生成。实验显示模型侧响应延迟约 200 ms,总交互延迟约 550 ms。需注意预训练数据中的世界上下文摘要可能存在信息丢失,且行为生成依赖语言描述的准确性。