快速导读:Evoke 通过外部几何世界状态库与长时域教师监督,实现三步骤、无 CFG 的有界成本小时级交互式世界生成。
交互式世界模型面临一个根本性矛盾:用户希望模型记住整个会话的历史,同时又要求低延迟的实时响应。现有方法把历史塞进上下文帧或 KV 缓存,成本随会话线性增长,最终要么丢弃信息,要么拖垮推理。Alaya-EVOKE 的核心主张是:持久状态不应该留在去噪器内部,而应该被外部化为一个按相机位姿索引的几何记忆库,去噪器只负责当前视图的生成。
这一架构选择带来两个直接后果。第一,每步推理的上下文与位置范围不再随会话时长增长,成本有界。第二,少步学生可以从一个专门为长时域监督重新设计的教师那里继承稳定性,而不是受限于短时域教师的视野。论文用 WBench 导航分割、两个公开排行榜、65.5 分钟连续 rollout 以及配对教师消融来支撑这一主张,同时也诚实地标注了细粒度一致性、动态世界状态和实时性方面的局限。
英文题目:Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
论文出处:arXiv 每日论文精选 · arXiv:2608.13546
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有交互世界模型的主流做法是把历史帧或特征缓存保留在去噪器内部。窗口化是最直接的缓解手段,但它以丢弃信息为代价:当相机转回曾经看过的区域时,模型只能靠猜测来填补。KV 缓存淘汰面临同样的问题。论文指出,这种'记忆在模型里'的设计本质上把持久状态和生成过程耦合在一起,成本结构无法摆脱会话长度的束缚。
少步推理是另一条被广泛采用的路径,但它依赖蒸馏。学生模型的能力上限由教师决定:教师用什么时域范围监督、用什么条件调度训练,学生就只能继承什么。如果教师只在短时域上训练,学生学到的就是短时域的行为模式,长会话中的曝光漂移、内容漂移等问题不会被教师示范过,学生自然无从习得。
论文把这两个问题合并成一个研究缺口:现有方法要么在去噪器内保留历史导致成本增长,要么少步学生受限于教师监督的时域与条件能力。Evoke 的贡献在于同时解决这两个问题——外部化状态解决成本问题,重新设计教师解决监督质量问题。
值得强调的是,论文并没有声称解决了所有问题。几何世界状态主要保留粗粒度场景结构,物体身份、外观与局部细节的细粒度一致性有限;动态世界状态(物体运动、状态转换)完全没有建模。这些是论文明确列出的局限,也是后续工作的自然起点。
核心创新
- 外部相机索引世界状态库解耦持久状态与去噪器,保持上下文与位置范围与会话时长无关
- 教师重设计:分块稀疏注意力实现线性成本长时域监督,逐块条件支持序列内指令变化
- 30 秒全窗口分布匹配蒸馏将长时域稳定性与动态条件能力迁移至三步骤无 CFG 学生
- 有界循环推理:每块复用局部位置布局,会话时长仅增加循环调用次数
方法概览
Evoke 将持久世界状态外部化为按相机位姿索引的世界状态库,仅检索当前视图相关几何;教师采用分块稀疏注意力与逐块文本条件,在 30 秒长时域分布匹配目标下通过自强制 rollout 蒸馏三步骤无 CFG 学生。
- 世界状态库(world state bank)是核心模块。它按相机位姿索引已生成区域的几何信息,推理时只检索当前视图相关的部分,渲染后注入学生去噪器的最粗尺度评估。这样,去噪器看到的上下文与位置范围是固定的,与会话时长无关。
- 教师重设计包含两个关键改动。分块稀疏注意力(chunk-wise sparse attention)让每个查询块只关注固定数量的关键源,注意力成本随序列长度线性增长而非二次增长,使 30 秒甚至 60 秒的长时域监督在计算上可行。
- 逐块文本条件让教师能够在序列内部处理指令变化。每个块读取覆盖它的文本片段,而不是整个序列共享一个全局条件。这为后续的定时文本控制(evocation)能力奠定了基础。
- 蒸馏目标采用分布匹配蒸馏(distribution matching distillation),并扩展到 30 秒全窗口。学生通过自强制 rollout(self-forced rollout)条件于自身生成的历史,与教师/评论家共享骨干进行长时域分布匹配。
- 推理采用有界循环结构:每块复用局部位置布局,会话时长只增加循环调用次数,不增加单步成本。三步骤、无分类器引导(classifier-free guidance)的设置进一步压缩了每块的计算开销。
- 几何路径的成本被单独分析。论文报告几何路径占去噪器成本的 38%,每块增加约 1.84 秒,且成本随 warp 覆盖度缩放——未观察空间成本更低,恰好对应记忆更少的区域。
逐图理解论文
失败案例

世界状态库的召回演示。相机转出再转回时,库的返回渲染与生成帧对比;黑色带是库不再持有的区域,需要模型补全。
研究缺口

有界保留的核心架构图。观察相机位姿如何读取世界状态库、渲染后注入最粗尺度评估,以及发出的块如何更新存储和历史。
最强证据

配对教师消融的关键证据。两个学生仅教师时域不同,长时域教师学生的亮度稳定在 101%,短时域教师学生降至 74%。
实验如何设计?
- WBench 导航分割包含 158 个案例,所有系统使用相同案例,与八个少步交互系统对比。
- VBench-2.0 与 VBench-Long 两个公开排行榜,与各自前十名对比。注意对比并非步数匹配:Evoke 用 3 步无 CFG,对手用各自的多步默认采样器。
- 八条 65.5 分钟连续 rollout 用于长会话稳定性评估,论文明确标注这是 n=1 的稳定性声明而非保真度声明。
- 配对教师消融:两个三步骤学生使用完全相同的蒸馏配方,唯一区别是教师的时域范围(短时域 vs 长时域),共享剪辑、轨迹、提示、种子和推理标志。
- 世界状态库的位姿寻址召回通过 PSNR 评估,定时文本控制通过 evocation 实现率评估。
关键结果与论文证据
- WBench 导航分割上,Evoke 的 Quality 平均 82.79,Setting 平均 83.76,Physical 平均 72.06,Consistency 平均 86.87,Navigation 78.63(第 12 页)。论文自身对领先幅度持谨慎态度,认为与拒绝解读为胜出的差异同量级。
- VBench-2.0 总分 66.77,排名第 1/10;VBench-Long 总分 85.11,排名第 7/10(第 13 页)。两个排行榜的排名差异反映了不同评测维度的侧重。
- 65.5 分钟 rollout 中,场景身份余弦稳定在 0.523,与真实视频 60 秒间隔自比水平相当(第 6 页)。论文将其解读为反对持续退化的证据,而非保真度声明。
- 配对教师消融显示,长时域教师学生的最终亮度为初始的 101%,短时域教师学生为 74%;8 条中 7 条改善(Wilcoxon p=0.016)(第 9 页)。论文明确限定这一声明为曝光稳定性,而非图像质量。
- 定时文本控制中,未锚定内容的定时引入实现率为 67%(上限 83%),锚定内容仅 4%(上限 17%)(第 14 页)。论文指出锚定内容的低实现率主要反映该检查点渲染锚定地板的能力,而非切换能力上限。
- 召回 PSNR 平台为 15.4–17.8 dB,保留窗口覆盖重访时比短窗口高 2.3–3.2 dB,20/21 比较符合预测(第 13 页)。论文强调这是可识别而非像素级忠实重建。
- 单 H200 上 384×640 分辨率每 1.5 秒块生成耗时 2.11 秒;几何路径占去噪器 38% 成本,增加 1.84 秒/块(第 19 页)。推理仍需进一步加速才能实现真正实时交互。
阅读时需要注意
- 几何世界状态主要保留粗粒度场景结构,物体身份、外观与局部细节的细粒度一致性有限。
- 未建模动态世界状态:物体运动、状态转换及其长期演化不在当前框架内。
- Navigation 与 Perspective 指标相对较弱,反映当前相机控制路径的局限。
- 召回 PSNR 平台 15.4–17.8 dB 表明是可识别而非像素级忠实重建。
- 推理仍需进一步加速才能实现真正实时交互。
关联工作
- Evoke 扩展了 Warp-as-history(Wang and He, 2026)的 warp 条件机制,从短程帧对应扩展为持久几何记忆。
- Gen3C(Ren et al., 2025)提供了基于几何的视图对齐条件生成思路,Evoke 采用类似的几何构造。
- Self-forcing(Huang et al., 2025a)和 DMD(Yin et al., 2024b,a)是分布匹配蒸馏的基础,Evoke 将其扩展到 30 秒全窗口。
- Causal forcing(Zhu et al., 2026)研究双向教师与因果学生的失配,Evoke 关注互补的监督时域与条件调度轴。
- MoGA(Jia et al., 2025)是分块稀疏注意力设计来源之一;Evoke 学生基于 Helios(Yuan et al., 2026)构建。