三分钟导读:本文提出OpenCoF框架,包含涵盖11类任务的OpenCoF-17K数据集及Wan-CoF模型,并通过引入Visual/Textual Reasoning Tokens (vt/tt) 显著提升了视频生成模型的Chain-of-Frame (CoF) 推理能力。
英文题目:OpenCoF: Learning to Reason Through Video Generation
论文出处:arXiv 每日论文精选 · arXiv:2607.08763
原始论文:PDF / 论文页面
对应视频标题:视频生成也能推理?OpenCoF用17K数据与推理Token破解长程逻辑难题|推荐指数:★★★★★
这篇论文解决什么问题?
现有视频生成模型主要训练于通用视频语料,缺乏针对Chain-of-Frame (CoF) 推理的多样化时间监督信号和专用架构设计,导致在长程时间连贯性、物理一致性和逻辑连续性方面表现不足。
核心创新
- 提出OpenCoF-17K数据集,采用四种互补的数据策展管道,提供多样化的CoF推理监督。
- 验证仅通过多样化时间监督(数据中心方法)即可显著提升视频模型的CoF推理能力。
- 提出互补的推理Token机制(vt和tt),分别作用于视觉潜在空间和文本条件空间,以显式组织中间推理状态。
- 通过注意力分析深入探究了推理Token在模型深度、去噪步骤、空间和时间维度上的作用机制。
方法概览
1. 构建OpenCoF-17K数据集:通过实例渲染、专家引导渲染、程序化场景合成和外部视频复用四种管道,收集17,312个视频样本,覆盖11个任务家族。2. 训练Wan-CoF:在Wan2.2-I2V-A14B基础上仅使用OpenCoF-17K进行LoRA微调。3. 引入推理Token:设计Visual Reasoning Tokens (vt) 插入视觉潜在序列以捕捉低级视觉线索,以及Textual Reasoning Tokens (tt) 附加到文本条件序列以提供高级语义先验,分别训练Wan-CoFvt和Wan-CoFtt。
逐图理解论文
OpenCoF-17K数据集

为此,作者构建OpenCoF-17K数据集,涵盖11类任务共17,312个视频。通过实例渲染、专家引导、程序化合成及外部复用四种管道,提供多样化的时间监督信号,填补了专用推理训练数据的空白。
Wan-CoF基线模型

基于Wan2.2-I2V-A14B基座,仅使用OpenCoF-17K进行LoRA微调得到Wan-CoF。实验表明,仅通过数据中心方法,无需复杂架构改动,即可在多个外部推理基准上实现显著性能提升,验证了数据监督的有效性。
推理Token机制

为显式组织推理状态,作者引入Visual Reasoning Tokens (vt) 插入视觉潜在序列,捕捉低级线索;以及Textual Reasoning Tokens (tt) 附加到文本条件,提供高级语义先验。两者分别形成Wan-CoFvt与Wan-CoFtt。
基准性能提升

在MME-CoF上,Wan-CoF从1.00提升至1.30;Gen-ViRe从0.304升至0.391;VIPER POC@1.0从3.3大幅增至7.5。Wan-CoFtt在MME-CoF和VIPER上达到最高分,Wan-CoFvt则在Gen-ViRe和RULER-Bench表现最佳。
注意力机制分析

通过注意力分析发现,vt在自注意力中关注全局计划维持,tt在交叉注意力中强化指令对齐。深度与去噪步骤分析显示,推理Token在不同阶段激活不同模式,揭示了模型内部处理推理线索的结构化机制。
实验与关键结果
- 在四个外部视频推理基准(MME-CoF, Gen-ViRe, VIPER, RULER-Bench)上评估Wan-CoF、Wan-CoFvt和Wan-CoFtt。
- 对比开源和闭源SOTA模型(如Sora-2, Veo-3.1, HunyuanVideo)。
- 进行分布外泛化分析,验证模型在独立基准上的迁移能力。
- 对推理Token的数量(n=16 vs n=32)进行消融实验。
- 可视化并分析vt和tt在自注意力和交叉注意力中的空间、时间及深度模式。
- Wan-CoF在MME-CoF Overall上从1.00提升至1.30 (+0.30)(第 9 页)
- Wan-CoF在Gen-ViRe Average上从0.304提升至0.391 (+0.087)(第 9 页)
- Wan-CoF在VIPER POC@1.0上从3.3提升至7.5 (+4.2)(第 9 页)
- Wan-CoF在RULER-Bench Overall上从55.8提升至56.8 (+1.0)(第 9 页)
- Wan-CoFvt在Gen-ViRe (0.441) 和 RULER-Bench (59.6) 上达到最高分(第 12 页)
- Wan-CoFtt在MME-CoF (1.35) 和 VIPER (8.8) 上达到最高分(第 12 页)
- n=16的Token数量在四个基准中的三个上优于n=32(第 19 页)
阅读时需要注意
- vt和tt目前仅单独研究,如何有效结合两者仍是未来工作。
- 基线模型Wan2.2-I2V-A14B不支持文本到视频生成,限制了RULER-Bench的部分评估范围。
- 推理Token的作用机制虽经注意力分析揭示,但其作为通用容量的扩展性有限(n=32未带来统一提升)。
- 视频生成的高视觉真实感并不保证可靠的推理能力。
- 推理Token的效果依赖于特定的任务维度,vt擅长全局计划维持,tt擅长指令对齐,需根据任务特性选择。
- 数据集策展依赖于多种渲染和合成方法,可能存在合成数据与真实物理世界的分布差异。
关联工作
- MME-CoF [10]:视频推理基准,本文在此基础上构建数据集并提升性能(第 1 页)
- VR-Bench [47]:早期视频推理工作,主要关注迷宫求解,本文扩展至更广泛任务(第 2 页)
- VBVR [42]:视频推理数据集,本文借鉴其部分子任务并扩展策展管道(第 2 页)
- Thinking in Frames [21]:探索视频推理的测试时缩放策略,本文侧重训练数据和架构(第 2 页)
- Wan2.2-I2V-A14B [41]:本文使用的视频生成基座模型(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
OpenCoF:通过学习进行视频生成推理
Xinyan Chen1,2,∗, Ziyu Guo3,∗, Renrui Zhang1,†, Dongzhi Jiang1,2, Hongsheng Li2
1 ByteDance Seed, 2 CUHK MMLab, 3 CUHK IMIXR
∗ 同等贡献, † 通讯作者
摘要
推理已成为大模型的核心能力,尤其是在可靠决策需要理解逻辑后果时。最近的视频生成模型提供了一种不同于以往思维链(Chain-of-Thought, CoT)的推理路径:推理可以通过时间上相连的帧序列展开,这被称为帧链推理(Chain-of-Frame, CoF)。然而,现有的视频生成器主要是在通用视频语料库上训练的,仍然缺乏多样化的监督和针对 CoF 推理的专门设计。为了弥补这一空白,我们引入了 OpenCoF,这是一个包含 OpenCoF-17K 数据集、涵盖 11 个任务家族的推理视频数据集以及 Wan-CoF 的框架,Wan-CoF 是一个经过微调的视频模型,用于研究多样化的时间监督是否能改善 CoF 行为。在四个视频推理基准测试中,Wan-CoF 相比 Wan2.2-I2V-A14B 基线取得了显著的提升。在此基础上,我们实证探索了更先进的 CoF 能力设计,即为模型配备视觉推理 Token(Visual Reasoning Tokens, vt)和文本推理 Token(Textual Reasoning Tokens, tt)。该机制分别捕捉低级视觉线索和高级语义先验,以支持空间和 temporal 推理。通过性能比较和注意力分析,我们考察了这些 Token 如何在模型深度、去噪步骤、空间和时间内发挥作用。我们的结果表明,更强的视频推理既需要广泛的时间监督,也需要用于组织中间推理状态的显式机制。我们开源了数据集、模型和代码,以促进面向推理的视频生成研究的未来发展。
日期:2026年7月10日 通讯:Renrui Zhang (renruizhang@bytedance.com) 项目主页:https://opencof.github.io/
1 引言
增强推理能力 [16, 24, 48, 49] 已成为大型语言模型(LLM)和多模态模型(LMM)开发中的核心目标。先前的工作证明,强大的推理能力对于视觉-语言上下文中的可靠决策至关重要。然而,主流的视觉思维链(Chain-of-Thought, CoT)[17, 27, 43] 流程仍然主要锚定于静态视觉观察。这些方法通常依赖于提取局部证据 [4, 34]、调用外部工具 [11, 13, 15, 50] 或采用辅助图像生成步骤 [20, 46],这限制了它们内在建模动态转换和多步视觉后果的能力。
视频生成模型的快速发展提供了一种有前景的替代方案:通过视频进行推理 [10, 23, 30, 44]。模型不再仅仅依赖文本步骤或静态视觉内容,而是可以通过
1
第 2 页
2D几何 点连线 数独
国际象棋 数独 专家引导 渲染 基于实例 渲染 OpenCoF-17K VBVR 4条构建流程,11项任务 立方体折叠 程序化场景 外部视频 合成 再利用 迷宫
七巧板 谜题 具身 物理 操作 运动
图1 OpenCoF概述。我们构建了OpenCoF-17K数据集,包含11项任务共17,312个视频,通过四条互补的流程,为帧链推理(Chain-of-Frame, CoF)提供多样化的时间监督。
帧的时间演变,这一过程被形式化为帧链推理(Chain-of-Frame, CoF)。最近的研究表明,视频模型已经表现出非平凡的世界知识以及物理和因果理解的早期迹象,这表明CoF具有巨大的潜力[44]。然而,这种潜力远未得到充分实现。在推理密集型任务中,当前的视频模型在长期时间连贯性、物理和空间一致性以及逻辑连续性方面仍然面临挑战[10]。最终,高视觉逼真度并不能保证可靠的推理。
从MME-CoF [10]开始,最近的工作主要集中在建立基准以界定和评估视频生成模型的推理范围,包括RULER-Bench [12]、Gen-ViRe [23]、VIPER [22]等[25, 38]。虽然这些工作对于定义问题空间至关重要,但专门致力于积极增强这些推理能力的研究仍然明显匮乏。少数初步研究探索了定制的训练和测试时扩展策略,但它们通常集中在特定的任务领域,例如VR-Bench [47]中的迷宫求解和Thinking in Frames [21],或者像VBVR [42]这样的自定义认知任务套件。尽管取得了这些初步进展,当前的方法存在两个局限性:(1) 它们的训练和评估协议局限于特定领域或与其自身构建的任务套件内在耦合,导致其在独立的、外部构建的推理基准上的真正泛化能力尚未得到充分探索;(2) 它们的主要重点在于数据扩展和推理策略,使得专门针对推理的视频模型内部架构在很大程度上未被研究。因此,在理解如何结构性地增强视频推理能力方面仍然存在根本性的空白。
为了弥补这一空白,我们引入了OpenCoF,这是一个致力于推进视频推理的框架。作为该项目的基础,我们构建了OpenCoF-17K数据集,这是一个包含11项任务家族共17,312个视频的多样化集合。其构建流程整合了四种不同的方法:基于实例的渲染、专家引导的渲染、程序化场景合成以及现有视频的再利用,如图1所示。利用该数据集,我们在一个强大的开源视频生成模型Wan2.2-I2V-A14B [41]中研究了视频推理能力的增强。首先,我们在OpenCoF-17K上对其进行微调,不引入任何特定的推理技术,从而得到Wan-CoF。这一以数据为中心的阶段旨在验证仅靠多样化的时间监督是否足以有效激发CoF行为。
2
第 3 页
CoF 技术探索 实验结果
Wan-CoFvt
… Wan2.2 OpenCoF-17K 视觉推理 Token Baseline Wan-CoF
… 文本推理 Token Wan-CoFtt Wan2.2 Baseline Wan-CoF Wan-CoFvt Wan-CoFtt
图 2 CoF 技术探索。在 OpenCoF-17K 上微调 Wan2.2-I2V-A14B 得到 Wan-CoF,该模型在四个外部视频推理基准(MME-CoF、Gen-ViRe、VIPER、RULER-Bench)上相比 Wan2.2 基线取得了显著提升。我们进一步探索了视觉推理 Token(vt)和文本推理 Token(tt)作为互补的推理 Token 设计,得到了 Wan-CoFvt 和 Wan-CoFtt,它们在各项基准上进一步提升了性能,并在不同基准上展现出不同的优势。
在四个外部视频推理基准上的后续评估表明,相比基础模型取得了显著提升。
除了这一以数据为中心的阶段外,我们进一步探索了专门的推理技术如何帮助视频生成器组织 CoF 所需的中间推理状态。在当前的基于 DiT 的视频生成器中,此类推理隐含在面向生成的视觉潜在变量和文本条件中。因此,我们探索了两种在不同模型层级上运行的互补推理 Token 设计:视觉推理 Token(vt),插入到视觉潜在序列中以捕捉低级视觉线索;以及文本推理 Token(tt),附加到文本条件序列中以提供高级语义先验。如图 2 所示,这两种变体进一步提升了 Wan-CoF 在外部基准上的表现,并在不同任务维度上展现出不同的优势。通过实证性能评估和注意力分析,我们考察了这些 Token 类型如何促进模型深度、去噪步骤、空间维度和时间上的推理。
我们的贡献总结如下:
• 我们引入了 OpenCoF-17K 数据集,包含 17K 个视频,涵盖 11 个任务家族,并采用可扩展的四源策展流程。
• 我们通过 OpenCoF-17K 微调 Wan2.2-I2V-A14B 开发了 Wan-CoF,证明了该模型在四个外部视频推理基准上相比基础模型取得了显著提升。
• 我们提出了互补的推理 Token 机制(vt 和 tt),并通过性能和注意力分析研究了它们在 CoF 推理中的作用。
2 OpenCoF-17K
当前的视频生成器缺乏针对推理任务的专用时间监督,因此多样化的以推理为中心的数据对于构建强大的 CoF 能力至关重要。为了满足这一需求,我们构建了 OpenCoF-17K,这是一个涵盖 11 个任务家族的视频推理数据集。我们首先在 2.1 节中总结其规模、格式和统计数据,然后在 2.2 节中详细介绍四部分策展流程。
2.1 数据集统计
OpenCoF-17K 数据集包含 17,312 个样本,涵盖 11 个任务家族。针对条件生成任务,每个数据实例将初始条件图像和文本提示与目标推理视频配对。为了确保来自不同数据源的优化一致性,所有视频均标准化为 480p 分辨率、15 fps 帧率和 81 帧的时间长度。表 1 报告了 OpenCoF-17K 的各任务统计数据。该数据集总共包含 17,312 个视频,涵盖 11 个任务家族,平均提示长度为 53.2 个单词。VBVR 家族聚合了 30 个子任务:其中 29 个子任务各贡献 250 个演示视频,剩余一个子任务贡献 500 个,总计 7,750 个视频。图 5 和图 6
3
第 4 页
图 3 OpenCoF-17K 数据集的构成。表 1 OpenCoF-17K 各任务统计数据。Avg prompt 表示平均提示词长度(单词数)。
| 任务 | 数量 | 平均提示词长度 | | :— | :— | :— | | 具身操作 (Embodied manip.) | 1,000 (5.8%) | 42.0 | | 国际象棋 (Chess) | 1,000 (5.8%) | 52.0 | | 数独 (Sudoku) | 1,000 (5.8%) | 31.0 | | 2D 几何 (2D geometry) | 1,162 (6.7%) | 23.4 | | 点连线 (Dot-to-dot) | 1,000 (5.8%) | 13.5 | | 七巧板谜题 (Tangram puzzle) | 800 (4.6%) | 17.7 | | 立方体折叠 (Cube folding) | 800 (4.6%) | 25.3 | | 3D 多立方体旋转 (3D polycube rotation) | 800 (4.6%) | 45.9 | | 物理运动 (Physics motion) | 1,000 (5.8%) | 179.4 | | 迷宫 (Maze) | 1,000 (5.8%) | 10.2 | | 具身操作 (Embodied manipulation) | 1,000 (5.8%) | 62.9 | | VBVR (30 个子任务) | 250 × 29 + 500 | 53.2 | | 总计 (Total) | 17,312 | |
展示 OpenCoF-17K 数据集中 11 个任务家族的典型示例。对于每个示例,我们展示从演示视频中均匀采样的三帧图像以及原始文本提示词。接下来,我们将描述如何收集这些数据并将其转换为统一的视频推理格式。
2.2 数据集构建
为了获得上述覆盖范围,我们的构建协议包含四个流程:(1) 基于实例的渲染,(2) 专家引导的渲染,(3) 程序化场景合成,以及 (4) 外部视频再利用。如图 4 所示,前三个流程侧重于生成式构建。为了补充这些工作,第四个流程战略性地复用了现有外部数据集中的高质量演示。 collectively,这些方法将多方面的数据整合为统一的视频推理格式,为未来的扩展奠定了可扩展的基础。与主要依赖程序化场景合成的先前工作(如 VBVR 和 VR-Bench)相比,我们的数据集构建流程结合了多种互补的构建策略。
2.2.1 基于实例的渲染
在此流程中,我们从预先存在的结构化资产(如谜题状态或棋盘配置)中合成视频数据。从这些资产中采样单个实例,并通过确定性代码渲染依次转换为视频格式。
国际象棋 (Chess)。 该任务旨在增强视频模型在高度结构化、基于规则的环境中的推理能力。我们从 Mate in One (Chess)1 数据集中采样实例,并程序化渲染相应的视频序列。模型的任务是识别并视觉执行导致将死的唯一合法移动。
数独 (Sudoku)。 为了注入算法和计算推理的监督信号,我们利用 Sudoku-Easy2 数据集的训练集,并辅以同等难度的程序化生成谜题。在此,视频模型需要通过严格的逐步演绎过程来解决 4 × 4 数独谜题。
— 1 https://www.kaggle.com/datasets/ancientaxe/mate-in-one-chess 2 https://huggingface.co/datasets/LangAGI-Lab/Sudoku-Easy
4
第 5 页
基于实例的渲染 专家引导的渲染 程序化场景合成
2D几何 点线连接 随机种子 国际象棋 数独 类别: a b c d e f g h +——-+——-+ 动物、建筑、 8 . k . . . . . . 7 . . . . . R . . | 4 . | . . | 食物、运动 …. 6 . . . R . . . . | . 3 | . . | 5 . . . . . . . . +——-+——-+ LLM专家 4 . . . . . . . . | . 1 | 3 . | 3 . . . . . . . . | 2 . . . . . . . . . . | . . | 人类 概念: +——-+——-+ 1 . . . . . K . . 专家 动物:大象、鲸鱼 … 物理引擎或图形管线 建筑:房屋、城堡 … 坐标: 食物:苹果、香蕉 … 程序化场景合成 A:[x_1, y_1], 运动:板球棒、船桨 … 2D 3D D:[x_2,y_2] 文本到图像模型专家 代码渲染
…
边缘检测
七巧板拼图 立方体折叠 代码渲染 代码渲染
物理运动 3D多立方体旋转 国际象棋 数独 2D几何 点线连接
图4 OpenCoF-17K的前三个策展流程概述。基于实例的渲染通过代码渲染将结构化资产转换为视频。专家引导的渲染使用人类、LLM或文本到图像模型的指导来定义结构,然后再进行渲染。程序化场景合成使用物理引擎或图形管线来实例化场景。
2D几何。针对几何推理,我们从Geo170K [7]中采样需要辅助线构建的2D几何图像。专家标注员为这些线段定义真实坐标,随后我们渲染展示逐步绘制过程的视频。
点线连接。点线连接任务可以增强模型对抽象图形的理解能力以及遵循严格顺序规则的能力。我们预定义各种类别,并提示LLM [6] 生成具体概念。随后,我们使用文本到图像模型 [35] 合成极简线条画图像,然后通过经典计算机视觉例程将其转换为顺序点线连接动画视频。
2.2.3 程序化场景合成
该流程完全从头开始合成视频数据。我们利用随机种子实例化基础场景参数,随后物理引擎或图形管线将展开的动态渲染为连续的视频流。
七巧板拼图。旨在培养空间意识和形状操作能力,该任务要求模型系统地重新排列七巧板碎片以形成目标配置。我们以随机形状和初始位置程序化生成拼图碎片,直接将顺序组装过程渲染为视觉格式。
立方体折叠。针对2D到3D的空间推理,我们程序化生成立方体折叠序列。给定一个平面的2D立方体展开图,模型必须预测正确的折叠序列以形成完整的3D立方体。初始展开图在拓扑结构、视角和表面图案方面是随机化的,折叠动态使用Matplotlib 3D进行编程动画。
3D多立方体旋转。为了在不同视角下注入几何运动控制监督,我们制定了3D多立方体旋转任务。在此,多立方体以随机化的复杂几何形状实例化,
5
第 6 页
国际象棋 数独
请扮演白方或黑方(通过观察棋盘和棋子位置确定你的阵营),并在下一步将死对手。 创建一个静态、平滑的动画,解决给定的 4×4 数独。 逐个填入缺失的数字。不要改变图片中的任何其他内容。仅在空格中填入数字,使数独 正确求解。光标移动并在空框中填入正确的数字。
在整个游戏过程中保持固定的摄像机角度和光照。静态场景,无缩放,无平移,无推拉。
2D 几何 连点成图
用直线平滑连接点 B 和点 D。视频在连接过程完成后结束。静态视角,无 动画展示从 1 到 12 的点依次连接,每段 缩放或平移。 直线平滑出现,直到完整轮廓显现。 保持带有微笑太阳和植物的背景不变。 固定镜头。
七巧板拼图 立方体折叠
将棋子 A 放置在 (x, y) = (2, 2)。 将展开图向上折叠成立方体,保持摄像机固定。
3D 多立方体旋转 物理运动
由 10 个立方体组成的结构,从方位角 318°、仰角 32° 观察。摄像机围绕该 一个球体放置在斜面顶部(倾斜角 θ = 结构执行平滑的水平轨道运动,过渡到方位角 95°,这是一个 137 度的旋转, 21.2 度)。表面摩擦系数 μ = 0.15。球体 同时保持与物体的距离恒定。 被释放并沿斜坡滚下至水平地面。展示完整的运动过程。固定镜头。
迷宫 具身操作
基于提供的网格谜题图像创建 2D 动画。紫色巫师移动到紫色木箱后面,并平滑地将其 推向蓝色魔法阵。紫色木箱仅在紫色巫师从后面推动时滑动,并沿灰色 石砖瓷砖直线移动。……
VBVR
一个由 3 个等直径垂直管组成的连通器系统,充满水(类水(低粘度)),呈现蓝色。如 初始帧所示,各管中的液面高度分别为 [14, 36, 36] 厘米。由于 各管之间的压力差,液体开始通过底部的连接通道流动。流动受静水压力 平衡控制,并受到系数 k=3.92 的粘性阻力阻尼。随着液体 重新分布,高度差逐渐减小,系统演化 趋向平衡。最终,通过体积守恒,所有管达到 相同的最终液面高度,等于初始高度的平均值。模拟 从初始不平衡状态到最终稳定 平衡的沉降过程。
图 5 OpenCoF-17K 的代表性示例。
6
第 7 页
国际象棋 数独
请扮演白方或黑方(通过观察棋盘和棋子位置确定你的阵营),并在下一步将死对手。 创建一个静态、平滑的动画,解决给定的 4×4 数独。 逐个填入缺失的数字。不要改变图片中的任何其他内容。仅在空格中填入数字,使数独 正确求解。光标移动并在空框中填入正确的数字。
在整个游戏过程中保持固定的摄像机角度和光照。静态场景,无缩放,无平移,无推拉。
2D 几何 点连线
用直线平滑连接点 O 和点 E。视频在连接过程完成后结束。静态视角,无缩放或平移。 动画展示从 1 到 9 的点依次连接,每条直线平滑出现,直到完整轮廓显现。 保持带有微笑太阳和植物的背景不变。 固定镜头。
七巧板拼图 立方体折叠
将块 A 顺时针旋转 60 度,并将其放置在 (x, y) = (2, 0) 处。 展开图折叠成一个立方体,折叠边缘清晰可见。静态摄像机视角,无缩放或平移。
3D 多立方体旋转 物理运动
围绕 3D 形状旋转以暗示空间结构,保持光照和几何形状固定。 一个方块从 U 形半圆形轨道的顶部边缘释放 (半径 R = 174)。表面摩擦系数 μ = 0.27。 方块沿曲面下滑,经过最低点,并爬上对面。展示完整的运动过程。静态 镜头。
迷宫 具身操作
基于提供的迷宫图像创建 2D 动画。蓝色 将叉子移到布料上方 圆圈沿白色方形路径平滑滑动,完美停在 绿色圆圈上。蓝色圆圈从不滑入或穿过 红色叉号(陷阱区域)。……
VBVR 一个黑球以所示初始方向箭头开始运动。它沿直线运动,并遵循反射定律 (反射角等于入射角)从两面垂直墙壁反射。遵循这一独特的 轨迹,直到球击中右下角区域中的一个红色空心圆目标。确定击中了哪个目标圆,并逐步展示完整 轨迹。
图 6 OpenCoF-17K 的代表性示例。
7
第 8 页
表 2 MME-CoF [10] 上的结果。分数报告在 0–4 的尺度上。
| Model | Overall | Instruction Alignment | Temporal Consistency | Visual Stability | Content Fidelity | Focus Relevance | | :— | :— | :— | :— | :— | :— | :— | | Closed-source Models | | | | | | | | Kling-v1 [19] | 0.71 | 0.09 | 0.21 | 2.46 | 0.30 | 0.48 | | Seedance-1.0-Pro [8] | 1.48 | 0.39 | 1.71 | 2.05 | 1.22 | 2.04 | | Veo-3.0-Fast [9] | 1.52 | 0.73 | 1.41 | 1.83 | 1.25 | 2.36 | | Veo-3.0-Preview [9] | 1.53 | 0.70 | 1.46 | 1.91 | 1.24 | 2.36 | | Sora-2 [28] | 1.80 | 0.74 | 1.60 | 2.36 | 1.75 | 2.53 | | Open-source Models | | | | | | | | Wan2.2-TI2V-5B [41] | 0.72 | 0.08 | 0.96 | 1.16 | 0.48 | 0.90 | | HunyuanVideo-I2V [18] | 0.98 | 0.23 | 1.38 | 1.52 | 0.68 | 1.08 | | Data-only Fine-tuning | | | | | | | | Wan2.2-I2V-A14B (Baseline) [41] | 1.00 | 0.22 | 0.96 | 1.52 | 0.68 | 1.62 | | Wan-CoF | 1.30 | 0.31 | 1.29 | 1.99 | 1.00 | 1.89 | | $\Delta$ over the Baseline | +0.30 | +0.10 | +0.33 | +0.47 | +0.32 | +0.28 | | Exploration of Reasoning Techniques | | | | | | | | Wan-CoF$_{vt}$ | 1.34 | 0.26 | 1.38 | 2.33 | 0.99 | 1.76 | | Wan-CoF$_{tt}$ | 1.35 | 0.34 | 1.27 | 2.18 | 1.17 | 1.77 |
视点,并随后在不同轴和角度上进行旋转。
物理运动。基于物理的运动推理是一种使视频模型扎根于物理现实的能力。我们模拟球体和方块在具有不同摩擦系数(例如,光滑表面与粗糙表面)的平坦或弯曲轨道上穿行的场景。模型的任务是仅根据初始状态预测这些物体的合理动态轨迹。
2.2.4 外部视频再利用
除了图 4 中可视化的三种主动构建流水线外,我们还战略性地利用现有视频数据集中的高质量演示。这些资源通过标准化其空间分辨率、帧率和时间长度,以无缝对齐我们的统一训练套件。
迷宫。我们从 VR-Bench [47] 数据集的训练集中采样迷宫导航数据。由于该数据集中的一些实例遵循相似的分布,我们在保留子任务和难度级别覆盖范围的同时采样了一个子集。
VBVR。由于某些 VBVR 子任务过于简单或针对相似的能力,我们从更广泛的 VBVR [42] 数据集中选择了 30 个代表性子任务,并从每个子任务中随机采样演示视频。
具身操作。具身操作任务的数据从 BridgeData V2 [40] 中采样。该任务要求视频模型理解空间关系并执行受控操作。
3 Wan-CoF 的训练
在引入模型中的显式推理技术之前,我们首先进行最直接的研究:当仅使用多样化的 CoF 监督进行训练时,强大的开源视频生成器能达到什么程度?为了回答这个问题,我们使用 Wan2.2-I2V-A14B [41],这是一个通用领域预训练的 I2V 模型,并使用 LoRA [14] 直接在 OpenCoF-17K 上进行微调。得到的模型 Wan-CoF 标志着我们研究的纯数据阶段,并作为将性能提升归因于数据集本身的清晰参考点。我们在四个视频推理基准上评估 Wan-CoF,这使我们能够将 OpenCoF-17K 的影响与第 4 节中探讨的推理 Token 设计分离开来。有关实验细节,请参阅附录 A。
8
第 9 页
表 3 Gen-ViRe [23] 上的结果。遵循 Gen-ViRe 协议,分数范围为 0–1。
| Model | Overall | Abstract | Algo. & Logi. | Analogy | Perceptual | Planning | Spatio-Temporal | | :— | :— | :— | :— | :— | :— | :— | :— | | Closed-source Models | | | | | | | | | Kling-v1 [19] | 0.198 | 0.071 | 0.057 | 0.117 | 0.140 | 0.443 | 0.359 | | Seedance-1.0-Pro [8] | 0.301 | 0.154 | 0.164 | 0.083 | 0.171 | 0.609 | 0.621 | | Veo-3.1 [9] | 0.486 | 0.440 | 0.451 | 0.367 | 0.386 | 0.722 | 0.550 | | Sora-2 [28] | 0.560 | 0.604 | 0.472 | 0.483 | 0.496 | 0.768 | 0.537 | | Data-only Fine-tuning | | | | | | | | | Wan2.2-I2V-A14B (Baseline) [41] | 0.304 | 0.220 | 0.359 | 0.083 | 0.190 | 0.519 | 0.452 | | Wan-CoF | 0.391 | 0.328 | 0.506 | 0.133 | 0.347 | 0.578 | 0.451 | | ∆over the Baseline | +0.087 | +0.107 | +0.147 | +0.050 | +0.157 | +0.059 | -0.001 | | Exploration of Reasoning Techniques | | | | | | | | | Wan-CoFvt | 0.441 | 0.475 | 0.507 | 0.233 | 0.298 | 0.628 | 0.507 | | Wan-CoFtt | 0.406 | 0.424 | 0.474 | 0.167 | 0.306 | 0.565 | 0.499 |
表 4 VIPER [22] 上的结果。我们遵循原始 VIPER 协议并报告 POC@1.0。
| Model | Overall | Temporal | Structural | Symbolic | Spatial | Physics | Planning | | :— | :— | :— | :— | :— | :— | :— | :— | | Closed-source Models | | | | | | | | | Seedance-1.5 [32] | 9.5 | 5.6 | 5.6 | 0.0 | 5.3 | 6.5 | 33.8 | | Veo-3.1 [9] | 20.3 | 22.2 | 20.0 | 13.3 | 10.7 | 14.7 | 41.0 | | Sora-2 [28] | 23.3 | 10.4 | 42.5 | 58.3 | 4.0 | 9.4 | 15.1 | | Open-source Models | | | | | | | | | Hunyuan-1.5 [45] | 8.1 | 8.4 | 5.0 | 0.0 | 2.7 | 11.1 | 21.1 | | Data-only Fine-tuning | | | | | | | | | Wan2.2-I2V-A14B (Baseline) [41] | 3.3 | 5.6 | 6.2 | 0.0 | 0.0 | 2.8 | 5.3 | | Wan-CoF | 7.5 | 18.8 | 10.0 | 0.0 | 5.3 | 8.3 | 5.3 | | ∆over the Baseline | +4.2 | +13.2 | +3.8 | 0.0 | +5.3 | +5.5 | 0.0 | | Exploration of Reasoning Techniques | | | | | | | | | Wan-CoFvt | 8.2 | 12.8 | 11.3 | 0.0 | 4.0 | 8.3 | 15.8 | | Wan-CoFtt | 8.8 | 14.8 | 15.0 | 0.0 | 8.0 | 2.8 | 10.5 |
3.1 主要结果
与基线模型的比较。 如表 2 至表 5 中“仅数据微调”行所示,与我们的基线模型 Wan2.2-I2V-A14B 相比,Wan-CoF 在所有基准测试中的主要指标均有所提升:MME-CoF Overall 从 1.00 提升至 1.30 (+0.30),Gen-ViRe 平均分从 0.304 提升至 0.391 (+0.087),VIPER POC 从 3.3 提升至 7.5 (+4.2),RULER-Bench 总体平均分从 55.8 提升至 56.8 (+1.0)。这些提升是全面的——MME-CoF 的各个方面均有改善,且在 Gen-ViRe 和 VIPER 上,几乎所有类别也均有所增益。那些严重非正值的单元格位于评估噪声内,或对应于开源模型得分仍接近零的维度。此外,最大的提升集中在面向推理的子维度上,如时间一致性 (Temporal Consistency)、物理 (Physics)、空间 (Spatial)、感知 (Perceptual) 以及算法与逻辑 (Algorithmic & Logical),而非仅在于视觉保真度,这表明我们的训练增强了帧级推理能力,而非仅仅作为视觉质量的正则化器。
与其他模型的比较。 在表 2 至表 5 的“仅数据微调”行中,Wan-CoF 超越了开源竞争对手,并缩小了与闭源前沿模型的差距。在 MME-CoF 上,Wan-CoF 超过了 HunyuanVideo-I2V 和 Wan2.2-TI2V-5B,接近 Seedance-1.0-Pro。在 Gen-ViRe 上,Wan-CoF 达到 0.391 的平均分,优于 Kling-v1 和 Seedance-1.0-Pro,并更接近 Veo-3.1。在 VIPER 上,Wan-CoF 达到 7.5 的 POC,与开源的 Hunyuan-1.5 和闭源的 Seedance-1.5 持平。在单个开源骨干网络上使用 LoRA 微调预算的情况下,这使得 Wan-CoF 成为 CoF 推理方面最强的开源 I2V 模型之一。
9
第 10 页
表 5 RULER-Bench [12] 上的结果。由于我们的基线模型不支持文生视频生成,因此我们报告了过滤后的图生视频设置,评分范围为 0–100。IF:指令遵循(Instruction Following),VC:视觉一致性(Visual Consistency),VF:视觉保真度(Visual Fidelity),RC:规则连贯性(Rule Coherence)。
| Model | Vision Overall | | | | | Science | | | | | Game | | | | | Humanity | | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | IF | VC | VF | RC | Avg. | IF | VC | VF | RC | Avg. | IF | VC | VF | RC | Avg. | IF | VC | VF | RC | Avg. | | Data-only Fine-tuning | | | | | | | | | | | | | | | | | | | | | | Wan2.2-I2V-A14B (Baseline) [41] | 55.8 | 0.0 | 69.1 | 65.8 | 28.0 | 54.3 | 44.2 | 73.5 | 83.6 | 18.4 | 54.9 | 21.6 | 65.6 | 83.4 | 12.0 | 45.6 | 61.1 | 91.7 | 91.7 | 40.2 | 71.2 | | Wan-CoF | 56.8 | 0.0 | 65.1 | 67.0 | 31.7 | 54.6 | 45.6 | 70.8 | 83.1 | 18.9 | 54.6 | 25.0 | 74.4 | 87.0 | 23.9 | 52.6 | 47.2 | 86.1 | 94.4 | 49.4 | 69.3 | | $\Delta$ over the Baseline | +1.0 | 0.0 | -4.0 | +1.3 | +3.6 | +0.3 | +1.4 | -2.7 | -0.5 | +0.5 | -0.3 | +3.4 | +8.8 | +3.6 | +11.9 | +6.9 | -13.9 | -5.6 | +2.8 | +9.3 | -1.9 | | Exploration of Reasoning Techniques | | | | | | | | | | | | | | | | | | | | | | Wan-CoF$_{vt}$ | 59.6 | 0.0 | 72.7 | 71.0 | 35.6 | 59.8 | 48.5 | 68.5 | 81.4 | 15.5 | 53.5 | 30.7 | 73.4 | 86.4 | 22.1 | 53.2 | 58.3 | 88.9 | 98.2 | 56.9 | 75.6 | | Wan-CoF$_{tt}$ | 57.7 | 0.0 | 71.2 | 68.1 | 34.2 | 57.8 | 45.9 | 69.8 | 84.6 | 18.9 | 54.8 | 28.6 | 76.5 | 87.2 | 23.1 | 53.8 | 52.8 | 86.1 | 94.9 | 49.4 | 70.8 |
3.2 分布外分析
评估 CoF 推理的一个关键挑战是确保模型能够超越其训练分布进行泛化。虽然最近的工作 [42, 47] 在其各自的任务套件内部评估分布偏移,但我们通过将模型直接迁移到独立的、外部构建的基准测试上来探索泛化能力。由于这些外部基准测试包含与我们的训练集不同的分布,在其上进行测试可以衡量模型在分布偏移下的性能。在此设置下,Wan-CoF 在所有四个基准测试中均表现出一致的改进。值得注意的是,各类别的增益似乎与 OpenCoF-17K 提供的监督类型相一致:在物理运动上的训练迁移到了 VIPER Physics (+5.5);结构化网格任务(例如国际象棋、数独、迷宫)与 Gen-ViRe Algorithmic & Logical (+0.147) 和 RULER-Bench Game 划分 (+6.9) 相关;而空间形状任务则映射到 Gen-ViRe Perceptual (+0.157) 和 VIPER Spatial (+5.3)。这些迁移信号共同表明,OpenCoF-17K 有助于培养跨任务套件的通用 CoF 推理技能,而不是过拟合到特定的训练领域。
4 CoF 技术探索
第 3 节中的纯数据实验确立了一个令人鼓舞的起点:即使没有显式添加推理技术,在 OpenCoF-17K 上进行训练也能迁移到外部推理基准测试。这一结果也明确了经验性问题:如果 CoF 的收益仅通过监督就能产生,那么专门的推理技术是否能为模型提供一个更明确的空间,用于组织这些收益背后的中间规则、计划和抽象目标?底层的生成器仍然缺乏用于维持推理状态的专用通道,必须通过像素级潜在变量隐式地表达此类信息。由于现有的视频生成模型最初并非为逐步推理而设计,因此它们没有提供专门的结构来承载在视觉潜在空间内运行的低级推理线索,或在提示层面运行的高级推理语义。因此,我们探索了两种互补的设计方案,以针对这些不同的层级:Visual Reasoning Tokens (vt),它们位于 DiT 的潜在空间内,用于捕捉低级推理线索;以及 Textual Reasoning Tokens (tt),它们增强文本条件以捕捉高级推理语义。随后,我们将分析这些令牌在何时、何地以及如何提供帮助。
4.1 推理令牌的两类策略
我们现在介绍我们的两种推理令牌策略,如图 7 所示。该公式与特定的视频生成器无关,适用于任何基于 DiT 的架构。为了具体说明,我们在 Wan2.2-I2V-A14B 上实例化该策略,这也是 Wan-CoF 所使用的相同主干网络。
视觉推理令牌 (vt)。DiT 视频生成器以视觉令牌序列 $x \in \mathbb{R}^{T \times H \times W \times d}$ 作为输入,这些令牌代表视频的压缩潜在表示,将其展平为 1D 序列,并通过一系列自注意力块进行处理。为了直接在视觉空间中承载推理状态,我们引入了 $N_r$ 个可学习的 Visual Reasoning Tokens,记为 $r_v \in \mathbb{R}^{N_r \times d}$,它们被随机初始化,并在进入第一个 DiT 块之前前置到视觉令牌序列中:
$$ z_0 = [r_{v1}, r_{v2}, \dots, r_{vN_r}, x_1, x_2, \dots, x_M], \quad (1) $$
其中 $M = T \times H \times W$ 是视觉令牌的总数。在每个 DiT 块内部,自注意力机制允许每个视觉令牌 $x_i$ 关注每个推理令牌 $r_{vj}$,而推理令牌反过来关注完整的视觉
第 11 页
视觉 视觉 解码器 解码器
扩散过程 … 扩散过程 … LoRA LoRA DiT 模块 × N 交叉注意力 DiT 模块 × N 文本 序列 自注意力 文本 推理 推理 令牌 …
+ … …
文本 序列 视觉 推理令牌 视觉令牌 … 视觉令牌 … + … …
文本 文本 编码器 视觉 编码器 视觉 编码器 编码器
将连接点从 1 到 8 依次动画化,每 将连接点从 1 到 8 依次动画化,每 条直线平滑出现,直到完整轮廓出 条直线平滑出现,直到完整轮廓出 现。 现。 保持带有微笑太阳和植物的背景不 保持带有微笑太阳和植物的背景不 变。 变。 固定镜头。 固定镜头。
(a) 视觉推理令牌 (b) 文本推理令牌
图 7 推理令牌设计的概述。(a) 视觉推理令牌被插入到视觉令牌序列中,并通过自注意力与视觉令牌进行交互。(b) 文本推理令牌被附加到文本条件序列中,并通过交叉注意力引导生成。
序列以及彼此之间。这种双向流动使 $v_t$ 能够聚合全局上下文,并将生成的特征反馈给视觉令牌。在最后一个 DiT 模块之后,推理令牌被丢弃,并从输出的视觉部分读取预测结果。
文本推理令牌 ($t_t$)。承载推理状态的另一个互补位置是文本条件侧。DiT 消耗由文本编码器产生的文本条件序列 $c \in \mathbb{R}^{L \times d}$,其中 $L$ 是该序列的长度。我们引入 $N_t$ 个可学习的文本推理令牌,记为 $r_t \in \mathbb{R}^{N_t \times d}$,并在它们进入每个 DiT 模块的交叉注意力之前,将它们前置到该序列中:
$c_0 = [r_{t1}, r_{t2}, \dots, r_{tN_t}, c_1, c_2, \dots, c_L]$. (2)
每个模块中的交叉注意力随后使每个视觉令牌 $x_i$ 能够同时关注原始文本令牌和新的 $r_{tj}$,因此 $r_t$ 提供了补充 $c$ 中每个提示内容的任务级信息。与 $v_t$ 不同,$r_t$ 仅作为额外的键/值上下文进入,从不出现在查询侧,因此它不会被视觉序列刷新,并且在每个空间补丁和每个时间帧之间共享且保持不变。这也意味着 $r_t$ 不需要在最终输出读取之前移除。因此,$t_t$ 充当单向的、与提示无关的文本先验,这与 $v_t$ 在视觉流内部放置的空间接地双向推理通道互补。
4.2 主要结果 我们使用 LoRA 分别对 Wan2.2-I2V-A14B 进行微调,使用 $v_t$ 和 $t_t$,分别得到 Wan-CoF$_{v_t}$ 和 Wan-CoF$_{t_t}$。如表 2 至 5 中的“推理技术探索”行所示,这两种变体均进一步改进
11
第 12 页
高噪声模型 低噪声模型 VT 高噪声模型 0.035 VT 高噪声 模型 低噪声 模型 0.0150 VT 低噪声模型 0.0018 TT 高噪声 模型score 0.004 VT score TT 高噪声 模型 0.030score score TT 低噪声 模型 0.0145 0.003 0.025 0.0016 TT 低噪声模型 0.0140 0.020 0.0014 0.002 0.0135 自注意力 0.015交叉注意力 自注意力 0.0012 0.0130交叉注意力 0.0010均值 0.001 0.010均值 均值 0.0125均值 VT 0.005TT VT 0.0008 0.0120TT 0.000 0.000 0 5 10 15 20 25 30 35 40 0 10 20 30 40 50 DiT 块 ID 去噪步数
(a) 深度方向注意力 (b) 去噪步数注意力
图 8 推理令牌的注意力模式。我们在推理过程中对 120 个 MME-CoF 案例的注意力进行平均。 对于 vt,我们报告自注意力中视觉令牌对 vt 的注意力;对于 tt,我们报告交叉注意力中视觉令牌对 tt 的注意力。面板 (a) 显示深度方向注意力,面板 (b) 显示去噪步数注意力。
在各项基准测试的首要指标上均优于 Wan-CoF。Wan-CoFvt 在 Gen-ViRe 和 RULER-Bench 上达到最高的综合得分,而 Wan-CoFtt 在 MME-CoF 和 VIPER 上领先。在子维度层面,这两种变体朝着相反的方向专业化,这与它们的设计一致:vt 主导那些需要在视觉序列内部维持全局、持久计划的任务维度,例如 VIPER 中的 Planning、Gen-ViRe 中的 Abstract、Analogy 和 Planning,以及 MME-CoF 中的 Visual Stability。相比之下,tt 主导那些受益于可学习的、与提示无关的文本先验的维度,例如 MME-CoF 中的 Instruction Alignment 和 VIPER 中的 Structural。
4.3 注意力分析
为了理解这些令牌如何运作,我们在 120 个 MME-CoF 案例的推理过程中提取注意力,并平均两种信号:分配给 vt 的视觉令牌自注意力 [39] 分数和分配给 tt 的交叉注意力 [39] 分数。然后,我们沿着四个轴检查这些注意力模式:DiT 块深度、去噪步数、帧内的空间位置以及跨帧的时间位置。
深度方向注意力。图 8 的面板 (a) 显示,vt 和 tt 在 DiT 深度上的使用是不均匀的,这表明推理令牌主要参与特定的计算阶段,而不是作为恒定的全局偏置。vt 显示出更强的层选择性:在低噪声模型中,它在浅层到中层块附近达到峰值,而在高噪声模型中,它在后续块中保持活跃,并表现出更强的中后期尖峰,这与视觉推理令牌在去噪难度较大时帮助组织潜在时空结构一致。tt 遵循从早期到中期的平滑强调,然后随深度衰减,这与其作为通过交叉注意力提供的提示级先验的角色相符。
去噪步数注意力。图 8 的面板 (b) 显示了沿去噪轨迹的类似模式。两种类型的令牌在去噪早期都接收到更强的注意力,尤其是在高噪声模型中,此时全局语义和运动结构尚未确定。vt 的注意力在高噪声模型中起始较高并迅速下降,表明其在视觉潜在规划中的早期作用;在低噪声模型中,它变得更为平坦且较低,这与后期的细化一致。tt 在去噪步数上较为平滑,但其高噪声曲线始终高于低噪声曲线,这表明任务级文本先验在生成过程稳定之前最为有用。
空间注意力。在单个帧内,RT 注意力揭示了 vt 和 tt 不同的空间角色,如图 9 顶行所示。vt 注意力相对稀疏,并形成明显的水平和垂直条带,在机械爪和豆子附近响应更强。这种模式表明 vt 捕捉局部视觉线索,同时保留来自视觉令牌网格的轴对齐结构,这可能受到 Wan 的可分离 3D RoPE [37] 的影响。相比之下,tt 注意力更为弥散,覆盖更广泛的与任务相关的区域,
12
第 13 页
空间注意力可视化
提示 单一连续镜头,无剪辑。 以静态全景镜头开始(1- 2秒)。然后动画展示机械臂 执行平滑、恒速运动,将桌上的豆子 从左向右擦拭。只有机械臂 移动;场景是刚性且 静态的,在整个镜头中外观和几何 结构均无变化。
(a) VT 空间自注意力 (b) TT 空间交叉注意力
时间注意力可视化
提示 展示带有高度标签 h 的粗糙 半圆形轨道以及位于 P 点的 滑块;释放它, 添加微弱的摩擦 (c) VT 时间自注意力 痕迹,当滑块沿右侧 下滑并上滑时, 最终停在边缘下方。快速且完整地展示移动过程。 静态镜头。 (d) TT 时间交叉注意力
图 9 空间和时间注意力可视化。顶部:针对具身操作提示,vt 自注意力和 tt 交叉注意力在较高噪声下的代表性空间注意力图。底部:针对物理推理提示,vt 和 tt 的时间注意力图,其中帧在时间上均匀采样并按从左到右的顺序排列。
包括机械臂、桌面和目标物体,这与 tt 作为高级语义先验而非局部空间追踪器的作用一致。
时间注意力。如图 9 底部所示,vt 和 tt 表现出不同的时间侧重,而非简单的物体追踪模式。vt 注意力在序列的开始和结束处更为明显,表明视觉推理令牌在模型锚定初始状态和解决运动最终结果时发挥作用。tt 注意力在最早帧中不太显著,但在后续采样的帧中变得同样突出,这与一旦建立时间上下文就保持活跃的提示级先验一致。这种对比表明了一种互补的时间分工:vt 强调视觉演变中的边界状态,而 tt 在随后的推理过程中提供更稳定的语义约束。
5 相关工作
5.1 现代视频生成模型
视频生成模型在视觉质量、时间一致性和指令遵循方面取得了快速进步。 在架构方面,从基于 U-Net 的扩散模型 [1, 31] 转向 DiT [29] 和流匹配框架 [26], 使得可扩展训练和更高分辨率合成成为可能。开放系统如 HunyuanVideo [18]、 HunyuanVideo-1.5 [45] 和 Wan [41] 为图像到视频和文本到视频生成提供了强大的骨干网络, 而专有系统包括 Kling [19]、Veo [9]、Seedance [33] 和 Sora [28] 则继续推动生成 质量和可控性。这些进展使视频生成成为视觉推理的一个有前景的基础, 但高保真生成本身并不能保证连贯的多步推理。
5.2 视频推理基准
推理已成为多模态模型的核心能力 [4, 16],但传统的思维链管道 [43] 通常依赖文本、静态视觉观察、外部工具 [15] 或辅助图像生成 [20]。 视频生成提供了另一条路径,其中推理通过时间连接的帧展开 [44]。
13
第 14 页
最近的基准测试,包括 MME-CoF [10]、VideoThinkBench [38]、V-ReasonBench [25]、Gen-ViRe [23]、RULER-Bench [12]、MMGR [2]、TiViBench [3] 和 VIPER [22],从不同角度形式化并评估了这一能力。OpenCoF 建立在这些基准测试之上,但侧重于通过 OpenCoF-17K 数据集和推理 Token 探索来改进 CoF 推理。
5.3 用于推理的视频生成模型
训练用于推理的视频生成模型的研究仍少于基准测试研究。VR-Bench [47] 研究了迷宫求解和测试时扩展(test-time scaling),Thinking in Frames [21] 专注于迷宫和七巧板拼图等领域,而 VBVR [42] 在认知任务套件中扩展了视频推理数据。这些工作表明,有针对性的监督可以改善视频推理,但它们通常局限于特定领域,或者在训练和评估之间存在内部耦合。相反,OpenCoF-17K 结合了四个数据源,并支持在独立的外部基准测试上进行迁移评估,而 OpenCoF 进一步探索了如何通过视觉推理 Token(vt)和文本推理 Token(tt)来组织推理状态。
6 结论与局限性
我们提出了 OpenCoF-17K 数据集,这是一个多样化的视频推理数据集,旨在改进视频生成模型中的帧链推理(Chain-of-Frame reasoning)。在 OpenCoF-17K 数据集上微调 Wan2.2-I2V-A14B 得到了 Wan-CoF,结果表明,多样化的时间监督改善了四个外部基准测试上的 CoF 行为。我们进一步探索了视觉推理 Token 和文本推理 Token,并通过基准测试结果和注意力模式分析了它们如何组织推理状态。一个局限性是 vt 和 tt 是分别研究的。如何有效地结合它们仍是未来的工作。
14
第 15 页
参考文献
[1] Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, 等。Lumiere:一种用于视频生成的时空扩散模型。在 SIGGRAPH Asia 2024 会议论文集中,第 1–11 页,2024。
[2] Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Minjia Zhang, Wen Xiao, Jiuxiang Gu, 等。Mmgr:多模态生成式推理。arXiv 预印本 arXiv:2512.14691,2025。
[3] Harold Haodong Chen, Disen Lan, Wen-Jie Shu, Qingyang Liu, Zihan Wang, Sirui Chen, Wenkai Cheng, Kanghao Chen, Hongfei Zhang, Zixin Zhang, 等。Tivibench:评估视频生成模型的“视频中思考”推理能力。arXiv 预印本 arXiv:2511.13704,2025。
[4] Xinyan Chen, Renrui Zhang, Dongzhi Jiang, Aojun Zhou, Shilin Yan, Weifeng Lin, 和 Hongsheng Li。Mint-cot:在数学思维链推理中启用交错的视觉 Token。arXiv 预印本 arXiv:2506.05331,2025。
[5] Hyung Won Chung, Noah Constant, Xavier Garcia, Adam Roberts, Yi Tay, Sharan Narang, 和 Orhan Firat。 Unimax:大规模多语言预训练中更公平且更有效的语言采样方法。arXiv 预印本 arXiv:2304.09151,2023。
[6] Gheorghe Comanici, Eric Bieber, Mike Schaekermann, Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, 等。Gemini 2.5:通过高级推理、多模态、长上下文和下一代智能体能力推动前沿。arXiv 预印本 arXiv:2507.06261,2025。
[7] Jiahui Gao, Renjie Pi, Jipeng Zhang, Jiacheng Ye, Wanjun Zhong, Yufei Wang, Lanqing Hong, Jianhua Han, Hang Xu, Zhenguo Li, 等。G-llava:利用多模态大语言模型解决几何问题。arXiv 预印本 arXiv:2312.11370,2023。
[8] Yu Gao, Haoyuan Guo, Tuyen Hoang, Weilin Huang, Lu Jiang, Fangyuan Kong, Huixia Li, Jiashi Li, Liang Li, Xiaojie Li, 等。Seedance 1.0:探索视频生成模型的边界。arXiv 预印本 arXiv:2506.09113,2025。
[9] Google DeepMind。Veo-3 技术报告。技术报告,Google DeepMind,2025 年 5 月。URL https: //storage.googleapis.com/deepmind-media/veo/Veo-3-Tech-Report.pdf。
[10] Ziyu Guo, Xinyan Chen, Renrui Zhang, Ruichuan An, Yu Qi, Dongzhi Jiang, Xiangtai Li, Manyuan Zhang, Hongsheng Li, 和 Pheng-Ann Heng。视频模型准备好作为零样本推理器了吗?基于 mme-cof 基准的实证研究。arXiv 预印本 arXiv:2510.26802,2025。
[11] Ziyu Guo, Rain Liu, Xinyan Chen, 和 Pheng-Ann Heng。Atlas:智能体还是潜在视觉推理?一个词足以兼顾两者。arXiv 预印本 arXiv:2605.15198,2026。
[12] Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, 和 Boxi Wu。Ruler-bench:探测下一代视频生成模型对视觉基础智能的规则推理能力。arXiv 预印本 arXiv:2512.02622,2025。
[13] Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, 和 Xing Yu。Deepeyesv2:迈向智能体 多模态模型。arXiv 预印本 arXiv:2511.05271,2025。
[14] Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Liang Wang, Weizhu Chen, 等。Lora:大语言模型的低秩适应。Iclr, 1(2):3, 2022。
[15] Yushi Hu, Weijia Shi, Xingyu Fu, Dan Roth, Mari Ostendorf, Luke Zettlemoyer, Noah A Smith, 和 Ranjay Krishna。Visual sketchpad:作为多模态语言模型视觉思维链的草图绘制。神经信息处理系统进展,37:139348–139379, 2024。
[16] Dongzhi Jiang, Renrui Zhang, Ziyu Guo, Yanwei Li, Yu Qi, Xinyan Chen, Liuhui Wang, Jianhan Jin, Claire Guo, Shen Yan, 等。Mme-cot:评估大型多模态模型在推理质量、鲁棒性和效率方面的思维链。arXiv 预印本 arXiv:2502.09621,2025。
[17] Takeshi Kojima, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo, 和 Yusuke Iwasawa。大语言模型是零样本推理器。神经信息处理系统进展,35:22199–22213, 2022。
15
第 16 页
[18] Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, 等。Hunyuanvideo:大型视频生成模型的系统性框架。arXiv 预印本 arXiv:2412.03603,2024。
[19] 快手科技。Kling ai:下一代 AI 创意工作室。https://klingai.com/,2024 年 6 月。
[20] Chengzu Li, Wenshan Wu, Huanyu Zhang, Yan Xia, Shaoguang Mao, Li Dong, Ivan Vulić, 和 Furu Wei。在空间中推理时想象:多模态思维可视化。arXiv 预印本 arXiv:2501.07542,2025。
[21] Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, 等。在帧中思考:视觉上下文和测试时扩展如何赋能视频推理。arXiv 预印本 arXiv:2601.21037,2026。
[22] Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Wayne Xin Zhao, 和 Minghui Qiu。Viper:面向生成式视频推理的过程感知评估。arXiv 预印本 arXiv:2512.24952,2025。
[23] Xinxin Liu, Zhaopan Xu, Ming Li, Kai Wang, Yong Jae Lee, 和 Yuzhang Shang。世界模拟器能推理吗? gen-vire:一个生成式视觉推理基准。arXiv 预印本 arXiv:2511.13853,2025。
[24] Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chun yue Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, 和 Jianfeng Gao。Mathvista:使用 GPT-4V、Bard 和其他大型多模态模型评估视觉上下文中的数学推理。ArXiv,abs/2310.02255,2023。
[25] Yang Luo, Xuanlei Zhao, Baijiong Lin, Lingting Zhu, Liyao Tang, Yuqi Liu, Ying-Cong Chen, Shengju Qian, Xin Wang, 和 Yang You。V-reasonbench:面向视频生成模型统一推理基准套件。arXiv 预印本 arXiv:2511.16668,2025。
[26] Nanye Ma, Mark Goldstein, Michael S Albergo, Nicholas M Boffi, Eric Vanden-Eijnden, 和 Saining Xie。Sit: 探索基于流和扩散的生成模型与可扩展插值 Transformer。在欧洲计算机视觉会议 (ECCV) 上,第 23–40 页。Springer,2024。
[27] Fanqing Meng, Lingxiao Du, Zongkai Liu, Zhixiang Zhou, Quanfeng Lu, Daocheng Fu, Tiancheng Han, Botian Shi, Wenhai Wang, Junjun He, 等。Mm-eureka:探索基于规则强化学习的多模态推理前沿。arXiv 预印本 arXiv:2503.07365,2025。
[28] OpenAI。Sora 2 系统卡片。技术报告,OpenAI,2025 年 9 月。URL https://cdn.openai.com/pdf/ 50d5973c-c4ff-4c2d-986f-c72b5d0ff069/sora_2_system_card.pdf。
[29] William Peebles 和 Saining Xie。基于 Transformer 的可扩展扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集上,第 4195–4205 页,2023。
[30] Yu Qi, Xinyi Xu, Ziyu Guo, Siyuan Ma, Renrui Zhang, Xinyan Chen, Ruichuan An, Ruofan Xing, Jiayi Zhang, Haojie Huang, 等。Mme-cof-pro:利用文本和视觉提示评估视频生成模型中的推理连贯性。arXiv 预印本 arXiv:2603.20194,2026。
[31] Olaf Ronneberger, Philipp Fischer, 和 Thomas Brox。U-net:用于生物医学图像分割的卷积网络。 在国际医学图像计算与计算机辅助干预会议上,第 234–241 页。Springer,2015。
[32] Team Seedance, Heyi Chen, Siyan Chen, Xin Chen, Yanfei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xinqi Cheng, 等。Seedance 1.5 pro:一个原生的音视频联合生成基础模型。arXiv 预印本 arXiv:2512.13507,2025。
[33] Team Seedance, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei Chen, Feng Cheng, Tianheng Cheng, Yufeng Cheng, 等。Seedance 2.0:推进面向世界复杂性的视频生成。arXiv 预印本 arXiv:2604.14148,2026。
[34] Hao Shao, Shengju Qian, Han Xiao, Guanglu Song, Zhuofan Zong, Letian Wang, Yu Liu, 和 Hongsheng Li。Visual cot:通过全面的思维链推理数据集和基准,推动多模态语言模型的发展。神经信息处理系统进展,37:8612–8642,2024。
[35] David Sharon 和 Nicole Brichtova。Gemini 的图像编辑功能刚刚迎来重大升级。The Keyword (Google 博客),2025 年 8 月 26 日。URL https://blog.google/products-and-platforms/products/gemini/ updated-image-editing-model/。
16
第 17 页
[36] Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz, Andy Davis, Quoc Le, Geoffrey Hinton, 和 Jeff Dean。 极其庞大的神经网络:稀疏门控混合专家层。arXiv 预印本 arXiv:1701.06538, 2017。
[37] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu。Roformer:带有旋转位置嵌入的增强型 Transformer。Neurocomputing, 568:127063, 2024。
[38] Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, 等人。与视频一起思考:视频生成作为一种有前景的多模态推理范式。arXiv 预印本 arXiv:2511.04570, 2025。
[39] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, 和 Illia Polosukhin。注意力即所需。神经信息处理系统进展, 30, 2017。
[40] Homer Rich Walke, Kevin Black, Tony Z Zhao, Quan Vuong, Chongyi Zheng, Philippe Hansen-Estruch, An- dre Wang He, Vivek Myers, Moo Jin Kim, Max Du, 等人。Bridgedata v2:一个用于大规模机器人学习的数据集。 在机器人学习会议中,第 1723–1736 页。PMLR, 2023。
[41] Wan 团队, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, 和 Ziyu Liu。Wan:开放且先进的超大规模视频生成模型。arXiv 预印本 arXiv:2503.20314, 2025。
[42] Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, 等人。一个非常大的视频推理套件。arXiv 预印本 arXiv:2602.20159, 2026。
[43] Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou, 等人。 思维链提示法激发大语言模型中的推理能力。神经信息处理系统进展, 35:24824–24837, 2022。
[44] Thaddäus Wiedemer, Yuxuan Li, Paul Vicol, Shixiang Shane Gu, Nick Matarese, Kevin Swersky, Been Kim, Priyank Jaini, 和 Robert Geirhos。视频模型是零样本学习者和推理者。arXiv 预印本 arXiv:2509.20328, 2025。
[45] Bing Wu, Chang Zou, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Jack Peng, Jianbing Wu, Jiangfeng Xiong, Jie Jiang, 等人。Hunyuanvideo 1.5 技术报告。arXiv 预印本 arXiv:2511.18870, 2025。
[46] Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, 和 Ivan Vulić。视觉规划: 让我们仅用图像思考。arXiv 预印本 arXiv:2505.11409, 2025。
[47] Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, 等人。通过视频推理:首次通过迷宫求解任务评估视频模型的推理能力。arXiv 预印本 arXiv:2511.15065, 2025。
[48] Yi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, 等人。R1-onevision:通过跨模态形式化推进通用多模态推理。在 IEEE/CVF 国际计算机视觉会议论文集 中,第 2376–2385 页, 2025。
[49] Renrui Zhang, Dongzhi Jiang, Yichi Zhang, Haokun Lin, Ziyu Guo, Pengshuo Qiu, Aojun Zhou, Pan Lu, Kai-Wei Chang, Peng Gao, 等人。Mathverse:你的多模态 LLM 真的看到了视觉数学问题中的图表吗? ECCV 2024, 2024。
[50] Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, 和 Xing Yu。Deepeyes: 通过强化学习激励“与图像一起思考”。arXiv 预印本 arXiv:2505.14362, 2025。
17
第 18 页
附录
概述
我们按以下方式组织补充材料。
• 其他实现细节
– 骨干网络与 LoRA 设置
– 模型变体
• 对比系统
– 评估协议
• 其他消融实验
– 推理 Token 数量消融
A 其他实现细节
A.1 骨干网络与 LoRA 设置。
Wan2.2-I2V-A14B 采用混合专家(Mixture-of-Experts)[36] 去噪架构,在扩散时间步上分别使用高噪声和低噪声专家,配备 umT5 [5] 文本编码器、用于视觉编码和解码的 Wan-VAE,以及主流的 DiT 去噪器。我们使用 LoRA [14] 从相同的 Wan2.2-I2V-A14B 骨干网络微调所有三个模型(Wan-CoF、Wan-CoFvt 和 Wan-CoFtt),LoRA 仅应用于 DiT 去噪器,而 umT5 文本编码器和 Wan-VAE 保持冻结。在每个 DiT 块中,LoRA 针对注意力投影(q, k, v, o)以及两个 MLP 线性层(ffn.0, ffn.2),秩设置为 32。学习率配置为 2 × 10−5。
A.2 模型变体。
为了将每一点增益归因于数据集本身,我们保持该架构完全不变,并使用 LoRA 在 OpenCoF-17K 上进行微调,得到 Wan-CoF。为了探索推理 Token,我们在 Wan2.2-I2V-A14B 上运行了两个独立的 LoRA 微调实验,一个仅使用 vt,另一个仅使用 tt,分别得到模型 Wan-CoFvt 和 Wan-CoFtt,其中我们设置 Nr = Nt = 16。Wan-CoF 在 OpenCoF-17K 上训练 2 个 epoch,而 Wan-CoFvt 和 Wan-CoFtt 训练 5 个 epoch,以便让额外的推理 Token 参数有更多的更新以收敛。
A.3 对比系统。
我们将 Wan-CoF 与闭源和开源视频生成模型进行比较。闭源集合包括最先进的系统,如 Kling-v1 [19]、Seedance 系列 [33] Seedance-1.0-Pro 和 Seedance-1.5、Veo-3 [9] 系列 Veo-3.0-Fast、Veo-3.0-Preview、Veo-3.0 和 Veo-3.1,以及 Sora-2 [28]。开源集合包括 HunyuanVideo-I2V [18] 和 HunyuanVideo-1.5 [45]。
A.4 评估协议。
我们在四个视频推理基准上评估我们的模型:MME-CoF [10]、RULER-Bench [12]、VIPER [22] 和 Gen-ViRe [23]。这些基准共同涵盖了远超 OpenCoF-17K 中 11 种任务类型的推理类别。具体针对 RULER-Bench,我们将评估限制在图像到视频的情况,因为我们的基线不支持文本到视频生成。对于每个基准,我们都遵循其官方评判模型。
B 其他消融实验
推理 Token 数量消融。第 4 节中的探索固定 Nr = Nt = 16。为了检查更大的 Token 预算是否改变我们的结论,我们在其他条件不变的情况下,使用 n = 32 重新训练 Wan-CoFvt 和 Wan-CoFtt。
18
第 19 页
表 6 推理 Token 数量的消融实验。针对 vt 和 tt 在 $n \in \{16, 32\}$ 情况下,所有四个基准测试的主要指标;Wan-CoF 作为参考包含在内。RULER Overall 是 RULER-Bench 上的总体得分,由四个评分维度(指令遵循、视觉一致性、视觉保真度和规则连贯性)的平均值计算得出。粗体标记表示每个 $n=16 / n=32$ 配对中更好的值。
| | MME-CoF | Gen-ViRe | VIPER | RULER-Bench | | :— | :—: | :—: | :—: | :—: | | Model | | | | Overall | | | | | | Avg. | POC↑ | Overall | | Wan-CoF | 1.30 | 0.391 | 7.5 | 56.8 | | Wan-CoF$_{vt}$ ($n=16$) | 1.34 | 0.441 | 8.2 | 59.6 | | Wan-CoF$_{vt}$ ($n=32$) | 1.28 | 0.416 | 8.9 | 58.5 | | Wan-CoF$_{tt}$ ($n=16$) | 1.35 | 0.406 | 8.8 | 58.4 | | Wan-CoF$_{tt}$ ($n=32$) | 1.34 | 0.412 | 6.8 | 57.7 |
在相同的设置下,报告了表 6 中每个基准测试的主要指标。将 Token 数量翻倍并未为任一变体带来一致的改进:每个基准测试的表现方向各不相同,这表明推理 Token 并不充当随 $n$ 线性扩展的通用容量。在基准测试层面,对于 vt 和 tt,在四个基准测试中有三个基准测试中 $n = 16$ 优于 $n = 32$,而在每种情况下 $n = 32$ 仅在单个基准测试中领先。结合 $n = 32$ 也使推理 Token 参数大致翻倍的事实,我们在正文中将 $n = 16$ 保持为默认值。
19