视频生成也能推理?OpenCoF用17K数据与推理Token破解长程逻辑难题

OpenCoF-17K数据集

现有视频生成模型缺乏针对Chain-of-Frame推理的专用训练信号,导致长程连贯性不足。本文提出OpenCoF框架,构建OpenCoF-17K数据集并在Wan2.2基座上微调得到Wan-CoF。实验显示,在MME-CoF、Gen-ViRe等基准上性能显著提升。进一步引入Visual/Textual Reasoning Tokens,通过注意力机制显式捕捉推理线索。需注意,高视觉真实感不等同于可靠推理,且Token效果依赖任务特性。