快速导读:提出VideoArgus框架与VideoArgus-Bench基准,通过为每个输入实例生成可复用的、输出盲态的样本特定评分细则,并结合VLM问答与专用视觉工具,实现对五种视频生成与编辑任务的统一、证据驱动的细粒度评估。
现代视频生成模型已能支持文本到视频(T2V)、文本和图像到视频(TI2V)、文本和主体到视频(TS2V)、文本驱动的视频编辑(TV2V)以及文本和主体驱动的视频编辑(TSV2V)等多种任务。然而,评估这些异构的生成与编辑设置一直缺乏统一的协议。现有基准如VBench、EvalCrafter等通常为特定任务设计,使用所有输入共享的预定义评估维度,难以捕捉实例相关的细粒度要求——例如,计数准确性、可见文本正确性、主体身份保持等需求高度依赖于具体输入。
VideoArgus针对这一研究缺口,提出了一个智能体式、基于评分细则的统一评估框架。其核心思想是:为每个输入实例生成一份输出盲态的、样本特定的评分细则,该细则定义具体标准、评分规则、失败模式和证据计划,然后被冻结并为所有候选视频复用。评估阶段则按细则执行证据计划,选择性调用VLM问答及跟踪、视觉相似度、OCR、深度分析等专用工具,收集证据后产生标准级分数与理由,最终通过重要性加权和硬性标准上限聚合得到总分和诊断报告。
英文题目:VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing
论文出处:arXiv 每日论文精选 · arXiv:2608.05485
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有视频评估基准存在三个主要局限。第一,评估内容固定:VBench、EvalCrafter、VBench-I2V等基准使用预定义的评估维度,无法针对每个输入实例的具体要求进行调整。例如,一个要求“三只猫”的提示与一个要求“一只狗”的提示,其计数准确性的重要性完全不同,但固定维度无法体现这种差异。
第二,任务覆盖碎片化:T2V、TI2V、TS2V、TV2V、TSV2V等任务各有专门的基准,如OpenS2V-Nexus针对TS2V、OpenVE-Bench针对TV2V、EditVerseBench覆盖TV2V和TSV2V。这种碎片化使得跨任务的模型比较变得困难,也无法为多任务模型提供统一的评估视角。
第三,评分证据有限:多数基准仅输出一个总体分数或少数维度的分数,缺乏对失败原因的定位能力。评估者无法知道一个低分是因为主体丢失、文本渲染错误还是运动不自然,这使得评估结果难以指导模型改进。
近期工作如UniVBench尝试统一评估多个视频任务,部分支持自适应评估;VideoGen-Eval则采用基于智能体的方法,使用输入衍生问题进行评估。然而,VideoArgus在标准级评分和结构化证据计划上更为细粒度,其评分细则生成与评估流程的分离设计也提供了更高的模块化和可替换性。
核心创新
- 提出输出盲态的、样本特定的评分细则生成机制,为每个输入实例一次性构建可复用的评估规范,包含独立评分的标准、显式评分规则和证据计划。
- 提出基于评分细则的视频评估流程,选择性执行标准特定的视觉工具,产生证据驱动的分数、理由和诊断报告,且细则生成与评估VLM骨干可独立替换。
- 构建VideoArgus-Bench统一基准,包含1026个覆盖五种任务的输入实例,所有评分细则预生成并冻结,支持可复现的模型比较。
方法概览
VideoArgus框架包含两个阶段:1) 输入侧评分细则生成器仅观察输入实例,构建一个输出盲态的、样本特定的评分细则,定义具体标准、评分规则、失败模式和证据计划,该细则被冻结并为所有候选视频复用;2) 视频评估阶段,针对每个标准执行其证据计划,选择性调用VLM问答及跟踪、视觉相似度、OCR、深度分析等专用工具,收集证据后产生标准级分数与理由,最后通过重要性加权和硬性标准上限聚合得到总分和诊断报告。
- 输入侧评分细则生成器:仅观察输入实例(文本提示及可选的图像、主体或视频条件),构建一份输出盲态的评分细则。该细则包含多个独立评分的标准,每个标准配有显式的评分规则(如0-4分量表)、预期失败模式和证据计划。证据计划指定了为评估该标准需要调用的工具序列,如VLM QA、跟踪器、OCR等。细则生成后即被冻结,为所有从同一输入生成的候选视频复用。
- 标准级视频评估:对每个候选视频,VideoArgus按细则中的每个标准执行其证据计划。首先选择性调用VLM问答进行初步判断,然后根据需要调用专用视觉工具——包括跟踪器(验证主体运动一致性)、视觉相似度(度量主体或场景保持)、OCR(检查可见文本)、深度分析(评估空间结构)和感知质量评估。收集到的证据被整合,产生该标准的分数和自然语言理由。
- 硬性标准机制:细则中的部分标准被标记为“硬性标准”。当候选视频在硬性标准上失败时,其总分将被限制在一个上限以下,无论其他标准表现如何。这确保了关键要求(如主体身份保持)的不可妥协性。
- 重要性加权聚合:所有标准分数按其预设的重要性权重(高、中、低)进行加权求和,并结合硬性标准上限,产生最终总分。同时生成一份诊断报告,汇总各标准的分数、理由和证据轨迹。
- 模块化设计:评分细则生成器和评估VLM骨干可独立替换。细则生成可使用Claude Opus 4.8、GPT 5.6 Sol或Gemini 3.1 Pro等大型API模型;评估VLM可使用Qwen3.6-27B或Gemma4-31B等本地模型。这种分离设计允许根据成本和性能需求灵活配置。
- VideoArgus-Bench基准构建:收集了1026个输入实例,覆盖T2V(300个)、TI2V(200个)、TS2V(200个)、TV2V(176个)和TSV2V(150个)五种任务。所有实例的评分细则已预生成并冻结,确保评估的可复现性。基准还包含对55个模型-任务对的评估结果,形成排行榜。
逐图理解论文
失败案例与直觉

图2详细说明了VideoArgus的两阶段评估流程。输入侧评分细则生成器仅观察输入实例,构建输出盲态的评分细则;视频评估阶段则按细则执行证据计划,调用VLM QA和专用工具,产生标准级分数与理由,最终聚合为总分和诊断报告。该图是理解方法核心机制的关键。
核心证据与结论

表3报告了VideoArgus与人类判断的相关性。VideoArgus-Full在所有五个任务上的Spearman和Kendall相关性均高于基准特定评估器,尤其在T2V和TI2V上提升显著。该表是验证方法有效性的核心证据。
意义与局限

表7报告了评分细则生成的token消耗和API成本。使用Claude Opus 4.8的平均一次性成本为每实例0.231美元,为实际部署提供了成本参考。
实验如何设计?
- 在VideoArgus-Bench上对55个模型-任务对进行基准测试,生成各任务的排行榜(Table 2, p.5)。
- 在独立的1260视频人类对齐集上,与各任务对应的基准特定评估器进行人类判断相关性比较。每任务使用48-56个输入实例,15名标注者进行判断(Table 3, p.7)。
- 通过工具消融实验分析专用视觉工具对评估性能的贡献,比较VideoArgus-Full与仅使用VLM QA的VideoArgus-VLM(Table 3, p.7)。
- 分析不同评分细则生成VLM(Claude Opus 4.8、GPT 5.6 Sol、Gemini 3.1 Pro)对模型排名一致性的影响(Table 5, p.7-8)。
- 分析不同评估VLM骨干(Qwen3.6-27B、Gemma4-31B)对模型排名一致性的影响(Table 6, p.8)。
- 分析评分细则生成的一次性API成本和视频评估的本地计算成本(Table 7, p.8)。
关键结果与论文证据
- VideoArgus-Full在所有五个任务上的within-input Spearman和Kendall排名相关性均高于对应的基准特定评估器,尤其在T2V和TI2V上提升显著,表明样本特定、标准级评估更接近人类偏好(Table 3, p.7)。
- 生成的评分细则平均每个实例包含11.9条标准,是人类编写细则(4.98条)的2.33倍,同时硬性标准数量相当(2.09 vs. 2.27),说明自动生成的细则更全面但不失关键约束(Table 4, p.7)。
- 工具消融显示,VideoArgus-Full相比仅使用VLM QA的VideoArgus-VLM在多数任务上提升了人类相关性,验证了专用视觉工具的证据价值(Table 3, p.7)。
- 固定评估VLM时,更换评分细则生成器得到的平均任务宏排名相似度为0.909;固定生成细则时,更换评估VLM得到的平均相似度为0.931。高相关性表明模型排名在不同骨干选择下保持稳定(Table 5, 6, p.8)。
- 使用Claude Opus 4.8生成评分细则的平均一次性成本为每实例0.231美元,评估单个生成视频平均需要0.033个Nvidia H100 GPU小时(Table 7, p.8)。
- 排行榜显示Seedance 2.0在所有五个任务上取得最高分,Veo 3.1在T2V上排名第二,Kling v3 Omni在其余四个任务上排名第二。开源模型中,HunyuanVideo-1.5在T2V和TI2V上表现最强(Table 2, p.5)。
阅读时需要注意
- 评分细则生成依赖大型API模型,产生一次性成本(每实例约0.231美元),可能限制大规模部署。
- 评估流程依赖本地VLM和专用工具,对计算资源有一定要求(每视频约0.033 H100 GPU小时)。
- 人类对齐实验的样本量(每任务48-56个输入)可能限制统计效力,更大规模的人类研究可进一步验证结论。
- 排行榜结果仅反映在VideoArgus-Bench特定评估协议下的相对性能,不代表在所有场景下的泛化能力。
关联工作
- VBench和EvalCrafter是早期T2V基准,使用固定评估维度和内容,与VideoArgus的输入衍生、样本特定评估形成对比。
- VBench-I2V、OpenS2V-Nexus、OpenVE-Bench和EditVerseBench分别是TI2V、TS2V、TV2V和TV2V/TSV2V的任务特定基准,均使用固定评估维度。
- UniVBench是统一评估多个视频任务的近期工作,部分支持自适应评估,但VideoArgus在标准级评分和证据计划上更细粒度。
- VideoGen-Eval采用基于智能体的视频生成评估系统,使用输入衍生问题,与VideoArgus的样本特定思路相似,但VideoArgus采用结构化评分细则和工具执行。