VideoArgus:为每个视频输入定制评分细则,统一评估生成与编辑

失败案例与直觉

提出VideoArgus框架与VideoArgus-Bench基准,通过为每个输入实例生成可复用的、输出盲态的样本特定评分细则,并结合VLM问答与专用视觉工具,实现对五种视频生成与编辑任务的统一、证据驱动的细粒度评估。