危机视频检测的锚点困境:RA-Bench如何揭示AI生成视频检测器的真实失效

快速导读:提出RA-Bench基准,以真实危机事件视频为锚点系统评估AI生成视频检测器、生成器与社会传播条件下的检测可靠性。

本文提出RA-Bench,一个以真实危机事件视频为锚点的AI生成视频检测基准。与以往聚焦通用内容的基准不同,RA-Bench从战争、灾害、社会冲突等真实事件中收集675个源视频,经场景分割与两轮人工审核得到1830个真实锚点片段,再以首帧条件I2V方式生成16056个对应生成片段,总计17886个视频。

核心发现是:现有检测器在RA-Bench上表现远低于其公开参考成绩,传统检测器均值AUC从67.6–98.6%降至43.9–57.3%,零样本多模态模型与微调MLLM同样面临跨源不稳定、提示敏感与协议依赖等问题。更严峻的是,人类无法识别的生成视频子集上所有检测器接近随机水平,而社会传播模拟可使微调检测器的生成视频召回率降至接近零。

英文题目:Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

论文出处:arXiv 每日论文精选 · arXiv:2608.14391

原始论文:PDF / 论文页面

这篇论文解决什么问题?

AI生成视频的逼真度已足以伪造危机事件画面,例如火箭发射、街头冲突或灾害现场。这类虚假内容一旦在社交媒体传播,可能引发恐慌、误导舆论甚至干扰应急响应。然而,现有检测基准如GVF、GenVideo、AIGVDBench主要评估通用视频,缺乏对真实事件锚定场景的系统覆盖。

真实危机视频与通用视频存在本质差异:前者往往画质参差、拍摄条件恶劣、内容高度情境化,而生成模型在首帧条件I2V模式下可以继承真实画面的场景布局与光照,仅合成后续运动,这使得检测难度显著提升。

此外,现有基准很少同时考察人类感知与社会传播两个环节。人类评审可能将高质量生成视频误判为真实,而平台转码、降采样、添加新闻徽标等操作会进一步破坏检测器依赖的细微伪影。RA-Bench正是针对这三个缺口设计。

核心创新

  • 首个以真实危机事件视频为锚点的AI生成视频检测基准RA-Bench(17886个视频,10个社会风险类别)
  • 引入RA-Bench-HumanProof:由5位评审员全部判为真实的633个生成视频构成的欺骗挑战集
  • 引入RA-Bench-LastMile:模拟转码、降采样、降帧率、新闻徽标等社会传播操作的检测鲁棒性评估
  • 系统揭示三类检测器家族的失效模式:传统检测器排名不迁移、零样本模型提示敏感、微调MLLM时间戳协议依赖

方法概览

构建RA-Bench:收集675个真实危机事件源视频,分割为5774个场景片段,经两轮人工审核与后处理得到1830个真实锚点片段;以首帧条件I2V方式,用4个开源和5个闭源生成器生成16056个生成片段;评估7个传统检测器、10个零样本多模态模型和2个微调MLLM,并分析生成质量、条件信息、采样种子、人类判断与社会传播的影响。

  • 数据构建:从公开来源收集675个真实危机事件视频,覆盖10个L1社会风险类别,经场景分割得到5774个片段,再经近重复筛选、两轮人工审核与发布导向后处理,最终保留1830个真实锚点片段。
  • 生成配对:每个锚点以其首帧为条件,通过4个开源生成器(含Wan2.2、LTX等)和5个闭源API生成器进行I2V生成,共获得16056个生成片段,形成真实-生成配对评估集。
  • 检测器评估:覆盖三个家族——7个传统检测器(基于AUC与T@5%)、10个零样本多模态模型(Binary/Diagnostic/Rating三种提示)、2个微调MLLM(Skyra-SFT/Skyra-RL与BusterX++)。
  • 人类研究:Stage 1由3位评审员对视频进行真实/生成判断,Stage 2由2位评审员复核,据此构建RA-Bench-HumanProof子集,包含633个所有评审员均判为真实的生成视频。
  • 社会传播模拟:RA-Bench-LastMile引入VP9-to-H.264转码、0.5倍空间降采样、8fps降帧率、合成新闻徽标四种操作及其组合,评估检测器在传播链末端的鲁棒性。
  • 条件与质量分析:对比T2V、首帧I2V、首末帧I2V三种生成条件,并利用VBench++评估器分析Condition Fidelity等质量维度与可检测性的关联。
  • 采样策略消融:在固定8帧预算下对比Uniform-8与Global–Local-8两种时间采样策略对稀疏帧检测器的影响。
  • 种子稳定性验证:在种子0、42、123下重复生成与检测,确认结果稳定性。

逐图理解论文

直觉失效案例

直觉失效案例
Figure 4 | A real anchor and its generated counterpart for a representative RA-Bench crisis event. The top filmstrip shows the real space-launch anchor, and the bottom shows the generated video, each represented by six uniformly sampled frames (f0–f5). The red dashed box marks the shared first frame used to condition the generator. The generated video continues from this frame, preserving much of the scene layout, capture style, and lighting while synthesizing new motion as the rocket leaves the pad. This example uses the dynamic-duration Wan2.2 setting. Additional examples across crisis categories and generators are provided in Figures 12 and 13.

火箭发射锚点与其生成对应物的六帧对比,红色虚线框标记共享首帧,生成视频保留了场景布局与光照但合成新运动,直观展示I2V条件下的检测难点。

研究缺口

研究缺口
Figure 2 | Overview of the five-stage RA-Bench construction pipeline. We collect public videos from real-world crises and other socially consequential events, segment them into scene-level clips and screen near-duplicates, conduct two-round manual review, and apply release-oriented postprocessing to form the real anchor set. Each retained anchor is then paired with image-to-video (I2V) generated counterparts using first-frame conditioning and a shared prompting pipeline.

五阶段构建管线图展示从源视频收集到生成配对的完整流程,重点观察两轮人工审核与发布导向后处理如何保证锚点质量。

论文贡献与测试方式

论文贡献与测试方式
Table 2 reports results for seven traditional detectors across the nine RA-Bench generation sources and the fixed-duration Wan2.2 control. For context, the public-reference column reports AIGVDBench LTX-I2V results for six detectors (Ma et al., 2026) and the VidProM result for ReStraV (Internò et al., 2025); these AUCs range from 67.6% to 98.6%. On RA-Bench, the seven-detector mean falls to 50.9–57.3% across the open-source generators and 43.9–54.0% across the closed-source generators. For 26 of the 63 detector–source pairs, AUC is below 50%, indicating that generated videos receive lower fake scores than real anchors in the same paired evaluation subset more often than the reverse.

传统检测器在9个生成源上的AUC与T@5%,公共参考列与RA-Bench结果的巨大落差是核心证据,26/63对低于50%表明检测器在真实危机场景下失效。

最强结论

最强结论
Figure 11 | Detection under the RA-Bench-LastMile social dissemination simulation. Original retains the standardized clips; T1 denotes VP9-to-H.264 transcoding, T2 denotes 0.5× spatial down- sampling, T3 denotes conversion to 8 fps, and T4 denotes a synthetic news badge. T1+T2, T1+T3, and T1+T4 isolate each added operation, while Full combines T1–T4. (a–b) Mean AUC and T@5% over the seven traditional detectors. (c–d) BAcc and FakeR for the fine-tuned MLLM detectors. Gray extensions show the loss from each configuration’s Original result, hatched bars denote frame-index prompts, and the red dashed line gives the mean over the five fine-tuned configurations. Results are equal-source means over the nine RA-Bench generators.

LastMile传播模拟下检测性能的阶梯式下降,Full条件使微调检测器FakeR降至1.4%,社会传播是检测的最后一道致命关卡。

实验如何设计?

  • 传统检测器在9个生成源(4开源+5闭源)上的配对AUC与T@5%评估,公共参考列为AIGVDBench LTX-I2V与VidProM结果,仅作上下文参考。
  • 零样本多模态模型在Binary、Diagnostic、Rating三种提示模板下的BAcc、macro-F1与AUC评估,覆盖Qwen3.5系列与Gemini-3.1-Pro-Preview等模型。
  • 微调MLLM评估中,Skyra分别使用官方时间戳提示与帧索引提示,BusterX++使用其发布管线,报告BAcc、FakeR与RealR。
  • Wan2.2条件消融在相同1830个锚点派生提示、种子0下对比T2V、首帧I2V、首末帧I2V。
  • RA-Bench-HumanProof上评估所有检测器,并按HumanProof源比例加权报告全基准结果。
  • RA-Bench-LastMile在Original与各传播操作组合下评估传统检测器与微调MLLM。

关键结果与论文证据

  • 传统检测器排名不迁移:公共参考AUC 67.6–98.6%降至RA-Bench源级均值43.9–57.3%,26/63个检测器-源对AUC低于50%,即生成视频得分低于真实锚点(第9页)。
  • 零样本模型提示敏感:Gemini-3.1-Pro-Preview在Binary下BAcc 63.4%为最强,但跨源范围54.3–74.5%,无模型同时具备强整体性能与跨提示、跨源稳定性(第12页)。
  • 微调MLLM协议依赖:将Skyra官方时间戳替换为帧索引后,均值BAcc降至54.4–54.9%,表明其部分性能来自时间戳与类别标签相关的协议先验(第14页)。
  • BusterX++弃权严重:FakeR仅4.1–9.1%,弃权计为错误可能低估其实际能力,但即便考虑此因素,其有效识别率仍远低于预期(第14页)。
  • 条件保真度与可检测性负相关:Condition Fidelity四分位增加关联Gemini Diagnostic FakeR下降14.4个百分点,生成质量越高越难检测(第16页)。
  • I2V条件改变检测格局:T2V→首帧I2V使7个传统检测器均值AUC从33.4%升至50.9%,但微调MLLM均值FakeR从70.5%降至42.7%,两类检测器对条件变化的响应方向相反(第17页)。
  • 人类识别能力有限:开源生成视频68.6%被判为生成,闭源仅52.9%,Seedance2.0和Kling分别降至40.7%和45.1%,人类对闭源生成内容几乎无法识别(第20页)。
  • HumanProof上检测器接近随机:Gemini Binary/Diagnostic BAcc仅54.7%/54.5%,7个传统检测器均值AUC 47.5%,人类无法识别的视频同样难倒机器(第21页)。
  • 社会传播使检测失效:LastMile Full条件使5个微调配置均值FakeR从46.0%降至1.4%,检测能力几乎完全丧失(第23页)。

阅读时需要注意

  • 闭源生成器因内容安全过滤导致配对子集不完整,可能引入选择偏差。
  • 质量-可检测性分析为关联性而非因果推断,无法确定质量提升直接导致检测困难。
  • 人类评审规模有限,Stage 1每视频3人、Stage 2每视频2人,可能低估人类识别的个体差异。
  • 社会传播模拟仅覆盖4种操作,未穷尽真实平台处理链,如压缩算法变体、水印叠加等。

关联工作

  • GVF(Ma et al., 2025)是早期AI生成视频检测基准,但无真实事件锚定,无法反映危机场景的特殊性。
  • GenVideo(Chen et al., 2024)提供配对真实与生成视频的跨生成器迁移评估,但未覆盖社会风险分类与传播模拟。
  • AIGVDBench(Ma et al., 2026)为本文传统检测器提供公共参考AUC,但其域与RA-Bench不同,不可直接对比。
  • Chameleon(Liao et al., 2026)部分覆盖真实事件与I2V条件生成,但仅含孤立传播操作,缺乏系统组合模拟。
  • VBench++(Huang et al., 2025)提供I2V质量评估器,用于本文质量-可检测性关联分析。

发表评论