快速导读:提出RA-Bench基准,以真实危机事件视频为锚点系统评估AI生成视频检测器、生成器与社会传播条件下的检测可靠性。
本文提出RA-Bench,一个以真实危机事件视频为锚点的AI生成视频检测基准。与以往聚焦通用内容的基准不同,RA-Bench从战争、灾害、社会冲突等真实事件中收集675个源视频,经场景分割与两轮人工审核得到1830个真实锚点片段,再以首帧条件I2V方式生成16056个对应生成片段,总计17886个视频。
核心发现是:现有检测器在RA-Bench上表现远低于其公开参考成绩,传统检测器均值AUC从67.6–98.6%降至43.9–57.3%,零样本多模态模型与微调MLLM同样面临跨源不稳定、提示敏感与协议依赖等问题。更严峻的是,人类无法识别的生成视频子集上所有检测器接近随机水平,而社会传播模拟可使微调检测器的生成视频召回率降至接近零。
英文题目:Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
论文出处:arXiv 每日论文精选 · arXiv:2608.14391
原始论文:PDF / 论文页面
这篇论文解决什么问题?
AI生成视频的逼真度已足以伪造危机事件画面,例如火箭发射、街头冲突或灾害现场。这类虚假内容一旦在社交媒体传播,可能引发恐慌、误导舆论甚至干扰应急响应。然而,现有检测基准如GVF、GenVideo、AIGVDBench主要评估通用视频,缺乏对真实事件锚定场景的系统覆盖。
真实危机视频与通用视频存在本质差异:前者往往画质参差、拍摄条件恶劣、内容高度情境化,而生成模型在首帧条件I2V模式下可以继承真实画面的场景布局与光照,仅合成后续运动,这使得检测难度显著提升。
此外,现有基准很少同时考察人类感知与社会传播两个环节。人类评审可能将高质量生成视频误判为真实,而平台转码、降采样、添加新闻徽标等操作会进一步破坏检测器依赖的细微伪影。RA-Bench正是针对这三个缺口设计。
核心创新
- 首个以真实危机事件视频为锚点的AI生成视频检测基准RA-Bench(17886个视频,10个社会风险类别)
- 引入RA-Bench-HumanProof:由5位评审员全部判为真实的633个生成视频构成的欺骗挑战集
- 引入RA-Bench-LastMile:模拟转码、降采样、降帧率、新闻徽标等社会传播操作的检测鲁棒性评估
- 系统揭示三类检测器家族的失效模式:传统检测器排名不迁移、零样本模型提示敏感、微调MLLM时间戳协议依赖
方法概览
构建RA-Bench:收集675个真实危机事件源视频,分割为5774个场景片段,经两轮人工审核与后处理得到1830个真实锚点片段;以首帧条件I2V方式,用4个开源和5个闭源生成器生成16056个生成片段;评估7个传统检测器、10个零样本多模态模型和2个微调MLLM,并分析生成质量、条件信息、采样种子、人类判断与社会传播的影响。
- 数据构建:从公开来源收集675个真实危机事件视频,覆盖10个L1社会风险类别,经场景分割得到5774个片段,再经近重复筛选、两轮人工审核与发布导向后处理,最终保留1830个真实锚点片段。
- 生成配对:每个锚点以其首帧为条件,通过4个开源生成器(含Wan2.2、LTX等)和5个闭源API生成器进行I2V生成,共获得16056个生成片段,形成真实-生成配对评估集。
- 检测器评估:覆盖三个家族——7个传统检测器(基于AUC与T@5%)、10个零样本多模态模型(Binary/Diagnostic/Rating三种提示)、2个微调MLLM(Skyra-SFT/Skyra-RL与BusterX++)。
- 人类研究:Stage 1由3位评审员对视频进行真实/生成判断,Stage 2由2位评审员复核,据此构建RA-Bench-HumanProof子集,包含633个所有评审员均判为真实的生成视频。
- 社会传播模拟:RA-Bench-LastMile引入VP9-to-H.264转码、0.5倍空间降采样、8fps降帧率、合成新闻徽标四种操作及其组合,评估检测器在传播链末端的鲁棒性。
- 条件与质量分析:对比T2V、首帧I2V、首末帧I2V三种生成条件,并利用VBench++评估器分析Condition Fidelity等质量维度与可检测性的关联。
- 采样策略消融:在固定8帧预算下对比Uniform-8与Global–Local-8两种时间采样策略对稀疏帧检测器的影响。
- 种子稳定性验证:在种子0、42、123下重复生成与检测,确认结果稳定性。
逐图理解论文
直觉失效案例

火箭发射锚点与其生成对应物的六帧对比,红色虚线框标记共享首帧,生成视频保留了场景布局与光照但合成新运动,直观展示I2V条件下的检测难点。
研究缺口

五阶段构建管线图展示从源视频收集到生成配对的完整流程,重点观察两轮人工审核与发布导向后处理如何保证锚点质量。
论文贡献与测试方式

传统检测器在9个生成源上的AUC与T@5%,公共参考列与RA-Bench结果的巨大落差是核心证据,26/63对低于50%表明检测器在真实危机场景下失效。
最强结论

LastMile传播模拟下检测性能的阶梯式下降,Full条件使微调检测器FakeR降至1.4%,社会传播是检测的最后一道致命关卡。
实验如何设计?
- 传统检测器在9个生成源(4开源+5闭源)上的配对AUC与T@5%评估,公共参考列为AIGVDBench LTX-I2V与VidProM结果,仅作上下文参考。
- 零样本多模态模型在Binary、Diagnostic、Rating三种提示模板下的BAcc、macro-F1与AUC评估,覆盖Qwen3.5系列与Gemini-3.1-Pro-Preview等模型。
- 微调MLLM评估中,Skyra分别使用官方时间戳提示与帧索引提示,BusterX++使用其发布管线,报告BAcc、FakeR与RealR。
- Wan2.2条件消融在相同1830个锚点派生提示、种子0下对比T2V、首帧I2V、首末帧I2V。
- RA-Bench-HumanProof上评估所有检测器,并按HumanProof源比例加权报告全基准结果。
- RA-Bench-LastMile在Original与各传播操作组合下评估传统检测器与微调MLLM。
关键结果与论文证据
- 传统检测器排名不迁移:公共参考AUC 67.6–98.6%降至RA-Bench源级均值43.9–57.3%,26/63个检测器-源对AUC低于50%,即生成视频得分低于真实锚点(第9页)。
- 零样本模型提示敏感:Gemini-3.1-Pro-Preview在Binary下BAcc 63.4%为最强,但跨源范围54.3–74.5%,无模型同时具备强整体性能与跨提示、跨源稳定性(第12页)。
- 微调MLLM协议依赖:将Skyra官方时间戳替换为帧索引后,均值BAcc降至54.4–54.9%,表明其部分性能来自时间戳与类别标签相关的协议先验(第14页)。
- BusterX++弃权严重:FakeR仅4.1–9.1%,弃权计为错误可能低估其实际能力,但即便考虑此因素,其有效识别率仍远低于预期(第14页)。
- 条件保真度与可检测性负相关:Condition Fidelity四分位增加关联Gemini Diagnostic FakeR下降14.4个百分点,生成质量越高越难检测(第16页)。
- I2V条件改变检测格局:T2V→首帧I2V使7个传统检测器均值AUC从33.4%升至50.9%,但微调MLLM均值FakeR从70.5%降至42.7%,两类检测器对条件变化的响应方向相反(第17页)。
- 人类识别能力有限:开源生成视频68.6%被判为生成,闭源仅52.9%,Seedance2.0和Kling分别降至40.7%和45.1%,人类对闭源生成内容几乎无法识别(第20页)。
- HumanProof上检测器接近随机:Gemini Binary/Diagnostic BAcc仅54.7%/54.5%,7个传统检测器均值AUC 47.5%,人类无法识别的视频同样难倒机器(第21页)。
- 社会传播使检测失效:LastMile Full条件使5个微调配置均值FakeR从46.0%降至1.4%,检测能力几乎完全丧失(第23页)。
阅读时需要注意
- 闭源生成器因内容安全过滤导致配对子集不完整,可能引入选择偏差。
- 质量-可检测性分析为关联性而非因果推断,无法确定质量提升直接导致检测困难。
- 人类评审规模有限,Stage 1每视频3人、Stage 2每视频2人,可能低估人类识别的个体差异。
- 社会传播模拟仅覆盖4种操作,未穷尽真实平台处理链,如压缩算法变体、水印叠加等。
关联工作
- GVF(Ma et al., 2025)是早期AI生成视频检测基准,但无真实事件锚定,无法反映危机场景的特殊性。
- GenVideo(Chen et al., 2024)提供配对真实与生成视频的跨生成器迁移评估,但未覆盖社会风险分类与传播模拟。
- AIGVDBench(Ma et al., 2026)为本文传统检测器提供公共参考AUC,但其域与RA-Bench不同,不可直接对比。
- Chameleon(Liao et al., 2026)部分覆盖真实事件与I2V条件生成,但仅含孤立传播操作,缺乏系统组合模拟。
- VBench++(Huang et al., 2025)提供I2V质量评估器,用于本文质量-可检测性关联分析。