SPARED:让检测器与伪造者互相训练,能否打破AI图像检测的三大捷径?

快速导读:SPARED的核心判断是:来源捷径、模板化解释和静态决策边界,这三个问题看似独立,其实都源于同一个根源——训练数据的构造方式。如果真实图和假图来自不同渠道,检测器就学会分辨渠道;如果解释语料是模板生成的,检测器就学会背模板;如果训练集固定不变,检测器的边界就静止不动。所以关键不是换更大的模型,而是换一种造数据的方式。

AI生成图像检测领域长期存在一个根本性困境:检测器训练一次后便成为静止目标,而生成模型持续进化,任何静态语料库训练出的决策边界都会迅速过时。SPARED针对这一问题提出了一种对抗式自训练框架,让一个扩散图像编辑器充当攻击者,持续伪造越来越难以识别的假图,同时让一个推理式多模态大语言模型检测器在每一轮对抗后重新训练,形成攻防交替的进化循环。

论文的核心论点是:检测器的三大失效模式——来源捷径、模板化解释和静态决策边界——并非独立问题,而是同一根源的不同表现,即训练数据的构造方式本身存在缺陷。SPARED通过三道'捷径锁'从数据层面同时封堵这三条退路,使检测器被迫学习真正与伪造痕迹相关的判别特征。

英文题目:SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

论文出处:arXiv 每日论文精选 · arXiv:2608.12876

原始论文:PDF / 论文页面

这篇论文解决什么问题?

第一代AIGI检测器依赖信号或频域特征,如噪声模式、压缩伪影等,但这类特征高度依赖特定生成器的架构,跨生成器泛化能力极差。第二代方法转向CLIP或多模态大语言模型微调,虽然提升了泛化性,却继承了训练数据中的来源偏差——当真实图像和生成图像来自不同采集渠道时,检测器学会的是区分数据来源而非识别伪造痕迹本身。

第三代方法引入推理式MLLM,要求模型不仅给出判定还要输出解释。然而监督微调阶段使用的解释语料库往往由模板生成,导致模型学会的是复述模板化的理由,而非真正理解图像中的语义异常。更关键的是,无论哪一代方法,训练完成后检测器都成为静止目标,攻击者可以针对其弱点定向生成绕过样本。

SPARED的出发点是一个直觉:如果检测器的问题源于训练数据的构造方式,那么解决方案也应该在数据层面。与其让检测器被动适应一个固定的伪造数据集,不如让伪造者主动适应检测器的当前弱点,生成针对性的困难样本。这一思路借鉴了LLM安全领域的攻击者-防御者循环,但将其迁移到视觉伪造检测领域时面临一个独特挑战:攻击者生成的是连续像素空间的图像,而防御者输出的是离散token序列,两者无法共享参数,必须解耦训练。

核心创新

方法概览

SPARED的核心判断是:来源捷径、模板化解释和静态决策边界,这三个问题看似独立,其实都源于同一个根源——训练数据的构造方式。如果真实图和假图来自不同渠道,检测器就学会分辨渠道;如果解释语料是模板生成的,检测器就学会背模板;如果训练集固定不变,检测器的边界就静止不动。所以关键不是换更大的模型,而是换一种造数据的方式。

  • SPARED的核心架构是一个解耦的交替训练循环。攻击者是一个基于扩散模型的图像编辑器,接收真实照片和编辑指令,生成伪造版本;防御者是一个推理式MLLM(Qwen3.5-9B),接收图像并输出判定和推理过程。两者交替训练,每一轮中一方冻结、另一方更新。
  • 第一道锁针对防御者的解释可游戏性问题。防御者使用verdict-only GRPO训练,即只有判定正确性获得奖励,解释内容不参与奖励计算。这意味着模型无法通过输出花哨但空洞的解释来获得高分,解释质量成为准确率的涌现副产品,而非独立优化的目标。
  • 第二道锁针对攻击者的退化胜利问题。攻击者的奖励由两部分组成:必须成功欺骗冻结的防御者,同时必须忠实执行编辑指令。指令保真度由PaCo评分器门控,如果攻击者只是生成一张与指令无关的假图来欺骗防御者,将无法获得奖励。这防止了攻击者找到'不编辑也能骗过检测器'的捷径。
  • 第三道锁针对来源捷径问题。攻击者从固定的真实照片集出发,对每张照片执行编辑指令,生成配对数据——同一张照片的编辑前后版本构成一对。检测器在训练时同时看到配对的两半,因此无法利用'真实图像来自数据集A、假图来自数据集B'这类来源差异进行分类,只能关注编辑本身引入的伪造痕迹。
  • 攻击者的训练使用DiffusionNFT在线扩散强化学习算法,在每一轮中从源照片和编辑指令出发采样一组候选编辑,只有通过PaCo门控且成功欺骗防御者的样本获得奖励。训练完成后,攻击者对固定的真实照片集重新编辑,生成新一轮的配对训练池。
  • 防御者的训练使用GRPO,在配对池上采样响应,仅以判定正确性为奖励信号。训练后的防御者被冻结,成为下一轮攻击者的裁判。整个循环重复三轮,每一轮的训练池都比上一轮更难,检测器的决策边界随之持续扩展。

逐图理解论文

一个具体失败案例

一个具体失败案例
Figure 1: (a) A detector trained once on a static corpus is a sta- tionary target for generators that keep moving. (b) SPARED instead trains an image-editing attacker against a reasoning detector in alternation: each round, the attacker forges harder paired fakes and the retrained detector becomes a stronger judge. (c) The same 9B backbone, trained in this loop, im- proves round over round on three external benchmarks; the SFT dip trades accuracy for the reasoning output format, which the adversarial rounds more than recover.

图1的三联图对比了静态训练与对抗循环的本质差异:静态检测器是静止靶子,而SPARED的检测器随攻击者进化而移动。注意(c)中SFT阶段的准确率下降——这是为推理格式付出的代价,随后被对抗轮次超额补偿。

研究空白:三道捷径锁

研究空白:三道捷径锁
Figure 2: Overview of SPARED: one adversarial round, read left to right. Attacker training: from one source photograph and its edit instruction the attacker samples a group of candidate edits, and the gated reward credits a rollout only when the instruction was faithfully executed and the result fools the frozen defender, so fooling without editing earns nothing (lock 2). Pool regeneration: the trained attacker re-edits a fixed set of real photographs into pairs whose two halves differ only by the edit (lock 3); the pair shown is an actual training pair. Defender training: both halves of a pair are supervised, and among the sampled responses only verdict correctness is rewarded, so explanations cannot be gamed (lock 1). The retrained defender’s frozen snapshot becomes the judge for round t+1.

图2展示了一个完整对抗轮次的数据流:攻击者训练、池重建、防御者训练三个阶段从左到右排列。重点观察三道锁的位置——PaCo门控在攻击者奖励中,配对结构在池重建中,verdict-only在防御者奖励中。

最强证据

最强证据
Figure 3: (a, b) Per-generator accuracy and AP on Holmes-Set across training stages, with axes ordered by final-round accuracy: each adversarial round expands the accuracy polygon, and the final round’s AP stays above 92 on every family. (c) DeepfakeJudge- Detect accuracy on the two fake subsets: the gain concentrates in the locally edited subset.

图3的雷达图展示了Holmes-Set上逐轮扩展的准确率多边形,每一轮对抗都向外扩张。注意(c)中收益集中在局部编辑子集,说明对抗训练精准打击了最薄弱的环节。

实验如何设计?

  • 主评估在DeepfakeJudge-Detect上进行,这是一个法官式检测基准,混合了文本生成图像和局部编辑伪造图像,要求模型输出判定和推理。无效或无法解析的回答计为错误。
  • 零样本语义异常推理评估使用AnomReason-Deepfake,该基准要求模型识别图像中的语义异常并给出解释,解释质量通过CSemAP指标评分,该指标同时考虑分类准确率和语义匹配度。
  • 零样本迁移评估使用Holmes-Set,包含十个完全未见过的生成器家族,测试检测器在全新伪造来源上的泛化能力。
  • 消融实验对比了五种变体:静态池继续GRPO、新鲜源冻结攻击者、移除PaCo门控、非配对真实图像、完整对抗调度,所有变体从同一Iter1模型出发。

关键结果与论文证据

  • {'point': '在DeepfakeJudge-Detect上,SPARED的Iter3模型达到79.5的整体准确率,超过SFT基线的69.6,并超过Qwen3-VL-235B的74.5,仅次于26倍大的Qwen3-VL-235B-Thinking(82.7)。', 'page': 5}(第 5 页)
  • {'point': '局部编辑子集的准确率从44.8提升到82.5,说明对抗训练的主要收益集中在最困难的局部伪造场景。', 'page': 5}(第 5 页)
  • {'point': '在AnomReason-Deepfake上,SPARED以92.18的准确率和0.5207的CSemAP实现零样本超越GPT-4o(87.76)和UniGenDet(88.59),CSemAP相对最强基线提升23%。', 'page': 5}(第 5 页)
  • {'point': 'Holmes-Set零样本平均准确率从基线的53.0经SFT的65.7提升到Iter1的84.5和Iter3的92.8,每一轮对抗都带来显著增益。', 'page': 6}(第 6 页)
  • {'point': '静态池继续GRPO仅捕获对抗分支所贡献7.4个点中的2.2个,证明持续对抗训练的价值远超在同一数据池上的重复训练。', 'page': 6}(第 6 页)
  • {'point': '移除PaCo门控后,攻击者轮次的表现跌至起点以下(66.7对Iter1的72.1),证明指令保真度门控是防止攻击者退化的关键机制。', 'page': 6}(第 6 页)
  • {'point': '非配对真实图像的对抗轮次仅带来1.1个点的提升,而配对轮次带来3.9个点,验证了严格配对在消除来源捷径中的核心作用。', 'page': 6}(第 6 页)
  • {'point': 'Janus家族出现从86.5到73.1的孤立回归,而其他所有家族均提升,揭示了硬性0/1欺骗奖励缺乏按家族难度控制的问题。', 'page': 6}(第 6 页)

阅读时需要注意

  • 硬性0/1欺骗奖励缺乏按生成器家族难度的精细控制,导致Janus家族在Iter3出现显著回归(86.5→73.1),尽管加入域内数据后可恢复到84.3。
  • 在DeepfakeJudge-Detect上仍落后于Qwen3-VL-235B-Thinking(79.5对82.7),后者参数量是SPARED的26倍,说明规模仍是推理能力的硬约束。
  • Holmes-Set已接近饱和,五个检测器超过95分,限制了该基准对未来改进的判别力。

关联工作

  • MAGIC(Wen et al. 2026)在LLM安全领域提出了协同进化的攻击者-防御者对抗游戏,SPARED将其解耦异构自博弈原则扩展到视觉伪造检测。
  • SecTOW(Dai et al. 2025)是SPARED的直接前驱,提出了多模态安全的迭代防御-攻击RL训练框架。
  • Aigi-Holmes(Zhou et al. 2025)提供了可解释MLLM检测的Holmes-Set基准,SPARED用它评估零样本迁移。
  • UniGenDet(Zhang et al. 2026)在Holmes-Set上表现强劲,但在DeepfakeJudge-Detect上几乎完全偏向假图(真实召回率0.0),暴露了统一生成-判别框架的平衡性问题。

发表评论