SPARED:让检测器与伪造者互相训练,能否打破AI图像检测的三大捷径?
SPARED的核心判断是:来源捷径、模板化解释和静态决策边界,这三个问题看似独立,其实都源于同一个根源——训练数据的构造方式。如果真实图和假图来自不同渠道,检测器就学会分辨渠道;如果解释语料是模板生成的,检测器就学会背模板;如果训练集固定不变,检测器的边界就静止不动。所以关键不是换更大的模型,而是换一种造数据的方式。
SPARED的核心判断是:来源捷径、模板化解释和静态决策边界,这三个问题看似独立,其实都源于同一个根源——训练数据的构造方式。如果真实图和假图来自不同渠道,检测器就学会分辨渠道;如果解释语料是模板生成的,检测器就学会背模板;如果训练集固定不变,检测器的边界就静止不动。所以关键不是换更大的模型,而是换一种造数据的方式。
提出 Space Tokens 框架,将场景级 3D 几何与物体中心空间属性蒸馏为连续潜在 token,在不增加推理模块的前提下提升 VLM 空间推理能力。
提出HierDoc框架,将长文档证据获取建模为从页面到区域的连续结构化集合预测,通过阶段式GRPO优化页面和区域策略,在多个长文档VQA基准上取得领先性能。