快速导读:对 ImageNet-1k 验证集进行从零开始的多标签定位重标注(ReImageNet),揭示约 12% 原始标签错误、33.3% 图像为多标签,并证明标注错误会结构性传播至衍生基准。
ImageNet-1k 的 Top-1 准确率至今仍是视觉识别领域最通用的指标,但它的验证集标签来自训练不足的众包工人,单标签假设经常被违反。本文作者对全部 50,000 张验证图像进行了从零开始的多标签定位重标注,发布 ReImageNet 数据集,发现约 12% 的原始标签错误、33.3% 的图像包含多个有效标签、3.8% 的图像根本不含任何有效 ImageNet-1k 类别。
这项工作不只是'再标一遍',而是把 ImageNet-1k 的评估任务从单标签分类重定义为多标签定位:标注员需要为每个'立即可见'的对象绘制边界框,并标注 rendition、reflection、text-recognition、crowd、dominant 五种语义属性。由此得到的 ReGT 标签不仅修正了错误,还暴露了旧基准如何系统性扭曲我们对模型能力的判断。
英文题目:Doomed to Re-Annotate, Forever: The ImageNet Story
论文出处:arXiv 每日论文精选 · arXiv:2608.13783
原始论文:PDF / 论文页面
这篇论文解决什么问题?
ImageNet-1k 验证集的原始标签由 Amazon Mechanical Turk 众包工人产生,他们接受的训练有限,且被要求为每张图只选一个标签。但真实图像往往包含多个对象:一张照片里可能同时有猫、沙发和窗户。单标签假设迫使标注员做出任意选择,而这些选择随后被当作'正确'答案,用于衡量所有模型的性能。
此前已有多次重标注尝试:Beyer et al. 2020 的 ReaL 报告多标签率 14.9%,Shankar et al. 2020 报告 18.3%,Tsipras et al. 2020 报告 21.6%,Northcutt et al. 2021 报告 11.0%。这些数字彼此不一致,且都沿用了原始有问题的分类体系。Kisel et al. 2024 进一步识别出训练/验证分布偏移、类别名称不匹配、近义类别和子类-超类重叠等结构性问题。
本文的核心判断是:如果基准本身有系统性缺陷,那么基于它的所有结论——包括哪些模型更好、哪些方法有效——都值得怀疑。更麻烦的是,ImageNet 的标签错误还会传播到 ImageNet-V2、-A、-R、-Sketch、ObjectNet 等衍生基准,因为这些基准在构建时都依赖原始标签进行筛选或验证。
因此,问题不是'有没有错误',而是'错误如何影响我们对模型能力的判断'。要回答这个问题,需要一个不沿用旧分类体系、不依赖旧标签的完整重标注。
核心创新
- ReImageNet:首个统一多标签校正、目标定位、修订类别定义和结构化属性标注的完整 ImageNet-1k 验证集重标注
- 将 ImageNet-1k 任务从单标签分类重定义为多标签定位,标注'立即可见'的对象而非所有可辨认对象
- 引入五种语义属性(rendition、reflection、text-recognition、crowd、dominant)以隔离特定模型能力
- 提出 ExCrops 等单标签兼容评估协议,基于扩展目标裁剪恢复严格单标签评测
- 证明人机协作(trained annotators + anonymized MLLM predictions)是当前大规模标注的质量上限
方法概览
由 7 名经培训的内部标注员按 WordNet 层级分组逐类准备,先修订类别定义与名称,再进行图像级多标签定位标注;辅助工具包括 OWLv2 检测框、OpenCLIP 预测,验证阶段改用 MLLM+SAM3 提议;引入 rendition、reflection、text-recognition、crowd、dominant 五种语义属性;通过控制集和持续沟通进行迭代修订。
- 由 7 名经培训的内部标注员按 WordNet 层级分组逐类准备:先修订类别定义与名称,再进行图像级多标签定位标注。标注员只标注'立即可见'的对象,而非所有可辨认对象——这一原则是在标注过程中发现小目标难以可靠识别后修订的。
- 辅助工具包括 OWLv2 检测框和 OpenCLIP 预测;验证阶段改用 MLLM+SAM3 提议,即用多模态大语言模型生成候选标签,再用 SAM3 生成定位。模型预测经过匿名化处理,以减少对标注员的引导。
- 引入五种语义属性:rendition(对象以玩具、绘画、雕塑等非照片形式呈现)、reflection(对象仅通过镜面或水面反射可见)、text-recognition(分类依赖读取图像中可见文本)、crowd(五个及以上同类实例合并为一个边界框)、dominant(人观看图像时立即注意到的对象,基于标注员判断而非尺寸)。
- 通过控制集和持续沟通进行迭代修订:标注过程中发现的模糊案例会反馈到类别定义,定义修订后再回溯检查已标注图像。
- 提出 ExCrops 评估协议:扩展目标裁剪,每个裁剪保证恰好包含一个标注对象且不与其他框重叠,用于恢复严格的单标签评测,使新旧评估范式可以衔接。
- 与四个先前重标注数据集(ReaL、Multi-label annotations、ImageNetMultiLabel、Label Errors)进行对比评估,用 alluvial 图展示各数据集标签与 ReGT 的映射关系。
逐图理解论文
一个具体失败案例

图 1 对比了 ImGT 原始单标签标注与 ReGT 新多标签定位标注。左侧的原始标签常遗漏明显对象或直接标错,右侧的 ReGT 标注了所有'立即可见'的对象。注意 (b) 中电视是镜面反射,(d) 中两种蛇类视觉上几乎无法区分,需要反向图像搜索才能确认。
研究缺口

图 4 定义了基于 ReGT 和 ImGT 的图像分类方案,是后续所有评估的基础。它将图像分为单标签、多标签、无有效标签等类别,使新旧标签的对比评估成为可能。
最强结论

表 1 展示了 MLLM、VLM 和监督模型在 ReGT 与 ImGT 上的准确率对比。MLLM 在 ReGT 上提升 5–6%,而监督模型最多只提升 1.2%,说明旧标签对监督模型的'惩罚'更重。
实验如何设计?
- 在 ReGT 与 ImGT 标签上评估 MLLM(GPT-5.4、Qwen3-VL、Gemma 4)、VLM(SigLIP 系列)和监督模型(DINOv3、EffNetV2、EffNet-L2、EVA-02)的 Top-1 ReaL 准确率。
- 按属性(crowd、reflection、rendition、text-recognition)分解单标签图像 S 上的准确率,以隔离特定模型能力。
- 在 96,051 个目标裁剪上评估四种设置(All、Largest、Any、ExCrops),考察模型在对象级识别上的表现。
- 估计 ImageNet-V2、-A、-R、-Sketch、ObjectNet、CounterAnimal 等衍生基准的标注错误下界,通过聚合 GPT-5.4 和 SigLIP2-g 的预测实现。
- 与四个先前重标注数据集对比评估,统一应用 ReGT 标签类别后比较模型排名变化。
关键结果与论文证据
- 约 12% 的原始 ImageNet-1k 标签错误,33.3% 的图像为多标签,3.8% 的图像不含有效 ImageNet-1k 类别(第 9 页)。
- MLLM 在 ReGT 上准确率提升 5–6%(GPT-5.4 +5.10%,Qwen3-VL +6.09%,Gemma 4 +5.39%),监督模型提升最多 1.2%(DINOv3 +1.20%,EVA-02 +0.05%)(第 7 页)。这说明旧标签对监督模型的'惩罚'更重,因为它们被训练去拟合那些错误标签。
- text-recognition 属性上 MLLM/VLM 提升 +6–16%(Qwen3-VL +15.58%),监督模型如 EffNetV2 下降 −6.74%(第 8 页)。旧基准系统性低估了能读文本的模型。
- rendition 属性使所有模型性能下降,监督模型降幅最大(EffNetV2 −9.76%,DINOv3 −7.26%)(第 8 页)。
- All crops 设置下监督模型准确率下降最多(EVA-02 −33.5%,DINOv3 −32.3%),MLLM 降幅较小(Gemma 4 −15.7%)(第 9 页)。
- 衍生基准标注错误率为 ImageNet-1k 的 1.7–5.8 倍(IN-A 14.80% vs 2.57%,IN-S 13.38% vs 4.74%)(第 9 页)。
- 多标签率 33.3% 显著高于先前工作:ReaL 14.9%、Multi-label annotations 18.3%、ImageNetMultiLabel 21.6%、Label Errors 11.0%(第 7 页)。
- 与先前重标注数据集的对比评估显示,模型排名在 ReGT 下发生变化,说明旧标签的偏差并非均匀分布。
阅读时需要注意
- 标注员共享欧洲背景,对某些文化特定类别(如 abaya)和细粒度野生动物的理解可能有偏差。
- 模型预测虽匿名化但可能仍会引导标注决策,形成隐性循环。
- 仅覆盖验证集,未涉及训练集;类别定义基于验证集内容,可能不反映训练集分布。
- 依赖闭源 MLLM(GPT-4o、GPT-5.4),输出不可复现且可用性可能变化。
- 残留标注员间差异:注意哪些对象、标记 dominant、边界框绘制位置。
- 多标签评估是宽松的:图像有多个有效标签时任一匹配即算正确,与过去十年的单标签数字不可直接比较。
关联工作
- Beyer et al. 2020 (ImageNet ReaL):首次全验证集多标签重标注,引入 ReaL 准确率指标;本文多标签率 33.3% 远高于其 14.9%。
- Kisel et al. 2024 (Flaws of ImageNet):识别训练/验证分布偏移、类别名称不匹配、近义类别和子类-超类重叠等结构性问题;本文工作建立在其分析之上。
- Kisel et al. 2026 (MLLMs as image classifiers):案例研究表明 GPT-4o 预测在约 50% 分歧案例中优于训练有素的标注员;本文验证阶段采用其 MLLM 预测。
- ImageNet-X (Idrissi et al. 2022):添加结构化属性标注;本文扩展此思路,将属性标注与多标签校正和定位结合。