arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

ImageNet用了14年的标签出问题:12%标错,重标后多模态模型涨5—6分

arXiv 2608.13783 cs.CV

捷克理工大学视觉识别团队提出ReImageNet,重新检查ImageNet-1k的5万张验证图,发现约12%的原标签错误,33.3%的图片天然包含多个类别,还有3.8%根本找不到合适的ImageNet类别。换用新标签后,多模态大模型准确率普遍上涨5—6个百分点。一个视觉模型说图片里有“键盘、鼠标和手机”,标准答案却只写“键盘”,这次究竟该判谁错?

ImageNet-1k长期用单个类别描述一张图,这在主体居中的物体识别时代足够方便。视觉模型逐渐具备开放词汇理解后,单标签规则开始制造反常判罚:模型识别出图中另一件同样明显的物体,也会被记为错误;原标签本身写错时,能力越强的模型反而越可能与答案不一致。

5万张验证图逐张重新核对

ReImageNet不是在旧标签上做简单同义词扩展,而是重新判断图片中可见的ImageNet类别,并记录标签错误、多标签和类外样本。标注流程结合候选类别、人工核验与一致性检查,使每张图可以拥有一个或多个有效答案,也可以明确标记“不属于现有千类”。

ReImageNet样例展示原标签与图中真实物体的差异

ReImageNet样例展示原标签与图中真实物体的差异。

统计结果显示,12%的原始标签不正确;33.3%的图片不应只有一个正确类别;3.8%的图片没有任何合适的ImageNet-1k类别。这些问题并非零星噪声,而足以改变模型间差距与错误分析。团队同时开放新标注和评测代码,便于旧模型在不重新训练的情况下复测。

错误来源也有多种形态:有的标签指向画面中并不存在的对象,有的把近邻类别混淆,还有的图片主体早已超出固定词表。把它们分开记录很重要,因为类别误标需要更正答案,多物体样本需要扩展答案集合,类外样本则不该勉强塞进最接近的一类。

从“唯一答案”改成“图里出现什么都可以答”

多标签评估更符合真实画面。一张桌面照片可以同时包含鼠标、键盘和手机;人物拿着乐器时,乐器与人物相关类别都可能有效。ReImageNet允许模型命中任何经核实的可见类别,减少把正确识别当成错误的情况。

同一张ImageNet图片中的多个有效类别与边界框

同一张ImageNet图片中的多个有效类别与边界框。

项目还提供交互式核查流程,研究者可以查看新旧标签、图像区域和类别关系。这样一来,准确率变化不再只是一个总分,而能追溯到原标签纠正、多目标补充或类外样本处理,帮助判断模型真正学会了什么。

新评测仍保留与ImageNet历史结果的对应关系。研究者既能报告原始单标签准确率,也能补充ReImageNet成绩,区分模型在旧协议下的可比性与在更完整语义下的真实识别能力。这样的双轨报告比直接删除旧榜单更利于社区迁移。

重评后监督模型最多涨1.2分,多模态模型涨5—6分

在新标注下,传统监督分类器的准确率最多提高1.2个百分点,而多模态大模型普遍提高5—6个百分点。差异说明开放词汇模型过去更容易给出“语义正确但不等于唯一标签”的答案,旧评测低估了它们的识别能力。

ReImageNet从候选生成到人工核验和重新评测的流程

ReImageNet从候选生成到人工核验和重新评测的流程。

重标并不会让所有模型排名彻底翻转,ImageNet-1k也仍然只覆盖固定的一千类。它解决的是评测尺子的系统误差,而不是现实视觉的全部长尾问题。不过,当几个百分点的差距常被用于宣称模型进步时,先确认答案本身可靠就非常重要。

ReImageNet梳理原始标签错误与多标签样本的分布

ReImageNet梳理原始标签错误与多标签样本的分布。

下一步让视觉基准随模型能力一起更新

ReImageNet适合作为动态基准的起点:后续可以加入层级标签、属性、物体关系和更明确的不可判定选项,使分类、检测和多模态问答共享一套可追溯语义。新增模型暴露出的争议样本,也可以进入下一轮人工复核,而不是永久冻结在2012年的答案里。

对研究团队而言,新标签能更准确地区分模型错误与数据错误;对产品团队而言,它提醒大家上线前必须抽查评测集,尤其是开放词汇模型面对多物体场景时。基准不只是排行榜的背景,持续维护的数据本身就是模型进步的一部分。

参考资料

https://arxiv.org/abs/2608.13783

https://vrg.fel.cvut.cz/reimagenet