俄罗斯Sirius教育中心和高等经济大学团队用186527张电商评价图片训练AI生成检测器。产品完全隔离的测试集上,最强模型PR-AUC达到0.9999;把合成图重新编码成真实图片常见的格式后,成绩跌到0.7254。
模型原本主要识别真实图的WebP压缩历史与合成图的JPEG格式,并非生成模型留下的稳定视觉特征。训练集和测试集没有商品重复,仍然挡不住这种跨样本存在的数据捷径。
论文图1:真实编辑区域位于画面侧边,中心位置先验没有读取检测器,却能在部分指标上取得高分。
真实与合成图片从保存时就带着不同标签
数据包含169751张真实电商评价照片和16776张由10种生成器制作的合成图。真实照片从托管服务下载时已经变成WebP,合成图则按JPEG q85保存。文件格式与真假标签几乎一一对应。
研究人员最初只把合成图转成WebP,模型仍可利用两类图片不同的编码链路。随后让两类图片都经过同一次尺寸调整和WebP编码,才减少这条线索。五款公开检测器在重新编码前后最多变化0.07,说明不同模型依赖压缩捷径的程度并不相同。
论文附图A2:本文训练的三种检测器最多下降0.274,五款公开检测器变化较小。
这项结果不能概括成“所有AI图片检测器都在看格式”。它说明高分检测器必须经过格式、尺寸、平台压缩和截图重传等控制实验,单一留出测试集不够。
热力图重合度高,也可能只是位置猜对了
论文第二阶段检查解释热力图。常见评测会比较热力图与人工编辑掩码的重合度,但电商图中的商品和编辑区域经常位于中央。一个完全不读取检测器、只把画面中心标红的简单先验,也能在部分重合指标上超过真实解释方法。
团队因此加入因果测试:遮挡热力图认为重要的区域,观察检测结果是否真的改变;同时保留随机、中心和边缘三种盲基线。部分方法能通过因果测试却定位不准,另一些定位漂亮却没有明显改变检测器输出。
论文图2:横轴测试遮挡重要区域是否改变判断,纵轴测试是否覆盖编辑位置,两者排名并不一致。
一张“像解释”的图不能直接交给审核员
论文选出的region_ensemble在200张局部编辑图上,相对随机热力图的因果优势为0.155,编辑区域像素AP为0.466。它在画面侧边出现编辑时比中心先验可靠,但遇到大面积、居中的编辑,中心先验仍可能获胜。
论文附图A5:侧边插入时中心先验失效,大面积居中编辑时区域方法也会落后。
研究没有进行人工审核员实验,无法证明热力图能帮助平台作出退款、封禁或内容标记决定。定位数据还存在有损压缩、掩码质量和生成器分布问题,部分统计样本只有60张。
上线前要同时审计数据、模型和解释
检测系统需要分开回答三个问题:数据是否泄露标签,模型是否在不同编码历史下仍有效,解释图是否真正影响模型判断。任何一个环节缺失,都可能出现“检测分数很高、热力图也很像,但证据并不成立”的结果。
论文针对的是电商评价图片和局部伪造,不能外推到新闻图片、艺术创作或所有生成模型。平台端还要考虑截图、裁剪、滤镜和多次转码后的实际分布。