arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

AI图片哪里画崩了?英伟达等团队让评分带上缺陷位置

作者:arXivDaily编辑部 arXiv 2610.00994 cs · cs.CV

论文导读

滑铁卢大学、英伟达、台湾大学和南洋理工大学等机构提出VIEScore2图片评分与缺陷定位模型。它指出异常所在格子,并区分画面瑕疵和指令不一致。总体评分比比较的通用模型更贴近人工排序,为人工返修提供具体位置。

不只给分,还指出哪一块有问题

一张AI图片得了低分,编辑还需要知道问题在手指、背景,还是没有遵守指令。VIEScore2把画面划成16×16网格,输出问题格子的行列坐标,并区分视觉瑕疵与语义不一致。

论文示例要求在湖面添加红船,生成结果却出现蓝船,右上角还留下异常色块。模型既给出感知质量与语义一致性评分,也标出对应区域。颜色不符合要求和画面有瑕疵,是两类不同问题。

图:论文图1以湖面加船任务串联输入、评分、缺陷网格和固定解析器生成的说明。

它接收生成图、提示词,以及可选的原图或参考图。检查普通生成时可以没有参考图;检查编辑有没有保留源图信息时,则可以把条件图一起输入。评估指令决定本次只要分数、只要位置,还是两者都要。

把不同标注转成统一格式

团队用约3.8万个样本训练,资料来自五个来源,覆盖只有评分、只有缺陷位置和两类标注都有的情况。掩码与热力图变成网格,评分归一到0—10尺度。

只有分数的样本不会被当作“没有缺陷”的图片训练。模型先学习输出结构化结果,再尝试多份回答,用预测格子与标注格子的重合程度、分数偏差和格式有效性计算反馈。

最后的说明由固定解析规则生成:合并连通的格子,描述它们在画面中的位置,并关联到相应缺陷类别。它忠实表达模型输出,不会额外核实这次判断是否正确,也不解释缺陷的真实成因。

图:论文图2显示五类数据转成统一标注,经监督训练与强化训练后输出评分、网格及解释。

0.601是相关性,不是60.1%准确率

主要评分测试使用900个样本,比较模型看到相同生成图、提示词与可用条件图时的结果。VIEScore2总体排序相关性为0.601,Gemini-3-Flash为0.491,GPT-5.6-sol为0.437。

细分任务并非全面领先。Gemini在文本引导编辑与单参考图编辑上更好,GPT-5.6-sol在多参考图生成和编辑上领先。把总分优势写成所有图片任务都更准确,会超出实验范围。

定位测试另用共享网格对齐不同方法。在六组基准中,VIEScore2的逐图网格重合指标有三组第一、五组位列前三。示例中的红格是预测,绿框是标注,两者不完全重合,也能看到误报和遗漏。

图:论文图3并列六组基准的定位例子,红色格子是预测、绿色轮廓是标注,并列出各例子的网格重合值。

图片返修应用:给人工一个可追踪的入口

这种输出可以让检查者回到指定区域,确认是生成异常,还是任务没有满足。与只收到一个总分相比,返修时至少有可查看的位置,之后还能对比重新生成结果。

网格并非越密越好。作者在不同分辨率间比较后选择16×16,兼顾标注细节与输出长度;更细的32×32需要更长文本,训练后的定位指标反而下降。

论文只验证了Qwen3-VL-8B这一底座,固定网格仍可能漏掉细小问题,强化训练也会在部分无缺陷图片上增加误报。项目页提供输入输出案例与模型入口,落地时仍需让人工复核错误区域,尤其不能让解析出来的通顺说明替代画面本身。

参考资料

https://arxiv.org/abs/2610.00994

https://arxiv.org/html/2610.00994

https://arxiv.org/pdf/2610.00994

https://tiger-ai-lab.github.io/VIEScore2/

↑