论文导读
滑铁卢大学、英伟达、台湾大学和南洋理工大学等机构提出VIEScore2图片评分与缺陷定位模型。它指出异常所在格子,并区分画面瑕疵和指令不一致。总体评分比比较的通用模型更贴近人工排序,为人工返修提供具体位置。
不只给分,还指出哪一块有问题
一张AI图片得了低分,编辑还需要知道问题在手指、背景,还是没有遵守指令。VIEScore2把画面划成16×16网格,输出问题格子的行列坐标,并区分视觉瑕疵与语义不一致。
论文示例要求在湖面添加红船,生成结果却出现蓝船,右上角还留下异常色块。模型既给出感知质量与语义一致性评分,也标出对应区域。颜色不符合要求和画面有瑕疵,是两类不同问题。
图:论文图1以湖面加船任务串联输入、评分、缺陷网格和固定解析器生成的说明。
它接收生成图、提示词,以及可选的原图或参考图。检查普通生成时可以没有参考图;检查编辑有没有保留源图信息时,则可以把条件图一起输入。评估指令决定本次只要分数、只要位置,还是两者都要。
把不同标注转成统一格式
团队用约3.8万个样本训练,资料来自五个来源,覆盖只有评分、只有缺陷位置和两类标注都有的情况。掩码与热力图变成网格,评分归一到0—10尺度。
只有分数的样本不会被当作“没有缺陷”的图片训练。模型先学习输出结构化结果,再尝试多份回答,用预测格子与标注格子的重合程度、分数偏差和格式有效性计算反馈。
最后的说明由固定解析规则生成:合并连通的格子,描述它们在画面中的位置,并关联到相应缺陷类别。它忠实表达模型输出,不会额外核实这次判断是否正确,也不解释缺陷的真实成因。
图:论文图2显示五类数据转成统一标注,经监督训练与强化训练后输出评分、网格及解释。
0.601是相关性,不是60.1%准确率
主要评分测试使用900个样本,比较模型看到相同生成图、提示词与可用条件图时的结果。VIEScore2总体排序相关性为0.601,Gemini-3-Flash为0.491,GPT-5.6-sol为0.437。
细分任务并非全面领先。Gemini在文本引导编辑与单参考图编辑上更好,GPT-5.6-sol在多参考图生成和编辑上领先。把总分优势写成所有图片任务都更准确,会超出实验范围。
定位测试另用共享网格对齐不同方法。在六组基准中,VIEScore2的逐图网格重合指标有三组第一、五组位列前三。示例中的红格是预测,绿框是标注,两者不完全重合,也能看到误报和遗漏。
图:论文图3并列六组基准的定位例子,红色格子是预测、绿色轮廓是标注,并列出各例子的网格重合值。
图片返修应用:给人工一个可追踪的入口
这种输出可以让检查者回到指定区域,确认是生成异常,还是任务没有满足。与只收到一个总分相比,返修时至少有可查看的位置,之后还能对比重新生成结果。
网格并非越密越好。作者在不同分辨率间比较后选择16×16,兼顾标注细节与输出长度;更细的32×32需要更长文本,训练后的定位指标反而下降。
论文只验证了Qwen3-VL-8B这一底座,固定网格仍可能漏掉细小问题,强化训练也会在部分无缺陷图片上增加误报。项目页提供输入输出案例与模型入口,落地时仍需让人工复核错误区域,尤其不能让解析出来的通顺说明替代画面本身。
参考资料
https://arxiv.org/abs/2610.00994
https://arxiv.org/html/2610.00994