Can VLMs Detect and Localize Fine-Grained AI-Edited Images?
视觉语言模型能否检测并定位细粒度的人工智能编辑图像?
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Shandong University(山东大学) ; Wuhan University(武汉大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。
Comments 14pages,19 figures