SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models
SIGNPOST-Bench:评估多模态大语言模型文本-视觉冲突解决能力的基准
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 本研究推出SIGNPOST-Bench基准,通过包含5111个反事实组的25555个图像变体,评估20个多模态大语言模型的文本-视觉冲突解决能力,发现对抗文本会显著提升定位误差,且模型对冲突文本的鲁棒性无法由干净输入的定位性能完全预测。
Comments 27 pages, 25 figures