Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models
超越表象:揭示多模态大语言模型的情境错觉
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。
Comments 9 pages, 5 figures