How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA
视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐
机构 * Singapore Institute of Technology(新加坡科技学院) ; NVIDIA(英伟达)
AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。
Comments Accepted at ACM Multimedia 2026