When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by AAAI 2026
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by AAAI 2026
机构 * EXL Health AI Lab at MEDIQA-WV 2025(EXL健康AI实验室)
专题命中 视觉问答 :visual question answering(title);分类 cs.AI
Comments 2 figures, 11 pages
机构 * KAUST(卡斯泰尔大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
Comments 12 pages, 7 figures, AI4NextG @ NeurIPS 2025
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments Accepted in AAAI 2026
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted by AAAI 2026