MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
机构 * The University of Melbourne(墨尔本大学) ; The University of Western Australia(西澳大学)
专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract)
Comments Findings of ACL 2025