MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
MaS-VQA: 一种基于掩码和选择的基于知识的视觉问答框架
机构 * Zhejiang University, Hangzhou, China(浙江大学, 杭州, 中国) ; Alibaba Group, Hangzhou, China(阿里巴巴集团, 杭州, 中国)
专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 MaS-VQA通过结合显式知识过滤与隐式知识推理,提升基于知识的视觉问答任务的准确性和鲁棒性。