Towards Reliable and Interpretable Document Question Answering via VLMs
机构 * Università degli Studi di Firenze(佛罗伦萨大学)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Università degli Studi di Firenze(佛罗伦萨大学)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract)
机构 * Department of Computer Science(计算机科学系) ; The University of British Columbia(不列颠哥伦比亚大学) ; ServiceNow Research(ServiceNow研究)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Findings of EMNLP 2025
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)
专题命中 视觉问答 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project site: https://linzhiqiu.github.io/papers/camerabench/
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)
Comments EMNLP2025 Findings
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract)
Comments This paper has been accepted by ACM MM 2025
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract)
Comments 21 pages
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to ICLR 2025
机构 * Renmin University of China(中国人民大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) ; Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract)
机构 * Tongji University(同济大学) ; University of Washington(华盛顿大学) ; Sun Yat-sen University(中山大学) ; Microsoft(微软) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at CVPR 2025
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2024; updated NExT-GQA results in Appendix
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR2025 Camera Ready
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract)
Comments The work was first submitted to an IEEE conference on September 15, 2024
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR2025
专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments This paper is accepted in AAAI'25", and the code is available at https://bnn-bella.github.io/BNN-Bella/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by AAAI 2025
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at ICLR 2025
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 15 pages, 2 figures, accepted by BMVC'24
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Findings of EMNLP 2024
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to EMNLP (Main) 2024
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at Deployable AI (DAI) Workshop at AAAI-2024
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments This is a survey paper on recent state of the art VL models that can be used for memes classification. it has 15 pages and 2 figures
Journal ref SCA 2020
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Our paper is accepted for publication at ML4CCE workshop at ECML PKDD 2024
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Our paper is published at ICML 2024 Workshop ML for Life and Material Science: From Theory to Industry Applications, Vienna, Austria