Solution for Meta KDD Cup'25: A Comprehensive Three-Step Framework for Vision Question Answering
专题命中 视觉问答 :visual question answering(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract)
专题命中 视觉问答 :LLaVA(abstract)
专题命中 视觉问答 :multimodal large language model(abstract)
Comments This paper has been accepted to the ACL Student Research Workshop (SRW) 2025
机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)
专题命中 视觉问答 :grounding(abstract)
Comments Accepted to ACL SRW 2025. 9 Pages, 2 Figures, 4 Tables
专题命中 视觉问答 :visual question answering(abstract)
Comments published in sigir2023
专题命中 视觉问答 :multimodal large language model(abstract)
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所) ; Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) ; Beijing Wenge Technology Co., Ltd.(北京文耕科技有限公司) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉问答 :visual reasoning(abstract)
机构 * University of Houston(德克萨斯大学休斯敦分校) ; Seoul National University(首尔国立大学) ; Snowflake AI Research(Snowflake人工智能研究)
专题命中 视觉问答 :grounding(abstract)
机构 * University of Trento(特伦托大学) ; Gran Sasso Science Institute(格兰萨索科学研究所) ; University of Essex(埃塞克斯大学) ; University of Bath(巴斯大学)
专题命中 视觉问答 :VLM(abstract)
专题命中 视觉问答 :vision language model(abstract)
Comments Accepted by IEEE Transactions on Vehicular Technology
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆森大学) ; Washington University in St.Louis(圣路易斯华盛顿大学) ; Banner Alzheimer’s Institute(班纳阿尔茨海默病研究所)
专题命中 视觉问答 :VLM(abstract)
专题命中 视觉问答 :vision-language model(abstract)
专题命中 视觉问答 :multimodal large language model(abstract)
Comments Accepted at SIGIR 2025
专题命中 视觉问答 :grounding(abstract)
Comments 33 pages, EMNLP24
专题命中 视觉问答 :visual question answering(abstract)
专题命中 视觉问答 :vision language model(abstract)
专题命中 视觉问答 :grounding(abstract)
专题命中 视觉问答 :multimodal large language model(abstract)
Comments Open-Source: https://github.com/AudioLLMs/Singlish
专题命中 视觉问答 :grounding(abstract)
专题命中 视觉问答 :grounding(abstract)
Comments AAAI-25 Workshop on Document Understanding and Intelligence
专题命中 视觉问答 :grounding(abstract)
专题命中 视觉问答 :multimodal large language model(abstract)
专题命中 视觉问答 :vision language model(abstract)
Comments submitted for review, total of 14 pages
专题命中 视觉问答 :vision language model(abstract)
Comments 24 pages
专题命中 视觉问答 :grounding(abstract)
Comments to appear NLLP @ EMNLP 2024
专题命中 视觉问答 :vision-language model(abstract)
专题命中 视觉问答 :grounding(abstract)
Comments ACL 2024 (main conference)
专题命中 视觉问答 :visual question answering(abstract)
Comments 14 pages, 8 figures, conference
专题命中 视觉问答 :visual question answering(abstract)
专题命中 视觉问答 :grounding(abstract)
Comments 8 pages, 4 figures, accepted to *SEM 2024
Journal ref https://aclanthology.org/2024.starsem-1.29