InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shenzhen University(深圳大学) ; West China Hospital of Sichuan University(四川大学华西医院) ; IHPC, Agency for Science, Technology and Research(科技研究局IHPC)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at ACM MM 2025 (also known as GEMeX-ThinkVG)
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Inc.(华为公司)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 21 pages, 6 figures
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to NeurIPS 2025 (Spotlight)
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Boston University(波士顿大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.LG
Comments In Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393
机构 * George Mason University(乔治·马歇尔大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments TMLR 2025
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; TU Munich(慕尼黑技术大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 63 pages, 29 tables, and 47 figures
机构 * NVIDIA ; MIT(麻省理工学院) ; HKU(香港大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B
机构 * The University of Queensland(昆士兰大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 13 pages, 2 figures, 2 tables
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Peking University(北京大学) ; Nanjing University(南京大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Microsoft Research Asia(微软亚洲研究院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted to ACL 2025 Main Conference
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 23 pages
机构 * Meta AI ; New York University(纽约大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 3 figures
机构 * University of Waterloo(滑铁卢大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments TMLR 2025
机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科、Winship癌症研究所、埃默里大学医学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Codatta ; Kite AI ; Binance Wallet Community ; Codatta Community
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 5 figures, 6 tables. The dataset is available at https://huggingface.co/datasets/Codatta/MM-Food-100K
机构 * Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室) ; Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院) ; National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV、cs.AI
Comments 1st Place Solution of the 9th AI City Challenge Track 3
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual reasoning(abstract);分类 cs.AI、cs.LG
Comments Under Review
机构 * Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences Beijing China ; School of Cyber Science ; Engineering, Nanjing University of Science ; VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Tianjin China ; Key Laboratory of Ethnic Language Intelligent Analysis ; Security Governance of MOE, Minzu University of China Beijing China ; Institute of Information Engineering, Chinese Academy of Sciences ; School of Cyber Security, University of Chinese Academy of Sciences ; VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University ; Security Governance of MOE, Minzu University of China
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by 2025 ACM MM
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; Coastal Carolina University(海岸卡罗来纳大学) ; Ohio State University(俄亥俄州立大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG
机构 * BAAI FlagEval Team(BAAI 评测团队)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by ACL 2025 Demo
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 10 pages, 10 figures
机构 * NCIT(尼泊尔信息技术研究所) ; Fusemachine(Fusemachine公司) ; Logictronix Technologies(Logictronix Technologies公司)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments accepted to ImageCLEF 2025, to be published in the lab proceedings
机构 * Vector Institute for AI(向量人工智能研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at ASONAM'25
机构 * The University of Queensland(昆士兰大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) ; Department of Biomedical Engineering, College of Engineering, Georgia Institute of Technology(生物医学工程系,工程学院,佐治亚理工学院) ; Department of Computer Science and Mathematics, Laney Graduate School, Emory University(计算机科学与数学系,兰尼研究生院,埃默里大学) ; School of Electrical and Computer Engineering, College of Engineering, Georgia Institute of Technology(电气与计算机工程系,工程学院,佐治亚理工学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI