MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
Varun Srivastava, Fan Lei, Srija Mukhopadhyay, Vivek Gupta, Ross Maciejewski
机构
*
School of Computing and Augmented Intelligence(计算与增强智能学院)
;
Arizona State University(亚利桑那州立大学)
;
Department of Computer Science(计算机科学系)
;
International Institute of Information Technology(国际信息科技研究所)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
CommentsPublished as a conference paper at COLM 2025
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
Qi Yang, Chenghao Zhang, Lubin Fan, Kun Ding, Jieping Ye, Shiming Xiang
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences, China(中国科学院自动化研究所MAIS部)
;
Alibaba Cloud Computing, China(阿里巴巴云计算)
专题命中
视觉问答
:vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
Songtao Jiang, Chenyi Zhou, Yan Zhang, Yeying Jin, Zuozhu Liu
机构
*
Zhejiang University(浙江大学)
;
Byte Dance(字节跳动)
;
National University of Singapore(新加坡国立大学)
;
Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)
专题命中
视觉问答
:visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract)
CommentsAccepted at The First Workshop of Evaluation of Multi-Modal Generation (EvalMG) in 31st International Conference on Computational Linguistics (COLING), 2025. 8 pages + references + 6 pages of Appendix
Flamingo: a Visual Language Model for Few-Shot Learning
Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katie Millican, Malcolm Reynolds, Roman Ring, Eliza Rutherford, Serkan Cabi, Tengda Han, Zhitao Gong, Sina Samangooei, Marianne Monteiro, Jacob Menick, Sebastian Borgeaud, Andrew Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, Karen Simonyan
专题命中
视觉问答
:visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments54 pages. In Proceedings of Neural Information Processing Systems (NeurIPS) 2022
'Just because you are right, doesn't mean I am wrong': Overcoming a Bottleneck in the Development and Evaluation of Open-Ended Visual Question Answering (VQA) Tasks
Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions
Akash Ghosh, Arkadeep Acharya, Sriparna Saha, Vinija Jain, Aman Chadha
机构
*
Department of Computer Science and Engineering, IIT Patna, India(印度帕纳大学计算机科学与工程系)
;
Stanford University(斯坦福大学)
;
Amazon AI(亚马逊人工智能)
;
Indian Institute of Technology Patna, India(印度帕纳大学)
专题命中
视觉问答
:vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI;visual language model(comments)
CommentsOne of the first survey on Visual Language Models
Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain
医学VQA中通过置信度-证据贝叶斯增益实现确定性幻觉检测
Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli
机构
*
Department of Electrical Engineering, Stanford University, CA, USA(电气工程系,斯坦福大学)
;
Department of Biology, Stanford University, CA, USA(生物学系,斯坦福大学)
;
Division of Cardiology, Department of Medicine, Stanford University, CA, USA(心脏病学部,医学系,斯坦福大学)
;
Department of Biomedical Data Science, Stanford University, CA, USA(生物医学数据科学系,斯坦福大学)
;
Department of Computer Science, Stanford University, CA, USA(计算机科学系,斯坦福大学)
;
Department of Psychiatry and Behavioral Sciences, Stanford University, CA, USA(精神病学与行为科学系,斯坦福大学)
专题命中
视觉问答
:MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI