arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2505.19616 2026-01-30 cs.LG cs.AI cs.CV 85%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10054 2026-01-21 q-bio.OT 85%

SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model

SurgPub-Video: 一个全面的外科视频数据集,用于增强视觉-语言模型中的外科智能

Yaoqian Li, Xikai Yang, Dunyuan Xu, Yang Yu, Litao Zhao, Xiaowei Hu, Jinpeng Li, Pheng-Ann Heng

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 SurgPub-Video数据集和SurgLLaVA-Video模型通过提供高质量外科视频数据和专门的视觉-语言模型,提升了手术场景分析的智能水平。

Journal ref AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11625 2025-10-07 cs.CL cs.AI cs.CV cs.LG 85%

MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering

Varun Srivastava, Fan Lei, Srija Mukhopadhyay, Vivek Gupta, Ross Maciejewski

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学) Department of Computer Science(计算机科学系) International Institute of Information Technology(国际信息科技研究所)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17588 2025-09-23 cs.CV cs.AI cs.LG 85%

Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models

Jinyeong Kim, Seil Kang, Jiwoo Park, Junhyeok Kim, Seong Jae Hwang

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18687 2025-08-27 cs.CL 85%

Knowing or Guessing? Robust Medical Visual Question Answering via Joint Consistency and Contrastive Learning

Songtao Jiang, Yuxi Chen, Sibo Song, Yan Zhang, Yeying Jin, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University, Zhejiang, China(浙江大学) Alibaba Group, Zhejiang, China(阿里巴巴集团) Angelalign Technology Inc., Shanghai, China(Angelalign技术有限公司) ChohoTech Inc., Hangzhou, China(楚合科技有限公司) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence, Zhejiang, China(浙江省医学影像人工智能重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07785 2025-06-10 cs.CV cs.AI cs.LG 85%

Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger

Qi Yang, Chenghao Zhang, Lubin Fan, Kun Ding, Jieping Ye, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences, China(中国科学院自动化研究所MAIS部) Alibaba Cloud Computing, China(阿里巴巴云计算)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2025 Spotlight. 22 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04353 2025-06-06 cs.CV cs.AI cs.CE cs.CL cs.LG 85%

ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding

Ankit Pal, Jung-Oh Lee, Xiaoman Zhang, Malaikannan Sankarasubbu, Seunghyeon Roh, Won Jung Kim, Meesun Lee, Pranav Rajpurkar

机构 * Saama AI Research(Saama AI研究机构) Seoul National University(首尔国立大学) Harvard Medical School(哈佛医学院)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11479 2025-06-04 cs.CL 85%

Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media Contexts

Jingxuan Li, Yuning Yang, Shengqi Yang, Linfan Zhang, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00806 2025-06-03 cs.CL 85%

Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering

Songtao Jiang, Chenyi Zhou, Yan Zhang, Yeying Jin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Byte Dance(字节跳动) National University of Singapore(新加坡国立大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23828 2025-06-02 cs.CR 85%

Spa-VLM: Stealthy Poisoning Attacks on RAG-based VLM

Lei Yu, Yechao Zhang, Ziqi Zhou, Yang Wu, Wei Wan, Minghui Li, Shengshan Hu, Pei Xiaobing, Jing Wang

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05445 2025-04-09 cs.HC 85%

Probing the Visualization Literacy of Vision Language Models: the Good, the Bad, and the Ugly

Lianghan Dong, Anamaria Crisan

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04550 2025-04-08 cs.CV cs.AI cs.LG cs.RO 85%

Advancing Egocentric Video Question Answering with Multimodal Large Language Models

Alkesh Patel, Vibhav Chitalia, Yinfei Yang

机构 * Apple(苹果公司)

专题命中 视觉问答 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10311 2025-03-11 cs.IR 85%

UniRAG: Universal Retrieval Augmentation for Large Vision Language Models

Sahel Sharifymoghaddam, Shivani Upadhyay, Wenhu Chen, Jimmy Lin

专题命中 视觉问答 :vision language model(title,abstract);LLaVA(abstract);visual question answering(abstract)

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09269 2024-12-13 cs.CV cs.AI cs.CL cs.LG 85%

Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types

Neelabh Sinha, Vinija Jain, Aman Chadha

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta AI Amazon GenAI(亚马逊生成式人工智能部门)

专题命中 视觉问答 :vision-language model(title,abstract);InternVL(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at The First Workshop of Evaluation of Multi-Modal Generation (EvalMG) in 31st International Conference on Computational Linguistics (COLING), 2025. 8 pages + references + 6 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04306 2024-10-29 cs.CV cs.AI cs.LG 85%

Effectiveness Assessment of Recent Large Vision-Language Models

Yao Jiang, Xinyu Yan, Ge-Peng Ji, Keren Fu, Meijun Sun, Huan Xiong, Deng-Ping Fan, Fahad Shahbaz Khan

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by Visual Intelligence

Journal ref Visual Intelligence, 2024, Vol. 2, article no. 17

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21788 2024-08-01 cs.CV cs.AI cs.CL cs.LG 85%

Vision-Language Model Based Handwriting Verification

Mihir Chauhan, Abhishek Satbhai, Mohammad Abuzar Hashemi, Mir Basheer Ali, Bina Ramamurthy, Mingchen Gao, Siwei Lyu, Sargur Srihari

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 4 Pages, 1 Figure, 1 Table, Accepted as Short paper at Irish Machine Vision and Image Processing (IMVIP) Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07280 2023-03-14 cs.CV cs.AI cs.LG 85%

Vision-Language Models as Success Detectors

Yuqing Du, Ksenia Konyushkova, Misha Denil, Akhil Raju, Jessica Landon, Felix Hill, Nando de Freitas, Serkan Cabi

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.14198 2022-11-17 cs.CV cs.AI cs.LG 85%

Flamingo: a Visual Language Model for Few-Shot Learning

Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katie Millican, Malcolm Reynolds, Roman Ring, Eliza Rutherford, Serkan Cabi, Tengda Han, Zhitao Gong, Sina Samangooei, Marianne Monteiro, Jacob Menick, Sebastian Borgeaud, Andrew Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, Karen Simonyan

专题命中 视觉问答 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 54 pages. In Proceedings of Neural Information Processing Systems (NeurIPS) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.15022 2022-06-02 cs.CL 85%

'Just because you are right, doesn't mean I am wrong': Overcoming a Bottleneck in the Development and Evaluation of Open-Ended Visual Question Answering (VQA) Tasks

Man Luo, Shailaja Keyur Sampat, Riley Tallman, Yankai Zeng, Manuha Vancha, Akarshan Sajja, Chitta Baral

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);visual reasoning(abstract)

Comments accepted to EACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02671 2022-05-06 cs.CV cs.AI cs.LG 85%

What is Right for Me is Not Yet Right for You: A Dataset for Grounding Relative Directions via Multi-Task Learning

Jae Hee Lee, Matthias Kerzel, Kyra Ahrens, Cornelius Weber, Stefan Wermter

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to IJCAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.09506 2019-07-12 cs.CL cs.AI cs.CV cs.LG 85%

GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering

Drew A. Hudson, Christopher D. Manning

专题命中 视觉问答 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published as a conference paper at CVPR 2019 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00377 2018-06-05 cs.CV cs.AI cs.CL cs.LG 85%

Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering

Aishwarya Agrawal, Dhruv Batra, Devi Parikh, Aniruddha Kembhavi

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 15 pages, 10 figures. To appear in IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07214 2025-10-15 cs.CV cs.AI cs.CL 84%

Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions

Akash Ghosh, Arkadeep Acharya, Sriparna Saha, Vinija Jain, Aman Chadha

机构 * Department of Computer Science and Engineering, IIT Patna, India(印度帕纳大学计算机科学与工程系) Stanford University(斯坦福大学) Amazon AI(亚马逊人工智能) Indian Institute of Technology Patna, India(印度帕纳大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI;visual language model(comments)

Comments One of the first survey on Visual Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18985 2025-07-30 cs.CV cs.AI 84%

GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models

Guanxi Shen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Keywords: Explainable Computer Vision, Large Vision-Language Models, AI Interpretability, Explainable AI, Visual Saliency, Attribution Maps, Cross-Modal Attribution, Human Attention Alignment, AI Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17519 2024-09-27 cs.RO cs.AI cs.CV 84%

Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization

Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa, Kei Okada, Masayuki Inaba

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI;VLM(comments)

Comments Accepted at Advanced Robotics, website - https://haraduka.github.io/vlm-bbo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14882 2024-04-16 cs.CL cs.AI cs.CV 84%

Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering

Xingyu Fu, Ben Zhou, Sihao Chen, Mark Yatskar, Dan Roth

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Multimodal, Visual Question Answering, Vision and Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09265 2023-06-16 cs.CV cs.AI 84%

LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models

Peng Xu, Wenqi Shao, Kaipeng Zhang, Peng Gao, Shuo Liu, Meng Lei, Fanqing Meng, Siyuan Huang, Yu Qiao, Ping Luo

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 10 figures, a comprehensive evaluation of large vision-language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07533 2026-08-11 cs.AI cs.SE 新提交 84%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);分类 cs.AI

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24354 2026-07-28 cs.AI 新提交 84%

Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization

提示优化器是盲目运行的吗?用于自动提示优化的跨模态视觉反馈

Haoyue Liu, Xiaoyu Ma, Ye Chen, Yuexian Zou, Xiaoying Tang

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 研究多模态任务中自动提示优化的盲目性问题,提出跨模态视觉反馈方法,含故障条件视觉诊断和错误感知聚合阶段,在多个VQA数据集和目标VLM上效果显著,能提升分数且优化器可跨模型转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21693 2026-07-21 cs.AI 版本更新 84%

Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain

医学VQA中通过置信度-证据贝叶斯增益实现确定性幻觉检测

Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli

机构 * Department of Electrical Engineering, Stanford University, CA, USA(电气工程系,斯坦福大学) Department of Biology, Stanford University, CA, USA(生物学系,斯坦福大学) Division of Cardiology, Department of Medicine, Stanford University, CA, USA(心脏病学部,医学系,斯坦福大学) Department of Biomedical Data Science, Stanford University, CA, USA(生物医学数据科学系,斯坦福大学) Department of Computer Science, Stanford University, CA, USA(计算机科学系,斯坦福大学) Department of Psychiatry and Behavioral Sciences, Stanford University, CA, USA(精神病学与行为科学系,斯坦福大学)

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CEBaG方法,利用模型自身log概率中的不一致置信度和弱视觉证据敏感性,实现无需随机采样和外部模型的确定性幻觉检测,在医疗MLLM和VQA基准测试中取得最佳AUC表现。

详情

展开后加载摘要…

URL PDF HTML 收藏