arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2511.01213 2025-11-04 cs.CV cs.AI 81%

Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering

Riddhi Jain, Manasi Patwardhan, Parijat Deshpande, Venkataramana Runkana

机构 * TCS-Research(TCS研究)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23344 2025-09-30 cs.CV cs.AI 81%

DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice

Zijie Meng, Jin Hao, Xiwei Dai, Yang Feng, Jiaxiang Liu, Bin Feng, Huikai Wu, Xiaotang Gai, Hengchuan Zhu, Tianxiang Hu, Yangyang Wu, Hongxia Xu, Jin Li, Jun Xiao, Xiaoqiang Liu, Joey Tianyi Zhou, Fudong Zhu, Zhihe Zhao, Lunguo Xia, Bing Fang, Jimeng Sun, Jian Wu, Zuozhu Liu

机构 * Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Zhejiang University, Hangzhou(牙科医院,口腔医学院,浙江大学医学院,浙江大学,杭州) College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University, Hangzhou(计算机科学与技术学院,浙江大学-伊利诺伊大学 Urbana-Champaign 院,浙江大学,杭州) Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University School of Medicine(正畸科,上海第九人民医院,口腔医学院,上海交通大学医学院) Angelalign Technology Inc.(Angelalign 技术公司)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20884 2025-09-26 cs.CV cs.AI 81%

Integrating Object Interaction Self-Attention and GAN-Based Debiasing for Visual Question Answering

Zhifei Li, Feng Qiu, Yiran Wang, Yujing Xia, Kui Xiao, Miao Zhang, Yan Zhang

机构 * School of Computer Science, Hubei University(湖北大学计算机学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 14 pages, 6 figures. ACCEPTED for publication as a REGULAR paper in the IEEE Transactions on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09159 2025-09-12 cs.CV cs.AI 81%

A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering

Zhiyue Liu, Sihang Liu, Jinyuan Liu, Xinru Zhang

机构 * School of Computer, Electronics and Information(计算机、电子与信息学院) Guangxi University(广西大学) Guangxi Key Laboratory of Multimedia Communications and Network Technology(广西多媒体通信与网络技术重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by the IEEE International Conference on Multimedia and Expo (ICME 2025) for oral presentation. © 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00102 2025-09-09 cs.CV cs.CL cs.LG 81%

ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?

Pragati Shuddhodhan Meshram, Swetha Karthikeyan, Bhavya Bhavya, Suma Bhat

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22369 2025-09-03 cs.CV cs.AI 81%

Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring

Sinh Trong Vu, Hieu Trung Pham, Dung Manh Nguyen, Hieu Minh Hoang, Nhu Hoang Le, Thu Ha Pham, Tai Tan Mai

机构 * Banking Academy of Vietnam(越南银行学院) Dublin City University(都柏林城市大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13184 2025-08-20 cs.LG cs.CV 81%

BERT-VQA: Visual Question Answering on Plots

Tai Vu, Robert Yang

机构 * Stanford University(斯坦福大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12430 2025-08-19 cs.CV cs.AI cs.CL 81%

Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations

Yahsin Yeh, Yilun Wu, Bokai Ruan, Honghan Shuai

机构 * National Yang Ming Chiao Tung University(阳明大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12036 2025-08-19 cs.CV cs.AI 81%

Q-FSRU: Quantum-Augmented Frequency-Spectral Fusion for Medical Visual Question Answering

Rakesh Thakur, Yusra Tariq

机构 * Amity Centre for Artificial Intelligence, Amity University, Noida(阿米蒂人工智能中心,阿米蒂大学,诺伊达)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 4 figures Submitted to AAAI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10869 2025-08-15 cs.CV cs.AI 81%

Medico 2025: Visual Question Answering for Gastrointestinal Imaging

Sushant Gautam, Vajira Thambawita, Michael Riegler, Pål Halvorsen, Steven Hicks

机构 * SimulaMet - Simula Metropolitan Center for Digital Engineering, Oslo, Norway(SimulaMet - Simula Metropolitan Center for Digital Engineering,挪威奥斯陆) Simula Research Laboratory, Oslo, Norway(Simula研究实验室,挪威奥斯陆) OsloMet - Oslo Metropolitan University, Oslo, Norway(OsloMet - 奥斯陆 Metropolitan 大学,挪威奥斯陆)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08137 2025-08-12 cs.LG cs.AI cs.SY eess.SY 81%

MuaLLM: A Multimodal Large Language Model Agent for Circuit Design Assistance with Hybrid Contextual Retrieval-Augmented Generation

Pravallika Abbineni, Saoud Aldowaish, Colin Liechty, Soroosh Noorzad, Ali Ghazizadeh, Morteza Fayazi

机构 * University of Utah(犹他大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21586 2025-08-08 cs.CL cs.AI cs.CV 81%

Can Vision Language Models Understand Mimed Actions?

Hyundong Cho, Spencer Lin, Tejas Srinivasan, Michael Saxon, Deuksin Kwon, Natali T. Chavez, Jonathan May

机构 * Information Sciences Institute(信息科学研究所) Institute for Creative Technologies(创意技术研究所) Department of Computer Science(计算机科学系) University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Aristotle University of Thessaloniki(希腊雅典纳大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04469 2025-07-29 cs.CV cs.AI 81%

Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering

Imad Eddine Marouf, Enzo Tartaglione, Stephane Lathuiliere, Joost van de Weijer

机构 * LTCI, Télécom-Paris, Institut Polytechnique de Paris(LTCI, Télécom-Paris, Institut Polytechnique de Paris) Inria, LJK, Univ. Grenoble Alpes(Inria, LJK, 火车头 Grenoble Alpes) Universitat Autónoma de Barcelona(Autonomous University of Barcelona)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments ICCV 2025, 8 pages. Code: https://github.com/IemProg/QUAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08870 2025-07-01 cs.CL cs.AI cs.LG 81%

The Limited Impact of Medical Adaptation of Large Language and Vision-Language Models

Daniel P. Jeong, Pranav Mani, Saurabh Garg, Zachary C. Lipton, Michael Oberst

机构 * Carnegie Mellon University(卡内基梅隆大学) Abridge Mistral AI Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Extended version of EMNLP 2024 paper arXiv:2411.04118. Includes additional results on clinical note QA tasks and supervised fine-tuning evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18322 2025-06-24 cs.CV cs.LG 81%

Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?

Yiwei Yang, Chung Peng Lee, Shangbin Feng, Dora Zhao, Bingbing Wen, Anthony Z. Liu, Yulia Tsvetkov, Bill Howe

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17903 2025-06-24 cs.CV cs.AI 81%

Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases

Huanjia Zhu, Yishu Liu, Xiaozhao Fang, Guangming Lu, Bingzhi Chen

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong University of Technology(广东工业大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07855 2025-06-18 cs.CV cs.AI cs.CL 81%

Vision-Language Models for Edge Networks: A Comprehensive Survey

Ahmed Sharshar, Latif U. Khan, Waseem Ullah, Mohsen Guizani

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈德布兹泽德人工智能大学)

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.AI

Journal ref JIOT.2025.3579032

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23045 2025-05-30 cs.CV cs.AI 81%

Multi-Sourced Compositional Generalization in Visual Question Answering

Chuanhao Li, Wenbo Ye, Zhen Li, Yuwei Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19624 2025-05-27 cs.CV cs.AI 81%

Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat

Pusheng Xu, Xia Gong, Xiaolan Chen, Weiyi Zhang, Jiancheng Yang, Bingjie Yan, Meng Yuan, Yalin Zheng, Mingguang He, Danli Shi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21000 2025-05-13 eess.IV cs.AI cs.CV 81%

Efficient Bilinear Attention-based Fusion for Medical Visual Question Answering

Zhilin Zhang, Jie Wang, Zhanghao Qin, Ruiqi Zhu, Xiaoliang Gong

机构 * Tandon School of Engineering, New York University(纽约大学工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments To be published in 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01903 2025-04-30 cs.CV cs.CL cs.LG 81%

Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering

Zhou Yu, Xuecheng Ouyang, Zhenwei Shao, Meng Wang, Jun Yu

机构 * Key Laboratory of Complex Systems Modeling and Simulation, the School of Computer Science, Hangzhou Dianzi University(复杂系统建模与仿真重点实验室、计算机科学学院、杭州电子大学) HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子大学-ITMO联合学院) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院、合肥工业大学) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(智能科学与工程学院、哈尔滨工业大学深圳校区)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments An extended journal version of our CVPR 2023 paper, which has been accepted at IEEE T-PAMI 2025. The original conference version can be referred to as the v1 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17073 2025-04-23 cs.CV cs.AI 81%

Path-RAG: Knowledge-Guided Key Region Retrieval for Open-ended Pathology Visual Question Answering

Awais Naeem, Tianhao Li, Huang-Ru Liao, Jiawei Xu, Aby M. Mathew, Zehao Zhu, Zhen Tan, Ajay Kumar Jaiswal, Raffi A. Salibian, Ziniu Hu, Tianlong Chen, Ying Ding

专题命中 视觉问答 :visual question answering(title);LLaVA(abstract);分类 cs.CV、cs.AI

Journal ref Proceedings of Machine Learning Research, Volume 259, 2025, pp. 735--746

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03135 2025-04-11 cs.CV cs.AI 81%

Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion

Junkai Zhang, Bin Li, Shoujun Zhou, Yue Du

机构 * School of Artificial Intelligence, Tiangong University(天津工业大学人工智能学院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Linying Medical Technology (Shenzhen) Co., Ltd.(临影医疗科技(深圳)有限公司)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05575 2025-04-09 cs.CV cs.LG 81%

A Lightweight Large Vision-language Model for Multimodal Medical Images

Belal Alsinglawi, Chris McCarthy, Sara Webb, Christopher Fluke, Navid Toosy Saidy

机构 * Swinburne University of Technology(斯威本科技大学) PropelHealthAI

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.LG

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06667 2025-03-26 cs.CV cs.AI cs.CL 81%

Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video

Bin Li, Yixuan Weng, Bin Sun, Shutao Li

机构 * College of Electrical and Information Engineering, Hunan University(湖南大学电气与信息工程学院)

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13938 2025-03-24 cs.CV cs.AI 81%

ChatBEV: A Visual Language Model that Understands BEV Maps

Qingyao Xu, Siheng Chen, Guang Chen, Yanfeng Wang, Ya Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 视觉问答 :visual language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21259 2025-03-07 cs.CV cs.AI 81%

AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Han Bao, Yue Huang, Yanbo Wang, Jiayi Ye, Xiangqi Wang, Xiuying Chen, Yue Zhao, Tianyi Zhou, Mohamed Elhoseiny, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院公园分校) KAUST(阿卜杜拉国王科技大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02157 2025-03-05 cs.CV cs.AI 81%

MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models

Aofei Chang, Le Huang, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, Cao Xiao

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) GE Healthcare(GE医疗)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20903 2025-03-05 cs.CV cs.AI 81%

WalkVLM:Aid Visually Impaired People Walking by Vision Language Model

Zhiqiang Yuan, Ting Zhang, Ying Deng, Jiapei Zhang, Yeshuang Zhu, Zexi Jia, Jie Zhou, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯公司微信AI模式识别中心)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15589 2025-03-04 cs.CV cs.LG 81%

Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models

Amir Mohammad Karimi Mamaghan, Samuele Papa, Karl Henrik Johansson, Stefan Bauer, Andrea Dittadi

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) University of Amsterdam(阿姆斯特丹大学) Digital Futures(数字未来机构) Helmholtz AI(亥姆霍兹人工智能研究所) Technical University of Munich(慕尼黑工业大学) MPI for Intelligent Systems, Tübingen(蒂宾根马克斯·普朗克智能系统研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏