arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2406.17974 2025-09-23 cs.CL cs.CV 79%

Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts

Xuyang Wu, Yuan Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) DOCOMO Innovations, Inc.(DOCOMO创新公司) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14886 2025-09-19 cs.CL cs.AI 79%

A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation

Ye Shen, Junying Wang, Farong Wen, Yijin Guo, Qi Jia, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 视觉问答 :MLLM(title,abstract);分类 cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06010 2025-09-09 cs.CV 79%

BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users

Wanyin Cheng, Zanxi Ruan

机构 * School of Cyber Science and Engineering, Qufu Normal University(网络科学与工程学院,曲阜师范大学) Department of Computer Science, University of Verona(计算机科学系,威尼斯大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04502 2025-09-08 cs.CL cs.AI 79%

VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples

Qixin Sun, Ziqin Wang, Hengyuan Zhao, Yilin Li, Kaiyou Song, Linjiang Huang, Xiaolin Hu, Qingpei Guo, Si Liu

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19887 2025-08-28 cs.CL cs.CV 79%

Bangla-Bayanno: A 52K-Pair Bengali Visual Question Answering Dataset with LLM-Assisted Translation Refinement

Mohammed Rakibul Hasan, Rafi Majid, Ahanaf Tahmid

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12404 2025-08-19 cs.CV 79%

LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving

Nan Song, Bozhou Zhang, Xiatian Zhu, Jiankang Deng, Li Zhang

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments 7 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05262 2025-08-15 cs.CV 79%

Debiasing Multimodal Large Language Models via Penalization of Language Priors

YiFan Zhang, Yang Shi, Weichen Yu, Qingsong Wen, Xue Wang, Wenjing Yang, Zhang Zhang, Liang Wang, Rong Jin

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Alibaba Group(阿里巴巴集团) National University of Defense Technology(国防科技大学) Meta

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00549 2025-08-11 cs.CV 79%

Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images

Daniel Wolf, Heiko Hillenhagen, Billurvan Taskin, Alex Bäuerle, Meinrad Beer, Michael Götz, Timo Ropinski

机构 * Visual Computing Group, Institute of Media Informatics, Ulm University, Germany(媒体信息研究所视觉计算组,乌尔姆大学,德国) Diagnostic and Interventional Radiology, Ulm University Medical Center, Germany(乌尔姆大学医学中心诊断与介入放射学) Axiom Bio, USA(Axiom Bio公司,美国)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at the International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18351 2025-08-08 cs.CL cs.AI 79%

Multi-Agents Based on Large Language Models for Knowledge-based Visual Question Answering

Zhongjian Hu, Peng Yang, Bing Li, Zhenqi Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

Comments We would like to withdraw this submission due to ongoing internal review and coordination among the author team. Upon the supervisor's recommendation, we have decided to delay public dissemination until the manuscript undergoes further refinement and aligns with our intended academic trajectory

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16936 2025-08-08 cs.CL cs.AI 79%

Rationale-guided Prompting for Knowledge-based Visual Question Answering

Zhongjian Hu, Peng Yang, Bing Li, Fengyuan Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

Comments We would like to withdraw this submission due to ongoing internal review and coordination among the author team. Upon the supervisor's recommendation, we have decided to delay public dissemination until the manuscript undergoes further refinement and aligns with our intended academic trajectory

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17050 2025-07-24 cs.CV 79%

Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models

Tz-Ying Wu, Tahani Trigui, Sharath Nittur Sridhar, Anand Bodas, Subarna Tripathi

机构 * Intel(英特尔)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted to CVAM Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11200 2025-07-21 cs.CV 79%

How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study

Che Liu, Jiazhen Pan, Weixiang Shen, Wenjia Bai, Daniel Rueckert, Rossella Arcucci

机构 * Imperial College London, UK(伦敦帝国学院) Technical University of Munich, Germany(慕尼黑技术大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08036 2025-07-15 cs.CL cs.CV 79%

Barriers in Integrating Medical Visual Question Answering into Radiology Workflows: A Scoping Review and Clinicians' Insights

Deepali Mishra, Chaklam Silpasuwanchai, Ashutosh Modi, Madhumita Sushil, Sorayouth Chumnanvej

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments 29 pages, 5 figures (1 in supplementary), 3 tables (1 in main text, 2 in supplementary). Scoping review and clinician survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04333 2025-07-08 cs.CV cs.CL 79%

Computed Tomography Visual Question Answering with Cross-modal Feature Graphing

Yuanhe Tian, Chen Su, Junwen Duan, Yan Song

机构 * University of Washington(华盛顿大学) University of Science and Technology of China(中国科学技术大学) Central South University(中南大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10798 2025-07-01 cs.CV 79%

Object Retrieval for Visual Question Answering with Outside Knowledge

Shichao Kan, Yuhai Deng, Jiale Fu, Lihui Cen, Zhe Qu, Linna Zhang, Yixiong Liang, Yigang Cen

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) School of Automation, Central South University(中南大学自动化学院) Dundee International Institute, Central South University(中南大学邓迪国际学院) College of Mechanical Engineering, Guizhou University(贵州大学机械工程学院) Institute of Information Science, School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院信息科学研究所) Beijing Key Laboratory of Advanced Information Science and Network Technology(北京高级信息科学与网络技术重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20362 2025-06-30 cs.CV 79%

Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding

Joao Pereira, Vasco Lopes, David Semedo, Joao Neves

机构 * DeepNeuronic NOVA LINCS, University of Beira Interior(NOVA LINCS,贝拉内里大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19367 2025-06-30 cs.CV 79%

VGAT: A Cancer Survival Analysis Framework Transitioning from Generative Visual Question Answering to Genomic Reconstruction

Zizhi Chen, Minghao Han, Xukun Zhang, Shuwei Ma, Tao Liu, Xing Wei, Lihua Zhang

机构 * 1 Academy for Engineering Technology, Fudan University, Shanghai, China 2 Institute of Metaverse \& Intelligent Medicine, Fudan University, Shanghai, China 3 Engineering Research Center of AI 4 Jilin Provincial Key Laboratory of Intelligence Science

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03896 2025-06-11 cs.CV 79%

Multimodal Rationales for Explainable Visual Question Answering

Kun Li, George Vosselman, Michael Ying Yang

机构 * University of Twente(特文特大学) University of Bath(巴斯大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to CVPR workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14991 2025-06-03 cs.CV cs.CL 79%

ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla

Deeparghya Dutta Barua, Md Sakib Ul Rahman Sourove, Md Fahim, Fabiha Haider, Fariha Tanjim Shifat, Md Tasmim Rahman Adib, Anam Borhan Uddin, Md Farhan Ishmam, Md Farhad Alam

专题命中 视觉问答 :visual question answering(title);vision language model(abstract);分类 cs.CV

Comments Accepted in ECML PKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11718 2025-06-02 cs.CL cs.CV 79%

"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models

Jihao Gu, Yingyao Wang, Pi Bu, Chen Wang, Ziming Wang, Tengtao Song, Donglai Wei, Jiale Yuan, Yingxiu Zhao, Yancheng He, Shilong Li, Jiaheng Liu, Meng Cao, Jun Song, Yingshui Tan, Xiang Li, Wenbo Su, Zhicheng Zheng, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV

Comments 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11051 2025-05-28 cs.CL cs.AI 79%

MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models

Jiahao Huo, Yibo Yan, Xu Zheng, Yuanhuiyi Lyu, Xin Zou, Zhihua Wei, Xuming Hu

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted as ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17625 2025-05-26 cs.CL cs.CV 79%

Enhancing Large Vision-Language Models with Layout Modality for Table Question Answering on Japanese Annual Securities Reports

Hayato Aida, Kosuke Takahashi, Takahiro Omi

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at IIAI AAI 2025, the 3rd International Conference on Computational and Data Sciences in Economics and Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16209 2025-05-26 cs.CV 79%

MedCFVQA: A Causal Approach to Mitigate Modality Preference Bias in Medical Visual Question Answering

Shuchang Ye, Usman Naseem, Mingyuan Meng, Dagan Feng, Jinman Kim

机构 * The University of Sydney(悉尼大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15928 2025-05-23 cs.CV cs.CL 79%

ViQAgent: Zero-Shot Video Question Answering via Agent with Open-Vocabulary Grounding Validation

Tony Montes, Fernando Lozano

机构 * The Department of Electrical and Electronics Engineering(电气与电子工程系) Universidad de los Andes(亚利桑德大学)

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15401 2025-05-22 cs.CV 79%

Visual Question Answering on Multiple Remote Sensing Image Modalities

Hichem Boussaid, Lucrezia Tosato, Flora Weissgerber, Camille Kurtz, Laurent Wendling, Sylvain Lobry

机构 * LIPADE, Université Paris Cité, France(巴黎cité大学LIPADE研究所) ONERA, France(法国ONERA研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments EARTHVISION 2025 8 pages, 1 page of supplementary material, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00479 2025-05-22 cs.CV 79%

Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach

Zhilin Zhang, Fangyu Wu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments To be published in 2025 6th International Conference on Computer Vision and Computational Intelligence (CVCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14319 2025-05-20 cs.CV cs.MM 79%

Scene-Text Grounding for Text-Based Video Question Answering

Sheng Zhou, Junbin Xiao, Xun Yang, Peipei Song, Dan Guo, Angela Yao, Meng Wang, Tat-Seng Chua

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08084 2025-05-14 cs.CV 79%

Visually Interpretable Subtask Reasoning for Visual Question Answering

Yu Cheng, Arushi Goel, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) NVIDIA(英伟达)

专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18681 2025-05-08 cs.CV cs.CL 79%

RaDialog: A Large Vision-Language Model for Radiology Report Generation and Conversational Assistance

Chantal Pellegrini, Ege Özsoy, Benjamin Busam, Nassir Navab, Matthias Keicher

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted for publication at MIDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11733 2025-04-22 cs.CV 79%

DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment

Li Yu, Situo Wang, Wei Zhou, Moncef Gabbouj

机构 * School of Computer Science, Nanjing University of Information Science & Technology(信息科学技术南京大学计算机科学学院) Jiangsu Collaborative Innovation Center of Atmospheric Environment and Equipment Technology (CICAEET)(江苏省大气环境与装备技术协同创新中心) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学) Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,坦佩雷大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏