arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3138 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3138 篇

2508.12036 2025-08-19 cs.CV cs.AI 81%

Q-FSRU: Quantum-Augmented Frequency-Spectral Fusion for Medical Visual Question Answering

Rakesh Thakur, Yusra Tariq

机构 * Amity Centre for Artificial Intelligence, Amity University, Noida(阿米蒂人工智能中心,阿米蒂大学,诺伊达)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 4 figures Submitted to AAAI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10869 2025-08-15 cs.CV cs.AI 81%

Medico 2025: Visual Question Answering for Gastrointestinal Imaging

Sushant Gautam, Vajira Thambawita, Michael Riegler, Pål Halvorsen, Steven Hicks

机构 * SimulaMet - Simula Metropolitan Center for Digital Engineering, Oslo, Norway(SimulaMet - Simula Metropolitan Center for Digital Engineering,挪威奥斯陆) Simula Research Laboratory, Oslo, Norway(Simula研究实验室,挪威奥斯陆) OsloMet - Oslo Metropolitan University, Oslo, Norway(OsloMet - 奥斯陆 Metropolitan 大学,挪威奥斯陆)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08137 2025-08-12 cs.LG cs.AI cs.SY eess.SY 81%

MuaLLM: A Multimodal Large Language Model Agent for Circuit Design Assistance with Hybrid Contextual Retrieval-Augmented Generation

Pravallika Abbineni, Saoud Aldowaish, Colin Liechty, Soroosh Noorzad, Ali Ghazizadeh, Morteza Fayazi

机构 * University of Utah(犹他大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21586 2025-08-08 cs.CL cs.AI cs.CV 81%

Can Vision Language Models Understand Mimed Actions?

Hyundong Cho, Spencer Lin, Tejas Srinivasan, Michael Saxon, Deuksin Kwon, Natali T. Chavez, Jonathan May

机构 * Information Sciences Institute(信息科学研究所) Institute for Creative Technologies(创意技术研究所) Department of Computer Science(计算机科学系) University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Aristotle University of Thessaloniki(希腊雅典纳大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04469 2025-07-29 cs.CV cs.AI 81%

Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering

Imad Eddine Marouf, Enzo Tartaglione, Stephane Lathuiliere, Joost van de Weijer

机构 * LTCI, Télécom-Paris, Institut Polytechnique de Paris(LTCI, Télécom-Paris, Institut Polytechnique de Paris) Inria, LJK, Univ. Grenoble Alpes(Inria, LJK, 火车头 Grenoble Alpes) Universitat Autónoma de Barcelona(Autonomous University of Barcelona)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments ICCV 2025, 8 pages. Code: https://github.com/IemProg/QUAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08870 2025-07-01 cs.CL cs.AI cs.LG 81%

The Limited Impact of Medical Adaptation of Large Language and Vision-Language Models

Daniel P. Jeong, Pranav Mani, Saurabh Garg, Zachary C. Lipton, Michael Oberst

机构 * Carnegie Mellon University(卡内基梅隆大学) Abridge Mistral AI Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Extended version of EMNLP 2024 paper arXiv:2411.04118. Includes additional results on clinical note QA tasks and supervised fine-tuning evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18322 2025-06-24 cs.CV cs.LG 81%

Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?

Yiwei Yang, Chung Peng Lee, Shangbin Feng, Dora Zhao, Bingbing Wen, Anthony Z. Liu, Yulia Tsvetkov, Bill Howe

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17903 2025-06-24 cs.CV cs.AI 81%

Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases

Huanjia Zhu, Yishu Liu, Xiaozhao Fang, Guangming Lu, Bingzhi Chen

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong University of Technology(广东工业大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07855 2025-06-18 cs.CV cs.AI cs.CL 81%

Vision-Language Models for Edge Networks: A Comprehensive Survey

Ahmed Sharshar, Latif U. Khan, Waseem Ullah, Mohsen Guizani

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈德布兹泽德人工智能大学)

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.AI

Journal ref JIOT.2025.3579032

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23045 2025-05-30 cs.CV cs.AI 81%

Multi-Sourced Compositional Generalization in Visual Question Answering

Chuanhao Li, Wenbo Ye, Zhen Li, Yuwei Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19624 2025-05-27 cs.CV cs.AI 81%

Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat

Pusheng Xu, Xia Gong, Xiaolan Chen, Weiyi Zhang, Jiancheng Yang, Bingjie Yan, Meng Yuan, Yalin Zheng, Mingguang He, Danli Shi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21000 2025-05-13 eess.IV cs.AI cs.CV 81%

Efficient Bilinear Attention-based Fusion for Medical Visual Question Answering

Zhilin Zhang, Jie Wang, Zhanghao Qin, Ruiqi Zhu, Xiaoliang Gong

机构 * Tandon School of Engineering, New York University(纽约大学工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments To be published in 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01903 2025-04-30 cs.CV cs.CL cs.LG 81%

Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering

Zhou Yu, Xuecheng Ouyang, Zhenwei Shao, Meng Wang, Jun Yu

机构 * Key Laboratory of Complex Systems Modeling and Simulation, the School of Computer Science, Hangzhou Dianzi University(复杂系统建模与仿真重点实验室、计算机科学学院、杭州电子大学) HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子大学-ITMO联合学院) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院、合肥工业大学) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(智能科学与工程学院、哈尔滨工业大学深圳校区)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments An extended journal version of our CVPR 2023 paper, which has been accepted at IEEE T-PAMI 2025. The original conference version can be referred to as the v1 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17073 2025-04-23 cs.CV cs.AI 81%

Path-RAG: Knowledge-Guided Key Region Retrieval for Open-ended Pathology Visual Question Answering

Awais Naeem, Tianhao Li, Huang-Ru Liao, Jiawei Xu, Aby M. Mathew, Zehao Zhu, Zhen Tan, Ajay Kumar Jaiswal, Raffi A. Salibian, Ziniu Hu, Tianlong Chen, Ying Ding

专题命中 视觉问答 :visual question answering(title);LLaVA(abstract);分类 cs.CV、cs.AI

Journal ref Proceedings of Machine Learning Research, Volume 259, 2025, pp. 735--746

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03135 2025-04-11 cs.CV cs.AI 81%

Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion

Junkai Zhang, Bin Li, Shoujun Zhou, Yue Du

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05575 2025-04-09 cs.CV cs.LG 81%

A Lightweight Large Vision-language Model for Multimodal Medical Images

Belal Alsinglawi, Chris McCarthy, Sara Webb, Christopher Fluke, Navid Toosy Saidy

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.LG

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06667 2025-03-26 cs.CV cs.AI cs.CL 81%

Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video

Bin Li, Yixuan Weng, Bin Sun, Shutao Li

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13938 2025-03-24 cs.CV cs.AI 81%

ChatBEV: A Visual Language Model that Understands BEV Maps

Qingyao Xu, Siheng Chen, Guang Chen, Yanfeng Wang, Ya Zhang

专题命中 视觉问答 :visual language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21259 2025-03-07 cs.CV cs.AI 81%

AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Han Bao, Yue Huang, Yanbo Wang, Jiayi Ye, Xiangqi Wang, Xiuying Chen, Yue Zhao, Tianyi Zhou, Mohamed Elhoseiny, Xiangliang Zhang

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02157 2025-03-05 cs.CV cs.AI 81%

MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models

Aofei Chang, Le Huang, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, Cao Xiao

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20903 2025-03-05 cs.CV cs.AI 81%

WalkVLM:Aid Visually Impaired People Walking by Vision Language Model

Zhiqiang Yuan, Ting Zhang, Ying Deng, Jiapei Zhang, Yeshuang Zhu, Zexi Jia, Jie Zhou, Jinchao Zhang

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15589 2025-03-04 cs.CV cs.LG 81%

Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models

Amir Mohammad Karimi Mamaghan, Samuele Papa, Karl Henrik Johansson, Stefan Bauer, Andrea Dittadi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07594 2025-01-09 cs.CL cs.AI cs.CV cs.MM 81%

How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model

Shezheng Song, Xiaopeng Li, Shasha Li, Shan Zhao, Jie Yu, Jun Ma, Xiaoguang Mao, Weimin Zhang

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03795 2024-12-03 cs.CV cs.AI 81%

VQA$^2$: Visual Question Answering for Video Quality Assessment

Ziheng Jia, Zicheng Zhang, Jiaying Qian, Haoning Wu, Wei Sun, Chunyi Li, Xiaohong Liu, Weisi Lin, Guangtao Zhai, Xiongkuo Min

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 23 pages 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04118 2024-11-21 cs.CL cs.AI cs.LG 81%

Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?

Daniel P. Jeong, Saurabh Garg, Zachary C. Lipton, Michael Oberst

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments This version was published at EMNLP 2024 Main Conference as a Long Paper (Oral). See the extended version (arXiv:2411.08870) for additional results on QA tasks based on clinical notes and evaluations in the supervised fine-tuning regime

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07001 2024-11-07 cs.CL cs.AI cs.CV 81%

ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering

Yifan Wu, Lutao Yan, Leixian Shen, Yunhai Wang, Nan Tang, Yuyu Luo

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08798 2024-11-07 cs.AI cs.CV 81%

D3: Data Diversity Design for Systematic Generalization in Visual Question Answering

Amir Rahimi, Vanessa D'Amario, Moyuru Yamada, Kentaro Takemoto, Tomotake Sasaki, Xavier Boix

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments TMLR (https://openreview.net/forum?id=ZAin13msOp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00828 2024-11-05 cs.CV cs.LG 81%

Dreaming Out Loud: A Self-Synthesis Approach For Training Vision-Language Models With Developmentally Plausible Data

Badr AlKhamissi, Yingtian Tang, Abdülkadir Gökce, Johannes Mehrer, Martin Schrimpf

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted to BabyLM Challenge at CoNLL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00308 2024-11-05 cs.CV cs.AI 81%

From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities

Md Farhan Ishmam, Md Sakib Hossain Shovon, M. F. Mridha, Nilanjan Dey

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16662 2024-10-23 eess.IV cs.AI cs.CV 81%

Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective

Xiaolan Chen, Ruoyu Chen, Pusheng Xu, Weiyi Zhang, Xianwen Shang, Mingguang He, Danli Shi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏