arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2602.02185 2026-03-03 cs.CV cs.AI cs.CL cs.LG 82%

Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索

Yu Zeng, Wenxuan Huang, Zhen Fang, Shuang Chen, Yufan Shen, Yishuo Cai, Xiaoman Wang, Zhenfei Yin, Lin Chen, Zehui Chen, Shiting Huang, Yiming Zhao, Xu Tang, Yao Hu, Philip Torr, Wanli Ouyang, Shaosheng Cao

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18053 2026-02-17 cs.RO 82%

V2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughts

V2V-GoT: 基于多模态大语言模型和思维图的车对车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Yu-Chiang Frank Wang, Min-Hung Chen, Stephen F. Smith

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文提出V2V-GoT框架,结合多模态大语言模型和图-思维方法,提升车对车协同自动驾驶的感知、预测和规划能力。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vgot.github.io/ Code: https://github.com/eddyhkchiu/V2V-GoT Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03328 2025-11-06 cs.CL cs.AI cs.CV cs.LG 82%

Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks

Jindong Hong, Tianjie Chen, Lingjie Luo, Chuanyang Zheng, Ting Xu, Haibao Yu, Jianing Qiu, Qianzhong Chen, Suning Huang, Yan Xu, Yong Gui, Yijun He, Jiankai Sun

机构 * Bytedance(字节跳动) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23759 2025-09-18 cs.CL cs.AI cs.CV cs.LG 82%

Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint

Heekyung Lee, Jiaxin Ge, Tsung-Han Wu, Minwoo Kang, Trevor Darrell, David M. Chan

机构 * POSTECH University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19455 2025-09-12 cs.CV cs.AI cs.LG 82%

MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering

Xu Li, Fan Lyu

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学克劳尔计算机科学学院) New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07084 2025-09-12 cs.RO 82%

DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models

Shucheng Huang, Freda Shi, Chen Sun, Jiaming Zhong, Minghao Ning, Yufeng Yang, Yukun Lu, Hong Wang, Amir Khajepour

机构 * MVSLab, Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系MVSLab) CompLING Lab, David R. Cheriton School of Computer Science, University of Waterloo(滑铁卢大学大卫·R·切里顿计算机科学学院CompLING Lab) Department of Data and Systems Engineering, University of Hong Kong(香港大学数据与系统工程系) Department of Mechanical Engineering, University of New Brunswick(新不伦瑞克大学机械工程系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract)

Comments This work has been accepted to IEEE Transactions on Vehicular Technology. Please refer to the copyright notice for additional information

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02357 2025-07-04 cs.CL 82%

Coling-UniA at SciVQA 2025: Few-Shot Example Retrieval and Confidence-Informed Ensembling for Multimodal Large Language Models

Christian Jaumann, Annemarie Friedrich, Rainer Lienhart

机构 * University of Augsburg(奥格斯堡大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract)

Comments Accepted at 5th Workshop on Scholarly Document Processing @ ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21755 2025-06-24 cs.CV cs.AI cs.CL cs.LG 82%

FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering

Chengyue Huang, Brisa Maneechotesuwan, Shivang Chopra, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18491 2025-06-12 cs.CL 82%

MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering

Shuo Yang, Siwen Luo, Soyeon Caren Han, Eduard Hovy

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract)

Comments Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06141 2025-06-05 cs.CV cs.AI cs.CL cs.LG 82%

MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization

Kangyu Zhu, Peng Xia, Yun Li, Hongtu Zhu, Sheng Wang, Huaxiu Yao

机构 * UNC Chapel-Hill(UNC夏洛特-希尔分校) Brown University(布朗大学) University of Washington(华盛顿大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03854 2025-06-02 cs.CL 82%

Vision-Language Models Struggle to Align Entities across Modalities

Iñigo Alonso, Gorka Azkune, Ander Salaberria, Jeremy Barnes, Oier Lopez de Lacalle

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract)

Comments Accepted Findings ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11193 2025-05-21 cs.CL 82%

MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model

Jiahao Huo, Yibo Yan, Boren Hu, Yutao Yue, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tongji University(同济大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract)

Comments Accepted by the Main Conference of Empirical Methods in Natural Language Processing (EMNLP) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12287 2025-03-24 cs.CL 82%

CUE-M: Contextual Understanding and Enhanced Search with Multimodal Large Language Model

Dongyoung Go, Taesun Whang, Chanhee Lee, Hwa-Yeon Kim, Sunghoon Park, Seunghwan Ji, Jinho Kim, Dongchan Kim, Young-Bum Kim

机构 * Naver Corp(Naver公司) Naver Search(Naver搜索)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract)

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14827 2025-03-05 cs.CV cs.AI cs.ET cs.LG 82%

Exploring Advanced Techniques for Visual Question Answering: A Comprehensive Comparison

Aiswarya Baby, Tintu Thankom Koshy

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages, No figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02104 2024-12-04 cs.CL 82%

Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey

Yunkai Dang, Kaichen Huang, Jiahao Huo, Yibo Yan, Sirui Huang, Dongrui Liu, Mengxi Gao, Jie Zhang, Chen Qian, Kun Wang, Yong Liu, Jing Shao, Hui Xiong, Xuming Hu

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13565 2024-11-13 cs.CV cs.AI cs.CL cs.LG 82%

Exploring Diverse Methods in Visual Question Answering

Panfeng Li, Qikai Yang, Xieming Geng, Wenjing Zhou, Zhicheng Ding, Yi Nian

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by 2024 5th International Conference on Electronic Communication and Artificial Intelligence

Journal ref Proceedings of the 2024 5th International Conference on Electronic Communication and Artificial Intelligence (ICECAI), 2024, pp. 681-685

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21220 2024-10-29 cs.CV cs.AI cs.IR cs.LG 82%

Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Zhixin Zhang, Yiyuan Zhang, Xiaohan Ding, Xiangyu Yue

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code is available at https://github.com/cnzzx/VSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16664 2024-10-24 cs.IR 82%

LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery

Yuyang Du, Kexin Chen, Yue Zhan, Chang Han Low, Tao You, Mobarakol Islam, Ziyu Guo, Yueming Jin, Guangyong Chen, Pheng-Ann Heng

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract)

Comments This paper has been accapted by 2024 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05131 2024-10-18 cs.LG cs.AI cs.CL cs.CV cs.CY 82%

RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models

Peng Xia, Kangyu Zhu, Haoran Li, Hongtu Zhu, Yun Li, Gang Li, Linjun Zhang, Huaxiu Yao

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments EMNLP 2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19339 2024-10-08 cs.CL cs.AI cs.CV cs.LG 82%

Visual Question Decomposition on Multimodal Large Language Models

Haowei Zhang, Jianzhe Liu, Zhen Han, Shuo Chen, Bailan He, Volker Tresp, Zhiqiang Xu, Jindong Gu

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to EMNLP2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10108 2024-09-04 cs.CV cs.AI cs.LG 82%

Privacy-Aware Document Visual Question Answering

Rubèn Tito, Khanh Nguyen, Marlon Tobaben, Raouf Kerkouche, Mohamed Ali Souibgui, Kangsoo Jung, Joonas Jälkö, Vincent Poulain D'Andecy, Aurelie Joseph, Lei Kang, Ernest Valveny, Antti Honkela, Mario Fritz, Dimosthenis Karatzas

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 35 pages, 12 figures, accepted for publication at the 18th International Conference on Document Analysis and Recognition, ICDAR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15050 2024-06-24 cs.LG cs.AI cs.CL cs.CV 82%

Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis

Lin Fan, Xun Gong, Cenyang Zheng, Yafei Ou

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01402 2024-06-04 cs.CV cs.AI cs.LG 82%

Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering

Tao Li, Linjun Shou, Xuejun Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10226 2024-04-17 cs.AI cs.CL cs.CV cs.LG 82%

Find The Gap: Knowledge Base Reasoning For Visual Question Answering

Elham J. Barezi, Parisa Kordjamshidi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04514 2024-04-09 cs.CL 82%

Joint Visual and Text Prompting for Improved Object-Centric Perception with Multimodal Large Language Models

Songtao Jiang, Yan Zhang, Chenyi Zhou, Yeying Jin, Yang Feng, Jian Wu, Zuozhu Liu

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03574 2024-04-05 cs.CV cs.AI cs.LG 82%

TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices

Hasib-Al Rashid, Argho Sarkar, Aryya Gangopadhyay, Maryam Rahnemoonfar, Tinoosh Mohsenin

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as a full paper by the tinyML Research Symposium 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14783 2024-03-25 cs.CV cs.AI cs.CL cs.LG cs.MA 82%

Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering

Bowen Jiang, Zhijun Zhuang, Shreyas S. Shivakumar, Dan Roth, Camillo J. Taylor

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments A full version of the paper will be released soon. The codes are available at https://github.com/bowen-upenn/Multi-Agent-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12728 2024-03-05 cs.CV cs.AI cs.CL cs.IR cs.LG 82%

Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering

Junnan Dong, Qinggang Zhang, Huachi Zhou, Daochen Zha, Pai Zheng, Xiao Huang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 8 pages,3 figures and 1 page appendix; The processed graphs and codes will be avalibale

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15933 2024-02-27 cs.CV cs.AI cs.CL cs.LG 82%

Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA

Wentao Mo, Yang Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments To be published in AAAI 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07384 2024-02-13 cs.CV cs.AI cs.LG 82%

Exploring Perceptual Limitation of Multimodal Large Language Models

Jiarui Zhang, Jinyi Hu, Mahyar Khayatkhoei, Filip Ilievski, Maosong Sun

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 14 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏