arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2509.16476 2025-09-23 cs.CV 77%

Eye Gaze Tells You Where to Compute: Gaze-Driven Efficient VLMs

Qinyu Chen, Jiawen Qi

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04323 2025-09-15 cs.CV 77%

MedM-VL: What Makes a Good Medical LVLM?

Yiming Shi, Shaoshuai Yang, Xun Zhu, Haoyu Wang, Xiangling Fu, Miao Li, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08757 2025-09-11 cs.RO cs.CV 77%

SocialNav-SUB: Benchmarking VLMs for Scene Understanding in Social Robot Navigation

Michael J. Munje, Chen Tang, Shuijing Liu, Zichao Hu, Yifeng Zhu, Jiaxun Cui, Garrett Warnell, Joydeep Biswas, Peter Stone

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系) Army Research Laboratory(陆军研究实验室) Sony AI(索尼人工智能)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Conference on Robot Learning (CoRL) 2025 Project site: https://larg.github.io/socialnav-sub

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08715 2025-09-11 cs.CV 77%

BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion

Sike Xiang, Shuang Chen, Amir Atapour-Abarghouei

机构 * Department of Computer Science, Durham University(计算机科学系,杜伦大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03805 2025-09-05 cs.CL cs.AI 77%

Measuring How (Not Just Whether) VLMs Build Common Ground

Saki Imai, Mert İnan, Anthony Sicilia, Malihe Alikhani

机构 * Northeastern University(东北大学)

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19944 2025-09-03 cs.CV cs.CL 77%

KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts

Taebaek Hwang, Minseo Kim, Gisang Lee, Seonuk Kim, Hyunjun Eun

机构 * Waddle Seoul National University(首尔国立大学) Krafton UNIST(全南大学) SK Telecom(SK电信)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16763 2025-08-26 cs.CV 77%

WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation

Rabiul Awal, Mahsa Massoud, Aarash Feizi, Zichao Li, Suyuchen Wang, Christopher Pal, Aishwarya Agrawal, David Vazquez, Siva Reddy, Juan A. Rodriguez, Perouz Taslakian, Spandana Gella, Sai Rajeswar

机构 * ServiceNow Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) École de Technologie Supérieure (ETS)(高等技术学院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments This paper has been accepted to the EMNLP 2025 main conference. Check the project page here: https://webmmu-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22346 2025-07-31 cs.CV 77%

DeltaVLM: Interactive Remote Sensing Image Change Analysis via Instruction-guided Difference Perception

Pei Deng, Wenqian Zhou, Hanlin Wu

机构 * School of Information Science and Technology, Beijing Foreign Studies University(信息科学与技术学院,北京外国语大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 12 pages, 5 figures. Submitted to IEEE Transactions on Geoscience and Remote Sensing (TGRS). Code and dataset are available at https://github.com/hanlinwu/DeltaVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21585 2025-07-30 cs.AI 77%

SafeDriveRAG: Towards Safe Autonomous Driving with Knowledge Graph-based Retrieval-Augmented Generation

Hao Ye, Mengshi Qi, Zhaohong Liu, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12849 2025-06-17 cs.CV 77%

CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making

Songtao Jiang, Yuan Wang, Ruizhe Chen, Yan Zhang, Ruilin Luo, Bohan Lei, Sibo Song, Yang Feng, Jimeng Sun, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Angelalign Inc.(Angelalign公司) UIUC(伊利诺伊大学香槟分校)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11036 2025-06-16 cs.LG cs.MM 77%

Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification

Yang Qin, Chao Chen, Zhihang Fu, Dezhong Peng, Xi Peng, Peng Hu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) National Key Laboratory of Fundamental Algorithms and Models for Engineering Simulation, Sichuan University(四川大学国家工程仿真基础算法与模型重点实验室) Sichuan National Innovation New Vision UHD Video Technology Co., Ltd(四川国家创新新视觉超高清视频技术有限公司) Tianfu Jincheng Laboratory(天府锦城实验室)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20421 2025-06-12 cs.AI 77%

Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA

Qianqi Yan, Xuehai He, Xiang Yue, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07227 2025-06-10 cs.CV cs.CL 77%

Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning

Tianyi Bai, Yuxuan Fan, Jiantao Qiu, Fupeng Sun, Jiayi Song, Junlin Han, Zichen Liu, Conghui He, Wentao Zhang, Binhang Yuan

机构 * HKUST(香港科技大学) Shanghai AI Lab(上海人工智能实验室) Peking University(北京大学) HKUST(GZ)(香港科技大学(广州)) Oxford University(牛津大学) Imperial College London(伦敦帝国理工学院)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04983 2025-06-06 cs.CV 77%

TextVidBench: A Benchmark for Long Video Scene Text Understanding

Yangyang Zhong, Ji Qi, Yuan Yao, Pengxin Luo, Yunfeng Yan, Donglian Qi, Zhiyuan Liu, Tat-Seng Chua

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03505 2025-06-03 cs.CL cs.AI cs.DC 77%

Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation

Weiqi Feng, Yangrui Chen, Shaoyu Wang, Yanghua Peng, Haibin Lin, Minlan Yu

机构 * Harvard University(哈佛大学) Bytedance(字节跳动) University of Southern California(南加州大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15816 2025-05-13 cs.CV 77%

A Vision Centric Remote Sensing Benchmark

Abduljaleel Adejumo, Faegheh Yeganli, Clifford Broni-bediako, Aoran Xiao, Naoto Yokoya, Mennatullah Siam

机构 * AMMI/AIMS Senegal(AMMI/AIMS塞内加尔) University of British Columbia(不列颠哥伦比亚大学) RIKEN AIP(理化学研究所AIP) the University of Tokyo(东京大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Eval-FoMo2 Workshop in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10465 2025-04-15 cs.CV 77%

Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding

Tao Zhang, Xiangtai Li, Zilong Huang, Yanwei Li, Weixian Lei, Xueqing Deng, Shihao Chen, Shunping Ji, Jiashi Feng

机构 * Bytedance(字节跳动) WHU(武汉大学)

专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08583 2025-04-14 astro-ph.IM cs.LG 77%

AstroLLaVA: towards the unification of astronomical data and natural language

Sharaf Zaman, Michael J. Smith, Pranav Khetarpal, Rishabh Chakrabarty, Michele Ginolfi, Marc Huertas-Company, Maja Jabłońska, Sandor Kruk, Matthieu Le Lain, Sergio José Rodríguez Méndez, Dimitrios Tanoglidis

机构 * UniverseTBD Indian Institute of Technology Delhi(印度理工学院德里分校) Intelligent Internet Inc.(Intelligent Internet公司) University of Florence(佛罗伦萨大学) Instituto de Astrofísica de Canarias (IAC)(加那利群岛天体物理学研究所) Observatoire de Paris(巴黎天文台) PSL University(巴黎文理研究大学) Université Paris-Cité(巴黎城市大学) ANU RSAA(澳大利亚国立大学天体物理学与天体生物学研究学院) European Space Agency(欧洲空间局) IRISA(IRISA研究所) Université Bretagne Sud(南布列塔尼大学) ANU School of Computing(澳大利亚国立大学计算机学院)

专题命中 视觉问答 :vision language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.LG

Comments 8 pages, 3 figures, accepted to SCI-FM@ICLR 2025. Code at https://w3id.org/UniverseTBD/AstroLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21457 2025-03-28 cs.CV 77%

FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs

Xiaoqin Wang, Xusen Ma, Xianxu Hou, Meidan Ding, Yudong Li, Junliang Chen, Wenting Chen, Xiaoyang Peng, Linlin Shen

机构 * Shenzhen University(深圳大学) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) Sun Yat-sen University(中山大学)

专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08308 2025-03-12 cs.AI 77%

Seeing and Reasoning with Confidence: Supercharging Multimodal LLMs with an Uncertainty-Aware Agentic Framework

Zhuo Zhi, Chen Feng, Adam Daneshmend, Mine Orlu, Andreas Demosthenous, Lu Yin, Da Li, Ziquan Liu, Miguel R. D. Rodrigues

机构 * University College London(伦敦大学学院) National Health Service(英国国家医疗服务体系) University of Surrey(萨里大学) Samsung AI Centre(三星人工智能中心) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09325 2025-02-14 cs.CV 77%

A Benchmark for Crime Surveillance Video Analysis with Large Models

Haoran Chen, Dong Yi, Moyan Cao, Chensen Huang, Guibo Zhu, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15411 2024-11-26 cs.CV 77%

FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity

Hang Hua, Qing Liu, Lingzhi Zhang, Jing Shi, Zhifei Zhang, Yilin Wang, Jianming Zhang, Jiebo Luo

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12384 2024-11-12 cs.CV 77%

VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding

Xiang Li, Jian Ding, Mohamed Elhoseiny

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments Accepted for publication at NeruIPS 2024 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17610 2024-10-31 cs.CL cs.CV 77%

ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue

Zhangpu Li, Changhong Zou, Suxue Ma, Zhicheng Yang, Chen Du, Youbao Tang, Zhenjie Cao, Ning Zhang, Jui-Hsin Lai, Ruei-Sung Lin, Yuan Ni, Xingzhi Sun, Jing Xiao, Jieke Hou, Kai Zhang, Mei Han

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07917 2024-08-26 cs.AI cs.CL 77%

DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation

Anna C. Doris, Daniele Grandi, Ryan Tomich, Md Ferdous Alam, Mohammadmehdi Ataei, Hyunmin Cheong, Faez Ahmed

专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01081 2024-07-02 cs.CV cs.CL 77%

CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation

Yuxuan Wang, Yijun Liu, Fei Yu, Chen Huang, Kexin Li, Zhiguo Wan, Wanxiang Che

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17455 2024-06-17 cs.CV cs.CL 77%

CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers

Dachuan Shi, Chaofan Tao, Anyi Rao, Zhendong Yang, Chun Yuan, Jiaqi Wang

专题命中 视觉问答 :vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

Comments ICML 2024. Code: https://github.com/sdc17/CrossGET

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09933 2024-04-16 cs.CV 77%

HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision

Siddhant Bansal, Michael Wray, Dima Damen

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Project Page: https://sid2697.github.io/hoi-ref/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17306 2024-04-02 cs.AI 77%

Visual Hallucination: Definition, Quantification, and Prescriptive Remediations

Anku Rani, Vipula Rawte, Harshad Sharma, Neeraj Anand, Krishnav Rajbangshi, Amit Sheth, Amitava Das

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06791 2023-12-07 cs.CV 77%

InfMLLM: A Unified Framework for Visual-Language Tasks

Qiang Zhou, Zhibin Wang, Wei Chu, Yinghui Xu, Hao Li, Yuan Qi

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 8

详情

展开后加载摘要…

URL PDF HTML 收藏