arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2504.03254 2025-04-07 cs.CV 79%

SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding

Yimin Wei, Aoran Xiao, Yexian Ren, Yuting Zhu, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

机构 * Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) RIKEN Center for Advanced Intelligence Project (AIP), RIKEN(理化学研究所先进智能研究中心) School of Electronics and Information Engineering, Nanjing University of Information Science and Technology(南京信息工程大学电子与信息工程学院) The School of Electronic and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18556 2025-03-25 cs.CV cs.CL 79%

Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models

Bin Li, Dehong Gao, Yeyuan Wang, Linbo Jin, Shanqing Yu, Xiaoyan Cai, Libin Yang

机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络空间安全学院) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学) Binjiang Institute of Artificial Intelligence(滨江人工智能研究院)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15035 2025-03-20 cs.AI cs.RO 79%

GraspCorrect: Robotic Grasp Correction via Vision-Language Model-Guided Feedback

Sungjae Lee, Yeonjoo Hong, Kwang In Kim

机构 * Graduate School of AI, POSTECH(浦项科技大学人工智能研究生院) Dept. of EE, POSTECH(浦项科技大学电气工程系)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13016 2025-03-18 cs.CV 79%

Efficient Motion-Aware Video MLLM

Zijia Zhao, Yuqi Huo, Tongtian Yue, Longteng Guo, Haoyu Lu, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 视觉问答 :MLLM(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08474 2025-03-18 cs.CV cs.CL 79%

SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models

Haotian Xia, Zhengbang Yang, Junbo Zou, Rhys Tracy, Yuqing Wang, Chi Lu, Christopher Lai, Yanjun He, Xun Shao, Zhuoqing Xie, Yuan-fang Wang, Weining Shen, Hanjie Chen

机构 * Rice University(莱斯大学) University of California, Irvine(加州大学欧文分校) George Mason University(乔治梅森大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Stanford University(斯坦福大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

Comments ICLR 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06492 2025-03-11 cs.CL cs.CV 79%

VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering

Yanling Wang, Yihan Zhao, Xiaodong Chen, Shasha Guo, Lixin Liu, Haoyang Li, Yong Xiao, Jing Zhang, Qi Li, Ke Xu

机构 * Zhongguancun Laboratory(中关村实验室) Renmin University of China(中国人民大学) Tencent(腾讯) Tsinghua University(清华大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12020 2025-03-06 cs.CV 79%

Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering

Jie Ma, Min Hu, Pinghui Wang, Wangchun Sun, Lingyun Song, Hongbin Pei, Jun Liu, Youtian Du

机构 * China Mobile System Integration Co., Ltd(中移系统集成有限公司) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16641 2025-02-25 cs.CV cs.CL cs.IR 79%

Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines

Xinwei Long, Zhiyuan Ma, Ermo Hua, Kaiyan Zhang, Biqing Qi, Bowen Zhou

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments AAAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12359 2025-02-19 cs.CV 79%

LanP: Rethinking the Impact of Language Priors in Large Vision-Language Models

Zongyu Wu, Yuwei Niu, Hongcheng Gao, Minhua Lin, Zhiwei Zhang, Zhifang Zhang, Qi Shi, Yilong Wang, Sike Fu, Junjie Xu, Junjie Ao, Enyan Dai, Lei Feng, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Singapore University of Technology and Design(新加坡科技设计大学) Peking University(北京大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02385 2025-02-13 cs.CV cs.CL 79%

Guiding Medical Vision-Language Models with Explicit Visual Prompts: Framework Design and Comprehensive Exploration of Prompt Variations

Kangyu Zhu, Ziyuan Qin, Huahui Yi, Zekun Jiang, Qicheng Lao, Shaoting Zhang, Kang Li

机构 * Sichuan University Pittsburgh Institute(四川大学匹兹堡学院) Beijing University of Posts and Telecommunications(北京邮电大学) Brown University(布朗大学) Case Western Reserve University(凯斯西储大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14877 2025-01-28 cs.CL cs.CV 79%

DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images

Sami Baral, Li Lucy, Ryan Knight, Alice Ng, Luca Soldaini, Neil T. Heffernan, Kyle Lo

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Berkeley(加州大学伯克利分校) Insource Services(Insource服务公司) Teaching Lab(教学实验室) Allen Institute for AI(艾伦人工智能研究所)

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV

Comments 19 pages, 10 figures, Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12697 2025-01-23 cs.CV 79%

Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering

Qian Tao, Xiaoyang Fan, Yong Xu, Xingquan Zhu, Yufei Tang

机构 * South China University of Technology(华南理工大学) Florida Atlantic University(佛罗里达大西洋大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07109 2025-01-14 cs.CV 79%

The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering

Anupam Pandey, Deepjyoti Bodo, Arpan Phukan, Asif Ekbal

机构 * IIT Patna(印度理工学院巴特那分校) IIT Jodhpur(印度理工学院焦特布尔分校)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15770 2025-01-14 cs.CV 79%

Text-Guided Coarse-to-Fine Fusion Network for Robust Remote Sensing Visual Question Answering

Zhicheng Zhao, Changfu Zhou, Yu Zhang, Chenglong Li, Xiaoliang Ma, Jin Tang

机构 * Anhui University(安徽大学) GEOVIS Earth Technology Co., Ltd.(地纬地球科技有限公司)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05690 2025-01-13 cs.CV cs.CL 79%

Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation

Daowan Peng, Wei Wei

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Joint Laboratory of HUST and Pingan Property & Casualty Research (HPL)(华中科技大学与平安财产保险研究联合实验室)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ICME2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12841 2024-12-18 cs.CL cs.AI 79%

Black-box Model Ensembling for Textual and Visual Question Answering via Information Fusion

Yuxi Xia, Kilm Zaporojets, Benjamin Roth

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

Comments 15 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14785 2024-12-10 cs.CL cs.CV 79%

Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models

Patrick Amadeus Irawan, Genta Indra Winata, Samuel Cahyawijaya, Ayu Purwarianti

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02452 2024-11-28 cs.CV eess.IV 79%

Goal-Oriented Semantic Communication for Wireless Visual Question Answering

Sige Liu, Nan Li, Yansha Deng, Tony Q. S. Quek

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11150 2024-11-19 cs.CV 79%

A Comprehensive Survey on Visual Question Answering Datasets and Algorithms

Raihan Kabir, Naznin Haque, Md Saiful Islam, Marium-E-Jannat

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10183 2024-11-18 cs.CV 79%

Visual question answering based evaluation metrics for text-to-image generation

Mizuki Miyamoto, Ryugo Morita, Jinjia Zhou

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ISCAS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04933 2024-11-12 cs.CV 79%

SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering

Tianyu Yang, Yiyang Nan, Lisen Dai, Zhenwen Liang, Yapeng Tian, Xiangliang Zhang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03386 2024-10-30 cs.CV 79%

Visual Robustness Benchmark for Visual Question Answering (VQA)

Md Farhan Ishmam, Ishmam Tashdeed, Talukder Asir Saadat, Md Hamjajul Ashmafee, Abu Raihan Mostofa Kamal, Md. Azam Hossain

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09428 2024-10-15 cs.AI cs.CL 79%

Declarative Knowledge Distillation from Large Language Models for Visual Question Answering Datasets

Thomas Eiter, Jan Hadl, Nelson Higuera, Johannes Oetsch

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

Comments Presented at NeLaMKRR@KR, 2024 (arXiv:2410.05339)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15002 2024-10-07 cs.CL cs.CV 79%

CommVQA: Situating Visual Question Answering in Communicative Contexts

Nandita Shankar Naik, Christopher Potts, Elisa Kreiss

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments EMNLP 2024 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00226 2024-10-02 cs.CV cs.CL 79%

Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training

Tongkun Su, Jun Li, Xi Zhang, Haibo Jin, Hao Chen, Qiong Wang, Faqin Lv, Baoliang Zhao, Yin Hu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19684 2024-10-01 cs.CV 79%

MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation

Lijian Xu, Hao Sun, Ziyu Ni, Hongsheng Li, Shaoting Zhang

专题命中 视觉问答 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10415 2024-09-10 cs.CV 79%

PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering

Xiaoman Zhang, Chaoyi Wu, Ziheng Zhao, Weixiong Lin, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10237 2024-09-04 cs.CV cs.CL 79%

Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models

Songtao Jiang, Tuo Zheng, Yan Zhang, Yeying Jin, Li Yuan, Zuozhu Liu

专题命中 视觉问答 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17006 2024-09-02 cs.CV 79%

Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering

Su Hyeon Lim, Minkuk Kim, Hyeon Bae Kim, Seong Tae Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments ICIP Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16176 2024-08-30 cs.CV 79%

VLM4Bio: A Benchmark Dataset to Evaluate Pretrained Vision-Language Models for Trait Discovery from Biological Images

M. Maruf, Arka Daw, Kazi Sajeed Mehrab, Harish Babu Manogaran, Abhilash Neog, Medha Sawhney, Mridul Khurana, James P. Balhoff, Yasin Bakis, Bahadir Altintas, Matthew J. Thompson, Elizabeth G. Campolongo, Josef C. Uyeda, Hilmar Lapp, Henry L. Bart, Paula M. Mabee, Yu Su, Wei-Lun Chao, Charles Stewart, Tanya Berger-Wolf, Wasila Dahdul, Anuj Karpatne

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments 36 pages, 37 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏