arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2506.16450 2025-06-23 cs.CV 83%

How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?

Giuseppe Lando, Rosario Forte, Giovanni Maria Farinella, Antonino Furnari

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10286 2025-06-13 cs.CV 83%

HalLoc: Token-level Localization of Hallucinations for Vision Language Models

Eunkyu Park, Minyeong Kim, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04459 2025-06-12 cs.CV 83%

Question-Aware Gaussian Experts for Audio-Visual Question Answering

Hongyeob Kim, Inyoung Jung, Dayoon Suh, Youjia Zhang, Sangmin Lee, Sungeun Hong

机构 * Sungkyunkwan University(成均馆大学) Purdue University(普渡大学)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments CVPR 2025. Code is available at https://github.com/AIM-SKKU/QA-TIGER

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05765 2025-06-12 cs.CV cs.CL 83%

Do Large Vision-Language Models Distinguish between the Actual and Apparent Features of Illusions?

Taiga Shinozaki, Tomoki Doi, Amane Watahiki, Satoshi Nishida, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Keio University(庆应大学) CiNet, NICT(NICT CiNet) Riken(理化学研究所)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV

Comments To appear in the Proceedings of the 47th Annual Meeting of the Cognitive Science Society (COGSCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11985 2025-06-12 cs.CV 83%

MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering

Jingqun Tang, Qi Liu, Yongjie Ye, Jinghui Lu, Shu Wei, Chunhui Lin, Wanqing Li, Mohamad Fitri Faiz Bin Mahmood, Hao Feng, Zhen Zhao, Yangfan He, Kuan Lu, Yanjie Wang, Yuliang Liu, Hao Liu, Xiang Bai, Can Huang

机构 * ByteDance Inc.(字节跳动公司) Huazhong University of Science and Technology(华中科技大学) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16469 2025-06-02 cs.CL cs.CV 83%

Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration

ChaeHun Park, Yujin Baek, Jaeseok Kim, Yu-Jung Heo, Du-Seong Chang, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) KT Corporation(KT公司) Sogang Univ.(ソガン大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments ACL 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19354 2025-05-27 cs.CL cs.CV 83%

GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance

Mohammad Mahdi Moradi, Sudhir Mudur

机构 * Concordia University(康科迪亚大学)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16674 2025-05-23 cs.CV 83%

Zero-Shot Anomaly Detection in Battery Thermal Images Using Visual Question Answering with Prior Knowledge

Marcella Astrid, Abdelrahman Shabayek, Djamila Aouada

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT)(安全、可靠性与信任跨学科中心)

专题命中 视觉问答 :visual question answering(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted in EUSIPCO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15564 2025-05-22 cs.CV 83%

TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving

Hossein Hassani, Soodeh Nikan, Abdallah Shami

机构 * Western University(滑铁卢大学)

专题命中 视觉问答 :visual question answering(title);vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21309 2025-05-01 cs.CV 83%

An Evaluation of a Visual Question Answering Strategy for Zero-shot Facial Expression Recognition in Still Images

Modesto Castrillón-Santana, Oliverio J Santana, David Freire-Obregón, Daniel Hernández-Sosa, Javier Lorenzo-Navarro

机构 * SIANI - Universidad de Las Palmas de Gran Canaria Spain(SIANI - 拉帕尔马群岛大加那利大学)

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04659 2025-04-10 cs.CV 83%

ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models

Ziyue Wang, Chi Chen, Fuwen Luo, Yurui Dong, Yuanchi Zhang, Yuzhuang Xu, Xiaolong Wang, Peng Li, Yang Liu

机构 * Tsinghua University(清华大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Fudan University(复旦大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18387 2025-04-08 cs.CV 83%

Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks

Lehan Wang, Haonan Wang, Honglong Yang, Jiaji Mao, Zehong Yang, Jun Shen, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) Sun Yat-Sen Memorial Hospital, Sun Yat-Sen University(中山大学孙逸仙纪念医院)

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14522 2025-03-28 cs.CV 83%

GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI

Tianbin Li, Yanzhou Su, Wei Li, Bin Fu, Zhe Chen, Ziyan Huang, Guoan Wang, Chenglong Ma, Ying Chen, Ming Hu, Yanjun Li, Pengcheng Chen, Xiaowei Hu, Zhongying Deng, Yuanfeng Ji, Jin Ye, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Nanjing University(南京大学) East China Normal University(华东师范大学) Fudan University(复旦大学) Xiamen University(厦门大学) Monash University(莫纳什大学) University of Washington(华盛顿大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16868 2025-03-24 cs.CL cs.CV 83%

Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction

Mengsay Loem, Taiju Hosaka

机构 * Sansan, Inc.(Sansan公司)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14140 2025-03-19 cs.CV 83%

Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding

Zining Wang, Tongkun Guan, Pei Fu, Chen Duan, Qianyi Jiang, Zhentao Guo, Shan Guo, Junfeng Luo, Wei Shen, Xiaokang Yang

机构 * Meituan(美团) Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13891 2025-03-19 cs.CV cs.CL 83%

Where do Large Vision-Language Models Look at when Answering Questions?

Xiaoying Xing, Chia-Wen Kuo, Li Fuxin, Yulei Niu, Fan Chen, Ming Li, Ying Wu, Longyin Wen, Sijie Zhu

机构 * Bytedance Intelligent Creation(字节跳动智能创作) Northwestern University(西北大学) Oregon State University(俄勒冈州立大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03554 2025-03-10 cs.CV 83%

Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset

Yingzi Ma, Jiongxiao Wang, Fei Wang, Siyuan Ma, Jiazhao Li, Jinsheng Pan, Xiujun Li, Furong Huang, Lichao Sun, Bo Li, Yejin Choi, Muhao Chen, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) University of Michigan-Ann Arbor(密歇根大学安娜堡分校) University of Washington(华盛顿大学) University of Maryland(马里兰大学) Lehigh University(理海大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) University of Rochester(罗切斯特大学) University of California, Davis(加州大学戴维斯分校)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04543 2025-03-07 cs.CL cs.AI 83%

Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model

Wenke Huang, Jian Liang, Xianda Guo, Yiyang Fang, Guancheng Wan, Xuankun Rong, Chi Wen, Zekun Shi, Qingyun Li, Didi Zhu, Yanbiao Ma, Ke Liang, Bin Yang, He Li, Jiawei Shao, Mang Ye, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) school of Electronics and Information Engineering, Harbin Institute of Technology(哈尔滨工业大学电子与信息工程学院) Department of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(腾讯AI Lab))

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01264 2025-03-03 cs.CV 83%

Backdooring Vision-Language Models with Out-Of-Distribution Data

Weimin Lyu, Jiachen Yao, Saumya Gupta, Lu Pang, Tao Sun, Lingjie Yi, Lijie Hu, Haibin Ling, Chao Chen

机构 * Stony Brook University(石溪大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11288 2025-02-18 cs.CL cs.CV 83%

MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Shengkang Wang, Hongzhan Lin, Ziyang Luo, Zhen Ye, Guang Chen, Jing Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Baptist University(香港浸会大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14179 2025-02-11 cs.CL cs.CV 83%

MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems

Zifeng Zhu, Mengzhao Jia, Zhihan Zhang, Lang Li, Meng Jiang

机构 * Xi’an Jiaotong University(西安交通大学) University of Notre Dame(圣母大学)

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments NAACL 2025, 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09996 2025-02-11 cs.CV cs.CL 83%

Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering

Rabiul Awal, Le Zhang, Aishwarya Agrawal

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Codes available at https://github.com/rabiulcste/vqazero

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09167 2025-01-17 cs.CV cs.RO 83%

Embodied Scene Understanding for Vision Language Models via MetaVQA

Weizhen Wang, Chenda Duan, Zhenghao Peng, Yuxin Liu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments for the project webpage, see https://metadriverse.github.io/metavqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02797 2025-01-17 cs.CL cs.AI 83%

PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging

Jinlong He, Pengfei Li, Gang Liu, Genrong He, Zhaolin Chen, Shenjun Zhong

机构 * Harbin Engineering University(哈尔滨工程大学) Monash University(莫纳什大学) National Imaging Facility(国家成像设施)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.AI

Comments 12 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03939 2025-01-14 cs.CV cs.MM 83%

Visual question answering: from early developments to recent advances -- a survey

Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Sunil Aryal, Imran Razzak, Hakim Hacid

机构 * Deakin University(迪肯大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of New South Wales(新南威尔士大学) Technology Innovation Institute(技术创新研究院)

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

Comments 20 papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08394 2025-01-03 cs.CV 83%

VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Jiannan Wu, Muyan Zhong, Sen Xing, Zeqiang Lai, Zhaoyang Liu, Zhe Chen, Wenhai Wang, Xizhou Zhu, Lewei Lu, Tong Lu, Ping Luo, Yu Qiao, Jifeng Dai

机构 * OpenGVLab(开放通用视觉实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Nanjing University(南京大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.CV

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16771 2024-12-24 cs.CV 83%

SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization

Tan-Hanh Pham, Hoang-Nam Le, Phu-Vinh Nguyen, Chris Ngo, Truong-Son Hy

机构 * Florida Institute of Technology(佛罗里达理工学院) FPT University(FPT大学) Uppsala University(乌普萨拉大学) Knovel Engineering Lab(诺弗尔工程实验室) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 视觉问答 :visual question answering(title,abstract);visual language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00220 2024-12-24 cs.CV 83%

A Dual-Attention Learning Network with Word and Sentence Embedding for Medical Visual Question Answering

Xiaofei Huang, Hongfang Gong

机构 * school of Mathematics and Statistics, Changsha University of Science and Technology(长沙理工大学数学与统计学院)

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

Journal ref IEEE Transactions on Medical Imaging, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14215 2024-11-26 cs.CV 83%

@Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology

Xin Jiang, Junwei Zheng, Ruiping Liu, Jiahang Li, Jiaming Zhang, Sven Matthiesen, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Li Auto Inc.(理想汽车有限公司)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted by WACV 2025, project page: https://junweizheng93.github.io/publications/ATBench/ATBench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23828 2024-11-14 cs.CV 83%

Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection

Ke Li, Fuyu Dong, Di Wang, Shaofeng Li, Quan Wang, Xinbo Gao, Tat-Seng Chua

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏