arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2311.07594 2025-01-09 cs.CL cs.AI cs.CV cs.MM 81%

How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model

Shezheng Song, Xiaopeng Li, Shasha Li, Shan Zhao, Jie Yu, Jun Ma, Xiaoguang Mao, Weimin Zhang

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03795 2024-12-03 cs.CV cs.AI 81%

VQA$^2$: Visual Question Answering for Video Quality Assessment

Ziheng Jia, Zicheng Zhang, Jiaying Qian, Haoning Wu, Wei Sun, Chunyi Li, Xiaohong Liu, Weisi Lin, Guangtao Zhai, Xiongkuo Min

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 23 pages 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04118 2024-11-21 cs.CL cs.AI cs.LG 81%

Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?

Daniel P. Jeong, Saurabh Garg, Zachary C. Lipton, Michael Oberst

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments This version was published at EMNLP 2024 Main Conference as a Long Paper (Oral). See the extended version (arXiv:2411.08870) for additional results on QA tasks based on clinical notes and evaluations in the supervised fine-tuning regime

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07001 2024-11-07 cs.CL cs.AI cs.CV 81%

ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering

Yifan Wu, Lutao Yan, Leixian Shen, Yunhai Wang, Nan Tang, Yuyu Luo

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08798 2024-11-07 cs.AI cs.CV 81%

D3: Data Diversity Design for Systematic Generalization in Visual Question Answering

Amir Rahimi, Vanessa D'Amario, Moyuru Yamada, Kentaro Takemoto, Tomotake Sasaki, Xavier Boix

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments TMLR (https://openreview.net/forum?id=ZAin13msOp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00828 2024-11-05 cs.CV cs.LG 81%

Dreaming Out Loud: A Self-Synthesis Approach For Training Vision-Language Models With Developmentally Plausible Data

Badr AlKhamissi, Yingtian Tang, Abdülkadir Gökce, Johannes Mehrer, Martin Schrimpf

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted to BabyLM Challenge at CoNLL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00308 2024-11-05 cs.CV cs.AI 81%

From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities

Md Farhan Ishmam, Md Sakib Hossain Shovon, M. F. Mridha, Nilanjan Dey

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16662 2024-10-23 eess.IV cs.AI cs.CV 81%

Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective

Xiaolan Chen, Ruoyu Chen, Pusheng Xu, Weiyi Zhang, Xianwen Shang, Mingguang He, Danli Shi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13120 2024-10-17 cs.CV cs.LG 81%

RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering

Yuduo Wang, Pedram Ghamisi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Journal ref IEEE Trans. Geosci. Remote Sens., vol. 62, pp. 1-13, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00977 2024-10-16 cs.CV cs.AI 81%

Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models

Rahul Thapa, Kezhen Chen, Ian Covert, Rahul Chalamala, Ben Athiwaratkun, Shuaiwen Leon Song, James Zou

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10184 2024-10-15 cs.CV cs.AI 81%

Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention

Ying Liu, Ge Bai, Chenji Lu, Shilong Li, Zhang Zhang, Ruifang Liu, Wenbin Guo

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Journal ref 2024 IEEE International Conference on Multimedia and Expo (ICME), Niagara Falls, ON, Canada, 2024, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16851 2024-10-07 cs.CL cs.AI cs.CV 81%

Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts

Aditya Sharma, Michael Saxon, William Yang Wang

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13592 2024-09-23 cs.CV cs.AI cs.CL 81%

YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models

Abhilash Nandy, Yash Agarwal, Ashish Patwa, Millon Madhur Das, Aman Bansal, Ankit Raj, Pawan Goyal, Niloy Ganguly

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Main (Long), 18 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00255 2024-09-04 cs.CV cs.AI cs.CL cs.GR cs.HC 81%

MAPWise: Evaluating Vision-Language Models for Advanced Map Queries

Srija Mukhopadhyay, Abhishek Rajgaria, Prerana Khatiwada, Vivek Gupta, Dan Roth

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 30 Pages, 46 Tables, 6 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04938 2024-08-31 cs.CV cs.AI 81%

Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering

Param Ahir, Hiteishi Diwanji

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07989 2024-08-16 cs.CV cs.AI 81%

IIU: Independent Inference Units for Knowledge-based Visual Question Answering

Yili Li, Jing Yu, Keke Gai, Gang Xiong

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03834 2024-08-08 cs.CV cs.AI 81%

Target Prompting for Information Extraction with Vision Language Model

Dipankar Medhi

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20693 2024-07-31 cs.CV cs.AI cs.MM 81%

Boosting Audio Visual Question Answering via Key Semantic-Aware Cues

Guangyao Li, Henghui Du, Di Hu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19410 2024-07-30 cs.AI cs.CV cs.MM 81%

AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering

Mahiro Ukai, Shuhei Kurita, Atsushi Hashimoto, Yoshitaka Ushiku, Nakamasa Inoue

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16171 2024-07-25 cs.CV cs.AI cs.MM 81%

Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality

Kyu Ri Park, Hong Joo Lee, Jung Uk Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10711 2024-07-24 cs.CV cs.AI cs.CL 81%

Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering

Haibo Wang, Chenghang Lai, Yixuan Sun, Weifeng Ge

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11383 2024-07-17 cs.CV cs.AI 81%

TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering

Tonmoy Rajkhowa, Amartya Roy Chowdhury, Sankalp Nagaonkar, Achyut Mani Tripathi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments conference (Accepted at Interspeech 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05183 2024-07-11 cs.CV cs.AI 81%

FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding

Huitong Pan, Qi Zhang, Cornelia Caragea, Eduard Dragut, Longin Jan Latecki

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ECAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05603 2024-07-09 cs.CV cs.AI 81%

WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering

Pingyi Chen, Chenglu Zhu, Sunyi Zheng, Honglin Li, Lin Yang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09156 2024-06-14 cs.LG cs.CV cs.MM cs.SD eess.AS 81%

Towards Multilingual Audio-Visual Question Answering

Orchid Chetia Phukan, Priyabrata Mallick, Swarup Ranjan Behera, Aalekhya Satya Narayani, Arun Balaji Buduru, Rajesh Sharma

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01879 2024-05-16 cs.CV cs.AI cs.CL 81%

Revisiting the Role of Language Priors in Vision-Language Models

Zhiqiu Lin, Xinyue Chen, Deepak Pathak, Pengchuan Zhang, Deva Ramanan

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Published at ICML 2024. Website: https://linzhiqiu.github.io/papers/visual_gpt_score/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19205 2024-05-01 cs.CV cs.AI 81%

TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains

Yoonsik Kim, Moonbin Yim, Ka Yeon Song

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08589 2024-04-15 cs.CV cs.AI 81%

Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts

Övgü Özdemir, Erdem Akagündüz

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments The paper has been accepted for presentation at CVPR 2024 Workshop on Prompting in Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00436 2024-03-19 cs.CV cs.AI 81%

Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space

Yuwei Sun, Hideya Ochiai, Jun Sakuma

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted for IJCNN 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09288 2024-03-15 cs.CV cs.AI 81%

Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering

Zhixuan Shen, Haonan Luo, Sijia Li, Tianrui Li

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 6 pages, 3 figures, accepted by 2024 IEEE International Conference on Multimedia and Expo

详情

展开后加载摘要…

URL PDF HTML 收藏