arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3138 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3138 篇

2310.13120 2024-10-17 cs.CV cs.LG 81%

RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering

Yuduo Wang, Pedram Ghamisi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Journal ref IEEE Trans. Geosci. Remote Sens., vol. 62, pp. 1-13, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00977 2024-10-16 cs.CV cs.AI 81%

Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models

Rahul Thapa, Kezhen Chen, Ian Covert, Rahul Chalamala, Ben Athiwaratkun, Shuaiwen Leon Song, James Zou

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10184 2024-10-15 cs.CV cs.AI 81%

Eliminating the Language Bias for Visual Question Answering with fine-grained Causal Intervention

Ying Liu, Ge Bai, Chenji Lu, Shilong Li, Zhang Zhang, Ruifang Liu, Wenbin Guo

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Journal ref 2024 IEEE International Conference on Multimedia and Expo (ICME), Niagara Falls, ON, Canada, 2024, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16851 2024-10-07 cs.CL cs.AI cs.CV 81%

Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts

Aditya Sharma, Michael Saxon, William Yang Wang

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13592 2024-09-23 cs.CV cs.AI cs.CL 81%

YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models

Abhilash Nandy, Yash Agarwal, Ashish Patwa, Millon Madhur Das, Aman Bansal, Ankit Raj, Pawan Goyal, Niloy Ganguly

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments EMNLP 2024 Main (Long), 18 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00255 2024-09-04 cs.CV cs.AI cs.CL cs.GR cs.HC 81%

MAPWise: Evaluating Vision-Language Models for Advanced Map Queries

Srija Mukhopadhyay, Abhishek Rajgaria, Prerana Khatiwada, Vivek Gupta, Dan Roth

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 30 Pages, 46 Tables, 6 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04938 2024-08-31 cs.CV cs.AI 81%

Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering

Param Ahir, Hiteishi Diwanji

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07989 2024-08-16 cs.CV cs.AI 81%

IIU: Independent Inference Units for Knowledge-based Visual Question Answering

Yili Li, Jing Yu, Keke Gai, Gang Xiong

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03834 2024-08-08 cs.CV cs.AI 81%

Target Prompting for Information Extraction with Vision Language Model

Dipankar Medhi

专题命中 视觉问答 :vision language model(title,abstract);分类 cs.CV、cs.AI

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20693 2024-07-31 cs.CV cs.AI cs.MM 81%

Boosting Audio Visual Question Answering via Key Semantic-Aware Cues

Guangyao Li, Henghui Du, Di Hu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19410 2024-07-30 cs.AI cs.CV cs.MM 81%

AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering

Mahiro Ukai, Shuhei Kurita, Atsushi Hashimoto, Yoshitaka Ushiku, Nakamasa Inoue

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16171 2024-07-25 cs.CV cs.AI cs.MM 81%

Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality

Kyu Ri Park, Hong Joo Lee, Jung Uk Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10711 2024-07-24 cs.CV cs.AI cs.CL 81%

Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering

Haibo Wang, Chenghang Lai, Yixuan Sun, Weifeng Ge

专题命中 视觉问答 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11383 2024-07-17 cs.CV cs.AI 81%

TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering

Tonmoy Rajkhowa, Amartya Roy Chowdhury, Sankalp Nagaonkar, Achyut Mani Tripathi

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments conference (Accepted at Interspeech 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05183 2024-07-11 cs.CV cs.AI 81%

FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding

Huitong Pan, Qi Zhang, Cornelia Caragea, Eduard Dragut, Longin Jan Latecki

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ECAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05603 2024-07-09 cs.CV cs.AI 81%

WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering

Pingyi Chen, Chenglu Zhu, Sunyi Zheng, Honglin Li, Lin Yang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09156 2024-06-14 cs.LG cs.CV cs.MM cs.SD eess.AS 81%

Towards Multilingual Audio-Visual Question Answering

Orchid Chetia Phukan, Priyabrata Mallick, Swarup Ranjan Behera, Aalekhya Satya Narayani, Arun Balaji Buduru, Rajesh Sharma

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01879 2024-05-16 cs.CV cs.AI cs.CL 81%

Revisiting the Role of Language Priors in Vision-Language Models

Zhiqiu Lin, Xinyue Chen, Deepak Pathak, Pengchuan Zhang, Deva Ramanan

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Published at ICML 2024. Website: https://linzhiqiu.github.io/papers/visual_gpt_score/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19205 2024-05-01 cs.CV cs.AI 81%

TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains

Yoonsik Kim, Moonbin Yim, Ka Yeon Song

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08589 2024-04-15 cs.CV cs.AI 81%

Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts

Övgü Özdemir, Erdem Akagündüz

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments The paper has been accepted for presentation at CVPR 2024 Workshop on Prompting in Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00436 2024-03-19 cs.CV cs.AI 81%

Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space

Yuwei Sun, Hideya Ochiai, Jun Sakuma

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted for IJCNN 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09288 2024-03-15 cs.CV cs.AI 81%

Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering

Zhixuan Shen, Haonan Luo, Sijia Li, Tianrui Li

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 6 pages, 3 figures, accepted by 2024 IEEE International Conference on Multimedia and Expo

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13081 2024-01-25 cs.CV cs.AI 81%

Free Form Medical Visual Question Answering in Radiology

Abhishek Narayanan, Rushabh Musthyala, Rahul Sankar, Anirudh Prasad Nistala, Pranav Singh, Jacopo Cirrone

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 6 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09442 2024-01-19 cs.CV cs.AI 81%

Object Attribute Matters in Visual Question Answering

Peize Li, Qingyi Si, Peng Fu, Zheng Lin, Yan Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16012 2023-12-27 cs.CV cs.AI 81%

Detection-based Intermediate Supervision for Visual Question Answering

Yuhang Liu, Daowan Peng, Wei Wei, Yuanyuan Fu, Wenfeng Xie, Dangyang Chen

专题命中 视觉问答 :visual question answering(title);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI24

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11435 2023-12-12 cs.CV cs.LG 81%

Bidirectional Contrastive Split Learning for Visual Question Answering

Yuwei Sun, Hideya Ochiai

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Accepted for AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09050 2023-11-16 cs.CV cs.AI 81%

Improving Zero-shot Visual Question Answering via Large Language Models with Reasoning Question Prompts

Yunshi Lan, Xiang Li, Xin Liu, Yang Li, Wei Qin, Weining Qian

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00807 2023-11-03 cs.CV cs.LG 81%

VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization

Suraj Jyothi Unni, Raha Moraffah, Huan Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20159 2023-11-01 cs.CV cs.AI 81%

Language Guided Visual Question Answering: Elevate Your Multimodal Language Model Using Knowledge-Enriched Prompts

Deepanway Ghosal, Navonil Majumder, Roy Ka-Wei Lee, Rada Mihalcea, Soujanya Poria

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09432 2023-10-17 cs.CL cs.AI cs.LG 81%

Enhancing BERT-Based Visual Question Answering through Keyword-Driven Sentence Selection

Davide Napolitano, Lorenzo Vaiani, Luca Cagliero

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI、cs.LG

Comments This paper is the technical research paper of CIKM 2023 DocIU challenges. The authors received the CIKM 2023 DocIU Winner Award, sponsored by Google, Microsoft, and the Centre for data-driven geoscience

详情

展开后加载摘要…

URL PDF HTML 收藏