arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3138 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3138 篇

2309.09179 2023-09-19 cs.CV cs.AI 81%

Syntax Tree Constrained Graph Network for Visual Question Answering

Xiangrui Su, Qi Zhang, Chongyang Shi, Jiachang Liu, Liang Hu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11501 2023-09-18 cs.CV cs.AI cs.CL 81%

VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks for Visual Question Answering

Yanan Wang, Michihiro Yasunaga, Hongyu Ren, Shinya Wada, Jure Leskovec

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10143 2023-09-06 cs.AI cs.CV 81%

An Empirical Study on the Language Modal in Visual Question Answering

Daowan Peng, Wei Wei, Xian-Ling Mao, Yuanyuan Fu, Dangyang Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by IJCAI2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09974 2023-07-25 cs.CV cs.AI eess.IV 81%

SurgicalGPT: End-to-End Language-Vision GPT for Visual Question Answering in Surgery

Lalithkumar Seenivasan, Mobarakol Islam, Gokul Kannan, Hongliang Ren

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments The manuscript is accepted in MICCAI 2023. Code are available at: https://github.com/lalithjets/SurgicalGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10408 2023-07-21 cs.CV cs.AI 81%

Explaining Autonomous Driving Actions with Visual Question Answering

Shahin Atakishiyev, Mohammad Salameh, Housam Babiker, Randy Goebel

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to the 2023 IEEE International Conference on Intelligent Transportation Systems (IEEE ITSC-2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10405 2023-07-21 cs.CV cs.AI 81%

Generative Visual Question Answering

Ethan Shen, Scotty Singh, Bhavesh Kumar

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05314 2023-07-12 cs.CV cs.AI 81%

Masked Vision and Language Pre-training with Unimodal and Multimodal Contrastive Losses for Medical Visual Question Answering

Pengfei Li, Gang Liu, Jinlong He, Zixu Zhao, Shenjun Zhong

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments accepted by MICCAI2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14264 2023-06-27 cs.CV cs.CL cs.LG 81%

Visual Question Answering in Remote Sensing with Cross-Attention and Multimodal Information Bottleneck

Jayesh Songara, Shivam Pande, Shabnam Choudhury, Biplab Banerjee, Rajbabu Velmurugan

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10056 2023-06-12 cs.CV cs.AI 81%

Medical Visual Question Answering: A Survey

Zhihong Lin, Donghao Zhang, Qingyi Tao, Danli Shi, Gholamreza Haffari, Qi Wu, Mingguang He, Zongyuan Ge

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12647 2023-06-08 cs.CV cs.AI 81%

Cross-Modal Causal Relational Reasoning for Event-Level Visual Question Answering

Yang Liu, Guanbin Li, Liang Lin

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 17 pages, 9 figures. This work has been accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). The datasets, code and models are available at https://github.com/HCPLab-SYSU/CMCIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00758 2023-06-05 cs.CV cs.LG 81%

LiT-4-RSVQA: Lightweight Transformer-based Visual Question Answering in Remote Sensing

Leonard Hackel, Kai Norman Clasen, Mahdyar Ravanbakhsh, Begüm Demir

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18842 2023-05-31 cs.CL cs.AI cs.CV 81%

Generate then Select: Open-ended Visual Question Answering Guided by World Knowledge

Xingyu Fu, Sheng Zhang, Gukyeong Kwon, Pramuditha Perera, Henghui Zhu, Yuhao Zhang, Alexander Hanbo Li, William Yang Wang, Zhiguo Wang, Vittorio Castelli, Patrick Ng, Dan Roth, Bing Xiang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03147 2023-04-07 cs.CV cs.AI 81%

Improving Visual Question Answering Models through Robustness Analysis and In-Context Learning with a Chain of Basic Questions

Jia-Hong Huang, Modar Alfadly, Bernard Ghanem, Marcel Worring

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01647 2023-04-05 cs.CV cs.AI 81%

SC-ML: Self-supervised Counterfactual Metric Learning for Debiased Visual Question Answering

Xinyao Shu, Shiyang Yan, Xu Yang, Ziheng Wu, Zhongfeng Chen, Zhenyu Lu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.11316 2023-03-20 cs.CV cs.LG 81%

Transformer Module Networks for Systematic Generalization in Visual Question Answering

Moyuru Yamada, Vanessa D'Amario, Kentaro Takemoto, Xavier Boix, Tomotake Sasaki

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07403 2023-03-15 cs.CV cs.AI 81%

Polar-VQA: Visual Question Answering on Remote Sensed Ice sheet Imagery from Polar Region

Argho Sarkar, Maryam Rahnemoonfar

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13069 2023-02-28 cs.CV cs.AI 81%

Medical visual question answering using joint self-supervised learning

Yuan Zhou, Jing Mei, Yiqin Yu, Tanveer Syeda-Mahmood

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01639 2022-12-06 stat.ML cs.CV cs.LG 81%

Visual Question Answering From Another Perspective: CLEVR Mental Rotation Tests

Christopher Beckham, Martin Weiss, Florian Golemo, Sina Honari, Derek Nowrouzezahrai, Christopher Pal

专题命中 视觉问答 :visual question answering(title);visual reasoning(abstract);分类 cs.CV、cs.LG

Comments Accepted for publication to Pattern Recognition journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15940 2022-12-02 cs.CV cs.AI 81%

PiggyBack: Pretrained Visual Question Answering Environment for Backing up Non-deep Learning Professionals

Zhihao Zhang, Siwen Luo, Junyi Chen, Sijia Lai, Siqu Long, Hyunsuk Chung, Soyeon Caren Han

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by WSDM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14450 2022-11-29 cs.CV cs.AI 81%

Text-Aware Dual Routing Network for Visual Question Answering

Luoqian Jiang, Yifan He, Jian Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12888 2022-11-29 cs.CV cs.AI 81%

LaKo: Knowledge-driven Visual Question Answering via Late Knowledge-to-Text Injection

Zhuo Chen, Yufeng Huang, Jiaoyan Chen, Yuxia Geng, Yin Fang, Jeff Pan, Ningyu Zhang, Wen Zhang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments IJCKG 2022. Repository: github.com/hackerchenzhuo/LaKo

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13594 2022-11-28 cs.CV cs.AI 81%

Self-supervised vision-language pretraining for Medical visual question answering

Pengfei Li, Gang Liu, Lin Tan, Jinying Liao, Shenjun Zhong

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05991 2022-11-14 cs.CV cs.AI 81%

MF2-MVQA: A Multi-stage Feature Fusion method for Medical Visual Question Answering

Shanshan Song, Jiangyun Li, Jing Wang, Yuanxiu Cai, Wenkai Dong

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14966 2022-10-28 cs.CL cs.AI cs.CV 81%

What's Different between Visual Question Answering for Machine "Understanding" Versus for Accessibility?

Yang Trista Cao, Kyle Seelman, Kyungjun Lee, Hal Daumé

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Journal ref AACL-IJCNLP 2022 The 2nd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 12th International Joint Conference on Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04563 2022-10-11 cs.CV cs.AI 81%

Towards Robust Visual Question Answering: Making the Most of Biased Samples via Contrastive Learning

Qingyi Si, Yuanxin Liu, Fandong Meng, Zheng Lin, Peng Fu, Yanan Cao, Weiping Wang, Jie Zhou

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Findings of EMNLP-2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04510 2022-10-11 cs.CV cs.AI 81%

Multi-Modal Fusion Transformer for Visual Question Answering in Remote Sensing

Tim Siebert, Kai Norman Clasen, Mahdyar Ravanbakhsh, Begüm Demir

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted in SPIE Remote Sensing (ESI22R)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08029 2022-09-14 cs.CV cs.AI 81%

Image Captioning for Effective Use of Language Models in Knowledge-Based Visual Question Answering

Ander Salaberria, Gorka Azkune, Oier Lopez de Lacalle, Aitor Soroa, Eneko Agirre

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Under review. 25 pages with 4 figures

Journal ref Expert Systems with Applications, Volume 212, 2023, 118669

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01322 2022-07-12 cs.CV cs.AI cs.CL cs.MM 81%

Recent, rapid advancement in visual question answering architecture: a review

Venkat Kodali, Daniel Berleant

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages. Accepted to EIT2022 conference and posted on ArXiv in accordance with IEEE policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14355 2022-06-30 cs.CV cs.CL cs.LG 81%

EBMs vs. CL: Exploring Self-Supervised Visual Pretraining for Visual Question Answering

Violetta Shevchenko, Ehsan Abbasnejad, Anthony Dick, Anton van den Hengel, Damien Teney

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13296 2022-06-28 cs.CV cs.LG 81%

Consistency-preserving Visual Question Answering in Medical Imaging

Sergio Tascon-Morales, Pablo Márquez-Neila, Raphael Sznitman

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Appears in Medical Image Computing and Computer Assisted Interventions (MICCAI), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏