arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2310.06641 2023-12-08 cs.CV 57%

How (not) to ensemble LVLMs for VQA

Lisa Alazraki, Lluis Castrejon, Mostafa Dehghani, Fantine Huot, Jasper Uijlings, Thomas Mensink

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments 4th I Can't Believe It's Not Better Workshop (co-located with NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07096 2023-12-07 cs.CV 57%

Global and Local Semantic Completion Learning for Vision-Language Pre-training

Rong-Cheng Tu, Yatai Ji, Jie Jiang, Weijie Kong, Chengfei Cai, Wenzhe Zhao, Hongfa Wang, Yujiu Yang, Wei Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2211.13437

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02463 2023-11-17 cs.CV cs.CL 57%

Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data

Chaoyi Wu, Xiaoman Zhang, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03354 2023-11-07 cs.CV 57%

CoVLM: Composing Visual Entities and Relationships in Large Language Models Via Communicative Decoding

Junyan Li, Delin Chen, Yining Hong, Zhenfang Chen, Peihao Chen, Yikang Shen, Chuang Gan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03971 2023-11-01 cs.CL cs.CV 57%

Adaptive loose optimization for robust question answering

Jie Ma, Pinghui Wang, Zewei Wang, Dechen Kong, Min Hu, Ting Han, Jun Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 13 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10503 2023-10-30 cs.AI 57%

Reusable Slotwise Mechanisms

Trang Nguyen, Amin Mansouri, Kanika Madan, Khuong Nguyen, Kartik Ahuja, Dianbo Liu, Yoshua Bengio

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07091 2023-10-20 cs.CL cs.AI 57%

Jaeger: A Concatenation-Based Multi-Transformer VQA Model

Jieting Long, Zewei Shi, Penghao Jiang, Yidong Gan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments This paper is the technical research paper of CIKM 2023 DocIU challenges. The authors received the CIKM 2023 DocIU Winner Award, sponsored by Google, Microsoft, and the Centre for data-driven geoscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07362 2023-10-20 cs.CV cs.CL 57%

A scoping review on multimodal deep learning in biomedical images and texts

Zhaoyi Sun, Mingquan Lin, Qingqing Zhu, Qianqian Xie, Fei Wang, Zhiyong Lu, Yifan Peng

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments This paper has been accepted by the Journal of Biomedical Informatics

Journal ref Journal of Biomedical Informatics, Volume 146, October 2023, 104482

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09147 2023-10-16 cs.MM cs.CV 57%

Exploring Sparse Spatial Relation in Graph Inference for Text-Based VQA

Sheng Zhou, Dan Guo, Jia Li, Xun Yang, Meng Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by TIP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04443 2023-10-16 cs.CL cs.AI 57%

Human Mobility Question Answering (Vision Paper)

Hao Xue, Flora D. Salim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01842 2023-10-04 cs.CV 57%

SelfGraphVQA: A Self-Supervised Graph Neural Network for Scene-based Question Answering

Bruno Souza, Marius Aasan, Helio Pedrini, Adín Ramírez Rivera

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments To appear in Vision-and-Language Algorithmic Reasoning Workshop at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15915 2023-09-29 cs.CV 57%

Zero-Shot and Few-Shot Video Question Answering with Multi-Modal Prompts

Deniz Engin, Yannis Avrithis

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments ICCV2023 CLVL Workshop (Oral). Project page: https://engindeniz.github.io/vitis

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15487 2023-09-28 cs.CV 57%

Tackling VQA with Pretrained Foundation Models without Further Training

Alvin De Jun Tan, Bingquan Shen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10375 2023-09-20 cs.CV 57%

Pointing out Human Answer Mistakes in a Goal-Oriented Visual Dialogue

Ryosuke Oshima, Seitaro Shinagawa, Hideki Tsunashima, Qi Feng, Shigeo Morishima

专题命中 视觉问答 :visual language model(abstract);分类 cs.CV

Comments Accepted at ICCVW 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08797 2023-09-15 cs.CV 57%

Towards Language-guided Visual Recognition via Dynamic Convolutions

Gen Luo, Yiyi Zhou, Xiaoshuai Sun, Yongjian Wu, Yue Gao, Rongrong Ji

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10240 2023-08-22 cs.CV 57%

Generic Attention-model Explainability by Weighted Relevance Accumulation

Yiming Huang, Aozhe Jia, Xiaodan Zhang, Jiawei Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09778 2023-08-22 cs.CV cs.CL 57%

I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision

Sophia Gu, Christopher Clark, Aniruddha Kembhavi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments website (https://prior.allenai.org/projects/close), code (https://github.com/allenai/close)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.05534 2023-08-22 cs.CV cs.CL 57%

PreSTU: Pre-Training for Scene-Text Understanding

Jihyung Kil, Soravit Changpinyo, Xi Chen, Hexiang Hu, Sebastian Goodman, Wei-Lun Chao, Radu Soricut

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11897 2023-08-21 cs.CV 57%

TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering

Yushi Hu, Benlin Liu, Jungo Kasai, Yizhong Wang, Mari Ostendorf, Ranjay Krishna, Noah A Smith

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09699 2023-08-21 cs.CV cs.CL 57%

PromptCap: Prompt-Guided Task-Aware Image Captioning

Yushi Hu, Hang Hua, Zhengyuan Yang, Weijia Shi, Noah A Smith, Jiebo Luo

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03906 2023-08-09 cs.CV 57%

TIJO: Trigger Inversion with Joint Optimization for Defending Multimodal Backdoored Models

Indranil Sur, Karan Sikka, Matthew Walmer, Kaushik Koneripalli, Anirban Roy, Xiao Lin, Ajay Divakaran, Susmit Jha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Published as conference paper at ICCV 2023. 13 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09224 2023-07-25 cs.CV 57%

Encyclopedic VQA: Visual questions about detailed properties of fine-grained categories

Thomas Mensink, Jasper Uijlings, Lluis Castrejon, Arushi Goel, Felipe Cadar, Howard Zhou, Fei Sha, André Araujo, Vittorio Ferrari

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ICCV'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00335 2023-07-04 cs.CL cs.LG 57%

Single Sequence Prediction over Reasoning Graphs for Multi-hop QA

Gowtham Ramesh, Makesh Sreedhar, Junjie Hu

专题命中 视觉问答 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03421 2023-06-19 cs.CV 57%

Diversifying Joint Vision-Language Tokenization Learning

Vardaan Pahuja, AJ Piergiovanni, Anelia Angelova

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to Transformers for Vision (T4V) workshop, CVPR 2023; 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08397 2023-06-16 cs.AI 57%

Scalable Neural-Probabilistic Answer Set Programming

Arseny Skryagin, Daniel Ochs, Devendra Singh Dhami, Kristian Kersting

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 37 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02329 2023-06-12 cs.CV 57%

Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes

Alexandros Delitzas, Maria Parelli, Nikolas Hars, Georgios Vlassis, Sotirios Anagnostidis, Gregor Bachmann, Thomas Hofmann

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments The first two authors contributed equally. arXiv admin note: text overlap with arXiv:2304.06061

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03553 2023-06-07 cs.AI 57%

An Approach to Solving the Abstraction and Reasoning Corpus (ARC) Challenge

Tan John Chong Min

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06447 2023-06-07 cs.CV cs.CL 57%

PDFVQA: A New Dataset for Real-World VQA on PDF Documents

Yihao Ding, Siwen Luo, Hyunsuk Chung, Soyeon Caren Han

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by ECML-PKDD 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01144 2023-06-05 cs.LG cs.CL 57%

Evaluating the Capabilities of Multi-modal Reasoning Models with Synthetic Task Data

Nathan Vaska, Victoria Helus

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17993 2023-05-30 cs.SD cs.AI cs.MM eess.AS 57%

Multi-Scale Attention for Audio Question Answering

Guangyao Li, Yixin Xu, Di Hu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments Accepted by InterSpeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏