arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3153 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2308.08545 2023-08-22 cs.CV cs.AI cs.GR 62%

TeCH: Text-guided Reconstruction of Lifelike Clothed Humans

Yangyi Huang, Hongwei Yi, Yuliang Xiu, Tingting Liao, Jiaxiang Tang, Deng Cai, Justus Thies

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Project: https://huangyangyi.github.io/TeCH, Code: https://github.com/huangyangyi/TeCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05182 2023-08-22 cs.CV cs.AI cs.RO 62%

CAT-ViL: Co-Attention Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

Long Bai, Mobarakol Islam, Hongliang Ren

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments To appear in MICCAI 2023. Code availability: https://github.com/longbai1006/CAT-ViL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07274 2023-08-15 cs.CV cs.AI cs.CL 62%

Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images

Nitzan Bitton-Guetta, Yonatan Bitton, Jack Hessel, Ludwig Schmidt, Yuval Elovici, Gabriel Stanovsky, Roy Schwartz

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2023. Website: whoops-benchmark.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06262 2023-08-14 cs.LG cs.AI 62%

Foundation Model is Efficient Multimodal Multitask Model Selector

Fanqing Meng, Wenqi Shao, Zhanglin Peng, Chonghe Jiang, Kaipeng Zhang, Yu Qiao, Ping Luo

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11769 2023-08-08 cs.CV cs.AI cs.CL cs.MM 62%

Enhancing Vision-Language Pre-Training with Jointly Learned Questioner and Dense Captioner

Zikang Liu, Sihan Chen, Longteng Guo, Handong Li, Xingjian He, Jing Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 12 pages. Accepted by ACM MM '23

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09886 2023-07-20 cs.CV cs.AI 62%

A reinforcement learning approach for VQA validation: an application to diabetic macular edema grading

Tatiana Fountoukidou, Raphael Sznitman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 16 pages (+ 23 pages supplementary material)

Journal ref Medical image analysis 87 (2023): 102822

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.12926 2023-07-06 cs.CL cs.CV cs.LG 62%

Compositionality as Lexical Symmetry

Ekin Akyürek, Jacob Andreas

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments ACL2023 Final Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14182 2023-06-27 cs.CV cs.AI 62%

Switch-BERT: Learning to Model Multimodal Interactions by Switching Attention and Input

Qingpei Guo, Kaisheng Yao, Wei Chu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01611 2023-06-06 cs.CV cs.AI 62%

Q2ATransformer: Improving Medical VQA via an Answer Querying Decoder

Yunyi Liu, Zhanyu Wang, Dong Xu, Luping Zhou

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00228 2023-06-02 cs.CV cs.AI cs.CL 62%

Using Visual Cropping to Enhance Fine-Detail Question Answering of BLIP-Family Models

Jiarui Zhang, Mahyar Khayatkhoei, Prateek Chhikara, Filip Ilievski

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13738 2023-05-24 cs.CL cs.AI cs.CV 62%

i-Code Studio: A Configurable and Composable Framework for Integrative AI

Yuwei Fang, Mahmoud Khademi, Chenguang Zhu, Ziyi Yang, Reid Pryzant, Yichong Xu, Yao Qian, Takuya Yoshioka, Lu Yuan, Michael Zeng, Xuedong Huang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06407 2023-05-12 cs.CV cs.AI 62%

Combo of Thinking and Observing for Outside-Knowledge VQA

Qingyi Si, Yuchen Mo, Zheng Lin, Huishan Ji, Weiping Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments ACL-23, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08888 2023-05-09 cs.LG cs.AI 62%

Multimodal Federated Learning via Contrastive Representation Ensemble

Qiying Yu, Yang Liu, Yimu Wang, Ke Xu, Jingjing Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

Comments ICLR 2023, update

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01603 2023-04-05 cs.CV cs.AI 62%

Locate Then Generate: Bridging Vision and Language with Bounding Box for Scene-Text VQA

Yongxin Zhu, Zhen Liu, Yukang Liang, Xin Li, Hao Liu, Changcun Bao, Linli Xu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments accepted in AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14777 2023-03-01 cs.CV cs.AI 62%

VQA with Cascade of Self- and Co-Attention Blocks

Aakansha Mishra, Ashish Anand, Prithwijit Guha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.04641 2023-02-22 cs.AI cs.CV cs.RO 62%

MQA: Answering the Question via Robotic Manipulation

Yuhong Deng, Di Guo, Xiaofeng Guo, Naifu Zhang, Huaping Liu, Fuchun Sun

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments has been accepted by Robotics: Science and Systems 2021

Journal ref Robotics: Science and System (RSS2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12032 2023-01-31 cs.CV cs.AI 62%

BinaryVQA: A Versatile Test Set to Evaluate the Out-of-Distribution Generalization of VQA Models

Ali Borji

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10362 2022-11-16 cs.CV cs.AI cs.CL 62%

CPL: Counterfactual Prompt Learning for Vision and Language Models

Xuehai He, Diji Yang, Weixi Feng, Tsu-Jui Fu, Arjun Akula, Varun Jampani, Pradyumna Narayana, Sugato Basu, William Yang Wang, Xin Eric Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04872 2022-11-10 cs.CV cs.AI 62%

Visual Named Entity Linking: A New Dataset and A Baseline

Wenxiang Sun, Yixing Fan, Jiafeng Guo, Ruqing Zhang, Xueqi Cheng

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 11 figures, published to EMNLP 2022(findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14156 2022-11-03 cs.CV cs.AI cs.CL 62%

TVLT: Textless Vision-Language Transformer

Zineng Tang, Jaemin Cho, Yixin Nie, Mohit Bansal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2022 Oral (21 pages; the first three authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12576 2022-10-12 cs.CL cs.AI cs.CV cs.HC 62%

WinoGAViL: Gamified Association Benchmark to Challenge Vision-and-Language Models

Yonatan Bitton, Nitzan Bitton Guetta, Ron Yosef, Yuval Elovici, Mohit Bansal, Gabriel Stanovsky, Roy Schwartz

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2022, Datasets and Benchmarks. Website: https://winogavil.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09019 2022-09-20 cs.CV cs.CL cs.LG 62%

LAVIS: A Library for Language-Vision Intelligence

Dongxu Li, Junnan Li, Hung Le, Guangsen Wang, Silvio Savarese, Steven C. H. Hoi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Preprint of LAVIS technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.01988 2022-08-05 cs.LG cs.AI stat.ML 62%

Sparse Continuous Distributions and Fenchel-Young Losses

André F. T. Martins, Marcos Treviso, António Farinhas, Pedro M. Q. Aguiar, Mário A. T. Figueiredo, Mathieu Blondel, Vlad Niculae

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

Comments JMLR 2022 camera ready version. arXiv admin note: text overlap with arXiv:2006.07214

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06675 2022-07-15 cs.AI cs.CV cs.CY 62%

Can Machines Help Us Answering Question 16 in Datasheets, and In Turn Reflecting on Inappropriate Content?

Patrick Schramowski, Christopher Tauchmann, Kristian Kersting

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: text overlap with arXiv:2110.04222

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05281 2022-06-14 cs.CV cs.CL cs.LG 62%

Less Is More: Linear Layers on CLIP Features as Powerful VizWiz Model

Fabian Deuser, Konrad Habel, Philipp J. Rösch, Norbert Oswald

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments VizWiz Grand Challenge: Describing Images and Videos Taken by Blind People (CVPR Workshop 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13724 2022-06-01 cs.AI cs.CV 62%

V-Doc : Visual questions answers with Documents

Yihao Ding, Zhe Huang, Runlin Wang, Yanhang Zhang, Xianru Chen, Yuzhong Ma, Hyunsuk Chung, Soyeon Caren Han

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05019 2022-05-12 cs.CV cs.CL cs.LG 62%

Learning to Answer Visual Questions from Web Videos

Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, Cordelia Schmid

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments Accepted at the TPAMI Special Issue on the Best Papers of ICCV 2021. Journal extension of the conference paper arXiv:2012.00451. 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04061 2022-05-10 cs.CV cs.AI 62%

Multilevel Hierarchical Network with Multiscale Sampling for Video Question Answering

Min Peng, Chongyang Wang, Yuan Gao, Yu Shi, Xiang-Dong Zhou

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted by IJCAI 2022. arXiv admin note: text overlap with arXiv:2109.04735

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06386 2022-03-31 cs.CL cs.AI cs.CV 62%

Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation

Wenliang Dai, Lu Hou, Lifeng Shang, Xin Jiang, Qun Liu, Pascale Fung

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07664 2022-03-16 cs.CV cs.AI 62%

Can you even tell left from right? Presenting a new challenge for VQA

Sai Raam Venkatraman, Rishi Rao, S. Balasubramanian, Chandra Sekhar Vorugunti, R. Raghunatha Sarma

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏