arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2010.00839 2020-10-05 cs.CV 57%

CAPTION: Correction by Analyses, POS-Tagging and Interpretation of Objects using only Nouns

Leonardo Anjoletto Ferreira, Douglas De Rizzo Meneghetti, Paulo Eduardo Santos

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Published at the First Annual International Workshop on Interpretability: Methodologies and algorithms (IMA 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.06884 2020-10-05 cs.CV cs.CL 57%

DeVLBert: Learning Deconfounded Visio-Linguistic Representations

Shengyu Zhang, Tan Jiang, Tan Wang, Kun Kuang, Zhou Zhao, Jianke Zhu, Jin Yu, Hongxia Yang, Fei Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 10 pages, 4 figures, to appear in ACM MM 2020 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.01523 2020-09-04 cs.CV 57%

A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports

Yikuan Li, Hanyin Wang, Yuan Luo

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 10 pages, 3 figures, submitted to BIBM2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10797 2020-08-25 cs.CV 57%

Why do These Match? Explaining the Behavior of Image Similarity Models

Bryan A. Plummer, Mariya I. Vasileva, Vitali Petsiuk, Kate Saenko, David Forsyth

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted at ECCV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.15631 2020-06-30 cs.CV 57%

Improving VQA and its Explanations \\ by Comparing Competing Explanations

Jialin Wu, Liyan Chen, Raymond J. Mooney

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06637 2020-06-17 cs.CV cs.CL 57%

Exploring Weaknesses of VQA Models through Attribution Driven Insights

Shaunak Halbe

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Second Grand-Challenge and Workshop on Multimodal Language, ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.08322 2020-06-16 cs.CV cs.MM 57%

ORD: Object Relationship Discovery for Visual Dialogue Generation

Ziwei Wang, Zi Huang, Yadan Luo, Huimin Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.11872 2020-04-01 cs.CV 57%

Vision and Language: from Visual Perception to Content Creation

Tao Mei, Wei Zhang, Ting Yao

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Journal ref APSIPA Transactions on Signal and Information Processing 9 (2020) e11

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.14080 2020-04-01 cs.CV 57%

X-Linear Attention Networks for Image Captioning

Yingwei Pan, Ting Yao, Yehao Li, Tao Mei

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2020; The source code and model are publicly available at: https://github.com/Panda-Peter/image-captioning

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.12511 2020-03-31 cs.CV 57%

Assessing Image Quality Issues for Real-World Problems

Tai-Yin Chiu, Yinan Zhao, Danna Gurari

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.08897 2020-03-20 cs.CV cs.CL cs.MM 57%

Normalized and Geometry-Aware Self-Attention Network for Image Captioning

Longteng Guo, Jing Liu, Xinxin Zhu, Peng Yao, Shichen Lu, Hanqing Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09844 2020-03-13 cs.CV 57%

Adversarial Multimodal Network for Movie Question Answering

Zhaoquan Yuan, Siyuan Sun, Lixin Duan, Xiao Wu, Changsheng Xu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments We will revise the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.04732 2020-01-15 cs.CV 57%

Fine-grained Image Classification and Retrieval by Combining Visual and Locally Pooled Textual Features

Andres Mafla, Sounak Dey, Ali Furkan Biten, Lluis Gomez, Dimosthenis Karatzas

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Winter Conference on Applications of Computer Vision (WACV 2020) Accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.01119 2019-12-10 cs.CV cs.CL 57%

Deep Bayesian Active Learning for Multiple Correct Outputs

Khaled Jedoui, Ranjay Krishna, Michael Bernstein, Li Fei-Fei

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11059 2019-12-05 cs.CV 57%

Unified Vision-Language Pre-Training for Image Captioning and VQA

Luowei Zhou, Hamid Palangi, Lei Zhang, Houdong Hu, Jason J. Corso, Jianfeng Gao

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments AAAI 2020 camera-ready version. The code and the pre-trained models are available at https://github.com/LuoweiZhou/VLP

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07251 2019-11-19 cs.CV cs.CL 57%

DualVD: An Adaptive Dual Encoding Model for Deep Visual Understanding in Visual Dialogue

Xiaoze Jiang, Jing Yu, Zengchang Qin, Yingying Zhuang, Xingxing Zhang, Yue Hu, Qi Wu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by the Thirty-Fourth AAAI Conference on Artificial Intelligence (AAAI-2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.06352 2019-11-18 cs.CV cs.CL 57%

Question-Conditioned Counterfactual Image Generation for VQA

Jingjing Pan, Yash Goyal, Stefan Lee

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by the VQA Workshop at CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.03083 2019-11-11 cs.CV cs.CL 57%

Are we asking the right questions in MovieQA?

Bhavan Jasani, Rohit Girdhar, Deva Ramanan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Spotlight presentation at CLVL workshop, ICCV 2019. Project page: https://bhavanj.github.io/MovieQAWithoutMovies/

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.11532 2019-11-11 cs.LG stat.ML 57%

Structure Learning for Neural Module Networks

Vardaan Pahuja, Jie Fu, Sarath Chandar, Christopher J. Pal

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.03285 2019-09-24 cs.CY cs.CV cs.HC 57%

Can You Explain That? Lucid Explanations Help Human-AI Collaborative Image Retrieval

Arijit Ray, Yi Yao, Rakesh Kumar, Ajay Divakaran, Giedrius Burachas

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 2019 AAAI Conference on Human Computation and Crowdsourcing

Journal ref 2019 AAAI Conference on Human Computation and Crowdsourcing

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.00313 2019-08-27 cs.CV 57%

VrR-VG: Refocusing Visually-Relevant Relationships

Yuanzhi Liang, Yalong Bai, Wei Zhang, Xueming Qian, Li Zhu, Tao Mei

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by ICCV2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05067 2019-08-15 cs.CL cs.CV 57%

Reactive Multi-Stage Feature Fusion for Multimodal Dialogue Modeling

Yi-Ting Yeh, Tzu-Chuan Lin, Hsiao-Hua Cheng, Yu-Hsuan Deng, Shang-Yu Su, Yun-Nung Chen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted for a poster session at the DSTC7 workshop at AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09635 2019-06-25 cs.CL cs.LG 57%

Investigating Biases in Textual Entailment Datasets

Shawn Tan, Yikang Shen, Chin-wei Huang, Aaron Courville

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12243 2019-05-30 cs.CV 57%

Vision-to-Language Tasks Based on Attributes and Attention Mechanism

Xuelong Li, Aihong Yuan, Xiaoqiang Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 15 pages, 6 figures, 50 references

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.12774 2019-04-30 cs.LG cs.NE stat.ML 57%

Routing Networks and the Challenges of Modular and Compositional Computation

Clemens Rosenbaum, Ignacio Cases, Matthew Riemer, Tim Klinger

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.06038 2019-04-15 cs.CL cs.CV 57%

Evaluating the Representational Hub of Language and Vision Models

Ravi Shekhar, Ece Takmaz, Raquel Fernández, Raffaella Bernardi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to IWCS 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02354 2019-04-10 cs.MM cs.CV cs.SI 57%

MMED: A Multi-domain and Multi-modality Event Dataset

Zhenguo Yang, Zehang Lin, Min Cheng, Qing Li, Wenyin Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.02664 2019-04-09 cs.CV 57%

Recursive Visual Attention in Visual Dialog

Yulei Niu, Hanwang Zhang, Manli Zhang, Jianhong Zhang, Zhiwu Lu, Ji-Rong Wen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments CVPR 2019 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02865 2019-04-08 cs.CV 57%

Actively Seeking and Learning from Live Data

Damien Teney, Anton van den Hengel

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.11280 2019-03-01 cs.LG cs.SD eess.AS stat.ML 57%

From Visual to Acoustic Question Answering

Jerome Abdelnour, Giampiero Salvi, Jean Rouat

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏