arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3138 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3138 篇

2209.02982 2022-12-01 cs.CL 82%

Improving the Cross-Lingual Generalisation in Visual Question Answering

Farhad Nooralahzadeh, Rico Sennrich

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract)

Comments This work is accepted by the AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.13242 2022-07-28 cs.CV cs.AI cs.CL cs.LG 82%

Uncertainty-based Visual Question Answering: Estimating Semantic Inconsistency between Image and Knowledge Base

Jinyeong Chae, Jihie Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by the 2022 International Joint Conference on Neural Networks (IJCNN 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11053 2022-06-28 cs.CV cs.AI cs.LG cs.RO eess.IV 82%

Surgical-VQA: Visual Question Answering in Surgical Scenes using Transformer

Lalithkumar Seenivasan, Mobarakol Islam, Adithya K Krishna, Hongliang Ren

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Code: https://github.com/lalithjets/Surgical_VQA.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10448 2022-04-25 cs.CV cs.AI cs.CL cs.LG 82%

Hypergraph Transformer: Weakly-supervised Multi-hop Reasoning for Knowledge-based Visual Question Answering

Yu-Jung Heo, Eun-Sol Kim, Woo Suk Choi, Byoung-Tak Zhang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13706 2022-02-08 cs.CV cs.AI cs.LG 82%

Multi-Image Visual Question Answering

Harsh Raj, Janhavi Dadhania, Akhilesh Bhardwaj, Prabuchandran KJ

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13906 2021-12-30 cs.CV cs.AI cs.CL cs.LG 82%

Does CLIP Benefit Visual Question Answering in the Medical Domain as Much as it Does in the General Domain?

Sedigheh Eslami, Gerard de Melo, Christoph Meinel

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.10906 2021-11-19 cs.CV cs.AI cs.CL cs.LG 82%

Single-Modal Entropy based Active Learning for Visual Question Answering

Dong-Jin Kim, Jae Won Cho, Jinsoo Choi, Yunjae Jung, In So Kweon

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to BMVC 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02331 2021-07-07 cs.CL cs.AI cs.CV cs.LG 82%

Mind Your Outliers! Investigating the Negative Impact of Outliers on Active Learning for Visual Question Answering

Siddharth Karamcheti, Ranjay Krishna, Li Fei-Fei, Christopher D. Manning

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at ACL-IJCNLP 2021. 17 pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.07583 2020-12-04 cs.CV cs.AI cs.CL cs.LG 82%

Inverse Visual Question Answering with Multi-Level Attentions

Yaser Alwattar, Yuhong Guo

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.10731 2020-11-24 cs.CL cs.AI cs.CV cs.LG 82%

LRTA: A Transparent Neural-Symbolic Reasoning Framework with Modular Supervision for Visual Question Answering

Weixin Liang, Feiyang Niu, Aishwarya Reganti, Govind Thattai, Gokhan Tur

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS KR2ML 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.09073 2020-11-05 cs.CV cs.AI cs.CL cs.LG 82%

Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering

Zihao Zhu, Jing Yu, Yujing Wang, Yajing Sun, Yue Hu, Qi Wu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.11673 2020-02-03 cs.AI cs.CL cs.CV cs.LG 82%

Augmenting Visual Question Answering with Semantic Frame Information in a Multitask Learning Approach

Mehrdad Alizadeh, Barbara Di Eugenio

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 14th IEEE International Conference on SEMANTIC COMPUTING, 8 Pages, February 2020, San Diego CA USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.08730 2020-01-24 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

Robust Explanations for Visual Question Answering

Badri N. Patro, Shivansh Pate, Vinay P. Namboodiri

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments WACV-2020 (Accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.07864 2019-07-01 cs.LG cs.AI cs.CV stat.ML 82%

Probabilistic Neural-symbolic Models for Interpretable Visual Question Answering

Ramakrishna Vedantam, Karan Desai, Stefan Lee, Marcus Rohrbach, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2019 Camera Ready + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.11737 2019-06-05 cs.CV cs.AI cs.CL cs.LG 82%

The meaning of "most" for visual question answering models

Alexander Kuhnle, Ann Copestake

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.09487 2019-02-26 cs.CV cs.AI cs.CL cs.LG 82%

MUREL: Multimodal Relational Reasoning for Visual Question Answering

Remi Cadene, Hedi Ben-younes, Matthieu Cord, Nicolas Thome

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR2019 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00300 2018-08-02 cs.CV cs.AI cs.CL cs.LG cs.NE 82%

Learning Visual Question Answering by Bootstrapping Hard Attention

Mateusz Malinowski, Carl Doersch, Adam Santoro, Peter Battaglia

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.09701 2018-07-23 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

R-VQA: Learning Visual Relation Facts with Semantic Attention for Visual Question Answering

Pan Lu, Lei Ji, Wei Zhang, Nan Duan, Ming Zhou, Jianyong Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 10 pages, 5 figures, accepted as an oral paper in SIGKDD 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.07121 2018-06-12 cs.CL cs.AI cs.CV cs.LG 82%

Being Negative but Constructively: Lessons Learnt from Creating Better Visual Question Answering Datasets

Wei-Lun Chao, Hexiang Hu, Fei Sha

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted for Oral Presentation at NAACL-HLT 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.04323 2017-11-15 cs.CV cs.AI cs.LG 82%

High-Order Attention Models for Visual Question Answering

Idan Schwartz, Alexander G. Schwing, Tamir Hazan

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 9 pages, 8 figures, NIPS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00837 2017-05-16 cs.CV cs.AI cs.CL cs.LG 82%

Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering

Yash Goyal, Tejas Khot, Douglas Summers-Stay, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.08243 2017-04-27 cs.CV cs.AI cs.CL cs.LG 82%

C-VQA: A Compositional Split of the Visual Question Answering (VQA) v1.0 Dataset

Aishwarya Agrawal, Aniruddha Kembhavi, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.07356 2016-10-05 cs.CL cs.AI cs.CV cs.LG 82%

Analyzing the Behavior of Visual Question Answering Models

Aishwarya Agrawal, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments 13 pages, 20 figures; To appear in EMNLP 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.08974 2016-09-12 cs.CV cs.AI cs.CL cs.LG 82%

Towards Transparent AI Systems: Interpreting Visual Question Answering Models

Yash Goyal, Akrit Mohapatra, Devi Parikh, Dhruv Batra

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.08716 2016-09-01 cs.AI cs.CL cs.CV cs.LG 82%

Measuring Machine Intelligence Through Visual Question Answering

C. Lawrence Zitnick, Aishwarya Agrawal, Stanislaw Antol, Margaret Mitchell, Dhruv Batra, Devi Parikh

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments AI Magazine, 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07303 2024-09-24 cs.CV cs.CL cs.LG 82%

Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion

Peiyuan Chen, Zecheng Zhang, Yiping Dong, Li Zhou, Han Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Visual Question Answering, Rank VQA, Faster R-CNN, BERT, Multimodal Fusion, Ranking Learning, Hybrid Training Strategy

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09192 2019-09-23 cs.LG cs.CL cs.CV stat.ML 82%

Learning Sparse Mixture of Experts for Visual Question Answering

Vardaan Pahuja, Jie Fu, Christopher J. Pal

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

Comments Accepted in Visual Question Answering and Dialog Workshop, CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.07724 2018-03-22 cs.CL cs.AI cs.CV 82%

Attention on Attention: Architectures for Visual Question Answering (VQA)

Jasdeep Singh, Vincent Ying, Alex Nutkiewicz

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Visual Question Answering Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18833 2026-08-20 cs.CV 新提交 81%

EVADE: Evidence-Verified Agentic Diagnosis with Escape

EVADE:带弃权机制的证据验证智能诊断方法

Mohaimenul Azam Khan Raiaan, Nur Mohammad Fahad

机构 * Monash University(莫纳什大学) Murdoch University(默多克大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16094 2026-08-20 cs.CV 版本更新 81%

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

机构 * Singapore Institute of Technology(新加坡科技学院) NVIDIA(英伟达)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏