arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2310.05338 2024-08-14 cs.CV cs.CL 79%

Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models

Holy Lovenia, Wenliang Dai, Samuel Cahyawijaya, Ziwei Ji, Pascale Fung

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);分类 cs.CV

Comments Published in ALVR Workshop at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21229 2024-08-01 cs.CV cs.CL 79%

Advancing Vietnamese Visual Question Answering with Transformer and Convolutional Integration

Ngoc Son Nguyen, Van Son Nguyen, Tung Le

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted at the journal of Computers & Electrical Engineering (Received 8 March 2024, Revised 8 June 2024, Accepted 10 July 2024)

Journal ref Computers and Electrical Engineering 119 (2024) 109474

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15346 2024-07-23 cs.CV cs.CL cs.MM 79%

Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models

Wenbin An, Feng Tian, Jiahao Nie, Wenkai Shi, Haonan Lin, Yan Chen, QianYing Wang, Yaqiang Wu, Guang Dai, Ping Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12277 2024-07-18 cs.CL cs.AI 79%

Multimodal Reranking for Knowledge-Intensive Visual Question Answering

Haoyang Wen, Honglei Zhuang, Hamed Zamani, Alexander Hauptmann, Michael Bendersky

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15562 2024-07-18 cs.CV 79%

Fully Authentic Visual Question Answering Dataset from Online Communities

Chongyan Chen, Mengchen Liu, Noel Codella, Yunsheng Li, Lu Yuan, Danna Gurari

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09833 2024-07-17 cs.AI cs.MM cs.SD eess.AS 79%

SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering

Zhe Yang, Wenrui Li, Guanghui Cheng

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14906 2024-07-16 cs.CV 79%

AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering

Xiuyuan Chen, Yuan Lin, Yuchen Zhang, Weiran Huang

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08669 2024-07-12 cs.CV 79%

Segmentation-guided Attention for Visual Question Answering from Remote Sensing Images

Lucrezia Tosato, Hichem Boussaid, Flora Weissgerber, Camille Kurtz, Laurent Wendling, Sylvain Lobry

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to IGARSS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19297 2024-06-28 cs.CV 79%

Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation

Malvina Nikandrou, Georgios Pantazopoulos, Ioannis Konstas, Alessandro Suglia

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12671 2024-06-18 cs.CV cs.CL 79%

Integrating Image Features with Convolutional Sequence-to-sequence Network for Multilingual Visual Question Answering

Triet Minh Thai, Son T. Luu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments VLSP2022-EVJVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09203 2024-06-14 cs.CV 79%

Optimizing Visual Question Answering Models for Driving: Bridging the Gap Between Human and Machine Attention Patterns

Kaavya Rekanar, Martin Hayes, Ganesh Sistu, Ciaran Eising

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00231 2024-06-04 cs.CV cs.CL 79%

Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models

Lei Li, Yuqi Wang, Runxin Xu, Peiyi Wang, Xiachong Feng, Lingpeng Kong, Qi Liu

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

Comments Project page: https://mm-arxiv.github.io, Camera Ready Version of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11058 2024-06-04 cs.CV cs.CL 79%

II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering

Jihyung Kil, Farideh Tavazoee, Dongyeop Kang, Joo-Kyung Kim

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13949 2024-05-24 cs.CV 79%

PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery

Runlong He, Mengya Xu, Adrito Das, Danyal Z. Khan, Sophia Bano, Hani J. Marcus, Danail Stoyanov, Matthew J. Clarkson, Mobarakol Islam

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12533 2024-05-22 cs.CV 79%

Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering

Hiba Maryam, Ling Fu, Jiajun Song, Tajrian ABM Shafayet, Qidi Luo, Xiang Bai, Yuliang Liu

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by the International Conference on Document Analysis and Recognition (ICDAR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02233 2024-05-13 cs.CV 79%

MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation

Ling Yang, Zhanyu Wang, Zhenghao Chen, Xinyu Liang, Luping Zhou

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19024 2024-05-01 cs.CV 79%

Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism

Lei Kang, Rubèn Tito, Ernest Valveny, Dimosthenis Karatzas

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to ICDAR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18397 2024-04-30 cs.CV 79%

ViOCRVQA: Novel Benchmark Dataset and Vision Reader for Visual Question Answering by Understanding Vietnamese Text in Images

Huy Quang Pham, Thang Kien-Bao Nguyen, Quan Van Nguyen, Dan Quang Tran, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16192 2024-04-26 cs.CL cs.CV 79%

Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering

Cuong Nhat Ha, Shima Asaadi, Sanjeev Kumar Karn, Oladimeji Farri, Tobias Heimann, Thomas Runkler

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);分类 cs.CV

Comments Clinical NLP @ NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13039 2024-04-22 cs.CV cs.CL 79%

LaPA: Latent Prompt Assist Model For Medical Visual Question Answering

Tiancheng Gu, Kaicheng Yang, Dongnan Liu, Weidong Cai

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments 10 pages, 4 figures, Accepted by CVPRW2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15596 2024-03-29 cs.CV cs.CL 79%

EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models

Sijie Cheng, Zhicheng Guo, Jingwen Wu, Kechen Fang, Peng Li, Huaping Liu, Yang Liu

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17545 2024-03-27 cs.CL cs.CV 79%

A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions

Shun Inadumi, Seiya Kawano, Akishige Yuguchi, Yasutomo Kawanishi, Koichiro Yoshino

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04735 2024-03-08 cs.CV 79%

SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM

Jielin Qiu, Andrea Madotto, Zhaojiang Lin, Paul A. Crook, Yifan Ethan Xu, Xin Luna Dong, Christos Faloutsos, Lei Li, Babak Damavandi, Seungwhan Moon

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13088 2024-02-21 cs.CV 79%

Slot-VLM: SlowFast Slots for Video-Language Modeling

Jiaqi Xu, Cuiling Lan, Wenxuan Xie, Xuejin Chen, Yan Lu

专题命中 视觉问答 :VLM(title,abstract);分类 cs.CV

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14836 2024-02-21 cs.CV 79%

NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario

Tianwen Qian, Jingjing Chen, Linhai Zhuo, Yang Jiao, Yu-Gang Jiang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11083 2024-02-20 cs.CV 79%

VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models

Ziyi Yin, Muchao Ye, Tianrong Zhang, Jiaqi Wang, Han Liu, Jinghui Chen, Ting Wang, Fenglong Ma

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments AAAI 2024, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09677 2024-02-16 cs.CV 79%

Prompt-based Personalized Federated Learning for Medical Visual Question Answering

He Zhu, Ren Togo, Takahiro Ogawa, Miki Haseyama

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accept by ICASSP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15646 2024-01-30 cs.CV 79%

Improving Data Augmentation for Robust Visual Question Answering with Effective Curriculum Learning

Yuhang Zheng, Zhen Wang, Long Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00044 2024-01-23 cs.LG 79%

Task Formulation Matters When Learning Continually: A Case Study in Visual Question Answering

Mavina Nikandrou, Lu Yu, Alessandro Suglia, Ioannis Konstas, Verena Rieser

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12816 2023-12-21 cs.CV 79%

Object-aware Adaptive-Positivity Learning for Audio-Visual Question Answering

Zhangbin Li, Dan Guo, Jinxing Zhou, Jing Zhang, Meng Wang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by AAAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏