arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2412.14133 2026-01-06 cs.CL 78%

Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models

视觉语言模型中实体知识提取跨模态性能差距

Ido Cohen, Daniela Gottesman, Mor Geva, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract)

AI总结 研究视觉语言模型在跨模态实体知识提取中的性能差异,揭示信息流动限制及模型推理效率问题。

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11840 2025-11-18 cs.RO 78%

LAVQA: A Latency-Aware Visual Question Answering Framework for Shared Autonomy in Self-Driving Vehicles

Shuangyu Xie, Kaiyuan Chen, Wenjing Chen, Chengyuan Qian, Christian Juette, Liu Ren, Dezhen Song, Ken Goldberg

机构 * University of California Berkeley(加州大学伯克利分校) Bosch Research(博世研究) MBZUAI Texas A&M University(德克萨斯农工大学) IEOR UC Berkeley(伯克利大学工业工程与运筹学系)

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26271 2025-10-31 cs.CL 78%

Distilling Multilingual Vision-Language Models: When Smaller Models Stay Multilingual

Sukrit Sriratanawilai, Jhayahgrit Thongwat, Romrawin Chumpu, Patomporn Payoungkhamdee, Sarana Nutanong, Peerat Limkonchotiwat

机构 * VISTEC AI Singapore

专题命中 视觉问答 :vision-language model(title,abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13606 2025-08-20 cs.CL 78%

AdaDocVQA: Adaptive Framework for Long Document Visual Question Answering in Low-Resource Settings

Haoxuan Li, Wei Song, Aofan Liu, Peiwu Qin

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Information Engineering, Peking University(北京大学信息工程学院)

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19202 2025-03-10 cs.CL 78%

LiGT: Layout-infused Generative Transformer for Visual Question Answering on Vietnamese Receipts

Thanh-Phong Le, Trung Le Chi Phan, Nghia Hieu Nguyen, Kiet Van Nguyen

机构 * University of Information Technology(信息科技大学) Vietnam National University(越南国立大学)

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted at IJDAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16410 2025-02-27 cs.CL 78%

Application of Multimodal Large Language Models in Autonomous Driving

Md Robiul Islam

机构 * William & Mary(威廉玛丽学院)

专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract)

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15481 2025-02-24 cs.ET eess.SP 78%

FaultGPT: Industrial Fault Diagnosis Question Answering System by Vision Language Models

Jiao Chen, Ruyi Huang, Zuohong Lv, Jianhua Tang, Weihua Li

专题命中 视觉问答 :vision language model(title);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01584 2025-02-17 cs.CL 78%

Towards Cross-Lingual Explanation of Artwork in Large-scale Vision Language Models

Shintaro Ozaki, Kazuki Hayashi, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

机构 * Nara Institute of Science and Technology (NAIST)(奈良科学技术研究所) The University of Tokyo(东京大学)

专题命中 视觉问答 :vision language model(title,abstract)

Comments NAACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04675 2025-01-09 cs.CL cs.AI cs.CV cs.LG 78%

Enhancing Financial VQA in Vision Language Models using Intermediate Structured Representations

Archita Srivastava, Abhas Kumar, Rajesh Kumar, Prabhakar Srinivasan

机构 * Synechron(森科龙(Synechron))

专题命中 视觉问答 :vision language model(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08263 2024-12-12 cs.CL 78%

Discrete Subgraph Sampling for Interpretable Graph based Visual Question Answering

Pascal Tilli, Ngoc Thang Vu

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13185 2024-11-01 cs.CL 78%

LIVE: Learnable In-Context Vector for Visual Question Answering

Yingzhe Peng, Chenduo Hao, Xu Yang, Jiawei Peng, Xinting Hu, Xin Geng

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05608 2024-10-10 cs.CL 78%

Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond

Soyeon Caren Han, Feiqi Cao, Josiah Poon, Roberto Navigli

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract)

Comments Accepted at ACM-MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07536 2024-08-27 cs.CL 78%

A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering

Yunxin Li, Longyue Wang, Baotian Hu, Xinyu Chen, Wanqi Zhong, Chenyang Lyu, Wei Wang, Min Zhang

专题命中 视觉问答 :visual question answering(title,abstract)

Comments 20 pages, 15 pages; technical paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06443 2024-08-01 cs.CL 78%

BOK-VQA: Bilingual outside Knowledge-Based Visual Question Answering via Graph Representation Pretraining

Minjun Kim, Seungwoo Song, Youhan Lee, Haneol Jang, Kyungtae Lim

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09994 2024-06-17 cs.CL 78%

Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models

Manas Jhalani, Annervaz K M, Pushpak Bhattacharyya

专题命中 视觉问答 :visual question answering(title,abstract)

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02331 2024-06-05 cs.CL 78%

Translation Deserves Better: Analyzing Translation Artifacts in Cross-lingual Visual Question Answering

ChaeHun Park, Koanho Lee, Hyesu Lim, Jaeseok Kim, Junmo Park, Yu-Jung Heo, Du-Seong Chang, Jaegul Choo

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ACL 2024 Findings Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06636 2024-05-24 cs.CV cs.AI cs.CL cs.LG 78%

Federated Document Visual Question Answering: A Pilot Study

Khanh Nguyen, Dimosthenis Karatzas

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02601 2024-05-06 cs.CL 78%

Knowledge-Based Counterfactual Queries for Visual Question Answering

Theodoti Stoikou, Maria Lymperaiou, Giorgos Stamou

专题命中 视觉问答 :visual question answering(title,abstract)

Journal ref AAAI MAKE 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08628 2024-04-24 cs.CL 78%

Learning the meanings of function words from grounded language using a visual question answering model

Eva Portelance, Michael C. Frank, Dan Jurafsky

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Published in Cognitive Science 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11752 2024-04-18 cs.CL 78%

EVJVQA Challenge: Multilingual Visual Question Answering

Ngan Luu-Thuy Nguyen, Nghia Hieu Nguyen, Duong T. D Vo, Khanh Quoc Tran, Kiet Van Nguyen

专题命中 视觉问答 :visual question answering(title,abstract)

Comments VLSP2022 EVJVQA challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17647 2024-03-28 cs.CL 78%

Intrinsic Subgraph Generation for Interpretable Graph based Visual Question Answering

Pascal Tilli, Ngoc Thang Vu

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted at LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05674 2024-03-19 cs.RO 78%

Robotic Applications of Pre-Trained Vision-Language Models to Various Recognition Behaviors

Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa, Kei Okada, Masayuki Inaba

专题命中 视觉问答 :vision-language model(title,abstract)

Comments Accepted at Humanoids2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05736 2024-01-12 cs.CL cs.IR 78%

Cross-modal Retrieval for Knowledge-based Visual Question Answering

Paul Lerner, Olivier Ferret, Camille Guinaudeau

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14670 2023-11-02 cs.CV cs.AI cs.CL cs.LG cs.MM 78%

Dataset Bias Mitigation in Multiple-Choice Visual Question Answering and Beyond

Zhecan Wang, Long Chen, Haoxuan You, Keyang Xu, Yicheng He, Wenhao Li, Noel Codella, Kai-Wei Chang, Shih-Fu Chang

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI、cs.LG

Comments EMNLP 2023

Journal ref EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04183 2023-10-03 cs.CL 78%

OpenViVQA: Task, Dataset, and Multimodal Fusion Models for Visual Question Answering in Vietnamese

Nghia Hieu Nguyen, Duong T. D. Vo, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

专题命中 视觉问答 :visual question answering(title,abstract)

Comments submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.07630 2023-06-12 cs.CL 78%

Delving Deeper into Cross-lingual Visual Question Answering

Chen Liu, Jonas Pfeiffer, Anna Korhonen, Ivan Vulić, Iryna Gurevych

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Findings of EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05392 2023-06-09 cs.CL 78%

Modular Visual Question Answering via Code Generation

Sanjay Subramanian, Medhini Narasimhan, Kushal Khangaonkar, Kevin Yang, Arsha Nagrani, Cordelia Schmid, Andy Zeng, Trevor Darrell, Dan Klein

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17690 2023-05-30 cs.CL 78%

HaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language

Shantipriya Parida, Idris Abdulmumin, Shamsuddeen Hassan Muhammad, Aneesh Bose, Guneet Singh Kohli, Ibrahim Said Ahmad, Ketan Kotwal, Sayan Deb Sarkar, Ondřej Bojar, Habeebah Adamu Kakudi

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Accepted at ACL 2023 as a long paper (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14336 2023-04-04 cs.IR 78%

Document Collection Visual Question Answering

Rubèn Tito, Dimosthenis Karatzas, Ernest Valveny

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10799 2023-02-14 cs.CL 78%

Towards a Unified Model for Generating Answers and Explanations in Visual Question Answering

Chenxi Whitehouse, Tillman Weyde, Pranava Madhyastha

专题命中 视觉问答 :visual question answering(title,abstract)

Comments Findings of EACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏