arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2606.16902 2026-06-16 cs.RO cs.AI 新提交 74%

Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models

基于开放视觉语言模型的空间问答与导航的二值追踪

Dongbin Na, Chanwoo Kim, Soonbin Rho, Giyun Choi, Gangbok Lee, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 视觉问答 :vision-language model(title);分类 cs.AI

AI总结 提出BinTrack,一种全开源的空间定位代理,通过二值搜索轨迹段,在SpaceLocQA基准上准确率提升22.8%,推理速度提升1.5倍,并发布多行程室外数据集GangnamLoop。

Comments 21 pages, 4 figures, 15 tables. Project page: https://ndb796.github.io/BinaryTracking ; Code and dataset: https://github.com/ndb796/BinaryTracking

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17547 2026-06-16 cs.CV cs.IR cs.MM 版本更新 74%

A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task

基于知识的视觉问答系统综述:视觉推理任务中的知识生命周期

Jiaqi Deng, Zonghan Wu, Huan Huo, Guandong Xu

机构 * University Technology of Sydney(悉尼大学技术学院) East China Normal University(华东师范大学) Education University of Hong Kong(香港教育大学)

专题命中 视觉问答 :visual reasoning(title);分类 cs.CV

AI总结 综述基于知识的视觉问答(KB-VQA)方法,将其分为知识表示、检索和推理三个阶段,并探讨大语言模型带来的变革,指出未来研究方向。

Comments Accepted at TKDE, 20 pages, 5 figures, 4 tables

Journal ref IEEE Transactions on Knowledge and Data Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29591 2026-05-29 cs.AI 74%

Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

Mind-Omni:通过离散扩散实现脑-视觉-语言建模的统一多任务框架

Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

机构 * NeuBCI Lab, State Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Future Technology, University of Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China Zhongguancun Academy, Beijing, China Peking University, Beijing, China

专题命中 视觉问答 :vision-language model(title);分类 cs.AI

AI总结 提出Mind-Omni框架,利用离散扩散范式统一七种编码与解码任务,通过脑分词器将连续脑信号转化为离散令牌,实现多模态交互,并构建脑问答指令调优数据集,在多项任务上达到或超越专用模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19356 2026-02-24 cs.CV 74%

Can Vision-Language Models Answer Face to Face Questions in the Real-World?

视觉-语言模型能否在现实世界中回答面对面问题?

Reza Pourreza, Rishit Dagli, Apratim Bhattacharyya, Sunny Panchal, Guillaume Berger, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 本文提出了一种新的数据集IVD,用于评估视觉-语言模型在现实世界中回答面对面问题的能力,并通过微调减少与人类表现的差距。

Comments ICLR 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16138 2026-02-19 cs.CV 74%

IRIS: Intent Resolution via Inference-time Saccades for Open-Ended VQA in Large Vision-Language Models

IRIS:通过推理时的注视来解决大型视觉-语言模型中开放式视觉问答的意图

Parsa Madinei, Srijita Karmakar, Russell Cohen Hoffing, Felix Gervitz, Miguel P. Eckstein

机构 * Department of Computer Science, UC Santa Barbara(计算机科学系,加州大学圣芭芭拉分校) Department of Psychological & Brain Sciences, UC Santa Barbara(心理学与脑科学系,加州大学圣芭芭拉分校) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 IRIS通过实时眼动数据提升大型视觉-语言模型在开放式视觉问答中的意图解析准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25867 2026-02-19 cs.LG 74%

Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs

从医学文献合成高质量的视觉问答系统:基于生成-验证框架的大型多模态模型

Xiaoke Huang, Ningsen Wang, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Fudan University(复旦大学) Amazon Research(亚马逊研究)

专题命中 视觉问答 :visual question answering(title);分类 cs.LG

AI总结 MedVLSynther通过生成-验证框架从开放文献合成高质量医学VQA数据,提升六个基准测试的准确率,达到77.57的VQA-RAD表现。

Comments Project page, code, data, and models: https://ucsc-vlaa.github.io/MedVLSynther/ ; Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15287 2026-01-22 cs.CV 74%

Towards Understanding Best Practices for Quantization of Vision-Language Models

朝着理解视觉-语言模型量化最佳实践

Gautom Das, Vincent La, Ethan Lau, Abhinav Shrivastava, Matthew Gwilliam

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 本研究探讨了视觉-语言模型量化方法对多模态流水线性能的影响,发现LLM低位量化在减少bpw时仍保持高精度,为高效部署MLLMs提供实践指导。

Comments 15 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12142 2025-12-19 cs.CV 74%

MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering

MAVIS:多模态来源归因的长形式视觉问答基准

Seokwon Song, Minsu Park, Gunhee Kim

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。

Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10591 2025-11-14 cs.CL cs.AI 74%

Mined Prompting and Metadata-Guided Generation for Wound Care Visual Question Answering

Bavana Durgapraveen, Sornaraj Sivasankaran, Abhinand Balachandran, Sriram Rajkumar

机构 * EXL Health AI Lab at MEDIQA-WV 2025(EXL健康AI实验室)

专题命中 视觉问答 :visual question answering(title);分类 cs.AI

Comments 2 figures, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11986 2025-09-16 cs.CV cs.CL 74%

Lost in Embeddings: Information Loss in Vision-Language Models

Wenyan Li, Raphael Tang, Chengzu Li, Caiqi Zhang, Ivan Vulić, Anders Søgaard

机构 * University of Copenhagen(哥本哈根大学) Microsoft(微软) University of Cambridge(剑桥大学)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00065 2025-05-02 cs.CL cs.LG 74%

ConSens: Assessing context grounding in open-book question answering

Ivan Vankov, Matyo Ivanov, Adriana Correia, Victor Botev

机构 * Iris.ai BG

专题命中 视觉问答 :grounding(title);分类 cs.LG

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00750 2025-04-17 cs.AI 74%

Beyond Text: Implementing Multimodal Large Language Model-Powered Multi-Agent Systems Using a No-Code Platform

Cheonsu Jeong

专题命中 视觉问答 :multimodal large language model(title);分类 cs.AI

Comments 22 pages, 27 figures

Journal ref 2025 Journal of Intelligence and Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10749 2024-12-17 cs.MM cs.CV 74%

Patch-level Sounding Object Tracking for Audio-Visual Question Answering

Zhangbin Li, Jinxing Zhou, Jing Zhang, Shengeng Tang, Kun Li, Dan Guo

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14132 2024-10-25 cs.CV cs.CL 74%

ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering

Nghia Hieu Nguyen, Tho Thanh Quan, Ngan Luu-Thuy Nguyen

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments PACLIC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10736 2024-05-20 cs.CV 74%

StackOverflowVQA: Stack Overflow Visual Question Answering Dataset

Motahhare Mirzaei, Mohammad Javad Pirhadi, Sauleh Eetemadi

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12720 2024-04-22 cs.CV cs.CL 74%

PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering

Yihao Ding, Kaixuan Ren, Jiabin Huang, Siwen Luo, Soyeon Caren Han

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Accepted by IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01151 2024-04-02 cs.CV 74%

Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs

Jialou Wang, Manli Zhu, Yulei Li, Honglei Li, Longzhi Yang, Wai Lok Woo

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Accepted to IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12222 2023-12-20 cs.CV 74%

EarthVQA: Towards Queryable Earth via Relational Reasoning-Based Remote Sensing Visual Question Answering

Junjue Wang, Zhuo Zheng, Zihang Chen, Ailong Ma, Yanfei Zhong

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Accepted By AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12638 2023-10-20 cs.AI 74%

PSYCHIC: A Neuro-Symbolic Framework for Knowledge Graph Question-Answering Grounding

Hanna Abi Akl

专题命中 视觉问答 :grounding(title);分类 cs.AI

Comments 10 pages, 3 figures, 2 tables, accepted for the Scholarly-QALD challenge at the International Semantic Web Conference (ISWC) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14558 2023-10-13 cs.CV 74%

Compressing And Debiasing Vision-Language Pre-Trained Models for Visual Question Answering

Qingyi Si, Yuanxin Liu, Zheng Lin, Peng Fu, Weiping Wang

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08283 2023-08-08 cs.CV cs.CL 74%

SceneGATE: Scene-Graph based co-Attention networks for TExt visual question answering

Feiqi Cao, Siwen Luo, Felipe Nunez, Zean Wen, Josiah Poon, Caren Han

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Published in Robotics (Q1, SCI indexed Journal): https://www.mdpi.com/2218-6581/12/4/114

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19664 2023-06-01 cs.CV cs.CL cs.MM 74%

Unveiling Cross Modality Bias in Visual Question Answering: A Causal View with Possible Worlds VQA

Ali Vosoughi, Shijian Deng, Songyang Zhang, Yapeng Tian, Chenliang Xu, Jiebo Luo

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05068 2023-03-10 cs.CV 74%

Toward Unsupervised Realistic Visual Question Answering

Yuwei Zhang, Chih-Hui Ho, Nuno Vasconcelos

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Yuwei Zhang and Chih-Hui Ho contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02624 2022-07-07 cs.CV cs.CL 74%

Knowing Earlier what Right Means to You: A Comprehensive VQA Dataset for Grounding Relative Directions via Multi-Task Learning

Kyra Ahrens, Matthias Kerzel, Jae Hee Lee, Cornelius Weber, Stefan Wermter

专题命中 视觉问答 :grounding(title);分类 cs.CV

Journal ref IJCAI 2022 Workshop on Spatio-Temporal Reasoning and Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.09134 2022-04-20 cs.CV cs.CL 74%

Good, Better, Best: Textual Distractors Generation for Multiple-Choice Visual Question Answering via Reinforcement Learning

Jiaying Lu, Xin Ye, Yi Ren, Yezhou Yang

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Journal ref CVPR'2022 Workshop on Open-Domain Retrieval Under a Multi-Modal Setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.17219 2022-04-01 cs.CV 74%

SimVQA: Exploring Simulated Environments for Visual Question Answering

Paola Cascante-Bonilla, Hui Wu, Letao Wang, Rogerio Feris, Vicente Ordonez

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Accepted to CVPR 2022. Camera-Ready version. Project page: https://simvqa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08484 2022-03-16 cs.CV cs.CL 74%

A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models

Woojeong Jin, Yu Cheng, Yelong Shen, Weizhu Chen, Xiang Ren

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

Comments Accepted to ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10283 2021-06-03 cs.CL cs.CV 74%

GraghVQA: Language-Guided Graph Neural Networks for Graph-based Visual Question Answering

Weixin Liang, Yanhao Jiang, Zixuan Liu

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments NAACL 2021 MAI-Workshop. Code available at https://github.com/codexxxl/GraphVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.08385 2020-04-21 cs.CV cs.CL 74%

Knowledge-Based Visual Question Answering in Videos

Noa Garcia, Mayu Otani, Chenhui Chu, Yuta Nakashima

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:1910.10706

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.13077 2019-10-30 cs.CV 74%

Learning Rich Image Region Representation for Visual Question Answering

Bei Liu, Zhicheng Huang, Zhaoyang Zeng, Zheyu Chen, Jianlong Fu

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

Comments Rank 2 in VQA Challenge 2019

详情

展开后加载摘要…

URL PDF HTML 收藏