arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2311.07306 2023-11-14 cs.CV 77%

What Large Language Models Bring to Text-rich VQA?

Xuejing Liu, Wei Tang, Xinzhe Ni, Jinghui Lu, Rui Zhao, Zechao Li, Fei Tan

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05109 2023-10-10 cs.CV 77%

Lightweight In-Context Tuning for Multimodal Unified Models

Yixin Chen, Shuai Zhang, Boran Han, Jiaya Jia

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12223 2023-05-24 cs.CV 77%

What Makes for Good Visual Tokenizers for Large Language Models?

Guangzhi Wang, Yixiao Ge, Xiaohan Ding, Mohan Kankanhalli, Ying Shan

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 15 pages, 3 figures. Project released at: https://github.com/TencentARC/GVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14045 2023-03-02 cs.CL cs.CV 77%

Language Is Not All You Need: Aligning Perception with Language Models

Shaohan Huang, Li Dong, Wenhui Wang, Yaru Hao, Saksham Singhal, Shuming Ma, Tengchao Lv, Lei Cui, Owais Khan Mohammed, Barun Patra, Qiang Liu, Kriti Aggarwal, Zewen Chi, Johan Bjorck, Vishrav Chaudhary, Subhojit Som, Xia Song, Furu Wei

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.01916 2021-11-09 cs.CV 77%

Answer Questions with Right Image Regions: A Visual Attention Regularization Approach

Yibing Liu, Yangyang Guo, Jianhua Yin, Xuemeng Song, Weifeng Liu, Liqiang Nie

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments ACM TOMM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12304 2026-07-15 cs.CV cs.LG 新提交 76%

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation

时间基准分数衡量的是什么?分解视频视觉语言模型评估中的通道使用情况

Farrukh Rahman

机构 * Microsoft(微软) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :VLM(title);分类 cs.CV、cs.LG

AI总结 研究视频视觉语言模型评估中时间基准分数衡量问题,提出无标签筛选方法“反转下降”区分模型通道使用情况,如Molmo2和Qwen3-VL,指出综合分数不能反映潜在失败模式,此区分在多基准和任务中成立。

Comments 9 pages, 11 pages supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04950 2026-04-23 cs.CV cs.AI 76%

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16618 2025-09-23 cs.CV cs.AI 76%

Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery

Pengfei Hao, Hongqiu Wang, Shuaibo Li, Zhaohu Xing, Guang Yang, Kaishun Wu, Lei Zhu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Imperial College London(帝国理工学院伦敦分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI

Comments Early accepted by MICCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13836 2025-06-17 cs.LG cs.AI 76%

Quantifying Memorization and Parametric Response Rates in Retrieval-Augmented Vision-Language Models

Peter Carragher, Abhinand Jha, R Raghav, Kathleen M. Carley

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05827 2024-04-04 cs.CL cs.AI cs.CV 76%

Hallucination Benchmark in Medical Visual Question Answering

Jinge Wu, Yunsoo Kim, Honghan Wu

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2024 Tiny Papers(Notable)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04914 2023-11-28 cs.CV cs.AI cs.CL 76%

Analyzing Zero-Shot Abilities of Vision-Language Models on Video Understanding Tasks

Avinash Madasu, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 视觉问答 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15325 2023-10-25 cs.CV cs.CL cs.LG 76%

LXMERT Model Compression for Visual Question Answering

Maryam Hashemi, Ghazaleh Mahmoudi, Sara Kodeiri, Hadi Sheikhi, Sauleh Eetemadi

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG

Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05863 2023-10-11 eess.AS cs.AI cs.CV cs.SD 76%

Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models

Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang

专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02489 2023-07-07 cs.CV cs.AI 76%

Visual Question Answering (VQA) on Images with Superimposed Text

Venkat Kodali, Daniel Berleant

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments To appear in: Proc. of the Future Technologies Conference (FTC) 2023, Nov. 2-3, San Francisco, pub. by Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01013 2023-06-27 cs.CV cs.AI cs.CL cs.MM 76%

Counterfactual Samples Synthesizing and Training for Robust Visual Question Answering

Long Chen, Yuhang Zheng, Yulei Niu, Hanwang Zhang, Jun Xiao

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence, TPAMI 2023. (Extension of CVPR'20 work). arXiv admin note: text overlap with arXiv:2003.06576

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08739 2022-09-16 cs.CV cs.AI cs.CL cs.MM 76%

Rethinking Data Augmentation for Robust Visual Question Answering

Long Chen, Yuhang Zheng, Jun Xiao

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Accepted to ECCV 2022; Codes: https://github.com/ItemZheng/KDDAug

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11574 2020-05-13 cs.CV cs.AI cs.CL 76%

TVQA+: Spatio-Temporal Grounding for Video Question Answering

Jie Lei, Licheng Yu, Tamara L. Berg, Mohit Bansal

专题命中 视觉问答 :grounding(title);分类 cs.CV、cs.AI

Comments ACL 2020 camera-ready (15 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.02032 2020-04-07 cs.AI cs.CL cs.CV 76%

Generating Rationales in Visual Question Answering

Hammad A. Ayyubi, Md. Mehrab Tanjim, Julian J. McAuley, Garrison W. Cottrell

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05054 2019-11-05 cs.CL cs.CV cs.LG 76%

Fusion of Detected Objects in Text for Visual Question Answering

Chris Alberti, Jeffrey Ling, Michael Collins, David Reitter

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.10650 2019-09-25 cs.AI cs.CV cs.RO 76%

Non-monotonic Logical Reasoning Guiding Deep Learning for Explainable Visual Question Answering

Heather Riley, Mohan Sridharan

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.02697 2016-11-28 cs.CV cs.AI cs.CL 76%

Ask Your Neurons: A Deep Learning Approach to Visual Question Answering

Mateusz Malinowski, Marcus Rohrbach, Mario Fritz

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Improved version, it also has a final table from the VQA challenge, and more baselines on DAQUAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 75%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交 75%

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19610 2026-07-01 cs.CE 75%

V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis

V2T-CoT:从视觉到文本链式推理用于医学推理与诊断

Yuan Wang, Jiaxiang Liu, Shujian Gao, Bin Feng, Zhihang Tang, Xiaotang Gai, Jian Wu, Zuozhu Liu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25136 2026-06-25 cs.RO 新提交 75%

Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control

视觉运动策略中的记忆检索用于长期机器人控制

Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。

Comments 16 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10893 2026-05-18 cs.CL 75%

Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking

grounded还是猜测?通过盲图像对比排序进行LVLM置信度估计

Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学) Independent AI Researcher(独立AI研究员) JPMorgan AI Research(摩根大通AI研究) Henry Ford Health(亨利福特健康)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 本文提出BICR框架,通过对比真实图像与遮蔽图像的隐藏状态,评估LVLM的置信度,实现跨模型的校准与判别性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 75%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 75%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10781 2026-03-12 cs.CV cs.AI cs.LG 75%

Taking Shortcuts for Categorical VQA Using Super Neurons

通过超级神经元进行类别视觉问答的捷径

Pierre Musacchio, Jaeyi Jeong, Dahun Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学) EPFL(瑞士联邦理工学院) Google Deepmind(谷歌DeepMind)

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过超级神经元提升类别视觉问答的性能,利用标量激活代替注意力向量,实现更高效的分类和更快的推理速度。

Comments 25 pages, 15 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01959 2026-03-02 cs.CV cs.AI cs.LG 75%

Structure-aware Contrastive Learning for Diagram Understanding of Multimodal Models

结构感知对比学习用于多模态模型的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。

Comments 10 pages, 8 figures

Journal ref ICCVW (2025) 7463-7472

详情

展开后加载摘要…

URL PDF HTML 收藏