arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3148 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3148 篇

2509.16618 2025-09-23 cs.CV cs.AI 76%

Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery

Pengfei Hao, Hongqiu Wang, Shuaibo Li, Zhaohu Xing, Guang Yang, Kaishun Wu, Lei Zhu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Imperial College London(帝国理工学院伦敦分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI

Comments Early accepted by MICCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13836 2025-06-17 cs.LG cs.AI 76%

Quantifying Memorization and Parametric Response Rates in Retrieval-Augmented Vision-Language Models

Peter Carragher, Abhinand Jha, R Raghav, Kathleen M. Carley

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05827 2024-04-04 cs.CL cs.AI cs.CV 76%

Hallucination Benchmark in Medical Visual Question Answering

Jinge Wu, Yunsoo Kim, Honghan Wu

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2024 Tiny Papers(Notable)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04914 2023-11-28 cs.CV cs.AI cs.CL 76%

Analyzing Zero-Shot Abilities of Vision-Language Models on Video Understanding Tasks

Avinash Madasu, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 视觉问答 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15325 2023-10-25 cs.CV cs.CL cs.LG 76%

LXMERT Model Compression for Visual Question Answering

Maryam Hashemi, Ghazaleh Mahmoudi, Sara Kodeiri, Hadi Sheikhi, Sauleh Eetemadi

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG

Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05863 2023-10-11 eess.AS cs.AI cs.CV cs.SD 76%

Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models

Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang

专题命中 视觉问答 :multimodal large language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02489 2023-07-07 cs.CV cs.AI 76%

Visual Question Answering (VQA) on Images with Superimposed Text

Venkat Kodali, Daniel Berleant

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments To appear in: Proc. of the Future Technologies Conference (FTC) 2023, Nov. 2-3, San Francisco, pub. by Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01013 2023-06-27 cs.CV cs.AI cs.CL cs.MM 76%

Counterfactual Samples Synthesizing and Training for Robust Visual Question Answering

Long Chen, Yuhang Zheng, Yulei Niu, Hanwang Zhang, Jun Xiao

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence, TPAMI 2023. (Extension of CVPR'20 work). arXiv admin note: text overlap with arXiv:2003.06576

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08739 2022-09-16 cs.CV cs.AI cs.CL cs.MM 76%

Rethinking Data Augmentation for Robust Visual Question Answering

Long Chen, Yuhang Zheng, Jun Xiao

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Accepted to ECCV 2022; Codes: https://github.com/ItemZheng/KDDAug

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11574 2020-05-13 cs.CV cs.AI cs.CL 76%

TVQA+: Spatio-Temporal Grounding for Video Question Answering

Jie Lei, Licheng Yu, Tamara L. Berg, Mohit Bansal

专题命中 视觉问答 :grounding(title);分类 cs.CV、cs.AI

Comments ACL 2020 camera-ready (15 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.02032 2020-04-07 cs.AI cs.CL cs.CV 76%

Generating Rationales in Visual Question Answering

Hammad A. Ayyubi, Md. Mehrab Tanjim, Julian J. McAuley, Garrison W. Cottrell

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05054 2019-11-05 cs.CL cs.CV cs.LG 76%

Fusion of Detected Objects in Text for Visual Question Answering

Chris Alberti, Jeffrey Ling, Michael Collins, David Reitter

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.10650 2019-09-25 cs.AI cs.CV cs.RO 76%

Non-monotonic Logical Reasoning Guiding Deep Learning for Explainable Visual Question Answering

Heather Riley, Mohan Sridharan

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.02697 2016-11-28 cs.CV cs.AI cs.CL 76%

Ask Your Neurons: A Deep Learning Approach to Visual Question Answering

Mateusz Malinowski, Marcus Rohrbach, Mario Fritz

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI

Comments Improved version, it also has a final table from the VQA challenge, and more baselines on DAQUAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 75%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交 75%

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19610 2026-07-01 cs.CE 75%

V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis

V2T-CoT:从视觉到文本链式推理用于医学推理与诊断

Yuan Wang, Jiaxiang Liu, Shujian Gao, Bin Feng, Zhihang Tang, Xiaotang Gai, Jian Wu, Zuozhu Liu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25136 2026-06-25 cs.RO 新提交 75%

Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control

视觉运动策略中的记忆检索用于长期机器人控制

Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。

Comments 16 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10893 2026-05-18 cs.CL 75%

Grounded or Guessing? LVLM Confidence Estimation via Blind-Image Contrastive Ranking

grounded还是猜测?通过盲图像对比排序进行LVLM置信度估计

Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学) Independent AI Researcher(独立AI研究员) JPMorgan AI Research(摩根大通AI研究) Henry Ford Health(亨利福特健康)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 本文提出BICR框架,通过对比真实图像与遮蔽图像的隐藏状态,评估LVLM的置信度,实现跨模型的校准与判别性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 75%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 75%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10781 2026-03-12 cs.CV cs.AI cs.LG 75%

Taking Shortcuts for Categorical VQA Using Super Neurons

通过超级神经元进行类别视觉问答的捷径

Pierre Musacchio, Jaeyi Jeong, Dahun Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学) EPFL(瑞士联邦理工学院) Google Deepmind(谷歌DeepMind)

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过超级神经元提升类别视觉问答的性能,利用标量激活代替注意力向量,实现更高效的分类和更快的推理速度。

Comments 25 pages, 15 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01959 2026-03-02 cs.CV cs.AI cs.LG 75%

Structure-aware Contrastive Learning for Diagram Understanding of Multimodal Models

结构感知对比学习用于多模态模型的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。

Comments 10 pages, 8 figures

Journal ref ICCVW (2025) 7463-7472

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 75%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03007 2026-02-04 cs.CV cs.AI cs.LG 75%

VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering

VOILA:基于信息价值的保真度选择框架用于成本感知的多模态问答

Rahul Atul Bhope, K. R. Jayaram, Vinod Muthusamy, Ritesh Kumar, Vatche Isahagian, Nalini Venkatasubramanian

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VOILA通过基于信息价值的自适应保真度选择,在多模态问答中实现成本优化与高精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05826 2025-12-04 cs.CV cs.AI cs.LG 75%

From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing

从像素到 prose:推进遥感多模态语言模型

Xintian Sun, Benji Peng, Charles Zhang, Fei Jin, Qian Niu, Junyu Liu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Ming Liu, Xinyuan Song, Yichao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Minnesota - Twin Cities(明尼苏达大学双城分校) Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Purdue University(普渡大学) Emory University(埃默里大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文探讨了多模态语言模型在遥感中的应用,分析了其技术基础、挑战及未来发展方向,强调了其在环境监测和灾害响应中的重要作用。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27280 2025-11-25 cs.CV cs.AI cs.LG 75%

FOCUS: Efficient Keyframe Selection for Long Video Understanding

FOCUS: 长视频理解中的高效关键帧选择

Zirui Zhu, Hailun Xu, Yang Luo, Yong Liu, Kanchan Sarkar, Zhenheng Yang, Yang You

机构 * National University of Singapore(新加坡国立大学) TikTok

专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 FOCUS通过两阶段探索-利用策略,在严格标记预算下高效选择关键帧,提升长视频理解的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04727 2025-11-10 cs.CV cs.AI cs.LG 75%

IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs

Ali Faraz, Akash, Shaharukh Khan, Raja Kolla, Akshat Patidar, Suranjan Goswami, Abhinav Ravi, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI OLA Electric

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20287 2025-10-24 cs.CV cs.AI cs.LG 75%

Breakdance Video classification in the age of Generative AI

Sauptik Dhar, Naveen Ramakrishnan, Michelle Munson

机构 * Eluvio AI Labs(Eluvio AI实验室)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07098 2025-10-09 cs.CL 75%

TALENT: Table VQA via Augmented Language-Enhanced Natural-text Transcription

Guo Yutong, Wanying Wang, Yue Wu, Zichen Miao, Haoyu Wang

机构 * Johns Hopkins University(约翰霍普金斯大学) Purdue University(普渡大学) University at Albany(阿尔巴尼大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏