arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2508.18989 2026-01-27 cs.CV 83%

Ask Me Again Differently: GRAS for Measuring Bias in Vision Language Models on Gender, Race, Age, and Skin Tone

再次提问:GRAS用于测量视觉语言模型在性别、种族、年龄和肤色上的偏见

Shaivi Malik, Hasnat Md Abdullah, Sriparna Saha, Amit Sheth

机构 * Guru Gobind Singh Indraprastha University(古鲁·戈宾德·辛格印度教普拉斯塔大学) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Patna, India(印度理工学院帕纳布分校)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 GRAS用于评估视觉语言模型在性别、种族、年龄和肤色上的偏见,通过基准测试揭示了模型的偏见水平,并提出了可解释的偏见评分方法。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10427 2026-01-21 cs.CV 83%

STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes

STRIDE-QA:用于城市驾驶场景时空推理的视觉问答数据集

Keishi Ishihara, Kento Sasaki, Tsubasa Takahashi, Daiki Shiono, Yu Yamaguchi

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 STRIDE-QA通过大规模视觉问答数据集提升自动驾驶中动态交通场景的时空推理能力,显著提升VLMs在空间定位和未来运动预测中的表现。

Comments Accepted to AAAI 2026 (Oral). project page: https://turingmotors.github.io/stride-qa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24591 2026-01-01 cs.CV 83%

Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning

通过决策模糊性引导的强化微调提升少样本变化检测视觉问答

Fuyu Dong, Ke Li, Di Wang, Nan Luo, Yiming Zhang, Kaiyu Li, Jianfei Yang, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Mathematics, University of California, San Diego(加州大学圣地亚哥分校数学系) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 DARFT通过决策模糊性引导的强化微调提升CDVQA的判别性和鲁棒性,尤其在少样本场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18286 2025-12-29 cs.CV 83%

RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System

RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试

Runwei Guan, Rongsheng Hu, Shangshu Chen, Ningyuan Xiao, Xue Xia, Jiayang Liu, Beibei Chen, Ziren Tang, Ningwei Ouyang, Shaofeng Liang, Yuxuan Fan, Wanjie Sun, Yutao Yue

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。

Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21126 2025-12-25 cs.CV cs.DB 83%

MarineEval: Assessing the Marine Intelligence of Vision-Language Models

MarineEval: 评估视觉-语言模型的海洋智能

YuK-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MarineEval首次构建大规模海洋VLM数据集和基准,评估现有VLM在回答海洋领域问题上的能力与局限性。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10200 2025-12-23 cs.CV 83%

LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents

LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解

Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :MLLM(title,abstract);InternVL(abstract);分类 cs.CV

AI总结 LVAgent通过多轮动态协作的MLLM代理提升长视频理解性能,实现80%的准确率并在LongVideoBench上提升13.3%

Comments accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22787 2025-12-11 cs.CV 83%

World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models

世界在框架中:将文化混合视为视觉语言模型的新挑战

Eunsu Kim, Junyeong Park, Na Min An, Junseong Kim, Hitesh Laxmichand Patel, Jiho Jin, Julia Kruk, Amit Agarwal, Srikant Panda, Fenal Ashokbhai Ilasariya, Hyunjung Shim, Alice Oh

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出CultureMix基准,研究文化混合对视觉语言模型的影响,发现模型在混合场景中表现不佳,通过监督微调提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01371 2025-12-09 cs.CV 83%

CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering

CLIP-UP: 基于CLIP的视觉问答中不可回答问题检测

Ben Vardi, Oron Nir, Ariel Shamir

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 CLIP-UP通过基于CLIP的相似性度量,为视觉问答模型提供检测不可回答问题的能力,提升模型在不可回答问题上的识别性能。

Comments Revised version. Improvements include support for open-ended VQA and an alternative injection method

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22143 2025-12-08 cs.CV 83%

3D Question Answering via only 2D Vision-Language Models

仅通过2D视觉-语言模型实现3D问答

Fengyun Wang, Sicheng Yu, Jiawei Wu, Jinhui Tang, Hanwang Zhang, Qianru Sun

机构 * Nanyang Technological University, Singapore Singapore Management University, Singapore National University of Singapore, Singapore Nanjing University of Science \& Technology, Nanjing, China

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出cdViews方法,通过仅使用2D视觉-语言模型,实现3D问答任务的高性能表现。

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06783 2025-12-05 cs.CV 83%

TTRV: Test-Time Reinforcement Learning for Vision Language Models

TTRV:用于视觉语言模型的测试时间强化学习

Akshit Singh, Shyam Marjit, Wei Lin, Paul Gavrikov, Serena Yeung-Levy, Hilde Kuehne, Rogerio Feris, Sivan Doveh, James Glass, M. Jehanzeb Mirza

机构 * IISc Bangalore(班加罗尔印度理工学院) JKU Linz(林茨约翰·凯撒大学) Stanford(斯坦福大学) Tübingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) MIT CSAIL Project(麻省理工CSAIL项目)

专题命中 视觉问答 :vision language model(title);InternVL(abstract);visual question answering(abstract);分类 cs.CV

AI总结 TTRV通过测试时间强化学习提升视觉语言模型的识别和问答性能,无需标记数据,在多个任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18921 2025-11-25 cs.CV 83%

BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models

BackdoorVLM:面向视觉-语言模型的后门攻击基准

Juncheng Li, Yige Li, Hanxun Huang, Yunhao Chen, Xin Wang, Yixu Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理学院) The University of Melbourne(墨尔本大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 BackdoorVLM提出首个评估视觉-语言模型后门攻击的基准,揭示VLMs对文本指令的高敏感性及多模后门的有效性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13892 2025-11-19 cs.AI 83%

Jailbreaking Large Vision Language Models in Intelligent Transportation Systems

Badhan Chandra Das, Md Tasnim Jawad, Md Jueal Mia, M. Hadi Amini, Yanzhao Wu

机构 * KFSCIS, Florida International University(凯斯-西储大学信息科学学院) Knight Foundation School of Computing and Information Sciences(骑士基金会计算与信息科学学院) Learning for InterDependent Networks Laboratory (solid lab)(依赖网络学习实验室)

专题命中 视觉问答 :vision language model(title,abstract);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18041 2025-11-17 cs.CV 83%

NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning

Sahil Shah, S P Sharan, Harsh Goel, Minkyu Choi, Mustafa Munir, Manvik Pasula, Radu Marculescu, Sandeep Chinchali

专题命中 视觉问答 :grounding(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00942 2025-11-13 cs.CL cs.AI eess.SP 83%

anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task Understanding

Haitao Li, Ziyu Li, Yiheng Mao, Ziyi Liu, Zhoujian Sun, Zhengxing Huang

专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00504 2025-11-11 cs.CV 83%

VinDr-CXR-VQA: A Visual Question Answering Dataset for Explainable Chest X-Ray Analysis with Multi-Task Learning

Dang H. Nguyen, Hieu H. Pham, Hao T. Nguyen, Hieu H. Pham

机构 * College of Engineering and Computer Science(工程与计算机科学学院) VinUniversity(Vin大学) VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心) Vietnam National Cancer Hospital(越南国家癌症医院) The Computer Vision and Medical AI Lab(计算机视觉与医学人工智能实验室)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments ISBI submission. Contains 5 pages, 2 figures, and 6 tables. Code & data: https://huggingface.co/datasets/Dangindev/VinDR-CXR-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00916 2025-11-04 cs.CV 83%

Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs

Yan Shu, Chi Liu, Robin Chen, Derek Li, Bryan Dai

机构 * Ubiquant(乌比量化)

专题命中 视觉问答 :visual reasoning(title);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11295 2025-11-03 cs.CV 83%

Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering

Jian Lan, Zhicheng Liu, Udo Schlegel, Raoyuan Zhao, Yihong Liu, Hinrich Schütze, Michael A. Hedderich, Thomas Seidl

机构 * University of Munich(慕尼黑大学) Munich Center of Machine Learning(慕尼黑机器学习中心)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07966 2025-10-08 cs.CV 83%

SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence

Ziyang Gong, Wenhao Li, Oliver Ma, Songyuan Li, Zhaokai Wang, Songyuan Li, Jiayi Ji, Xue Yang, Gen Luo, Junchi Yan, Rongrong Ji

机构 * SJTU(上海交通大学) XMU(厦门大学) Shanghai AI Lab(上海人工智能实验室) SYSU(南方科技大学) FDU(福建大学) NUS(新加坡国立大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02328 2025-10-06 cs.CL cs.AI cs.MA 83%

AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering

Ziqing Wang, Chengsheng Mao, Xiaole Wen, Yuan Luo, Kaize Ding

机构 * Northwestern University(西北大学) Microsoft(微软公司)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25696 2025-10-01 cs.LG cs.CL eess.SP 83%

Can VLM Pseudo-Labels Train a Time-Series QA Model That Outperforms the VLM?

Takuya Fujimura, Kota Dohi, Natsuo Yamashita, Yohei Kawaguchi

机构 * Nagoya University(名古屋大学)

专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16628 2025-09-23 cs.CV 83%

Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning

Janak Kapuriya, Anwar Shaikh, Arnav Goel, Medha Hira, Apoorv Singh, Jay Saraf, Sanjana, Vaibhav Nauriyal, Avinash Anand, Zhengkui Wang, Rajiv Ratn Shah

机构 * Indraprastha Institute of Information Technology, Delhi(印度德里印度理工学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18172 2025-09-23 cs.CL cs.AI 83%

Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering

Zixin Chen, Sicheng Song, Kashun Shum, Yanna Lin, Rui Sheng, Weiqi Wang, Huamin Qu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments 34 pages in total, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13773 2025-09-17 cs.CV cs.CL 83%

Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions

Pu Jian, Donglei Yu, Wen Yang, Shuo Ren, Jiajun Zhang

专题命中 视觉问答 :vision-language model(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV

Comments ACL2025 Main (SAC Highlight Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17659 2025-08-14 cs.CV 83%

See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering

Junjie Wang, Yunhan Tang, Yijie Wang, Zhihao Yuan, Huan Wang, Yangfan He, Bin Li

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments We are withdrawing this preprint because it is undergoing a major revision and restructuring. We feel that the current version does not convey our core contributions and methodology with sufficient clarity and accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07023 2025-08-12 cs.CV 83%

MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering

Jingwei Peng, Jiehao Chen, Mateo Alejandro Rojas, Meilin Zhang

机构 * Shaanxi University of Technology(陕西理工大学) Technological University of Peru(秘鲁技术大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04059 2025-08-07 cs.CV 83%

Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models

Zhaochen Liu, Kaiwen Gao, Shuyi Liang, Bin Xiao, Limeng Qiao, Lin Ma, Tingting Jiang

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07631 2025-07-31 cs.LG cs.CL 83%

OWLViz: An Open-World Benchmark for Visual Question Answering

Thuy Nguyen, Dang Nguyen, Hoang Nguyen, Thuan Luong, Long Hoang Dang, Viet Dac Lai

机构 * Posts and Telecommunications Institute of Technology, Viet Nam(越南电信技术研究所) Adobe Research, USA(Adobe研究) University of Maryland, USA(美国马里兰大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.LG

Comments 8 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21596 2025-07-16 cs.CL cs.AI cs.IR 83%

Evaluating Multimodal Large Language Models on Educational Textbook Question Answering

Hessa A. Alawwad, Anas Zafar, Areej Alhothali, Usman Naseem, Ali Alkhathlan, Amani Jamal

机构 * Faculty of Computing and Information Technology(计算与信息科技学院) King Abdulaziz University(阿卜杜勒阿齐兹大学) FAST School of Computing(快速计算学院) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) School of Computing(计算学院) Macquarie University(麦考瑞大学) Center of Research Excellence in AI and Data Science(人工智能与数据科学卓越研究中心)

专题命中 视觉问答 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.AI

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06183 2025-07-09 cs.CV 83%

Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling

Prahitha Movva, Naga Harshita Marupaka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Southern California(南加州大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20566 2025-06-26 cs.RO cs.CV 83%

HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction

Zhonghao Shi, Enyu Zhao, Nathaniel Dennler, Jingzhen Wang, Xinyang Xu, Kaleen Shrestha, Mengxue Fu, Daniel Seita, Maja Matarić

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering University of Southern California, Los Angeles CA 90089, USA

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to the 19th International Symposium on Experimental Robotics (ISER 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏