arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2305.10046 2023-05-18 cs.CL cs.CV 83%

Probing the Role of Positional Information in Vision-Language Models

Philipp J. Rösch, Jindřich Libovický

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Findings of the Association for Computational Linguistics: NAACL 2022, pages 1031-1041, Seattle, United States. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06954 2023-05-09 cs.CV 83%

Correlation Information Bottleneck: Towards Adapting Pretrained Multimodal Models for Robust Visual Question Answering

Jingjing Jiang, Ziyi Liu, Nanning Zheng

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);分类 cs.CV

Comments 20 pages, 6 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02297 2023-05-04 cs.CV 83%

Making the Most of What You Have: Adapting Pre-trained Visual Language Models in the Low-data Regime

Chuhan Zhang, Antoine Miech, Jiajun Shen, Jean-Baptiste Alayrac, Pauline Luc

专题命中 视觉问答 :visual language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.00949 2022-12-02 cs.CV 83%

Answer-Me: Multi-Task Open-Vocabulary Visual Question Answering

AJ Piergiovanni, Wei Li, Weicheng Kuo, Mohammad Saffar, Fred Bertsch, Anelia Angelova

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06122 2022-11-10 cs.CV cs.CL 83%

Discovering the Unknown Knowns: Turning Implicit Knowledge in the Dataset into Explicit Training Examples for Visual Question Answering

Jihyung Kil, Cheng Zhang, Dong Xuan, Wei-Lun Chao

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments Accepted to EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12085 2022-07-28 cs.CV 83%

UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling

Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Faisal Ahmed, Zicheng Liu, Yumao Lu, Lijuan Wang

专题命中 视觉问答 :vision-language model(title);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments ECCV 2022 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02334 2022-07-07 cs.CV 83%

Weakly Supervised Grounding for VQA in Vision-Language Transformers

Aisha Urooj Khan, Hilde Kuehne, Chuang Gan, Niels Da Vitoria Lobo, Mubarak Shah

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

Comments To appear at ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.12533 2022-06-28 cs.CV 83%

From Shallow to Deep: Compositional Reasoning over Graphs for Visual Question Answering

Zihao Zhu

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.03354 2022-06-10 cs.CL cs.CV 83%

cViL: Cross-Lingual Training of Vision-Language Models using Knowledge Distillation

Kshitij Gupta, Devansh Gautam, Radhika Mamidi

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at ICPR 2022; 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01718 2022-06-06 cs.CV cs.CL 83%

A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge

Dustin Schwenk, Apoorv Khandelwal, Christopher Clark, Kenneth Marino, Roozbeh Mottaghi

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12616 2022-05-26 cs.CV 83%

Guiding Visual Question Answering with Attention Priors

Thao Minh Le, Vuong Le, Sunil Gupta, Svetha Venkatesh, Truyen Tran

专题命中 视觉问答 :visual question answering(title);visual reasoning(abstract);grounding(abstract);分类 cs.CV

Comments Preprint, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.01993 2022-04-12 cs.CV cs.CL 83%

Grounding Answers for Visual Questions Asked by Visually Impaired People

Chongyan Chen, Samreen Anjum, Danna Gurari

专题命中 视觉问答 :grounding(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.00975 2022-04-05 cs.CV cs.CL 83%

Question-Driven Graph Fusion Network For Visual Question Answering

Yuxi Qian, Yuncong Hu, Ruonan Wang, Fangxiang Feng, Xiaojie Wang

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments Accepted by ICME 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.05122 2021-10-12 cs.CV 83%

Pano-AVQA: Grounded Audio-Visual Question Answering on 360$^\circ$ Videos

Heeseung Yun, Youngjae Yu, Wonsuk Yang, Kangil Lee, Gunhee Kim

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments Published to ICCV2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14741 2021-05-03 cs.CV 83%

Chop Chop BERT: Visual Question Answering by Chopping VisualBERT's Heads

Chenyu Gao, Qi Zhu, Peng Wang, Qi Wu

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05981 2021-04-14 cs.CV 83%

CLEVR_HYP: A Challenge Dataset and Baselines for Visual Question Answering with Hypothetical Actions over Images

Shailaja Keyur Sampat, Akshay Kumar, Yezhou Yang, Chitta Baral

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 16 pages, 11 figures, Accepted as a Long Paper at NAACL-HLT 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13406 2020-12-24 cs.CV 83%

Learning from Lexical Perturbations for Consistent Visual Question Answering

Spencer Whitehead, Hui Wu, Yi Ren Fung, Heng Ji, Rogerio Feris, Kate Saenko

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.08324 2020-09-07 cs.CV 83%

Question Guided Modular Routing Networks for Visual Question Answering

Yanze Wu, Qiang Sun, Jianqi Ma, Bin Li, Yanwei Fu, Yao Peng, Xiangyang Xue

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.03649 2018-11-12 cs.CV 83%

Overcoming Language Priors in Visual Question Answering with Adversarial Regularization

Sainandan Ramakrishnan, Aishwarya Agrawal, Stefan Lee

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments NIPS 2018. 11 pages ( with references ), 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.08390 2016-11-24 cs.CV 83%

Revisiting Visual Question Answering Baselines

Allan Jabri, Armand Joulin, Laurens van der Maaten

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract);分类 cs.CV

Comments European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19929 2026-02-27 cs.NI cs.IT math.IT 83%

BeamVLM for Low-altitude Economy: Generative Beam Prediction via Vision-language Models

BeamVLM 用于低空经济:通过视觉-语言模型进行生成式波束预测

Chenran Kou, Changsheng You, Mingjiang Wu, Dingzhu Wen, Zezhong Zhang, Chengwen Xing

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract)

AI总结 BeamVLM 通过视觉-语言模型实现生成式波束预测,提升无人机与地面基站间通信的准确性和泛化能力。

Comments We propose a novel end-to-end generative framework for beam prediction by using vision-language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13360 2025-03-31 cs.CV cs.AI cs.CL cs.LG cs.MM 83%

RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models

Haoran Hao, Jiaming Han, Changsheng Li, Yu-Feng Li, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Beijing Institute of Technology(北京理工大学) CUHK(香港中文大学)

专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by CVPR 2025. Code: https://github.com/Hoar012/RAP-MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 82%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03890 2026-08-05 cs.CV cs.AI 新提交 82%

CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement

CARE-X:借助辅助监督、奖励对齐学习与工具增强测量实现临床可用的放射学视觉语言模型

Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja Ganu

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

AI总结 CARE-X是一款胸部X射线视觉语言模型,通过辅助监督、奖励对齐学习及工具增强测量,在多个医学影像任务上实现了优于基线的性能,缩小了放射科医生需求与现有生成模型间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17834 2026-07-21 cs.CV cs.AI 新提交 82%

Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA

测量和提高内窥镜视觉问答中复杂原子答案的一致性

Yuhao Liu, Cheng Zhao, Guanghui Yue

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 研究内窥镜VQA中复杂问题答案一致性,引入EndoCA基准,评估11个VLM,发现部分模型复杂答案准确率高但原子答案准确率及复杂-原子答案一致性低,提出ASR机制,能在选定模型上提高配对复杂-原子正确性及已回答案例准确性。

Comments 7 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30794 2026-07-08 cs.CV cs.AI 版本更新 82%

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing

机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) Beijing University of Technology, China(北京理工大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。

Comments accept by iclm2026, add github link

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 82%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18558 2026-06-29 cs.CV cs.AI 版本更新 82%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 视觉问答 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20980 2026-06-23 cs.CV cs.AI cs.RO 新提交 82%

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

Robusto-2: 在利马与纽约市对自动驾驶中人类与VLM的基准测试

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

机构 * Artificio Lima, Peru

专题命中 视觉问答 :VLM(title_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过视觉问答范式,比较人类驾驶员(来自利马和纽约)与视觉语言模型在利马和纽约的驾驶场景中的表现,发现人类与模型在回答事实、评级、反事实和推理四类问题时存在差异,但地理因素影响不显著。

Comments 11 pages main body. 42 pages total. Data publicly available online

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16898 2026-06-16 cs.CV cs.AI 新提交 82%

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。

Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip

详情

展开后加载摘要…

URL PDF HTML 收藏