arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

1610.06620 2016-10-25 cs.CL cs.AI cs.CV 81%

Proposing Plausible Answers for Open-ended Visual Question Answering

Omid Bakhshandeh, Trung Bui, Zhe Lin, Walter Chang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.05234 2016-03-22 cs.CV cs.AI cs.CL cs.NE 81%

Ask, Attend and Answer: Exploring Question-Guided Spatial Attention for Visual Question Answering

Huijuan Xu, Kate Saenko

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments include test-standard result on VQA full release (V1.0) dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10326 2023-06-16 cs.CV cs.MM 80%

Toward 3D Spatial Reasoning for Human-like Text-based Visual Question Answering

Hao Li, Jinfa Huang, Peng Jin, Guoli Song, Qi Wu, Jie Chen

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Accepted by TIP2023, The Arxiv version of "Weakly-Supervised 3D Spatial Reasoning for Text-based Visual Question Answering"

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.07998 2018-03-15 cs.CV 80%

Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering

Peter Anderson, Xiaodong He, Chris Buehler, Damien Teney, Mark Johnson, Stephen Gould, Lei Zhang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments CVPR 2018 full oral, winner of the 2017 Visual Question Answering challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.02711 2017-08-10 cs.CV cs.CL 80%

Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge

Damien Teney, Peter Anderson, Xiaodong He, Anton van den Hengel

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

Comments Winner of the 2017 Visual Question Answering (VQA) Challenge at CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00123 2026-06-02 cs.CV cs.AI cs.LG 80%

CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距

Zixian Su, Hongkai Zhang, Fan Gao, Encheng Su, Taiping Qu, Jingwei Guo, Nan Zhang, Hui Wang, Zhen Zhou, Kairui Bo, Yan Chen, Yue Ren, Shuai Li, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Anzhen Hospital(北京安贞医院) Beihang University(北航) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20525 2026-05-21 cs.CV cs.AI cs.CL cs.LG eess.IV 80%

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA: 一种大规模的3D脑部MRI理解图像 grounded 评估基准

Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh, Ridvan Yesiloglu, Yuncong Mao, Bailey Trang, Mohammad Asadi, Merryn Daniel, Gustavo Chau Loo Kung, Ken Chang, Pavan Pinkesh Shah, Adam Turnbull, Kyan Younes, Seena Dehkharghani, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出NeuroQA,一个大规模的3D脑部MRI视觉问答基准,包含来自12977名受试者的56953个问答对,涵盖5-104岁及五个临床领域,通过3D体积评估11种临床推理技能,并提供可复现的生成脚本和在线排行榜。

Comments 30 pages, dataset and benchmark release

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03583 2026-04-30 cs.MM cs.IR 80%

OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset

OpenLifelogQA:一个开放式多模态生活日志问答数据集

Quang-Linh Tran, Hoang-Bao Le, Tuong-Nghiem Diep, Binh Nguyen, Gareth J. F. Jones, Cathal Gurrin

专题命中 视觉问答 :LLaVA(summary_cn,abstract)

AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。

Comments In the proceedings of the 14th International Symposium on Information and Communication Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20816 2026-04-22 cs.CL 80%

Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective

重新思考多模态问答中的信息合成:多智能体视角

Krishna Singh Rajput, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual language model(abstract);multimodal large language model(abstract)

AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11169 2025-11-17 cs.CV cs.AI cs.LG 80%

Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA

Ayush Pandey, Jai Bardhan, Ishita Jain, Ramya S Hebbalaguppe, Rohan Raju Dhanakshirur, Lovekesh Vig

机构 * TCS Research(塔塔咨询研究)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 17 pages, 6 figures, 5 tables. Accepted to Special Track on AI Alignment, AAAI 2026. Project Page- https://refine-align.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12750 2025-10-15 cs.CV cs.AI cs.LG 80%

VQArt-Bench: A semantically rich VQA Benchmark for Art and Cultural Heritage

A. Alfarano, L. Venturoli, D. Negueruela del Castillo

机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14424 2024-12-20 cs.CV cs.AI cs.LG 80%

FedPIA -- Permuting and Integrating Adapters leveraging Wasserstein Barycenters for Finetuning Foundation Models in Multi-Modal Federated Learning

Pramit Saha, Divyanshu Mishra, Felix Wagner, Konstantinos Kamnitsas, J. Alison Noble

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted for publication in AAAI 2025 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14683 2024-06-18 cs.CV cs.AI cs.LG 80%

Visual Hallucinations of Multi-modal Large Language Models

Wen Huang, Hongbin Liu, Minxin Guo, Neil Zhenqiang Gong

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments To appear in ACL Findings, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03685 2024-05-07 cs.CV cs.AI cs.CL cs.LG 80%

Language-Image Models with 3D Understanding

Jang Hyun Cho, Boris Ivanovic, Yulong Cao, Edward Schmerling, Yue Wang, Xinshuo Weng, Boyi Li, Yurong You, Philipp Krähenbühl, Yan Wang, Marco Pavone

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://janghyuncho.github.io/Cube-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04157 2024-02-21 cs.RO 80%

RePLan: Robotic Replanning with Perception and Language Models

Marta Skreta, Zihan Zhou, Jia Lin Yuan, Kourosh Darvish, Alán Aspuru-Guzik, Animesh Garg

专题命中 视觉问答 :vision language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07575 2023-11-14 cs.CV cs.AI cs.CL cs.LG 80%

SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models

Ziyi Lin, Chris Liu, Renrui Zhang, Peng Gao, Longtian Qiu, Han Xiao, Han Qiu, Chen Lin, Wenqi Shao, Keqin Chen, Jiaming Han, Siyuan Huang, Yichi Zhang, Xuming He, Hongsheng Li, Yu Qiao

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04399 2023-04-11 cs.CV cs.AI cs.LG cs.MM 80%

CAVL: Learning Contrastive and Adaptive Representations of Vision and Language

Shentong Mo, Jingfei Xia, Ihor Markevych

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08358 2023-01-11 cs.CV cs.AI cs.LG 80%

MixGen: A New Multi-Modal Data Augmentation

Xiaoshuai Hao, Yi Zhu, Srikar Appalaraju, Aston Zhang, Wanqian Zhang, Bo Li, Mu Li

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments First three authors contributed equally. Code are available at https://github.com/amazon-research/mix-generation. Oral presentation at WACV 2023 Pretraining Large Vision and Multimodal Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 79%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21431 2026-08-25 cs.CV cs.MM 新提交 79%

Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning

基于结构化上下文推理提升基于知识的视觉问答性能

Qiyou Liu, Yong Zhang, Jianjie Luo, Zhenguo Yang, Yi Yu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出SCoRe框架,通过上下文获取、选择、压缩三阶段处理多模态知识,在OK-VQA和A-OKVQA基准上性能优于现有最优方法,提升了基于知识的视觉问答效果。

Comments Accepted by ICME 2026. Source code is available at https://github.com/WISLab-GDUT/SCoRe

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03337 2026-08-25 cs.CV 版本更新 79%

QIRL: Optimized Question-Image Relation Learning for Bias-Robust Visual Question Answering

QIRL:用于实现偏差鲁棒视觉问答的优化问答-图像关系学习

Quanxing Xu, Ling Zhou, Xian Zhong, Feifei Zhang, Rubing Huang

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科技大学计算机科学与工程学院) Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) State Key Laboratory of Maritime Technology and Safety, Wuhan University of Technology(武汉理工大学) School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) Macau University of Science and Technology Zhuhai MUST Science and Technology Research Institute(澳门科技大学珠海澳科大科技研究院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 该研究针对现有VQA偏差缓解方法的两大局限,提出QIRL框架,通过NIG与ISI模块结合生成驱动自监督学习,在VQA-CPv2和VQA-v2数据集上取得最优性能,可适配各类VQA架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-19 cs.CL cs.LG 版本更新 79%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 视觉问答 :grounding(title,abstract);分类 cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25143 2026-08-12 cs.CV cs.CL 版本更新 79%

TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models

TemMed-Bench:评估视觉语言模型的时序医学图像推理能力

Junyi Zhang, Jia-Chen Gu, Wenbo Hu, Yu Zhou, Robinson Piramuthu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23304 2026-08-11 cs.AI 版本更新 79%

Multi-Modal Scene Graph with Kolmogorov-Arnold Experts for Audio-Visual Question Answering

多模态场景图与科莫戈罗夫-阿诺尔德专家网络用于音频-视觉问答

Zijian Fu, Changsheng Lv, Xianlin Zhang, Mengshi Qi, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态场景图与科莫戈罗夫-阿诺尔德专家网络的SHRIKE模型,用于提升音频-视觉问答任务中的跨模态交互建模与时间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01147 2026-08-06 cs.IR cs.CL cs.CV 版本更新 79%

UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

UniHEAR:面向基于知识的视觉问答的统一异构源注意力检索

Ganzhong Luo, Yang Ren, Hanyong Wang, Shuyu Zheng, Menglong Yang

机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 针对KB-VQA现有系统的单源检索瓶颈与检索源盲重排序问题,提出UniHEAR框架,在E-VQA和InfoSeek数据集上实现最优检索与VQA性能,提升Recall@1达6.7和1.2个点。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02907 2026-08-05 cs.LG 新提交 79%

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29638 2026-08-03 cs.CV 新提交 79%

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

HierDoc:用于长文档视觉问答的分层页到区域证据路由

Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 HierDoc是分层证据路由框架,将长文档视觉问答的页与区域选择整合为连续两阶段,在开放权重系统中达SOTA,使LongDocURL提升16.87%,区域证据可显著提升单页系统性能。

Comments 15 pages, 4 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新 79%

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13800 2026-07-17 cs.CV 版本更新 79%

Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space

超越医学诊断:医学多模态大语言模型如何在空间中思考

Quoc-Huy Trinh, Xi Ding, Yang Liu, Zhenyue Qin, Xingjian Li, Gorkem Durak, Halil Ertugrul Aktas, Andrea M. Bejar, Ulas Bagci, Min Xu

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出SpatialMed基准,通过自主合成空间视觉问答数据评估医学MLLMs的3D空间智能,发现现有模型在医学影像空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18346 2026-07-13 cs.CV 版本更新 79%

AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering

AV-Master:双路径综合感知实现更优的音频视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Xun Lin, Zihan Song, Zitong Yu

机构 * Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Nankai University(南开大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 AV-Master通过动态建模时序和模态维度,提升模型在复杂视听场景中提取关键信息的能力,有效解决现有方法在时间采样和模态偏好意识上的不足,从而在复杂场景中增强推理能力。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT'26)

详情

展开后加载摘要…

URL PDF HTML 收藏