arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3148 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3148 篇

2511.01458 2025-11-04 cs.CV cs.AI 73%

When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA

Dennis Pierantozzi, Luca Carlini, Mauro Orazio Drago, Chiara Lena, Cesare Hassan, Elena De Momi, Danail Stoyanov, Sophia Bano, Mobarak I. Hoque

机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19001 2025-10-23 cs.CV cs.AI cs.RO 73%

Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts

Seungjun Yu, Junsung Park, Youngsun Lim, Hyunjung Shim

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14605 2025-10-21 cs.CV cs.AI 73%

Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering

Yuyang Hong, Jiaqi Gu, Qi Yang, Lubin Fan, Yue Wu, Ying Wang, Kun Ding, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14446 2025-10-01 cs.CV cs.CY cs.LG 73%

Neglected Risks: The Disturbing Reality of Children's Images in Datasets and the Urgent Call for Accountability

Carlos Caetano, Gabriel O. dos Santos, Caio Petrucci, Artur Barros, Camila Laranjeira, Leo S. F. Ribeiro, Júlia F. de Mendonça, Jefersson A. dos Santos, Sandra Avila

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04740 2025-09-30 cs.CV cs.AI 73%

SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data

Samarth Mishra, Kate Saenko, Venkatesh Saligrama

机构 * Boston University(波士顿大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14480 2025-09-25 cs.RO cs.CL cs.CV cs.LG 73%

GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering

Saumya Saxena, Blake Buchanan, Chris Paxton, Peiqi Liu, Bingqing Chen, Narunas Vaskevicius, Luigi Palmieri, Jonathan Francis, Oliver Kroemer

机构 * Carnegie Mellon University(卡内基梅隆大学) Neya Systems(Neya系统) Agility Robotics(敏捷机器人) Hello Robot Bosch Center for AI(博世人工智能中心)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Project website: https://saumyasaxena.github.io/grapheqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03823 2025-09-23 cs.CV cs.AI cs.CL cs.MM 73%

Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM

Dingjie Song, Sicheng Lai, Mingxuan Wang, Shunian Chen, Lichao Sun, Benyou Wang

机构 * Lehigh University(莱维大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05244 2025-09-22 cs.CV cs.AI 73%

RegionMed-CLIP: A Region-Aware Multimodal Contrastive Learning Pre-trained Model for Medical Image Understanding

Tianchen Fang, Guiru Liu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Upon further review, we identified that our dataset requires optimization to ensure research reliability and accuracy. Additionally, considering the target journal's latest submission policies, we believe comprehensive manuscript revisions are necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15189 2025-08-22 cs.AI cs.CV eess.IV 73%

SurgWound-Bench: A Benchmark for Surgical Wound Diagnosis

Jiahao Xu, Changchang Yin, Odysseas Chatzipanagiotou, Diamantis Tsilimigras, Kevin Clear, Bingsheng Yao, Dakuo Wang, Timothy Pawlik, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心) Northeastern University(东北大学)

专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20263 2025-08-12 cs.RO cs.AI cs.CV 73%

EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering

Kai Cheng, Zhengyuan Li, Xingpeng Sun, Byung-Cheol Min, Amrit Singh Bedi, Aniket Bera

机构 * Purdue University(普渡大学) University of Central Florida(中央佛罗里达大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments IROS 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03328 2025-07-29 cs.CV cs.AI cs.NE 73%

Visual Enumeration Remains Challenging for Multimodal Generative AI

Alberto Testolin, Kuinan Hou, Marco Zorzi

机构 * Department of General Psychology and Department of Mathematics University of Padova(帕多瓦大学心理学系和数学系) Department of General Psychology University of Padova(帕多瓦大学心理学系) Department of General Psychology and Padova Neuroscience Center University of Padova(帕多瓦大学心理学系和帕多瓦神经科学中心) IRCSS San Camillo Hospital, Venice-Lido(威尼斯利多医院IRCSS桑卡莫医院)

专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19525 2025-07-29 cs.LG cs.AI 73%

MMCircuitEval: A Comprehensive Multimodal Circuit-Focused Benchmark for Evaluating LLMs

Chenchen Zhao, Zhengyuan Shi, Xiangyu Wen, Chengjie Liu, Yi Liu, Yunhao Zhou, Yuxiang Zhao, Hefei Feng, Yinan Zhu, Gwok-Waa Wan, Xin Cheng, Weiyu Chen, Yongqi Fu, Chujie Chen, Chenhao Xue, Guangyu Sun, Ying Wang, Yibo Lin, Jun Yang, Ning Xu, Xi Wang, Qiang Xu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(中国香港中文大学计算机科学与工程系) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) School of Integrated Circuits, Peking University(北京大学集成电路学院) School of Intergrated Circuits, Southeast University(东南大学集成电路学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术系) National Center of Technology Innovation for EDA(EDA技术创新国家中心)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 1 figure, 5 tables. To appear in ICCAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19795 2025-07-25 cs.CL cs.AI cs.CV 73%

VolDoGer: LLM-assisted Datasets for Domain Generalization in Vision-Language Tasks

Juhwan Choi, Junehyoung Kwon, JungMin Yun, Seunguk Yu, YoungBin Kim

机构 * AITRICS Seoul(AITRICS首尔) Chung-Ang University(Chung-ang 大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07106 2025-07-10 cs.CV cs.LG 73%

Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor

Vatsal Agarwal, Matthew Gwilliam, Gefen Kohavi, Eshan Verma, Daniel Ulbricht, Abhinav Shrivastava

机构 * University of Maryland(马里兰大学) Apple(苹果公司)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments Website: see https://vatsalag99.github.io/mustafar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09634 2025-06-12 cs.CV cs.AI 73%

HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding

Yanzhao Shi, Xiaodan Zhang, Junzhong Ji, Haoning Jiang, Chengxin Zheng, Yinong Wang, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) Beijing University of Technology(北京工业大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 27 pages, 9 figures. arXiv admin note: text overlap with arXiv:2410.14200 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09445 2025-06-12 cs.CV cs.AI 73%

TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision

Ayush Gupta, Anirban Roy, Rama Chellappa, Nathaniel D. Bastian, Alvaro Velasquez, Susmit Jha

机构 * SRI Johns Hopkins University(约翰霍普金斯大学) United States Military Academy(美国军事学院) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12803 2025-06-12 cs.CV cs.LG 73%

TextSquare: Scaling up Text-Centric Visual Instruction Tuning

Jingqun Tang, Chunhui Lin, Zhen Zhao, Shu Wei, Binghong Wu, Qi Liu, Yangfan He, Kuan Lu, Hao Feng, Yang Li, Siqi Wang, Lei Liao, Wei Shi, Yuliang Liu, Hao Liu, Yuan Xie, Xiang Bai, Can Huang

机构 * ByteDance Inc.(字节跳动公司) East China Normal University(东华大学) Huazhong University of Science and Technology(华中科技大学) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16652 2025-06-10 cs.CV cs.LG 73%

Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding

Feilong Tang, Chengzhi Liu, Zhongxing Xu, Ming Hu, Zelin Peng, Zhiwei Yang, Jionglong Su, Minquan Lin, Yifan Peng, Xuelian Cheng, Imran Razzak, Zongyuan Ge

机构 * Monash University(蒙纳士大学) MBZUAI XJTLU(西安交通大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments Clarification note for the CVPR 2025 paper (FarSight). Prepared by a subset of the original authors; remaining co-authors are acknowledged in the text

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05440 2025-06-09 cs.CV cs.AI cs.CL 73%

BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models

Ludovic Arnould, Salim Khazem, Hugues Ali Mehenni

机构 * R&D Center, Talan(Talan 研发中心)

专题命中 视觉问答 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04756 2025-06-06 cs.AI cs.CV eess.IV 73%

Ontology-based knowledge representation for bone disease diagnosis: a foundation for safe and sustainable medical artificial intelligence systems

Loan Dao, Ngoc Quoc Ly

专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11651 2025-05-26 cs.CV cs.AI 73%

MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progression

Linjie Mu, Zhongzhen Huang, Shengqian Qin, Yakun Zhu, Shaoting Zhang, Xiaofan Zhang

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04388 2025-05-19 cs.CV cs.AI cs.MM 73%

Question-Answering Dense Video Events

Hangyu Qin, Junbin Xiao, Angela Yao

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉问答 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to SIGIR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22093 2025-04-25 cs.CV cs.AI 73%

How Well Can Vison-Language Models Understand Humans' Intention? An Open-ended Theory of Mind Question Evaluation Benchmark

Ximing Wen, Mallika Mainali, Anik Sen

机构 * College of Computing and Informatics, Drexel University(计算与信息学院,德雷塞尔大学)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments 4 pages, accepted by ToM@AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09795 2025-04-15 cs.CL cs.AI cs.CV cs.IR 73%

VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents

Ryota Tanaka, Taichi Iki, Taku Hasegawa, Kyosuke Nishida, Kuniko Saito, Jun Suzuki

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025; project page: https://vdocrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09249 2025-04-15 cs.CV cs.IR cs.LG cs.MM 73%

NoTeS-Bank: Benchmarking Neural Transcription and Search for Scientific Notes Understanding

Aniket Pal, Sanket Biswas, Alloy Das, Ayush Lodh, Priyanka Banerjee, Soumitri Chattopadhyay, Dimosthenis Karatzas, Josep Llados, C. V. Jawahar

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19186 2025-03-26 cs.CV cs.CL cs.LG 73%

MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification

Laura Fieback, Jakob Spiegelberg, Hanno Gottschalk

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16778 2025-03-25 cs.CV cs.AI 73%

GEMeX: A Large-Scale, Groundable, and Explainable Medical VQA Benchmark for Chest X-ray Diagnosis

Bo Liu, Ke Zou, Liming Zhan, Zexin Lu, Xiaoyu Dong, Yidi Chen, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu, Huazhu Fu

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments This project is available at https://www.med-vqa.com/GEMeX

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07587 2025-03-11 cs.CV cs.AI cs.RO 73%

Robusto-1 Dataset: Comparing Humans and VLMs on real out-of-distribution Autonomous Driving VQA from Peru

Dunant Cusipuma, David Ortega, Victor Flores-Benites, Arturo Deza

专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments A pre-print. 26 pages. Link to Code + Data: https://huggingface.co/datasets/Artificio/robusto-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00162 2025-03-04 cs.CV cs.AI cs.CL cs.MA 73%

PreMind: Multi-Agent Video Understanding for Advanced Indexing of Presentation-style Videos

Kangda Wei, Zhengyu Zhou, Bingqing Wang, Jun Araki, Lukas Lange, Ruihong Huang, Zhe Feng

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01474 2025-02-18 cs.CL cs.AI cs.CV 73%

Understanding Figurative Meaning through Explainable Visual Entailment

Arkadiy Saakyan, Shreyas Kulkarni, Tuhin Chakrabarty, Smaranda Muresan

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏