arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-17 至 2025-11-17 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2511.11206 2025-11-17 cs.CV cs.LG 84%

Questioning the Stability of Visual Question Answering

Amir Rosenfeld, Neta Glazer, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 视觉问答 :visual question answering(title);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00060 2025-11-17 cs.CV cs.AI 84%

MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image

Shezheng Song, Chengxiang He, Shan Zhao, Chengyu Wang, Qian Wan, Tianwei Yan, Meng Wang

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) CCNU(中国地质大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18041 2025-11-17 cs.CV 83%

NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning

Sahil Shah, S P Sharan, Harsh Goel, Minkyu Choi, Mustafa Munir, Manvik Pasula, Radu Marculescu, Sandeep Chinchali

专题命中 视觉问答 :grounding(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11034 2025-11-17 cs.CV cs.AI 82%

CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging

Pooja Singh, Siddhant Ujjain, Tapan Kumar Gandhi, Sandeep Kumar

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11169 2025-11-17 cs.CV cs.AI cs.LG 80%

Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA

Ayush Pandey, Jai Bardhan, Ishita Jain, Ramya S Hebbalaguppe, Rohan Raju Dhanakshirur, Lovekesh Vig

机构 * TCS Research(塔塔咨询研究)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 17 pages, 6 figures, 5 tables. Accepted to Special Track on AI Alignment, AAAI 2026. Project Page- https://refine-align.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11198 2025-11-17 cs.CV 79%

Geospatial Chain of Thought Reasoning for Enhanced Visual Question Answering on Satellite Imagery

Shambhavi Shanker, Manikandan Padmanaban, Jagabondhu Hazra

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) IBM Research India(IBM印度研究)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09914 2025-11-17 cs.AI 70%

OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive

Xuan Shen, Brian Wingenroth, Zichao Wang, Jason Kuen, Wanrong Zhu, Ruiyi Zhang, Yiwei Wang, Lichun Ma, Anqi Liu, Hongfu Liu, Tong Sun, Kevin S. Hawkins, Kate Tasker, G. Caleb Alexander, Jiuxiang Gu

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

Comments Accepted by AAAI 2026 Artificial Intelligence for Social Impact Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11468 2025-11-17 cs.CV cs.AI 62%

Benchmarking Visual LLMs Resilience to Unanswerable Questions on Visually Rich Documents

Davide Napolitano, Luca Cagliero, Fabrizio Battiloro

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏