arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-12 至 2025-08-12 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2508.07918 2025-08-12 cs.CV 85%

RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering

Xing Zi, Jinghao Xiao, Yunxiao Shi, Xian Tao, Jun Li, Ali Braytee, Mukesh Prasad

机构 * School of Computer Science, University of Technology Sydney(技术悉尼大学计算机科学学院) SEDE, University of Technology Sydney(技术悉尼大学SEDE) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments This paper has been accepted to the proceedings of the 33rd ACM International Multimedia Conference (ACM Multimedia 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20756 2025-08-12 cs.CV cs.CL 85%

SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models

Zheng Liu, Hao Liang, Bozhou Li, Wentao Xiong, Chong Chen, Conghui He, Wentao Zhang, Bin Cui

机构 * Peking University Beijing China Huawei Technologies Ltd. Beijing China Shanghai AI Laboratory Shanghai China Peking University Center for Machine Learning Research Beijing China Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China Peking University Huawei Technologies Ltd. Shanghai AI Laboratory

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07023 2025-08-12 cs.CV 83%

MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering

Jingwei Peng, Jiehao Chen, Mateo Alejandro Rojas, Meilin Zhang

机构 * Shaanxi University of Technology(陕西理工大学) Technological University of Peru(秘鲁技术大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08137 2025-08-12 cs.LG cs.AI cs.SY eess.SY 81%

MuaLLM: A Multimodal Large Language Model Agent for Circuit Design Assistance with Hybrid Contextual Retrieval-Augmented Generation

Pravallika Abbineni, Saoud Aldowaish, Colin Liechty, Soroosh Noorzad, Ali Ghazizadeh, Morteza Fayazi

机构 * University of Utah(犹他大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20263 2025-08-12 cs.RO cs.AI cs.CV 73%

EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering

Kai Cheng, Zhengyuan Li, Xingpeng Sun, Byung-Cheol Min, Amrit Singh Bedi, Aniket Bera

机构 * Purdue University(普渡大学) University of Central Florida(中央佛罗里达大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments IROS 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06496 2025-08-12 cs.CV cs.MA 70%

Med-GRIM: Enhanced Zero-Shot Medical VQA using prompt-embedded Multimodal Graph RAG

Rakesh Raj Madavan, Akshat Kaimal, Hashim Faisal, Chandrakala S

机构 * Shiv Nadar University Chennai(施瓦斯纳大学钦奈)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07022 2025-08-12 cs.AI cs.CL cs.LG cs.MM 62%

MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA

Shengtao Wen, Haodong Chen, Yadong Wang, Zhongying Pan, Xiang Chen, Yu Tian, Bo Qian, Dong Liang, Sheng-Jun Huang

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01422 2025-08-12 cs.CV 57%

DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes

Zhende Song, Chenchen Wang, Jiamu Sheng, Chi Zhang, Shengji Tang, Jiayuan Fan, Tao Chen

机构 * Fudan University(复旦大学) Westlake University, Tencent PCG(西湖大学、腾讯PCG)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACMM'MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏