arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-07-28 至 2025-07-28 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2507.18910 2025-07-28 cs.CL cs.LG 57%

A Systematic Review of Key Retrieval-Augmented Generation (RAG) Systems: Progress, Gaps, and Future Directions

Agada Joseph Oche, Ademola Glory Folashade, Tirthankar Ghosal, Arpan Biswas

机构 * Bredesen Center for Interdisciplinary Research, University of Tennessee, Knoxville, USA(跨学科研究中心,田纳西大学,肯塔基州 Knoxville) National Center for Computational Sciences, Oak Ridge National Laboratory, Oak Ridge, USA(计算科学国家中心,橡树岭国家实验室,橡树岭) University of Tennessee-Oak Ridge Innovation Institute, University of Tennessee, Knoxville, USA(田纳西大学橡树岭创新研究所,田纳西大学,肯塔基州 Knoxville)

专题命中 视觉问答 :grounding(abstract);分类 cs.LG

Comments 33 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06303 2025-07-28 cs.CL cs.CV 57%

Long-Form Answers to Visual Questions from Blind and Low Vision People

Mina Huh, Fangyuan Xu, Yi-Hao Peng, Chongyan Chen, Hansika Murugu, Danna Gurari, Eunsol Choi, Amy Pavel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

Comments COLM 2024 Oral Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏