A Systematic Review of Key Retrieval-Augmented Generation (RAG) Systems: Progress, Gaps, and Future Directions
Agada Joseph Oche, Ademola Glory Folashade, Tirthankar Ghosal, Arpan Biswas
机构
*
Bredesen Center for Interdisciplinary Research, University of Tennessee, Knoxville, USA(跨学科研究中心,田纳西大学,肯塔基州 Knoxville)
;
National Center for Computational Sciences, Oak Ridge National Laboratory, Oak Ridge, USA(计算科学国家中心,橡树岭国家实验室,橡树岭)
;
University of Tennessee-Oak Ridge Innovation Institute, University of Tennessee, Knoxville, USA(田纳西大学橡树岭创新研究所,田纳西大学,肯塔基州 Knoxville)
Long-Form Answers to Visual Questions from Blind and Low Vision People
Mina Huh, Fangyuan Xu, Yi-Hao Peng, Chongyan Chen, Hansika Murugu, Danna Gurari, Eunsol Choi, Amy Pavel
机构
*
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中
视觉问答
:vision language model(abstract);分类 cs.CV
Unraveling the geometry of visual relational reasoning
Jiaqi Shang, Gabriel Kreiman, Haim Sompolinsky
机构
*
Program in Neuroscience, Harvard Medical School(神经科学项目,哈佛医学院)
;
Boston Children’s Hospital, Harvard Medical School(波士顿儿童医院,哈佛医学院)
;
Center for Brains, Minds, and Machines(大脑、心智与机器中心)
;
Edmond and Lily Safra Center for Brain Sciences, Hebrew University(埃德蒙与莉莉·萨弗脑科学中心,希伯来大学)
专题命中
视觉推理
:visual reasoning(abstract);分类 cs.CV
Comments27 pages, 7 figures, 8 SI figures, 2 SI tables
AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark
Aruna Gauba, Irene Pi, Yunze Man, Ziqi Pang, Vikram S. Adve, Yu-Xiong Wang
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Rice University(Rice大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
AIFARMS
;
Center for Digital Agriculture at UIUC(伊利诺伊大学厄巴纳-香槟分校数字农业中心)
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
Sensetime
专题命中
视觉定位与Grounding
:LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学研究所)
;
Donders Institute for Brain Cognition and Behaviour(多纳尔斯脑认知与行为研究所)
;
Utrecht University(乌得勒支大学)
专题命中
视觉定位与Grounding
:grounding(abstract);分类 cs.CV
CommentsAccepted to IEEE/CVF International Conference on Computer Vision (ICCV) 2025
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Xiamen University(厦门大学)
;
University of Science and Technology of China(中国科学技术大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Tsinghua University(清华大学)
;
Nanjing University(南京大学)
;
Fudan University(复旦大学)
;
University of Hong Kong(香港大学)
;
Donghua University(东华大学)
;
The Chinese University of Hong Kong(香港中文大学)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
Qiong Wu, Wenhao Lin, Yiyi Zhou, Weihao Ye, Zhanpeng Zen, Xiaoshuai Sun, Rongrong Ji
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
;
Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)
专题命中
VLM训练与架构
:multimodal large language model(title);LLaVA(abstract);InternVL(abstract);分类 cs.CV、cs.LG