arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8587 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 552 篇

2510.22868 2026-08-04 cs.CV 版本更新 88%

Seeing the Unseen: Towards Training-Free Inspection for Wind Turbine Blades Using Knowledge-Augmented Vision Language Models

看见不可见:基于知识增强视觉语言模型的无训练风机叶片检测方法

Yang Zhang, Qianyu Zhou, Farhad Imani, Jiong Tang

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract,abstract_cn);retriever(abstract)

AI总结 该研究提出结合RAG与VLM的零样本风机叶片检测框架,构建多模态知识库,在小样本测试中表现优于基线,为工业检测提供数据高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02047 2026-03-03 cs.CV 88%

NICO-RAG: Multimodal Hypergraph Retrieval-Augmented Generation for Understanding the Nicotine Public Health Crisis

NICO-RAG:多模态超图检索增强生成用于理解尼古丁公共卫生危机

Manuel Serna-Aguilera, Raegan Anderes, Page Dobbs, Khoa Luu

机构 * University of Arkansas(亚拉巴马大学) University of Arkansas for Medical Sciences(亚拉巴马大学医学科学分校)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(title,abstract)

AI总结 NICO-RAG通过多模态超图检索增强生成,解决尼古丁公共卫生危机中的信息检索与生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05141 2025-06-09 eess.AS cs.SD 88%

Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation

Mu Yang, Bowen Shi, Matthew Le, Wei-Ning Hsu, Andros Tjandra

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(title,abstract)

Comments Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18465 2026-08-20 cs.HC cs.ET cs.IR 新提交 87%

Reducing Technician Search Burden: A Multimodal RAG for Cessna 172 Maintenance Manual

减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成

Seongjun Ha, Md Rashedul Islam, Gaurav Nanda, Damon Lercel

专题命中 多模态RAG :RAG(title,abstract);retrieval augmented generation(abstract);retriever(abstract);分类 cs.IR

AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21968 2026-06-23 cs.CV cs.CL 新提交 87%

Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG

先看再缩放:视觉RAG中分辨率-上下文权衡的自适应路由

Oanh N. Tran, Thanh Quoc Hung Le, Oscar Chew, Kuan-Hao Huang, Khoa D. Doan

机构 * VinUni-Illinois Smart Health Center, VinUniversity(VinUni-Illinois智慧健康中心,VinUniversity) Texas A&M University(德克萨斯农工大学)

专题命中 多模态RAG :RAG(title,title_cn);分类 cs.CL

AI总结 提出ViRGo框架,通过自适应路由选择全局感知、基于补丁或注意力的检索,以平衡小目标细节和大目标上下文,提升视觉RAG的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12323 2025-10-15 cs.AI 87%

RAG-Anything: All-in-One RAG Framework

Zirui Guo, Xubin Ren, Lingrui Xu, Jiahao Zhang, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);knowledge retrieval(abstract);hybrid retrieval(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24875 2026-07-29 cs.LG 新提交 87%

FinAbstain: Uncertainty-Calibrated Multimodal RAG for Selective Financial Forecasting

FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型

Dorothy Torres, Wei Cheng, Henan Huang

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract)

AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04625 2026-07-07 cs.CV cs.AI 新提交 86%

Hierarchical Evidence-Driven Reasoning for Long Document Understanding

用于长文档理解的分层证据驱动推理

Junyu Xiong, Yonghui Wang, Rongjian Gu, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(科大讯飞研究院)

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI

AI总结 针对现有多模态RAG管道面临的问题,提出分层证据驱动的多模态RAG框架HIEVI-RAG,通过四阶段管道,包括分层问题分解、粗视觉页面检索、细粒度页面验证和内存引导迭代生成,提升长文档理解,效果显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22217 2026-02-27 cs.IR cs.AI 86%

RAGdb: A Zero-Dependency, Embeddable Architecture for Multimodal Retrieval-Augmented Generation on the Edge

RAGdb: 一种无依赖、可嵌入的多模态检索增强生成边缘计算架构

Ahmed Bin Khalid

机构 * SKAS IT

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);vector search(abstract);分类 cs.IR、cs.AI

AI总结 RAGdb通过单文件SQLite容器实现多模态检索增强生成,无需GPU推理,提升边缘计算效率与数据主权

Comments 6 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15435 2025-11-20 cs.CV cs.AI cs.IR 86%

HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation

HV-Attack:多模态检索增强生成的分层视觉攻击

Linyin Luo, Yujuan Ding, Yunshan Ma, Wenqi Fan, Hanjiang Lai

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-Sen University(中山大学) Singapore Management University(新加坡管理学院)

专题命中 多模态RAG :retrieval augmented generation(title);retrieval-augmented generation(abstract);RAG(abstract);retriever(abstract)

AI总结 本文提出了一种分层视觉攻击方法,通过在图像输入中添加不可察觉扰动,破坏多模态检索增强生成系统的检索和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV 86%

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 86%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract,abstract_cn)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16628 2026-08-18 cs.AI 新提交 85%

Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement

基于超图的多模态检索增强生成与增量优化

Shenao Chen, Yidan Xu, Xiangmin Han, Rundong Xue, Duanpo Wu, Yuhan Gao, Chenggang Yan, Yue Gao

机构 * Hangzhou Dianzi University(杭州电子科技大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对现有多模态检索增强生成系统的二元连接局限与优化冗余问题,提出Hyper-M2RAG框架,通过多模态超图建模与锚点驱动的增量优化机制,在多模态基准数据集上实现优于现有方法的性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21544 2026-08-03 cs.CV cs.CL 85%

Vision Meets Language: A RAG-Augmented YOLOv8 Framework for Coffee Disease Diagnosis and Farmer Assistance

Semanto Mondal

机构 * University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 多模态RAG :RAG(title,abstract);retrieval augmented generation(abstract);retrieval-augmented generation(abstract);分类 cs.CL

Comments There are 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01737 2026-06-02 cs.AI 85%

TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination

TrafficRAG:用于交通事故责任认定的多模态RAG框架

Xu Li, Zedong Fu, Xinyi Li, Xun Han

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 多模态RAG :RAG(title,title_cn);hybrid retrieval(abstract);分类 cs.AI

AI总结 提出TrafficRAG框架,通过视觉语言模型生成结构化描述、混合检索获取法规和案例、大语言模型融合多模态证据进行推理,实现自动化交通事故责任分析报告生成。

Comments 12 pages, 3 figures, accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05594 2026-05-08 cs.CL cs.CV cs.LG 85%

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文的成本:减轻多模态检索增强生成中的文本偏差

Hoin Jung, Xiaoqian Wang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家族电气与计算机工程学院)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 本文探讨了多模态大语言模型在整合检索增强生成时出现的文本偏差问题,提出BAIR方法通过恢复视觉显著性并施加位置感知惩罚来提升多模态接地和诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27724 2026-05-01 cs.AI 85%

Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

迭代多模态检索增强生成用于医疗问答

Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Independent Researcher(独立研究者) Chinese Academy of Sciences, Beijing, China(中国科学院)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.AI

AI总结 MED-VRAG通过多模态检索增强生成框架,利用文档页面图像而非OCR文本进行医疗问答,提升准确率至78.6%,并验证检索和迭代对问答性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12735 2026-04-22 cs.CV cs.CL 85%

VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph

VimRAG:通过多模态记忆图导航大规模视觉上下文

Qiuchen Wang, Shihang Wang, Yu Zeng, Qiang Zhang, Fanrui Zhang, Zhuoning Guo, Bosi Zhang, Wenxuan Huang, Lin Chen, Zehui Chen, Pengjun Xie, Ruixue Ding

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 VimRAG通过多模态记忆图提升检索增强生成在处理大规模视觉上下文中的能力,采用动态有向无环图结构和图调制视觉记忆编码机制,实现高效的信息检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10030 2026-03-03 cs.CR cs.AI 85%

Safeguarding Multimodal Knowledge Copyright in the RAG-as-a-Service Environment

在RAG-as-a-Service环境中保护多模态知识版权

Tianyu Chen, Jian Lou, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学)

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI

AI总结 AQUA是一种用于多模态RAG系统中图像知识保护的首个水印框架,通过嵌入语义信号实现高效、隐蔽的版权追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09721 2025-09-15 cs.CV cs.AI cs.LG 85%

A Multimodal RAG Framework for Housing Damage Assessment: Collaborative Optimization of Image Encoding and Policy Vector Retrieval

Jiayi Miao, Dingxin Lu, Zhuqi Wang

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08826 2025-06-03 cs.CL cs.AI cs.IR 85%

Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation

Mohammad Mahdi Abootorabi, Amirhosein Zobeiri, Mahdi Dehghani, Mohammadali Mohammadkhani, Bardia Mohammadi, Omid Ghahroodi, Mahdieh Soleymani Baghshah, Ehsaneddin Asgari

机构 * Computer Engineering Department, Sharif University of Technology(沙斐大学计算机工程系) College of Interdisciplinary Science and Technology, University of Tehran(德黑兰大学跨学科科学与技术学院) Computer Engineering Department, K.N. Toosi University of Technology(技术学院计算机工程系) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract,comments);分类 cs.IR、cs.CL、cs.AI

Comments GitHub repository: https://github.com/llm-lab-org/Multimodal-RAG-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22833 2026-05-25 cs.IR cs.AI cs.LG 85%

RAG4Outcome: A Retrieval-Augmented Multimodal Framework for Prognostic Prediction in Chronic Osteomyelitis

RAG4Outcome:用于慢性骨髓炎预后预测的检索增强多模态框架

Daqian Shi, Pei Han, Jishizhan Chen, Yang Wang, Xiaolei Diao, Xianyou Zheng, Pengfei Cheng

机构 * Queen Mary University of London(女王玛丽大学) Shanghai Sixth People’s Hospital Affiliated to SJTU School of Medicine(上海第六人民医院附属复旦大学医学院) University College London(大学学院伦敦)

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 提出RAG4Outcome框架,通过检索增强生成技术融合PET-CT影像报告、结构化手术诊断记录和非结构化随访笔记等多模态临床数据,实现慢性骨髓炎的预后预测,提高可解释性和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23276 2026-04-28 cs.CV cs.AI cs.CL 85%

Lightweight and Production-Ready PDF Visual Element Parsing

轻量且适用于生产的PDF视觉元素解析

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li

机构 * Oracle AI

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级PDF解析框架,通过空间启发式、布局分析和语义相似性结合,实现高准确率的视觉元素检测与标题关联,提升多模态RAG检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03354 2026-06-03 cs.CR 85%

ImageAuditor: Membership Inference Attack against Image-based Retrieval-Augmented Generation

ImageAuditor: 针对基于图像的检索增强生成系统的成员推理攻击

Jinghuai Zhang, Pengyue Yu, Zhexiao Lin, Kunlin Cai, Fnu Suya, Yuan Tian

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn)

AI总结 提出首个针对基于图像的检索增强生成(IRAG)的成员推理攻击方法ImageAuditor,通过奖励引导策略优化解决跨模态检索和判别信号提取两大挑战,在仅需四次查询时AUROC超过80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05285 2025-07-15 cs.CL cs.AI cs.CY cs.IR 85%

Beyond classical and contemporary models: a transformative AI framework for student dropout prediction in distance learning using RAG, Prompt engineering, and Cross-modal fusion

Miloud Mihoubi, Meriem Zerkouk, Belkacem Chikhaoui

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 13 pages, 8 figures, 1 Algorithms, 17th International Conference on Education and New Learning Technologies,: 30 June-2 July, 2025 Location: Palma, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02544 2025-06-06 cs.CL cs.AI cs.IR 85%

CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAG

Yang Tian, Fan Liu, Jingyuan Zhang, Victoria W., Yupeng Hu, Liqiang Nie

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted to ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05874 2025-05-30 cs.CV cs.AI cs.CL cs.IR cs.LG 85%

VideoRAG: Retrieval-Augmented Generation over Video Corpus

Soyeong Jeong, Kangsan Kim, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16086 2025-04-30 cs.IR cs.AI cs.CL cs.CV eess.IV 85%

Towards Interpretable Radiology Report Generation via Concept Bottlenecks using a Multi-Agentic RAG

Hasan Md Tusfiqur Alam, Devansh Srivastav, Md Abdul Kadir, Daniel Sonntag

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Oldenburg(奥尔登堡大学)

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted in the 47th European Conference for Information Retrieval (ECIR) 2025

Journal ref Lecture Notes in Computer Science (LNCS) 2025, Volume 15574

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08748 2025-04-15 cs.IR cs.AI cs.CL cs.ET cs.LG 85%

A Survey of Multimodal Retrieval-Augmented Generation

Lang Mei, Siyu Mo, Zhihan Yang, Chong Chen

专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15262 2024-12-23 cs.CL cs.AI cs.IR 85%

Advanced ingestion process powered by LLM parsing for RAG system

Arnau Perez, Xavier Vizcaino

专题命中 多模态RAG :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏