arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1212 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1212 篇

2410.02932 2024-10-07 cs.AI 85%

Intrinsic Evaluation of RAG Systems for Deep-Logic Questions

Junyi Hu, You Zhou, Jie Wang

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04369 2024-06-10 cs.SE cs.AI 85%

RAG Does Not Work for Enterprises

Tilmann Bruckhaus

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);knowledge retrieval(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20735 2026-02-25 cs.IR cs.AI cs.CL 85%

RMIT-ADM+S at the MMU-RAG NeurIPS 2025 Competition

RMIT-ADM+S在MMU-RAG NeurIPS 2025比赛中的表现

Kun Ran, Marwah Alaofi, Danula Hettiachchi, Chenglong Ma, Khoi Nguyen Dinh Anh, Khoi Vo Nguyen, Sachin Pathiyan Cherumanal, Lida Rashidi, Falk Scholer, Damiano Spina, Shuoqi Sun, Oleg Zendel

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 RMIT-ADM+S系统通过Routing-to-RAG架构在NeurIPS 2025 MMU-RAG比赛中获胜,实现了高效检索增强生成和复杂科研任务处理。

Comments MMU-RAG NeurIPS 2025 winning system

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13708 2026-08-17 cs.CL cs.AI 新提交 85%

TeachMateGPT: A Multi-Agent Knowledge-Grounded Framework for Pedagogical Assessment Generation from Science Curriculum Materials

TeachMateGPT:面向科学课程材料的多智能体知识基教学评估生成框架

Fatema Tuj Johora Faria, Mukaffi Bin Moin, M. F. Mridha, Jubayer Al Mahmud

机构 * Ahsanullah University of Science and Technology(阿赫桑乌拉科技大学) American International University - Bangladesh(孟加拉国美国国际大学) Jashore University of Science and Technology(杰索尔科技大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 TeachMateGPT作为多智能体知识基框架,通过四项改进解决现有RAG系统局限,生成的科学评估题提升了忠实度与相关性,相关数据集经教师评分验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14400 2026-07-17 cs.CL cs.IR 新提交 85%

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础

Brandon Michaels, Brendon Johnson

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。

Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13189 2026-07-16 cs.CL cs.AI 新提交 85%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24902 2026-07-16 cs.CL cs.AI cs.LG 版本更新 85%

When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation

当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估

Faizan Faisal

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30062 2026-06-30 cs.CL cs.AI 85%

Little Brains, Big Feats: Exploring Compact Language Models

小脑袋,大成就:探索紧凑型语言模型

Dari Baturova, Elena Bruches, Ivan Chernov, Roman Derunets, Arsenii Fomin, Andrey Kostin

机构 * Siberian Neuronets LLC(西伯利亚神经网络有限公司)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本研究探索小型语言模型在检索增强生成(RAG)系统中的生成性能,实验表明无需GPU即可在设备上运行,并提供了基准测试结果。

Comments Accepted to ECML PKDD 2026, Applied Data Science track. Author preprint; the definitive version will appear in the proceedings of ECML PKDD 2026, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 85%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01020 2026-05-04 cs.AI cs.CL 85%

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics

用法律问题树准则评估法律推理轨迹

Jinu Lee, Kyoung-Woon On, Simeng Han, Arman Cohan, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) LBOX Stanford(斯坦福) Yale(耶鲁)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 LEGIT 数据集,用于评估 LLM 在法律领域推理轨迹的质量,发现法律问题覆盖度和正确性影响 LLM 推理能力,RAG 和带准则的 RL 分别提升整体能力与正确性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02208 2026-07-15 cs.CL cs.AI cs.IR cs.SE 85%

Towards AI Evaluation in Domain-Specific RAG Systems: The AgriHubi Case Study

面向领域特定RAG系统的AI评估:AgriHubi案例研究

Md. Toufique Hasan, Ayman Asad Khan, Mika Saari, Vaishnavi Bankhele, Pekka Abrahamsson

机构 * Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 AgriHubi通过整合芬兰农业文档与开放模型,结合来源 grounding 和用户反馈,提升了农业决策支持系统的回答完整性、语言准确性和可靠性。

Comments 6 pages, 2 figures, submitted to MIPRO 2026

Journal ref 2026 49th MIPRO ICT and Electronics Convention (MIPRO), Opatija, Croatia, pp. 989-994

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01222 2026-06-02 eess.SP 85%

RAG-driven Multi-Agent LLM Framework with Task Decomposition for Beyond 5G Auto-Configuration

基于RAG驱动的多智能体LLM框架与任务分解的超越5G自动配置

İrşat Emin Sarıdaş, Onur Salan, Ali Görçin, Ibrahim Hokelek, Hakan Ali Çırpan

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 提出一种检索增强和任务分解的多智能体LLM框架,通过语义检索和模块化架构减少幻觉,实现超越5G网络自动配置,成功率达94.4%。

Comments 6 pages, 2 figures, accepted to International Conference on Telecommunications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25333 2026-03-27 cs.CL cs.AI cs.IR 85%

Adaptive Chunking: Optimizing Chunking-Method Selection for RAG

自适应分块:为RAG优化分块方法选择

Paulo Roberto de Moura Júnior, Jean Lelong, Annabelle Blangero

机构 * Ekimetrics

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出自适应分块框架,通过五个新指标优化分块策略,提升RAG性能,使答案正确率提升至72%,问题解答数增加30%。

Comments Accepted at LREC 2026. 10 pages, 4 figures. Code: https://github.com/ekimetrics/adaptive-chunking

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09028 2026-01-27 cs.CL cs.AI cs.IR 85%

OpenDecoder: Open Large Language Model Decoding to Incorporate Document Quality in RAG

OpenDecoder: 开源大型语言模型解码以纳入文档质量在RAG中

Fengran Mo, Zhan Su, Yuchen Hui, Jinghan Zhang, Jia Ao Sun, Zheyuan Liu, Chao Zhang, Tetsuya Sakai, Jian-Yun Nie

机构 * Clemson University(克莱姆森大学) University of Notre Dame(诺特丹大学) Georgia Institute of Technology(佐治亚理工学院) Waseda University(早稻田大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 OpenDecoder通过整合文档质量评估提升RAG模型的鲁棒性,利用相关性、排序和QPP评分优化生成过程。

Comments Accepted by ACM WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05260 2026-01-12 cs.IR cs.AI cs.CL cs.LG 85%

Quantifying Document Impact in RAG-LLMs

量化RAG-LLM中的文档影响

Armin Gerami, Kazem Faghih, Ramani Duraiswami

机构 * Department of Computer Science(计算机科学系) Umiacs University of Maryland(马里兰大学) College Park MD

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出影响评分(IS)用于量化RAG-LLM中单个文档对输出的影响,通过实验验证其有效性,提升系统透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 85%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11654 2025-11-19 cs.IR cs.AI cs.CL 85%

FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection

Daniel Berhane Araya, Duoduo Liao

机构 * College of Engineering and Computing(工程与计算学院) George Mason University(乔治·马歇尔大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04696 2025-11-10 cs.CL cs.AI cs.IR 85%

EncouRAGe: Evaluating RAG Local, Fast, and Reliable

Jan Strich, Adeline Scharfenberg, Chris Biemann, Martin Semmann

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13694 2025-10-10 cs.CL cs.AI cs.IR 85%

Multi-Source Knowledge Pruning for Retrieval-Augmented Generation: A Benchmark and Empirical Study

Shuo Yu, Mingyue Cheng, Qi Liu, Daoyu Wang, Jiqian Yang, Jie Ouyang, Yucong Luo, Chenyi Lei, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04675 2025-09-22 cs.CL cs.AI cs.IR 85%

ConfReady: A RAG based Assistant and Dataset for Conference Checklist Responses

Michael Galarnyk, Rutwik Routu, Vidhyakshaya Kannan, Kosha Bheda, Prasun Banerjee, Agam Shah, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Sai University(赛大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06339 2025-06-10 cs.IR cs.AI cs.CL 85%

Optimizing RAG Pipelines for Arabic: A Systematic Analysis of Core Components

Jumana Alsubhi, Mohammad D. Alahmadi, Ahmed Alhusayni, Ibrahim Aldailami, Israa Hamdine, Ahmad Shabana, Yazeed Iskandar, Suhayb Khayyat

机构 * Naseej Innovation Lab, Naseej for Technology(Naseej创新实验室,Naseej技术)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15205 2025-04-22 cs.CL cs.AI cs.IR 85%

Support Evaluation for the TREC 2024 RAG Track: Comparing Human versus LLM Judges

Nandan Thakur, Ronak Pradeep, Shivani Upadhyay, Daniel Campos, Nick Craswell, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Snowflake(Snowflake公司) Microsoft(微软公司)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted at SIGIR 2025 (short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24307 2025-04-01 cs.CL cs.AI cs.IR cs.LG 85%

A Systematic Evaluation of LLM Strategies for Mental Health Text Analysis: Fine-tuning vs. Prompt Engineering vs. RAG

Arshia Kermani, Veronica Perez-Rosas, Vangelis Metsis

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09213 2024-11-15 cs.CL cs.AI cs.IR 85%

Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering

Nghia Trung Ngo, Chien Van Nguyen, Franck Dernoncourt, Thien Huu Nguyen

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12873 2024-07-23 cs.CL cs.AI cs.IR cs.LG 85%

Evaluation of RAG Metrics for Question Answering in the Telecom Domain

Sujoy Roychowdhury, Sumit Soman, H G Ranjani, Neeraj Gunda, Vansh Chhabra, Sai Krishna Bala

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted for publication in ICML 2024 Workshop on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09476 2024-04-02 cs.CL cs.AI cs.IR 85%

ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems

Jon Saad-Falcon, Omar Khattab, Christopher Potts, Matei Zaharia

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09699 2024-10-15 cs.CL cs.AI 84%

Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG

Xinxi Chen, Li Wang, Wei Wu, Qi Tang, Yiyao Liu

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI;retrieval augmented generation(journal_ref)

Journal ref 2024 KDD Cup Workshop for Retrieval Augmented Generation at the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03708 2024-09-09 cs.CL cs.IR 84%

RAG based Question-Answering for Contextual Response Prediction System

Sriram Veturi, Saurabh Vaichal, Reshma Lal Jagadheesh, Nafis Irtiza Tripto, Nian Yan

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL

Comments Accepted at the 1st Workshop on GenAI and RAG Systems for Enterprise, CIKM'24. 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16776 2026-08-20 cs.AI 版本更新 84%

GRIP: Grounded Reasoning via Information-Restricted Premises

GRIP:基于信息受限前提的接地推理

Lirui Teng

机构 * University of Waterloo(滑铁卢大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对RAG中查询主导导致证据失效的问题,提出GRIP方法,通过容量不对称设计优化信息编码,在五个推理基准上实现性能提升,大幅降低互信息与幻觉。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01791 2026-08-07 cs.ET cs.AI 版本更新 84%

PICopilot: An LLM-based Agentic Framework for Assisting Photonic Integrated Circuit Design via Script Generation

PICopilot:一种基于大语言模型的智能体框架,通过脚本生成辅助光子集成芯片设计

Xiaohan Jiang, Zeyu Li, Wei Zhang, Jiang Xu

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 PICopilot是首个基于LLM的智能体框架,通过带反馈机制的多智能体架构与专用RAG流程,成功完成全部48项PIC脚本任务,性能优于其他LLM方法及通用RAG的GPT-5。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏