arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8633 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1223 篇

2405.05444 2024-05-10 cs.CL cs.AI 84%

Evaluating Students' Open-ended Written Responses with LLMs: Using the RAG Framework for GPT-3.5, GPT-4, Claude-3, and Mistral-Large

Jussi S. Jauhiainen, Agustín Garagorry Guerra

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 6 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00820 2024-03-05 cs.IR cs.CL 84%

Retrieval Augmented Generation Systems: Automatic Dataset Creation, Evaluation and Boolean Agent Setup

Tristan Kenneweg, Philip Kenneweg, Barbara Hammer

专题命中 RAG评测 :retrieval augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL

Comments Was handed in to IJCNN prior to preprint publication here. Was neither accepted nor rejected at date of publication here

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00824 2026-08-04 cs.SE 新提交 83%

Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations

结合标题链前缀的结构感知语义分块:1600次查询评估及文本变换消融实验中的测量陷阱

Yang Yang

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 本文提出仅在分块侧的三阶段语义分块流水线,经1600次查询评估提升RAG的MRR@5,还发现分块研究中存在的测量陷阱并推荐检索时每个候选前缀评估的方向。

Comments 8 pages, 1 table. Replication package: DOI 10.5281/zenodo.21744653

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19047 2026-07-01 cs.CL cs.AI cs.IR 版本更新 83%

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora

RARE:面向高相似性语料的冗余感知检索评估框架

Hanjun Cho, Jay-Yoon Lee

机构 * Allganize Seoul National University(首尔国立大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 RARE通过分解文档为原子事实和增强LLM生成数据,构建更真实的基准,揭示当前评估体系无法捕捉的鲁棒性差距。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25361 2026-06-25 cs.CL cs.AI cs.IR 新提交 83%

Memory Makes the Difference: Evaluating How Different Memory Roles Shape Conversational Agents

记忆决定差异:评估不同记忆角色如何塑造对话代理

Yuxin Wang, Paul Thomas, Zhiwei Yu, Yuan Gao, Saeed Hassanpour, Soroush Vosoughi, Robert Sim, Nick Craswell

机构 * Dartmouth College(达特茅斯学院) Microsoft(微软公司)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本研究提出对话记忆细粒度分类法,通过用户中心评估框架,揭示不同类型记忆(如澄清记忆、无关记忆)对RAG对话系统响应准确性、个性化及主题相关性的差异化影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20359 2026-06-19 cs.LG 新提交 83%

Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act

训练、检索,还是两者兼用?针对安大略省住宅租赁法的正确法定引用的四组头对头比较

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 RAG评测 :RAG(summary_cn,abstract);hybrid retrieval(abstract)

AI总结 研究自诉租户、房东和帮助台工作人员如何获得正确的法定引用,通过四组实验比较微调、检索及混合方法,发现SFT+RAG混合模型在精确匹配上得分最高且无幻觉引用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17179 2026-06-16 cs.MA 版本更新 83%

Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection

公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究

Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang, Emily F. Wong, Paul Wang, Jason H. Moore, Tiffani J. Bright

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09845 2026-06-10 cs.HC cs.ET 新提交 83%

Tutor, Not Solver: Designing a Guardrailed AI Assistant for Learning in Higher Education: A Design Case of PeteChat

导师,而非解题者:设计高等教育中带护栏的AI学习助手——PeteChat的设计案例

Belle Li, Lily Tan, Wei Zakharov, Qiang Qiu, Colby Ben Acton

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 本文通过设计案例PeteChat,提出八项可迁移的评估感知AI导师设计原则,包括作业护栏、调试支架等,基于本地Llama-3模型和RAG技术,旨在平衡学习支持与学术诚信。

Comments Preprint. Includes supplementary appendices, interface figures, and baseline-analysis tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 83%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05436 2026-06-05 cs.AI cs.CL cs.IR 83%

Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

十位头痛专家与人工智能在临床文献总结中的比较:一项关键评估与对比

Alejandro Lozano, Keiko Ihara, Ping-Hao Yang, Carrie E. Robertson, Jennifer Stern, Allan Purdy, Hsiangkuo Yuan, Pengfei Zhang, Yulia Orlova, Olga Fermo, Jennifer Hranilovich, Fred Cohen, Todd J. Schwedt, Jenelle A. Jindal, Serena Yeung-Levy, Chia-Chun Chiang

机构 * Stanford University Palo Alto CA USA(斯坦福大学) Department of Neurology Mayo Clinic Rochester MN USA(梅奥诊所神经科) Department of Neurology Dalhousie University Halifax Canada(达尔豪斯大学神经科) Jefferson Headache Center Department of Neurology Thomas Jefferson University PA USA(泰勒大学神经科) Beth Israel Deaconess Medical Center Boston MA USA(贝斯以色列医疗中心) Department of Neurology University of Florida Gainesville FL USA(佛罗里达大学神经科) University of Colorado School of Medicine Department of Pediatrics Division of Child Neurology Aurora CO USA(科罗拉多医学院儿科部儿童神经科) Department of Medicine Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院医学部) Department of Neurology Mayo Clinic Scottsdale AZ USA(梅奥诊所Scottsdale分部) Harvard Medical School Boston MA USA(哈佛医学院) Department of Neurology Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院神经科)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本研究通过构建基于RAG的AI框架,比较了三种大语言模型与十位头痛专家在临床文献总结方面的表现,发现专家撰写的摘要更受青睐,但专家有时难以区分人类与AI生成的摘要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11974 2026-05-13 cs.LG 83%

Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization

迈向顺序公平性:通过双组优势优化缓解大语言模型的顺序敏感性

Xu Chu, Guanyu Wang, Zhijie Tan, Xinrong Chen, Ziyu Li, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(软件与微电子学院,北京大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 本文提出双组优势优化(DGAO),通过平衡组内准确性优势和组间稳定性优势,缓解LLM的顺序敏感性,提升模型在RAG、数学推理和分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12400 2026-04-16 cs.NI 83%

Agentic AI for 6G: A New Paradigm for Autonomous RAN Security Compliance

面向6G的代理AI:自主RAN安全合规的新范式

Sotiris Chatzimiltis, Mahdi Boloursaz Mashhadi, Mohammad Shojafar, Merouane Debbah, Rahim Tafazolli

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 本文提出利用基于LLM的AI代理与RAG流程框架,实现RAN安全合规的智能自主执行,通过案例研究展示其在O-RAN联盟和3GPP标准合规性评估中的应用,并探讨模型幻觉、供应商不一致等挑战及未来发展方向。

Comments Accepted at IEEE Communications Standards Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16775 2026-08-18 cs.CR cs.AI 新提交 83%

Topological Attribution Distance (TAD): Revealing Segment-Level RAG Influence on LLM Output Geometry for Incident Log Analysis

拓扑归因距离(TAD):揭示用于事件日志分析的RAG片段级影响对LLM输出几何的作用

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM在网络安全应用中证据归因追踪的缺口,提出拓扑归因距离(TAD)方法,可自适应识别对LLM输出关键的事件日志,为证据验证提供可解释追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11419 2026-04-14 cs.AI cs.CR 83%

Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval

超越RAG的网络威胁情报:基于图和代理检索的系统评估

Dzenan Hamzic, Florian Skopik, Max Landauer, Markus Wurzenberger, Andreas Rauber

机构 * AIT Austrian Institute of Technology(AIT奥地利技术研究所)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文系统评估了四种RAG架构在CTI分析中的表现,发现图检索在结构化查询中表现更优,混合图文方法在多跳查询中提升答案质量达35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10745 2026-04-14 cs.CL 83%

How You Ask Matters! Adaptive RAG Robustness to Query Variations

提问方式影响重大!适应性RAG对查询变化的鲁棒性

Yunah Jang, Megha Sundriyal, Kyomin Jung, Meeyoung Cha

机构 * Seoul National University(首尔大学) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究探讨了适应性RAG在面对不同表层查询形式时的鲁棒性,通过大规模基准测试发现小幅度语义变化会显著影响检索行为和准确性,揭示了适应性RAG在保持语义一致时的鲁棒性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10734 2026-04-14 cs.CL 83%

Self-Correcting RAG: Enhancing Faithfulness via MMKP Context Selection and NLI-Guided MCTS

自校正RAG:通过MMKP上下文选择和NLI引导的MCTS增强忠实性

Shijia Xu, Zhou Wu, Xiaolong Jia, Yu Wang, Kai Liu, April Xiaowen Dong

机构 * Chongqing University(重庆大学) Queen Mary University of London(伦敦玛丽女王大学) Chongqing Key Laboratory of Big Data Intelligence and Privacy Computing(重庆市大数据智能与隐私计算重点实验室) Fangda Partners(方达律师事务所)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本研究提出Self-Correcting RAG框架,通过MMKP上下文选择和NLI引导的MCTS机制,提升复杂推理任务中的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03926 2026-04-09 cs.AI cs.CY cs.HC cs.MA 83%

CODE-GEN: A Human-in-the-Loop RAG-Based Agentic AI System for Multiple-Choice Question Generation

CODE-GEN:一种基于检索增强生成的多选题生成人机协作人工智能系统

Xiaojing Duan, Frederick Nwanganga, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 CODE-GEN通过生成与课程目标一致的多选题提升学生代码推理能力,采用生成器和验证器代理,结合专用工具提高准确性,评估结果显示系统在七个教学维度上表现优异,但人类专家仍需参与设计教学性干扰项和反馈质量。

Comments Full version of the paper accepted as a short paper at the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27253 2026-04-09 cs.CL 83%

Mitigating Hallucination on Hallucination in RAG via Ensemble Voting

通过集成投票缓解RAG中的幻觉

Zequn Xie, Zhengyang Sun

机构 * Polytechnic Institute Zhejiang University Hangzhou, China School of Computer Science Technology Xinjiang University Urumqi, China

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出VOTE-RAG框架,通过集成投票机制缓解RAG中的幻觉问题,实验表明其性能优于复杂框架,且结构简单、并行高效。

Comments arXiv admin note: text overlap with arXiv:2505.18581 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05358 2026-04-08 cs.AI cs.LG 83%

LatentAudit: Real-Time White-Box Faithfulness Monitoring for Retrieval-Augmented Generation with Verifiable Deployment

LatentAudit: 用于检索增强生成的实时白盒可信度监控与可验证部署

Zhe Yu, Wenpeng Xing, Meng Han

机构 * Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Communication University of Zhejiang(浙江传媒学院) Zhejiang University(浙江大学)

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.AI

AI总结 LatentAudit通过分析生成器中间层激活来实时监控RAG系统的可信度,无需额外模型,且在多个基准测试中表现出高准确率和低延迟,支持公开验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00296 2026-04-07 cs.IR 83%

RAGRouter-Bench: A Dataset and Benchmark for Adaptive RAG Routing

RAGRouter-Bench:一种自适应RAG路由的数据库和基准测试

Ziqi Wang, Xi Zhu, Shuhang Lin, Haochen Xue, Minghao Guo, Yongfeng Zhang

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 本文提出RAGRouter-Bench,首个用于自适应RAG路由的数据库和基准测试,通过整合查询-语料兼容性、细粒度语料指标和统一评估协议,系统评估生成质量和资源消耗,验证自适应路由在不同查询-语料上下文中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02640 2026-04-06 cs.CL 83%

Overcoming the "Impracticality" of RAG: Proposing a Real-World Benchmark and Multi-Dimensional Diagnostic Framework

克服RAG的“不实际性”:提出一个现实世界基准和多维诊断框架

Kenichirou Narita, Siqi Peng, Taku Fukui, Moyuru Yamada, Satoshi Munakata, Satoru Takahashi

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出一个现实世界RAG基准和多维诊断框架,以解决企业环境中RAG系统评估的复杂挑战,提升系统可靠性。

Comments 8 pages, 3 figures. Accepted at AAAI 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05866 2026-03-31 cs.CL 83%

FACTUM: Mechanistic Detection of Citation Hallucination in Long-Form RAG

FACTUM:长形式RAG中引用幻觉的机制检测

Maxime Dassen, Rebecca Kotula, Kenton Murray, Andrew Yates, Dawn Lawrie, Efsun Kayi, James Mayfield, Kevin Duh

机构 * University of Amsterdam(阿姆斯特丹大学) Department of Defense(美国国防部) HLTCOE, Johns Hopkins University(约翰霍普金斯大学HLTCOE) Applied Physics Laboratory, Johns Hopkins University(约翰霍普金斯大学应用物理实验室)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 FACTUM通过四个机制性评分(CAS、BAS、PFS、PAS)检测RAG中的引用幻觉,发现高参数力(PFS)和注意力sink使用(BAS)与正确引用相关,且随着模型规模变化,正确性特征也随之演变,FACTUM在AUC上优于现有方法37.5%。

Comments Accepted at ECIR 2026. 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00216 2026-03-27 cs.CL 83%

From Evidence-Based Medicine to Knowledge Graph: Retrieval-Augmented Generation for Sports Rehabilitation and a Domain Benchmark

从循证医学到知识图谱:面向体育康复的检索增强生成及领域基准

Jinning Zhang, Jie Song, Wenhui Tu, Zecheng Li, Jingxuan Li, Jin Li, Xuan Liu, Taole Sha, Zichen Wei, Yan Li

机构 * Beijing Key Laboratory of Sports Performance and Skill Assessment, Beijing Sport University(北京体育大学北京市运动表现与技能评估重点实验室) Department of Exercise Physiology, School of Sport Science, Beijing Sport University(北京体育大学运动科学学院运动生理学教研室) School of Sport Medicine and Physical Therapy, Beijing Sport University(北京体育大学运动医学与康复学院) Rehabilitation Center, Beijing Rehabilitation Hospital(北京康复医院康复中心) Optum Care Washington School of Management, Beijing Sport University(北京体育大学管理学院) Department of Statistics and Actuarial Science, The University of Hong Kong(香港大学统计与精算学系)

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出SR-RAG框架,结合PICO框架构建知识图谱并改进检索,引入贝叶斯证据层级重排序方法,通过体育康复验证,释放包含357844个节点和371226条边的知识图谱及1637个问答对基准,显著优于基线模型。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20534 2026-03-25 cs.SE cs.AI 83%

An Industrial-Scale Retrieval-Augmented Generation Framework for Requirements Engineering: Empirical Evaluation with Automotive Manufacturing Data

面向工业规模的检索增强生成框架用于需求工程:基于汽车制造数据的实证评估

Muhammad Khalid, Yilmaz Uygun

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出一个工业级检索增强生成框架,用于需求工程自动化,通过实证评估展示其在提高提取准确性和减少人工分析时间方面的优势。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11650 2026-03-13 cs.CL 83%

QChunker: Learning Question-Aware Text Chunking for Domain RAG via Multi-Agent Debate

QChunker: 通过多智能体辩论学习问题感知的文本分块以实现领域RAG

Jihao Zhao, Daixuan Li, Pengfei Li, Shuaishuai Zu, Biao Qin, Hongyan Liu

机构 * School of Information, Renmin University of China(中国人民大学信息学院) School of Smart Governance, Renmin University of China(中国人民大学智能治理学院) School of Information, BRAIN, Renmin University of China(中国人民大学信息学院、BRAIN学院) School of Economics and Management, Tsinghua University(清华大学经济管理学院)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 QChunker通过多智能体辩论框架,提升RAG中文本分块的语义完整性和信息粒度,采用ChunkScore评估指标,实现更高效高质量的文本分块生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09704 2026-03-12 cs.CL 83%

Evaluation of LLMs in retrieving food and nutritional context for RAG systems

对LLMs在RAG系统中检索食物和营养上下文的评估

Maks Požarnik Vavken, Matevž Ogrinc, Tome Eftimov, Barbara Koroušić Seljak

机构 * Department of Computer Systems Institute "Jožef Stefan"(计算机系统研究所(Jožef Stefan)部门)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文评估了LLMs在RAG系统中检索食物和营养信息的能力,发现其在可表达约束下表现良好,但在复杂约束下存在局限。

Comments This is the preprint for our conference paper for IEEE International Conference on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04238 2026-03-05 cs.CL 83%

Retrieval or Representation? Reassessing Benchmark Gaps in Multilingual and Visually Rich RAG

检索还是表示?重新评估多语言和视觉丰富的RAG基准差距

Martin Asenov, Kenza Benkirane, Dan Goldwater, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel AI实验室)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 该研究通过系统分析发现,文档表示质量是多语言和视觉丰富RAG基准提升的主要因素,而非检索方法改进。

Comments ICLR 2026 Workshop I Can't Believe It's Not Better: Where Large Language Models Need to Improve

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11371 2026-03-05 cs.IR 83%

RAG vs. GraphRAG: A Systematic Evaluation and Key Insights

RAG与GraphRAG:系统评估与关键洞察

Haoyu Han, Li Ma, Yu Wang, Harry Shomer, Yongjia Lei, Zhisheng Qi, Kai Guo, Zhigang Hua, Bo Long, Hui Liu, Charu C. Aggarwal, Jiliang Tang

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 本文系统评估RAG与GraphRAG在文本任务中的表现,提出统一评估协议,揭示两者优势与权衡,并探索整合策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03300 2026-03-05 cs.CL 83%

Benchmarking Legal RAG: The Promise and Limits of AI Statutory Surveys

法律RAG基准测试:AI立法调研的潜力与局限

Mohamed Afane, Emaan Hariri, Derek Ouyang, Daniel E. Ho

机构 * Stanford University(斯坦福大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文评估了三种新兴工具在法律RAG基准测试中的表现,发现STARA性能显著提升,而商业平台表现不佳,同时揭示了DOL律师的遗漏问题,并提出了法律RAG的未来设计原则。

Comments Accepted at the 5th ACM Symposium on Computer Science and Law (CS&Law '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23184 2026-02-27 cs.CL 83%

MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG Conversations

MTRAG-UN:多轮检索增强生成对话中开放挑战的基准

Sara Rosenthal, Yannis Katsis, Vraj Shah, Lihong He, Lucian Popa, Marina Danilevsky

机构 * IBM Research(IBM研究院)

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.CL

AI总结 MTRAG-UN是一个用于评估多轮检索增强生成对话中开放挑战的基准,包含666个任务和2800多轮对话,揭示了检索和生成模型在处理无答案、无描述等问题时的不足。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏