arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1212 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1212 篇

2603.21607 2026-08-10 cs.AI 版本更新 91%

INTRYGUE: Induction-Aware Entropy Gating for Reliable RAG Uncertainty Estimation

INTRYGUE:面向可靠RAG不确定性估计的诱导感知熵门控

Alexandra Bazarova, Andrei Volodichev, Daria Kotova, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出INTRYGUE方法,通过诱导头激活模式门控预测熵,解决RAG中熵基不确定性估计的机械悖论问题,提升hallucination检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04366 2026-08-06 cs.CR cs.AI 新提交 91%

Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework

对抗智能体系统中的知识篡改:一种拜占庭容错的安全协同RAG框架

Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对RAG系统面临的知识篡改攻击问题,提出拜占庭容错的安全协同RAG框架SecureCollaRAG,通过多源知识验证机制与动态GNN可信度评分实现攻击防护,在非IID数据下保持鲁棒性。

Journal ref Proceedings of the ACM Web Conference 2026, pages 2661-2672, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00006 2026-08-04 cs.AI 新提交 91%

Enhancing LLMs with Context-Specific Knowledge for Mitigating Misinformation in SMEs: A RAG-based Modeling and Analysis

用特定上下文知识增强大语言模型以缓解中小企业的错误信息:一种基于RAG的建模与分析

Md. Samiul Islam, Iqbal H. Sarker, Chadni Islam, Ahmad Mohsin, Ahmed Ibrahim, Helge Janicke

机构 * School of Science, Edith Cowan University(伊迪斯科文大学理学院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 该研究针对中小企业使用LLM时面临的错误信息问题,提出VectorRAG与GraphRAG方法,在LLaMA等模型上验证RAG可提升响应质量,助力可靠决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27752 2026-07-21 cs.CL cs.SE 版本更新 91%

Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG

基于分层验证的反向测试用于RAG中的幻觉检测

Boxi Yu, Yuzhong Zhang, Liting Lin, Lionel Briand, Emir Muñoz

机构 * Lero, the Research Ireland Centre for Software, University of Limerick(Lero,爱尔兰科学基金会软件研究中心,利默里克大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Ottawa(渥太华大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出RT4CHART框架,通过分层验证提升RAG中上下文忠实度评估的准确性,实现细粒度审计,并在新标注基准上取得最佳检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11257 2026-06-11 cs.CL cs.LG cs.PF 新提交 91%

Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite

移动NPU上的能效型设备端RAG:Snapdragon X Elite系统设计与基准测试

Zhiyuan Cheng, Longying Lai

机构 * Qualcomm(高通) Snapdragon X Elite(骁龙X Elite) Dell XPS 13 laptop(戴尔XPS 13笔记本电脑) Qualcomm Hexagon NPU(高通Hexagon NPU) Adreno X1-85

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文首次在Snapdragon X Elite的Hexagon NPU上实现端到端RAG流水线,通过对比CPU和GPU,NPU在嵌入吞吐量、系统能耗和查询延迟上分别提升9.1倍、降低12.3倍和4.0倍,且答案质量相当。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04739 2026-06-04 cs.SE cs.AI 91%

Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models

重新审视Vul-RAG:基于RAG的漏洞检测的可复现性与可复制性——使用开放权重模型

Sabrina Kaniewski, Fabian Schmidt, Tobias Heer

机构 * Institute for Secure Networked Systems, Esslingen University(安全网络系统研究所,埃斯林根大学) Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本研究通过本地部署和多种开放权重模型,复现并扩展了Vul-RAG框架,发现其性能存在约0.30成对准确率的上限,且模型能力提升无法显著改善性能。

Comments Accepted at AI&CCPS 2026 workshop, co-located with the 21st International Conference on Availability, Reliability and Security (ARES 2026). This is the authors' preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30400 2026-06-01 cs.CL 91%

Protocol for evaluating ChatGPT in biomedical association generation and verification using a RAG-enabled, cross-model majority voting workflow

使用RAG支持的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议

Ahmed Abdeen Hamed, Luis M. Rocha

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 提出一个协议,通过RAG和跨模型多数投票工作流评估ChatGPT生成疾病中心生物医学关联的能力,并验证其可靠性。

Comments Main Manuscript and Supplementary Information. Both are equally important

Journal ref STAR Protocols, 2026; 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30029 2026-05-29 cs.AI 91%

RAISE: RAG Design as an Architecture Search Problem

RAISE:将RAG设计视为架构搜索问题

Zhen Chen, Yibing Liu, Weihao Xie, Yu Liang, Peilin Chen, Shiqi Wang

机构 * City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出将检索增强生成(RAG)系统的设计选择形式化为架构搜索问题,并构建RAISE框架和基准,通过标准化搜索空间和预算评估13种优化算法在7个数据集上的表现,发现优化性能高度依赖任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05253 2026-05-21 cs.IR 91%

EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge

EnterpriseRAG-Bench: 一个用于企业内部知识的RAG基准测试

Yuhong Sun, Joachim Rahmfeld, Chris Weaver, Weijia Chen, Roshan Desai, Wenxi Huang, Mark H. Butler

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 本文提出EnterpriseRAG-Bench,一个包含50万文档和500个问题的基准测试,用于评估和比较基于检索增强生成(RAG)方法在企业内部知识处理中的性能。

Comments Code and dataset available at https://github.com/onyx-dot-app/EnterpriseRAG-Bench or https://huggingface.co/datasets/onyx-dot-app/EnterpriseRAG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09174 2026-05-21 cs.CL 91%

Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG

面向证据不确定性和幻觉的面级追踪(RAG)

Passant Elchafei, Monorama Swain, Shahed Masoudian, Markus Schedl

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Institute of Computational Perception(计算感知研究所) Artificial Intelligence Lab(人工智能实验室)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出了一种面向问答任务的面级诊断框架,通过分解每个输入问题为原子推理面,评估证据充分性和基础性,揭示RAG系统中幻觉产生的根源在于生成过程中证据整合的方式,而非检索准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10853 2026-05-12 cs.CL 91%

Grounded Satirical Generation with RAG

基于RAG的 grounded 愚笑生成

Oona Itkonen, Yuxin Su, Linyao Du, Ona De Gibert

机构 * University of Helsinki(赫尔辛基大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出基于RAG的 grounded 愚笑生成方法,通过当前新闻检索生成芬兰语讽刺词典定义,并引入任务特定评估框架,分析文化背景、源词类型及RAG存在与否对输出的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20932 2026-04-24 cs.CR cs.AI 91%

Adaptive Defense Orchestration for RAG: A Sentinel-Strategist Architecture against Multi-Vector Attacks

面向多向攻击的RAG自适应防御编排:Sentinel-Strategist架构

Pranav Pallerla, Wilson Naik Bhukya, Bharath Vemula, Charan Ramtej Kodi

机构 * University of Hyderabad(Hyderabad大学) Purdue University(普渡大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出Sentinel-Strategist架构,通过动态选择防御措施,在RAG系统中有效降低安全与效用的权衡,减少成员推断泄漏并恢复检索效用。

Comments 21 pages, 2 figures, 9 tables. Manuscript prepared for submission to ACM CCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23281 2026-04-22 cs.CL 91%

MCP vs RAG vs NLWeb vs HTML: A Comparison of the Effectiveness and Efficiency of Different Agent Interfaces to the Web (Technical Report)

MCP与RAG与NLWeb与HTML:不同网页代理接口的有效性和效率比较(技术报告)

Aaron Steiner, Ralph Peeters, Christian Bizer

机构 * Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文比较了四种网页代理接口的有效性和效率,发现RAG、MCP和NLWeb在效果和效率上均优于HTML。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13-17, 2026, Dubai, United Arab Emirates. ACM, New York, NY, USA, pp. 8493-8496

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07711 2026-04-21 cs.CL 91%

Is Agentic RAG worth it? An experimental comparison of RAG approaches

代理RAG值得吗?RAG方法的实验比较

Pietro Ferrazzi, Milica Cvjeticanin, Alessio Piraccini, Davide Giannuzzi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Padova(帕多瓦大学) Cargill Geneve(卡吉尔日内夫) Alkemy(阿尔凯米) Komebi Studio(科梅比工作室)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文通过多场景多维度实验比较了增强型和代理型RAG方法,揭示了两者在性能与成本上的权衡,为实际应用提供选择指导。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05096 2026-04-16 cs.CL 91%

RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World

RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限

Hanbing Liu, Lang Cao, Yang Li

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出一个现实世界动态事件基准,评估模型在连续知识漂移下的适应能力,揭示现有方法如RAG和学习方法的局限性,并提出时间感知检索基线Chronos以提升时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26843 2026-07-30 cs.SE 新提交 90%

When Knowledge Changes: Metamorphic Testing of RAG Systems with Mutations

当知识发生变化时:面向RAG系统的变异体态测试

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 针对现有RAG系统评估方法无法检测语料库演变带来的故障问题,提出含11个变异算子的体态测试框架,实验显示其F1分数远优于RAGAS,可有效评估RAG系统在语料库变化下的一致性。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13744 2026-07-13 math.ST stat.TH 版本更新 90%

A Note on k-NN Gating in RAG

关于检索增强生成(RAG)中k近邻门控的一个注释

Gérard Biau, Claire Boyer

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 为检索增强生成(RAG)提出统计代理框架,推导出最优查询级门控,通过检索不一致性分析幻觉并建模查询-内存不匹配,还进行了数值验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29523 2026-05-29 cs.LG 90%

K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance

K-FinHallu:面向韩语金融多轮RAG的幻觉检测基准

Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi

机构 * KAIST AI(KAIST人工智能实验室) Financial Tech Lab(金融科技实验室) KakaoBank Corp(Kakao银行公司)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 提出K-FinHallu基准,通过构建多轮对话和层次化幻觉分类,评估LLM在韩语金融RAG中的幻觉检测能力,发现即使最强模型在细粒度金融诊断和合理弃权上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18490 2026-08-18 cs.CL cs.IR 版本更新 90%

Single-Round Vector RAG vs an LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research Corpus

向量RAG与LLM编写的维基:在小型多领域研究上的预注册比较

Theodore O. Cochran

机构 * AI for Altruism (A4A)(AI为利他主义(A4A))

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.IR、cs.CL

AI总结 本文通过预注册比较,研究了向量RAG系统与LLM编写的维基在小型多领域研究中的表现,发现两者在跨论文连接、答案组织和成本等方面各有优劣,没有单一系统在所有指标上最优。

Comments v2: two-judge reanalysis of the decomposition-RAG ablation (groundedness advantage +1.15 to +0.15); H3a adjudicated; one registered-plan deviation disclosed; artifact deposit at osf.io/j37b8; title corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27506 2026-07-31 cs.CL cs.AI 新提交 90%

Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models

极简RAG的模型:B1ade 335M嵌入模型与1B参数小型语言模型

Shreyas Subramanian, Mecit Gungor, Vikram Elango

机构 * Amazon(亚马逊公司)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究提出含B1ade-embed嵌入模型与B1ade-1B小型语言模型的高效极简RAG架构,其在多QA基准及RAG评估中表现优异,还涌现出无明确监督的来源引用能力,验证了资源高效RAG的可行路径。

Comments 28 pages, 3 figures. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27355 2026-05-22 cs.AI cs.CL cs.SE 90%

LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications

LLM Readiness Harness: 评估、可观测性和持续集成门禁用于LLM/RAG应用

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出了一种LLM和RAG应用的准备性框架,通过自动化基准测试、OpenTelemetry可观测性和持续集成质量门禁,将评估转化为部署决策流程,并通过帕累托前沿计算场景加权的准备度分数,展示了在票务路由工作流和BEIR接地任务上的评估结果。

Comments 19 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07595 2026-04-15 cs.AI cs.CL 90%

Reasoning Graphs: Self-Improving, Deterministic RAG through Evidence-Centric Feedback

推理图:通过以证据为中心的反馈实现自我改进的确定性RAG

Matthew Penaroza

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出推理图,通过证据中心反馈提升RAG的准确性和确定性,实验显示在50%以上的证据覆盖下,错误率降低47%,在多跳问题中准确率提升11.0个百分点,实现高重用场景下的性能优势。

Comments 15 pages including appendix, 2 figures, 3 algorithms, framework paper with evaluation protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07933 2026-08-11 cs.CR cs.CL 新提交 90%

EvoTrustRAG: Evolution-Aware Conflict Attribution and Evidence Handling for Reliable Retrieval-Augmented Generation

EvoTrustRAG:面向可靠检索增强生成的感知演化冲突归因与证据处理

Xi Nie, Hongwei Li, Shenghao Wu, Wenshu Fan, Qiyang Song, Wenbo Jiang

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(summary_cn,abstract);分类 cs.CL

AI总结 针对RAG在动态对抗环境中面临的冲突证据挑战,提出无训练框架EvoTrustRAG,通过构建冲突证据图并利用时间关系等进行归因,提升了冲突归因的准确率与宏F1值,降低了协同攻击下的错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05571 2026-08-07 cs.LG cs.IR 新提交 90%

Align-RAG: Alignment Is All You Need for TSFM In-Context Learning

Align-RAG:TSFM上下文学习的全部需求在于对齐

Mohammad Asadi, Soheil Hor, Bardiya Akhbari, Jack W. O'Sullivan, Tahoura Nedaee, Layne C. Price, Raviteja Anantha, Euan Ashley, Ehsan Adeli

机构 * Stanford University(斯坦福大学) Amazon(亚马逊公司)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.IR

AI总结 提出无需训练的Align-RAG方法,通过闭式对齐检索窗口,在冻结TSFM上提升检索增强预测性能,证明冻结TSFM可动态整合检索结果,闭式对齐可作为默认基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07302 2026-07-09 cs.CL 新提交 90%

Evaluating RAG Metrics in Applied Contexts: An Experiment, Its Findings and Its Limitations

在应用场景中评估RAG指标:一项实验、其发现及局限性

Quentin Brabant

机构 * Orange Research(Orange研究院)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL

AI总结 研究评估RAG指标相关性,基于商业数据问答数据集,用四个库的指标对RAG系统响应等评分,与评估者分数及标准指标比较并分析相关性,指出方法局限,为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19127 2026-07-03 cs.CL 版本更新 90%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17356 2026-06-17 cs.CL 版本更新 90%

PACE-RAG: Patient-Aware Contextual and Evidence-Constrained RAG for Clinical Drug Recommendation

PACE-RAG:面向临床药物推荐的患者感知上下文与证据约束RAG

Chaeyoung Huh, Hyunmin Hwang, Jung Hwan Shin, Sungyang Jo, Jinse Park, Jong Chul Ye

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Department of Neurology, Seoul National University Hospital(首尔国立大学医院神经科) Asan Medical Center, University of Ulsan, College of Medicine(釜山大学医学院阿桑医院) Haeundae Paik Hospital, Inje University(庆尚大学医院海undae医院)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL

AI总结 提出PACE-RAG框架,通过提取患者特定临床特征、检索相关病例并结合当前症状与用药史,实现个性化药物推荐,在帕金森病和MIMIC-IV数据集上取得最优性能。

Comments 32 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28044 2026-05-28 cs.AI 90%

Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

相关并不保证:引用RAG的证据力度校准

Pin Qian, Su Wang, Xiaoyuan Wang, Yihang Chen, Wenxuan Xu, Qiaolin Yu, Shuhuai Lin, Sipeng Zhang, Junxian You, Xinpeng Wei

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Dartmouth College(达特茅斯学院) Cornell University(康奈尔大学) University of California San Diego(加州大学圣地亚哥分校) University of Glasgow(格拉斯哥大学)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.AI

AI总结 针对引用RAG中证据力度不足的问题,提出FORCEBENCH基准测试,通过对比证据校准声明与力度增强变体,评估模型在五个操作轴上的单调性,发现标准支持提示不足以校准证据力度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11330 2026-05-13 cs.AI 90%

Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights

重新思考LLM幻觉检测的评估:一种需求清单,一个新的基于RAG的基准,新的见解

Wenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.AI

AI总结 本文提出了一种基于RAG的新型基准T RIVIA+,填补了现有基准在长上下文和噪声标签方面的空白,并通过实验揭示了当前检测器在RAG基准上的改进空间。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12188 2026-07-15 cs.AI cs.DB cs.IR 新提交 89%

Cost-Governed RAG: Unified Per-Tenant Cost Attribution Across Retrieval and Generation in Multi-Tenant LLM Systems

成本治理的检索增强生成模型:多租户大语言模型系统中跨检索与生成的统一租户成本归因

Navnit Shukla

专题命中 RAG评测 :RAG(title,summary_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI、cs.DB

AI总结 研究多租户大语言模型系统中成本治理问题,提出成本治理的RAG架构,集成TurboVec与治理网关实现统一可观测堆栈,能按租户联合归因成本,准确率高且降低成本,还形式化三层成本模型。

详情

展开后加载摘要…

URL PDF HTML 收藏