arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-08-28 至 2026-08-28 共收录 3 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 3 篇

2608.26385 2026-08-28 cs.CL cs.AI 新提交 89%

Why RAGs Hallucinate: Penalty-Aware Evaluation of Retrieval-Augmented Generation Systems with Knowledge-Gap Canaries

检索增强生成系统为何会产生幻觉:基于知识间隔金丝雀的惩罚感知评估

Alden Do Rosario, Hussein Younes, Felipe Pires

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对RAG系统的幻觉问题,提出惩罚感知评估框架,结合不对称评分、知识间隔金丝雀和失败归因流程,在SimpleQA-Verified数据集上揭示系统差异源于不当作答,而非准确率,相关资源已公开。

Comments 13 pages, 1 figure, 5 tables. Code, full per-request logs, and all judge votes: this https URL (https://github.com/adorosario/why-rags-hallucinate)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26110 2026-08-28 cs.DC cs.AI 新提交 77%

Exploring the Role of LLMs in HPC Programming: A Survey

探索大语言模型(LLM)在高性能计算(HPC)编程中的作用:一项综述

Strahinja Ljaljevic, Josep Jorba, Sergio Iserte

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本综述梳理了LLM在HPC编程五大类任务中的应用,指出通用LLM在串行等任务表现尚可但分布式范式不足,领域专用模型准确率更高但范围狭窄,LLM短期内无法取代HPC专家,将成为软件开发的强大合作者,二者融合是长期共同演化过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26292 2026-08-28 cs.CL cs.AI cs.LG 新提交 62%

On Scope Classification and Current Knowledge-Editing Benchmarks: A Negative Result, with INLAY as a Gradient-Free Case Study

范围分类与当前知识编辑基准:一项负面结果——以INLAY为例的无梯度案例研究

Aditya Pratap Singh

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 该研究指出当前知识编辑基准无法衡量SERAC系列的范围决策,以INLAY为案例验证其结构性缺陷,还披露了INLAY的不足及自身路由机制的两个未影响核心结果的错误。

Comments 12 pages, 5 figures, 6 tables. Code and data: this https URL (https://github.com/Aditya-PS-05/INLAY)

详情

展开后加载摘要…

URL PDF HTML 收藏