arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-08-27 至 2026-08-27 共收录 6 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 知识库问答 6 篇

2608.25717 2026-08-27 cs.CL cs.AI 新提交 91%

When RAG Fails to Equalize: Geo-bias in Factual Question Answering over Public Companies

当检索增强生成(RAG)无法实现均衡:上市公司事实问答中的地理偏差

Abhinav Havaldar, Enrico Santus

机构 * Bloomberg(彭博公司)

专题命中 知识库问答 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对上市公司事实问答场景,构建含约2000家公司的基准,评估六个LLM在四种条件下的表现,发现RAG无法消除地理偏差,更大模型也无法消除结构性影响,挑战了RAG作为通用纠正手段的观点。

Comments 10 pages, COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04711 2026-08-27 cs.IR cs.AI 版本更新 91%

Addressing Corpus Knowledge Poisoning Attacks on RAG Using Sparse Attention

通过稀疏注意力缓解RAG中的语料知识污染攻击

Sagie Dekel, Moshe Tennenholtz, Oren Kurland

机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology, Haifa, Israel(数据与决策科学学院,技术Ion-以色列理工学院,海法,以色列)

专题命中 知识库问答 :RAG(title,title_cn);retrieval augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本文提出SDAG方法,通过稀疏注意力机制有效防御RAG中的语料知识污染攻击,显著提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-08-27 cs.IR cs.AI cs.CL cs.MA 版本更新 90%

Corpus2Skill: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 知识库问答 :RAG(title,title_cn);retrieval-augmented generation(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25123 2026-08-27 cs.CL cs.AI 新提交 90%

SelfGraphRAG: Bridging the Supervision Gap in Graph-Based RAG with Synthetic QA Generation

SelfGraphRAG:通过合成问答对弥合基于图的检索增强生成(RAG)中的监督缺口

Ben Lagnese, Manas Gaur

机构 * University of Maryland, Baltimore County (UMBC)(马里兰大学巴尔的摩县分校)

专题命中 知识库问答 :RAG(title,title_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.CL、cs.AI

AI总结 SelfGraphRAG框架通过从知识图谱结构生成问答对训练查询条件图检索器,解决新建图谱缺乏标注数据的问题,在多跳问答等任务中提升了检索与推理性能。

Comments 16 pages, 2 figures. Based on M.S. thesis work. Thesis available at this https URL (https://www.proquest.com/docview/3350071346). Under review. Code available upon request from manas@umbc.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25721 2026-08-27 cs.CR cs.CL cs.IR 版本更新 79%

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

通过令牌影响归因追踪中毒检索语料库中的目标答案

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学) IBM Research(IBM研究院) Hon Hai Research Institute(宏海研究院)

专题命中 知识库问答 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 提出TRACE框架,通过令牌影响归因识别检索增强生成系统中的语料投毒攻击,无需额外分类器或LLM验证,在三个QA基准和六个LLM上验证了有效性。

Comments This paper has been accepted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25655 2026-08-27 cs.CL cs.AI 新提交 73%

Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context

重构正确的会话片段:超越长上下文的交错式对话记忆评估

Zhexi Feng, Ruiyi Zhang, Yongbo Yang, Pengtao Xie

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 知识库问答 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对混合主题长对话的记忆难题,研究人员构建了SCALE-QA基准,并提出TSIM方法,在三类LLM后端上均比最强基线提升5.6-17.6个准确率点,实现最优表现。

Comments 19 pages, 6 figures, 30 tables. Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏