arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-02-10 至 2026-02-10 共收录 5 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 5 篇

2507.05713 2026-02-10 cs.CL cs.AI 81%

DRAGOn: Designing RAG On Periodically Updated Corpus

DRAGOn:设计一个定期更新语料库的RAG基准测试

Fedor Chernogorskii, Sergei Averkiev, Liliya Kudraleeva, Zaven Martirosian, Maria Tikhonova, Valentin Malykh, Alena Fenogenova

机构 * SberAI MBZUAI ITMO MISIS HSE University(俄罗斯高等经济大学) MWS AI IITU(俄罗斯联邦信息技术大学) YSDA

专题命中 RAG评测 :RAG(title,abstract);分类 cs.CL、cs.AI

AI总结 DRAGOn通过定期更新的语料库设计RAG基准测试,提供自动问题生成和评估流程,减少数据泄漏并促进社区参与。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00508 2026-02-10 cs.CL cs.AI 73%

Copy-Paste to Mitigate Large Language Model Hallucinations

通过复制粘贴缓解大语言模型的幻觉

Yongchao Long, Xian Wu, Yingying Zhang, Xianbin Wen, Yuxi Zhou, Shenda Hong

机构 * Department of Computer Science, Tianjin University of Technology(天津理工大学计算机学院) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 通过复制粘贴方法提升大语言模型上下文忠实性,减少幻觉并提高测试性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07164 2026-02-10 cs.CL cs.AI 73%

Your Language Model Secretly Contains Personality Subnetworks

你的语言模型秘密包含个性子网络

Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图兰大学) Northwestern University(西北大学) University of Arizona(亚利桑那大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型内部已嵌入身份子网络,无需外部知识即可实现身份切换和行为调整。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04982 2026-02-10 cs.CL 70%

BioACE: An Automated Framework for Biomedical Answer and Citation Evaluations

BioACE: 一种用于生物医学答案和引用评估的自动化框架

Deepak Gupta, Davis Bartels, Dina Demner-Fushman

机构 * Division of Intramural Research(院内研究部) National Library of Medicine(国家医学图书馆)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 BioACE提出了一种自动化框架,用于评估生物医学答案和引用的质量,通过多方面指标和实验分析,提供最佳的评估方法。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08070 2026-02-10 cs.IR 57%

IRB: Automated Generation of Robust Factuality Benchmarks

IRB: 自动生成鲁棒事实性基准

Lam Thanh Do, Bhagyashree Taleka, Hozaifa Ammar Bhutta, Vikram Sharma Mailthody, Kevin Chen-Chuan Chang, Wen-mei Hwu

专题命中 RAG评测 :RAG(abstract);分类 cs.IR

AI总结 IRB通过自动生成鲁棒事实性基准,评估RAG系统事实性,发现前沿LLM在闭书设置中面临挑战,推理LLM更可靠,改进检索组件更有效。

Comments Code: https://github.com/Hozaifa-Bhutta/IRB

详情

展开后加载摘要…

URL PDF HTML 收藏