arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-01-21 至 2026-01-21 共收录 5 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 5 篇

2502.16101 2026-01-21 cs.AI cs.IR 84%

Worse than Zero-shot? A Fact-Checking Dataset for Evaluating the Robustness of RAG Against Misleading Retrievals

比零样本更差?一个评估RAG在误导检索中鲁棒性的事实核查数据集

Linda Zeng, Rithwik Gupta, Divij Motwani, Yi Zhang, Diji Yang

机构 * The Harker School(哈克尔学校) Irvington High School(艾尔文顿高中) Palo Alto High School(帕洛阿尔托高中) University of California Santa Cruz(加州大学圣克鲁兹分校)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 RAGuard是首个评估RAG系统在误导检索中鲁棒性的基准,揭示LLM在面对误导信息时的表现劣于零样本基线。

Comments Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20136 2026-01-21 cs.CL cs.AI cs.IR 82%

Multi-Stage Verification-Centric Framework for Mitigating Hallucination in Multi-Modal RAG

多阶段验证导向框架用于缓解多模态RAG中的幻觉

Baiyu Chen, Wilson Wongso, Xiaoqian Hu, Yue Tan, Flora Salim

机构 * The University of New South Wales(新南威尔士大学)

专题命中 RAG评测 :RAG(title,abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出了一种多阶段验证导向框架,通过优先考虑事实准确性和真实性来缓解多模态RAG中的幻觉问题,并在KDD Cup 2025中取得第三名。

Comments KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04492 2026-01-21 cs.CL cs.AI 73%

Learned Hallucination Detection in Black-Box LLMs using Token-level Entropy Production Rate

在黑盒大语言模型中利用令牌级熵产率学习幻觉检测

Charles Moslonka, Hicham Randrianarivo, Arthur Garnier, Emmanuel Malherbe

机构 * Artefact Research Center(艺术研究中心)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于令牌级熵产率的学习方法,用于在黑盒LLM中高效检测幻觉,通过单次生成过程提升问答系统响应的可信度。

Comments 8 pages, 5 figures, 2 tables. pre-print version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12974 2026-01-21 cs.CL 70%

Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios

通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟

Hongyang Ma, Tiantian Gu, Huaiyuan Sun, Huilin Zhu, Yongxin Wang, Jie Li, Wubin Sun, Zeliang Lian, Yinghong Zhou, Yi Gao, Shirui Wang, Zhihui Tang

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12921 2026-01-21 cs.CL 70%

Injecting Knowledge from Social Science Journals to Improve Indonesian Cultural Understanding by LLMs

通过社会科学期刊注入知识以提升LLMs对印度尼西亚文化的理解

Adimulya Kartiyasa, Bao Gia Cao, Boyang Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本研究通过构建IndoSoSci数据集,利用检索增强生成方法将印度尼西亚文化知识注入LLMs,提升其对印度尼西亚文化的理解能力,并在基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏