arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1212 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1212 篇

2506.01646 2026-03-09 cs.CL cs.AI cs.LG 73%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04452 2026-03-06 cs.CL cs.AI 73%

A unified foundational framework for knowledge injection and evaluation of Large Language Models in Combustion Science

为燃烧科学中的大语言模型知识注入和评估构建统一的基础框架

Zonglin Yang, Runze Mao, Tianhao Wu, Han Li, QingGuo Zhou, Zhi X. Chen

机构 * School of Mechanics and Engineering Science, Peking University(力学与工程科学学院,北京大学) AI for Science Institute(人工智能科学研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一个统一框架,用于开发燃烧科学专用的大语言模型,通过三阶段知识注入路径提升模型性能。

Comments 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02879 2026-03-03 cs.CL cs.AI cs.CY cs.LG 73%

Wikipedia in the Era of LLMs: Evolution and Risks

维基百科在大语言模型时代的演变与风险

Siming Huang, Yuliang Xu, Mingmeng Geng, Yao Wan, Dongping Chen

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型对维基百科的影响,分析了其在文章内容、页面浏览和NLP任务中的作用,指出潜在风险并提出监控框架。

Comments Accepted by TMLR: https://openreview.net/forum?id=ahVmnYkVLt

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12284 2026-02-16 cs.CL cs.AI cs.LG 73%

A Lightweight LLM Framework for Disaster Humanitarian Information Classification

轻量级LLM框架用于灾难人道主义信息分类

Han Jinzhen, Kim Jisung, Yang Jong Soo, Yun Hong Sik

机构 * Department of Civil, Architectural & Environment Engineering, Sungkyunkwan University(苏州市立大学土木、建筑与环境工程系) School of Geography, University of Leeds(利兹大学地理学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出轻量级LLM框架,通过参数高效微调实现灾难推文的人道主义信息分类和事件类型识别,展示LoRA和QLoRA在资源受限环境下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00508 2026-02-10 cs.CL cs.AI 73%

Copy-Paste to Mitigate Large Language Model Hallucinations

通过复制粘贴缓解大语言模型的幻觉

Yongchao Long, Xian Wu, Yingying Zhang, Xianbin Wen, Yuxi Zhou, Shenda Hong

机构 * Department of Computer Science, Tianjin University of Technology(天津理工大学计算机学院) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 通过复制粘贴方法提升大语言模型上下文忠实性,减少幻觉并提高测试性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07164 2026-02-10 cs.CL cs.AI 73%

Your Language Model Secretly Contains Personality Subnetworks

你的语言模型秘密包含个性子网络

Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图兰大学) Northwestern University(西北大学) University of Arizona(亚利桑那大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型内部已嵌入身份子网络,无需外部知识即可实现身份切换和行为调整。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06526 2026-02-09 cs.CL cs.AI 73%

Completing Missing Annotation: Multi-Agent Debate for Accurate and Scalable Relevant Assessment for IR Benchmarks

补全缺失注释:基于多智能体辩论的准确且可扩展的相关性评估框架用于信息检索基准测试

Minjeong Ban, Jeonghwan Choi, Hyangsuk Min, Nicole Hee-Yeon Kim, Minseok Kim, Jae-Gil Lee, Hwanjun Song

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 RAG评测 :RAG(abstract);retriever(abstract);分类 cs.CL、cs.AI

AI总结 DREAM通过多智能体辩论框架提高IR基准测试的相关性评估准确性,减少人力参与,构建BRIDGE基准并揭示缺失相关片段,改进检索器比较。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21969 2026-02-02 cs.CL cs.AI 73%

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

Token-Guard: 通过自检解码实现token级幻觉控制

Yifan Zhu, Huiqiang Rong, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 Token-Guard通过自检解码技术,实现对大型语言模型中token级幻觉的有效控制,提升生成准确性与输出可靠性。

Comments Accepted by ICLR 2026 main conference

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11509 2026-01-22 cs.CL cs.AI 73%

Does Less Hallucination Mean Less Creativity? An Empirical Investigation in LLMs

减少幻觉是否意味着减少创造力?在大语言模型中的实证研究

Mohor Banerjee, Nadya Yuki Wangsajaya, Syed Ali Redha Alsagoff, Min Sen Tan, Zachary Choy Kit Chun, Alvin Chan Guo Wei

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了三种减少幻觉的方法对大语言模型创造力的影响,发现CoVe促进发散思维,DoLa抑制创造力,RAG影响较小,为科学应用中的准确性与创造性平衡提供指导。

Comments Accepted at the AAAI 2026 Workshop on AI for Scientific Research (AI4Research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04492 2026-01-21 cs.CL cs.AI 73%

Learned Hallucination Detection in Black-Box LLMs using Token-level Entropy Production Rate

在黑盒大语言模型中利用令牌级熵产率学习幻觉检测

Charles Moslonka, Hicham Randrianarivo, Arthur Garnier, Emmanuel Malherbe

机构 * Artefact Research Center(艺术研究中心)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于令牌级熵产率的学习方法,用于在黑盒LLM中高效检测幻觉,通过单次生成过程提升问答系统响应的可信度。

Comments 8 pages, 5 figures, 2 tables. pre-print version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06607 2026-01-13 cs.CL cs.AI cs.LG 73%

Pragya: An AI-Based Semantic Recommendation System for Sanskrit Subhasitas

Pragya:一种基于人工智能的印地语Subhasitas语义推荐系统

Tanisha Raorane, Prasenjit Kole

机构 * Department of Computer Engineering Don Bosco Institute of Technology Mumbai, India(计算机工程系 内华大学技术学院 孟买 印度) Department of Mechanical Engineering Don Bosco Institute of Technology Mumbai, India(机械工程系 内华大学技术学院 孟买 印度)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 Pragya通过结合检索与生成技术,为印地语Subhasitas提供语义推荐,提升其在数字时代的可访问性和应用价值。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22533 2026-01-12 cs.CL cs.AI 73%

CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records

CliCARE: 在纵向癌症电子健康记录上基于临床指南 grounding 大型语言模型以支持决策

Dongchen Li, Jitao Liang, Wei Li, Xiaoyu Wang, Longbing Cao, Kun Yu

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 CliCARE 通过将纵向癌症 EHRs 转换为时序知识图谱并结合临床指南,为肿瘤科医生提供证据支持的决策支持。

Comments Accepted in AAAI Conference on Artificial Intelligence (AAAI-26, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03269 2026-01-08 cs.CL cs.AI 73%

The Instruction Gap: LLMs get lost in Following Instruction

指令鸿沟:LLMs在遵循指令时迷失

Vishesh Tripathi, Uday Allu, Biddwan Ahmed

机构 * Vishesh Tripathi Uday Allu Biddwan Ahmed

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了LLMs在企业部署中遵循指令的不足,通过评估13种模型发现Claude-Sonnet-4和GPT-5表现最佳,指出指令遵循能力的鸿沟及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03860 2026-01-06 cs.CL cs.AI cs.LG 73%

Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models

幻觉与事实:大型语言模型中事实核查与事实性评估的综述

Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba, Md. Abdur Rahman, Sadia Sultana Chowa, Mohaimenul Azam Khan Raiaan, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16893 2026-01-05 cs.CL cs.AI 73%

From Transformers to LLMs: A Systematic Survey of Efficiency Considerations in NLP

从Transformer到LLM:NLP中基于效率考虑的系统性综述

Wazib Ansar, Saptarsi Goswami, Amlan Chakrabarti

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了NLP中基于Transformer的LLM在效率方面的研究,探讨了数据整理、模型设计等多方面效率提升方法,并评估了多个知名NLP模型的效率和有效性。

Comments 63 pages, 5 tables and 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24848 2026-01-01 cs.CL cs.AI 73%

PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI

PrivacyBench: 一个用于评估个性化AI隐私的对话基准

Srija Mukhopadhyay, Sathwik Reddy, Shruthi Muthukumar, Jisun An, Ponnurangam Kumaraguru

机构 * International Institute of Information Technology Hyderabad(国际信息科技研究所(海得拉巴)) Indiana University(印第安纳大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 PrivacyBench通过多轮对话评估揭示RAG助手在隐私保护上的缺陷,指出需结构性隐私保障措施以确保伦理网络环境。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23397 2025-12-01 cs.CL cs.AI cs.MA 73%

MegaChat: A Synthetic Persian Q&A Dataset for High-Quality Sales Chatbot Evaluation

MegaChat: 一个用于高质量销售聊天机器人评估的合成波斯语问答数据集

Mahdi Rahmani, AmirHossein Saffari, Reyhane Rahmani

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 MegaChat通过自动化多代理架构生成高质量波斯语问答数据,用于评估销售聊天机器人,优于传统RAG模型。

Comments 6 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06073 2025-11-11 cs.CL cs.AI cs.LG cs.LO 73%

Stemming Hallucination in Language Models Using a Licensing Oracle

Simeon Emanuilov, Richard Ackermann

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 23 pages, 4 figures, 8 tables. Introduces the Licensing Oracle, an architectural solution for eliminating hallucinations in language models through formal SHACL validation against knowledge graphs. All datasets and models are available at https://huggingface.co/collections/s-emanuilov/licensing-oracle-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02119 2025-11-05 cs.AI cs.CL 73%

InsurAgent: A Large Language Model-Empowered Agent for Simulating Individual Behavior in Purchasing Flood Insurance

Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) Hunan University(湖南大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Lehigh University(莱斯大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16724 2025-10-29 cs.AI cs.CL 73%

A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications

Minhua Lin, Zongyu Wu, Zhichao Xu, Hui Liu, Xianfeng Tang, Qi He, Charu Aggarwal, Hui Liu, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) The University of Utah(犹他大学) Amazon(亚马逊) Microsoft(微软) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) Michigan State University(密歇根州立大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 38 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21440 2025-10-27 cs.CL cs.IR 73%

Redefining Retrieval Evaluation in the Era of LLMs

Giovanni Trappolini, Florin Cuconasu, Simone Filice, Yoelle Maarek, Fabrizio Silvestri

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) Technology Innovation Institute(技术创新研究所)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09933 2025-10-24 cs.AI cs.CL cs.LG 73%

MIR-Bench: Can Your LLM Recognize Complicated Patterns via Many-Shot In-Context Reasoning?

Kai Yan, Zhan Ling, Kang Liu, Yifan Yang, Ting-Han Fan, Lingfeng Shen, Zhengyin Du, Jiecao Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 39 pages, 11 figures. The paper is accepted at NeurIPS 2025 Datasets & Benchmarks Track, and the latest version adds modifications in camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03931 2025-10-23 cs.CL cs.AI 73%

NAACL2025 Tutorial: Adaptation of Large Language Models

Zixuan Ke, Yifei Ming, Shafiq Joty

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments NAACL2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17924 2025-10-22 cs.CL cs.AI 73%

Efficient Toxicity Detection in Gaming Chats: A Comparative Study of Embeddings, Fine-Tuned Transformers and LLMs

Yehor Tereshchenko, Mika Hämäläinen

机构 * Metropolia University of Applied Sciences(Metropolia应用科学大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments Published in the Journal of Data Mining & Digital Humanities (JDMDH), special issue NLP4DH

Journal ref Journal of Data Mining & Digital Humanities, NLP4DH, October 14, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09738 2025-10-14 cs.CL cs.AI 73%

Judge's Verdict: A Comprehensive Analysis of LLM Judge Capability Through Human Agreement

Steve Han, Gilberto Titericz Junior, Tom Balough, Wenfei Zhou

机构 * NVIDIA Corporation(NVIDIA公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 1 figure, 4 tables, under review as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05957 2025-10-10 cs.AI cs.CL 73%

AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents

Jiabin Tang, Tianyu Fan, Chao Huang

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/HKUDS/AutoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02653 2025-10-06 cs.AI cs.IR 73%

Geolog-IA: Conversational System for Academic Theses

Micaela Fuel Pozo, Andrea Guatumillo Saltos, Yeseña Tipan Llumiquinga, Kelly Lascano Aguirre, Marilyn Castillo Jara, Christian Mejia-Escobar

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

Comments 17 pages, in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02347 2025-10-06 cs.CL cs.AI 73%

Small Language Models for Curriculum-based Guidance

Konstantinos Katharakis, Sippo Rossi, Raghava Rao Mukkamala

机构 * Copenhagen Business School(哥本哈根商学院) Hanken School of Economics(汉肯经济学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21188 2025-09-26 cs.HC cs.AI cs.CY cs.IR 73%

Adoption, usability and perceived clinical value of a UK AI clinical reference platform (iatroX): a mixed-methods formative evaluation of real-world usage and a 1,223-respondent user survey

Kolawole Tytler

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13978 2025-09-24 cs.DC cs.AI cs.DB 73%

LLM Agents for Interactive Workflow Provenance: Reference Architecture and Evaluation Methodology

Renan Souza, Timothy Poteet, Brian Etz, Daniel Rosendo, Amal Gueroudji, Woong Shin, Prasanna Balaprakash, Rafael Ferreira da Silva

机构 * Oak Ridge National Lab.(橡树岭国家实验室) Argonne National Lab.(阿贡国家实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI、cs.DB

Comments Paper accepted in the proceedings of the Supercomputing Conference (SC). Cite it as Renan Souza, Timothy Poteet, Brian Etz, Daniel Rosendo, Amal Gueroudji, Woong Shin, Prasanna Balaprakash, and Rafael Ferreira da Silva. LLM Agents for Interactive Workflow Provenance: Reference Architecture and Evaluation Methodology. In WORKS at the ACM/IEEE International Conference on Supercomputing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏