arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2507.22911 2026-02-02 cs.CL cs.AI 62%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20276 2026-01-29 cs.CL cs.AI 62%

Beyond the Needle's Illusion: Decoupled Evaluation of Evidence Access and Use under Semantic Interference at 326M-Token Scale

超越针的错觉:在32600万token规模下解耦证据访问和使用下的语义干扰评估

Tianwei Lin, Zuyi Zhou, Xinda Zhao, Chenke Wang, Xiaohong Li, Yu Chen, Chuanrui Hu, Jian Pei, Yafeng Deng

机构 * EverMind Shanda Group(Shanda集团) Duke University(杜克大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMB-S基准,用于评估长上下文模型在大规模语义干扰下的证据访问与使用能力,揭示语义辨别是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09723 2026-01-16 cs.CL cs.AI 62%

SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels

SagaScale: 一种真实、可扩展且高质量的长上下文基准,基于完整小说构建

Guancheng Du, Yong Hu, Wenqing Wang, Yaming Yang, Jiaheng Gao

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 SagaScale基于完整小说构建,提供长上下文基准,通过自动化数据收集管道,评估12个LLMs和三种方法,揭示LLM在长上下文处理中的表现差异及Agentic RAG的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07226 2026-01-13 cs.AI cs.CL 62%

Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

陷入噪声中:推理模型在上下文干扰中的失败

Seongyun Lee, Yongrae Jo, Minju Seo, Moontae Lee, Minjoon Seo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RARE方法,通过激励识别噪声中的有用信息,提升模型在上下文干扰下的鲁棒性,揭示增加计算量反而导致噪声环境下性能下降的反比例趋势。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04770 2026-01-13 cs.AI cs.DB 62%

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

SciIF: 科学指令遵循基准测试以实现严谨的科学智能

Encheng Su, Jianyu Wu, Chen Tang, Lintao Wang, Pengze Li, Aoran Wang, Jinouwen Zhang, Yizhou Wang, Yuan Meng, Xinzhu Ma, Shixiang Tang, Houqiang Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Fudan University(复旦大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI、cs.DB

AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10662 2026-01-13 cs.CL cs.AI 62%

Evaluation of the Automated Labeling Method for Taxonomic Nomenclature Through Prompt-Optimized Large Language Model

通过提示优化的大型语言模型评估自动标注方法在分类学命名中的应用

Keito Inoshita, Kota Nojiri, Haruto Sugeno, Takumi Taga

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示优化的大型语言模型评估了自动标注方法在分类学命名中的可行性,发现其在形态、地理和人名类别中表现良好,但在生态与行为及文化背景类别中存在挑战。

Comments This paper was accepted by IEEE IAICT

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18565 2026-01-01 cs.CL cs.AI 62%

Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation

Bielik 7B v0.1:波兰语言模型——开发、见解与评估

Krzysztof Ociepa, Łukasz Flis, Krzysztof Wróbel, Adrian Gwoździej, Remigiusz Kinas

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 7B v0.1通过创新技术提升波兰语处理能力,实现多项NLP任务性能提升,为语言AI发展提供新基准。

Journal ref Computer Science 26(4) (2025) 131-161

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20949 2025-12-25 cs.CL cs.AI 62%

Neural Probe-Based Hallucination Detection for Large Language Models

基于神经探针的大型语言模型幻觉检测

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于神经网络的token级幻觉检测框架,通过冻结语言模型参数并使用MLP探针进行非线性建模,结合多目标损失函数和贝叶斯优化,实现对LLMs幻觉内容的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18749 2025-11-25 cs.CL cs.CY cs.IR 62%

Large Language Models Require Curated Context for Reliable Political Fact-Checking -- Even with Reasoning and Web Search

大语言模型需要经过筛选的上下文才能可靠地进行政治事实核查——即使有推理和网络搜索

Matthew R. DeVerna, Kai-Cheng Yang, Harry Yaojun Yan, Filippo Menczer

专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.CL

AI总结 大语言模型需通过筛选的上下文提升政治事实核查的可靠性,定制RAG系统显著提升宏F1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19843 2025-11-18 cs.CR cs.AI cs.CL 62%

SoK: Large Language Model Copyright Auditing via Fingerprinting

Shuo Shao, Yiming Li, Yu He, Hongwei Yao, Wenyuan Yang, Dacheng Tao, Zhan Qin

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Sun Yat-Sen University(中山大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26457 2025-10-31 cs.SE cs.AI cs.CL 62%

SecureReviewer: Enhancing Large Language Models for Secure Code Review through Secure-aware Fine-tuning

Fang Liu, Simiao Liu, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * 1 State Key Laboratory of Complex \& Critical Software Environment, School of Computer Science Engineering, Beihang University, China

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

Comments Accepted by ICSE 2026. Code and data: https://github.com/SIMIAO515/SecureReviewer

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10390 2025-10-14 cs.CL cs.AI cs.LG 62%

RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models

Aashiq Muhamed, Leonardo F. R. Ribeiro, Markus Dreyer, Virginia Smith, Mona T. Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01259 2025-10-03 cs.CL cs.AI cs.CR 62%

In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b

Nils Durner

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

Comments 27 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01237 2025-10-03 cs.CL cs.AI 62%

Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation

Nandakishor M

机构 * AI Safety Research(人工智能安全研究) Convai Innovations(Convai创新)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09598 2025-09-30 cs.CL cs.AI cs.CY 62%

How to Protect Yourself from 5G Radiation? Investigating LLM Responses to Implicit Misinformation

Ruohao Guo, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22658 2025-09-30 cs.IR cs.AI 62%

How good are LLMs at Retrieving Documents in a Specific Domain?

Nafis Tanveer Islam, Zhiming Zhao

机构 * MultiScale Networked Systems (MNS) University of Amsterdam, Netherlands, University of Amsterdam, Netherlands(多尺度网络化系统(MNS)阿姆斯特丹大学,荷兰,阿姆斯特丹大学,荷兰)

专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.AI

Comments Accepted at FAIEMA Conference 2025. DOI will be provided once the conference publishes the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13144 2025-09-29 cs.CL cs.AI 62%

DialSim: A Dialogue Simulator for Evaluating Long-Term Multi-Party Dialogue Understanding of Conversational Agents

Jiho Kim, Woosog Chay, Hyeonji Hwang, Daeun Kyung, Hyunseung Chung, Eunbyeol Cho, Yeonsu Kwon, Yohan Jo, Edward Choi

机构 * KAIST(韩国科学技术院) SNU(釜山大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11507 2025-09-26 cs.AI cs.CL 62%

TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains

Wanying Wang, Zeyu Ma, Xuhong Wang, Yangchun Zhang, Pengfei Liu, Mingang Chen

机构 * Shanghai Key Laboratory of Computer Software Testing and Evaluating, Shanghai Development Center of Computer Software Technology(上海软件测试与评估关键实验室、上海计算机软件技术发展中心) Shanghai Normal University(上海师范大学) Shanghai Artificial Intelligence Lab(上海人工智能实验室) Shanghai University(上海大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

Comments Wang et al. Copyright 2026 lEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, including reprinting/republishing, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work. DOI will be added upon IEEE Xplore publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12621 2025-09-25 cs.CL cs.IR 62%

SAFE: Improving LLM Systems using Sentence-Level In-generation Attribution

João Eduardo Batista, Emil Vatai, Mohamed Wahib

机构 * RIKEN-CCS Kobe, Japan(日本神户RIKEN-CCS)

专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.CL

Comments 30 pages (9 pages of content, 5 pages of references, 16 pages of supplementary material), 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04410 2025-09-23 cs.AI cond-mat.mtrl-sci cs.CL 62%

Matter-of-Fact: A Benchmark for Verifying the Feasibility of Literature-Supported Claims in Materials Science

Peter Jansen, Samiah Hassan, Ruoyao Wang

机构 * University of Arizona(亚利桑那大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构)

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL、cs.AI

Comments 9 pages (Accepted to EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09848 2025-08-15 cs.CL cs.AI 62%

PRELUDE: A Benchmark Designed to Require Global Comprehension and Reasoning over Long Contexts

Mo Yu, Tsz Ting Chung, Chulun Zhou, Tong Li, Rui Lu, Jiangnan Li, Liyan Xu, Haoshu Lu, Ning Zhang, Jing Li, Jie Zhou

机构 * WeChat AI, Tencent(腾讯微信AI)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

Comments First 7 authors contributed equally. Project page: https://gorov.github.io/prelude

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08942 2025-08-13 cs.CL cs.IR 62%

Jointly Generating and Attributing Answers using Logits of Document-Identifier Tokens

Lucas Albarede, Jose Moreno, Lynda Tamine, Luce Lefeuvre

机构 * Dir. Technologies Innovation, SNCF(技术创新部,法国国家铁路公司)

专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06729 2025-08-12 cs.CL cs.AI 62%

Large Language Models for Oral History Understanding with Text Classification and Sentiment Analysis

Komala Subramanyam Cherukuri, Pranav Abishai Moses, Aisa Sakata, Jiangping Chen, Haihua Chen

机构 * University of North Texas(北卡罗来纳州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06600 2025-08-12 cs.CL cs.IR 62%

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent

Zijian Chen, Xueguang Ma, Shengyao Zhuang, Ping Nie, Kai Zou, Andrew Liu, Joshua Green, Kshama Patel, Ruoxi Meng, Mingyi Su, Sahel Sharifymoghaddam, Yanxi Li, Haoran Hong, Xinyu Shi, Xuye Liu, Nandan Thakur, Crystina Zhang, Luyu Gao, Wenhu Chen, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) CSIRO(澳大利亚联邦科学与工业研究组织) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) The University of Queensland(昆士兰大学)

专题命中 RAG评测 :retriever(abstract);分类 cs.IR、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22915 2025-08-01 cs.CL cs.AI 62%

Theoretical Foundations and Mitigation of Hallucination in Large Language Models

Esmail Gumaan

机构 * Department of Computer Science, University of Sana'a(桑加大学计算机科学系)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14651 2025-07-29 cs.CL cs.AI 62%

Real-time Factuality Assessment from Adversarial Feedback

Sanxing Chen, Yukun Huang, Bhuwan Dhingra

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18392 2025-07-25 cs.CL cs.AI cs.LG 62%

CLEAR: Error Analysis via LLM-as-a-Judge Made Easy

Asaf Yehudai, Lilach Eden, Yotam Perlitz, Roy Bar-Haim, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) The Hebrew University of Jerusalem(特拉维夫大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22486 2025-07-01 cs.CL cs.AI 62%

Hallucination Detection with Small Language Models

Ming Cheung

机构 * dBeta Labs, The Lane Crawford Joyce Group(dBeta实验室,Lane Crawford Joyce集团)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

Journal ref Hallucination Detection with Small Language Models, IEEE International Conference on Data Engineering (ICDE), Workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01344 2025-06-30 cs.AI cs.CL 62%

Pairing Analogy-Augmented Generation with Procedural Memory for Procedural Q&A

K Roth, Rushil Gupta, Simon Halle, Bang Liu

机构 * Université de Montréal & Mila(蒙特利尔大学及Mila) Thales Canada(加拿大泰雷兹公司) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19175 2025-06-16 cs.CL cs.AI 62%

MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential Diagnosis

Daniel Rose, Chia-Chien Hung, Marco Lepri, Israa Alqassem, Kiril Gashteovski, Carolin Lawrence

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏