arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1212 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1212 篇

2512.05430 2026-02-17 cs.CL cs.AI cs.IR cs.LG 75%

ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering

ArtistMus: 一个全球多样、以艺术家为中心的基准,用于检索增强的音乐问答

Daeyong Kwon, SeungHeon Doh, Juhan Nam

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 ArtistMus提出一个全球多样、以艺术家为中心的基准,通过检索增强生成技术提升音乐问答的准确性和上下文推理能力。

Comments Accepted to LREC 2026. This work is an evolution of our earlier preprint arXiv:2507.23334

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00010 2026-02-03 cs.IR cs.AI cs.CL 75%

ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking

ChunkNorris: 一种高性能且低能耗的PDF解析与分块方法

Mathieu Ciancone, Clovis Varangot-Reille, Marion Schaeffer

机构 * Wikit Laboratoire Hubert Curien(Hubert Curien实验室) Université Jean Monnet(Jean Monnet大学) INSA Rouen Normandie(Rouen Normandie国立理工学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 ChunkNorris通过高效启发式方法实现PDF解析与分块的高性能低能耗,优于现有技术,适用于资源受限的检索增强生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05256 2026-01-12 cs.AI cs.CL cs.CV cs.IR 75%

Naiad: Novel Agentic Intelligent Autonomous System for Inland Water Monitoring

Naiad:一种新型智能自主系统用于内陆水体监测

Eirini Baltzi, Tilemachos Moumouris, Athena Psalta, Vasileios Tsironis, Konstantinos Karantzalos

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16106 2025-12-19 cs.DB cs.AI cs.IR 75%

ModelTables: A Corpus of Tables about Models

ModelTables: 一个关于模型的表格语料库

Zhengyuan Dong, Victor Zhong, Renée J. Miller

机构 * University of Waterloo(滑铁卢大学) University Waterloo(滑铁卢大学)

专题命中 RAG评测 :dense retrieval(abstract);hybrid retrieval(abstract);分类 cs.IR、cs.AI、cs.DB

AI总结 ModelTables是一个大规模结构化数据基准,用于评估模型和表格的相关性,通过表格搜索展示了改进语义检索和结构化知识组织的潜力。

Comments 14 pages, 8 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06125 2025-11-11 cs.CL cs.AI cs.IR 75%

Evaluation of retrieval-based QA on QUEST-LOFT

Nathan Scales, Nathanael Schärli, Olivier Bousquet

机构 * Google DeepMind(谷歌DeepMind)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11310 2025-08-18 cs.CL cs.AI cs.IR 75%

SGSimEval: A Comprehensive Multifaceted and Similarity-Enhanced Benchmark for Automatic Survey Generation Systems

Beichen Guo, Zhiyuan Wen, Yu Yang, Peng Gao, Ruosong Yang, Jiaxing Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) China Mobile (Hong Kong) Innovation and Research Institute(中国移动(香港)创新与研究院) Lingnan University(岭南大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted to The 21st International Conference on Advanced Data Mining and Applications (ADMA2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07179 2025-08-12 cs.CL cs.AI cs.DB 75%

Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks

Jiaqi Yin, Yi-Wei Chen, Meng-Lung Lee, Xiya Liu

机构 * Microsoft Redmond, WA(微软红木城) Antra. Inc.(Antra公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI、cs.DB

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15737 2025-06-05 cs.CL cs.AI cs.IR 75%

Who's Who: Large Language Models Meet Knowledge Conflicts in Practice

Quang Hieu Pham, Hoang Ngo, Anh Tuan Luu, Dat Quoc Nguyen

机构 * VinAI Research(VinAI研究院) Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14567 2025-05-06 cs.CL cs.AI cs.IR 75%

ELOQ: Resources for Enhancing LLM Detection of Out-of-Scope Questions

Zhiyuan Peng, Jinming Nian, Alexandre Evfimievski, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) Adobe Inc.(Adobe公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted by SIGIR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14258 2025-05-01 cs.CL cs.AI cs.IR 75%

JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System

Weihang Su, Baoqing Yue, Qingyao Ai, Yiran Hu, Jiaqi Li, Changyue Wang, Kaiyuan Zhang, Yueyue Wu, Yiqun Liu

机构 * DCST, Tsinghua University(清华大学数据科学研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02228 2025-04-14 cs.CL cs.AI cs.IR 75%

Attribution in Scientific Literature: New Benchmark and Methods

Yash Saxena, Deepa Tilwani, Ali Mohammadi, Edward Raff, Amit Sheth, Srinivasan Parthasarathy, Manas Gaur

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21315 2025-03-28 cs.LG cs.CR 75%

Tricking Retrievers with Influential Tokens: An Efficient Black-Box Corpus Poisoning Attack

Cheng Wang, Yiwei Wang, Yujun Cai, Bryan Hooi

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);retriever(abstract)

Comments Accepted to NAACL 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15280 2024-12-23 cs.CL cs.AI cs.IR 75%

Context-DPO: Aligning Language Models for Context-Faithfulness

Baolong Bi, Shaohan Huang, Yiwei Wang, Tianchi Yang, Zihan Zhang, Haizhen Huang, Lingrui Mei, Junfeng Fang, Zehao Li, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang, Shenghua Liu

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10878 2024-11-19 cs.CL cs.AI cs.IR 75%

Empowering Meta-Analysis: Leveraging Large Language Models for Scientific Synthesis

Jawad Ibn Ahad, Rafeed Mohammad Sultan, Abraham Kaikobad, Fuad Rahman, Mohammad Ruhul Amin, Nabeel Mohammed, Shafin Rahman

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted in 2024 IEEE International Conference on Big Data (IEEE BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06805 2024-11-12 cs.CL cs.AI cs.IR 75%

AssistRAG: Boosting the Potential of Large Language Models with an Intelligent Information Assistant

Yujia Zhou, Zheng Liu, Zhicheng Dou

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted by NeurIPS 2024 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11217 2024-10-16 cs.CL cs.AI cs.IR 75%

On the Capacity of Citation Generation by Large Language Models

Haosheng Qian, Yixing Fan, Ruqing Zhang, Jiafeng Guo

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted by CCIR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15337 2024-09-25 cs.IR cs.AI cs.CL 75%

Revisiting the Solution of Meta KDD Cup 2024: CRAG

Jie Ouyang, Yucong Luo, Mingyue Cheng, Daoyu Wang, Shuo Yu, Qi Liu, Enhong Chen

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14516 2024-09-24 cs.AI cs.CL cs.IR 75%

Beyond Words: Evaluating Large Language Models in Transportation Planning

Shaowei Ying, Zhenlong Li, Manzhu Yu

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02028 2024-07-03 cs.CL cs.AI cs.IR cs.LG 75%

Why does in-context learning fail sometimes? Evaluating in-context learning on open and closed questions

Xiang Li, Haoran Tang, Siyu Chen, Ziwei Wang, Ryan Chen, Marcin Abram

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 8 pages plus references, 4 main figures, 6 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02474 2024-04-04 cs.CL cs.AI cs.IR cs.LG 75%

uTeBC-NLP at SemEval-2024 Task 9: Can LLMs be Lateral Thinkers?

Pouya Sadeghi, Amirhossein Abaskohi, Yadollah Yaghoobzadeh

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 12 pages, 5 figures, 6 tables, Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024) @ NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08479 2024-09-23 cs.IR cs.AI 74%

Exploring Information Retrieval Landscapes: An Investigation of a Novel Evaluation Techniques and Comparative Document Splitting Methods

Esmaeil Narimissa, David Raithel

专题命中 RAG评测 :RAG(abstract,comments);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

Comments This article is 16 pages long and includes detailed comparisons of RAG systems and document splitting techniques

Journal ref Access-2024-36001

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05980 2026-03-09 cs.AI 74%

An Interactive Multi-Agent System for Evaluation of New Product Concepts

一个用于新产品概念评估的交互式多智能体系统

Bin Xuan, Ruo Ai, Hakyeon Lee

专题命中 RAG评测 :retrieval-augmented generation(abstract,comments);RAG(abstract,comments);分类 cs.AI

AI总结 本文提出基于大型语言模型的多智能体系统,用于自动化评估新产品概念的技术可行性和市场可行性,通过结构化讨论和专业数据微调,验证概念并提升判断准确性。

Comments 46 pages, 3 figures + This paper proposes an LLM-based multi-agent system (MAS) for automated evaluation of new product concepts, incorporating retrieval-augmented generation (RAG) and cross-functional virtual agents to assess technical and market feasibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18004 2024-12-25 cs.CL 74%

Correctness is not Faithfulness in RAG Attributions

Jonas Wallat, Maria Heuss, Maarten de Rijke, Avishek Anand

专题命中 RAG评测 :RAG(title);分类 cs.CL

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15436 2026-08-20 cs.IR cs.CV cs.DB cs.DC cs.DS 版本更新 73%

PLASMA: A Layout-Aware Benchmark Reveals Memory Layout Matters for Graph-based ANNS on GPU

PLASMA:揭示GPU上基于图的近似最近邻搜索中内存布局重要性的布局感知基准

Yutaro Oguri, Mai Nishimura, Yusuke Matsui

机构 * The University of Tokyo(东京大学) OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.DB

AI总结 研究人员提出PLASMA框架,用于评估GPU上基于图的ANNS,发现顶点重排序可提升QPS且不损失准确率,凸显内存布局对该任务的重要性。

Comments Accepted to VLDB2026 VecDB Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14588 2026-08-18 cs.AI cs.CL cs.MA 新提交 73%

The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines

幻觉滚雪球:将多智能体大语言模型流水线中的错误传播建模为状态转移

Prabhjot Singh, Bhushan Pawar

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究发现多智能体LLM流水线中存在幻觉滚雪球效应,即幻觉会随状态转移而逃逸,且边界门控验证比末端检查更能有效降低幻觉存活率,还提出了最优验证资源分配策略。

Comments 10 pages, 3 figures; accepted at the FAGEN Workshop (Failure Modes in Agentic AI), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14320 2026-08-17 cs.AI cs.CL 新提交 73%

AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs

AnchorBench:针对大语言模型中锚定效应的多路径基准测试

Yiderigun Borjigin, Alexander Hermann, Christian Cyron, Roland Aydin

机构 * Saarland University(萨尔大学) Hamburg University of Technology(汉堡工业大学) Helmholtz-Zentrum Hereon(亥姆霍兹中心赫伦) German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文推出针对大语言模型锚定效应的基准测试AnchorBench,经14种模型实验,揭示锚定效应的路径依赖性等特性,发现高控制准确率的前沿模型仍易受合理锚点影响。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10385 2026-08-12 cs.IR cs.AI 新提交 73%

Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具

Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie, Gianluca Demartini

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02613 2026-08-05 cs.CL cs.AI cs.LG cs.MA 新提交 73%

MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

MemArena:面向移动端智能体个人记忆助手的大规模自我中心基准测试

Jiadong Zhang, Xiaosong Ma

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究针对现有记忆基准测试的不足,构建了MemArena基准,评估了不同记忆后端对移动端个人记忆助手的影响,发现后端选择对内容准确性影响更大,权限感知访问失效,搜索延迟仅在阅读器规模极小时有影响。

Comments 48 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02594 2026-07-28 q-bio.QM cs.AI cs.ET cs.IR 版本更新 73%

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现

Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

机构 * OpenAI

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。

Comments 13 pages, two graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28732 2026-07-17 cs.CL cs.AI cs.LG 版本更新 73%

MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems

MemTrace:大型语言模型记忆系统中的错误追踪与归因

Xinle Deng, Ruobin Zhong, Hujin Peng, Xiaoben Lu, Yanzhe Wu, Guang Li, Buqiang Xu, Yunzhi Yao, Jizhan Fang, Haoliang Cao, Junjie Guo, Yuan Yuan, Ziqing Ma, Yuanqiang Yu, Rui Hu, Baohua Dong, Hangcheng Zhu, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出MemTrace框架,通过构建可执行的记忆演化图实现细粒度错误追踪,并利用自动归因方法定位根因,进而优化提示词提升下游任务性能。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏