arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 4563 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 4563 篇

2306.15222 2023-12-19 cs.CL cs.AI cs.IR 67%

Learning to Rank in Generative Retrieval

Yongqi Li, Nan Yang, Liang Wang, Furu Wei, Wenjie Li

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04205 2023-10-31 cs.IR cs.AI cs.CL cs.HC 67%

Keyword Augmented Retrieval: Novel framework for Information Retrieval integrated with speech interface

Anupam Purwar, Rahul Sundar

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13760 2023-08-29 cs.AI cs.CL cs.IR 67%

How Can Context Help? Exploring Joint Retrieval of Passage and Personalized Context

Hui Wan, Hongkang Li, Songtao Lu, Xiaodong Cui, Marina Danilevsky

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04028 2023-08-09 cs.CL cs.AI cs.IR cs.LG 67%

Top K Relevant Passage Retrieval for Biomedical Question Answering

Shashank Gupta

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 6 pages, 5 figures. arXiv admin note: text overlap with arXiv:2004.04906 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12756 2023-06-23 cs.IR cs.AI cs.CL cs.LG 67%

On the Robustness of Generative Retrieval Models: An Out-of-Distribution Perspective

Yu-An Liu, Ruqing Zhang, Jiafeng Guo, Wei Chen, Xueqi Cheng

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 4 pages, submit to GenIR23

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.06027 2023-04-25 cs.IR cs.AI cs.CL 67%

PAIR: Leveraging Passage-Centric Similarity Relation for Improving Dense Passage Retrieval

Ruiyang Ren, Shangwen Lv, Yingqi Qu, Jing Liu, Wayne Xin Zhao, QiaoQiao She, Hua Wu, Haifeng Wang, Ji-Rong Wen

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

Comments ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11005 2023-03-21 cs.CL cs.AI cs.IR cs.LG 67%

Controllable Ancient Chinese Lyrics Generation Based on Phrase Prototype Retrieving

Li Yi

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05197 2022-10-14 cs.CL cs.AI cs.IR 67%

Mixed-modality Representation Learning and Pre-training for Joint Table-and-Text Retrieval in OpenQA

Junjie Huang, Wanjun Zhong, Qian Liu, Ming Gong, Daxin Jiang, Nan Duan

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted to Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05758 2022-10-13 cs.CL cs.AI cs.IR 67%

Decoupled Context Processing for Context Augmented Language Modeling

Zonglin Li, Ruiqi Guo, Sanjiv Kumar

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06300 2022-07-14 cs.CL cs.AI cs.IR 67%

Re2G: Retrieve, Rerank, Generate

Michael Glass, Gaetano Rossiello, Md Faisal Mahbub Chowdhury, Ankita Rajaram Naik, Pengshan Cai, Alfio Gliozzo

专题命中 检索器与排序 :RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted at NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.10086 2021-09-22 cs.IR cs.AI cs.CL 67%

SPLADE v2: Sparse Lexical and Expansion Model for Information Retrieval

Thibault Formal, Carlos Lassance, Benjamin Piwowarski, Stéphane Clinchant

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 5 pages. arXiv admin note: substantial text overlap with arXiv:2107.05720

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.09595 2020-06-18 cs.IR cs.AI cs.CL 67%

CO-Search: COVID-19 Information Retrieval with Semantic Search, Question Answering, and Abstractive Summarization

Andre Esteva, Anuprit Kale, Romain Paulus, Kazuma Hashimoto, Wenpeng Yin, Dragomir Radev, Richard Socher

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22641 2026-06-12 cs.CL cs.AI cs.LG 版本更新 66%

More Context, Larger Models, or Moral Knowledge? A Systematic Study of Schwartz Value Detection in Political Texts

更多上下文、更大模型还是道德知识?政治文本中施瓦茨价值观检测的系统研究

Víctor Yeste, Paolo Rosso

机构 * PRHLT Research Center, Universitat Politècnica de València, Spain(巴塞罗那理工大学研究中心,西班牙 Valencia理工大学) School of Science, Engineering and Design, Universidad Europea de Valencia, Spain(Valencia欧洲大学科学、工程与设计学院,西班牙) Valencian Graduate School and Research Network of Artificial Intelligence (ValgrAI)(瓦伦西亚人工智能研究生学院与研究网络(ValgrAI))

专题命中 检索器与排序 :RAG(abstract,comments);分类 cs.CL、cs.AI

AI总结 本研究系统比较了上下文范围、检索增强道德知识和模型规模对政治文本中施瓦茨价值观检测的影响,发现全文档上下文和检索知识对监督编码器有效,但对零样本大语言模型帮助有限,且模型扩展不保证性能提升。

Comments Code: https://github.com/VictorMYeste/human-value-detection-context-rag, best model: https://huggingface.co/VictorYeste/value-context-rag-deberta-v3-base-doc-rag, 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25716 2025-10-01 cs.SE cs.AI cs.IR 66%

DeepCodeSeek: Real-Time API Retrieval for Context-Aware Code Generation

Esakkivel Esakkiraja, Denis Akhiyarov, Aditya Shanmugham, Chitra Ganapathy

机构 * ServiceNow, Inc.(ServiceNow公司)

专题命中 检索器与排序 :RAG(abstract);分类 cs.IR、cs.AI;retrieval-augmented generation(comments)

Comments Retrieval-Augmented Generation, API Prediction, Context-Aware Code Generation, Enterprise Code Completion, Reinforcement Learning, ServiceNow, Real-Time Code Search, Query Enhancement, Fine-Tuning, Embedding, Reranker

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03030 2022-07-08 cs.CL cs.IR 66%

Multi-Task Retrieval-Augmented Text Generation with Relevance Sampling

Sebastian Hofstätter, Jiecao Chen, Karthik Raman, Hamed Zamani

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL;knowledge retrieval(comments)

Comments Accepted at the ICML 2022 Workshop on Knowledge Retrieval and Language Models (KRLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20348 2026-08-24 cs.CL cs.AI 新提交 62%

Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing

用于临床长上下文推理的抑制注意力:电子病历处理中中间信息丢失效应的表征与缓解

Sanjay Basu

机构 * University of California San Francisco(加利福尼亚大学旧金山分校) Waymark(韦马克公司)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对电子病历处理中的临床中间信息丢失问题,提出查询条件化临床抑制方法,经实验验证其在中间位置指令及整体任务上的表现均优于多种基线检索与重排序方法。

Comments 29 pages, 5 figures. Code: this https URL (https://github.com/sanjaybasu/inhibitory-attention-ehr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18752 2026-08-21 cs.IR cs.CL 版本更新 62%

GreekBarRetrieval: A Benchmark for Greek Statutory Retrieval

GreekBarRetrieval:希腊成文法检索基准

Ernest Beta, Odysseas S. Chlapanis, Dimitrios Galanis, Ion Androutsopoulos

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 本研究推出希腊成文法检索基准GreekBarRetrieval,通过实验发现基于大型语言模型的查询重表述可提升BM25检索效果,使其在多项指标上优于其他检索方法。

Comments Submitted to NLLP workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19020 2026-08-21 cs.LG cs.AI cs.IR q-bio.QM 版本更新 62%

Drift-Adaptive ICU Intervention Prediction: Freezing the Physiological Encoder for Auditable Model Updating

重症监护室时间序列预测中的生物失忆:一种具有时间检索的漂移自适应双流架构

Fatema Ferdous Tamanna, K. M. Merajul Arefin, Md. Abdul Masud

机构 * Patuakhali Science and Technology University(帕图阿卡利科学技术大学) University of Dhaka(达卡大学)

专题命中 检索器与排序 :RAG(abstract);分类 cs.IR、cs.AI

AI总结 研究重症监护室时间序列预测中临床决策支持系统退化问题,提出自适应临床智能架构,通过解耦生理与治疗表征、限制参数更新等实现漂移自适应,实验验证其有效性,为高风险临床环境中部署自适应模型提供模板。

Comments v2: narrower scope. The v1 cross-model XGBoost comparison, is not carried forward: it used a fixed threshold across differently calibrated models. Claims are now restricted to within-architecture comparisons (selective vs. full adaptation); retrieval results are exploratory. Title updated. 12 pages, 4 figures, 7 tables. Code: https://github.com/empresst/ClinicalRag. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10388 2026-08-21 cs.IR cs.AI 版本更新 62%

Right Family, Wrong Skill: Benchmarking Risk Exposure in Agent Skill Retrieval

SkillResolve-Bench:衡量和解决智能体技能检索中的同能力歧义

Jiandong Ding, Honglei Ji, Ming Liu, Tao Duan

机构 * Huawei Technologies Ltd(华为技术有限公司)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 针对智能体技能库中同一能力族内不同技能的执行风险,提出SkillResolve-Bench基准和SkillResolve方法,通过候选族解析和代表性选择,在保持高召回率的同时将有害技能暴露率降至0。

Comments Preprint. 21 pages, 3 figures, 6 tables. Supersedes arXiv:2606.10388

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01684 2026-08-20 cs.IR cs.CL 版本更新 62%

LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum

LACONIC: 通过双阶段训练课程实现可扩展稀疏检索的密集级有效性

Zhichao Xu, Shengyao Zhuang, Crystina Zhang, Xueguang Ma, Yijun Tian, Maitrey Mehta, Jimmy Lin, Vivek Srikumar

机构 * University of Utah(犹他大学) The University of Queensland(昆士兰大学) University of Waterloo(滑铁卢大学) University of Notre Dame(圣约翰大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 LACONIC通过双阶段训练课程实现高效稀疏检索,以更少的计算资源达到与密集模型相当的检索效果。

Comments SIGIR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16918 2026-08-19 cs.IR cs.AI 新提交 62%

Sparse Coverage: Semantic Center Representations for Patent Prior-Art Retrieval

稀疏覆盖:用于专利现有技术检索的语义中心表示

You Zuo, Kim Gerdes, Éric de la Clergerie, Benoît Sagot

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 针对专利现有技术检索的长文档特性,提出无监督语义检索框架Sparse Coverage,采用面向覆盖的k中心目标生成稀疏表示,在CLEF-IP 2013实验中其文档级召回率优于或媲美稠密专利编码器,可作为专利检索的有效第一阶段方法。

Journal ref CORIA-TALN 2026 - 21e Conf{é}rence en Recherche d'Information et Applications (CORIA), Jun 2026, Nantes, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16071 2026-08-18 cs.CL cs.IR 新提交 62%

Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval

Skill2Query:利用技能结构生成智能体技能检索的伪查询

Lihui Ding, Zihan Guo, Bingwei Lu, Chenyu Zhou, Yuanjian Zhou, Weinan Zhang, Jianghao Lin, Dongdong Ge

机构 * Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 Skill2Query是利用技能知识图谱生成伪查询的框架,可提升多类检索性能,生成的训练数据表现最优,还能提高智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14580 2026-08-18 cs.AI cs.IR 新提交 62%

OGX: An Open-Source, Vendor-Neutral Generative AI Application Server

OGX:开源、厂商中立的生成式AI应用服务器

Francisco Javier Arceo, Sébastien Han, Matthew Farrellee, Charlie Doern, Yuan Tang, Derek Higgins, Varsha Prasad Narsing, Gordon Sim, Sumanth Kamenani, Ben Browning, Raghotham Murthy

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 OGX是开源厂商中立的生成式AI应用服务器,支持主流实验室API与多后端,为多款AI开发者工具提供模型无关自托管后端,获超8400 GitHub星标

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00801 2026-08-18 cs.AI cs.IR 版本更新 62%

The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents

合成网络:用于诊断语言代理知识弱点的对抗性定制迷你互联网

Shrey Shah, Levent Ozgur

机构 * Microsoft(微软)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本研究提出合成网络基准测试,通过对抗性内容测试揭示语言代理在处理冲突信息时的弱点,为高风险领域中的可靠代理开发提供评估框架。

Comments This version includes a revised manuscript presentation and formatting, expanded methodological and experimental details, enhanced reproducibility documentation, and improved benchmark framing and evaluation descriptions

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15041 2026-08-18 cs.AI cs.CL 版本更新 62%

mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA

mR²AG:用于基于知识的视觉问答的多模态检索-反思增强生成

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Yuxuan Zhao, Zehua Xie, Jin Ma, Ying Shan, Weiming Hu

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多模态大语言模型在基于知识的视觉问答中的缺陷,提出mR²AG框架,通过两种反思操作实现自适应检索与信息定位,在相关基准任务上性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13004 2026-08-14 cs.CL cs.IR 新提交 62%

HybridRAG-BN: A Retrieval-Augmented Framework with Fine-Tuned Verification for Bangla KBQA

HybridRAG-BN:面向孟加拉语知识库问答的带微调验证的检索增强框架

Rathijit Aich, Nirjhar Das, Mahfuzulhoq Chowdhury

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.IR、cs.CL

AI总结 针对孟加拉语KBQA的低资源挑战,提出HybridRAG-BN框架,整合混合检索、答案生成与LoRA微调的验证模块,经实验获竞赛双排行榜第一。

Comments Developed for the IEEE Computer Society CUET Student Branch

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20990 2026-08-12 cs.IR cs.AI 版本更新 62%

$\mathrm{ECI}_{\mathrm{sem}}$: Semantic Residual Effective Contrastive Information for Evaluating Hard Negatives

ECI: 有效对比信息用于评估难负样本

Aarush Sinha, Rahul Seetharaman, Aman Bansal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT), Kharagpur, India(1. 印度理工学院(IIT)计算机科学与工程系,克哈格布尔,印度)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 本文提出ECI,一种无需训练的诊断方法,通过冻结的目标编码器嵌入对候选负样本进行排序,其在MS MARCO数据集上展示了优于其他模型的性能,且在不同条件下表现出稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07622 2026-08-11 cs.AI cs.IR cs.LG 新提交 62%

Controlled Memory Interference in Continual LLM Agents

持续大型语言模型智能体中的可控记忆干扰

Ao Ding, Hongzong LI, Shiqin Tang, Li Zhang, Liang Chen, Xuyang Chen, Zi Liang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Northwestern Polytechnical University(西北工业大学) The Hong Kong University of Science and Technology(香港科技大学) Chinese Academy of Sciences(中国科学院) The Hong Kong Polytechnic University(香港理工大学) École polytechnique fédérale de Lausanne(洛桑联邦理工学院) National University of Singapore(新加坡国立大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 本研究提出可控记忆干扰(CMI)框架,揭示记忆进化受经验相互作用影响,为持续大型语言模型智能体的记忆系统提供诊断与学习方法,提升记忆更新区分度与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05151 2026-08-07 cs.CL cs.AI 新提交 62%

Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support

面向工业因果推理的模拟器驱动大语言模型:用于污水处理决策支持的工具使用、结构化注入及工厂可迁移检索

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University(奥尔堡大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 该研究对比三种适配Qwen2.5-32B-Instruct模型的方法,在污水处理因果问答任务中,DRR检索器兼具高准确率、跨工厂迁移能力及训练高效性,优于其他方法与基线。

Comments 20 pages, 2 figures, 8 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27707 2026-08-06 cs.AI cs.CL 版本更新 62%

Contextual Agentic Memory is a Memo, Not True Memory

情境代理记忆是一种备忘录,而非真正的记忆

Binyan Xu, Xilin Dai, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文指出当前代理记忆系统仅实现查找而非记忆,导致代理能力、长期学习和安全性的局限,提出生物智能通过结合快速海马体示例存储与慢速新皮层权重巩固解决此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏