arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-02-04 至 2026-02-04 共收录 21 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 12 篇

2602.03645 2026-02-04 cs.LG 89%

Reinforcement Fine-Tuning for History-Aware Dense Retriever in RAG

强化微调用于历史感知密集检索器在RAG中

Yicheng Zhang, Zhen Qin, Zhaomin Wu, Wenqi Zhang, Shuiguang Deng

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 检索器与排序 :RAG(title,abstract);retriever(title,abstract);retrieval-augmented generation(abstract)

AI总结 本文提出通过强化学习优化RAG中的检索器,通过引入随机采样和历史状态缓解状态别名问题,提升检索性能。

Comments On going work. Codes are released at https://github.com/zyc140345/HARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03442 2026-02-04 cs.CL 86%

A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

A-RAG:通过分层检索接口扩展代理检索增强生成

Mingxuan Du, Benfeng Xu, Chiwei Zhu, Shaohan Wang, Pengyu Wang, Xiaorui Wang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(title);分类 cs.CL

AI总结 A-RAG通过分层检索接口提升检索增强生成效果,有效利用模型能力并适应不同任务。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03652 2026-02-04 cs.CL cs.AI cs.IR 85%

RAGTurk: Best Practices for Retrieval Augmented Generation in Turkish

RAGTurk:土耳其语中检索增强生成的最佳实践

Süha Kağan Köse, Mehmet Can Baytekin, Burak Aktaş, Bilge Kaan Görür, Evren Ayberk Munis, Deniz Yılmaz, Muhammed Yusuf Kartal, Çağrı Toraman

专题命中 检索器与排序 :retrieval augmented generation(title);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 RAGTurk研究了土耳其语中检索增强生成的最佳实践,通过构建土耳其RAG数据集并测试RAG管道各阶段,发现HyDE方法在准确性上表现最佳,同时帕累托最优配置在成本较低的情况下也表现出色。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03689 2026-02-04 cs.CL cs.AI 84%

Rethinking the Reranker: Boundary-Aware Evidence Selection for Robust Retrieval-Augmented Generation

重新思考重排序器:面向鲁棒检索增强生成的边界感知证据选择

Jiashuo Sun, Pengcheng Jiang, Saizhuo Wang, Jiajun Fan, Heng Wang, Siru Ouyang, Ming Zhong, Yizhu Jiao, Chengsong Huang, Xueqiang Xu, Pengrui Han, Peiran Li, Jiaxin Huang, Ge Liu, Heng Ji, Jiawei Han

机构 * University of Illinois Urbana-Champaign Hong Kong University of Science Washington University in St. Louis Texas A\&M University

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 BAR-RAG通过边界感知证据选择提升检索增强生成在噪声下的鲁棒性与性能

Comments 19 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03578 2026-02-04 cs.CL cs.AI 84%

Use Graph When It Needs: Efficiently and Adaptively Integrating Retrieval-Augmented Generation with Graphs

在需要时使用图:高效且适应性地整合检索增强生成与图

Su Dong, Qinggang Zhang, Yilin Xiao, Shengyuan Chen, Chuang Zhou, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EA-GraphRAG框架,通过动态整合RAG和GraphRAG,根据查询复杂度灵活选择检索策略,提升处理混合场景的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03731 2026-02-04 cs.CL 83%

CUBO: Self-Contained Retrieval-Augmented Generation on Consumer Laptops 10 GB Corpora, 16 GB RAM, Single-Device Deployment

CUBO:面向消费者笔记本电脑的自包含检索增强生成系统,支持10 GB语料库、16 GB RAM单设备部署

Paolo Astrino

专题命中 检索器与排序 :retrieval-augmented generation(title);RAG(abstract);hybrid retrieval(abstract);分类 cs.CL

AI总结 CUBO是一种面向消费者笔记本电脑的RAG系统,通过16GB内存和本地处理实现GDPR合规的高效检索增强生成。

Comments 24 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20041 2026-02-04 cs.LG cs.AI 83%

CiMRAG: CiM-Aware Domain-Adaptive and Noise-Resilient Retrieval-Augmented Generation for Edge-Based LLMs

CiMRAG: 面向边缘LLM的意识域自适应与噪声鲁棒检索增强生成

Shih-Hsuan Chiu, Ming-Syan Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.AI

AI总结 CiMRAG通过TONEL框架提升边缘LLM在噪声环境下的检索准确性和域适应性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01757 2026-02-04 cs.CL cs.LG 70%

Zero2Text: Zero-Training Cross-Domain Inversion Attacks on Textual Embeddings

Zero2Text: 无训练跨域反向攻击文本嵌入

Doohyun Kim, Donghwa Kang, Kyungjae Lee, Hyeongboo Baek, Brent Byunghoon Kang

机构 * School of Computing, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院计算学院) Graduate School of Information Security, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院信息安全研究生院) Department of Artificial Intelligence, University of Seoul, Seoul, Republic of Korea(首尔大学人工智能系) Department of Computer Science, University of Seoul, Seoul, Republic of Korea(首尔大学计算机科学系)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 Zero2Text通过递归在线对齐机制,在无训练情况下实现跨域文本嵌入反向攻击,有效对抗传统防御手段,实验显示其在恢复句子方面表现优异。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02896 2026-02-04 cs.SE 67%

Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework

面向大语言模型(LLM)代码生成的失败意识增强:决策框架的实证研究

Jianru Shen, Zedong Peng, Lucy Owen

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文通过实证研究,提出了一种基于失败特征的决策框架,用于指导大语言模型代码生成中的增强策略选择。

Comments Accepted at SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12960 2026-02-04 cs.MA 67%

ENGRAM: Effective, Lightweight Memory Orchestration for Conversational Agents

ENGRAM: 有效的、轻量级的内存编排用于对话代理

Daivik Patel, Shrenik Patel

专题命中 检索器与排序 :retriever(abstract);dense retrieval(abstract)

AI总结 ENGRAM通过轻量级内存编排实现对话代理的长周期一致性,利用类型化内存和密集检索在多个基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02444 2026-02-04 cs.IR cs.CV 57%

RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval

RANKVIDEO: 文本到视频检索中的推理重排序

Tyler Skow, Alexander Martin, Benjamin Van Durme, Rama Chellappa, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 RANKVIDEO通过基于视频内容的推理机制,提升了文本到视频检索的重排序性能,实验显示在nDCG@10上平均提升31%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03400 2026-02-04 cs.SE cs.AI 57%

Precision in Practice: Knowledge Guided Code Summarizing Grounded in Industrial Expectations

实践中的精确性:基于工业期望的知识引导代码摘要

Jintai Li, Songqiang Chen, Shuo Jin, Xiaoyuan Xie

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, China(香港科学与技术大学计算机科学与工程系) Department of Computer Science(计算机科学系)

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.AI

AI总结 ExpSum 通过整合元数据抽象和领域知识检索,生成符合工业期望的代码摘要,显著提升摘要质量与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长文档RAG 1 篇

2602.03647 2026-02-04 cs.AI cs.CL 62%

Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration

Search-R2: 通过演员-细化协作提升搜索集成推理

Bowei He, Minda Hu, Zenan Xu, Hongru Wang, Licheng Zong, Yankai Chen, Chen Ma, Xue Liu, Pluto Zhou, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯语言模型部门) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) McGill University(麦吉尔大学) City University of Hong Kong(香港城市大学) The University of Edinburgh(爱丁堡大学)

专题命中 长文档RAG :RAG(abstract);分类 cs.CL、cs.AI

AI总结 Search-R2通过演员-细化协作框架提升搜索集成推理,通过针对性干预和混合奖励设计,在多种QA数据集上超越强基线,实现更优的推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图谱与结构化RAG 2 篇

2601.09241 2026-02-04 cs.CL 83%

When to Trust: A Causality-Aware Calibration Framework for Accurate Knowledge Graph Retrieval-Augmented Generation

何时信任:一种因果意识校准框架用于准确的知识图谱检索增强生成

Jing Ren, Bowen Li, Ziqi Xu, Xikun Zhang, Haytham Fayek, Xiaodong Li

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 图谱与结构化RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL

AI总结 Ca2KG通过整合反事实提示和重新评分机制,提升KG-RAG在高风险领域的可靠性与准确性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02752 2026-02-04 cs.SE 50%

Beyond the Prompt: Assessing Domain Knowledge Strategies for High-Dimensional LLM Optimization in Software Engineering

超越提示:评估领域知识策略在软件工程高维LLM优化中的应用

Srinath Srinivasan, Tim Menzies

专题命中 图谱与结构化RAG :RAG(abstract)

AI总结 本研究比较了人类与人工智能策略在生成领域知识方面的效果,通过四种不同架构评估如何利用结构化知识整合提升LLM在高维优化中的表现。

Comments Accepted at MSR 2026 (Registered Reports Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态RAG 2 篇

2602.03432 2026-02-04 cs.IR 57%

Failure is Feedback: History-Aware Backtracking for Agentic Traversal in Multimodal Graphs

失败是反馈:面向多模态图中代理遍历的历史感知回溯

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 多模态RAG :retriever(abstract);分类 cs.IR

AI总结 FiF通过历史感知回溯和经济理性的代理工作流程,提升多模态图中检索的适应性和效率。

Comments Project page: https://failureisfeedback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02537 2026-02-04 cs.CV cs.LG 50%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 多模态RAG :knowledge retrieval(abstract)

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. RAG评测 4 篇

2509.21875 2026-02-04 cs.CL 83%

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

LUMINA:通过上下文-知识信号检测RAG系统中的幻觉

Samuel Yeh, Sharon Li, Tanwi Mallick

机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 LUMINA通过上下文-知识信号检测RAG系统中的幻觉,利用分布距离和token演变测量,实现高准确率和实用性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01355 2026-02-04 cs.AI 70%

Aggregation Queries over Unstructured Text: Benchmark and Agentic Method

无结构文本上的聚合查询:基准测试与代理方法

Haojia Zhu, Qinyuan Xu, Haoyu Li, Yuxi Liu, Hanchen Qiu, Jiaoyan Chen, Jiahui Jin

机构 * Southeast University(东南大学) Imperial College London(伦敦帝国学院) The University of Manchester(曼彻斯特大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出DFA方法,用于在无结构文本上进行完整性导向的聚合查询,通过模块化设计提升证据覆盖能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03693 2026-02-04 cs.CL cs.AI 62%

OCRTurk: A Comprehensive OCR Benchmark for Turkish

OCRTurk:土耳其的综合OCR基准

Deniz Yılmaz, Evren Ayberk Munis, Çağrı Toraman, Süha Kağan Köse, Burak Aktaş, Mehmet Can Baytekin, Bilge Kaan Görür

机构 * Middle East Technical University, Computer Engineering Department(中东部技术大学,计算机工程系) Politecnico di Torino(托里诺理工大学) Roketsan Inc.(罗克特兰公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 OCRTurk是一个针对土耳其语文档解析的综合基准测试,通过多难度级别和多种文档类型评估七种OCR模型,发现PaddleOCR在多数指标上表现最佳,但幻灯片文档对模型构成挑战。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02053 2026-02-04 cs.CL 57%

WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora

WildGraphBench: 用野源语料基准测试图式检索增强生成

Pengyu Wang, Benfeng Xu, Licheng Zhang, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 WildGraphBench通过真实语料评估GraphRAG在长上下文和异构文档中的性能,揭示多事实聚合的局限性。

Comments https://github.com/BstWPY/WildGraphBench

详情

展开后加载摘要…

URL PDF HTML 收藏