arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-08-31 至 2026-08-31 共收录 14 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 14 篇

2608.27809 2026-08-31 cs.IR 新提交 92%

LINE Conversation History Retrieval for Personal Memory RAG: Evaluating Search Representations and Hybrid Retrieval

用于个人记忆检索增强生成(RAG)的LINE对话历史检索:评估搜索表示与混合检索

Akito Hattori

专题命中 检索器与排序 :RAG(title,title_cn);hybrid retrieval(title,abstract);retrieval-augmented generation(abstract);retriever(abstract)

AI总结 本研究针对一名用户的LINE对话历史开展检索增强生成的初始案例,构建三种搜索表示并对比多种检索方法,发现特定混合检索配置在100个评估问题上的检索性能最优,但研究存在单用户单标注等局限性。

Comments 16 pages, 6 figures, 10 tables. Exploratory single-user case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00422 2026-08-31 cs.CR 版本更新 88%

KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems

KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击

Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract)

AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28572 2026-08-31 cs.IR 新提交 87%

PULSAR: Pooled Unified Late-Interaction Search and Retrieval for Enterprise Visual Document RAG

PULSAR:面向企业视觉文档RAG的池化统一后期交互搜索与检索

Benjamin Constable, Anup Roy, Vishal Sharma, Rishabh Upadhyay, Robin Mills, Aidan Millar

专题命中 检索器与排序 :RAG(title,title_cn);分类 cs.IR

AI总结 针对企业视觉文档RAG的检索难题,提出PULSAR系统,采用池化两阶段后期交互索引,在延迟、QPS、成本等指标上显著优于OCR基线,已在生产环境大规模应用。

Comments Accepted at EMNLP 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28112 2026-08-31 cs.CR cs.CL cs.IR 版本更新 86%

A Wolf in Sheep's Clothing: Targeted Routing Hijacking in Federated RAG

披着羊皮的狼:联邦RAG中的目标路由劫持

Junjie Mu, Qiongxiu Li

机构 * Politecnico di Milano(米兰理工大学) Aalborg University(奥胡斯大学)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 本文提出路由劫持攻击,恶意客户端伪造语义配置文件以吸引目标查询,导致检索结果被篡改,并设计了一种基于信任的后路由框架来缓解该攻击。

Comments Accepted to the EMNLP 2026 Main Conference. Code available at this https URL (https://github.com/Junjie-Mu/routing-hijacking-fedrag)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28389 2026-08-31 cs.CR cs.CL 新提交 84%

CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents

CamoDocs:针对检索增强语言模型的伪装文档中毒攻击

Jaewon Jung, Haizhong Zheng, Hongsun Jang, Jaeyong Song, Beidi Chen, Jinho Lee

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本研究提出CamoDocs伪装文档中毒攻击,将对抗性文档伪装在良性内容中,在多种RAG防御、LLM及专有模型上实现高攻击成功率,同时避免易被检测的查询重叠痕迹。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11671 2026-08-31 cs.SE 版本更新 83%

Do Not Treat Code as Natural Language: Implications for Repository-Level Code Generation and Beyond

不要将代码视为自然语言:对仓库级代码生成及更广泛领域的启示

Minh Le-Anh, Huyen Nguyen, Khanh An Tran, Nam Le Hai, Linh Ngo Van, Nghi D.Q. Bui, Bach Le

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);hybrid retrieval(abstract)

AI总结 Hydra通过结构化代码生成框架提升仓库级代码生成性能,超越现有方法并实现更高效依赖检索。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28155 2026-08-31 cs.CL 新提交 81%

FinExam-10K: When Retrieval Helps Financial Reasoning?

FinExam-10K:检索如何助力金融推理?

Yan Lin, Jingyu Sun, Zhongliang Guo, Qing Li, Zhuohan Xie, Yuxia Wang

机构 * Newcastle University(纽卡斯尔大学) University of Manchester(曼彻斯特大学) University of Melbourne(墨尔本大学) University of Aberdeen(阿伯丁大学) University of Groningen(格罗宁根大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) INSAIT Sofia University “St. Kliment Ohridski”(索非亚大学“圣·克利门特·奥赫里德斯基”)

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本研究推出覆盖CFA与FRM全体系的最大金融推理基准FinExam-10K,测试17个模型后发现FunctionGraph-RAG经门控调用可小幅提升留存题准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27470 2026-08-31 cs.CL cs.AI cs.DB 新提交 67%

Select, Don't Train: The Benefits of Modular Entity Disambiguation with LLM-Based Selection

选择,而非训练:基于大语言模型(LLM)选择的模块化实体消歧的优势

Fina Polat, Daniel Daza, Pengyu Zhang, Klim Zaporojets, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Aarhus University(奥胡斯大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI、cs.DB

AI总结 该研究提出将实体消歧的检索与选择解耦,基于LLM选择器对比不同检索策略,发现无需训练的BM25搭配LLM选择器在ZELDA基准上达到先进性能,还支持检测到检索失败时弃权,提升了实体消歧效果。

Comments Accepted at the 25th International Semantic Web Conference (ISWC 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02751 2026-08-31 cs.IR cs.AI cs.CL 版本更新 67%

Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Search Agents

搜索、检查、获取:利用布尔检索构建深度研究智能体

Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon

机构 * The University of Queensland(昆士兰大学) CSIRO(联邦科学与工业研究组织)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本研究针对现有深度研究智能体的缺陷,提出基于BQL的SIEVE接口,在三个问答数据集上实现更高准确率且token用量显著减少,验证了BQL过滤的有效性。

Comments clean up text, format, clearer setup;

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12451 2026-08-31 cs.AI cs.IR cs.LG 版本更新 62%

ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs

ToolSense: 审计LLM中参数化工具知识的诊断框架

Ashutosh Hathidara, Sai Shruthi Sistla, Sebastian Schreiber, Sahil Bansal

机构 * SAP Labs(SAP实验室)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 提出ToolSense诊断框架,自动生成三类基准测试,揭示参数化工具检索中知识-检索分离现象,发现模型在模糊查询下性能显著下降。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27945 2026-08-31 cs.AI 新提交 57%

Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense

跨会话分解攻击:规模风险与意图对齐检索防御

Disen Liao, Yihan Wang, Freda Shi, Yaoliang Yu

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 检索器与排序 :retriever(abstract);分类 cs.AI

AI总结 该研究聚焦跨会话分解攻击的规模风险,提出IntentAlign-MiniLM防御方法,实验显示更大的Qwen3、Gemma3系列模型在该攻击下有害能力提升更显著,所提防御效果优于更大嵌入模型。

Comments 30 pages, 3 figures, EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27925 2026-08-31 cs.CL 新提交 57%

Entity-Memory Graph Retrieval Improves Evidence Coverage in Long-Conversation Question Answering

实体记忆图检索提升长对话问答中的证据覆盖率

Shumao Sun

机构 * Tsinghua University(清华大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL

AI总结 该研究提出实体记忆图检索方法,在10个LoCoMo对话的1986个问题上,使top-k=25的证据召回率提升约4.74个百分点,实现检索覆盖增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27912 2026-08-31 cs.IR 新提交 57%

ITER: Interaction-Aware Retrieval for Agentic Search

ITER:面向智能体搜索的交互感知检索

Haodong Chen, Shuai Wang, Yu Yin, Shengyao Zhuang, Guido Zuccon, Teerapong Leelanupab

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 本文提出交互感知稠密检索器ITER,利用智能体轨迹学习信号训练,在六种智能体骨干上优于LRAT,跨智能体鲁棒性强于AgentIR,在两个基准上获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17654 2026-08-31 cs.IR cs.LG 版本更新 57%

Mine and Refine: Optimizing Graded Relevance in E-commerce Semantic Search Retrieval

挖掘与精炼:优化电子商务搜索检索中的分级相关性

Jiaqi Xi, Raghav Saboo, Luming Chen, Johny Rufus, Aditya Dodda, Ved Sampath, Kenny Chi, Elyse Winer, Akshad Viswanathan, Martin Wang, Sudeep Das

机构 * DoorDash Inc.(DoorDash公司)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 本文提出一种两阶段框架,通过挖掘和精炼提升电子商务搜索检索的分级相关性,结合对比学习和多类圆损失优化嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏