arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 372 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 372 篇

2606.24579 2026-06-24 cs.CL 新提交 57%

Cross-Lingual Exploration for Parametric Knowledge

跨语言探索参数化知识

Elisha Diskind, Itamar Trainin, Uri Shaham, Leshem Choshen, Idan Szpektor, Omri Abend

机构 * The Hebrew University of Jerusalem(海法大学) Google Research(谷歌研究) MIT, IBM-MIT Watson AI Lab(麻省理工学院与IBM-麻省理工 Watson人工智能实验室)

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.CL

AI总结 本文研究通过跨语言提示策略探索大型语言模型中的隐藏事实知识,发现跨语言探索能显著提升知识迁移和事实召回,比单语言扩展更高效,并改善跨语言一致性。

Comments 29 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23889 2026-06-24 cs.IR 新提交 57%

INSPIRE: Intent-aware Neural Sponsored Product Retrieval for E-commerce

INSPIRE:面向电子商务的意图感知神经赞助商品检索

Shasvat Desai, Hong Yao, Utkarsh Porwal, Kuang-chih Lee

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR

AI总结 针对电商搜索中用户意图与商品不匹配问题,提出INSPIRE框架,利用结构化意图信号(如品牌、口味、饮食限制)增强查询与赞助商品的匹配,通过弱监督意图学习和大模型蒸馏实现精准检索。

Comments Accepted to ACM SIGIR E-commerce Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21676 2026-06-23 cs.IR 新提交 57%

CRAwLeR -- Cross-Reference Aware Legal Retrieval

CRAwLeR -- 交叉引用感知的法律检索

Maciej Jalocha, William Michelsen

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 针对法律文档中的交叉引用,提出CRAwLeR流水线,生成需要上下文的查询并构建数据集,实验表明约80%的查询真正需要上下文,最佳Recall@10为55%-59%。

Comments 26 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20047 2026-06-19 cs.IR 新提交 57%

PACMS: Submodular Context Selection as a Pluggable Engine for LLM Agents

PACMS: 作为LLM代理可插拔引擎的子模上下文选择

Manu Ghulyani, Arunabh Singh, Karan Bharadwaj, Ankit Nath, Suranjan Goswami

专题命中 检索器与排序 :retrieval augmented generation(abstract);分类 cs.IR

AI总结 提出PACMS,一种基于子模函数最大化的上下文选择方法,在提示组装时按相关性从会话、记忆和工具输出中挑选内容,替代截断机制,提升长对话中的信息保持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19469 2026-06-19 cs.AI cs.SE 新提交 57%

Measuring Curriculum Alignment across Topical Coverage, Competency, and Cognitive Depth: A Longitudinal Framework Applied to CS2013 and CS2023

衡量课程在主题覆盖、能力与认知深度上的一致性:应用于CS2013和CS2023的纵向框架

Sherzod Turaev, Mary John, Saja Aldabet, Mamoun Awad, Nazar Zaki, Khaled Shuaib

机构 * United Arab Emirates University(阿联酋大学) Abu Dhabi Polytechnic(阿布扎比理工学院)

专题命中 检索器与排序 :retriever(abstract);分类 cs.AI

AI总结 提出一种人机协同流程,通过语义检索与人工确认,纵向衡量计算机科学课程对CS2013和CS2023指南的覆盖情况,发现课程覆盖稳定但新指南对认知深度要求更高。

Comments 24 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19172 2026-06-18 cs.AI 新提交 57%

User as Engram: Internalizing Per-User Memory as Local Parametric Edits

用户作为印迹:将每用户记忆内化为局部参数编辑

Bojie Li

机构 * Pine AI

专题命中 检索器与排序 :retriever(abstract);分类 cs.AI

AI总结 提出User as Engram方法,将用户事实存储为Engram模型的哈希键控记忆表中的局部编辑,推理技能共享一个适配器,实现高精度间接推理且内存占用极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19037 2026-06-18 cs.IR 新提交 57%

Querit-Reranker: Training Compact Multilingual Rerankers via Efficient Label-Free Distribution Adaptation

Querit-Reranker: 通过高效无标签分布适应训练紧凑型多语言重排序器

Yunfei Zhong, Jun Yang, Wei Huang, Yinqiong Cai, Haosheng Qian, Yixing Fan, Ruqing Zhang, Lixin Su, Daiting Shi, Jiafeng Guo

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 提出Querit-Reranker系列多语言交叉编码器重排序模型,采用数据驱动的无标签适应管道,通过合成查询挖掘和教师软标签进行分布适应,并利用球面线性插值合并检查点,在BEIR和MIRACL上显著提升nDCG@10,在MTEB多语言重排序上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18098 2026-06-17 cs.AI 新提交 57%

IsabeLLM: Automated Theorem Proving Applied to Formally Verifying Consensus

IsabeLLM: 自动化定理证明应用于共识的形式化验证

Elliot Jones, William Knottenbelt

机构 * Imperial College London(伦敦帝国学院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文改进IsabeLLM自动化定理证明工具,通过检索增强生成、错误追踪和反例生成提升大语言模型上下文,并兼容最新Isabelle和Sledgehammer,用于验证比特币工作量证明共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18051 2026-06-17 cs.CL 新提交 57%

Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose

面向LLM智能体的组合技能路由:分解、检索与组合

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL

AI总结 提出SkillWeaver框架,通过迭代技能感知分解(SAD)将复杂查询分解为原子子任务,检索对应技能并组合为可执行计划,在CompSkillBench上验证了分解质量是主要瓶颈,SAD将分解准确率提升32.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17929 2026-06-17 cs.AI 新提交 57%

PreAct: Computer-Using Agents that Get Faster on Repeated Tasks

PreAct:在重复任务上加速的计算机使用代理

Bojie Li

机构 * Pine AI

专题命中 检索器与排序 :retriever(abstract);分类 cs.AI

AI总结 提出PreAct方法,通过将首次成功执行编译为状态机程序,在后续任务中直接重放,避免逐步骤调用语言模型,实现8.5-13倍加速,并确保重放时屏幕状态匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17459 2026-06-17 cs.AI 新提交 57%

Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation

LLM 能当 CEO 吗?基于多角色智能体模拟的战略资源重新配置基准测试

Yuyang Dai, Xueqing Peng, Lingfei Qian, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Yale University(耶鲁大学)

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.AI

AI总结 提出 CEO-Bench,一个多智能体基准,评估 LLM 在约束丰富的组织环境中进行多轮战略资源重新配置的能力,发现模型在结构有效性上表现良好,但在战略校准上存在系统性失败模式。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17220 2026-06-17 cs.AI 新提交 57%

When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval

当规则学习时:一种用于法律案例检索的自演化智能体

Mingxu Tao, Jiawei Hu, Xian Zhou, Wenpeng Hu, Jiajun Cheng, Yunbo Cao, Zhunchen Luo, Guotong Geng

机构 * Center of Information Research, AMS(AMS信息研究中心) Discipline and Technology Research Center for Large Model Intelligence Applications(大模型智能应用学科与技术研究中心) Hebei University of Engineering(河北工程大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.AI

AI总结 提出一种自演化框架,通过LLM智能体自动生成并优化查询重写规则,无需参数训练即可增强BM25在法律案例检索中的性能。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17197 2026-06-17 cs.SE cs.AI 新提交 57%

Cluster-Aware Dual-Level Test Specification Generation for Large-Scale Automotive Software Requirements

面向大规模汽车软件需求的集群感知双层测试规格生成

Hazem Ayman, Menna Sedik, Kareem Mostafa, Mahmoud Soliman, Samer Saber, Ibrahim Habib

机构 * CairoMotive Cairo, Egypt(开罗动力埃及)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出一种“先聚类后总结”流水线,通过嵌入、降维、聚类、多级摘要和双层测试生成,解决大规模需求下LLM处理依赖缺失和上下文窗口限制问题,提升集成测试覆盖率并高效扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16244 2026-06-16 cs.CR cs.AI 新提交 57%

SPARK: Security Knowledge Priming and Representation-Guided Knowledge Activation for LLM-based Secure Code Generation

SPARK: 基于安全知识引导与表示激活的LLM安全代码生成

Xiaoyun Xu, Lichao Wu, Jona te Lintelo, Siyu Zhang, Stjepan Picek

机构 * Radboud University(拉德堡德大学) University of Bristol(布里斯托大学) University of Zagreb(扎格雷布大学)

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.AI

AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14474 2026-06-15 cs.IR cs.HC 新提交 57%

Verifiable User Simulation for Search and Recommendation Systems

面向搜索与推荐系统的可验证用户模拟

Chenglong Ma, Xinye Wanyan, Danula Hettiachchi, Ziqi Xu, Yongli Ren, Jeffrey Chan

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR

AI总结 提出一个七组件可审计框架,将用户模拟器视为可验证工程制品,通过动手实验检查模拟器行为、诊断差异并检测人口偏差。

Comments Presented as a half-day tutorial at SIGIR 2026, 4 pages

Journal ref In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14243 2026-06-15 cs.CL 新提交 57%

Decoupled Mixture-of-Experts for Parametric Knowledge Injection

解耦混合专家用于参数化知识注入

Baoqing Yue, Weihang Su, Qingyao Ai, Yichen Tang, Changyue Wang, Jiacheng Kang, Jingtao Zhan, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 提出解耦混合专家(DMoE)架构,将外部知识转化为独立可更新的专家模块,通过轻量级不确定性感知路由器在基础模型知识不足时激活相关专家,实现参数级知识增强,在知识密集型基准上优于检索和适配器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13204 2026-06-12 cs.IR 新提交 57%

CoDeR: Local Constraint-Compatible Retrieval Beyond Semantic Similarity

CoDeR: 超越语义相似性的局部约束兼容检索

Xingkun Yin, Xuebin Tang, Hongyang Du

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR

AI总结 针对约束敏感查询中语义相似性作为相关性代理的失效问题,提出CoDeR方法,通过分离主题相关性与约束兼容性,利用对比学习训练兼容性评分器,在不调用外部大模型的情况下实现约束兼容检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11700 2026-06-11 cs.IR 新提交 57%

CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring

CompRank: 通过令牌级压缩和无解码评分实现高效的LLM重排序

Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR

AI总结 提出CompRank框架,通过令牌级压缩和无解码注意力评分减少冗余计算,在BEIR数据集上仅保留10.2%文档令牌即达到接近全令牌的排序性能,并实现4.9-9.5倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11117 2026-06-10 cs.AR cs.AI cs.PF 新提交 57%

Towards Autonomous Accelerator Design: FPGA Accelerator Generation with SECDA

迈向自主加速器设计:基于SECDA的FPGA加速器生成

Vinamra Sharma, Xingjian Fu, Jude Haris, José Cano

机构 * School of Computing Science, University of Glasgow, Scotland, UK(格拉斯哥大学计算机科学学院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出SECDA-DSE框架,集成大语言模型引导FPGA加速器设计空间探索,通过结构化探索器和LLM推理生成可综合的加速器设计,减少人工干预。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10932 2026-06-10 cs.CL cs.LG 新提交 57%

Density Field State Space Models: 1-Bit Distillation, Efficient Inference, and Knowledge Organization in Mamba-2

密度场状态空间模型:Mamba-2中的1比特蒸馏、高效推理与知识组织

Chirag Shinde

机构 * Independent Researcher(独立研究者)

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.CL

AI总结 提出DF-SSM框架,将SSM压缩至1比特骨架加int8低秩校正,应用于Mamba-2 1.3B模型,实现9.7倍压缩和21.4倍推理加速,仅需3200万令牌和6小时蒸馏,并发现模型内部知识组织的三个处理阶段。

Comments 16 pages, 6 figures, 7 tables. Code available at https://github.com/cs-cmyk/df-ssm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09459 2026-06-09 cs.CL 新提交 57%

AbstRAG: Learning to Abstract for Retrieval Problems

AbstRAG:面向检索问题的抽象学习

Lei Xu, Xin Quan, Daniel Pedronette, André Freitas

机构 * Idiap Research Institute(Idiap 研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院 (EPFL)) São Paulo State University(圣保罗州立大学) University of Manchester(曼彻斯特大学) CRUK National Biomarker Centre(英国癌症研究中心国家生物标志物中心)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 针对查询与文档证据间的抽象鸿沟问题,提出AbstRAG方法,通过将抽象作为显式检索对象,并采用反思性精炼机制,在三个基准上提升了检索和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07654 2026-06-09 cs.CV cs.AI 新提交 57%

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.AI

AI总结 提出MM-Matryoshka,一种二维套娃训练框架,使视觉文档检索器在向量维度和编码器深度上实现弹性预算选择,无需为不同预算训练独立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06880 2026-06-08 cs.IR 新提交 57%

Towards Retrieving Interaction Spaces for Agentic Search

面向智能体搜索的交互空间检索

Shengyao Zhuang, Yuansheng Ni, Hengxin Fun, Jimmy Lin, Xueguang Ma

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 提出RISE方法,通过BM25构建有边界的交互空间,并预处理文档支持shell式导航,在BrowseComp-Plus上以约四分之一成本达到78%准确率,优于纯shell基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12419 2026-08-14 cs.LG 新提交 50%

LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining

LoKiFormer:面向高效大语言模型预训练的 locality-aware 注意力与解耦知识记忆

Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

机构 * AIGCode South China University of Technology(华南理工大学) Pazhou Laboratory(琶洲实验室)

专题命中 检索器与排序 :knowledge retrieval(abstract)

AI总结 针对LLM预训练效率问题,提出含局部融合注意力与知识记忆模块的LoKiFormer,使预训练收敛速度提升1.33倍,性能优于现有架构。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11592 2026-08-13 cs.RO 新提交 50%

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06060 2026-08-07 cs.CV 新提交 50%

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索

Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

专题命中 检索器与排序 :retriever(abstract)

AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。

Comments 26 pages,10 figures,14 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04100 2026-08-06 hep-ph hep-ex hep-th 新提交 50%

Language-Guided Hypotheses Generation for Sparse SMEFT Analyses

用于稀疏SMEFT分析的语言引导假设生成

Ahmed Hammad, Veronica Sanz

专题命中 检索器与排序 :retrieval augmented generation(abstract)

AI总结 研究解决稀疏SMEFT分析中算符假设选择难题,提出开源llm4smeft框架,结合微调语言模型与检索增强生成,可本地运行且能生成候选算符及费希尔信息。

Comments 34 pages, 2 figures and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01211 2026-08-04 cs.CV 新提交 50%

VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval

VaRS-Doc:面向视觉文档检索的、通过潜在自探测实现的、具备解释感知能力的变体表示方法

Haocheng Wang, Tongkun Guan, Wei Shen, Xiaokang Yang

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文针对视觉文档检索中固定文档表示难以适配不同查询意图的问题,提出VaRS-Doc框架,通过两阶段训练实现变体表示,在基准测试中达到最先进性能,解决了查询与文档编码的不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20116 2026-07-23 cs.CV 新提交 50%

RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs

RIM:无人机跨域全局视觉定位的检索匹配框架

Xin Li, Siyuan Duan, Shang Wang, Zhimin Mao, Bingliang Hu, Geng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 检索器与排序 :retriever(abstract)

AI总结 研究无人机跨域全局视觉定位问题,提出检索匹配框架RIM,通过采样参考视图、两阶段微调SALAD及冻结检索器蒸馏解码器等方法,在多数据集零样本评估中表现出色,建立了高效可部署的定位管道。

Comments 56 pages, 10 figures, and 18 tables. Supplementary material is included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19115 2026-07-22 cs.CV 新提交 50%

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 检索器与排序 :retriever(abstract)

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏