arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 372 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 372 篇

2607.24800 2026-07-29 cs.IR cs.AI cs.CL 新提交 67%

When Thinking Before Retrieval Hurts: TraceBound Diagnostics for Adaptive Knowledge-Graph Retrieval

当检索前思考有害时:用于自适应知识图谱检索的TraceBound诊断

Partha Sarathi Purkayastha

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究知识图谱自适应检索中“检索前思考”有害问题,引入TraceBound诊断协议,它能暴露查询配置文件等。实验表明虽改善可检查性,但降低检索质量,通过分析定位退化原因,指出应将其作为动作选择控制问题评估。

Comments 11 pages, 4 figures, 15 tables. Accepted at the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10994 2026-07-14 cs.LG 新提交 67%

A Multi-Agent Framework for Zero-Dimensional Reduced-Order Model Planning

用于零维降阶模型规划的多智能体框架

Bingteng Sun, Hao Yin, Yiling Chen, Renjie Xiao, Lei Xie, Shanyou Wang, Ruonan Wang, Shubao Chen, Qingzong Xu, Lin Lu, Qiang Du, Junqiang Zhu

机构 * Institute of Engineering Thermophysics, Chinese Academy of Sciences(中国科学院工程热物理研究所) National Key Laboratory of Science and Technology on Advanced Light-duty Gas-turbine(先进轻型燃气轮机技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Qingdao Institute of Aeronautical Technology(青岛航空技术研究院) Nanjing Future Energy System Research Institute(南京未来能源系统研究院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文针对复杂零维降阶模型规划中依赖人工、传统方法局限等问题,提出多智能体架构Z-COPA,其核心是专用图表示法,将规划转化为图结构优化问题,经多基准测试验证,该框架性能卓越且打破传统范式,提供新规划技术方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交 67%

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 检索器与排序 :retrieval augmented generation(abstract);retriever(abstract)

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05968 2026-07-08 cs.CL cs.AI cs.IR 新提交 67%

InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost

InfluMatch:以4B模型成本实现前沿质量的关键意见领袖搜索

Krittanon Kaewtawee, Petmongkon Pornpichitsuwan, Natchaya Temyingyong, Nutnicha Laplamoon, Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究如何将关键意见领袖与泰国营销标准匹配,提出低成本三阶段级联InfluMatch,由小型开放权重模型构建,能以低得多的成本达到前沿模型效果,是可部署、可解释的KOL搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00798 2026-07-02 cs.CV 新提交 67%

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction

ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测

Yaofei Duan, Yuhao Huang, Tianyu Zhang, Yuan Gao, Luyi Han, Xin Wang, Xinyu Xie, Xinglong Liang, Chunyao Lu, Muzhen He, Patrick Pang, Yue Sun, Ning Mao, Tao Tan, Ritse Mann

机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19911 2026-06-19 cs.AI cs.CL cs.IR 新提交 67%

Multi-Agent Transactive Memory

多智能体交互记忆

To Eun Kim, Xuhong He, Dishank Jain, Ambuj Agrawal, Negar Arabzadeh, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出MATM框架,通过共享存储和检索智能体轨迹,实现异构智能体群体间的知识复用,提升下游任务性能并减少交互步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18467 2026-06-18 stat.ML cs.LG 新提交 67%

ToolChain-CRC: Conformal Risk Control for Agentic AI Under Retrieval and Tool-Use Drift

ToolChain-CRC: 检索与工具使用漂移下代理型AI的共形风险控制

Jeffery Opoku, David Banahene

机构 * The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) Florida International University(佛罗里达国际大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn)

AI总结 针对检索增强和工具使用代理在漂移下的风险控制问题,提出ToolChain-CRC方法,通过构建轨迹级风险评分并校准接受或干预规则,实现可证明的轨迹级风险控制。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17910 2026-06-17 cs.IR cs.AI cs.CL 新提交 67%

Non-negative Elastic Net Decoding for Information Retrieval

非负弹性网络解码用于信息检索

Koki Okajima, Yasutoshi Ida, Tsukasa Yoshida, Yasuaki Nakamura

机构 * NTT, Inc(NTT公司)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出非负弹性网络(NNN)解码方法,将检索视为联合解码问题,通过稀疏非负线性组合重构查询嵌入,在理论上严格优于稠密检索,实验表明在多个基准上取得一致改进。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16918 2026-08-19 cs.IR cs.AI 新提交 62%

Sparse Coverage: Semantic Center Representations for Patent Prior-Art Retrieval

稀疏覆盖:用于专利现有技术检索的语义中心表示

You Zuo, Kim Gerdes, Éric de la Clergerie, Benoît Sagot

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 针对专利现有技术检索的长文档特性,提出无监督语义检索框架Sparse Coverage,采用面向覆盖的k中心目标生成稀疏表示,在CLEF-IP 2013实验中其文档级召回率优于或媲美稠密专利编码器,可作为专利检索的有效第一阶段方法。

Journal ref CORIA-TALN 2026 - 21e Conf{é}rence en Recherche d'Information et Applications (CORIA), Jun 2026, Nantes, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16071 2026-08-18 cs.CL cs.IR 新提交 62%

Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval

Skill2Query:利用技能结构生成智能体技能检索的伪查询

Lihui Ding, Zihan Guo, Bingwei Lu, Chenyu Zhou, Yuanjian Zhou, Weinan Zhang, Jianghao Lin, Dongdong Ge

机构 * Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 Skill2Query是利用技能知识图谱生成伪查询的框架,可提升多类检索性能,生成的训练数据表现最优,还能提高智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14580 2026-08-18 cs.AI cs.IR 新提交 62%

OGX: An Open-Source, Vendor-Neutral Generative AI Application Server

OGX:开源、厂商中立的生成式AI应用服务器

Francisco Javier Arceo, Sébastien Han, Matthew Farrellee, Charlie Doern, Yuan Tang, Derek Higgins, Varsha Prasad Narsing, Gordon Sim, Sumanth Kamenani, Ben Browning, Raghotham Murthy

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 OGX是开源厂商中立的生成式AI应用服务器,支持主流实验室API与多后端,为多款AI开发者工具提供模型无关自托管后端,获超8400 GitHub星标

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13004 2026-08-14 cs.CL cs.IR 新提交 62%

HybridRAG-BN: A Retrieval-Augmented Framework with Fine-Tuned Verification for Bangla KBQA

HybridRAG-BN:面向孟加拉语知识库问答的带微调验证的检索增强框架

Rathijit Aich, Nirjhar Das, Mahfuzulhoq Chowdhury

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.IR、cs.CL

AI总结 针对孟加拉语KBQA的低资源挑战,提出HybridRAG-BN框架,整合混合检索、答案生成与LoRA微调的验证模块,经实验获竞赛双排行榜第一。

Comments Developed for the IEEE Computer Society CUET Student Branch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07622 2026-08-11 cs.AI cs.IR cs.LG 新提交 62%

Controlled Memory Interference in Continual LLM Agents

持续大型语言模型智能体中的可控记忆干扰

Ao Ding, Hongzong LI, Shiqin Tang, Li Zhang, Liang Chen, Xuyang Chen, Zi Liang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Northwestern Polytechnical University(西北工业大学) The Hong Kong University of Science and Technology(香港科技大学) Chinese Academy of Sciences(中国科学院) The Hong Kong Polytechnic University(香港理工大学) École polytechnique fédérale de Lausanne(洛桑联邦理工学院) National University of Singapore(新加坡国立大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 本研究提出可控记忆干扰(CMI)框架,揭示记忆进化受经验相互作用影响,为持续大型语言模型智能体的记忆系统提供诊断与学习方法,提升记忆更新区分度与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05151 2026-08-07 cs.CL cs.AI 新提交 62%

Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support

面向工业因果推理的模拟器驱动大语言模型:用于污水处理决策支持的工具使用、结构化注入及工厂可迁移检索

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University(奥尔堡大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 该研究对比三种适配Qwen2.5-32B-Instruct模型的方法,在污水处理因果问答任务中,DRR检索器兼具高准确率、跨工厂迁移能力及训练高效性,优于其他方法与基线。

Comments 20 pages, 2 figures, 8 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00452 2026-08-04 cs.IR cs.AI 新提交 62%

CeQe: Grounding Lexical Retrieval in Semantic Evidence

CeQe:在语义证据中实现词汇检索

Adam Kahirov, Umesh Deshpande, Swaminathan Sundararaman

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 针对BM25的语义词汇鸿沟问题,本文提出CE-QE方法,利用交叉编码器的语义检索结果扩展BM25查询,在多个BEIR数据集上显著提升检索性能且不修改底层索引。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27766 2026-07-31 cs.CL cs.IR cs.LG 新提交 62%

Gradient-free Task-Conditioned Retrieval for On-Device In-Context Learning

面向设备内上下文学习的无梯度任务条件检索

Xinyu Luo, Hui Liu, Yihua Shao, Junyi Yang, Arindam Basu, Haoliang Li

机构 * City University of Hong Kong(香港城市大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 该研究提出无梯度框架CoRA,实现设备内任务条件检索,无需检索器微调等操作,在多数据集及树莓派5部署中展现有效性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26070 2026-07-30 cs.IR cs.AI 新提交 62%

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

SimpleWikiSearch:用于智能体搜索的简洁离线维基百科环境

Guanming Xiong, Penghui Zhang

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 SimpleWikiSearch是一套明确可运行的离线维基百科环境,用于智能体搜索的可复现评估,提供基线结果及对比闭源模型的子集,而非提出新智能体算法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20430 2026-07-24 cs.CL cs.AI 新提交 62%

LLM-INSTRUCT at UZH Shared Task 2026: Constraint-Aware Retrieval and Selective Debate for Paragraph-Level Argument Mining

LLM-INSTRUCT在UZH 2026共享任务中的应用:用于段落级论证挖掘的约束感知检索和选择性辩论

Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

机构 * Vietnamese-German University(越南-德国大学) RMIT University Vietnam(皇家墨尔本理工大学越南分校) VANGIA INNOVATIONS(VANGIA创新公司)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍了在UZH 2026共享任务中用于段落级论证挖掘的获胜系统LLM-INSTRUCT,通过元数据感知检索、约束解码等方法缩小决策空间,提高了准确性和提交稳健性,在官方排行榜上取得优异成绩。

Comments Accepted to the 13th Workshop on Argument Mining (ArgMining 2026) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18756 2026-07-22 cs.IR cs.CL 新提交 62%

RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency

RAGAL:政府机构技术支持的节俭型全本地检索增强助手

Dan Musetoiu

机构 * IT Department, Agency for Financing Rural Investments (AFIR)(金融农村投资机构信息部)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 针对公共机构数据不能流出的限制,开发RAGAL检索增强助手。在特定语料库上验证,检索工程和微调效果好,记录单域微调问题及解决方法,还有两个发现和全嵌入器微调方法,最后介绍零流出下的替代评判方案并开源脚本。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17598 2026-07-21 cs.AI cs.CL cs.SE 新提交 62%

Is Progressive Disclosure All You Need for Long-Context Agents?

长上下文智能体仅靠渐进式披露就够了吗?

Yifeng He, Yinzhe Zhao, Jicheng Wang, Hao Chen

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 研究长文档问答中智能体获取文档路径自行决定读取内容的模式,通过对照研究,在InfiniteBench上对比原始文档导航、Agent Skills包设计与经典混合检索器,发现不同情况下各方法表现不同,渐进式披露在语料库大时作用关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14115 2026-07-17 cs.AI cs.CL cs.CV 新提交 62%

DialogueVPR: Towards Conversational Visual Place Recognition

DialogueVPR:迈向对话式视觉场所识别

Yukun Song, Changwei Wang, Xingtian Pei, Shibiao Xu, Wenhao Xu, Shunpeng Chen, Yu Zhang, Ke Zhang, Rongtao Xu, Xuxiang Feng, Pengyang Wang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Shandong Computer Science Center, Qilu University of Technology(山东省计算中心(国家超级计算济南中心),齐鲁工业大学) Macquarie University(麦考瑞大学) Spatialtemporal AI(时空人工智能公司) University of Macau(澳门大学) Aerospace Information Research Institute(航天信息研究所)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 研究针对语言引导地理定位中现有方法不足,提出DlgPR,将场所识别转为对话驱动推理过程。构建DlgQuest-Cities基准及统一推理框架,用课程训练DQ-pilot,通过特定指标指导学习并实验,该方法显著优于基线。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05441 2026-07-08 cs.IR cs.AI 新提交 62%

PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models

PORTS:用于大语言模型工具选择的偏好优化检索器

Lorenzo Molfetta, Giacomo Frisoni, Nicolò Monaldini, Gianluca Moro

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 研究针对大语言模型工具选择中现有检索器与LLMs不一致问题,提出PORTS方法,利用受困惑度启发的偏好信号,通过优化相关性及施加对比语义损失微调检索器,经多实验验证其通用性及提高工具选择准确性的能力,且计算需求低便于推广。

Comments Please cite the definitive, peer-reviewed version of this article published in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, edited by Christos Christodoulopoulos et al., Association for Computational Linguistics, pp. 10007-10030, 2025. DOI: https://doi.org/10.18653/v1/2025.emnlp-main.507

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, pp. 10007-10030, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04088 2026-07-07 cs.IR cs.AI 新提交 62%

Submitted and Diagnostic Analysis of Full-Text Temporal Retrieval for LongEval-Sci

LongEval-Sci的全文时间检索的提交与诊断分析

Yingdong Yang, Haijian Wu

机构 * CLEF 2026

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 研究LongEval-Sci科学检索,比较多种方法与基线。全文检索是基础,时间整合可提升官方纵向有效性,引用证据待优化。还报告基于摄取速度和陈旧覆盖漂移的定性每周IR系统更新监测分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00004 2026-07-02 cs.IR cs.AI cs.LG 新提交 62%

Why Advanced Encoders Lag on Sparse Retrieval? The Answer and an Approach to Bridging Vocabulary Gaps

为什么高级编码器在稀疏检索上落后?答案及弥合词汇鸿沟的方法

Zhichao Geng, Yang Yang

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 发现高级编码器在稀疏检索中落后于旧模型的原因是词汇鸿沟:现代分词器使用原始、区分大小写的词汇表导致语义单元冗余。提出词汇迁移框架,通过语义初始化和激活势校准解决该问题,在BEIR上取得SOTA性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24841 2026-06-24 cs.AI cs.CL 新提交 62%

Matching Tasks to Objectives: Fine-Tuning and Prompt-Tuning Strategies for Encoder-Decoder Pre-trained Language Models

匹配任务与目标:编码器-解码器预训练语言模型的微调和提示调优策略

Ahmad Pouramini, Hesham Faili

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 提出MTO框架,通过匹配任务与预训练目标,在少样本和全数据集场景下显著提升编码器-解码器模型的生成与问答性能,性能增益超120%。

Journal ref Appl Intell 54(20):9783-9810, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23937 2026-06-24 cs.CL cs.AI cs.LG 新提交 62%

When Retrieval Metrics Mislead: Measuring Policy Signal in Long-Horizon Tool-Use Agents

当检索指标误导:衡量长周期工具使用智能体中的策略信号

Tianyu Ding, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 研究发现精确匹配的检索召回率会低估下游策略效用,通过分类器实验表明检索到的策略子句与黄金子句在宏F1上无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22778 2026-06-23 cs.IR cs.CL 新提交 62%

HAKARI-Bench: A Lightweight Benchmark for Comparing Retrieval Architectures and Efficiency Settings under Unified Conditions

HAKARI-Bench:统一条件下比较检索架构和效率设置的轻量级基准

Yuichi Tateno

机构 * MIT License(MIT许可证)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 提出HAKARI-Bench轻量级基准,通过重构现有检索套件为统一格式的小型数据集,实现五种检索家族及其效率变体的同条件比较,在排名上高保真复现MTEB等大型基准。

Comments 48 pages. Code and leaderboard: https://huggingface.co/spaces/hakari-bench/leaderboard https://github.com/hakari-bench/hakari-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18801 2026-06-18 cs.IR cs.AI 新提交 62%

SHIFT: Semantic Harmonization via Index-side Feature Transformation for Multilingual Information Retrieval

SHIFT: 通过索引侧特征变换实现多语言信息检索的语义对齐

Youngjoon Jang, Seongtae Hong, Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 提出SHIFT方法,在索引阶段通过平行翻译对估计相对语言向量并修正文档嵌入,以缓解多语言密集检索中的语言偏差,无需训练即可提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18717 2026-06-18 cs.CL cs.AI 新提交 62%

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish

Morpheus: 一种面向土耳其语的形态感知神经分词器和词嵌入器

Tolga Şakar

机构 * Independent Researcher(独立研究者)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语粘着特性,提出Morpheus神经词素边界模型,实现无损可逆分词与结构化词嵌入,在可逆分词器中达到最低比特每字符(1.425),词素对齐F1提升至0.61,GPU内存节省约19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17664 2026-06-17 cs.IR cs.AI 新提交 62%

Temporal Preference Optimization for Unsupervised Retrieval

面向无监督检索的时间偏好优化

HyunJin Kim, Jaejun Shim, Young Jin Kim, JinYeong Bak

机构 * Microsoft, Redmond, USA(微软公司,美国红mond) Sungkyunkwan University, Suwon, South Korea(成均馆大学,韩国首尔)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 提出TPOUR方法,通过时间检索偏好优化(TRPO)和可学习时间嵌入插值,使无监督稠密检索器能捕捉时间相关性,在时间信息检索任务上超越有监督和无监督基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏