Robustness of IR Models to Collection Growth
信息检索模型对集合增长的鲁棒性
专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL
AI总结 本研究探究IR模型对集合增长的鲁棒性,将模型分为MDA和MDD两类,发现两类模型均无法完全抵御非相关文档添加带来的性能下降,且MDA检索器效果优于MDD,二者重排序器效果相当。
Comments CIKM 2026 Short Paper track
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
信息检索模型对集合增长的鲁棒性
专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL
AI总结 本研究探究IR模型对集合增长的鲁棒性,将模型分为MDA和MDD两类,发现两类模型均无法完全抵御非相关文档添加带来的性能下降,且MDA检索器效果优于MDD,二者重排序器效果相当。
Comments CIKM 2026 Short Paper track
超级智能检索代理:代理检索的下一个前沿
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; Rice University(里士满大学)
专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI
AI总结 提出SIRA,通过单次语料判别性检索压缩多轮探索,利用LLM丰富文档词汇、预测查询缺失词汇并基于语料统计过滤,在BEIR基准上取得最强平均检索性能,并在下游QA任务中超越RL训练的代理系统。
HiQA:一种用于多文档问答的分层上下文增强检索与生成模型
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Southeast University(东南大学) ; Hello World(Shanghai) Technology Co., Ltd.(Hello World(上海)科技有限公司)
专题命中 知识库问答 :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.CL、cs.AI
AI总结 针对检索增强生成在多文档问答中面对大量相似文档时检索准确性有限的问题,提出HiQA框架,它集成级联元数据与多路径检索机制,还发布MasQA基准,在多文档环境中展现了最优性能。
Comments Metadata correction: the arXiv author metadata has been updated to include Xinjian Chen, consistent with the author list already present in the v3 manuscript files. The manuscript content is unchanged
MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试
专题命中 知识库问答 :retrieval-augmented generation(abstract);RAG(abstract_cn);分类 cs.CL
AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。
Comments Accepted to EMNLP 2026 Main Conference
训练知识库:智能体策划文档存储的监督结构学习
机构 * University of Nebraska–Lincoln(内布拉斯加大学林肯分校)
专题命中 知识库问答 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 该研究提出监督式结构学习方法训练知识库,以智能体策划文档存储,提升动作效率与准确率,其泛化性与键覆盖相关,欠训练的存储可通过增加训练问题进一步优化。
Comments 10 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026
检索效果更好,鲁棒性更差:多跳检索增强生成(RAG)如何放大上游自动语音识别(ASR)错误
机构 * Continuum AI
专题命中 长文档RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);dense retrieval(abstract);分类 cs.IR、cs.CL
AI总结 该研究探究多跳RAG的实体图链接、迭代重述两种扩展方式对上游ASR错误的影响,发现二者会放大错误,其组合使F1差距增大36%-67%,实体损坏是主要失效模式,轻量缓解措施效果有限。
Comments Accepted to EMNLP 2026 (Main Conference)
函数调用中结构化输出增益的归因:接口对齐与过程转移
专题命中 图谱与结构化RAG :RAG(abstract)
AI总结 研究结构化输出基准中提示诱导函数调用增益的归因,介绍四层增益归因协议,应用于相关数据集得出部分增益源于接口对齐而非过程转移的结论,并发布相关资源。
Comments 18 pages, 5 figures
EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件
机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ; ETH Zurich(苏黎世联邦理工学院) ; Autom8.build
专题命中 RAG评测 :RAG(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。
Comments 42 pages, 17 figures, 15 tables. Extended version of work presented at the ASME 2026 International Design Engineering Technical Conferences and Computers and Information in Engineering Conference (IDETC-CIE 2026), Houston, Texas, USA, August 23-26, 2026. Submitted to the ASME Journal of Mechanical Design
PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; IBM, New York(IBM,纽约)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。
Comments 23 pages, 3 figures
MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准
机构 * Seoul National University College of Medicine(首尔国立大学医学院) ; Seoul National University(首尔国立大学) ; Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。
Comments 19 pages, 7 figures, 18 tables. Accepted to Findings of EMNLP 2026