Intrinsic Evaluation of RAG Systems for Deep-Logic Questions
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);knowledge retrieval(abstract);分类 cs.AI
RMIT-ADM+S在MMU-RAG NeurIPS 2025比赛中的表现
机构 * RMIT University(皇家墨尔本理工大学)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 RMIT-ADM+S系统通过Routing-to-RAG架构在NeurIPS 2025 MMU-RAG比赛中获胜,实现了高效检索增强生成和复杂科研任务处理。
Comments MMU-RAG NeurIPS 2025 winning system
TeachMateGPT:面向科学课程材料的多智能体知识基教学评估生成框架
机构 * Ahsanullah University of Science and Technology(阿赫桑乌拉科技大学) ; American International University - Bangladesh(孟加拉国美国国际大学) ; Jashore University of Science and Technology(杰索尔科技大学)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 TeachMateGPT作为多智能体知识基框架,通过四项改进解决现有RAG系统局限,生成的科学评估题提升了忠实度与相关性,相关数据集经教师评分验证。
DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL
AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。
Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes
RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标
机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) ; Cisco Systems(思科系统公司) ; Zaitra s.r.o.(扎伊特拉有限公司) ; NaiveNeuron(天真神经元)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。
Comments SemEval-2026 Task 1
当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。
小脑袋,大成就:探索紧凑型语言模型
机构 * Siberian Neuronets LLC(西伯利亚神经网络有限公司)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本研究探索小型语言模型在检索增强生成(RAG)系统中的生成性能,实验表明无需GPU即可在设备上运行,并提供了基准测试结果。
Comments Accepted to ECML PKDD 2026, Applied Data Science track. Author preprint; the definitive version will appear in the proceedings of ECML PKDD 2026, Springer LNCS
MedMeta:用于从医学研究中合成元分析结论的LLM基准测试
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。
用法律问题树准则评估法律推理轨迹
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; LBOX ; Stanford(斯坦福) ; Yale(耶鲁)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出 LEGIT 数据集,用于评估 LLM 在法律领域推理轨迹的质量,发现法律问题覆盖度和正确性影响 LLM 推理能力,RAG 和带准则的 RL 分别提升整体能力与正确性。
Comments ACL 2026 Main Conference
面向领域特定RAG系统的AI评估:AgriHubi案例研究
机构 * Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 AgriHubi通过整合芬兰农业文档与开放模型,结合来源 grounding 和用户反馈,提升了农业决策支持系统的回答完整性、语言准确性和可靠性。
Comments 6 pages, 2 figures, submitted to MIPRO 2026
Journal ref 2026 49th MIPRO ICT and Electronics Convention (MIPRO), Opatija, Croatia, pp. 989-994
基于RAG驱动的多智能体LLM框架与任务分解的超越5G自动配置
专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)
AI总结 提出一种检索增强和任务分解的多智能体LLM框架,通过语义检索和模块化架构减少幻觉,实现超越5G网络自动配置,成功率达94.4%。
Comments 6 pages, 2 figures, accepted to International Conference on Telecommunications 2026
自适应分块:为RAG优化分块方法选择
机构 * Ekimetrics
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出自适应分块框架,通过五个新指标优化分块策略,提升RAG性能,使答案正确率提升至72%,问题解答数增加30%。
Comments Accepted at LREC 2026. 10 pages, 4 figures. Code: https://github.com/ekimetrics/adaptive-chunking
OpenDecoder: 开源大型语言模型解码以纳入文档质量在RAG中
机构 * Clemson University(克莱姆森大学) ; University of Notre Dame(诺特丹大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Waseda University(早稻田大学)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 OpenDecoder通过整合文档质量评估提升RAG模型的鲁棒性,利用相关性、排序和QPP评分优化生成过程。
Comments Accepted by ACM WWW 2026
量化RAG-LLM中的文档影响
机构 * Department of Computer Science(计算机科学系) ; Umiacs ; University of Maryland(马里兰大学) ; College Park MD
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出影响评分(IS)用于量化RAG-LLM中单个文档对输出的影响,通过实验验证其有效性,提升系统透明度和可靠性。
FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。
机构 * College of Engineering and Computing(工程与计算学院) ; George Mason University(乔治·马歇尔大学)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Currently under review
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted by CIKM 2025
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Duke University(杜克大学) ; Sai University(赛大学)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted at EMNLP 2025 Demo
机构 * Naseej Innovation Lab, Naseej for Technology(Naseej创新实验室,Naseej技术)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
机构 * University of Waterloo(滑铁卢大学) ; Snowflake(Snowflake公司) ; Microsoft(微软公司)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted at SIGIR 2025 (short)
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted for publication in ICML 2024 Workshop on Foundation Models in the Wild
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments NAACL 2024
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI;retrieval augmented generation(journal_ref)
Journal ref 2024 KDD Cup Workshop for Retrieval Augmented Generation at the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL
Comments Accepted at the 1st Workshop on GenAI and RAG Systems for Enterprise, CIKM'24. 6 pages
GRIP:基于信息受限前提的接地推理
机构 * University of Waterloo(滑铁卢大学)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 针对RAG中查询主导导致证据失效的问题,提出GRIP方法,通过容量不对称设计优化信息编码,在五个推理基准上实现性能提升,大幅降低互信息与幻觉。
Comments 15 pages, 3 figures
PICopilot:一种基于大语言模型的智能体框架,通过脚本生成辅助光子集成芯片设计
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 PICopilot是首个基于LLM的智能体框架,通过带反馈机制的多智能体架构与专用RAG流程,成功完成全部48项PIC脚本任务,性能优于其他LLM方法及通用RAG的GPT-5。
Comments 9 pages, 6 figures