ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments NAACL 2024
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments NAACL 2024
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI;retrieval augmented generation(journal_ref)
Journal ref 2024 KDD Cup Workshop for Retrieval Augmented Generation at the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL
Comments Accepted at the 1st Workshop on GenAI and RAG Systems for Enterprise, CIKM'24. 6 pages
评估针对大语言模型生成代码中包幻觉的推理时防御措施
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。
Comments Accepted ASE 2026
用于乳腺癌多学科团队会议的边缘人工智能医疗设备系统的开发与可行性评估
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 该研究开发了基于边缘AI的乳腺癌MDT会议系统,利用开源ASR、LLM和RAG实现设备上运行,经评估其ASR与RAG性能优异,证明了该系统的可行性。
用于磁共振引导放疗的扩散加权成像处理与解释一体化平台
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 该研究开发了一体化网络平台,整合MR-Linac的DWI后处理与可追溯的RAG临床解释,经专家评分验证其在胶质母细胞瘤病例中具有高临床实用性。
Comments 29 pages
GRIP:基于信息受限前提的接地推理
机构 * University of Waterloo(滑铁卢大学)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 针对RAG中查询主导导致证据失效的问题,提出GRIP方法,通过容量不对称设计优化信息编码,在五个推理基准上实现性能提升,大幅降低互信息与幻觉。
Comments 15 pages, 3 figures
PICopilot:一种基于大语言模型的智能体框架,通过脚本生成辅助光子集成芯片设计
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 PICopilot是首个基于LLM的智能体框架,通过带反馈机制的多智能体架构与专用RAG流程,成功完成全部48项PIC脚本任务,性能优于其他LLM方法及通用RAG的GPT-5。
Comments 9 pages, 6 figures
RF-Agent:用于构建射频集成电路设计语言代理的实用框架
机构 * Rice University(莱斯大学) ; The George Washington University(乔治·华盛顿大学)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。
Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026
MamaBench:通过反事实临床扰动对母婴健康诊断中的大语言模型稳健性进行基准测试
机构 * Helpmum Africa(非洲帮助妈妈组织) ; University of Ibadan(伊巴丹大学)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 研究针对大语言模型在母婴健康诊断中缺乏对临床相似表现区分能力的问题,提出MamaBench基准及EA - RAG方法,通过实验揭示基础准确率高估稳健准确率现象,EA - RAG有效降低BTR,提升稳健准确率,为临床人工智能反事实稳健性研究提供参考。
基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。
Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
机构 * KR Labs(KR实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学) ; TU Wien(维也纳工业大学)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。
Comments 8 pages
面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型
机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) ; Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) ; Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。
FasterPy:基于大语言模型的代码执行效率优化框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院) ; School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) ; School of Computer Science, Central China Normal University(中央中国师范大学计算机学院) ; School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机学院) ; School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出FasterPy框架,结合检索增强生成(RAG)和低秩适应(LoRA)技术,利用大语言模型自动优化Python代码执行效率,在PIE基准上超越现有方法。
Comments 38 pages, 5 images, 14 tables, Manuscript revision submitted to a Journal (2026)
FactoryLLM:用于评估智能工厂中大语言模型的安全开源AI实验场
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出FactoryLLM,一个安全开源的AI实验场,通过多机器文档分析评估基于RAG的大语言模型,采用RAGAS和NVIDIA LLM-as-a-Judge双评估机制,案例验证了跨机器文档推理的有效性。
Comments 6 pages, 3 figures, IEEE INDIN 2026
SafeLLM: 在安全关键场景中,提取作为重写的抗幻觉替代方案
机构 * Institute of Health Informatics, University College London(伦敦大学学院健康信息学研究所) ; National Hospital for Neurology and Neurosurgery(国家神经内科与神经外科医院) ; Somerset NHS Foundation Trust(萨默塞特NHS基金会信托) ; King's College Hospital(国王学院医院) ; King's College London(伦敦国王学院)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 提出将提取作为重写型RAG的抗幻觉替代方案,通过行号选择策略在安全关键文档中实现高召回(95%)和低幻觉,优于直接复制和安全导向方法。
EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件
机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ; ETH Zurich(苏黎世联邦理工学院) ; Autom8.build
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。
Comments 26 pages, 10 figures, to be published at IDETC 2026
KompeteAI:面向机器学习问题端到端流水线生成的加速自主多智能体系统
机构 * Research Center of the Artificial Intelligence Institute(人工智能研究所研究中心) ; Innopolis University(因诺波利斯大学) ; Sberbank of Russia(俄罗斯Sberbank) ; AI4S Center(AI4S中心) ; MIPT(莫斯科国立信息安全大学) ; Steklov Institute(斯捷克洛夫研究所)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 KompeteAI通过动态探索解决方案空间和整合RAG技术,提升了AutoML的探索效率与执行速度,实现6.9倍的流水线评估加速,并在MLE-Bench基准上超越主流方法3%。
RAG中多态性女巫中毒的故障模式基准测试
机构 * Department of Computer Engineering(计算机工程系) ; Dongguk University(东国大学)
专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL、cs.AI
AI总结 该研究发布了用于问答的基准测试和评估框架,划分读者输出类别,介绍多态性女巫中毒攻击,通过对比揭示其危害,还发布了冻结基准、评估工具等。
Comments 17 pages, 2 figures, 11 tables. Corresponding author: Juntae Kim. Dataset and code to be released upon publication
AOP-Smart:一种增强检索的大型语言模型框架用于不良后果路径分析
机构 * Nanyang Normal University(南阳师范学院)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AOP-Smart框架,通过检索增强生成技术提升大型语言模型在不良后果路径分析中的可靠性与准确性,实验表明其显著缓解了模型幻觉问题。
印地语方言偏见评估:整合基于RAG的翻译和人类增强的RLAIF的多阶段框架
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一个多阶段框架,通过基于RAG的翻译和人类增强的RLAIF评估九种印地语方言的偏见。研究发现方言差异导致性能下降,模型规模增加不总是缓解偏见。
Comments 12 pages, 1 figure, 5 tables
TempPerturb-Eval: 关于RAG鲁棒性中内部温度与外部扰动的联合影响
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了RAG系统中内部温度与外部扰动的交互影响,提出分析框架并展示实验结果,揭示高温度设置加剧扰动敏感性,提出评估基准和调参指南。
Comments LREC 2026, Palma, Mallorca (Spain), 11-16 May 2026
RAGXplain: 从可解释评估到RAG流水线的可操作指导
机构 * Wix.com AI Research(Wix.com人工智能研究)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
AI总结 RAGXplain通过'指标钻石'框架将性能指标转化为可操作指导,利用LLM生成自然语言失败模式解释,提升RAG流水线性能。
混合意图感知个性化:结合机器学习和RAG增强的大语言模型用于金融服务营销
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
AI总结 本文提出一种混合架构,结合传统机器学习与RAG增强的大语言模型,用于金融服务营销中的个性化营销,通过时间编码器、潜在表示和多任务分类提高个性化准确性。
Comments 18 pages, 5 figures, 3 tables. Applied ML systems paper. The contribution is architectural rather than algorithmic
CTRL-RAG:基于对比似然奖励的强化学习用于上下文忠实的RAG模型
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 CTRL-RAG通过对比似然奖励机制提升RAG模型的上下文忠实性,结合内部与外部奖励框架,在多个基准测试中表现优异。
基于概率距离的LLM中幻觉检测方法(RAG)
机构 * Markov Lab, Department of Mathematics(马尔可夫实验室,数学系) ; Computer Science, Saint-Petersburg University(计算机科学,圣彼得堡大学) ; AI Center, Skoltech(人工智能中心,斯克里普丘克技术学院) ; SB AI Lab(SB人工智能实验室) ; AI Center, Skoltech, Risk department, Sber(人工智能中心,斯克里普丘克技术学院,风险部门)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种基于概率距离的LLM幻觉检测方法,利用提示标记与响应标记嵌入分布的距离来检测幻觉,具有高效性和可迁移性。
Comments Updated approach to constructing a hallucination detection score. Added results from experiments with the NLI task. The approach with trainable deep kernels has been removed, with a focus on the unsupervised approach
面向企业级RAG系统的案例感知LLM-as-a-Judge评估
机构 * Dell Technologies(戴尔技术)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。
Comments 12 pages including appendix, 6 figures
通过检索增强生成增强科学文献聊天机器人:向量和图基系统性能评估
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.AI
AI总结 本文通过对比向量和图基检索系统,评估了检索增强生成在提升科学文献聊天机器人性能中的效果,展示了混合系统在提高科学知识可及性方面的潜力。
基于Jensen-Shannon散度的响应归因研究:一种驱动上下文归因的机理研究
机构 * University of Aberdeen(阿伯丁大学) ; Nanyang Technological University(南洋理工大学) ; University College London(伦敦大学学院) ; University of Colorado Anschutz Medical Campus(科罗拉多大学安舒兹医学校区) ; University of Sheffield(谢菲尔德大学)
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于Jensen-Shannon散度的ARC-JSD方法,实现高效准确的上下文归因,提升RAG模型的性能和效率。
Comments Accepted at ICLR 2026; Best Paper Award at COLM 2025 XLLM-Reason-Plan Workshop; Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop
多模态制造安全聊天机器人:知识库设计、基准开发及多种RAG方法的评估
机构 * Farmer School of Business, Miami University(Miami大学农业商学院) ; Department of Computer Science and Software Engineering, Miami University(Miami大学计算机科学与软件工程系) ; Department of Engineering Technology, Miami University(Miami大学工程技术系) ; Department of Mechanical and Manufacturing Engineering, Miami University(Miami大学机械与制造工程系) ; Department of Industrial and Systems Engineering, University at Buffalo(University at Buffalo工业与系统工程系)
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
AI总结 本文提出了一种多模态制造安全聊天机器人,通过RAG方法实现高准确率、低延迟和低成本的安全培训,展示了其在工业5.0环境中的应用价值。
Comments 25 pages, 5 figures