arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1212 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1212 篇

2601.02522 2026-01-13 cs.SE 82%

On the Effectiveness of Proposed Techniques to Reduce Energy Consumption in RAG Systems: A Controlled Experiment

在RAG系统中减少能耗的所提技术有效性:一项受控实验

Zhinuan Guo, Chushu Gao, Justus Bogner

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

AI总结 本研究通过受控实验评估了五种减少RAG系统能耗的技术,发现调整检索阈值和减少嵌入尺寸能有效降低能耗与延迟,同时保持准确率。

Comments Accepted for publication at the 2026 International Conference on Software Engineering: Software Engineering in Society (ICSE-SEIS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06779 2026-01-13 cs.CR 82%

CyberLLM-FINDS 2025: Instruction-Tuned Fine-tuning of Domain-Specific LLMs with Retrieval-Augmented Generation and Graph Integration for MITRE Evaluation

CyberLLM-FINDS 2025:基于检索增强生成和图集成的领域特定LLM指令微调方法用于MITRE评估

Vasanth Iyer, Leonardo Bobadilla, S. S. Iyengar

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract)

AI总结 本文提出了一种基于检索增强生成和图集成的领域特定LLM微调方法,通过STIX威胁情报实现与MITRE ATT&CK技术的对齐,提升网络安全威胁情报分析的准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12043 2025-11-18 cs.CR 82%

BudgetLeak: Membership Inference Attacks on RAG Systems via the Generation Budget Side Channel

Hao Li, Jiajun He, Guangshuo Wang, Dengguo Feng, Zheng Li, Min Zhang

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26160 2025-10-31 cs.CV 82%

CRAG-MM: Multi-modal Multi-turn Comprehensive RAG Benchmark

Jiaqi Wang, Xiao Yang, Kai Sun, Parth Suresh, Sanat Sharma, Adam Czyzewski, Derek Andersen, Surya Appini, Arkav Banerjee, Sajal Choudhary, Shervin Ghasemlou, Ziqiang Guan, Akil Iyer, Haidar Khan, Lingkun Kong, Roy Luo, Tiffany Ma, Zhen Qiao, David Tran, Wenfang Xu, Skyler Yeatman, Chen Zhou, Gunveer Gujral, Yinglong Xia, Shane Moon, Nicolas Scheffer, Nirav Shah, Eun Chang, Yue Liu, Florian Metze, Tammy Stark, Zhaleh Feizollahi, Andrea Jessee, Mangesh Pujari, Ahmed Aly, Babak Damavandi, Rakesh Wanga, Anuj Kumar, Rohit Patel, Wen-tau Yih, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室) Meta Superintelligence Labs(Meta超智能实验室) FAIR, Meta(FAIR,Meta) Meta

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21845 2025-09-29 cs.CV 82%

A Comprehensive Evaluation of Transformer-Based Question Answering Models and RAG-Enhanced Design

Zichen Zhang, Kunlong Zhang, Hongwei Ruan, Yiming Luo

机构 * Machine Learning, ICML(机器学习,ICML)

专题命中 RAG评测 :RAG(title);retrieval-augmented generation(abstract);hybrid retrieval(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13465 2025-09-25 cs.IR cs.AI cs.CL 82%

HawkBench: Investigating Resilience of RAG Methods on Stratified Information-Seeking Tasks

Hongjin Qian, Zheng Liu, Chao Gao, Yankai Wang, Defu Lian, Zhicheng Dou

机构 * Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 RAG评测 :RAG(title,abstract);分类 cs.IR、cs.CL、cs.AI

Comments Neurips 25 DB Track, Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18869 2025-09-24 cs.DC 82%

On The Reproducibility Limitations of RAG Systems

Baiqiang Wang, Dongfang Zhao, Nathan R Tallent, Luanzheng Guo

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04125 2025-08-20 cs.SE cs.CR cs.LG 82%

VulScribeR: Exploring RAG-based Vulnerability Augmentation with LLMs

Seyed Shayan Daneshvar, Yu Nong, Xu Yang, Shaowei Wang, Haipeng Cai

机构 * University of Manitoba(曼尼托巴大学) Washington State University(华盛顿州立大学) University at Buffalo(布法罗大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract)

Comments Accepted by TOSEM; 26 pages, 6 figures, 8 tables, 3 prompt templates, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17347 2025-05-05 cs.SE cs.HC 82%

InspectorRAGet: An Introspection Platform for RAG Evaluation

Kshitij Fadnis, Siva Sankalp Patel, Odellia Boni, Yannis Katsis, Sara Rosenthal, Benjamin Sznajder, Marina Danilevsky

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract)

Comments Published at NAACL2025 Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00105 2025-05-02 cs.IR cs.CL cs.DB 82%

Optimization of embeddings storage for RAG systems using quantization and dimensionality reduction techniques

Naamán Huerga-Pérez, Rubén Álvarez, Rubén Ferrero-Guillén, Alberto Martínez-Gutiérrez, Javier Díez-González

机构 * Department of Mechanical, Computer and Aerospace Engineering(机械、计算机和航空航天工程系)

专题命中 RAG评测 :RAG(title);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.DB

Comments 13 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16883 2025-04-24 cs.HC 82%

Enhancing Critical Thinking with AI: A Tailored Warning System for RAG Models

Xuyang Zhu, Sejoon Chang, Andrew Kuik

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments Presented at the 2025 ACM Workshop on Human-AI Interaction for Augmented Reasoning

Journal ref Proceedings of the 2025 ACM CHI Workshop on Human-AI Interaction for Augmented Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13769 2025-04-21 cs.SE 82%

Detecting Malicious Source Code in PyPI Packages with LLMs: Does RAG Come in Handy?

Motunrayo Ibiyo, Thinakone Louangdy, Phuong T. Nguyen, Claudio Di Sipio, Davide Di Ruscio

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments The paper has been peer-reviewed and accepted for publication to the 29th International Conference on Evaluation and Assessment in Software Engineering (EASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09593 2025-04-18 cs.CR cs.LG 82%

ControlNET: A Firewall for RAG-based LLM System

Hongwei Yao, Haoran Shi, Yidou Chen, Yixin Jiang, Cong Wang, Zhan Qin

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments Project Page: https://ai.zjuicsr.cn/firewall

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21157 2025-04-08 cs.LG 82%

Real-Time Evaluation Models for RAG: Who Detects Hallucinations Best?

Ashish Sardana

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16444 2025-04-07 cs.LG 82%

CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion

Jiayi Yao, Hanchen Li, Yuhan Liu, Siddhant Ray, Yihua Cheng, Qizheng Zhang, Kuntai Du, Shan Lu, Junchen Jiang

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05782 2025-02-11 cs.SE 82%

Quality Assurance for LLM-RAG Systems: Empirical Insights from Tourism Application Testing

Bestoun S. Ahmed, Ludwig Otto Baader, Firas Bayram, Siri Jagstedt, Peter Magnusson

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04476 2024-11-08 cs.LG 82%

LLM-R: A Framework for Domain-Adaptive Maintenance Scheme Generation Combining Hierarchical Agents and RAG

Laifa Tao, Qixuan Huang, Xianjun Wu, Weiwei Zhang, Yunlong Wu, Bin Li, Chen Lu, Xingshuo Hai

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06272 2024-08-13 cs.CR 82%

A RAG-Based Question-Answering Solution for Cyber-Attack Investigation and Attribution

Sampath Rajapaksha, Ruby Rani, Erisa Karafili

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract)

Comments Accepted at SECAI 2024 (ESORICS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-08-18 cs.CR cs.AI 81%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 81%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 RAG评测 :RAG(summary_cn,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14040 2026-07-16 cs.CL 新提交 81%

Can an Old Dog Be Taught New Tricks? Taking LLMs Beyond Sentence Level Translation

老狗能学新把戏吗?让大语言模型超越句子级翻译

Alaina Brandt

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 探讨能否让大语言模型超越逐句翻译范式,提出基于RAG的PAT系统,通过与语料库结合让大语言模型进行全文翻译生成草稿,经评估发现其能朝重新表述发展,但提升重新表述有效性仍需更多工作,还讨论了相关设计与评估等要点。

Comments Accepted for publication in HCI International 2026, Late Breaking Papers Proceedings, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09322 2026-07-14 cs.AI 版本更新 81%

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29914 2026-06-30 cs.CL cs.LG 81%

MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation

MemDelta:智能体记忆评估中的受控基线和隐藏混杂因素

Kuan Wang

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 提出MemDelta控制评估协议,通过逐一改变组件发现RAG与全上下文基线排名因模型而异,嵌入模型切换可翻转结论,智能体自记忆不如基本检索,建议固定嵌入模型并分层报告。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04109 2026-06-09 cs.CL 版本更新 81%

Discourse-Role Labels as Presentation-Time Variables for Context Use in Language Models

话语角色标签作为语言模型上下文使用的呈现时间变量

Jianguo Zhu, Xiangmei Li, Wenjie Liu

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 通过固定内容探针实验,研究不同话语角色标签(如Instruction、Reference、Example)如何影响语言模型对误导信息的采纳率,发现标签可导致采纳率变化56-84个百分点,并建议上下文利用和RAG基准应报告和控制包装标签。

Comments Revised version with updated author information, added clean baselines, clarified evaluation metrics, and tightened discussion of context-augmented settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28508 2026-06-02 cs.AI 81%

Benchmarking AI for low-resource contexts: Thinking beyond leaderboards

低资源场景下的AI基准测试:超越排行榜的思考

Aakash Pant, Kavya Shah, Apoorv Agnihotri, Sneha Nikam, Prasaanth Balraj, Nakul Jain

机构 * Wadhwani AI Global(Wadhwani AI全球)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 本文通过分析语音、聊天/RAG和视觉系统的基准测试,指出实验室评估与低资源环境部署之间的差距,提出以部署系统为评估单位,并整合任务性能与噪声输入、代码切换等部署条件,同时为不同应用类制定差异化评估框架,最后建议标准化报告工具以支持决策。

Comments Aakash Pant, Kavya Shah, and Apoorv Agnihotri contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09986 2026-05-28 stat.ML cs.CL cs.LG 81%

Federated Language Models Under Bandwidth Budgets: Distillation Rates and Conformal Coverage

带宽预算下的联邦语言模型:蒸馏率与共形覆盖

Prasanjit Dubey, Xiaoming Huo

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本文研究带宽受限节点间分布式语言模型的统计保证,提出联邦探针-对数蒸馏(FPLD)和联邦共形RAG(FC-RAG)两种协议,分别给出训练时的KL一致性率和推理时的无分布边际覆盖界,首次将带宽作为一阶统计参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17943 2026-05-28 cs.CL 81%

A Benchmark Construction and Evaluation Framework for Specialist Domains: Case Study on Defense-related Documents

专业领域基准构建与评估框架:以国防相关文档为例

Bao Gia Doan, Aditya Joshi, Pantelis Elinas, Aarya Bodhankar, Oscar Leslie, Tom Marchant, Flora Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Cyndr AI

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 提出DoRA框架,通过合成数据生成和双LLM流水线解决专业领域RAG问答的冷启动问题,在国防文档上显著减少幻觉并提升覆盖率和忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21063 2026-05-21 cs.CL 81%

APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

APM:通过任意偏好映射评估大语言模型中的风格个性化

Philipp Spohn, Leander Girrbach, Zeynep Akata

机构 * Technical University of Munich, Helmholtz Munich(慕尼黑技术大学,亥姆霍兹慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出APM基准,通过隐式偏好映射评估大语言模型的风格个性化能力,发现路由方法是最可靠的方法,而RAG和软提示优化在强基础模型上才有提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25931 2026-04-30 cs.CL 81%

Anchored Confabulation: Partial Evidence Non-Monotonically Amplifies Confident Hallucination in LLMs

锚定编造:部分证据非单调放大LLM中的自信幻觉

Ashish Balkishan Lathkar

机构 * Florida State University(佛罗里达州立大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中一种新校准特性:提供一个确认的中间事实可非单调放大自信错误答案率。通过六个证据线证明了参数幻觉信心(PHC)概念,并在RAG路由中应用,显著提升性能。

Comments 62 pages, 5 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20303 2026-04-29 cs.CL 81%

Citation Failure: Definition, Analysis and Efficient Mitigation

引用失败:定义、分析与高效缓解

Jan Buchmann, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(普遍知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本文研究了LLM基于RAG系统的引用失败问题,提出CITECONTROL基准以分析失败模式,并通过CITENTION框架提升引用效率。

Comments Accepted to TACL in April 2024. Paper repository: https://github.com/UKPLab/tacl2026-citation-failure

详情

展开后加载摘要…

URL PDF HTML 收藏