arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2505.07968 2025-09-09 cs.CL 57%

Assessing and Mitigating Medical Knowledge Drift and Conflicts in Large Language Models

Weiyi Wu, Xinwen Xu, Chongyang Gao, Xingjian Diao, Siting Li, Lucas A. Salas, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) Massachusetts General Hospital(麻省总医院) Northwestern University(西北大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05225 2025-09-04 cs.CL 57%

QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluation

Mengze Hong, Wailing Ng, Chen Jason Zhang, Di Jiang

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank公司人工智能部)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Main Conference. Homepage: https://github.com/mengze-hong/QualBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10701 2025-08-15 cs.LG cs.AI 57%

REFN: A Reinforcement-Learning-From-Network Framework against 1-day/n-day Exploitations

Tianlong Yu, Lihong Liu, Ziyi Zhou, Fudu Xing, Kailong Wang, Yang Yang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Huazhong University of Science and Technology(华中科技大学) University of Southern California(美国南加州大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06851 2025-08-12 cs.AI cs.CY 57%

MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams

Pengfei Zhou, Xiaopeng Peng, Fanrui Zhang, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Zekai Li, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) USTC(中国科学技术大学) RIT(罗切斯特理工学院) HIT(哈尔滨工业大学) WHU(武汉大学) MBZUAI(马克斯·普朗克人工智能研究所) NUS(新加坡国立大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments 35 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15715 2025-08-07 cs.CL astro-ph.IM 57%

From Queries to Criteria: Understanding How Astronomers Evaluate LLMs

Alina Hyk, Kiera McCormick, Mian Zhong, Ioana Ciucă, Sanjib Sharma, John F Wu, J. E. G. Peek, Kartheik G. Iyer, Ziang Xiao, Anjalie Field

机构 * Oregon State University(俄勒冈州立大学) Loyola University Maryland(马里兰洛约纳大学) Johns Hopkins University(约翰霍普金斯大学) Stanford University(斯坦福大学) Space Telescope Science Institute(空间望远镜科学研究所) Columbia University(哥伦比亚大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

Comments Accepted to the Conference on Language Modeling 2025 (COLM), 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01746 2025-08-05 cs.AI 57%

Bayes-Entropy Collaborative Driven Agents for Research Hypotheses Generation and Optimization

Shiyang Duan, Yuan Tian, Qi Bing, Xiaowei Shao

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments Corresponding author: Xiaowei Shao. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23588 2025-08-01 cs.CL 57%

DiffLoRA: Differential Low-Rank Adapters for Large Language Models

Alexandre Misrahi, Nadezhda Chirkova, Maxime Louis, Vassilina Nikoulina

机构 * EPFL(瑞士联邦理工学院) NAVER LABS Europe(NAVER LABS欧洲)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21815 2025-07-30 cs.CL cs.CY 57%

HRIPBench: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs

Kaixuan Wang, Chenxin Diao, Jason T. Jacques, Zhongliang Guo, Shuai Zhao

机构 * University of St. Andrews(圣安德鲁大学) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments 15 pages, 5 figures, 12 tables, a dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16809 2025-07-25 cs.CL 57%

LingBench++: A Linguistically-Informed Benchmark and Reasoning Framework for Multi-Step and Cross-Cultural Inference with LLMs

Da-Chen Lian, Ri-Sheng Huang, Pin-Er Chen, Chunki Lim, You-Kuan Lin, Guan-Yu Tseng, Zi-Cheng Yang, Zhen-Yu Lin, Pin-Cheng Chen, Shu-Kai Hsieh

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

Comments 42p, 17f, 10t. Revisions: Merged paragraphs in Intro to emphasize contributions. Clarified benchmark design (Sec 3.5.1). Added single-agent, OpenAI-guided & 6-round experiments (Sec 5.2). Note: we only ran each experiment once; statistical tests are needed for strong claims. Revised Sec 6. Added acknowledgements, 2 new co-authors, and corrected typos/grammar

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12367 2025-07-23 cs.SE cs.AI cs.PL 57%

GitChameleon 2.0: Evaluating AI Code Generation Against Python Library Version Incompatibilities

Diganta Misra, Nizar Islah, Victor May, Brice Rauby, Zihan Wang, Justine Gehring, Antonio Orvieto, Muawiz Chaudhary, Eilif B. Muller, Irina Rish, Samira Ebrahimi Kahou, Massimo Caccia

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) MPI-IS Tübingen(图宾根MPI研究所) Mila Quebec AI Institute(魁北克AI研究所) Google(谷歌) Polytechnique Montréal(蒙特利尔高等理工学院) McGill University(麦吉尔大学) Moderne(Moderne公司) Gologic(Gologic公司) Tübingen AI Center(图宾根人工智能中心) Université de Montréal(蒙特利尔大学) ServiceNow Research(ServiceNow研究)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments Version 2 of the dataset from: arXiv:2411.05830

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21536 2025-07-17 cs.AI cs.HC 57%

PsyLite Technical Report

Fangjun Ding, Renyu Zhang, Xinyu Feng, Chengye Xie, Zheng Zhang, Yanting Zhang

机构 * Donghua University(东华大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23992 2025-07-01 cs.AI cs.ET 57%

Harnessing AI Agents to Advance Research on Refugee Child Mental Health

Aditya Shrivastava, Komal Gupta, Shraddha Arora

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments 14 page , 2 image , 2 tables , accepted under 5th International Conference on Innovations in Computational Intelligence and Computer Vision (ICICV-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13310 2025-06-30 cs.SE cs.AI cs.DC cs.ET 57%

Generative AI for Software Architecture. Applications, Challenges, and Future Directions

Matteo Esposito, Xiaozhou Li, Sergio Moreschini, Noman Ahmad, Tomas Cerny, Karthik Vaidhyanathan, Valentina Lenarduzzi, Davide Taibi

机构 * University of Oulu, Finland(奥卢大学) Tampere University, Finland(塔尔库大学) University of Arizona, USA(亚利桑那大学) Software Engineering Research Center, IIIT Hyderabad, India(IIIT Hyderabad软件工程研究中心)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20274 2025-06-26 cs.AI 57%

Enterprise Large Language Model Evaluation Benchmark

Liya Wang, David Yi, Damien Jose, John Passarelli, James Gao, Jordan Leventis, Kang Li

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

Comments Submitted to MLNLP 2025 at https://csity2025.org/mlnlp/index

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21647 2025-06-26 cs.SE cs.CL 57%

Can Language Models Replace Programmers for Coding? REPOCOD Says 'Not Yet'

Shanchao Liang, Yiran Hu, Nan Jiang, Lin Tan

机构 * Purdue University(普渡大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13805 2025-06-18 cs.CY cs.AI 57%

Dr. GPT Will See You Now, but Should It? Exploring the Benefits and Harms of Large Language Models in Medical Diagnosis using Crowdsourced Clinical Cases

Bonam Mingole, Aditya Majumdar, Firdaus Ahmed Choudhury, Jennifer L. Kraschnewski, Shyam S. Sundar, Amulya Yadav

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16185 2025-06-10 cs.CR cs.AI cs.SE 57%

LLM4Vuln: A Unified Evaluation Framework for Decoupling and Enhancing LLMs' Vulnerability Reasoning

Yuqiang Sun, Daoyuan Wu, Yue Xue, Han Liu, Wei Ma, Lyuye Zhang, Yang Liu, Yingjiu Li

机构 * Nanyang Technological University, Singapore(南洋理工大学) The Hong Kong University of Science(香港科学与技术大学) MetaTrust Labs(MetaTrust实验室) Singapore Management University, Singapore(新加坡管理学院) University of Oregon, Eugene, OR, USA(俄勒冈大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

Comments This is a technical report by Nanyang Technological University. Updated to support Solidity, Java and C/C++

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18069 2025-06-03 cs.CL 57%

Improving Factuality with Explicit Working Memory

Mingda Chen, Yang Li, Karthik Padthe, Rulin Shao, Alicia Sun, Luke Zettlemoyer, Gargi Ghosh, Wen-tau Yih

机构 * Meta FAIR

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments ACL 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16365 2025-05-26 cs.CL 57%

Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines

Zi-Ao Ma, Tian Lan, Rong-Cheng Tu, Yong Hu, Yu-Shi Zhu, Tong Zhang, Heyan Huang, Zhijing Wu, Xian-Ling Mao

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14856 2025-04-22 cs.CL 57%

Transparentize the Internal and External Knowledge Utilization in LLMs with Trustworthy Citation

Jiajun Shen, Tong Zhou, Yubo Chen, Delai Qiu, Shengping Liu, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Unisound Al Technology Co,Ltd(Unisound人工智能技术有限公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12845 2025-04-18 cs.CL 57%

Can LLMs reason over extended multilingual contexts? Towards long-context evaluation beyond retrieval and haystacks

Amey Hengle, Prasoon Bajpai, Soham Dan, Tanmoy Chakraborty

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL

Comments 33 Pages in Total - 23 (Main Manuscript) + 10 (Appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04569 2025-04-15 cs.CL 57%

KnowsLM: A framework for evaluation of small language models for knowledge augmentation and humanised conversations

Chitranshu Harbola, Anupam Purwar

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02694 2025-04-15 cs.LG cs.AI cs.CV 57%

Loss Functions and Metrics in Deep Learning

Juan Terven, Diana M. Cordova-Esparza, Alfonso Ramirez-Pedraza, Edgar A. Chavez-Urbiola, Julio A. Romero-Gonzalez

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

Comments 134 pages, 4 figures, 21 tables, 238 equations

Journal ref Terven, J., Cordova-Esparza, DM., Romero-González, JA. et al. A comprehensive survey of loss functions and metrics in deep learning. Artif Intell Rev 58, 195 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18460 2025-03-25 cs.SE cs.AI 57%

ModiGen: A Large Language Model-Based Workflow for Multi-Task Modelica Code Generation

Jiahui Xiang, Tong Ye, Peiyu Liu, Yinan Zhang, Wenhai Wang

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14603 2025-03-20 cs.CL cs.LG 57%

Command R7B Arabic: A Small, Enterprise Focused, Multilingual, and Culturally Aware Arabic LLM

Yazeed Alnumay, Alexandre Barbet, Anna Bialas, William Darling, Shaan Desai, Joan Devassy, Kyle Duffy, Stephanie Howe, Olivia Lasche, Justin Lee, Anirudh Shrinivason, Jennifer Tracey

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14392 2025-03-19 cs.CL 57%

From "Hallucination" to "Suture": Insights from Language Philosophy to Enhance Large Language Models

Qiantong Wang

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01695 2025-03-04 cs.CL 57%

Generate, Discriminate, Evolve: Enhancing Context Faithfulness via Fine-Grained Sentence-Level Self-Evolution

Kun Li, Tianhua Zhang, Yunxiang Li, Hongyin Luo, Abdalla Moustafa, Xixin Wu, James Glass, Helen Meng

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19629 2025-02-28 cs.AI 57%

Agentic Mixture-of-Workflows for Multi-Modal Chemical Search

Tiffany J. Callahan, Nathaniel H. Park, Sara Capponi

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

Comments PDF includes supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11861 2025-02-18 cs.CL 57%

Exploring Large Language Models in Healthcare: Insights into Corpora Sources, Customization Strategies, and Evaluation Metrics

Shuqi Yang, Mingrui Jing, Shuai Wang, Jiaxin Kou, Manfei Shi, Weijie Xing, Yan Hu, Zheng Zhu

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

Comments 45 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05431 2025-02-13 cs.LG cs.AI 57%

APE: Faster and Longer Context-Augmented Generation via Adaptive Parallel Encoding

Xinyu Yang, Tianqi Chen, Beidi Chen

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏