arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2504.01509 2026-01-28 cs.CL 70%

PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation

PROPHET:一个基于因果干预似然估计的可推断未来预测基准

Zhengwei Tao, Pu Wu, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Chengfeng Dou, Xiancai Chen, Jia Li, Linyu Li, Chongyang Tao, Wentao Zhang

机构 * Peking University(北京大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18880 2026-01-27 cs.AI 70%

Challenges for Generative AI in Legal Reasoning

生成AI在法律推理中的挑战

Eljas Linna, Tuula Linna

机构 * Tampere University(塔尔库大学) University of Helsinki(赫尔辛基大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文探讨了生成AI在法律推理中的关键挑战,分析了现有AI技术在处理法律问题中的局限性,并提出分阶段采用技术以提升法律推理的严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15153 2026-01-22 cs.AI 70%

How to Build AI Agents by Augmenting LLMs with Codified Human Expert Domain Knowledge? A Software Engineering Framework

如何通过将编码化的人类专家领域知识与大语言模型结合来构建AI代理?一种软件工程框架

Choro Ulan uulu, Mikhail Kulyabin, Iris Fuhrmann, Jan Joosten, Nuno Miguel Martins Pacheco, Filippos Petridis, Rebecca Johnson, Jan Bosch, Helena Holmström Olsson

机构 * Department of Computer Science and Engineering, Chalmers University of Technology(计算机科学与工程系,查尔姆斯理工大学) Department of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学) Department of Computer Science and Media Technology, Malmö University(计算机科学与媒体技术系,马尔默大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出一种软件工程框架,通过增强大语言模型与编码化专家知识,构建能自主生成可视化内容的AI代理,实现非专家在专业领域内达到专家水平的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12276 2026-01-22 cs.HC cs.AI 70%

Predictive Prototyping: Evaluating Design Concepts with ChatGPT

预测性原型:通过ChatGPT评估设计概念

Hilsann Yong, Bradley A. Camburn

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文通过GPT-RAG方法评估设计概念,证明其在预测成本、性能和可用性方面优于人类估计,并展示了由该方法指导的原型在性能上的优势。

Comments 22 pages, 15 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12974 2026-01-21 cs.CL 70%

Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios

通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟

Hongyang Ma, Tiantian Gu, Huaiyuan Sun, Huilin Zhu, Yongxin Wang, Jie Li, Wubin Sun, Zeliang Lian, Yinghong Zhou, Yi Gao, Shirui Wang, Zhihui Tang

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12921 2026-01-21 cs.CL 70%

Injecting Knowledge from Social Science Journals to Improve Indonesian Cultural Understanding by LLMs

通过社会科学期刊注入知识以提升LLMs对印度尼西亚文化的理解

Adimulya Kartiyasa, Bao Gia Cao, Boyang Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本研究通过构建IndoSoSci数据集,利用检索增强生成方法将印度尼西亚文化知识注入LLMs,提升其对印度尼西亚文化的理解能力,并在基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11286 2026-01-19 cs.AI 70%

XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making

XChoice: 用于基于LLM的受限选择决策中的可解释性AI-人类对齐评估

Weihong Qi, Fan Huang, Rasika Muralidharan, Jisun An, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 XChoice是一种用于评估基于LLM的受限选择决策中AI-人类对齐的可解释框架,通过机制模型恢复可解释参数以诊断不一致并支持改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07790 2026-01-13 cs.AI 70%

Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification

在系统日志严重性分类上评估小型语言模型和小型推理语言模型

Yahya Masri, Emily Ma, Zifu Wang, Joseph Rogers, Chaowei Yang

机构 * George Mason University(乔治·马歇尔大学) Harvard University(哈佛大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本研究评估了小型语言模型和小型推理语言模型在系统日志严重性分类上的性能,发现架构设计、训练目标和上下文整合能力共同影响模型表现。

Comments 28 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 70%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06039 2026-01-13 cs.CL 70%

Operation Veja: Fixing Fundamental Concepts Missing from Modern Roleplaying Training Paradigms

Operation Veja: 修复现代角色扮演训练范式中缺失的根本概念

Yueze Liu, Ajay Nagi Reddy Kumdam, Ronit Kanjilal, Hao Yang, Yichi Zhang

机构 * Divergence 2% LLC Department of Electrical and Computer Engineering University of Illinois Urbana-Champaign(电气与计算机工程系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 Operation Veja提出VEJA框架,通过整合价值观、经历、判断和能力,改进角色扮演模型的数据整理方法,以提升角色真实性和叙述连续性。

Comments Accepted to NeurIPS 2025 PeronaLLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06240 2026-01-12 cs.CL 70%

Bridging External and Parametric Knowledge: Mitigating Hallucination of LLMs with Shared-Private Semantic Synergy in Dual-Stream Knowledge

弥合外部与参数化知识:通过共享-私有语义协同缓解LLM的幻觉

Yi Sui, Chaozhuo Li, Chen Zhang, Dawei song, Qiuchi Li

机构 * Beijing Institute of Technology, China(北京理工大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) Meituan, China(美团) The Open University, UK(开放大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出DSSP-RAG框架,通过共享-私有语义协同机制,缓解LLM在整合外部知识时的幻觉问题,并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00340 2026-01-08 cs.AI 70%

Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities

更好的CLAUSE:用于审计LLM法律推理能力的差异基准

Manan Roy Choudhury, Adithya Chandramouli, Mannan Anand, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 CLAUSE是一个用于评估LLM法律推理能力的基准,通过生成现实扰动合同检测细微法律错误,揭示LLM在识别和解释法律缺陷方面的不足。

Comments 42 pages, 4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10549 2026-01-08 cs.AI 70%

ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding

ELAIPBench: 一个用于专家级人工智能论文理解的基准

Xinbang Dai, Huikang Hu, Yongrui Chen, Jiaqi Li, Rihui Jin, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Guilin Qi

机构 * Southeast University(东南大学) Noah’s Ark Lab(诺亚实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 ELAIPBench通过专家编纂的多选题评估LLM对AI论文的理解能力,发现最佳模型准确率仅为39.95%,远低于人类,揭示了LLM在学术论文理解上的显著不足。

Comments 24 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06311 2026-01-07 cs.CR cs.AI 70%

Defending against Indirect Prompt Injection by Instruction Detection

对抗间接提示注入的指令检测

Tongyu Wen, Chenglong Wang, Xiyuan Yang, Haoyu Tang, Yueqi Xie, Lingjuan Lyu, Zhicheng Dou, Fangzhao Wu

机构 * Renmin University of China(中国人民大学) Peking University Shenzhen Graduate School(北京大学深圳研究生院) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Sony AI(索尼人工智能) Microsoft Research Asia(微软亚洲研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出InstructDetector,通过检测LLMs行为状态来识别IPI攻击,实现高检测准确率和低攻击成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22135 2025-12-30 cs.DC cs.AI cs.HC cs.MA 70%

SoDA: An Efficient Interaction Paradigm for the Agentic Web

SoDA:面向代理网络的高效交互范式

Zicai Cui, Zhouyuan Jian, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 SoDA提出了一种面向代理网络的高效交互范式,通过解耦记忆与应用逻辑,降低数据锁定和认知过载,提升信息处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15363 2025-12-18 cs.DB 70%

Revisiting Task-Oriented Dataset Search in the Era of Large Language Models: Challenges, Benchmark, and Solution

重新审视大语言模型时代任务导向型数据集搜索:挑战、基准测试与解决方案

Zixin Wei, Yucan Guo, Jinyang Li, Xiaolin Han, Xiaolong Jin, Chenhao Ma

专题命中 RAG评测 :retrieval-augmented generation(abstract);vector search(abstract);分类 cs.DB

AI总结 KATS通过构建任务-数据集知识图和混合查询引擎,解决任务导向型数据集搜索中的挑战,并通过CS-TDS基准测试展示其优越性。

Comments Accepted to Proc. VLDB Endow. (PVLDB), Vol. 19. 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23242 2025-12-15 cs.CV cs.CL cs.LG 70%

Annotation-Free Reinforcement Learning Query Rewriting via Verifiable Search Reward

无需标注的强化学习查询重写通过可验证的搜索奖励

Sungguk Cha, DongWook Kim, Taeseung Hahn, Mintae Kim, Youngsub Han, Byoung-Ki Jeon

机构 * LG Uplus(LG 通信)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 RL-QR通过可验证的搜索奖励实现无需标注的查询重写,显著提升检索性能,适用于多种模态和索引领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05137 2025-12-11 cs.CL 70%

Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics

解析深度搜索:基于无提示多跳问题和因子化指标的全面评估

Maojia Song, Renhang Liu, Xinyu Wang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出WebDetective基准测试,通过无提示多跳问题和因子化指标,揭示深度搜索中模型在知识利用和拒绝行为上的系统性弱点,并开发EvidenceLoop工作流程以改进自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06240 2025-12-09 cs.AI 70%

AI Application in Anti-Money Laundering for Sustainable and Transparent Financial Systems

人工智能在构建可持续和透明金融系统中的反洗钱应用

Chuanhao Nie, Yunbo Liu, Chao Wang

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出利用人工智能技术提升反洗钱流程的效率和透明度,通过整合图检索增强生成模型,优化KYC流程以支持可持续金融发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03887 2025-12-05 cs.AI 70%

A Hierarchical Tree-based approach for creating Configurable and Static Deep Research Agent (Static-DRA)

一种基于层次树的创建可配置和静态深度研究代理(静态-DRA)的方法

Saurav Prateek

机构 * Saurav Prateek(独立研究者)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出静态-DRA,通过深度和广度参数实现可配置的深度研究代理,提升多轮复杂研究任务的处理能力。

Comments 16 pages, 6 figures, 4 tables. Code available at: https://github.com/SauravP97/Static-Deep-Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20662 2025-11-27 cs.CL 70%

Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability

让大语言模型效率普及:从超大规模优化到通用部署

Hen-Hsen Huang

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出通过改进LLM的效率方法,使其在有限资源和专业知识下仍能有效运作,以实现更广泛的部署和公平性。

Comments 8 pages, accepted as a Blue Sky Talk in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15974 2025-11-27 cs.AI 70%

KRAL: Knowledge and Reasoning Augmented Learning for LLM-assisted Clinical Antimicrobial Therapy

KRAL: 用于LLM辅助临床抗菌治疗的知识与推理增强学习

Zhe Li, Yehan Qiu, Yujie Chen, Xiang Zhou

机构 * Information Center, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital(信息中心、复杂严重罕见疾病国家重点实验室、北京友谊医院) Department of Critical Care Medicine, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(重症医学科、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院) Medical Intensive Care Unit, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(医疗重症病房、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 KRAL通过知识与推理增强学习提升LLM在临床抗菌治疗中的诊断能力,以低成本高效方式优化医疗决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16395 2025-11-21 cs.AI cs.PL cs.SE cs.SY eess.SY 70%

CorrectHDL: Agentic HDL Design with LLMs Leveraging High-Level Synthesis as Reference

CorrectHDL: 基于LLM的代理HDL设计利用高层次综合作为参考

Kangwei Xu, Grace Li Zhang, Ulf Schlichtmann, Bing Li

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Technical University of Darmstadt(达姆施塔特技术大学) Technical University of Ilmenau(伊尔梅恩艾大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 CorrectHDL利用LLM和HLS结合,通过参考设计纠正生成错误,提升HDL设计的面积和功率效率,接近人工设计水平。

Comments 7 pages, 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15759 2025-11-21 cs.CR cs.AI 70%

Securing AI Agents Against Prompt Injection Attacks

保护AI代理免受提示注入攻击

Badrinath Ramakrishnan, Akshaya Balaji

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14362 2025-11-19 cs.DL cs.CL 70%

SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature

Hang Ding, Yilun Zhao, Tiansheng Hu, Manasi Patwardhan, Arman Cohan

机构 * Shanghai Jiao Tong University(上海交通大学) Yale University(耶鲁大学) NYU Shanghai(纽约大学上海分校) TCS Research(TCS研究)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13987 2025-11-19 cs.AI 70%

Artificial Intelligence Agents in Music Analysis: An Integrative Perspective Based on Two Use Cases

Antonio Manuel Martínez-Heredia, Dolores Godrid Rodríguez, Andrés Ortiz García

机构 * Dpto. Ingeniería de Comunicaciones, Universidad de Málaga, Campus de Teatinos(通信工程系,马拉加大学,泰蒂诺校区) Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments Extended version of the conference paper presented at SATMUS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08343 2025-11-18 cs.AI cs.CY 70%

JobSphere: An AI-Powered Multilingual Career Copilot for Government Employment Platforms

Srihari R, Adarsha B, Mohammed Usman Hussain, Shweta Singh

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments 7 pages, 4 figures, 4 tables

Journal ref Published in IEEE NQComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03138 2025-11-18 cs.AI 70%

DeepKnown-Guard: A Proprietary Model-Based Safety Response Framework for AI Agents

Qi Li, Jianjun Xu, Pingtao Wei, Jiu Li, Peiqiang Zhao, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Wenqin Shao

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10639 2025-11-11 cs.AR cs.AI 70%

Evaluating LLM-based Workflows for Switched-Mode Power Supply Design

Simon Nau, Jan Krummenauer, André Zimmermann

机构 * Robert Bosch GmbH, Cross-Domain Computing Solutions(罗伯特·博世有限公司,跨领域计算解决方案) University of Stuttgart, Institute for Micro Integration (IFM)(斯图加特大学,微系统集成研究所) Hahn-Schickard, Stuttgart, Germany(哈恩-施克尔德研究所,斯图加特,德国)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26941 2025-11-03 cs.CR cs.AI 70%

LLM-based Multi-class Attack Analysis and Mitigation Framework in IoT/IIoT Networks

Seif Ikbarieh, Maanak Gupta, Elmahedi Mahalal

机构 * Department of Computer Science Tennessee Tech University(计算机科学系田纳西科技大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏