arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2604.19776 2026-04-23 cs.CL cs.LG 57%

Development and Preliminary Evaluation of a Domain-Specific Large Language Model for Tuberculosis Care in South Africa

针对南非结核病护理的领域专用大型语言模型的开发与初步评估

Thokozile Khosa, Olawande Daramola

机构 * University of Pretoria(南非大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出一种专门用于南非结核病护理的大型语言模型,通过量化低秩适应算法和图检索生成技术,提升了模型在结核病领域的上下文对齐能力。

Comments 12 pages, 2 figures, ICICT 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19977 2026-04-23 cs.AI 57%

Context Attribution with Multi-Armed Bandit Optimization

基于多臂老虎机优化的上下文归因

Deng Pan, Keerthiram Murugesan, Ting Hua, Nuno Moniz, Nitesh Chawla

机构 * Lucy Family Institute for Data & Society, University of Notre Dame(数据与社会学院卢西家庭研究所,圣约翰大学) Department of Computer Science & Engineering, University of Notre Dame(计算机科学与工程系,圣约翰大学) IBM Research(IBM研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出一种将上下文归因问题建模为组合多臂老虎机问题的框架,利用线性汤普森采样高效识别关键上下文片段,减少模型查询次数,实验表明在多个问答基准上实现30%的查询减少同时保持归因质量。

Comments Accepted as a Findings paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07428 2026-04-10 cs.LG cs.AI 57%

Regret-Aware Policy Optimization: Environment-Level Memory for Replay Suppression under Delayed Harm

考虑后悔的策略优化:环境层面的记忆用于回放抑制在延迟伤害下

Prakul Sunil Hiremath

机构 * Department of Computer Science and Engineering, VTU, Belagavi, India(印度贝尔高姆VTU计算机科学与工程系) Aliens on Earth (AoE) Autonomous Research Group, Belagavi, India(印度贝尔高姆地球外星人自主研究小组)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出RAPO方法,通过环境层面的记忆机制抑制回放,减少有害区域的可达性,从而提升安全性和任务性能。

Comments 18 pages, 3 figures. Includes theoretical analysis and experiments on graph diffusion environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00185 2026-04-08 cond-mat.mtrl-sci cs.AI 57%

QUASAR: A Universal Autonomous System for Atomistic Simulation and a Benchmark of Its Capabilities

QUASAR:一个通用的自主系统用于原子模拟及其能力的基准测试

Fengxu Yang, Jack D. Evans

机构 * School of Physics, Chemistry and Earth Sciences, Adelaide University(阿德莱德大学物理、化学与地球科学学院)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 QUASAR通过整合多种原子模拟方法,实现自主的多尺度工作流,展示了其在材料筛选和新型材料评估中的应用潜力。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02834 2026-04-06 cs.AI 57%

ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents

ESL-Bench: 一个基于事件的合成纵向基准用于健康代理

Chao Li, Cailiang Liu, Ang Gao, Kexin Deng, Shu Zhang, Langping Xu, Xiaotong Shi, Xionghao Ding, Jian Pei, Xun Jiang

机构 * Shanda Group(盛大集团)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 ESL-Bench通过合成100个用户数据,涵盖健康档案、多阶段叙事计划、日常设备测量、定期检查记录和事件日志,评估健康代理在多源轨迹推理中的性能,发现数据库代理在比较和解释任务中显著优于记忆增强RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00284 2026-04-02 cs.AI cs.MA 57%

Improvisational Games as a Benchmark for Social Intelligence of AI Agents: The Case of Connections

即兴游戏作为AI代理社交智能的基准测试:以Connections为例

Gaurav Rajesh Parikh, Angikar Ghosal

机构 * Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 本文通过即兴词游戏Connections探讨AI代理的推理能力,提出该游戏作为测试社交智能的基准,涵盖知识检索、总结及认知状态意识等核心能力。

Comments https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

Journal ref https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00053 2026-04-02 cs.SE cs.AI 57%

The Energy Footprint of LLM-Based Environmental Analysis: LLMs and Domain Products

基于大语言模型的环境分析能耗:LLM与领域产品

Alicia Bao, Jiamian He, Angel Hsu, Diego Manya, Ji, Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arboretica Data-Driven EnviroLab UNC Institute for Environment(北卡罗来纳大学环境研究所数据驱动环境实验室)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文研究了领域特定RAG系统与通用LLM在能耗上的差异,通过分解工作流程评估了ChatNetZero和ChatNDC的能耗,发现领域设计显著影响能耗与输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15355 2026-03-31 cs.CL 57%

HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning

HEAD-QA v2:扩展医疗基准以进行推理

Alexis Correa-Guillén, Carlos Gómez-Rodríguez, David Vilares

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 HEAD-QA v2扩展了医疗推理数据集,包含12000个西班牙专业考试问题,评估多种LLM性能,发现模型规模和推理能力是主要影响因素。

Comments LREC 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27768 2026-03-31 cs.CL 57%

TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities

TailNLG:一种针对长尾实体 verbalization 的多语言基准

Lia Draetta, Michael Oliverio, Virginia Ramón-Ferrer, Pier Felice Balestrucci, Flaviana Corallo, Carlos Badenes-Olmedo, Alessandro Mazzei, Marco Antonio Stranisci, Rossana Damiano

机构 * University of Turin(都灵大学) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出TailNLG基准,评估大型语言模型在长尾实体上的表现,揭示其存在偏见,强调需更可靠的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08492 2026-03-31 cs.AI 57%

Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance

自主问题解决者:迈向零接触代码维护

Aliaksei Kaliutau

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出基于数据转换图的新型方法,通过数据状态节点和函数边的拓扑结构,解决传统代码属性图的控制流逻辑缺陷,实现数据完整性导航与控制流逻辑的统一,提升代码修复效率。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26106 2026-03-30 cs.CL 57%

LLM Benchmark-User Need Misalignment for Climate Change

LLM基准-气候变化中的用户需求错位

Oucheng Liu, Lexing Xie, Jing Jiang

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 研究揭示现有LLM基准与实际用户需求存在显著不匹配,提出主动知识行为框架和主题-意图-形式分类法,为基准设计、RAG系统开发和LLM训练提供指导。

Comments 37 pages (8 main), 31 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25105 2026-03-27 cs.CL 57%

OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMs

OMIND:面向心理健康大语言模型的知识引导微调与多轮对话基准框架

Suraj Racha, Prashant Harish Joshi, Utkarsh Maurya, Nitin Yadav, Mridul Sharma, Ananya Kunisetty, Saranya Darisipudi, Nirmal Punjabi, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

AI总结 本文提出OMIND框架,通过结构化知识检索、模型剪枝和人工审核生成高质量多任务SFT数据集,并引入oMind-Chat多轮对话基准,验证了其在核心能力和对话任务上的优越性能。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI 57%

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16581 2026-03-18 cs.AI 57%

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

V-DyKnow:面向视觉语言模型的时间敏感知识动态基准

Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出V-DyKnow基准,评估视觉语言模型对时间敏感事实知识的处理能力,分析模型响应可靠性、知识更新方法有效性及过时预测原因,揭示当前VLM在多模态时间敏感知识获取与更新中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22333 2026-03-17 cs.DC cs.CL 57%

PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel

PAT: 通过资源高效的多瓷砖内核加速大语言模型解码的前缀感知注意力

Jinjun Yi, Zhixin Zhao, Yitao Hu, Ke Yan, Weiwei Sun, Hao Wang, Laiping Zhao, Yuhao Zhang, Wenxin Li, Keqiu Li

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本文提出PAT,一种基于前缀感知的注意力内核,通过包前向合并范式减少内存访问,提升资源利用率,降低解码延迟和TPOT。

Comments Accepted by ASPLOS'26, code available at https://github.com/flashserve/PAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10570 2026-03-12 cs.CL 57%

End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering

端到端对话机器人评估与自适应推理和不确定性过滤

Nhi Dang, Tung Le, Huy Tien Nguyen

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL

AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 57%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05828 2026-03-09 cs.CL 57%

HART: Data-Driven Hallucination Attribution and Evidence-Based Tracing for Large Language Models

HART: 基于数据的幻觉归因与证据导向追踪用于大语言模型

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

AI总结 HART通过结构化建模方法提升大语言模型幻觉归因与证据追踪的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00285 2026-03-03 cs.AI 57%

TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?

TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?

Xiaochuang Yuan, Hui Xu, Silvia Xu, Cui Zou, Jing Xiong

机构 * Amazon.com Inc.(亚马逊公司) Stony Brook University(石溪大学) Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。

Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17675 2026-02-23 cs.DC cs.AI 57%

Mind the Boundary: Stabilizing Gemini Enterprise A2A via a Cloud Run Hub Across Projects and Accounts

注意边界:通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A

Takao Morita

机构 * Independent Researcher(独立研究者)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A,解决边界依赖认证和UI兼容性问题,实现可靠路由和稳定响应。

Comments 7 pages. Implementation and evaluation study of cross-boundary agent orchestration for Gemini Enterprise UI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17046 2026-02-20 cs.AI 57%

Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs

动态系统指令与工具暴露用于高效代理LLM

Uria Franko

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14955 2026-02-17 cs.CL cs.SE 57%

Tool-Aware Planning in Contact Center AI: Evaluating LLMs through Lineage-Guided Query Decomposition

接触中心AI中的工具感知规划:通过 lineage 引导的查询分解评估LLMs

Varun Nathan, Shreyas Guha, Ayush Kumar

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本文提出接触中心AI中的工具感知规划框架,通过lineage引导查询分解评估LLMs,揭示工具理解的不足及简计划的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08070 2026-02-10 cs.IR 57%

IRB: Automated Generation of Robust Factuality Benchmarks

IRB: 自动生成鲁棒事实性基准

Lam Thanh Do, Bhagyashree Taleka, Hozaifa Ammar Bhutta, Vikram Sharma Mailthody, Kevin Chen-Chuan Chang, Wen-mei Hwu

专题命中 RAG评测 :RAG(abstract);分类 cs.IR

AI总结 IRB通过自动生成鲁棒事实性基准,评估RAG系统事实性,发现前沿LLM在闭书设置中面临挑战,推理LLM更可靠,改进检索组件更有效。

Comments Code: https://github.com/Hozaifa-Bhutta/IRB

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05883 2026-02-06 cs.AI 57%

A Guide to Large Language Models in Modeling and Simulation: From Core Techniques to Critical Challenges

大语言模型在建模与仿真中的应用指南:从核心技术到关键挑战

Philippe J. Giabbanelli

机构 * Old Dominion University(旧 Dominion 大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在建模与仿真中的应用,分析了核心技术和关键挑战,提供了全面的使用指南和实践建议。

Comments Book chapter. Accepted in Artificial Intelligence in Modeling and Simulation, Philippe J. Giabbanelli and Istvan David (eds). Series on Simulation Foundations, Methods and Applications. Springer, Cham. Series ISSN: 2195-2817

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02053 2026-02-04 cs.CL 57%

WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora

WildGraphBench: 用野源语料基准测试图式检索增强生成

Pengyu Wang, Benfeng Xu, Licheng Zhang, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 WildGraphBench通过真实语料评估GraphRAG在长上下文和异构文档中的性能,揭示多事实聚合的局限性。

Comments https://github.com/BstWPY/WildGraphBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00723 2026-02-03 cs.LG cs.AI 57%

Rethinking Hallucinations: Correctness, Consistency, and Prompt Multiplicity

重新思考幻觉:正确性、一致性与提示多样性

Prakhar Ganesh, Reza Shokri, Golnoosh Farnadi

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出提示多样性框架,揭示LLM幻觉评估中一致性的重要性,指出现有检测与缓解技术的局限性。

Comments To appear at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 57%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21937 2026-02-02 cs.AI 57%

Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities

检索增强推理沙盒:一种解耦检索与推理能力的基准

Shuangshuang Ying, Zheyu Wang, Yunjian Peng, Jin Chen, Yuhao Wu, Hongbin Lin, Dingyu He, Siyi Liu, Gengchen Yu, YinZhu Piao, Yuchen Wu, Xin Gui, Zhongyuan Peng, Xin Li, Xeron Du, Libo Qin, YiXin Cao, Ge Zhang, Stephen Huang

机构 * Full author list in Contributions(完整作者列表)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 DeR2通过解耦检索与推理能力,提供了一种评估大语言模型处理新颖科学信息能力的基准测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15745 2026-01-23 cs.CL 57%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏