arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-08-26 至 2026-08-26 共收录 6 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 6 篇

2608.24753 2026-08-26 cs.CL cs.AI 新提交 91%

The RAT: A Unified Bayesian Model for RAG Evaluation

RAT:一种用于RAG评估的统一贝叶斯模型

Pius von Däniken, Felix Matthias Saaro, Mark Cieliebak, Jan Deriu

机构 * Centre for Artificial Intelligence(人工智能中心) ZHAW School of Engineering(苏黎世应用科技大学工程学院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 针对RAG系统评估的不足,提出RAT统一贝叶斯框架,联合建模多维度指标,通过27种配置验证其能揭示系统差异,还分析了注释分配并扩展模型以结合人工与自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19743 2026-08-26 cs.AI cs.LG cs.MA 版本更新 77%

EngiAI: Capability-Based Evaluation of Tool-Connected LLM Agents for Engineering Design

EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件

Gioele Molinari, Florian Felten, Soheyl Massoudi, Mark Fuge

机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ETH Zurich(苏黎世联邦理工学院) Autom8.build

专题命中 RAG评测 :RAG(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。

Comments 42 pages, 17 figures, 15 tables. Extended version of work presented at the ASME 2026 International Design Engineering Technical Conferences and Computers and Information in Engineering Conference (IDETC-CIE 2026), Houston, Texas, USA, August 23-26, 2026. Submitted to the ASME Journal of Mechanical Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-08-26 cs.AI 版本更新 77%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Yusheng Li, Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06268 2026-08-26 cs.CL cs.LG 版本更新 77%

MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs

MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准

Junhyeok Lee, Han Jang, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University(首尔国立大学) Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。

Comments 19 pages, 7 figures, 18 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23601 2026-08-26 cs.AR cs.LG cs.MA 新提交 75%

StateTune: Transforming LLM-Assisted EDA Flow Tuning into a Stateful, Closed-Loop Process

StateTune:将大语言模型辅助的EDA流程调优转化为有状态的闭环过程

Kunlong Li, Shangshang Yao, Su Zheng, Lingli Wang

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 StateTune将LLM辅助的EDA调优改为有状态闭环过程,以持久优化记忆为核心,结合EHVI引导的提升策略,在六个基准模块上性能优于多个基线,验证了设计有效性。

Comments Accepted to the 2026 IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23568 2026-08-26 cs.AI 新提交 70%

RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation

RENDER:控制LLM记忆评估中面向读者的证据

Yuan Si, Simeng Han, Daming Li, Jialu Zhang

机构 * University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 RENDER是控制LLM记忆评估中面向读者证据的基准,实验显示其相关数据包比原始对话表现更优,效果可迁移,提示需关注评估中的读者面向人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏