arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-02-09 至 2026-02-09 共收录 2 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 2 篇

2602.06526 2026-02-09 cs.CL cs.AI 73%

Completing Missing Annotation: Multi-Agent Debate for Accurate and Scalable Relevant Assessment for IR Benchmarks

补全缺失注释:基于多智能体辩论的准确且可扩展的相关性评估框架用于信息检索基准测试

Minjeong Ban, Jeonghwan Choi, Hyangsuk Min, Nicole Hee-Yeon Kim, Minseok Kim, Jae-Gil Lee, Hwanjun Song

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 RAG评测 :RAG(abstract);retriever(abstract);分类 cs.CL、cs.AI

AI总结 DREAM通过多智能体辩论框架提高IR基准测试的相关性评估准确性,减少人力参与,构建BRIDGE基准并揭示缺失相关片段,改进检索器比较。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06268 2026-02-09 cs.CL cs.LG 70%

MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs

MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准

Junhyeok Lee, Han Jang, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University(首尔国立大学) Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏