arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-02-04 至 2026-02-04 共收录 4 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 4 篇

2509.21875 2026-02-04 cs.CL 83%

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

LUMINA:通过上下文-知识信号检测RAG系统中的幻觉

Samuel Yeh, Sharon Li, Tanwi Mallick

机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 LUMINA通过上下文-知识信号检测RAG系统中的幻觉,利用分布距离和token演变测量,实现高准确率和实用性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01355 2026-02-04 cs.AI 70%

Aggregation Queries over Unstructured Text: Benchmark and Agentic Method

无结构文本上的聚合查询:基准测试与代理方法

Haojia Zhu, Qinyuan Xu, Haoyu Li, Yuxi Liu, Hanchen Qiu, Jiaoyan Chen, Jiahui Jin

机构 * Southeast University(东南大学) Imperial College London(伦敦帝国学院) The University of Manchester(曼彻斯特大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出DFA方法,用于在无结构文本上进行完整性导向的聚合查询,通过模块化设计提升证据覆盖能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03693 2026-02-04 cs.CL cs.AI 62%

OCRTurk: A Comprehensive OCR Benchmark for Turkish

OCRTurk:土耳其的综合OCR基准

Deniz Yılmaz, Evren Ayberk Munis, Çağrı Toraman, Süha Kağan Köse, Burak Aktaş, Mehmet Can Baytekin, Bilge Kaan Görür

机构 * Middle East Technical University, Computer Engineering Department(中东部技术大学,计算机工程系) Politecnico di Torino(托里诺理工大学) Roketsan Inc.(罗克特兰公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 OCRTurk是一个针对土耳其语文档解析的综合基准测试,通过多难度级别和多种文档类型评估七种OCR模型,发现PaddleOCR在多数指标上表现最佳,但幻灯片文档对模型构成挑战。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02053 2026-02-04 cs.CL 57%

WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora

WildGraphBench: 用野源语料基准测试图式检索增强生成

Pengyu Wang, Benfeng Xu, Licheng Zhang, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 WildGraphBench通过真实语料评估GraphRAG在长上下文和异构文档中的性能,揭示多事实聚合的局限性。

Comments https://github.com/BstWPY/WildGraphBench

详情

展开后加载摘要…

URL PDF HTML 收藏