arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2025-12-02 至 2025-12-02 共收录 5 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 5 篇

2512.01335 2025-12-02 cs.CR cs.AI cs.CL 84%

EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations

EmoRAG:评估RAG对符号扰动的鲁棒性

Xinyun Zhou, Xinfeng Li, Yinan Peng, Ming Xu, Xuanwang Zhang, Miao Yu, Yidong Wang, Xiaojun Jia, Kun Wang, Qingsong Wen, XiaoFeng Wang, Wei Dong

机构 * ZJU Hangzhou China(浙江大学杭州校区) NTU Singapore(南洋理工大学) Hengxin Tech. Singapore(新加坡恒心科技) NUS Singapore(国立新加坡大学) NJU Nanjing China(南京大学) PKU Beijing China(北京大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 EmoRAG研究揭示RAG系统对细微表情符号扰动的鲁棒性问题,发现单个表情符号可导致检索严重误导,并提出针对性防御措施。

Comments Accepted to ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12003 2025-12-02 cs.AI 83%

Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning

看而思:通过强化学习统一推理与视觉证据归因以实现可验证文档RAG

Shuochen Liu, Pengfei Luo, Chao Zhang, Yuhao Chen, Haotian Zhang, Qi Liu, Xin Kou, Tong Xu, Enhong Chen

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 通过强化学习统一推理与视觉证据归因,提升多模态问答的可验证性和准确性。

Comments Poster of AAAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13671 2025-12-02 cs.CL 79%

HEALTH-PARIKSHA: Assessing RAG Models for Health Chatbots in Real-World Multilingual Settings

HEALTH-PARIKSHA: 评估医疗聊天机器人在真实多语言环境中的RAG模型

Varun Gumma, Ananditha Raghunath, Mohit Jain, Sunayana Sitaram

机构 * Microsoft(微软)

专题命中 RAG评测 :RAG(title);retrieval augmented generation(abstract);分类 cs.CL

AI总结 HEALTH-PARIKSHA研究评估了24个LLMs在真实多语言环境中的表现,发现印地语模型在印地语查询中表现不一,且事实准确性低于英语查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01786 2025-12-02 cs.AI cs.LG 57%

Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems

谁评判法官?LLM陪审团即需:构建可信的LLM评估系统

Xiaochuan Li, Ke Wang, Girija Gouda, Shubham Choudhary, Yaqun Wang, Linwei Hu, Joel Vaughan, Freddy Lecue

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出LLM陪审团即需,通过动态学习框架提升LLM评估的可靠性和可扩展性,实验表明其在关键决策中的相关性优于传统方法。

Comments 66 pages, 22 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00991 2025-12-02 cs.CL 57%

Advancing Academic Chatbots: Evaluation of Non Traditional Outputs

推进学术聊天机器人:非传统输出的评估

Nicole Favero, Francesca Salute, Daniel Hardt

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本研究评估了非传统学术输出生成,比较了两种检索策略并测试了LLMs在幻灯片和播客脚本生成中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏