arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2402.18264 2024-12-18 cs.CL 57%

WIKIGENBENCH: Exploring Full-length Wikipedia Generation under Real-World Scenario

Jiebin Zhang, Eugene J. Yu, Qinyu Chen, Chenhao Xiong, Dawei Zhu, Han Qian, Mingbo Song, Weimin Xiong, Xiaoguang Li, Qun Liu, Sujian Li

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments COLING 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10313 2024-12-16 cs.IR cs.LG 57%

MST-R: Multi-Stage Tuning for Retrieval Systems and Metric Evaluation

Yash Malviya, Karan Dhingra, Maneesh Singh

专题命中 RAG评测 :retriever(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05764 2024-11-11 cs.CL cs.LG 57%

FinDVer: Explainable Claim Verification over Long and Hybrid-Content Financial Documents

Yilun Zhao, Yitao Long, Yuru Jiang, Chengye Wang, Weiyuan Chen, Hongjun Liu, Yiming Zhang, Xiangru Tang, Chen Zhao, Arman Cohan

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16434 2024-11-01 cs.CL 57%

Enhancing LLM's Cognition via Structurization

Kai Liu, Zhihang Fu, Chao Chen, Wei Zhang, Rongxin Jiang, Fan Zhou, Yaowu Chen, Yue Wu, Jieping Ye

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL

Comments This paper has been accepted by NeurIPS 2024. Code is available at https://github.com/alibaba/struxgpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07799 2024-10-24 cs.CL 57%

Attribute or Abstain: Large Language Models as Long Document Assistants

Jan Buchmann, Xiao Liu, Iryna Gurevych

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments Accepted at EMNLP 2024. Code and data: https://github.com/UKPLab/arxiv2024-attribute-or-abstain

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02115 2024-10-07 cs.CL 57%

L-CiteEval: Do Long-Context Models Truly Leverage Context for Responding?

Zecheng Tang, Keyan Zhou, Juntao Li, Baibei Ji, Jianye Hou, Min Zhang

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13833 2024-08-27 cs.CL 57%

Biomedical Large Languages Models Seem not to be Superior to Generalist Models on Unseen Medical Data

Felix J. Dorfner, Amin Dada, Felix Busch, Marcus R. Makowski, Tianyu Han, Daniel Truhn, Jens Kleesiek, Madhumita Sushil, Jacqueline Lammert, Lisa C. Adams, Keno K. Bressem

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

Comments 10 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15739 2024-08-27 cs.DL cs.AI cs.LG cs.SI 57%

Large Language Models Reflect Human Citation Patterns with a Heightened Citation Bias

Andres Algaba, Carmen Mazijn, Vincent Holst, Floriano Tori, Sylvia Wenmackers, Vincent Ginis

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

Comments 30 pages, 13 figures, 4 tables. Added GPT-4o and Claude 3.5 results

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16565 2024-07-24 cs.CL 57%

Retrieve, Generate, Evaluate: A Case Study for Medical Paraphrases Generation with Small Language Models

Ioana Buhnila, Aman Sinha, Mathieu Constant

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL

Comments KnowledgeableLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11987 2024-07-18 cs.HC cs.AI 57%

SlicerChat: Building a Local Chatbot for 3D Slicer

Colton Barr

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09512 2024-07-16 cs.HC cs.AI 57%

Design and evaluation of AI copilots -- case studies of retail copilot templates

Michal Furmakiewicz, Chang Liu, Angus Taylor, Ilya Venger

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06519 2024-06-11 cs.IR 57%

UMBRELA: UMbrela is the (Open-Source Reproduction of the) Bing RELevance Assessor

Shivani Upadhyay, Ronak Pradeep, Nandan Thakur, Nick Craswell, Jimmy Lin

专题命中 RAG评测 :RAG(abstract);分类 cs.IR

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04253 2024-02-07 cs.CL 57%

AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API Calls

Yu Du, Fangyun Wei, Hongyang Zhang

专题命中 RAG评测 :retriever(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07204 2023-11-14 cs.IR cs.LG 57%

On Elastic Language Models

Chen Zhang, Benyou Wang, Dawei Song

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR

Comments 27 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01173 2023-11-03 cs.CL 57%

CRUSH4SQL: Collective Retrieval Using Schema Hallucination For Text2SQL

Mayank Kothyari, Dhruva Dhingra, Sunita Sarawagi, Soumen Chakrabarti

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL

Comments To appear at EMNLP 2023 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10760 2023-10-18 cs.CL q-fin.PM q-fin.ST stat.AP 57%

Towards reducing hallucination in extracting information from financial reports using Large Language Models

Bhaskarjit Sarmah, Tianjie Zhu, Dhagash Mehta, Stefano Pasquali

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

Comments 4 pages + references. Accepted for publication in Workshop on Generative AI at the 3rd International Conference on AI-ML Systems 2023, Bengaluru, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12678 2022-10-25 cs.CL 57%

ComFact: A Benchmark for Linking Contextual Commonsense Knowledge

Silin Gao, Jena D. Hwang, Saya Kanno, Hiromi Wakaki, Yuki Mitsufuji, Antoine Bosselut

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

Comments Findings of EMNLP 2022, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14997 2026-04-10 cs.CL cs.AI cs.IR 56%

OrgForge: A Multi-Agent Simulation Framework for Verifiable Synthetic Corporate Corpora

OrgForge:一种用于可验证合成企业语料的多智能体仿真框架

Jeffrey Flynt

专题命中 RAG评测 :分类 cs.IR、cs.CL、cs.AI;RAG(comments)

AI总结 OrgForge通过多智能体仿真框架生成一致且可追溯的合成企业语料,解决现有语料在法律约束和幻觉问题上的不足,提升AI系统评估的准确性。

Comments v2: Major revision. Recenters the paper on the simulation framework as the primary contribution. System Architecture substantially expanded (CRM state machine, Knowledge Recovery Arc, multi-pathway knowledge gap detection, embedding-based ticket assignment). Introduction restructured for broader framing. RAG retrieval baselines replaced by cross-document consistency evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25334 2026-06-25 cs.MA 新提交 50%

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架

Runwei Guan, Yi Zhou, Heyi Lin, Jinjing Zhu, Mingyuan Hou, Yang Yang, Fang Yuan, Xiaohong Lin, Shaofeng Liang, Xuming Hu, Tao Li, Tianbin Zhao, Yutao Yue, Zhiyuan Wang, Hui Xiong

专题命中 RAG评测 :retrieval-augmented generation(abstract)

AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19988 2026-06-19 cs.SE 新提交 50%

Repository-Level Solidity Code Generation with Large Language Models: From Prompting to Fine-Tuning

基于大语言模型的仓库级Solidity代码生成:从提示到微调

Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang

专题命中 RAG评测 :retrieval-augmented generation(abstract)

AI总结 提出SolidityBench基准和SolidityScore指标,评估多种LLM方法在仓库级Solidity代码生成中的表现,发现监督微调最有效。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23285 2026-04-28 cs.NI cs.SE 50%

Towards Agentic Test-Driven Quality Assurance for 6G Networks

面向6G网络的代理驱动测试驱动质量保证

Christos Tranoris, Besiana Agko, Kostis Trantzas, Irene Denazi

专题命中 RAG评测 :knowledge retrieval(abstract)

AI总结 本文提出一个代理驱动的端到端 orchestration 框架,通过意图共创与测试驱动质量保证相结合,确保SLA合规性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11078 2026-04-14 cs.CR 50%

From Context to Rules: Toward Unified Detection Rule Generation

从上下文到规则:迈向统一的检测规则生成

Cheng Meng, Wenxin Le, Xinyi Li, Qiuyun Wang, Fangli Ren, Zhengwei Jiang, Baoxu Liu

专题命中 RAG评测 :RAG(abstract)

AI总结 本文提出UniRule框架,通过双语义投影空间实现跨上下文和语言的统一检测规则生成,实验表明其优于纯LLM生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10846 2026-04-14 eess.SY cs.SY 50%

PFAgent: A Tractable and Self-Evolving Power-Flow Agent for Interactive Grid Analysis

PFAgent:一种可计算且自演化功率流代理用于交互式电网分析

Buxin She, Brian Chen, Luanzheng Guo, Fangxing Li

专题命中 RAG评测 :knowledge retrieval(abstract)

AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08082 2026-04-10 cs.HC 50%

From Binary Groundedness to Support Relations: Towards a Reader-Centred Taxonomy for Comprehension of AI Output

从二元 groundedness 到支持关系:迈向以读者为中心的 AI 输出理解分类体系

Advait Sarkar, Christian Poelitz, Viktor Kewenig

专题命中 RAG评测 :retrieval augmented generation(abstract)

AI总结 本文提出以读者为中心的 groundedness 分类体系,旨在通过支持关系提升 AI 输出理解的透明度和可解释性。

Comments Advait Sarkar, Christian Poelitz, and Viktor Kewenig. 2026. From Binary Groundedness to Support Relations: Towards a Reader-Centred Taxonomy for Comprehension of AI Output. ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR) ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12142 2025-12-19 cs.CV 50%

MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering

MAVIS:多模态来源归因的长形式视觉问答基准

Seokwon Song, Minsu Park, Gunhee Kim

专题命中 RAG评测 :RAG(abstract)

AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。

Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10257 2025-12-15 cs.HC 50%

Reject or Not?: A Benchmark for Voice Assistant Query Rejection in Smart Home Scenario and an Improved Method Based on LLMs

拒绝或不?:智能家庭场景下的语音助手查询拒绝基准及基于LLM的改进方法

Huichao Men, Yizhen Hu, Yingyang He, Yu Gao, Xiaofeng Mou, Yi Xu

专题命中 RAG评测 :RAG(abstract)

AI总结 本文提出面向智能家庭场景的语音助手查询拒绝基准及基于LLM的改进方法,通过构建多模态数据集和三级协作架构提升拒绝准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00619 2025-11-04 cs.SE 50%

GDPR-Bench-Android: A Benchmark for Evaluating Automated GDPR Compliance Detection in Android

Huaijin Ran, Haoyi Zhang, Xunzhu Tang

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05533 2025-10-08 q-fin.PM 50%

The New Quant: A Survey of Large Language Models in Financial Prediction and Trading

Weilong Fu

专题命中 RAG评测 :retrieval-augmented generation(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03902 2025-10-07 cs.SE 50%

Multi-Agent Code-Orchestrated Generation for Reliable Infrastructure-as-Code

Rana Nameer Hussain Khan, Dawood Wasif, Jin-Hee Cho, Ali Butt

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13703 2025-09-18 cs.DC 50%

GPU Programming for AI Workflow Development on AWS SageMaker: An Instructional Approach

Sriram Srinivasan, Hamdan Alabsi, Rand Obeidat, Nithisha Ponnala, Azene Zenebe

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏