arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-09-01 至 2026-09-01 共收录 67 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 13 篇

2608.28629 2026-09-01 cs.CL cs.AI 新提交 73%

Intelligent Identification and Repair of Design Defects in BIM via Domain-Specific Large Language Models

基于领域专用大语言模型的BIM设计缺陷智能识别与修复

Jia-Rui Lin, Yun-Hong Cai, Xiang-Rui Ni, Peng Pan

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出结合领域专用LLM、BIM转文本方法及幻觉控制策略的集成框架,实现BIM设计缺陷的智能识别与修复,识别准确率达85%,合理修复建议生成率94%,构建了端到端原型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28607 2026-09-01 cs.AI cs.CL 新提交 73%

RegDivergence-101: An LLM Benchmark for Cross-Jurisdiction Regulatory Contradiction Detection in Life Sciences

RegDivergence-101:用于生命科学领域跨司法管辖区监管矛盾检测的大语言模型基准

Chuchu Wu, Zhiyin Zhou, Jingzhuo Hu, Liang You

机构 * Carnegie Mellon University(卡内基梅隆大学) Pratt Institute(普拉特学院) University of Pennsylvania(宾夕法尼亚大学) University of Pittsburgh(匹兹堡大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文发布RegDivergence-101基准,提出跨司法管辖区监管分歧检测任务,对比四类方法性能,发现未提及类的检测特性,为大规模检测指明架构方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29742 2026-09-01 cs.AI 版本更新 70%

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

引用闭包检索与逐规则归因:面向真实世界法规合规问答

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 针对法规合规问答中多层级权威结构的引用追踪难题,提出基于操作知识图谱的基准RegOps-Bench和统一框架RefWalk,通过共享主题锚点遍历跨文档引用、多视角候选融合及逐规则归因,显著提升检索召回率和引用准确性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20884 2026-09-01 cs.CL 版本更新 70%

MemoNoveltyAgent: A Historical Research Memory-Aware Agent Workflow for Paper Novelty Assessment

MemoNoveltyAgent:一种用于论文新颖性评估的历史研究记忆感知智能体工作流

Jiajun Hou, Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Xiaopeng Ke, Derek F. Wong, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能研究院,哈尔滨工业大学深圳校区,中国) Xiaohongshu Inc.(小红书公司) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) NLP 2 CT Lab, Department of Computer and Information Science, University of Macau, China(自然语言处理2实验室,计算机与信息科学系,澳门大学,中国)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 提出MemoNoveltyAgent多智能体系统,通过分层抽象记忆、细粒度新颖点分解和自验证机制,生成忠实的新颖性报告,在评估中比GPT-5 DeepResearch提升13.69%。

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30932 2026-09-01 cs.AR 新提交 67%

Beacon: LLM Multi-Agent Driven Hardware Design Space Exploration for Heterogeneous Multi-Chiplet Deep Learning Accelerators

Beacon:面向异构多小芯片深度学习加速器的大语言模型多智能体驱动硬件设计空间探索

Boyu Li, Zongwei Zhu, Qianyue Cao, Xi Li, Xuehai Zhou

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 Beacon是一种报告驱动的LLM多智能体框架,用于异构多小芯片深度学习加速器的HW-DSE,可在有限迭代预算下将延迟-能耗-金钱成本的综合目标降低25.1%-93.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29582 2026-09-01 cs.CL cs.AI 新提交 62%

SUP-MIMIC: A Multi-Task Clinical Diagnosis Benchmark for Evaluating LLMs' Robustness to Contradictory Evidence

SUP-MIMIC:用于评估大型语言模型对矛盾证据鲁棒性的多任务临床诊断基准

Yi Yu, Bo Wang, Chong Feng, Ge Shi, Xia Liu, Ziyi Yang, Xuewen Shi

机构 * Beijing University of Technology(北京工业大学) Beijing Institute of Technology(北京理工大学) China-Japan Friendship Hospital(中日友好医院) Dongbei University of Finance and Economics(东北财经大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出多任务临床诊断基准SUP-MIMIC,评估发现当前先进LLMs在诊断分歧与聚合任务上性能大幅下降,存在漏诊风险,为提升医疗场景下LLMs安全性提供了方法与路线图。

Comments 18 pages, 13 figures, 3 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30327 2026-09-01 cs.CL 新提交 57%

Do Small Models Use the Law You Give Them? Measuring Context Use on a Bilingual Bangladesh Legal Benchmark

小模型是否会利用你提供的法律?在孟加拉语-英语双语孟加拉法律基准上测量上下文利用情况

Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa, Mir Mohammad Asif Abdullah, Swakkhar Shatabda, Md Adnan Arefeen

机构 * North South University(北南大学) BRAC University(BRAC大学) HuggingFace

专题命中 RAG评测 :retriever(abstract);分类 cs.CL

AI总结 该研究针对双语孟加拉法律问答任务,发现微调未提升小模型对上下文中法律的依赖,需分离评分、检索及模型效应对评估法律适配性的影响

Comments Legal Data Benchmark for Bangladesh

详情

展开后加载摘要…

URL PDF HTML 收藏