arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2604.00803 2026-04-02 cs.IR 70%

A novel three-step approach to forecast firm-specific technology convergence opportunity via multi-dimensional feature fusion

一种新颖的三步方法用于通过多维特征融合预测企业特定技术收敛机会

Fu Gu, Ao Chen, Yingwen Wu

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR

AI总结 本文提出一种三步方法,通过多维特征融合预测企业特定技术收敛机会,利用注意力机制和集成学习模型提升预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00550 2026-04-02 cs.AI 70%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI 70%

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24579 2026-03-26 cs.CL 70%

MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination

MARCH: 多智能体强化自检用于大语言模型幻觉

Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(通义大模型应用团队,阿里巴巴)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 MARCH通过多智能体强化学习框架,利用信息不对称机制减少大语言模型幻觉,实验表明其能显著降低幻觉率,8B参数模型表现接近闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23848 2026-03-26 cs.CL cs.CY 70%

BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents

BeliefShift:评估LLM代理中时间信念一致性和意见漂移的基准测试

Praveen Kumar Myakala, Manan Agrawal, Rahul Manche

机构 * Independent AI Researcher(独立AI研究员) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent Researcher(独立研究员)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 BeliefShift提出一个长期基准测试,评估多会话LLM交互中的信念动态,涵盖时间信念一致性、矛盾检测和证据驱动修正三个赛道,通过2400个标注交互轨迹验证模型在零样本和RAG设置下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02868 2026-03-24 cs.AI 70%

PrecLLM: A Privacy-Preserving Framework for Efficient Clinical Annotation Extraction from Unstructured EHRs using Small-Scale LLMs

PrecLLM: 一种用于从非结构化电子健康记录中高效提取临床注释的隐私保护框架,使用小型语言模型

Yixiang Qu, Yifan Dai, Shilin Yu, Pradham Tanikella, Malvika Pillai, Walter Chen, Jialiu Xie, Yishan Ren, Duan Wang, Yikai Wang, Sid Sheth, Guanting Chen, Yufeng Liu, Travis Schrank, Trevor Hackman, Didong Li, Di Wu

机构 * Department of Biostatistics, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校生物统计学系) Department of Genetics, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校遗传学系) Curriculum for Bioinformatics and Computational Biology, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校生物信息学与计算生物学课程) Carolina Health Informatics Program, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校健康信息学计划) Department of Statistics and Operations Research, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校统计学与运筹学系) Department of Otolaryngology/Head and Neck Surgery, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校耳鼻喉科及头颈外科系) Department of Statistics, University of Michigan(密歇根大学统计学系) Department of Biomedical Sciences, Adams School of Dentistry, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校阿德姆牙科学院生物医学科学系) Computational Medicine Program, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算医学计划) Lineberger Comprehensive Cancer Center, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校林伯格综合癌症中心)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出PrecLLM框架,利用小型语言模型高效处理非结构化电子健康记录,通过正则表达式和RAG技术提升隐私保护下的临床注释提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16526 2026-03-18 cs.AI 70%

Exploring different approaches to customize language models for domain-specific text-to-code generation

探索不同方法以定制语言模型用于领域特定的文本到代码生成

Luís Freire, Fernanda A. Andaló, Nicki Skafte Detlefsen

机构 * Technical University of Denmark(丹麦技术大学) The LEGO Group(乐高集团)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文探讨了如何通过合成数据集定制小型语言模型用于领域特定的代码生成,比较了少样本提示、检索增强生成和LoRA微调三种方法,发现LoRA在准确性和领域对齐上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15994 2026-03-18 cs.AI 70%

Selective Memory for Artificial Intelligence: Write-Time Gating with Hierarchical Archiving

选择性记忆用于人工智能:具有层次归档的写时门控

Oliver Zahn, Simran Chana

机构 * Independent Researcher(独立研究者) University of Cambridge(剑桥大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出写时门控机制,通过复合显著性评分筛选知识对象,保持版本链以保存先前状态,实验证明其在噪声环境下优于传统方法,尤其在干扰比例增加时表现更优。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 70%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03782 2026-03-12 cond-mat.supr-con cond-mat.str-el cs.AI 70%

Expert Evaluation of LLM World Models: A High-$T_c$ Superconductivity Case Study

专家评估LLM世界模型:一个高温超导体案例研究

Haoyu Guo, Maria Tikhanovskaya, Paul Raccuglia, Alexey Vlaskin, Chris Co, Daniel J. Liebling, Scott Ellsworth, Matthew Abraham, Elizabeth Dorfman, N. P. Armitage, Chunhan Feng, Antoine Georges, Olivier Gingras, Dominik Kiese, Steven A. Kivelson, Vadim Oganesyan, B. J. Ramshaw, Subir Sachdev, T. Senthil, J. M. Tranquada, Michael P. Brenner, Subhashini Venugopalan, Eun-Ah Kim

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。

Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25

Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 70%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04663 2026-03-10 cs.LG cs.AI cs.CE 70%

Neuro-Symbolic Financial Reasoning via Deterministic Fact Ledgers and Adversarial Low-Latency Hallucination Detector

通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理

Pedram Agand

机构 * FactAI Lab(FactAI实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06604 2026-03-10 cs.LG cs.CL 70%

Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection

知何时错误:将置信度与正确性对齐以用于LLM错误检测

Xie Xiaohu, Liu Xiaohu, Yao Benjamin

机构 * Alexa AI, Amazon, Seattle, WA, USA(Alexa AI,亚马逊,西雅图,华盛顿州)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出归一化置信度分数和自我评估框架,通过SFT提升LLM置信度可靠性,减少校准误差,提升错误检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06424 2026-03-09 cs.CL 70%

From Prompting to Preference Optimization: A Comparative Study of LLM-based Automated Essay Scoring

从提示到偏好优化:基于LLM的自动作文评分方法比较研究

Minh Hoang Nguyen, Vu Hoang Pham, Xuan Thanh Huynh, Phuc Hong Mai, Vinh The Nguyen, Quang Nhut Huynh, Huy Tien Nguyen, Tung Le

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文比较了基于LLM的自动作文评分方法,发现结合k-SFT和RAG的配置在F1分数上表现最佳,为英语作为第二语言的自动评分提供了新的研究方向。

Comments 19 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04756 2026-03-09 cs.AI cs.CE cs.SE 70%

MOOSEnger -- a Domain-Specific AI Agent for the MOOSE Ecosystem

MOOSEnger -- 一个针对MOOSE生态系统的领域特定AI代理

Mengnan Li, Jason Miller, Zachary Prince, Alexander Lindsay, Cody Permann

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 MOOSEnger 是一个专为MOOSE生态系统的AI代理,通过检索增强生成和领域特定工具提升多物理场仿真效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04417 2026-03-06 cs.CL 70%

Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge

相同输入,不同评分:多模型研究LLM裁判的一致性

Fiona Lau

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本研究探讨了LLM在不同模型、温度设置下对相同输入评分的一致性问题,发现模型间评分差异显著,温度影响稳定性,需引入混合评估策略以确保可靠应用。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01554 2026-03-03 cs.AI 70%

S5-HES Agent: Society 5.0-driven Agentic Framework to Democratize Smart Home Environment Simulation

S5-HES代理:面向社会5.0的代理框架,以民主化智能家庭环境模拟

Akila Siriweera, Janani Rangila, Keitaro Naruse, Incheon Paik, Isuru Jayanada

机构 * The University of Aizu(立命馆大学) The KD University(KD大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 S5-HES代理通过自主AI编排,实现无需编程的智能家庭模拟,满足社会5.0的多样化研究需求。

Comments 12 pages, 9 figures, and Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00958 2026-03-03 cs.CL 70%

S-VoCAL: A Dataset and Evaluation Framework for Inferring Speaking Voice Character Attributes in Literature

S-VoCAL:用于推断文学作品中说话声音特征属性的数据集和评估框架

Abigail Berthe-Pardo, Gaspard Michel, Elena V. Epure, Christophe Cerisara

机构 * LORIA Deezer Research Idiap Research Institute

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 S-VoCAL通过引入首个专门评估声音相关虚构角色属性推断的数据集和框架,展示了RAG流程在推断年龄和性别等属性上的有效性,但在出身和身体健康等属性上存在挑战。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14433 2026-03-03 cs.CY cs.AI cs.CR cs.HC 70%

PRISM: A Personalized, Rapid, and Immersive Skill Mastery framework for personalizing experiential learning through Generative AI

PRISM:一种个性化、快速且沉浸式的技能掌握框架,通过生成式AI实现体验式学习个性化

Yu-Zheng Lin, Karan Patel, Ahmed Hussain J Alhamadah, Bono Po-Jen Shih, Matthew William Redondo, David Rafael Vidal Corona, Banafsheh Saber Latibari, Jesus Pacheco, Soheil Salehi, Pratik Satam

机构 * Department of Electrical and Computer Engineering, University of Arizona(电气与计算机工程系,亚利桑那大学) Department of Systems and Industrial Engineering, University of Arizona(系统与工业工程系,亚利桑那大学) Department of Industrial Engineering, University of Sonora(工业工程系,索诺拉大学) Leonhard Center for Enhancement of Engineering Education, The Pennsylvania State University(工程教育增强中心,宾夕法尼亚州立大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 PRISM框架利用生成式AI和数字孪生技术,通过情感分析和RAG实现个性化、快速且沉浸式的技能学习,提升教育效率和适应性。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17826 2026-02-23 cs.AI cs.LG cs.SC 70%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.AI

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15860 2026-02-19 cs.CL 70%

Reranker Optimization via Geodesic Distances on k-NN Manifolds

通过k-NN流形上的测地距离实现重排序优化

Wen G. Gong

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 Maniscope通过k-NN流形上的测地距离优化重排序,实现比基线方法更高的精度和更低的延迟,适用于实时RAG部署。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13868 2026-02-17 cs.NI cs.IR 70%

Agentic Assistant for 6G: Turn-based Conversations for AI-RAN Hierarchical Co-Management

6G代理助手:基于回合的对话用于AI-RAN分层协同管理

Udhaya Srinivasan, Weisi Guo

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR

AI总结 本文提出了一种基于回合的对话助手,用于AI-RAN的分层协同管理,通过三层架构实现高效网络管理和降低运营成本。

Comments submitted to IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10017 2026-02-11 cs.CL 70%

SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation

SCORE:特定性、上下文利用、鲁棒性与相关性用于无参考LLM评估

Homaira Huda Shomee, Rochana Chaturvedi, Yangxinyu Xie, Tanwi Mallick

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出了一种无参考评估框架,用于评估LLM在高风险领域任务中的特定性、鲁棒性、相关性和上下文利用,通过精心编纂的数据集和人工评估验证了多指标评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04982 2026-02-10 cs.CL 70%

BioACE: An Automated Framework for Biomedical Answer and Citation Evaluations

BioACE: 一种用于生物医学答案和引用评估的自动化框架

Deepak Gupta, Davis Bartels, Dina Demner-Fushman

机构 * Division of Intramural Research(院内研究部) National Library of Medicine(国家医学图书馆)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 BioACE提出了一种自动化框架,用于评估生物医学答案和引用的质量,通过多方面指标和实验分析,提供最佳的评估方法。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06268 2026-02-09 cs.CL cs.LG 70%

MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs

MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准

Junhyeok Lee, Han Jang, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University(首尔国立大学) Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04693 2026-02-05 cs.CL cs.CY 70%

LinGO: A Linguistic Graph Optimization Framework with LLMs for Interpreting Intents of Online Uncivil Discourse

LinGO:一种结合大语言模型的语言图优化框架,用于解释在线不文明言论的意图

Yuan Zhang, Thales Bertaglia

机构 * University of Zurich(苏黎世大学) Utrecht University(乌特雷赫大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 LinGO通过多步骤语言组件优化,提升大语言模型对在线不文明言论意图的识别与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01355 2026-02-04 cs.AI 70%

Aggregation Queries over Unstructured Text: Benchmark and Agentic Method

无结构文本上的聚合查询:基准测试与代理方法

Haojia Zhu, Qinyuan Xu, Haoyu Li, Yuxi Liu, Hanchen Qiu, Jiaoyan Chen, Jiahui Jin

机构 * Southeast University(东南大学) Imperial College London(伦敦帝国学院) The University of Manchester(曼彻斯特大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出DFA方法,用于在无结构文本上进行完整性导向的聚合查询,通过模块化设计提升证据覆盖能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23129 2026-02-02 cs.CL 70%

Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics

评估基于参考-free LLM的文档接地的效用

Yilun Hua, Giuseppe Castellucci, Peter Schulam, Heba Elfardy, Kevin Small

机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16033 2026-01-29 cs.HC cs.AI 70%

Helping Johnny Make Sense of Privacy Policies with LLMs

帮助约翰尼理解隐私政策的LLMs

Vincent Freiberger, Arthur Fleig, Erik Buchmann

机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI) Dresden/Leipzig, Leipzig University(可扩展数据分析与人工智能中心(ScaDS.AI)德累斯顿/莱比锡,莱比锡大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 PRISMe通过结合LLM的政策评估与交互式界面,帮助用户更有效地理解和参与隐私政策,同时揭示了设计和技术上的挑战。

Comments 21 pages, 3 figures, 3 tables, ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19899 2026-01-28 cs.CL 70%

Evaluation of Oncotimia: An LLM based system for supporting tumour boards

对Oncotimia的评估:一种基于LLM的系统,用于支持肿瘤板

Luis Lorenzo, Marcos Montana-Mendez, Sergio Figueiras, Miguel Boubeta, Cristobal Bernardo-Castineira

机构 * Innovation Department, Bahía Software SLU(Bahía Software SLU创新部)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 Oncotimia通过LLM自动完成肺癌肿瘤板表单,提高了效率并减少了文档负担。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏