arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1212 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1212 篇

2601.02023 2026-07-16 cs.CL cs.AI 版本更新 73%

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉

Amirali Ebrahimzadeh, Seyyed M. Salili

机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。

Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 73%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05257 2026-06-30 cs.CL cs.AI 73%

Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

通过增量多轮交互评估LLM代理的记忆能力

Yuanzhe Hu, Yu Wang, Julian McAuley

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MemoryAgentBench,通过多轮交互模拟记忆代理的信息积累过程,评估准确检索、测试时学习、长程理解与选择性遗忘四项核心能力。

Comments Y. Hu and Y. Wang contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29473 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 版本更新 73%

Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

告知、指导、共情、倾听:审计LLM护理支持角色

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Dong Whi Yoo, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15335 2026-06-16 cs.CL cs.AI 新提交 73%

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

基于解耦表示的分布式智能体协作隐私保护文本净化

Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出DiSan框架,通过解耦文本为任务语义和风格子空间,结合联邦原型对齐与对抗正则化,在分布式多智能体协作中实现隐私保护,显著降低风格归因和PII泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11712 2026-06-11 cs.CL cs.AI cs.LG 新提交 73%

Substrate Asymmetry in User-Side Memory: A Diagnostic Framework

用户侧记忆中的子模块不对称性:一个诊断框架

Youwang Deng

机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一个诊断框架,将LLM用户侧记忆分解为行为一致性、事实存在和事实缺失三个正交子模块,发现参数记忆与检索记忆在不同子模块上存在不对称性,且RLHF调优加剧了这种不对称性。

Comments Preprint. Code: https://github.com/EpistemicaLab/substrate-asymmetry-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06492 2026-06-05 cs.SE cs.AI cs.CL 73%

Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution

Code2LoRA:用于软件演化下代码语言模型的超网络生成适配器

Liliana Hotsko, Yinxi Li, Yuntian Deng, Pengyu Nie

机构 * University of Waterloo(滑铁卢大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Code2LoRA超网络框架,通过生成仓库特定的LoRA适配器注入仓库知识,无需推理时令牌开销,支持静态和演化两种场景,在RepoPeftBench上达到与逐仓库LoRA相当或更优的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10063 2026-06-05 cs.CL cs.AI math.AT 73%

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs

基于注意力图拓扑分歧的LLM幻觉检测

Alexandra Bazarova, Andrei Volodichev, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey Savchenko, Serguei Barannikov, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所) SB AI Lab(SB人工智能实验室) HSE University(俄罗斯高等经济学院) CNRS, Universite Paris Cite(法国国家科学研究中心,巴黎Cité大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出TOHA方法,通过分析注意力矩阵的拓扑结构来检测LLM中的幻觉现象,实验表明该方法在多个基准测试中表现优异,且对标注数据和计算资源需求较低。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03728 2026-06-03 cs.CL cs.IR 73%

Re-Ranking Through an Attribution Lens for Citation Quality in Legal QA

通过归因视角对法律问答中的引用质量进行重排序

Mohamed Hesham Elganayni, Selim Saleh

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL

AI总结 针对法律问答中检索增强生成系统的引用质量问题,提出基于扰动归因分数训练轻量级交叉编码器对候选段落重排序,显著提升引用忠实度并与专家答案对齐。

Comments 11 pages, 4 tables, 1 figure. Published at ASAIL 2026 (8th Workshop on Automated Semantic Analysis of Information in Legal Text), co-located with ICAIL 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18565 2026-05-20 cs.CL cs.AI 73%

MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

MINTEval: 评估长时间跨度智能体系统中的多目标干扰下的记忆

Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh, Zaid Khan, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出MINTEval基准,用于评估智能体在长时间跨度和多目标干扰下的记忆表现,通过长连接上下文、多领域和多类型问题来测试记忆增强代理的鲁棒性和泛化能力。

Comments Equal contribution; order decided by a coin flip. Code and data: https://github.com/amy-hyunji/MINTEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14679 2026-05-15 cs.CL cs.AI 73%

AI-assisted cultural heritage dissemination: Comparing NMT and glossary-augmented LLM translation in rock art documents

人工智能辅助文化遗产传播:比较NMT和术语增强大语言模型在岩画文档中的翻译

Vicent Briva-Iglesias, María Ferre-Fernández

机构 * Dublin City University(都柏林城市大学) CTTS(文化传承研究所) ADAPT Centre(适应中心) SALIS Universidad de Almería(阿尔梅里亚大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文比较了NMT和术语增强大语言模型在岩画文档翻译中的表现,发现术语增强方法在术语准确性上更优,且在保持整体质量方面表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 73%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10024 2026-05-11 cs.IR cs.CL 73%

Overview of the TREC 2025 RAGTIME Track

TREC 2025 RAGTIME 跟踪任务概述

Dawn Lawrie, Sean MacAvaney, James Mayfield, Luca Soldaini, Eugene Yang, Andrew Yates

机构 * Johns Hopkins University Human Language Technology Center of Excellence(约翰霍普金斯大学人机语言技术卓越中心) University of Glasgow(格拉斯哥大学) Allen Institute for AI(人工智能研究院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.CL

AI总结 TREC 2025 RAGTIME 跟踪任务旨在研究多语言源文档的报告生成,包含阿拉伯语、中文、英语和俄语新闻故事的文档集,涵盖多语言报告生成、英语报告生成和多语言信息检索三个任务,共13支队伍提交125次运行。

Comments 14 pages, 3 figures, final version of the RAGTIME 2025 overview paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19897 2026-05-04 cs.CL cs.AI cs.LG 73%

Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation

通过语义和事件记忆学习:一种反思式智能体适应方法

Jackson Hassell, Dan Zhang, Hannah Kim, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一种基于记忆增强的框架,利用预训练大语言模型生成的批判性反馈,通过语义和事件记忆提升智能体适应能力,实验证明其在多个任务中有效。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22003 2026-05-04 cs.CL cs.AI 73%

Lightweight Domain Adaptation of a Large Language Model for Legal Assistance in the Indian Context

轻量级领域适应大型语言模型用于印度法律援助

Jatin Gupta, Akhil Sharma, Saransh Singhania, Ali Imam Abidi

机构 * Department of Computer Science and Engineering, Sharda University, Greater Noida, India(计算机科学与工程系,Sharda大学,Greater Noida,印度)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Legal Assist AI框架,通过检索增强生成与策略性提示工程,在印度法律领域实现高效表现,利用高质量法律文档集提升性能,比GPT-3.5 Turbo更高效,且有效缓解幻觉问题。

Comments 8 pages, 2 tables, 5 figures. This is a revised version of a preprint previously available at this DOI: \url{https://doi.org/10.48550/arXiv.2505.22003}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13071 2026-04-28 cs.CL cs.AI 73%

EVE: A Domain-Specific LLM Framework for Earth Intelligence

EVE:面向地球智能的领域专用LLM框架

Àlex R. Atrio, Antonio Lopez, Jino Rohit, Yassine El Ouahidi, Marcello Politi, Vijayasri Iyer, Umar Jamil, Sébastien Bratières, Nicolas Longépé

机构 * Pi School(Pi学校) Mistral AI Translated ESA Φ \Phi -lab(ESA Φ实验室)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 EVE首次提出开源端到端框架,构建24B领域适应模型,在地球观测和科学基准上超越同类模型,提供系统化评估基准和生产系统,支持350名试点用户。

Comments To be published in the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13240 2026-04-28 cs.SE cs.AI cs.CL cs.LG 73%

KOCO-BENCH: Can Large Language Models Leverage Domain Knowledge in Software Development?

KOCO-BENCH: 大型语言模型能否在软件开发中利用领域知识?

Xue Jiang, Ge Li, Jiaru Qian, Xianjie Shi, Chenjie Li, Hao Zhu, Ziyu Wang, Jielun Zhang, Zheyu Zhao, Lingwei Wu, Kechi Zhang, Jia Li, Wenpin Jiao, Zhi Jin, Yihong Dong

机构 * School of Computer Science, Peking University(北京大学计算机科学系) School of Computer Science, Wuhan University(武汉大学计算机科学系)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 KOCO-BENCH旨在评估大型语言模型在软件开发中利用领域知识的能力,包含6个新兴领域、11个软件框架和25个项目,通过多粒度任务测试模型的知识获取与应用能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06710 2026-04-21 cs.AI cs.IR 73%

ATANT: An Evaluation Framework for AI Continuity

ATANT:人工智能连续性的评估框架

Samuel Sameer Tanguturi

机构 * Kenotic Labs(肯otic实验室)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 本文提出ATANT框架,用于评估AI系统在时间维度上的连续性能力,通过10个检查点方法和250个故事的叙事测试集,验证系统在不同架构下的连续性表现。

Comments 7 pages, 8 tables. Framework and evaluation protocol available at https://github.com/Kenotic-Labs/ATANT and https://kenoticlabs.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11209 2026-04-14 cs.CL cs.AI 73%

Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method

探索知识冲突以实现忠实的LLM推理:基准与方法

Tianzhe Zhao, Jiaoyan Chen, Shuxiu Zhang, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08256 2026-04-13 cs.CL cs.AI 73%

HyperMem: Hypergraph Memory for Long-Term Conversations

HyperMem:用于长期对话的超图记忆

Juwei Yue, Chuanrui Hu, Jiawei Sheng, Zuyi Zhou, Wenyuan Zhang, Tingwen Liu, Li Guo, Yafeng Deng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) EverMind AI

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 HyperMem通过超图结构建模高阶关联,提升长期对话中的记忆检索效率与准确性,实验表明其在LoCoMo基准上达到92.73%的LLM-as-a-judge准确率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09096 2026-03-31 cs.CL cs.IR 73%

Link Prediction for Event Logs in the Process Industry

过程工业事件日志中的链接预测

Anastasia Zhukova, Thomas Walton, Christian E. Lobmüller, Bela Gipp

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 本文提出一种跨文档核心ference解决方法,用于解决过程工业中事件日志碎片化问题,提升数据质量和连接性。

Comments accepted to RESOURCEFUL 2026, co-located with LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27404 2026-03-31 cs.AI cs.CL cs.CY cs.HC cs.MA 73%

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

异质辩论引擎:基于身份的认知架构用于鲁棒的基于大语言模型的伦理导师

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙理工大学计算机科学研究所)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出异质辩论引擎,结合身份导向检索增强生成与启发式理论思维,解决多代理系统在伦理教学中保持精确回答的挑战。

Comments 15 pages, 3 figures, 4 tables. Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23625 2026-03-26 cs.AI cs.CL 73%

Evaluating a Multi-Agent Voice-Enabled Smart Speaker for Care Homes: A Safety-Focused Framework

评估多智能体语音赋能的智能音箱在养老机构中的应用:以安全为导向的框架

Zeinab Dehghani, Rameez Raja Kureshi, Koorosh Aslansefat, Faezeh Alsadat Abedi, Dhavalkumar Thakker, Lisa Greaves, Bhupesh Kumar Mishra, Baseer Ahmad, Tanaya Maslekar

机构 * University of Hull, UK(赫尔大学) University of Southampton, UK(南安普顿大学) Connexin, Hull, UK(Connexin公司) Leeds Teaching Hospital NHS Trust, UK(利兹教学医院国家健康服务信托)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了语音赋能的养老机构智能音箱,通过结合语音识别与检索增强生成技术,验证其在居民识别、提醒提取和任务调度中的准确性,为安全导向的护理系统提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22625 2026-03-25 cs.IR cs.CL 73%

Leveraging Large Language Models to Extract and Translate Medical Information in Doctors' Notes for Health Records and Diagnostic Billing Codes

利用大型语言模型提取和翻译医生笔记中的医疗信息用于健康记录和诊断收费代码

Peter Hartnett, Chung-Chi Huang, Sarah Hartnett, David Hartnett

机构 * Department of Computer Science & Information Technologies, Frostburg State University(弗罗斯堡州立大学计算机科学与信息科技系) Department of Emergency Medicine, FAU Charles E Schmidt College of Medicine(FAU查尔斯·E·施密特医学院急诊医学系)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 本文研究利用本地大语言模型提取医生笔记中的临床信息并翻译为ICD-10-CM诊断代码,探讨隐私保护下的医疗信息提取方法,发现需结合人类辅助以提高准确性。

Comments 45 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22367 2026-03-25 cs.IR cs.AI 73%

Reasoner-Executor-Synthesizer: Scalable Agentic Architecture with Static O(1) Context Window

推理-执行-合成器:具有静态O(1)上下文窗口的可扩展代理架构

Ivan Dobrovolskyi

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

AI总结 本文提出RES架构,通过分离意图解析、确定性数据检索与叙事生成,实现O(1)的token复杂度,有效解决LLM代理中上下文窗口过大导致的幻觉风险和token成本问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22290 2026-03-25 cs.CL cs.IR 73%

Less is More: Adapting Text Embeddings for Low-Resource Languages with Small Scale Noisy Synthetic Data

少即是多:利用小规模噪声合成数据适应低资源语言的文本嵌入

Zaruhi Navasardyan, Spartak Bughdaryan, Bagrat Minasyan, Hrant Davtyan

机构 * Metric AI Lab(Metric AI实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 本文挑战了大规模数据对语义对齐的必要性假设,通过小规模噪声合成数据提升低资源语言文本嵌入性能,实验显示在仅1万对数据下即可获得显著改进,验证了噪声对语义对齐的鲁棒性。

Comments Accepted at LoResLM 2026, EACL 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18009 2026-03-20 cs.CL cs.AI 73%

How Confident Is the First Token? An Uncertainty-Calibrated Prompt Optimization Framework for Large Language Model Classification and Understanding

第一个token的可信度如何?一种用于大型语言模型分类和理解的不确定性校准提示优化框架

Wei Chen, Guoyang Ju, Yuanyuan Qi

机构 * China Jiliang University(中国嘉兴大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LSFU指标和UCPOF框架,通过校准提示优化提升模型性能,实验显示在少样本基准上准确率提升6.03%,超越全RAG方法,并降低检索触发率50.66%。

Comments 27 pages,16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12458 2026-03-16 cs.CL cs.AI 73%

Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs

打破捷径:一种用于LLMs多跳医学推理的拓扑正则化基准

Xing Zi, Xinying Zhou, Jinghao Xiao, Catarina Moreira, Mukesh Prasad

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ShatterMed-QA基准,通过拓扑正则化知识图谱评估深度诊断推理能力,揭示LLMs在多跳医学推理中的缺陷,并验证RAG方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06426 2026-03-10 cs.CL cs.AI 73%

NC-Bench: An LLM Benchmark for Evaluating Conversational Competence

NC-Bench: 一个评估大型语言模型对话能力的LLM基准

Robert J. Moore, Sungeun An, Farhan Ahmed, Jay Pankaj Gala

机构 * Independent Researcher(独立研究者) IBM Research(IBM研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 NC-Bench提出了一种评估大型语言模型对话能力的基准,通过三种不同集合测试模型在不同对话任务中的表现,发现模型在基础回答任务表现较好,但在复杂多轮请求上面临挑战。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05519 2026-03-09 cs.CL cs.HC cs.IR 73%

Verify as You Go: An LLM-Powered Browser Extension for Fake News Detection

边验证边检测:一种基于大语言模型的浏览器扩展用于假新闻检测

Dorsaf Sallami, Esma Aïmeur

机构 * Department of Computer Science and Operations Research, University of Montreal(计算机科学与运筹学系,蒙特利尔大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 Aletheia通过结合RAG和大语言模型,提供基于证据的假新闻检测和用户互动功能,提升透明度和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏