arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 113 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 113 篇

2607.27654 2026-07-31 cs.CL cs.AI 新提交 79%

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 79%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13647 2026-06-12 cs.CL cs.AI cs.LG 新提交 79%

SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation

SkMTEB:斯洛伐克大规模文本嵌入基准与模型适配

Marek Šuppa, Andrej Ridzik, Daniel Hládek, Natália Kňažeková, Viktória Ondrejová

机构 * Comenius University in Bratislava(布拉迪斯拉发夸美纽斯大学) Cisco Systems(思科系统) Technical University of Košice(科希策技术大学) Kempelen Institute of Intelligent Technologies(肯佩伦智能技术研究所)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源西斯拉夫语斯洛伐克语,构建首个MTEB风格文本嵌入基准SkMTEB(含31个数据集、7类任务),并开发高效本地部署模型e5-sk-small/large,通过词汇裁剪与微调在参数减少62%下达到与商业API相当的竞争力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09142 2026-08-11 cs.CL 新提交 77%

An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

用于结直肠癌治疗规划的智能体生成式大语言模型

Mengxian Lyu, Cheng Peng, Tim Jang, Ang Li, Mengyuan Zhang, Ziyi Chen, Leighton Elliott, Tianshi Liu, Lidice Galindo, Chiranjeevi Sainatham, Oscar F. Borja-Montes, Kaleb E. Smith, Ying Zhang, Lichao Sun, Jiang Bian, Gloria Lipori, Duane A. Mitchell, Elizabeth A. Shenkman, Yi Guo, Thomas J. George, Yonghui Wu

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05266 2026-08-07 cs.AI cond-mat.mtrl-sci cs.LG 新提交 77%

Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务

Nathan S Johnson, Ian Abshire

机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04286 2026-08-06 cs.CL cs.LG 新提交 77%

Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks

通过语义等价对抗攻击引出大语言模型的内在幻觉

Atri Vivek Sharma, Brian Formento, Alessio Lomuscio

机构 * Imperial College London(帝国理工学院) Safe Intelligence(安全智能研究院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出新框架,通过语义等价对抗攻击测试LLMs鲁棒性,发现先进模型易受语义保留扰动影响致忠实度大幅下降,凸显需开发鲁棒接地的LLM架构与训练目标。

Comments To be presented at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13370 2026-07-16 cs.CY cs.AI cs.HC 新提交 77%

Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System

学习参与助手(LEA):智能AI辅导系统的跨课程可扩展性与课堂评估

Teri Rumble, Javad Zarrin, P. George Lovell, Ruth Falconer

机构 * Faculty of Design, Informatics and Business(设计、信息学与商业学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究LEA智能AI辅导系统,首次在真实学生中进行课堂部署并测试跨课程可扩展性,发现模拟与实际有差异,基于RAGAS评估答案相关性等指标,表明编排层无需改,下游组件课程无关性待进一步研究。

Comments Extended version of a paper presented at ICAART 2026. Manuscript under review at SN Computer Science (Springer). 32 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07721 2026-07-10 cs.AI cs.LG 新提交 77%

Context Graphs for Proactive Enterprise Agents

用于主动企业智能体的上下文图

Avinash Kumar

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究旨在让企业智能体更主动,提出上下文图结构,定义相关检测引擎、评分器和呈现层,形式化组件并给出Python实现,经案例研究评估,该方法提升了Precision@5,降低误报率和平均呈现时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05479 2026-07-08 cs.CR cs.AI 新提交 77%

Privilege and confidentiality in generative AI workflows

生成式人工智能工作流程中的特权与保密性

Václav Janeček, Thomas Melham

机构 * University of Bristol Law School(布里斯托大学法学院) University of Oxford(牛津大学) Department of Computer Science(计算机科学系)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究生成式人工智能系统三种数据存储和处理模式带来的保密性与法律专业特权风险,结合英美判决、权威及研究进行分析,置于监管框架和专业疏忽原则中探讨,助法律服务人员理解风险,推动GenAI更负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24902 2026-06-25 cs.DL cs.AI 新提交 77%

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

大语言模型在研究级数学问题上的失败模式:分类与实证刻画

Arnesh Banerjee, Ayushi Bhattacharjee

机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21123 2026-06-23 cs.CL 新提交 77%

A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening

面向高风险推理的多智能体审计框架:临床心理健康筛查中的评估与可解释性

Jingchen Ye, Yanpei Yu, Luyao Zhang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract);分类 cs.CL

AI总结 提出多智能体审计框架,通过感知、知识检索、思维链推理和审计验证的多步协作,在临床心理健康筛查中降低PHQ-8抑郁预测误差,提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-19 cs.NE 新提交 75%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 RAG评测 :RAG(summary_cn);retrieval-augmented generation(abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 75%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01783 2026-08-04 cs.SD cs.HC stat.AP 新提交 75%

Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

Baicheng Lin, Lingxi Jin, Kyung-Seok Min

机构 * Sejong University(世宗大学) Ewha Womans University(梨花女子大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

Comments Proceedings of the International Meeting of the Psychometric Society: The 91st Annual Meeting, Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05440 2026-07-08 econ.EM cs.SY eess.SY 新提交 75%

Retrieval over Reasoning: A Cost-Controlled Benchmark of Language Models for Energy-Retrofit Recommendation

基于推理的检索:用于能源改造推荐的语言模型成本控制基准

Eliseo Curcio

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08921 2026-06-09 cs.LG 新提交 75%

Generalized Rank-based Evaluation for Knowledge Graph Completion: Perspectives, Framework, and Analyses

基于排序的知识图谱补全广义评估:视角、框架与分析

Sooho Moon, Jian Kang, Yunyong Ko

机构 * Chung-Ang University(中央大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 针对现有评估指标忽视预测锐度与流行偏差鲁棒性的问题,提出广义评估框架PROBE,通过排序变换器和排序聚合器实现更全面、灵活且一致的模型评估。

Comments 25 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14588 2026-08-18 cs.AI cs.CL cs.MA 新提交 73%

The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines

幻觉滚雪球:将多智能体大语言模型流水线中的错误传播建模为状态转移

Prabhjot Singh, Bhushan Pawar

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究发现多智能体LLM流水线中存在幻觉滚雪球效应,即幻觉会随状态转移而逃逸,且边界门控验证比末端检查更能有效降低幻觉存活率,还提出了最优验证资源分配策略。

Comments 10 pages, 3 figures; accepted at the FAGEN Workshop (Failure Modes in Agentic AI), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14320 2026-08-17 cs.AI cs.CL 新提交 73%

AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs

AnchorBench:针对大语言模型中锚定效应的多路径基准测试

Yiderigun Borjigin, Alexander Hermann, Christian Cyron, Roland Aydin

机构 * Saarland University(萨尔大学) Hamburg University of Technology(汉堡工业大学) Helmholtz-Zentrum Hereon(亥姆霍兹中心赫伦) German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文推出针对大语言模型锚定效应的基准测试AnchorBench,经14种模型实验,揭示锚定效应的路径依赖性等特性,发现高控制准确率的前沿模型仍易受合理锚点影响。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10385 2026-08-12 cs.IR cs.AI 新提交 73%

Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具

Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie, Gianluca Demartini

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02613 2026-08-05 cs.CL cs.AI cs.LG cs.MA 新提交 73%

MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

MemArena:面向移动端智能体个人记忆助手的大规模自我中心基准测试

Jiadong Zhang, Xiaosong Ma

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究针对现有记忆基准测试的不足,构建了MemArena基准,评估了不同记忆后端对移动端个人记忆助手的影响,发现后端选择对内容准确性影响更大,权限感知访问失效,搜索延迟仅在阅读器规模极小时有影响。

Comments 48 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15335 2026-06-16 cs.CL cs.AI 新提交 73%

Privacy-Preserving Text Sanitization for Distributed Agents Collaboration via Disentangled Representations

基于解耦表示的分布式智能体协作隐私保护文本净化

Xuan Liu, Hefeng Zhou, Sicheng Chen, Chao Yang, Xingcheng Xu, Jingjing Qu, Jiong Lou, Jie LI, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出DiSan框架,通过解耦文本为任务语义和风格子空间,结合联邦原型对齐与对抗正则化,在分布式多智能体协作中实现隐私保护,显著降低风格归因和PII泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11712 2026-06-11 cs.CL cs.AI cs.LG 新提交 73%

Substrate Asymmetry in User-Side Memory: A Diagnostic Framework

用户侧记忆中的子模块不对称性:一个诊断框架

Youwang Deng

机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一个诊断框架,将LLM用户侧记忆分解为行为一致性、事实存在和事实缺失三个正交子模块,发现参数记忆与检索记忆在不同子模块上存在不对称性,且RLHF调优加剧了这种不对称性。

Comments Preprint. Code: https://github.com/EpistemicaLab/substrate-asymmetry-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16286 2026-08-18 cs.CL 新提交 70%

Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?

条款式的第三类接触:大型语言模型能否替代语言教师?

Kristina Šekrst, Ana Kovačić

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn);分类 cs.CL

AI总结 该研究评估了LLM替代语言教师提供教学反馈与解释的能力,发现其纠错能力出色但教学解释不足,AI辅助语言学习热情或超出对其教学能力的认知。

Journal ref Oxford Intersections: AI in Society (Oxford, online edn, Oxford Academic, 20 Mar. 2025 - )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13883 2026-08-17 cs.AI 新提交 70%

MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends

基于MemoryArena的MemoryLake研究:智能体记忆后端的匹配对比

Chaoqun Zhan, Qiang Zhou, Guannan Li, Zhenqiang Huang, Qianjin Wang

机构 * MemoryLake Team(MemoryLake团队)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 该研究在MemoryArena的五个任务领域中,对比MemoryLake等三种智能体记忆后端,发现MemoryLake在数学等三个领域成功率最高,整体平均成功率领先,且性能与工作负载相关。

Comments 16 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12984 2026-08-14 cs.MA cs.CL 新提交 70%

Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research

一次对账,随时撰写:用于无漂移、时点研究的信任分层图书馆与多智能体撰写器

Xing Zhang, Yanwei Cui, Guanghui Wang, Peiyang He

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出双层智能体系统,通过信任分层图书馆与多智能体撰写器分离知识库与报告撰写,消除报告矛盾与漂移,实验验证其在多指标、多场景下的有效性与效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 70%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 70%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17963 2026-07-21 cs.AI 新提交 70%

OntoExtend: A Framework for Requirement-driven and Scalable Ontology Extension with LLMs

OntoExtend:一个用于基于需求驱动和可扩展的大语言模型本体扩展框架

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Stefan Schmid, Simon Blattner, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * Linköping University(林雪平大学) University of Bologna(博洛尼亚大学) Bosch(博世公司) ISTC-CNR(意大利国家研究委员会信息科学与技术研究所)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 研究基于需求驱动的本体扩展问题,提出用检索增强生成的OntoExtend框架,通过在相关输入本体和需求上应用该框架,在两个用例的能力问题上评估,结果显示其可作为现实场景中本体扩展起草助手,对问题特异性和建模概要敏感。

Comments Accepted in research track of Semantics 2026: https://2026-eu.semantics.cc/page/accepted_research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14035 2026-07-16 cs.IR cs.DL 新提交 70%

Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)

优化生成引擎中的可见性:生成引擎优化的批判性综述(2023 - 2026)

Olivier Martinez

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR

AI总结 该研究对2023年11月至2026年有关生成引擎优化的45项研究进行批判性综述,指出其术语等存在异质性。贡献多阶段形式模型等,表明虽有成果但证据有限,未显示技术对有机可发现性等有稳定因果效应。

Comments 18 pages, 8 tables, 1 figure; critical survey of 45 studies; ancillary literature matrix and search protocol included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 70%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏