arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2312.14211 2023-12-25 cs.CL astro-ph.IM cs.AI 62%

Experimenting with Large Language Models and vector embeddings in NASA SciX

Sergi Blanco-Cuaresma, Ioana Ciucă, Alberto Accomazzi, Michael J. Kurtz, Edwin A. Henneken, Kelly E. Lockhart, Felix Grezes, Thomas Allen, Golnaz Shapurian, Carolyn S. Grant, Donna M. Thompson, Timothy W. Hostetler, Matthew R. Templeton, Shinyi Chen, Jennifer Koch, Taylor Jacovich, Daniel Chivvis, Fernanda de Macedo Alves, Jean-Claude Paquin, Jennifer Bartlett, Mugdha Polimera, Stephanie Jarmak

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL、cs.AI

Comments To appear in the proceedings of the 33th annual international Astronomical Data Analysis Software & Systems (ADASS XXXIII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15548 2023-11-28 cs.CL cs.AI cs.LG q-fin.ST 62%

Deficiency of Large Language Models in Finance: An Empirical Examination of Hallucination

Haoqiang Kang, Xiao-Yang Liu

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18344 2023-10-31 cs.CL cs.AI cs.LG 62%

Chainpoll: A high efficacy method for LLM hallucination detection

Robert Friel, Atindriyo Sanyal

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02520 2023-07-18 cs.CL cs.AI cs.LG 62%

A Study of Situational Reasoning for Traffic Understanding

Jiarui Zhang, Filip Ilievski, Kaixin Ma, Aravinda Kollaa, Jonathan Francis, Alessandro Oltramari

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 6 figures, 5 tables, camera ready version of SIGKDD 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-08-24 cs.CL 版本更新 57%

ZenGen: Social Mind for LLMs

Zing:大语言模型的社交智能

ZenGen Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-20 cs.AI 版本更新 57%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02876 2026-08-19 cs.CL 版本更新 57%

Eval4Sim: An Evaluation Framework for Persona Simulation

Eval4Sim: 一种用于人设模拟的评估框架

Eliseo Bao, Anxo Perez, Javier Parapar, Xi Wang

机构 * University of Sheffield(谢菲尔德大学)

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL

AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16586 2026-08-18 cs.IR 新提交 57%

When Is Complex Chunking Worth It? A Multi-Objective Evaluation of Chunking Methods at Scale

复杂分块何时值得?大规模分块方法的多目标评估

Laura Caspari, Kanishka Ghosh Dastidar, Michael Dinzinger, Jelena Mitrović, Michael Granitzer

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR

AI总结 该研究针对长文档分块的多目标评估问题,在多语料库、多模型下对比八种分块策略,发现分块需兼顾检索性能与系统成本,应作为多目标设计决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13389 2026-08-14 cs.AI cs.CR cs.NI 新提交 57%

TopoIntent: Compiling Security Intent into Executable, Compliance-Checked Network Topologies

TopoIntent:将安全意图编译为可执行、合规性检查的网络拓扑结构

Xiaokang Qu, Jianliang Ma, Zao Fan, Tianshu Chu, Tianlong Fan, Linyuan Lü

机构 * University of Science and Technology of China(中国科学技术大学) Topsec Technologies Group Inc.(天融信科技集团股份有限公司)

专题命中 RAG评测 :vector search(abstract);分类 cs.AI

AI总结 TopoIntent系统通过模式契约、向量搜索和分阶段融合将安全意图编译为合规可执行拓扑,经评估其修复后CIS满意度与ACL通过率均显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00898 2026-08-11 cs.CL cs.DL 版本更新 57%

Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law

引用溯源:通过法律引用图检测和减少LLM引用幻觉

Volodymyr Ovcharov

机构 * LEX AI LLC

专题命中 RAG评测 :RAG(abstract_cn);分类 cs.CL

AI总结 提出引用溯源(CG)指标,利用乌克兰法院判决的引用图(1.008亿判决,5.02亿边)检测LLM法律引用幻觉,并通过CG-DPO方法(基于真实判决构建偏好对)减少幻觉,在100个法律查询上CG为0.791-0.873,幻觉率13-21%。

Comments 21 pages, 4 figures, 5 tables. Substantially revised: title, framing and several v1 results changed. Adds a coverage sweep and a separability analysis; corrects the DPO configuration, the density-accuracy correlation and the qualitative examples. Code and data: https://huggingface.co/datasets/overthelex/citation-grounding-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03591 2026-08-05 cs.CR cs.AI 新提交 57%

DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

DiagChain:用于评估大语言模型智能体基于证据的攻击链重构的诊断基准

Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究针对LLM智能体攻击链重构基准的不足,提出DiagChain基准与ECRAG方法,经6种LLM评估发现模型在证据整合与排序环节存在瓶颈,为网络安全智能体改进提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22345 2026-07-27 cs.RO cs.AI 新提交 57%

Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education

Teachy Mini:用于高等教育的基于知识的生成式社交机器人的开发与初步评估

Stephan Vonschallen, Karim Kaufmann, Dominique Oberle, Friederike Eyssel, Theresa Schmiedel

机构 * Institute of Information Systems, Zurich University of Applied Sciences(苏黎世应用科学大学信息系统研究所) Center for Cognitive Interaction Technology, Bielefeld University(比勒费尔德大学认知交互技术中心)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究针对生成式社交机器人在高等教育辅导中的风险,基于知识的设计要求开发Teachy Mini系统,经初步评估,该系统在负责任辅导行为及个性化等方面表现更佳,虽在部分方面与对照无显著差异,但显示出基于知识的设计对学习效果有积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10380 2026-07-14 cs.CL 新提交 57%

CAFE: A Compound-AI Factorial Evaluation Framework

CAFE:一种复合人工智能因子评估框架

Fabian Lukassen, Christoph Weisser, Thomas Kneib, Alexander Silbersdorff

机构 * University of Göttingen(哥廷根大学) Bielefeld University of Applied Sciences and Arts (HSBI)(比勒费尔德应用科学与艺术大学)

专题命中 RAG评测 :retriever(abstract);分类 cs.CL

AI总结 CAFE是开源平台,用于复合人工智能系统评估。它将管道组件设为因子构建析因设计,运行配置并用模型评判器和人工评分。能归因质量差异,报告多种结果,还能解释组件影响,在问答管道验证有效,已发布为Python包和Web应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03510 2026-07-07 cs.SE cs.AI cs.CY 新提交 57%

CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI

CAGE-1:企业智能代理人工智能的控制、保证和治理评估

Roopam W. Sure

机构 * Independent technical report(独立技术报告)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究企业人工智能从实验转向运营工作流带来的评估问题,介绍CAGE-1评估框架,评估多方面内容,引入预绑定保证,用于判断企业代理是否可部署。

Comments 17 pages, 3 figures; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 57%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16116 2026-06-29 cs.CR cs.AI 版本更新 57%

DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain

DMind Benchmark:面向Web3领域LLM能力的全面评估

Enhao Huang, Pengyu Sun, Shuxun Wang, Zixin Lin, Alex Chen, Kaichun Hu, Joey Ouyang, Frank Li, Zhiyu Zhang, Haobo Wang, Yiming Li, Zhan Qin, James Yi, Gang Zhao, Ziang Ling, Lowes Yang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 提出DMind Benchmark,覆盖Web3九个子领域,结合客观知识与开放推理任务,评估31个LLM,发现模型在安全审计等高推理任务中存在显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00875 2026-06-19 cs.CL cs.HC cs.MA 版本更新 57%

TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law

TransLaw:模拟香港判例法专业翻译的大规模数据集与多智能体基准

Xi Xuan, Chunyu Kit

机构 * City University of Hong Kong, Hong Kong SAR, China(香港城市大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 针对香港判例法英译中资源匮乏、法律术语和格式要求严格的问题,构建了首个大规模句对齐平行语料库HKCFA Judgment 97-22,并提出多智能体框架TransLaw,通过分解翻译任务、集成法律词汇库和检索增强生成,显著提升翻译质量,但仍未达到人类专家的风格自然度。

Comments Accepted at ICML 2026 - AI for Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16629 2026-06-16 cs.CL 新提交 57%

Islamic Large Language Models: From Knowledge Acquisition to Trustworthy and Hallucination-Resistant AI

伊斯兰大语言模型:从知识获取到可信且抗幻觉的人工智能

Mohammed Amine Mouhoub

机构 * Paris Dauphine University(巴黎多芬纳大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 综述伊斯兰大语言模型领域,提出构建可信、抗幻觉的伊斯兰AI需结合阿拉伯语NLP、检索增强生成、教法学派推理及专家评估等关键技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13756 2026-06-15 cs.CL 新提交 57%

QIAS 2026: Overview of the Shared Task on Islamic Inheritance Reasoning

QIAS 2026:伊斯兰继承推理共享任务综述

Abdessalam Bouchekif, Somaya Eltanbouly, Samer Rashwani, Shahd Gaben, Mutaz Al-Khatib, Heba Sbahi, Emad Mohamed, Mohammed Ghaly

机构 * Hamad bin Khalifa University(哈马德·本·哈利法大学) Nazarbayev University(纳扎尔巴耶夫大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文介绍 QIAS 2026 共享任务,评估大语言模型在伊斯兰继承领域的复杂推理能力,基于 MAWARITH 数据集,使用 MIR-E 多步指标评估,16 支队伍参与,结果显示该任务对当前模型极具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26778 2026-05-27 cs.AI 57%

The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context

归因盲点:检测语言模型何时依赖记忆而非检索到的上下文

Zhe Yu, Wenpeng Xing, Yunzhao Wei, Bo Yang, Chen Ye, Gaolei Li, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) National Fintech Evaluation Center(国家金融科技评估中心) Hangzhou Dianzi University(杭州电子科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出计算现实监控(CRM)方法,通过比较有无上下文时的内部表征差异,检测语言模型是否依赖预训练记忆而非检索到的上下文进行生成,解决了输出级监控无法识别的归因盲点问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22143 2026-05-26 cs.CL 57%

Benchmarking and Learning Real-World Customer Service Dialogue

基准测试与学习真实世界客服对话

Tianhong Gao, Jundong Shen, Jiapeng Wang, Bei Shi, Ying Ju, Junfeng Yao, Huiyu Yu

机构 * ByteDance, Beijing, China(字节跳动,北京,中国)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 针对工业智能客服与真实对话需求脱节的问题,提出OlaBench基准和OlaMind模型,通过蒸馏专家推理模式与分阶段强化学习,在OlaBench上超越GPT-5.2和Gemini 3 Pro,在线A/B测试中问题解决率提升23.67%,人工转接率降低6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21097 2026-05-21 cs.CL 57%

WCXB: A Multi-Type Web Content Extraction Benchmark

WCXB:一个多类型网络内容提取基准

Murrough Foley

机构 * Murrough Foley

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出WCXB基准,包含2008个网页,涵盖七种结构不同的页面类型,通过五阶段流程生成真实标注,评估13种提取系统,发现现有文章-only基准无法发现结构化页面的盲区。

Comments Dataset: github.com/Murrough-Foley/web-content-extraction-benchmark, doi.org/10.5281/zenodo.19316874. Leaderboard: webcontentextraction.org. Preprint also deposited at doi.org/10.5281/zenodo.19664685

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18630 2026-05-19 cs.AI physics.comp-ph 57%

SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science

SCICONVBENCH: 评估LLM在计算科学任务公式化中的多轮澄清能力

Nithin Somasekharan, Youssef Hassan, Shiyao Lin, Gihan Panapitiya, Patrick Emami, Anurag Acharya, Sameera Horawalavithana, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of Texas at Arlington(德克萨斯大学阿灵顿分校) Pacific Northwest National Laboratory(太平洋西北国家实验室) National Renewable Energy Laboratory(国家可再生能源实验室)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 该研究提出SCICONVBENCH基准,用于评估LLM在计算科学任务公式化中的多轮澄清能力,重点在于获取缺失信息和解决请求中的矛盾,通过结构化任务本体和基于标准的评估框架,系统测量LLM在澄清行为、对话基础性和最终规格忠实度三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05807 2026-05-08 cs.CR cs.AI 57%

LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution

LCC-LLM:利用代码导向的大语言模型进行恶意软件归因

Christopher G. Pedraza Pohlenz, Hassan Jalil Hadi, Ali Hassan, Ali Shoker

机构 * CyberSaR, King Abdullah University of Science and Technology(CyberSaR,国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出LCC-LLM,一种代码导向的恶意软件归因和多任务静态恶意软件分析框架,通过构建包含34000个PE样本的LCCD数据集,结合静态分析与多源安全知识,提升恶意软件归因的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17677 2026-05-05 cs.AI 57%

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00383 2026-05-04 cs.CL 57%

Agentic AI for Substance Use Education: Integrating Regulatory and Scientific Knowledge Sources

代理AI用于物质使用教育:整合监管与科学知识源

Kosar Haghani, Zahra Kolagar, Mohammed Atiquzzaman

机构 * Department of Social Science, Texas Woman's University(德克萨斯女子大学社会科学系) Department of Computer Science, Augsburg University of Applied Sciences(应用科学大学计算机科学系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出一种基于代理的AI系统,结合监管数据与科学文献,提供实时、权威的物质使用教育,通过专家评估验证其准确性与适用性。

Comments 22 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15564 2026-05-01 cs.SE cs.AI cs.LG 57%

OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research

OpenClassGen: 一个大规模的真实世界Python类语料库用于大语言模型研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab

机构 * Concordia University(康科德大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 OpenClassGen提供324,843个Python类的语料库,用于评估大语言模型的代码生成能力,通过类骨架和静态代码度量指标,支持多种应用场景。

Comments This paper has been accepted for publication at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026) AI models/data track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23539 2026-04-28 cs.AI 57%

MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation

MetaGAI:一个大规模且高质量的生成AI模型和数据卡生成基准

Haoxuan Zhang, Ruochi Li, Yang Zhang, Zhenni Liang, Junhua Ding, Ting Xiao, Haihua Chen

机构 * University of North Texas(北德克萨斯大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 RAG评测 :retriever(abstract);分类 cs.AI

AI总结 本文提出MetaGAI基准,通过语义三角化构建2541个验证文档三元组,采用多智能体框架进行评估,揭示稀疏MoE架构在成本与质量效率上的优势,为大规模评估生成模型和数据卡方法提供基础测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21308 2026-04-24 cs.CR cs.CL 57%

CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents

CI-Work: 企业LLM代理中情境完整性基准测试

Wenjie Fu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Lukas Wutschitz, Robert Sim, Saravan Rajmohan, Dongmei Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft(微软)

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL

AI总结 CI-Work基准测试评估企业LLM代理在密集检索中传达关键内容并隐藏敏感信息的能力,揭示隐私泄露普遍且高任务效用与隐私违规正相关,需转向以情境为中心的架构。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL'2026) -- Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20117 2026-04-23 cs.CL 57%

To Know is to Construct: Schema-Constrained Generation for Agent Memory

知即建构:基于模式约束的代理记忆生成

Lei Zheng, Weinan Song, Daili Li, Yanming Yang

机构 * UnionPay(中国银联)

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL

AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏