Beyond Words: On Large Language Models Actionability in Mission-Critical Risk Analysis
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI
Comments Accepted in Workshop on Evaluation and Trustworthiness of Generative AI Models, KDD 2024
专题命中 RAG评测 :retrieval augmented generation(abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Journal ref 43rd Annual CNS Conference and the 48th Annual CNS/CNA Student Conference Sheraton Cavalier Saskatoon Hotel, Saskatoon, SK, Canada, June 16-19, 2024
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments 9 pages, 1 figure, 5 tables. arXiv admin note: substantial text overlap with arXiv:2407.02742
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted at BioNLP Workshop 2024, colocated with ACL 2024
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI
Comments Published in IEEE Access
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments 26 pages, 11 figures
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI
Comments 7 pages, 3 figures. Code available at https://github.com/jsalt2024-evaluating-llms-for-astronomy/astro-arxiv-bot
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted at SemEval 2024, NAACL 2024; 8 Pages
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments 19 pages; Project page: https://snap-research.github.io/locomo/
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments 16 Pages, 7 Figures
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments Long paper accepted to ACM ICAIF-23
结合领域专家心智模型的大语言模型增强:通过因果提示工程减少大语言模型幻觉
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出结合专家心智模型(EMM)的因果提示工程框架,通过形式化相关前置流程构建EMM,减少LLM幻觉,在三类任务中验证了方法有效性。
Comments 42 pages,4 figures, 4 tables
条款式的第三类接触:大型语言模型能否替代语言教师?
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn);分类 cs.CL
AI总结 该研究评估了LLM替代语言教师提供教学反馈与解释的能力,发现其纠错能力出色但教学解释不足,AI辅助语言学习热情或超出对其教学能力的认知。
Journal ref Oxford Intersections: AI in Society (Oxford, online edn, Oxford Academic, 20 Mar. 2025 - )
FDABench:异构数据上分析查询的数据代理基准
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.DB
AI总结 提出FDABench基准,通过2007个任务覆盖六种数据模态,并设计PUDDING框架自动构建数据集,以评估数据代理在异构数据上的推理能力。
Comments Accepted to KDD'26
基于MemoryArena的MemoryLake研究:智能体记忆后端的匹配对比
机构 * MemoryLake Team(MemoryLake团队)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 该研究在MemoryArena的五个任务领域中,对比MemoryLake等三种智能体记忆后端,发现MemoryLake在数学等三个领域成功率最高,整体平均成功率领先,且性能与工作负载相关。
Comments 16 pages, 7 tables
一次对账,随时撰写:用于无漂移、时点研究的信任分层图书馆与多智能体撰写器
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL
AI总结 该研究提出双层智能体系统,通过信任分层图书馆与多智能体撰写器分离知识库与报告撰写,消除报告矛盾与漂移,实验验证其在多指标、多场景下的有效性与效率优势。
多层架构中的防御效果:对持久内存攻击状态机LLM代理的机制性评估
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 本文评估了六种防御措施在九个开源模型上的延迟触发攻击效果,发现输入级和检索级过滤器效果不佳,而内存层工具门控(Memory Sandbox)显著降低攻击成功率,揭示了不同防御类别的失效原因。
Comments v4: Added double dissociation (reasoning-mode ablation), content-layer defense (RATG), loaded-corpus frontier evaluation (21 models, 3 providers, N=40), 7B judge capability bound, reproducibility validity criterion, ethics/disclosure statement. Gemini 3.1 Pro Preview 95% ASR; GPT-5.1 regression (22.5%); tripartite vendor divergence. Code: github.com/junwenleong/stateful-agent-security-eval