Generating Complex Code Analyzers from Natural Language Questions
从自然语言问题生成复杂代码分析器
专题命中 图谱与结构化RAG :RAG(abstract,abstract_cn)
AI总结 本文提出Merlin系统,通过整合LLM与CodeQL,解决复杂代码分析问题,提升代码问题解答的准确性和效率。
Comments 12 pages, 8 figures, 1 table
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
从自然语言问题生成复杂代码分析器
专题命中 图谱与结构化RAG :RAG(abstract,abstract_cn)
AI总结 本文提出Merlin系统,通过整合LLM与CodeQL,解决复杂代码分析问题,提升代码问题解答的准确性和效率。
Comments 12 pages, 8 figures, 1 table
PathISE: 通过信息路径监督学习知识图谱问答
机构 * The University of Melbourne(墨尔本大学)
专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract);分类 cs.AI
AI总结 PathISE通过学习高质量的中间监督信号提升知识图谱问答性能,利用轻量级Transformer估计关系路径信息,生成可复用的监督信号以增强现有模型。
针对医疗多模态检索增强生成的知识污染攻击
机构 * Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Northwestern Polytechnical University(西北工业大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);分类 cs.AI
AI总结 本文提出M³Att框架,针对医疗多模态RAG系统,通过在文本数据中注入隐蔽虚假信息并利用配对视觉数据作为查询无关触发器,提升检索概率,从而在不依赖用户查询先验知识的情况下实现知识污染攻击。
Comments Accepted by ACL 2026
生成无泄漏的基准以评估鲁棒的RAG
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) ; New Jersey Institute of Technology(新泽西理工学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research(微软研究院)
专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SeedRG方法,通过半合成方式生成无知识泄漏的RAG评估基准,解决基准老化问题,确保评估的有效性。
基于RAG的 grounded 愚笑生成
机构 * University of Helsinki(赫尔辛基大学)
专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文提出基于RAG的 grounded 愚笑生成方法,通过当前新闻检索生成芬兰语讽刺词典定义,并引入任务特定评估框架,分析文化背景、源词类型及RAG存在与否对输出的影响。
可量化不确定性:一种随机一致性多智能体RAG框架用于鲁棒恶意软件检测
专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)
AI总结 本文提出MAGMA框架,通过语义代码检索与概率验证分离恶意软件分析,引入随机一致性集合和两个互补指标,提升恶意软件检测鲁棒性。
MedMeta:用于从医学研究中合成元分析结论的LLM基准测试
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。
PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; IBM, New York(IBM,纽约)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。
Comments 23 pages, 3 figures
PRISM: 通过调度-内存协同设计实现快速在线LLM服务
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)
AI总结 PRISM通过协同设计调度与内存管理,优化LLM服务响应时间,减少TTFT并提升缓存命中率。
Comments 25 pages, 9 figures, Preprint
基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测
机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) ; Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) ; Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。
Comments Presented at the ROMCIR Workshop at ECIR 2026
Scam2Prompt: 一种可扩展的框架,用于审计生产LLM中的恶意诈骗端点
机构 * OpenAI
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 Scam2Prompt通过生成开发者风格提示来测试LLM生成恶意代码的能力,发现4.24%的LLM会生成恶意URL,且在2025年发布的七种LLM中,恶意代码生成率高达12.9%-47.3%。