RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
面向Verilog代码生成的执行锚定幻觉校准重排序
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。
基于大语言模型的低成本需求变更影响分析
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。
Comments 33 pages, 4 figures
深度学术调查:用于学术调查自动化的有状态智能体闭环范式
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 该研究提出DAS框架,通过状态智能体闭环实现学术调查自动化,在DAS-Bench基准测试中,其在引用质量等四维度得分及专家评估中均优于现有系统。
Comments Project page: https://zhikaixu24.github.io/projects/DAS/ | Code: https://github.com/ZhikaiXu24/DAS | Data: https://huggingface.co/datasets/ZhikaiXu24/DAS-2M
修复会破坏安全性吗?对迭代式大语言模型驱动的基础设施即代码修复中安全性退化的实证研究
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 该研究通过分析IaC-Eval基准的5968个场景,发现迭代式LLM驱动的IaC修复会引入约3.3%场景的安全退化,主要由资源重构导致,第3次迭代是最优停止点,为安全反馈设计提供指导。
Comments 20 pages, 3 figures, 5 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026). To appear in LIPIcs Vol. 394. v2: corrected the bibliographic record of one reference (preprint, not a journal article) and added the related-version link to the published LIPIcs article
实际性能提升有多显著?GraphRAG的无偏评估框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) ; OceanBase
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 针对GraphRAG现有评估框架的不相关问题与评估偏差缺陷,提出无偏评估框架并发现代表性GraphRAG方法的性能提升远小于此前报告结果,呼吁开展科学评估。
EMBL AI Librarian:面向AI智能体的生命科学知识层
专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。
FinanceComplexQA:对工业级金融文档进行智能体推理的基准测试
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 研究针对金融文档智能体推理性能差异问题,设计Finance-LaTeX SKILL生成金融文档和问答对,引入FinanceComplexQA基准测试,对领先系统和工具全面评估,通过分析失败案例研究其在多方面的能力。
Comments 27 pages, 9 tables, 2 figures
需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配
机构 * Department of Computer Science(计算机科学系) ; Technion, Israel(技术ion, 以色列) ; Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。
PriEval-Protect:医疗系统中隐私评估与保护的统一框架
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 针对医疗系统隐私问题,PriEval-Protect框架分两阶段统一评估与缓解隐私风险。评估阶段结合法规评分与技术分析得出综合风险评分,保护阶段依风险推荐对策,实现法规与数据级风险分析的衔接,结果具合规性与可解释性。
Comments 10 pages, 3 figures. Accepted at IDT 2026
基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn)
AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。
Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC
SABER-Math:数学信息检索评估的自动化基准
专题命中 RAG评测 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 提出首个无需专家标注的数学信息检索自动化基准SABER-Math,通过三步构建重排序任务,评估检索器在数学领域的效果,发现通用基准无法可靠预测数学检索性能。
Comments Accepted in the 3rd AI for Math Workshop at the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026
通过潜在迭代细化的符号回归
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 提出潜在方程嵌入(LEE)框架,通过迭代推断在功能基础化的潜在空间中缩小符号回归的推断差距,生成更简单且准确的表达式。
Comments Preprint. 21 pages, 11 figures
Pramana:自主代理网络中声明验证的协议层处理
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出Pramana协议层,通过定义缺失的线缆格式,为自主代理网络中的声明验证提供结构化方法,结合经典印度认识论中的四种知识类型,确保验证过程的确定性和可追溯性。
Comments 23 pages, 4 figures, 5 tables, 42 references
GGBound:一种基于基因组的微生物生命边界预测代理
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。
自回归模型中反事实信用归因的障碍
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 研究自回归模型中反事实信用归因的挑战,发现信用归因不具有自回归性,且基于弱最优性要求的反事实归因需指数级查询复杂度。
Comments ICML 2026
Red-MIRROR:基于大语言模型的自主渗透测试系统,结合反射验证与知识增强交互
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 Red-MIRROR通过引入紧密耦合的记忆-反射架构,解决传统渗透测试中依赖参数知识、记忆碎片化和验证不足的问题,实现复杂Web漏洞的高效检测与验证,其在XBOW基准测试中成功率达到86%。
Comments 26 pages
重新审视量子代码生成:领域知识应该在哪里居住?
机构 * Quantum Computing Research, QCentroid(量子计算研究,QCentroid)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 研究比较了Qiskit代码生成中不同专精策略,发现通用LLM在零样本和检索增强设置下表现更优,结合执行反馈代理可提升性能,表明无需领域微调即可实现更灵活的量子软件开发。
Comments Submitted to Quantum Machine Intelligence
大语言模型在教学与学习中的应用:在高等教育中实施AI聊天机器人反思
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 本文探讨了在高等教育中实施增强型AI助手中的风险与挑战,通过实验评估了大语言模型对学习动机、教学质量及学生表现的影响。
上下文在代码之前:关于在实践中使用Vibe编码的经验报告
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 本文报告了一个全栈团队在实践中应用Vibe编码构建多项目代理学习平台和学术检索增强生成系统,并探讨了生成代码在隔离约束和架构设计上的不足。
Comments 6 Pages, 1 Figure
InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。
Comments Accepted at ACM Multimedia 2025
基于代码图的未见代码库数据合成与训练
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。
MalCVE: 使用大语言模型进行恶意软件检测与CVE关联
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 MalCVE利用大语言模型检测恶意软件并关联CVE,实现高准确率的恶意软件识别和漏洞关联。
RealSec-bench:一个评估现实世界仓库中安全代码生成的基准
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 RealSec-bench是一个基于现实世界Java仓库构建的安全代码生成评估基准,通过多阶段流程和专家验证,评估5种LLM在功能正确性和安全性方面的表现。
Comments 9 pages, 6 figures
评估大型语言模型在航空航天软件时间序列异常检测中的应用
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 本文提出ATSADBench基准,评估大型语言模型在航空航天软件时间序列异常检测中的性能,发现其在单变量任务表现良好,但多变量任务效果欠佳,且RAG策略可能加剧假警报问题。
Comments This paper has been accepted by ASE 2025
XY-Cut++: 一种基于新型基准的分层遮罩机制的高级布局排序方法
机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 XY-Cut++通过分层遮罩机制在新型基准上实现高级布局排序,提升文档阅读顺序恢复的准确性和效率。