ChipExpert: The Open-Source Integrated-Circuit-Design-Specific Large Language Model
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments 14 pages, 7 figures, 10 tables
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments BioNLP 2024 workshop
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments Independent study, Exploring LLMs, Deploying LLMs and their Risks
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments Accepted to Findings of ACL '24
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments Our dataset, tool outputs, and labels will be made available upon publication. This version of the manuscript (May 30, 2024) is updated to reflect an evaluation of Westlaw's AI-Assisted Research
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
深度学术调查:用于学术调查自动化的有状态智能体闭环范式
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 该研究提出DAS框架,通过状态智能体闭环实现学术调查自动化,在DAS-Bench基准测试中,其在引用质量等四维度得分及专家评估中均优于现有系统。
Comments Project page: https://zhikaixu24.github.io/projects/DAS/ | Code: https://github.com/ZhikaiXu24/DAS | Data: https://huggingface.co/datasets/ZhikaiXu24/DAS-2M
修复会破坏安全性吗?对迭代式大语言模型驱动的基础设施即代码修复中安全性退化的实证研究
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 该研究通过分析IaC-Eval基准的5968个场景,发现迭代式LLM驱动的IaC修复会引入约3.3%场景的安全退化,主要由资源重构导致,第3次迭代是最优停止点,为安全反馈设计提供指导。
Comments 20 pages, 3 figures, 5 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026). To appear in LIPIcs Vol. 394. v2: corrected the bibliographic record of one reference (preprint, not a journal article) and added the related-version link to the published LIPIcs article
实际性能提升有多显著?GraphRAG的无偏评估框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) ; OceanBase
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 针对GraphRAG现有评估框架的不相关问题与评估偏差缺陷,提出无偏评估框架并发现代表性GraphRAG方法的性能提升远小于此前报告结果,呼吁开展科学评估。
EMBL AI Librarian:面向AI智能体的生命科学知识层
专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。
FinanceComplexQA:对工业级金融文档进行智能体推理的基准测试
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 研究针对金融文档智能体推理性能差异问题,设计Finance-LaTeX SKILL生成金融文档和问答对,引入FinanceComplexQA基准测试,对领先系统和工具全面评估,通过分析失败案例研究其在多方面的能力。
Comments 27 pages, 9 tables, 2 figures
基于大语言模型的低成本需求变更影响分析
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。
Comments 33 pages, 4 figures
需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配
机构 * Department of Computer Science(计算机科学系) ; Technion, Israel(技术ion, 以色列) ; Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。
PriEval-Protect:医疗系统中隐私评估与保护的统一框架
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 针对医疗系统隐私问题,PriEval-Protect框架分两阶段统一评估与缓解隐私风险。评估阶段结合法规评分与技术分析得出综合风险评分,保护阶段依风险推荐对策,实现法规与数据级风险分析的衔接,结果具合规性与可解释性。
Comments 10 pages, 3 figures. Accepted at IDT 2026
基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn)
AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。
Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC
SABER-Math:数学信息检索评估的自动化基准
专题命中 RAG评测 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 提出首个无需专家标注的数学信息检索自动化基准SABER-Math,通过三步构建重排序任务,评估检索器在数学领域的效果,发现通用基准无法可靠预测数学检索性能。
Comments Accepted in the 3rd AI for Math Workshop at the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026
通过潜在迭代细化的符号回归
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 提出潜在方程嵌入(LEE)框架,通过迭代推断在功能基础化的潜在空间中缩小符号回归的推断差距,生成更简单且准确的表达式。
Comments Preprint. 21 pages, 11 figures
Pramana:自主代理网络中声明验证的协议层处理
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出Pramana协议层,通过定义缺失的线缆格式,为自主代理网络中的声明验证提供结构化方法,结合经典印度认识论中的四种知识类型,确保验证过程的确定性和可追溯性。
Comments 23 pages, 4 figures, 5 tables, 42 references
GGBound:一种基于基因组的微生物生命边界预测代理
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。
自回归模型中反事实信用归因的障碍
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 研究自回归模型中反事实信用归因的挑战,发现信用归因不具有自回归性,且基于弱最优性要求的反事实归因需指数级查询复杂度。
Comments ICML 2026
Red-MIRROR:基于大语言模型的自主渗透测试系统,结合反射验证与知识增强交互
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 Red-MIRROR通过引入紧密耦合的记忆-反射架构,解决传统渗透测试中依赖参数知识、记忆碎片化和验证不足的问题,实现复杂Web漏洞的高效检测与验证,其在XBOW基准测试中成功率达到86%。
Comments 26 pages
重新审视量子代码生成:领域知识应该在哪里居住?
机构 * Quantum Computing Research, QCentroid(量子计算研究,QCentroid)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 研究比较了Qiskit代码生成中不同专精策略,发现通用LLM在零样本和检索增强设置下表现更优,结合执行反馈代理可提升性能,表明无需领域微调即可实现更灵活的量子软件开发。
Comments Submitted to Quantum Machine Intelligence