PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
PATH-Bench:面向终身智能体的路径依赖评估基准
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
PATH-Bench:面向终身智能体的路径依赖评估基准
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。
UpliftBench:揭示uplift评估中的结果 regime 与目标不匹配问题
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 UpliftBench评估12种uplift估计器,发现基准分歧源于指标而非模型,揭示Qini等指标与效应准确性一致性不足等问题,发布可复现基准工具。
Comments 25 pages, 9 figures. Code, data, and results: https://github.com/binshuangli/uplift-bench
追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。
Comments 36 pages, 7 figures and 5 tables
TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Tibet University(西藏大学) ; Peking University(北京大学) ; Southwest Jiaotong University(西南交通大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。
源代码作者身份归属无法从竞赛场景泛化到课堂场景
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 本研究发现,针对Google Code Jam竞赛数据微调的CodeBERT等模型,在课程作业数据集上的作者身份归属性能远低于随机基线,竞赛场景的基准无法泛化到教育场景,需针对性验证。
AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。
一种使用两种距离度量的新型k-means聚类方法
机构 * School of Mathematical Sciences(数学科学学院) ; College of Science(科学学院) ; Rochester Institute of Technology(罗切斯特技术学院)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出了一种结合簇内和簇间距离度量的新型k-means聚类方法,通过Calinski-Harabasz准则确定簇数,提高聚类结果的鲁棒性和准确性。
Comments Keywords: machine learning, clustering algorithms, k-means
CodeSpec:面向智能体长周期功能开发的双可执行规范
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。
ExplainBench:评估智能体生成的代码解释
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。
Comments ASE 2026
MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。
超越表格数据的TabPFN:多模态嵌入的校准与准确性
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 研究少样本多模态分类中轻量级头部校准不佳问题,核心方法是评估TabPFN作为即插即用分类头。贡献在于其在多数据集、多编码器和多模态评估中表现优异,能提升校准并保持准确率,为校准敏感多模态分类提供指导。
Comments 19 pages, 13 figures, 10 tables. Jingxiang Zhang and Lujia Zhong contributed equally. Code: https://github.com/Jingxiang-Zhang/tabpfn-multimodal-embeddings
NOVA: 面向工业推荐系统架构演化的验证感知智能体框架
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 提出NOVA框架,通过架构梯度、验证级联和层级任务控制实现工业推荐模型架构的自动化演化,有效减少静默失败,缩短文献到生产周期13倍以上。
Comments 12 pages, 3 figures
ParasGB:用于 AMS 电路寄生估计的图形基准套件
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 研究针对 AMS 电路寄生估计问题,引入 ParasGB 开源基准套件,提供大规模异构 RC 网络与统一评估协议,用标准化流程对 GNN 架构基准测试,揭示相关挑战,为电路图学习和寄生感知模型开发提供可重复研究平台。
Comments Published at ICCAD2026. Full appendix version
MINT-V2X:用于预测资源管理的移动集成网络轨迹数据集
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文介绍用于预测资源管理的移动集成网络轨迹数据集MINT-V2X,它通过耦合SUMO与OMNeT++/Simu5G生成,经多项测试验证,包含大量同步数据点,通过案例研究证明其在RSU负载预测上比仅用网络历史基线性能更好。
ParBench:用于可靠评估大语言模型并行代码翻译的基准测试
专题命中 代码评测 :coding agent(abstract);分类 cs.AI
AI总结 研究针对大语言模型并行代码翻译缺乏可靠评估方法的问题,提出ParBench基准框架,通过声明性规范评估,涵盖多开源套件与跨API翻译方向,经源增强测试,揭示了当前并行代码翻译存在的如方向不对称等障碍。
Comments 57 pages, 22 figures, 11 tables; includes appendices
PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集
机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。
Comments 18 pages, 3 figures, includes Supplementary Information
JETO-Bench: Java执行时间改进补丁的可复现基准测试
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 提出JETO-Mine工具,通过静态分析、动态分析和评估框架自动构建可复现的Java执行时间改进补丁基准,并构建包含660个补丁的JETO-Bench,验证了其有效性。
可变形图像配准用于多视角多疾病心脏磁共振图像的自监督心脏相位检测
机构 * Department of Internal Medicine III, Heidelberg University Hospital(海德堡大学第三内科部门医院) ; Medical Faculty of Heidelberg University(海德堡大学医学院) ; DZHK (German Centre for Cardiovascular Research)(德国心血管研究中心) ; Division of Pediatric Cardiology, Department of Pediatrics, UT Southwestern /Children’s Health(儿童心脏病科,德克萨斯西南医学中心/儿童健康) ; Department of Cardiothoracic, Transplantation and Vascular Surgery, Hannover Medical School(汉诺威医学院心胸外科、移植外科和血管外科部门)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出一种自监督深度学习方法,通过多视角多疾病心脏磁共振图像检测五个关键帧,提高了心脏相位检测的准确率,适用于SAX和4CH cine CMR。
Comments Main 30 pages, 6 figures
Journal ref Medical Image Analysis, 2026
智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性
机构 * Tencent(腾讯) ; The Hong Kong University of Science and Technology(香港科技大学) ; Duke Kunshan University(昆山杜克大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。
AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架
机构 * The University of Melbourne(墨尔本大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。
ADABORD:一种用于有序分类的新型AdaBoost方法
机构 * IMIBIC(IMIBIC(初级保健临床流行病学研究部)) ; Universidad de Córdoba(科尔多瓦大学) ; Universidad Loyola Andalucía(安达卢西亚洛约拉大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 研究有序分类问题,提出ADABORD框架,将类别顺序特性融入AdaBoost算法关键组件,在TOC-UCO库与七种方法比较,实验表明其显著优于竞品,尤其在多类数据集上,且公开代码等方便后续研究。
Comments 42 pages, 6 figures, 7 tables. Submitted to CS top tier journal
CANN基准测试:针对真实NPU和算法限制对代理生成的内核进行基准测试
机构 * Huawei(华为)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 研究针对人工智能代理生成的算子内核在Ascend NPU上缺乏通用评估基线的问题,提出CANN Bench基准测试,涵盖多算子和测试用例,采用三维加权综合评分,为Ascend生态系统提供评估算子编写能力的标准。
超越解决率:非功能性质量研究
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 研究对比新旧模型在存储库级修复任务中生成补丁的非功能性质量,通过两个案例研究,用CodeQL等工具评估,发现新模型解决实例更多,但非功能性指标无一致改善,旨在推动对模型软件工程能力的全面评估。
当后锚定指标失败时:人工智能证据开源项目中的稳定机制
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 研究人工智能证据开源项目中架构变更后稳定义务衡量问题,指出后锚定稳定密度指标失败,引入稳定机制并人工验证校准,强调需受控设计与机制感知归因来可靠识别稳定义务。
SEC-bench Pro:语言模型能解决长周期软件安全任务吗?
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 代码评测 :coding agent(abstract);分类 cs.LG
AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。
基于商用现货二进制文件的智能体漏洞推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 代码评测 :coding agent(abstract);分类 cs.LG
AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。
大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理
机构 * Alibaba Group(阿里巴巴集团)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI
AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。
Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)
大语言模型能写出可靠的评分标准吗?实验复现的元评估
机构 * The University of Manchester(曼彻斯特大学) ; Institute for Infocomm Research (I²R), A*STAR(资讯通信研究院(I²R),新加坡科技研究局) ; IQuest Research(IQuest研究公司) ; ELLIS Manchester(ELLIS曼彻斯特) ; University of Information Technology, VNU(越南国家大学信息技术大学)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 研究大语言模型生成的论文复现评分标准,将其 reformulate 为清单样式,在两个骨干模型上评估四种生成设置,通过语义相似性和分数对齐进行元评估,结果显示增强设置改善下游评估对齐,同时指出其存在过于细化、偏向高分和适应性差等问题。
基于代理的软件工件评估
专题命中 代码评测 :coding agent(abstract);分类 cs.SE
AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。
受限动态几何复杂度:结构化预处理的证书
机构 * Xidian University(西安电子科技大学)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 研究优化几何动力学中受限动态几何复杂度,通过发展相关理论,如单调性和子流形距离原理等,将结构化预处理器问题转化为几何问题,还给出低秩谱模型等诊断接口及相关工作流程。
Comments 32 pages, 1 table