Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation
专题命中 代码评测 :code generation(title);program synthesis(abstract);分类 cs.SE、cs.CL、cs.LG
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 代码评测 :code generation(title);program synthesis(abstract);分类 cs.SE、cs.CL、cs.LG
专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.AI、cs.LG
Comments This paper has been withdrawn because we found a bug in the FOMAML implementation that invalidates some of the key claims in the paper
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG
Comments Code and data available at https://github.com/amazon-science/recode
LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程
专题命中 代码评测 :coding agent(title,abstract);分类 cs.SE、cs.CL
AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。
Comments Project page: https://loopsbench.ai/
VISTA:面向视觉规格到网页应用编码智能体的端到端基准
机构 * University of Arizona(亚利桑那大学) ; Zoom ; Stony Brook University(石溪大学)
专题命中 代码评测 :coding agent(title);code generation(abstract);分类 cs.SE、cs.AI
AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。
Comments Project page: https://kaboider.github.io/VIS_APP/
Every Eval Ever:AI评估结果的统一模式与社区仓库
机构 * Technical University Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Weizenbaum Institute(魏岑鲍姆研究所) ; Zuse Institute Berlin(柏林祖泽研究所) ; Evidence Prime ; Trustible ; Kitware ; ETH Zurich(苏黎世联邦理工学院) ; StickFlux Labs ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; IBM Research(IBM研究院) ; Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) ; Cisco(思科) ; University of Notre Dame(圣母大学) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; University of Oxford(牛津大学) ; Ohio University(俄亥俄大学) ; Writer ; TCS Research(塔塔咨询服务研究院) ; Oxford University Press(牛津大学出版社) ; Queen Mary University of London(伦敦玛丽女王大学) ; Technical University Berlin(柏林工业大学) ; University of Delaware(特拉华大学) ; Cinemo ; Johns Hopkins University(约翰霍普金斯大学) ; University of Copenhagen(哥本哈根大学) ; ELLIS(欧洲学习与智能系统实验室) ; Iowa State University(爱荷华州立大学) ; Meta FAIR ; University of Montreal(蒙特利尔大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所) ; EleutherAI ; Yale University(耶鲁大学) ; Hugging Face ; University of Edinburgh(爱丁堡大学) ; Harvard University(哈佛大学) ; ETH AI Center(ETH人工智能中心) ; MIT(麻省理工学院) ; MIT-IBM Watson Lab(MIT-IBM沃森实验室)
专题命中 代码评测 :repository(title,abstract);分类 cs.CL、cs.AI
AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。
ContractEval:一个用于评估代码生成中合同满足断言的基准测试
机构 * Yonsei University(延世大学) ; University of Seoul(首尔大学)
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI
AI总结 ContractEval通过显式陈述合同,评估生成代码是否满足合同要求,揭示当前LLM在合同满足上的不足。
Comments 18 pages, 10 figures, 11 tables
面向仓库级别的软件工程评估的时间一致性基准
专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI
AI总结 本文提出时间一致性基准方法,通过冻结仓库时间点并利用历史代码知识评估未来任务,展示提示构造对软件工程评估的重要性。
Comments 10 pages, 10 figures, 4 tables
DesignBench: 一个全面的基于MLLM的前端代码生成基准测试
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI
AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。
MHRC-Bench: 一个多语言硬件仓库级代码补全基准
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 代码评测 :repository(title,abstract);分类 cs.AI、cs.PL
AI总结 MHRC-Bench是首个多语言硬件仓库级代码补全基准,涵盖三种硬件设计编码风格,通过代码结构和硬件导向语义标签进行补全任务评估。
机构 * Tencent Hunyuan Team(腾讯文脉团队)
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL
机构 * UCAS(中国科学技术大学) ; CASIA(中国科学院自动化研究所) ; BUPT(北京理工大学) ; NUS(新加坡国立大学) ; StepFun ; HKUST(香港理工大学) ; SDU(山东大学) ; PINAI ; USYD(悉尼大学) ; PKU(北京大学) ; USTC(中国科学技术大学)
专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI
Comments Highly practical, Well-motivated, Actionable
机构 * University of Luxembourg(卢森堡大学) ; University College London(伦敦大学学院)
专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE、cs.AI
机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA Santa Clara 分部)
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL
Comments Work in progress
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL
Comments 17 pages (9 Appendix pages), 4 figures, 7 tables
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; Drexel University(德雷塞尔大学)
专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI
Comments 18 pages, 13 figures. Accepted to the ACL 2025 Findings
机构 * ONEKQ Lab, USA(ONEKQ实验室)
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI
Comments arXiv admin note: text overlap with arXiv:2409.05177
专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI
Comments Accepted at DL4C@ICLR'25 and FMWild@ICLR'25
专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.LG
Comments Accepted by the 22nd International Conference on Mining Software Repositories (MSR 25)
专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL
Comments Accepted by the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)
专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI
Comments Accepted for publication in the conference proceedings of IEEE AITest 2024
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI
Comments The paper is accepted by IEEE AITest 2024 at IEEE CISOSE 2024 Congress as an invited paper, and will appear in the AITest 2024 Conference Proceedings
专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI
专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.LG
Comments Code and data release: https://github.com/amazon-research/mxeval
专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL
专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.PL
Journal ref Proceedings of the 2019 ACM SIGPLAN International Conference on Systems, Programming, Languages, and Applications: Software for Humanity (SPLASH Companion '19), ACM, 2019, pp. 7-8