arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1744 篇

2412.17744 2025-12-17 cs.SE cs.AI cs.CL 82%

RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation

RepoTransBench: 一个面向真实世界的多语言代码仓库翻译基准

Yanli Wang, Yanlin Wang, Suiquan Wang, Daya Guo, Jiachi Chen, John Grundy, Xilin Liu, Yuchi Ma, Mingzhi Mao, Hongyu Zhang, Zibin Zheng

机构 * Sun Yat-sen University, China(中山大学) Monash University, Australia(墨尔本大学) Huawei Cloud Computing Technologies Co., Ltd, China(华为云计算技术有限公司) Chongqing University, China(重庆大学)

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 RepoTransBench提出一个现实世界多语言代码仓库翻译基准,评估代码仓库级翻译的挑战,揭示不同语言对方向的翻译难度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05040 2025-11-10 cs.CL cs.AI cs.SE 82%

UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian

Mykyta Syromiatnikov, Victoria Ruvinskaya

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

Comments 8 pages, 5 figures. XI International conference "Informatics. Culture. Technique." (2025)

Journal ref XI International conference "Informatics. Culture. Technique." (2025) 308-314

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00865 2025-03-25 cs.SE cs.AI cs.CL 82%

Demo-Craft: Using In-Context Learning to Improve Code Generation in Large Language Models

Nirmal Joshua Kapu, Mihit Sreejith

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

Comments Accepted at IEEE ICIITCEE 2025. Presented on 16th January 2025 in Bengaluru, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08200 2025-01-15 cs.SE cs.CL cs.LG 82%

CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code Generation

Jinjun Peng, Leyi Cui, Kele Huang, Junfeng Yang, Baishakhi Ray

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG

Comments to be published in LLM4Code 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16458 2024-05-22 cs.LG cs.AI cs.CL 82%

BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language Models

Xiangru Tang, Bill Qian, Rick Gao, Jiakang Chen, Xinyun Chen, Mark Gerstein

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16694 2024-03-26 cs.CL cs.PL cs.SE 82%

HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Qiwei Peng, Yekun Chai, Xuhong Li

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.PL

Comments LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01210 2023-11-01 cs.SE cs.CL cs.LG 82%

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang

专题命中 代码评测 :code generation(title);program synthesis(abstract);分类 cs.SE、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.11768 2023-06-21 cs.LG cs.AI cs.SE stat.ML 82%

On-the-Fly Adaptation of Source Code Models using Meta-Learning

Disha Shrivastava, Hugo Larochelle, Daniel Tarlow

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.AI、cs.LG

Comments This paper has been withdrawn because we found a bug in the FOMAML implementation that invalidates some of the key claims in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10264 2022-12-21 cs.LG cs.CL cs.SE 82%

ReCode: Robustness Evaluation of Code Generation Models

Shiqi Wang, Zheng Li, Haifeng Qian, Chenghao Yang, Zijian Wang, Mingyue Shang, Varun Kumar, Samson Tan, Baishakhi Ray, Parminder Bhatia, Ramesh Nallapati, Murali Krishna Ramanathan, Dan Roth, Bing Xiang

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG

Comments Code and data available at https://github.com/amazon-science/recode

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00267 2026-08-04 cs.SE cs.CL 新提交 81%

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 代码评测 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。

Comments Project page: https://loopsbench.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26144 2026-06-24 cs.SE cs.AI cs.CV 版本更新 81%

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

VISTA:面向视觉规格到网页应用编码智能体的端到端基准

JunJia Guo, Yuhang Yao, Jiawei, Zhou, Jingdi Chen

机构 * University of Arizona(亚利桑那大学) Zoom Stony Brook University(石溪大学)

专题命中 代码评测 :coding agent(title);code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。

Comments Project page: https://kaboider.github.io/VIS_APP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14516 2026-06-15 cs.AI cs.CL cs.CY 新提交 81%

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Every Eval Ever:AI评估结果的统一模式与社区仓库

Jan Batzner, Sree Harsha Nelaturu, Damian Stachura, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen

机构 * Technical University Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Weizenbaum Institute(魏岑鲍姆研究所) Zuse Institute Berlin(柏林祖泽研究所) Evidence Prime Trustible Kitware ETH Zurich(苏黎世联邦理工学院) StickFlux Labs Stanford University(斯坦福大学) Northeastern University(东北大学) IBM Research(IBM研究院) Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) Cisco(思科) University of Notre Dame(圣母大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of Oxford(牛津大学) Ohio University(俄亥俄大学) Writer TCS Research(塔塔咨询服务研究院) Oxford University Press(牛津大学出版社) Queen Mary University of London(伦敦玛丽女王大学) Technical University Berlin(柏林工业大学) University of Delaware(特拉华大学) Cinemo Johns Hopkins University(约翰霍普金斯大学) University of Copenhagen(哥本哈根大学) ELLIS(欧洲学习与智能系统实验室) Iowa State University(爱荷华州立大学) Meta FAIR University of Montreal(蒙特利尔大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所) EleutherAI Yale University(耶鲁大学) Hugging Face University of Edinburgh(爱丁堡大学) Harvard University(哈佛大学) ETH AI Center(ETH人工智能中心) MIT(麻省理工学院) MIT-IBM Watson Lab(MIT-IBM沃森实验室)

专题命中 代码评测 :repository(title,abstract);分类 cs.CL、cs.AI

AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12047 2026-04-21 cs.AI cs.SE 81%

ContractEval: A Benchmark for Evaluating Contract-Satisfying Assertions in Code Generation

ContractEval:一个用于评估代码生成中合同满足断言的基准测试

Soohan Lim, Joonghyuk Hahn, Hyunwoo Park, Sang-Ki Ko, Yo-Sub Han

机构 * Yonsei University(延世大学) University of Seoul(首尔大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 ContractEval通过显式陈述合同,评估生成代码是否满足合同要求,揭示当前LLM在合同满足上的不足。

Comments 18 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26137 2026-03-30 cs.SE cs.AI 81%

ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation

面向仓库级别的软件工程评估的时间一致性基准

Xianpeng, Sun, Haonan Sun, Tian Yu, Sheng Ma, Qincheng Zhang, Lifei Rao, Chen Tian

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出时间一致性基准方法,通过冻结仓库时间点并利用历史代码知识评估未来任务,展示提示构造对软件工程评估的重要性。

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06251 2026-03-17 cs.SE cs.AI 81%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03708 2026-02-03 cs.PL cs.AI 81%

MHRC-Bench: A Multilingual Hardware Repository-Level Code Completion benchmark

MHRC-Bench: 一个多语言硬件仓库级代码补全基准

Qingyun Zou, Jiahao Cui, Nuo Chen, Bingsheng He, Weng-Fai Wong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 代码评测 :repository(title,abstract);分类 cs.AI、cs.PL

AI总结 MHRC-Bench是首个多语言硬件仓库级代码补全基准,涵盖三种硬件设计编码风格,通过代码结构和硬件导向语义标签进行补全任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04952 2025-09-30 cs.CL cs.SE 81%

ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation

Chenchen Zhang, Yuhang Li, Can Xu, Jiaheng Liu, Ao Liu, Changzhi Zhou, Ken Deng, Dengpeng Wu, Guanhua Huang, Kejiao Li, Qi Yi, Ruibin Xiong, Shihui Hu, Yue Zhang, Yuhao Jiang, Zenan Xu, Yuanxing Zhang, Wiggin Zhou, Chayse Zhou, Fengzong Lian

机构 * Tencent Hunyuan Team(腾讯文脉团队)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18993 2025-09-16 cs.SE cs.AI 81%

GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging

Ziyi Ni, Huacan Wang, Shuo Zhang, Shuo Lu, Ziyang He, Wang You, Zhenheng Tang, Yuntao Du, Bill Sun, Hongzhang Liu, Sen Hu, Ronghao Chen, Bo Li, Xin Li, Chen Hu, Binxing Jiao, Daxin Jiang, Pin Lyu

机构 * UCAS(中国科学技术大学) CASIA(中国科学院自动化研究所) BUPT(北京理工大学) NUS(新加坡国立大学) StepFun HKUST(香港理工大学) SDU(山东大学) PINAI USYD(悉尼大学) PKU(北京大学) USTC(中国科学技术大学)

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

Comments Highly practical, Well-motivated, Actionable

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20439 2025-07-29 cs.SE cs.AI 81%

When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions

Maya Larbi, Amal Akli, Mike Papadakis, Rihab Bouyousfi, Maxime Cordy, Federica Sarro, Yves Le Traon

机构 * University of Luxembourg(卢森堡大学) University College London(伦敦大学学院)

专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18789 2025-06-11 cs.SE cs.CL 81%

From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?

Wasi Uddin Ahmad, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA Santa Clara 分部)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07010 2025-06-03 cs.SE cs.CL 81%

ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation

Kaiyuan Liu, Youcheng Pan, Yang Xiang, Daojing He, Jing Li, Yexing Du, Tianrun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

Comments 17 pages (9 Appendix pages), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10452 2025-05-30 cs.CL cs.AI 81%

DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation

Wenhao Hu, Jinhao Duan, Chunchen Wei, Li Zhang, Yue Zhang, Kaidi Xu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Drexel University(德雷塞尔大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, 13 figures. Accepted to the ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09027 2025-05-15 cs.SE cs.AI 81%

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation

Yi Cui

机构 * ONEKQ Lab, USA(ONEKQ实验室)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

Comments arXiv admin note: text overlap with arXiv:2409.05177

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07701 2025-03-12 cs.SE cs.AI 81%

Automated Benchmark Generation for Repository-Level Coding Tasks

Konstantinos Vergopoulos, Mark Niklas Müller, Martin Vechev

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

Comments Accepted at DL4C@ICLR'25 and FMWild@ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03806 2025-02-07 cs.SE cs.LG 81%

Should Code Models Learn Pedagogically? A Preliminary Evaluation of Curriculum Learning for Real-World Software Engineering Tasks

Kyi Shin Khant, Hong Yi Lin, Patanamon Thongtanunam

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.LG

Comments Accepted by the 22nd International Conference on Mining Software Repositories (MSR 25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16050 2025-01-28 cs.SE cs.AI 81%

Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluation

Xing Zhang, Jiaheng Wen, Fangkai Yang, Pu Zhao, Yu Kang, Junhao Wang, Maoquan Wang, Yufan Huang, Elsie Nallipogu, Qingwei Lin, Yingnong Dang, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21199 2025-01-03 cs.SE cs.CL 81%

HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation

Zhaojian Yu, Yilun Zhao, Arman Cohan, Xiao-Ping Zhang

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22821 2024-10-31 cs.CL cs.SE 81%

EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations

Jia Li, Ge Li, Xuanming Zhang, Yunfei Zhao, Yihong Dong, Zhi Jin, Binhua Li, Fei Huang, Yongbin Li

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

Comments Accepted by the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07331 2024-10-14 cs.CL cs.AI 81%

DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models

Yiming Huang, Jianwen Luo, Yan Yu, Yitong Zhang, Fangyu Lei, Yifan Wei, Shizhu He, Lifu Huang, Xiao Liu, Jun Zhao, Kang Liu

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13204 2024-08-26 cs.AI cs.SE 81%

DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation

Qiming Zhu, Jialun Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Shing-Chi Cheung

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏