arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1744 篇

2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 75%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04177 2026-06-09 cs.SE cs.AI cs.LG 版本更新 75%

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

CodeTaste:LLM能否生成人类级别的代码重构?

Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12185 2026-02-17 cs.SE cs.CL cs.LG 75%

EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming

EVALOOOP:一种以自一致性为中心的大型语言模型编程鲁棒性评估框架

Sen Fang, Weiyuan Ding, Mengshi Zhang, Zihao Chen, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 EVALOOOP通过自一致性反馈循环评估LLM在编程任务中的鲁棒性,利用ASL度量揭示模型在持续自指代转换中的语义保持能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11077 2026-01-19 cs.SE cs.AI cs.CL 75%

ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development

ABC-Bench: 评估现实世界开发中自主后端编码的基准测试

Jie Yang, Honglin Guo, Li Ji, Jiazheng Zhou, Rui Zheng, Zhikai Lei, Shuo Zhang, Zhiheng Xi, Shichun Liu, Yuxin Wang, Bo Wang, Yining Zheng, Tao Gui, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启济智风有限公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 ABC-Bench是一个评估自主后端编码在真实可执行工作流中性能的基准测试,通过224个实际任务揭示了当前模型在复杂后端工程任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10820 2026-01-19 cs.LG cs.AI cs.CL cs.MA 75%

Towards Reliable ML Feature Engineering via Planning in Constrained-Topology of LLM Agents

通过LLM代理的受限拓扑规划实现可靠的机器学习特征工程

Himanshu Thakur, Anusha Kamath, Anurag Muthyala, Dhwani Sanmukhani, Smruthi Mukund, Jay Katukuri

机构 * Meta Menlo Park, CA(Meta 洛杉矶公园分校) JPMorgan Chase & Co.(摩根大通公司)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的受限拓扑规划框架,通过多步骤生成代码提升特征工程的可靠性与效率,实验显示在数据集和实际应用中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20854 2025-10-13 cs.SE cs.AI cs.CL 75%

An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks

Xin Zhou, Kisub Kim, Ting Zhang, Martin Weyssow, Luis F. Gomes, Guang Yang, Kui Liu, Xin Xia, David Lo

机构 * Singapore Management University(新加坡国立管理学院) DGIST(韩国高等智能科学研究院) Monash University(墨尔本大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Huawei Software Engineering Application Technology Lab(华为软件工程应用技术实验室) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10641 2025-07-16 cs.SE cs.AI cs.CL 75%

A Code Comprehension Benchmark for Large Language Models for Code

Jayant Havare, Saurav Chaudhary, Ganesh Ramakrishnan, Kaushik Maharajan, Srikanth Tamilselvam

机构 * IIT Bombay(印度理工学院博伊斯分校) IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09063 2025-07-15 cs.SE cs.AI cs.LG 75%

SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments

Avi Arora, Jinu Jang, Roshanak Zilouchian Moghaddam

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06215 2025-02-11 cs.SE cs.AI cs.CL 75%

LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks

Xin Zhou, Martin Weyssow, Ratnadira Widyasari, Ting Zhang, Junda He, Yunbo Lyu, Jianming Chang, Beiqi Zhang, Dan Huang, David Lo

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09997 2024-10-15 cs.SE cs.AI cs.CL 75%

Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code

Nan Jiang, Qi Li, Lin Tan, Tianyi Zhang

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05987 2023-02-21 cs.CL cs.AI cs.SE 75%

DocPrompting: Generating Code by Retrieving the Docs

Shuyan Zhou, Uri Alon, Frank F. Xu, Zhiruo Wang, Zhengbao Jiang, Graham Neubig

专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.CL、cs.AI

Comments ICLR 2023 (notable-top-25%); code and data are available at https://github.com/shuyanzhou/docprompting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01518 2026-08-07 cs.SE 版本更新 74%

Probe to Generate: Program Variant-Guided Test Augmentation for Repository-Level Repair Benchmarks

基准测试足够强大吗?基于突变的诊断和回归套件的增强

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 代码评测 :repository(title);分类 cs.SE

AI总结 本文提出STING框架,通过语义改变的程序变体增强回归测试,提高基准测试的可靠性。实验显示,77%的实例存在至少一个存活变体,测试覆盖率提升,修复率下降,揭示了基准测试的不足。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07744 2026-07-10 cs.SE 新提交 74%

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization

PERFOPT-Bench:评估软件性能优化中的编码代理

Yingyun Cui, Yi Xie, Piaohong Wang, Jiawei Ma, Bo Liu, Liangliang Cao

专题命中 代码评测 :coding agent(title);分类 cs.SE

AI总结 该研究介绍PERFOPT-Bench基准,用于评估软件性能优化中编码代理的完整性能工程循环。通过7个长期任务评估7个不同的代理堆栈,发现优化性能取决于工作负载,原始加速作基准分数不安全,还提出中继试验可恢复额外空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02390 2026-07-03 cs.LG 新提交 74%

DecompRL: Solving Harder Problems by Learning Modular Code Generation

DecompRL: 通过学习模块化代码生成解决更难的问题

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve

机构 * FAIR at Meta Inria, \'Ecole Normale Sup\'erieure

专题命中 代码评测 :code generation(title);分类 cs.LG

AI总结 提出DecompRL算法,通过强化学习将问题分解为可复用的子函数,重组模块生成候选解,将GPU瓶颈转移至CPU评估,在LiveCodeBench和CodeContests上超越标准RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12606 2026-05-12 cs.LG 74%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 代码评测 :repository(title);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06565 2026-04-08 cs.CL 74%

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation

EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试

Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学)

专题命中 代码评测 :code generation(title);分类 cs.CL

AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13251 2026-03-17 cs.AI 74%

ManiBench: A Benchmark for Testing Visual-Logic Drift and Syntactic Hallucinations in Manim Code Generation

ManiBench:一个用于测试Manim代码生成中视觉-逻辑漂移和语法幻觉的基准测试

Nabin Oli

机构 * Sunway College Kathmandu(加德满都阳光学院) Birmingham City University(伯明翰城市大学)

专题命中 代码评测 :code generation(title);分类 cs.AI

AI总结 ManiBench旨在评估LLM在生成Manim CE代码时的性能,针对语法幻觉和视觉-逻辑漂移两种关键失败模式,包含150-200个问题,涵盖微积分、线性代数、概率、拓扑和AI等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13213 2026-03-16 cs.SE 74%

MoEKD: Mixture-of-Experts Knowledge Distillation for Robust and High-Performing Compressed Code Models

MoEKD:混合专家知识蒸馏用于鲁棒且高性能的压缩代码模型

Md. Abdul Awal, Mrigank Rochan, Chanchal K. Roy

专题命中 代码评测 :code model(title);分类 cs.SE

AI总结 本文提出MoEKD框架,通过混合专家架构实现多专家知识蒸馏,提升压缩模型的鲁棒性和性能,实验表明在漏洞检测任务中,MoEKD在对抗鲁棒性和预测性能上均优于现有基线方法。

Comments Accepted to the Research Track of the Evaluation and Assessment in Software Engineering (EASE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20823 2025-12-25 cs.AR cs.AI 74%

NotSoTiny: A Large, Living Benchmark for RTL Code Generation

NotSoTiny: 一个大规模、活体的RTL代码生成基准

Razine Moundir Ghorab, Emanuele Parisi, Cristian Gutierrez, Miquel Alberti-Binimelis, Miquel Moreto, Dario Garcia-Gasulla, Gokcen Kestor

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politecnica de Catalunya(加泰罗尼亚理工大学)

专题命中 代码评测 :code generation(title);分类 cs.AI

AI总结 NotSoTiny是一个大规模、活体的RTL代码生成基准,通过评估LLM生成结构丰富且具有上下文意识的RTL代码的能力,以克服当前LLM在硬件设计中的限制并推动技术发展。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01081 2025-05-05 cs.AI 74%

MADIL: An MDL-based Framework for Efficient Program Synthesis in the ARC Benchmark

Sébastien Ferré

机构 * IRISA(里索斯研究所)

专题命中 代码评测 :program synthesis(title);分类 cs.AI

Comments 54 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07990 2024-05-14 cs.CL cs.CV 74%

Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots

Chengyue Wu, Yixiao Ge, Qiushan Guo, Jiahao Wang, Zhixuan Liang, Zeyu Lu, Ying Shan, Ping Luo

专题命中 代码评测 :code generation(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.09163 2023-04-17 cs.CL 74%

UniCausal: Unified Benchmark and Repository for Causal Text Mining

Fiona Anting Tan, Xinyu Zuo, See-Kiong Ng

专题命中 代码评测 :repository(title);分类 cs.CL

Comments 15 pages include References

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 73%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20911 2026-07-24 cs.CL cs.SE 新提交 73%

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

腾讯工作伙伴基准测试:一个具有抗污染任务构建的多领域编码智能体基准测试

Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, Xing Sun

机构 * Tencent(腾讯) Youtu Lab(腾讯优图实验室) Keen Security Lab(腾讯安全科恩实验室) Workbuddy(腾讯工作伙伴) Yunding Security Lab(腾讯云鼎实验室)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL

AI总结 介绍腾讯工作伙伴基准测试这一多领域编码智能体评估套件,核心是统一评估框架,任务经反向设计防污染,数据集公开,四个子集探测工作不同方面,以统一格式和协议运行,还给出跨模型排行榜。

Comments 30 pages, 9 figures. Project page: https://workbuddybench.com/ ; code: https://github.com/Tencent/workbuddy-bench ; dataset: https://huggingface.co/datasets/tencent/workbuddy-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26648 2026-07-21 cs.SE cs.AI 版本更新 73%

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证

Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00041 2026-07-02 cs.SE cs.AI 新提交 73%

ATM: CID-Brokered Pre-Write Admission for Multi-Agent Code Co-Synthesis

ATM:基于CID的预写准入机制用于多智能体代码协同合成

Eagl Huang

专题命中 代码评测 :software agent(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。

Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14084 2026-05-22 cs.LG cs.AI 73%

TIP: Token Importance in On-Policy Distillation

TIP: on-policy distillation 中的 token 重要性

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

专题命中 代码评测 :repository(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究探讨了在 on-policy 知识蒸馏中哪些 token 对学习信号最有用,提出了一种基于学生熵和教师-学生分歧的双轴分类方法,并通过实验验证了在有限内存条件下使用少量 token 进行蒸馏的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06296 2026-04-21 cs.PL cs.AI 73%

VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code

VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数

Lingfei Zeng, Fengdi Che, Xuhan Huang, Fei Ye, Xu Xu, Binhang Yuan, Jie Fu

机构 * Huazhong University of Science and Technology(华中科技大学) University of Alberta(阿尔伯塔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI、cs.PL

AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17204 2026-03-19 cs.CL cs.AR cs.PL 73%

CODMAS: A Dialectic Multi-Agent Collaborative Framework for Structured RTL Optimization

CODMAS:一种基于辩证多智能体协作的结构化RTL优化框架

Che-Ming Chang, Prashanth Vijayaraghavan, Ashutosh Jadhav, Charles Mackin, Vandana Mukherjee, Hsinyu Tsai, Ehsan Degan

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.PL

AI总结 CODMAS通过结合结构化辩证推理与领域感知代码生成和确定性评估,实现RTL优化自动化,显著提升了时钟门控的功耗降低和流水线的延迟减少效果。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 73%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏