arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1744 篇

2404.08008 2025-05-30 cs.LG cs.CL cs.HC 62%

Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition

Kehua Feng, Keyan Ding, Hongzhi Tan, Kede Ma, Zhihua Wang, Shuangquan Guo, Yuzhou Cheng, Ge Sun, Guozhou Zheng, Qiang Zhang, Huajun Chen

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

Comments 35 pages, 6 figures, Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20184 2025-05-27 cs.CL cs.AI 62%

THiNK: Can Large Language Models Think-aloud?

Yongan Yu, Mengqian Wu, Yiran Lin, Nikki G. Lobczowski

机构 * McGill University(麦吉尔大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19502 2025-05-27 cs.SE cs.AI 62%

CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation

Guang Yang, Yu Zhou, Xiang Chen, Wei Zheng, Xing Hu, Xin Zhou, David Lo, Taolue Chen

机构 * College of Computer Science and Technology(计算机科学与技术学院) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) School of Software(软件学院) School of Software Technology(软件技术学院) School of Computing and Information Systems(计算与信息系统学院) School of Computing and Mathematical Sciences(计算与数学科学学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17149 2025-05-26 cs.CL cs.AI 62%

Large Language Models for Predictive Analysis: How Far Are They?

Qin Chen, Yuanyi Ren, Xiaojun Ma, Yuyang Shi

机构 * Peking University(北京大学) Harvard University(哈佛大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15253 2025-05-23 cs.CL cs.LG 62%

Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators

Yilun Zhou, Austin Xu, Peifeng Wang, Caiming Xiong, Shafiq Joty

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

Comments ICML 2025. The first two authors contributed equally. The codebase is at https://github.com/SalesforceAIResearch/jetts-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13178 2025-05-22 cs.LG cs.AI 62%

Benchmarking Post-Training Quantization in LLMs: Comprehensive Taxonomy, Unified Evaluation, and Comparative Analysis

Jiaqi Zhao, Ming Wang, Miao Zhang, Yuzhang Shang, Xuebo Liu, Yaowei Wang, Min Zhang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 3 fugures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15469 2025-05-22 cs.SE cs.AI 62%

A Qualitative Investigation into LLM-Generated Multilingual Code Comments and Automatic Evaluation Metrics

Jonathan Katzy, Yongcheng Huang, Gopal-Raj Panchu, Maksym Ziemlewski, Paris Loizides, Sander Vermeulen, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI

Comments Accepted PROMISE '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15189 2025-05-13 cs.SE cs.CL 62%

EffiLearner: Enhancing Efficiency of Generated Code via Self-Optimization

Dong Huang, Jianbo Dai, Han Weng, Puzhen Wu, Yuhao Qing, Heming Cui, Zhijiang Guo, Jie M. Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02037 2025-05-13 cs.SE cs.CL 62%

EffiBench: Benchmarking the Efficiency of Automatically Generated Code

Dong Huang, Yuhao Qing, Weiyi Shang, Heming Cui, Jie M. Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Camera Ready for NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14338 2025-05-12 cs.CL cs.SE 62%

English Please: Evaluating Machine Translation with Large Language Models for Multilingual Bug Reports

Avinash Patil, Siru Tao, Aryan Jadon

机构 * Juniper Networks Inc.(Juniper网络公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL

Comments 8 Pages, 4 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02854 2025-05-07 cs.CL cs.AI 62%

Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open Datasets

Masumi Morishige, Ryo Koshihara

机构 * Galirage Inc.(加利拉格公司)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20673 2025-04-30 cs.SE cs.AI 62%

CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation

Wenjing Yin, Tianze Sun, Yijiong Yu, Jiawei Fang, Guangyao Su, Jiancheng Wang, Zekun Wang, Wei Wang, Ran Chen, Ziyun Dai, Shuai Yuan, Menghang Dong, Peng Luo, Dong Cao, Da Lei, Yajun Zhang, Hao Chen, Xiang Ma, Yong Liu, Weifeng Liu, Yuanjian Xu, Ji Pei

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Submitted to ACL 2025. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19444 2025-04-29 cs.SE cs.CL 62%

Large Language Models are Qualified Benchmark Builders: Rebuilding Pre-Training Datasets for Advancing Code Intelligence Tasks

Kang Yang, Xinjun Mao, Shangwen Wang, Yanlin Wang, Tanghaoran Zhang, Bo Lin, Yihao Qin, Zhang Zhang, Yao Lu, Kamal Al-Sabahi

机构 * College of Computer, National University of Defense Technology(计算机学院,国防科技大学) Sun Yat-sen University(中山大学) College of Banking and Financial Studies(金融学院)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.CL

Comments Awarded the ACM SIGSOFT Distinguished Paper Award in ICPC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16263 2025-04-24 cs.LG cs.AI 62%

Gradient-Optimized Fuzzy Classifier: A Benchmark Study Against State-of-the-Art Models

Magnus Sieverding, Nathan Steffen, Kelly Cohen

机构 * University of Cincinnati(辛辛那提大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06193 2025-04-22 cs.SE cs.AI 62%

Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering

Ruiqi Wang, Jiyu Guo, Cuiyun Gao, Guodong Fan, Chun Yong Chong, Xin Xia

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Monash University Malaysia(墨尔本大学马来西亚分校) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Accepted by ISSTA 2025: https://conf.researchr.org/details/issta-2025/issta-2025-papers/85/Can-LLMs-replace-Human-Evaluators-An-Empirical-Study-of-LLM-as-a-Judge-in-Software-E

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13059 2025-04-18 cs.RO cs.AI cs.CL 62%

RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins

Yao Mu, Tianxing Chen, Zanxin Chen, Shijia Peng, Zhiqian Lan, Zeyu Gao, Zhixuan Liang, Qiaojun Yu, Yude Zou, Mingkun Xu, Lunkai Lin, Zhiqiang Xie, Mingyu Ding, Ping Luo

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments CVPR 2025 Highlight. 22 pages. Project page: https://robotwin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02920 2025-04-17 cs.RO cs.AI cs.CL 62%

RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)

Yao Mu, Tianxing Chen, Shijia Peng, Zanxin Chen, Zeyu Gao, Yude Zou, Lunkai Lin, Zhiqiang Xie, Ping Luo

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments Project page: https://robotwin-benchmark.github.io/early-version/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11369 2025-04-16 cs.CL cs.AI cs.CY cs.HC physics.soc-ph 62%

OpenTuringBench: An Open-Model-based Benchmark and Framework for Machine-Generated Text Detection and Attribution

Lucio La Cava, Andrea Tagarelli

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments Under review with ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06468 2025-04-10 cs.RO cs.AI cs.SE 62%

Agent-Arena: A General Framework for Evaluating Control Algorithms

Halid Abdulrahim Kadi, Kasim Terzić

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

Comments 20 pages and 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04582 2025-04-09 cs.CV cs.AI cs.LG 62%

Your Image Generator Is Your New Private Dataset

Nicolo Resmini, Eugenio Lomurno, Cristian Sbrolli, Matteo Matteucci

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03736 2025-04-08 cs.LG cs.AI cs.CV 62%

Uncertainty Propagation in XAI: A Comparison of Analytical and Empirical Estimators

Teodor Chiaburu, Felix Bießmann, Frank Haußer

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments 23 pages, 10 figures, accepted at WCXAI 2025 Istanbul

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01420 2025-04-03 cs.CL cs.AI 62%

FAIRE: Assessing Racial and Gender Bias in AI-Driven Resume Evaluations

Athena Wen, Tanush Patil, Ansh Saxena, Yicheng Fu, Sean O'Brien, Kevin Zhu

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20952 2025-03-28 cs.LG cs.AI 62%

TS-Inverse: A Gradient Inversion Attack Tailored for Federated Time Series Forecasting Models

Caspar Meijer, Jiyue Huang, Shreshtha Sharma, Elena Lazovik, Lydia Y. Chen

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14443 2025-03-19 cs.LG cs.SE 62%

EnvBench: A Benchmark for Automated Environment Setup

Aleksandra Eliseeva, Alexander Kovrigin, Ilia Kholkin, Egor Bogomolov, Yaroslav Zharov

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.LG

Comments Accepted at the DL4Code workshop at ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12794 2025-03-18 cs.AI cs.LG 62%

Job Shop Scheduling Benchmark: Environments and Instances for Learning and Non-learning Methods

Robbert Reijnen, Igor G. Smit, Hongxiang Zhang, Yaoxin Wu, Zaharah Bukhsh, Yingqian Zhang

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13187 2025-03-11 cs.LG cs.AI cs.RO 62%

A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models

Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam, Alvaro Velasquez, Paulo Shakarian, Hua Wei

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04543 2025-03-07 cs.CL cs.AI 62%

Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model

Wenke Huang, Jian Liang, Xianda Guo, Yiyang Fang, Guancheng Wan, Xuankun Rong, Chi Wen, Zekun Shi, Qingyun Li, Didi Zhu, Yanbiao Ma, Ke Liang, Bin Yang, He Li, Jiawei Shao, Mang Ye, Bo Du

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12723 2025-03-07 cs.LG cs.AI cs.CV q-bio.PE 62%

BIOSCAN-5M: A Multimodal Dataset for Insect Biodiversity

Zahra Gharaee, Scott C. Lowe, ZeMing Gong, Pablo Millan Arias, Nicholas Pellegrino, Austin T. Wang, Joakim Bruslund Haurum, Iuliia Zarubiieva, Lila Kari, Dirk Steinke, Graham W. Taylor, Paul Fieguth, Angel X. Chang

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13921 2025-03-06 cs.LG cs.AR cs.SE 62%

Exploring Code Language Models for Automated HLS-based Hardware Generation: Benchmark, Infrastructure and Analysis

Jiahao Gai, Hao Mark Chen, Zhican Wang, Hongyu Zhou, Wanru Zhao, Nicholas Lane, Hongxiang Fan

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.LG

Comments Paper accepted by ASP-DAC'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16456 2025-03-05 cs.LG cs.SE 62%

CoCoNUT: Structural Code Understanding does not fall out of a tree

Claas Beger, Saikat Dutta

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.LG

Comments Accepted at 2025 IEEE/ACM International Workshop on Large Language Models for Code (LLM4Code)

详情

展开后加载摘要…

URL PDF HTML 收藏