arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1744 篇

2508.14727 2025-08-21 cs.SE cs.LG 62%

Assessing the Quality and Security of AI-Generated Code: A Quantitative Analysis

Abbas Sabra, Olivier Schmitt, Joseph Tyler

机构 * Sonar

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14704 2025-08-21 cs.AI cs.CL 62%

MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers

Ziyang Luo, Zhiqi Shen, Wenzhuo Yang, Zirui Zhao, Prathyusha Jwalapuram, Amrita Saha, Doyen Sahoo, Silvio Savarese, Caiming Xiong, Junnan Li

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments Website: https://mcp-universe.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05668 2025-08-20 cs.IR cs.AI cs.CL 62%

A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges

Yunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09101 2025-08-13 cs.CL cs.SE 62%

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Jason Chou, Ao Liu, Yuchi Deng, Zhiying Zeng, Tao Zhang, Haotian Zhu, Jianwei Cai, Yue Mao, Chenchen Zhang, Lingyun Tan, Ziyan Xu, Bohui Zhai, Hengyi Liu, Speed Zhu, Wiggin Zhou, Fengzong Lian

机构 * Hunyuan Team, Tencent(腾讯文心团队)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Homepage: https://autocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08661 2025-08-13 cs.SE cs.AI 62%

Hallucinations in Code Change to Natural Language Generation: Prevalence and Evaluation of Detection Metrics

Chunhua Liu, Hong Yi Lin, Patanamon Thongtanunam

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments 8 main pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04030 2025-08-11 cs.SE cs.CL 62%

OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs

Wasi Uddin Ahmad, Aleksander Ficek, Mehrzad Samadi, Jocelyn Huang, Vahid Noroozi, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA圣克拉拉分校)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23989 2025-08-07 cs.SE cs.AI 62%

Rubric Is All You Need: Enhancing LLM-based Code Evaluation With Question-Specific Rubrics

Aditya Pathak, Rachit Gandhi, Vaibhav Uttam, Arnav Ramamoorthy, Pratyush Ghosh, Aaryan Raj Jindal, Shreyash Verma, Aditya Mittal, Aashna Ased, Chirag Khatri, Yashwanth Nakka, Devansh, Jagat Sesh Challa, Dhruv Kumar

机构 * BITS Pilani(比特斯理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Accepted in ICER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02193 2025-08-05 cs.CL cs.LG 62%

Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference

Yuxuan Song, Zheng Zhang, Cheng Luo, Pengyang Gao, Fan Xia, Hao Luo, Zheng Li, Yuehang Yang, Hongli Yu, Xingwei Qu, Yuwei Fu, Jing Su, Ge Zhang, Wenhao Huang, Mingxuan Wang, Lin Yan, Xiaoying Jia, Jingjing Liu, Wei-Ying Ma, Ya-Qin Zhang, Yonghui Wu, Hao Zhou

机构 * ByteDance Seed(字节跳动种子) Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学)

专题命中 代码评测 :code model(abstract);分类 cs.CL、cs.LG

Comments Demo is available at https://studio.seed.ai/exp/seed_diffusion/; Project page is https://seed.bytedance.com/seed_diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18812 2025-07-28 cs.SE cs.AI 62%

MemoCoder: Automated Function Synthesis using LLM-Supported Agents

Yiping Jia, Zhen Ming Jiang, Shayan Noei, Ying Zou

机构 * Queen's University(女王大学) York University(约克大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07945 2025-07-16 cs.AR cs.AI cs.CL 62%

ProtocolLLM: RTL Benchmark for SystemVerilog Generation of Communication Protocols

Arnav Sheth, Ivaxi Sheth, Mario Fritz

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) CISPA Helmholtz Center for Information Security(CISPA 沃尔夫冈·泡利研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments Accepted at MLSysArch@ISCA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07748 2025-07-11 cs.CL cs.AI 62%

When Large Language Models Meet Law: Dual-Lens Taxonomy, Technical Advances, and Ethical Governance

Peizhang Shao, Linrui Xu, Jinxi Wang, Wei Zhou, Xingyu Wu

机构 * School of Law, China University of Political Science and Law(中国政法大学法学院) Zhejiang University of Finance and Economics Dongfang College(浙江财经大学东洋学院) School of Information Management for Law, China University of Political Science and Law(中国政法大学信息管理法学院) Department of Artificial Intelligence, Chung-Ang University(成均馆大学人工智能系) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19543 2025-07-01 cs.CL cs.AI 62%

RAG and RAU: A Survey on Retrieval-Augmented Language Model in Natural Language Processing

Yucheng Hu, Yuxing Lu

机构 * East China University of Science and Technology(东华大学) Peking University(北京大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments 30 pages, 7 figures. Draft version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20081 2025-06-27 cs.CL cs.AI 62%

SACL: Understanding and Combating Textual Bias in Code Retrieval with Semantic-Augmented Reranking and Localization

Dhruv Gupta, Gayathri Ganesh Lakshmy, Yiqing Xie

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17847 2025-06-24 cs.LG cs.AI 62%

A Comparative Study of Open-Source Libraries for Synthetic Tabular Data Generation: SDV vs. SynthCity

Cristian Del Gobbo

机构 * Cristian Del Gobbo(独立研究者)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments 23 Pages, 5 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17335 2025-06-24 cs.SE cs.AI 62%

LMR-BENCH: Evaluating LLM Agent's Ability on Reproducing Language Modeling Research

Shuo Yan, Ruochen Li, Ziming Luo, Zimu Wang, Daoyang Li, Liqiang Jing, Kaiyu He, Peilin Wu, George Michalopoulos, Yue Zhang, Ziyang Zhang, Mian Zhang, Zhiyu Chen, Xinya Du

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21349 2025-06-23 cs.LG cs.AI cs.PF 62%

FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system

Zeyuan Li, Yangfan He, Lewei He, Jianhui Wang, Tianyu Shi, Bin Lei, Yuchen Li, Qiuwu Chen

机构 * School of Software, South China Normal University(南方科技大学软件学院) University of Minnesota - Twin Cities(明尼苏达大学双城分校) University of Electronic Science and Technology of China(电子科技大学) University of Toronto(多伦多大学) University of Connecticut(康涅狄格大学) AI center, AIGCode Inc.(AIGCode公司人工智能中心)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15251 2025-06-19 cs.LG cs.AI 62%

Singular Value Decomposition on Kronecker Adaptation for Large Language Model

Yee Hin Chong, Peng Qu

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13832 2025-06-19 cs.SE cs.AI 62%

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Hongda Zhu, Yiwen Zhang, Bing Zhao, Jingzhe Ding, Siyao Liu, Tong Liu, Dandan Wang, Yanan Liu, Zhaojian Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗quant研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00319 2025-06-19 cs.LG cs.AI 62%

Data Augmentation Policy Search for Long-Term Forecasting

Liran Nochumsohn, Omri Azencot

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments TMLR 2025

Journal ref Transactions on Machine Learning Research, 2025. https://openreview.net/forum?id=Wnd0XY0twh

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18379 2025-06-18 cs.CR cs.AI cs.SE 62%

MALSIGHT: Exploring Malicious Source Code and Benign Pseudocode for Iterative Binary Malware Summarization

Haolang Lu, Hongrui Peng, Guoshun Nan, Jiaoyang Cui, Cheng Wang, Weifei Jin, Songtao Wang, Shengli Pan, Xiaofeng Tao

机构 * National Engineering Research Center for Mobile Network Technologies(移动网络技术国家工程研究中心) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Laboratory(中关村实验室)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI

Comments Accepted by IEEE Transactions on Information Forensics & Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11221 2025-06-16 cs.AI cs.CL cs.LO 62%

LLM-as-a-Fuzzy-Judge: Fine-Tuning Large Language Models as a Clinical Evaluation Judge with Fuzzy Logic

Weibing Zheng, Laurah Turner, Jess Kropczynski, Murat Ozer, Tri Nguyen, Shane Halse

机构 * University of Cincinnati(辛辛那提大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 1 figure, 2025 IFSA World Congress NAFIPS Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10989 2025-06-16 cs.SE cs.AI 62%

Prompt engineering and framework: implementation to increase code reliability based guideline for LLMs

Rogelio Cruz, Jonatan Contreras, Francisco Guerrero, Ezequiel Rodriguez, Carlos Valdez, Citlali Carrillo

机构 * IBM Technologies(IBM技术)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08743 2025-06-11 cs.IR cs.AI cs.DB cs.LG 62%

Bridging RDF Knowledge Graphs with Graph Neural Networks for Semantically-Rich Recommender Systems

Michael Färber, David Lamprecht, Yuni Susanti

机构 * ScaDS.AI \& TU Dresden, Dresden, Germany metaphacts GmbH, Walldorf, Germany Fujitsu Ltd., Japan

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments Accepted at DASFAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06957 2025-06-10 cs.LG cs.AI 62%

Policy Filtration for RLHF to Mitigate Noise in Reward Models

Chuheng Zhang, Wei Shen, Li Zhao, Xuyun Zhang, Xiaolong Xu, Wanchun Dou, Jiang Bian

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04670 2025-06-05 cs.SE cs.AI 62%

LLM Code Customization with Visual Results: A Benchmark on TikZ

Charly Reux, Mathieu Acher, Djamel Eddine Khelladi, Olivier Barais, Clément Quinton

机构 * Univ Rennes, Inria, IRISA, INSA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国工业与应用科学学院) Univ Rennes, Inria, CNRS, IUF, IRISA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国国家信息与自动化研究所、法国国家信息与自动化研究所) Univ Rennes, Inria, CNRS, IRISA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国国家信息与自动化研究所) Univ. Lille, CNRS, Inria(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所) Univ. Rennes, IRISA, Inria(里昂大学、法国国家信息与自动化研究所、法国国家信息与自动化研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Journal ref EASE 2025 - Evaluation and Assessment in Software Engineering, Jun 2025, Istanbul, Turkey. pp.1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02314 2025-06-04 cs.AI cs.CL 62%

ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code

Tianyu Hua, Harper Hua, Violet Xiang, Benjamin Klieger, Sang T. Truong, Weixin Liang, Fan-Yun Sun, Nick Haber

机构 * Stanford University(斯坦福大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00943 2025-06-03 cs.SE cs.AI 62%

Legal Compliance Evaluation of Smart Contracts Generated By Large Language Models

Chanuka Wijayakoon, Hai Dong, H. M. N. Dilum Bandara, Zahir Tari, Anurag Soin

机构 * School of Computing Technologies, RMIT University(RMIT大学计算机技术学院) CSIRO’s Data61(CSIRO数据61研究中心) University of Technology, Sydney(悉尼技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Accepted for publication at IEEE International Conference on Blockchain and Cryptocurrency (ICBC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00676 2025-06-03 cs.LG cs.AI 62%

SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning

Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla

机构 * Critical ML Lab(关键机器学习实验室) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16167 2025-06-03 cs.SE cs.CL 62%

CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models

Hong Yi Lin, Chunhua Liu, Haoyu Gao, Patanamon Thongtanunam, Christoph Treude

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments The paper is published in Findings of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23239 2025-05-30 cs.SE cs.AI 62%

OSS-UAgent: An Agent-based Usability Evaluation Framework for Open Source Software

Lingkai Meng, Yu Shao, Long Yuan, Longbin Lai, Peng Cheng, Wenyuan Yu, Wenjie Zhang, Xuemin Lin, Jingren Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Wuhan University of Technology(武汉理工大学) Alibaba Group(阿里巴巴集团) Tongji University(同济大学) University of New South Wales(新南威尔士大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏