arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 284 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 284 篇

2607.27271 2026-07-31 cs.LG cs.SE 新提交 81%

RLPF: Reinforcement Learning from Performance Feedback for Code Generation

RLPF:基于性能反馈的代码生成强化学习

Huihao Jing, Haozhe Cui, Wenbin Hu, Shaojin Chen, Haochen Shi, Changxuan Fan, Yuxuan Liu, Hanyu Yang, Sirui Zhang, Ziyi Chen, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学)

专题命中 代码生成 :code generation(title);code model(abstract);分类 cs.SE、cs.LG

AI总结 该研究提出RLPF方法,将执行结果转化为分阶段奖励,微调Qwen3-32B后提升了代码生成的正确性与效率,模型性能可适度迁移,验证了代码智能体可优化生成程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22898 2026-07-28 cs.SE cs.CL 新提交 81%

AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation

假设挖掘器:在大语言模型代码生成中提取、追踪和修正隐式假设

Jie "JW" Wu

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 研究LLMs代码生成中隐式假设问题,提出AssumptionMiner框架,能生成显式假设层并实现针对性代码再生。通过新基准测试评估,结果显示该框架提升了代码生成的透明度与可控性。

Comments 20 pages, 6 figures, 9 tables. Submitted to IEEE Transactions on Software Engineering. Replication package: https://doi.org/10.5281/zenodo.21535058

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22471 2026-07-27 cs.SE cs.AI 新提交 81%

MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

MineValiCoder:通过测试用例质量挖掘和基于二分图的相互验证实现可靠的代码生成

Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo Li

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对基于大语言模型的测试驱动开发中现有方法的不足,提出MineValiCoder框架,通过测试用例质量挖掘、并行TDD优化和二分图代码-测试相互验证三个模块,有效减轻LLM随机性,提升自动代码生成可靠性,在多基准测试中表现优异。

Comments 12 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20630 2026-07-24 cs.DB cs.AI cs.CL 新提交 81%

Demonstrating GenDB: Instance-Optimized and Customized Query Processing Code Generation via LLM Agents

展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。

Comments Accepted by VLDB 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19104 2026-07-22 cs.SE cs.AI 新提交 81%

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

SciCodePile:用于具有挑战性的科学代码生成的128GB语料库和可执行基准测试

Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

机构 * Singapore Management University(新加坡管理大学) Nanjing University(南京大学) SUN YAT-SEN University(孙中山大学) Home Team Science & Technology Agency(家庭团队科技局)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 研究大型语言模型处理科学代码的能力,提出SciCodePile语料库及可执行基准测试,评估15个模型在三项任务上的表现,发现科学代码生成极具挑战,同时展示了该语料库在训练上的效用,代码和数据可获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17420 2026-07-21 cs.CL cs.SE 新提交 81%

The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation

拒绝编码的图书管理员:大语言模型代码生成中依赖模型的身份设定

Shayell Aharon Salomon, Noam Israel, Ido Safruti, Amir Shaked

机构 * Bluebear Security(蓝熊安全公司)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 研究在可控条件下评估不同人物角色对代码生成的影响,测试了四种提示条件、两个模型等,发现角色影响因模型而异,如Claude Opus上图书管理员角色降低正确性,结果表明角色是依赖模型的行为策略偏差,还发布了相关数据和文档。

Comments 17 pages, 3 tables, no figures. Ancillary files include raw completions, derived scores, analysis scripts, persona texts, and preregistration

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14816 2026-07-17 cs.SE cs.AI 新提交 81%

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

用于从多语言提示生成代码的大语言模型:一个精心策划的基准测试和对代码质量的研究

Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

机构 * University of Catania(卡塔尼亚大学) North Carolina State University(北卡罗来纳州立大学) University of Sannio(萨尼奥大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 研究多语言提示对代码生成的影响,通过460个Python和Java编码任务,将英文提示翻译成多种语言并评估生成代码,发现英文提示非最佳,提示语言影响因编程语言和大语言模型而异,提供多语言基准测试及见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07881 2026-07-10 cs.SE cs.CR cs.LG 新提交 81%

Functional and Secure Code Generation with Task Vectors

使用任务向量进行功能和安全代码生成

Felix Wang, Anudeep Das, Mei Nagappan, N. Asokan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.LG

AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25402 2026-06-25 cs.SE cs.AI 新提交 81%

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

LibEvoBench:探测代码生成模型中的时间知识分层

Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) JetBrains Research, Amsterdam, Netherlands(JetBrains研究)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。

Comments Accepted at the DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22586 2026-06-23 cs.AI cs.SE 新提交 81%

Text2DSL: LLM-Based Code Generation for Domain-Specific Languages

Text2DSL:基于大语言模型的领域特定语言代码生成

Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. Magomedov

机构 * RTU MIREA --- Russian Technological University(俄罗斯技术大学) Academy of the Federal Guard Service of the Russian Federation(俄罗斯联邦警卫局学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 提出Text2DSL任务,将自然语言描述自动转换为领域特定语言(DSL)代码;构建PolkitBench数据集,通过结构化上下文(BNF语法、API规范等)显著提升LLM生成代码的语法和结构有效性。

Comments 14 pages, 4 figures, 5 tables. Accepted at KES 2026 (Knowledge-Based Intelligent Information and Engineering Systems), Procedia Computer Science, Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12864 2026-06-12 cs.SE cs.AI 新提交 81%

Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming

超越问题求解:用于评估竞赛编程中代码生成、攻击和修复的UOJ-Bench基准

Tingqiang Xu, Hangrui Zhou, Tianle Cai, Alex Gu, Kaifeng Lyu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 提出UOJ-Bench基准,通过代码生成、攻击和修复三项任务评估LLM在竞赛编程中的问题求解与人类代码错误识别能力,发现最强模型在一次性评估中无法识别超过50%的错误提交,但测试时扩展可提升至90%以上,且能发现约5%的满分提交中的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29529 2026-08-03 cs.SE 新提交 80%

AuditCoder: Responsibility-Preserving Task Graphs for Auditable Code Generation and Bounded Repair

AuditCoder:用于可审计代码生成与有界修复的责任保留任务图

Kangjie Huang, Chen Lyu

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE;repository(comments)

AI总结 AuditCoder通过带契约注释的任务图为代码生成保留责任标识,结合保守定位器与有界修复,在APPS、ClassEval数据集上取得优于CoT+重试的可审计代码生成效果。

Comments Preprint. 37 pages, 5 figures. Code and data are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19784 2026-08-21 cs.SE 新提交 79%

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation

PRAXIS:面向领域代码生成的基于图的默会知识

Xue Jiang, Tianyu Zhang, Lingwei Wu, Ziyu Wang, Ge Li, Yuan Sui, Hao Zhu, Wenpin Jiao, Zhi Jin, Yihong Dong

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 PRAXIS框架通过模拟人类开发工作流提取代码依赖图上的默会知识,提升智能体领域代码生成性能,优于现有方法且可适配多种智能体框架与大语言模型

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15510 2026-08-18 cs.AI 新提交 79%

Who Leads Now? Token-Level Modality Arbitration for Chart-to-Code Generation

当前谁主导?用于图表转代码生成的令牌级模态仲裁

Qinghao Fu, Yarong Wang, Shunlei Ning, Yilin Wang, Shunwen Bai, Xinda Wang, Jiaotuan Wang, Yinan Nie, Wei Zhou

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11394 2026-08-13 cs.SE 新提交 79%

GraphAlignCoder: Aligning Program and Proof Graphs for Code Generation

GraphAlignCoder:对齐程序与证明图的代码生成框架

Yueke Zhang, Zihan Fang, Kevin Leach, Yu Huang

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09068 2026-08-11 cs.SE 新提交 79%

Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation

Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试

Shadikur Rahman, Umme Ayman Koana, Syed Muhammad Danish

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06848 2026-08-10 cs.CR cs.SE 新提交 79%

Understanding and Improving Model Editing for Secure Code Generation

理解与改进用于安全代码生成的模型编辑

Weifeng Sun, Quanjun Zhang, Yuchen Chen, Chengran Yang, Gou Tan, David Lo

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本研究系统探究模型编辑用于安全代码生成,提出SafeEdit方法缓解模型编辑的安全与功能权衡,其与CoSec结合可提升安全代码生成性能。

Comments ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03535 2026-08-05 cs.SE 新提交 79%

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation

CodeAssay:带有审计基准真值的多指标大语言模型代码生成基准

Shahbaz Siddeeq, Muhammad Waseem, Umar Subhan Malhi, Pekka Abrahamsson

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出CodeAssay基准,涵盖185个Python任务,结合多类测试与度量,经审计后发现模型正确性标签有9.0%变化,且验证了多类LLM代码生成的评估特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00494 2026-08-04 cs.AI 新提交 79%

TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation

TaPR:面向反馈条件代码生成的感知测试策略优化

Aofan Liu, Jingxiang Meng, Fangxin Liu, Yongbiao Chen

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 该研究针对代码智能体强化学习中反馈利用不足的问题,提出TaPR框架,通过将执行反馈转换为密集每轮测试通过率奖励,在219个代码问题上提升了多轮代码生成成功率。

Comments 9 pages, 3 figures, 3 tables. Aofan Liu and Jingxiang Meng contributed equally; Fangxin Liu and Yongbiao Chen are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28529 2026-07-31 cs.SE 新提交 79%

CoGate: Confidence-Gated Co-Decoding for Secure Code Generation

CoGate:用于安全代码生成的置信门控协同解码

Minghao Hu, Lannan Luo, Allen Roush, Phillip Howard

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 针对现有协同解码未考虑专家模型置信度的问题,提出CoGate方法,在多LLM后端和代码生成基准上优于CoSec+,在CWEval的Func-Sec@10指标最高提升12.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23088 2026-07-28 cs.CR cs.AI 新提交 79%

Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios

海报:通过现实世界风险场景重新思考大语言模型代码生成中的安全性

Lixun Ma, Ruolong Ma, Bei Wang, Feng Wei, Zhenguang Liu, Lorenzo Cavallaro, Wentao Chen

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 研究LLM代码生成的安全行为,识别出三种风险场景,构建含2700个测试用例的基准评估安全性,发现先进LLMs平均漏洞率超56%,证明安全感知提示可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20501 2026-07-24 cs.AI cs.MA 新提交 79%

MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation

MKEvolve:用于内核代码生成的模块化多智能体框架

Jason Yoo, Rajarshi Saha, Shaowei Zhu, Tao Yu, Wei Tang, Youngsuk Park

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 针对硬件加速器内核代码生成瓶颈,MKEvolve框架通过迭代共同进化PyTorch模块分解与子模块内核,经拆分融合优化分解并以束搜索改进子内核,实验证明其在正确性、加速及减少LLM令牌使用上有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19703 2026-07-23 cs.SE 新提交 79%

Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development

架起行为与实现的桥梁:用于行为驱动开发的自动化Java胶水代码生成

Xinyu Shi, Zhou Yang, An Ran Chen

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究针对行为驱动开发中胶水代码开发维护难题,提出分层多智能体框架AutoGlue,遵循行为优先工作流程。经实验评估,相比少样本提示,其在代码生成指标上有显著提升,能有效连接行为规范与项目代码,支持软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17540 2026-07-21 cs.LG stat.ML 新提交 79%

Program Synthesis for Simulation-Based Inference: Joint Model Selection and Parameter Estimation

基于仿真推理的程序合成:联合模型选择与参数估计

Siddharth Mishra-Sharma

机构 * Anthropic

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.LG

AI总结 研究提出结合大语言模型与神经仿真推理的框架,用于联合模型选择与参数估计。给定自然语言描述,大语言模型提出候选程序,经反馈驱动变异和神经密度估计评估,能在一组模型上推理,在多基准测试中可从提示识别合理模型族。

Comments 15+7 pages, 4+2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15937 2026-07-20 cs.CR cs.SE 新提交 79%

The Language of Security: How Prompt Syntax Shapes Secure Code Generation in Open LLMs

安全语言:提示语法如何塑造开放语言模型中的安全代码生成

Matteo Cicalese, Antonio Della Porta, Stefano Lambiase, Emanuele Iannone, Torge Hinrichs, Riccardo Scandariato, Fabio Palomba

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究开放语言模型中提示语法对安全代码生成的影响,采用解析器驱动方法生成句法变体并评估,发现特定句法元素及其位置影响代码安全性,为降低LLM辅助开发漏洞风险提供指导。

Comments Accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13820 2026-07-16 cs.SE 新提交 79%

PROBE: Benchmarking Code Generation in Large Language Models

PROBE:大语言模型中代码生成的基准测试

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。

Comments Accepted for publication in Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09146 2026-07-13 cs.SE 新提交 79%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 79%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05810 2026-07-08 cs.SE 新提交 79%

SCOPE: Leveraging Subgoal Critiques for Code Generation

SCOPE:利用子目标批判进行代码生成

Yueke Zhang, Yifan Zhang, Zihan Fang, Kevin Leach, Wei Zhang, Yu Huang

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究针对大语言模型代码生成不可靠问题,提出SCOPE方法,利用证明器初始化子目标批判,结合监督微调、强化学习等,通过两个互补奖励改进代码生成,实验显示在多个数据集上优于基线,优势集中在有语义约束任务,代码修正更局部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03130 2026-07-07 cs.SE 新提交 79%

Copper: Unifying Correctness and Performance Specification in Code Generation

Copper:统一代码生成中的正确性和性能规范

André Lizardo, Raul Barbosa

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究如何在代码生成中兼顾正确性与性能,核心方法是结合形式验证与性能感知规范,主要贡献是生成的代码可证明正确且高效执行,缩小了AI辅助编程中可信度和性能的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏