A Theoretical Analysis of Test-Driven Code Generation
测试驱动代码生成的理论分析
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出概率框架分析测试驱动开发中代码生成与选择策略,证明模糊功能相似性估计器在信号噪声比上优于功能等价性估计器,并通过实验验证了回提示在任务描述模糊性下的有效性。
Comments preprint
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
测试驱动代码生成的理论分析
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出概率框架分析测试驱动开发中代码生成与选择策略,证明模糊功能相似性估计器在信号噪声比上优于功能等价性估计器,并通过实验验证了回提示在任务描述模糊性下的有效性。
Comments preprint
超越训练分布:神经程序合成中的泛化边界映射
机构 * Friedrich Schiller University(弗里德里希-席勒大学)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过构建领域特定算术语法规则的严格控制环境,系统评估了模型在程序合成中的泛化能力,发现优化密度泛化能提升鲁棒性,但transformers在语法扩展时表现下降30%以上,且计算规模提升与泛化能力呈对数线性关系。
反馈优先于流程:执行反馈比流程拓扑在1-3B代码生成中更重要
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究探讨了在1-3B模型中,执行反馈对代码生成能力的影响,发现执行反馈比流程拓扑更有效,且通过进化搜索验证了简单循环优于复杂结构。
Comments 17 pages main text, 2 page references, 3 figures. Code: https://github.com/L3G/feedback-over-form
共存测试,更好的AI代码:测试语法结构如何影响基础模型代码生成
机构 * Cosmic AI
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究探讨测试代码结构对基础模型代码生成质量的影响,发现内联测试在保真度和正确性上表现更优,且模型行为随世代变化,非transformer架构也验证了该设计的鲁棒性。
Comments 20 pages. Preprint; arXiv long version of a paper accepted at AIware 2026. Adds Appendices A (cross-language) and B (Python isolation) not present in the ACM camera-ready
CodeRL+: 通过执行语义对齐改进代码生成
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; School of Computer Science, Wuhan University(武汉大学计算机科学系)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出CodeRL+,通过将执行语义对齐整合到RLVR训练流程中,提升代码生成的准确性,实验显示其在pass@1指标上平均提升4.6%。
Comments Accepted by ACL 2026
带有多模验证器的认证程序合成
机构 * National University of Singapore(新加坡国立大学) ; Neapolis University Pafos(纳皮奥斯大学帕福斯)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。
SEW:自演化代理工作流用于自动化代码生成
机构 * University of Aberdeen(阿伯丁大学) ; University of Glasgow(格拉斯哥大学) ; University of Cambridge(剑桥大学) ; MBZUAI(马克斯·普朗克智能系统研究所)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出SEW框架,通过自演化方法自动设计和优化多代理工作流,提升代码生成任务的性能,实验表明在LiveCodeBench上比仅使用基础LLM提升12%。
Comments 16 pages, 5 figures
错误的架构:对人工智能与人类代码生成的哲学探究
机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究所(IIIA-CSIC))
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文探讨人类与机器代码生成的本质差异,通过分析错误的根源,揭示认知与随机性导致的因果区别,为AI与人类协作软件开发提供哲学框架。
Comments preprint
通过语义熵和行为共识的自我改进代码生成
机构 * Nanjing University(南京大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 本文提出ConSelf方法,利用语义熵构建课程和共识驱动优化,无需外部监督提升代码生成能力。
Comments Accepted in the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)
看清并非掌握:教LLM使用私有库进行代码生成
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Proxseer Inc.(Proxseer公司) ; School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) ; Software Institute, Nanjing University(南京大学软件学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出PriCoder方法,通过自动生成数据教LLM有效调用私有库API,提升私有库代码生成能力,实验显示在多种设置下pass@1指标提升超20%。
Comments 12 pages
基于对称约束的语言引导程序合成的 governing 方程发现方法
机构 * Fandaqah (Owned by Dyafa)(法达卡(由迪法夫所有)) ; Hamdard University(哈姆达德大学)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SymLang 通过结合对称约束、语言模型引导程序合成和贝叶斯模型选择,实现了从噪声和部分观测中发现 governing 方程的高精度结构恢复。
Comments 12 pages, 4 figures, 5 tables
CONCUR: 评估LLM在并发代码生成中的基准测试
机构 * The University of Queensland(昆士兰大学) ; Texas A&M University - Kingsville(德克萨斯农工大学-国王维尔分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 CONCUR是一个专门评估LLM在并发代码生成能力的基准测试,包含115个问题,涵盖基础和变体,用于评估LLM在并发编程中的性能。
在代码生成上的大语言模型操作鲁棒性
机构 * School of Engineering, Computing and Mathematics, Oxford Brookes University(工程、计算与数学学院,奥克斯伯里大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出了一种评估大语言模型在代码生成任务中鲁棒性的方法,通过分析自然语言描述的最小变化来评估模型性能,并对四种先进模型进行了实验验证。
TAROT: 为基于大语言模型的代码生成设计的测试驱动和能力适应课程强化微调
机构 * Electronics and Telecommunications Research Institute(电信研究所) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Hugging Face ; Ant Group(蚂蚁集团)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 TAROT通过测试驱动和能力适应的课程强化微调方法,提升大语言模型生成代码的功能正确性和稳健性。
Comments The first three authors contributed equally to this work; listing order is random
IntentCoding: 提升代码生成中用户意图的遵循能力
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 IntentCoding通过增强用户意图的影响力,提升代码生成中对约束条件的遵循能力,显著提高约束满足和功能正确性。
Herb.jl:一个统一的程序合成库
机构 * Technical University Delft(代尔夫特理工大学)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 Herb.jl是一个用Julia编写的统一程序合成库,旨在通过分解底层算法为可扩展的子组件,简化程序合成的重用和调整过程。
Bench4HLS: 面向端到端评估LLM在高层次综合代码生成中的表现
机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida(电子与计算机工程系,中央佛罗里达大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 Bench4HLS通过提供结构化、可扩展的测试平台,评估LLM在高层次综合代码生成中的性能与优化能力。
Comments Accepted to the Design, Automation and Test in Europe Conference (DATE 2026)
对大型语言模型在ABAP代码生成中的性能评估:一项通过编译器反馈实现迭代改进的实证研究
机构 * Technische Hochschule Köln(科隆技术大学) ; CONSILIO GmbH(CONSILIO公司)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 本研究通过实证分析评估了大型语言模型在生成ABAP代码中的性能,探讨了编译器反馈对迭代改进的影响,并揭示了不同模型在任务类型上的表现差异。
Comments 20 pages, 10 figures, Author: Hartmut Westenberger (ORCID: 0009-0009-9063-8318)
Protocode: 为LLMs中的代码生成提供原型驱动的可解释性
机构 * University of Maryland, College Park(马里兰大学 College Park分校)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 Protocode通过原型驱动的ICL采样提升代码生成的可解释性和性能。
ShortCoder: 用于令牌高效代码生成的知识增强语法优化
机构 * Sun Yat-sen University, China(中山大学) ; Huawei Cloud Computing Technologies Co., Ltd., China(华为云计算技术有限公司) ; Chongqing University, China(重庆大学) ; University of Electronic Science and Technology of China, China(电子科技大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 ShortCoder通过语法优化和知识增强提升代码生成效率,实现18.1%-37.8%的效率提升。
BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好
机构 * Monash University(墨尔本大学) ; CSIRO’s Data61(CSIRO的数据61) ; Purdue University(普渡大学) ; Independent(独立) ; HKUST (Guangzhou)(香港科技大学(广州)) ; UCSD(加州大学圣地亚哥分校) ; UVA(弗吉尼亚大学) ; CNRS, France(法国国家科学研究中心) ; IBM ; Cisco(思科) ; Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学) ; University of Notre Dame(Notre Dame大学) ; Uber ; Tano Labs(Tano实验室) ; NUS(国立大学新加坡) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Tencent AI Lab(腾讯AI实验室) ; University of Washington(华盛顿大学) ; Nevsky Collective(Nevsky集体) ; ETH Zurich(苏黎世联邦理工学院) ; Detomo Inc(Detomo公司) ; University of Oxford(牛津大学) ; UIUC(伊利诺伊大学香槟分校) ; Google(谷歌) ; NVIDIA ; Singapore Management University(新加坡管理学院) ; ServiceNow Research(ServiceNow研究) ; Hugging Face
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。
Comments Built with love by the BigCode community :)
面向LLM的多校准代码生成
机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出多校准方法以提升代码生成模型的置信度评分准确性,通过实验验证其在技能分数上的显著提升。
Comments Accepted at AI-SQE 2026 (The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond)
MERA Code: 一个统一的框架,用于评估跨任务的代码生成
机构 * SberAI ; ITMO University(ITMO大学) ; MWS AI(MWS人工智能) ; T-Technologies ; Rostelecom ; Siberian Neuronets(西伯利亚神经网络) ; Skoltech ; Innopolis University(Innopolis大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 MERA Code是一个新的评估框架,专门用于评估代码生成模型在俄语中的实际编程能力,通过11个任务和8种编程语言,提供开源工具和评分系统,以提升代码生成模型的评估标准。
基于语义的优化方法用于修复大语言模型:代码生成的案例研究
机构 * Monash University(墨尔本大学) ; Technical University of Munich(慕尼黑技术大学) ; Chongqing University(重庆大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 本文提出STAR方法,通过基于语义的优化修复大语言模型,提升代码生成的准确性和效率。
Comments 13 pages, 6 figure, 8 tables, camera-ready version
机构 * Anonymous Authors(匿名作者)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.SE、cs.AI、cs.LG
Comments Under review at MLSys 2026
机构 * Apollo Applications Group Reston, VA, USA(Apollo Applications Group) ; University of Dhaka(达卡大学) ; Islamic University of Technology(伊斯兰科技大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.LG、cs.PL
Comments AACL-IJCNLP 2025 Workshop BLP Shared Task 2, 6 pages, 7 figures, 3 tables
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG
机构 * Concordia University(康科德大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
Comments Pre-print submitted for reviwer to TOSEM
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2025. 34 pages, 7 figures
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI