BeSpec: Behavior-Level Specification Alignment for Code Generation
BeSpec:用于代码生成的行为级规范对齐
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
BeSpec:用于代码生成的行为级规范对齐
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。
ClarifyCodeBench: 评估大语言模型在代码生成中澄清模糊需求的能力
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 提出ClarifyCodeBench基准,通过人工标注的模糊需求、澄清问题和指标,评估LLMs主动澄清需求的能力,发现代码生成能力与需求澄清能力脱钩,且多模糊场景下性能下降。
AxDafny: Dafny中的智能验证代码生成
机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。
无资源、无基准、无问题?评估和改进无资源语言的代码生成大语言模型
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究无资源语言(LLM未见训练数据的语言)的代码生成问题,通过构建三个基准并实验提示技术、预训练和微调方法,提出权重差异迁移方法提升性能。
Comments Accepted for publication at IEEE Transactions on Software Engineering
SPARK: 基于安全知识引导与表示激活的LLM安全代码生成
机构 * Radboud University(拉德堡德大学) ; University of Bristol(布里斯托大学) ; University of Zagreb(扎格雷布大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。
EstRTL:功能估计引导的RTL代码生成
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Defense Innovation Institute, Academy of Military Science (AMS)(军事科学院创新院) ; School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) ; Key Laboratory of Advanced Microprocessor Chips and Systems, Changsha, China, and College of Computer Science and Technology, National University of Defense Technology, Changsha, China(先进微处理器芯片与系统重点实验室,长沙,中国,和国防科技大学计算机科学与技术学院,长沙,中国) ; Defense Innovation Institute, AMS, Beijing, China and Qiyuan Lab, Beijing, China(军事科学院创新院,北京,中国和启元实验室,北京,中国)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出EstRTL框架,通过静态功能评分估计,结合生成、评估和修正三阶段范式,提升LLM生成RTL代码的功能正确性,在通用LLM上正确率提升3.2%-9.0%。
SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。
剔除低效:用于高效代码生成的结构骨架监督
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出EffiSkel框架,通过提取和学习效率骨架,提升代码生成的效率与正确性,实验显示在多个编程语言和基准上均取得显著提升。
CLOSER-Bench:评估硬件代理的预算跨阶段设计封闭性
专题命中 代码生成 :code generation(abstract);repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究硬件代理跨阶段设计封闭性评估难题,提出CLOSER-Bench协议,通过配对任务记录调用,测量多方面指标。经试点和验证揭示差距,构建加速器,促使将硬件封闭视为预算顺序决策问题。
Comments 6 pages, 2 figures, 4 tables
生成式AI在统计研究中的应用:文献综述与代码生成案例研究
专题命中 代码生成 :code generation(title,abstract)
AI总结 本研究通过案例研究分析了ChatGPT-5和ScholarAI在统计研究的文献综述与代码生成中的应用,发现其需专业人员提示监督,可作为研究工具但无法替代专业方法论知识。
长期记忆中的不安全编码偏好:基于大语言模型的代码生成的安全风险
专题命中 代码生成 :code generation(title,abstract)
AI总结 研究基于LLM的代码生成中,长期记忆里不安全编码偏好带来的安全风险,通过评估四种LLM在五种编程语言上的表现,发现其显著增加生成漏洞代码风险及存在警告差距,还评估了三种缓解策略并给出改进安全性的建议。
Comments Accepted to the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)
AlgoBench: 代码生成中算法适配的基准测试
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI、cs.PL
AI总结 提出AlgoBench框架,通过结构化约束变换自动生成新算法问题,并引入复杂度感知指标评估模型适配能力,实验发现LLM在算法适配中性能显著下降。
Comments Under Review
UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 代码生成 :code generation(title,abstract)
AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。
受治理的AI辅助工程:受监管领域中代理代码生成的渐进式人工监督
专题命中 代码生成 :code generation(title,abstract)
AI总结 针对受监管行业中代理AI编码系统的治理挑战,提出GAIE框架,通过三级渐进式人工监督模型(人机协同、人机监控、自动监控)平衡编码速度与合规性,在保留91%编码速度的同时确保监管证据覆盖。
代码不仅仅是文本:代码生成的不确定性估计
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Cambridge(剑桥大学)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.CL、cs.LG
AI总结 针对代码生成中错误程序的可靠性问题,提出基于词法、算法和功能三个正交轴的不确定性估计方法,在五个代码LLM上将AUROC提升8.1个百分点。
PrivCode++: 潜在条件差分隐私代码生成以实现全面保障
专题命中 代码生成 :code generation(title,abstract)
AI总结 针对指令-代码对微调的大语言模型可能泄露敏感数据的问题,提出PrivCode-Plus,首个在微调中同时保护提示和代码的差分隐私代码生成方法,通过两阶段DP框架和无隐私潜在条件模块实现高效合成。
Comments Accepted at ICML 2026
Vero:AI智能体能否构建形式化验证的软件仓库?
机构 * University of Chicago(芝加哥大学) ; California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Amazon Web Services(亚马逊云计算服务) ; Apodex
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。
基于大语言模型的流体系统仿真代码生成:模型与提示策略的基准测试
机构 * German Aerospace Centre (DLR)(德国航空航天中心) ; Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特应用技术大学)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.LG
AI总结 本研究通过系统比较10种大语言模型与6种提示策略,评估其将流体系统模型图表示转换为WNTR、Modelica代码的能力,为相关设计流程提供指导,同时指出仿真保真度仍存差距。
SpecFirst:将行为规范提取作为从零开始的基于智能体的程序合成中的一等步骤
专题命中 代码生成 :program synthesis(title);分类 cs.SE、cs.CL
AI总结 SpecFirst是将行为规范提取设为独立前置阶段的两阶段框架,在ProgramBench上显著提升了从零开始的程序合成的测试通过率与二进制探索覆盖率。
BackendForge:使用后端服务对智能端到端代码生成进行基准测试
机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) ; SCS, Peking University(北京通明湖信息技术应用创新中心) ; Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) ; Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) ; Shanghai Institute of Systems for Open Computing
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。
推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究
机构 * TrendAI
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 本研究通过90次独立智能体运行构建同一应用,发现推理努力(从高到极高)将首试完美运行率从28%提升至89%,而测试工具虽增加成本却未改善功能得分或可靠性。
Comments 22 pages, 5 figures, 10 tables. Dataset and evaluation artifacts: https://doi.org/10.5281/zenodo.21134406
用程序合成解释注意力机制
机构 * NJIT(新泽西理工学院) ; MIT(麻省理工学院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 代码生成 :program synthesis(title);分类 cs.AI、cs.LG
AI总结 提出用可执行程序近似深度网络组件行为的方法,针对Transformer注意力头,通过生成Python程序再现注意力模式,实现可解释性。
SemaPLC:一种基于项目、经验证门控的PLC代码生成智能体框架
专题命中 代码生成 :code generation(title);分类 cs.SE
AI总结 SemaPLC是基于项目、经验证门控的PLC代码生成智能体框架,通过外部检查确认任务完成,在多模型的POU任务及项目上下文任务中均表现最优,动态行为测试得分显著高于基线。
Drawing-Recode:基于栅格2D CAD图纸的参数化CAD代码生成的标注定位方法
专题命中 代码生成 :code generation(title);分类 cs.AI
AI总结 Drawing-Recode是一种从栅格2D CAD图纸生成参数化CAD代码的框架,通过图像编码器、文本识别模块、交叉注意力与AGL实现标注定位,性能优于基线且对工业扫描图纸鲁棒,可助力制造自动化。
ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架
机构 * Columbia University(哥伦比亚大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Northeastern University(东北大学)
专题命中 代码生成 :program synthesis(title);分类 cs.AI
AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。
从失败到通过:为大语言模型代码生成演化自然语言提示优化规则
专题命中 代码生成 :code generation(title);分类 cs.SE
AI总结 研究大语言模型提示敏感性,用搜索法演化自然语言转换规则,提出DUALFIX管道,结合规则与执行反馈修复,可跨问题跨模型使用,提升代码生成性能。
保护AI生成代码:一种即时漏洞检测与修复流水线
专题命中 代码生成 :code generation(abstract,abstract_cn);分类 cs.SE、cs.AI
AI总结 本文提出一种自动化安全评估流水线,可检测、修复AI生成代码的漏洞,在Claude的4种模型上评估发现,P2配置表现优于P1,Sonnet 4.6的修复效果最佳,且流水线有效性与初稿安全性不同。
Comments 7 pages, 8 tables, 2 figures. Georgia Institute of Technology Master's final practicum project. Code: https://github.com/Droidsurikov/securing-ai-generated-code
SiriusDeliver:腾讯的数据仓库交付自动化方案
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.AI
AI总结 腾讯提出SiriusDeliver端到端交付自动化智能体,集成三类组件,经离线实验和腾讯云WeData大规模部署验证,可显著提升DW交付的成功率、效率,缩短交付时间与工程师工作量。
Comments 13 pages, 13 figures, 3 tables. Under submission
关于LLM生成的代码和注释在代码仓库中的探索性研究
机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 本研究通过检测工具分析2021-2025年公司和社区维护的仓库,发现LLM生成的代码随时间减少且多出现在测试用例中,注释则相对稳定;公司仓库中LLM生成内容比例更高,且仅少数人工标记的bug与LLM生成代码相关。
Comments Accepted to The Journal of Systems & Software (JSS) on 1 July 2026
PrintAnything:学习用于3D打印G-code生成的中间表示
机构 * IPAI, Seoul National University(首尔大学 IPAI) ; Seoul National University(首尔大学) ; Soongsil University(崇实大学) ; Kairoba Inc.(Kairoba公司)
专题命中 代码生成 :code generation(title)
AI总结 PrintAnything框架无需网格重建,通过切片式点投影策略和G-plan图,直接从点云生成可执行3D打印G-code,实现无网格的实用3D打印流程。
Comments European Conference on Computer Vision (ECCV) 2026