Optimisations for quadrature representations of finite element tensors through automated code generation
专题命中 代码生成 :code generation(title,abstract)
Journal ref ACM Trans. Math. Softw. 37, 1, Article 8 (January 2010), 23 pages
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 代码生成 :code generation(title,abstract)
Journal ref ACM Trans. Math. Softw. 37, 1, Article 8 (January 2010), 23 pages
专题命中 代码生成 :code generation(title,comments);分类 cs.SE、cs.LG
Comments Sebastian Haug: This paper, spanning 12 pages with 5 figures, presents my work on automated code generation and validation for STM32F407 microcontroller software components. Developed as part of a research project at Munich University of Applied Sciences and AGSOTEC GmbH, it leverages AST and RAG to streamline embedded development. Includes glossary and bibliography as supplementary materials
ArkEval: 对ArkTS自动代码修复的基准测试与评估
专题命中 代码生成 :code generation(abstract);program repair(abstract);repository(abstract);分类 cs.SE
AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。
Vero:AI智能体能否构建形式化验证的软件仓库?
机构 * University of Chicago(芝加哥大学) ; California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Amazon Web Services(亚马逊云计算服务) ; Apodex
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。
KOCO-BENCH: 大型语言模型能否在软件开发中利用领域知识?
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; School of Computer Science, Wuhan University(武汉大学计算机科学系)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 KOCO-BENCH旨在评估大型语言模型在软件开发中利用领域知识的能力,包含6个新兴领域、11个软件框架和25个项目,通过多粒度任务测试模型的知识获取与应用能力。
Comments Accepted by ACL 2026
GraphSkill: 基于文档的分层检索增强编码用于复杂图推理
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Michigan State University(密歇根州立大学)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 GraphSkill通过分层检索增强编码框架和自我调试代理,提升复杂图推理任务的准确性和效率。
Comments Under review
将学术与产业对齐:一项关于工业需求和学术能力的AI驱动软件工程实证研究
专题命中 代码生成 :code generation(abstract);code model(abstract);program repair(abstract);分类 cs.SE
AI总结 本文通过分析学术研究与工业需求的差距,揭示AI驱动软件工程中的关键挑战,旨在引导未来研究更贴近实际应用。
OSVBench:用于操作系统验证的大型语言模型规范生成基准测试
专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 OSVBench通过长上下文任务评估LLMs在操作系统验证中的规范生成能力,揭示现有模型在复杂代码生成任务中的性能差异。
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.LG
专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2024 camera-ready
何时思考:通过测试时间训练实现的自适应计算分配
机构 * Dongpae High School, Paju, Gyeonggi-do, Republic of Korea(京畿道帕久郡东垈高中)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.LG
AI总结 通过测试时间训练实现自适应计算分配,利用自监督重建损失选择性更新,提升代码语言建模性能
Comments 14 pages, 1 figure, 14 tables, code available at https://github.com/deveworld/ponderTTT
概率程序合成中的似然黑客行为
机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) ; University of Edinburgh, School of Informatics(爱丁堡大学信息学院) ; CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)
专题命中 代码生成 :program synthesis(title);分类 cs.LG、cs.PL
AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。
Journal ref Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence, PMLR 337:2744-2791, 2026
机器学习画布:关于为何策略比AI代码生成更重要的实证发现
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 本研究通过实证分析揭示了机器学习项目成功的关键因素,强调策略比AI代码生成更重要,提出了机器学习画布框架,指出组织支持、策略规划、流程管理和生态系统是决定项目成败的核心要素。
Comments Dataset available: https://ieee-dataport.org/documents/machine-learning-canvas-success-determinants
基于代码生成模型的高效代码嵌入
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Jina AI GmbH(Jina AI公司)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI
AI总结 研究提出jina-code-embeddings代码嵌入模型套件,采用文本与代码预训练的自回归主干及最后token池化,以较小规模实现最优性能,可用于代码检索、问答及相似代码识别。
Comments 9 pages. Accepted at the NeurIPS 2025 Workshop on Deep Learning for Code (DL4CODE)
基于大语言模型的流体系统仿真代码生成:模型与提示策略的基准测试
机构 * German Aerospace Centre (DLR)(德国航空航天中心) ; Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特应用技术大学)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.LG
AI总结 本研究通过系统比较10种大语言模型与6种提示策略,评估其将流体系统模型图表示转换为WNTR、Modelica代码的能力,为相关设计流程提供指导,同时指出仿真保真度仍存差距。
SpecFirst:将行为规范提取作为从零开始的基于智能体的程序合成中的一等步骤
专题命中 代码生成 :program synthesis(title);分类 cs.SE、cs.CL
AI总结 SpecFirst是将行为规范提取设为独立前置阶段的两阶段框架,在ProgramBench上显著提升了从零开始的程序合成的测试通过率与二进制探索覆盖率。
PennySynth:基于RAG的数据合成用于自动量子代码生成
机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) ; Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究所) ; Department of Computer Science and Engineering, NYU Tandon School of Engineering(计算机科学与工程系,纽约大学坦顿工程学院)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI
AI总结 提出PennySynth框架,通过检索增强生成和代码感知嵌入,利用13,389个PennyLane指令-代码对数据集,在QHack竞赛中实现52%-68%的pass@5,显著提升量子代码生成的结构有效性和功能正确性。
Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026
通过概念感知一致性学习提高大语言模型中的代码理解能力
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.PL
AI总结 研究针对大语言模型对基本编程概念理解浅的问题,引入结合概念感知调整的反事实代码增强框架,经多模型和基准综合评估,证明此方法能引导大语言模型增强概念理解,有效提升其在代码相关任务中的表现。
Comments To appear at IJCAI 2026
量子电路视觉:用于量子代码生成的视觉人工智能代理的成本感知评估
机构 * Amazon Web Services(亚马逊网络服务) ; Duke Kunshan University(杜克昆山大学)
专题命中 代码生成 :code generation(title);分类 cs.AI、cs.LG
AI总结 研究人工智能代理对量子电路图的理解及代码生成成本,提出量子电路视觉评估框架,构建基准并评估模型,发现中级模型在成本-准确性上平衡最佳,电路深度是失败主因,提出级联路由策略并开源数据集及代码。
BackendForge:使用后端服务对智能端到端代码生成进行基准测试
机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) ; SCS, Peking University(北京通明湖信息技术应用创新中心) ; Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) ; Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) ; Shanghai Institute of Systems for Open Computing
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。
从预训练或微调的大语言模型进行无奖励代码对齐:揭示代码生成中的权衡
机构 * York University Canada(加拿大约克大学)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 本研究通过实证分析,探讨了在代码生成任务中,对预训练或微调后的大语言模型进行无奖励对齐(DPO和BoNBoN)的效果,发现预训练到对齐的路径提升更大,但微调版本基线更高。
Journal ref The ACM International Conference on the Foundations of Software Engineering (FSE) 2026
推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究
机构 * TrendAI
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 本研究通过90次独立智能体运行构建同一应用,发现推理努力(从高到极高)将首试完美运行率从28%提升至89%,而测试工具虽增加成本却未改善功能得分或可靠性。
Comments 22 pages, 5 figures, 10 tables. Dataset and evaluation artifacts: https://doi.org/10.5281/zenodo.21134406
Animation2Code: 评估视频到代码生成中的时间视觉推理
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI
AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。
用程序合成解释注意力机制
机构 * NJIT(新泽西理工学院) ; MIT(麻省理工学院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 代码生成 :program synthesis(title);分类 cs.AI、cs.LG
AI总结 提出用可执行程序近似深度网络组件行为的方法,针对Transformer注意力头,通过生成Python程序再现注意力模式,实现可解释性。
HLS-Seek: 一种基于代理比较奖励强化学习的面向高质量结果的高层次综合代码生成
机构 * National University of Singapore(新加坡国立大学)
专题命中 代码生成 :code generation(title);分类 cs.AI、cs.LG
AI总结 HLS-Seek通过代理比较奖励强化学习方法,实现了高质量结果导向的高层次综合代码生成,其在语法正确性和功能准确性上超越了GPT-5.1等前沿模型,并在训练速度和QoR评估中表现出色。
通过提示工程实现多智能体代码生成的TDD治理
机构 * University of Jyväskylä(于韦斯屈莱大学) ; Tampere University(塔尔基尔大学)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 本文提出一种AI原生的TDD框架,通过结构化提示和工作流程治理机制将经典TDD原则形式化,提升LLM辅助开发的稳定性与可重复性。
Comments 5 pages. Submitted to the 1st International Workshop on Empirical Prompt Engineering for Software Engineering (PROMPT-SE 2026)
FormalScience: 基于代理代码生成的可扩展人类在环科学自动形式化
机构 * University of Manchester, UK(英国曼彻斯特大学) ; Idiap Research Institute, Switzerland(瑞士Idiap研究所) ; National Biomarker Centre, CRUK-MI, UK(英国国家生物标志物中心,CRUK-MI)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI
AI总结 FormalScience通过人类在环的代理流程,使非专业领域专家以低成本生成形式化证明,构建了包含200个大学物理问题及解决方案的FormalPhysics数据集,并探讨了现代LLM在自动形式化中的局限性。
Comments ACL 2026
从自然语言到验证代码:迈向借助Dafny基于形式验证的AI辅助问题到代码生成
机构 * Department of Computer Science, The University of Alabama(阿拉巴马大学计算机科学系) ; The University of Alabama(阿拉巴马大学) ; Alabama Water Institute, The University of Alabama(阿拉巴马水研究院,阿拉巴马大学)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 本文提出NL2VC-60数据集,通过分层提示策略评估不同LLM在形式验证中的表现,发现结构化提示和迭代反馈能显著提升验证成功率,证明开放权重LLM可用于高可靠软件开发。
Comments 16 pages
基于神经解释语言的梯度程序合成
机构 * AMLab, University of Amsterdam(阿姆斯特丹大学AMLab) ; Ndea ; Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) ; Alberta Machine Intelligence Institute (Amii), Edmonton, Canada(阿尔伯塔机器智能研究所(Amii),加拿大爱德蒙顿)
专题命中 代码生成 :program synthesis(title);分类 cs.AI、cs.LG
AI总结 本文提出神经语言解释器(NLI),通过端到端学习离散符号语言,结合梯度优化实现复杂程序合成,优于上下文学习和连续潜在程序网络。
Comments 26 pages, The International Conference on Learning Representations (ICLR)
RefineStat: 高效探索概率程序合成
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 代码生成 :program synthesis(title);分类 cs.LG、cs.PL
AI总结 RefineStat通过引入语言模型驱动框架,在概率程序合成中强制语义约束并应用诊断感知细化,提升生成程序的语法正确性和统计可靠性。
Comments RefineStat constrains LM decoding with statistical validity checks and uses diagnostic-guided resampling (priors/likelihoods) to transform small LMs' drafts into correct, reliable probabilistic programs that can match or surpass closed-source models
Journal ref ICLR 2026 (Oral)