Automated Table Reproduction via Code Generation
Artisan: 自动化代理评估
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。
Comments Accepted at ASE 2026
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
Artisan: 自动化代理评估
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。
Comments Accepted at ASE 2026
更好地调用Grep:评估和改进用于仓库级代码补全的类Grep词汇检索方法
专题命中 代码生成 :repository(title,abstract);分类 cs.SE
AI总结 本文评估改进类Grep词汇检索,提出Naive GrepRAG基线,又结合后处理流水线的GrepRAG在代码补全任务上优于SOTA,为轻量检索支撑仓库级代码补全提供方案。
Comments ISSTA2026
MoT:用于有效代码生成的思维模块化提示
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。
ACES: 谁测试测试?留一法AUC一致性用于代码生成
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 本文提出ACES方法,通过留一法AUC评估测试区分正确与错误代码的能力,解决测试正确性判断的循环依赖问题,实现代码生成的高精度筛选。
Comments 32 pages, 14 figures, 9 tables
基于程序合成的张量网络结构搜索
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.PL
AI总结 本文提出将张量网络结构搜索视为程序合成问题,通过约束基于评估方法和输出导向分割操作,提升搜索效率并实现更好的压缩比。
面向竞争性代码生成的迭代测试与修复框架
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 FixAudit通过迭代测试与修复循环改进代码生成,通过共享模型和专门角色联合训练,提升代码质量与测试覆盖率。
令人惊讶的简单自蒸馏方法提升代码生成能力
机构 * Apple(苹果公司)
专题命中 代码生成 :code generation(title,abstract);分类 cs.CL
AI总结 提出简单自蒸馏(SSD)方法,仅利用模型自身输出进行微调,无需验证器或强化学习,显著提升代码生成性能,并揭示其通过重塑token分布解决精度-探索冲突的机制。
HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Xi’an Jiaotong University(西安交通大学) ; Nanjing University(南京大学) ; ZTE Corporation(中兴通讯)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。
图表规范:用于促进VLM在图表到代码生成中推理的结构表示
机构 * Waseda University(早稻田大学) ; University of Science and Technology of China(中国科学技术大学) ; NanKai University(南开大学)
专题命中 代码生成 :code generation(title,abstract)
AI总结 本文提出图表规范,通过结构化中间表示提升VLM在图表到代码生成中的结构保真度,实验显示其在数据效率和性能上优于现有方法。
Comments Accepted by Neurocomputing
自动推导合一算法:演绎程序合成的一个案例研究
专题命中 代码生成 :program synthesis(title,abstract)
AI总结 该研究聚焦于合一算法的自动推导,以演绎程序合成方式,将编程视为定理证明任务。通过推广和自动化手动证明,新程序能依给定环境替换合一符号表达式,确定输出替换,还能处理不可合一情况,且怀疑带环境的算法更易自动合成。
Comments 92 pages
Journal ref Journal of Symbolic Computation, January-February 2027
SecureCode:用于训练安全意识代码生成模型的生产级多轮数据集
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对AI编码助手生成漏洞代码问题,提出SecureCode数据集,涵盖网络应用安全和AI/ML安全领域,有特定对话结构,经质量保证,发布统一数据集、开源模型及评估框架,是首个提供相关覆盖的公共数据集。
Comments 30 pages, 12 figures, 10 tables. Dataset available at https://huggingface.co/datasets/scthornton/securecode. Code and validation tools at https://github.com/scthornton/securecode
UI2Code^N: 将UI到代码生成视为交互式视觉优化
机构 * Zhejiang University(浙江大学)
专题命中 代码生成 :code generation(title,abstract)
AI总结 提出将UI截图转代码任务重构为交互式视觉优化问题,采用基于偏好的强化学习方法RVPO优化视觉排名,在UI起草、润色和编辑任务上达到SOTA。
Comments 27 pages
CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化
机构 * Nanjing University(南京大学) ; LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) ; East China Normal University(华东师范大学) ; Nanjing University of Science and Technology(南京理工大学) ; Central South University(中南大学)
专题命中 代码生成 :code generation(title,abstract)
AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。
Comments Accepted to ACL 2026 Main
ArkEval: 对ArkTS自动代码修复的基准测试与评估
专题命中 代码生成 :code generation(abstract);program repair(abstract);repository(abstract);分类 cs.SE
AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。
概率程序合成中的似然黑客行为
机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) ; University of Edinburgh, School of Informatics(爱丁堡大学信息学院) ; CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)
专题命中 代码生成 :program synthesis(title);分类 cs.LG、cs.PL
AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。
Journal ref Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence, PMLR 337:2744-2791, 2026
基于代码生成模型的高效代码嵌入
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Jina AI GmbH(Jina AI公司)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI
AI总结 研究提出jina-code-embeddings代码嵌入模型套件,采用文本与代码预训练的自回归主干及最后token池化,以较小规模实现最优性能,可用于代码检索、问答及相似代码识别。
Comments 9 pages. Accepted at the NeurIPS 2025 Workshop on Deep Learning for Code (DL4CODE)
PennySynth:基于RAG的数据合成用于自动量子代码生成
机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) ; Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究所) ; Department of Computer Science and Engineering, NYU Tandon School of Engineering(计算机科学与工程系,纽约大学坦顿工程学院)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI
AI总结 提出PennySynth框架,通过检索增强生成和代码感知嵌入,利用13,389个PennyLane指令-代码对数据集,在QHack竞赛中实现52%-68%的pass@5,显著提升量子代码生成的结构有效性和功能正确性。
Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026
通过概念感知一致性学习提高大语言模型中的代码理解能力
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.PL
AI总结 研究针对大语言模型对基本编程概念理解浅的问题,引入结合概念感知调整的反事实代码增强框架,经多模型和基准综合评估,证明此方法能引导大语言模型增强概念理解,有效提升其在代码相关任务中的表现。
Comments To appear at IJCAI 2026
从预训练或微调的大语言模型进行无奖励代码对齐:揭示代码生成中的权衡
机构 * York University Canada(加拿大约克大学)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI
AI总结 本研究通过实证分析,探讨了在代码生成任务中,对预训练或微调后的大语言模型进行无奖励对齐(DPO和BoNBoN)的效果,发现预训练到对齐的路径提升更大,但微调版本基线更高。
Journal ref The ACM International Conference on the Foundations of Software Engineering (FSE) 2026
SEA-TS:面向时间序列预测算法自主代码生成的自我进化智能体
机构 * Ecoflow Inc.(Ecoflow公司)
专题命中 代码生成 :code generation(title);分类 cs.AI
AI总结 提出SEA-TS框架,通过度量优势MCTS、代码审查与运行提示优化、全局可引导推理三大机制,自主迭代生成、验证和优化时间序列预测算法代码,在四个数据集上优于TimeMixer等基线。
面向非专家用户的定制化拥塞控制:基于大语言模型的CCA代码生成与eBPF部署
机构 * School of Computing, University of Nebraska-Lincoln(内布拉斯加大学林肯分校计算机学院)
专题命中 代码生成 :code generation(title);分类 cs.LG
AI总结 提出NECC框架,利用大语言模型和eBPF接口,使非专家用户能轻松建模、实现和部署定制化拥塞控制算法,首次解决定制化CCA实现问题。
Comments Accepted manuscript (AAM) of IEEE ICC 2025 paper. DOI: 10.1109/ICC52391.2025.11160790
Journal ref Proc. IEEE International Conference on Communications (ICC), 2025
基于大语言模型的、由规范引导的无死锁通信协议精化合成
专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.SE、cs.AI
AI总结 该研究提出Syntropy框架,结合多方会话类型规范与大语言模型合成无死锁通信协议精化,经评估其有效性达95.6%-99.5%,可生成多样且语法正确的协议精化方案。
从混合量词属性中递归程序合成
专题命中 代码生成 :program synthesis(title)
AI总结 本文提出了一种基于反例引导和预防性剪枝的递归程序合成方法,通过斯科伦化将混合量词问题转化为$\forall^*$-合成问题,提升合成效率。
对软件工程任务中投机解码的实证研究
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。
Comments Accepted by ISSTA 2026
像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代品
机构 * Amazon(亚马逊) ; Siemens(西门子) ; University of Minnesota(明尼苏达大学)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.LG
AI总结 提出KernelPro闭环多智能体系统,通过LLM代码生成与硬件剖析反馈及可插拔瓶颈检测工具迭代优化GPU内核,在KernelBench上实现2.42x/4.69x/5.30x加速比,并首次兼顾能效优化。
通过强化学习学习检测用户界面原则违规
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.CL
AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。
RIDGE:一个用于验证和发现大语言模型生成的期权定价方法的自主框架
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 针对大语言模型生成的期权定价实现,介绍自主验证框架RIDGE,通过多种测试和检查优化定价实现与验证方法,应用于五个随机波动率模型,消除缺陷并带来新定价方法。
Comments 33 pages
代理心理测量:在代理编码基准中的任务级性能预测
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Fulcrum ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。
EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) ; Alibaba Group(阿里巴巴集团) ; SUAT(深圳大学)
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。
代码相关任务中的参数高效多任务微调
专题命中 代码生成 :code generation(abstract);code model(abstract);分类 cs.SE
AI总结 研究多任务QLoRA微调在代码生成、翻译和总结中的效果,发现其在1.5B、3B和7B规模上达到或优于单任务QLoRA和全微调,大模型平衡正确性与质量更佳。