CGEMs: A Metric Model for Automatic Code Generation using GPT-3
专题命中 代码评测 :code generation(title,abstract);分类 cs.AI
Comments 11 pages, 6 figures, 2 tables
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 代码评测 :code generation(title,abstract);分类 cs.AI
Comments 11 pages, 6 figures, 2 tables
再试一次,不要回头:小型代码模型中盲重采样优于自我修复
专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI、cs.LG
AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。
Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent
AgentLens:用于编码智能体评估的生产评估轨迹审查
机构 * Explyt ; St. Petersburg Department of the Steklov Institute of Mathematics(圣彼得堡斯捷克洛夫数学研究所圣彼得堡分部) ; St. Petersburg State University(圣彼得堡国立大学)
专题命中 代码评测 :coding agent(title);分类 cs.SE、cs.AI、cs.LG
AI总结 介绍用于编码智能体评估的AgentLens基准,结合形式验证、大语言模型编写的轨迹审查和并排比较来评估智能体整个轨迹,不仅能排名,还可用于诊断模型行为、比较智能体版本及发现产品回归问题,且已开源。
编码智能体会欺骗我们吗?通过带随机测试的上限评估检测和防止作弊
机构 * The University of Tokyo(东京大学) ; RIKEN(理化学研究所)
专题命中 代码评测 :coding agent(title);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CapCode框架,通过设置上限评估检测模型在编码任务中的作弊行为,并设计CapReward奖励机制防止作弊,实验表明该方法能有效检测和减少作弊。
Omni-I2C:一个全面的图像到代码生成基准测试
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Independent Researcher(独立研究者) ; Xidian University(西安电子科技大学) ; Guangzhou University(广州大学)
专题命中 代码评测 :code generation(title,abstract)
AI总结 本文提出Omni-I2C基准测试,评估大多模态模型将复杂数字图形转化为可执行代码的能力,揭示当前模型在视觉感知与生成表达方面的协同挑战及性能差距。
Comments 35 pages, 26 figures, change authors' information in page 1
专题命中 代码评测 :program synthesis(title);分类 cs.SE、cs.LG、cs.PL
Comments 25 pages, 1 figure; data available at https://github.com/Beneficial-AI-Foundation/vericoding-benchmark
专题命中 代码评测 :repository(title,abstract)
Comments 10 pages, 5 figures
机构 * ServiceNow ; Mila ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; École de Technologie Supérieure (ETS)(高等技术学院) ; Polytechnique Montréal(蒙特利尔理工学院)
专题命中 代码评测 :code generation(title,abstract)
Comments This paper has been accepted to the EMNLP 2025 main conference. Check the project page here: https://webmmu-paper.github.io/
专题命中 代码评测 :code generation(title,abstract)
Comments This paper has been accepted for presentation at the 50th IEEE Conference on Local Computer Networks (LCN) - special track on Large Language Models and Networking
专题命中 代码评测 :code generation(title);分类 cs.SE、cs.CL、cs.AI
专题命中 代码评测 :code generation(title);分类 cs.CL、cs.AI、cs.LG
专题命中 代码评测 :repository(title,abstract)
弥合知识鸿沟:在推理时获取不熟悉编程语言以完成编码任务
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) ; National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学,中国)
专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ILA-agent框架,通过推理时动态交互获取不熟悉编程语言,提升编码任务性能。
SWE-Bench++: 一个从开源仓库生成可扩展软件工程基准的框架
机构 * Research & Development, Turing(研发与图灵)
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 SWE-Bench++通过自动化生成多语言软件工程基准,提升仓库级代码生成的评估与改进
专题命中 代码评测 :code generation(abstract);program synthesis(abstract);分类 cs.SE、cs.CL、cs.LG
用于基础设施即代码生成的智能语言模型的验证优先评估
专题命中 代码评测 :code generation(title);分类 cs.SE、cs.AI
AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。
Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2
SamatNext v0.2-B: 针对小型代码模型中课程保留的RMS归一化混合解码器的探索性研究
专题命中 代码评测 :code model(title);分类 cs.CL、cs.LG
AI总结 提出SamatNext v0.2-B混合解码器,在课程微调中通过RMS归一化和输出缩放校准交替使用差分注意力层与简化线性状态混合器,在Python代码课程上相比Transformer基线显著提升保留率,但长期早期阶段保留仍较弱。
Comments 12 pages, 3 tables. Technical report. Code and reproducibility artifacts: https://github.com/samat2003/samatnext-v0.1/tree/samatnext-v02-lsm-rmsnorm. v2 adds an AI-assisted software development disclosure; no changes to main results
基准的基准:解构影响与代码仓库质量在LLM安全基准中的作用
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) ; University of Waterloo(滑铁卢大学) ; Flexera(Flexera公司)
专题命中 代码评测 :repository(title);分类 cs.SE、cs.AI
AI总结 本文通过系统研究31个LLM安全基准及382篇非基准论文,发现仅39%的基准仓库可直接运行,且缺乏伦理考量。研究揭示社区采用基准与作者声望和代码运行性相关,但与代码质量无关,指出安全基准可能存在安全隐患和不可比性问题。
Comments 24 pages. 19 figures
TimeMachine-bench:一个评估仓库级迁移任务模型能力的基准
机构 * Tohoku University(东大理工大学) ; Future Corporation(未来公司) ; RIKEN(日本理化学研究所) ; NII LLMC(国家信息研究所LLMC)
专题命中 代码评测 :repository(title);分类 cs.SE、cs.CL
AI总结 本文提出TimeMachine-bench基准,用于评估软件迁移任务中的模型能力,通过自动化构建GitHub仓库测试失败数据集,评估基于11种模型的基线方法,发现LLM在迁移任务中仍存在可靠性挑战。
Comments Accepted to EACL 2026 Main, camera-ready
Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8233-8264, 2026
机构 * Knowledgeverse AI(知识verse AI)
专题命中 代码评测 :code generation(title);分类 cs.CL、cs.AI
Comments Accepted to the SDProc Workshop @ ACL 2025
Journal ref Proceedings of the Fifth Workshop on Scholarly Document Processing (SDP 2025), pages 7-16, 2025
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; The Ohio State University(俄亥根州立大学)
专题命中 代码评测 :code generation(title);分类 cs.SE、cs.AI
Comments 34 pages, 8 figures
Journal ref Transactions in GIS, 2025
专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI
Comments ICSE 2023
专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI
Comments accepted by ICSE'23-NIER
专题命中 代码评测 :code model(title);分类 cs.LG、cs.PL
FormulaCode: 评估在大规模代码库上进行代理优化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; California Institute of Technology(加州理工学院) ; Cornell University(康奈尔大学)
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。
Comments ICML Camera Ready Version
CodeTaste:LLM能否生成人类级别的代码重构?
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。
EVALOOOP:一种以自一致性为中心的大型语言模型编程鲁棒性评估框架
机构 * North Carolina State University(北卡罗来纳州立大学)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 EVALOOOP通过自一致性反馈循环评估LLM在编程任务中的鲁棒性,利用ASL度量揭示模型在持续自指代转换中的语义保持能力。
Comments 27 pages, 7 figures
ABC-Bench: 评估现实世界开发中自主后端编码的基准测试
机构 * Fudan University(复旦大学) ; Shanghai Qiji Zhifeng Co., Ltd.(上海启济智风有限公司) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 ABC-Bench是一个评估自主后端编码在真实可执行工作流中性能的基准测试,通过224个实际任务揭示了当前模型在复杂后端工程任务中的不足。
通过LLM代理的受限拓扑规划实现可靠的机器学习特征工程
机构 * Meta Menlo Park, CA(Meta 洛杉矶公园分校) ; JPMorgan Chase & Co.(摩根大通公司)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于LLM代理的受限拓扑规划框架,通过多步骤生成代码提升特征工程的可靠性与效率,实验显示在数据集和实际应用中均取得显著改进。
机构 * Singapore Management University(新加坡国立管理学院) ; DGIST(韩国高等智能科学研究院) ; Monash University(墨尔本大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Huawei Software Engineering Application Technology Lab(华为软件工程应用技术实验室) ; Zhejiang University(浙江大学)
专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI
Comments 13 pages