arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1096 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2607.15205 2026-07-17 cs.SE cs.AI 新提交 81%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14340 2026-07-17 cs.SE cs.AI cs.CR 新提交 81%

The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK

验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件

Tobias Philipp

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13080 2026-07-16 cs.SE cs.AI 新提交 81%

Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

企业编码代理的推理经济学:云与本地大语言模型的案例研究

Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei Lee

机构 * PEGAVERSE Pegatron Corporation(PEGAVERSE 联合科技公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究企业编码代理中云与本地大语言模型的权衡,通过案例研究对比两者,发现提示缓存可大幅降低API成本,本地配置缺陷修复负担高,不同场景下各有成本优劣,混合路由网关在成本与质量间有平衡表现。

Comments 20 pages, 13 figures, 14 tables. Industrial longitudinal case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03525 2026-07-16 cs.SE cs.CL 版本更新 81%

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments

GameEngineBench:在真实C++运行时环境中评估编码智能体

Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal

机构 * Nitrode Nexon Intelligence Labs Dartmouth University(达特茅斯大学) Columbia University(哥伦比亚大学) Cornell University(康奈尔大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 研究利用GameEngineBench在虚幻引擎5项目中评估编码智能体,核心方法是构建来自九个真实游戏仓库的基准测试集,主要贡献是揭示智能体在实时交互软件的C++开发中面临挑战,凸显游戏引擎基准测试的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11565 2026-07-14 cs.LG cs.AI physics.flu-dyn 新提交 81%

Heuristic Learning for Active Flow Control Using Coding Agents

使用编码智能体的主动流动控制启发式学习

Paul Garnier, Jonathan Viquerat, Elie Hachem

机构 * Mines Paris - PSL University Centre for Material Forming (CEMEF) CNRS(巴黎矿业 - 巴黎文理研究大学材料成型中心(CEMEF)法国国家科学研究中心)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究主动流动控制中控制器设计难题,提出用编码智能体直接搜索显式可执行反馈律的启发式学习范式及受限协议,经多基准评估,其启发式控制器性能优、可解释,是传统强化学习的可靠互补替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09510 2026-07-13 cs.SE cs.AI 新提交 81%

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

失败作为一个过程:CLI编码代理轨迹剖析

Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究CLI编码代理失败轨迹,引入面向过程框架,收集并标注大量执行轨迹,发现失败多由认知错误驱动,起始于最初几步且常隐藏,提出提高编码代理可靠性需早期验证和干预,而非仅靠最终结果评估。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03968 2026-07-13 cs.SE cs.AI 新提交 81%

Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents

在聊天中被拒绝,用代码编写:IDE 编码代理中的工作流级越狱构造

Abhishek Kumar, Carsten Maple

机构 * The Alan Turing Institute(阿尔法·图灵研究院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究 IDE 编码代理安全评估问题,介绍工作流级越狱构造,通过对特定模型在不同基准测试下表现研究发现,对话拒绝基准可能高估其安全性,需跨多轮 IDE 工作流评估安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07946 2026-07-10 cs.SE cs.LG 新提交 81%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05188 2026-07-07 cs.LG cs.SE 新提交 81%

Latent Programming Horizons in Coding Agents

编码智能体中的潜在编程视界

André Silva, Han Tu, Martin Monperrus

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02911 2026-07-07 cs.SE cs.AI 新提交 81%

CoACT: Action-Preserving Observation Compression for Coding Agents

CoACT:用于编码智能体的动作保持观测压缩

Haorui Chen, Yuancheng Zhu, Yitong Zhang, Jia Li

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究编码智能体观测压缩问题,提出基于动作保持的CoACT方法,通过检查智能体下一个动作来筛选压缩候选,训练时用两种奖励过滤并选择候选,实验表明该方法能降成本且保持任务解决有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02389 2026-07-03 cs.AI cs.CR cs.SE 新提交 81%

Steerability via constraints: a substrate for scalable oversight of coding agents

通过约束实现可操控性:编码智能体可扩展监督的基础

Thomas Winninger

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出通过访问控制、网络策略和工具强制编码规范等传统工程管理方法约束编码智能体,以降低人类监督成本并提升安全性;实验表明约束基板使后门检测召回率从54.5%提升至90.9%。

Comments Accepted to the Deep Learning for Code Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01810 2026-07-03 cs.SE cs.AI 新提交 81%

Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS

解耦代码复杂度与新参与者参与度:AI编码代理在开源软件中采纳的因果研究

Weiwei Xu, Xuanning Cui, Hengzhi Ye, Minghui Zhou

机构 * School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education, China(教育部高可信软件技术重点实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过因果推断方法,研究AI编码代理(如Cursor和Claude Code)在开源项目中的采纳是否会导致新参与者减少,发现采纳后新参与者流入未显著下降,代码复杂度虽有增加但未影响新人参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01418 2026-07-03 cs.SE cs.AI cs.HC 新提交 81%

Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI

命令行AI编码代理的采用与影响:微软2026年初推出Claude Code和GitHub Copilot CLI的研究

Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究微软2026年初推出Claude Code和GitHub Copilot CLI时,数万名工程师的采用模式、留存因素及对代码合并的影响,发现社交网络驱动首次使用,编码活跃度关联留存,采用者合并PR数量增加约24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30560 2026-07-01 cs.LG cs.AI cs.PF 版本更新 81%

TraceLab: Characterizing Coding Agent Workloads for LLM Serving

TraceLab: 表征用于LLM服务的编码代理工作负载

Kan Zhu, Mathew Jacob, Chenxi Ma, Yi Pan, Stephanie Wang, Arvind Krishnamurthy, Baris Kasikci

机构 * University of Washington(华盛顿大学) Wuhan University of Technology(武汉理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 通过收集4300个编码代理会话(含35万LLM步骤和43万工具调用)的真实轨迹,分析发现长自主循环、长上下文短输出、多样化重尾工具调用及高但不完美前缀缓存命中率等特征,为优化服务提供具体方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 81%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26300 2026-06-26 cs.AI cs.CL 新提交 81%

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

验证地平线:编码智能体奖励没有银弹

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mingze Li, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu Wang, Yuheng Jing, Zeyao Ma, Zeyu Cui

机构 * Qwen Team(Qwen团队)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文指出,随着编码智能体能力增强,验证解决方案比生成更难,并沿可扩展性、忠实性和鲁棒性三个维度分析验证信号质量,通过四种奖励构建实验表明验证必须与生成器共同进化。

Comments Authors are listed alphabetically by their first names

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24453 2026-06-24 cs.AI cs.CL 新提交 81%

Bayesian control for coding agents

编码智能体的贝叶斯控制

Theodore Papamarkou, Vladislav Smirnov, Viktor Mazanov, Artem Vazhentsev, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * PolyShape National Technical University of Athens(雅典国家技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 将编码智能体的编排建模为成本敏感的序贯假设检验,贝叶斯控制器动态决策证据收集、候选优化、验证或停止,在昂贵验证下最有效,且信念状态提供可解释的正确性分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24429 2026-06-24 cs.SE cs.AI 新提交 81%

Detecting AI Coding Agents in Open Source: A Validated Multi-Method Census of 180 Million Repositories

检测开源中的AI编码代理:对1.8亿个仓库的多方法普查验证

Arsham Khosravani, Audris Mockus

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出多层面检测框架,整合配置扫描、提交消息分析等四种方法,发现单一信号低估AI代理活动达30倍,揭示不同检测渠道捕获的代理群体几乎不重叠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 81%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25764 2026-06-23 cs.SE cs.AI 版本更新 81%

Confident and Wrong: Silent Semantic Failures in Coding Agents

自信且错误:编码智能体中的无声语义失败

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI研究院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。

Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19613 2026-06-19 cs.SE cs.AI 新提交 81%

StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns

StaminaBench: 对编码智能体进行100轮交互的压力测试

Vlad Sobal, Shuo Yang, Yuting Zhang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出StaminaBench基准,通过100轮连续变更请求测试编码智能体的耐力,发现所有模型在5-6轮内失败,而测试反馈和重试机制可将通过轮数提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05013 2026-06-10 cs.SE cs.AI 81%

Scaling Coding Agents via Atomic Skills

通过原子技能扩大编码代理

Yue Liu

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出通过原子技能提升编码代理的新型方法,通过联合强化学习提升五个基础技能,从而提高复杂软件任务的泛化能力。

Comments We request standard withdrawal of this submission because significant errors were discovered in the data after submission, which affect the validity of the results. We may submit a corrected version later

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10842 2026-06-09 cs.SE cs.AI 版本更新 81%

Resilient Write: A Six-Layer Durable Write Surface for LLM Coding Agents

抗挫写入:一种六层耐用写入表面用于大语言模型编码代理

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperixlabs, Ghana(塞普里克斯实验室,加纳) Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(库马西技术大学,加纳) VIA Cybersecurity Lab, Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(VIA网络安全实验室,库马西技术大学,加纳)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出Resilient Write,通过六层耐用写入表面提升编码代理在文件写入时的容错能力,减少恢复时间并提高自我纠正率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05391 2026-06-05 cs.SE cs.AI 81%

Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents

实践中对智能体系统的人类监督:考察使用软件代理的开发者的监督工作、挑战与启发式方法

Shipi Dhanorkar, Samir Passi, Mihaela Vorvoreanu

机构 * Microsoft Redmond USA(微软红mond美国)

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过访谈17位经验丰富的开发者,探索人类对自主软件代理的监督实践,发现四种监督工作形式(先验控制、协同规划、实时监控、事后审查),并总结监督挑战与应对策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29442 2026-05-29 cs.SE cs.AI cs.HC 81%

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

编码助手如何辜负用户:基于20,574个真实会话的开发人员与智能体不一致的大规模分析

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li

机构 * University of Notre Dame(诺丁汉大学) Vanderbilt University(范德比大学) Google(谷歌)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过对20,574个编码助手会话的分析,识别出七种常见的不一致形式,发现大多数不一致导致信任成本而非系统损坏,且多数仍需用户显式纠正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11088 2026-05-29 cs.AI cs.CL 81%

Guardrails Beat Guidance: A Large-Scale Study of Rules, Skills, and Persistent Configuration for Coding Agents

护栏优于指导:关于编码智能体的规则、技能和持久配置的大规模研究

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 通过大规模实验发现,随机规则与专家规则对编码智能体性能提升相当,且有益规则均为负面约束,有害规则均为正面指令,提出应使用约束而非指导来配置智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28122 2026-05-28 cs.CR cs.AI cs.CL 81%

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

SNARE: 自适应场景合成以诱发编码代理中的过度行为

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang

机构 * Griffith University(格里菲斯大学) Quantstamp Nanyang Technological University(南洋理工大学) UNSW Sydney(悉尼大学) Wake Forest University(卫斯理大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SNARE流水线,通过组合良性场景片段并使用无评判器预言机评分与汤普森采样,自适应地诱发编码代理的过度行为,并在4×5代理-模型矩阵上评估,发现19.51%的良性运行触发过度行为,且代理框架比模型影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20251 2026-05-27 cs.SE cs.AI 81%

ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

ProcCtrlBench: 评估LLM编码智能体中的过程级缺陷与控制保持

Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

机构 * Amap, Alibaba Group(阿里云)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出ProcCtrlBench基准,通过可复用的缺陷本体和标准化轨迹表示,从过程证据而非仅最终结果评估LLM编码智能体的执行质量,并引入控制保持量化执行过程的可解释性、可中断性等属性。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18470 2026-05-25 cs.SE cs.AI cs.MA 81%

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios

SWE-EVO:在长周期软件演化场景中基准测试编码智能体

Tue Le, Minh V. T. Thai, Dung Nguyen Manh, Huy Phan Nhat, Nghi D. Q. Bui

机构 * FPT Software AI Center(FPT软件人工智能中心) School of Computing and Information Systems(计算与信息系统学院) University of Melbourne(墨尔本大学) Center of AI Research(人工智能研究中心) VinUniversity(文大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 针对现有基准测试仅关注孤立单任务问题,提出SWE-EVO基准,包含48个需跨多文件多步骤修改的长周期任务,实验显示当前智能体在此类任务上表现显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20086 2026-05-20 cs.NE cs.AI cs.LG 81%

What Do Evolutionary Coding Agents Evolve?

进化编码代理进化什么?

Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) Technical University of Berlin(柏林技术大学) Hong Kong Baptist University(香港 Baptist大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了进化编码代理在数学发现和算法设计中通过任务特定反馈生成、修改和选择代码的过程,通过EvoTrace数据集和EvoReplay方法分析了进化过程中的机制,发现大部分得分提升来自少数几种编辑类型,并发现存在确定性的循环模式。

Comments 28 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏