arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1096 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2606.11447 2026-06-11 cs.CL 新提交 79%

AI Coding Agents Can Reproduce Social Science Findings

AI编码智能体能够复现社会科学研究结果

Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi, Atoosa Kasirzadeh, Joshua Tucker

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 本研究构建SocSci-Repro-Bench基准测试,评估Claude Code和Codex两个前沿编码智能体在221项社会科学任务中的复现能力,发现它们能复现大部分结果,且Claude Code表现更优,同时提示框架会影响确认性规范搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10933 2026-06-10 cs.AI 新提交 79%

Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages

前沿编码代理使用元编程适应不熟悉的编程语言

Aman Sharma, Sushrut Thorat, Paras Chopra

机构 * Lossfunk

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究评估LLM编码代理在陌生语言上的表现,发现强代理通过元编程(如用Python生成目标语言代码)适应,禁止此策略性能大幅下降,而弱代理无法从中受益。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09801 2026-06-10 cs.AI 版本更新 79%

How can we assess human-agent interactions? Case studies in software agent design

如何评估人机交互?软件代理设计案例研究

Valerie Chen, Rohit Malhotra, Xingyao Wang, Juan Michelini, Xuhui Zhou, Aditya Bharat Soni, Hoang H. Tran, Calvin Smith, Ameet Talwalkar, Graham Neubig

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :software agent(title,abstract);分类 cs.AI

AI总结 提出PULSE框架,通过用户反馈和模型预测结合评估人机交互,在15k用户实验中验证其能减少40%置信区间,并揭示基准测试与真实结果的差异。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05138 2026-06-09 cs.AI 版本更新 79%

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

可执行世界模型在编码智能体时代的ARC-AGI-3应用

Sergey Rodionov

机构 * SingularityNET

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。

Comments 13 pages. Accepted for publication at AGI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07448 2026-06-08 cs.SE 新提交 79%

Agentic Very Much! Adoption of Coding Agent in New GitHub Projects

Agentic Very Much! 新GitHub项目中编码助手的采用

Romain Robbes, Théo Matricon, Thomas Degueule, Andre Hora, Stefano Zacchiroli

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究新创建的GitHub项目中编码助手的采用情况,发现采用率是之前研究的两倍以上,且AI辅助提交比例显著更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-06-02 cs.SE cs.CR 79%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00579 2026-06-02 cs.CL cs.CV 79%

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

沙盒化编码智能体是竞争性的全模态任务求解器

Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) MBZUAI

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 本文提出沙盒化编码智能体,仅通过文本+图像访问和工具使用,即可在全模态任务中匹配甚至超越原生全模态模型,并通过技能注入和训练配方Code-X进一步提升性能。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25430 2026-05-26 cs.AI 79%

CODESKILL: Learning Self-Evolving Skills for Coding Agents

CODESKILL:学习自进化技能的编码智能体

Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出CODESKILL框架,通过强化学习从编码智能体轨迹中提取多粒度程序性技能并维护技能库,提升下游任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23647 2026-05-26 cs.SE 79%

SGAgent: Suggestion-Guided LLM-Based Multi-Agent Framework for Repository-Level Software Repair

SGAgent:基于建议引导的LLM多智能体框架用于仓库级软件修复

Quanjun Zhang, Chengyu Gao, Yu Han, Ye Shang, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE

AI总结 提出SGAgent框架,通过引入建议阶段(localize-suggest-fix范式)和知识图谱工具,增强从定位到修复的推理,在SWE-Bench-Lite上达到51.3%修复准确率。

Comments Accepted to ACM Transactions on Software Engineering and Methodology (TOSEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24110 2026-05-26 cs.AI 79%

EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions

EvoCode-Bench:评估多轮迭代交互中的编码智能体

Haiyang Shen, Xuanzhong Chen, Wendong Xu, Yun Ma, Liang Chen, Kuan Li

机构 * UniPat AI Peking University(北京大学) Tsinghua University(清华大学) HKU(香港大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出EvoCode-Bench基准,通过多轮状态化任务和累积测试评估编码智能体在需求变化下维持代码库工作的能力,发现多轮指标远低于单轮指标,且最强智能体多轮成功率仅约50%。

Comments Work in Progress; 32 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22526 2026-05-22 cs.SE 79%

"Refactoring Runaway": Understanding and Mitigating Tangled Refactorings in Coding Agents for Issue Resolution

重构失控:理解并缓解编码代理中交织的重构

Zhao Tian, Zifan Zhang, Tao Xiao, Dong Wang, Masanari Kondo, Junjie Chen, Yasutaka Kamei

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文研究了编码代理在问题解决中交织重构的现象,通过实证分析发现代理重构的频率和强度低于人类开发者,提出了一种重构感知的精炼方法以提高编译性并解决未解决的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18854 2026-05-20 cs.LG 79%

Evaluating Memory Condensation Strategies for Coding Agents in Data-Driven Scientific Discovery

评估用于数据驱动科学发现的编码代理的记忆压缩策略

Renuka Chintalapati, Sid Raskar, Anurag Acharya, Jared Willard, Patrick Emami, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) National Laboratory of the Rockies(落基山国家实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG

AI总结 本文评估了八种记忆压缩策略在数据驱动科学发现任务中的表现,发现没有压缩器显著提升假设质量,但基于LLM的压缩器会增加24-94%的token成本,而屏蔽工具调用输出可实现8.6%的净节省,且最佳压缩器因科学领域和任务长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14859 2026-05-18 cs.CR cs.AI 79%

Do Coding Agents Understand Least-Privilege Authorization?

编码代理是否理解最小特权授权?

Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu

机构 * Evolvent AI Research Team(Evolvent AI研究院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究编码代理是否能自主推断最小特权授权边界,提出Sufficiency-Tightness Decomposition方法,提升敏感任务成功率并降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09423 2026-05-14 cs.AI 79%

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning

SimWorld Studio:基于进化编码代理的自动环境生成用于具身学习

Haoqiang Kang, Xiaokang Ye, Yuhan Liu, Siddhant Hitesh Mantri, Lingjun Mao, James Fleming, Drishti Regmi, Lianhui Qin

机构 * UC San Diego(加州大学圣迭戈分校) New York University(纽约大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文提出SimWorld Studio平台,通过进化编码代理生成动态3D环境,提升具身学习性能。环境生成与学习相互促进,使代理在未见基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08017 2026-05-14 cs.SE 79%

Collaborator or Assistant? How AI Coding Agents Partition Work Across Pull Request Lifecycles

合作者还是助手?AI编码代理如何在拉取请求生命周期中分配工作

Young Jo, Chung, Safwat Hassan

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文研究AI编码代理在拉取请求生命周期中如何分配工作,通过分析工具的协作-助手光谱,探讨操作权与合并治理的分离,提出分类学、状态机和可重复实验包。

Comments 10 pages, 8 figures, AIWare 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08927 2026-05-12 cs.PL 79%

Quantitative Comparison of Credible Compilation and Verification In Coding Agent Compiler Development

代码代理编译器开发中可信编译与验证的定量比较

Martin Rinard

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.PL

AI总结 本文通过首个由人类监督的验证编译器,比较了可信编译与验证两种编译验证方法的效率,发现验证需要更多开发工作量,且验证优化选择更不高效的算法,证书检查时间占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07769 2026-05-11 cs.SE 79%

Coding Agents Don't Know When to Act

编码代理不知何时行动

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究发现当前编码代理在处理过时bug报告时频繁错误修改代码,提出需显式引导无行动以避免技术债务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11045 2026-04-14 cs.SE 79%

Sema Code: Decoupling AI Coding Agents into Programmable, Embeddable Infrastructure

Sema Code: 将AI编码代理解耦为可编程、可嵌入的基础设施

Huacan Wang, Jie Zhou, Ningyan Zhu, Shuo Zhang, Feiyu Chen, Jiarou Wu, Ge Chen, Chen Liu, Wangyi Chen, Xiaofeng Mou, Yi Xu

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 Sema Code通过解耦核心代理引擎与客户端层,提供可嵌入的AI编码框架,解决企业跨异构环境复用能力的挑战,其核心机制包括多租户隔离、异步权限控制等,支持多种产品形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09805 2026-04-14 cs.SE 79%

Building an Internal Coding Agent at Zup: Lessons and Open Questions

在Zup构建内部编码代理:经验与开放问题

Gustavo Pinto, Pedro Eduardo de Paula Naves, Ana Paula Camargo, Marselle Silva

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究探讨了构建内部编码代理时原型性能与生产准备之间的差距,指出工具设计、安全控制等工程决策比模型质量更重要,通过CodeGen案例展示改进方法和人类监督模式对代理可靠性和采用的影响。

Comments 9 Paginas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09409 2026-04-13 cs.SE 79%

Do AI Coding Agents Log Like Humans? An Empirical Study

AI 编程代理是否像人类一样记录日志?一项实证研究

Youssef Esseddiq Ouatiti, Mohammed Sayagh, Hao Li, Ahmed E. Hassan

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究通过分析4550个代理拉取请求,发现代理在58.4%的仓库中更改日志频率低于人类,但日志密度更高。明确的日志指令稀缺且无效,人类在72.5%的情况下修复日志问题,表明自然语言指令存在不足,需引入确定性限制以确保一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18341 2026-04-09 cs.SE 79%

Agentic Much? Adoption of Coding Agents on GitHub

代理那么多?GitHub上编码代理的采用情况

Romain Robbes, Théo Matricon, Thomas Degueule, Andre Hora, Stefano Zacchiroli

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究探讨了编码代理在GitHub上的采用情况,发现其采用率高达22.20%-28.66%,且在项目成熟度、组织类型和编程语言上均广泛适用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04580 2026-04-07 cs.SE 79%

Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints

超越固定测试:仓库级问题解决作为代码和行为约束的共进化

Kefan Li, Yuan Yuan, Mengfei Wang, Shihao Zheng, Wei Wang, Ping Yang, Mu Li, Weifeng Lv

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE

AI总结 本文提出Agent-CoEvo框架,通过共进化代码与行为约束提升修复效果,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02547 2026-04-06 cs.SE 79%

Beyond Resolution Rates: Behavioral Drivers of Coding Agent Success and Failure

超越分辨率率:编码代理成功与失败的行为驱动因素

Tural Mehtiyev, Wesley Assunção

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文通过大规模实证研究分析了9374条轨迹,探讨了编码代理在特定任务中失败的原因,发现行为模式和LLM能力对成功与失败有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24119 2026-03-26 cs.SE 79%

Enhancing and Reporting Robustness Boundary of Neural Code Models for Intelligent Code Understanding

增强神经代码模型的鲁棒性边界报告

Tingxu Han, Wei Song, Weisong Sun, Hao Wu, Chunrong Fang, Yuan Xiao, Xiaofang Zhang, Zhenyu Chen, Yang Liu

专题命中 软件智能体 :code model(title,abstract);分类 cs.SE

AI总结 本文提出ENBECOME,一种无需训练的轻量级对抗防御方法,通过推理时引入语义保持的扰动,提升神经代码模型的鲁棒性并报告认证鲁棒性边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21698 2026-03-24 cs.AI 79%

A Blueprint for Self-Evolving Coding Agents in Vehicle Aerodynamic Drag Prediction

车辆气动阻力预测中自演化编码代理的蓝图

Jinhui Ren, Huaiming Li, Yabin Liu, Tao Li, Zhaokun Liu, Yujia Liang, Zengle Ge, Chufan Wu, Xiaomin Yuan, Danyu Liu, Annan Li, Jianmin Wu

机构 * Famou Agent Team(Famou 代理团队) Baidu AI Cloud(百度AI云) IAT AI Team(IAT人工智能团队)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文提出一种基于合同的自演化编码代理框架,通过约束优化发现可执行的代理管道,提升车辆阻力系数预测的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05344 2026-03-16 cs.AI 79%

Building Effective AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons Learned

构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训

Nghi D. Q. Bui

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。

Comments Work in progress, new versions will be updated continuously

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04466 2026-03-06 cs.RO cs.LG 79%

Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation

动作-观察-重写:多模态编码代理作为机器人操作的上下文政策学习者

Vaishak Kumar

机构 * General Bionix, Inc.(通用生物交叉公司)

专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.LG

AI总结 AOR框架通过生成可执行代码使机器人操作策略学习无需演示或奖励工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22764 2026-02-27 cs.SE 79%

Evaluating and Improving Automated Repository-Level Rust Issue Resolution with LLM-based Agents

评估和改进基于LLM代理的仓库级Rust问题解决

Jiahong Xiang, Wenxiao He, Xihua Wang, Hongliang Tian, Yuqun Zhang

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE

AI总结 本研究提出RUSTFORGER,通过集成自动化测试环境与动态跟踪策略,有效提升Rust问题解决效率,解决率达28.6%。

Comments Accepted to the 48th International Conference on Software Engineering (ICSE 2026)

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE '26), April 12--18, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19594 2026-02-24 cs.LG 79%

ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?

ISO-Bench: 编码代理能否优化现实世界的推理工作负载?

Ayush Nangia, Shikhar Mishra, Aman Gokrani, Paras Chopra

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG

AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13363 2026-02-17 cs.CR cs.AI 79%

Assessing Spear-Phishing Website Generation in Large Language Model Coding Agents

评估大型语言模型编码代理生成钓鱼网站的能力

Tailia Malloy, Tegawende F. Bissyande

机构 * University of Luxembourg, Interdisciplinary Center for Security, Reliability, and Trust (SnT), Trustworthy Software Engineering Group (TruX)(卢森堡大学,安全、可靠与信任跨学科中心(SnT),可信软件工程组(TruX))

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型在生成钓鱼网站代码方面的能力和潜在风险,通过比较不同模型生成危险代码库的能力,构建了包含200个网站代码库的数据集。

Comments 18 Pages, 7 Figures, 1 Table. Accepted to the conference Human Computer Interaction International

详情

展开后加载摘要…

URL PDF HTML 收藏