arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1096 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2605.18684 2026-05-19 cs.SE cs.AI 73%

Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents

Reversa:一个用于将遗留软件转换为AI代理操作规范的反向文档工程框架

Sanderson Oliveira de Macedo, Ronaldo Martins da Costa

机构 * Federal Institute of Goias(戈亚斯联邦理工学院) Federal University of Goias(戈亚斯联邦大学)

专题命中 软件智能体 :software agent(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Reversa框架,旨在通过反向文档工程将遗留软件转换为AI代理可操作的规范,通过多代理流水线流程提取隐含规则,生成可追溯的操作规范,并提出评估协议以衡量覆盖率、可追溯性、置信度、效用和成本。

Comments Preprint. Includes a generative AI use statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05278 2026-04-08 cs.SE cs.AI cs.MA 73%

Spec Kit Agents: Context-Grounded Agentic Workflows

Spec Kit Agents:基于上下文的代理工作流

Pardis Taghavi, Santosh Bhavani

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Spec Kit Agents,一种多代理的规范驱动开发流程,通过添加阶段级上下文绑定钩子,提升代码质量与测试兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27524 2026-03-31 cs.SE cs.AI 73%

Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs

更安全的构建者,危险的维护者:人类与代理PR中破坏性变更的比较研究

K M Ferdous, Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim

机构 * Kennesaw State University(肯尼索州立大学)

专题命中 软件智能体 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文比较了人类与代理PR中破坏性变更的频率和任务情境,发现代理在维护任务中风险更高,存在'信心陷阱'问题。

Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26130 2026-03-30 cs.SE cs.AI 73%

SWE-PRBench: Benchmarking AI Code Review Quality Against Pull Request Feedback

SWE-PRBench:基于拉取请求反馈的AI代码审查质量基准测试

Deepak Kumar

专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 SWE-PRBench通过350个带人工标注的拉取请求评估AI代码审查质量,发现即使在代码生成基准测试中表现良好,AI在仅基于差异的配置下仍只能检测出人类标记问题的15-31%,表明AI代码审查距离人类专家表现仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19441 2026-02-24 cs.SE cs.AI 73%

When AI Teammates Meet Code Review: Collaboration Signals Shaping the Integration of Agent-Authored Pull Requests

当AI队友遇见代码审查:协作信号塑造代理编写的拉取请求整合

Costain Nachuma, Minhaz Zibran

机构 * Idaho State University USA(爱达荷州立大学)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究探讨了AI代理提交的拉取请求在代码审查中的整合效果,发现审查员参与和协作信号对整合成功至关重要。

Comments 5 pages, 2 figures, 1 table. Accepted at the 23rd International Conference on Mining Software Repositories (MSR 2026), Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11655 2026-01-21 cs.SE cs.CL 73%

Advances and Frontiers of LLM-based Issue Resolution in Software Engineering: A Comprehensive Survey

大语言模型在软件工程中的问题解决进展与前沿:一项全面的调查

Caihua Li, Lianghong Guo, Yanlin Wang, Daya Guo, Wei Tao, Zhenyu Shan, Mingwei Liu, Jiachi Chen, Haoyu Song, Duyu Tang, Hongyu Zhang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) Huawei Technologies Co, Ltd(华为技术有限公司) Chongqing University(重庆大学)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文全面调查了大语言模型在软件工程中问题解决的进展与前沿,分析了数据构建、方法和技术挑战,并提供了开源资源。

Comments 26 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14757 2025-12-23 cs.SE cs.AI 73%

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

专题命中 软件智能体 :program repair(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16005 2025-11-21 cs.SE cs.AI 73%

InfCode-C++: Intent-Guided Semantic Retrieval and AST-Structured Search for C++ Issue Resolution

InfCode-C++: 基于意图的语义检索与AST结构化搜索用于C++问题解决

Qingao Dong, Mengfei Wang, Hengzhi Zhang, Zhichao Li, Yuan Yuan, Mu Li, Xiang Gao, Hailong Sun, Chunming Hu, Weifeng Lv

机构 * Beihang University(北航) Beijing Tokfinity Technology Co., Ltd.(北京 Tokfinity 技术有限公司)

专题命中 软件智能体 :software agent(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 INFCODE-C++ 是首个针对 C++ 的自主系统,通过结合语义代码意图检索和 AST 结构查询,实现端到端的问题解决,其性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01860 2025-10-13 cs.SE cs.LG 73%

SWE-Arena: An Interactive Platform for Evaluating Foundation Models in Software Engineering

Zhimin Zhao

机构 * School of Computing Queen's University Kingston, Canada(计算学院皇后大学加拿大金斯顿)

专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE、cs.LG

Comments Check the online arena at https://huggingface.co/spaces/SWE-Arena/Software-Engineering-Arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17927 2024-06-28 cs.SE cs.AI 73%

MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue Resolution

Wei Tao, Yucheng Zhou, Yanlin Wang, Wenqiang Zhang, Hongyu Zhang, Yu Cheng

专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08654 2026-08-11 cs.AI 新提交 70%

The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

脚手架比接口更重要:在七种智能体脚手架、五种语言模型和一项软件任务中对MCP与CLI工具使用的对照比较

Marc Alier Forment, María José Casañ Guerrero, Francisco José García-Peñalvo, Juanan Pereira

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究通过对照实验发现,智能体脚手架对AI编码智能体的工具使用成本影响远大于接口,MCP并非必要,且智能体常忽略分配的接口,相关数据已开源。

Comments 29 pages, 4 figures, 8 tables. Companion methodology paper: arXiv:2606.11869. Dataset and measurement harness (open source, GPL-3.0): https://doi.org/10.5281/zenodo.21851992

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03585 2026-08-05 cs.AI cs.CY 新提交 70%

From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities

从社交编码到智能体编码:开源社区中的生产力与关系重构

Mengying Zhou, Yongjie Yin, Yang Chen

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14061 2026-08-04 cs.SE 版本更新 70%

LLM Agents Can See Code Repositories

LLM智能体能够查看代码仓库

Dongjian Ma, Silin Chen, Yufei Yang, Yuling Shi, Yanfu Yan, Xiaodong Gu

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。

Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26563 2026-07-29 cs.SE 版本更新 70%

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

TrajAudit:智能体编码系统的自动化故障诊断

Minxing Wang, Xiaofei Xie, Yintong Huo

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22677 2026-07-28 cs.DL cs.AI 新提交 70%

SetGo: Metadata Readiness for Scientific AI Datasets

SetGo:科学人工智能数据集的元数据就绪性

Sean R. Wilkinson, Polina Shpilker, Wesley Brewer

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 研究针对科学AI数据集元数据就绪性评估工具缺失的问题,提出开源工具SetGo,能从六个维度评估修复元数据,揭示通用工具未发现的缺陷,提升公平性分数,还可集成大语言模型支持自动化工作流程。

Comments 6 pages; accepted at SSDBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12057 2026-07-15 cs.SE 新提交 70%

Predicting Acceptance and Review Effort in Human and Agent Pull Requests

预测人类和智能体拉取请求的接受情况及评审工作量

Kartik Ghanshyambhai Pansuriya, Ehsan Ghorbani, Deepak Singh, Eman Abdullah AlOmar

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究在拉取请求打开时预测其接受情况及评审工作量的可行性,利用AIDev数据集构建预测管道,评估多种机器学习模型,发现接受度预测可行,评审工作量预测较难,早期模型可支持分类和优先级排序,应作咨询工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11308 2026-07-14 cs.SE cs.CR 新提交 70%

FlowArk: Boosting Agentic Data-flow Analysis for Android Apps via Context-Aware Knowledge Reuse

FlowArk:通过上下文感知知识重用提升安卓应用的智能数据流分析

Yiming Zhang, Jiangrong Wu, Yuhong Nan

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究安卓应用数据流分析中批量任务重复分析成本高的问题,提出FlowArk系统,通过提炼、打包和注入知识条目降低成本,实验表明其在保持分析质量的同时,能降低API成本并增加任务完成量。

Comments 12 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06065 2026-07-08 cs.SE 新提交 70%

SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review

SWE-Review:通过智能代码审查解决问题闭环

Ruoyu Wang, Jierun Chen, Shaowei Wang, Chaofan Tao, Sidi Yang, Yuxin Jiang, Kim-Hui Yap, Lifeng Shang, Xiaohui Li, Haoli Bai

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究通过智能代码审查闭合PR生成环的问题,核心方法是SWE-Review框架,由审查代理进行审查并提供反馈。主要贡献是能持续改进PR,在多方面表现优于单轮审查,还能推动AI编码代理从一次性PR生成迈向闭环问题解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04697 2026-07-08 cs.SE 新提交 70%

AI Agent Pull Requests on GitHub: Frequency, Structure, and Merge Conflict Rates

GitHub上的AI代理拉取请求:频率、结构和合并冲突率

George Xu, Arjun Subramanian, Nithilan Karthik

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 利用AIDev-pop数据集对AI代理编写的拉取请求并发情况进行大规模实证分析,发现特定时间重叠下部分仓库有协同活动的请求对,多数为同一代理,还研究了合并冲突率及冲突类型。

Comments 7 pages, 4 figures, 2 tables. Replication package: https://doi.org/10.5281/zenodo.21186464

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00016 2026-07-02 cs.IR cs.AI 新提交 70%

Libra: Training the Environment for Agentic Information Retrieval

Libra: 为智能信息检索训练环境

Xuan Zhao, Andy Chiu, Gengyu Wang

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 提出Libra框架,通过引入可变目录和LLM驱动优化循环,自动改进代码仓库的索引结构,提升代码定位准确率,并实现跨模型和问题的零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12415 2026-07-02 cs.SE 版本更新 70%

SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?

SWE-Perf:语言模型能否优化真实仓库中的代码性能?

Xinyi He, Qian Liu, Mingzhe Du, Lin Yan, Zhijie Fan, Yiming Huang, Yin Zheng, Zejian Yuan, Zejun Ma

专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26721 2026-06-26 cs.SE cs.HC 新提交 70%

Knowledge-Based Pull Requests: A Trusted Workflow for Agent-Mediated Knowledge Collaboration

基于知识的拉取请求:一种可信的智能体中介知识协作工作流

Xinyu Zhang, Weiwei Sun

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 提出知识型拉取请求(KPR)工作流,通过分离知识采纳与实现合并,利用智能体蒸馏外部知识并再生代码,以降低跨信任边界的软件协作成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26963 2026-06-16 cs.OS cs.DC cs.LG cs.MA 版本更新 70%

MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems

MARS:面向异构智能体系统的高效自适应协同调度

Yifei Wang, Hancheng Ye, Yechen Xu, Cong Guo, Chiyue Wei, Qinsi Wang, Dongting Li, Tingjun Chen, Hai "Helen" Li, Danyang Zhuo, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.LG

AI总结 提出MARS协同调度系统,通过统一信息流全局协调GPU推理与CPU工具执行,解耦准入与执行防止资源过载,并采用智能体中心调度器最小化端到端延迟,实验显示延迟降低5.94倍。

Comments 14 pages, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21810 2026-05-22 cs.AI cs.MA 70%

Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents

Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理

Zijian Du, Nathaniel Pinckney

机构 * NVIDIA

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13139 2026-05-14 cs.SE 70%

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

SWE-Cycle:在完整问题解决周期中对齐代码代理的基准测试

Hao Guan, Lingyue Fu, Shao Zhang, Yaoming Zhu, Kangning Zhang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, Yong Yu

专题命中 软件智能体 :software agent(abstract);repository(abstract);分类 cs.SE

AI总结 本文提出SWE-Cycle基准测试,评估代码代理在环境重建、代码实现和测试生成等任务中的能力,揭示了在端到端任务中处理跨阶段依赖和保持代码质量的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05258 2026-05-08 cs.SE 70%

PARNESS: A Paper Harness for End-to-End Automated Scientific Research with Dynamic Workflows, Full-Text Indexing, and Cross-Run Knowledge Accumulation

PARNESS:一种用于端到端自动化科学研究的论文工具,支持动态工作流、全文索引和跨运行知识积累

Yuchen Wang, Zhongzhi Luan

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 PARNESS通过动态工作流、全文索引和跨运行知识积累,解决传统科研系统流程僵化、知识累积不足的问题,实现端到端自动化科研。

Comments 31 pages, 13 figures, includes appendix with a verbatim end-to-end-generated paper produced by the framework. Source: https://github.com/gtrhythm/PARNESS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26892 2026-04-30 cs.SE 70%

Hot Fixing in the Wild

野火修复

Carol Hanna, Karine Even-Mendoza, W. B. Langdon, Mar Zamorano López, Justyna Petke, Federica Sarro

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究分析了61000余个仓库中的人工和AI代理生成的热修复,发现其具有紧迫性特征,揭示了人类与AI在修复行为上的差异,为实际应用中的热修复协作提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16529 2026-04-22 cs.SE cs.AI cs.CL cs.LG 70%

Scaling Test-Time Compute for Agentic Coding

为代理编程扩展测试时计算

Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk Helenowski, Ruan Silva, Zhengxing Chen, Srinivasan Iyer, Manzil Zaheer, Daniel Fried, Hannaneh Hajishirzi, Sanjeev Arora, Gabriel Synnaeve, Ruslan Salakhutdinov, Anirudh Goyal

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Washington(华盛顿大学) New York University(纽约大学) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出基于轨迹紧凑表示的代理编程测试时扩展框架,通过递归竞赛投票和并行-蒸馏-细化方法提升长周期代理性能,实验证明在SWE-Bench和Terminal-Bench上显著提升效果。

Comments 70 pages, 26 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09744 2026-04-14 cs.MA cs.AI 70%

MPAC: A Multi-Principal Agent Coordination Protocol for Interoperable Multi-Agent Collaboration

MPAC:一种多主代理协调协议用于互操作性多代理协作

Kaiyang Qian, Xinmin Fang, Zhengxiong Li

机构 * University of Colorado Denver (CU Denver)(科罗拉多大学丹佛分校)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 本文提出MPAC协议,解决多主代理共享状态协调问题,通过五层结构实现显式协调语义,减少协调开销并提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17833 2026-03-19 cs.SE 70%

ArchBench: Benchmarking Generative-AI for Software Architecture Tasks

Bassam Adnan, Aviral Gupta, Sreemaee Akshathala, Karthik Vaidhyanathan

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

Comments 5 pages, 3 figures, Software Architecture Showcase Track, ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏