arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1096 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2512.10398 2026-02-04 cs.CL cs.AI cs.LG cs.SE 70%

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

孔子代码代理:面向真实世界代码库的可扩展代理构建

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

机构 * Meta

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 孔子代码代理通过可扩展的代理构建框架,在真实世界软件工程任务中实现高性能,超越现有研究和商业成果。

Comments The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07468 2026-02-04 cs.AI cs.CL cs.LG cs.SE 70%

CP-Agent: Agentic Constraint Programming

CP-Agent:代理约束编程

Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 CP-Agent通过代理工作流实现约束编程问题的高效求解,展示了最少指导优于详细指导,并揭示了任务管理工具对建模任务的双重影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13646 2025-11-25 cs.SE cs.AI cs.CL cs.LG 70%

Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

Live-SWE-agent: 软件工程代理能否在飞行中自我进化?

Chunqiu Steven Xia, Zhe Wang, Yan Yang, Yuxiang Wei, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 Live-SWE-agent是一种能够在运行时自主进化其自身框架的软件代理,通过解决现实软件问题实现了77.4%的解决率,优于现有所有软件代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18779 2025-11-03 cs.CL 70%

KAT-Coder Technical Report

Zizheng Zhan, Ken Deng, Jinghui Wang, Xiaojiang Zhang, Huaixi Tang, Minglei Zhang, Zhiyi Lai, Haoyang Huang, Wen Xiang, Kun Wu, Wenhao Zhuang, Shaojie Wang, Shangpeng Yan, Kepeng Lei, Zongxian Feng, Huiming Wang, Zheng Lin, Mengtong Li, Mengfei Xie, Yinghan Cui, Xuxing Chen, Chao Wang, Weihao Li, Wenqiang Zhu, Jiarong Zhang, Jingxuan Xu, Songwei Yu, Yifan Yao, Xinping Lei, C. Zhang, Han Li, Junqi Xiong, Zuchen Gao, Dailin Li, Haimo Li, Jiaheng Liu, Yuqun Zhang, Junyi Peng, Haotian Zhang, Bin Chen

机构 * Kwaipilot Team(Kwaipilot 团队)

专题命中 软件智能体 :code model(abstract);coding agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23671 2025-10-28 cs.SE cs.AI cs.CL cs.LG 70%

GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents

Manish Shetty, Naman Jain, Jinjian Liu, Vijay Kethanaboyina, Koushik Sen, Ion Stoica

机构 * UC Berkeley(伯克利大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Website: https://gso-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08724 2025-09-11 cs.SE 70%

SWE-Mirror: Scaling Issue-Resolving Datasets by Mirroring Issues Across Repositories

Junhao Wang, Daoguang Zan, Shulin Xin, Siyao Liu, Yurong Wu, Kai Shen

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17812 2025-06-24 cs.SE 70%

Is Your Automated Software Engineer Trustworthy?

Noble Saji Mathews, Meiyappan Nagappan

专题命中 软件智能体 :software agent(abstract);coding agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18455 2025-03-25 cs.SE 70%

SEAlign: Alignment Training for Software Engineering Agent

Kechi Zhang, Huangzhao Zhang, Ge Li, Jinliang You, Jia Li, Yunfei Zhao, Zhi Jin

专题命中 软件智能体 :code generation(abstract);code model(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03735 2024-02-07 cs.SE 70%

Investigating the Utility of ChatGPT in the Issue Tracking System: An Exploratory Study

Joy Krishan Das, Saikat Mondal, Chanchal K. Roy

专题命中 软件智能体 :code generation(abstract);program repair(abstract);分类 cs.SE

Comments Accepted in MSR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14155 2022-09-29 cs.SE cs.AI cs.CL cs.DL cs.LG 70%

Automatic Analysis of Available Source Code of Top Artificial Intelligence Conference Papers

Jialiang Lin, Yingmin Wang, Yao Yu, Yu Zhou, Yidong Chen, Xiaodong Shi

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Please cite the version of IJSEKE

Journal ref International Journal of Software Engineering and Knowledge Engineering, Vol. 32, No. 07, pp. 947-970 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14876 2026-08-18 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Workspace Topology as an Attack Vector in Agentic Coding Assistants

工作空间拓扑作为智能体代码助手的攻击向量

Alexandre G. R. Day, Pradeep Yadlapalli, Sriram Venkatapathy, Thomas Paniagua, Nick Raines, Sahil Wadhwa, Himanshu Kumar, Andy Luo, Sudeep Panyam, Rikhiya Ghosh, Pranab Mohanty, Giri Iyengar

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。

Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00073 2026-08-06 cs.SE cs.AI cs.CL 版本更新 67%

Terminal Agents Suffice for Enterprise Automation

终端代理足以实现企业自动化

Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Rajeswar

机构 * Mila -- Quebec AI Institute(Mila — 魁北克人工智能研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文探讨终端代理通过直接调用平台API在企业自动化中表现优异,证明简单接口结合强大基础模型足以替代复杂代理架构。

Comments Pre-print. Under review. 51 pages, 6 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21629 2026-07-27 hep-ph hep-th 新提交 67%

Scattering Amplitudes as Programs: Self-Evolving Search for Theory and Event Generation

作为程序的散射振幅:理论与事件生成的自演化搜索

Yi Gu, Sven Krippendorf

专题命中 软件智能体 :repository(abstract);coding agent(abstract)

AI总结 该研究将散射振幅视为程序,连接揭示解析结构与构建数值评估器的目标。通过自演化程序搜索进行缩放、结构和精确操作搜索,优化振幅计算,在多个过程测试中取得加速等成果,初步证明部分振幅优化可系统化。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17799 2026-07-21 cs.SE cs.AI cs.CL 版本更新 67%

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

立场:编程基准与智能体软件工程不一致

Maria I. Gorinova, Macey Baker, Amy Heineike, Maksim Shaposhnikov, Rob Willoughby, Dru Knox

机构 * Tessl

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文指出当前编程基准在智能体时代存在三大问题:混淆模型与系统框架、单一参考答案惩罚有效替代方案、缺乏组件级信号导致迭代困难,并提出应重新设计基准以对齐智能体软件工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新 67%

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03451 2026-07-07 cs.SE cs.AI cs.LG 新提交 67%

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

SkillOpt-Lite:通过一行代码实现更好更快的智能体自我进化

Yifei Shen, Bo Li, Xinjie Zhang

机构 * LMMs-Lab(LMMs实验室) NTU MMLab(国立台湾大学MMLab) Microsoft(微软公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究智能体技能优化,通过零阶优化形式化,基于相关理念和学习建立收敛与泛化原则,提出SkillOpt-Lite加速收敛且性能优,还集成到生产编码智能体,最小管道可推广到完整 harness 优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25530 2026-06-25 cs.SE cs.AI cs.CL 新提交 67%

Evaluating LLMs on Real-World Software Performance Optimization

评估大语言模型在真实软件性能优化中的表现

Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

机构 * Siemens AG(西门子公司) Technical University of Munich(慕尼黑技术大学) Heilbronn, Germany(德国海德堡) Munich, Germany(德国慕尼黑)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 针对现有基准过度简化性能优化的问题,提出基于102个专家优化的仓库级基准SWE-Pro,评估LLM在运行时、峰值内存和时间加权内存使用上的表现,发现LLM优化效果显著弱于专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10913 2026-06-25 cs.AI cs.PL cs.SE 版本更新 67%

Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces

Shepherd: 一个为元代理提供形式化执行迹的运行时基座

Simon Yu, Derek Chong, Ananjan Nandi, Dilara Soylu, Jiuding Sun, Christopher D Manning, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。

Comments 50 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14084 2026-06-11 cs.SE cs.AI cs.CL 版本更新 67%

CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing

CRANE:通过空域编辑实现代码代理的约束推理注入

Mingzhi Zhu, Michele Merler, Raju Pavuluri, Stacy Patterson

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 CRANE通过空域编辑技术,结合推理和工具使用能力,提升代码代理性能,在多个基准测试中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21347 2026-06-08 cs.AI cs.LG cs.SE 版本更新 67%

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

Insights Generator: LLM代理的系统级语料库追踪诊断

Akshay Manglik, Apaar Shanker, Kaustubh Deshpande, Jason Qin, Yash Maurya, Veronica Chatrath, Vijay S. Kalmath, Levi Lentz, Yuan Xue

机构 * Scale AI, Inc.

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出Insights Generator,一种多智能体系统,通过在语料库中提出和测试假设来生成基于证据的洞察报告,从而系统性地诊断LLM代理的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31463 2026-06-01 cs.LG cs.AI cs.CL cs.DC 67%

PithTrain: A Compact and Agent-Native MoE Training System

PithTrain: 一个紧凑且面向智能体的MoE训练系统

Ruihang Lai, Hao Kang, Haozhan Tang, Akaash R. Parthasarathy, Zichun Yu, Junru Shao, Todd C. Mowry, Chenyan Xiong, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Xlue NVIDIA(英伟达)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PithTrain,一个基于智能体原生设计原则的紧凑型MoE训练框架,通过引入ATE-Bench评估智能体任务效率,在保持生产框架吞吐量的同时,将智能体任务轮次和活跃GPU时间分别降低62%和64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07457 2026-06-01 cs.SE cs.AI cs.CL 67%

Pull Requests as a Training Signal for Repo-Level Code Editing

拉取请求作为仓库级代码编辑的训练信号

Qinglin Zhu, Tianyu Chen, Shuai Lu, Lei Ji, Runcong Zhao, Murong Ma, Xiangxiang Dai, Yulan He, Lin Gui, Peng cheng, Yeyun Gong

机构 * King's College London, UK(伦敦国王学院) Chinese University of Hong Kong, HK(香港中文大学) National University of Singapore, SG(新加坡国立大学) Microsoft Research Asia, CN(微软亚洲研究院) The Alan Turing Institute, UK(艾伦·图灵研究所)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出Clean-PR方法,利用真实GitHub拉取请求作为训练信号,通过重建和验证转换为搜索/替换编辑块,结合无代理对齐的监督微调,在SWE-bench上显著提升仓库级代码编辑性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 67%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19932 2026-05-20 cs.AI cs.CL cs.LG 67%

PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

PEEK:上下文地图作为长上下文LLM代理的导向缓存

Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10005 2026-05-14 cs.PL cs.AI cs.LO cs.SE 67%

Combining Mechanical and Agentic Specification Inference for Move

结合机械和代理规范推断的Move

Wolfgang Grieskamp, Teng Zhang, Vineeth Kashyap

机构 * Aptos Labs(Aptos实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 本文提出结合机械分析与代理编码的Move规范推断工具,通过WP分析和AI辅助生成高阶规范,减少手动编写规范的繁琐工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09863 2026-05-12 cs.CR cs.AI cs.CL cs.IR cs.LG 67%

Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents

Nautilus Compass:生产LLM代理的黑盒人格漂移检测

Chunxiao Wang

机构 * Yiluo Technology Co., Ltd.(亿洛科技有限公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Nautilus Compass通过提示文本层的余弦相似度检测生产编码代理的人格漂移,无需调用LLM提取事实,实现高效且低成本的代理记忆层。

Comments 19 pages, 6 figures. MIT-licensed code + reproduction scripts at github.com/chunxiaoxx/nautilus-compass

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21375 2026-04-27 cs.CL cs.AI cs.SE 67%

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xiong, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz CMU(卡内基梅隆大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Salesforce UC Berkeley(伯克利加州大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00917 2026-04-02 cs.SE cs.AI cs.LG 67%

Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time

在真实世界中研究自主代理的贡献:活动模式与代码变更趋势

Razvan Mihai Popescu, David Gros, Andrei Botocan, Rahul Pandita, Prem Devanbu, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文通过分析11万条开源拉取请求数据,研究自主编码代理在开源项目中的活动模式及代码变更,探讨其对代码质量、团队动态和软件维护性的影响。

Comments MSR 2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10079 2026-03-31 cs.LG cs.AI cs.CL 67%

Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts

稀疏强化学习:通过稳定稀疏回放突破大语言模型强化学习的内存瓶颈

Sijia Luo, Xiaokang Zhang, Yuxuan Hu, Bohan Zhang, Ke Wang, Jinbo Su, Mengshu Sun, Lei Liang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Key Laboratory of Data Engineering and Knowledge Engineering(数据工程与知识工程重点实验室) Ant Group(蚂蚁集团)

专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稀疏强化学习方法,通过稳定稀疏回放解决大语言模型强化学习中的内存瓶颈问题,采用稀疏采样和重要性重加权技术减少计算开销并提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13023 2026-03-17 cs.SE cs.AI cs.CL 67%

daVinci-Env: Open SWE Environment Synthesis at Scale

daVinci-Env:大规模开放软件工程环境合成

Dayuan Fu, Shenyu Wu, Yunze Wu, Zerui Peng, Yaxing Huang, Jie Sun, Ji Zeng, Mohan Jiang, Lin Zhang, Yukun Li, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出OpenSWE,一个大规模透明的软件工程代理训练框架,包含45320个可执行Docker环境,通过多代理合成管道和质量过滤流程,实现高效学习和高质量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏