Investigating the Utility of ChatGPT in the Issue Tracking System: An Exploratory Study
专题命中 软件智能体 :code generation(abstract);program repair(abstract);分类 cs.SE
Comments Accepted in MSR 2024
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 软件智能体 :code generation(abstract);program repair(abstract);分类 cs.SE
Comments Accepted in MSR 2024
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
Comments Please cite the version of IJSEKE
Journal ref International Journal of Software Engineering and Knowledge Engineering, Vol. 32, No. 07, pp. 947-970 (2022)
工作空间拓扑作为智能体代码助手的攻击向量
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。
Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)
终端代理足以实现企业自动化
机构 * Mila -- Quebec AI Institute(Mila — 魁北克人工智能研究所)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文探讨终端代理通过直接调用平台API在企业自动化中表现优异,证明简单接口结合强大基础模型足以替代复杂代理架构。
Comments Pre-print. Under review. 51 pages, 6 figures, 21 tables
作为程序的散射振幅:理论与事件生成的自演化搜索
专题命中 软件智能体 :repository(abstract);coding agent(abstract)
AI总结 该研究将散射振幅视为程序,连接揭示解析结构与构建数值评估器的目标。通过自演化程序搜索进行缩放、结构和精确操作搜索,优化振幅计算,在多个过程测试中取得加速等成果,初步证明部分振幅优化可系统化。
Comments 29 pages, 8 figures
立场:编程基准与智能体软件工程不一致
机构 * Tessl
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文指出当前编程基准在智能体时代存在三大问题:混淆模型与系统框架、单一参考答案惩罚有效替代方案、缺乏组件级信号导致迭代困难,并提出应重新设计基准以对齐智能体软件工程。
SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试
机构 * GigaCode ; ITMO University(ITMO大学) ; MWS AI(MWS人工智能) ; IITU university(IITU大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。
Comments EMNLP 2025
SkillOpt-Lite:通过一行代码实现更好更快的智能体自我进化
机构 * LMMs-Lab(LMMs实验室) ; NTU MMLab(国立台湾大学MMLab) ; Microsoft(微软公司)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究智能体技能优化,通过零阶优化形式化,基于相关理念和学习建立收敛与泛化原则,提出SkillOpt-Lite加速收敛且性能优,还集成到生产编码智能体,最小管道可推广到完整 harness 优化。
评估大语言模型在真实软件性能优化中的表现
机构 * Siemens AG(西门子公司) ; Technical University of Munich(慕尼黑技术大学) ; Heilbronn, Germany(德国海德堡) ; Munich, Germany(德国慕尼黑)
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 针对现有基准过度简化性能优化的问题,提出基于102个专家优化的仓库级基准SWE-Pro,评估LLM在运行时、峰值内存和时间加权内存使用上的表现,发现LLM优化效果显著弱于专家。
Shepherd: 一个为元代理提供形式化执行迹的运行时基座
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。
Comments 50 pages, 22 figures, 14 tables
CRANE:通过空域编辑实现代码代理的约束推理注入
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; IBM Research(IBM研究院)
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 CRANE通过空域编辑技术,结合推理和工具使用能力,提升代码代理性能,在多个基准测试中取得显著成果。
Insights Generator: LLM代理的系统级语料库追踪诊断
机构 * Scale AI, Inc.
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出Insights Generator,一种多智能体系统,通过在语料库中提出和测试假设来生成基于证据的洞察报告,从而系统性地诊断LLM代理的行为模式。
PithTrain: 一个紧凑且面向智能体的MoE训练系统
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Xlue ; NVIDIA(英伟达)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PithTrain,一个基于智能体原生设计原则的紧凑型MoE训练框架,通过引入ATE-Bench评估智能体任务效率,在保持生产框架吞吐量的同时,将智能体任务轮次和活跃GPU时间分别降低62%和64%。
拉取请求作为仓库级代码编辑的训练信号
机构 * King's College London, UK(伦敦国王学院) ; Chinese University of Hong Kong, HK(香港中文大学) ; National University of Singapore, SG(新加坡国立大学) ; Microsoft Research Asia, CN(微软亚洲研究院) ; The Alan Turing Institute, UK(艾伦·图灵研究所)
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 提出Clean-PR方法,利用真实GitHub拉取请求作为训练信号,通过重建和验证转换为搜索/替换编辑块,结合无代理对齐的监督微调,在SWE-bench上显著提升仓库级代码编辑性能。
Comments Accepted at ICML 2026
SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架
机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。
PEEK:上下文地图作为长上下文LLM代理的导向缓存
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。
结合机械和代理规范推断的Move
机构 * Aptos Labs(Aptos实验室)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 本文提出结合机械分析与代理编码的Move规范推断工具,通过WP分析和AI辅助生成高阶规范,减少手动编写规范的繁琐工作。
Nautilus Compass:生产LLM代理的黑盒人格漂移检测
机构 * Yiluo Technology Co., Ltd.(亿洛科技有限公司)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Nautilus Compass通过提示文本层的余弦相似度检测生产编码代理的人格漂移,无需调用LLM提取事实,实现高效且低成本的代理记忆层。
Comments 19 pages, 6 figures. MIT-licensed code + reproduction scripts at github.com/chunxiaoxx/nautilus-compass
VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架
机构 * UC Santa Cruz ; CMU(卡内基梅隆大学) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Salesforce ; UC Berkeley(伯克利加州大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。
Comments The first two authors contribute equally
在真实世界中研究自主代理的贡献:活动模式与代码变更趋势
机构 * Delft University of Technology(代尔夫特理工大学) ; University of California, Davis(加利福尼亚大学戴维斯分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文通过分析11万条开源拉取请求数据,研究自主编码代理在开源项目中的活动模式及代码变更,探讨其对代码质量、团队动态和软件维护性的影响。
Comments MSR 2026 Technical Track
稀疏强化学习:通过稳定稀疏回放突破大语言模型强化学习的内存瓶颈
机构 * School of Information, Renmin University of China(中国人民大学信息学院) ; Key Laboratory of Data Engineering and Knowledge Engineering(数据工程与知识工程重点实验室) ; Ant Group(蚂蚁集团)
专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出稀疏强化学习方法,通过稳定稀疏回放解决大语言模型强化学习中的内存瓶颈问题,采用稀疏采样和重要性重加权技术减少计算开销并提升模型鲁棒性。
daVinci-Env:大规模开放软件工程环境合成
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出OpenSWE,一个大规模透明的软件工程代理训练框架,包含45320个可执行Docker环境,通过多代理合成管道和质量过滤流程,实现高效学习和高质量训练。
初级AI科学家及其风险报告:从基础论文出发的自主科学探索
机构 * The University of Tokyo(东京大学) ; Tokyo University of Science(东京科学大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Jr. AI Scientist通过模仿初级研究人员的工作流程,自主生成科学论文,但存在潜在风险和局限性,需进一步研究。
Comments TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist
Arbiter:检测LLM代理系统提示中的干扰
机构 * the University of British Columbia(不列颠哥伦比亚大学) ; the Georgia Institute of Technology(佐治亚理工学院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 Arbiter通过结合形式评估规则和多模型LLM扫描,检测LLM代理系统提示中的干扰模式,发现152个问题并揭示漏洞类别差异。
解析SWE-Bench排行榜:LLM和基于代理的修复系统的提交者与架构分析
专题命中 软件智能体 :program repair(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文分析了SWE-Bench排行榜上的提交者和架构,揭示了专有LLM的主导地位及不同设计类型。
Comments Part of this work (RQ1) has been published at the 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP 2026), DOI: 10.1145/3786583.3786904. The published version is also available on arXiv at arXiv:2602.04449
SWE-Replay:面向软件工程代理的高效测试时间扩展
机构 * Siebel School of Computing(计算科学系) ; Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校)
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 SWE-Replay通过重用历史轨迹和动态选择探索或利用策略,实现了高效且可推广的软件工程代理测试时间扩展。
基于用户修改的LLM原理化微调:偏好、监督与奖励的融合
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于用户修改的LLM微调方法,通过融合偏好、监督和奖励反馈,提升模型在不同任务中的适应能力。
Comments Accepted at NeurIPS 2025
Kimi-Dev:无代理训练作为SWE-代理的技能先验
机构 * Moonshot AI ; THU(清华大学) ; PKU(北京大学) ; UCAS(中国科学技术大学) ; BUPT(北京邮电大学) ; NUS(新加坡国立大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。
Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China(区块链与数据安全国家重点实验室,浙江大学,杭州,中国) ; School of Big Data and Software Engineering, Chongqing University, Chongqing, China(大数据与软件工程学院,重庆大学,重庆,中国)
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
Comments Accepted by ASE 2025
机构 * institutetext(机构)
专题命中 软件智能体 :software agent(abstract);分类 cs.AI、cs.LG、cs.PL
Comments In this version I added ORCID, corrected Licence and arxiv.org Metadata