SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements
SWE-NFI:面向非功能改进的编码智能体研究与基准测试
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出SWE-NFI基准,基于开源Python项目的真实合并拉取请求构建188个任务,评估编码智能体的非功能改进能力,发现智能体在该能力上普遍落后于人类开发者。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SWE-NFI:面向非功能改进的编码智能体研究与基准测试
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出SWE-NFI基准,基于开源Python项目的真实合并拉取请求构建188个任务,评估编码智能体的非功能改进能力,发现智能体在该能力上普遍落后于人类开发者。
AI辅助的开源软件提交预评审:来自BOSC 2026的经验报告
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对BOSC 2026投稿激增问题,开发bosc-pre-review与Runabilly辅助评审,调查显示该预评审工具对志愿评审人员有用,需人工复核结论。
Comments 18 pages, 4 figures
初探编码智能体在开源社区中对AI贡献规则的合规性
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。
增强小型语言模型以实现射电天文学中的可持续代码优化
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。
像素换程序?关于将源代码作为文本和图像的输入令牌计费的跨供应商案例研究
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究将源代码作为文本和图像时商业API如何计费,通过可重复案例研究,涵盖五种编程语言、多种源长度及多个模型别名,得出不同模型的图像与文本比率及收支平衡行为差异,还发布了重现研究所需的资料。
用于保护大语言模型生成的C代码的工具引导检索增强修复
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究大语言模型生成C代码可靠性问题,提出结合编译诊断、CodeQL静态分析等及检索先前修复模式的分析与修复工作流程,在相关C编程任务上评估,该方法有效降低了基线模型的编译失败率和安全缺陷率,提升了代码安全性。
传递而非存储:线索锚定工作记忆作为编码代理的一种约束属性
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究编码代理记忆问题,提出基于认知文献的两层设计理论及线索锚定记忆模型,通过实际编码任务评估,表明传递而非存储是关键,可靠记忆通道应让代理无需思考,给出相关实验结果及贡献。
用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习
机构 * Iowa State University(爱荷华州立大学) ; Cisco AI Research(思科人工智能研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。
MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。
Comments 16 pages, 8 figures
CODENS:将代码变更转化为生动、可访问且可查询的文档
机构 * CAPSENS
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究如何在快速发展代码库中维护文档,提出CODENS系统,它从拉取请求构建知识图,经语义提取等操作,通过三种检索模式展示知识,保留变更历史并集成评估指标,在项目中评估效果良好,但在文档综合方面有挑战。
Comments Accepted at the 26th ACM Symposium on Document Engineering (DocEng 2026). DOI: 10.1145/3820755.3832807
SWE-Pruner Pro:编码语言模型已知道该修剪什么
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE
AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。
Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro
CLOSER-Bench:评估硬件代理的预算跨阶段设计封闭性
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究硬件代理跨阶段设计封闭性评估难题,提出CLOSER-Bench协议,通过配对任务记录调用,测量多方面指标。经试点和验证揭示差距,构建加速器,促使将硬件封闭视为预算顺序决策问题。
Comments 6 pages, 2 figures, 4 tables
MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准
机构 * Tsinghua University(清华大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。
通过累积行为规则实现自我改进的人工智能编码代理:一个闭环框架
机构 * Microsoft(微软)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究基于大语言模型的编码代理重复犯错问题,提出闭环框架,将审查评论编码为行为规则,经实验验证其能转移审查重点、降低错误复发率且跨接口转移,实现跨会话学习且不更新权重,积累人类工程智慧。
Comments Already presented and accepted in - 32nd ICE IEEE/ITMC Conference (ICE 2026)
使用编码智能体的主动流动控制启发式学习
机构 * Mines Paris - PSL University Centre for Material Forming (CEMEF) CNRS(巴黎矿业 - 巴黎文理研究大学材料成型中心(CEMEF)法国国家科学研究中心)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究主动流动控制中控制器设计难题,提出用编码智能体直接搜索显式可执行反馈律的启发式学习范式及受限协议,经多基准评估,其启发式控制器性能优、可解释,是传统强化学习的可靠互补替代方案。
人工智能时代关于代码审查的3100种观点:从从业者话语中构建因果理论
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究人工智能对代码审查的影响,通过收集从业者话语构建因果模型,明确审查是控制点,团队决定编码代理对软件影响,转化相关命题,还提供LLM辅助灰色文献理论构建方法。
DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体
机构 * Datacurve
专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE
AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。
Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/
野外数据分析:针对现实世界数据复杂性对大语言模型进行基准测试
机构 * Fujitsu Research of America(富士通美国研究院)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 针对大语言模型在数据分析基准测试无法反映现实情况的问题,引入DataGovBench基准测试,含表格问答和表格洞察两个任务,通过实验发现现有模型有性能差距,为推进相关研究提供挑战基准。
Comments 29 pages, 9 figures
利用代码智能体进行自动软件验证
机构 * Singapore Management University, Barkhausen Institut(新加坡管理大学, 巴克豪森研究所)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究利用大语言模型代码智能体进行自动软件验证,将引理交给智能体自由选择方法并置于验证框架,该方法简单有效,能完全覆盖目标引理,在多维度评估中表现出色,可自动为软件开发编写证明。
挥之不去的权限:面向编码智能体的可撤销资源与效果能力
机构 * International University of La Rioja(拉里奥ja国际大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 针对编码智能体中临时权限残留问题,提出PORTICO监控器,通过可撤销能力生命周期管理,在保持任务成功率的同时消除越权副作用。
Comments 20 pages
编码智能体中的潜在编程视界
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)
专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE
AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。
RustMizan:用于Rust漏洞的可编译、污染感知基准测试框架
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Trinity University(特里尼蒂大学) ; Microsoft Research(微软研究院) ; Amii(阿米国际)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 针对现有Rust漏洞分析基准不足,介绍RustMizan框架,含可编译代码变体及注释,用配对突变框架测试,给出不同模型在该框架下的测试结果。
Comments 36 pages, 7 figures
通过约束实现可操控性:编码智能体可扩展监督的基础
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出通过访问控制、网络策略和工具强制编码规范等传统工程管理方法约束编码智能体,以降低人类监督成本并提升安全性;实验表明约束基板使后门检测召回率从54.5%提升至90.9%。
Comments Accepted to the Deep Learning for Code Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
命令行AI编码代理的采用与影响:微软2026年初推出Claude Code和GitHub Copilot CLI的研究
机构 * Microsoft(微软)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究微软2026年初推出Claude Code和GitHub Copilot CLI时,数万名工程师的采用模式、留存因素及对代码合并的影响,发现社交网络驱动首次使用,编码活跃度关联留存,采用者合并PR数量增加约24%。
SWE-Doctor: 通过多面缺陷复现测试的运行时诊断引导软件工程智能体
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出SWE-Doctor,通过生成多面缺陷复现测试并执行调试,构建运行时诊断记录,结合定位信息指导补丁生成,在SWE-bench Verified和Pro上平均解决率分别达75.7%和59.4%。
规范增长引擎:AI辅助软件开发的规范锚定、代码耦合、漂移强制架构
机构 * Hochschule Offenburg(奥芬堡应用科学大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出规范增长引擎框架,通过机器可读的规范图、Spine上下文组装器、垂直切片增长协议和漂移门,解决AI编码代理中的上下文爆炸和规范-代码漂移问题。
LLM编码代理的确定性控制平面
机构 * Happiest Minds Technologies (AIP Centre of Excellence)(happiest minds technologies(aip中心卓越机构))
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 针对LLM编码代理配置缺乏管理的问题,提出确定性控制平面Rel(AI)Build,通过内容寻址、分层权限、阶段状态机等机制确保配置安全与一致性。
Comments 45 pages, 9 figures, 13 tables. Dataset and reproduction scripts: Zenodo DOI 10.5281/zenodo.20780913. Ancillary files include report.json, organizations.txt, and figure-reproduction scripts
编码智能体的贝叶斯控制
机构 * PolyShape ; National Technical University of Athens(雅典国家技术大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 软件智能体 :tool-use(abstract);分类 cs.AI、cs.CL
AI总结 将编码智能体的编排建模为成本敏感的序贯假设检验,贝叶斯控制器动态决策证据收集、候选优化、验证或停止,在昂贵验证下最有效,且信念状态提供可解释的正确性分数。
检测开源中的AI编码代理:对1.8亿个仓库的多方法普查验证
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出多层面检测框架,整合配置扫描、提交消息分析等四种方法,发现单一信号低估AI代理活动达30倍,揭示不同检测渠道捕获的代理群体几乎不重叠。
Metis: 连接文本与代码记忆以实现自我进化智能体
机构 * The Chinese University of Hong Kong(香港中文大学) ; Huawei(华为) ; Wuhan University(武汉大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出Metis系统,通过分层双表示记忆(文本与代码)平衡构建成本、执行效率和可迁移性,在AppWorld上任务准确率提升20.6%,执行成本降低22.8%。
Comments Work in progress