arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-09-01 至 2026-09-01 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 23 篇

2608.30686 2026-09-01 cs.CR cs.CL 新提交 88%

Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning

超越有效载荷:用户调用如何塑造编码代理对仓库中毒的漏洞

Fukang Zhu, Binbin Zhao, Ruixiao Lin, Ping He, Tianyu Du, Shouling Ji

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.CL

AI总结 该研究推出首个针对编码代理仓库中毒漏洞的基准CIPR,发现漏洞高度依赖用户提示级配置,任务类型可使攻击成功率产生4.5倍差异,测试执行任务为隐蔽攻击面,不明确或嘈杂提示会间接改变风险。

Comments 30 pages,7 figures, Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29675 2026-09-01 cs.SE cs.AI 新提交 84%

Cost-Effective Repository Exploration for Agentic Issue Localization

面向智能体问题定位的高性价比代码仓库探索

Mohammad Nour Al Awad, Sergey Ivanov

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本研究在IssueLoc-Bench上评估5种探索器模型,发现低成本探索器可保留较高定位质量并大幅降低耗时与token用量,支持将仓库探索作为编码智能体的模块化独立阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02875 2026-09-01 cs.AI 版本更新 83%

Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks

交接债务:当编码代理接管被中断任务时的重新发现成本

Dipesh KC, Anjila Budathoki

机构 * Independent Researcher(独立研究者) Georgia State University(佐治亚州立大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 本文通过引入“交接债务”概念,研究编码代理在任务中断后从部分状态恢复时的重新发现成本,并提出一种接管协议来量化不同交接视图对后继代理效率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28795 2026-09-01 cs.SE cs.AI 新提交 81%

The reach of a verification tool decides its value: A controlled study of verification surface, artifact quality, and cost in AI coding agents

验证工具的覆盖范围决定其价值:AI编码智能体中验证面、产物质量与成本的对照研究

Achint Mehta

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 该研究通过构建仅工具列表为受控变量的极简编码智能体,开展对照实验,发现验证工具的覆盖范围需匹配应用实际故障方式才能提升产物质量,且不同验证工具的成本效益存在差异。

Comments 27 pages, 13 figures, 10 tables. Submitted to IEEE Access. Data and code: https://doi.org/10.5281/zenodo.21961590

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27831 2026-09-01 cs.AI cs.LG 版本更新 81%

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

RealSWE:面向真实用户请求的编码智能体组合式评估

Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee

机构 * Sungkyunkwan University(成均馆大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对编码智能体评估基准与真实用户请求的差异,构建了新基准sys并评估7种LLM,发现真实输入降低解决率且改变模型排名,明确陈述期望行为和动机可提升LLM软件工程性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29442 2026-09-01 cs.SE cs.AI cs.HC 版本更新 81%

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

编码助手如何辜负用户:基于20,574个真实会话的开发人员与智能体不一致的大规模分析

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li

机构 * University of Notre Dame(诺丁汉大学) Vanderbilt University(范德比大学) Google(谷歌)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过对20,574个编码助手会话的分析,识别出七种常见的不一致形式,发现大多数不一致导致信任成本而非系统损坏,且多数仍需用户显式纠正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31057 2026-09-01 cs.AI 新提交 79%

Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents

先测量再管理:评估编码智能体的工作记忆

Le Chen, Zishen Wan, Baixi Sun, Xiaolong Ma, Chih-Hsuan Yang, Feng Yan, Sheng Di, Franck Cappello, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Columbia University(哥伦比亚大学) University of Houston(休斯顿大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本研究针对编码智能体工作记忆的语义异质性,提出两种语义感知记忆管理策略,发现校准增益难迁移、相同token预算效果不同等问题,表明评估记忆管理策略需考虑更多维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30701 2026-09-01 cs.SE 新提交 79%

A Phased Workflow for Operating LLM-Based Coding Agents

操作基于大语言模型(LLM)的编码智能体的分阶段工作流

Ante Kapetanovic, Tomislav Duricic, Andro Mercep, Emanuel Lacic

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究提出Infobip团队开发的四阶段编码智能体操作工作流,通过前置人力审查、分阶段上下文管理应对故障,同时指出工作流有效性指标缺失等两个未解决问题。

Comments 2 pages, industry paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28972 2026-09-01 cs.SE 新提交 79%

Legacy System Modernization with Coding Agents: A Case Study

基于编码智能体的遗留系统现代化:一项案例研究

Iago da Silva Rodrigues Alves, Cristiano Politowski, João Eduardo Montandon

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究通过工业案例评估Claude Code智能体迁移企业ERP系统功能的效果,发现其平均等价率70%,低级功能表现优于高级功能,同时探讨了该方法的适用场景及局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19319 2026-09-01 cs.MA cs.AI cs.DB 版本更新 79%

Data Intelligence Agents: Interpreting, Modeling, and Querying Enterprise Data via Autonomous Coding Agents

数据智能代理:通过自主编码代理解释、建模和查询企业数据

Anoushka Vyas, Aarushi Dhanuka, Sina Khoshfetrat Pakazad, Henrik Ohlsson

机构 * C3 AI

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出Data Intelligence Agents (DIA)系统,由三个自主编码代理组成,通过执行、验证和修复工件来压缩数据集成工作流,在七个SQL基准测试中达到或超越最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28632 2026-09-01 cs.AI cs.CL cs.LG 新提交 78%

AutoScientist-Quant: Self-Evolving Coding Agents for Automatic Research in Quantitative Investment

AutoScientist-Quant:用于量化投资自动研究的自进化编码智能体

Zongqian Li, Yaoyiran Li, Yaohui Guo, Ming Zhang, Nigel Collier, Eugene Ie

机构 * Google(谷歌公司) University of Cambridge(剑桥大学)

专题命中 软件智能体 :coding agent(title);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoScientist-Quant是将量化研究视为带预算约束搜索问题的自进化编码智能体,修复了评估流程的前瞻问题,在CSI universe等场景下实现最优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23763 2026-09-01 cs.NI 版本更新 78%

AgenticNet: Utilizing AI Coding Agents To Create Hybrid Network Experiments

AgenticNet:利用AI编码代理创建混合网络实验

Majd Latah, Kubra Kalkan

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 AgenticNet通过AI编码代理提供混合网络实验工具,支持纯模拟、纯仿真和混合模式,提升实验灵活性和开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29831 2026-09-01 cs.CL cs.SE 新提交 76%

A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents

A^2Agent:面向仓库级代码定位智能体的动作感知强化学习方法

Doyeon Kim, Suyoung Bae, Yumin Lee, Jee-Hyong Lee

机构 * College of Computing and Informatics(计算与信息学院) Sungkyunkwan University(成均馆大学)

专题命中 软件智能体 :repository(title);分类 cs.SE、cs.CL

AI总结 A^2Agent是一种动作感知强化学习方法,通过优化奖励与优势估计,在SWE-Bench的两个基准上提升代码定位性能,且4B模型优于更大规模的基线。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08311 2026-09-01 cs.SE cs.AI 版本更新 76%

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy, Andrei Kuznetsov

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) Artificial Intelligence Research Institute(人工智能研究所)

专题命中 软件智能体 :coding agent(title);分类 cs.SE、cs.AI

AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-09-01 cs.SE cs.LG 版本更新 73%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Jiajun Cao, Shihab Rashid, Mononito Goswami, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.LG

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29204 2026-09-01 cs.SE cs.AI 新提交 62%

AgentLogs: A Dataset for Opening the Black Box of GitHub's Cloud Agent

AgentLogs:用于揭开GitHub云智能体黑箱的数据集

Jonan Richards, Kosei Horikawa, Youmei Fan, Yutaro Kashiwa, Mairieli Wessel

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出AgentLogs数据集,包含GitHub上35810个热门仓库的智能体任务、会话及6400余万条日志,可用于研究智能体行为、协作等,填补了智能体贡献过程数据的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-09-01 cs.SE cs.AI 版本更新 62%

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Abhik Roychoudhury, Sungmin Kang, Baishakhi Ray

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29889 2026-09-01 cs.CL 新提交 57%

VibeJam: A User Study Platform for Web Development with Agents

VibeJam:用于智能体辅助Web开发的用户研究平台

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。

Comments EMNLP 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29460 2026-09-01 cs.AI cs.CR cs.CY 新提交 57%

Can escalation channels redirect reward hacking toward defect disclosure?

升级渠道能否将奖励黑客行为转向缺陷披露?

Francesca Gomez

机构 * Wiser Human(怀瑟人类)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究评估升级渠道作为决策环境干预措施,结合反奖励黑客策略可大幅减少编码智能体的奖励黑客行为,同时提升缺陷检测覆盖率,将智能体能力转向缺陷披露而非利用。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28433 2026-09-01 cs.AI cs.LO cs.MA 版本更新 57%

Prove2Me: An Open Collaborative Platform for Scaling Math Formalization

Prove2Me:用于规模化数学形式化的开源协作平台

Shuze Chen, Kunal Marwaha, Xiaoyang Lu, Henry Yuen, Tianyi Peng

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Purdue University(普渡大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 Prove2Me是支持人类与AI智能体协作的开源数学形式化平台,可降低大规模数学形式化的门槛,实现众包式规模化形式化验证。

Comments https://prove2.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-09-01 cs.CL 版本更新 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

Comments Accepted to EMNLP 2026 Main Conference. Code: https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/sherloc

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27787 2026-09-01 cs.MA cs.CL 版本更新 57%

Long Live the Librarian! A Persistent Search Sub-Agent for Energy-Efficient Multi-Agent Software Engineering Systems

图书馆员万岁!面向节能多智能体软件工程系统的持久搜索子智能体

Seunghyuk Cho, Sunghyun Choi, Jaeseung Heo, Youngbin Choi, Saemi Moon, MoonJeong Park, Dongwoo Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 针对多智能体系统中输出令牌冗余导致的高能耗问题,提出持久搜索子智能体Librarian,通过跟踪仓库搜索历史并抑制重复探索,减少输出令牌量,在SWE-Bench Verified上实现高达25%的GPU能耗降低且不损失任务性能。

Comments 2026 EMNLP Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24600 2026-09-01 cs.AI 版本更新 57%

Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qualitative Analysis

Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架

Zhimin Lin, Kun Cheng, Zhiyao Shu, Junhua Fang, Juntao Li, Fan Bai, Jie Gao

机构 * Soochow University(苏州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏