arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 265 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 265 篇

2607.18057 2026-07-21 cs.SE 新提交 57%

Test Coverage Analysis of Agentic Pull Requests

智能拉取请求的测试覆盖分析

Atish Kumar Dipongkor, Talank Baral, Wing Lam, Kevin Moran

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究人工智能编码代理生成的拉取请求的测试覆盖情况,分析4882个相关请求,发现代理包含测试更改比例低,现有测试覆盖不足,代理编写测试仅在少数请求中提升覆盖,错误处理结构测试严重不足,为此提出相关改进措施。

Comments 12 pages, to appear 42nd International Conference on Software Maintenance and Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16740 2026-07-21 cs.SE 新提交 57%

Agentic Code Review in the Terminal: A Trajectory-Level Analysis of Behavior, Cost, and Human-Alignment

终端中的智能代码审查:行为、成本和人工对齐的轨迹级分析

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究终端环境中智能代码审查的行为、成本等,基于审查者轨迹分析,发现智能审查者审查精度高但有探索等开销,成功审查与规划等有关,凸显轨迹感知和成本敏感评估对未来此类系统的好处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16494 2026-07-21 cs.SE 新提交 57%

Personalized Assessments from Personal Artifacts

基于个人工件的个性化评估

Yufan Zhang, Jaromir Savelka, Seth Copen Goldstein, Majd Sakr

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 针对人工智能编码代理发展下学生和从业者对自身代码理解存疑的问题,开发个性化探测谜题($p^3$)方法,经云计算课程测试,该方法能识别理解差距,谜题自动生成、耗时短,后续要关联结果与代码理解并嵌入审查流程。

Comments 6 pages, 3 figures, ECTEL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15970 2026-07-20 cs.CR cs.LG 新提交 57%

Code-Poisoning Property Inference Attacks

代码中毒属性推理攻击

Xukun Luan, Yuhui Gong, Gang Zhang, Zixuan Huang, Yuanguo Bi, Xuesong Li, Jinyan Liu

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computer Science and Engineering, Northeastern University(计算机科学与工程学院,东北大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 研究针对机器学习模型训练数据隐私泄露问题,提出代码中毒属性推理攻击(CPPIA),克服现有工作局限。通过恶意代码提供者使数据持有者下载中毒代码训练模型,对手借此嵌入属性查询模型泄露隐私,该方法攻击准确率高、计算轻量,评估证明其通用性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14570 2026-07-17 cs.AI cs.CR 新提交 57%

Democratizing Agent Deployment Safety: A Structural Monitoring Approach

使智能体部署安全民主化:一种结构监测方法

Preeti Ravindra, Rahul Tiwari, Vincent Wolowski

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。

Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 57%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11046 2026-07-14 cs.SE 新提交 57%

Retrieval-Oriented Code Representations in Agentic Bug Localization

面向检索的智能体漏洞定位中的代码表示

Genevieve Caumartin, Tse-Hsun, Chen, Diego Elias Costa

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究文件级漏洞定位中代码表示的作用,在LCA和SWE数据集上比较五种代码表示,通过实验发现角色感知摘要性价比最佳,结合互补结果和LLM排序可进一步提升效果,案例研究验证技术有效性,强调代码表示应是智能体定位管道的重要设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10839 2026-07-14 cs.SE 新提交 57%

Maintenance and Support in Community-Driven Scientific Pipeline Ecosystems: A Cross-Platform Empirical Study of nf-core

社区驱动的科学管道生态系统中的维护与支持:对nf-core的跨平台实证研究

Khairul Alam, Kowsik Roy, Md Shamimur Rahman, Banani Roy

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究社区驱动的科学管道生态系统nf-core中的维护与支持,通过分析大量GitHub问题、拉取请求及论坛讨论来研究相关问题、解决因素等,发现不同平台作用不同,解决结果与多种因素有关,跨平台分析揭示了内部可追溯性及联系有限的情况。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09553 2026-07-13 cs.SE 新提交 57%

Writing Bug Reports for Software Repair Agents: What Information Matters Most?

为软件修复代理编写错误报告:哪些信息最重要?

Vincenzo Luigi Bruno, Alessandro Giagnorio, Daniele Bifolco, Leon Wienges, Massimiliano Di Penta, Gabriele Bavota

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究软件开发中为软件修复代理编写错误报告的问题,通过对错误报告分类标注,用三个LLM主干运行mini-swe-agent,拟合回归模型,发现定位线索和建议修复等信息对代理成功更重要,传统对人类有用的信息作用较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09123 2026-07-13 cs.SE 新提交 57%

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent:从问题报告中通过工具增强的多阶段代理生成错误重现测试

Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究提出ReProAgent多阶段代理框架,从问题报告生成错误重现测试,将任务分解为四个阶段,集成多种工具支持各阶段,实验表明其能成功重现较多问题,优于基线,还可跨模型泛化并提升下游问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02134 2026-07-13 cs.AI 新提交 57%

Coding-agents can replicate scientific machine learning papers

编码代理可以复现科学机器学习论文

Atharva Hans, Ilias Bilionis

机构 * School of Mechanical Engineering, Purdue University(机械工程学院,普渡大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出Paper-replication工作流,让编码代理以目标驱动方式复现论文的计算声明,通过记录目标、重建方法、运行实验并验证,在四篇论文的12次独立运行中全部完成并通过验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02514 2026-07-10 cs.AI 新提交 57%

Distributed Attacks in Persistent-State AI Control

持久状态AI控制中的分布式攻击

Josh Hills, Ida Caspary, Asa Cooper Stickland

机构 * Constellation Astra Fellowship(Constellation Astra 奖学金) Imperial College London(帝国理工学院) UK AI Security Institute(英国人工智能安全研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究AI编码代理在持久代码库中跨拉取请求分布攻击的威胁,提出Iterative VibeCoding基准,发现单一监控器无法同时防御渐进与非渐进攻击,而状态跟踪监控器可显著降低渐进攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05785 2026-07-08 cs.SE 新提交 57%

Can Large Language Models Generate Observability-Aware Code?

大语言模型能否生成可观测性感知代码?

Yongliang Tao, Hongyu Zhang, Pengfei Gao, Minghua Ma, Zhiyu Fan, Yu Kang, Jue Zhang, Si Qin, Liqun Li, Qingwei Lin, Saravan Rajmohan

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究大语言模型生成的代码在可观测性方面的表现,通过恢复工件和注入故障评估代理生成系统的源级诊断语义与运行时故障信号,发现两者存在差距,引入的技能改进有限,指出当前评估或忽视可观测性这一软件质量维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05120 2026-07-07 cs.CR cs.AI 新提交 57%

Agent Data Injection Attacks are Realistic Threats to AI Agents

智能体数据注入攻击对人工智能智能体构成现实威胁

Woohyuk Choi, Juhee Kim, Taehyun Kang, Jihyeon Jeong, Luyi Xing, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学) Largosoft University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。

Comments 19 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04613 2026-07-07 cs.AI cs.CR 新提交 57%

Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority

受治理的个体化:通过密码学方式将智能体的学习与其授权方解耦

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 研究智能体在部署中学习时,运行系统是否仍受操作员授权限制的问题。提出受治理的个体化方法,通过绑定身份摘要和基于语义效果的动作门控保证限制,证明学习等不会扩大权限,实证验证了该方法效果。

Comments Technical companion report. 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03423 2026-07-07 cs.CR cs.AI 新提交 57%

Securing Multi-Tool AI Agent Chains With Dynamic, Real-Time Compositional Policies

通过动态实时组合策略保护多工具人工智能代理链

Chris Schneider, Kriti Faujdar, Philipp Schoenegger, Ben Bariach

机构 * Microsoft AI(微软人工智能)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究多工具代理链安全问题,提出动态安全控制合成器(DSCC),分两阶段实现组合安全。阶段1在会话检查时合成策略,阶段2在运行时跟踪数据敏感度,提供深度防御,评估了参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02357 2026-07-03 cs.CR cs.SE 新提交 57%

Cloak and Detonate: Scanner Evasion and Dynamic Detection of Agent Skill Malware

伪装与引爆:技能型恶意软件的扫描规避与动态检测

Zimo Ji, Congying Xu, Zongjie Li, Yudong Gao, Xin Wei, Shuai Wang, Shing-Chi Cheung

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 针对LLM编码代理技能市场中的恶意技能,提出两种规避静态扫描的方法(结构混淆和自提取技能打包),并设计基于沙箱运行时行为审计的检测系统SkillDetonate,实现97%检测率与2%误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00334 2026-07-02 cs.AI 新提交 57%

Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems

运行时管理自主性:基于档位的单/多智能体信息物理系统安全与治理

Srini Ramaswamy, Wang Miaosheng

机构 * DNRS.ai, USA

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 提出一种离散时间控制系统,通过五个执行档位和效用门控调度,在单智能体场景中证明单调稳定性、执行安全性和最终稳定,在多智能体CPS中结合治理状态实现分布式安全保证,在UR5机器人装配单元上达到99.6%异常检测率。

Comments to be submitted to a Journal, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00155 2026-07-02 cs.AI cs.GT 新提交 57%

A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry

具有双边信息不对称的情境赌博机监督博弈

Yunjin Tong

机构 * Stanford Graduate School of Business(斯坦福商学院)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 研究AI代理运行时人类监督中的双边信息不对称问题,提出情境赌博机团队博弈模型,刻画了团队最优与短视规则之间的可避免伤害差距,并分析了动态学习与信号传递机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32025 2026-07-01 cs.CL 新提交 57%

Generative Skill Composition for LLM Agents

面向LLM智能体的生成式技能组合

Xinyu Zhao, Zhen Tan, Vaishnav Tadiparthi, Nakul Agarwal, Kwonjoon Lee, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Honda Research Institute USA(本田美国研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 提出SkillComposer方法,将技能组合形式化为任务条件技能序列预测,通过约束自回归解码器联合决定技能子集、数量和顺序,在真实技能库上训练并验证其提升下游任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31182 2026-07-01 cs.AI 新提交 57%

AI-Assisted Discovery of Convex Relaxations via Dual Agents

通过双智能体实现凸松弛的AI辅助发现

Sungyoon Kim, Mert Pilanci

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种双智能体自动研究范式,通过编码智能体提议约束、理论智能体验证并搜索反例,结合区间算术验证,改进了两个优化常数的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28125 2026-06-29 cs.SE cs.CR 新提交 57%

How Humans, Bots, and Agents Communicate About Vulnerabilities in Pull Requests

人类、机器人和代理如何在拉取请求中沟通漏洞

Pien Rooijendijk, Christoph Treude, Mairieli Wessel

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究拉取请求讨论中人类、机器人和编码代理通过显式标识符和隐式安全语言沟通漏洞的方式,并分析其与代码变更及审查活动的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25257 2026-06-25 cs.SE 新提交 57%

How Do Developers Maintain and Evolve Their Agents' Instructions? An Empirical Study

开发者如何维护和演化他们的智能体指令?一项实证研究

Gianmario Voria, Alfonso Cannavale, Andrea De Lucia, Yutaro Kashiwa, Gemma Catolino, Fabio Palomba

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过大规模挖掘研究,分类智能体上下文文件的变更类型,分析其与代码质量的关系及开发周期中的时间模式,为自主编码智能体的治理提供设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-06-24 cs.CL 新提交 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23175 2026-06-23 cs.LG 新提交 57%

Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

立场:正确答案,错误机制——当AI科学家用自身数据反驳其通用主张时

Steven Young Eulig

机构 * Department of Physics and Laboratory for Particle Physics and Cosmology (LPPC), Harvard University(哈佛大学物理系与粒子物理与宇宙学实验室(LPPC))

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 本文通过编码代理在Geant4模拟中重新发现已知粒子识别可观测量的实验,指出仅以最终结果评估AI科学家系统不足,提出需分别衡量任务结果、机制保真度和认知诚实性,并发现正确答案但错误机制(CAWM)现象。

Comments 8 pages body plus 12 pages references and appendix, non-archival upload for ICML 2026 AI for Science workshop, selected as spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22721 2026-06-23 cs.SE 新提交 57%

Habituation at the Gate: Rising Approval and Declining Scrutiny in Human Review of AI Agent Code

门前的习惯化:人类对AI智能体代码审查中批准率上升与审查力度下降

Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过分析400名重复审查者在七个月内对AI生成代码的审查行为,发现批准率从30.1%上升至36.8%,审查评论量下降22%,而等待时间增加3.5倍,表明审查者因工作负荷增加而出现习惯化反应。

Comments 5 pages, 2 figures, 2 tables. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21836 2026-06-23 cs.AR cs.AI 新提交 57%

AgentDSE: Reasoning-Augmented Architectural Design Space Exploration

AgentDSE:推理增强的架构设计空间探索

Chenyu Wang, Jiahe Caroline Shi, David Kong, Duane S. Boning, Zishen Wan, Yilun Du, Vijay Janapa Reddi

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19980 2026-06-19 cs.AI 新提交 57%

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

ENPIRE: 现实世界中智能体机器人策略的自我改进

Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, Guanya Shi

机构 * NVIDIA(英伟达) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出ENPIRE框架,通过环境重置、策略执行、结果验证和迭代优化的闭环反馈,使编码智能体自主改进机器人操作策略,在灵巧操作任务上达到99%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19419 2026-06-19 cs.RO cs.AI 新提交 57%

Playful Agentic Robot Learning

趣味性具身机器人学习

Junyi Zhang, Jiaxin Ge, Hanjun Yoo, Letian Fu, Zihan Yang, Yaowei Liu, Raj Saravanan, Shaofeng Yin, Justin Yu, Dantong Niu, Zirui Wang, Roei Herzig, Ken Goldberg, Yutong Bai, David M. Chan, Ion Stoica, Angjoo Kanazawa, Jiahui Lei, Haiwen Feng, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) Impossible Research

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出RATs框架,让机器人通过自主探索学习可复用技能,在LIBERO-PRO和MolmoSpaces上分别提升20.6和17.0个百分点。

Comments Project page: https://playful-rats.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10728 2026-06-17 cs.SE 新提交 57%

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

DeNovoSWE:扩展长时域环境以从零生成完整仓库

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 提出DeNovoSWE数据集,通过沙盒代理工作流自动构建4818个从文档生成完整仓库的实例,采用分治与批评修复策略及难度感知轨迹过滤,微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准得分从5.8%提升至47.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏