arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12148 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2607.00155 2026-07-02 cs.AI cs.GT 新提交 57%

A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry

具有双边信息不对称的情境赌博机监督博弈

Yunjin Tong

机构 * Stanford Graduate School of Business(斯坦福商学院)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 研究AI代理运行时人类监督中的双边信息不对称问题,提出情境赌博机团队博弈模型,刻画了团队最优与短视规则之间的可避免伤害差距,并分析了动态学习与信号传递机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32025 2026-07-01 cs.CL 新提交 57%

Generative Skill Composition for LLM Agents

面向LLM智能体的生成式技能组合

Xinyu Zhao, Zhen Tan, Vaishnav Tadiparthi, Nakul Agarwal, Kwonjoon Lee, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Honda Research Institute USA(本田美国研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 提出SkillComposer方法,将技能组合形式化为任务条件技能序列预测,通过约束自回归解码器联合决定技能子集、数量和顺序,在真实技能库上训练并验证其提升下游任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31182 2026-07-01 cs.AI 新提交 57%

AI-Assisted Discovery of Convex Relaxations via Dual Agents

通过双智能体实现凸松弛的AI辅助发现

Sungyoon Kim, Mert Pilanci

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种双智能体自动研究范式,通过编码智能体提议约束、理论智能体验证并搜索反例,结合区间算术验证,改进了两个优化常数的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30573 2026-06-30 cs.LG 57%

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

SWE-INTERACT: 将 SWE 基准重新构想为用户驱动的长周期编码会话

Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

机构 * Scale AI

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 提出 SWE-Interact 测试平台,通过用户模拟器模拟多轮交互式软件开发任务,评估编码代理在模糊需求、渐进反馈和迭代修订下的意图发现与自适应能力。

Comments -

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29871 2026-06-30 cs.AI 57%

AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes

AI训练管理器:自适应训练配方的有界闭环控制

Anjali Rao, Nikhil Kamalkumar Advani

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种基于LLM的有界监督控制器,通过结构化遥测和约束动作空间,动态调整学习率、正则化等超参数,解决训练中的过拟合、损失不平衡等问题,在语言建模和强化学习任务中提升性能。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27996 2026-06-30 cs.AI cs.GR cs.HC 57%

Exploring LLM Agent Designs and Interaction Modalities for Scientific Visualization

探索LLM代理在科学可视化中的交互范式

Jackson Vonderhorst, Kuangshi Ai, Haichao Miao, Shusen Liu, Chaoli Wang

机构 * Univ. Notre Dame(诺特难大学) LLNL(劳伦斯利弗莫尔国家实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文研究不同类型的LLM代理在科学可视化任务中的表现,通过评估八种代表性代理在15个基准任务中的可视化质量、效率、鲁棒性和计算成本,发现通用编程代理任务成功率最高但计算成本高,领域专用代理更高效稳定但灵活性差,计算机使用代理在单步任务表现良好但多步流程受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28125 2026-06-29 cs.SE cs.CR 新提交 57%

How Humans, Bots, and Agents Communicate About Vulnerabilities in Pull Requests

人类、机器人和代理如何在拉取请求中沟通漏洞

Pien Rooijendijk, Christoph Treude, Mairieli Wessel

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究拉取请求讨论中人类、机器人和编码代理通过显式标识符和隐式安全语言沟通漏洞的方式,并分析其与代码变更及审查活动的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25257 2026-06-25 cs.SE 新提交 57%

How Do Developers Maintain and Evolve Their Agents' Instructions? An Empirical Study

开发者如何维护和演化他们的智能体指令?一项实证研究

Gianmario Voria, Alfonso Cannavale, Andrea De Lucia, Yutaro Kashiwa, Gemma Catolino, Fabio Palomba

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过大规模挖掘研究,分类智能体上下文文件的变更类型,分析其与代码质量的关系及开发周期中的时间模式,为自主编码智能体的治理提供设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29919 2026-06-25 cs.SE 版本更新 57%

SkillReducer: Optimizing LLM Agent Skills for Token Efficiency

SkillReducer: 优化LLM代理技能的令牌效率

Yudong Gao, Zongjie Li, Yuanyuan Yuan, Zimo Ji, Pingchuan Ma, Shuai Wang

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 针对LLM代理技能中令牌浪费问题,提出SkillReducer两阶段优化框架,通过压缩路由描述和重构技能主体,实现48%描述压缩和39%主体压缩,同时提升功能质量2.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-06-24 cs.CL 新提交 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23175 2026-06-23 cs.LG 新提交 57%

Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

立场:正确答案,错误机制——当AI科学家用自身数据反驳其通用主张时

Steven Young Eulig

机构 * Department of Physics and Laboratory for Particle Physics and Cosmology (LPPC), Harvard University(哈佛大学物理系与粒子物理与宇宙学实验室(LPPC))

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 本文通过编码代理在Geant4模拟中重新发现已知粒子识别可观测量的实验,指出仅以最终结果评估AI科学家系统不足,提出需分别衡量任务结果、机制保真度和认知诚实性,并发现正确答案但错误机制(CAWM)现象。

Comments 8 pages body plus 12 pages references and appendix, non-archival upload for ICML 2026 AI for Science workshop, selected as spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22721 2026-06-23 cs.SE 新提交 57%

Habituation at the Gate: Rising Approval and Declining Scrutiny in Human Review of AI Agent Code

门前的习惯化:人类对AI智能体代码审查中批准率上升与审查力度下降

Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过分析400名重复审查者在七个月内对AI生成代码的审查行为,发现批准率从30.1%上升至36.8%,审查评论量下降22%,而等待时间增加3.5倍,表明审查者因工作负荷增加而出现习惯化反应。

Comments 5 pages, 2 figures, 2 tables. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21836 2026-06-23 cs.AR cs.AI 新提交 57%

AgentDSE: Reasoning-Augmented Architectural Design Space Exploration

AgentDSE:推理增强的架构设计空间探索

Chenyu Wang, Jiahe Caroline Shi, David Kong, Duane S. Boning, Zishen Wan, Yilun Du, Vijay Janapa Reddi

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19980 2026-06-19 cs.AI 新提交 57%

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

ENPIRE: 现实世界中智能体机器人策略的自我改进

Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, Guanya Shi

机构 * NVIDIA(英伟达) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出ENPIRE框架,通过环境重置、策略执行、结果验证和迭代优化的闭环反馈,使编码智能体自主改进机器人操作策略,在灵巧操作任务上达到99%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19419 2026-06-19 cs.RO cs.AI 新提交 57%

Playful Agentic Robot Learning

趣味性具身机器人学习

Junyi Zhang, Jiaxin Ge, Hanjun Yoo, Letian Fu, Zihan Yang, Yaowei Liu, Raj Saravanan, Shaofeng Yin, Justin Yu, Dantong Niu, Zirui Wang, Roei Herzig, Ken Goldberg, Yutong Bai, David M. Chan, Ion Stoica, Angjoo Kanazawa, Jiahui Lei, Haiwen Feng, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) Impossible Research

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出RATs框架,让机器人通过自主探索学习可复用技能,在LIBERO-PRO和MolmoSpaces上分别提升20.6和17.0个百分点。

Comments Project page: https://playful-rats.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16136 2026-06-19 cs.SE 57%

Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Fixing

视觉即修复:基于多模态大语言模型的视觉软件问题修复

Kai Huang, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 本文提出GUIRepair方法,通过多模态推理解决视觉软件问题,结合图像到代码和代码到图像的组件提升故障理解和修复验证。

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10728 2026-06-17 cs.SE 新提交 57%

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

DeNovoSWE:扩展长时域环境以从零生成完整仓库

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 提出DeNovoSWE数据集,通过沙盒代理工作流自动构建4818个从文档生成完整仓库的实例,采用分治与批评修复策略及难度感知轨迹过滤,微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准得分从5.8%提升至47.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16839 2026-06-16 cs.SE 新提交 57%

Towards LLM Accelerated Rapid Reviews for Software Tool Discovery -- Case for Log Anomaly Detection

面向软件工具发现的LLM加速快速综述——以日志异常检测为例

Jesse Nyyssölä, Hamza Bin Mazhar, Alexander Bakhtin, Matteo Esposito, Nana Reinikainen, Yuqing Wang, Ying Song, Davide Taibi, Mika Mäntylä

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 提出一种结合LLM筛选和编码代理的流水线,用于快速识别和运行软件工具,在日志异常检测案例中实现高效综述。

Comments 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16358 2026-06-16 cs.CR cs.AI cs.ET cs.MA 新提交 57%

The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs

代理知道太多:用认证TEE密封LLM API路由器

Sipeng Xie, Qianhong Wu, Hengrun Lu, Ziliang Sun, Qi Wu, Bo Qin, Qin Wang

机构 * Beihang University(北京航空航天大学) Renmin University of China(中国人民大学) Independent(独立)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 针对API路由器作为应用层中间人可窃取明文交互的问题,提出AEGIS,一种提供者透明的认证API路由器,通过硬件飞地保护数据路径,客户端验证飞地后释放明文,阻止所有恶意路由器攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15376 2026-06-16 cs.DC cs.AI cs.MA 新提交 57%

CoAgent: Concurrency Control for Multi-Agent Systems

CoAgent: 多智能体系统的并发控制

Hongtao Lyu, Dingyan Zhang, Mingyu Wu, Xingda Wei, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 针对多智能体LLM系统并发访问共享状态时的冲突问题,提出MTPO协议,通过智能体自身判断冲突并修复计划,实现可串行化执行,在保持近串行正确率的同时提升速度。

Comments 14 pages, 7 figures. Submitted to ATC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14000 2026-06-15 cs.AI 新提交 57%

Formalizing Numerical Analysis: An Agent Pipeline and Quality Audit Beyond Kernel Acceptance

数值分析的形式化:超越内核接受的智能体流水线与质量审计

Theodore Meek, Siyuan Ge, Di Qiu Xiang, Simon Chess, Vasily Ilin

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种编码智能体流水线,将数值分析教材形式化为Lean 4代码,并引入三维质量评估框架(语义正确性、Mathlib复用、跨文件复用),发现编译通过掩盖了不忠实的形式化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13643 2026-06-12 cs.CL 新提交 57%

Recursive Agent Harnesses

递归智能体框架

Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 提出递归智能体框架(RAH),通过代码优先的框架递归扩展模型递归,在长上下文推理中显著提升编码智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12834 2026-06-12 cs.AI 新提交 57%

Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement

神奇的科学智能体及其构建方法:用于Rietveld精修的AgentBuild

Woong Shin, Craig A. Bridges, Marshall T. McDonnell, Rafael Ferreira da Silva

机构 * UT-Battelle, LLC(UT-Battelle有限责任公司) US Department of Energy (DOE)(美国能源部)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出AgentBuild框架,通过科学家编写的合同(包含评分标准、课程和知识库)自动构建科学智能体,用于X射线衍射数据的Rietveld精修,实现可复用的智能体编译而非手动调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11476 2026-06-11 cs.SE 新提交 57%

SentTrack: Sentiment-Driven Bottleneck Detection in GitHub Issue Repositories

SentTrack: GitHub问题仓库中情感驱动的瓶颈检测

Xinyu Hu, Ali Behbahani, Daniel Moon, Yaren Dogan, Nasir U. Eisty

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 提出SentTrack双管道框架,结合大语言模型摘要与ABCDE交互分类,从约9000个GitHub问题线程中检测社会技术瓶颈,发现49%线程停滞,仅13%解决,并通过加权评分引擎优先处理高摩擦讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01459 2026-06-11 eess.SY cs.SE cs.SY 版本更新 57%

Semantic Technologies in Practical Demand Response: An Informational Requirement-based Roadmap

实际需求响应中的语义技术:基于信息需求的路标图

Ozan Baris Mulayim, Anand Krishnan Prakash, Yuvraj Agarwal, Mario Bergés, Marco Pritoni, Derek Supple, Steve Schaefer, Mitali Shah

专题命中 软件智能体 :software agent(abstract);分类 cs.SE

AI总结 本文针对商业建筑激励型需求响应,通过形式化本体评估方法定义信息需求,评估现有本体(Brick、DELTA、EFOnt、CIM)的不足,并提出扩展与整合路标图以增强语义互操作性。

Comments Accepted at ACM eEnergy 2026. Not yet published/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09935 2026-06-10 cs.CR cs.AI 新提交 57%

GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

GitInject: AI驱动的CI/CD流水线中的真实提示注入攻击

Jafar Isbarov, Umid Suleymanov, Ilia Shumailov, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工学院) AI Sequrity Company(AI安全公司)

专题命中 软件智能体 :repository(abstract);分类 cs.AI

AI总结 提出GitInject框架,在真实GitHub工作流中评估AI代理的提示注入漏洞,发现所有测试提供商均存在结构性风险,并给出最低成本防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27532 2026-06-08 cs.SE 版本更新 57%

A Longitudinal Analysis of Good First Issue Practices and Newcomer Pull Requests in Popular OSS Projects

对流行开源软件项目中良好首次问题实践和新成员拉取请求的纵向分析

Hirotatsu Hoshikawa, Hidetake Tanaka, Kazumasa Shimari, Raula Gaikovina Kula, Kenichi Matsumoto

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究分析了37个流行GitHub仓库中406826个问题和1117个新成员GFI拉取请求,发现GFI标签比例在2024年后显著下降,但新成员参与度稳定,但拉取请求合并率下降,表明GFI基于的入职机制需持续维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05249 2026-06-05 cs.SE 57%

SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code

SWE-InfraBench:评估语言模型在云基础设施代码上的表现

Natalia Tarasova, Enrique Balp-Straffon, Aleksei Iancheruk, Yevhenii Sielskyi, Nikita Kozodoi, Liam H. Byrne, Jack Butler, Dayuan Jiang, Marcin Czelej, Andrew Ang, Yash Shah, Roi Blanco, Sergei Ivanov

专题命中 软件智能体 :code generation(abstract);分类 cs.SE

AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。

Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06310 2026-06-04 cs.SE 57%

Trustworthy AI Software Engineers

可信赖的AI软件工程师

Aldeida Aleti, Baishakhi Ray, Rashina Hoda, Simin Chen

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文探讨AI代理作为软件工程师的信任问题,提出以证据为中心的检查方法,从技术质量、透明度、认知谦逊和社会伦理等维度定义可信赖性。

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03394 2026-06-03 cs.SE 57%

Human-AI Collaboration and the Transformation of Software Engineering Work

人机协作与软件工程工作的转型

Mamdouh Alenezi

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文通过结构化综合分析方法,研究了生成式AI和智能体AI如何将软件工程从以人类编写代码为中心转变为以指导、验证和管理自主及半自主系统为中心,并提出了一个包含技术、认知、社会技术、治理和组织五个维度的未来工程师能力框架。

详情

展开后加载摘要…

URL PDF HTML 收藏