arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1096 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2602.17902 2026-08-11 cs.AI cs.MA cs.SE physics.chem-ph 版本更新 62%

El Agente Gráfico: A Semantic Execution Runtime for Scientific Agents

图形代理:用于科学代理的结构化执行图

Jiaru Bai, Abdulrahman Aldossary, Thomas Swanick, Marcel Müller, Yeonghun Kang, Changhyeok Choi, Naruki Yoshikawa, Zijian Zhang, Jin Won Lee, Tsz Wai Ko, Aiwei Yin, Mohammad Ghazi Vakili, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06811 2026-08-10 cs.SE cs.AI 新提交 62%

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

在软件问题解决的大语言模型智能体中耦合规划与情景记忆

Jiahao Zhang, Yifan Zhang, Yu Huang

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09297 2026-08-07 cs.SE cs.AI 版本更新 62%

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO:软件工程中代理技能的多目标优化

Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang

机构 * King's College London(伦敦国王学院) Queen's University Belfast(贝尔法斯特女王大学) Nanjing University(南京大学) Johannes Gutenberg University Mainz(美因茨约翰尼斯·古滕贝格大学) University College London(伦敦大学学院) University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SkillMOO框架,通过LLM提议的编辑和NSGA-II算法优化代理技能包,提升任务成功率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04942 2026-08-06 cs.LG cond-mat.mtrl-sci cond-mat.other cs.AI physics.chem-ph 新提交 62%

CheMLFlow: An Open-Source Platform for Cheminformatics and Materials Informatics Applications

CheMLFlow:用于化学信息学与材料信息学应用的开源平台

Brendan Smith, Susana Lopez-Moreno, Eric Dolores-Cuenca, Sangil Kim, Jose L. Mendoza-Cortes, Nijamudheen Abdulrahiman

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 CheMLFlow是用于构建端到端高通量智能体工作流的开源平台,可降低科学机器学习开发的编排开销,其在多类性质预测任务上达到文献性能,还支持非分子化学数据集的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03222 2026-08-05 cs.SE cs.AI 新提交 62%

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启

Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02685 2026-08-05 cs.SE cs.AI 新提交 62%

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

BulkPR-Bench:针对交互拉取请求的队列级治理基准

Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。

Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02677 2026-08-05 cs.SE cs.AI cs.MA 新提交 62%

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review

当策略改变概率时:用于LLM代码审查的模块化决策

Rasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对LLM代码审查,测试4种审查界面的策略与概率分离情况,提出模块化流水线可提升概率准确性、降低损失,验证了风险与行动分离评估的必要性。

Comments 20 pages, 6 figures; includes technical appendices. Code and data: https://github.com/rasvik/when-policies-change-probabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00101 2026-08-04 cs.AI cs.LG 新提交 62%

Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析

Banruo Liu, Haoran Qiu, Íñigo Goiri, Rodrigo Fonseca, Ricardo Bianchini, Esha Choukse

机构 * Microsoft Azure Research(微软Azure研究院) Microsoft Azure(微软Azure)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22917 2026-07-31 cs.AI cs.LG cs.MA 版本更新 62%

Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams

智能体团队工作区:面向长期存在的编码智能体团队的自动化持久工作区

Shouren Wang

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对Claude Code等大语言模型智能体在长期工作流程中存在的问题,提出ATWZ,通过围绕其原生智能体团队构建基于文件系统的操作层,保存智能体工作状态等,解决相关问题并减少提示编写工作量。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新 62%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07809 2026-07-28 cs.CL cs.LG 版本更新 62%

No Optimal Language Set Exists for Multilingual Instruction Tuning: Insights from a Linguistically-Informed Study

多语言指令微调不存在最优语言集:基于语言信息研究的见解

Gürkan Soykan, Gözde Gül Şahin

专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.LG

AI总结 研究多语言指令微调中语言集选择问题,通过评估基于多种特征的语言信息选择策略与随机基线对比,发现固定预算下无通用语言选择策略,性能因任务和模型而异,超阈值加语言会致性能下降,还讨论了相关影响和评估陷阱。

Comments 7 pages, 4 figures Updated the title and revised the manuscript for submission to the Workshop on Insights from Negative Results in NLP (Insights 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21656 2026-07-27 cs.SE cs.AI 新提交 62%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 62%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19837 2026-07-23 cs.AI cs.CR cs.LG 新提交 62%

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

了解你的智能体:基于侦察的人工智能智能体渗透测试

Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能智能体的渗透测试,提出通过形式化智能体侦察,在KYA框架中利用探测、构建配置文件等实现黑盒侦察驱动的渗透测试自动化,并进行评估与发布,以提升智能体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18213 2026-07-21 cs.CL cs.SE 新提交 62%

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro:编码语言模型已知道该修剪什么

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。

Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17686 2026-07-21 cs.SE cs.AI 新提交 62%

Integrating High-Level Requirements to Low-Level Tests with Machine-Readable V&V Specifications

通过机器可读的验证与确认规范将高级需求集成到低级测试中

Mansur Arief, Nur Ahmad Khatim, Ali Akarma, Ahmad Alfan Alfian Irfan

机构 * Systems Engineering, King Fahd University of Petroleum Faculty of Computer Information Systems Islamic University of Madinah Madinah, Saudi Arabia Division of Information Science, Nara Institute of Science

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对人工智能和网络物理系统中高级需求与低级测试脱节问题,提出VNVSpec开源框架,使V&V规范机器可读可执行,能检查需求质量、链接需求与测试结果等,通过自我应用评估并可扩展用于相关测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29538 2026-07-20 cs.SE cs.AI 版本更新 62%

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) Microsoft(微软)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI

AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14890 2026-07-17 cs.AI cs.SE 新提交 62%

Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control

证明或停止:不要信任代理,信任证据——用于可验证证据门控生命周期控制的循环工程

Jek Huang, Jeffery Hsia, Jiayi Sun, Freddie Shi, Wei Huang, Ian H. White

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究自主编码代理多步骤软件工作中生命周期状态缺乏证据支持的问题,提出证明或停止生命周期控制方法,经实验评估,该方法能有效控制生命周期转换,支持其作为与模型无关、主机中立的控制层。

Comments 48 pages, 10 figures, 29 numbered tables. Preprint v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06101 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 62%

Agents That Teach: Towards Designing Incidental Learning Back into AI-Assisted Software Development

教学型智能体:将偶然学习重新融入人工智能辅助软件开发的设计探索

Rohit Mehra, Samdyuti Suri, Prithviraj K Tagadinamani, Kapil Singi, Vikrant Kaulgud, Adam P. Burden

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, USA(Accenture,美国)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 探讨人工智能编码智能体使开发者过度依赖而失去偶然学习机会并积累知识债务的问题,提出六项设计原则,展示基于“教学型智能体”概念的“SHIELD”系统,推动形成生产力与学习互补的学习感知开发环境。

Comments 5 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (New Ideas and Emerging Results Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05744 2026-07-08 cs.CR cs.AI cs.SE 新提交 62%

Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations

模型上下文协议中工具元数据负载的Unicode标签块隐藏:三个独立服务器实现之间的批准视图保真度差距

Mohammadreza Rashidi

机构 * Department of Computer Science(计算机科学系) AI and Media Analysis Lab(人工智能与媒体分析实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究模型上下文协议中工具元数据负载隐藏问题,通过无模型无协议分析发现Unicode的TAG块可实现隐藏,构建概念验证并在不同元数据表面实现8种技术,验证其能突破客户端防御,且在三个独立服务器库中结果一致。

Comments 15 pages, 4 figures, 7 tables, 5 listings. Real-protocol proof-of-concept, 8 techniques across 3 independently developed MCP server libraries with 32 of 32 cross-library outcome cells agreeing, and 0 of 25 baseline false positives on a benign corpus. Data, harness, and fail-closed verifier released as a supplementary artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05666 2026-07-08 cs.SE cs.AI 新提交 62%

What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requests

人工智能代理实际改变了什么?性能改进拉取请求中突变模式的实证分类法

Illia Dovhoshliubnyi, Nima Soroush, Ashkan Sami, Alexander Brownlee

机构 * Edinburgh Napier University(爱丁堡纳皮尔大学) University of Stirling(斯特林大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究聚焦人工智能编码代理这一黑箱,通过对33596个代理拉取请求中1254个性能相关差异块进行分类,发现主导的三类突变模式,揭示代理身份和目标策略对缩小基于搜索的软件工程操作空间有参考价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05456 2026-07-08 cs.AI cs.CL q-bio.QM 新提交 62%

Prompt-to-Paper: Agentic AI System for Bioinformatics

从提示到论文:用于生物信息学的智能AI系统

Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03780 2026-07-07 cs.SE cs.AI 新提交 62%

SkillFab: An Agent-Native Skill Production Platform

SkillFab:一个原生代理技能生产平台

Anjie Xu, Yifeng Cai, Yi Li, Zixing Wang, Zhiyu Zhang, Jingfan Chen, Ruohan Xu, Leye Wang

机构 * Peking University(北京大学) Huawei(华为) Northwestern Polytechnical University(西北工业大学) Zhongguancun Academy(中关村学院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SkillFab是原生代理平台,将缺失能力转化为可复用技能。运行时代理先找技能,无则提需求,经SkillFab管理库等流程开发,通过多界面暴露相同生命周期,使工作可审查可恢复,还介绍了平台及案例。

Comments 12 pages, 7 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02703 2026-07-07 cs.SE cs.AI cs.DC cs.MA 新提交 62%

LLMoxie: Exploring Agentic AI for Scientific Software Development

LLMoxie:探索用于科学软件开发的智能AI

Landung Setiawan, Anant Mittal, Cordero Core, Anshul Tambay, Carlos Garcia Jurado Suarez, David A. C. Beck, Andrew J. Connolly, Vani Mandava

机构 * eScience Institute University of Washington(eScience研究院华盛顿大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对科学软件开发中现有AI编码代理的不足,介绍LLMoxie平台及其插件生态系统,通过实践总结多域研究软件工程师中心采用智能AI的挑战、平台设计及操作经验,提升AI编码代理能力。

Comments 9 pages, 4 figures. Accepted to ACM SIGKDD 2026 Workshop: Agentic AI for Scientific and Societal Advances (SciSoc Agents and LLMs). Describes an agentic AI platform for scientific software engineering with governed multi-cloud inference, structured multiagent workflows, and domain-aware coding support (cs.SE, cs.MA, cs.AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01087 2026-07-07 cs.SE cs.AI 新提交 62%

Cheap Code, Costly Judgment: A Case Study on Governable Agentic Software Engineering

廉价代码,昂贵判断:可控代理软件工程案例研究

James C. Davis, Paschal C. Amusuo, Tanmay Singla, Berk Çakar, Kirsten A. Davis

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 通过12周案例研究,提出治理转换理论模型,解释专家工程师如何利用AI编码代理实现高速开发并保持可控性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30963 2026-07-01 cs.SE cs.AI 新提交 62%

Loc2Repair: A Framework for Evaluating the Impact of File-Level Issue Localization in Repo-Level LLM Repair

Loc2Repair:评估文件级问题定位在仓库级LLM修复中影响的框架

Mohammad Nour Al Awad, Sergey Ivanov

机构 * ITMO University(ITMO大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出Loc2Repair模块化评估框架,通过解耦定位与修复,在SWE-bench Verified上验证文件级定位能一致提升修复率(44.7%→49.1%)并降低平均耗时。

Comments To appear in the Proceedings of the Generative Code Intelligence Workshop (GeCoIn 2026), co-located with the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026), Bremen, Germany, August 15--17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04126 2026-07-01 cs.CL cs.AI cs.CV 版本更新 62%

InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training

InfiniteWeb: 面向GUI智能体训练的可扩展Web环境合成

Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang, Zongyu Guo, Jiahao Li, Bin Li, Yan Lu

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 提出InfiniteWeb系统,通过统一规范、任务驱动测试和多样化种子设计自动生成功能完备的Web环境,解决GUI智能体训练数据稀缺问题,在OSWorld和Online-Mind2Web上取得显著性能提升。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13932 2026-06-30 cs.SE cs.AI 62%

Code Reasoning for Software Engineering Tasks: A Survey and A Call to Action

代码推理用于软件工程任务:调查与呼吁行动

Saurabh Pujar, Ira Ceka, Irene Manotas, Gail Kaiser, Baishakhi Ray, Shyam Ramji

机构 * IBM Columbia University(哥伦比亚大学)

专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文调查代码推理技术,探讨其在软件工程任务中的影响,提出未来研究方向。

Comments Published in Transactions on Machine Learning Research (06/2026) 40 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06090 2026-06-30 cs.SE cs.AI cs.PF 62%

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?

Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Google(谷歌)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。

Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09774 2026-06-29 cs.AI cs.CL 新提交 62%

Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters

SIGA: 用于科学模拟的自演化编码智能体适配器

Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏