arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3232 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3232 篇

2502.00350 2026-08-20 cs.SE cs.AI 81%

OrcaLoca: An LLM Agent Framework for Software Issue Localization

Zhongming Yu, Hejia Zhang, Yujie Zhao, Hanxian Huang, Matrix Yao, Ke Ding, Jishen Zhao

机构 * University of California, San Diego, USA(加州大学圣迭戈分校) Intel Corporation(英特尔公司)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 81%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17075 2026-08-19 cs.CL cs.AI 新提交 81%

Foundation Agents Meet Agentic Deep Research: Evidence-Grounded Clinical Code Forecasting

基础智能体与智能型深度研究结合:基于证据的临床代码预测

Junda Wang, Meysam Ghaffari, Akshat Choube, Mohsen Sharifi Renani, Hong Yu, Carlos Morato

专题命中 软件智能体 :agentic(title);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ICD-Deepresearch工作流,结合EHR基础模型、语言基础模型与医学搜索工具,在MIMIC-III、MIMIC-IV数据集上实现ICD编码预测,其检索证据的医生有用性评分优于对比系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 81%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12440 2026-08-18 cs.SE cs.AI 版本更新 81%

Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review

采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究

Joel Abenhaim

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。

Comments 14 pages, 4 figures, 3 tables. v2: added plain-text log URLs in Section 10 for LLM readability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13228 2026-08-14 cs.AI cs.LG 新提交 81%

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试

Saveliy Batruin

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12355 2026-08-14 cs.HC cs.AI cs.SE 新提交 81%

Humans are Missing from AI Coding Agent Research

AI编码智能体研究中缺失了人类

Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 81%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08311 2026-08-12 cs.SE cs.AI 版本更新 81%

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy, Andrei Kuznetsov

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08377 2026-08-11 cs.AI cs.CL 版本更新 81%

SkillClaw: Let Skills Evolve Collectively with Agentic Evolver

SkillClaw: 让技能与代理进化者共同进化

Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu

机构 * DreamX Team(DreamX团队)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06410 2026-08-10 cs.AI cs.CL cs.MA 新提交 81%

ADIAS: Automated Design of Interactive Agentic Systems

ADIAS:交互式智能体系统的自动化设计

Lekang Jiang, Bohan Tang, Stephan Goetz, Yiwen Guo

机构 * University of Cambridge(剑桥大学) Tencent(腾讯)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对现有智能体设计方法的缺陷,提出以问题为中心的优化方案,构建ADIAS框架,在五个交互式基准中较最强基线平均提升25.2%,消融实验验证了关键机制的有效性。

Comments 23 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05204 2026-08-10 cs.AI cs.LG 版本更新 81%

SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse

SkillTrace:面向LLM智能体技能复用的多溯源审计

Jialuo Chen, Minghe Wang, Lingqi Jiang, Jianan Ma, Xinhao Deng, Xiaohu Du, Ruixiao Lin, Yunhao Feng, Linkang Du, Jingyi Wang

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SKILLTRACE框架,通过提取三种溯源审计LLM智能体技能复用,在SKILLTRACE-BENCH上取得高指标,野外审计显示其能生成更具操作性的复用审查队列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05886 2026-08-07 cs.SE cs.AI 新提交 81%

CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体

Wuya Chen, Yihao yang, Yang Cao, Yue Lin

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04032 2026-08-06 cs.AR cs.AI cs.MA cs.SE 新提交 81%

EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

EDATracer:用于大规模EDA工件分析的智能体框架

Phat Tieu, Sayanti Jana, Matthew DeLorenzo, Jiawen Wu, Narendran Srinivasan, Srinivas Shakkottai, Jiang Hu, Jeyavijayan Rajendran

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出EDATracer框架,将EDA工件组织为知识图谱搭配语义向量索引,构建含2787个开源芯片设计的18.9GB数据集及90题基准,使LLM智能体跨工件检索证据,准确率优于Cursor、Claude Code且token用量更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00195 2026-08-06 cs.CR cs.AI cs.SE 版本更新 81%

Formal Analysis and Supply Chain Security for Agentic AI Skills

代理AI技能的正式分析与供应链安全

Varun Pratap Bhardwaj

机构 * Independent Research(独立研究)

专题命中 软件智能体 :agentic(title);agent(abstract_cn);分类 cs.AI、cs.SE

AI总结 SkillFortify是首个用于代理技能供应链的形式化分析框架,通过六大贡献提升安全性和检测效率。

Comments 32 pages, 5 theorems with full proofs, 68 references, open-source tool: https://github.com/qualixar/skillfortify

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00267 2026-08-04 cs.SE cs.CL 新提交 81%

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。

Comments Project page: https://loopsbench.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16169 2026-08-04 cs.LG cs.AI 版本更新 81%

When Does Muon Help Agentic Reinforcement Learning?

μ子何时有助于智能体强化学习?

Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 研究μ子在稀疏奖励智能体强化学习中的作用,通过与AdamW对比,发现在组内组策略优化下,μ子应用于隐藏权重矩阵能提升成功率,效果与优势估计器、学习率有关,表明其可使智能体RL受益,还需多种子和跨任务验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28271 2026-07-31 cs.SE cs.AI 新提交 81%

Agentic Method for Deterministic Validation of Legacy Code Migration

用于遗留代码迁移确定性验证的智能体方法

Andras Ferenczi, Jordan Docherty, Mariya Bessonov, Matthew Findlay, Krishna Lingamneni

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出名为Locksmith Loop的智能体测试合成方法,通过在三项COBOL-Java案例研究中提升测试覆盖率,实现了遗留代码迁移的确定性验证。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27250 2026-07-31 cs.SE cs.AI 新提交 81%

Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories

上下文文件对编码智能体有帮助吗?针对真实仓库的双智能体消融研究

Prakhar Khatri

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本研究通过双智能体(Claude Code、Codex)的受控消融实验,发现上下文文件对编码智能体的正确性无显著提升,其失败源于实现技能而非知识缺失,还解释了过往研究矛盾的原因并公开了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27167 2026-07-30 cs.SE cs.CL 新提交 81%

SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

SpecFirst:将行为规范提取作为从零开始的基于智能体的程序合成中的一等步骤

Yihao Chen, Shi Chang, Feng Lin, Khaled Chawa, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 SpecFirst是将行为规范提取设为独立前置阶段的两阶段框架,在ProgramBench上显著提升了从零开始的程序合成的测试通过率与二进制探索覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25032 2026-07-29 cs.SE cs.AI 新提交 81%

Authoring Agent Skills: A Software-Engineering Approach

编写智能体技能:一种软件工程方法

Giuseppe Destefanis

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究如何编写智能体技能,遵循软件工程原则,以Claude Code为参考实现阐述技能结构等,与其他塑造智能体行为机制比较并给出选择规则,还介绍评估驱动编写过程等,为智能体技能编写提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22807 2026-07-28 cs.SE cs.CL 新提交 81%

The Best Programming Language for Tokenmaxxing: An Investigation of Coding Agent Behavior Across Programming Languages

用于Tokenmaxxing的最佳编程语言:跨编程语言的编码代理行为研究

Zixuan Wu, Carolyn Jane Anderson, Arjun Guha

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 研究跨Python、Java、Rust和OCaml的编码代理行为,通过评估五个模型发现不同语言的令牌消耗有显著差异。分析代理轨迹结构与内容,揭示其在不熟悉语言中的行为特点,指出按语言的令牌效率对多语言代理基准测试和开发有指导意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21832 2026-07-27 cs.SE cs.LG 新提交 81%

How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究

Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse Khomh

机构 * Polytechnique Montréal(蒙特利尔大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG、cs.SE

AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21482 2026-07-27 cs.AI cs.CL 版本更新 81%

Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks

无需云端的智能编码:在纵向数据准备任务中评估开放权重的大语言模型

Mack Nixon, Liam Wright, Yevgeniya Kovalchuk, Alison Fang-Wei Wu, Martin Danka, Andy Boyd, David Bann

专题命中 软件智能体 :agentic(title);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究在纵向数据准备任务中评估开放权重的大语言模型,介绍开源框架,含真实数据集、任务定义和评估程序,通过基准测试发现当前先进模型表现良好,为治理受限研究中的AI辅助数据准备提供可行路径。

Comments Presented at SLLS 2026; accepted at CLS 2026 and RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21302 2026-07-23 cs.CR cs.AI cs.SE 81%

Locus: Agentic Predicate Synthesis for Directed Fuzzing

Locus:面向定向模糊测试的代理谓词合成

Jie Zhu, Chihao Shen, Ziyang Li, Jiahao Yu, Yizheng Chen, Kexin Pei

机构 * University of Chicago(芝加哥大学) University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学) Northwestern University(西北大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 Locus通过合成语义谓词提升定向模糊测试效率,发现多个未修补漏洞。

Journal ref ICSE '26: 2026 IEEE/ACM 48th International Conference on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29538 2026-07-20 cs.SE cs.AI 版本更新 81%

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) Microsoft(微软)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14890 2026-07-17 cs.AI cs.SE 新提交 81%

Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control

证明或停止:不要信任代理,信任证据——用于可验证证据门控生命周期控制的循环工程

Jek Huang, Jeffery Hsia, Jiayi Sun, Freddie Shi, Wei Huang, Ian H. White

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究自主编码代理多步骤软件工作中生命周期状态缺乏证据支持的问题,提出证明或停止生命周期控制方法,经实验评估,该方法能有效控制生命周期转换,支持其作为与模型无关、主机中立的控制层。

Comments 48 pages, 10 figures, 29 numbered tables. Preprint v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14167 2026-07-17 cs.SE cs.AI 新提交 81%

Structured Feedback Improves Repair in an LLM Agent Loop

结构化反馈改进大语言模型智能体循环中的修复

Jaideep Ray, Ankit Goyal

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究大语言模型智能体验证与调用接口问题,提出VeriHarness代码控制智能体循环。通过比较原始诊断与含失败位置等信息的反馈,发现含三个字段反馈能大幅提升成功率,多数增益源于可接受替代方案,JSON语法本身对修复无显著作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12747 2026-07-15 cs.AI cs.CL 新提交 81%

Tracing Agentic Failure from the Flow of Success

从成功流中追溯智能体失败

Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 研究基于大语言模型的智能体系统失败归因问题,提出OAT方法将其转化为单类学习,用神经控制微分方程建模成功轨迹动态模式,实验表明该方法比基线快且F1分数更高,是诊断智能体系统失败的有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12605 2026-07-15 cs.SE cs.AI 新提交 81%

Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs

通过代码属性图和时间执行图进行多视角智能程序修复

Zhili Huang, Ling Xu, Hongyu Zhang

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。

Comments 12 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏