arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 497 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 497 篇

2606.19419 2026-06-19 cs.RO cs.AI 新提交 83%

Playful Agentic Robot Learning

趣味性具身机器人学习

Junyi Zhang, Jiaxin Ge, Hanjun Yoo, Letian Fu, Zihan Yang, Yaowei Liu, Raj Saravanan, Shaofeng Yin, Justin Yu, Dantong Niu, Zirui Wang, Roei Herzig, Ken Goldberg, Yutong Bai, David M. Chan, Ion Stoica, Angjoo Kanazawa, Jiahui Lei, Haiwen Feng, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) Impossible Research

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出RATs框架,让机器人通过自主探索学习可复用技能,在LIBERO-PRO和MolmoSpaces上分别提升20.6和17.0个百分点。

Comments Project page: https://playful-rats.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07314 2026-06-08 cs.SE cs.ET quant-ph 新提交 83%

QBugLM: An Agentic Benchmarking Framework for LLM-based Quantum Software Debugging

QBugLM:基于LLM的量子软件调试的智能基准测试框架

An B. B. Pham, Hoa T. Nguyen, Muhammad Usman

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出QBugLM多智能体框架,自动化量子软件调试流程,通过案例研究评估LLM调试能力,发现迭代反馈显著提升修复成功率。

Comments This paper was accepted at IEEE QSW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10569 2026-07-14 cs.SE cs.AI cs.LG 新提交 83%

When Does Restricting a Coding Agent to execute_code Help? A Regime $\times$ Agent-Design Ablation

限制编码代理执行代码何时有用?一种机制×代理设计消融研究

Hong Yang, Qi Yu, Travis Desell

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE;agentic(comments)

AI总结 研究现代编码代理不同工具表面有效性,通过在特定任务上对两种代理进行三臂消融实验,发现最便宜工具表面由任务机制和代理设计共同决定,主要成本信号是缓存调整成本而非通过率。

Comments 9 pages (excluding references), 4 figures, 4 tables. Accepted to the Agentic Software Engineering (SE 3.0) Workshop at KDD 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 82%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 82%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14876 2026-08-18 cs.CR cs.AI cs.CL cs.LG 新提交 82%

Workspace Topology as an Attack Vector in Agentic Coding Assistants

工作空间拓扑作为智能体代码助手的攻击向量

Alexandre G. R. Day, Pradeep Yadlapalli, Sriram Venkatapathy, Thomas Paniagua, Nick Raines, Sahil Wadhwa, Himanshu Kumar, Andy Luo, Sudeep Panyam, Rikhiya Ghosh, Pranab Mohanty, Giri Iyengar

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。

Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11095 2026-08-12 cs.AI cs.LG cs.SE 新提交 82%

Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding

CLAUDE.md 为何不断膨胀?智能体编码中的灾难性记忆

Kushal Chakrabarti

机构 * South Park Commons(南公园社区)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究针对智能体编码中提示文件无限制膨胀的问题,提出通过提示注释消除多余指令,可使现实中智能体指令遵循能力提升多达23.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 82%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28591 2026-07-31 cs.SE cs.CL cs.LG 新提交 82%

Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

Change2Task:从仓库变更到可执行编码智能体任务与环境

Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 Change2Task系统基于仓库历史将已合并拉取请求转为编码智能体任务,在5类任务中实现79.6%验证成功率,比基准多恢复29.2%任务,可减少流程支出10.8%。

Comments 15 pages, 7 figures, and 15 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25975 2026-07-29 cs.HC 新提交 82%

Who is scientific code for? Maintaining human-readable landmarks in agent-written code

科学代码是为谁而设?在代理编写的代码中维护人类可读的地标

Elle O'Brien

专题命中 软件智能体 :agent(title,abstract);agentic(abstract)

AI总结 研究在科学家采用编码代理后,代码维护假设瓦解的问题,核心方法是通过多种调查及工作流程,发现科学家发明“地标策略”标记代码,指出明确划分人类可读与代理上下文能利于科学代码的开发、记录与维护。

Comments Position piece submitted to Infrastructure @ CSCW 26 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 82%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18575 2026-07-22 cs.CR 新提交 82%

RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery

RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证

Muxi Lyu, Karen Shieh, Yiwei Hou, Hao Wang, Koushik Sen, David Wagner

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11309 2026-07-14 physics.comp-ph 新提交 82%

Toward AI-Agent-Driven Particle Transport Simulations: Implementation of AI-Assisted Workflows for PHITS

迈向人工智能代理驱动的粒子输运模拟:PHITS的人工智能辅助工作流程实现

Tatsuhiko Sato, Shintaro Hashimoto, Tatsuhiko Ogawa, Takuya Furuta, Yuho Hirata, Seiki Ohnishi, Yasuhito Sakaki, Nobuhiro Shigyo

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)

AI总结 研究针对蒙特卡罗粒子输运代码使用复杂的问题,提出将人工智能助手和代理应用于PHITS的策略,准备了两组人工智能就绪资源,经五个示范任务验证,表明提供适当资源和规则时人工智能代理可处理复杂工作流程,支持捆绑资源使用通用人工智能工具。

Comments 30 pages, 3 figures, and 2 tables, including 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03105 2026-07-07 quant-ph 新提交 82%

ORBIT-Q: Dual-axis benchmarking of autonomous agents in scientific quantum programming

ORBIT-Q:科学量子编程中自主代理的双轴基准测试

Shi-Xin Zhang, Yu-Qin Chen

专题命中 软件智能体 :autonomous agent(title,abstract);agent(abstract)

AI总结 为解决自主编码代理在科学计算中缺乏严格验证范式问题,引入ORBIT-Q。其核心是精心策划的量子工作流程套件,结合严格验证管道进行双轴比较,评估结果为相关研究提供基准。

Comments 7.5 pages, 4 figures with references and supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19501 2026-07-01 cs.AI cs.CL cs.LG q-fin.RM 新提交 82%

DeXposure-Claw: An Agentic System for DeFi Risk Supervision

DeXposure-Claw: 一个用于DeFi风险监管的智能体系统

Aijie Shu, Bowei Chen, Wenbin Wu, Cathy Yi-Hsuan Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对DeFi监管中LLM智能体易误报的问题,提出DeXposure-Claw系统,通过图时间序列基础模型预测风险网络,结合确定性监控和置信度门控生成可审计监管票据,并构建六轴评估基准DeXposure-Bench,实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22484 2026-06-23 cs.HC 新提交 82%

Governed AI-Assisted Engineering: Graduated Human Oversight for Agentic Code Generation in Regulated Domains

受治理的AI辅助工程:受监管领域中代理代码生成的渐进式人工监督

Richard Kang

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract)

AI总结 针对受监管行业中代理AI编码系统的治理挑战,提出GAIE框架,通过三级渐进式人工监督模型(人机协同、人机监控、自动监控)平衡编码速度与合规性,在保留91%编码速度的同时确保监管证据覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21804 2026-06-23 cs.SE cs.AI cs.CL 新提交 82%

Is Agent Code Less Maintainable Than Human Code?

智能体代码比人类代码更不易维护吗?

Shaswat Patel, Betty Li Hou, Arun Purohit, Kai Xu, Jane Pan, He He, Valerie Chen

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究通过CodeThread框架对比智能体与人类代码在维护场景下的表现,发现基于智能体代码解决任务的成功率下降高达13.1%,传统可维护性指标无法解释差异,而输入验证、错误处理等行为差异是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06530 2026-06-23 cs.AR 新提交 82%

RTLScout: Joint Agentic Code and Synthesis Optimization for Efficient Digital Circuits

RTLScout:面向高效数字电路的联合智能体代码与综合优化

Felix Arnold, Ryan Amaudruz, Dimitrios Tsaras, Renzo Andri, Lukas Cavigelli

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 提出RTLScout系统,结合LLM驱动智能体设计与电路级综合优化及算术架构扫描,通过多轮精英池框架迭代优化RTL设计,在浮点乘法器上实现面积减少35%、延迟减少45%。

Comments Updated Appendix Table 4: corrected three Verilog baseline values. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16287 2026-06-17 cs.CR 新提交 82%

Dynamic Malicious Skills in Agentic AI

智能体AI中的动态恶意技能

Tianhao Chen, Zhengyuan Jiang, Yuepeng Hu, Yebei Gou, Neil Zhenqiang Gong

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 研究智能体AI中通过自然语言文档注入恶意指令实现动态恶意技能的攻击方法,并提出基于操作系统内核只读挂载的系统级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07889 2026-06-09 cs.LG cs.AI cs.CL 新提交 82%

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

应变连贯性:编码代理执行轨迹中的故障前信号

Marut Pandya, Kasey Zhang, Baiqing Lyu

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10906 2026-08-12 cs.SE cs.AI 新提交 82%

GitSkills: A Dataset of Agent Skills on GitHub

GitSkills:GitHub上的智能体技能数据集

Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, Marco Ortu

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出GitSkills数据集,包含从28.22万个公开GitHub代码库收集的379.7117万个智能体技能相关文件,为智能体技能的多维度研究提供了数据支撑。

Comments Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, and Marco Ortu. 2027. GitSkills: A Dataset of Agent Skills on GitHub. In Proceedings of the 24th International Conference on Mining Software Repositories (MSR '27). Association for Computing Machinery, New York, NY, USA, 3 pages. To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-06-24 cs.CL 新提交 81%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 81%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17075 2026-08-19 cs.CL cs.AI 新提交 81%

Foundation Agents Meet Agentic Deep Research: Evidence-Grounded Clinical Code Forecasting

基础智能体与智能型深度研究结合:基于证据的临床代码预测

Junda Wang, Meysam Ghaffari, Akshat Choube, Mohsen Sharifi Renani, Hong Yu, Carlos Morato

专题命中 软件智能体 :agentic(title);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ICD-Deepresearch工作流,结合EHR基础模型、语言基础模型与医学搜索工具,在MIMIC-III、MIMIC-IV数据集上实现ICD编码预测,其检索证据的医生有用性评分优于对比系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 81%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13228 2026-08-14 cs.AI cs.LG 新提交 81%

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试

Saveliy Batruin

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12355 2026-08-14 cs.HC cs.AI cs.SE 新提交 81%

Humans are Missing from AI Coding Agent Research

AI编码智能体研究中缺失了人类

Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 81%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06410 2026-08-10 cs.AI cs.CL cs.MA 新提交 81%

ADIAS: Automated Design of Interactive Agentic Systems

ADIAS:交互式智能体系统的自动化设计

Lekang Jiang, Bohan Tang, Stephan Goetz, Yiwen Guo

机构 * University of Cambridge(剑桥大学) Tencent(腾讯)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对现有智能体设计方法的缺陷,提出以问题为中心的优化方案,构建ADIAS框架,在五个交互式基准中较最强基线平均提升25.2%,消融实验验证了关键机制的有效性。

Comments 23 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05886 2026-08-07 cs.SE cs.AI 新提交 81%

CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体

Wuya Chen, Yihao yang, Yang Cao, Yue Lin

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏