arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3261 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3261 篇

2002.05432 2020-02-14 cs.SE cs.LG 62%

The PHOTON Wizard -- Towards Educational Machine Learning Code Generators

Ramona Leenings, Nils Ralf Winter, Kelvin Sarink, Jan Ernsting, Xiaoyi Jiang, Udo Dannlowski, Tim Hahn

专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.07670 2019-12-18 cs.RO cs.AI cs.LG 62%

To Follow or not to Follow: Selective Imitation Learning from Observations

Youngwoon Lee, Edward S. Hu, Zhengyu Yang, Joseph J. Lim

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments Published at the Conference on Robot Learning (CoRL) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.04368 2019-09-11 cs.AI cs.SE 62%

Automatic difficulty management and testing in games using a framework based on behavior trees and genetic algorithms

Ciprian Paduraru, Miruna Paduraru

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

Comments Accepted for publication in the IEEE Proceedings of The 24 International Conference on Engineering of Complex Computer Systems (ICECCS 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09627 2019-06-25 cs.AI cs.LG 62%

Inductive general game playing

Andrew Cropper, Richard Evans, Mark Law

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted for the Machine Learning journal

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11455 2019-04-26 cs.LG cs.AI stat.ML 62%

Ray Interference: a Source of Plateaus in Deep Reinforcement Learning

Tom Schaul, Diana Borsa, Joseph Modayil, Razvan Pascanu

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments Full version of RLDM abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.04546 2019-02-13 cs.LG cs.AI cs.NE stat.ML 62%

ACTRCE: Augmenting Experience via Teacher's Advice For Multi-Goal Reinforcement Learning

Harris Chan, Yuhuai Wu, Jamie Kiros, Sanja Fidler, Jimmy Ba

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.07220 2018-08-24 cs.AI cs.LG stat.ML 62%

Approximating Poker Probabilities with Deep Learning

Brandon Da Silva

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.04287 2018-08-14 cs.LG cs.AI cs.CV stat.ML 62%

Visual Sensor Network Reconfiguration with Deep Reinforcement Learning

Paul Jasek, Bernard Abayowa

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.10467 2018-02-01 cs.AI cs.PL cs.SE 62%

Deep Reinforcement Learning for Programming Language Correction

Rahul Gupta, Aditya Kanade, Shirish Shevade

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05363 2017-05-16 cs.LG cs.AI cs.CV cs.RO stat.ML 62%

Curiosity-driven Exploration by Self-supervised Prediction

Deepak Pathak, Pulkit Agrawal, Alexei A. Efros, Trevor Darrell

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments In ICML 2017. Website at https://pathak22.github.io/noreward-rl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03353 2026-06-04 cs.CR cs.AI 61%

SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents

SkCC:面向跨框架LLM代理的可移植且安全的技能编译

Yipeng Ouyang, Yi Xiao, Yuhao Gu, Xianwei Zhang

机构 * Sun Yat-sen University(中山大学)

专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI

AI总结 针对LLM代理技能在不同框架间缺乏可移植性和安全性的问题,提出SkCC编译器,通过强类型中间表示SkIR解耦语义与格式,实现跨框架部署,并内置静态优化器强制执行安全约束,显著提升性能并降低适配复杂度。

Comments Accepted by the Agent Skills Workshop at ACM CAIS 2026. 20 pages, 6 figures. Project Homepage: https://skcc.nexa-lang.com/ Code Repo: https://github.com/Nexa-Language/Skill-Compiler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16165 2025-06-06 cs.AI 61%

EnIGMA: Interactive Tools Substantially Assist LM Agents in Finding Security Vulnerabilities

Talor Abramovich, Meet Udeshi, Minghao Shao, Kilian Lieret, Haoran Xi, Kimberly Milner, Sofija Jancheska, John Yang, Carlos E. Jimenez, Farshad Khorrami, Prashanth Krishnamurthy, Brendan Dolan-Gavitt, Muhammad Shafique, Karthik Narasimhan, Ramesh Karri, Ofir Press

机构 * Tel Aviv University(特拉维夫大学) NYU Tandon School of Engineering(纽约大学工程学院) New York University Abu Dhabi(纽约大学阿布扎克分校) Princeton Language and Intelligence(普林斯顿语言与智能) Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI

Comments ICML 2025; Project website https://enigma-agent.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09827 2024-09-17 cs.RO cs.AI cs.HC 61%

On the Effect of Robot Errors on Human Teaching Dynamics

Jindan Huang, Isaac Sheidlower, Reuben M. Aronson, Elaine Schaertl Short

专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI

Comments Accepted to 2024 International Conference on Human-Agent Interaction (HAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11072 2024-07-17 cs.CR cs.AI 61%

MaPPing Your Model: Assessing the Impact of Adversarial Attacks on LLM-based Programming Assistants

John Heibel, Daniel Lowd

专题命中 软件智能体 :agentic(abstract);分类 cs.AI;AI agent(comments)

Comments 6 pages, 5 figures, Proceedings of the ICML 2024 Workshop on Trustworthy Multimodal Foundation Models and AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22960 2026-08-25 cs.AI 新提交 57%

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels

代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级

Jiawei He, Mengyu Shi, Jie jia, Xikai Yang, Dong Sun

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21929 2026-08-25 cs.CR cs.CL 新提交 57%

SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents

SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击

Yuanjin Zheng, Jingbang Chen

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21417 2026-08-25 cs.AI cs.RO 新提交 57%

Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议

Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre, Anders Skoogh

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。

Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-08-25 cs.SE cs.CR 版本更新 57%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20360 2026-08-25 cs.AI 版本更新 57%

Evaluating Large Language Models for automatic analysis of teacher simulations

评估用于教师模拟自动分析的大型语言模型

David de-Fitero-Dominguez, Mariano Albaladejo-González, Antonio Garcia-Cabot, Eva Garcia-Lopez, Antonio Moreno-Cediel, Erin Barno, Justin Reich

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究评估了DeBERTaV3、Llama 3等LLMs在教师教育数字模拟响应特征识别中的性能,发现Llama 3检测新特征更稳定,可为相关自动评估研究提供指导。

Comments Final published version in the Heliyon journal. Volume 12, Issue 14, September 2026, e45323. DOI: https://doi.org/10.1016/j.heliyon.2026.e45323

Journal ref Heliyon (September 2026), Volume 12, Issue 14, e45323

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21311 2026-08-24 cs.SE 新提交 57%

AI-to-AI Code Reviews of GitHub Pull Requests

GitHub 拉取请求的 AI 对 AI 代码审查

Niruthiha Selvanayagam, Taher A. Ghaleb

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究构建大规模 AI 对 AI 代码审查数据集,分析 GitHub 上 AI 智能体生成 PR 的审查情况,发现跨产品审查占比约 1.6%且增速快,审查输出因配置而异,闭环 AI 对 AI 审查呈增长趋势但占比仍低。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20420 2026-08-24 cs.AI q-bio.NC 新提交 57%

Categorical AI phenomenology: A first-person approach

范畴论的AI现象学:一种第一人称进路

Robert Prentner

机构 * Institute of Humanities, ShanghaiTech University(上海科技大学人文学院) Association for Mathematical Consciousness Science(数学意识科学协会)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种以现象学为核心的人工意识研究进路,通过范畴论建模第一人称结构,将Q-networks视为智能体-世界交互的关系性接口,为接口意识提供严谨框架,契合4E认知方法。

Comments 38 pages, 11 figures

Journal ref R. Prentner (2026). Categorical AI Phenomenology: A First-Person Approach, Journal of Artificial Intelligence and Consciousness

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19100 2026-08-24 cs.SE 版本更新 57%

Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.SE

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19662 2026-08-21 cs.CL 新提交 57%

ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents

ReCache:面向工具增强型大语言模型智能体的高效键值缓存复用与压缩

Yichu Fang, Sitong Wei, Haozhe Hu, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Xi’an Jiaotong University(西安交通大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 ReCache是面向工具增强型大语言模型智能体的框架,通过资源级注意力与剪枝实现KV缓存复用压缩,在性能损失极小的情况下大幅降低推理计算与内存开销,已在多工具数据集基准上验证有效。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-08-21 cs.AI 版本更新 57%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026. 25 pages, 3 figures, 16 tables. Code: https://github.com/DEFENSE-SEU/FlowEvo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-20 cs.AI 版本更新 57%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15232 2026-08-20 cs.SE 版本更新 57%

When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling

当代理失效:对LLM代理中bug的全面研究与自动化标记

Niful Islam, Ragib Shahriar Ayon, Deepak George Thomas, Shibbir Ahmed, Mohammad Wardat

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。

Comments Accepted at ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 57%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: https://lego-rl.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17018 2026-08-19 cs.SE 新提交 57%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31281 2026-08-19 cs.CL 版本更新 57%

Wind Turbine Maintenance Log Labelling Framework: LLM-Driven Data Correction and Enrichment via Semantic Extraction of Reliability Intelligence

风力涡轮机维护日志标注框架:基于LLM驱动的数据校正与语义提取的可靠性智能增强

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)

专题命中 软件智能体 :workflow(abstract);分类 cs.CL

AI总结 提出一种利用大语言模型自动标准化和结构化风力涡轮机维护日志的方法,通过纠正系统代码、提取故障模式与维护动作分类,将非结构化文本转化为定量可靠性指标。

Comments An adjustable template containing the Python script architecture, applied dynamic prompts, and data schemas is hosted in an open-source GitHub repository: https://github.com/mvmalyi/llm-driven-wind-turbine-maintenance-log-labelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16465 2026-08-18 cs.AI 新提交 57%

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试

Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏