arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3244 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3244 篇

2603.28653 2026-04-14 cs.NE cs.SE 77%

BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations

BACE:基于大语言模型的代码生成:通过贝叶斯锚定的代码与测试种群共演化

Kaushitha Silva, Srinath Perera

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 BACE通过贝叶斯锚定的共演化方法,改进代码生成中的测试反馈机制,提升代码与测试种群的协同进化性能。

Comments 10 Pages, 3 Figures. To appear in Proceedings of the 2026 Genetic and Evolutionary Computation Conference (GECCO '26), July 13-17, 2026, San Jose, Costa Rica

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17192 2026-03-02 cs.CL 77%

Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning

Paper2Code: 从科学论文自动生成机器学习代码

Minju Seo, Jinheon Baek, Seongyun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究所)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.CL

AI总结 Paper2Code通过多代理LLM框架自动生成机器学习论文的高质量代码实现,有效提升代码生成效率和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04847 2026-02-24 cs.LG 77%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 软件智能体 :agent(abstract);function calling(abstract);agentic(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03219 2026-02-10 cs.AI 77%

Beyond Quantity: Trajectory Diversity Scaling for Code Agents

超越数量:代码代理的轨迹多样性扩展

Guhong Chen, Chenghao Sun, Cheng Fu, Qiyao Wang, Zhihong Huang, Chaopeng Wei, Guangxu Chen, Feiteng Fang, Ahmadreza Argha, Bing Zhao, Xander Xu, Qi Han, Hamid Alinejad-Rokny, Qiang Qu, Binhua Li, Shiwen Ni, Min Yang, Hu Wei, Yongbin Li

机构 * SIAT, CAS(中国科学院软件研究所) Alibaba Group(阿里巴巴集团) UNSW Sydney(新南威尔士大学悉尼分校) SUAT(上海大学)

专题命中 软件智能体 :agent(abstract);tool-use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TDScaling通过提升轨迹多样性而非单纯增加数据量,优化代码代理训练的性能-成本平衡,提升工具使用泛化和编码能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19942 2026-02-10 cs.SE 77%

Prometheus: Towards Long-Horizon Codebase Navigation for Repository-Level Problem Solving

Prometheus:面向仓库级问题解决的长周期代码库导航

Yue Pan, Zimin Chen, Siyu Lu, Zhaoyang Chu, Xiang Li, Han Li, Yang Feng, Claire Le Goues, Federica Sarro, Martin Monperrus, He Ye

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 Prometheus通过统一知识图谱和增强内存引擎,实现长周期代码库导航,提升仓库级问题解决的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20106 2026-01-29 cs.SE 77%

Are We All Using Agents the Same Way? An Empirical Study of Core and Peripheral Developers Use of Coding Agents

我们是否都在以相同的方式使用代理?核心和边缘开发者对编码代理使用的一次实证研究

Shamse Tasnim Cynthia, Joy Krishan Das, Banani Roy

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文通过实证研究发现,核心和边缘开发者在使用编码代理时存在差异,核心开发者更关注文档和测试,而边缘开发者更频繁使用代理进行任务分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16839 2026-01-26 cs.SE 77%

AI builds, We Analyze: An Empirical Study of AI-Generated Build Code Quality

AI构建,我们分析:对AI生成构建代码质量的实证研究

Anwar Ghammam, Mohamed Almukhtar

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本研究通过分析AI生成的构建代码质量,探讨其在构建系统中的影响,并发现AI生成代码既可能引入质量问题,也部分消除了现有问题,同时大部分代理提交被开发者接受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14914 2026-01-22 cs.CL 77%

CodeDelegator: Mitigating Context Pollution via Role Separation in Code-as-Action Agents

CodeDelegator: 通过角色分离缓解上下文污染在代码作为行动代理中

Tianxiang Fei, Cheng Chen, Yue Pan, Mao Zheng, Mingyang Song

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.CL

AI总结 CodeDelegator通过角色分离缓解上下文污染,利用多代理框架实现战略规划与实现的分离,提升代码作为行动代理的长期性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16709 2025-11-24 cs.CR cs.AI 77%

AutoBackdoor: Automating Backdoor Attacks via LLM Agents

AutoBackdoor: 通过LLM代理自动化后门攻击

Yige Li, Zhe Li, Wei Zhao, Nay Myat Min, Hanxun Huang, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 AutoBackdoor通过LLM代理自动化后门攻击,实现高效触发器生成和毒化数据构建,验证了对抗防御的脆弱性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03588 2025-10-07 cs.SE cs.MA 77%

REFINE: Enhancing Program Repair Agents through Context-Aware Patch Refinement

Anvith Pabba, Simin Chen, Alex Mathai, Anindya Chakraborty, Baishakhi Ray

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.SE

Comments We also open source our code at https://anonymous.4open.science/r/SemAgent-7B2F/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25370 2025-10-01 cs.AI 77%

Where LLM Agents Fail and How They can Learn From Failures

Kunlun Zhu, Zijia Liu, Bingxuan Li, Muxin Tian, Yingxuan Yang, Jiaxun Zhang, Pengrui Han, Qipeng Xie, Fuyang Cui, Weijia Zhang, Xiaoteng Ma, Xiaodong Yu, Gowtham Ramesh, Jialian Wu, Zicheng Liu, Pan Lu, James Zou, Jiaxuan You

专题命中 软件智能体 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07832 2025-03-12 cs.AI cs.CL cs.LG cs.SE 77%

RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code

Dhruv Gautam, Spandan Garg, Jinu Jang, Neel Sundaresan, Roshanak Zilouchian Moghaddam

专题命中 软件智能体 :agent(abstract);function calling(abstract);分类 cs.AI、cs.CL、cs.LG

Comments ICLR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04485 2024-12-09 cs.AR cs.AI 77%

EDA-Aware RTL Generation with Large Language Models

Mubashir ul Islam, Humza Sami, Pierre-Emmanuel Gaillardon, Valerio Tenace

专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17025 2024-06-06 cs.CL cs.AI cs.LG cs.SE 77%

Experiential Co-Learning of Software-Developing Agents

Chen Qian, Yufan Dang, Jiahao Li, Wei Liu, Zihao Xie, Yifei Wang, Weize Chen, Cheng Yang, Xin Cong, Xiaoyin Che, Zhiyuan Liu, Maosong Sun

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted to ACL 2024, https://github.com/OpenBMB/ChatDev

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06775 2023-11-02 cs.HC cs.AI 77%

Conceptual Framework for Autonomous Cognitive Entities

David Shapiro, Wangfan Li, Manuel Delaflor, Carlos Toxtli

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13927 2026-04-16 cs.PL 76%

AI Coding Agents Need Better Compiler Remarks

AI 编程代理需要更好的编译器注释

Akash Deo, Simone Campanoni, Tommy McMichen

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(comments)

AI总结 本文研究了编译器注释对AI代理优化程序的影响,发现精确注释能显著提升性能,而模糊注释会导致语义错误,结论是未来编译器需提供结构化反馈以支持自主性能工程。

Comments 3 pages, 1 figure, 2 tables, Presented at Workshop on Co-Design for Agentic and Multimodal AI (CoDAIM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06471 2026-08-10 cs.CR cs.AI cs.SE 新提交 76%

CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training

CyberForge:用于网络安全智能体训练的、基于代码仓库级别的经验证漏洞注入框架

Amine Lbath, Manan Suri, Aurelien Delaitre, Vadim Okun, Massih-Reza Amini, Ram D. Sriram, Dinesh Manocha

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.SE

AI总结 本研究提出CyberForge框架,通过向真实C/C++项目注入漏洞生成经验证的代码仓库级安全训练数据,微调后可提升智能体在SEC-bench和PatchEval上的漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24604 2026-07-28 cs.CL cs.AI 新提交 76%

Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair

循环并非可靠性保障:智能代码修复的状态约束证据与类型化修订契约

Xueping Gao, Jianwei Yang, Qiang Yang

机构 * Alibaba Cloud(阿里云)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.CL

AI总结 研究编码智能体中生成-测试-修订循环的可靠性问题,通过实验揭示相关差距及问题,提出证据约束的类型化循环契约并实例化其可机械执行子集,实现规范与工件,非证明修复能力提升等。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01057 2026-06-02 cs.CV cs.AI cs.GR cs.LG 76%

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

3DCodeBench:通过代码进行智能体程序化3D建模的基准测试

Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.LG

AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。

Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14150 2026-05-29 cs.AI cs.LG cs.NE 76%

CodeEvolve: an open source evolutionary coding agent for algorithmic discovery and optimization

CodeEvolve:用于算法发现和优化的开源进化编码智能体

Henrique Assumpção, Diego Ferreira, Leandro Campos, Fabricio Murai

机构 * Inter Science - Inter&Co Federal University of Minas Gerais(联邦大学伯南迪斯) Worcester Polytechnic Institute(沃思彻斯特理工大学)

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.LG

AI总结 提出CodeEvolve开源框架,结合大语言模型与岛屿进化搜索,通过灵感交叉、元提示和深度细化,在AlphaEvolve基准上匹配或超越5/9问题,并在匹配条件下优于OpenEvolve和ShinkaEvolve,以更低成本超越前沿闭源集成。

Comments 21 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13109 2026-04-16 cs.SE cs.AI 76%

Applying an Agentic Coding Tool for Improving Published Algorithm Implementations

应用代理编码工具改进已发表的算法实现

Worasait Suwannik

机构 * Worasait Suwannik(独立研究者)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出一个两阶段流程,利用AI改进已发表的算法实现。首先,大语言模型识别符合条件的算法,其次通过Claude Code重复基准并迭代改进。研究显示所有实验均取得改进,且需单日完成,同时讨论了人类在选择目标、验证实验有效性等方面不可替代的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20048 2026-02-24 cs.AI cs.SE 76%

CodeCompass: Navigating the Navigation Paradox in Agentic Code Intelligence

CodeCompass: 在代理代码智能中导航悖论的探索

Tarakanath Paipuru

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.SE

AI总结 CodeCompass通过基于图的结构导航提升代码智能代理在隐藏依赖任务中的性能,揭示导航与检索本质不同,需显式引导代理利用结构上下文。

Comments 23 pages, 7 figures. Research study with 258 trials on SWE-bench-lite tasks. Code and data: https://github.com/tpaip607/research-codecompass

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11688 2026-01-21 cs.SE cs.AI 76%

SpecMap: Hierarchical LLM Agent for Datasheet-to-Code Traceability Link Recovery in Systems Engineering

SpecMap:用于系统工程中datasheet到代码可追溯性链接恢复的分层LLM代理

Vedant Nipane, Pulkit Agrawal, Amit Singh

机构 * H2LooP.ai(H2LooP人工智能研究院)

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.SE

AI总结 SpecMap通过分层LLM代理实现嵌入式系统datasheet到代码的可追溯性链接恢复,提升映射精度与效率,支持自动化分析与下游应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07921 2025-12-10 cs.SE cs.AI 76%

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.SE

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13767 2025-09-24 cs.SE cs.AI 76%

Agentic AI Software Engineers: Programming with Trust

Abhik Roychoudhury, Corina Pasareanu, Michael Pradel, Baishakhi Ray

机构 * National University of Singapore(新加坡国立大学) Carnegie Mellon University, KBR Inc., NASA Ames(卡内基梅隆大学、KBR公司、NASA阿姆斯特朗实验室) CISPA Helmholtz Center for Information Security, University of Stuttgart(CISPA海姆霍兹信息安全中心、斯图加特大学) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.SE

Comments 5 pages

Journal ref Communications of the ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08069 2024-12-12 cs.SE cs.AI 76%

DialogAgent: An Auto-engagement Agent for Code Question Answering Data Production

Xiaoyun Liang, Jingyi Ren, Jiayi Qi, Chao Peng, Bo Jiang

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13840 2024-06-21 cs.AI cs.CL 76%

StackRAG Agent: Improving Developer Answers with Retrieval-Augmented Generation

Davit Abrahamyan, Fatemeh H. Fard

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.03188 2022-08-11 cs.CL cs.AI 76%

BlenderBot 3: a deployed conversational agent that continually learns to responsibly engage

Kurt Shuster, Jing Xu, Mojtaba Komeili, Da Ju, Eric Michael Smith, Stephen Roller, Megan Ung, Moya Chen, Kushal Arora, Joshua Lane, Morteza Behrooz, William Ngan, Spencer Poff, Naman Goyal, Arthur Szlam, Y-Lan Boureau, Melanie Kambadur, Jason Weston

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11142 2022-04-26 cs.LG cs.AI 76%

Graph Neural Network based Agent in Google Research Football

Yizhan Niu, Jinglong Liu, Yuhao Shi, Jiren Zhu

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.LG

Comments Accepted by the 2nd International Conference on Artificial Intelligence, Automation and High Performance Computing (AIAHPC 2022), which was held in Zhuhai, China in February 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20525 2026-08-24 cs.DB 新提交 75%

Bolo: Verified Model Hub for Next-Generation AI Databases

Bolo:面向下一代AI数据库的经验证的模型中心

Yunqi Li, Ila Petrovic, Yongjoo Park

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏