arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3244 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3244 篇

2506.08311 2026-05-28 cs.SE cs.AI 79%

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 软件智能体 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21453 2026-05-21 cs.SE cs.AI 79%

Quality and Security Signals in AI-Generated Python Refactoring Pull Requests

AI生成Python重构拉取请求中的质量和安全信号

Mohamed Almukhtar, Anwar Ghammam, Hua Ming

机构 * University of Michigan-Flint(密歇根大学弗林特分校) University of Michigan-Dearborn(密歇根大学戴尔本分校)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过分析AIDev数据集中的Python重构拉取请求,探讨了AI生成代码对代码质量和安全性的影响,发现AI提交在22.5%的案例中提升了质量属性,但同时也引入了新的代码问题,提出了24种重构操作的分类和安全门控的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20874 2026-05-21 cs.AI cs.SE 79%

Governance by Construction for Generalist Agents

为通用智能体构建的治理机制

Segev Shlomov, Iftach Shoham, Alon Oved, Ido Levy, Sami Marreed, Harold Ship, Offer Akrabi, Sergey Zeltyn, Avi Yaeli, Nir Mashkif

机构 * IBM

专题命中 软件智能体 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种模块化的政策-as-code层,用于在不微调模型的情况下,通过与通用大语言模型智能体结合,实现可预测、可审计且符合合规要求的行为,在复合工作流中无需为每个领域重新构建智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI 79%

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 79%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27264 2026-05-01 cs.SE cs.AI 79%

Self-Evolving Software Agents

自演化软件代理

Marco Robol, Paolo Giorgini

机构 * University of Trento(特伦托大学)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出自演化软件代理,结合BDI推理与大语言模型,使代理能自主进化目标、推理和可执行代码。实验显示代理可自主发现新目标并生成行为,验证了LLM驱动进化的可行性与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21598 2026-04-29 cs.SE cs.AI 79%

You Don't Need Public Tests to Generate Correct Code

你不需要公共测试来生成正确代码

Kaushitha Silva, Srinath Perera

机构 * WSO2(WSO2公司)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出DryRUN框架,通过让大语言模型自主生成测试输入并模拟执行,避免依赖公共测试用例,从而减少过自信偏差并提升代码生成效率。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 79%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.CL、cs.SE

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL 79%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 软件智能体 :agentic(abstract,abstract_cn);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17037 2026-02-23 cs.SE cs.AI cs.HC cs.PL 79%

Wink: Recovering from Misbehaviors in Coding Agents

Wink: 代码代理中行为失误的恢复

Rahul Nanda, Chandra Maddila, Smriti Jha, Euna Mehnaz Khan, Matteo Paltenghi, Satish Chandra

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 Wink通过异步自我干预系统有效恢复代码代理的行为失误,减少工具调用失败和人工干预需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12144 2026-02-13 cs.SE cs.AI 79%

On the Adoption of AI Coding Agents in Open-source Android and iOS Development

在开源Android和iOS开发中采用AI编码代理的影响

Muhammad Ahmad Khan, Hasnain Ali, Muneeb Rana, Muhammad Saqib Ilyas, Abdul Ali Bangash

机构 * Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文首次研究了AI编码代理在开源Android和iOS开发中的影响,发现Android项目接收更多AI生成PR且接受率更高,同时任务类别和时间变化对PR解决有显著影响。

Comments Accepted at MSR 2026 Mining Challenge track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05941 2026-02-12 cs.SE cs.LG cs.MA 79%

Code2MCP: Transforming Code Repositories into MCP Services

Code2MCP: 将代码仓库转化为MCP服务

Chaoqian Ouyang, Ling Yue, Shimin Di, Libin Zheng, Linan Yue, Shaowu Pan, Jian Yin, Min-Ling Zhang

机构 * Sun Yat-sen University(中山大学) Rensselaer Polytechnic Institute(罗切斯特理工学院) Southeast University(东南大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

AI总结 Code2MCP通过自动化将GitHub仓库转换为MCP兼容服务,解决现有MCP工具池不足的问题,促进MCP协议的普及与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09185 2026-02-11 cs.SE cs.AI 79%

AIDev: Studying AI Coding Agents on GitHub

AIDev:研究GitHub上的AI编码代理

Hao Li, Haoxiang Zhang, Ahmed E. Hassan

机构 * Queen's University(女王大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 AIDev是一个大规模数据集,包含来自五个AI代理的GitHub pull requests,用于研究AI在软件工程中的应用、开发者生产力及人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14762 2025-12-18 cs.SE cs.AI 79%

Workflows vs Agents for Code Translation

工作流与代理在代码翻译中的比较

Henry Gray, Tom Yotam, Octavian Udrea

机构 * Code Metal

专题命中 软件智能体 :autonomous agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究比较了工作流与代理方法在MATLAB到HDL代码翻译中的效果,发现代理方法在语法修复和提升模拟覆盖率方面表现更优。

Journal ref NeurIPS 2025 Fourth Workshop on Deep Learning for Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15126 2025-12-18 cs.AI cs.CL 79%

aiXiv: A Next-Generation Open Access Ecosystem for Scientific Discovery Generated by AI Scientists

aiXiv:一个由AI科学家生成的下一代开放获取生态系统

Pengsong Zhang, Xiang Hu, Guowei Huang, Yang Qi, Heng Zhang, Xiuxu Li, Jiaxing Song, Jiabin Luo, Yijiang Li, Shuo Yin, Chengxiao Dai, Eric Hanchen Jiang, Xiaoyan Zhou, Zhenfei Yin, Boqin Yuan, Jing Dong, Guinan Su, Guanren Qiao, Haiming Tang, Anghong Du, Lili Pan, Zhenzhong Lan, Xinyu Liu

专题命中 软件智能体 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 aiXiv是一个由AI科学家生成的下一代开放获取生态系统,通过多代理架构和API接口,实现人类与AI科学家的协同,提升AI生成科研内容的质量和传播效率。

Comments Preprint under review. Code is available at https://github.com/aixiv-org. Website is available at https://aixiv.science

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10819 2025-11-21 cs.AI cs.LG 79%

PoE-World: Compositional World Modeling with Products of Programmatic Experts

PoE-World: 通过程序专家的乘积进行组合世界建模

Wasu Top Piriyakulkij, Yichao Liang, Hao Tang, Adrian Weller, Marta Kryven, Kevin Ellis

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Dalhousie University(达尔豪斯大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 PoE-World通过程序专家的乘积有效建模复杂非网格世界领域,利用LLMs学习世界模型并实现高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26161 2025-10-01 cs.AI cs.SE 79%

90% Faster, 100% Code-Free: MLLM-Driven Zero-Code 3D Game Development

Runxin Yang, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16299 2025-09-08 cs.SE cs.AI 79%

HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale

Huy Nhat Phan, Tien N. Nguyen, Phong X. Nguyen, Nghi D. Q. Bui

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01893 2025-05-20 cs.CL cs.AI 79%

What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best Practices

Zhi Chen, Qiguang Chen, Libo Qin, Qipeng Guo, Haijun Lv, Yicheng Zou, Wanxiang Che, Hang Yan, Kai Chen, Dahua Lin

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments ACL 2025 Camera Ready. Code is available at: https://github.com/WowCZ/LongMIT

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18653 2025-02-03 cs.SE cs.AI 79%

Cogito, ergo sum: A Neurobiologically-Inspired Cognition-Memory-Growth System for Code Generation

Yanlong Li, Jindong Li, Qi Wang, Menglin Yang, He Kong, Shengsheng Wang

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12468 2024-12-30 cs.SE cs.AI 79%

Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios

Zhi Chen, Lingxiao Jiang

专题命中 软件智能体 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

Comments Paper accepted to the SANER 2025 Conference Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05001 2024-09-10 cs.SE cs.AI 79%

A Pair Programming Framework for Code Generation via Multi-Plan Exploration and Feedback-Driven Refinement

Huan Zhang, Wei Cheng, Yuhan Wu, Wei Hu

专题命中 软件智能体 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.SE

Comments Accepted in the 39th IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15991 2024-09-06 cs.SE cs.LG cs.PL 79%

WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models

Chenyuan Yang, Yinlin Deng, Runyu Lu, Jiayi Yao, Jiawei Liu, Reyhaneh Jabbarvand, Lingming Zhang

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

Comments Published in OOPSLA 2024

Journal ref Proc. ACM Program. Lang., Vol. 8, No. OOPSLA2, Article 296. Publication date: October 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09835 2024-08-22 cs.CL cs.AI 79%

ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code

Xiangru Tang, Yuliang Liu, Zefan Cai, Yanjun Shao, Junjie Lu, Yichi Zhang, Zexuan Deng, Helan Hu, Kaikai An, Ruijun Huang, Shuzheng Si, Sheng Chen, Haozhe Zhao, Liang Chen, Yan Wang, Tianyu Liu, Zhiwei Jiang, Baobao Chang, Yin Fang, Yujia Qin, Wangchunshu Zhou, Yilun Zhao, Arman Cohan, Mark Gerstein

专题命中 软件智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20370 2026-08-24 cs.DC cs.MA 新提交 78%

Benchmarking LLM Serving Systems for Agentic AI Workloads with XPerf

使用XPerf对智能体AI工作负载的大语言模型服务系统进行基准测试

Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

专题命中 软件智能体 :agentic(title,abstract)

AI总结 研究人员提出XPerf基准测试框架,可对智能体AI工作负载的LLM服务系统进行负载测试,能减少工作负载变化、提供性能分析并助力服务调试,将在GitHub开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16951 2026-08-19 q-bio.QM cs.MA 新提交 78%

The Little Scientist: LLM Agent-Driven Discovery via the Scientific Method

小科学家:基于大语言模型智能体的科学方法驱动发现

Travis Smith

专题命中 软件智能体 :agent(title,abstract)

AI总结 该研究提出The Little Scientist框架,让LLM智能体遵循科学方法迭代探索,在蛋白质适应性预测、DNA基序发现问题上发现了优于现有方案的新算法与集成策略。

Comments Code: https://github.com/travis42/little-scientist-dale and https://github.com/travis42/little-scientist-delta-v (Apache 2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14093 2026-08-17 cs.HC 新提交 78%

AppLooper: An Agentic Application Engineering Loop for Accountable Release with Virtual-User Feedback

AppLooper:用于负责任发布的智能体应用工程闭环,结合虚拟用户反馈

Zihong He, Chen Liang, Hai-Ning Liang

专题命中 软件智能体 :agentic(title);agent(abstract)

AI总结 本文提出AppLooper,一种结合虚拟用户反馈的人-编码智能体-虚拟用户应用工程闭环,将开发各环节绑定至特定版本,实现可追踪的负责任发布,人类保留最终发布权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06862 2026-08-10 cs.CR 新提交 78%

SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains

SynChain:诱导计算机使用智能体系统构建自身攻击链

Fuyao Zhang, Jiaming Zhang, Che Wang, Boyang Chen, Yurong Hao, Xiongtao Sun, Guowei Guan, Blaise Delattre, Yang Cao, Wei Yang Bryan Lim

专题命中 软件智能体 :agent(title,abstract)

AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04587 2026-08-06 cs.CV 新提交 78%

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

MetaVideoAgent:面向长视频理解的自动视频智能体进化框架

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) ByteDance(字节跳动)

专题命中 软件智能体 :agent(title,abstract)

AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。

Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 78%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 软件智能体 :agent(title,abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏