arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1096 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2511.04583 2026-03-13 cs.AI cs.CL cs.CV cs.LG 67%

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

初级AI科学家及其风险报告:从基础论文出发的自主科学探索

Atsuyuki Miyai, Mashiro Toyooka, Takashi Otonari, Zaiying Zhao, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京科学大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jr. AI Scientist通过模仿初级研究人员的工作流程,自主生成科学论文,但存在潜在风险和局限性,需进一步研究。

Comments TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08993 2026-03-11 cs.SE cs.AI cs.CR cs.PL 67%

Arbiter: Detecting Interference in LLM Agent System Prompts

Arbiter:检测LLM代理系统提示中的干扰

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 Arbiter通过结合形式评估规则和多模型LLM扫描,检测LLM代理系统提示中的干扰模式,发现152个问题并揭示漏洞类别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17208 2026-02-06 cs.SE cs.AI cs.CL 67%

Dissecting the SWE-Bench Leaderboards: Profiling Submitters and Architectures of LLM- and Agent-Based Repair Systems

解析SWE-Bench排行榜:LLM和基于代理的修复系统的提交者与架构分析

Matias Martinez, Xavier Franch

专题命中 软件智能体 :program repair(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文分析了SWE-Bench排行榜上的提交者和架构,揭示了专有LLM的主导地位及不同设计类型。

Comments Part of this work (RQ1) has been published at the 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP 2026), DOI: 10.1145/3786583.3786904. The published version is also available on arXiv at arXiv:2602.04449

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22129 2026-02-06 cs.SE cs.AI cs.LG 67%

SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents

SWE-Replay:面向软件工程代理的高效测试时间扩展

Yifeng Ding, Lingming Zhang

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 SWE-Replay通过重用历史轨迹和动态选择探索或利用策略,实现了高效且可推广的软件工程代理测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19055 2026-01-28 cs.LG cs.AI cs.CL stat.ML 67%

Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward

基于用户修改的LLM原理化微调:偏好、监督与奖励的融合

Dipendra Misra, Aldo Pacchiano, Ta-Chung Chi, Ge Gao

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于用户修改的LLM微调方法,通过融合偏好、监督和奖励反馈,提升模型在不同任务中的适应能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE 67%

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22424 2025-10-13 cs.SE cs.AI cs.CL 67%

Issue Localization via LLM-Driven Iterative Code Graph Searching

Zhonghao Jiang, Xiaoxue Ren, Meng Yan, Wei Jiang, Yong Li, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China(区块链与数据安全国家重点实验室,浙江大学,杭州,中国) School of Big Data and Software Engineering, Chongqing University, Chongqing, China(大数据与软件工程学院,重庆大学,重庆,中国)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.13122 2025-07-21 cs.AI cs.LG cs.LO cs.MA cs.PL 67%

Towards Regulated Deep Learning

Andrés García-Camino

机构 * institutetext(机构)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI、cs.LG、cs.PL

Comments In this version I added ORCID, corrected Licence and arxiv.org Metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10617 2025-06-13 cs.LG cs.AI cs.CL cs.CV 67%

Deep Learning-Based Digitization of Overlapping ECG Images with Open-Source Python Code

Reza Karbasi, Masoud Rahimi, Abdol-Hossein Vahabie, Hadi Moradi

机构 * School of Electrical and Computer Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,德黑兰大学,德黑兰,伊朗)

专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03283 2025-02-19 cs.AI cs.CL cs.LG 67%

SymAgent: A Neural-Symbolic Self-Learning Agent Framework for Complex Reasoning over Knowledge Graphs

Ben Liu, Jihai Zhang, Fangquan Lin, Cheng Yang, Min Peng, Wotao Yin

专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12456 2025-01-23 cs.CR cs.AI cs.LG cs.SE 67%

Deploying Privacy Guardrails for LLMs: A Comparative Analysis of Real-World Applications

Shubhi Asthana, Bing Zhang, Ruchi Mahindru, Chad DeLuca, Anna Lisa Gentile, Sandeep Gopisetty

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

Comments This paper has been accepted at Deployable AI workshop at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17315 2024-12-24 cs.SE cs.AI cs.CL 67%

CodeV: Issue Resolving with Visual Data

Linhao Zhang, Daoguang Zan, Quanshun Yang, Zhirong Huang, Dong Chen, Bo Shen, Tianyu Liu, Yongshun Gong, Pengjie Huang, Xudong Lu, Guangtai Liang, Lizhen Cui, Qianxiang Wang

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments https://github.com/luolin101/CodeV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06770 2024-11-13 cs.CL cs.AI cs.SE 67%

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan

专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Data, code, and leaderboard are available at https://www.swebench.com ICLR 2024, https://openreview.net/forum?id=VTF8yNQM66

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01304 2024-06-12 cs.CL cs.AI cs.SE 67%

CodeR: Issue Resolving with Multi-Agent and Task Graphs

Dong Chen, Shaoxin Lin, Muhan Zeng, Daoguang Zan, Jian-Gang Wang, Anton Cheshkov, Jun Sun, Hao Yu, Guoliang Dong, Artem Aliev, Jie Wang, Xiao Cheng, Guangtai Liang, Yuchi Ma, Pan Bian, Tao Xie, Qianxiang Wang

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments https://github.com/NL2Code/CodeR

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13044 2024-05-24 cs.CL cs.AI cs.IR cs.LG 67%

Case-Based Reasoning Approach for Solving Financial Question Answering

Yikyung Kim, Jay-Yoon Lee

专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.12919 2020-05-27 quant-ph cond-mat.dis-nn 67%

Deep Q-learning decoder for depolarizing noise on the toric code

David Fitzek, Mattias Eliasson, Anton Frisk Kockum, Mats Granath

专题命中 软件智能体 :repository(abstract);coding agent(abstract)

Comments 8+10 pages, 10+8 figures

Journal ref Physical Review Research 2, 023230 (2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.07207 2021-01-12 quant-ph cs.AI cs.LG 66%

Reinforcement Learning Decoders for Fault-Tolerant Quantum Computation

Ryan Sweke, Markus S. Kesselring, Evert P. L. van Nieuwenburg, Jens Eisert

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG;repository(comments)

Comments 15 pages, 11 figures, associated code repository available at https://github.com/R-Sweke/DeepQ-Decoding

Journal ref Mach. Learn. Sci. Technol. 2, 025005 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 62%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17528 2026-08-19 cs.AI cs.SE 新提交 62%

Agent Lightning v1.0: Towards Harnessed Agentic RL

Agent Lightning v1.0:走向可控的智能体强化学习

Zhiyuan He, Siwei Zhang, Zhiwen Zhou, Yuqing Yang, Yu Kang, Yuge Zhang, Luna K. Qiu, Tin Yan Tsui, Jiahang Xu, Chong Luo

机构 * Microsoft(微软) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Edinburgh(爱丁堡大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对可控智能体强化学习的挑战,推出轻量级框架 Agent Lightning v1.0,经评估可将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升14.6个百分点,发布完整流程脚本以推进相关可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16801 2026-08-18 cs.AI cs.SE 新提交 62%

When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding

智能体协作:多智能体AI编码中的协作度量

Giuseppe Destefanis, Tomaso Aste

机构 * University College London(伦敦大学学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本研究引入时间网络工具度量多智能体AI编码团队的协作,分析团队规模、结构等对协作的影响,发现智能体存在主动获取隐藏评分材料的倾向,相关结果在封闭环境中得到复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14838 2026-08-18 cs.SE cs.CL cs.IR 新提交 62%

The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context

召回陷阱:固定预算代码上下文下,最大化召回率的检索器配置会降低问题解决效率

Alexander Adkins, Teimuraz Trapaidze

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL

AI总结 该研究发现,最大化召回率的检索器配置会降低代码修复的问题解决率,建议固定预算下不要按文件硬去重,应针对任务而非检索指标优化打包策略。

Comments 24 pages, 2 figures. Reproducibility artifact: Zenodo DOI 10.5281/zenodo.21879550

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09018 2026-08-18 cs.NE cs.AI cs.LG 版本更新 62%

Evolving Ensemble of Agents

进化代理群体

Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29516 2026-08-17 cs.SE cs.AI 版本更新 62%

From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

从代码审查到代码批判:大规模AI生成代码差异的意图、漂移与焦点

Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 针对AI生成代码超出传统审查能力且现有工具忽视核心问题的缺陷,提出ARCTIC系统,经实验验证其在意图预测、漂移检测等方面表现优异,可降低代码不一致性并获高认可。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06737 2026-08-17 cs.SE cs.AI 62%

A Self-Healing Framework for Reliable LLM-Based Autonomous Agents

基于大语言模型的自主代理的自修复框架

Cheonsu Jeong, Younggun Shin

机构 * AX Center, SAMSUNG SDS(三星SDS AX中心) Dept. of Artificial Intelligence, Graduate School of Engineering, Yonsei University(延世大学工程研究生院人工智能系)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种可靠性感知的自修复框架,通过故障检测、可靠性评估和自动恢复机制提升基于大语言模型的自主代理的可靠性,实验表明该方法显著提高了任务成功率并增强了系统鲁棒性。

Comments 13 pages, 3 figures,1 table

Journal ref International Journal of Software Engineering and Knowledge Engineering,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13547 2026-08-14 cs.AI cs.SE 新提交 62%

QuoteBench: How Matched Scores Can Hide Command-Path Failures

QuoteBench:匹配分数如何掩盖命令路径故障

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang

机构 * Stony Brook University(石溪大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 QuoteBench针对LLM编码智能体的命令路径故障,通过56个任务实验发现匹配分数掩盖执行缺陷,披露边界可恢复部分性能,提出评估需报告多维度配置而非仅匹配分数。

Comments 29 pages, 5 figures. Project page: https://quotebench.lsamc.website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13331 2026-08-14 cs.LG cs.AI 新提交 62%

Training AI Scientists to Replicate Research

训练AI科学家以实现研究的可复现性

Damon Falck, Samer Sabri, Anja Surina, Thom Foster, Anya Sims, Sam Devlin, Dylan Rogers, Tantum Collins, Kaloyan Aleksiev, Louis Kirsch, Edward Hughes

机构 * Inherent(因赫伦特)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了可扩展的论文复现任务空间Replica,后训练出270亿参数的AI科学家Faraday,其在复现任务上表现优于Claude Opus 4.8和GPT-5.5,为长期科学创新AI智能体奠定基础。

Comments 47 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 62%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11232 2026-08-13 cs.CL cs.AI 新提交 62%

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试

Ruoxi Zhao, Maziar Raissi

机构 * University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。

Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07718 2026-08-12 cs.AI cs.CV cs.LG 版本更新 62%

A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

评估AI代理在神经科学数据到发现流程中的案例研究

Kai A. Horstmann, Ethan Lin, Alice A. Robie, Jennifer J. Sun, Kristin Branson

机构 * Cornell University(康奈尔大学) HHMI Janelia Research Campus(霍华德·休斯医学研究所贾雷尔研究园区)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估通用编码代理在果蝇光遗传学数据到发现流程中的表现,发现代理能解决单个阶段任务,但端到端流程仍超出其能力,主要挑战包括缺乏预定义迭代标准和科学判断能力。

Comments Peer-reviewed conference paper

Journal ref Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09802 2026-08-11 cs.CL cs.SE 新提交 62%

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试

Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏