arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-04 至 2025-12-04 共收录 11 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2509.08863 2025-12-04 cs.SE 79%

GeoJSON Agents:A Multi-Agent LLM Architecture for Geospatial Analysis-Function Calling vs Code Generation

GeoJSON代理:一种用于地理空间分析的多智能体LLM架构——功能调用与代码生成

Qianqian Luo, Qingming Lin, Liuchang Xu, Sensen Wu, Ruichen Mao, Chao Wang, Hailin Feng, Bo Huang, Zhenhong Du

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 GeoJSON代理通过功能调用与代码生成技术,提升地理空间分析任务的准确性和稳定性,展现多智能体LLM在复杂任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07506 2025-12-04 cs.DC cs.AI cs.CL cs.LG cs.SE 70%

Astra: A Multi-Agent System for GPU Kernel Performance Optimization

Astra:一种用于GPU内核性能优化的多智能体系统

Anjiang Wei, Tianran Sun, Yogesh Seenichamy, Hang Song, Anne Ouyang, Azalia Mirhoseini, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 Astra是首个基于LLM的多智能体系统,用于优化GPU内核性能,通过协作生成高效内核并实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03272 2025-12-04 cs.AI 57%

When Do Symbolic Solvers Enhance Reasoning in Large Language Models?

符号求解器在大语言模型中增强推理何时有效?

Zhiyuan He, Dingmin Wang

机构 * University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文研究符号求解器如何在大语言模型中增强推理,发现其在需要有限隐式推理但具有充足搜索空间的问题中表现优异,尤其在约束满足问题中提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03289 2025-12-04 cs.HC 50%

DAWZY: A New Addition to AI powered "Human in the Loop" Music Co-creation

DAWZY:一种新的AI驱动的“人机协同”音乐共创工具

Aaron C Elkins, Sanchit Singh, Adrian Kieback, Sawyer Blankenship, Uyiosa Philip Amadasun, Aman Chadha

专题命中 代码生成 :code generation(abstract)

AI总结 DAWZY是一种基于AI的开源音乐创作工具,通过自然语言交互和LLM代码生成,提升音乐制作效率与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2512.03549 2025-12-04 cs.AI 79%

PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks

PARC:一种自主自反思编码代理,用于稳健执行长周期任务

Yuki Orimo, Iori Kurata, Hodaka Mori, Ryuhei Okuno, Ryohto Sawada, Daisuke Okanohara

机构 * PARC

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 PARC是一种自主自反思编码代理,通过自我评估和反馈机制实现长周期任务的稳健执行,展示了AI在自主科学分析中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2507.12482 2025-12-04 cs.SE cs.AI cs.CE cs.LG 85%

Kodezi Chronos: A Debugging-First Language Model for Repository-Scale Code Understanding

Kodezi Chronos:面向仓库级代码理解的调试优先语言模型

Ishraq Khan, Assad Chowdary, Sharoz Haseeb, Urvish Patel, Yousuf Zaii

专题命中 程序修复 :repository(title,abstract);code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 Kodezi Chronos-1是一种专为调试设计的语言模型,通过自适应图引导检索、持久调试内存和七层架构,在多文件调试任务中达到67.3%的修复准确率,超越现有模型并实现仓库特定的高解决率。

Comments 24 figures, 43 tables, 2 algorithms. Extended technical report introducing Chronos-1, a debugging-specific language model. Information available at https://github.com/Kodezi/chronos

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2506.03013 2025-12-04 cs.SE cs.LG 73%

Cataloguing Hugging Face Models to Software Engineering Activities: Automation and Findings

对Hugging Face模型进行软件工程活动的分类:自动化与发现

Alexandra González, Xavier Franch, David Lo, Silverio Martínez-Fernández

机构 * Universitat Politècnica de Catalunya(政治与技术大学) Singapore Management University(新加坡管理大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.LG

AI总结 本文通过分类Hugging Face上的预训练模型,揭示了软件工程中模型的应用现状与不足,为自动化场景提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24091 2025-12-04 cs.SE cs.AI cs.PF 62%

PerfBench: Can Agents Resolve Real-World Performance Bugs?

PerfBench: 代理能否解决现实中的性能缺陷?

Spandan Garg, Roshanak Zilouchian Moghaddam, Neel Sundaresan

机构 * Microsoft Corporation(微软公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 PerfBench通过引入新的基准测试,评估代理解决性能缺陷的能力,发现现有代理在性能优化任务上表现不佳,但通过改进工具和指导可提升至20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 50%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 代码评测 :repository(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 2 篇

2501.01496 2025-12-04 astro-ph.IM astro-ph.HE cs.AI cs.LG 62%

ORACLE: A Real-Time, Hierarchical, Deep-Learning Photometric Classifier for the LSST

ORACLE:一种用于LSST的实时、分层、深度学习光度分类器

Ved G. Shah, Alex Gagliano, Konstantin Malanchev, Gautham Narayan, Alex I. Malz, The LSST Dark Energy Science Collaboration

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 ORACLE是一种基于深度学习的实时光度分类器,通过分层结构和上下文信息实现高精度瞬变天体分类。

Comments 30 pages, 20 figures, 9 tables. Accepted to ApJ

Journal ref 2025 ApJ 995 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02977 2025-12-04 cs.SE cs.AI 62%

Large Language Model-Based Agents for Software Engineering: A Survey

基于大型语言模型的软件工程代理:一项综述

Junwei Liu, Kaixin Wang, Yixuan Chen, Xin Peng, Zhenpeng Chen, Lingming Zhang, Yiling Lou

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文综述了基于大型语言模型的软件工程代理,分析了其应用、挑战及未来方向。

Comments Accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏