arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-02 至 2026-02-02 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2510.10460 2026-02-02 cs.SE cs.AI 84%

Understanding and Bridging the Planner-Coder Gap: A Systematic Study on the Robustness of Multi-Agent Systems for Code Generation

理解并弥合规划者-生成者之间的差距:对多智能体系统在代码生成中鲁棒性的系统研究

Zongyi Lyu, Songqiang Chen, Zhenlan Ji, Liwen Wang, Shuai Wang, Daoyuan Wu, Wenxuan Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Lingnan University(岭南大学) Renmin University of China(中国人民大学)

专题命中 代码生成 :code generation(title,abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文研究多智能体系统在代码生成中的鲁棒性问题,发现规划者与生成者之间的信息丢失是主要缺陷,并提出修复方法以提升系统鲁棒性。

Comments 18pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09726 2026-02-02 cs.PL cs.AI cs.SE 82%

Herb.jl: A Unifying Program Synthesis Library

Herb.jl:一个统一的程序合成库

Tilman Hinnerichs, Reuben Gardos Reid, Jaap de Jong, Bart Swinkels, Pamela Wochner, Nicolae Filat, Tudor Magurescu, Issa Hanou, Sebastijan Dumancic

机构 * Technical University Delft(代尔夫特理工大学)

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 Herb.jl是一个用Julia编写的统一程序合成库,旨在通过分解底层算法为可扩展的子组件,简化程序合成的重用和调整过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22249 2026-02-02 cs.LG cs.SE 81%

FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation

FunPRM:基于元奖励校正的函数作为步骤过程奖励模型用于代码生成

Ruiyi Zhang, Peijia Qin, Qi Cao, Eric Xue, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.LG

AI总结 FunPRM通过元学习的奖励校正机制提升代码生成性能,实现更高质量的代码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23009 2026-02-02 cs.SE 79%

SolAgent: A Specialized Multi-Agent Framework for Solidity Code Generation

SolAgent: 一种专门用于Solidity代码生成的多智能体框架

Wei Chen, Zhiyuan Peng, Xin Yin, Chao Ni, Chenhao Ying, Bang Xie, Yuan Luo

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 SolAgent通过双循环机制和文件系统能力,在智能合约生成中实现高正确性和安全性,Pass@1率达64.39%,减少安全漏洞39.77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22230 2026-02-02 cs.LG 79%

DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation

DAJ:用于代码生成测试时缩放的数据重加权LLM评判器

Peijia Qin, Ruiyi Zhang, Qi Cao, Pengtao Xie

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 DAJ通过双层数据重加权学习框架,提升LLM评判器在代码生成测试时缩放中的性能,实现对困难问题和轨迹一致数据的自动强调,取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00459 2026-02-02 cs.AI 57%

Thinking Machines: Mathematical Reasoning in the Age of LLMs

思考机器:在大语言模型时代中的数学推理

Andrea Asperti, Alberto Naibo, Claudio Sacerdoti Coen

机构 * Department of Informatics--- Science and Engineering (DISI), University of Bologna(信息科学与工程系(DISI),博洛尼亚大学) Department of Philosophy, University Paris 1 Panthéon-Sorbonne(哲学系,巴黎第一大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在数学推理中的现状,分析了传统数学与形式化数学的差异,以及证明合成与代码生成的对比,旨在明确当前系统的局限性并指出未来发展方向。

Journal ref Big Data and Cognitive Computing, 2026, 10(1), 38

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2510.21903 2026-02-02 cs.SE cs.AI 62%

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2512.09957 2026-02-02 cs.DC cs.CR cs.SE 57%

CloudFix: Automated Policy Repair for Cloud Access Control Policies Using Large Language Models

CloudFix: 利用大语言模型实现云访问控制策略的自动化修复

Bethel Hall, Owen Ungaro, William Eiers

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 CloudFix利用大语言模型和形式方法,实现云访问控制策略的自动化修复,提高修复准确性和效率。

Comments 12 pages

Journal ref SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2601.22803 2026-02-02 cs.AI cs.SE 62%

CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning

CVeDRL: 一种通过难度感知强化学习实现的高效代码验证器

Ji Shi, Peiming Guo, Meishan Zhang, Miao Zhang, Xuebo Liu, Min Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 CVeDRL通过难度感知强化学习提升代码验证效率,实现更高通过率和分支覆盖,参数更少,推理更快。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 2 篇

2601.22706 2026-02-02 cs.CR cs.SE 83%

RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories

RealSec-bench:一个评估现实世界仓库中安全代码生成的基准

Yanlin Wang, Ziyao Zhang, Chong Wang, Xinyi Xu, Mingwei Liu, Yong Wang, Jiachi Chen, Zibin Zheng

专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 RealSec-bench是一个基于现实世界Java仓库构建的安全代码生成评估基准,通过多阶段流程和专家验证,评估5种LLM在功能正确性和安全性方面的表现。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00205 2026-02-02 cs.SE cs.CR 70%

Towards a Benchmark for Dependency Decision-Making

面向依赖决策制定的基准测试

Tanmay Singla, Berk Çakar, Paschal C. Amusuo, James C. Davis

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 本文提出DepDec-Bench基准测试,用于评估人工智能编码代理在依赖决策中的安全性和效率,通过分析实际依赖变更数据,揭示代理在版本选择、依赖重用及安全影响方面的表现。

Comments Under review at JAWS 2026. 5 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 3 篇

2601.19494 2026-02-02 cs.SE cs.AI 81%

AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context

AACR-Bench: 评估自动代码审查的综合仓库级上下文

Lei Zhang, Yongda Yu, Minghui Yu, Xinxin Guo, Zhengqi Zhuang, Guoping Rong, Dong Shao, Haifeng Shen, Hongyu Kuang, Zhengfeng Li, Boge Wang, Guoan Zhang, Bangyu Xiang, Xiaobin Xu

机构 * Southern Cross University, Gold Coast, Australia(南方十字大学) TRE, Alibaba Inc., Hangzhou, China(阿里云)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 AACR-Bench通过综合仓库级上下文和专家验证流程,提升自动代码审查评估的准确性与全面性,揭示上下文粒度和检索方法对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22887 2026-02-02 cs.LG cs.AI cs.CL cs.CV 67%

MoVE: Mixture of Value Embeddings -- A New Axis for Scaling Parametric Memory in Autoregressive Models

MoVE:价值嵌入的混合——扩展自回归模型参数内存的新轴

Yangyan Li

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MoVE通过引入价值嵌入的混合机制,实现了自回归模型参数内存的独立扩展,提升了文本和图像生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19378 2026-02-02 cs.CV 50%

Establishing dermatopathology encyclopedia DermpathNet with Artificial Intelligence-Based Workflow

建立基于人工智能的工作流的皮肤病病理学百科全书DermpathNet

Ziyang Xu, Mingquan Lin, Yiliang Zhou, Zihan Xu, Seth J. Orlow, Shane A. Meehan, Alexandra Flamm, Ata S. Moshiri, Yifan Peng

机构 * Perelman Department of Dermatology, NYU Grossman School of Medicine(NYU Grossman医学院皮质病理科系) Weill Cornell Medicine(韦尔医学院) Mount Sinai Health(辛格医院) Department of Population Health Sciences(人群健康科学系)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出了一种基于人工智能的混合工作流,用于建立一个全面的开放获取皮肤病病理学图像数据集DermpathNet,通过深度学习和关键词检索相结合的方法,实现了高质量的图像分类和标注。

Comments Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏