arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-29 至 2025-12-29 共收录 3 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 3 篇

2512.21373 2025-12-29 cs.SE cs.AI cs.PL 82%

AInsteinBench: Benchmarking Coding Agents on Scientific Repositories

AInsteinBench:在科学仓库中评估编码代理的基准测试

Titouan Duston, Shuo Xin, Yang Sun, Daoguang Zan, Aoyan Li, Shulin Xin, Kai Shen, Yixiao Chen, Qiming Sun, Ge Zhang, Jiashuo Liu, Huan Zhou, Jingkai Liu, Zhichen Pu, Yuanheng Wang, Bo-Xuan Ge, Xin Tong, Fei Ye, Zhi-Chao Zhao, Wen-Biao Han, Zhoujian Cao, Yueran Zhao, Weiluo Ren, Qingshen Long, Yuxiao Liu, Anni Huang, Yidi Du, Yuanyuan Rong, Jiahao Peng

机构 * Princeton University(普林斯顿大学)

专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 AInsteinBench通过评估大型语言模型在科学计算开发中的能力,提供了一个基于真实科研软件生态系统的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22087 2025-12-29 cs.CL 57%

Context as a Tool: Context Management for Long-Horizon SWE-Agents

上下文作为工具:长周期SWE代理的上下文管理

Shukai Liu, Jian Yang, Bo Jiang, Yizhi Li, Jinyang Guo, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Manchester(曼彻斯特) Ubiquant

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 CAT通过整合上下文管理工具,提升SWE代理的长周期推理能力,实验表明其在SWE-Bench-Verified上达到57.6%的解决率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21919 2025-12-29 cs.CL 57%

SWE-RM: Execution-free Feedback For Software Engineering Agents

SWE-RM:无执行反馈用于软件工程代理

KaShun Shum, Binyuan Hui, Jiawei Chen, Lei Zhang, X. W., Jiaxi Yang, Yuzhen Huang, Junyang Lin, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 SWE-RM通过混合专家架构提升软件工程代理在TTS和RL中的性能,达到新的开源模型最佳水平。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏