arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-22 至 2025-12-22 共收录 4 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 4 篇

2512.17419 2025-12-22 cs.SE cs.AI cs.CL cs.LG 77%

SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories

SWE-Bench++: 一个从开源仓库生成可扩展软件工程基准的框架

Lilin Wang, Lucas Ramalho, Alan Celestino, Phuc Anthony Pham, Yu Liu, Umang Kumar Sinha, Andres Portillo, Onassis Osunwa, Gabriel Maduekwe

机构 * Research & Development, Turing(研发与图灵)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Bench++通过自动化生成多语言软件工程基准,提升仓库级代码生成的评估与改进

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17387 2025-12-22 cs.SE cs.CL 62%

CIFE: Code Instruction-Following Evaluation

CIFE:代码指令遵循评估

Sravani Gunnu, Shanmukha Guttula, Hima Patel

机构 * IIT Bombay(印度班加罗尔理工学院) IBM Research India(IBM印度研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 CIFE评估了1000个Python任务的代码生成模型,通过13类约束测试,揭示了模型在遵循开发者要求方面的不足,提出C2A分数衡量正确性与约束遵循性。

Comments 20 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 57%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17838 2025-12-22 cs.CV 50%

ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges

ReX-MLE:医疗影像挑战的自主代理基准

Roshan Kenia, Xiaoman Zhang, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 代码评测 :coding agent(abstract)

AI总结 ReX-MLE是一个针对医学影像挑战的自主代理基准,通过评估端到端工作流程,揭示了现有代理在领域知识和工程能力上的不足。

Comments https://github.com/rajpurkarlab/ReX-MLE

详情

展开后加载摘要…

URL PDF HTML 收藏