arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-04 至 2025-12-04 共收录 3 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 3 篇

2506.03013 2025-12-04 cs.SE cs.LG 73%

Cataloguing Hugging Face Models to Software Engineering Activities: Automation and Findings

对Hugging Face模型进行软件工程活动的分类:自动化与发现

Alexandra González, Xavier Franch, David Lo, Silverio Martínez-Fernández

机构 * Universitat Politècnica de Catalunya(政治与技术大学) Singapore Management University(新加坡管理大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.LG

AI总结 本文通过分类Hugging Face上的预训练模型,揭示了软件工程中模型的应用现状与不足,为自动化场景提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24091 2025-12-04 cs.SE cs.AI cs.PF 62%

PerfBench: Can Agents Resolve Real-World Performance Bugs?

PerfBench: 代理能否解决现实中的性能缺陷?

Spandan Garg, Roshanak Zilouchian Moghaddam, Neel Sundaresan

机构 * Microsoft Corporation(微软公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 PerfBench通过引入新的基准测试,评估代理解决性能缺陷的能力,发现现有代理在性能优化任务上表现不佳,但通过改进工具和指导可提升至20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 50%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 代码评测 :repository(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏