arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-02 至 2026-02-02 共收录 2 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 2 篇

2601.22706 2026-02-02 cs.CR cs.SE 83%

RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories

RealSec-bench:一个评估现实世界仓库中安全代码生成的基准

Yanlin Wang, Ziyao Zhang, Chong Wang, Xinyi Xu, Mingwei Liu, Yong Wang, Jiachi Chen, Zibin Zheng

专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 RealSec-bench是一个基于现实世界Java仓库构建的安全代码生成评估基准,通过多阶段流程和专家验证,评估5种LLM在功能正确性和安全性方面的表现。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00205 2026-02-02 cs.SE cs.CR 70%

Towards a Benchmark for Dependency Decision-Making

面向依赖决策制定的基准测试

Tanmay Singla, Berk Çakar, Paschal C. Amusuo, James C. Davis

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 本文提出DepDec-Bench基准测试,用于评估人工智能编码代理在依赖决策中的安全性和效率,通过分析实际依赖变更数据,揭示代理在版本选择、依赖重用及安全影响方面的表现。

Comments Under review at JAWS 2026. 5 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏