arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-17 至 2026-02-17 共收录 4 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 4 篇

2602.13921 2026-02-17 cs.LG cs.AI cs.SE 82%

GREPO: A Benchmark for Graph Neural Networks on Repository-Level Bug Localization

GREPO:图神经网络在仓库级Bug定位上的基准

Juntong Wang, Libin Chen, Xiyuan Wang, Shijia Kang, Haotong Yang, Da Zheng, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 GREPO是首个用于仓库级Bug定位的GNN基准,包含86个Python仓库和47294个Bug修复任务,展示了GNN在Bug定位中的优越性能。

Comments 46 pages, 14figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12185 2026-02-17 cs.SE cs.CL cs.LG 75%

EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming

EVALOOOP:一种以自一致性为中心的大型语言模型编程鲁棒性评估框架

Sen Fang, Weiyuan Ding, Mengshi Zhang, Zihao Chen, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 EVALOOOP通过自一致性反馈循环评估LLM在编程任务中的鲁棒性,利用ASL度量揭示模型在持续自指代转换中的语义保持能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19666 2026-02-17 cs.CL 57%

RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams

RoD-TAL:罗马尼亚驾照考试问答的基准测试

Andrei Vlad Man, Răzvan-Alexandru Smădu, Cristian-George Craciun, Dumitru-Clementin Cercel, Florin Pop, Mihaela-Claudia Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校) Technical University of Munich(慕尼黑技术大学) National Institute for Research & Development in Informatics - ICI Bucharest(信息研究所-布加勒斯特) Paris 1 Panthéon-Sorbonne University(巴黎1大学) University of Bucharest(布加勒斯特大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 RoD-TAL是一个用于评估大型语言模型和视觉语言模型在罗马尼亚驾照法律问答中性能的多模态基准数据集,通过文本和图像问答任务验证了领域微调和推理优化对考试通过率的影响。

Comments 41 pages, 30 figures, Accepted by the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13671 2026-02-17 cs.MA cs.AI 57%

MAS-on-the-Fly: Dynamic Adaptation of LLM-based Multi-Agent Systems at Test Time

MAS-on-the-Fly: 在测试时动态适应基于大语言模型的多智能体系统

Guangyi Liu, Haojun Lin, Huan Zeng, Heng Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Ant Group(蚂蚁集团)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MASFly通过动态适应机制在测试时优化多智能体系统,利用检索增强和经验引导机制提升任务适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏