arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-03 至 2026-02-03 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 9 篇

2601.03708 2026-02-03 cs.PL cs.AI 81%

MHRC-Bench: A Multilingual Hardware Repository-Level Code Completion benchmark

MHRC-Bench: 一个多语言硬件仓库级代码补全基准

Qingyun Zou, Jiahao Cui, Nuo Chen, Bingsheng He, Weng-Fai Wong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 代码评测 :repository(title,abstract);分类 cs.AI、cs.PL

AI总结 MHRC-Bench是首个多语言硬件仓库级代码补全基准,涵盖三种硬件设计编码风格,通过代码结构和硬件导向语义标签进行补全任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13853 2026-02-03 cs.CL cs.AI cs.DB cs.HC 62%

BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation

BenchPress:一种用于快速文本到SQL基准定制的人机协作标注系统

Fabian Wenz, Omar Bouattour, Devin Yang, Justin Choi, Cecil Gregg, Nesime Tatbul, Çağatay Demiralp

机构 * TU Munich(慕尼黑技术大学) MIT(麻省理工学院) Intel Labs(英特尔实验室) AWS AI Labs(亚马逊AI实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 BenchPress通过人机协作系统加速特定领域文本到SQL基准的创建,结合LLM生成与人类验证提升标注准确性与基准可靠性。

Comments CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02345 2026-02-03 cs.SE 57%

A Task-Level Evaluation of AI Agents in Open-Source Projects

对开源项目中AI代理的任务级评估

Shojibur Rahman, Md Fazle Rabbi, Minhaz Zibran

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文评估了五个AI代理在开源项目中的表现,发现Codex在PR接受率上表现优异,而Copilot在审查讨论量上领先,但提交质量因任务类型而异。

Comments 5 pages, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01714 2026-02-03 cs.CL 57%

MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark

MedAraBench:大规模阿拉伯语医学问答数据集和基准测试

Mouath Abu-Daoud, Leen Kharouf, Omar El Hajj, Dana El Samad, Mariam Al-Omari, Jihad Mallat, Khaled Saleh, Nizar Habash, Farah E. Shamout

机构 * Engineering Division, New York University Abu Dhabi(纽约大学阿布扎克分校工程系) Cleveland Clinic Abu Dhabi(阿布扎克克利夫兰诊所) Science Division, New York University Abu Dhabi(纽约大学阿布扎克分校科学系)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 MedAraBench是一个大规模阿拉伯语医学问答数据集,旨在通过提供多样化的医学领域数据来提升大型语言模型的多语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19110 2026-02-03 cs.CL 57%

APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

APE-Bench: 评估形式数学库中的自动化证明工程

Huajian Xin, Luming Li, Xiaoran Jin, Jacques Fleuriot, Wenda Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 APE-Bench提出了一种系统性评估仓库级证明工程的框架,通过双验证机制评估语法编译和语义要求满足,并提供开源工具进行标准化评估和公平比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13620 2026-02-03 cs.SE 57%

Programming Language Confusion: When Code LLMs Can't Keep their Languages Straight

编程语言混淆:当代码LLM无法保持语言一致

Micheline Bénédicte Moumoula, Serge Lionel Nikiema, Abdoul Kader Kabore, Jacques Klein, Tegawendé F. Bissyande

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 研究揭示代码LLM在编程语言混淆问题上的系统性错误,提出通过显式语言关键词缓解,并倡导标准化评估以提升多语言代码生成系统的可靠性。

Comments Accepted for publication at SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01170 2026-02-03 cs.CL 57%

EmoAra: Emotion-Preserving English Speech Transcription and Cross-Lingual Translation with Arabic Text-to-Speech

EmoAra: 一种保留情感的英语语音转录与跨语言翻译系统,结合阿拉伯语文本到语音

Besher Hassan, Ibrahim Alsarraj, Musaab Hasan, Yousef Melhim, Shahem Fadi, Shahem Sultan

机构 * MBZUAI(穆罕默德·本·拉希德智能技术研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 EmoAra通过整合语音情感识别、自动语音识别、机器翻译和文本到语音技术,实现英语语音转录与阿拉伯语音输出的跨语言翻译,保留情感细微差别。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 57%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01597 2026-02-03 astro-ph.HE 50%

A Catalogue of Variable Active Galactic Nuclei Based on Multi-Timescale Variability Analysis from Fermi-LAT Data

基于费米-拉特数据多时间尺度变异性分析的变星活动星系核目录

Luana Passos-Reis, Elisabete M. de Gouveia Dal Pino, Tarek Hassan, Santiago Pita, Alberto Domínguez

专题命中 代码评测 :repository(abstract)

AI总结 基于费米-拉特数据多时间尺度变异性分析,构建变星活动星系核目录,揭示FSRQ与BL Lac的变异性差异,为高能喷流研究提供基础。

Comments 4 pages, 1 figure, 1 table. Presented at High Energy Phenomena in Relativistic Outflows IX (HEPRO-IX), 2025

Journal ref PoS(HEPRO-IX)078 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏