arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-07-14 至 2026-07-14 共收录 1
2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏