SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试
机构 * GigaCode ; ITMO University(ITMO大学) ; MWS AI(MWS人工智能) ; IITU university(IITU大学)
AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。
Comments EMNLP 2025