EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
EvoCodeBench:用于自演化LLM驱动编码系统的性能基准
机构 * Nanyang Technological University(南洋理工大学) ; East China University of Science and Technology(东华大学) ; Guangdong Ocean University(广东海洋大学) ; City University of Hong Kong(香港城市大学) ; Stanford University(斯坦福大学)
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。