CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation
CodeSpecBench: 用于可执行行为规范生成的LLM基准测试
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Edinburgh(爱丁堡大学) ; UCL(伦敦大学学院) ; CUHK (SZ)(香港中文大学(深圳)) ; SUTD(新加坡科技设计大学) ; HKUST(香港科技大学) ; CUHK(香港中文大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL
AI总结 本文提出CodeSpecBench,一个基于执行评估协议的LLM可执行行为规范生成基准,评估了15种最新LLM在函数和仓库级任务中的表现,发现仓库级任务性能显著下降,且规范生成比代码生成更具挑战性。