CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
CodeIF-Bench: 评估大型语言模型在交互式代码生成中的指令遵循能力
机构 * School of Computer Science & Engineering, State Key Laboratory of Complex & Critical Software Environment, Beihang University(计算机科学与工程学院、复杂与关键软件环境国家重点实验室、北京航空航天大学) ; School of Software, Beihang University(软件学院、北京航空航天大学) ; Huawei Cloud Computing Technologies Co., Ltd. China(华为云计算技术有限公司)
专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 CodeIF-Bench通过九种可验证指令评估LLMs在多轮交互中的指令遵循能力,揭示了上下文管理对性能的影响。