PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code
PACIFIC:用于检查精确自动指令遵循的代码基准生成框架
机构 * IBM Research(IBM研究)
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 PACIFIC框架通过生成具有明确预期输出的基准,评估LLM在代码指令遵循和dry运行能力上的表现,提供了一种抗污染且可扩展的评估方法。