AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration
AXIOM:通过基于规则的扰动和多源质量校准构建LLM-as-a-Judge代码评估基准
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Monash University Malaysia(墨尔本大学马来西亚分校) ; Zhejiang University(浙江大学)
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 AXIOM通过基于规则的扰动和多源质量校准构建代码评估基准,以实现高质量代码评分的平衡分布和可靠评估。