CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
CoreEval: 通过现实世界知识自动构建抗污染数据集以实现可靠的LLM评估
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东省新型安全智能技术重点实验室) ; The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 CoreEval通过现实世界知识自动更新数据集,提升LLM评估的抗污染能力,减少数据污染导致的性能高估问题。
Comments ACL'25