JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors
JuICE:评估LLM裁判识别文化错误的基准
机构 * KAIST(韩国科学技术院) ; Google(谷歌) ; Universitas Gadjah Mada(加查马达大学)
AI总结 提出JuICE基准,包含7470个文化语言错误标注的多语言数据集,用于评估LLM裁判在长文本中识别深层文化错误的能力,发现最强模型F1仅0.52且常遗漏本地人易识别的错误。