CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks
CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Language and Culture University(北京语言大学) ; LMU Munich(慕尼黑大学) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; University of Turku(图尔库大学) ; IBM Research AI, UAE(阿联酋IBM人工智能研究) ; MBZUAI ; Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) ; Southern University of Science and Technology(南方科技大学)
AI总结 本文提出 CulturALL 基准测试,评估 LLM 在 grounded 任务中的多语言和多文化能力,包含 14 种语言 51 个地区 16 个主题的 2610 个样本,实验显示最佳 LLM 准确率仅 44.48%。