arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-22 至 2026-04-22 共收录 2
2604.19262 2026-04-22 cs.CL cs.AI

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

机构 * Alibaba Group(阿里巴巴集团) Beijing Language and Culture University(北京语言大学) LMU Munich(慕尼黑大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) IBM Research AI, UAE(阿联酋IBM人工智能研究) MBZUAI Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出 CulturALL 基准测试,评估 LLM 在 grounded 任务中的多语言和多文化能力,包含 14 种语言 51 个地区 16 个主题的 2610 个样本,实验显示最佳 LLM 准确率仅 44.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18177 2026-04-22 cs.CL cs.AI

STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs

STaD:基于支架任务设计的LLM组合技能缺口识别

Sungeun An, Swanand Ravindra Kadhe, Shailja Thakur, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

AI总结 STaD框架通过生成受控变体任务,系统探测LLM在组合技能上的不足,揭示不同模型的独特技能缺口。

Comments 9 pages, 3 figures, 3 tables, ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏