arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.28405cs.CLcs.CY

CultureConverse:面向东亚与东南亚文化适配助手的多语言多轮模拟工具包

CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia

Bryan Chen Zhengyu Tan, Weihua Zheng, Thong T. Doan, Bich Ngoc Doan, Jia Wang Peh, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Zhengyuan Liu, JinYeong Bak, … 展开作者

Bryan Chen Zhengyu Tan, Weihua Zheng, Thong T. Doan, Bich Ngoc Doan, Jia Wang Peh, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Zhengyuan Liu, JinYeong Bak, Wafi Shamdi, Soo Kai Chie, Liew Yu Siong, Aina Azyyati Binti Mohamad Rezal, Lew Yan Yan Vanessa, Huadan Wu, Dylan Raharja, Nadya Yuki Wangsajaya, Akane Fukushige, Kazushi Kato, Koji Inoue, Tatsuya Kawahara, Jaehyung Seo, Dongjun Kim, Seungyoon Lee, Zi Haur Pang, Rui Yang Tan, Charibeth Ko Cheng, Maria Regina Justina Estuar, Jann Railey Montalan, Pham Minh Duc, Roy Ka-Wei Lee

首次发表
浏览论文内容

中文总结 AI 辅助

本研究推出CultureConverse多语言多轮模拟工具包,构建含14610个基准回合的数据集,评估18个模型发现GPT-5 mini表现最优,微调后模型在文化相关任务上性能提升。

中文摘要 AI 辅助

当前对大型语言模型(LLMs)的文化评估常将文化简化为通过多项选择题(MCQs)进行的单轮事实回忆,无法捕捉用户在文化适配场景下寻求多轮实际帮助这一常见使用场景。我们推出CultureConverse,这是一个可扩展的多语言文化适配助手对话模拟与评估工具包,覆盖10个东亚与东南亚地区、58个亚群体身份及7个领域。每个模拟与评估回合会生成带评分的交互结果,其中助手为用户提供帮助并从部分信息中推断文化约束条件。由此得到的CultureConverse-DS数据集包含14610个基准(评估)回合与274295个由先知引导(黄金模式)的对话。在对18个模型的基准评估中,GPT-5 mini实现了最高的帮助质量。人工标注实验表明,我们的评估框架足以作为人类判断的替代指标。对27860个高质量CultureConverse-DS样本进行微调带来的性能提升,既改善了领域内帮助效果,也提升了跨领域在文化MCQ及安全分类基准上的表现。我们发布该工具包、两个数据划分版本及评判提示,以支持对文化能力的交互式评估。

英文摘要

Current cultural evaluations for large language models (LLMs) often reduce culture to single-turn factual recall via MCQs, failing to capture a common use case: users seeking practical help over multiple turns in culturally grounded scenarios. We introduce CultureConverse, a scalable, multilingual simulation and evaluation harness for culturally grounded assistant dialogue that covers 10 East and Southeast Asian regions, 58 subgroup identities, and 7 domains. Each simulated and evaluated episode produces a scored interaction where the assistant assists the user and infers cultural constraints from partial information. The resulting CultureConverse-DS dataset contains 14,610 benchmark (evaluation) episodes and 274,295 oracle-guided (gold-mode) dialogues. In our benchmark evaluation of 18 models, GPT-5 mini achieves the highest assistance quality. Human annotation experiments suggest that our evaluation framework is a sufficient proxy for human judgment. Performance gains from fine-tuning on 27,860 high-quality CultureConverse-DS samples improve in-domain assistance and transfer out-of-domain to cultural MCQ and safety classification benchmarks. We release the harness, both splits, and judge prompts to support interactive evaluation of cultural competency.

发表机构

  • Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)
  • Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局)
  • École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)
  • Microsoft Research Asia (MSRA)(微软亚洲研究院)
  • Sungkyunkwan University (SKKU)(成均馆大学)
  • Universiti Brunei Darussalam (UBD)(文莱大学)
  • China University of Petroleum (East China)(中国石油大学(华东))
  • Nanyang Technological University (NTU)(南洋理工大学)
  • Kyoto University(京都大学)
  • Konkuk University(建国大学)
  • Upstage AI

机构由 AI 辅助整理,请以论文原文为准。

补充信息

↑