LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations
LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准
机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)
专题命中 Agent评测 :agent(title);multi-agent(title);autonomous agent(abstract);分类 cs.AI
AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。