Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge
大语言模型的流行病学:一种用于观察分布知识的基准测试
机构 * Department of Statistics & Data Science University of California, Los Angeles(统计与数据科学系,加州大学洛杉矶分校) ; Department of Computer Science ETH Zürich(计算机科学系,苏黎世联邦理工学院) ; Causal AI Lab Columbia University(因果AI实验室,哥伦比亚大学)
AI总结 本文提出了一种用于评估大语言模型在现实世界概率分布知识方面能力的基准测试,发现LLMs在理解和内部化真实世界统计信息方面表现不佳。