StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs
StatABench:评估大语言模型统计分析能力的数据集与框架
机构 * Southern University of Science and Technology(南方科技大学) ; Alibaba Group(阿里巴巴集团) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Hong Kong(香港大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。