Comments28 pages; v2: added Gemini Pro results, error analysis, and a discussion on confabulation; v3: see its extended version, an EMNLP 2024 paper, at https://aclanthology.org/2024.emnlp-main.740/
FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
FrontierMath: 一个评估人工智能高级数学推理能力的基准
Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Järviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, Mark Wildon
机构
*
Epoch AI
;
University of Leicester(利兹大学)
;
RWTH Aachen University(亚琛工业大学)
;
King’s College London(伦敦大学国王学院)
;
University of Bristol(布里斯托大学)
;
Iowa State University(爱荷华州立大学)
;
MIT(麻省理工学院)
;
University of North Carolina(北卡罗来纳大学)
;
CNRS - Université Paris-Saclay(法国国家科学研究中心-巴黎-萨克雷大学)
;
University of Siegen(锡根大学)
;
Knox College at Charlotte(夏洛特克恩学院)
;
James Madison University(詹姆斯麦迪逊大学)
;
ICMC, USP(巴西圣保罗大学ICMC分校)
;
Masaryk University(马萨里克大学)
;
UC Berkeley(伯克利加州大学)
;
Cornell University(康奈尔大学)
;
Rutgers University(罗格斯大学)
;
Harvard University(哈佛大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Independent(独立研究者)