arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Cornell University(康奈尔大学)

2025-12-24 至 2025-12-24 共收录 2
2512.19903 2025-12-24 cs.CL

How well do Large Language Models Recognize Instructional Moves? Establishing Baselines for Foundation Models in Educational Discourse

大型语言模型如何识别教学行为?为教育对话的基础模型建立基准

Kirk Vanacore, Rene F. Kizilcec

机构 * National Tutoring Observatory(国家辅导观察所) Cornell University(康奈尔大学)

AI总结 研究评估了六种LLM在分类真实课堂教学行为任务中的基准性能,发现少样本提示显著提升表现,但存在可靠性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04872 2025-12-24 cs.AI

FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI

FrontierMath: 一个评估人工智能高级数学推理能力的基准

Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Järviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, Mark Wildon

机构 * Epoch AI University of Leicester(利兹大学) RWTH Aachen University(亚琛工业大学) King’s College London(伦敦大学国王学院) University of Bristol(布里斯托大学) Iowa State University(爱荷华州立大学) MIT(麻省理工学院) University of North Carolina(北卡罗来纳大学) CNRS - Université Paris-Saclay(法国国家科学研究中心-巴黎-萨克雷大学) University of Siegen(锡根大学) Knox College at Charlotte(夏洛特克恩学院) James Madison University(詹姆斯麦迪逊大学) ICMC, USP(巴西圣保罗大学ICMC分校) Masaryk University(马萨里克大学) UC Berkeley(伯克利加州大学) Cornell University(康奈尔大学) Rutgers University(罗格斯大学) Harvard University(哈佛大学) ETH Zurich(苏黎世联邦理工学院) Independent(独立研究者)

AI总结 FrontierMath是一个由专家数学家设计的数学问题基准,用于评估AI在高级数学推理能力上的表现,揭示了当前AI与数学界能力之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏