arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-24 至 2025-12-24 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2505.17266 2025-12-24 cs.CL cs.AI 90%

Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning

Select2Reason: 为长链推理实现高效的指令微调数据选择

Cehao Yang, Xueyuan Lin, Xiaojun Wu, Chengjin Xu, Xuhui Jiang, Honghao Liu, Hui Xiong, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) IDEA Research, International Digital Economy Academy(IDEA研究所,国际数字经济学院) Hithink RoyalFlush Information Network Co., Ltd(Hithink RoyalFlush信息网络有限公司)

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 Select2Reason通过高效数据选择提升长链推理性能,实验证明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23129 2025-12-24 cs.LG cs.AI cs.CL 82%

C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning

C$^2$GSPG:基于置信度校准的群体序列策略梯度方法,用于自感知推理

Haotian Liu, Shuo Wang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) Tsinghua University(清华大学) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 C$^2$GSPG通过置信度校准群体序列策略梯度方法提升推理性能并抑制过度自信,适用于逻辑和数学推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04872 2025-12-24 cs.AI 74%

FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI

FrontierMath: 一个评估人工智能高级数学推理能力的基准

Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Järviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, Mark Wildon

机构 * Epoch AI University of Leicester(利兹大学) RWTH Aachen University(亚琛工业大学) King’s College London(伦敦大学国王学院) University of Bristol(布里斯托大学) Iowa State University(爱荷华州立大学) MIT(麻省理工学院) University of North Carolina(北卡罗来纳大学) CNRS - Université Paris-Saclay(法国国家科学研究中心-巴黎-萨克雷大学) University of Siegen(锡根大学) Knox College at Charlotte(夏洛特克恩学院) James Madison University(詹姆斯麦迪逊大学) ICMC, USP(巴西圣保罗大学ICMC分校) Masaryk University(马萨里克大学) UC Berkeley(伯克利加州大学) Cornell University(康奈尔大学) Rutgers University(罗格斯大学) Harvard University(哈佛大学) ETH Zurich(苏黎世联邦理工学院) Independent(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI

AI总结 FrontierMath是一个由专家数学家设计的数学问题基准,用于评估AI在高级数学推理能力上的表现,揭示了当前AI与数学界能力之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏