arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2505.15068 2025-05-22 cs.AI cs.CL cs.LG 75%

ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges

Cheng Qian, Hongyi Du, Hongru Wang, Xiusi Chen, Yuji Zhang, Avirup Sil, Chengxiang Zhai, Kathleen McKeown, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research AI(IBM人工智能研究) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 36 Pages, 26 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20355 2025-04-30 cs.CL cs.AI cs.LG 75%

Local Prompt Optimization

Yash Jain, Vishal Chowdhary

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted as Oral at NAACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19865 2025-03-11 cs.CL cs.AI cs.LG 75%

Reverse Thinking Makes LLMs Stronger Reasoners

Justin Chih-Yao Chen, Zifeng Wang, Hamid Palangi, Rujun Han, Sayna Ebrahimi, Long Le, Vincent Perot, Swaroop Mishra, Mohit Bansal, Chen-Yu Lee, Tomas Pfister

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14985 2025-03-04 cs.CL cs.AI cs.LG 75%

Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data

Xinyi Wang, Antonis Antoniades, Yanai Elazar, Alfonso Amayuelas, Alon Albalak, Kexun Zhang, William Yang Wang

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19393 2025-03-04 cs.CL cs.AI cs.LG 75%

s1: Simple test-time scaling

Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Candès, Tatsunori Hashimoto

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 46 pages (9 main), 10 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18514 2025-03-03 cs.AI cs.CL cs.LG 75%

Scaling up Masked Diffusion Models on Text

Shen Nie, Fengqi Zhu, Chao Du, Tianyu Pang, Qian Liu, Guangtao Zeng, Min Lin, Chongxuan Li

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16666 2025-02-26 cs.AI cs.CL cs.LG 75%

SBSC: Step-By-Step Coding for Improving Mathematical Olympiad Performance

Kunal Singh, Ankan Biswas, Sayandeep Bhowmick, Pradeep Moturi, Siva Kishore Gollapalli

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a full conference paper at ICLR 2025. Shorter(Early) Version accepted at NeurIPS'24 MATH-AI track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17387 2025-02-25 cs.LG cs.AI cs.CL 75%

Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models

Alon Albalak, Duy Phung, Nathan Lile, Rafael Rafailov, Kanishk Gandhi, Louis Castricato, Anikait Singh, Chase Blagden, Violet Xiang, Dakota Mahan, Nick Haber

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18356 2025-01-31 cs.LG cs.AI cs.CL 75%

State Stream Transformer (SST) : Emergent Metacognitive Behaviours Through Latent State Persistence

Thea Aviss

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08273 2024-11-19 cs.CL cs.AI cs.LG 75%

Large Language Models are Null-Shot Learners

Pittawat Taveekitworachai, Febri Abdullah, Ruck Thawonmas

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages; v2: added Gemini Pro results, error analysis, and a discussion on confabulation; v3: see its extended version, an EMNLP 2024 paper, at https://aclanthology.org/2024.emnlp-main.740/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08739 2024-11-05 cs.CV 75%

MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine

Renrui Zhang, Xinyu Wei, Dongzhi Jiang, Ziyu Guo, Shicheng Li, Yichi Zhang, Chengzhuo Tong, Jiaming Liu, Aojun Zhou, Bin Wei, Shanghang Zhang, Peng Gao, Chunyuan Li, Hongsheng Li

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments WData and Models will be released at https://github.com/ZrrSkywalker/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10176 2024-11-05 cs.CL cs.AI cs.LG 75%

OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset

Shubham Toshniwal, Ivan Moshkov, Sean Narenthiran, Daria Gitman, Fei Jia, Igor Gitman

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Camera-ready version for NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01560 2024-10-08 cs.CL cs.AI cs.LG 75%

OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data

Shubham Toshniwal, Wei Du, Ivan Moshkov, Branislav Kisacanin, Alexan Ayrapetyan, Igor Gitman

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18219 2024-07-29 cs.LG cs.AI cs.CL 75%

Recursive Introspection: Teaching Language Model Agents How to Self-Improve

Yuxiao Qu, Tianjun Zhang, Naman Garg, Aviral Kumar

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05492 2024-06-10 cs.CL cs.AI cs.LG 75%

How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition

Guanting Dong, Hongyi Yuan, Keming Lu, Chengpeng Li, Mingfeng Xue, Dayiheng Liu, Wei Wang, Zheng Yuan, Chang Zhou, Jingren Zhou

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12219 2024-04-18 cs.CL cs.AI cs.LG 75%

Reformatted Alignment

Run-Ze Fan, Xuefeng Li, Haoyang Zou, Junlong Li, Shwai He, Ethan Chern, Jiewen Hu, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Homepage: https://gair-nlp.github.io/ReAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15670 2024-01-30 cs.CL cs.AI cs.LG 75%

YODA: Teacher-Student Progressive Learning for Language Models

Jianqiao Lu, Wanjun Zhong, Yufei Wang, Zhijiang Guo, Qi Zhu, Wenyong Huang, Yanlin Wang, Fei Mi, Baojun Wang, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09009 2023-11-01 cs.CL cs.AI cs.LG 75%

How is ChatGPT's behavior changing over time?

Lingjiao Chen, Matei Zaharia, James Zou

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments add more evaluations on instruction following

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16797 2023-10-02 cs.CL cs.AI cs.LG cs.NE 75%

Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution

Chrisantha Fernando, Dylan Banarse, Henryk Michalewski, Simon Osindero, Tim Rocktäschel

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08767 2023-07-19 cs.CL cs.AI cs.LG 75%

A mixed policy to improve performance of language models on math problems

Gang Chen

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-24 cs.CL cs.AI 版本更新 74%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model, v2: added memorization audits

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09351 2026-08-11 cs.LG cs.AI stat.ML 新提交 74%

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute

大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性

Nikita Kozodoi, Zainab Afolabi, Jack Butler

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(abstract,comments);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26823 2026-05-27 cs.CL 74%

Generating Logically Consistent Synthetic Supply Chain Data with LLM-Driven Knowledge Graph Reasoning

基于LLM驱动知识图谱推理生成逻辑一致的合成供应链数据

Yunbo Long, Ge Zheng, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 数学推理 :reasoning(title);分类 cs.CL

AI总结 针对合成供应链数据需保持操作逻辑一致性的问题,提出TabKG框架,通过构建列关系知识图谱并利用多LLM集成验证关系,结合潜在扩散模型生成逻辑一致的表格数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16675 2026-05-19 cs.AI 74%

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式

Shradha Agarwal, Deepak Rajbhar, Tariq J

机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)

专题命中 数学推理 :reasoning(title);分类 cs.AI

AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。

Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04872 2025-12-24 cs.AI 74%

FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI

FrontierMath: 一个评估人工智能高级数学推理能力的基准

Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Järviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, Mark Wildon

机构 * Epoch AI University of Leicester(利兹大学) RWTH Aachen University(亚琛工业大学) King’s College London(伦敦大学国王学院) University of Bristol(布里斯托大学) Iowa State University(爱荷华州立大学) MIT(麻省理工学院) University of North Carolina(北卡罗来纳大学) CNRS - Université Paris-Saclay(法国国家科学研究中心-巴黎-萨克雷大学) University of Siegen(锡根大学) Knox College at Charlotte(夏洛特克恩学院) James Madison University(詹姆斯麦迪逊大学) ICMC, USP(巴西圣保罗大学ICMC分校) Masaryk University(马萨里克大学) UC Berkeley(伯克利加州大学) Cornell University(康奈尔大学) Rutgers University(罗格斯大学) Harvard University(哈佛大学) ETH Zurich(苏黎世联邦理工学院) Independent(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI

AI总结 FrontierMath是一个由专家数学家设计的数学问题基准,用于评估AI在高级数学推理能力上的表现,揭示了当前AI与数学界能力之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10197 2025-10-02 cs.AI 74%

MathConstruct: Challenging LLM Reasoning with Constructive Proofs

Mislav Balunović, Jasper Dekoninck, Nikola Jovanović, Ivo Petrov, Martin Vechev

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) INSAIT, Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·欧里斯基"学院)

专题命中 数学推理 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03573 2025-06-05 cs.CL 74%

Exchange of Perspective Prompting Enhances Reasoning in Large Language Models

Lin Sun, Can Zhang

专题命中 数学推理 :reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11899 2025-05-20 cs.AI 74%

From Recall to Reasoning: Automated Question Generation for Deeper Math Learning through Large Language Models

Yongan Yu, Alexandre Krantz, Nikki G. Lobczowski

机构 * McGill University(麦吉尔大学)

专题命中 数学推理 :reasoning(title);分类 cs.AI

Comments 8 pages, 2 figures, accepted by AIED conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09998 2025-01-14 cs.CL math.HO 74%

Controlling Equational Reasoning in Large Language Models with Prompt Interventions

Jordan Meadows, Marco Valentino, Andre Freitas

专题命中 数学推理 :reasoning(title);分类 cs.CL

Comments AAAI 2025 (7 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.13512 2022-05-18 cs.AI cs.CV cs.RO 74%

Projection: A Mechanism for Human-like Reasoning in Artificial Intelligence

Frank Guerin

专题命中 数学推理 :reasoning(title);分类 cs.AI

Comments 29 pages, 3 figures. Some minor additions/clarifications in this revision, e.g. mathematical description

详情

展开后加载摘要…

URL PDF HTML 收藏