arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3227 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3227 篇

2309.13075 2023-09-26 cs.AI cs.CL cs.LG 82%

SCREWS: A Modular Framework for Reasoning with Revisions

Kumar Shridhar, Harsh Jhamtani, Hao Fang, Benjamin Van Durme, Jason Eisner, Patrick Xia

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01906 2023-08-04 cs.CL cs.AI cs.LG 82%

Reasoning in Large Language Models Through Symbolic Math Word Problems

Vedant Gaur, Nikunj Saunshi

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at the Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10535 2023-06-23 cs.AI cs.CL cs.CV cs.LG 82%

A Survey of Deep Learning for Mathematical Reasoning

Pan Lu, Liang Qiu, Wenhao Yu, Sean Welleck, Kai-Wei Chang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2023. The repository is available at https://github.com/lupantech/dl4math

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14325 2023-05-24 cs.CL cs.AI cs.CV cs.LG 82%

Improving Factuality and Reasoning in Language Models through Multiagent Debate

Yilun Du, Shuang Li, Antonio Torralba, Joshua B. Tenenbaum, Igor Mordatch

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project Webpage and Code: https://composable-models.github.io/llm_debate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09066 2022-11-17 cs.LG cs.AI cs.CL 82%

Teaching Algorithmic Reasoning via In-context Learning

Hattie Zhou, Azade Nova, Hugo Larochelle, Aaron Courville, Behnam Neyshabur, Hanie Sedghi

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05660 2022-04-13 cs.CL cs.AI cs.LG 82%

NumGLUE: A Suite of Fundamental yet Challenging Mathematical Reasoning Tasks

Swaroop Mishra, Arindam Mitra, Neeraj Varshney, Bhavdeep Sachdeva, Peter Clark, Chitta Baral, Ashwin Kalyan

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03921 2021-06-09 cs.CL cs.AI cs.LG 82%

Measuring and Improving BERT's Mathematical Abilities by Predicting the Order of Reasoning

Piotr Piękos, Henryk Michalewski, Mateusz Malinowski

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments The paper has been accepted to the ACL-IJCNLP 2021 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11207 2026-07-14 cs.CL cs.AI 新提交 82%

ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm

ProgramTab:通过编程范式提升大语言模型的表格推理能力

Pei Guo, Enjie Liu, Yunzhi Tan, Mochi Gao, Jianxin Zhang, Ruichao Zhong, Juntao Li, Bo Hu, Zang Li

机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。

Comments Large Language Models, Table Reasoning, In-context Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23292 2026-06-30 cs.AI cs.CL 82%

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

学习如何使用工具,而非仅仅何时:基于模式的工具集成推理

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang

机构 * University of Georgia(佐治亚大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。

Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13706 2025-12-17 cs.LG cs.CL 82%

Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training

通过混合训练缓解数学推理微调中的灾难性遗忘

John Graham Reynolds

机构 * Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出混合训练策略,通过交错数学和NLI任务来缓解微调中的灾难性遗忘,同时保持数学性能和NLI准确性。

Comments 11 pages, 2 figures. Code available at https://github.com/johngrahamreynolds/mathematical_catastrophe_mitigation. Models available at https://huggingface.co/collections/MarioBarbeque/catastrophic-forgetting-in-mathematical-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06522 2025-11-11 cs.AI cs.LG 82%

FractalBench: Diagnosing Visual-Mathematical Reasoning Through Recursive Program Synthesis

Jan Ondras, Marek Šuppa

机构 * MIT(麻省理工学院) Comenius University in Bratislava(布拉迪斯拉发孔院大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to The 5th Workshop on Mathematical Reasoning and AI at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025); 25 pages, 14 figures, 8 tables; Code available at https://github.com/NaiveNeuron/FractalBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03808 2025-11-07 cs.LG cs.AI 82%

Optimizing Reasoning Efficiency through Prompt Difficulty Prediction

Bo Zhao, Berkcan Kapusuzoglu, Kartik Balasubramaniam, Sambit Sahu, Supriyo Chakraborty, Genta Indra Winata

机构 * UC San Diego(加州大学圣地亚哥分校) Capital One(Capital One公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17496 2025-11-03 cs.LG cs.AI 82%

I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models

Giacomo Camposampiero, Michael Hersche, Roger Wattenhofer, Abu Sebastian, Abbas Rahimi

机构 * IBM Research – Zurich(IBM瑞士研究中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at the 5th Workshop on Mathematical Reasoning and AI (MATH-AI), NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00726 2025-08-29 cs.AI cs.LG 82%

Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess

Dongyoon Hwang, Hojoon Lee, Jaegul Choo, Dongmin Park, Jongho Park

机构 * KAIST AI(韩国科学技术院人工智能研究所) KRAFTON(KRAFTON公司) UC Berkeley(伯克利大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted into Test-time Scaling and Reasoning Models (SCALR) workshop at COLM 2025. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08989 2025-06-11 cs.LG cs.CL 82%

SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning

Xiao Liang, Zhong-Zhi Li, Yeyun Gong, Yang Wang, Hengyuan Zhang, Yelong Shen, Ying Nian Wu, Weizhu Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) School of Artificial Intelligence Chinese Academy of Sciences(中国科学院人工智能学院) Microsoft(微软) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Reinforcement Learning; Large Language Models; LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01207 2026-08-06 cs.CV cs.AI 版本更新 81%

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择

Puzhuo Zheng, Hasan Kurban

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02003 2026-06-30 cs.CL cs.HC 81%

HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs

HoT: 用于从输入中引用支持事实的高亮推理链

Tin Nguyen, Logan Bolton, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(亚伯拉罕大学) University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出HoT技术,通过XML标签高亮输入中的关键事实,减少LLM的幻觉问题,提升22项任务的准确性,并帮助人类更高效地验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19302 2026-05-28 cs.CL 81%

Formula-One Prompting: A Composable Equation-First Prefix for Applied Mathematics

Formula-One Prompting:一种可组合的方程优先前缀用于应用数学

Natapong Nitarach, Pittawat Taveekitworachai, Kunat Pipatanakul

机构 * SCB DataX, SCBX Group(SCB数据X,SCBX集团)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出公式提示(FP)和Formula-One提示(F-1),通过先形式化问题中的控制方程再求解,在多个应用数学基准上优于思维链和程序思维提示,平均提升5.76和8.42个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10443 2026-05-08 cs.SE cs.AI 81%

Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?

大型语言模型在语义保持变异下的理解鲁棒性如何?

Pedro Orvalho, Marta Kwiatkowska

机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学)

专题命中 数学推理 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在Python程序上的推理能力,通过五种语义保持的代码变异测试,发现模型在语义变换下表现出显著的脆弱性,正确预测基于 flawed reasoning 的比例在10%-50%之间,且预测稳定性差。

Comments 17 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12736 2026-04-15 cs.CL 81%

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood

令牌级策略优化:通过序列级似然将群体级奖励与令牌级聚合联系起来

Xingyu Lin, Yilin Wen, Du Su, Jinchang Hou, En Wang, Wenbin Liu, Chenfu Bao, Zhonghou Lv

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(教育部符号计算与知识工程重点实验室,吉林大学) Baidu Inc.(百度公司) Tsinghua University(清华大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出TEPO,通过序列级似然将群体奖励与单个令牌联系,并引入KL散度掩码约束以提升训练稳定性,实验显示其在数学推理任务中表现优异且收敛时间减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08665 2025-08-14 cs.AI 81%

Aryabhata: An exam-focused language model for JEE Math

Ritvik Rastogi, Sachin Dharashivkar, Sandeep Varma

机构 * PhysicsWallah(物理墙)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01714 2024-03-12 cs.LG 81%

Large Language Models as Analogical Reasoners

Michihiro Yasunaga, Xinyun Chen, Yujia Li, Panupong Pasupat, Jure Leskovec, Percy Liang, Ed H. Chi, Denny Zhou

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments Published at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24472 2026-08-19 cs.CL cs.LG 版本更新 81%

Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

为什么自蒸馏(有时)会降低大语言模型的推理能力?

Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dohyung Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国成均馆大学) Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了自蒸馏在数学推理中降低大语言模型推理能力的原因,发现其通过抑制模型在推理过程中的不确定性表达,导致在未见过的问题上表现下降,强调了适当表达不确定性对鲁棒推理的重要性。

Comments Accepted to COLM 2026. Code is available at https://github.com/beanie00/self-distillation-analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15797 2026-08-18 cs.AI cs.CL 新提交 81%

KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving

KV-Rescue:通过逐步交错恢复推理语言模型的KV驱逐损失

Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KV-Rescue是一种无需训练的推理框架,通过交错轻量级辅助模型的推理步骤,结合在线检测器,在驱逐预算B=64时平均恢复了87%的KV驱逐损失准确率,还减少了43%的基础模型token生成量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14277 2026-08-17 cs.CL cs.AI 新提交 81%

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

SimpleOPD:适用于长上下文推理的、简单的与分词器无关的在线策略蒸馏

Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出SimpleOPD方法,通过共享文本空间对齐令牌、引入学生参考KL损失并屏蔽特殊终止令牌优势,将长上下文模型SU-01的推理能力迁移至多类学生模型,在数学及科学基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01014 2026-08-17 cs.CL cs.AI 版本更新 81%

Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何

Yuzhou Liu, Xiyang Hu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。

Comments 14 pages, 2 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09128 2026-08-11 cs.CL cs.AI cs.MA 新提交 81%

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进

Keyu He, Xuhui Zhou, Maarten Sap

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23333 2026-08-11 cs.LG cs.CL 版本更新 81%

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

校准大语言模型推理的置信度边际过程监督

Liaoyaqi Wang, Chunsheng Zuo, William Jurayj, Benjamin Van Durme, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 81%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06465 2026-08-11 cs.CL cs.AI 版本更新 81%

Multi-objective Evolutionary Merging Enables Efficient Reasoning Models

多目标进化融合实现高效推理模型

Mario Iacobelli, Adrian Robert Minut, Tommaso Mencattini, Donato Crisostomi, Andrea Santilli, Iacopo Masi, Emanuele Rodolà

机构 * Sapienza University of Rome(罗马大学) Independent Researcher(独立研究员) EPFL(瑞士联邦理工学院洛桑) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Evo-L2S框架,通过多目标优化解决长到短推理问题,减少生成推理轨迹长度同时保持或提升推理准确性。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏