arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2512.19995 2026-05-12 cs.CL cs.AI cs.LG 82%

Schoenfeld's Anatomy of Mathematical Reasoning by Language Models

语言模型的数学推理解剖:Schoenfeld的推理结构

Ming Li, Chenrui Fan, Yize Cheng, Soheil Feizi, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Schoenfeld的事件理论,提出ThinkARM框架,解剖语言模型的推理过程,揭示推理与非推理模型在结构上的差异,并通过案例研究展示探索步骤与正确性及效率方法的影响。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03190 2026-05-12 cs.LG cs.AI cs.CL 82%

PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning

PrAg-PO:用于鲁棒且多样数学推理的提示增强策略优化

Wenquan Lu, Hai Huang, Enqi Liu, Randall Balestriero

机构 * Brown University(布朗大学) Palona AI Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PrAg-PO,通过混合提示模板与特定格式奖励提升大语言模型的数学推理能力,增强鲁棒性和多样性,优于GRPO和DAPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07600 2026-05-11 cs.LG cs.AI cs.CL 82%

Mathematical Reasoning via Intervention-Based Time-Series Causal Discovery Using LLMs as Concept Mastery Simulators

通过基于干预的时间序列因果发现进行数学推理:利用LLMs作为概念掌握模拟器

Tsuyoshi Okita

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CIKA框架,利用LLM自身作为干预模拟器,通过干预能力探针区分因果相关概念,提升数学推理能力。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23747 2026-04-28 cs.LG cs.AI cs.CL 82%

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

在LLM推理中,SFT-然后-RL优于混合策略方法

Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

机构 * ETH AI Center, ETH Zürich(苏黎世联邦理工学院人工智能中心) EPFL(瑞士联邦理工学院) Allen Institute for AI(人工智能研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文指出,混合策略方法的性能提升源于两个错误:DeepSpeed优化器在梯度累积中丢失中间微批次,以及OpenRLHF损失聚合错误加权。修正后,标准SFT-然后-RL流程在数学基准上超越了所有混合策略方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11582 2026-04-22 cs.CL cs.AI cs.LG 82%

A Triadic Suffix Tokenization Scheme for Numerical Reasoning

三元后缀数字分词方案用于数值推理

Olga Chetverina

机构 * MIPT, Moscow, Russia(莫斯科米进大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Triadic Suffix Tokenization方案,通过三元分组和明确的量级标记,解决数字分词不一致问题,提升大语言模型在算术和科学推理中的稳定性与准确性。

Comments v3: Updated to include analysis of N=1 scalability for SLM architectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06767 2026-04-21 cs.CL cs.AI cs.LG 82%

GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO

GanitLLM:通过课程-GRPO实现难度感知的孟加拉数学推理

Shubhashis Roy Dipta, Khairul Mahbub, Nadia Najjar

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GanitLLM模型及新的难度感知孟加拉数学语料库和基于课程的GRPO流程,提升低资源环境下孟加拉数学推理能力。

Comments Accepted at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00772 2026-04-21 cs.LG cs.AI cs.CL 82%

LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning

揭开真相的面纱:秩减少后主权重的浮现使以推理为导向的监督微调得以提升

Zihang Liu, Tianyu Pang, Oleg Balabanov, Chaoqun Yang, Tianjin Huang, Lu Yin, Yaoqing Yang, Shiwei Liu

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校) International Computer Science Institute, CA, USA(国际计算机科学研究所) Lawrence Berkeley National Laboratory, CA, USA(伯克利国家实验室) Dartmouth College, NH, USA(达特茅斯学院) University of Exeter, Exeter, UK(埃克塞特大学) University of Oxford, Oxford, UK(牛津大学) University of Surrey, Guildford, UK(萨里大学) Tsinghua University, China(清华大学) Eindhoven University of Technology, the Netherlands(埃因霍温理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LIFT方法,通过秩减少后选取主权重进行微调,提升推理能力,同时保持内存效率,优于全微调和LoRA。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10898 2026-04-15 cs.LG cs.AI cs.CL 82%

ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval

ZoomR:通过多粒度键值检索实现内存高效的推理

David H. Yang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Subhajit Chaudhury, Pin-Yu Chen

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM Research(IBM研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ZoomR通过多粒度键值检索实现内存高效的推理,减少内存使用,适用于长输出生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16917 2026-03-26 cs.AI cs.CL cs.LG 82%

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

生成对抗推理器:通过对抗性强化学习增强大语言模型推理

Qihao Liu, Luoxin Ye, Wufei Ma, Yu-Cheng Chou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出生成对抗推理器,通过对抗性强化学习联合训练LLM推理器和判别器,提升推理质量与准确性。

Comments Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06632 2026-03-17 cs.LG cs.AI cs.CL 82%

Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning

从简单到困难的任务课程强化学习提升大语言模型推理能力

Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, Shuiwang Ji

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出E2H Reasoner方法,通过从易到难的任务调度提升LLM推理能力,理论证明其收敛性并展示更少样本需求,实验显示在多个领域显著提升小型LLM的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02091 2026-03-03 cs.LG cs.AI cs.CL 82%

Learning from Synthetic Data Improves Multi-hop Reasoning

通过合成数据学习提升多跳推理能力

Anmol Kabra, Yilun Yin, Albert Gong, Kamilė Stankevičiūtė, Dongyoung Go, Johann Lee, Katie Z. Luo, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过规则生成的合成数据提升LLM多跳推理能力,发现合成数据能有效训练模型组成知识,从而在现实问答任务中表现更优。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG 82%

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05004 2026-02-16 cs.LG cs.AI cs.CL 82%

R-Zero: Self-Evolving Reasoning LLM from Zero Data

R-Zero:从零数据自演化推理大语言模型

Chengsong Huang, Wenhao Yu, Xiaoyang Wang, Hongming Zhang, Zongxia Li, Ruosen Li, Jiaxin Huang, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland, College Park(马里兰大学科廷分校) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Zero通过自动生成训练数据,实现无需人工干预的自演化推理大语言模型,显著提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02301 2026-02-11 cs.CL cs.AI cs.LG 82%

Advancing General-Purpose Reasoning Models with Modular Gradient Surgery

通过模块化梯度手术提升通用推理模型

Min Cai, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Xi Ye, Daiting Shi

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过模块化梯度手术提升通用推理模型,解决跨领域训练中的梯度冲突问题,提升多任务RL性能。

Comments Preprint; Code: https://github.com/StringNLPLAB/MGS Website: https://modular-gradient-surgery.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02842 2026-02-04 cs.AI cs.CL cs.LG 82%

Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing

模拟链:一种用于大语言模型的双模式推理框架,具有动态问题路由

Saeid Sheikhi

机构 * Faculty of Information Technology(信息科技学院) Electrical Engineering University of Oulu, Oulu, Finland, 90014(奥卢大学电气工程学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoS是一种双模式推理框架,通过动态问题路由提升大语言模型的推理能力,实现更高效的准确性和效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00983 2026-02-03 cs.CL cs.AI cs.LG 82%

DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning

DISPO:提升大型语言模型数学推理中的训练效率和稳定性

Batuhan K. Karaman, Aditya Rawal, Suhaila Shakiah, Mohammad Ghavamzadeh, Mingyi Hong, Arijit Biswas, Ruida Zhou

机构 * Cornell University(康奈尔大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DISPO通过分离正确与错误响应的重要性采样权重裁剪,实现训练效率与稳定性的平衡,提升大型语言模型在数学推理任务中的性能。

Comments This work is accepted to the 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14888 2026-01-22 cs.LG cs.AI cs.CL 82%

What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study

是什么使低比特量化感知训练在推理大语言模型中有效?一项系统研究

Keyu Lv, Manyi Zhang, Xiaobo Xia, Jingchen Ni, Shannan Yan, Xianzhi Yu, Lu Hou, Chun Yuan, Haoli Bai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technologies(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过系统分析揭示了低比特量化感知训练在推理大语言模型中的有效性,提出优化工作流Reasoning-QAT,显著提升精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14209 2026-01-21 cs.LG cs.AI cs.CL 82%

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

InT:自我提出干预使LLM推理中的信用分配成为可能

Matthew Y. R. Yang, Hao Bai, Ian Wu, Gene Yang, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 InT通过自我提出干预实现LLM推理中的细粒度信用分配,提升模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11741 2026-01-12 cs.AI cs.CL cs.LG 82%

Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?

攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?

Yiyou Sun, Georgia Zhou, Haoyue Bai, Hao Wang, Dacheng Li, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23129 2025-12-24 cs.LG cs.AI cs.CL 82%

C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning

C$^2$GSPG:基于置信度校准的群体序列策略梯度方法,用于自感知推理

Haotian Liu, Shuo Wang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) Tsinghua University(清华大学) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 C$^2$GSPG通过置信度校准群体序列策略梯度方法提升推理性能并抑制过度自信,适用于逻辑和数学推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02324 2025-12-23 cs.CL cs.AI cs.LG 82%

PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models

PromptCoT: 为大型语言模型中的数学推理合成竞赛级问题

Xueliang Zhao, Wei Wu, Jian Guan, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PromptCoT通过模拟竞赛级问题设计者的思维过程,自动生成高质量数学问题,提升大型语言模型的数学推理能力。

Comments Preprint

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10532 2025-12-18 cs.LG cs.AI cs.CL 82%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24850 2025-12-16 cs.LG cs.AI cs.CL 82%

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning

利用负信号:从教师数据中进行强化蒸馏以提升大语言模型推理能力

Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi

机构 * National University of Singapore(国立新加坡大学) INF AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过强化蒸馏利用正负推理轨迹提升LLM推理性能,实验表明在少量数据下可达到与大量数据训练模型相当的性能。

Comments 22 pages, 10 figures. Code available at https://github.com/Tim-Siu/reinforcement-distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05033 2025-12-10 cs.CL cs.AI cs.LG 82%

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

套利:通过优势感知投机实现高效推理

Monishwaran Maheswaran, Rishabh Tiwari, Yuezhou Hu, Kerem Dilmen, Coleman Hooper, Haocheng Xi, Nicholas Lee, Mehrdad Farajtabar, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * UC Berkeley(伯克利大学) Apple(苹果公司) ICSI(信息与计算科学研究所) LBNL(劳伦斯伯克利国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Arbitrage通过动态路由机制提升步骤级投机生成的效率和准确性,减少推理延迟。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20561 2025-12-09 cs.LG cs.AI cs.CL stat.ML 82%

Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning

超越马尔可夫:通过贝叶斯自适应强化学习实现LLM推理的反思探索

Shenao Zhang, Yaqing Wang, Yinxiao Liu, Tianqi Liu, Peter Grabowski, Eugene Ie, Zhaoran Wang, Yunxuan Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过贝叶斯自适应强化学习实现LLM推理的反思探索,提升测试性能与令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20745 2025-12-09 cs.CV 82%

Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs

数学视觉盲:图示理解的失败削弱了多模态大语言模型的推理能力

Yanpeng Sun, Shan Zhang, Wei Tang, Aotian Chen, Piotr Koniusz, Kai Zou, Yuan Xue, Anton van den Hengel

机构 * Ohio State University(俄亥俄州立大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本研究发现多模态大语言模型在图示理解上的缺陷导致推理能力下降,通过改进图示感知可显著提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08833 2025-12-05 cs.CL cs.AI cs.LG 82%

An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems

对LLMs在数学推理中鲁棒性的调查:通过高级数学问题的数学等价转换进行基准测试

Yuren Hao, Xiang Wan, ChengXiang Zhai

机构 * Department of Computer Science University of Illinois Urbana–Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science Stanford University(计算机科学系斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种新的评估方法,通过数学等价转换的变体测试LLMs的数学推理鲁棒性,发现模型在不同变体上的表现差异显著。

Comments 34 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14495 2025-12-01 cs.CL cs.AI cs.LG 82%

Temporal Consistency for LLM Reasoning Process Error Identification

LLM推理过程错误识别中的时序一致性

Jiacheng Guo, Yue Wu, Jiahao Qiu, Kaixuan Huang, Xinzhe Juan, Ling Yang, Mengdi Wang

机构 * Department of Electrical & Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) AI Lab, Princeton University(普林斯顿大学人工智能实验室) Department of Computer Science & Engineering, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于时序一致性的LLM推理过程错误识别方法,通过迭代自我反思提升验证准确性,在多个基准测试中实现了优于基线方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17577 2025-11-25 cs.LG cs.AI cs.CL 82%

Efficient Mathematical Reasoning Models via Dynamic Pruning and Knowledge Distillation

通过动态剪枝和知识蒸馏实现高效的数学推理模型

Fengming Yu, Qingyu Meng, Haiwei Pan, Kejia Zhang

机构 * Harbin Engineering University(哈尔滨工程大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过动态剪枝和知识蒸馏优化方法,提升大型语言模型在数学推理任务中的效率与性能。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22411 2025-11-18 cs.LG cs.AI cs.CL 82%

Mitigating Overthinking in Large Reasoning Models via Manifold Steering

Yao Huang, Huanran Chen, Shouwei Ruan, Yichi Zhang, Xingxing Wei, Yinpeng Dong

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究所) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏