arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-12 至 2026-02-12 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2509.21124 2026-02-12 cs.AI cs.CL 86%

Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns

通过学习多样的思维链模式扩展基础模型的推理潜力

Xuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Shuo Wang, Hongfei Yan, Jingang Wang, Xunliang Cai

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Meituan(美团) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过学习富含高价值推理模式的多样化数据,扩展基础模型的推理潜力,显著提升模型在数学推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10632 2026-02-12 cs.SC cs.AI 85%

The Neurosymbolic Frontier of Nonuniform Ellipticity: Formalizing Sharp Schauder Theory via Topos-Theoretic Reasoning Models

非均匀椭圆性神经符号前沿:通过拓扑学推理模型形式化精确Schauder理论

Suyash Mishra

机构 * Suyash Mishra

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过拓扑学推理模型形式化精确Schauder理论,结合神经符号大推理模型解决非均匀椭圆正则性理论中的关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08554 2026-02-12 cs.LG stat.ML 79%

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

通过群体扩散策略优化提升扩散语言模型的推理能力

Kevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Molei Tao, Wei Deng

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Research, Morgan Stanley(摩根士丹利机器学习研究部)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出GDPO算法,通过减少ELBO估计的方差提升扩散语言模型的推理能力,实验证明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09718 2026-02-12 cs.CL cs.AI 62%

StatLLaMA: Multi-Stage training for domain-optimized statistical large language models

StatLLaMA:面向统计领域优化的多阶段训练方法

Jing-Yi Zeng, Guan-Hua Huang

机构 * Institute of Statistics, National Yang Ming Chiao Tung University(统计研究所,国立阳明交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 StatLLaMA通过多阶段训练方法优化统计领域,实现高效且平衡的模型性能。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02482 2026-02-12 cs.LG 57%

Expanding the Capabilities of Reinforcement Learning via Text Feedback

通过文本反馈扩展强化学习的能力

Yuda Song, Lili Chen, Fahim Tajwar, Remi Munos, Deepak Pathak, J. Andrew Bagnell, Aarti Singh, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过文本反馈改进强化学习的方法,通过自我蒸馏和反馈建模在推理、数学和写作任务中超越基线性能。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23279 2026-02-12 cs.CL 57%

Unveiling Super Experts in Mixture-of-Experts Large Language Models

揭示混合专家大语言模型中的超级专家

Zunhai Su, Qingyuan Li, Hao Zhang, Weihao Ye, Qibo Xue, YuLei Qian, Yuchen Xie, Ngai Wong, Kehong Yuan

机构 * Tsinghua University(清华大学) Meituan(美团) Xiamen University(厦门大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示了混合专家大语言模型中起关键作用的超级专家,通过分析其影响发现其在数学推理中的重要性,并探讨了压缩这些专家对模型性能的显著影响。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10597 2026-02-12 cs.CY 50%

Llama-Polya: Instruction Tuning for Large Language Model based on Polya's Problem-solving

Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优

Unggi Lee, Yeil Jeong, Chohui Lee, Gyuri Byun, Yunseo Lee, Minji Kang, Minji Jeon

专题命中 数学推理 :reasoning(abstract)

AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏