arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-20 至 2026-02-20 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2602.16839 2026-02-20 cs.LG cs.CL 81%

Training Large Reasoning Models Efficiently via Progressive Thought Encoding

通过渐进性思维编码高效训练大型推理模型

Zeliang Zhang, Xiaodong Liu, Hao Cheng, Hao Sun, Chenliang Xu, Jianfeng Gao

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过渐进性思维编码方法,提升大型推理模型在有限内存下的推理效率和准确性。

Comments ICLR 2026, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 70%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17288 2026-02-20 cs.AI cs.CL 62%

ArXiv-to-Model: A Practical Study of Scientific LM Training

ArXiv-to-Model:科学语言模型训练的实践研究

Anuj Gupta

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过从arXiv LaTeX源数据直接训练科学语言模型,探讨了预处理、分词和计算资源对模型训练的影响,提供了工程层面的训练实践与透明分析。

Comments 15 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00794 2026-02-20 cs.LG cs.AI 62%

Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration

为大语言模型高效强化学习引入内在探索

Yan Sun, Jia Guo, Stanley Kok, Zihao Wang, Zujie Wen, Zhiqiang Zhang

机构 * National University of Singapore(新加坡国立大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PREPO通过利用内在数据属性提升大语言模型强化学习的数据效率,减少回放需求同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17100 2026-02-20 cs.MA 50%

AgentConductor: Topology Evolution for Multi-Agent Competition-Level Code Generation

AgentConductor: 多智能体竞争级代码生成中的拓扑演化

Siyu Wang, Ruotian Lu, Zhihao Yang, Yuchao Wang, Yanzhou Zhang, Lei Xu, Qimin Xu, Guojun Yin, Cailian Chen, Xinping Guan

专题命中 数学推理 :reasoning(abstract)

AI总结 AgentConductor通过动态拓扑生成和强化学习优化,提升多智能体系统在竞争级代码生成中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏