arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-17 至 2026-02-17 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2602.14444 2026-02-17 cs.LG cs.AI 86%

Broken Chains: The Cost of Incomplete Reasoning in LLMs

断裂的链条:在大语言模型中不完整推理的成本

Ian Su, Gaurav Purushothaman, Jey Narayan, Ruhika Goel, Kevin Zhu, Sunishchal Dev, Yash More, Maheep Chaudhary

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了大语言模型在不同推理模式下在标记限制下的表现,发现截断推理可能有害,代码退化较好,混合推理表现欠佳,鲁棒性取决于模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07861 2026-02-17 cs.CL cs.AI cs.LG 85%

Scalable LLM Reasoning Acceleration with Low-rank Distillation

可扩展的大语言模型推理加速与低秩蒸馏

Harry Dong, Bilge Acun, Beidi Chen, Yuejie Chi

机构 * CMU Department of Electrical and Computer Engineering(卡内基梅隆大学电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学) Meta FAIR at Meta(Meta FAIR) CMU(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Caprese通过低秩蒸馏方法恢复高效推理方法中丢失的数学推理能力,同时减少参数数量和延迟,提升响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14451 2026-02-17 cs.AI cs.CL 84%

Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning

基于先例的推理:通过测试时先例学习缓解大推理模型中的过度思考

Qianyue Wang, Jinwu Hu, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Yu Rong, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(黄埔实验室) DAMO Academy(达摩院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 PIR通过测试时先例学习,优化大推理模型的推理过程,减少冗余探索并提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08838 2026-02-17 cs.LG cs.AI stat.ML 81%

wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models

wd1: 为扩散语言模型推理的加权策略优化

Xiaohang Tang, Rares Dolga, Sangwoong Yoon, Ilija Bogunovic

机构 * Department of Statistical Science, University College London, United Kingdom(伦敦大学统计科学系) UCL AI Centre, University College London, United Kingdom(伦敦大学UCL人工智能中心) Graduate School of AI, Ulsan National Institute of Science and Technology, South Korea(韩国乌山国立科学与技术研究院人工智能研究生院) Department of Mathematics and Computer Science, Universität Basel, Switzerland(巴塞尔大学数学与计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 wd1通过加权策略优化提升扩散语言模型推理能力,实现更高准确率和更低计算成本。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20426 2026-02-17 cs.AI 79%

RV-Syn: Rational and Verifiable Mathematical Reasoning Data Synthesis based on Structured Function Library

RV-Syn: 基于结构化函数库的理性且可验证的数学推理数据合成

Jiapeng Wang, Jinhao Jiang, Zhiqiang Zhang, Jun Zhou, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Ant Group(蚂蚁集团) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RV-Syn通过结构化函数库生成可验证的数学推理数据,提升数据质量和生成效率。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18702 2026-02-17 cs.LG cs.AI cs.AR 76%

From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic

从模糊到精确:通过有理算术的Halo架构实现无限深度推理

Hansheng Ren

机构 * Hansheng Ren(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。

Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13262 2026-02-17 cs.AI cs.CL 73%

General learned delegation by clones

通过克隆实现通用学习委托

Darren Li, Meiqi Chen, Chenze Shao, Fandong Meng, Jie Zhou

机构 * Qiuzhen College, Tsinghua University(清华大学齐振学院) Pattern Recognition Center, WeChat AI, Tencent Inc(微信AI模式识别中心,腾讯公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SELFCEST通过代理强化学习实现通用学习委托,利用克隆技术在不同并行上下文中分配资源,提升数学推理和长上下文问答任务的准确性与效率。

Comments Code available at https://github.com/SuffixAutomata/SELFCEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16652 2026-02-17 cs.LG cs.AI 62%

Evolution Strategies at the Hyperscale

超大规模进化策略

Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, Jakob Nicolaus Foerster

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EGGROLL通过低秩学习提升算术强度,实现大规模参数模型的高效训练,稳定预训练非线性循环语言模型并提升推理任务性能。

Comments 76 pages, 15 figures, Website at https://eshyperscale.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03195 2026-02-17 cs.LG cs.AI 62%

Reinforcement Learning with Promising Tokens for Large Language Models

基于有前景标记的强化学习用于大语言模型

Jing-Cheng Pang, Liang Lu, Xian Tang, Kun Jiang, Sijie Wu, Kai Zhang, Xubin Li

机构 * huawei(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 基于有前景标记的强化学习框架通过解耦战略决策与标记生成,有效提升大语言模型的训练稳定性与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14468 2026-02-17 cs.LG 57%

LACONIC: Length-Aware Constrained Reinforcement Learning for LLM

LACONIC:面向LLM的长度感知约束强化学习

Chang Liu, Yiran Zhao, Lawrence Liu, Yaoqi Ye, Csaba Szepesvári, Lin F. Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究院) National University of Singapore(新加坡国立大学) University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 LACONIC通过长度感知约束强化学习,在保持任务性能的同时有效控制输出长度,减少50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13103 2026-02-17 cs.LG 57%

R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training

R-Diverse: 缓解自博弈LLM训练中的多样性幻觉

Gengsheng Li, Jinghan He, Shijie Wang, Dan Zhang, Ruiqi Liu, Renrui Zhang, Zijun Yao, Junfeng Fang, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究所) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 R-Diverse通过引入记忆增强惩罚和技能感知测量,缓解自博弈LLM训练中的多样性幻觉问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07132 2026-02-17 stat.ML cs.LG 57%

Discrete Adjoint Matching

离散共轭匹配

Oswin So, Brian Karrer, Chuchu Fan, Ricky T. Q. Chen, Guan-Horng Liu

机构 * Massachusetts Institute of Technology(麻省理工学院) FAIR at Meta(Meta 的 FAIR)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏