arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-14 至 2026-01-14 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2601.08808 2026-01-14 cs.CL cs.AI cs.LG 88%

Multiplex Thinking: Reasoning via Token-wise Branch-and-Merge

多路思考:通过令牌级分支-合并进行推理

Yao Tang, Li Dong, Yaru Hao, Qingxiu Dong, Furu Wei, Jiatao Gu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 多路思考是一种通过令牌级分支-合并机制实现软推理的新方法,能自适应地在离散和连续之间切换,从而在数学推理任务中优于传统CoT和RL基线。

Comments 21 pages. Code available at https://github.com/GMLR-Penn/Multiplex-Thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07898 2026-01-14 cs.LG cs.AI 62%

Large Language Models and Algorithm Execution: Application to an Arithmetic Function

大语言模型与算法执行:应用于一个算术函数

Farah Ben Slama, Frédéric Armetta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-DAL模型,通过专门训练提升大语言模型执行算法的能力,应用于算术函数的推理与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21005 2026-01-14 cs.AI cs.IR 57%

ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning

ICPO:内在置信度驱动的群体相对偏好优化用于高效强化学习

Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ICPO通过内在置信度驱动的群体相对偏好优化,提升大型语言模型的推理能力,有效解决粗粒度奖励和奖励噪声问题,增强高质量响应的相对优势。

详情

展开后加载摘要…

URL PDF HTML 收藏