arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2601.03769 2026-01-13 cs.AI 85%

EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation

EntroCoT:通过自适应熵引导分割增强链式思考

Zihang Li, Yuhang Wang, Yikun Zong, Wenhan Yu, Xiaokun Yuan, Runhan Jiang, Zirui Liu, Tong Yang, Arthur Jiang

机构 * Peking University(北京大学) IQuest Research(IQuest研究)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 EntroCoT通过自适应熵引导分割提升链式思考的推理质量,构建高质量数据集以提高大语言模型的数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06677 2026-01-13 cs.LG cs.AI 84%

Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget

可塑性与刚性:低秩适配器对微预算推理的影响

Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究通过低秩适配器在微预算下提升小型模型推理能力,发现高秩适配器能显著增强模型可塑性,但数学对齐模型性能下降,揭示了预算限制对模型优化的复杂影响。

Comments 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23232 2026-01-13 cs.LG cs.AI cs.CL 80%

SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts

SPEC-RL: 通过推测性回放加速在线策略学习

Bingshuai Liu, Ante Wang, Zijun Min, Liang Yao, Haibo Zhang, Yang Liu, Xu Han, Peng Li, Anxiang Zeng, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee公司语言模型团队) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPEC-RL通过整合推测解码技术,有效减少强化学习回放阶段的计算开销,提升大模型推理能力。

Comments fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07696 2026-01-13 cs.CL 79%

Exploring the Meta-level Reasoning of Large Language Models via a Tool-based Multi-hop Tabular Question Answering Task

通过基于工具的多跳表格问答任务探索大型语言模型的元级推理

Nick Ferguson, Alan Bundy, Kwabena Nuamah

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过设计基于工具的多跳表格问答任务,探索大型语言模型的元级推理能力,发现其在任务分解和工具选择方面表现良好,但在数学运算和任务理解上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07123 2026-01-13 cs.AI 79%

ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning

ENTRA:基于熵的大型语言模型推理中的冗余避免

Ruichu Cai, Haopeng Du, Qingwen Lin, Yutong Chen, Zijian Li, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) Peng Cheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ENTRA通过基于熵的训练框架减少大型语言模型的冗余推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07038 2026-01-13 cs.AI 79%

Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning

工具增强的策略优化:通过强化学习协同推理与自适应工具使用

Wenxun Wu, Yuanyang Li, Guhan Chen, Linyue Wang, Hongyang Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 79%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06911 2026-01-13 cs.CL cs.AI cs.LG 67%

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models

分布清晰度:大型语言模型中RL友好性的隐藏驱动因素

Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Baidu Inc(百度公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了大型语言模型中RL友好性的隐藏驱动因素——分布清晰度,通过量化Silhouette系数并提出Silhouette-aware Reweighting策略,提升了模型在数学基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07264 2026-01-13 cs.CL 57%

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

置信二元性:分析和缓解工具使用代理中的校准偏差

Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏