arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-12 至 2026-01-12 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2601.05616 2026-01-12 cs.LG 87%

Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks

双阶段LLM推理:自演化数学框架

ShaoZhen Liu, Xinting Huang, Houwen Peng, Xin Chen, Xinyang Song, Qi Li, Zhenan Sun

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11741 2026-01-12 cs.AI cs.CL cs.LG 82%

Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?

攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?

Yiyou Sun, Georgia Zhou, Haoyue Bai, Hao Wang, Dacheng Li, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01937 2026-01-12 cs.LG cs.AI stat.ML 81%

Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR

更短但不更差:通过易样本作为长度正则化器进行节俭推理

Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse, Ahmad Chamma, Amr Mohamed, Dani Bouch, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过易样本作为长度正则化器,使模型在不增加输出长度的情况下更高效地解决复杂问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05300 2026-01-12 cs.LG cs.CL 81%

TIME: Temporally Intelligent Meta-reasoning Engine for Context Triggered Explicit Reasoning

TIME:面向上下文触发的显式推理的时序智能元推理引擎

Susmit Das

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 TIME通过引入时序智能元推理引擎,改进对话模型的显式推理能力,提升时间感知和推理效率。

Comments 14 pages, 3 figures with 27 page appendix. See https://github.com/The-Coherence-Initiative/TIME and https://github.com/The-Coherence-Initiative/TIMEBench for associated code

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-01-12 cs.CL cs.AI 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05870 2026-01-12 cs.LG cs.AI 62%

IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck

IIB-LPO: 通过迭代信息瓶颈进行潜在策略优化

Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang

机构 * DeepSeek-AI

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 IIB-LPO通过迭代信息瓶颈方法,解决LLM推理中的探索崩溃问题,实现更多样化的推理路径和更高的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05501 2026-01-12 cs.LG cs.CL 62%

Hi-ZFO: Hierarchical Zeroth- and First-Order LLM Fine-Tuning via Importance-Guided Tensor Selection

Hi-ZFO:通过重要性引导的张量选择实现层次化零阶和一阶LLM微调

Feihu Jin, Ying Tan

机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Hi-ZFO通过结合一阶和零阶优化,提升LLM微调的精度与探索能力,有效解决训练中的局部极小值问题。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05607 2026-01-12 cs.LG 57%

Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR

协调标记与序列:动态混合策略优化用于RLVR

Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05298 2026-01-12 cs.AI 57%

Mathematical Knowledge Graph-Driven Framework for Equation-Based Predictive and Reliable Additive Manufacturing

基于数学知识图谱的方程驱动框架用于基于方程的预测和可靠的增材制造

Yeongbin Cha, Namjung Kim

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于数学知识图谱的框架,结合大语言模型与增材制造知识图谱,实现可靠的知识提取和外推建模,提升预测的准确性和物理一致性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏