arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2601.17006 2026-01-27 cs.LG cs.AI 81%

MathMixup: Boosting LLM Mathematical Reasoning with Difficulty-Controllable Data Synthesis and Curriculum Learning

MathMixup: 通过难度可控的数据合成与课程学习提升LLM的数学推理能力

Xuchen Li, Jing Chen, Xuzhao Li, Hao Liang, Xiaohuan Zhou, Taifeng Wang, Wentao Zhang

机构 * CASIA(中国科学院自动化研究所) ZGCA(浙江大学) UCAS(中国科学技术大学) PKU(北京大学) ByteDance(字节跳动)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MathMixup通过难度可控的数据合成与课程学习策略,提升LLM的数学推理能力,实验显示其在多个基准测试中表现优于现有方法。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16218 2026-01-26 cs.CL cs.AI 81%

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

M3Kang: 评估视觉-语言模型在多语言多模态数学推理中的表现

Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 M3Kang是一个大规模多语言多模态数学推理数据集,用于评估视觉-语言模型在多语言数学推理中的表现,通过基准测试揭示模型在基础数学和图表推理上的不足,并展示多语言技术在多模态设置中的有效性。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16219 2026-01-21 cs.LG cs.CL 81%

Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn't

用于小型大语言模型推理的强化学习:什么有效,什么无效

Quy-Anh Dang, Chris Ngo

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过强化学习提升小型LLM的推理能力,展示了在有限资源下实现显著性能提升的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18760 2026-01-21 cs.AI cs.CL 81%

Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models

回答不可回答的问题是明知其错:分析和缓解大推理模型中的回避失败

Yi Liu, Xiangyu Liu, Zequn Sun, Wei Hu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文针对大推理模型在面对不可回答问题时的回避失败问题,提出一种轻量级两阶段方法,通过认知监控与推理干预提升回避率并保持推理性能。

Comments Accepted in the 39th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11979 2026-01-21 cs.AI cs.LG 81%

Process In-Context Learning: Enhancing Mathematical Reasoning via Dynamic Demonstration Insertion

过程在上下文学习:通过动态演示插入增强数学推理

Ang Gao, Changshuo Zhang, Xiao Zhang, Deyang Li, Minjun Zhao, Fangchao Liu, Xinyu Zhang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Huawei Poisson Lab, China(华为Poisson实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PICL通过动态插入相关演示来提升数学推理能力,有效缓解推理过程中的困惑问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09667 2026-01-16 cs.AI cs.CL 81%

Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning

协同多智能体测试时间强化学习用于推理

Zhiyuan Hu, Yunhai Hu, Juncheng Liu, Shuyue Stella Li, Yucheng Wang, Zhen Xu, See-Kiong Ng, Anh Tuan Luu, Xinxing Xu, Bryan Hooi, Cynthia Breazeal, Hae Won Park

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) NYU(纽约大学) Microsoft(微软) Columbia(哥伦比亚大学) NTU(国立科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MATTRL通过在推理阶段注入结构化文本经验,提升多智能体在医学、数学和教育等领域的推理准确性,比多智能体基线提升3.67%,比单智能体基线提升8.67%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10094 2026-01-16 cs.CV cs.AI cs.LG 81%

V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation

V-Zero:基于零标注的自改进多模态推理

Han Wang, Yi Yang, Jingyuan Hu, Minfeng Zhu, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 V-Zero通过自改进机制在无需人工标注的情况下提升多模态模型的视觉数学推理和通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01937 2026-01-12 cs.LG cs.AI stat.ML 81%

Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR

更短但不更差:通过易样本作为长度正则化器进行节俭推理

Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse, Ahmad Chamma, Amr Mohamed, Dani Bouch, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过易样本作为长度正则化器,使模型在不增加输出长度的情况下更高效地解决复杂问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05300 2026-01-12 cs.LG cs.CL 81%

TIME: Temporally Intelligent Meta-reasoning Engine for Context Triggered Explicit Reasoning

TIME:面向上下文触发的显式推理的时序智能元推理引擎

Susmit Das

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 TIME通过引入时序智能元推理引擎,改进对话模型的显式推理能力,提升时间感知和推理效率。

Comments 14 pages, 3 figures with 27 page appendix. See https://github.com/The-Coherence-Initiative/TIME and https://github.com/The-Coherence-Initiative/TIMEBench for associated code

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12366 2026-01-07 cs.LG cs.AI 81%

DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization

DisCO:通过判别约束优化强化大推理模型

Gang Li, Ming Lin, Tomer Galanti, Zhengzhong Tu, Tianbao Yang

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 DisCO通过判别约束优化方法,有效解决大推理模型中的难度偏差和熵不稳定性,显著提升数学推理能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01714 2026-01-06 cs.LG cs.CL 81%

Entropy-Aligned Decoding of LMs for Better Writing and Reasoning

基于熵对齐的语言模型解码以提升写作与推理能力

Kareem Ahmed, Sameer Singh

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维特分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 EPIC通过将未来轨迹的熵纳入语言模型解码,提升写作与推理能力,生成更多样且忠实的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15959 2025-12-19 cs.CL cs.AI 81%

BRAID: Bounded Reasoning for Autonomous Inference and Decisions

BRAID:自主推理与决策的有界推理

Armağan Amcalar, Eyup Cinar

机构 * OpenServ Labs(OpenServ实验室) Computer Engineering Department(计算机工程系) Eskisehir Osmangazi University(埃斯基谢普大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 BRAID通过结构化提示提升自主代理推理效率和成本效益

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15687 2025-12-18 cs.LG cs.AI 81%

Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning

大语言模型能否引导自身探索?基于梯度引导的强化学习用于大语言模型推理

Zhenwen Liang, Sidi Lu, Wenhao Yu, Kishan Panaganti, Yujun Zhou, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 G2RL通过利用模型自身的梯度几何特性,改进大语言模型的推理能力,优于传统探索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13106 2025-12-16 cs.LG cs.AI 81%

TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning

TraPO:一种用于提升大语言模型推理能力的半监督强化学习框架

Shenzhi Yang, Guangcheng Zhu, Xing Zheng, Yingfan MA, Zhongqi Chen, Bowen Song, Weiqiang Wang, Junbo Zhao, Gang Chen, Haobo Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 TraPO通过结合少量标注样本与大量未标注样本,提升大语言模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00900 2025-12-15 cs.AI cs.CL 81%

From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models

从单个词到数学:语言模型中数学推理学习动态

Shubhra Mishra, Gabriel Poesia, Noah D. Goodman

机构 * Department of Computer Science 1 and Psychology 2(计算机科学系和心理学系) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了语言模型在预训练和后训练过程中数学推理能力的发展,揭示了数学技能学习顺序与课程设计的相关性,并探讨了指令微调对不同数学技能的影响。

Comments Accepted to COLM 2025. Dataset and code: https://github.com/gpoesia/mathcamps/

Journal ref Conference on Language Modeling (COLM), Montreal, Canada, October 7-10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11373 2025-12-02 cs.CL cs.AI 81%

Reliable Reasoning Beyond Natural Language

超越自然语言的可靠推理

Nasim Borazjanizadeh, Steven T. Piantadosi

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出神经符号推理方法,通过整合Prolog引擎,解决LLMs在非线性推理任务中的不足,提升推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00908 2025-12-02 cs.LG cs.AI 81%

Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs

超越高熵探索:面向推理LLM的正确性感知低熵段优势塑造

Xinzhu Chen, Xuesheng Li, Zhongxiang Sun, Weijie Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际经济贸易大学人工智能与数据科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 LESS通过正确性感知的低熵段优势调节,提升推理LLM的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18449 2025-12-02 cs.SE cs.AI cs.CL 81%

SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

SWE-RL:通过强化学习提升大语言模型推理能力

Yuxiang Wei, Olivier Duchenne, Jade Copet, Quentin Carbonneaux, Lingming Zhang, Daniel Fried, Gabriel Synnaeve, Rishabh Singh, Sida I. Wang

机构 * Meta AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SWE-RL通过强化学习提升大语言模型在软件工程领域的推理能力,实现了41.0%的解决率,超越了现有中等规模LLM的性能。

Comments Accepted to NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02583 2025-12-01 cs.AI cs.LG 81%

CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge

CAMA: 通过因果知识增强大语言模型的数学推理

Lei Zan, Keli Zhang, Ruichu Cai, Lujia Pan

机构 * Huawei Noah’s Ark Lab France(华为诺亚实验室(法国)) Guangdong University of Technology Peng Cheng Laboratory(广东工业大学鹏城实验室) Huawei Noah’s Ark Lab China(华为诺亚实验室(中国))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CAMA通过构建数学因果图并结合因果知识,提升大语言模型在数学推理任务中的性能。

Journal ref Main Track, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03151 2025-11-26 cs.CL cs.LG 81%

Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)

为何推理重要?多模态推理的进展综述(v1)

Jing Bi, Susan Liang, Xiaofei Zhou, Pinxin Liu, Junjia Guo, Yunlong Tang, Luchuan Song, Chao Huang, Ali Vosoughi, Guangyu Sun, Jinxi He, Jiarui Wu, Shu Yang, Daoan Zhang, Chen Chen, Lianggong Bruce Wen, Zhang Liu, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Central Florida(中央佛罗里达大学) Corning Inc.(康宁公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文综述了多模态推理的进展,探讨了推理在多模态任务中的挑战与优化方法,为未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12115 2025-11-21 cs.CL cs.AI 81%

Eliciting Reasoning in Language Models with Cognitive Tools

通过认知工具激发语言模型的推理能力

Brown Ebouky, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research - Zurich(IBM瑞士研究中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过引入认知工具,提升语言模型在数学推理任务上的性能,探索推理机制并补充训练后方法的作用。

Comments 25 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16826 2025-11-18 cs.AI cs.CL 81%

KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning

Wei Sun, Wen Yang, Pu Jian, Qianlong Du, Fuwei Cui, Shuo Ren, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06805 2025-11-11 cs.AI cs.LG 81%

MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning

Jinhao Chen, Zhen Yang, Jianxin Shi, Tianyu Wo, Jie Tang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24630 2025-11-07 cs.CL cs.AI 81%

Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models

Junyi Li, Hwee Tou Ng

机构 * Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01846 2025-11-04 cs.CL cs.AI 81%

Towards Robust Mathematical Reasoning

Thang Luong, Dawsen Hwang, Hoang H. Nguyen, Golnaz Ghiasi, Yuri Chervonyi, Insuk Seo, Junsu Kim, Garrett Bingham, Jonathan Lee, Swaroop Mishra, Alex Zhai, Clara Huiyi Hu, Henryk Michalewski, Jimin Kim, Jeonghyun Ahn, Junhwi Bae, Xingyou Song, Trieu H. Trinh, Quoc V. Le, Junehyuk Jung

机构 * Georgia Institute of Technology(佐治亚理工学院) Seoul National University(首尔国立大学) Microsoft(微软) Massachusetts Institute of Technology(麻省理工学院) Brown University(布朗大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 (main conference), https://aclanthology.org/2025.emnlp-main.1794/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26143 2025-10-31 cs.AI cs.CL 81%

Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math

Bo Pang, Deqian Kong, Silvio Savarese, Caiming Xiong, Yingbo Zhou

机构 * Salesforce AI Research(Salesforce AI研究院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26094 2025-10-31 cs.AI cs.LG 81%

Lean4Physics: Comprehensive Reasoning Framework for College-level Physics in Lean4

Yuxin Li, Minghao Liu, Ruida Wang, Wenzhao Ji, Zhitao He, Rui Pan, Junming Huang, Tong Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19099 2025-10-28 cs.LG cs.AI 81%

What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning

Yaning Jia, Chunhui Zhang, Xingjian Diao, Xiangchi Yuan, Zhongyu Ouyang, Chiyu Ma, Soroush Vosoughi

机构 * Dartmouth College(达特茅斯学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 8 pages (main text) + 4 pages (appendix), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01347 2025-10-28 cs.CL cs.LG 81%

The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning

Xinyu Zhu, Mengzhou Xia, Zhepei Wei, Wei-Lin Chen, Danqi Chen, Yu Meng

机构 * Computer Science Department, University of Virginia(弗吉尼亚大学计算机科学系) Princeton Language and Intelligence (PLI), Princeton University(普林斯顿大学语言与智能研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20909 2025-10-27 cs.CL cs.AI 81%

Code-enabled language models can outperform reasoning models on diverse tasks

Cedegao E. Zhang, Cédric Colas, Gabriel Poesia, Joshua B. Tenenbaum, Jacob Andreas

机构 * MIT(麻省理工学院) Inria(法国国家科研机构) Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏