arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2407.03624 2024-08-27 cs.CL 85%

Question-Analysis Prompting Improves LLM Performance in Reasoning Tasks

Dharunish Yugeswardeenoo, Kevin Zhu, Sean O'Brien

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted in Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics: Student Research Workshop (ACL-SRW 2024) 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12246 2024-07-23 cs.CL 85%

Active Prompting with Chain-of-Thought for Large Language Models

Shizhe Diao, Pengcheng Wang, Yong Lin, Rui Pan, Xiang Liu, Tong Zhang

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments Published in ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17140 2024-06-07 cs.CL 85%

Small Language Models Need Strong Verifiers to Self-Correct Reasoning

Yunxiang Zhang, Muhammad Khalifa, Lajanugen Logeswaran, Jaekyeom Kim, Moontae Lee, Honglak Lee, Lu Wang

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);self-correction(abstract);分类 cs.CL

Comments ACL Findings 2024 - Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06427 2024-06-04 cs.CL 85%

Boosting Language Models Reasoning with Chain-of-Knowledge Prompting

Jianing Wang, Qiushi Sun, Xiang Li, Ming Gao

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09267 2024-04-23 cs.AI 85%

GraphReason: Enhancing Reasoning Capabilities of Large Language Models through A Graph-Based Verification Approach

Lang Cao

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05190 2024-04-04 cs.CL 85%

DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs

Zijie Meng, Yan Zhang, Zhaopeng Feng, Zuozhu Liu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18295 2024-03-28 cs.CL 85%

Dual Instruction Tuning with Large Language Models for Mathematical Reasoning

Yongwei Zhou, Tiejun Zhao

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11467 2024-03-21 cs.CL 85%

Over-Reasoning and Redundant Calculation of Large Language Models

Cheng-Han Chiang, Hung-yi Lee

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments EACL 2024 main conference paper. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12822 2024-02-28 cs.CL 85%

Automatic Prompt Augmentation and Selection with Chain-of-Thought from Labeled Data

KaShun Shum, Shizhe Diao, Tong Zhang

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15585 2024-01-30 cs.CL 85%

Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting

Masahiro Kaneko, Danushka Bollegala, Naoaki Okazaki, Timothy Baldwin

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14628 2023-12-29 cs.CL 85%

Plan, Verify and Switch: Integrated Reasoning with Diverse X-of-Thoughts

Tengxiao Liu, Qipeng Guo, Yuqing Yang, Xiangkun Hu, Yue Zhang, Xipeng Qiu, Zheng Zhang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18170 2023-06-12 cs.CL 85%

Leveraging Training Data in Few-Shot Prompting for Numerical Reasoning

Zhanming Jie, Wei Lu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08061 2023-06-06 cs.CL 85%

On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning

Omar Shaikh, Hongxin Zhang, William Held, Michael Bernstein, Diyi Yang

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL

Comments ACL 2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11364 2025-10-29 cs.LG cs.AI cs.CL 85%

Offline Learning and Forgetting for Reasoning with Large Language Models

Tianwei Ni, Allen Nie, Sapana Chaudhary, Yao Liu, Huzefa Rangwala, Rasool Fakoor

机构 * Mila - Quebec AI Institute & Université de Montréal(魁北克AI研究所与蒙特利尔大学) Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in Transactions on Machine Learning Research (TMLR), 2025. Code: https://github.com/twni2016/llm-reasoning-uft

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02061 2025-03-06 cs.LG cs.AI cs.CL 85%

Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models

Marianna Nezhurina, Lucia Cipolina-Kun, Mehdi Cherti, Jenia Jitsev

机构 * LAION School of Electrical and Electronic Engineering, University of Bristol(布里斯托大学电气与电子工程学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments v3.0. Control experiments, further AIW problem versions, testing recent reasoning models. Short version appeared at NeurIPS Scientific Methods for Understanding Deep Learning Workshop (SciDL) 2024, https://openreview.net/forum?id=Mkl7dzjYiW

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14927 2026-08-18 cs.AI cs.CL cs.LG 新提交 85%

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

大语言模型(LLM)可预测失败风险,但难以预测哪种协作协议能产生回报:推理任务中考虑成本的协议路由

Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨LLM多智能体系统中协作成本与收益的平衡,测试四种协作协议,发现LLM可预测失败风险但难以识别有效协议,置信度可支持初始协作升级,特定协议的成本感知路由仍待解决。

Comments 23 pages, 6 figures; includes appendices and ancillary aggregate-result CSV files

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20161 2026-07-21 cs.LG cs.AI cs.CL 版本更新 85%

Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning

棱柱形合成:基于梯度的数据多样化提升语言模型推理中的泛化能力

Jaehun Jung, Seungju Han, Ximing Lu, Skyler Hallinan, David Acuna, Shrimai Prabhumoye, Mostafa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA Research(NVIDIA研究部) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型训练数据多样性对泛化的作用,提出基于梯度熵的G - Vendi指标,进而构建棱柱形合成框架生成多样合成数据,有效提升模型性能,在多个基准测试中表现优于依赖更大数据生成器的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30852 2026-07-07 cs.AI cs.CL cs.LG 新提交 85%

When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models

何时学习停止有帮助?推理模型中早期退出的成本感知研究

Zhe Dong, Fang Qin, Manish Shah

机构 * University of Maine at Presque Isle(缅因大学普雷斯克岛分校) Stanford University(斯坦福大学) Independent Researcher(独立研究员)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理语言模型中学习停止规则相对于简单置信度或收敛阈值的优势,提出LearnStop方法,发现其效果取决于任务类型,在自由形式数学任务中表现优于标量退出。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23543 2026-06-23 cs.AI cs.CL cs.CV cs.LG 新提交 85%

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol:通过可验证的进化指令扩展多模态数学推理

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯混元)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09591 2026-06-11 cs.CL cs.AI cs.LG 版本更新 85%

On the Optimal Reasoning Length for RL-Trained Language Models

关于RL训练的语言模型的最优推理长度

Daisuke Nohara, Taishi Nakamura, Rio Yokota

机构 * University of Tokyo(东京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究强化学习训练的语言模型中推理长度与准确率的非单调关系,发现存在最优中间长度,并通过模式准确率分析揭示其成因。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00791 2026-06-11 cs.LG cs.AI cs.CL cs.LO 版本更新 85%

Geometry of Reason: Spectral Signatures of Valid Mathematical Reasoning

推理的几何:有效数学推理的谱特征

Valentin Noël

机构 * Valentin Noël(瓦伦丁·诺埃尔)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过将注意力矩阵视为加权词图,提取四个无需学习的谱诊断指标(Fiedler值、高频能量比、谱熵和平滑度),有效区分有效推理与模式匹配,在多个模型上达到85-96%的分类准确率。

Comments 30 pages, 13 figures, Accepted at ICML 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11609 2026-05-13 cs.LG cs.AI cs.CL 85%

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

反自我蒸馏用于通过点互信息的推理强化学习

Guobin Shen, Xiang Cheng, Chenxiao Zhao, Lei Huang, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反自我蒸馏方法,通过分析点互信息解决自我蒸馏在数学推理中的不一致问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14846 2026-04-21 cs.LG cs.AI cs.CL 85%

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization

通过群体回合策略优化增强多轮工具集成代理推理

Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AWS AI Labs(AWS人工智能实验室) NVIDIA Meta

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21244 2026-04-21 cs.LG cs.AI cs.CL 85%

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

更少的噪声,更多的声音:通过指令净化进行推理的强化学习

Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

机构 * Department of Computer Science, Aarhus University(计算机科学系,阿arhus大学) Baidu Inc.(百度公司)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LENS框架,通过去除干扰标记提升强化学习推理效率,实验显示其在数学推理和科学推理中性能更优,收敛更快。

Comments Accepted at ACL 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06993 2026-04-14 cs.CV 85%

Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?

文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?

Jie Zhu, Yiyang Su, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。

Comments CVPR Finding, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06636 2026-04-09 cs.LG cs.AI cs.CL 85%

SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning

SHAPE:基于潜在估计的阶段感知分层优势用于大语言模型推理

Zhengyang Ai, Zikang Shan, Xiaodong Ai, Jingxian Tang, Hangkai Hu, Pinyan Lu

机构 * Huawei Taylor Lab(华为泰勒实验室) Center for Data Science, Peking University(北京大学数据科学中心) Shanghai University of Finance and Economics(上海财经大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SHAPE通过潜在估计引入分层信用分配机制,提升大语言模型推理的效率与准确性,实验显示在数学推理任务中平均准确率提升3%,token消耗减少30%。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02322 2026-04-03 cs.LG cs.AI cs.CL 85%

Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning

批量上下文强化:一种任务扩展定律以实现高效推理

Bangji Yang, Hongbo Ma, Jiajun Fan, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出批量上下文强化方法,通过在共享上下文窗口中同时解决多个问题,实现高效推理,减少token消耗并提升准确性。

Comments 43 pages, 5 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12372 2026-04-03 cs.AI cs.CL cs.LG 85%

Efficient Reasoning with Balanced Thinking

高效平衡思考推理

Yulin Li, Tengyao Tu, Li Ding, Junjie Wang, Huiling Zhen, Yixin Chen, Yong Li, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zhongguancun Academy(中关村学院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReBalance框架,通过平衡思考提升推理效率,减少冗余并提高准确性,适用于多种推理任务。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12853 2026-03-30 cs.CL cs.AI cs.LG 85%

Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks

思想多样性在多智能体辩论框架中增强了推理能力

Mahmood Hegazy

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过多智能体辩论框架发现,思想多样性显著提升LLM推理能力,中等规模模型在GSM-8K基准测试中超越GPT-4,达到91%准确率,同时在ASDiv基准测试中创下新纪录。

Comments 11 pages, 9 figures

Journal ref Journal of Robotics and Automation Research(JRAR), Vol. 5 Issue 3, October -2024, pg. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04072 2026-03-19 cs.LG cs.AI cs.CL stat.ML 85%

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

慢-快策略优化:在更新前重新定位用于大语言模型推理

Ziyan Wang, Zheng Wang, Xingwei Qu, Qi Cheng, Jie Fu, Shengpu Tang, Minjia Zhang, Xiaoming Huo

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Manchester(曼彻斯特大学) NVIDIA Independent(独立) Emory University(埃默里大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出慢-快策略优化框架,通过分解步骤为三个阶段,解决RL在早期训练中的稳定性与效率问题,实验表明其在推理任务中提升稳定性、减少rollouts数量并加速收敛。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏