arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2510.07038 2026-01-13 cs.AI 79%

Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning

工具增强的策略优化:通过强化学习协同推理与自适应工具使用

Wenxun Wu, Yuanyang Li, Guhan Chen, Linyue Wang, Hongyang Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 79%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03822 2026-01-08 cs.AI 79%

ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition

ROI-Reasoning: 为推理的理性优化 via 预计算元认知

Muyang Zhao, Qi Qi, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ROI-Reasoning通过预计算元认知,为LLMs提供预算感知的理性优化,提升推理性能并减少计算资源浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02397 2026-01-07 cs.AI 79%

OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation

OThink-R1: 内在快速/缓慢思考模式切换以抑制过度推理

Shengjia Zhang, Junjie Wu, Jiawei Chen, Changwang Zhang, Zhe Li, Xingyu Lou, Wangchunshu Zhou, Sheng Zhou, Can Wang, Jun Wang

机构 * Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 OThink-R1通过整合快速和缓慢思考模式,实现自动模式切换,从而在减少token使用的同时保持高准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24505 2026-01-01 cs.AI 79%

Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems

评估大语言模型在不常见数学竞赛问题上的推理能力

Samuel Golladay, Majid Bani-Yaghoub

机构 * University of Missouri: Kansas City(密苏里大学:堪萨斯城)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了三种LLM在不常见数学竞赛问题上的推理能力,发现DeepSeek-V3在微积分、解析几何和离散数学中表现最佳,但所有模型在几何学上均表现较弱。

Comments 7 pages, submitted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06337 2026-01-01 cs.AI 79%

DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization

DaGRPO:通过意识性群相对策略优化纠正推理中的梯度冲突

Xuan Xie, Xuan Wang, Wenjie Wang, Shuai Chen, Wei Lin

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 DaGRPO通过意识性群相对策略优化纠正推理中的梯度冲突,提升推理能力和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI 79%

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22774 2025-12-30 cs.LG cs.CV 79%

Schrodinger AI: A Unified Spectral-Dynamical Framework for Classification, Reasoning, and Operator-Based Generalization

薛定谔AI:一种用于分类、推理和基于算子的泛化统一频谱-动态框架

Truong Son Nguyen

机构 * Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 薛定谔AI通过统一频谱-动态框架实现分类、推理和基于算子的泛化,提供稳健的泛化能力与可解释的语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21540 2025-12-29 cs.AI 79%

Leash: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model

Leash:自适应长度惩罚与奖励塑造用于高效大推理模型

Yanhao Li, Lu Ma, Jiaran Zhang, Lexiang Tang, Wentao Zhang, Guibo Luo

机构 * Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Leash通过自适应长度惩罚与奖励塑造,有效提升大模型推理效率,减少推理长度60%同时保持性能竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19287 2025-12-23 cs.AI 79%

Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6

Vibe Reasoning: 引导前沿AI数学能力——以IMO 2025问题6的案例研究

Jiaao Wu, Xian Zhang, Fan Yang, Yinpeng Dong

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Vibe Reasoning通过结合AI与人类协作,利用元提示和代理编排解决复杂数学问题,展示了前沿AI在组合优化中的应用与改进。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19093 2025-12-23 cs.AI 79%

Tool-Augmented Hybrid Ensemble Reasoning with Distillation for Bilingual Mathematical Problem Solving

工具增强的混合集成推理与蒸馏用于双语数学问题求解

Peiqing Lu, Yuan Zhang, Haoyun Zhang, Jiasen Zheng, Kejian Tong, Wenjun Wu

机构 * Boston University(波士顿大学) University of Pennsylvania(宾夕法尼亚大学) Northwestern University(西北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 HERALD通过结合自适应学习、工具强化学习和知识蒸馏,提升双语数学问题求解的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15489 2025-12-18 cs.AI 79%

Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision

Nemotron-Math:基于多模式监督的高效长上下文数学推理蒸馏

Wei Du, Shubham Toshniwal, Branislav Kisacanin, Sadegh Mahdavi, Ivan Moshkov, George Armstrong, Stephen Ge, Edgar Minasyan, Feng Chen, Igor Gitman

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Nemotron-Math通过多模式监督和长上下文训练,实现了高效数学推理蒸馏,显著提升数学竞赛任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13978 2025-12-17 cs.AI 79%

Evaluating Frontier LLMs on PhD-Level Mathematical Reasoning: A Benchmark on a Textbook in Theoretical Computer Science about Randomized Algorithms

评估前沿大语言模型在博士级数学推理中的表现:一个关于随机算法理论教材的基准测试

Yang Cao, Yubin Chen, Xuyang Guo, Zhao Song, Song Yue, Jiahao Zhang, Jiale Zhao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了前沿大语言模型在博士级数学推理中的表现,通过随机算法教材的基准测试,发现顶级模型在准确性上表现优异,但可靠性存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02580 2025-12-16 cs.CL 79%

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

从模仿到辨别:一种通用的课程优势机制,增强跨领域推理任务

Changpeng Yang, Jinyang Wu, Yuchen Liu, Shuai Zhang, Yang Li, Qiliang Liang, Hongzhen Wang, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

机构 * \equalcontrib(1号机构)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 CAPO是一种基于优势信号的自适应课程机制,通过引导模仿学习和引入负信号提升跨领域推理任务的泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05943 2025-12-15 cs.AI 79%

TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models

TRACE:一种用于分析和增强视觉-语言模型逐步推理的框架

Shima Imani, Seungwhan Moon, Lambert Mathias, Lu Zhang, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TRACE通过辅助推理集和一致性评估,提升视觉-语言模型的推理透明性和错误检测能力,促进模型改进和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17114 2025-12-10 cs.AI 79%

Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models

数学证明作为检验标准:揭示先进大推理模型的失败模式

Dadi Guo, Jiayu Liu, Zhiyuan Fan, Zhitao He, Haoran Li, Yuxin Li, Yumeng Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过引入RFMDataset揭示大推理模型在数学证明中的失败模式,发现其在严谨性和正确性上的不足,需进一步提升逻辑训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07871 2025-12-10 quant-ph cs.AI 79%

Quantum Circuit Reasoning Models: A Variational Framework for Differentiable Logical Inference

量子电路推理模型:一种用于可微逻辑推理的变分框架

Andrew Kiruluta

机构 * UC Berkeley, School of Information(伯克利大学信息学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 量子电路推理模型通过变分框架实现可微逻辑推理,将量子力学操作映射到推理原语,用于科学、生物医学和化学领域的推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16401 2025-12-09 cs.LG 79%

Exploring the Hidden Reasoning Process of Large Language Models by Misleading Them

通过误导性训练探索大型语言模型的隐藏推理过程

Guanyu Chen, Peiyang Wang, Yizhou Jiang, Yuqian Liu, Chujie Zhao, Ying Fang, Tianren Zhang, Feng Chen

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) College of Computer and Cyber Security, Fujian Normal University(计算机与网络安全学院,福建师范大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过误导性训练方法探索LLMs的隐藏推理过程,发现其具备在任务抽象前进行推理的内部机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04355 2025-12-05 cs.DC cs.AI cs.PF 79%

Counting Without Running: Evaluating LLMs' Reasoning About Code Complexity

无需运行即可计数:评估LLM对代码复杂度的推理能力

Gregory Bolet, Giorgis Georgakoudis, Konstantinos Parasyris, Harshitha Menon, Niranjan Hasabnis, Kirk W. Cameron, Gal Oren

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出gpuFLOPBench基准测试,评估LLM在无需运行代码的情况下预测CUDA内核FLOP计数的能力,揭示现有代码助手在硬件特定微码效应方面的局限性。

Comments 13 pages, 6 figures, MLSys 2026 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00552 2025-12-02 cs.CL 79%

Catch Me If You Can: How Smaller Reasoning Models Pretend to Reason with Mathematical Fidelity

捉摸不到:为何小型推理模型用数学严谨性伪装推理

Subramanyam Sahoo, Vinija Jain, Saanidhya Vats, Siddharth Mohapatra, Rui Min, Aman Chadha, Divya Chaudhary

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究提出诊断框架,揭示小型模型依赖模式匹配而非真实逻辑计算,通过四个轴线评估推理忠实性,推动可验证的数学推理研究。

Comments 8 pages, 5 figures. A preprint. Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27044 2025-12-02 cs.LG 79%

Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning

RLVR在数学推理中的泛化极限:两个案例研究

Md Tanvirul Alam, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 RLVR在数学推理任务中通过强化表面启发式方法提升指标,但难以获得真实推理策略,凸显其泛化能力的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19333 2025-11-25 cs.CL 79%

Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces

学习推理:通过GPT-OSS或DeepSeek R1推理轨迹训练LLMs

Shaltiel Shmidman, Asher Fredman, Oleg Sudakov, Meriem Bendris

机构 * DICTA NVIDIA

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过比较DeepSeek-R1和gpt-oss生成的推理轨迹对中型LLMs在数学问题上的微调效果,评估了推理轨迹在提升模型推理能力中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08987 2025-11-21 cs.AI 79%

Towards Efficient Multimodal Unified Reasoning Model via Model Merging

通过模型合并实现高效的多模态统一推理模型

Qixiang Yin, Huanjin Yao, Jianghao Chen, Jiaxing Huang, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Tiny-R1V通过两阶段优化和模型合并方法,实现高效多模态推理,提升轻量模型在多种任务中的性能。

Comments Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13404 2025-11-19 cs.AI 79%

Effective Learning for Small Reasoning Models: An Empirical Study on 0.5B Reasoning LLMs

Xialie Zhuang, Peixian Ma, Zhikai Jia, Zane Cao, Shiwei Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SCITIX (SGP) TECH PTE. LTD.(SCITIX(SGP)技术有限公司) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13016 2025-11-18 cs.LG 79%

The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training

Subramanyam Sahoo

机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

Comments Paper accepted to the 2nd Workshop on Aligning Reinforcement Learning Experimentalists and Theorists (ARLET 2025) at NeurIPS; the paper consists of 14 pages (including the appendix) and contains 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09158 2025-11-13 cs.AI 79%

Efficient Reasoning via Reward Model

Yuhao Wang, Xiaopeng Li, Cheng Gong, Ziru Liu, Suiyun Zhang, Rui Liu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03133 2025-11-13 cs.CL 79%

ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models

Boyang Xue, Qi Zhu, Rui Wang, Sheng Wang, Hongru Wang, Minda Hu, Fei Mi, Yasheng Wang, Lifeng Shang, Qun Liu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08055 2025-11-12 cs.AI 79%

MSCR: Exploring the Vulnerability of LLMs' Mathematical Reasoning Abilities Using Multi-Source Candidate Replacement

Zhishen Sun, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20166 2025-11-12 cs.CR cs.AI 79%

CyberSOCEval: Benchmarking LLMs Capabilities for Malware Analysis and Threat Intelligence Reasoning

Lauren Deason, Adam Bali, Ciprian Bejean, Diana Bolocan, James Crnkovich, Ioana Croitoru, Krishna Durai, Chase Midler, Calin Miron, David Molnar, Brad Moon, Bruno Ostarcevic, Alberto Peltea, Matt Rosenberg, Catalin Sandu, Arthur Saputkin, Sagar Shah, Daniel Stan, Ernest Szocs, Shengye Wan, Spencer Whitman, Sven Krasser, Joshua Saxe

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07396 2025-11-11 cs.LG 79%

C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning

Antonios Valkanas, Soumyasundar Pal, Pavel Rumiantsev, Yingxue Zhang, Mark Coates

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Int. Lab. Learning Systems(国际学习系统实验室) Huawei Montréal, Canada(华为蒙特利尔加拿大分公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏