arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-21 至 2025-10-21 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 14 篇

2507.00432 2025-10-21 cs.AI cs.CL 90%

Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning

Maggie Huan, Yuetai Li, Tuney Zheng, Xiaoyu Xu, Seungone Kim, Minxin Du, Radha Poovendran, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) University of Washington(华盛顿大学) M-A-P The Hong Kong Polytechnic University(香港理工大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15965 2025-10-21 cs.LG cs.AI cs.CR 88%

One Token Embedding Is Enough to Deadlock Your Large Reasoning Model

Mohan Zhang, Yihua Zhang, Jinghan Jia, Zhangyang Wang, Sijia Liu, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Michigan State University(密歇根州立大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13850 2025-10-21 cs.CL cs.AI 87%

Revisiting the UID Hypothesis in LLM Reasoning Traces

Minju Gwak, Guijin Son, Jaehyung Kim

机构 * Department of Artificial Intelligence(人工智能系) Yonsei University(延世大学) OneLine AI

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Journal ref The 5th Workshop on Mathematical Reasoning and AI, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10252 2025-10-21 cs.CL cs.AI 86%

Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models

Samir Abdaljalil, Erchin Serpedin, Khalid Qaraqe, Hasan Kurban

机构 * Texas A&M University(德克萨斯大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24550 2025-10-21 cs.CL 83%

A*-Thought: Efficient Reasoning via Bidirectional Compression for Low-Resource Settings

Xiaoang Xu, Shuo Wang, Xu Han, Zhenghao Liu, Huijia Wu, Peipei Li, Zhiyuan Liu, Maosong Sun, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) Northeastern University(东北大学) Institute for AI, Tsinghua University(清华大学人工智能研究院) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16476 2025-10-21 cs.AI 83%

NP-Engine: Empowering Optimization Reasoning in Large Language Models with Verifiable Synthetic NP Problems

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24760 2025-10-21 cs.LG cs.AI cs.CL 83%

REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards

Zafir Stojanovski, Oliver Stanley, Joe Sharratt, Richard Jones, Abdulhakeem Adefioye, Jean Kaddour, Andreas Köpf

机构 * Open-Thought Scale AI University College London(伦敦大学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 Spotlight. For code, see https://github.com/open-thought/reasoning-gym

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15979 2025-10-21 cs.LG cs.AI 81%

Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning

Zexu Sun, Yongcheng Zeng, Erxue Min, Heyang Gao, Bokai Ji, Xu Chen

机构 * Baidu Inc.(百度公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 22 Pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17715 2025-10-21 cs.CL 70%

QueST: Incentivizing LLMs to Generate Difficult Problems

Hanxu Hu, Xingxing Zhang, Jannis Vamvas, Rico Sennrich, Furu Wei

机构 * University of Zurich(苏黎世大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06917 2025-10-21 cs.CL eess.AS 70%

SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models

Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang

机构 * National Taiwan University(台湾大学) Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16645 2025-10-21 cs.CL cs.AI cs.LG cs.MA 67%

Unleashing Diverse Thinking Modes in LLMs through Multi-Agent Collaboration

Zhixuan He, Yue Feng

机构 * University of Birmingham, United Kingdom(英国伯明翰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17733 2025-10-21 cs.CL cs.LG 62%

Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations

Tong Chen, Akari Asai, Luke Zettlemoyer, Hannaneh Hajishirzi, Faeze Brahman

机构 * University of Washington(华盛顿大学) Allen Institute for AI (Ai2)(人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02456 2025-10-21 cs.LG cs.AI cs.NA math.NA 62%

Market-Driven Subset Selection for Budgeted Training

Ashish Jha, Valentin Leplat, AH Phan

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所) Innopolis University(因诺波利斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Retitled major revision of the same work (formerly "Market-Based Data Subset Selection -- Principled Aggregation of Multi-Criteria Example Utility"). Abstract and exposition revised; ablations added; theory clarified. Core results unchanged. Supersedes v1; please process as a replacement

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20673 2025-10-21 cs.CL 57%

Geometric-Mean Policy Optimization

Yuzhong Zhao, Yue Liu, Junpeng Liu, Jingye Chen, Xun Wu, Yaru Hao, Tengchao Lv, Shaohan Huang, Lei Cui, Qixiang Ye, Fang Wan, Furu Wei

机构 * UCAS(中国科学院大学) CUHK(香港中文大学) HKUST(香港科技大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments Code is available at https://github.com/callsys/GMPO

详情

展开后加载摘要…

URL PDF HTML 收藏