arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2510.11062 2026-02-02 cs.LG cs.MA 70%

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

Stronger-MAS: 多智能体强化学习用于协作大语言模型

Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

机构 * University of California, San Diego(加州大学圣地亚哥分校) Intel Corporation(英特尔公司)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 Stronger-MAS提出了一种针对多智能体强化学习的AT-GRPO算法,通过改进的分组策略和训练系统,在多个任务中显著提升了大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09026 2026-02-02 cs.LG cs.CR 70%

Detecting Instruction Fine-tuning Attacks using Influence Function

利用影响函数检测指令微调攻击

Jiawei Li

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出一种无需先验知识的检测方法,通过影响函数和语义转换识别污染示例,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13332 2026-01-29 cs.CL 70%

The Imitation Game: Turing Machine Imitator is Length Generalizable Reasoner

模仿游戏:图灵机模仿器是长度可推广的推理机

Zhouqi Hua, Wenwei Zhang, Chengqi Lyu, Yuzhe Gu, Songyang Gao, Kuikun Liu, Dahua Lin, Kai Chen

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出TAIL方法,通过合成图灵机执行过程的链式思维数据,提升LLM的长度泛化能力,超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13551 2026-01-27 cs.AI 70%

Tandem Training for Language Models

语言模型的串联训练

Robert West, Ashton Anderson, Ece Kamar, Eric Horvitz

机构 * EPFL(瑞士联邦理工学院) University of Toronto(多伦多大学) Microsoft(微软公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出串联训练方法,通过强化学习促进语言模型在任务中保持可解释性,使模型能适应较弱协作者并保持高准确性。

Journal ref Proceedings of the 2026 Conference of the European Chapter of the Association for Computational Linguistics (EACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08521 2026-01-23 cs.LG 70%

Your Group-Relative Advantage Is Biased

你的组相对优势存在偏差

Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun Yin, Wei Lin, Shuai Ma, Fuzhen Zhuang, Deqing Wang, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Meituan(美团)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出HA-DW方法,通过修正组相对优势估计的偏差,提升基于组的强化学习在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13244 2026-01-21 cs.LG 70%

Do Instruction-Tuned Models Always Perform Better Than Base Models? Evidence from Math and Domain-Shifted Benchmarks

指令微调模型是否总是比基模型表现更好?数学和领域转移基准的证据

Prateek Munjal, Clement Christophe, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi, UAE(阿布扎希德)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.LG

AI总结 研究通过数学和领域转移基准验证指令微调模型在不同设置下的表现差异,发现其性能依赖于提示模式而非内在推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20578 2026-01-06 cs.CL 70%

Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits

LLMs能否预测自身失败?通过内部电路实现自感知

Amirhosein Ghasemabadi, Di Niu

机构 * University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 Gnosis通过分析LLM内部状态实现自我验证,有效提升生成过程的准确性和校准性,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11495 2025-12-18 cs.LG stat.ML 70%

How Reinforcement Learning After Next-Token Prediction Facilitates Learning

如何在生成下一个标记后使用强化学习促进学习

Nikolaos Tsilivis, Eran Malach, Karen Ullrich, Julia Kempe

机构 * New York University(纽约大学) Harvard University(哈佛大学) FAIR, Meta

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 通过在生成下一个标记后使用强化学习,研究了如何在推理任务中提升模型的学习能力,证明其在预测比特奇偶性等任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03846 2025-12-16 cs.CL 70%

Do LLM Evaluators Prefer Themselves for a Reason?

大语言模型评估器为何偏好自己?

Wei-Lin Chen, Zhepei Wei, Xinyu Zhu, Shi Feng, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) George Washington University(乔治华盛顿大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在评估时自我偏好现象的成因,发现更强模型更倾向于偏好自身输出,但其中大部分偏好源于客观质量优势,同时提出通过扩展策略可减少有害自我偏好。

Comments Added LMArena experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12429 2025-11-18 cs.LG 70%

Tailored Primitive Initialization is the Secret Key to Reinforcement Learning

Yihang Yao, Guangtao Zeng, Raina Wu, Yang Zhang, Ding Zhao, Zhang-Wei Hong, Chuang Gan

机构 * Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00183 2025-11-06 cs.LG 70%

PDE-SHARP: PDE Solver Hybrids through Analysis and Refinement Passes

Shaghayegh Fazliani, Madeleine Udell

机构 * Department of Mathematics Stanford University(数学系 斯坦福大学) Department of Management Science & Engineering Stanford University(管理科学与工程系 斯坦福大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01190 2025-11-04 cs.LG stat.ML 70%

Analyzing the Power of Chain of Thought through Memorization Capabilities

Lijia Yu, Xiao-Shan Gao, Lijun Zhang

机构 * Institute of AI for Industries(人工智能产业研究院) State Key Laboratory of Mathematical Sciences(数学科学国家重点实验室) Academy of Mathematics and Systems Science(数学与系统科学学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of System Software of Chinese Academy of Sciences(中国科学院系统软件重点实验室)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12872 2025-11-04 cs.MA cs.AI stat.ML 70%

KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems

Hancheng Ye, Zhengqi Gao, Mingyuan Ma, Qinsi Wang, Yuzhe Fu, Ming-Yu Chung, Yueqian Lin, Zhijian Liu, Jianyi Zhang, Danyang Zhuo, Yiran Chen

机构 * Duke University(杜克大学) MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

Comments Accepted for publication in NeurIPS2025. Code is available at \url{https://github.com/FastMAS/KVCOMM}

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27355 2025-11-03 cs.CL 70%

ThoughtProbe: Classifier-Guided LLM Thought Space Exploration via Probing Representations

Zijian Wang, Chang Xu

机构 * School of Computer Science(计算机科学学院) The University of Sydney(悉尼大学)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

Comments EMNLP2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24397 2025-10-29 cs.AI 70%

APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training

Jiarui Qin, Yunjia Xi, Junjie Huang, Renting Rui, Di Yin, Weiwen Liu, Yong Yu, Weinan Zhang, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19339 2025-10-23 cs.CV cs.CL 70%

PixelWorld: How Far Are We from Perceiving Everything as Pixels?

Zhiheng Lyu, Xueguang Ma, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Vector Institute, Toronto(多伦多向量研究所)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17715 2025-10-21 cs.CL 70%

QueST: Incentivizing LLMs to Generate Difficult Problems

Hanxu Hu, Xingxing Zhang, Jannis Vamvas, Rico Sennrich, Furu Wei

机构 * University of Zurich(苏黎世大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06917 2025-10-21 cs.CL eess.AS 70%

SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models

Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang

机构 * National Taiwan University(台湾大学) Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06652 2025-10-09 cs.CL 70%

Aligning Large Language Models via Fully Self-Synthetic Data

Shangjian Yin, Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Yu Meng

机构 * University of California, Riverside(加州大学河滨分校) University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18189 2025-09-24 cs.CV cs.AI 70%

Qianfan-VL: Domain-Enhanced Universal Vision-Language Models

Daxiang Dong, Mingming Zheng, Dong Xu, Bairong Zhuang, Wenyu Zhang, Chunhua Luo, Haoran Wang, Zijian Zhao, Jie Li, Yuxuan Li, Hanjun Zhong, Mengyue Liu, Jieting Chen, Shupeng Li, Lun Tian, Yaping Feng, Xin Li, Donggang Jiang, Yong Chen, Yehua Xu, Duohao Qin, Chen Feng, Dan Wang, Henghua Zhang, Jingjing Ha, Jinhui He, Yanfeng Zhai, Chengxin Zheng, Jiayi Mao, Jiacheng Chen, Ruchang Yao, Ziye Yuan, Jianmin Wu, Guangjun Xie, Dou Shen

机构 * Qianfan Team, Baidu AI Cloud(百度AI云团队)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11930 2025-09-23 cs.CL 70%

Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback

Dongwei Jiang, Alvin Zhang, Andrew Wang, Nicholas Andrews, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08910 2025-09-12 cs.CV cs.AI 70%

PromptGuard: An Orchestrated Prompting Framework for Principled Synthetic Text Generation for Vulnerable Populations using LLMs with Enhanced Safety, Fairness, and Controllability

Tung Vu, Lam Nguyen, Quynh Dao

机构 * Posts and Telecommunications Institute of Technology(邮电技术研究所) Hanoi Architectural University(河内建筑大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08780 2025-09-09 cs.CL 70%

Large Language Models Might Not Care What You Are Saying: Prompt Format Beats Descriptions

Chenming Tang, Zhixiang Wang, Hao Sun, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) MOE Key Laboratory of Computational Linguistics, Peking University School of Computer Science, Peking University(教育部计算语言学重点实验室,北京大学计算机科学学院,北京大学)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings. 23 pages, 23 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00125 2025-09-03 cs.AI 70%

Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning

Ang Li, Zhihang Yuan, Yang Zhang, Shouda Liu, Yisen Wang

机构 * PKU(北京大学) ByteDance Seed(字节跳动种子)

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07124 2025-08-11 cs.CL 70%

Structural Reformation of Large Language Model Neuron Encapsulation for Divergent Information Aggregation

Denis Bakushev, Gideon Boultinghouse, Harriet Oppenheimer, Sebastian Gillingwater, Valentina Ashington, Wilfred Stanborough

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04094 2025-08-08 cs.CL 70%

BloomWise: Enhancing Problem-Solving capabilities of Large Language Models using Bloom's-Taxonomy-Inspired Prompts

Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos, Alexandros Potamianos

机构 * Speech and Language Processing Group, National Technical University of Athens(国家技术大学雅典语音与语言处理组) Institute for Language and Speech Processing, Athena Research Center(雅典研究中心语言与语音处理研究所) National Technical University of Athens(国家技术大学雅典)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03500 2025-08-06 cs.AI 70%

Error Detection and Correction for Interpretable Mathematics in Large Language Models

Yijin Yang, Cristina Cornelio, Mario Leiva, Paulo Shakarian

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02076 2025-08-05 cs.AI cs.GT 70%

Everyone Contributes! Incentivizing Strategic Cooperation in Multi-LLM Systems via Sequential Public Goods Games

Yunhao Liang, Yuan Qu, Jingyuan Yang, Shaochong Lin, Zuo-Jun Max Shen

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12079 2025-07-17 cs.CL 70%

Findings of MEGA: Maths Explanation with LLMs using the Socratic Method for Active Learning

Tosin Adewumi, Foteini Simistira Liwicki, Marcus Liwicki, Viktor Gardelli, Lama Alkhaled, Hamam Mokayed

机构 * Department of Electrical and Computer Engineering, Michigan State University(密歇根州立大学电气与计算机工程系)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

Comments This paper was accepted for the special issue AI for Education by the IEEE Signal Processing Magazine journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02173 2025-07-04 cs.AI 70%

Data Diversification Methods In Alignment Enhance Math Performance In LLMs

Berkan Dokmeci, Qingyang Wu, Ben Athiwaratkun, Ce Zhang, Shuaiwen Leon Song, James Zou

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Together AI University of Chicago(芝加哥大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏