arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-03 至 2026-02-03 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 20 篇

2602.01982 2026-02-03 cs.CL 92%

S3-CoT: Self-Sampled Succinct Reasoning Enables Efficient Chain-of-Thought LLMs

S3-CoT:自采样简洁推理实现高效链式推理LLM

Yanrui Du, Sendong Zhao, Yibo Gao, Danyang Zhao, Qika Lin, Ming Ma, Jiayun Li, Yi Jiang, Kai He, Qianyi Xu, Bing Qin, Mengling Feng

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

AI总结 S3-CoT通过自采样简洁推理实现高效链式推理LLM,解决冗余推理问题,提升模型性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01017 2026-02-03 cs.LG cs.AI 86%

How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments

自回归训练如何导致不忠推理?合成实验研究

Fuxin Wang, Amr Alazali, Yiqiao Zhong

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过合成实验探讨自回归训练如何导致不忠推理,发现训练噪声阈值影响推理的忠实性,模型在低噪声下能学习因果推理,高噪声下则出现跳步推理。

Comments 25 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04291 2026-02-03 cs.CL 85%

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

数学推理中的进化预提示优化

Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

机构 * Meta AI Paris France(Meta AI) TAU, INRIA LISN (CNRS \& Univ. Paris-Saclay) Orsay France INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108 Rouen France Meta AI LISN (CNRS \& Univ. Paris-Saclay) INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出进化预提示优化方法,通过优化示例选择提升CoT预提示效果,在数学推理任务中取得显著提升。

Comments Revised and extended version. To appear in ACM Transactions on Evolutionary Learning and Optimization (TELO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01365 2026-02-03 cs.LG cs.AI cs.CL 85%

When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning

当领域互动时:强化学习中的非对称和顺序敏感的跨领域效应

Wang Yang, Shouren Wang, Chaoda Song, Chuang Ma, Xinpeng Li, Nengbo Wang, Kaixiong Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示GRPO在多领域训练中存在不对称性和顺序敏感性,指出训练顺序对推理性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00983 2026-02-03 cs.CL cs.AI cs.LG 82%

DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning

DISPO:提升大型语言模型数学推理中的训练效率和稳定性

Batuhan K. Karaman, Aditya Rawal, Suhaila Shakiah, Mohammad Ghavamzadeh, Mingyi Hong, Arijit Biswas, Ruida Zhou

机构 * Cornell University(康奈尔大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DISPO通过分离正确与错误响应的重要性采样权重裁剪,实现训练效率与稳定性的平衡,提升大型语言模型在数学推理任务中的性能。

Comments This work is accepted to the 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10887 2026-02-03 cs.CL cs.LG 81%

Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers

泛化还是幻觉?理解Transformer中的上下文推理

Yixiao Huang, Hanlin Zhu, Tianyu Guo, Jiantao Jiao, Somayeh Sojoudi, Michael I. Jordan, Stuart Russell, Song Mei

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer中上下文推理机制,揭示其驱动泛化与幻觉的双重性,并通过理论分析与实验验证了矩阵因子化在其中的关键作用。

Comments NeurIPS 2025, first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11104 2026-02-03 cs.CL cs.AI 81%

Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization

通过非人类样式推理路径偏好优化增强大语言模型推理

Junjie Lu, Yuliang Liu, Chaofeng Qu, Wei Shen, Zhouhan Lin, Chuheng Zhang, Min Xu

机构 * University of Technology Sydney(悉尼技术大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CGPO方法,通过置信度信号优化推理路径,提升大语言模型在代码和数学推理任务中的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01983 2026-02-03 cs.AI 79%

Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning

从工具使用者到创作者的进化:通过无训练经验重用在多模态推理中

Xintian Shen, Jiawei Chen, Lihao Zheng, Hao Ma, Tao Wei, Kun Zhan

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 UCT框架通过无训练经验重用,使智能体从工具使用者转变为工具创造者,提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01207 2026-02-03 cs.AI 79%

Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models

并非所有偏好都同等重要:面向推理模型的稳定性感知与梯度高效对齐

Hui Wu, Hengyi Cai, Jinman Zhao, Xinran Chen, Ziheng Li, Zhejun Zhao, Shuaiqiang Wang, Yuchen Li, Dawei Yin

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Baidu Inc.(百度公司) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SAGE通过动态框架提升推理模型对齐的稳定性与梯度效率,通过信噪比优化和稳定性感知评分函数实现更高效的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01204 2026-02-03 cs.CL 79%

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

ASTER: 基于工具集成扩展推理的代理扩展

Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University, China(人工智能学院) Department of Foundation Model, 2012 Labs, Huawei(基础模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ASTER通过冷启动策略提升工具集成推理性能,实现长周期推理的高效扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22069 2026-02-03 cs.CL 79%

VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning

VTC-R1: 视觉-文本压缩用于高效长上下文推理

Yibo Wang, Yongcheng Jing, Shunyu Liu, Hao Guan, Rong-cheng Tu, Chengyu Wang, Jun Huang, Dacheng Tao

机构 * Nanyang Technical University(南洋技术大学) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。

Comments Code: https://github.com/w-yibo/VTC-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 79%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04120 2026-02-03 cs.CL 79%

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

RIDE: 通过项目反应理论进行数学推理的难度演变扰动

Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

机构 * East China Normal University(东华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 RIDE通过项目反应理论生成更具挑战性的数学问题,评估大型语言模型的数学推理能力,实验显示其性能下降21.73%,验证了评估方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00092 2026-02-03 cs.LG cs.AI cs.CL cs.CV 67%

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

通过宪法进行原子概念编辑来解释和控制模型行为

Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

机构 * Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出通过原子概念编辑学习模型宪法,以解释和控制模型行为,实验证明其在提升模型成功率方面效果显著。

Journal ref Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01711 2026-02-03 cs.AI cs.LG 62%

Optimizing Prompts for Large Language Models: A Causal Approach

为大型语言模型优化提示:一种因果方法

Wei Chen, Yanbin Fang, Shuran Fu, Fasheng Xu, Xuan Wei

机构 * School of Business, University of Connecticut(康涅狄格大学商学院) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CPO通过因果推断方法优化提示设计,提升企业LLM在复杂查询中的鲁棒性,并降低提示优化的经济成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00576 2026-02-03 cs.LG cs.AI 62%

Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs

数据分布作为引导优化器实现LLM超一般化的杠杆

Tushaar Gangavarapu, Jiping Li, Christopher Vattheuer, Zhangyang Wang, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过调整训练数据分布降低简单性偏见,提升大型语言模型的泛化能力,实验表明在数学推理任务中性能提升达18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23753 2026-02-03 cs.LG cs.CL 62%

Anchored Supervised Fine-Tuning

锚定监督微调

He Zhu, Junyou Su, Peng Lai, Ren Ma, Wenjia Zhang, Linyi Yang, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出锚定监督微调(ASFT),通过引入KL正则化解决动态微调(DFT)的稳定性问题,在数学推理、医学知识和代码生成等领域取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00279 2026-02-03 cs.CL cs.LG 62%

Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering

在大型语言模型长格式问答中评估不确定性校准的基准测试

Philip Müller, Nicholas Popovič, Michael Färber, Peter Steinbach

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03205 2026-02-03 cs.CL cs.AI 62%

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

U-MATH:一个大学级评估LLM数学能力的基准测试

Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

机构 * Toloka AI Gradarius Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 U-MATH是一个大学级数学能力评估基准,包含1100个开放性问题,用于评估LLM在多模态推理和解决方案判断方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26313 2026-02-03 cs.CL 57%

One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient

单个标记回滚:通过策略梯度引导大语言模型的监督微调

Rui Ming, Haoyuan Wu, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) ChatEDA Tech(ChatEDA技术公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 通过策略梯度引导监督微调,单个标记回滚(OTR)在多个基准测试中优于标准SFT,展示了on-policy数据对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏