arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-03 至 2026-02-03 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 20 篇

2602.01982 2026-02-03 cs.CL 92%

S3-CoT: Self-Sampled Succinct Reasoning Enables Efficient Chain-of-Thought LLMs

S3-CoT:自采样简洁推理实现高效链式推理LLM

Yanrui Du, Sendong Zhao, Yibo Gao, Danyang Zhao, Qika Lin, Ming Ma, Jiayun Li, Yi Jiang, Kai He, Qianyi Xu, Bing Qin, Mengling Feng

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

AI总结 S3-CoT通过自采样简洁推理实现高效链式推理LLM,解决冗余推理问题,提升模型性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01017 2026-02-03 cs.LG cs.AI 86%

How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments

自回归训练如何导致不忠推理?合成实验研究

Fuxin Wang, Amr Alazali, Yiqiao Zhong

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过合成实验探讨自回归训练如何导致不忠推理,发现训练噪声阈值影响推理的忠实性,模型在低噪声下能学习因果推理,高噪声下则出现跳步推理。

Comments 25 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04291 2026-02-03 cs.CL 85%

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

数学推理中的进化预提示优化

Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

机构 * Meta AI Paris France(Meta AI) TAU, INRIA LISN (CNRS \& Univ. Paris-Saclay) Orsay France INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108 Rouen France Meta AI LISN (CNRS \& Univ. Paris-Saclay) INSA Rouen Normandy, University of Rouen Normandy, LITIS UR 4108

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出进化预提示优化方法,通过优化示例选择提升CoT预提示效果,在数学推理任务中取得显著提升。

Comments Revised and extended version. To appear in ACM Transactions on Evolutionary Learning and Optimization (TELO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01365 2026-02-03 cs.LG cs.AI cs.CL 85%

When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning

当领域互动时:强化学习中的非对称和顺序敏感的跨领域效应

Wang Yang, Shouren Wang, Chaoda Song, Chuang Ma, Xinpeng Li, Nengbo Wang, Kaixiong Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示GRPO在多领域训练中存在不对称性和顺序敏感性,指出训练顺序对推理性能有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00983 2026-02-03 cs.CL cs.AI cs.LG 82%

DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning

DISPO:提升大型语言模型数学推理中的训练效率和稳定性

Batuhan K. Karaman, Aditya Rawal, Suhaila Shakiah, Mohammad Ghavamzadeh, Mingyi Hong, Arijit Biswas, Ruida Zhou

机构 * Cornell University(康奈尔大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DISPO通过分离正确与错误响应的重要性采样权重裁剪,实现训练效率与稳定性的平衡,提升大型语言模型在数学推理任务中的性能。

Comments This work is accepted to the 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10887 2026-02-03 cs.CL cs.LG 81%

Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers

泛化还是幻觉?理解Transformer中的上下文推理

Yixiao Huang, Hanlin Zhu, Tianyu Guo, Jiantao Jiao, Somayeh Sojoudi, Michael I. Jordan, Stuart Russell, Song Mei

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer中上下文推理机制,揭示其驱动泛化与幻觉的双重性,并通过理论分析与实验验证了矩阵因子化在其中的关键作用。

Comments NeurIPS 2025, first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11104 2026-02-03 cs.CL cs.AI 81%

Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization

通过非人类样式推理路径偏好优化增强大语言模型推理

Junjie Lu, Yuliang Liu, Chaofeng Qu, Wei Shen, Zhouhan Lin, Chuheng Zhang, Min Xu

机构 * University of Technology Sydney(悉尼技术大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CGPO方法,通过置信度信号优化推理路径,提升大语言模型在代码和数学推理任务中的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01983 2026-02-03 cs.AI 79%

Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning

从工具使用者到创作者的进化:通过无训练经验重用在多模态推理中

Xintian Shen, Jiawei Chen, Lihao Zheng, Hao Ma, Tao Wei, Kun Zhan

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 UCT框架通过无训练经验重用,使智能体从工具使用者转变为工具创造者,提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01207 2026-02-03 cs.AI 79%

Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models

并非所有偏好都同等重要:面向推理模型的稳定性感知与梯度高效对齐

Hui Wu, Hengyi Cai, Jinman Zhao, Xinran Chen, Ziheng Li, Zhejun Zhao, Shuaiqiang Wang, Yuchen Li, Dawei Yin

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Baidu Inc.(百度公司) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SAGE通过动态框架提升推理模型对齐的稳定性与梯度效率,通过信噪比优化和稳定性感知评分函数实现更高效的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01204 2026-02-03 cs.CL 79%

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

ASTER: 基于工具集成扩展推理的代理扩展

Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University, China(人工智能学院) Department of Foundation Model, 2012 Labs, Huawei(基础模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ASTER通过冷启动策略提升工具集成推理性能,实现长周期推理的高效扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22069 2026-02-03 cs.CL 79%

VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning

VTC-R1: 视觉-文本压缩用于高效长上下文推理

Yibo Wang, Yongcheng Jing, Shunyu Liu, Hao Guan, Rong-cheng Tu, Chengyu Wang, Jun Huang, Dacheng Tao

机构 * Nanyang Technical University(南洋技术大学) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。

Comments Code: https://github.com/w-yibo/VTC-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 79%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04120 2026-02-03 cs.CL 79%

RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning

RIDE: 通过项目反应理论进行数学推理的难度演变扰动

Xinyuan Li, Murong Xu, Wenbiao Tao, Hanlun Zhu, Yike Zhao, Jipeng Zhang, Yunshi Lan

机构 * East China Normal University(东华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 RIDE通过项目反应理论生成更具挑战性的数学问题,评估大型语言模型的数学推理能力,实验显示其性能下降21.73%,验证了评估方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00092 2026-02-03 cs.LG cs.AI cs.CL cs.CV 67%

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

通过宪法进行原子概念编辑来解释和控制模型行为

Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

机构 * Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出通过原子概念编辑学习模型宪法,以解释和控制模型行为,实验证明其在提升模型成功率方面效果显著。

Journal ref Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01711 2026-02-03 cs.AI cs.LG 62%

Optimizing Prompts for Large Language Models: A Causal Approach

为大型语言模型优化提示:一种因果方法

Wei Chen, Yanbin Fang, Shuran Fu, Fasheng Xu, Xuan Wei

机构 * School of Business, University of Connecticut(康涅狄格大学商学院) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CPO通过因果推断方法优化提示设计,提升企业LLM在复杂查询中的鲁棒性,并降低提示优化的经济成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00576 2026-02-03 cs.LG cs.AI 62%

Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs

数据分布作为引导优化器实现LLM超一般化的杠杆

Tushaar Gangavarapu, Jiping Li, Christopher Vattheuer, Zhangyang Wang, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过调整训练数据分布降低简单性偏见,提升大型语言模型的泛化能力,实验表明在数学推理任务中性能提升达18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23753 2026-02-03 cs.LG cs.CL 62%

Anchored Supervised Fine-Tuning

锚定监督微调

He Zhu, Junyou Su, Peng Lai, Ren Ma, Wenjia Zhang, Linyi Yang, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出锚定监督微调(ASFT),通过引入KL正则化解决动态微调(DFT)的稳定性问题,在数学推理、医学知识和代码生成等领域取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00279 2026-02-03 cs.CL cs.LG 62%

Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering

在大型语言模型长格式问答中评估不确定性校准的基准测试

Philip Müller, Nicholas Popovič, Michael Färber, Peter Steinbach

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03205 2026-02-03 cs.CL cs.AI 62%

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

U-MATH:一个大学级评估LLM数学能力的基准测试

Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

机构 * Toloka AI Gradarius Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 U-MATH是一个大学级数学能力评估基准,包含1100个开放性问题,用于评估LLM在多模态推理和解决方案判断方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26313 2026-02-03 cs.CL 57%

One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient

单个标记回滚:通过策略梯度引导大语言模型的监督微调

Rui Ming, Haoyuan Wu, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) ChatEDA Tech(ChatEDA技术公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 通过策略梯度引导监督微调,单个标记回滚(OTR)在多个基准测试中优于标准SFT,展示了on-policy数据对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 6 篇

2602.02462 2026-02-03 cs.CL cs.AI 81%

Abstract Activation Spaces for Content-Invariant Reasoning in Large Language Models

抽象激活空间用于大语言模型中的内容不变推理

Gabriele Maraia, Marco Valentino, Fabio Massimo Zanzotto, Leonardo Ranaldi

机构 * Human Centric ART, University of Rome Tor Vergata(人类中心ART,罗马大学托尔维加塔分校) ILCC, School of Informatics, University of Edinburgh(ILCC,信息学院,爱丁堡大学) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Almawave S.p.A.(Almawave公司)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种抽象引导推理框架,通过分离结构推理与词法语义,减少语义干扰对形式推理的影响,提升大语言模型的推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00998 2026-02-03 cs.CL 74%

Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning

通过资格推理和面向节段的强化学习可靠地使用引理

Zhikun Xu, Xiaodong Yu, Ben Zhou, Jiang Liu, Jialian Wu, Ze Wang, Ximeng Sun, Hao Chen, Zicheng Liu

机构 * Arizona State University(亚利桑那州立大学) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL

AI总结 通过资格推理和面向节段的强化学习提升LLM在数学引理应用的可靠性与鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09917 2026-02-03 cs.SE 67%

Enhancing LLM-based Specification Generation via Program Slicing and Logical Deletion

通过程序切片和逻辑删除增强基于LLM的规范生成

Zehan Chen, Long Zhang, Zhiwei Zhang, JingJing Zhang, Ruoyu Zhou, Yulong Shen, JianFeng Ma, Lin Yang

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract)

AI总结 SLD-Spec通过程序切片和逻辑删除提升LLM生成规范的准确性和完整性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00337 2026-02-03 cs.DL 67%

Smarter AI Through Prompt Engineering: Insights and Case Studies from Data Science Application

通过提示工程实现更智能的AI:来自数据科学应用的洞察与案例研究

Snehasish Paul, Rohit Kumar, Laxman Das

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文通过提示工程在不同领域的应用案例,展示其提升AI性能的潜力及方法论有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00638 2026-02-03 cs.CL 57%

Formal Semantic Control over Language Models

语言模型的正式语义控制

Yingji Zhang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过VAE框架,探索了在潜在空间中解构语义特征以提升语言模型的可解释性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01291 2026-02-03 cs.LO 50%

Construction-Verification: A Benchmark for Applied Mathematics in Lean 4

构造-验证:Lean 4中的应用数学基准

Bowen Yang, Yi Yuan, Chenyi Li, Ziyu Wang, Liangqi Li, Bo Zhang, Zhe Li, Zaiwen Wen

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出Lean 4中的构造-验证框架,通过AMBER基准评估应用数学领域中显式解决方案合成与验证能力,揭示通用模型在复杂构造任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 14 篇

2602.00087 2026-02-03 cs.LG cs.AI cs.PF cs.PL 84%

ECCO: Evidence-Driven Causal Reasoning for Compiler Optimization

ECCO:基于证据的编译器优化因果推理

Haolin Pan, Lianghong Huang, Jinyuan Dong, Mingjie Xing, Yanjun Wu

机构 * Institute of Software at Chinese Academy of Sciences(中国科学院软件研究所) Hangzhou Institute for Advanced Study at University of Chinese Academy of Sciences(中国科学院大学杭州高等研究 institute) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 ECCO通过结合可解释推理与组合搜索,提升编译器优化性能,实现24.44%的平均周期减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01208 2026-02-03 cs.CL 83%

Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling

Chronos: 学习推理链的时序动态以实现测试时扩展

Kai Zhang, Jiayi Liao, Chengpeng Li, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 Chronos通过学习推理链的时序动态,提升大语言模型在测试时的推理性能,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00015 2026-02-03 cs.CL cs.AI 81%

G-MemLLM: Gated Latent Memory Augmentation for Long-Context Reasoning in Large Language Models

G-MemLLM:基于门控潜在记忆增强的长上下文推理大语言模型

Xun Xu

机构 * Department of Computer Science(计算机科学系) Fudan University(复旦大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 G-MemLLM通过引入门控潜在记忆库,提升大语言模型在长上下文推理中的表现,显著增强多跳推理和关系精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12726 2026-02-03 cs.CL 80%

DESIGNER: Design-Logic-Guided Multidisciplinary Data Synthesis for LLM Reasoning

DESIGNER: 多学科数据合成用于LLM推理的设计逻辑引导

Weize Liu, Yongchi Zhao, Yijia Luo, Mingyu Xu, Jiaheng Liu, Yanan Li, Xiguo Hu, Zhiqi Bai, Yuchi Xu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Nanjing University(南京大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 DESIGNER通过设计逻辑引导生成多学科推理数据集,提升LLM跨学科推理能力。

Comments Accepted to ICLR 2026. Project page: https://attention-is-all-i-need.github.io/Design-Logic-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏