arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3227 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3227 篇

2604.13062 2026-04-16 cs.CL 79%

Mathematical Reasoning Enhanced LLM for Formula Derivation: A Case Study on Fiber NLI Modellin

增强数学推理的LLM用于公式推导:光纤非线性干扰建模的案例研究

Yao Zhang, Yuchen Song, Xiao Luo, Shengnan Li, Xiaotian Jiang, Min Zhang, Danshi Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种增强数学推理的生成AI方法,用于光学通信公式推导,聚焦光纤非线性干扰建模,通过结构化提示引导LLM推导出已知闭式ISRS GN表达式并推导出适用于多段C和C+L波段传输的新近似式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06695 2026-04-09 cs.AI 79%

Reasoning Fails Where Step Flow Breaks

推理在步骤流断裂处失效

Xiaoyu Xu, Yulan Pan, Xiaosong Yuan, Zhihong Shen, Minghao Su, Yuanhao Su, Xiaofeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fuzhou University(福州大学) Jilin University(吉林大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究提出StepFlow方法,通过修复信息流提升多步骤数学、科学和编码任务的推理准确性,揭示了浅层锁定和深层衰减两种信息流失效模式。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01591 2026-04-08 cs.AI 79%

ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement

ThinkTwice:联合优化大型语言模型以进行推理和自我完善

Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Coolwei AI Lab(Coolwei AI实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ThinkTwice通过两阶段框架联合优化LLM,提升推理和自我完善性能,基于GRPO方法,在多个数学推理基准上优于现有基线。

Comments 27 pages,7 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03664 2026-04-07 cs.CL 79%

Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports

跨单表和多表的财务报告中数字推理

Yi-Cheng Wang, Wei-An Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学资讯工程学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出FinLongDocQA数据集,解决长文档中跨表数字推理问题,发现LLM在长文本中定位和多步计算时存在瓶颈,提出FinLongDocAgent多智能体方法提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03506 2026-04-07 cs.AI 79%

BioAlchemy: Distilling Biological Literature into Reasoning-Ready Reinforcement Learning Training Data

生物炼金术:将生物文献提炼为可用于强化学习训练的数据

Brian Hsu, Ozan Gökdemir, Carlo Siebenschuh, Bruce Parrello, Neil Getty, Thomas S. Brettin, Rick L. Stevens, Ian T. Foster, Nicholas Chia, Arvind Ramanathan

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BioAlchemy方法,通过提炼生物文献生成高质量训练数据,提升生物领域推理性能,最终在生物基准测试中实现9.12%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05144 2026-04-02 cs.AI 79%

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models

提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型

Shuliang Liu, Xingyu Li, Hongyi Liu, Dong Fang, Yibo Yan, Bingchen Duan, Qi Zheng, Lingfeng Su, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ReasonMark,一种专为推理密集型LLM设计的水印框架,通过分离生成过程为无干扰的思维阶段和水印标注的答案阶段,利用关键性评分提取语义关键标记,提升水印鲁棒性与推理质量。

Comments 31 pages, Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25419 2026-03-27 cs.CL 79%

TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning

TAPO:多语言数学推理中的翻译增强策略优化

Xu Huang, Zhejian Lai, Zixian Huang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TAPO通过引入翻译增强策略优化框架,提升多语言数学推理能力,有效结合语言理解和推理能力,优于基线方法并在未见语言和领域任务中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI 79%

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15340 2026-03-24 cs.LG 79%

SSR: Speculative Parallel Scaling Reasoning in Test-time

SSR:测试时的推测并行扩展推理

Yuanlin Chu, Bo Wang, Xiang Liu, Hong Chen, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 SSR提出一种无需训练的框架,通过引入分步推测解码加速推理而不牺牲正确性,提升数学推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16060 2026-03-20 cs.AI 79%

ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning

ARISE: 在分层强化学习中通过内在技能进化实现智能体推理

Yu Li, Rui Miao, Zhengling Qi, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Mathematical Sciences, University of Texas at Dallas(德克萨斯大学达拉斯分校数学科学系) School of Business, George Washington University(乔治华盛顿大学商学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ARISE提出一种分层强化学习框架,通过共享策略管理高阶技能和生成低阶响应,提升数学推理能力,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14041 2026-03-17 cs.AI 79%

GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models

GRPO与反思奖励在大语言模型数学推理中的应用

Zhijie Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出GRPO与反思奖励机制相结合的四阶段框架,提升大语言模型的自我反思能力,通过实验验证其在数学推理中的优越性。

Journal ref Applied and Computational Engineering 154 161-166 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00410 2026-03-17 cs.LG 79%

Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models

共奖励:用于大型语言模型中激发推理的稳定自监督强化学习

Zizhuo Zhang, Jianing Zhu, Xinmu Ge, Zihua Zhao, Zhanke Zhou, Xuan Li, Xiao Feng, Jiangchao Yao, Bo Han

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Co-rewarding框架,通过引入互补监督提升训练稳定性,通过对比一致性和模型蒸馏方法,在多个数学推理基准上实现性能提升,尤其在Llama-3.2-3B-Instruct上表现突出。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11193 2026-03-13 cs.CL 79%

DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning

DeReason: 一种考虑难度的课程改进了解耦的SFT-然后-RL训练以促进一般推理

Hanxu Hu, Yuxuan Wang, Maggie Huan, Jannis Vamvas, Yinya Huang, Zhijiang Guo, Rico Sennrich

机构 * University of Zurich(苏黎世大学) University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 DeReason通过基于难度的数据解耦策略,优化SFT与RL的训练分配,提升一般推理能力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00997 2026-03-12 cs.AI 79%

IndiMathBench: Autoformalizing Mathematical Reasoning Problems with a Human Touch

IndiMathBench: 用人类触感实现数学推理问题的自动形式化

Param Biyani, Shashank Kirtania, Yasharth Bajpai, Sumit Gulwani, Ashish Tiwari

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 IndiMathBench通过人机协作管道形式化数学问题,提供具有挑战性的数学推理测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08743 2026-03-11 cs.DC cs.AI 79%

Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention

Zipage: 通过压缩分页注意力维持大语言模型推理的高请求并发性

Mengqi Liao, Lu Wang, Chaoyun Zhang, Bo Qiao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Huaiyu Wan

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Zipage通过压缩分页注意力技术,在维持高并发的同时实现接近全KV推理性能的高效大语言模型推理

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05357 2026-03-06 cs.CL 79%

DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning

DiSCTT: 基于共识的自我课程学习用于推理中的高效测试时适应

Mohammad Mahdi Moradi, Sudhir Mudur

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 DiSCTT通过动态分配测试时优化策略,提升推理模型在异质问题上的适应效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05120 2026-03-06 cs.AI 79%

Bidirectional Curriculum Generation: A Multi-Agent Framework for Data-Efficient Mathematical Reasoning

双向课程生成:一种用于数据高效数学推理的多智能体框架

Boren Hu, Xiao Liu, Boci Peng, Xinping Zhao, Xiaoran Shang, Yun Zhu, Lijun Wu

机构 * Zhejiang University(浙江大学) University of Macau(澳门大学) Peking University(北京大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Wuhan University(武汉大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出双向课程生成框架,通过多智能体系统动态生成数据以提升数学推理效率,优化学习轨迹并减少训练样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02504 2026-03-05 cs.AI 79%

NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect

NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调

Pratibha Zunjare, Michael Hsiao

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01641 2026-03-03 cs.AI 79%

Learning Structured Reasoning via Tractable Trajectory Control

通过可计算的轨迹控制学习结构化推理

Po-Nien Kung, Zhen Yang, Jeffrey Luo, Cheng-Fu Yang, Haikang Deng, Zi-Yi Dou, Yinfei Yang, Nanyun Peng, Zhe Gan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Apple(苹果公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Ctrl-R通过可计算的轨迹控制学习结构化推理,提升复杂问题解决的多样化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02339 2026-03-03 cs.CL 79%

AStar: Boosting Multimodal Reasoning with Automated Structured Thinking

AStar: 通过自动化结构化思维提升多模态推理

Jinyang Wu, Mingkuan Feng, Guocheng Zhai, Shuai Zhang, Zheng Lian, Fangrui Lv, Pengpeng Shao, Ruihan Jin, Zhengqi Wen, Jianhua Tao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 AStar通过自动化结构化思维提升多模态推理效率,实现更高准确率和更强迁移能力。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22193 2026-02-26 cs.CL 79%

Improving Parametric Knowledge Access in Reasoning Language Models

提升推理语言模型的参数知识访问能力

Melody Ma, John Hewitt

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过强化学习训练,提升推理语言模型在参数知识访问上的能力,改进知识回忆和问答任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20904 2026-02-25 cs.LG 79%

Transcoder Adapters for Reasoning-Model Diffing

推理模型差分的转码适配器

Nathan Hu, Jake Ward, Thomas Icard, Christopher Potts

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 转码适配器用于分析推理模型微调前后的差异,揭示了推理训练对模型内部机制的影响,并展示了适配器在恢复推理准确性方面的有效性。

Comments 9 pages main, 27 pages total, 10 figures. Code and visualizations at https://transcoder-adapters.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01874 2026-02-25 cs.CV cs.AI 79%

CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving

CogFlow:通过知识内化连接感知与推理以解决视觉数学问题

Shuhang Chen, Yunqiu Xu, Junjie Xie, Aojun Lu, Tao Feng, Zeying Huang, Ning Zhang, Yi Sun, Yi Yang, Hangjie Yuan

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CogFlow通过知识内化连接感知与推理,提升视觉数学问题解决能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18568 2026-02-25 cs.AR cs.AI 79%

RPU -- A Reasoning Processing Unit

RPU -- 一种推理处理单元

Matthew Adiletta, Gu-Yeon Wei, David Brooks

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RPU通过优化内存带宽和架构设计,显著提升了大型语言模型推理的性能和效率。

Comments To Appear in HPCA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20132 2026-02-24 cs.LG 79%

LAD: Learning Advantage Distribution for Reasoning

LAD: 为推理学习优势分布

Wendi Li, Sharon Li

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 LAD通过学习优势分布提升大型模型推理的多样性和准确性,无需额外训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24183 2026-02-24 cs.LG cs.AR cs.PL 79%

QiMeng-CodeV-R1: Reasoning-Enhanced Verilog Generation

QiMeng-CodeV-R1: 基于推理增强的Verilog生成

Yaoyu Zhu, Di Huang, Hanqi Lyu, Xiaoyun Zhang, Chongxiao Li, Wenxuan Shi, Yutong Wu, Jianan Mu, Jinghua Wang, Yang Zhao, Pengwei Jin, Shuyao Cheng, Shengwen Liang, Xishan Zhang, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 QiMeng-CodeV-R1通过改进的RLVR框架,实现了基于推理增强的Verilog生成,提升了硬件描述语言生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20426 2026-02-17 cs.AI 79%

RV-Syn: Rational and Verifiable Mathematical Reasoning Data Synthesis based on Structured Function Library

RV-Syn: 基于结构化函数库的理性且可验证的数学推理数据合成

Jiapeng Wang, Jinhao Jiang, Zhiqiang Zhang, Jun Zhou, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Ant Group(蚂蚁集团) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RV-Syn通过结构化函数库生成可验证的数学推理数据,提升数据质量和生成效率。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11639 2026-02-13 cs.CL 79%

PACE: Prefix-Protected and Difficulty-Aware Compression for Efficient Reasoning

PACE: 用于高效推理的前缀保护和难度感知压缩

Ruixiang Feng, Yuntao Wen, Silin Zhou, Ke Shi, Yifan Wang, Ran Le, Zhenwei An, Zongchao Chen, Chen Yang, Guangyue Peng, Yiming Jia, Dongsheng Wang, Tao Zhang, Lisi Chen, Yang Song, Shen Gao, Shuo Shang

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanbeige Lab, BOSS Zhipin(纳米贝实验室,BOSS智联) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 PACE通过双层框架实现前缀保护和难度感知压缩,有效减少token使用并提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11175 2026-02-13 cs.CL 79%

Barriers to Discrete Reasoning with Transformers: A Survey Across Depth, Exactness, and Bandwidth

Transformer在离散推理中的障碍:深度、精确性与带宽的跨领域综述

Michelle Yuan, Weiyi Sun, Amir H. Rezaeian, Jyotika Singh, Sandip Ghoshal, Yao-Ting Wang, Miguel Ballesteros, Yassine Benajiba

机构 * Oracle AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文综述了Transformer在离散推理任务中的理论限制,从电路复杂度、近似理论和通信复杂度三个角度分析了深度、精确性和带宽等障碍,并探讨了模型设计的改进方向。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08554 2026-02-12 cs.LG stat.ML 79%

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

通过群体扩散策略优化提升扩散语言模型的推理能力

Kevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Molei Tao, Wei Deng

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Research, Morgan Stanley(摩根士丹利机器学习研究部)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出GDPO算法,通过减少ELBO估计的方差提升扩散语言模型的推理能力,实验证明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏