arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

1811.04760 2018-11-13 cs.AI quant-ph 79%

Quantum Reasoning using Lie Algebra for Everyday Life (and AI perhaps...)

Steven Gratton

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.05838 2015-02-23 cs.AI cs.LO 79%

Automated Reasoning for Robot Ethics

Ulrich Furbach, Claudia Schon, Frieder Stolzenburg

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:1411.4823

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10474 2026-07-14 cs.LG cs.AI cs.CE 新提交 79%

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards

具有可验证物理的强化学习:具有连续奖励的训练后语言模型

Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究针对偏微分方程求解器代码生成,引入RLVP强化学习训练后框架,通过混合验证器解决可验证性问题,在多PDE族训练单个策略,优于基线且有零样本改进转移,训练后小LLM表现良好,策略有组合性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05106 2026-06-04 cs.CL cs.AI cs.CY 79%

Arithmetic Pedagogy for Language Models

语言模型的算术教学法

Andhika Bernard Lumbantobing, Hokky Situngkir

机构 * Bandung Fe Institute & Adjunct Science Fellow in InaAI(巴旦格Fe研究所及InaAI兼职科学研究员) AI Research Center IT Del & Bandung Fe Institute(IT Del人工智能研究中心及巴旦格Fe研究所)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 借鉴人类数学教学法,通过将GASING方法操作化为链式思维监督训练小规模GPT-2模型,使其在算术推理上达到高准确率并展现出联想式心算能力。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04465 2026-06-04 cs.CL cs.AI 79%

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

SePO: 用于系统提示优化的自我进化提示智能体

Wangcheng Tao, Han Wu, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SePO方法,通过自我指涉设计让提示智能体同时优化任务智能体和自身的系统提示,采用两阶段进化训练,在多个基准上平均准确率提升4.49%。

Comments 26 pages. Code: https://github.com/taowangcheng/SePO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00915 2026-05-25 cs.LG cs.AI 79%

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

在不完美验证器下基于可验证但含噪声奖励的强化学习

Xin-Qiang Cai, Wei Wang, Feng Liu, Tongliang Liu, Gang Niu, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所AIP) The University of Tokyo(东京大学) The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对不完美验证器引入的假阴性和假阳性噪声,提出后向校正(无偏奖励)和前向校正(梯度方向对齐)两种轻量级方法,在分组相对策略优化中提升数学推理性能,并设计上诉机制在线估计假阴性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14862 2026-04-29 cs.CL cs.AI 79%

Schema Key Wording as an Instruction Channel in Structured Generation under Constrained Decoding

模式键作为在受限解码下的指令通道在结构生成中的应用

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在受限解码中模式键作为隐式指令通道的作用,提出结构生成是多通道指令问题,并通过实验展示模式键词汇对准确性的影响,揭示了不同模型对不同通道的依赖性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08483 2026-04-17 cs.CL cs.AI 79%

DeepPrune: Parallel Scaling without Inter-trace Redundancy

DeepPrune: 无需跨轨迹冗余的并行扩展

Shangqing Tu, Yaxuan Li, Yushi Bai, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeepPrune框架,通过动态剪枝解决并行推理中的冗余问题,实现65.73%-88.50%的token减少,保持高精度。

Comments Accepted by ACL 2026 Findings, please check out the project page: https://deepprune.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15402 2026-03-17 cs.CL cs.AI 79%

A Closer Look into LLMs for Table Understanding

深入探究用于表格理解的大型语言模型

Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过研究16种LLM,探讨其理解表格数据和执行下游任务的机制,发现注意力动态、有效层数、专家激活及输入设计影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06619 2026-03-10 cs.LG cs.AI 79%

Not all tokens are needed(NAT): token efficient reinforcement learning

并非所有标记都必要(NAT):标记效率强化学习

Hejian Sang, Yuanda Xu, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 NAT通过局部标记采样提升RL效率,使用50%标记实现与完整标记相同性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14280 2026-01-22 cs.CL cs.AI 79%

Hallucination-Free Automatic Question & Answer Generation for Intuitive Learning

无幻觉的自动问答生成用于直观学习

Nicholas X. Wang, Aggelos K. Katsaggelos

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无幻觉的多代理生成框架,通过结构化协作减少教育内容中的幻觉,提升问答生成的准确性与教育价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23367 2026-01-09 cs.LG cs.AI 79%

Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2

在Atlas A2上对OpenPangu模型进行训练后量化以实现高效部署

Yilun Luo, Huaqing Zheng, Haoqian Meng, Wenyuan Liu, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在Atlas A2上通过低比特量化提升OpenPangu模型的推理效率,实现高效CoT推理并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13007 2025-11-18 cs.AI cs.LG 79%

GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs

Yiyang Zhao, Huiyu Bai, Xuejiao Zhao

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted by AAAI 2026-AIA and designated as an oral presentation paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17612 2025-11-06 cs.CL cs.AI 79%

Distilling LLM Agent into Small Models with Retrieval and Code Tools

Minki Kang, Jongwon Jeong, Seanie Lee, Jaewoong Cho, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) KRAFTON(KRAFTON公司)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16421 2025-10-10 cs.CL cs.LG 79%

WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning

Zhepei Wei, Wenlin Yao, Yao Liu, Weizhi Zhang, Qin Lu, Liang Qiu, Changlong Yu, Puyang Xu, Chao Zhang, Bing Yin, Hyokun Yun, Lihong Li

机构 * University of Virginia(弗吉尼亚大学) Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025. Code: https://github.com/weizhepei/WebAgent-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08550 2025-09-23 cs.CL cs.AI 79%

No Need for Explanations: LLMs can implicitly learn from mistakes in-context

Lisa Alazraki, Maximilian Mozes, Jon Ander Campos, Tan Yi-Chern, Marek Rei, Max Bartolo

机构 * Imperial College London(伦敦帝国学院) Cohere

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15729 2025-09-10 cs.AI cs.CL cs.PL 79%

How Do Humans Write Code? Large Models Do It the Same Way Too

Long Li, Xuzheng He, Haozhe Wang, Linlin Wang, Liang He

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15969 2025-08-26 cs.CV cs.AI cs.CL 79%

Forgotten Polygons: Multimodal Large Language Models are Shape-Blind

William Rudman, Michal Golovanevsky, Amir Bar, Vedant Palit, Yann LeCun, Carsten Eickhoff, Ritambhara Singh

机构 * Brown University(布朗大学) Tel Aviv University(特拉维夫大学) IIT Kharagpur(印度理工学院卡里帕尔分校) New York University(纽约大学) University of Tübingen(图宾根大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12379 2025-07-17 cs.CL cs.AI 79%

Probing for Arithmetic Errors in Language Models

Yucheng Sun, Alessandro Stolfo, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07498 2025-07-15 cs.CL cs.LG 79%

Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code

Keqin Bao, Nuo Chen, Xiaoyuan Li, Binyuan Hui, Bowen Yu, Fuli Feng, Xiangnan He, Dayiheng Liu

专题命中 数学推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14963 2025-03-28 cs.CL cs.AI 79%

Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems

Qihuang Zhong, Kang Wang, Ziyang Xu, Juhua Liu, Liang Ding, Bo Du

机构 * Wuhan University(武汉大学) University of Sydney(悉尼大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: { 10.1007/s11704-025-41102-z }

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20339 2025-02-28 cs.CL cs.AI 79%

Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners

Daniele Paliotta, Junxiong Wang, Matteo Pagliardini, Kevin Y. Li, Aviv Bick, J. Zico Kolter, Albert Gu, François Fleuret, Tri Dao

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12853 2025-02-19 cs.CL cs.LG 79%

S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning

Ruotian Ma, Peisong Wang, Cheng Liu, Xingyan Liu, Jiaqi Chen, Bang Zhang, Xin Zhou, Nan Du, Jia Li

机构 * Tencent(腾讯) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 数学推理 :reasoning(abstract);CoT(abstract);self-correction(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19113 2024-12-30 cs.CL cs.DB cs.LG 79%

SketchFill: Sketch-Guided Code Generation for Imputing Derived Missing Values

Yunfan Zhang, Changlun Li, Yuyu Luo, Nan Tang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13697 2024-09-24 cs.CL cs.AI 79%

Prompt Baking

Aman Bhargava, Cameron Witkowski, Alexander Detkov, Matt Thomson

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11319 2024-08-27 cs.CL cs.AI 79%

SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding

Yazhou Zhang, Chunwang Zou, Zheng Lian, Prayag Tiwari, Jing Qin

专题命中 数学推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06979 2024-07-31 cs.LG cs.CL 79%

Auto-Regressive Next-Token Predictors are Universal Learners

Eran Malach

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14681 2024-02-22 cs.LG cs.AI 79%

Are Human-generated Demonstrations Necessary for In-context Learning?

Rui Li, Guoyin Wang, Jiwei Li

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15408 2023-12-27 cs.LG cs.CC cs.CL stat.ML 79%

Towards Revealing the Mystery behind Chain of Thought: A Theoretical Perspective

Guhao Feng, Bohang Zhang, Yuntian Gu, Haotian Ye, Di He, Liwei Wang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments 42 pages; Camera-ready version for NeurIPS 2023 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09561 2023-10-20 cs.AI cs.CL 79%

Large Language Models are Better Reasoners with Self-Verification

Yixuan Weng, Minjun Zhu, Fei Xia, Bin Li, Shizhu He, Shengping Liu, Bin Sun, Kang Liu, Jun Zhao

专题命中 数学推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments Accept in EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏