arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2510.13501 2025-10-16 cs.AI 77%

Confidence as a Reward: Transforming LLMs into Reward Models

He Du, Bowen Li, Chengxing Xie, Chang Gao, Kai Chen, Dacheng Tao

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09369 2025-10-13 cs.CL 77%

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood

Xingyu Lin, Yilin Wen, En Wang, Du Su, Wenbin Liu, Chenfu Bao, Zhonghou Lv

机构 * Baidu Inc(百度公司) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(吉林大学教育部符号计算与知识工程重点实验室) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07486 2025-10-10 cs.CL 77%

AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding

Shuqing Luo, Yilin Guan, Pingzhi Li, Hanrui Wang, Tianlong Chen

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校) Johns Hopkins University(约翰霍普金斯大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 14 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24884 2025-09-30 cs.CL 77%

Expanding Computation Spaces of LLMs at Inference Time

Yoonna Jang, Kisu Yang, Isabelle Augenstein

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24460 2025-09-30 cs.AI 77%

ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling

Haotian Zhang, Liu Liu, Baosheng Yu, Jiayan Qiu, Likang Xiao, Yanwei Ren, Quan Chen, Xianglong Liu

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Hangzhou International Innovation Institute, Beihang University(北航杭州国际创新研究院) Nanyang Technological University(南洋理工大学) University of Leicester(莱斯特大学) Kuaishou Technology(快手科技)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20016 2025-09-29 cs.CL 77%

Vulnerability of LLMs to Vertically Aligned Text Manipulations

Zhecheng Li, Yiwei Wang, Bryan Hooi, Yujun Cai, Zhen Xiong, Nanyun Peng, Kai-wei Chang

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of California, Los Angeles(加州大学洛杉矶分校) The University of Queensland(昆士兰大学) National University of Singapore(新加坡国立大学) University of Southern California(南加州大学) University of California, Merced(加州大学默塞德分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06949 2025-09-09 cs.CL 77%

Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models

Yinjie Wang, Ling Yang, Bowen Li, Ye Tian, Ke Shen, Mengdi Wang

专题命中 数学推理 :reasoning(abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL

Comments Code and Models: https://github.com/Gen-Verse/dLLM-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04755 2025-08-08 cs.LG cs.CE 77%

Are Large Language Models Dynamic Treatment Planners? An In Silico Study from a Prior Knowledge Injection Angle

Zhiyao Luo, Tingting Zhu

机构 * Department of Engineering Science University of Oxford(工程科学系牛津大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18013 2025-07-30 cs.CL 77%

Technical Report of TeleChat2, TeleChat2.5 and T1

Zihan Wang, Xinzhang Liu, Yitong Yao, Chao Wang, Yu Zhao, Zhihao Yang, Wenmin Deng, Kaipeng Jia, Jiaxin Peng, Yuyao Huang, Sishi Xiong, Zhuo Jiang, Kaidong Yu, Xiaohui Hu, Fubei Yao, Ruiyu Fang, Zhuoru Jiang, Ruiting Song, Qiyi Xie, Rui Xue, Xuewei He, Yanlei Xue, Zhu Yuan, Zhaoxi Zhang, Zilu Huang, Shiquan Wang, Xin Wang, Hanming Wu, Mingyuan Wang, Xufeng Zhan, Yuhan Sun, Zhaohu Xing, Yuhao Jiang, Bingkai Yang, Shuangyong Song, Yongxiang Li, Zhongjiang He, Xuelong Li

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04625 2025-03-10 cs.CL 77%

START: Self-taught Reasoner with Tools

Chengpeng Li, Mingfeng Xue, Zhenru Zhang, Jiaxi Yang, Beichen Zhang, Xiang Wang, Bowen Yu, Binyuan Hui, Junyang Lin, Dayiheng Liu

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 38 pages, 5 figures and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16040 2025-02-25 cs.IR cs.CL 77%

Inference Computation Scaling for Feature Augmentation in Recommendation Systems

Weihao Liu, Zhaocheng Du, Haiyuan Zhao, Wenbo Zhang, Xiaoyan Zhao, Gang Wang, Zhenhua Dong, Jun Xu

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04057 2025-02-12 cs.CL 77%

Self-Harmonized Chain of Thought

Ziqi Jin, Wei Lu

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12393 2024-09-20 cs.CL 77%

Small Language Models are Equation Reasoners

Bumjun Kim, Kunha Lee, Juyeon Kim, Sangam Lee

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17349 2024-07-25 cs.CL 77%

Boosting Large Language Models with Socratic Method for Conversational Mathematics Teaching

Yuyang Ding, Hanglei Hu, Jie Zhou, Qin Chen, Bo Jiang, Liang He

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL

Comments Accepted By CIKM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12744 2024-03-20 cs.CL 77%

Instructing Large Language Models to Identify and Ignore Irrelevant Conditions

Zhenyu Wu, Chao Shen, Meng Jiang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments NAACL 2024 - Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06867 2023-12-13 cs.CL 77%

Get an A in Math: Progressive Rectification Prompting

Zhenyu Wu, Meng Jiang, Chao Shen

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments AAAI 2024 - Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14999 2023-11-03 cs.CL 77%

The Art of SOCRATIC QUESTIONING: Recursive Thinking with Large Language Models

Jingyuan Qi, Zhiyang Xu, Ying Shen, Minqian Liu, Di Jin, Qifan Wang, Lifu Huang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments ACL 2023 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05653 2023-10-04 cs.CL 77%

MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning

Xiang Yue, Xingwei Qu, Ge Zhang, Yao Fu, Wenhao Huang, Huan Sun, Yu Su, Wenhu Chen

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Work in progress; Xiang Yue and Wenhu Chen contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05077 2026-02-26 cs.CL cs.AI 76%

Slm-mux: Orchestrating small language models for reasoning

Slm-mux: 通过协调小型语言模型进行推理

Chenyu Wang, Zishen Wan, Hao Kang, Emma Chen, Zhiqiang Xie, Tushar Krishna, Vijay Janapa Reddi, Yilun Du

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 SLM-MUX通过协调多个小型语言模型提升推理准确性,实现比单个模型更高的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15260 2026-02-18 cs.LG cs.AI 76%

Fast and Effective On-policy Distillation from Reasoning Prefixes

基于推理前缀的高效在线策略蒸馏

Dongxu Zhang, Zhichao Yang, Sepehr Janghorbani, Jun Han, Andrew Ressler, Qian Qian, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于推理前缀的在线策略蒸馏方法,通过仅对生成输出的前缀应用蒸馏目标并提前终止采样,有效降低训练成本,同时保持与完整OPD相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18702 2026-02-17 cs.LG cs.AI cs.AR 76%

From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic

从模糊到精确:通过有理算术的Halo架构实现无限深度推理

Hansheng Ren

机构 * Hansheng Ren(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。

Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07412 2024-04-10 cs.CL cs.LG 76%

Advancing Regular Language Reasoning in Linear Recurrent Neural Networks

Ting-Han Fan, Ta-Chung Chi, Alexander I. Rudnicky

专题命中 数学推理 :reasoning(title);分类 cs.CL、cs.LG

Comments Accepted at the 2024 Annual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL 2024). The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
1211.7012 2021-12-03 cs.AI cs.DL cs.LG cs.LO 76%

Learning-Assisted Automated Reasoning with Flyspeck

Cezary Kaliszyk, Josef Urban

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

Journal ref J. Automated Reasoninig 54(1): 99, 2014

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13607 2026-08-17 cs.AI cs.CL cs.LG 新提交 75%

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

没有通用信号可预测版本更新下的样本级大语言模型退化

Jia Sheng, Yiwei Lu

机构 * University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10123 2026-07-14 cs.LG cs.AI cs.CL 版本更新 75%

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

Nested-ReFT:通过离策略展开实现大语言模型微调的高效强化学习

Maxime Heuillet, Yufei Cui, Boxing Chen, Audrey Durand, Prasanna Parthasarathi

机构 * Mila - Québec AI Institute, Canada(魁北克人工智能研究所) Huawei Noah's Ark Lab (Montreal Research Center), Canada(华为诺亚实验室(蒙特利尔研究中心)) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型在数学推理等领域的高级推理难题,提出Nested-ReFT框架,利用离策略展开及动态层跳过降低训练推理成本,经理论与实证分析验证其有效性,还探索偏差缓解变体以维持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02510 2026-07-03 cs.AI cs.CL cs.LG stat.AP stat.ML 新提交 75%

Online Safety Monitoring for LLMs

LLMs的在线安全监控

Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。

Comments ICML 2026 Hypothesis Testing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新 75%

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15327 2026-06-09 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Prescriptive Scaling Reveals the Evolution of Language Model Capabilities

规范性缩放揭示语言模型能力的演变

Hanlin Zhang, Jikai Jin, Vasilis Syrgkanis, Sham Kakade

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。

Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01167 2026-06-02 cs.LG cs.AI cs.CL 75%

Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards

同时多目标对齐:可验证与不可验证奖励

Yiran Shen, Yu Xia, Jonathan Chang, Prithviraj Ammanabrolu

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MAHALO框架,通过标准化PRM训练、多动作头DPO和PRM引导解码,实现大语言模型在可验证与不可验证奖励上的多目标对齐,减少目标冲突并支持推理时控制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10201 2026-05-26 cs.LG cs.AI cs.CL 75%

Future-KL Regularized GRPO: Process-Level Credit Assignment from $f$-Divergence Regularization

未来KL正则化GRPO:基于f-散度正则化的过程级信用分配

Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出未来KL正则化策略优化(FRPO),通过因果未来正则化回报修正GRPO中局部KL损失缺失的梯度信号,在数学推理任务中提升pass@16并保持更高熵和更低策略漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏