arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3227 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3227 篇

2511.19078 2026-05-19 cs.CL cs.AI 81%

GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning

GraphMind: 一种基于动态GNN的定理选择与结论生成框架用于LLM推理

Yutong Li, Yitian Zhou, Xudong Wang, GuoChen, Caiyan Qin

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GraphMind通过动态图神经网络与LLM结合,实现多步推理中的定理选择和结论生成,提升上下文感知的推理能力。

Comments This paper has been withdrawn by the authors in order to prepare a substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01683 2026-05-19 cs.CL cs.AI 81%

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

手术式后训练:用于知识保留的近端策略蒸馏

Wenye Lin, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPOT框架,通过近端策略蒸馏在后训练中保留知识,提升推理性能,实验表明其在少量数据下显著提升模型准确率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04265 2026-05-15 cs.LG cs.AI 81%

Boosting LLM Reasoning via Human-Inspired Reward Shaping

通过人类启发的奖励塑造提升大语言模型推理能力

Wenze Lin, Zhen Yang, Xitai Jiang, Xiaoteng Ma, Gao Huang

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Mind Lab

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10931 2026-05-14 cs.LG cs.CL 81%

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

异步推理:无需训练的交互式思考LLM

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi, Vyacheslav Zhdanovskiy, Denis Kuznedelev, Alina Shutova, Max Ryabinin

机构 * Yandex HSE University(俄罗斯高等经济大学) The University of Tokyo(东京大学) MATS Together AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13301 2026-05-14 cs.AI cs.CL 81%

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

通过简单统一的扩展实现金牌级竞赛推理

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种简单统一的方法,将训练好的推理模型扩展为金牌级竞赛解题器,通过反熵课程和两级强化学习提升证明搜索能力,最终在数学和物理竞赛中取得金牌水平表现。

Comments Technical Report. 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10805 2026-05-12 cs.AI cs.CL stat.ML 81%

Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

推理并非免费:面向LLM-as-a-Judge的鲁棒自适应成本高效路由

Wenbo Zhang, Lijinghua Zhang, Liner Xiang, Hengrui Cai

机构 * Department of Statistics, University of California, Irvine, USA(加州大学伊维特分校统计学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比推理与非推理法官,发现推理在结构验证任务中提升准确性,但成本高。提出RACER方法,通过分布鲁棒优化动态选择推理或非推理法官,实现成本效率的最优平衡。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01698 2026-05-12 cs.CL cs.LG 81%

Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models

训练后探索恢复:大型推理模型的潜在探索解码

Wenhui Tan, Fiorenzo Parascandolo, Enver Sangineto, Jianzhong Ju, Zhenbo Luo, Qian Cao, Rita Cucchiara, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司北京MiLM Plus团队) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米莉亚大学) University of Pisa, Italy(比萨大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent Exploration Decoding方法,通过累积中间后验并选择熵最大配置来提升推理模型的pass@1和pass@16准确率,同时增强强化学习中的探索能力。

Comments Project Page: https://github.com/AlbertTan404/LED

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09496 2026-05-12 cs.CL cs.LG 81%

Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models

超越语言:大型语言模型中的格式无关推理子空间

Aojie Yuan, Zhiyuan Su

机构 * University of Southern California(南加州大学) Duke University(杜克大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大型语言模型中存在格式无关推理子空间(FARS),通过TriForm基准测试发现,FARS能增强概念结构并抑制形式信息,且在不同架构中表现一致,支持柏拉图表示假设。

Comments Preprint. 13 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL 81%

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04078 2026-05-12 cs.LG cs.AI 81%

Validity-Calibrated Reasoning Distillation

有效性校准的推理蒸馏

Khouloud Saadi, Di Wang

机构 * Department of Computer Science(计算机科学系) KAUST(科威特大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出有效性校准的推理蒸馏框架,通过动态监督机制优化学习信号分配,提升数学推理、代码生成和指令遵循任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08221 2026-05-12 cs.LG cs.AI 81%

NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning

NoisyCoconut:通过潜在空间推理实现反事实共识

Michael Jerge, David Evans

机构 * University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 NoisyCoconut通过在潜在空间中注入可控噪声生成多样化推理路径,利用路径一致性的置信度信号提升大语言模型可靠性,无需重新训练即可在多个推理基准中实现有效的覆盖-准确率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 81%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07137 2026-05-11 cs.LG cs.AI 81%

Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

自适应负强化用于大语言模型推理:在强化学习中动态平衡纠正与多样性

Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布希·尼尔马伊技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应负强化方法,通过时间依赖调度函数动态平衡纠正与多样性,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06188 2026-05-08 cs.AI cs.CL 81%

OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models

OPSD 压缩 RLVR 教授的内容:一种为推理模型设计的后 RL 压缩阶段

Jaehoon Kim, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OPSD 在数学推理中作为压缩机制更可靠,通过仅训练正确轨迹可保持准确性并显著缩短响应,而训练错误轨迹则损害准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG 81%

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04065 2026-05-08 cs.CL cs.ET cs.LG 81%

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11504 2026-04-28 cs.LG cs.CL 81%

LongFlow: Efficient KV Cache Compression for Reasoning Models

LongFlow:用于推理模型的高效KV缓存压缩

Yi Su, Zhenxu Tian, Dan Qiao, Yuechi Zhou, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University, China(苏州大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 LongFlow通过高效的重要性估计指标实现KV缓存压缩,减少内存消耗和带宽压力,提升推理模型的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13262 2026-04-28 cs.AI cs.CL 81%

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning

CURE-MED:基于课程的强化学习用于多语言医学推理

Eric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Technology Patna(印度理工学院帕纳布分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) MBZUAI(中东技术研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CURE-MED框架,通过课程引导的强化学习提升多语言医学推理的逻辑正确性和语言稳定性,实验表明在13种语言上均优于基线模型,实现了高一致性与高正确率。

Comments Accepted at ACL 2026, main conference, oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21935 2026-04-27 cs.AI cs.LG 81%

Math Takes Two: A test for emergent mathematical reasoning in communication

数学需要两个:一种评估交流中涌现数学推理的测试

Michael Cooper, Samuel Cooper

机构 * Cooper Cognitive(Cooper认知)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Math Takes Two基准测试,通过两个无先验数学知识的智能体交流,评估模型在视觉任务中通过发现潜在结构来发展抽象概念的能力。

Comments Accepted at HCAIR workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20659 2026-04-23 cs.LG cs.AI 81%

GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

GRPO-VPS:通过可验证的过程监督增强组相对策略优化以实现有效的推理

Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GRPO-VPS,通过在推理轨迹中探测模型对正确答案的信心,改进GRPO的轨迹级反馈,实现更精准高效的策略更新,实验显示在数学和通用领域任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18897 2026-04-22 cs.CL cs.LG 81%

Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning

少即是多:在大语言模型数学推理中的认知负荷与单提示天花板

Manuel Israel Cazares

机构 * Bytepro AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示工程在形式数学推理中的效果,发现单提示存在性能上限,通过分析发现数学不可判定性、复杂规则系统及提示顺序影响是限制因素,最佳提交在硬性任务中达到79.25%的准确率。

Comments Companion repository: https://github.com/israelcazares/sair-prompt-engineering | Zenodo DOI: 10.5281/zenodo.19598433 | v15: final Contributor Network data (n=52, competition close April 20, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI 81%

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12632 2026-04-15 cs.LG cs.AI 81%

Calibration-Aware Policy Optimization for Reasoning LLMs

面向推理大语言模型的校准感知策略优化

Ziqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与复杂系统决策智能国家实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAPO方法,通过引入logistic AUC替代损失和噪声掩码机制,提升推理大语言模型的校准与准确性,实验显示其在多个数学推理基准上校准提升达15%,并在下游任务中进一步提升准确性。

Comments Published as a conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12229 2026-04-15 cs.AI cs.CL 81%

HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models

HintMR:在小型语言模型中激发更强的数学推理

Jawad Hossain, Xiangyu Guo, Jiawei Zhou, Chong Liu

机构 * University at Albany(阿尔巴尼大学) University at Buffalo(布法罗大学) Stony Brook University(石溪大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HintMR框架,通过提示辅助引导小型语言模型进行多步数学问题解决,通过协作的双模型系统提升推理准确性,实验表明在多种数学基准上显著提升性能。

Comments 15 pages, 5 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11188 2026-04-14 cs.CL cs.AI 81%

MathAgent: Adversarial Evolution of Constraint Graphs for Mathematical Reasoning Data Synthesis

MathAgent: 基于约束图的对抗进化用于数学推理数据合成

Zixiong Yu, Jun Rao, Guhan Chen, Songtao Tian, Bohan Li, Jiansheng Wei, Min Zhang, Xiaojun Meng

机构 * Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kyoto University(京都大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MathAgent框架,通过约束图的对抗进化生成高质量数学推理数据,提升模型在八个数学基准上的泛化能力。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28204 2026-04-06 cs.LG cs.AI 81%

ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models

ERPO:基于熵调节的策略优化用于大推理模型

Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang

机构 * School of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ERPO通过引入熵感知门控、桶式隐式归一化和结果锚定优势合成,解决大语言模型中因统一优势信号导致的探索不足问题,提升推理准确性和路径简洁性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22871 2026-03-25 cs.AI cs.LG math.DS 81%

Dynamical Systems Theory Behind a Hierarchical Reasoning Model

层次推理模型背后的动力系统理论

Vasiliy A. Es'kin, Mikhail E. Smorkalov

机构 * Department of Radiophysics, University of Nizhny Novgorod(尼日尼诺夫戈罗德大学无线电物理系) Huawei Nizhny Novgorod Research Center(华为尼日尼诺夫戈罗德研究中心) Skolkovo Institute of Science and Technology(斯克洛科夫科学与技术研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Contraction Mapping Model,通过将离散递归推理转化为连续的NODEs/NSDEs,提供数学严谨且稳定的推理引擎,在Sudoku-Extreme基准测试中取得93.7%的准确率,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16578 2026-03-18 cs.LG cs.CL 81%

When and Why Does Unsupervised RL Succeed in Mathematical Reasoning? A Manifold Envelopment Perspective

在何种情况下和为何无监督强化学习在数学推理中成功?一种流形包裹视角

Zelin Zhang, Fei Cheng, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究无监督强化学习在数学推理中的成功条件,提出通过流形包裹视角分析其稳定性与失效原因,设计内在奖励机制并揭示基础逻辑先验对性能的影响。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12284 2026-03-17 cs.AI cs.CL 81%

Shorten After You're Right: Lazy Length Penalties for Reasoning RL

在正确后缩短:用于推理RL的懒惰长度惩罚

Danlong Yuan, Tian Xie, Shaohan Huang, Zhuocheng Gong, Huishuai Zhang, Chong Luo, Furu Wei, Dongyan Zhao

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出三种集成到大推理模型强化学习过程中的奖励设计,通过减少响应长度而不增加训练阶段,实验证明在逻辑推理和数学问题中均显著缩短响应长度并保持或提升性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01214 2026-03-13 cs.CL cs.LG 81%

Reasoning Boosts Opinion Alignment in LLMs

推理提升大语言模型中的观点一致性

Frédéric Berdoz, Yann Billeter, Yann Vonlanthen, Roger Wattenhofer

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏