arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2606.22570 2026-06-23 cs.CL 新提交 79%

What are Key Factors for Updates in RL for LLM Reasoning?

RL提升LLM推理能力的关键更新因素是什么?

Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19120 2026-06-23 cs.LG cs.CV 新提交 79%

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏

Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出ViGOS框架,通过解耦感知和推理,在MLLM后训练中避免文本捷径,提升图像依赖行为。

Comments 29 pages, 5 figures, 8 tables; Project page: https://oedosoldier.github.io/ViGOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19771 2026-06-19 cs.AI 新提交 79%

Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

超越熵:从令牌级分布偏差中学习以增强LLM推理

Xuanzhi Feng, Zhengyang Li, Zeyu Liu, Haoxi Li, Yuming Jiang, Bing Guo, Jingcai Guo, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Sichuan University(四川大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对RLVR中令牌更新导致的熵塌陷或爆炸问题,提出ICT框架,利用JS散度识别关键令牌,通过选择性更新平衡策略集中度,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16152 2026-06-16 cs.AI 新提交 79%

The Quality-Utility Paradox: Why High-Reward Data Impairs Small Model Mathematical Reasoning

质量-效用悖论:为什么高奖励数据会损害小模型的数学推理

Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 发现数学推理蒸馏中的质量-效用悖论:Oracle精炼的高奖励数据因分布漂移增加适应成本,反而不如SLM自生成数据;提出风格对齐精炼方法恢复效用。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13982 2026-06-15 stat.ML cs.LG 新提交 79%

Adaptive Nucleus Truncation for Long-Form Reasoning

自适应核截断用于长形式推理

Ousmane Amadou Dia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出自适应核截断采样(ANTS),通过熵条件控制器动态调整截断宽度,在长文本生成中提升推理性能,在33B参数稀疏MoE模型上平均提升1.9-5.2分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12941 2026-06-15 cs.CL 新提交 79%

Multi-Turn Reasoning When Context Arrives in Pieces: Scalable Sharding and Memory-Augmented RL

当上下文分片到达时的多轮推理:可扩展的分片与记忆增强强化学习

Shu Tong Luo, Wenqin Liu, Rui Liu, Mingming Gong, Jiaxian Guo

机构 * The University of Melbourne(墨尔本大学) Google Research Australia(谷歌澳大利亚研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对多轮对话中信息碎片化导致LLM准确率下降65%的问题,提出通过训练模型维护紧凑滚动记忆而非增长历史来缓解,并引入低成本分片流水线将单轮QA转换为多轮碎片化情节,训练的记忆增强策略显著提升多轮准确率并零样本泛化到更难任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13197 2026-06-12 cs.AI 新提交 79%

ARMOR-MAD: Adaptive Routing for Heterogeneous Multi-Agent Debate in Large Language Model Reasoning

ARMOR-MAD:大语言模型推理中异构多智能体辩论的自适应路由

Fuqiang Niu, Bowen Zhang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ARMOR-MAD框架,通过辩论前协议路由、早期一致停止评估和语义异常检测,自适应控制异构多智能体辩论,提升推理准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12976 2026-06-12 cs.AI 新提交 79%

A Mathematical Forum Platform for Collaborative Problem Solving and Dataset Generation for AI Reasoning

面向协作问题求解与AI推理数据集生成的数学论坛平台

Akbar Erkinov, Nurmukhammad Abdurasulov

机构 * Independent Researchers, San Francisco, CA, USA(独立研究者,美国加利福尼亚州旧金山)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出一个集成图像到LaTeX转换管线的论坛系统,消除数学内容分享的摩擦,支持桌面和移动端,并生成社区验证的数学问题数据集以训练AI推理。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10346 2026-06-10 cs.AI 新提交 79%

Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

推理还是记忆?LLM强化学习中的方向感知多样性探索

Jiangnan Xia, Yucheng Shi, Yu Yang, Kishan Panaganti, Zhenwen Liang, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Lab(腾讯AI实验室) The Education University of Hong Kong(香港教育大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DiRL框架,通过方向感知奖励区分推理与记忆驱动的探索,在GRPO中集成方向加权梯度特征,显著提升数学与通用推理性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08974 2026-06-09 cs.AI 新提交 79%

Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models

多样思维图式激发大型语言模型更优推理

Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出多样图式策略优化(DiScO),通过增强推理步骤转换和答案候选的多样性,提升大型语言模型在数学推理任务中的表现和错误恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08543 2026-06-09 cs.AI 新提交 79%

PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR

PAEC:面向RLVR中LLM推理的位置感知熵校准

Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出位置感知熵校准(PAEC),通过局部top-p熵和top-2候选竞争构建软掩码,并施加基于锚点的下界惩罚,防止决策相关位置熵崩溃,提升数学推理性能。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25004 2026-06-09 cs.AI 版本更新 79%

CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning

CLPO:课程学习与策略优化相结合用于大语言模型推理

Shijie Zhang, Zheng Xiao, Shiyu Liu, Guohao Sun, Kevin Zhang, Xiang Guo, Rujun Guo, Shaoyu Liu, Wangxiao Zhao, Guanjun Jiang

机构 * Peking University(北京大学) Qwen Applications Business Group, Alibaba Group(通义实验室,阿里巴巴集团) Xiamen University(厦门大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CLPO框架,通过在线策略准确率动态调整问题难度,使课程与策略共同进化,在数学和通用推理基准上显著优于GRPO和DAPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07190 2026-06-08 cs.CL 新提交 79%

From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

从正确性到效用:基于增益的LLM推理前缀评估

Yuhang Zhou, Yixin Cao, Guangnan Ye

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出前缀增益概念,训练前缀效用模型(PUM)通过成对排序目标评估推理前缀对成功率的提升,在数学推理任务中优于传统正确性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06745 2026-06-08 cs.CL 新提交 79%

When to Think Deeply: Inhibitory Deliberation for LLM Reasoning

何时深度思考:用于LLM推理的抑制性深思

Zhixuan He, Yue Feng

机构 * University of Birmingham, United Kingdom(英国伯明翰大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出IDPR框架,通过抑制控制器根据快速答案决定是否启动慢速推理,在数学推理测试集上仅调用8.20%的慢速推理,准确率从47.90%提升至48.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06252 2026-06-05 cs.AI 79%

Closing the Loop on Latent Reasoning via Test-Time Reconstruction

通过测试时重建实现潜在推理的闭环

Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) Florida State University(佛罗里达州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ReLAT方法,利用自监督测试时训练通过查询重建损失优化潜在状态,实现潜在推理的闭环,提升数学推理、知识问答和代码生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03606 2026-06-04 cs.CR cs.AI 79%

Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

测试大语言模型算术推理泛化能力:自动数值重映射攻击

Malia Barker, Bishal Lakha, Edoardo Serra, Francesco Gullo

机构 * Department of Computer Science, Boise State University(计算机科学系,博伊州立大学) University of L’Aquila(拉奎拉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出自动数值重映射攻击算法,通过保持推理程序的小数值变化测试LLM算术推理鲁棒性,发现GSM8K上准确率下降12-26个百分点,而MAWPS和MultiArith更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09803 2026-06-04 cs.LG 79%

Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning

好的推理产生好的示范:通过上下文强化学习进行隐式推理质量监督

Tiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su, Hongru Hou, Hengrui Chen, Ao Xu, Deqing Yang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Chinese Academy of Sciences(中国科学院大学) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出In-Context RLVR方法,利用策略模型自身的上下文学习能力衡量示范效用(Demonstration Utility),通过隐式奖励加权提升推理质量和准确性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03234 2026-06-03 cs.LG 79%

Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

正确即力量:对齐验证的隐藏状态增强强化学习推理

Ziyue Wang, Aomufei Yuan, Yongfu Zhu, Shuai Dong, Wenpu Liu, Yiran Yao, Weichu Xie, Yuqi Xu, Caoyuan Ma, Wenqi Shao, Xiaoying Zhang, Nan Duan, Jiaqi Wang

机构 * Peking University(北京大学) JINGDONG(京东) Shanghai Innovation Institute(上海创新研究院) The University of Tokyo(东京大学) Tianjin University(天津大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出Hidden-Align辅助损失函数,在强化学习训练中对齐正确rollout在锚点token处的最后一层隐藏状态,提升数学推理性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17708 2026-06-03 cs.AI 79%

Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization

协同进化智能体架构与可解释推理用于自动化优化

Jiahao Huang, Peilan Xu, Xiaoya Nan, Wenjian Luo

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出EvoOR-Agent协同进化框架,通过将智能体工作流表示为活动边网络,并利用图介导的路径条件重组、多粒度语义变异和精英种群更新,实现自动化优化中的自适应协调与可解释推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00532 2026-06-02 cs.AI 79%

KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning

KACE: 知识自适应上下文工程用于数学推理

Jayant Parashar, Suchendra M. Bhandarkar

机构 * School of Computing, University of Georgia(计算学院,佐治亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出KACE方法,通过难度和领域分层的知识库与分层自一致性,解决数学推理中上下文膨胀问题,在AIME 2025上达到62.2%准确率。

Comments 9 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01914 2026-06-01 cs.LG 79%

Towards Long-Horizon Interpretability: Efficient and Faithful Multi-Token Attribution for Reasoning LLMs

面向长程可解释性:高效且忠实的多Token归因用于推理大语言模型

Wenbo Pan, Zhichao Liu, Xianlong Wang, Haining Yu, Xiaohua Jia

机构 * Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(香港城市大学计算机科学系) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出FlashTrace方法,通过跨跨度聚合和递归归因机制,在长上下文推理中实现高效且忠实的多Token归因,速度提升超130倍。

Comments Accepted as an Oral paper at ICML 2026. Code available at https://github.com/wbopan/flashtrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18760 2026-06-01 cs.AI cs.FL 79%

HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs

HERMES: 迈向高效且可验证的LLM数学推理

Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

机构 * Department of Computer Science \& Engineering, The Chinese University of Hong Kong Huawei Foundation Model Department

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Hermes框架,通过将非正式推理与Lean形式化验证交替结合,并引入中间形式化检查和记忆模块,在提升推理准确性的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21235 2026-05-29 cs.CL 79%

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

LamPO: 一种用于推理语言模型的Lambda风格策略优化

Redacted by arXiv

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出LamPO方法,通过成对分解优势函数和置信度加权,改进基于可验证奖励的强化学习在推理语言模型中的信用分配和训练稳定性。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission. Author list and submitter name redacted due to disputed authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10520 2026-05-29 cs.LG 79%

Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models

优先过程而非结果:奖励潜在思维轨迹改善循环语言模型的推理能力

Jonathan Williams, Esin Tureci

机构 * Department of Computer Science, Princeton University, Princeton NJ, U.S.A(普林斯顿大学计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 针对循环语言模型(LoopLM)中标准强化学习(如GRPO)仅奖励最终潜在状态导致推理改进失败的问题,提出RLTT框架,通过在整个潜在推理轨迹上分配奖励实现密集的轨迹级信用分配,显著提升数学推理性能并泛化至非数学任务。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28389 2026-05-28 cs.CL 79%

FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning

FABSVer: 更快的训练与更好的自验证用于大语言模型数学推理

Haihui Pan, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang Education Technology(左岳邦教育科技)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出FABSVer方法,通过融合解生成与自验证为单次前向传播,并引入动态参考模型更新(DRMU)突破奖励瓶颈,在三个模型规模上实现更优的自验证与推理性能,训练时间仅为现有方法的51%-71%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28028 2026-05-28 cs.LG 79%

BPPO: Binary Prefix Policy Optimization for Efficient GRPO-Style Reasoning RL with Concise Responses

BPPO: 二元前缀策略优化用于高效GRPO式推理强化学习与简洁响应

Qingfei Zhao, Huan Song, Shuyu Tian, Jiawei Shao, Xuelong Li

机构 * TeleAI Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 针对GRPO更新成本高且易产生冗长推理的问题,提出BPPO方法,通过仅使用最短正确和错误完成作为更新单元并聚焦前缀优化,实现6倍加速并缩短30-50%响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27715 2026-05-28 cs.CL 79%

Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs

超越输入理解:使用有向无环迹图诊断多语言数学推理

Jiaqiao Zhang, Zhoujun Li, Raoyuan Zhao, Jian Lan, Thomas Seidl, Michael A. Hedderich, Hinrich Schütze, Yihong Liu

机构 * Southwest University(西南大学) LMU Munich(慕尼黑莱茵-瓦尔德大学) MCML

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出有向无环迹图(DATG)框架,通过将推理迹映射到与语言无关的数学锚点和依赖关系,诊断多语言数学推理中的语言影响,并设计Loop-Retry和Formula-Retry两种测试时控制方法改善低资源语言性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27712 2026-05-28 cs.AI 79%

Prefix-Safe Bayesian Belief Tracking for LLM Reasoning Reliability:Separating Calibration from Ranking

前缀安全贝叶斯信念追踪用于LLM推理可靠性:将校准与排序分离

Zhenghan Song, Yunyi Li, Yulong Liu

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出前缀安全贝叶斯信念追踪(SBBT)框架,通过分离概率质量与排序能力,在长链推理中实现可靠的在线校准与不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27570 2026-05-28 cs.AI 79%

LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation

LaneRoPE: 用于协同并行推理与生成的位置编码

Gabriele Cesa, Thomas Hehn, Aleix Torres-Camps, Àlex Batlle Casellas, Jordi Ros-Giralt, Arash Behboodi, Tribhuvanesh Orekondy

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出LaneRoPE方法,通过序列间注意力掩码和扩展的RoPE位置编码,使多个序列在生成时协同合作,提升数学推理任务在有限生成长度下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21128 2026-05-28 cs.AI 79%

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

RL 压缩,SFT 扩展:推理型大语言模型的比较研究

Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过轨迹级和步骤级分析框架,比较了强化学习(RL)和监督微调(SFT)对数学推理大语言模型推理路径的影响,发现RL压缩错误轨迹并集中推理功能,而SFT扩展正确轨迹并均匀化推理功能。

Comments Accepted at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏