arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2604.09349 2026-05-25 cs.CV cs.AI cs.CL 81%

Visually-Guided Policy Optimization for Multimodal Reasoning

视觉引导的多模态推理策略优化

Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) SYSU(南方科技大学) BUPT(北京邮电大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在推理中视觉关注不足和时序遗忘问题,提出视觉引导策略优化(VGPO)框架,通过视觉注意力补偿机制和双粒度优势重加权策略增强视觉聚焦,提升多模态推理性能。

Comments Accepted to ACL 2026, https://github.com/wzb-bupt/VGPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14652 2026-05-25 cs.AI cs.CL cs.MA 81%

MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks

MAS-Orchestra:通过整体编排和受控基准理解与改进多智能体推理

Zixuan Ke, Yifei Ming, Austin Xu, Ryan Chin, Xuan-Phi Nguyen, Prathyusha Jwalapuram, Jiayu Wang, Semih Yavuz, Caiming Xiong, Shafiq Joty

机构 * Salesforce Research(Salesforce研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MAS-Orchestra框架,将多智能体系统编排形式化为函数调用的强化学习问题,并引入受控基准MASBENCH,揭示MAS收益依赖于任务结构等因素,在数学推理等任务上取得一致改进且效率提升10倍以上。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22263 2026-05-22 cs.LG cs.AI 81%

Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

按能力定制教学:方向自适应自蒸馏用于LLM推理

Hongbin Zhang, Chaozheng Wang, Kehai Chen, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算智能研究所,哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Keeta AI, Meituan(Keeta AI,美团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出方向自适应自蒸馏(DASD),通过熵引导的定向监督改进LLM推理,通过分析发现统一的教师监督导致探索被压制,DASD在六个数学推理基准中取得最佳表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07962 2026-05-22 cs.CL cs.AI 81%

LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?

LightReasoner: 小型语言模型能否教会大型语言模型推理?

Jingyuan Wang, Yankai Chen, Zhonghang Li, Chao Huang

机构 * University of Hong Kong(香港大学) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LightReasoner框架,通过利用强专家模型与弱业余模型之间的行为差异,发现高价值推理时刻,从而提升大型语言模型的推理能力,同时减少资源消耗。

Comments Updated to ACL 2026 camera-ready version with improved method presentation, expanded related work discussion, additional analyses, and presentation refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19762 2026-05-20 cs.AI cs.CL 81%

What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code

什么真正提升了数学推理:超越纯代码的结构化推理信号

Yuze Zhao, Junpeng Fang, Lu Yu, Zhenya Huang, Kai Zhang, Qing Cui, Qi Liu, Jun Zhou, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science(认知智能国家重点实验室,科学大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Centerce(人工智能研究院,合肥综合性国家科学中心) Individual Researcher(个人研究员) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过控制预训练实验研究代码对推理能力的影响,发现代码主要提升编程能力而非通用推理,且在复杂数学推理中与知识密集型任务竞争,同时结构化推理轨迹(如代码-文本和数学-文本混合)比纯可执行代码更能提升推理能力。

Comments Accepted by ICML 2026, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15851 2026-05-19 cs.LG cs.AI cs.CR 81%

DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy

DPrivBench:评估大语言模型在差分隐私推理中的基准测试

Erchi Wang, Pengrun Huang, Eli Chien, Om Thakkar, Kamalika Chaudhuri, Yu-Xiang Wang, Ruihan Wu

机构 * Halıcıoğlu Data Science Institute, UC San Diego(哈里奇奥格卢数据科学研究所,加州大学圣地亚哥分校) Department of Computer Science and Engineering, UC San Diego(计算机科学与工程系,加州大学圣地亚哥分校) Department of Electrical Engineering, National Taiwan University(电气工程系,国立台湾大学) OpenAI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPrivBench基准测试,用于评估大语言模型在差分隐私推理中的能力,发现当前模型在高级算法推理上存在显著差距,并为改进自动化差分隐私推理提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10528 2026-05-19 cs.CL cs.LG 81%

Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting

Merlin's Whisper:通过黑盒说服提示增强大语言模型的高效推理

Heming Xia, Cunxiao Du, Rui Li, Chak Tou Leong, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Sea AI Lab(Sea AI实验室) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Whisper框架,通过黑盒说服提示减少大语言模型(LRM)的推理过程中的token使用量,同时保持性能,展示了在多个基准测试中显著的token减少效果。

Comments ACL 2026 (Long Paper), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19078 2026-05-19 cs.CL cs.AI 81%

GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning

GraphMind: 一种基于动态GNN的定理选择与结论生成框架用于LLM推理

Yutong Li, Yitian Zhou, Xudong Wang, GuoChen, Caiyan Qin

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GraphMind通过动态图神经网络与LLM结合,实现多步推理中的定理选择和结论生成,提升上下文感知的推理能力。

Comments This paper has been withdrawn by the authors in order to prepare a substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01683 2026-05-19 cs.CL cs.AI 81%

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

手术式后训练:用于知识保留的近端策略蒸馏

Wenye Lin, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SPOT框架,通过近端策略蒸馏在后训练中保留知识,提升推理性能,实验表明其在少量数据下显著提升模型准确率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04265 2026-05-15 cs.LG cs.AI 81%

Boosting LLM Reasoning via Human-Inspired Reward Shaping

通过人类启发的奖励塑造提升大语言模型推理能力

Wenze Lin, Zhen Yang, Xitai Jiang, Xiaoteng Ma, Gao Huang

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Mind Lab

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10931 2026-05-14 cs.LG cs.CL 81%

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

异步推理:无需训练的交互式思考LLM

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi, Vyacheslav Zhdanovskiy, Denis Kuznedelev, Alina Shutova, Max Ryabinin

机构 * Yandex HSE University(俄罗斯高等经济大学) The University of Tokyo(东京大学) MATS Together AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13301 2026-05-14 cs.AI cs.CL 81%

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

通过简单统一的扩展实现金牌级竞赛推理

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种简单统一的方法,将训练好的推理模型扩展为金牌级竞赛解题器,通过反熵课程和两级强化学习提升证明搜索能力,最终在数学和物理竞赛中取得金牌水平表现。

Comments Technical Report. 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10805 2026-05-12 cs.AI cs.CL stat.ML 81%

Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

推理并非免费:面向LLM-as-a-Judge的鲁棒自适应成本高效路由

Wenbo Zhang, Lijinghua Zhang, Liner Xiang, Hengrui Cai

机构 * Department of Statistics, University of California, Irvine, USA(加州大学伊维特分校统计学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比推理与非推理法官,发现推理在结构验证任务中提升准确性,但成本高。提出RACER方法,通过分布鲁棒优化动态选择推理或非推理法官,实现成本效率的最优平衡。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01698 2026-05-12 cs.CL cs.LG 81%

Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models

训练后探索恢复:大型推理模型的潜在探索解码

Wenhui Tan, Fiorenzo Parascandolo, Enver Sangineto, Jianzhong Ju, Zhenbo Luo, Qian Cao, Rita Cucchiara, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司北京MiLM Plus团队) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米莉亚大学) University of Pisa, Italy(比萨大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent Exploration Decoding方法,通过累积中间后验并选择熵最大配置来提升推理模型的pass@1和pass@16准确率,同时增强强化学习中的探索能力。

Comments Project Page: https://github.com/AlbertTan404/LED

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09496 2026-05-12 cs.CL cs.LG 81%

Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models

超越语言:大型语言模型中的格式无关推理子空间

Aojie Yuan, Zhiyuan Su

机构 * University of Southern California(南加州大学) Duke University(杜克大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大型语言模型中存在格式无关推理子空间(FARS),通过TriForm基准测试发现,FARS能增强概念结构并抑制形式信息,且在不同架构中表现一致,支持柏拉图表示假设。

Comments Preprint. 13 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL 81%

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04078 2026-05-12 cs.LG cs.AI 81%

Validity-Calibrated Reasoning Distillation

有效性校准的推理蒸馏

Khouloud Saadi, Di Wang

机构 * Department of Computer Science(计算机科学系) KAUST(科威特大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出有效性校准的推理蒸馏框架,通过动态监督机制优化学习信号分配,提升数学推理、代码生成和指令遵循任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08221 2026-05-12 cs.LG cs.AI 81%

NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning

NoisyCoconut:通过潜在空间推理实现反事实共识

Michael Jerge, David Evans

机构 * University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 NoisyCoconut通过在潜在空间中注入可控噪声生成多样化推理路径,利用路径一致性的置信度信号提升大语言模型可靠性,无需重新训练即可在多个推理基准中实现有效的覆盖-准确率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 81%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07137 2026-05-11 cs.LG cs.AI 81%

Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

自适应负强化用于大语言模型推理:在强化学习中动态平衡纠正与多样性

Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布希·尼尔马伊技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应负强化方法,通过时间依赖调度函数动态平衡纠正与多样性,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06188 2026-05-08 cs.AI cs.CL 81%

OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models

OPSD 压缩 RLVR 教授的内容:一种为推理模型设计的后 RL 压缩阶段

Jaehoon Kim, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OPSD 在数学推理中作为压缩机制更可靠,通过仅训练正确轨迹可保持准确性并显著缩短响应,而训练错误轨迹则损害准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG 81%

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04065 2026-05-08 cs.CL cs.ET cs.LG 81%

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11504 2026-04-28 cs.LG cs.CL 81%

LongFlow: Efficient KV Cache Compression for Reasoning Models

LongFlow:用于推理模型的高效KV缓存压缩

Yi Su, Zhenxu Tian, Dan Qiao, Yuechi Zhou, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University, China(苏州大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 LongFlow通过高效的重要性估计指标实现KV缓存压缩,减少内存消耗和带宽压力,提升推理模型的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13262 2026-04-28 cs.AI cs.CL 81%

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning

CURE-MED:基于课程的强化学习用于多语言医学推理

Eric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Technology Patna(印度理工学院帕纳布分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) MBZUAI(中东技术研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CURE-MED框架,通过课程引导的强化学习提升多语言医学推理的逻辑正确性和语言稳定性,实验表明在13种语言上均优于基线模型,实现了高一致性与高正确率。

Comments Accepted at ACL 2026, main conference, oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21935 2026-04-27 cs.AI cs.LG 81%

Math Takes Two: A test for emergent mathematical reasoning in communication

数学需要两个:一种评估交流中涌现数学推理的测试

Michael Cooper, Samuel Cooper

机构 * Cooper Cognitive(Cooper认知)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Math Takes Two基准测试,通过两个无先验数学知识的智能体交流,评估模型在视觉任务中通过发现潜在结构来发展抽象概念的能力。

Comments Accepted at HCAIR workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20659 2026-04-23 cs.LG cs.AI 81%

GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

GRPO-VPS:通过可验证的过程监督增强组相对策略优化以实现有效的推理

Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GRPO-VPS,通过在推理轨迹中探测模型对正确答案的信心,改进GRPO的轨迹级反馈,实现更精准高效的策略更新,实验显示在数学和通用领域任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18897 2026-04-22 cs.CL cs.LG 81%

Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning

少即是多:在大语言模型数学推理中的认知负荷与单提示天花板

Manuel Israel Cazares

机构 * Bytepro AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示工程在形式数学推理中的效果,发现单提示存在性能上限,通过分析发现数学不可判定性、复杂规则系统及提示顺序影响是限制因素,最佳提交在硬性任务中达到79.25%的准确率。

Comments Companion repository: https://github.com/israelcazares/sair-prompt-engineering | Zenodo DOI: 10.5281/zenodo.19598433 | v15: final Contributor Network data (n=52, competition close April 20, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI 81%

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12632 2026-04-15 cs.LG cs.AI 81%

Calibration-Aware Policy Optimization for Reasoning LLMs

面向推理大语言模型的校准感知策略优化

Ziqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与复杂系统决策智能国家实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAPO方法,通过引入logistic AUC替代损失和噪声掩码机制,提升推理大语言模型的校准与准确性,实验显示其在多个数学推理基准上校准提升达15%,并在下游任务中进一步提升准确性。

Comments Published as a conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏