Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
专题命中 数学推理 :reasoning(title);math reasoning(title);分类 cs.CL
Comments 30 pages, 23 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title);math reasoning(title);分类 cs.CL
Comments 30 pages, 23 figures
基于大语言模型和链式推理的智能AI框架用于无人机辅助物流调度与移动边缘计算
机构 * Nanyang Technological University(南洋理工大学) ; Singapore Institute of Technology(新加坡理工学院) ; Seatrium New Energy Laboratory(Seatrium 新能源实验室) ; Ministry of Education (MOE) Tier 1(教育部 Tier 1) ; Research Innovation and Enterprise (RIE) 2025 Industry Alignment Fund-Industry Collaboration Projects (IAF-ICP)(研究创新与企业 (RIE) 2025 行业对齐基金-行业合作项目 (IAF-ICP))
专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出结合大语言模型和链式推理的智能AI框架,用于解决无人机辅助物流调度中的混合调度问题,通过分层深度强化学习实现无人机路由和任务执行优化,提升物流效率与任务完成率。
Comments 37 pages
通过可验证的推理过程监督获得正确答案:语言模型的可验证过程监督
机构 * KAIST AI(KAIST人工智能研究所) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Rice University(里士满大学) ; Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学) ; Sentient Labs(Sentient实验室)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出VPS框架,通过联合优化预测准确性和推理质量,在可验证领域使语言模型同时获得准确和可靠的推理能力。
Comments COLM 2026
掩码蒸馏:将思维链内化到语言模型中
机构 * SCAI, Arizona State University(亚利桑那州立大学计算与增强智能学院)
专题命中 数学推理 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 研究能否将大型推理模型中间步骤计算内化到语言模型参数中,提出掩码蒸馏框架,在自我蒸馏和双模型设置中实例化,并改变中间令牌支架长度,通过实验在GSM8K和Countdown推理领域进行评估。
统计早停法用于推理模型
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
Turbo Connection: 从高层到低层的信息流推理
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 Turbo Conn通过反向连接增强LLM推理能力,实现任务性能显著提升
同伴预测自训练用于语言模型推理
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PST框架,通过多模型协作利用交叉模型聚合响应作为内部训练信号,提升数学推理任务的准确率并减少生成-验证差距。
Comments 22 pages, 5 figures
大型语言模型中的数学推理:基准测试、架构、评估与开放挑战
机构 * organization= School of Electrical Engineering ; Computer Science, National University of Science ; organization= School of Computing, Data ; Mathematical Sciences, Western Sydney University, Indonesia ; organization= Department of Communication, Quality Management ; Information Systems, Mid Sweden University, Östersund Campus, Sweden
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。
模型可以自我帮助:无需奖励的自我训练用于大语言模型推理
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SePT方法,通过自我生成和训练自我生成响应交替进行,无需外部奖励提升大语言模型推理性能,实验表明在多个数学推理基准上有效。
DART: 用于混合推理模型中免训练自适应思考预算的草案一致路由
机构 * Korea University(高丽大学) ; dot(42dot) ; Konkuk University(建国大学) ; Yonsei University(延世大学) ; Soongsil University(崇实大学) ; Kumoh National Institute of Technology(金乌国立技术学院)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出免训练路由框架DART,通过采样两个廉价无思考草案,当草案一致时直接回答,不一致时根据草案熵预测思考预算,在保持或提升准确率的同时大幅减少思考令牌使用。
Comments 15 pages, 4 figures, 16 tables. Code: https://github.com/js-lee-AI/DART
知道何时退出:LLM推理中动态弃权的原则性框架
机构 * Hebrew University of Jerusalem(特拉维夫大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一个基于正则化强化学习框架的动态弃权原则,通过价值函数与弃权奖励的比较来决定是否提前终止推理,在数学推理和毒性避免任务上优于现有方法。
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)
选择与改进:理解推理后训练的机制
机构 * Microsoft Research NYC(微软研究院纽约) ; UIUC(伊利诺伊大学厄巴纳-香槟分校)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。
在移动边缘训练:一种在线验证的提示选择方法用于大型推理模型的高效强化学习训练
机构 * Southern University of Science and Technology(南方科技大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科学理工大学) ; Nanyang Technological University(南洋理工大学) ; Rutgers University(罗格斯大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州))
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出HIVE方法,通过历史奖励轨迹和实时提示熵实现高效RL训练,提升提示选择效率而不牺牲性能。
人类与DeepSeek-R1大语言模型数学推理的全面解剖
机构 * UCL Centre for Artificial Intelligence(伦敦大学人工智能中心)
专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 通过AIME 2025所有30道题目的10247个推理步骤注释,发现DeepSeek-R1存在拓扑模仿(表面模仿推理而非真正推理),但成功轨迹中分支与回溯的稳定使用以及反射在演绎推理中的有效放置是真正推理的信号。
当RL抑制自身词汇:在谜题到数学迁移中恢复推理多样性
机构 * Fin AI Research(Fin AI研究院) ; Salk Institute for Biological Studies(萨尔克生物医学研究所)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于可验证奖励的强化学习框架,通过引入新颖性奖励机制恢复被抑制的探索性推理原语,实现从约束满足谜题到数学问题的跨领域迁移,在无需数学数据的情况下将OlymMATH-Hard的pass@32从16%提升至36%。
Comments Preprint
技能条件门控自蒸馏用于大语言模型推理
机构 * Tsinghua University(清华大学) ; Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。
推理语言模型中的实时进度预测
机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究通过离散化推理轨迹训练线性探针和微调模型生成0-100%进度估计,实现推理语言模型中的实时进度预测,并在数学推理任务上达到0.161 MAE。
努力作为上限,而非调节器:推理预算不影响人类与大推理模型之间的认知成本对齐
机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) ; School of Philosophy, Anhui University(安徽大学哲学系)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究探讨了推理预算是否影响人类与大推理模型之间的认知成本对齐,发现无论推理努力如何变化,对齐情况保持不变,表明这种对齐是在训练时形成的,而非在推理时动态调整。
Comments 8 pages, 6 figures
LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃
机构 * UC San Diego(斯克利普斯海洋研究所) ; Apple(苹果公司)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。
通过内在梯度-范数奖励实现无需验证器的LLM强化学习
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 数学推理 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VIGOR,一种无需外部验证器的强化学习奖励机制,通过内在偏好信号提升政策优化效果,在数学推理和代码基准测试中表现优于现有方法。
Comments Accepted to Findings of ACL 2026
并非所有思考都需要HBM:面向LLM推理的语义感知内存层次结构
机构 * University of Southern California(南加州大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种语义感知内存层次结构,通过累积注意力评分将token分为四个层级,减少HBM占用并提升推理准确性,实验表明仅3%的淘汰率可保持91%的GSM8K准确率。
Comments Preprint. 14 pages + appendix. Under review at AdaptFM Workshop @ ICML 2026
面向时间序列预测的推理感知训练
机构 * Google(谷歌) ; University of Kentucky(肯塔基大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出STRIDE框架,通过将LLM推理注入到时间序列基础模型的连续嵌入空间中,提升数值预测的准确性和可解释性。
Lightning OPD: 为大推理模型高效实现离线在线蒸馏
机构 * NVIDIA
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Lightning OPD,通过强制教师一致性消除对实时教师服务器的需求,实现高效离线在线蒸馏,实验表明其在数学推理和代码生成任务中性能与传统OPD相当,训练效率提升4倍。
CORE:面向概念的强化学习,弥合定义与应用之间的数学推理差距
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Arizona State University(亚利桑那州立大学)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 CORE通过引入概念导向的强化学习框架,解决大语言模型在数学推理中概念应用不足的问题,通过合成概念对齐习题和注入概念片段提升模型的推理能力。
MGSM-Pro:一种用于多语言数学推理评估的简单策略
机构 * McGill University(麦吉尔大学) ; Mila-Quebec AI Institute(蒙特利尔AI研究院) ; University of Toronto(多伦多大学) ; Masakhane ; Hanyang University(翰阳大学) ; Instituto Politécnico Nacional(国家理工学院) ; Umbaji ; University of Ibadan(伊巴德安大学) ; McPherson University(麦菲逊大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MGSM-Pro,通过增加数字变化实例提升多语言数学推理评估的鲁棒性,发现低资源语言在不同数字实例下表现下降,且专有模型对数字变化更敏感。
通过步骤级优势选择稳定高效推理
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG
AI总结 本文提出SAS方法,在步骤层面选择优势,提升推理稳定性与效率,实验显示在多个基准上准确率提升0.86点,推理长度减少16.3%。
Comments Findings of ACL 2026, Code: https://github.com/HanNight/SAS
评分、推理与选择最佳!通过同行评审过程进行大型语言模型的集成
机构 * Beihang University, Beijing, China(北京航空航天大学) ; Zhongguancun Laboratory, Beijing, China(中关村实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; Tsinghua University, Beijing, China(清华大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LLM-PeerReview方法,通过同行评审机制集成多个大型语言模型,提升响应质量。实验显示其在多个数据集上优于Smoothie-Global,适用于事实性问答、数学推理等任务。
LogicDiff:逻辑引导去噪提升掩码扩散语言模型的零样本推理
机构 * Independent Researcher(独立研究者)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 LogicDiff通过逻辑角色引导去噪策略提升掩码扩散语言模型的零样本推理能力,显著提高GSM8K和MATH-500任务的准确率,但较少样本提示下效果受限。
Comments 9 pages, 3 figures, 3 tables
SelfBudgeter:面向高效大语言模型推理的自适应令牌分配
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; BandAI, Bytedance(字节跳动BandAI)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SelfBudgeter策略,通过自适应预算分配提升LLM推理效率,实验显示在数学推理任务中平均响应长度压缩61%并保持准确性。
一个样本统治一切:通过强化学习实现多学科推理的极端数据效率
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) ; GAIR
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出多学科学习框架,通过一个训练样本提升多领域推理能力,证明样本质量而非数量对模型性能的关键作用。