MathConstruct: Challenging LLM Reasoning with Constructive Proofs
机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) ; INSAIT, Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·欧里斯基"学院)
专题命中 数学推理 :reasoning(title);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) ; INSAIT, Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·欧里斯基"学院)
专题命中 数学推理 :reasoning(title);分类 cs.AI
专题命中 数学推理 :reasoning(title);分类 cs.CL
机构 * McGill University(麦吉尔大学)
专题命中 数学推理 :reasoning(title);分类 cs.AI
Comments 8 pages, 2 figures, accepted by AIED conference
专题命中 数学推理 :reasoning(title);分类 cs.CL
Comments AAAI 2025 (7 pages)
专题命中 数学推理 :reasoning(title);分类 cs.AI
Comments 29 pages, 3 figures. Some minor additions/clarifications in this revision, e.g. mathematical description
专题命中 数学推理 :planning(title);分类 cs.AI
从原子到智能体:迈向大语言模型智能体数学能力的可解释评估
机构 * Sun Yat-sen University(中山大学) ; Tencent Youtu Lab(腾讯优图实验室) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Pengcheng Laboratory(鹏城实验室)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。
Comments EMNLP 2026
GSM8K-V:视觉语言模型能否在视觉语境下解决小学级数学应用题
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究构建了多图像视觉数学基准GSM8K-V,评估34个VLMs发现其存在显著模态差距,最优模型仅达59%准确率,瓶颈为隐式视觉推理错误,且视觉数学优化模型在此无提升。
Comments 59 pages, 7 figures, Project Page: https://zju-real.github.io/GSM8K-V Code: https://github.com/ZJU-REAL/GSM8K-V Datasets: https://huggingface.co/datasets/ZJU-REAL/GSM8K-V Accepted at EMNLP 2026 Main Conference. Updated to the camera-ready version with additional experiments, analyses, and revisions
测试时强化学习的工具验证
机构 * Ludwig-Maximilians-University of Munich(慕尼黑路德维希-马克西米利安大学) ; Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 T^3RL通过引入测试时工具验证机制,提升测试时强化学习在复杂问题上的表现,减少错误模式崩溃风险。
Comments 12 pages, 11 figures; Code: https://github.com/mayhugotong/T3RL
SPADE:自适应合成可执行环境中的自博弈
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Seoul National University(首尔大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Chicago(芝加哥大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。
Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade
解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国学院) ; Technical University of Munich(慕尼黑工业大学) ; MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。
基于强化学习的知识蒸馏与大语言模型作为评判者
机构 * University of Iowa(爱荷华大学)
专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于强化学习的知识蒸馏方法,利用大语言模型作为评判者在无标签数据上生成奖励,实现无需真实标签的蒸馏,提升数学推理基准性能。
混合策略蒸馏用于大语言模型
机构 * Department of Computer Science(计算机科学系) ; Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) ; Shanghai Innovation Institute(上海创新研究院) ; Large Language Department, Tencent(腾讯大语言部门)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。
Comments ICML 2026
Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。
Comments 7 pages, comments welcome!
SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) ; International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。
T^2MLR:具有时间中层循环的Transformer
机构 * Princeton University(普林斯顿大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对Transformer推理受自回归解码限制问题,提出T2MLR架构,将前token缓存中间层表示融合到当前token较早层,在自然语言预训练和多跳推理微调中表现优,且局部中层块应用循环效果好,还无需从头预训练,降低实际应用门槛。
重新思考思维模型的在线策略自蒸馏
机构 * Princeton University(普林斯顿大学) ; Princeton Language and Intelligence(普林斯顿语言与智能实验室)
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG
AI总结 针对思维模型自蒸馏性能退化问题,研究发现特权上下文在线策略蒸馏会降低长推理轨迹性能,揭示其作用机制,为强思维模型自蒸馏优化提供方向。
dOPSD:扩散语言模型的策略内自蒸馏
机构 * National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。
用于探索、提纯和模型合并的频谱重布线
机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。
HyperDFlash: 面向MHC架构的块级推测解码与门控残差缩减
机构 * ByteDance(字节跳动)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对DeepSeek-V4的多超连接架构,提出HyperDFlash框架,通过对齐残差流和轻量门控缩减器,解决推测解码中特征错位和误差累积问题,显著提升解码速度。
熵感知的在线策略蒸馏语言模型
机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) ; University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) ; Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。
Comments 18 pages, 11 figures, ICML 2026
LLM 在掷骰子时有多可靠?
机构 * Università degli Studi di Firenze(佛罗伦萨大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 通过离散概率问题基准测试,发现 LLM 在标准问题上准确率 0.96,但在反直觉问题上仅 0.59,且存在 token 偏差和误导提示的脆弱性。
N-GRPO:嵌入级邻居混合增强策略优化
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。
Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO
当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。
语言模型需要睡眠吗?用于改进在线推理的离线循环
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种类似睡眠的巩固机制,通过离线循环将上下文转换为快速权重,以解决Transformer注意力机制随上下文长度扩展性差的问题,并在合成任务和数学推理任务上验证了其有效性。
基于结果的强化学习可证明地引导Transformer进行推理,但仅在合适的数据条件下
机构 * Tel Aviv University(特拉维夫大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文通过分析单层Transformer在合成图遍历任务上的策略梯度动力学,证明了基于结果的强化学习能够使Transformer自发学习出结构化的迭代推理算法,并揭示了训练数据中“简单示例”的分布对推理能力涌现的关键作用。
Comments 94 pages, 7 figures
思维经济:具有经济交互的涌现多智能体智能
机构 * Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 受哈耶克经济理论启发,通过拍卖和财富积累的简单经济信号实现去中心化信用分配,使弱智能体群体涌现出多步推理策略,在五个智能体任务中超越强单体基线。
超越前沿:用于高效测试时扩展的随机回溯
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 提出随机回溯方法,通过维护历史前缀池并利用子池选择和幂回溯序列蒙特卡洛机制,在测试时扩展中实现更高的准确率-令牌数权衡。
基于同伴成功与失败的多轨迹在线策略蒸馏
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; Purdue University(普渡大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。
Comments 23 pages
将你的展开用在关键处:基于组强化学习后训练的展开分配
机构 * Cornell University(康奈尔大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出 Pilot-Commit 框架,通过预算感知的展开分配策略,优先将计算资源分配给高信息量的提示,从而在组策略优化中减少采样成本并加速收敛。