Planning with Arithmetic and Geometric Attributes
专题命中 数学推理 :planning(title);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :planning(title);分类 cs.AI
SPADE:自适应合成可执行环境中的自博弈
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Seoul National University(首尔大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Chicago(芝加哥大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。
Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade
解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国学院) ; Technical University of Munich(慕尼黑工业大学) ; MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。
基于强化学习的知识蒸馏与大语言模型作为评判者
机构 * University of Iowa(爱荷华大学)
专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于强化学习的知识蒸馏方法,利用大语言模型作为评判者在无标签数据上生成奖励,实现无需真实标签的蒸馏,提升数学推理基准性能。
混合策略蒸馏用于大语言模型
机构 * Department of Computer Science(计算机科学系) ; Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) ; Shanghai Innovation Institute(上海创新研究院) ; Large Language Department, Tencent(腾讯大语言部门)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。
Comments ICML 2026
Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。
Comments 7 pages, comments welcome!
SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) ; International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。
T^2MLR:具有时间中层循环的Transformer
机构 * Princeton University(普林斯顿大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对Transformer推理受自回归解码限制问题,提出T2MLR架构,将前token缓存中间层表示融合到当前token较早层,在自然语言预训练和多跳推理微调中表现优,且局部中层块应用循环效果好,还无需从头预训练,降低实际应用门槛。
重新思考思维模型的在线策略自蒸馏
机构 * Princeton University(普林斯顿大学) ; Princeton Language and Intelligence(普林斯顿语言与智能实验室)
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG
AI总结 针对思维模型自蒸馏性能退化问题,研究发现特权上下文在线策略蒸馏会降低长推理轨迹性能,揭示其作用机制,为强思维模型自蒸馏优化提供方向。
dOPSD:扩散语言模型的策略内自蒸馏
机构 * National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。
用于探索、提纯和模型合并的频谱重布线
机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。
HyperDFlash: 面向MHC架构的块级推测解码与门控残差缩减
机构 * ByteDance(字节跳动)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对DeepSeek-V4的多超连接架构,提出HyperDFlash框架,通过对齐残差流和轻量门控缩减器,解决推测解码中特征错位和误差累积问题,显著提升解码速度。
熵感知的在线策略蒸馏语言模型
机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) ; University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) ; Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。
Comments 18 pages, 11 figures, ICML 2026
LLM 在掷骰子时有多可靠?
机构 * Università degli Studi di Firenze(佛罗伦萨大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 通过离散概率问题基准测试,发现 LLM 在标准问题上准确率 0.96,但在反直觉问题上仅 0.59,且存在 token 偏差和误导提示的脆弱性。
N-GRPO:嵌入级邻居混合增强策略优化
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。
Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO
当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。
语言模型需要睡眠吗?用于改进在线推理的离线循环
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种类似睡眠的巩固机制,通过离线循环将上下文转换为快速权重,以解决Transformer注意力机制随上下文长度扩展性差的问题,并在合成任务和数学推理任务上验证了其有效性。
基于结果的强化学习可证明地引导Transformer进行推理,但仅在合适的数据条件下
机构 * Tel Aviv University(特拉维夫大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文通过分析单层Transformer在合成图遍历任务上的策略梯度动力学,证明了基于结果的强化学习能够使Transformer自发学习出结构化的迭代推理算法,并揭示了训练数据中“简单示例”的分布对推理能力涌现的关键作用。
Comments 94 pages, 7 figures
思维经济:具有经济交互的涌现多智能体智能
机构 * Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 受哈耶克经济理论启发,通过拍卖和财富积累的简单经济信号实现去中心化信用分配,使弱智能体群体涌现出多步推理策略,在五个智能体任务中超越强单体基线。
超越前沿:用于高效测试时扩展的随机回溯
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 提出随机回溯方法,通过维护历史前缀池并利用子池选择和幂回溯序列蒙特卡洛机制,在测试时扩展中实现更高的准确率-令牌数权衡。
基于同伴成功与失败的多轨迹在线策略蒸馏
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; Purdue University(普渡大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。
Comments 23 pages
将你的展开用在关键处:基于组强化学习后训练的展开分配
机构 * Cornell University(康奈尔大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出 Pilot-Commit 框架,通过预算感知的展开分配策略,优先将计算资源分配给高信息量的提示,从而在组策略优化中减少采样成本并加速收敛。
隐藏以引导:通过语义掩码学习
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。
RMA:一个面向研究级数学问题的智能体系统
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出Research Math Agents (RMA)框架,通过多角色多轮协作的智能体工作流,在First Proof基准上解决80%的研究级数学问题,优于GPT-5.2R等基线。
通用偏好强化学习
机构 * Stanford University(斯坦福大学) ; The University of Oklahoma(俄克拉荷马大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。
基于测试时间可调节的贝叶斯偏好学习的奖励模型
机构 * LinkedIn Corporation(LinkedIn公司) ; Nubank
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种新的贝叶斯奖励建模目标,即变分上下文奖励建模(ICRM),通过上下文偏好演示实现测试时间可调节性,从而适应未见过的偏好分布,提高了奖励模型的准确性和鲁棒性。
Comments Preprint
HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models
机构 * Department of Computer Science and Technlogy(计算机科学与技术系) ; Tsinghua University(清华大学) ; School of Computer Science and Technlogy(计算机科学与技术系) ; Xi’an Jiaotong University(西安交通大学) ; The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)
专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。
GRPO在离线策略下的可能性:Mu-GRPO用于高效的大语言模型强化学习
机构 * Rice University(里士大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了GRPO在离线策略下的可行性,提出Mu-GRPO方法,通过减少rollout-optimization切换开销,实现高效的LLM强化学习,同时在多个基准测试中表现出色。
通过模板填充解锁扩散语言模型的潜力
机构 * Seoul National University(首尔国立大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。
Comments ACL 2026 Main Conference - Long Paper, Oral Presentation
保持旋转的监督微调
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; Polytechnique Montréal(蒙特利尔理工学院) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; CIFAR AI Chair(CIFAR人工智能主席) ; Google DeepMind(谷歌DeepMind)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RPSFT方法,通过保持预训练奇异子空间的投影旋转来提升模型在领域内和领域外任务间的平衡性能,改进了标准SFT的不足。
Comments 31 pages, 13 figures