Hide to Guide: Learning via Semantic Masking
隐藏以引导:通过语义掩码学习
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
隐藏以引导:通过语义掩码学习
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。
RMA:一个面向研究级数学问题的智能体系统
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出Research Math Agents (RMA)框架,通过多角色多轮协作的智能体工作流,在First Proof基准上解决80%的研究级数学问题,优于GPT-5.2R等基线。
通用偏好强化学习
机构 * Stanford University(斯坦福大学) ; The University of Oklahoma(俄克拉荷马大学)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通用偏好强化学习(GPRL),通过引入通用偏好模型(GPM)解决传统强化学习在开放任务中连续探索不足的问题,通过多维偏好比较提升模型性能。
基于测试时间可调节的贝叶斯偏好学习的奖励模型
机构 * LinkedIn Corporation(LinkedIn公司) ; Nubank
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种新的贝叶斯奖励建模目标,即变分上下文奖励建模(ICRM),通过上下文偏好演示实现测试时间可调节性,从而适应未见过的偏好分布,提高了奖励模型的准确性和鲁棒性。
Comments Preprint
HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models
机构 * Department of Computer Science and Technlogy(计算机科学与技术系) ; Tsinghua University(清华大学) ; School of Computer Science and Technlogy(计算机科学与技术系) ; Xi’an Jiaotong University(西安交通大学) ; The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)
专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。
GRPO在离线策略下的可能性:Mu-GRPO用于高效的大语言模型强化学习
机构 * Rice University(里士大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了GRPO在离线策略下的可行性,提出Mu-GRPO方法,通过减少rollout-optimization切换开销,实现高效的LLM强化学习,同时在多个基准测试中表现出色。
通过模板填充解锁扩散语言模型的潜力
机构 * Seoul National University(首尔国立大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。
Comments ACL 2026 Main Conference - Long Paper, Oral Presentation
保持旋转的监督微调
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; Polytechnique Montréal(蒙特利尔理工学院) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; CIFAR AI Chair(CIFAR人工智能主席) ; Google DeepMind(谷歌DeepMind)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RPSFT方法,通过保持预训练奇异子空间的投影旋转来提升模型在领域内和领域外任务间的平衡性能,改进了标准SFT的不足。
Comments 31 pages, 13 figures
精确更简单:合作大语言模型代理的信用分配
机构 * Eastern Institute of Technology(东部技术研究所) ; The Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出C3方法,通过精确历史恢复实现合作大语言模型代理的信用分配,证明精确方法在效果、成本和效率上均优于近似方法,并引入三种可审计指标用于信用评估。
VESPO:变分序列级软策略优化用于稳定的反政策LLM训练
机构 * Xiaohongshu Inc(小红书公司)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VESPO,通过变分方法减少反政策更新中的方差,提升大语言模型在严重反政策条件下的稳定性,实验显示其在数学推理和代码生成任务中优于现有基线方法。
文本恐怖谷:LLM信息检索中的非单调性能退化
机构 * University of Chicago(芝加哥大学) ; Northwestern University(西北大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了文本碎片化对LLM信息检索性能的影响,发现性能呈现U型曲线,提出模式过渡假说解释LLM在不同文本状态下的工作模式变化。
Comments 18 pages, 9 figures
ZAYA1-8B 技术报告
机构 * Zyphra
专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI
AI总结 ZAYA1-8B 是基于 MoE++ 架构的推理聚焦混合专家模型,通过全栈 AMD 平台训练,在数学和编程基准中表现优异,采用 RL 策略和 Markovian RSA 方法提升推理性能。
AutoPyVerifier: 为大语言模型输出学习紧凑的可执行验证器
机构 * Megagon Labs(梅加戈恩实验室)
专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG
AI总结 本文提出AutoPyVerifier框架,通过LLM生成候选验证器并利用DAG搜索优化,提升验证器集对目标任务的预测精度,实验表明在多个基准测试中性能提升显著。
DVPO:基于分布价值建模的策略优化用于大语言模型后训练
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Honor Device Co., Ltd(荣誉设备有限公司)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 DVPO通过结合条件风险理论与分布价值建模,在噪声监督下提升大语言模型后训练的鲁棒性和泛化能力,优于PPO、GRPO等方法。
TLoRA:面向任务的大型语言模型低秩适应
机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 TLoRA通过联合优化初始化和资源分配,提升LoRA在不同任务中的性能,减少可训练参数数量。
Comments Accept to ACL 2026
LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统
机构 * Microsoft(微软)
专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。
跨认知领域接受动态的推测解码
机构 * College of Engineering, Al Ain University Abu Dhabi, United Arab Emirates(阿联酋阿因大学工程学院)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了基于树的推测解码接受动态,分析了不同NLP任务领域对接受概率的影响,发现任务类型比树深度更能预测接受率,且聊天领域表现出较高的熵和接受率。
解开OPD之谜:大型语言模型中的长度膨胀与稳定策略
机构 * Department of Computer Science, Rice University, Houston, USA(莱斯大学计算机科学系,美国休斯顿) ; Department of Computer Science, University of North Carolina at Charlotte, Charlotte, USA(北卡罗来纳大学夏洛特分校计算机科学系,美国夏洛特) ; Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系,美国巴尔的摩) ; Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了OPD训练中长度膨胀问题,提出StableOPD框架结合参考 divergence 约束和rollout混合蒸馏,有效稳定训练并提升性能。
TreeAdv:基于群体的强化学习中的树状优势再分配
机构 * Huawei Technologies Co., Ltd., China(华为技术有限公司)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 TreeAdv通过引入树状结构显式化群体回放的探索和优势分配,提升群体强化学习在复杂推理任务中的效率与逻辑深度。
大语言模型能否在噪声监督下实现稳健推理?
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了强化学习中可验证奖励在噪声标签下的鲁棒性问题,提出在线标签细化方法,通过动态修正潜在噪声标签提升模型性能。
Brainstacks:通过冻结MoE-LoRA堆栈实现跨领域认知能力的持续LLM学习
机构 * Brains Build Research
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 Brainstacks通过冻结MoE-LoRA堆栈实现持续多领域微调,利用残差增强突破单堆栈限制,实现跨领域组合。
Comments 26 pages, 13 figures, 4 tables
隐式模型的表达能力:丰富的均衡与测试时扩展
机构 * University of Central Florida(中佛罗里达大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Decision Intelligence Lab, DAMO Academy, Alibaba US(达摩院决策智能实验室,阿里巴巴美国)
专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 研究隐式模型通过非参数分析揭示其表达能力,证明其表达能力随测试时计算量增加而提升,验证了其在多个领域中的有效性。
超越多令牌预测:通过未来摘要预训练语言模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; FAIR at Meta(Meta的FAIR)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出未来摘要预测(FSP)方法,通过训练辅助头预测紧凑的长期未来表示,提升长形式生成能力,在数学、推理和编码基准测试中优于NTP和MTP。
Comments Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026
SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练
机构 * National University of Singapore(新加坡国立大学) ; Microsoft Research Asia(微软亚洲研究院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。
探索提示调优中嵌入先验以提升可解释性和可控性
机构 * New York University(纽约大学)
专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了提示调优中嵌入坍缩现象对模型性能的影响,提出嵌入先验以提升可解释性和可控性,并发现不同激活区域的嵌入能有效提升任务表现。
DistillGuard: 评估对抗大语言模型知识蒸馏的防御措施
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 DistillGuard通过系统评估发现,现有输出层面防御措施在对抗大语言模型知识蒸馏时效果有限,尤其在数学推理任务中表现突出,揭示了防御措施的依赖性和任务特定性。
大型语言模型是对比推理器
机构 * Sun Yat-sen University Shenzhen, China(中山大学深圳校区)
专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出对比提示方法,通过简单提示提升大型语言模型的推理能力,在算术和常识推理任务中优于零样本和少样本方法。
Journal ref Expert Systems With Applications 301 (2026) 130407
R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理
机构 * MIT / Harvard(麻省理工学院/哈佛大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan(密歇根大学) ; MIT(麻省理工学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; Harvard(哈佛大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 R1-Code-Interpreter通过监督学习和多阶段强化学习提升LLM的代码推理能力,实现对多样化任务的高效处理,显著提升模型性能。
Comments 29 pages
对齐与过滤:提升异步在线强化学习的性能
机构 * Mila – Quebec AI Institute, Canada(魁北克AI研究所) ; University of Alberta, Canada(阿尔伯塔大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于总变分的优势对齐约束策略优化方法,用于缓解异步在线强化学习中的策略滞后问题,并在经典和现代强化学习任务中展示了其优越的鲁棒性。
在线因果卡尔曼滤波用于稳定和有效的策略优化
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Southeast University, China(东南大学,中国)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出KPO方法,通过在线因果卡尔曼滤波稳定和提升策略优化效果,有效解决token级重要性采样比率的高方差问题。
Comments Preprint