Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals
剪裁瓶颈:通过近边界信号的随机恢复稳定RLVR
机构 * Alibaba Group(阿里巴巴集团)
AI总结 本文研究了强化学习可验证奖励(RLVR)中由于硬剪裁决策导致的训练不稳定问题,提出了一种名为近边界随机救援(NSR)的简单方法,通过随机保留略微超出边界范围的token来恢复丢失的信号,从而提升训练稳定性和性能。
大厂专区
剪裁瓶颈:通过近边界信号的随机恢复稳定RLVR
机构 * Alibaba Group(阿里巴巴集团)
AI总结 本文研究了强化学习可验证奖励(RLVR)中由于硬剪裁决策导致的训练不稳定问题,提出了一种名为近边界随机救援(NSR)的简单方法,通过随机保留略微超出边界范围的token来恢复丢失的信号,从而提升训练稳定性和性能。
统一的数据选择用于LLM推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出了一种无需训练的高熵和(HES)指标,用于评估和选择高质量的推理样本,通过在三种主流训练范式(监督微调、拒绝微调和强化学习)中验证,证明了其在提高LLM推理性能和减少计算开销方面的有效性。
Comments Under Review
TransitLM: 一个大规模数据集和基准,用于无地图的公共交通路线生成
机构 * Alibaba Group(阿里巴巴集团) ; AMAP
AI总结 本文提出TransitLM,一个包含1300万条公共交通路线规划记录的数据集,用于无地图的公共交通路线生成,展示了通过数据训练模型生成有效路线的能力。
单向策略优化用于自演化大语言模型
机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) ; Dartmouth College(达特茅斯学院) ; Alibaba(阿里巴巴)
AI总结 本文提出单向策略优化方法,通过解耦优化方向与更新幅度,解决传统方法中验证器奖励稀疏导致的训练不稳定问题,实现大语言模型的持续自演化。
SiameseNorm: 突破预规范与后规范之间的障碍
机构 * Leap Lab, Tsinghua University(清华大学 Leap 实验室) ; Qwen Large Model Application Team, Alibaba(阿里巴巴 Qwen 大模型应用团队) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学研究院)
AI总结 本文提出SiameseNorm,一种双流架构,通过共享残差块将预规范和后规范结合,从而在保持训练稳定性的同时提升模型性能,适用于多种架构和模态。
Comments Accepted to ICML 2026; camera-ready version; revised presentation and added additional experimental results
MTR-Bench:多轮推理评估的综合性基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出MTR-Bench,一个包含4类、40个任务和3600个实例的综合性基准,用于评估大型语言模型的多轮推理能力,通过自动化框架实现大规模评估,并揭示了当前先进推理模型在多轮交互任务中的不足。
Comments ACL 2026 Main Conference
Faithful-MR1: 通过锚定和强化视觉注意力实现忠实的多模态推理
机构 * AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出Faithful-MR1框架,通过锚定和强化视觉注意力解决多模态推理中的忠实性问题,提升模型在多模态基准上的表现。
Comments 20 pages, 7 figures, 3 tables. Preprint
为扩散模型带来稳定性:分解和减少训练掩码扩散模型的方差
机构 * University of Cambridge(剑桥大学) ; Peking University(北京大学) ; Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队)
AI总结 本文研究了掩码扩散模型(MDMs)训练方差高导致不稳定的问题,通过分解方差来源并提出六种方差减少方法,显著提升了模型在复杂推理任务中的准确率,并将运行间变异性降低至自回归模型(ARMs)水平。
深度学习鲁棒矩阵补全用于大规模低秩数据恢复
机构 * School of Data, Mathematical, and Statistical Sciences and the Department of Computer Science, University of Central Florida(数据、数学与统计科学学院和计算机科学系,中央佛罗里达大学) ; School of Data, Mathematical, and Statistical Sciences, University of Central Florida(数据、数学与统计科学学院,中央佛罗里达大学) ; Damo Academy, Alibaba US(阿里云美国研究院)
AI总结 本文提出了一种可扩展且可学习的非凸方法,即学得鲁棒矩阵补全(LRMC),用于大规模鲁棒矩阵补全问题,该方法具有低计算复杂度和线性收敛性,并通过深度展开有效学习自由参数以实现最优性能,同时在合成数据集和实际应用中验证了其优越的实验性能。
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 48(6): 6541-6556, 2026