Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
过于正确而无法学习:在饱和推理数据上进行强化学习
机构 * Tencent AI Lab(腾讯AI实验室) ; University of Notre Dame(诺丁汉大学)
AI总结 本文提出CUTS策略,通过约束均匀Top-K采样增强探索,结合Mixed-CUTS框架提升推理多样性,实验显示在AIME25基准上Pass@1准确率提升15.1%。
Comments ACL 2026 Main Paper