When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL
重要采样误分配信用:用于结果监督强化学习的非对称比率
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kuaishou Technology(快手科技) ; Tsinghua University(清华大学)
AI总结 本文揭示了在结果监督强化学习中,重要采样比率因角色转变导致正优势token与负优势token的权重失衡,提出非对称重要采样策略ASPO以纠正此问题,提升训练稳定性与性能。