Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
基于掩码与重排的自监督学习用于可验证奖励的强化学习
机构 * DP Technology(DP技术)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。