On-policy Distillation with Verifiable Reward
结合可验证奖励的在线蒸馏
机构 * LeapLab, Tsinghua University(清华大学LeapLab) ; Beihang University(北京航空航天大学) ; SMS, Peking University(北京大学SMS) ; NLPLab, Tsinghua University(清华大学NLPLab)
AI总结 本研究提出OPDVR方法,无缝结合OPD与RLVR且不增加超参数,经六个推理基准实验验证其性能优于标准OPD。