CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
CoRT:用于令牌级评分标准引导策略优化的反事实重放
机构 * ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中响应内信用分配问题,提出CoRT方法,利用反事实重放对响应重新评分,将对比映射为权重来重新分配优势,实验表明该方法能有效提升训练效果,兼具简单性与稳定性。
大厂专区
CoRT:用于令牌级评分标准引导策略优化的反事实重放
机构 * ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中响应内信用分配问题,提出CoRT方法,利用反事实重放对响应重新评分,将对比映射为权重来重新分配优势,实验表明该方法能有效提升训练效果,兼具简单性与稳定性。