Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime
回滚通过率控制:引导二元奖励强化学习进入其最信息丰富的区域
机构 * Baidu(百度)
AI总结 本文提出Prefix Sampling方法,通过回放自生成轨迹前缀引导二元奖励强化学习进入最信息丰富的区域,提升模型效率和性能。
Comments 25 pages, 8 figures, 12 tables; revised formatting