Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
重用FLOPs:通过条件化非常离策略前缀来扩展RL在困难问题上的应用
机构 * Meta ; Carnegie Mellon University(卡内基梅隆大学) ; University of Southern California(南加州大学)
AI总结 通过条件化离策略前缀提升RL在困难问题上的学习效率,实现更快的训练奖励和更高的最终奖励。