SRT: Accelerating Reinforcement Learning via Speculative Rollout with Tree-Structured Cache
SRT:通过树结构缓存的推测式回滚加速强化学习
机构 * Cornell University(康奈尔大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; ByteDance(字节跳动)
AI总结 SRT通过树结构缓存的推测式回滚方法,有效加速语言模型的在线强化学习,提升生成效率并降低推理成本。