WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
WarpSAC:通过重新思考探索与利用,迈向可拓展离线强化学习的顶峰
机构 * Tianjin University(天津大学) ; Shanxi University(山西大学) ; Imperial College London(伦敦帝国学院)
AI总结 该研究针对大规模并行模拟下离线RL的数据 regime 变化问题,提出具 regime 感知的WarpSAC算法家族,适配不同数据规模场景,在多基准任务及现实部署上较FlashSAC实现显著性能提升。