BroRL: Scaling Reinforcement Learning via Broadened Exploration
机构 * NVIDIA ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
Comments 16 pages, 4 figures
作者
Natural Language Processing
机构 * NVIDIA ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
Comments 16 pages, 4 figures
Comments Project Page: https://deeptracereward.github.io/