DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
DeepSearch: 通过蒙特卡洛树搜索克服强化学习中的瓶颈问题
机构 * Stanford University(斯坦福大学) ; University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所革新智能研究中心) ; UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Amazon AWS(亚马逊云科技)
AI总结 DeepSearch通过将蒙特卡洛树搜索整合到强化学习中,解决探索不足的问题,提升数学推理能力,实验显示其在推理任务中达到62.95%的准确率,且效率显著高于传统方法。