Learning mirror maps in policy mirror descent
在策略镜像下降中学习镜像映射
机构 * Department of Statistics University of Oxford(统计系牛津大学) ; FLAIR University of Oxford(FLAIR牛津大学)
AI总结 本文通过实证研究发现,传统镜像映射(如NPG)在强化学习中效果有限,利用进化策略学习更高效的镜像映射可提升PMD性能,尤其在复杂环境中表现更优。
高校专区
在策略镜像下降中学习镜像映射
机构 * Department of Statistics University of Oxford(统计系牛津大学) ; FLAIR University of Oxford(FLAIR牛津大学)
AI总结 本文通过实证研究发现,传统镜像映射(如NPG)在强化学习中效果有限,利用进化策略学习更高效的镜像映射可提升PMD性能,尤其在复杂环境中表现更优。