arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-01-07 至 2026-01-07 共收录 1
2402.05187 2026-01-07 stat.ML cs.LG math.OC

Learning mirror maps in policy mirror descent

在策略镜像下降中学习镜像映射

Carlo Alfano, Sebastian Towers, Silvia Sapora, Chris Lu, Patrick Rebeschini

机构 * Department of Statistics University of Oxford(统计系牛津大学) FLAIR University of Oxford(FLAIR牛津大学)

AI总结 本文通过实证研究发现,传统镜像映射(如NPG)在强化学习中效果有限,利用进化策略学习更高效的镜像映射可提升PMD性能,尤其在复杂环境中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏