A KL-regularization Framework for Learning to Plan with Adaptive Priors
一种基于KL正则化的学习规划框架:具有自适应先验的规划
机构 * LIACS, Leiden University, Leiden, The Netherlands(莱顿大学莱顿分校,荷兰) ; Google Deepmind, London, United Kingdom(谷歌DeepMind,英国伦敦) ; University of Oxford, Oxford, United Kingdom(牛津大学,英国牛津)
专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG、cs.RO
AI总结 本文提出了一种基于KL正则化的学习规划框架,通过将规划器的动作分布作为先验整合到策略优化中,提升了在高维连续控制任务中模型驱动强化学习的样本效率和长期性能。
Comments Published at ICML2026