Soft Forward-Backward Representations for Zero-shot Reinforcement Learning with General Utilities
用于具有通用效用的零样本强化学习的软前向-后向表示
机构 * ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院) ; Max Planck Institute for Intelligent Systems, Tubingen, Germany(智能系统马克斯·普朗克研究所) ; University of Tubingen, Tubingen, Germany(图宾根大学)
AI总结 本文提出了一种软前向-后向算法,用于解决具有通用效用的零样本强化学习问题,通过离线数据恢复随机策略并直接优化通用效用。