Reward-Conditioned Reinforcement Learning
基于奖励的强化学习
机构 * University of Warsaw(华沙大学) ; Nomagic ; UC Berkeley, Amazon FAR(伯克利大学,亚马逊FAR)
AI总结 本文提出基于奖励的强化学习(RCRL),通过在收集经验时使用单一名义目标,使智能体在不额外交互的情况下暴露于多种奖励目标,从而提高样本效率并支持零样本行为调整。
Comments preprint
作者
Robotics
基于奖励的强化学习
机构 * University of Warsaw(华沙大学) ; Nomagic ; UC Berkeley, Amazon FAR(伯克利大学,亚马逊FAR)
AI总结 本文提出基于奖励的强化学习(RCRL),通过在收集经验时使用单一名义目标,使智能体在不额外交互的情况下暴露于多种奖励目标,从而提高样本效率并支持零样本行为调整。
Comments preprint