Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics
残差奖励模型:利用先验知识实现机器人领域高效的基于偏好的强化学习
机构 * University of Toronto(多伦多大学) ; Tsinghua University(清华大学)
AI总结 本文提出残差奖励模型(RRM),将环境真实奖励拆分为先验奖励与学习奖励之和,可提升机器人领域基于偏好的强化学习的样本效率,在仿真与物理机器人实验中均优于基准方法。
Comments 25 pages, 15 figures