Learning Process Rewards via Success Visitation Matching for Efficient RL
通过成功访问匹配学习过程奖励以实现高效强化学习
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 针对稀疏奖励导致的信用分配难题,提出通过判别器区分成功/失败轨迹,生成密集过程奖励以匹配成功访问分布,在不改变最优策略下加速机器人控制策略微调。
作者
Robotics / Reinforcement Learning
通过成功访问匹配学习过程奖励以实现高效强化学习
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 针对稀疏奖励导致的信用分配难题,提出通过判别器区分成功/失败轨迹,生成密集过程奖励以匹配成功访问分布,在不改变最优策略下加速机器人控制策略微调。