arXivDaily arXiv每日学术速递 周一至周五更新

作者

Sergey Levine

Robotics / Reinforcement Learning

2026-06-23 至 2026-06-23 共收录 1
2606.23640 2026-06-23 cs.LG cs.AI cs.RO stat.ML 新提交

Learning Process Rewards via Success Visitation Matching for Efficient RL

通过成功访问匹配学习过程奖励以实现高效强化学习

Raymond Tsao, Andrew Wagenmaker, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 针对稀疏奖励导致的信用分配难题,提出通过判别器区分成功/失败轨迹,生成密集过程奖励以匹配成功访问分布,在不改变最优策略下加速机器人控制策略微调。

详情

展开后加载摘要…

URL PDF HTML 收藏