arXivDaily arXiv每日学术速递 周一至周五更新

作者

Pieter Abbeel

Robotics

2026-05-20 至 2026-05-20 共收录 1
2603.05066 2026-05-20 cs.LG

Reward-Conditioned Reinforcement Learning

基于奖励的强化学习

Michal Nauman, Marek Cygan, Pieter Abbeel

机构 * University of Warsaw(华沙大学) Nomagic UC Berkeley, Amazon FAR(伯克利大学,亚马逊FAR)

AI总结 本文提出基于奖励的强化学习(RCRL),通过在收集经验时使用单一名义目标,使智能体在不额外交互的情况下暴露于多种奖励目标,从而提高样本效率并支持零样本行为调整。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏