EXPO: Stable Reinforcement Learning with Expressive Policies
EXPO: 通过表达性策略进行稳定的强化学习
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 EXPO通过构建实时策略最大化Q值,提升样本效率,适用于基于离线数据的策略微调和在线训练。
Comments changed formatting, added code
作者
Robotics / Machine Learning
EXPO: 通过表达性策略进行稳定的强化学习
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 EXPO通过构建实时策略最大化Q值,提升样本效率,适用于基于离线数据的策略微调和在线训练。
Comments changed formatting, added code