arXivDaily arXiv每日学术速递 周一至周五更新

作者

Chelsea Finn

Robotics / Machine Learning

2026-05-01 至 2026-05-01 共收录 1
2507.07986 2026-05-01 cs.LG cs.AI

EXPO: Stable Reinforcement Learning with Expressive Policies

EXPO: 通过表达性策略进行稳定的强化学习

Perry Dong, Qiyang Li, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 EXPO通过构建实时策略最大化Q值,提升样本效率,适用于基于离线数据的策略微调和在线训练。

Comments changed formatting, added code

详情

展开后加载摘要…

URL PDF HTML 收藏