Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
后验行为克隆:为高效强化学习微调预训练BC策略
机构 * UC Berkeley(伯克利大学) ; Stanford(斯坦福大学)
AI总结 本文提出后验行为克隆策略,通过建模示范者行为的后验分布来提升强化学习微调效果。
作者
Robotics / Reinforcement Learning
后验行为克隆:为高效强化学习微调预训练BC策略
机构 * UC Berkeley(伯克利大学) ; Stanford(斯坦福大学)
AI总结 本文提出后验行为克隆策略,通过建模示范者行为的后验分布来提升强化学习微调效果。