Best Policy Learning from Trajectory Preference Feedback
最佳策略学习从轨迹偏好反馈
机构 * University of Southern California(南加州大学) ; Google(谷歌) ; DeepMind(深度Mind) ; OpenAI
AI总结 本文研究了基于偏好强化学习的最佳策略识别问题,提出PSPL算法,通过维护奖励模型和动态的后验分布,提供首个贝叶斯简单遗憾保证,并在模拟和图像生成基准中优于现有基线。
大厂专区
最佳策略学习从轨迹偏好反馈
机构 * University of Southern California(南加州大学) ; Google(谷歌) ; DeepMind(深度Mind) ; OpenAI
AI总结 本文研究了基于偏好强化学习的最佳策略识别问题,提出PSPL算法,通过维护奖励模型和动态的后验分布,提供首个贝叶斯简单遗憾保证,并在模拟和图像生成基准中优于现有基线。