arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-04-23 至 2026-04-23 共收录 1
2501.18873 2026-04-23 cs.LG

Best Policy Learning from Trajectory Preference Feedback

最佳策略学习从轨迹偏好反馈

Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

机构 * University of Southern California(南加州大学) Google(谷歌) DeepMind(深度Mind) OpenAI

AI总结 本文研究了基于偏好强化学习的最佳策略识别问题,提出PSPL算法,通过维护奖励模型和动态的后验分布,提供首个贝叶斯简单遗憾保证,并在模拟和图像生成基准中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏