How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?
如何通过扩散模型使拉格朗日量引导安全强化学习?
机构 * University College London(伦敦大学学院) ; Imperial College London(伦敦帝国学院) ; University of California, San Diego(加州大学圣地亚哥分校) ; Kyoto University(京都大学) ; King's College London(伦敦国王学院) ; University of Sheffield(谢菲尔德大学) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 本文提出ALGD算法,通过增强拉格朗日方法解决安全强化学习中的稳定性问题,实现稳定有效的政策生成。