Off Policy Lyapunov Stability in Reinforcement Learning
强化学习中的非策略李雅普诺夫稳定性
机构 * Department of Mechanical Engineering University of Victoria, Canada(机械工程系维多利亚大学)
AI总结 本文提出非策略李雅普诺夫函数学习方法,将其应用于软演员批评者和近端策略优化算法,提升其数据效率和稳定性保证。
Comments Conference on Robot Learning (CORL) 2025