Bayesian policy gradient and actor-critic algorithms
贝叶斯策略梯度与actor-critic算法
机构 * Adobe Research & Inria(Adobe研究与法国国家信息与自动化研究所) ; Rafael Advanced Defence System(拉斐尔高级防御系统) ; Inria Lille — SequeL team(法国国家信息与自动化研究所里尔分校——SequeL团队)
AI总结 本文提出基于高斯过程的贝叶斯策略梯度框架,减少采样需求并提供自然梯度和梯度协方差估计,结合非参数贝叶斯critics改进马尔可夫性质,通过实验验证方法有效性。
Comments Published in Journal of Machine Learning Research 17(66):1-53, 2016
Journal ref Journal of Machine Learning Research 17(66):1-53, 2016