Predictive Safety Shield for Dyna-Q Reinforcement Learning
动态Q强化学习的预测安全护盾
机构 * Departement U2IS, ENSTA Paris, Institut Polytechnique de Paris(ENSTA巴黎大学U2IS部门,巴黎理工学院) ; Department of Electrical Engineering and Computer Science, University of California, Berkeley, USA(加州大学伯克利分校电气工程与计算机科学系)
AI总结 本文提出了一种预测安全护盾,通过环境模型的安全模拟本地更新Q函数,以在保持严格安全保证的同时提高模型强化学习性能。