Adaptive Probabilistic Shielding by Learning MDPs for Safe Reinforcement Learning
通过学习马尔可夫决策过程(MDP)实现自适应概率屏蔽用于安全强化学习
机构 * Aalborg University(奥尔堡大学) ; Radboud University(拉德堡德大学) ; Ruhr University Bochum(波鸿鲁尔大学)
专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文针对已知MDP转移图但转移概率未知的场景,提出将概率屏蔽与在线模型学习结合的自适应方法,通过实验验证其在安全强化学习中的有效性。
Comments 19 pages, 3 figures, 3 tables. To be published in the proceedings of RV 2026