Latent Safety-Constrained Policy Approach for Safe Offline Reinforcement Learning
潜在安全约束策略方法用于安全离线强化学习
机构 * Iowa State University(爱荷华州立大学)
专题命中 仿真评测 :autonomous driving(abstract)
AI总结 本文提出了一种潜在安全约束策略方法,通过条件变分自动编码器和受约束奖励-回报最大化框架,实现了安全离线强化学习中的安全性和奖励优化的平衡。
Journal ref International Conference on Learning Representations (ICLR), 2025