Latent Q-Barrier Shielding for Safe In-Context Reinforcement Learning
潜在Q-屏障屏蔽用于安全上下文强化学习
机构 * University of Virginia(弗吉尼亚大学)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG
AI总结 提出一种潜在Q-屏障屏蔽方法,通过学习上下文表示、潜在动力学和集成成本评论家,在部署时无需参数更新即可根据剩余预算和预测未来成本过滤或软重加权候选动作,从而改善安全上下文强化学习在分布外转移下的奖励-安全权衡。