Towards Fast Safe Online Reinforcement Learning via Policy Finetuning
通过策略微调实现快速安全在线强化学习
机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) ; Arizona State University(亚利桑那州立大学) ; School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) ; Washington State University(华盛顿州立大学) ; Department of Computer Science(计算机科学系) ; University of Houston(休斯顿大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Marvel框架,通过价值预对齐和自适应PID控制,实现更高效安全的在线强化学习。
Comments Accepted by Transactions on Machine Learning Research (TMLR), 2026
Journal ref Transactions on Machine Learning Research (TMLR), 2026