FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
FBOS-RL: 基于反馈的双目标协同强化学习
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Kuaishou Technology(快手科技)
AI总结 本文提出FBOS-RL框架,通过环境反馈引导探索增强,并设计两个相互促进的目标:以利用为导向的策略对齐(EPA)和以探索为导向的能力培养(ECC),从而提高强化学习的训练效率和最终性能。